
¡Bienvenido a este curso de Databricks Data Engineering!
Un gusto conocerte. Aqui la presentación.
¡Estoy desenado responder cualquier pregunta que puedas tener!
¡Bienvenido al equipo de Ingeniería de Datos de Ecomotive!
Antes de escribir una sola línea de código, necesitas entender dónde has aterrizado y por qué tu trabajo es crítico para nosotros.
Prepárate. Tienes los datos, tienes las herramientas y Ecomotive depende de ti.
¡Encendamos los motores!
Sign up for Databricks Free Community Edition: https://www.databricks.com/learn/free-edition
En tu buscador: https://github.com/PabloCumbrera/preparacion_databricks_data_engineer
Desde Databricks HTTPS: https://github.com/PabloCumbrera/preparacion_databricks_data_engineer.git
La primera pregunta: ¿qué es Databricks?
Vamos a ver que aspecto tiene la plataforma Databricks.
Qué es lo que hace la arquitectura Lakehouse tan especial.
Cómo da fiabilidad y seguridada el '_delta_log' al Delta Lake: ACID.
Vamos a ver cómo funciona el Marketplace de Databricks.
FUNDAMENTAL: Aprender y diferenciar correctamente las diferentes estrategias de cómputo existentes en Databricks.
Contenido teórico resumido sobre la mejor estratégia de cómputo.
Es necesario entender bien cómo funciona Spark para ser un buen ingeniero de datos.
¿Qué hay detrás de los notebooks?
¿Cuáles son los métodos de ingesta que ofrece Databricks?
¿Cómo subir un archivo CSV manualmente a Databricks?
¿Cómo puedo saber qué método de ingesta debo seleccionar dado un caso de uso especifico?
El autoloader es una de las funcionalidades mas TOP de ingesta de datos en Databricks. Fundamental para examen,
En esta lección vamos a ver Auto Loader sobre el terreno.
Vamos a probar diferentes argumentos para hacer mas robusto el Auto Loader.
Vamos a mover los archivos de GIT al Volumen, y desde allí a BRONZE con Auto Loader.
Arquitectura de Medallón es el standard actual de la industria. Vamos a conocerlo.
Vamos a definir y ver comandos más importantes de Data Definition Lenguage.
¿Qué tipo de lenguaje son las vistas? Vamos a probarlo.
Vamos a definir y ver comandos más importantes de Data Manipulation Lenguage.
Dentro del DML, trabajar con fechas siempre es complejo. Vamos a ver por qué.
El comando CREATE TABLE AS SELECT, muy útil y utilizado.
Vamos a continuar la construcción del Pipeline llevando los datos de BRONZE a SILVER.
Qué es modelar datos y cómo aplicar las mejores prácticas.
Modelar datos no siempre es fácil. ¿Qué podemos hacer cuando se vuelve complicado?
Los datos normalmente van a requerir unirse con otros para dar respuesta a situaciones de negocio. Vamos a ver los JOIN más importantes.
Las funciones de ventana caen en examen 99%, vamos a ver de qué tratan.
Vamos a profundizar más en cómo Spark realiza el procesamiento de datos.
Spark une datos de dos formas: Broadcast y Shuffle. Vamos a ver que son y cómo aplicarlos.
Es el momento de modelar datos em GOLD para Ecomotive.
Vamos a construir un Lakeflow Spark Declarative Pipeline para Ecomotive.
La diferencia entre un junior y un senior no es el número de herramientas que conoce, sino cómo afronta un problema y las prácticas que aplica.
Vamos a ver la solución IaC de Databricks para despliegues.
Vamos a ver todas las partes que tiene un archivo .yml
vscode instalación: https://code.visualstudio.com/
Link Databricks CLI Repositorio: https://github.com/databricks/cli
Comando powershell instalar CLI Databricks: winget install Databricks.DatabricksCLI
Comando powershell log in Databricks CLI: databricks auth login -- host https://adb-xxxxxx.xx.azuredatabricks.net
comandos DABs:
databricks bundle validate
databricks bundle deploy
databricks bundle run ecomotive_trigger_job
databricks bundle deploy -t prod
Vamos a crear un Job con TASKA dependencia TASKB.
Repair & Run es una herramienta de Databricks para ahorrar costes y tiempos cuando hay errores en el pipeline. Veámosla.
Vamos a ver cómo funciona QUERY PROFILE para entender y visualizar Spark.
Vamos a probar QUERY PROFILE sobre una consulta SQL y sobre nuestro Pipeline.
Cómo podemos regresar a versiones anteriores de una tabla y a través de qué mecanismo y sintaxis.
Vamos a romper una tabla y volverla a su estado original.
Qué es el 'problema de los archivos pequeños', y cómo solucionarlo.
Vamos a aplicar OPTIMIZE Y ZORDER a 'drim_drivers'
¿Qué es Liquid Clustering y por qué es el futuro de la optimización?
Vamos a comprobar cómo funciona VACUUM aplicandolo a 'dim_drivers'
Un repaso de los componentes jerárquicos de Unity Catalog: Catálogo, Esquema, Tabla.
100% en examen. Cómo dar y quitar permisos a tablas, esquemas, volumenes...
Vamos a aplicar politicas de seguridad sobre una tabla.
Con el volumen podemos traer todo tipo de archivos a Databricks. Veámos cómo asegurar estos archivos.
100% en examen: diferencia entre tabalas Gestionadas y Externas.
Vamos a profundizar en una de las joyas de la corona del Unity Catalog: El linaje de datos.
Opción potentísima de Unity Catalog para datos que residen fuera de la plataforma.
Bienvenido al curso definitivo para dominar Databricks como Ingeniero de Datos. Aquí no vamos a ver sólo teoría para que apruebes el examen. Aquí quiero a enseñarte a pensar y trabajar como un Ingeniero de Datos profesional.
Este curso es para ti si:
Quieres aprobar el examen Databricks Data Engineer
Buscas un curso completamente en ESPAÑOL.
Ya trabajas con datos y quieres subir de nivel
Buscas proyectos reales, no teoría
Al finalizar sabrás:
Construir pipelines ETL en Databricks
Comprenderas Lakeflow Spark Declarative Pipelines
Usar Delta Lake y Lakehouse
Optimizar Spark para producción
Resolver preguntas tipo examen
No importa si acabas de empezar en este mundo, o llevas 5 años trabajando, estoy seguro vas a aprender en profundidad un montón de cosas nuevas.
Desde una perspectiva teórica: Vamos a revisar todos los conceptos básicos sobre los que construiremos los más vanguardistas y complejos.
Desde una perspectiva práctica: Vamos a poner en práctica lo aprendido desde contextos de casos reales que pueden ocurrir en una empresa real.
Vamos a seguir el guión de los contenidos del examen 'Databricks Certified Data Engineer Associate' pero no pretendemos quedarnos ahí, queremos entender bien la plataforma, de forma que podamos pasar también cualquier entrevista que nos puedan hacer. Asi que si eres un ML Engineer, o un Data Engineer, tienes muchisimo que aprender aquí.
Para hacer de ti todo un profesional, hemos preparado:
4:30+ de video
200 diagramas originales para que entiendas bien cada concepto
15 ejercicios prácticos para que pongas en prueba lo aprendido
60 preguntas de examen para que te sientas confiado.
Si querias dominar Databricks... ¡Has llegado al lugar que esperabas!