
Data Engineering with Databricks Course
Domina el stack completo de ingeniería de datos de Databricks: desde los fundamentos de Apache Spark y la arquitectura de Delta Lake hasta la orquestación de pipelines en producción y el gobierno empresarial. Este curso te proporciona las habilidades prácticas para diseñar, optimizar y operar plataformas de datos confiables que escalan. Ya sea que estés incursionando en ingeniería de datos o mejorando tu experiencia en lakehouse, esta es la capacitación definitiva en Databricks.
Lo que vas a aprender:
Configura y administra clústeres, espacios de trabajo y recursos de cómputo de Databricks de manera eficiente.
Construye pipelines de ELT escalables utilizando Auto Loader, Structured Streaming y arquitectura medallón.
Implementa tablas de Delta Lake con transacciones ACID, viaje en el tiempo y evolución de esquemas.
Crea pipelines declarativos y autorreparables con Delta Live Tables y expectativas de calidad.
Aplica técnicas avanzadas de ajuste de Spark, incluyendo AQE, estrategias de particionado y el motor Photon.
Aplica gobierno de datos empresarial, control de acceso y seguimiento de linaje utilizando Unity Catalog.
Cómo estudias de forma práctica Data Engineering with Databricks Course
Cómo practicas Data Engineering with Databricks Course
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de la Plataforma Databricks
Fundamentos de la Plataforma Databricks
Lección 1 • Configuración y Gestión de Clústeres
Enseña la creación, dimensionamiento, autoescalado y políticas de terminación de clústeres. Los estudiantes adquieren control sobre los costos de cómputo y el rendimiento desde el inicio.
Lección 2 • Panorama de la Arquitectura de Databricks
Cubre el plano de control, el plano de datos y la arquitectura de clúster que sustentan Databricks. Fundamenta todo el uso posterior de la plataforma en un modelo mental claro.
Lección 3 • Navegación y Configuración del Espacio de Trabajo
Introduce la IU de Databricks, la estructura de carpetas y la configuración de usuario. Permite a los estudiantes organizar proyectos y gestionar entornos personales de manera efectiva.
Lección 4 • Fundamentos de CLI y API REST de Databricks
Introduce el acceso programático a la plataforma mediante CLI y API REST. Prepara a los estudiantes para las tareas de automatización que se cubren en capítulos posteriores.
Lección 5 • Notebooks y Desarrollo Colaborativo
Explora la creación de notebooks, comandos mágicos y funciones de colaboración en tiempo real. Establece la interfaz de desarrollo principal utilizada a lo largo del curso.
Capítulo 2OcultarOcultar detallesVer detallesConceptos Básicos de Apache Spark
Conceptos Básicos de Apache Spark
Lección 1 • Transformaciones y Acciones
Distingue transformaciones estrechas vs. amplias y explica los desencadenantes de acciones. Los estudiantes aprenden a razonar sobre los costos de shuffle y los límites de ejecución.
Lección 2 • Modelo de Ejecución Distribuida de Spark
Explica los RDD, DAG, etapas y tareas dentro del motor de ejecución de Spark. Proporciona la base conceptual para escribir código distribuido eficiente.
Lección 3 • Fundamentos de la API DataFrame
Cubre la creación de DataFrames, la inferencia de esquemas y las transformaciones principales. Los estudiantes aplican estas operaciones como la interfaz principal de manipulación de datos.
Lección 4 • Fundamentos de Rendimiento de Spark
Introduce la IU de Spark, los planes de ejecución y las palancas de ajuste básicas. Prepara a los estudiantes para diagnosticar y abordar cuellos de botella de rendimiento comunes.
Lección 5 • Spark SQL y Catálogo
Enseña consultas SQL en DataFrames y el catálogo de Spark para la gestión de metadatos. Une el conocimiento SQL con el uso programático de Spark.
Capítulo 3OcultarOcultar detallesVer detallesArquitectura y Operaciones de Delta Lake
Arquitectura y Operaciones de Delta Lake
Lección 1 • Formato de Almacenamiento de Delta Lake
Explica los archivos Parquet, el registro de transacciones y los archivos de checkpoint que forman Delta Lake. Los estudiantes comprenden por qué Delta proporciona confiabilidad sobre los formatos de archivo sin procesar.
Lección 2 • Creación y Gestión de Tablas Delta
Cubre DDL para crear, modificar y eliminar tablas Delta. Establece las habilidades de gestión de tablas requeridas para todo el trabajo de pipeline por delante.
Lección 3 • Transacciones ACID y Concurrencia
Enseña el control de concurrencia optimista, niveles de aislamiento y resolución de conflictos en Delta. Los estudiantes pueden diseñar pipelines que manejan de forma segura escrituras concurrentes.
Lección 4 • Técnicas de Optimización de Delta Lake
Cubre OPTIMIZE, Z-ordering y compactación de archivos para mejorar el rendimiento de consultas. Los estudiantes aplican estas técnicas a tablas Delta de grado de producción.
Lección 5 • Viaje en el Tiempo y Versionado de Datos
Demuestra la consulta de versiones históricas de tablas y la restauración de estados previos. Habilita patrones de auditoría, rollback y reproducibilidad en pipelines de datos.
Capítulo 4OcultarOcultar detallesVer detallesIngesta de Datos y Patrones ELT
Ingesta de Datos y Patrones ELT
Lección 1 • Patrones de Diseño ELT
Presenta la arquitectura de medallón y estrategias de carga incremental para ELT estructurado. Los estudiantes diseñan pipelines de múltiples saltos que separan las capas de datos crudos, depurados y curados.
Lección 2 • Ingesta por Lotes desde Fuentes Comunes
Enseña a leer desde almacenamiento de objetos en la nube, bases de datos JDBC y formatos de archivo. Proporciona la base de ingesta para todos los patrones de pipeline en este capítulo.
Lección 3 • Aplicación de la Calidad de Datos en la Ingesta
Enseña validación basada en restricciones, patrones de cuarentena y marcos de expectativas. Asegura que la calidad de los datos se aplique antes de que lleguen a los consumidores posteriores.
Lección 4 • Fundamentos de Structured Streaming
Cubre DataFrames de streaming, desencadenantes y modos de salida para el procesamiento continuo de datos. Conecta los conceptos de streaming con el receptor Delta Lake utilizado en producción.
Lección 5 • Auto Loader para Ingesta Incremental
Introduce los modos de notificación de archivos y listado de directorios de Auto Loader para cargas incrementales escalables. Los estudiantes configuran el checkpointing y la evolución de esquema de Auto Loader.
Capítulo 5OcultarOcultar detallesVer detallesDelta Live Tables y Orquestación de Pipelines
Delta Live Tables y Orquestación de Pipelines
Lección 1 • Configuración y Despliegue de Pipelines
Enseña la configuración de pipelines, políticas de clúster y despliegue mediante IU y API. Los estudiantes configuran pipelines listas para producción con la configuración de cómputo y almacenamiento adecuada.
Lección 2 • Monitoreo y Solución de Problemas de DLT
Explora el registro de eventos, las métricas de la IU de pipeline y los patrones de fallo comunes. Los estudiantes diagnostican y resuelven problemas de pipeline utilizando herramientas de observabilidad integradas.
Lección 3 • Calidad de Datos con Expectativas
Cubre las restricciones EXPECT, EXPECT OR DROP y EXPECT OR FAIL en DLT. Los estudiantes incorporan reglas de calidad directamente en las definiciones de pipeline para su aplicación automatizada.
Lección 4 • Orquestación de Pipelines con Databricks Workflows
Integra pipelines DLT en Databricks Workflows de múltiples tareas con dependencias y programación. Los estudiantes construyen productos de datos orquestados de extremo a extremo.
Lección 5 • Conceptos Básicos de Delta Live Tables
Introduce la sintaxis de DLT, tablas en vivo, tablas de streaming en vivo y el gráfico de pipeline. Establece el paradigma declarativo que distingue a DLT del código Spark imperativo.
Capítulo 6OcultarOcultar detallesVer detallesUnity Catalog y Gobernanza de Datos
Unity Catalog y Gobernanza de Datos
Lección 1 • Gestión de Identidad y Acceso
Cubre usuarios, grupos, directores de servicio y concesiones de privilegios en Unity Catalog. Los estudiantes implementan modelos de acceso con privilegios mínimos para activos de datos.
Lección 2 • Arquitectura de Unity Catalog
Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Proporciona la comprensión estructural necesaria para diseñar espacios de nombres gobernados.
Lección 3 • Compartición de Datos con Delta Sharing
Introduce el protocolo abierto Delta Sharing para la compartición de datos entre plataformas y organizaciones. Los estudiantes publican y consumen conjuntos de datos compartidos de forma segura.
Lección 4 • Auditoría y Cumplimiento
Enseña el acceso al registro de auditoría, el historial de consultas y los patrones de informes de cumplimiento. Los estudiantes configuran el monitoreo para satisfacer los requisitos de auditoría empresarial.
Lección 5 • Linaje y Descubrimiento de Datos
Demuestra la captura automática de linaje y el explorador de datos para el descubrimiento de activos. Los estudiantes utilizan el linaje para rastrear el flujo de datos y apoyar el análisis de impacto.
Capítulo 7OcultarOcultar detallesVer detallesOptimización Avanzada y Ajuste de Spark
Optimización Avanzada y Ajuste de Spark
Lección 1 • Optimización Basada en Costos y Estadísticas
Cubre ANALYZE TABLE, estadísticas de columna y el reordenamiento de joins del optimizador basado en costos. Los estudiantes recopilan y aprovechan estadísticas para mejorar la calidad del plan.
Lección 2 • Gestión de Memoria y Derrame
Cubre las regiones de memoria de Spark, el dimensionamiento del ejecutor y la detección y mitigación de derrames. Los estudiantes configuran los ajustes de memoria para eliminar el costoso derrame a disco.
Lección 3 • Motor Photon y Ejecución Vectorizada
Introduce el motor Photon de Databricks y sus beneficios de ejecución vectorizada. Los estudiantes identifican las cargas de trabajo que más se benefician de Photon y lo habilitan adecuadamente.
Lección 4 • Estrategias de Particionado y Shuffling
Enseña el recuento óptimo de particiones, repartition vs. coalesce y ajuste de shuffle. Los estudiantes eliminan el sesgo de datos y reducen la sobrecarga de shuffle en pipelines complejas.
Lección 5 • Adaptive Query Execution
Explica los ajustes del plan en tiempo de ejecución de AQE para joins, sesgo y coalescencia. Los estudiantes habilitan y configuran AQE para reducir la sobrecarga de ajuste manual.
Capítulo 8OcultarOcultar detallesVer detallesPrácticas de Ingeniería de Datos en Producción
Prácticas de Ingeniería de Datos en Producción
Lección 1 • Gestión de Costos y FinOps
Cubre el análisis de consumo de DBU, el dimensionamiento correcto de clústeres y las estrategias de instancias spot. Los estudiantes reducen los costos de cómputo sin sacrificar la confiabilidad de la pipeline.
Lección 2 • CI/CD para Proyectos de Databricks
Enseña Databricks Asset Bundles, automatización de despliegues y promoción de entornos. Los estudiantes implementan una pipeline CI/CD completa desde desarrollo hasta producción.
Lección 3 • Fortalecimiento de la Seguridad y Mejores Prácticas
Enseña aislamiento de red, gestión de secretos y manejo seguro de credenciales. Los estudiantes aplican principios de defensa en profundidad para proteger los activos de datos en producción.
Lección 4 • Pruebas de Pipelines de Datos
Cubre pruebas unitarias con pytest, estrategias de pruebas de integración y gestión de datos de prueba. Los estudiantes construyen un conjunto de pruebas que valida la lógica de la pipeline antes del despliegue.
Lección 5 • Observabilidad y Monitoreo de Pipelines
Introduce marcos de registro, emisión de métricas y alertas para pipelines de datos. Los estudiantes instrumentan pipelines para detectar fallos e incumplimientos de SLA de manera proactiva.
Tu certificado válido de finalización
Este curso es para ti:
Analistas de datos: listos para pasar de consultar datos a diseñar pipelines confiables.
Desarrolladores backend: con interés en orientar sus habilidades de programación hacia el ámbito de las plataformas de datos.
Ingenieros de datos junior: que buscan una ruta estructurada hacia un dominio de Databricks a nivel de producción.
Desarrolladores de BI: que desean modernizar su trabajo de ETL utilizando herramientas nativas de lakehouse.
Ingenieros DevOps: ampliando su alcance para incluir infraestructura de datos y automatización de pipelines.
Estudiantes de posgrado: desarrollando habilidades de ingeniería de datos listas para el trabajo antes de ingresar al mercado laboral.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en México?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















