
Curso de Ingeniería de Datos con Databricks
Domine el stack de ingeniería de datos completo de Databricks: desde los fundamentos de Apache Spark y la arquitectura de Delta Lake hasta la orquestación de pipelines para producción y el gobierno empresarial. Este curso le brinda las habilidades prácticas para diseñar, optimizar y operar plataformas de datos confiables que escalan. Ya sea que esté ingresando al campo de la ingeniería de datos o mejorando su experiencia en lakehouse, este es el entrenamiento definitivo en Databricks.
Lo que vas a aprender:
Configure y administre clústeres, espacios de trabajo y recursos de cómputo de Databricks de manera eficiente.
Construya pipelines de ELT escalables usando Auto Loader, Structured Streaming y la arquitectura de medallón.
Implemente tablas de Delta Lake con transacciones ACID, viajes en el tiempo y evolución de esquemas.
Cree pipelines declarativos y con capacidad de autorreparación usando Delta Live Tables y expectativas de calidad.
Aplique técnicas avanzadas de afinación de Spark, incluyendo AQE, estrategias de particionamiento y el motor Photon.
Implemente gobierno de datos empresariales, control de acceso y seguimiento de linaje usando Unity Catalog.
Cómo estudias de forma práctica Curso de Ingeniería de Datos con Databricks
Cómo practicas Curso de Ingeniería de Datos con Databricks
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de la Plataforma Databricks
Fundamentos de la Plataforma Databricks
Lección 1 • Configuración y Gestión de Clústeres
Enseña la creación de clústeres, su dimensionamiento, el autoescalado y las políticas de terminación. Los estudiantes obtienen control sobre los costos y el rendimiento del cómputo desde el principio.
Lección 2 • Descripción General de la Arquitectura de Databricks
Cubre el plano de control, el plano de datos y la arquitectura de clústeres que sustentan Databricks. Fundamenta todo el uso posterior de la plataforma en un modelo mental claro.
Lección 3 • Navegación y Configuración del Espacio de Trabajo
Introduce la interfaz de usuario de Databricks, la estructura de carpetas y la configuración del usuario. Permite a los estudiantes organizar proyectos y gestionar entornos personales de manera efectiva.
Lección 4 • Fundamentos de la CLI y la API REST de Databricks
Introduce el acceso programático a la plataforma a través de la CLI y la API REST. Prepara a los estudiantes para las tareas de automatización que se cubren en capítulos posteriores.
Lección 5 • Notebooks y Desarrollo Colaborativo
Explora la creación de notebooks, los comandos mágicos y las funcionalidades de colaboración en tiempo real. Establece la interfaz de desarrollo principal utilizada a lo largo del curso.
Capítulo 2OcultarOcultar detallesVer detallesConceptos Básicos de Apache Spark
Conceptos Básicos de Apache Spark
Lección 1 • Transformaciones y Acciones
Distingue transformaciones estrechas vs. anchas y explica los desencadenantes de las acciones. Los estudiantes aprenden a razonar sobre los costos de Shuffle y los límites de ejecución.
Lección 2 • Modelo de Ejecución Distribuida de Spark
Explica los RDD, los DAG, las etapas y las tareas dentro del motor de ejecución de Spark. Proporciona la base conceptual para escribir código distribuido eficiente.
Lección 3 • Fundamentos de la API DataFrame
Cubre la creación de DataFrames, la inferencia de esquemas y las transformaciones principales. Los estudiantes aplican estas operaciones como la interfaz principal de manipulación de datos.
Lección 4 • Fundamentos de Rendimiento en Spark
Introduce la Spark UI, los planes de ejecución y las palancas básicas de ajuste. Capacita a los estudiantes para diagnosticar y abordar cuellos de botella de rendimiento comunes.
Lección 5 • Spark SQL y Catálogo
Enseña consultas SQL sobre DataFrames y el catálogo de Spark para la gestión de metadatos. Une el conocimiento de SQL con el uso programático de Spark.
Capítulo 3OcultarOcultar detallesVer detallesArquitectura y Operaciones de Delta Lake
Arquitectura y Operaciones de Delta Lake
Lección 1 • Formato de Almacenamiento de Delta Lake
Explica los archivos Parquet, el registro de transacciones y los archivos de checkpoint que conforman Delta Lake. Los estudiantes entienden por qué Delta ofrece confiabilidad sobre los formatos de archivo en bruto.
Lección 2 • Creación y Gestión de Tablas Delta
Cubre DDL para crear, alterar y eliminar tablas Delta. Establece las habilidades de gestión de tablas necesarias para todo el trabajo de pipeline futuro.
Lección 3 • Transacciones ACID y Concurrencia
Enseña el control de concurrencia optimista, los niveles de aislamiento y la resolución de conflictos en Delta. Los estudiantes pueden diseñar pipelines que gestionen escrituras concurrentes de forma segura.
Lección 4 • Técnicas de Optimización en Delta Lake
Cubre OPTIMIZE, Z-ordering y compactación de archivos para mejorar el rendimiento de las consultas. Los estudiantes aplican estas técnicas a tablas Delta de grado de producción.
Lección 5 • Viaje en el Tiempo y Versionado de Datos
Demuestra la consulta de versiones históricas de tablas y la restauración de estados anteriores. Habilita patrones de auditoría, reversión y reproducibilidad en los pipelines de datos.
Capítulo 4OcultarOcultar detallesVer detallesIngesta de Datos y Patrones ELT
Ingesta de Datos y Patrones ELT
Lección 1 • Patrones de Diseño ELT
Presenta la arquitectura Medallion y las estrategias de carga incremental para ELT estructurado. Los estudiantes diseñan pipelines multi-hop que separan las capas en bruto, depurada y curada.
Lección 2 • Ingesta Batch desde Fuentes Comunes
Enseña la lectura desde almacenamiento de objetos en la nube, bases de datos JDBC y formatos de archivo. Proporciona la base de ingesta para todos los patrones de pipeline en este capítulo.
Lección 3 • Aseguramiento de la Calidad de Datos en la Ingesta
Enseña validación basada en restricciones, patrones de cuarentena y marcos de expectativas. Asegura que la calidad de los datos se aplique antes de que los datos lleguen a los consumidores posteriores.
Lección 4 • Fundamentos de Structured Streaming
Cubre Streaming DataFrames, disparadores y modos de salida para el procesamiento continuo de datos. Conecta los conceptos de streaming con el destino Delta Lake utilizado en producción.
Lección 5 • Auto Loader para Ingesta Incremental
Introduce los modos de notificación de archivos y listado de directorios de Auto Loader para cargas incrementales escalables. Los estudiantes configuran el checkpointing y la evolución de esquemas en Auto Loader.
Capítulo 5OcultarOcultar detallesVer detallesDelta Live Tables y Orquestación de Pipelines
Delta Live Tables y Orquestación de Pipelines
Lección 1 • Configuración y Despliegue de Pipelines
Enseña la configuración de pipelines, políticas de clúster y el despliegue a través de la UI y la API. Los estudiantes configuran pipelines listos para producción con los ajustes de cómputo y almacenamiento adecuados.
Lección 2 • Monitorización y Resolución de Problemas en DLT
Explora el log de eventos, las métricas de la UI del pipeline y los patrones de fallo comunes. Los estudiantes diagnostican y resuelven problemas del pipeline utilizando las herramientas de observabilidad integradas.
Lección 3 • Calidad de Datos con Expectativas
Cubre las restricciones EXPECT, EXPECT OR DROP y EXPECT OR FAIL en DLT. Los estudiantes integran reglas de calidad directamente en las definiciones del pipeline para su aplicación automatizada.
Lección 4 • Orquestación de Pipelines con Databricks Workflows
Integra pipelines DLT en Workflows de Databricks de múltiples tareas con dependencias y programación horaria. Los estudiantes construyen productos de datos orquestados de extremo a extremo.
Lección 5 • Conceptos Básicos de Delta Live Tables
Introduce la sintaxis de DLT, las tablas live, las tablas streaming live y el grafo del pipeline. Establece el paradigma declarativo que distingue DLT del código Spark imperativo.
Capítulo 6OcultarOcultar detallesVer detallesUnity Catalog y Gobernanza de Datos
Unity Catalog y Gobernanza de Datos
Lección 1 • Gestión de Identidad y Acceso
Cubre usuarios, grupos, service principals y la concesión de privilegios en Unity Catalog. Los estudiantes implementan modelos de acceso con privilegios mínimos para los activos de datos.
Lección 2 • Arquitectura de Unity Catalog
Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Proporciona la comprensión estructural necesaria para diseñar espacios de nombres gobernados.
Lección 3 • Compartición de Datos con Delta Sharing
Introduce el protocolo abierto Delta Sharing para la compartición de datos entre plataformas y organizaciones. Los estudiantes publican y consumen conjuntos de datos compartidos de forma segura.
Lección 4 • Auditoría y Cumplimiento Normativo
Enseña el acceso al log de auditoría, el historial de consultas y los patrones de informes de cumplimiento. Los estudiantes configuran la monitorización para satisfacer los requisitos de auditoría empresarial.
Lección 5 • Linaje de Datos y Descubrimiento
Demuestra la captura automática de linaje y el explorador de datos para el descubrimiento de activos. Los estudiantes utilizan el linaje para rastrear el flujo de datos y respaldar el análisis de impacto.
Capítulo 7OcultarOcultar detallesVer detallesOptimización y Ajuste Avanzado de Spark
Optimización y Ajuste Avanzado de Spark
Lección 1 • Optimización Basada en Costos y Estadísticas
Cubre ANALYZE TABLE, estadísticas de columna y el reordenamiento de joins del optimizador basado en costos. Los estudiantes recopilan y aprovechan las estadísticas para mejorar la calidad de los planes de ejecución.
Lección 2 • Gestión de Memoria y Derrame
Cubre las regiones de memoria de Spark, el dimensionamiento de ejecutores y la detección y mitigación de derrames. Los estudiantes configuran los ajustes de memoria para eliminar costosos derrames a disco.
Lección 3 • Photon Engine y Ejecución Vectorizada
Introduce el motor Photon de Databricks y sus beneficios de ejecución vectorizada. Los estudiantes identifican las cargas de trabajo que más se benefician de Photon y lo habilitan adecuadamente.
Lección 4 • Estrategias de Particionamiento y Shuffle
Enseña el número óptimo de particiones, repartition vs. coalesce, y el ajuste de Shuffle. Los estudiantes eliminan el sesgo de datos y reducen la sobrecarga de Shuffle en pipelines complejos.
Lección 5 • Adaptive Query Execution
Explica los ajustes en tiempo de ejecución del plan de AQE para joins, sesgo y coalesce. Los estudiantes habilitan y configuran AQE para reducir la sobrecarga de ajuste manual.
Capítulo 8OcultarOcultar detallesVer detallesPrácticas de Ingeniería de Datos en Producción
Prácticas de Ingeniería de Datos en Producción
Lección 1 • Gestión de Costos y FinOps
Cubre el análisis de consumo de DBU, el redimensionamiento adecuado de clústeres y las estrategias de instancias spot. Los estudiantes reducen los costos de cómputo sin sacrificar la confiabilidad del pipeline.
Lección 2 • CI/CD para Proyectos en Databricks
Enseña los Databricks Asset Bundles, la automatización del despliegue y la promoción entre entornos. Los estudiantes implementan un pipeline de CI/CD completo desde desarrollo hasta producción.
Lección 3 • Fortalecimiento de Seguridad y Mejores Prácticas
Enseña el aislamiento de red, la gestión de secretos y el manejo seguro de credenciales. Los estudiantes aplican principios de defensa en profundidad para proteger los activos de datos en producción.
Lección 4 • Pruebas de Pipelines de Datos
Cubre las pruebas unitarias con pytest, estrategias de pruebas de integración y la gestión de datos de prueba. Los estudiantes construyen un conjunto de pruebas que valida la lógica del pipeline antes del despliegue.
Lección 5 • Observabilidad y Monitorización de Pipelines
Introduce marcos de registro, emisión de métricas y alertas para pipelines de datos. Los estudiantes instrumentan pipelines para detectar fallos e incumplimientos de SLA de forma proactiva.
Tu certificado válido de finalización
Este curso es para ti:
Analistas de datos: listos para pasar de consultar datos a construir pipelines confiables.
Desarrolladores backend: buscando orientar sus habilidades de programación hacia el espacio de plataformas de datos.
Ingenieros de datos junior: buscando un camino estructurado hacia la experiencia en Databricks a nivel de producción.
Desarrolladores de BI: con el propósito de modernizar su trabajo de ETL utilizando herramientas nativas de lakehouse.
Ingenieros de DevOps: ampliando su alcance para incluir infraestructura de datos y automatización de pipelines.
Estudiantes de posgrado: desarrollando habilidades de ingeniería de datos listas para el empleo antes de ingresar al mercado laboral.
Lo que dicen nuestros estudiantes
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Colombia?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















