Elige tu idioma
Data Engineering with Databricks Course
Más de 2 millones de estudiantes en todo el mundo

Data Engineering with Databricks Course

Domina el stack completo de ingeniería de datos de Databricks: desde los fundamentos de Apache Spark y la arquitectura de Delta Lake hasta la orquestación de pipelines en producción y el gobierno empresarial. Este curso te proporciona las habilidades prácticas para diseñar, optimizar y operar plataformas de datos confiables que escalan. Ya sea que estés incursionando en ingeniería de datos o mejorando tu experiencia en lakehouse, esta es la capacitación definitiva en Databricks.

Dedika para empresas

Lo que vas a aprender:

  • Configura y administra clústeres, espacios de trabajo y recursos de cómputo de Databricks de manera eficiente.

  • Construye pipelines de ELT escalables utilizando Auto Loader, Structured Streaming y arquitectura medallón.

  • Implementa tablas de Delta Lake con transacciones ACID, viaje en el tiempo y evolución de esquemas.

  • Crea pipelines declarativos y autorreparables con Delta Live Tables y expectativas de calidad.

  • Aplica técnicas avanzadas de ajuste de Spark, incluyendo AQE, estrategias de particionado y el motor Photon.

  • Aplica gobierno de datos empresarial, control de acceso y seguimiento de linaje utilizando Unity Catalog.

Cómo estudias de forma práctica Data Engineering with Databricks Course

Cómo practicas Data Engineering with Databricks Course

Para ti que eres empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de la Plataforma Databricks

  • Lección 1 • Configuración y Gestión de Clústeres

    Enseña la creación, dimensionamiento, autoescalado y políticas de terminación de clústeres. Los estudiantes adquieren control sobre los costos de cómputo y el rendimiento desde el inicio.

  • Lección 2 • Panorama de la Arquitectura de Databricks

    Cubre el plano de control, el plano de datos y la arquitectura de clúster que sustentan Databricks. Fundamenta todo el uso posterior de la plataforma en un modelo mental claro.

  • Lección 3 • Navegación y Configuración del Espacio de Trabajo

    Introduce la IU de Databricks, la estructura de carpetas y la configuración de usuario. Permite a los estudiantes organizar proyectos y gestionar entornos personales de manera efectiva.

  • Lección 4 • Fundamentos de CLI y API REST de Databricks

    Introduce el acceso programático a la plataforma mediante CLI y API REST. Prepara a los estudiantes para las tareas de automatización que se cubren en capítulos posteriores.

  • Lección 5 • Notebooks y Desarrollo Colaborativo

    Explora la creación de notebooks, comandos mágicos y funciones de colaboración en tiempo real. Establece la interfaz de desarrollo principal utilizada a lo largo del curso.

Capítulo 2Ver detalles

Conceptos Básicos de Apache Spark

  • Lección 1 • Transformaciones y Acciones

    Distingue transformaciones estrechas vs. amplias y explica los desencadenantes de acciones. Los estudiantes aprenden a razonar sobre los costos de shuffle y los límites de ejecución.

  • Lección 2 • Modelo de Ejecución Distribuida de Spark

    Explica los RDD, DAG, etapas y tareas dentro del motor de ejecución de Spark. Proporciona la base conceptual para escribir código distribuido eficiente.

  • Lección 3 • Fundamentos de la API DataFrame

    Cubre la creación de DataFrames, la inferencia de esquemas y las transformaciones principales. Los estudiantes aplican estas operaciones como la interfaz principal de manipulación de datos.

  • Lección 4 • Fundamentos de Rendimiento de Spark

    Introduce la IU de Spark, los planes de ejecución y las palancas de ajuste básicas. Prepara a los estudiantes para diagnosticar y abordar cuellos de botella de rendimiento comunes.

  • Lección 5 • Spark SQL y Catálogo

    Enseña consultas SQL en DataFrames y el catálogo de Spark para la gestión de metadatos. Une el conocimiento SQL con el uso programático de Spark.

Capítulo 3Ver detalles

Arquitectura y Operaciones de Delta Lake

  • Lección 1 • Formato de Almacenamiento de Delta Lake

    Explica los archivos Parquet, el registro de transacciones y los archivos de checkpoint que forman Delta Lake. Los estudiantes comprenden por qué Delta proporciona confiabilidad sobre los formatos de archivo sin procesar.

  • Lección 2 • Creación y Gestión de Tablas Delta

    Cubre DDL para crear, modificar y eliminar tablas Delta. Establece las habilidades de gestión de tablas requeridas para todo el trabajo de pipeline por delante.

  • Lección 3 • Transacciones ACID y Concurrencia

    Enseña el control de concurrencia optimista, niveles de aislamiento y resolución de conflictos en Delta. Los estudiantes pueden diseñar pipelines que manejan de forma segura escrituras concurrentes.

  • Lección 4 • Técnicas de Optimización de Delta Lake

    Cubre OPTIMIZE, Z-ordering y compactación de archivos para mejorar el rendimiento de consultas. Los estudiantes aplican estas técnicas a tablas Delta de grado de producción.

  • Lección 5 • Viaje en el Tiempo y Versionado de Datos

    Demuestra la consulta de versiones históricas de tablas y la restauración de estados previos. Habilita patrones de auditoría, rollback y reproducibilidad en pipelines de datos.

Capítulo 4Ver detalles

Ingesta de Datos y Patrones ELT

  • Lección 1 • Patrones de Diseño ELT

    Presenta la arquitectura de medallón y estrategias de carga incremental para ELT estructurado. Los estudiantes diseñan pipelines de múltiples saltos que separan las capas de datos crudos, depurados y curados.

  • Lección 2 • Ingesta por Lotes desde Fuentes Comunes

    Enseña a leer desde almacenamiento de objetos en la nube, bases de datos JDBC y formatos de archivo. Proporciona la base de ingesta para todos los patrones de pipeline en este capítulo.

  • Lección 3 • Aplicación de la Calidad de Datos en la Ingesta

    Enseña validación basada en restricciones, patrones de cuarentena y marcos de expectativas. Asegura que la calidad de los datos se aplique antes de que lleguen a los consumidores posteriores.

  • Lección 4 • Fundamentos de Structured Streaming

    Cubre DataFrames de streaming, desencadenantes y modos de salida para el procesamiento continuo de datos. Conecta los conceptos de streaming con el receptor Delta Lake utilizado en producción.

  • Lección 5 • Auto Loader para Ingesta Incremental

    Introduce los modos de notificación de archivos y listado de directorios de Auto Loader para cargas incrementales escalables. Los estudiantes configuran el checkpointing y la evolución de esquema de Auto Loader.

Capítulo 5Ver detalles

Delta Live Tables y Orquestación de Pipelines

  • Lección 1 • Configuración y Despliegue de Pipelines

    Enseña la configuración de pipelines, políticas de clúster y despliegue mediante IU y API. Los estudiantes configuran pipelines listas para producción con la configuración de cómputo y almacenamiento adecuada.

  • Lección 2 • Monitoreo y Solución de Problemas de DLT

    Explora el registro de eventos, las métricas de la IU de pipeline y los patrones de fallo comunes. Los estudiantes diagnostican y resuelven problemas de pipeline utilizando herramientas de observabilidad integradas.

  • Lección 3 • Calidad de Datos con Expectativas

    Cubre las restricciones EXPECT, EXPECT OR DROP y EXPECT OR FAIL en DLT. Los estudiantes incorporan reglas de calidad directamente en las definiciones de pipeline para su aplicación automatizada.

  • Lección 4 • Orquestación de Pipelines con Databricks Workflows

    Integra pipelines DLT en Databricks Workflows de múltiples tareas con dependencias y programación. Los estudiantes construyen productos de datos orquestados de extremo a extremo.

  • Lección 5 • Conceptos Básicos de Delta Live Tables

    Introduce la sintaxis de DLT, tablas en vivo, tablas de streaming en vivo y el gráfico de pipeline. Establece el paradigma declarativo que distingue a DLT del código Spark imperativo.

Capítulo 6Ver detalles

Unity Catalog y Gobernanza de Datos

  • Lección 1 • Gestión de Identidad y Acceso

    Cubre usuarios, grupos, directores de servicio y concesiones de privilegios en Unity Catalog. Los estudiantes implementan modelos de acceso con privilegios mínimos para activos de datos.

  • Lección 2 • Arquitectura de Unity Catalog

    Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Proporciona la comprensión estructural necesaria para diseñar espacios de nombres gobernados.

  • Lección 3 • Compartición de Datos con Delta Sharing

    Introduce el protocolo abierto Delta Sharing para la compartición de datos entre plataformas y organizaciones. Los estudiantes publican y consumen conjuntos de datos compartidos de forma segura.

  • Lección 4 • Auditoría y Cumplimiento

    Enseña el acceso al registro de auditoría, el historial de consultas y los patrones de informes de cumplimiento. Los estudiantes configuran el monitoreo para satisfacer los requisitos de auditoría empresarial.

  • Lección 5 • Linaje y Descubrimiento de Datos

    Demuestra la captura automática de linaje y el explorador de datos para el descubrimiento de activos. Los estudiantes utilizan el linaje para rastrear el flujo de datos y apoyar el análisis de impacto.

Capítulo 7Ver detalles

Optimización Avanzada y Ajuste de Spark

  • Lección 1 • Optimización Basada en Costos y Estadísticas

    Cubre ANALYZE TABLE, estadísticas de columna y el reordenamiento de joins del optimizador basado en costos. Los estudiantes recopilan y aprovechan estadísticas para mejorar la calidad del plan.

  • Lección 2 • Gestión de Memoria y Derrame

    Cubre las regiones de memoria de Spark, el dimensionamiento del ejecutor y la detección y mitigación de derrames. Los estudiantes configuran los ajustes de memoria para eliminar el costoso derrame a disco.

  • Lección 3 • Motor Photon y Ejecución Vectorizada

    Introduce el motor Photon de Databricks y sus beneficios de ejecución vectorizada. Los estudiantes identifican las cargas de trabajo que más se benefician de Photon y lo habilitan adecuadamente.

  • Lección 4 • Estrategias de Particionado y Shuffling

    Enseña el recuento óptimo de particiones, repartition vs. coalesce y ajuste de shuffle. Los estudiantes eliminan el sesgo de datos y reducen la sobrecarga de shuffle en pipelines complejas.

  • Lección 5 • Adaptive Query Execution

    Explica los ajustes del plan en tiempo de ejecución de AQE para joins, sesgo y coalescencia. Los estudiantes habilitan y configuran AQE para reducir la sobrecarga de ajuste manual.

Capítulo 8Ver detalles

Prácticas de Ingeniería de Datos en Producción

  • Lección 1 • Gestión de Costos y FinOps

    Cubre el análisis de consumo de DBU, el dimensionamiento correcto de clústeres y las estrategias de instancias spot. Los estudiantes reducen los costos de cómputo sin sacrificar la confiabilidad de la pipeline.

  • Lección 2 • CI/CD para Proyectos de Databricks

    Enseña Databricks Asset Bundles, automatización de despliegues y promoción de entornos. Los estudiantes implementan una pipeline CI/CD completa desde desarrollo hasta producción.

  • Lección 3 • Fortalecimiento de la Seguridad y Mejores Prácticas

    Enseña aislamiento de red, gestión de secretos y manejo seguro de credenciales. Los estudiantes aplican principios de defensa en profundidad para proteger los activos de datos en producción.

  • Lección 4 • Pruebas de Pipelines de Datos

    Cubre pruebas unitarias con pytest, estrategias de pruebas de integración y gestión de datos de prueba. Los estudiantes construyen un conjunto de pruebas que valida la lógica de la pipeline antes del despliegue.

  • Lección 5 • Observabilidad y Monitoreo de Pipelines

    Introduce marcos de registro, emisión de métricas y alertas para pipelines de datos. Los estudiantes instrumentan pipelines para detectar fallos e incumplimientos de SLA de manera proactiva.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Analistas de datos: listos para pasar de consultar datos a diseñar pipelines confiables.

  • Desarrolladores backend: con interés en orientar sus habilidades de programación hacia el ámbito de las plataformas de datos.

  • Ingenieros de datos junior: que buscan una ruta estructurada hacia un dominio de Databricks a nivel de producción.

  • Desarrolladores de BI: que desean modernizar su trabajo de ETL utilizando herramientas nativas de lakehouse.

  • Ingenieros DevOps: ampliando su alcance para incluir infraestructura de datos y automatización de pipelines.

  • Estudiantes de posgrado: desarrollando habilidades de ingeniería de datos listas para el trabajo antes de ingresar al mercado laboral.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en México?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF