Elige tu idioma
Curso de Ingeniería de Datos con Databricks
Más de 2 millones de estudiantes en todo el mundo

Curso de Ingeniería de Datos con Databricks

Domine el stack de ingeniería de datos completo de Databricks: desde los fundamentos de Apache Spark y la arquitectura de Delta Lake hasta la orquestación de pipelines para producción y el gobierno empresarial. Este curso le brinda las habilidades prácticas para diseñar, optimizar y operar plataformas de datos confiables que escalan. Ya sea que esté ingresando al campo de la ingeniería de datos o mejorando su experiencia en lakehouse, este es el entrenamiento definitivo en Databricks.

Dedika para empresas

Lo que vas a aprender:

  • Configure y administre clústeres, espacios de trabajo y recursos de cómputo de Databricks de manera eficiente.

  • Construya pipelines de ELT escalables usando Auto Loader, Structured Streaming y la arquitectura de medallón.

  • Implemente tablas de Delta Lake con transacciones ACID, viajes en el tiempo y evolución de esquemas.

  • Cree pipelines declarativos y con capacidad de autorreparación usando Delta Live Tables y expectativas de calidad.

  • Aplique técnicas avanzadas de afinación de Spark, incluyendo AQE, estrategias de particionamiento y el motor Photon.

  • Implemente gobierno de datos empresariales, control de acceso y seguimiento de linaje usando Unity Catalog.

Cómo estudias de forma práctica Curso de Ingeniería de Datos con Databricks

Cómo practicas Curso de Ingeniería de Datos con Databricks

Para ti que eres empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de la Plataforma Databricks

  • Lección 1 • Configuración y Gestión de Clústeres

    Enseña la creación de clústeres, su dimensionamiento, el autoescalado y las políticas de terminación. Los estudiantes obtienen control sobre los costos y el rendimiento del cómputo desde el principio.

  • Lección 2 • Descripción General de la Arquitectura de Databricks

    Cubre el plano de control, el plano de datos y la arquitectura de clústeres que sustentan Databricks. Fundamenta todo el uso posterior de la plataforma en un modelo mental claro.

  • Lección 3 • Navegación y Configuración del Espacio de Trabajo

    Introduce la interfaz de usuario de Databricks, la estructura de carpetas y la configuración del usuario. Permite a los estudiantes organizar proyectos y gestionar entornos personales de manera efectiva.

  • Lección 4 • Fundamentos de la CLI y la API REST de Databricks

    Introduce el acceso programático a la plataforma a través de la CLI y la API REST. Prepara a los estudiantes para las tareas de automatización que se cubren en capítulos posteriores.

  • Lección 5 • Notebooks y Desarrollo Colaborativo

    Explora la creación de notebooks, los comandos mágicos y las funcionalidades de colaboración en tiempo real. Establece la interfaz de desarrollo principal utilizada a lo largo del curso.

Capítulo 2Ver detalles

Conceptos Básicos de Apache Spark

  • Lección 1 • Transformaciones y Acciones

    Distingue transformaciones estrechas vs. anchas y explica los desencadenantes de las acciones. Los estudiantes aprenden a razonar sobre los costos de Shuffle y los límites de ejecución.

  • Lección 2 • Modelo de Ejecución Distribuida de Spark

    Explica los RDD, los DAG, las etapas y las tareas dentro del motor de ejecución de Spark. Proporciona la base conceptual para escribir código distribuido eficiente.

  • Lección 3 • Fundamentos de la API DataFrame

    Cubre la creación de DataFrames, la inferencia de esquemas y las transformaciones principales. Los estudiantes aplican estas operaciones como la interfaz principal de manipulación de datos.

  • Lección 4 • Fundamentos de Rendimiento en Spark

    Introduce la Spark UI, los planes de ejecución y las palancas básicas de ajuste. Capacita a los estudiantes para diagnosticar y abordar cuellos de botella de rendimiento comunes.

  • Lección 5 • Spark SQL y Catálogo

    Enseña consultas SQL sobre DataFrames y el catálogo de Spark para la gestión de metadatos. Une el conocimiento de SQL con el uso programático de Spark.

Capítulo 3Ver detalles

Arquitectura y Operaciones de Delta Lake

  • Lección 1 • Formato de Almacenamiento de Delta Lake

    Explica los archivos Parquet, el registro de transacciones y los archivos de checkpoint que conforman Delta Lake. Los estudiantes entienden por qué Delta ofrece confiabilidad sobre los formatos de archivo en bruto.

  • Lección 2 • Creación y Gestión de Tablas Delta

    Cubre DDL para crear, alterar y eliminar tablas Delta. Establece las habilidades de gestión de tablas necesarias para todo el trabajo de pipeline futuro.

  • Lección 3 • Transacciones ACID y Concurrencia

    Enseña el control de concurrencia optimista, los niveles de aislamiento y la resolución de conflictos en Delta. Los estudiantes pueden diseñar pipelines que gestionen escrituras concurrentes de forma segura.

  • Lección 4 • Técnicas de Optimización en Delta Lake

    Cubre OPTIMIZE, Z-ordering y compactación de archivos para mejorar el rendimiento de las consultas. Los estudiantes aplican estas técnicas a tablas Delta de grado de producción.

  • Lección 5 • Viaje en el Tiempo y Versionado de Datos

    Demuestra la consulta de versiones históricas de tablas y la restauración de estados anteriores. Habilita patrones de auditoría, reversión y reproducibilidad en los pipelines de datos.

Capítulo 4Ver detalles

Ingesta de Datos y Patrones ELT

  • Lección 1 • Patrones de Diseño ELT

    Presenta la arquitectura Medallion y las estrategias de carga incremental para ELT estructurado. Los estudiantes diseñan pipelines multi-hop que separan las capas en bruto, depurada y curada.

  • Lección 2 • Ingesta Batch desde Fuentes Comunes

    Enseña la lectura desde almacenamiento de objetos en la nube, bases de datos JDBC y formatos de archivo. Proporciona la base de ingesta para todos los patrones de pipeline en este capítulo.

  • Lección 3 • Aseguramiento de la Calidad de Datos en la Ingesta

    Enseña validación basada en restricciones, patrones de cuarentena y marcos de expectativas. Asegura que la calidad de los datos se aplique antes de que los datos lleguen a los consumidores posteriores.

  • Lección 4 • Fundamentos de Structured Streaming

    Cubre Streaming DataFrames, disparadores y modos de salida para el procesamiento continuo de datos. Conecta los conceptos de streaming con el destino Delta Lake utilizado en producción.

  • Lección 5 • Auto Loader para Ingesta Incremental

    Introduce los modos de notificación de archivos y listado de directorios de Auto Loader para cargas incrementales escalables. Los estudiantes configuran el checkpointing y la evolución de esquemas en Auto Loader.

Capítulo 5Ver detalles

Delta Live Tables y Orquestación de Pipelines

  • Lección 1 • Configuración y Despliegue de Pipelines

    Enseña la configuración de pipelines, políticas de clúster y el despliegue a través de la UI y la API. Los estudiantes configuran pipelines listos para producción con los ajustes de cómputo y almacenamiento adecuados.

  • Lección 2 • Monitorización y Resolución de Problemas en DLT

    Explora el log de eventos, las métricas de la UI del pipeline y los patrones de fallo comunes. Los estudiantes diagnostican y resuelven problemas del pipeline utilizando las herramientas de observabilidad integradas.

  • Lección 3 • Calidad de Datos con Expectativas

    Cubre las restricciones EXPECT, EXPECT OR DROP y EXPECT OR FAIL en DLT. Los estudiantes integran reglas de calidad directamente en las definiciones del pipeline para su aplicación automatizada.

  • Lección 4 • Orquestación de Pipelines con Databricks Workflows

    Integra pipelines DLT en Workflows de Databricks de múltiples tareas con dependencias y programación horaria. Los estudiantes construyen productos de datos orquestados de extremo a extremo.

  • Lección 5 • Conceptos Básicos de Delta Live Tables

    Introduce la sintaxis de DLT, las tablas live, las tablas streaming live y el grafo del pipeline. Establece el paradigma declarativo que distingue DLT del código Spark imperativo.

Capítulo 6Ver detalles

Unity Catalog y Gobernanza de Datos

  • Lección 1 • Gestión de Identidad y Acceso

    Cubre usuarios, grupos, service principals y la concesión de privilegios en Unity Catalog. Los estudiantes implementan modelos de acceso con privilegios mínimos para los activos de datos.

  • Lección 2 • Arquitectura de Unity Catalog

    Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Proporciona la comprensión estructural necesaria para diseñar espacios de nombres gobernados.

  • Lección 3 • Compartición de Datos con Delta Sharing

    Introduce el protocolo abierto Delta Sharing para la compartición de datos entre plataformas y organizaciones. Los estudiantes publican y consumen conjuntos de datos compartidos de forma segura.

  • Lección 4 • Auditoría y Cumplimiento Normativo

    Enseña el acceso al log de auditoría, el historial de consultas y los patrones de informes de cumplimiento. Los estudiantes configuran la monitorización para satisfacer los requisitos de auditoría empresarial.

  • Lección 5 • Linaje de Datos y Descubrimiento

    Demuestra la captura automática de linaje y el explorador de datos para el descubrimiento de activos. Los estudiantes utilizan el linaje para rastrear el flujo de datos y respaldar el análisis de impacto.

Capítulo 7Ver detalles

Optimización y Ajuste Avanzado de Spark

  • Lección 1 • Optimización Basada en Costos y Estadísticas

    Cubre ANALYZE TABLE, estadísticas de columna y el reordenamiento de joins del optimizador basado en costos. Los estudiantes recopilan y aprovechan las estadísticas para mejorar la calidad de los planes de ejecución.

  • Lección 2 • Gestión de Memoria y Derrame

    Cubre las regiones de memoria de Spark, el dimensionamiento de ejecutores y la detección y mitigación de derrames. Los estudiantes configuran los ajustes de memoria para eliminar costosos derrames a disco.

  • Lección 3 • Photon Engine y Ejecución Vectorizada

    Introduce el motor Photon de Databricks y sus beneficios de ejecución vectorizada. Los estudiantes identifican las cargas de trabajo que más se benefician de Photon y lo habilitan adecuadamente.

  • Lección 4 • Estrategias de Particionamiento y Shuffle

    Enseña el número óptimo de particiones, repartition vs. coalesce, y el ajuste de Shuffle. Los estudiantes eliminan el sesgo de datos y reducen la sobrecarga de Shuffle en pipelines complejos.

  • Lección 5 • Adaptive Query Execution

    Explica los ajustes en tiempo de ejecución del plan de AQE para joins, sesgo y coalesce. Los estudiantes habilitan y configuran AQE para reducir la sobrecarga de ajuste manual.

Capítulo 8Ver detalles

Prácticas de Ingeniería de Datos en Producción

  • Lección 1 • Gestión de Costos y FinOps

    Cubre el análisis de consumo de DBU, el redimensionamiento adecuado de clústeres y las estrategias de instancias spot. Los estudiantes reducen los costos de cómputo sin sacrificar la confiabilidad del pipeline.

  • Lección 2 • CI/CD para Proyectos en Databricks

    Enseña los Databricks Asset Bundles, la automatización del despliegue y la promoción entre entornos. Los estudiantes implementan un pipeline de CI/CD completo desde desarrollo hasta producción.

  • Lección 3 • Fortalecimiento de Seguridad y Mejores Prácticas

    Enseña el aislamiento de red, la gestión de secretos y el manejo seguro de credenciales. Los estudiantes aplican principios de defensa en profundidad para proteger los activos de datos en producción.

  • Lección 4 • Pruebas de Pipelines de Datos

    Cubre las pruebas unitarias con pytest, estrategias de pruebas de integración y la gestión de datos de prueba. Los estudiantes construyen un conjunto de pruebas que valida la lógica del pipeline antes del despliegue.

  • Lección 5 • Observabilidad y Monitorización de Pipelines

    Introduce marcos de registro, emisión de métricas y alertas para pipelines de datos. Los estudiantes instrumentan pipelines para detectar fallos e incumplimientos de SLA de forma proactiva.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Analistas de datos: listos para pasar de consultar datos a construir pipelines confiables.

  • Desarrolladores backend: buscando orientar sus habilidades de programación hacia el espacio de plataformas de datos.

  • Ingenieros de datos junior: buscando un camino estructurado hacia la experiencia en Databricks a nivel de producción.

  • Desarrolladores de BI: con el propósito de modernizar su trabajo de ETL utilizando herramientas nativas de lakehouse.

  • Ingenieros de DevOps: ampliando su alcance para incluir infraestructura de datos y automatización de pipelines.

  • Estudiantes de posgrado: desarrollando habilidades de ingeniería de datos listas para el empleo antes de ingresar al mercado laboral.

Lo que dicen nuestros estudiantes

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en Colombia?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF