
Curso de Data Apps en Databricks Lakehouse
Domina la plataforma Databricks Lakehouse desde los fundamentos de arquitectura hasta los pipelines listos para producción. Aprende a ingerir, transformar y gobernar datos a escala usando Delta Lake, Unity Catalog y MLflow. Este curso proporciona a los ingenieros y arquitectos de datos las habilidades prácticas para construir aplicaciones de datos modernas, confiables y rentables.
Lo que vas a aprender:
Configure clústeres de Databricks, notebooks e integraciones de almacenamiento en la nube para cargas de trabajo de producción.
Construye pipelines de ingesta escalables utilizando Auto Loader, COPY INTO y Structured Streaming.
Implementa la Arquitectura Medallion con capas Bronze, Silver y Gold de Delta Lake.
Aplica políticas de Unity Catalog para aplicar la gobernanza de datos, la auditoría y el uso compartido seguro de datos.
Optimiza consultas de Spark SQL y tablas Delta utilizando estrategias de Z-ORDER, particionado y almacenamiento en caché.
Integra el seguimiento de MLflow y el Model Registry para gestionar el ciclo de vida completo del aprendizaje automático.
Cómo estudias de forma práctica Curso de Data Apps en Databricks Lakehouse
Cómo practicas Curso de Data Apps en Databricks Lakehouse
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesArquitectura Lakehouse y Fundamentos de Databricks
Arquitectura Lakehouse y Fundamentos de Databricks
Lección 1 • Descripción General de la Plataforma Databricks
Mapea los principales servicios de Databricks: espacio de trabajo, clústeres, trabajos y Unity Catalog. Los estudiantes obtienen orientación antes de configurar cualquier recurso.
Lección 2 • Configuración y Gestión de Clústeres
Cubre clústeres de propósito general vs. de trabajo, autoescalado y selección de runtime. Un diseño correcto del clúster reduce directamente los costos y mejora la confiabilidad del pipeline.
Lección 3 • Notebooks y Desarrollo Colaborativo
Presenta los notebooks multilenguaje, los comandos mágicos y las funciones de coautoría. Establece el entorno de desarrollo principal que se utilizará a lo largo del curso.
Lección 4 • Integración de Almacenamiento y Conectividad en la Nube
Explica cómo Databricks monta y accede al almacenamiento de objetos en la nube de forma segura. Los estudiantes configuran las credenciales de almacenamiento necesarias para todos los ejercicios de datos posteriores.
Lección 5 • Evolución de Lagos de Datos a Lakehouse
Rastrea las limitaciones de los almacenes de datos y los lagos de datos que motivaron el diseño Lakehouse. Proporciona el contexto histórico necesario para justificar cada decisión arquitectónica cubierta más adelante.
Capítulo 2OcultarOcultar detallesVer detallesFuncionamiento Interno de Delta Lake y Gestión de Tablas
Funcionamiento Interno de Delta Lake y Gestión de Tablas
Lección 1 • Técnicas de Optimización de Tablas
Cubre OPTIMIZE, Z-ORDER y compactación de archivos para mejorar el rendimiento de las consultas. Estas técnicas se aplican a tablas de producción en capítulos avanzados.
Lección 2 • Creación y Modificación de Tablas Delta
Cubre DDL para tablas gestionadas y externas, definición de esquemas y operaciones ALTER. Los estudiantes construyen las tablas utilizadas en todos los ejercicios de pipeline.
Lección 3 • Operaciones DML y Patrones de Merge
Enseña INSERT, UPDATE, DELETE y MERGE INTO con escenarios prácticos de upsert. MERGE es la piedra angular de la carga incremental de datos cubierta en capítulos posteriores.
Lección 4 • Viaje en el Tiempo y Versionado de Datos
Demuestra cómo consultar versiones históricas de tablas y restaurar estados anteriores. Los estudiantes utilizan el viaje en el tiempo para escenarios de auditoría y recuperación.
Lección 5 • Conceptos Básicos de Delta Lake
Explica el registro de transacciones, los archivos de datos Parquet y cómo se logran las garantías ACID. Esta base es necesaria antes de que cualquier operación de tabla tenga sentido.
Capítulo 3OcultarOcultar detallesVer detallesPatrones de Ingesta de Datos y Auto Loader
Patrones de Ingesta de Datos y Auto Loader
Lección 1 • Ingesta por Lotes con COPY INTO
Presenta COPY INTO para la carga idempotente de archivos desde el almacenamiento en la nube hacia tablas Delta. Establece el patrón de ingesta más simple antes de introducir alternativas de streaming.
Lección 2 • Arquitectura de Auto Loader
Explica cómo Auto Loader detecta nuevos archivos usando listado de directorios o notificación de archivos. Los estudiantes comprenden la mecánica interna antes de configurar pipelines.
Lección 3 • Ingesta de Datos Semiestructurados
Enseña el análisis de JSON, XML y estructuras anidadas durante la ingesta. Los estudiantes aplanan y normalizan cargas útiles complejas en columnas Delta consultables.
Lección 4 • Ingesta de Streaming desde Agentes de Mensajes
Conecta Databricks a plataformas de streaming de eventos para la ingesta en tiempo real en Delta. Los estudiantes configuran offsets, grupos de consumidores y semántica exactly-once.
Lección 5 • Inferencia y Evolución de Esquemas
Cubre la detección automática de esquemas, sugerencias de esquema y el manejo de cambios de esquema en tiempo de ejecución. Una gestión de esquemas robusta previene fallos en los pipelines de producción.
Capítulo 4OcultarOcultar detallesVer detallesSpark SQL y Transformaciones de DataFrame
Spark SQL y Transformaciones de DataFrame
Lección 1 • Funciones Definidas por el Usuario y Funciones de Orden Superior
Presenta las UDF de Python, las Pandas UDF y las funciones de orden superior integradas para arrays y maps. Los estudiantes amplían Spark SQL con lógica personalizada de manera eficiente.
Lección 2 • API de DataFrame en Python y Scala
Enseña la creación de DataFrames, operaciones de columna y el encadenamiento de transformaciones mediante programación. Los estudiantes eligen entre los enfoques SQL y API según el caso de uso.
Lección 3 • Fundamentos de Spark SQL
Revisa la sintaxis SQL dentro de Databricks, incluyendo CTEs, funciones de ventana y subconsultas. Proporciona la base de consultas para todo el trabajo de transformación en el curso.
Lección 4 • Agregaciones y Joins
Cubre groupBy, pivot y todas las estrategias de join con sus implicaciones de rendimiento. La selección correcta del join es crítica para evitar el sesgo de datos en grandes conjuntos de datos.
Lección 5 • Optimización de Consultas y el Planificador Catalyst
Explica los planes lógicos y físicos, el predicate pushdown y la poda de particiones. Los estudiantes leen planes EXPLAIN para diagnosticar y corregir consultas lentas.
Capítulo 5OcultarOcultar detallesVer detallesConstrucción de Pipelines de Arquitectura Medallón
Construcción de Pipelines de Arquitectura Medallón
Lección 1 • Delta Live Tables para Orquestación de Pipelines
Presenta los pipelines declarativos de DLT, las expectativas y la resolución automática de dependencias. Los estudiantes migran un pipeline Medallón manual a un pipeline DLT gestionado.
Lección 2 • Implementación de la Capa Bronce
Construye la capa de ingesta cruda utilizando Auto Loader con columnas de metadatos y campos de auditoría. Los estudiantes aplican los patrones de ingesta del Capítulo 3 en un pipeline estructurado.
Lección 3 • Principios de Diseño de la Arquitectura Medallón
Define el propósito y las expectativas de calidad de datos de cada capa Medallón. Un diseño de capas correcto previene que los problemas de calidad de datos se propaguen hacia abajo.
Lección 4 • Limpieza y Conformación de la Capa Plata
Aplica reglas de calidad de datos, deduplicación y conversión de tipos para producir tablas Plata. Los estudiantes usan MERGE para actualizar incrementalmente la capa Plata desde Bronce.
Lección 5 • Agregación y Servicio de la Capa Oro
Crea tablas Oro agregadas y desnormalizadas optimizadas para el consumo de BI y ML. Los estudiantes aplican Z-ORDER y particionado para el rendimiento de las consultas.
Capítulo 6OcultarOcultar detallesVer detallesUnity Catalog y Gobernanza de Datos
Unity Catalog y Gobernanza de Datos
Lección 1 • Compartición de Datos con Delta Sharing
Configura Delta Sharing de protocolo abierto para distribuir datos a destinatarios externos de forma segura. Los estudiantes publican shares y gestionan credenciales de destinatarios sin copiar datos.
Lección 2 • Linaje de Datos y Descubrimiento
Demuestra la captura automática de linaje a nivel de columna y la interfaz de búsqueda del catálogo de datos. El linaje permite el análisis de impacto antes de desplegar cambios en el esquema.
Lección 3 • Gestión de Identidad y Acceso
Cubre usuarios, grupos, service principals y concesión de privilegios en Unity Catalog. Los estudiantes implementan acceso de privilegio mínimo para analistas, ingenieros y trabajos automatizados.
Lección 4 • Modelo de Objetos de Unity Catalog
Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Comprender el modelo de objetos es un requisito previo para asignar cualquier permiso.
Lección 5 • Auditoría y Monitoreo de Cumplimiento
Consulta el registro de auditoría de Unity Catalog para detectar accesos no autorizados y violaciones de políticas. Los estudiantes construyen dashboards de auditoría alineados con los requisitos de gobernanza de datos.
Capítulo 7OcultarOcultar detallesVer detallesIntegración de Machine Learning con MLflow
Integración de Machine Learning con MLflow
Lección 1 • Inferencia de Modelos por Lotes y en Tiempo Real
Despliega modelos registrados para puntuación por lotes en tablas Delta y servicio en tiempo real a través de endpoints. Los estudiantes escriben los resultados de la inferencia de vuelta a las tablas Delta de la capa Oro.
Lección 2 • Entrenamiento de Modelos en Spark DataFrames
Entrena modelos de scikit-learn y Spark MLlib utilizando datos de características respaldados por Delta a escala. Los estudiantes aplican validación cruzada y ajuste de hiperparámetros dentro de Databricks.
Lección 3 • MLflow Model Registry y Ciclo de Vida
Registra modelos, gestiona las transiciones de etapa y aplica flujos de trabajo de aprobación en el Model Registry. Los estudiantes promueven un modelo de staging a producción de forma segura.
Lección 4 • Seguimiento de MLflow y Gestión de Experimentos
Enseña el registro de parámetros, métricas y artefactos en experimentos de MLflow desde notebooks de Databricks. El seguimiento sistemático es la base del aprendizaje automático reproducible.
Lección 5 • Ingeniería de Características con Feature Store
Crea y publica tablas de características en el Databricks Feature Store respaldado por Delta. Los estudiantes vinculan características a conjuntos de datos de entrenamiento para una paridad consistente entre entrenamiento y servicio.
Capítulo 8OcultarOcultar detallesVer detallesOperaciones de Producción y Ajuste de Rendimiento
Operaciones de Producción y Ajuste de Rendimiento
Lección 1 • Databricks Workflows y Orquestación de Trabajos
Construye trabajos de múltiples tareas con dependencias, ramificación condicional y lógica de reintento en Databricks Workflows. Los estudiantes reemplazan las ejecuciones ad-hoc de notebooks con pipelines gobernados y programados.
Lección 2 • Almacenamiento en Caché, Particionado y Gestión de Archivos
Aplica el almacenamiento en caché de Delta, el almacenamiento en caché de disco y el particionado estratégico para acelerar las consultas repetidas. Los estudiantes equilibran la granularidad de la partición frente a la sobrecarga de archivos pequeños.
Lección 3 • Observabilidad y Alertas
Configura las tablas del sistema de Databricks, las métricas de Ganglia y las alertas externas para la salud del pipeline. Los estudiantes construyen un dashboard de monitoreo que cubre la latencia, los errores y la frescura de los datos.
Lección 4 • Gestión de Costos y Optimización de Clústeres
Analiza el consumo de DBU, aplica estrategias de grupos de instancias y dimensiona correctamente los clústeres. El control de costos es esencial antes de escalar las cargas de trabajo a volúmenes de producción.
Lección 5 • Diagnóstico de Rendimiento de Spark
Utiliza la UI de Spark, las líneas de tiempo de las etapas y las métricas de tareas para identificar cuellos de botella. Los estudiantes diagnostican derrames de shuffle, sesgo y fallos de ejecutor de manera sistemática.
Tu certificado válido de finalización
Este curso es para ti:
Ingeniero de datos: listo para ir más allá de Spark básico hacia la arquitectura de Lakehouse.
Arquitecto en la nube: diseñando estrategias de almacenamiento unificado para plataformas de datos empresariales.
Ingeniero de analítica: cerrando la brecha entre los datos en bruto y las tablas listas para el negocio.
Científico de datos: con el deseo de operacionalizar modelos dentro de un entorno de datos gobernado.
Desarrollador de BI: que busca una mayor propiedad sobre los pipelines, más allá de los dashboards y reportes.
Ingeniero de software: transitando hacia roles de ingeniería de infraestructura y plataformas de datos.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en México?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















