
Curso de Data Apps con Databricks Lakehouse
Dominar la plataforma Databricks Lakehouse, desde los fundamentos de la arquitectura hasta pipelines listos para producción. Aprender a ingerir, transformar y gobernar datos a escala usando Delta Lake, Unity Catalog y MLflow. Este curso brinda a los ingenieros y arquitectos de datos las habilidades prácticas para construir aplicaciones de datos modernas, confiables y rentables.
Qué vas a aprender:
Configurar clusters de Databricks, notebooks e integraciones de almacenamiento en la nube para cargas de trabajo en producción.
Construir pipelines de ingesta escalables usando Auto Loader, COPY INTO y Structured Streaming.
Implementar la Arquitectura Medallion con capas Bronze, Silver y Gold Delta Lake.
Aplicar políticas de Unity Catalog para hacer cumplir la gobernanza de datos, la auditoría y el uso compartido seguro de datos.
Optimizar consultas Spark SQL y tablas Delta usando estrategias de Z-ORDER, particionamiento y caché.
Integrar el seguimiento de MLflow y el Model Registry para gestionar el ciclo de vida completo del aprendizaje automático.
Cómo estudiás de forma práctica Curso de Data Apps con Databricks Lakehouse
Cómo practicás Curso de Data Apps con Databricks Lakehouse
Para vos que sos empresa y querés capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesArquitectura Lakehouse y fundamentos de Databricks
Arquitectura Lakehouse y fundamentos de Databricks
Lección 1 • Descripción general de la plataforma Databricks
Mapea los principales servicios de Databricks: workspace, clusters, jobs y Unity Catalog. Los estudiantes se orientan antes de configurar cualquier recurso.
Lección 2 • Configuración y gestión de clusters
Cubre los clusters de uso general vs. job, el autoescalado y la selección del runtime. Un diseño de cluster correcto reduce directamente los costos y mejora la confiabilidad del pipeline.
Lección 3 • Notebooks y desarrollo colaborativo
Presenta notebooks multilingüe, comandos mágicos y funciones de coautoría. Establece el entorno de desarrollo principal que se usa a lo largo del curso.
Lección 4 • Integración de almacenamiento y conectividad en la nube
Explica cómo Databricks monta y accede de forma segura al almacenamiento de objetos en la nube. Los estudiantes configuran las credenciales de almacenamiento necesarias para todos los ejercicios de datos posteriores.
Lección 5 • Evolución de los lagos de datos a Lakehouse
Traza las limitaciones de los almacenes de datos y los lagos de datos que motivaron el diseño Lakehouse. Proporciona el contexto histórico necesario para justificar cada decisión arquitectónica que se cubre más adelante.
Capítulo 2OcultarOcultar detallesVer detallesFuncionamiento interno de Delta Lake y gestión de tablas
Funcionamiento interno de Delta Lake y gestión de tablas
Lección 1 • Técnicas de optimización de tablas
Cubre OPTIMIZE, Z-ORDER y compactación de archivos para mejorar el rendimiento de las consultas. Estas técnicas se aplican a tablas de producción en capítulos avanzados.
Lección 2 • Creación y modificación de tablas Delta
Cubre DDL para tablas gestionadas y externas, definición de esquemas y operaciones ALTER. Los estudiantes construyen las tablas que se usan en todos los ejercicios de pipeline.
Lección 3 • Operaciones DML y patrones de merge
Enseña INSERT, UPDATE, DELETE y MERGE INTO con escenarios prácticos de upsert. MERGE es la piedra angular de la carga incremental de datos que se cubre en capítulos posteriores.
Lección 4 • Time Travel y versionado de datos
Demuestra la consulta de versiones históricas de tablas y la restauración de estados anteriores. Los estudiantes usan Time Travel para escenarios de auditoría y recuperación.
Lección 5 • Conceptos centrales de Delta Lake
Explica el log de transacciones, los archivos de datos Parquet y cómo se logran las garantías ACID. Esta base es necesaria antes de que cualquier operación de tabla tenga sentido.
Capítulo 3OcultarOcultar detallesVer detallesPatrones de ingesta de datos y Auto Loader
Patrones de ingesta de datos y Auto Loader
Lección 1 • Ingesta batch con COPY INTO
Presenta COPY INTO para la carga idempotente de archivos desde el almacenamiento en la nube hacia tablas Delta. Establece el patrón de ingesta más simple antes de presentar alternativas de streaming.
Lección 2 • Arquitectura de Auto Loader
Explica cómo Auto Loader detecta archivos nuevos usando listado de directorios o notificación de archivos. Los estudiantes entienden la mecánica interna antes de configurar pipelines.
Lección 3 • Ingesta de datos semiestructurados
Enseña el parseo de JSON, XML y estructuras anidadas durante la ingesta. Los estudiantes aplanan y normalizan cargas útiles complejas en columnas Delta consultables.
Lección 4 • Ingesta de streaming desde brokers de mensajes
Conecta Databricks a plataformas de streaming de eventos para la ingesta en tiempo real en Delta. Los estudiantes configuran offsets, grupos de consumidores y semántica exactly-once.
Lección 5 • Inferencia y evolución de esquemas
Cubre la detección automática de esquemas, las sugerencias de esquema y el manejo de cambios de esquema en tiempo de ejecución. Una gestión robusta de esquemas previene fallas en los pipelines en producción.
Capítulo 4OcultarOcultar detallesVer detallesSpark SQL y transformaciones con DataFrames
Spark SQL y transformaciones con DataFrames
Lección 1 • Funciones definidas por el usuario y funciones de orden superior
Presenta UDFs en Python, Pandas UDFs y funciones de orden superior integradas para arrays y maps. Los estudiantes extienden Spark SQL con lógica personalizada de manera eficiente.
Lección 2 • API de DataFrames en Python y Scala
Enseña la creación de DataFrames, operaciones con columnas y el encadenamiento de transformaciones de forma programática. Los estudiantes eligen entre enfoques SQL y API según el caso de uso.
Lección 3 • Fundamentos de Spark SQL
Revisa la sintaxis SQL dentro de Databricks, incluyendo CTEs, funciones de ventana y subconsultas. Proporciona la base de consultas para todo el trabajo de transformación en el curso.
Lección 4 • Agregaciones y joins
Cubre groupBy, pivot y todas las estrategias de join con sus implicancias de rendimiento. La selección correcta del join es crítica para evitar el data skew en grandes conjuntos de datos.
Lección 5 • Optimización de consultas y el Catalyst Planner
Explica los planes lógicos y físicos, el predicate pushdown y el partition pruning. Los estudiantes leen explain plans para diagnosticar y corregir consultas lentas.
Capítulo 5OcultarOcultar detallesVer detallesConstrucción de pipelines con arquitectura Medallion
Construcción de pipelines con arquitectura Medallion
Lección 1 • Delta Live Tables para orquestación de pipelines
Presenta los pipelines declarativos de DLT, las expectations y la resolución automática de dependencias. Los estudiantes migran un pipeline Medallion manual a un pipeline DLT gestionado.
Lección 2 • Implementación de la capa Bronze
Construye la capa de ingesta cruda usando Auto Loader con columnas de metadatos y campos de auditoría. Los estudiantes aplican patrones de ingesta del Capítulo 3 en un pipeline estructurado.
Lección 3 • Principios de diseño de arquitectura Medallion
Define el propósito y las expectativas de calidad de datos de cada capa Medallion. Un diseño de capas correcto evita que los problemas de calidad de datos se propaguen hacia adelante.
Lección 4 • Depuración y conformación de la capa Silver
Aplica reglas de calidad de datos, deduplicación y casteo de tipos para producir tablas Silver. Los estudiantes usan MERGE para actualizar incrementalmente Silver desde Bronze.
Lección 5 • Agregación y exposición de la capa Gold
Crea tablas Gold agregadas y desnormalizadas optimizadas para el consumo de BI y ML. Los estudiantes aplican Z-ORDER y particionamiento para el rendimiento de consultas.
Capítulo 6OcultarOcultar detallesVer detallesUnity Catalog y gobierno de datos
Unity Catalog y gobierno de datos
Lección 1 • Compartición de datos con Delta Sharing
Configura Delta Sharing de protocolo abierto para distribuir datos a destinatarios externos de forma segura. Los estudiantes publican shares y gestionan credenciales de destinatarios sin copiar datos.
Lección 2 • Linaje y descubrimiento de datos
Demuestra la captura automática de linaje a nivel de columna y la interfaz de búsqueda del catálogo de datos. El linaje permite el análisis de impacto antes de desplegar cambios de esquema.
Lección 3 • Gestión de identidad y acceso
Cubre usuarios, grupos, service principals y concesión de privilegios en Unity Catalog. Los estudiantes implementan acceso con privilegios mínimos para analistas, ingenieros y jobs automatizados.
Lección 4 • Modelo de objetos de Unity Catalog
Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Entender el modelo de objetos es un prerrequisito para asignar cualquier permiso.
Lección 5 • Auditoría y monitoreo de cumplimiento
Consulta el log de auditoría de Unity Catalog para detectar accesos no autorizados y violaciones de políticas. Los estudiantes construyen dashboards de auditoría alineados con los requisitos de gobierno de datos.
Capítulo 7OcultarOcultar detallesVer detallesIntegración de machine learning con MLflow
Integración de machine learning con MLflow
Lección 1 • Inferencia de modelos batch y en tiempo real
Despliega modelos registrados para scoring batch en tablas Delta y serving en tiempo real vía endpoints. Los estudiantes escriben los resultados de la inferencia de vuelta en tablas Delta de la capa Gold.
Lección 2 • Entrenamiento de modelos en Spark DataFrames
Entrena modelos de scikit-learn y Spark MLlib usando datos de features respaldados por Delta a escala. Los estudiantes aplican validación cruzada y ajuste de hiperparámetros dentro de Databricks.
Lección 3 • MLflow Model Registry y ciclo de vida
Registra modelos, gestiona transiciones de etapa y aplica flujos de trabajo de aprobación en el Model Registry. Los estudiantes promueven un modelo de staging a producción de forma segura.
Lección 4 • MLflow Tracking y gestión de experimentos
Enseña el registro de parámetros, métricas y artefactos en experimentos de MLflow desde notebooks de Databricks. El tracking sistemático es la base del ML reproducible.
Lección 5 • Ingeniería de features con Feature Store
Crea y publica tablas de features en el Databricks Feature Store respaldado por Delta. Los estudiantes vinculan features a conjuntos de datos de entrenamiento para una paridad train-serve coherente.
Capítulo 8OcultarOcultar detallesVer detallesOperaciones de producción y ajuste de rendimiento
Operaciones de producción y ajuste de rendimiento
Lección 1 • Databricks Workflows y orquestación de jobs
Construye jobs multitarea con dependencias, ramificaciones condicionales y lógica de reintento en Databricks Workflows. Los estudiantes reemplazan las ejecuciones ad-hoc de notebooks con pipelines gobernados y programados.
Lección 2 • Caching, particionamiento y gestión de archivos
Aplica Delta caching, disk caching y particionamiento estratégico para acelerar consultas repetidas. Los estudiantes equilibran la granularidad del particionamiento con la sobrecarga de archivos pequeños.
Lección 3 • Observabilidad y alertas
Configura las tablas de sistema de Databricks, las métricas de Ganglia y las alertas externas para la salud del pipeline. Los estudiantes construyen un dashboard de monitoreo que cubre latencia, errores y frescura de datos.
Lección 4 • Gestión de costos y optimización de clusters
Analiza el consumo de DBU, aplica estrategias de pools de instancias y ajusta el tamaño de los clusters. El control de costos es esencial antes de escalar las cargas de trabajo a volúmenes de producción.
Lección 5 • Diagnóstico de rendimiento de Spark
Usa la Spark UI, las líneas de tiempo de las etapas y las métricas de tareas para identificar cuellos de botella. Los estudiantes diagnostican derrames de shuffle, skew y fallas de ejecutores de manera sistemática.
Tu certificado válido de finalización
Este curso es para vos:
Ingeniero de datos: listo para ir más allá de Spark básico y adentrarse en la arquitectura Lakehouse.
Arquitecto de cloud: diseñando estrategias de almacenamiento unificado para plataformas de datos empresariales.
Ingeniero de analítica: acortando la brecha entre los datos sin procesar y las tablas listas para el negocio.
Científico de datos: con ganas de operacionalizar modelos dentro de un entorno de datos gobernado.
Desarrollador de BI: buscando una mayor apropiación del pipeline más allá de los tableros y los informes.
Ingeniero de software: en transición hacia roles de infraestructura de datos e ingeniería de plataformas.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los recomendé a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltear contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Argentina?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















