Elige tu idioma
Curso de Data Apps con Databricks Lakehouse
Más de 2 millones de estudiantes en todo el mundo

Curso de Data Apps con Databricks Lakehouse

Dominar la plataforma Databricks Lakehouse, desde los fundamentos de la arquitectura hasta pipelines listos para producción. Aprender a ingerir, transformar y gobernar datos a escala usando Delta Lake, Unity Catalog y MLflow. Este curso brinda a los ingenieros y arquitectos de datos las habilidades prácticas para construir aplicaciones de datos modernas, confiables y rentables.

Dedika para empresas

Qué vas a aprender:

  • Configurar clusters de Databricks, notebooks e integraciones de almacenamiento en la nube para cargas de trabajo en producción.

  • Construir pipelines de ingesta escalables usando Auto Loader, COPY INTO y Structured Streaming.

  • Implementar la Arquitectura Medallion con capas Bronze, Silver y Gold Delta Lake.

  • Aplicar políticas de Unity Catalog para hacer cumplir la gobernanza de datos, la auditoría y el uso compartido seguro de datos.

  • Optimizar consultas Spark SQL y tablas Delta usando estrategias de Z-ORDER, particionamiento y caché.

  • Integrar el seguimiento de MLflow y el Model Registry para gestionar el ciclo de vida completo del aprendizaje automático.

Cómo estudiás de forma práctica Curso de Data Apps con Databricks Lakehouse

Cómo practicás Curso de Data Apps con Databricks Lakehouse

Para vos que sos empresa y querés capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Hacé clic acá

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Arquitectura Lakehouse y fundamentos de Databricks

  • Lección 1 • Descripción general de la plataforma Databricks

    Mapea los principales servicios de Databricks: workspace, clusters, jobs y Unity Catalog. Los estudiantes se orientan antes de configurar cualquier recurso.

  • Lección 2 • Configuración y gestión de clusters

    Cubre los clusters de uso general vs. job, el autoescalado y la selección del runtime. Un diseño de cluster correcto reduce directamente los costos y mejora la confiabilidad del pipeline.

  • Lección 3 • Notebooks y desarrollo colaborativo

    Presenta notebooks multilingüe, comandos mágicos y funciones de coautoría. Establece el entorno de desarrollo principal que se usa a lo largo del curso.

  • Lección 4 • Integración de almacenamiento y conectividad en la nube

    Explica cómo Databricks monta y accede de forma segura al almacenamiento de objetos en la nube. Los estudiantes configuran las credenciales de almacenamiento necesarias para todos los ejercicios de datos posteriores.

  • Lección 5 • Evolución de los lagos de datos a Lakehouse

    Traza las limitaciones de los almacenes de datos y los lagos de datos que motivaron el diseño Lakehouse. Proporciona el contexto histórico necesario para justificar cada decisión arquitectónica que se cubre más adelante.

Capítulo 2Ver detalles

Funcionamiento interno de Delta Lake y gestión de tablas

  • Lección 1 • Técnicas de optimización de tablas

    Cubre OPTIMIZE, Z-ORDER y compactación de archivos para mejorar el rendimiento de las consultas. Estas técnicas se aplican a tablas de producción en capítulos avanzados.

  • Lección 2 • Creación y modificación de tablas Delta

    Cubre DDL para tablas gestionadas y externas, definición de esquemas y operaciones ALTER. Los estudiantes construyen las tablas que se usan en todos los ejercicios de pipeline.

  • Lección 3 • Operaciones DML y patrones de merge

    Enseña INSERT, UPDATE, DELETE y MERGE INTO con escenarios prácticos de upsert. MERGE es la piedra angular de la carga incremental de datos que se cubre en capítulos posteriores.

  • Lección 4 • Time Travel y versionado de datos

    Demuestra la consulta de versiones históricas de tablas y la restauración de estados anteriores. Los estudiantes usan Time Travel para escenarios de auditoría y recuperación.

  • Lección 5 • Conceptos centrales de Delta Lake

    Explica el log de transacciones, los archivos de datos Parquet y cómo se logran las garantías ACID. Esta base es necesaria antes de que cualquier operación de tabla tenga sentido.

Capítulo 3Ver detalles

Patrones de ingesta de datos y Auto Loader

  • Lección 1 • Ingesta batch con COPY INTO

    Presenta COPY INTO para la carga idempotente de archivos desde el almacenamiento en la nube hacia tablas Delta. Establece el patrón de ingesta más simple antes de presentar alternativas de streaming.

  • Lección 2 • Arquitectura de Auto Loader

    Explica cómo Auto Loader detecta archivos nuevos usando listado de directorios o notificación de archivos. Los estudiantes entienden la mecánica interna antes de configurar pipelines.

  • Lección 3 • Ingesta de datos semiestructurados

    Enseña el parseo de JSON, XML y estructuras anidadas durante la ingesta. Los estudiantes aplanan y normalizan cargas útiles complejas en columnas Delta consultables.

  • Lección 4 • Ingesta de streaming desde brokers de mensajes

    Conecta Databricks a plataformas de streaming de eventos para la ingesta en tiempo real en Delta. Los estudiantes configuran offsets, grupos de consumidores y semántica exactly-once.

  • Lección 5 • Inferencia y evolución de esquemas

    Cubre la detección automática de esquemas, las sugerencias de esquema y el manejo de cambios de esquema en tiempo de ejecución. Una gestión robusta de esquemas previene fallas en los pipelines en producción.

Capítulo 4Ver detalles

Spark SQL y transformaciones con DataFrames

  • Lección 1 • Funciones definidas por el usuario y funciones de orden superior

    Presenta UDFs en Python, Pandas UDFs y funciones de orden superior integradas para arrays y maps. Los estudiantes extienden Spark SQL con lógica personalizada de manera eficiente.

  • Lección 2 • API de DataFrames en Python y Scala

    Enseña la creación de DataFrames, operaciones con columnas y el encadenamiento de transformaciones de forma programática. Los estudiantes eligen entre enfoques SQL y API según el caso de uso.

  • Lección 3 • Fundamentos de Spark SQL

    Revisa la sintaxis SQL dentro de Databricks, incluyendo CTEs, funciones de ventana y subconsultas. Proporciona la base de consultas para todo el trabajo de transformación en el curso.

  • Lección 4 • Agregaciones y joins

    Cubre groupBy, pivot y todas las estrategias de join con sus implicancias de rendimiento. La selección correcta del join es crítica para evitar el data skew en grandes conjuntos de datos.

  • Lección 5 • Optimización de consultas y el Catalyst Planner

    Explica los planes lógicos y físicos, el predicate pushdown y el partition pruning. Los estudiantes leen explain plans para diagnosticar y corregir consultas lentas.

Capítulo 5Ver detalles

Construcción de pipelines con arquitectura Medallion

  • Lección 1 • Delta Live Tables para orquestación de pipelines

    Presenta los pipelines declarativos de DLT, las expectations y la resolución automática de dependencias. Los estudiantes migran un pipeline Medallion manual a un pipeline DLT gestionado.

  • Lección 2 • Implementación de la capa Bronze

    Construye la capa de ingesta cruda usando Auto Loader con columnas de metadatos y campos de auditoría. Los estudiantes aplican patrones de ingesta del Capítulo 3 en un pipeline estructurado.

  • Lección 3 • Principios de diseño de arquitectura Medallion

    Define el propósito y las expectativas de calidad de datos de cada capa Medallion. Un diseño de capas correcto evita que los problemas de calidad de datos se propaguen hacia adelante.

  • Lección 4 • Depuración y conformación de la capa Silver

    Aplica reglas de calidad de datos, deduplicación y casteo de tipos para producir tablas Silver. Los estudiantes usan MERGE para actualizar incrementalmente Silver desde Bronze.

  • Lección 5 • Agregación y exposición de la capa Gold

    Crea tablas Gold agregadas y desnormalizadas optimizadas para el consumo de BI y ML. Los estudiantes aplican Z-ORDER y particionamiento para el rendimiento de consultas.

Capítulo 6Ver detalles

Unity Catalog y gobierno de datos

  • Lección 1 • Compartición de datos con Delta Sharing

    Configura Delta Sharing de protocolo abierto para distribuir datos a destinatarios externos de forma segura. Los estudiantes publican shares y gestionan credenciales de destinatarios sin copiar datos.

  • Lección 2 • Linaje y descubrimiento de datos

    Demuestra la captura automática de linaje a nivel de columna y la interfaz de búsqueda del catálogo de datos. El linaje permite el análisis de impacto antes de desplegar cambios de esquema.

  • Lección 3 • Gestión de identidad y acceso

    Cubre usuarios, grupos, service principals y concesión de privilegios en Unity Catalog. Los estudiantes implementan acceso con privilegios mínimos para analistas, ingenieros y jobs automatizados.

  • Lección 4 • Modelo de objetos de Unity Catalog

    Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Entender el modelo de objetos es un prerrequisito para asignar cualquier permiso.

  • Lección 5 • Auditoría y monitoreo de cumplimiento

    Consulta el log de auditoría de Unity Catalog para detectar accesos no autorizados y violaciones de políticas. Los estudiantes construyen dashboards de auditoría alineados con los requisitos de gobierno de datos.

Capítulo 7Ver detalles

Integración de machine learning con MLflow

  • Lección 1 • Inferencia de modelos batch y en tiempo real

    Despliega modelos registrados para scoring batch en tablas Delta y serving en tiempo real vía endpoints. Los estudiantes escriben los resultados de la inferencia de vuelta en tablas Delta de la capa Gold.

  • Lección 2 • Entrenamiento de modelos en Spark DataFrames

    Entrena modelos de scikit-learn y Spark MLlib usando datos de features respaldados por Delta a escala. Los estudiantes aplican validación cruzada y ajuste de hiperparámetros dentro de Databricks.

  • Lección 3 • MLflow Model Registry y ciclo de vida

    Registra modelos, gestiona transiciones de etapa y aplica flujos de trabajo de aprobación en el Model Registry. Los estudiantes promueven un modelo de staging a producción de forma segura.

  • Lección 4 • MLflow Tracking y gestión de experimentos

    Enseña el registro de parámetros, métricas y artefactos en experimentos de MLflow desde notebooks de Databricks. El tracking sistemático es la base del ML reproducible.

  • Lección 5 • Ingeniería de features con Feature Store

    Crea y publica tablas de features en el Databricks Feature Store respaldado por Delta. Los estudiantes vinculan features a conjuntos de datos de entrenamiento para una paridad train-serve coherente.

Capítulo 8Ver detalles

Operaciones de producción y ajuste de rendimiento

  • Lección 1 • Databricks Workflows y orquestación de jobs

    Construye jobs multitarea con dependencias, ramificaciones condicionales y lógica de reintento en Databricks Workflows. Los estudiantes reemplazan las ejecuciones ad-hoc de notebooks con pipelines gobernados y programados.

  • Lección 2 • Caching, particionamiento y gestión de archivos

    Aplica Delta caching, disk caching y particionamiento estratégico para acelerar consultas repetidas. Los estudiantes equilibran la granularidad del particionamiento con la sobrecarga de archivos pequeños.

  • Lección 3 • Observabilidad y alertas

    Configura las tablas de sistema de Databricks, las métricas de Ganglia y las alertas externas para la salud del pipeline. Los estudiantes construyen un dashboard de monitoreo que cubre latencia, errores y frescura de datos.

  • Lección 4 • Gestión de costos y optimización de clusters

    Analiza el consumo de DBU, aplica estrategias de pools de instancias y ajusta el tamaño de los clusters. El control de costos es esencial antes de escalar las cargas de trabajo a volúmenes de producción.

  • Lección 5 • Diagnóstico de rendimiento de Spark

    Usa la Spark UI, las líneas de tiempo de las etapas y las métricas de tareas para identificar cuellos de botella. Los estudiantes diagnostican derrames de shuffle, skew y fallas de ejecutores de manera sistemática.

Certificación

Tu certificado válido de finalización

Este curso es para vos:

  • Ingeniero de datos: listo para ir más allá de Spark básico y adentrarse en la arquitectura Lakehouse.

  • Arquitecto de cloud: diseñando estrategias de almacenamiento unificado para plataformas de datos empresariales.

  • Ingeniero de analítica: acortando la brecha entre los datos sin procesar y las tablas listas para el negocio.

  • Científico de datos: con ganas de operacionalizar modelos dentro de un entorno de datos gobernado.

  • Desarrollador de BI: buscando una mayor apropiación del pipeline más allá de los tableros y los informes.

  • Ingeniero de software: en transición hacia roles de infraestructura de datos e ingeniería de plataformas.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los recomendé a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltear contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompts

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en Argentina?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF