Elige tu idioma
Curso de Data Apps en Databricks Lakehouse
Más de 2 millones de estudiantes en todo el mundo

Curso de Data Apps en Databricks Lakehouse

Domina la plataforma Databricks Lakehouse desde los fundamentos de arquitectura hasta los pipelines listos para producción. Aprende a ingerir, transformar y gobernar datos a escala usando Delta Lake, Unity Catalog y MLflow. Este curso proporciona a los ingenieros y arquitectos de datos las habilidades prácticas para construir aplicaciones de datos modernas, confiables y rentables.

Dedika para empresas

Lo que vas a aprender:

  • Configure clústeres de Databricks, notebooks e integraciones de almacenamiento en la nube para cargas de trabajo de producción.

  • Construye pipelines de ingesta escalables utilizando Auto Loader, COPY INTO y Structured Streaming.

  • Implementa la Arquitectura Medallion con capas Bronze, Silver y Gold de Delta Lake.

  • Aplica políticas de Unity Catalog para aplicar la gobernanza de datos, la auditoría y el uso compartido seguro de datos.

  • Optimiza consultas de Spark SQL y tablas Delta utilizando estrategias de Z-ORDER, particionado y almacenamiento en caché.

  • Integra el seguimiento de MLflow y el Model Registry para gestionar el ciclo de vida completo del aprendizaje automático.

Cómo estudias de forma práctica Curso de Data Apps en Databricks Lakehouse

Cómo practicas Curso de Data Apps en Databricks Lakehouse

Para ti que eres empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Arquitectura Lakehouse y Fundamentos de Databricks

  • Lección 1 • Descripción General de la Plataforma Databricks

    Mapea los principales servicios de Databricks: espacio de trabajo, clústeres, trabajos y Unity Catalog. Los estudiantes obtienen orientación antes de configurar cualquier recurso.

  • Lección 2 • Configuración y Gestión de Clústeres

    Cubre clústeres de propósito general vs. de trabajo, autoescalado y selección de runtime. Un diseño correcto del clúster reduce directamente los costos y mejora la confiabilidad del pipeline.

  • Lección 3 • Notebooks y Desarrollo Colaborativo

    Presenta los notebooks multilenguaje, los comandos mágicos y las funciones de coautoría. Establece el entorno de desarrollo principal que se utilizará a lo largo del curso.

  • Lección 4 • Integración de Almacenamiento y Conectividad en la Nube

    Explica cómo Databricks monta y accede al almacenamiento de objetos en la nube de forma segura. Los estudiantes configuran las credenciales de almacenamiento necesarias para todos los ejercicios de datos posteriores.

  • Lección 5 • Evolución de Lagos de Datos a Lakehouse

    Rastrea las limitaciones de los almacenes de datos y los lagos de datos que motivaron el diseño Lakehouse. Proporciona el contexto histórico necesario para justificar cada decisión arquitectónica cubierta más adelante.

Capítulo 2Ver detalles

Funcionamiento Interno de Delta Lake y Gestión de Tablas

  • Lección 1 • Técnicas de Optimización de Tablas

    Cubre OPTIMIZE, Z-ORDER y compactación de archivos para mejorar el rendimiento de las consultas. Estas técnicas se aplican a tablas de producción en capítulos avanzados.

  • Lección 2 • Creación y Modificación de Tablas Delta

    Cubre DDL para tablas gestionadas y externas, definición de esquemas y operaciones ALTER. Los estudiantes construyen las tablas utilizadas en todos los ejercicios de pipeline.

  • Lección 3 • Operaciones DML y Patrones de Merge

    Enseña INSERT, UPDATE, DELETE y MERGE INTO con escenarios prácticos de upsert. MERGE es la piedra angular de la carga incremental de datos cubierta en capítulos posteriores.

  • Lección 4 • Viaje en el Tiempo y Versionado de Datos

    Demuestra cómo consultar versiones históricas de tablas y restaurar estados anteriores. Los estudiantes utilizan el viaje en el tiempo para escenarios de auditoría y recuperación.

  • Lección 5 • Conceptos Básicos de Delta Lake

    Explica el registro de transacciones, los archivos de datos Parquet y cómo se logran las garantías ACID. Esta base es necesaria antes de que cualquier operación de tabla tenga sentido.

Capítulo 3Ver detalles

Patrones de Ingesta de Datos y Auto Loader

  • Lección 1 • Ingesta por Lotes con COPY INTO

    Presenta COPY INTO para la carga idempotente de archivos desde el almacenamiento en la nube hacia tablas Delta. Establece el patrón de ingesta más simple antes de introducir alternativas de streaming.

  • Lección 2 • Arquitectura de Auto Loader

    Explica cómo Auto Loader detecta nuevos archivos usando listado de directorios o notificación de archivos. Los estudiantes comprenden la mecánica interna antes de configurar pipelines.

  • Lección 3 • Ingesta de Datos Semiestructurados

    Enseña el análisis de JSON, XML y estructuras anidadas durante la ingesta. Los estudiantes aplanan y normalizan cargas útiles complejas en columnas Delta consultables.

  • Lección 4 • Ingesta de Streaming desde Agentes de Mensajes

    Conecta Databricks a plataformas de streaming de eventos para la ingesta en tiempo real en Delta. Los estudiantes configuran offsets, grupos de consumidores y semántica exactly-once.

  • Lección 5 • Inferencia y Evolución de Esquemas

    Cubre la detección automática de esquemas, sugerencias de esquema y el manejo de cambios de esquema en tiempo de ejecución. Una gestión de esquemas robusta previene fallos en los pipelines de producción.

Capítulo 4Ver detalles

Spark SQL y Transformaciones de DataFrame

  • Lección 1 • Funciones Definidas por el Usuario y Funciones de Orden Superior

    Presenta las UDF de Python, las Pandas UDF y las funciones de orden superior integradas para arrays y maps. Los estudiantes amplían Spark SQL con lógica personalizada de manera eficiente.

  • Lección 2 • API de DataFrame en Python y Scala

    Enseña la creación de DataFrames, operaciones de columna y el encadenamiento de transformaciones mediante programación. Los estudiantes eligen entre los enfoques SQL y API según el caso de uso.

  • Lección 3 • Fundamentos de Spark SQL

    Revisa la sintaxis SQL dentro de Databricks, incluyendo CTEs, funciones de ventana y subconsultas. Proporciona la base de consultas para todo el trabajo de transformación en el curso.

  • Lección 4 • Agregaciones y Joins

    Cubre groupBy, pivot y todas las estrategias de join con sus implicaciones de rendimiento. La selección correcta del join es crítica para evitar el sesgo de datos en grandes conjuntos de datos.

  • Lección 5 • Optimización de Consultas y el Planificador Catalyst

    Explica los planes lógicos y físicos, el predicate pushdown y la poda de particiones. Los estudiantes leen planes EXPLAIN para diagnosticar y corregir consultas lentas.

Capítulo 5Ver detalles

Construcción de Pipelines de Arquitectura Medallón

  • Lección 1 • Delta Live Tables para Orquestación de Pipelines

    Presenta los pipelines declarativos de DLT, las expectativas y la resolución automática de dependencias. Los estudiantes migran un pipeline Medallón manual a un pipeline DLT gestionado.

  • Lección 2 • Implementación de la Capa Bronce

    Construye la capa de ingesta cruda utilizando Auto Loader con columnas de metadatos y campos de auditoría. Los estudiantes aplican los patrones de ingesta del Capítulo 3 en un pipeline estructurado.

  • Lección 3 • Principios de Diseño de la Arquitectura Medallón

    Define el propósito y las expectativas de calidad de datos de cada capa Medallón. Un diseño de capas correcto previene que los problemas de calidad de datos se propaguen hacia abajo.

  • Lección 4 • Limpieza y Conformación de la Capa Plata

    Aplica reglas de calidad de datos, deduplicación y conversión de tipos para producir tablas Plata. Los estudiantes usan MERGE para actualizar incrementalmente la capa Plata desde Bronce.

  • Lección 5 • Agregación y Servicio de la Capa Oro

    Crea tablas Oro agregadas y desnormalizadas optimizadas para el consumo de BI y ML. Los estudiantes aplican Z-ORDER y particionado para el rendimiento de las consultas.

Capítulo 6Ver detalles

Unity Catalog y Gobernanza de Datos

  • Lección 1 • Compartición de Datos con Delta Sharing

    Configura Delta Sharing de protocolo abierto para distribuir datos a destinatarios externos de forma segura. Los estudiantes publican shares y gestionan credenciales de destinatarios sin copiar datos.

  • Lección 2 • Linaje de Datos y Descubrimiento

    Demuestra la captura automática de linaje a nivel de columna y la interfaz de búsqueda del catálogo de datos. El linaje permite el análisis de impacto antes de desplegar cambios en el esquema.

  • Lección 3 • Gestión de Identidad y Acceso

    Cubre usuarios, grupos, service principals y concesión de privilegios en Unity Catalog. Los estudiantes implementan acceso de privilegio mínimo para analistas, ingenieros y trabajos automatizados.

  • Lección 4 • Modelo de Objetos de Unity Catalog

    Explica la jerarquía de metastore, catálogo, esquema y tabla en Unity Catalog. Comprender el modelo de objetos es un requisito previo para asignar cualquier permiso.

  • Lección 5 • Auditoría y Monitoreo de Cumplimiento

    Consulta el registro de auditoría de Unity Catalog para detectar accesos no autorizados y violaciones de políticas. Los estudiantes construyen dashboards de auditoría alineados con los requisitos de gobernanza de datos.

Capítulo 7Ver detalles

Integración de Machine Learning con MLflow

  • Lección 1 • Inferencia de Modelos por Lotes y en Tiempo Real

    Despliega modelos registrados para puntuación por lotes en tablas Delta y servicio en tiempo real a través de endpoints. Los estudiantes escriben los resultados de la inferencia de vuelta a las tablas Delta de la capa Oro.

  • Lección 2 • Entrenamiento de Modelos en Spark DataFrames

    Entrena modelos de scikit-learn y Spark MLlib utilizando datos de características respaldados por Delta a escala. Los estudiantes aplican validación cruzada y ajuste de hiperparámetros dentro de Databricks.

  • Lección 3 • MLflow Model Registry y Ciclo de Vida

    Registra modelos, gestiona las transiciones de etapa y aplica flujos de trabajo de aprobación en el Model Registry. Los estudiantes promueven un modelo de staging a producción de forma segura.

  • Lección 4 • Seguimiento de MLflow y Gestión de Experimentos

    Enseña el registro de parámetros, métricas y artefactos en experimentos de MLflow desde notebooks de Databricks. El seguimiento sistemático es la base del aprendizaje automático reproducible.

  • Lección 5 • Ingeniería de Características con Feature Store

    Crea y publica tablas de características en el Databricks Feature Store respaldado por Delta. Los estudiantes vinculan características a conjuntos de datos de entrenamiento para una paridad consistente entre entrenamiento y servicio.

Capítulo 8Ver detalles

Operaciones de Producción y Ajuste de Rendimiento

  • Lección 1 • Databricks Workflows y Orquestación de Trabajos

    Construye trabajos de múltiples tareas con dependencias, ramificación condicional y lógica de reintento en Databricks Workflows. Los estudiantes reemplazan las ejecuciones ad-hoc de notebooks con pipelines gobernados y programados.

  • Lección 2 • Almacenamiento en Caché, Particionado y Gestión de Archivos

    Aplica el almacenamiento en caché de Delta, el almacenamiento en caché de disco y el particionado estratégico para acelerar las consultas repetidas. Los estudiantes equilibran la granularidad de la partición frente a la sobrecarga de archivos pequeños.

  • Lección 3 • Observabilidad y Alertas

    Configura las tablas del sistema de Databricks, las métricas de Ganglia y las alertas externas para la salud del pipeline. Los estudiantes construyen un dashboard de monitoreo que cubre la latencia, los errores y la frescura de los datos.

  • Lección 4 • Gestión de Costos y Optimización de Clústeres

    Analiza el consumo de DBU, aplica estrategias de grupos de instancias y dimensiona correctamente los clústeres. El control de costos es esencial antes de escalar las cargas de trabajo a volúmenes de producción.

  • Lección 5 • Diagnóstico de Rendimiento de Spark

    Utiliza la UI de Spark, las líneas de tiempo de las etapas y las métricas de tareas para identificar cuellos de botella. Los estudiantes diagnostican derrames de shuffle, sesgo y fallos de ejecutor de manera sistemática.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Ingeniero de datos: listo para ir más allá de Spark básico hacia la arquitectura de Lakehouse.

  • Arquitecto en la nube: diseñando estrategias de almacenamiento unificado para plataformas de datos empresariales.

  • Ingeniero de analítica: cerrando la brecha entre los datos en bruto y las tablas listas para el negocio.

  • Científico de datos: con el deseo de operacionalizar modelos dentro de un entorno de datos gobernado.

  • Desarrollador de BI: que busca una mayor propiedad sobre los pipelines, más allá de los dashboards y reportes.

  • Ingeniero de software: transitando hacia roles de ingeniería de infraestructura y plataformas de datos.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en México?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF