
Capacitación en Databricks
Domina la plataforma Databricks desde cero: cubre la arquitectura lakehouse, Apache Spark, Delta Lake y flujos de trabajo de ML. Esta capacitación dota a ingenieros de datos, analistas y científicos de datos con las habilidades prácticas necesarias para construir pipelines y soluciones analíticas listas para producción. Si trabajas con datos a escala, esta es la formación que impulsa tu carrera.
Lo que vas a aprender:
Este curso cubre cada capa principal de la plataforma Databricks, comenzando con la arquitectura lakehouse y los fundamentos del espacio de trabajo. Escribirás y optimizarás trabajos de Apache Spark, administrarás tablas de Delta Lake y construirás pipelines ETL confiables usando Auto Loader y Delta Live Tables. Aplicarás la arquitectura de medallón para organizar los datos en capas Bronce, Plata y Oro. El curso también cubre Databricks SQL para analítica, MLflow para la gestión del ciclo de vida del aprendizaje automático y orquestación de flujos de trabajo para despliegues en producción. Los temas avanzados incluyen ajuste de rendimiento de Spark, gobernanza con Unity Catalog, streaming en tiempo real con Kafka e inteligencia artificial generativa con Mosaic AI.
Cómo estudias de forma práctica Capacitación en Databricks
Cómo practicas Capacitación en Databricks
Para ti que tienes una empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesIntroducción a Databricks y el Lakehouse
Introducción a Databricks y el Lakehouse
Lección 1 • Navegación por el espacio de trabajo de Databricks
Cubre la interfaz de usuario del espacio de trabajo, la organización de recursos y los roles de usuario. Los estudiantes adquieren familiaridad práctica con el entorno antes de escribir cualquier código.
Lección 2 • Conexión a fuentes de datos
Demuestra cómo montar almacenamiento en la nube y conectarse a bases de datos externas. Establece los patrones de acceso a datos necesarios para todas las tareas de ingeniería de datos y analítica.
Lección 3 • ¿Qué es la arquitectura lakehouse?
Define el paradigma lakehouse y lo contrasta con los almacenes de datos y los lagos de datos. Establece el contexto arquitectónico para todo el trabajo posterior en Databricks.
Lección 4 • Trabajo con notebooks de Databricks
Introduce la creación de notebooks, comandos mágicos y soporte multilenguaje. Los notebooks son la interfaz de desarrollo principal utilizada en todos los capítulos siguientes.
Lección 5 • Clústeres: configuración y gestión
Explica los tipos de clúster, las opciones de configuración y la gestión del ciclo de vida. Una configuración adecuada del clúster es esencial para el uso eficiente de los recursos durante todo el curso.
Capítulo 2OcultarOcultar detallesVer detallesFundamentos de Apache Spark en Databricks
Fundamentos de Apache Spark en Databricks
Lección 1 • Lectura y escritura de formatos de datos
Cubre la lectura y escritura de formatos Parquet, JSON, CSV y Delta con opciones. El manejo adecuado de formatos es fundamental para todas las tuberías de ingesta y salida.
Lección 2 • DataFrames y la API DataFrame
Cubre la creación de DataFrames, la inferencia de esquemas y las transformaciones principales. Los DataFrames son la abstracción principal utilizada en todos los capítulos de procesamiento de datos.
Lección 3 • Conceptos básicos de rendimiento de Spark
Introduce el particionamiento, el almacenamiento en caché y las uniones broadcast para la optimización del rendimiento. Estas técnicas se aplican en capítulos de optimización avanzada más adelante en el curso.
Lección 4 • Arquitectura de Spark y modelo de ejecución
Explica los drivers, ejecutores, DAGs y la evaluación perezosa. Comprender el flujo de ejecución es fundamental para escribir código Spark eficiente en capítulos posteriores.
Lección 5 • Spark SQL para consultas de datos
Enseña consultas basadas en SQL sobre Spark usando vistas temporales y tablas de catálogo. Une las habilidades de SQL con el motor de ejecución de Spark.
Capítulo 3OcultarOcultar detallesVer detallesDelta Lake: almacenamiento de datos confiable
Delta Lake: almacenamiento de datos confiable
Lección 1 • Operaciones DML en tablas Delta
Enseña operaciones INSERT, UPDATE, DELETE y MERGE en tablas Delta. Permite a los estudiantes implementar patrones de upsert esenciales para tuberías de datos incrementales.
Lección 2 • Optimización de tablas Delta
Cubre los comandos OPTIMIZE, ZORDER y VACUUM para la gestión del rendimiento y el almacenamiento. Estas operaciones son críticas para mantener tablas Delta en producción.
Lección 3 • Time Travel y versionado de datos
Demuestra cómo consultar versiones históricas de tablas y restaurar estados anteriores. Time Travel permite la auditoría y la recuperación de errores en tuberías de datos en producción.
Lección 4 • Creación y gestión de tablas Delta
Cubre operaciones DDL, propiedades de tabla y tablas gestionadas vs. externas. Estas habilidades son necesarias para construir capas de datos estructurados en capítulos posteriores de tuberías.
Lección 5 • Conceptos básicos de Delta Lake
Explica el registro de transacciones de Delta, las garantías ACID y en qué se diferencia Delta de Parquet simple. Proporciona la base conceptual para todas las operaciones con tablas Delta.
Capítulo 4OcultarOcultar detallesVer detallesIngesta de datos y tuberías ETL
Ingesta de datos y tuberías ETL
Lección 1 • Auto Loader para ingesta incremental
Presenta los modos de notificación de archivos y listado de directorios de Auto Loader para una ingesta escalable. Auto Loader es el patrón recomendado de Databricks para la ingesta continua basada en archivos.
Lección 2 • Patrones de ingesta por lotes
Cubre estrategias de carga por lotes completa e incremental usando Spark y Delta. Establece los patrones de ingesta que sustentan todas las arquitecturas de tuberías en este capítulo.
Lección 3 • Construcción de lógica de transformación
Cubre patrones de transformación de varios pasos que incluyen limpieza, enriquecimiento y deduplicación. La lógica de transformación es la capa central de valor agregado en cualquier tubería ETL.
Lección 4 • Delta Live Tables para orquestación de tuberías
Presenta Delta Live Tables (DLT) para la definición declarativa de tuberías y la aplicación de calidad. DLT simplifica la gestión de tuberías y se integra con la arquitectura medallón.
Lección 5 • Fundamentos de Structured Streaming
Enseña streaming de microlotes y continuo con Spark Structured Streaming. Proporciona la base de streaming necesaria para las secciones de tuberías en tiempo real más adelante.
Capítulo 5OcultarOcultar detallesVer detallesModelado de datos y la arquitectura medallón
Modelado de datos y la arquitectura medallón
Lección 1 • Principios de la arquitectura medallón
Define las responsabilidades de las capas Bronce, Plata y Oro, y los contratos de datos. Proporciona el marco estructural aplicado en cada sección posterior de modelado y tuberías.
Lección 2 • Diseño de la capa Bronce
Cubre el aterrizaje de datos en bruto, el esquema en lectura y la preservación de la fidelidad de origen. Una capa Bronce bien diseñada garantiza una capacidad de auditoría y reprocesamiento totales.
Lección 3 • Construcción de agregados de la capa Oro
Cubre la construcción de tablas preagregadas y desnormalizadas optimizadas para BI y reportes. Las tablas Oro reducen la complejidad de las consultas y mejoran el rendimiento de los dashboards.
Lección 4 • Construcción de la capa Plata
Enseña la limpieza, la conversión de tipos, la deduplicación y la conformación de datos a un esquema unificado. La capa Plata es la fuente principal para las cargas de trabajo analíticas y de ML.
Lección 5 • Calidad de datos y expectativas
Introduce la aplicación de restricciones, patrones de cuarentena y seguimiento de métricas de calidad. Incorporar controles de calidad en cada capa evita que los datos incorrectos se propaguen downstream.
Capítulo 6OcultarOcultar detallesVer detallesDatabricks SQL y analítica
Databricks SQL y analítica
Lección 1 • Optimización de consultas para analítica
Enseña el análisis del plan de consulta, estrategias de almacenamiento en caché y caché de resultados para cargas de trabajo SQL. Las consultas optimizadas reducen los costos del almacén y mejoran la experiencia del usuario.
Lección 2 • Construcción de dashboards y visualizaciones
Cubre la creación de gráficos, dashboards y alertas dentro de Databricks SQL. Los dashboards permiten a los interesados del negocio consumir datos sin escribir código.
Lección 3 • Unity Catalog para gobernanza de datos
Presenta el espacio de nombres de tres niveles de Unity Catalog, el control de acceso y el linaje de datos. La gobernanza es fundamental para una analítica segura y conforme a las normas entre equipos.
Lección 4 • Técnicas avanzadas de SQL en Databricks
Enseña funciones de ventana, CTEs y funciones de orden superior para consultas analíticas complejas. Estas técnicas permiten un análisis sofisticado directamente dentro de Databricks SQL.
Lección 5 • Almacenes SQL y ejecución de consultas
Cubre los tipos de almacenes SQL, su dimensionamiento y el enrutamiento de consultas. La configuración adecuada del almacén impacta directamente el rendimiento de las consultas y el costo de las cargas de trabajo analíticas.
Capítulo 7OcultarOcultar detallesVer detallesAprendizaje Automático con Databricks y MLflow
Aprendizaje Automático con Databricks y MLflow
Lección 1 • Model Registry de MLflow
Presenta el registro de modelos, las transiciones de etapa y la gestión de versiones en el Model Registry. El registro proporciona gobernanza y trazabilidad para los modelos en producción.
Lección 2 • Servicio de modelos e inferencia por lotes
Cubre los endpoints de servicio de modelos en tiempo real y la inferencia por lotes con Spark. El despliegue de modelos en ambos modos garantiza flexibilidad para diversos requisitos de negocio.
Lección 3 • Entrenamiento de modelos a escala con Spark
Cubre el entrenamiento distribuido usando UDFs pandas, Spark ML y Hyperopt para el ajuste. El entrenamiento distribuido reduce el tiempo para obtener información en conjuntos de datos grandes.
Lección 4 • Seguimiento de experimentos con MLflow
Enseña el registro de parámetros, métricas y artefactos con MLflow Tracking. El seguimiento sistemático de experimentos permite la reproducibilidad y la selección informada de modelos.
Lección 5 • Databricks ML Runtime e ingeniería de características
Cubre el entorno ML Runtime, las bibliotecas preinstaladas y los conceptos básicos de Feature Store. Un conjunto de características bien preparado es la base del entrenamiento de modelos reproducible.
Capítulo 8OcultarOcultar detallesVer detallesOrquestación de flujos de trabajo y despliegue en producción
Orquestación de flujos de trabajo y despliegue en producción
Lección 1 • Monitoreo, registro y gestión de costos
Cubre los registros de eventos del clúster, las métricas de trabajos, los registros de auditoría y el seguimiento de costos de DBU. La observabilidad y el control de costos son esenciales para operaciones de producción sostenibles.
Lección 2 • Programación y activación de flujos de trabajo
Enseña la programación basada en cron, los activadores por llegada de archivos y los activadores de API externa. La activación flexible asegura que las tuberías se ejecuten en el momento adecuado con una mínima intervención manual.
Lección 3 • Infraestructura como código con Terraform
Presenta el aprovisionamiento de recursos de Databricks utilizando el proveedor de Terraform. La infraestructura como código asegura una configuración del entorno reproducible y auditable entre espacios de trabajo.
Lección 4 • Trabajos y orquestación de tareas en Databricks
Cubre la creación de trabajos de múltiples tareas, el establecimiento de dependencias y la configuración de la computación para cada tarea. Los trabajos son el mecanismo principal para ejecutar cargas de trabajo de producción programadas.
Lección 5 • CI/CD para Databricks con Repos
Cubre la integración de Git mediante Databricks Repos, las estrategias de ramas y el despliegue automatizado. Las prácticas de CI/CD reducen el riesgo de despliegue y aceleran la entrega de productos de datos.
Tu certificado válido de finalización
Este curso es para ti:
Ingeniero de datos: listo para ir más allá de los pipelines básicos hacia una plataforma lakehouse unificada.
Analista de datos: quiere consultar y visualizar datos a escala usando Databricks SQL.
Científico de datos: necesita una plataforma confiable para ingeniería de características y despliegue de modelos.
Ingeniero analítico: construye capas de transformación al estilo dbt y explora alternativas nativas de Spark.
Ingeniero de nube: apoya a los equipos de datos y necesita un conocimiento más profundo de la infraestructura de Databricks.
Persona en transición de carrera: está migrando del desarrollo de software al campo de la ingeniería de datos moderna.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en México?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















