Elige tu idioma
Capacitación en Databricks
Más de 2 millones de estudiantes en todo el mundo

Capacitación en Databricks

Domina la plataforma Databricks desde cero: cubre la arquitectura lakehouse, Apache Spark, Delta Lake y flujos de trabajo de ML. Esta capacitación dota a ingenieros de datos, analistas y científicos de datos con las habilidades prácticas necesarias para construir pipelines y soluciones analíticas listas para producción. Si trabajas con datos a escala, esta es la formación que impulsa tu carrera.

Dedika para empresas

Lo que vas a aprender:

Este curso cubre cada capa principal de la plataforma Databricks, comenzando con la arquitectura lakehouse y los fundamentos del espacio de trabajo. Escribirás y optimizarás trabajos de Apache Spark, administrarás tablas de Delta Lake y construirás pipelines ETL confiables usando Auto Loader y Delta Live Tables. Aplicarás la arquitectura de medallón para organizar los datos en capas Bronce, Plata y Oro. El curso también cubre Databricks SQL para analítica, MLflow para la gestión del ciclo de vida del aprendizaje automático y orquestación de flujos de trabajo para despliegues en producción. Los temas avanzados incluyen ajuste de rendimiento de Spark, gobernanza con Unity Catalog, streaming en tiempo real con Kafka e inteligencia artificial generativa con Mosaic AI.

Cómo estudias de forma práctica Capacitación en Databricks

Cómo practicas Capacitación en Databricks

Para ti que tienes una empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Introducción a Databricks y el Lakehouse

  • Lección 1 • Navegación por el espacio de trabajo de Databricks

    Cubre la interfaz de usuario del espacio de trabajo, la organización de recursos y los roles de usuario. Los estudiantes adquieren familiaridad práctica con el entorno antes de escribir cualquier código.

  • Lección 2 • Conexión a fuentes de datos

    Demuestra cómo montar almacenamiento en la nube y conectarse a bases de datos externas. Establece los patrones de acceso a datos necesarios para todas las tareas de ingeniería de datos y analítica.

  • Lección 3 • ¿Qué es la arquitectura lakehouse?

    Define el paradigma lakehouse y lo contrasta con los almacenes de datos y los lagos de datos. Establece el contexto arquitectónico para todo el trabajo posterior en Databricks.

  • Lección 4 • Trabajo con notebooks de Databricks

    Introduce la creación de notebooks, comandos mágicos y soporte multilenguaje. Los notebooks son la interfaz de desarrollo principal utilizada en todos los capítulos siguientes.

  • Lección 5 • Clústeres: configuración y gestión

    Explica los tipos de clúster, las opciones de configuración y la gestión del ciclo de vida. Una configuración adecuada del clúster es esencial para el uso eficiente de los recursos durante todo el curso.

Capítulo 2Ver detalles

Fundamentos de Apache Spark en Databricks

  • Lección 1 • Lectura y escritura de formatos de datos

    Cubre la lectura y escritura de formatos Parquet, JSON, CSV y Delta con opciones. El manejo adecuado de formatos es fundamental para todas las tuberías de ingesta y salida.

  • Lección 2 • DataFrames y la API DataFrame

    Cubre la creación de DataFrames, la inferencia de esquemas y las transformaciones principales. Los DataFrames son la abstracción principal utilizada en todos los capítulos de procesamiento de datos.

  • Lección 3 • Conceptos básicos de rendimiento de Spark

    Introduce el particionamiento, el almacenamiento en caché y las uniones broadcast para la optimización del rendimiento. Estas técnicas se aplican en capítulos de optimización avanzada más adelante en el curso.

  • Lección 4 • Arquitectura de Spark y modelo de ejecución

    Explica los drivers, ejecutores, DAGs y la evaluación perezosa. Comprender el flujo de ejecución es fundamental para escribir código Spark eficiente en capítulos posteriores.

  • Lección 5 • Spark SQL para consultas de datos

    Enseña consultas basadas en SQL sobre Spark usando vistas temporales y tablas de catálogo. Une las habilidades de SQL con el motor de ejecución de Spark.

Capítulo 3Ver detalles

Delta Lake: almacenamiento de datos confiable

  • Lección 1 • Operaciones DML en tablas Delta

    Enseña operaciones INSERT, UPDATE, DELETE y MERGE en tablas Delta. Permite a los estudiantes implementar patrones de upsert esenciales para tuberías de datos incrementales.

  • Lección 2 • Optimización de tablas Delta

    Cubre los comandos OPTIMIZE, ZORDER y VACUUM para la gestión del rendimiento y el almacenamiento. Estas operaciones son críticas para mantener tablas Delta en producción.

  • Lección 3 • Time Travel y versionado de datos

    Demuestra cómo consultar versiones históricas de tablas y restaurar estados anteriores. Time Travel permite la auditoría y la recuperación de errores en tuberías de datos en producción.

  • Lección 4 • Creación y gestión de tablas Delta

    Cubre operaciones DDL, propiedades de tabla y tablas gestionadas vs. externas. Estas habilidades son necesarias para construir capas de datos estructurados en capítulos posteriores de tuberías.

  • Lección 5 • Conceptos básicos de Delta Lake

    Explica el registro de transacciones de Delta, las garantías ACID y en qué se diferencia Delta de Parquet simple. Proporciona la base conceptual para todas las operaciones con tablas Delta.

Capítulo 4Ver detalles

Ingesta de datos y tuberías ETL

  • Lección 1 • Auto Loader para ingesta incremental

    Presenta los modos de notificación de archivos y listado de directorios de Auto Loader para una ingesta escalable. Auto Loader es el patrón recomendado de Databricks para la ingesta continua basada en archivos.

  • Lección 2 • Patrones de ingesta por lotes

    Cubre estrategias de carga por lotes completa e incremental usando Spark y Delta. Establece los patrones de ingesta que sustentan todas las arquitecturas de tuberías en este capítulo.

  • Lección 3 • Construcción de lógica de transformación

    Cubre patrones de transformación de varios pasos que incluyen limpieza, enriquecimiento y deduplicación. La lógica de transformación es la capa central de valor agregado en cualquier tubería ETL.

  • Lección 4 • Delta Live Tables para orquestación de tuberías

    Presenta Delta Live Tables (DLT) para la definición declarativa de tuberías y la aplicación de calidad. DLT simplifica la gestión de tuberías y se integra con la arquitectura medallón.

  • Lección 5 • Fundamentos de Structured Streaming

    Enseña streaming de microlotes y continuo con Spark Structured Streaming. Proporciona la base de streaming necesaria para las secciones de tuberías en tiempo real más adelante.

Capítulo 5Ver detalles

Modelado de datos y la arquitectura medallón

  • Lección 1 • Principios de la arquitectura medallón

    Define las responsabilidades de las capas Bronce, Plata y Oro, y los contratos de datos. Proporciona el marco estructural aplicado en cada sección posterior de modelado y tuberías.

  • Lección 2 • Diseño de la capa Bronce

    Cubre el aterrizaje de datos en bruto, el esquema en lectura y la preservación de la fidelidad de origen. Una capa Bronce bien diseñada garantiza una capacidad de auditoría y reprocesamiento totales.

  • Lección 3 • Construcción de agregados de la capa Oro

    Cubre la construcción de tablas preagregadas y desnormalizadas optimizadas para BI y reportes. Las tablas Oro reducen la complejidad de las consultas y mejoran el rendimiento de los dashboards.

  • Lección 4 • Construcción de la capa Plata

    Enseña la limpieza, la conversión de tipos, la deduplicación y la conformación de datos a un esquema unificado. La capa Plata es la fuente principal para las cargas de trabajo analíticas y de ML.

  • Lección 5 • Calidad de datos y expectativas

    Introduce la aplicación de restricciones, patrones de cuarentena y seguimiento de métricas de calidad. Incorporar controles de calidad en cada capa evita que los datos incorrectos se propaguen downstream.

Capítulo 6Ver detalles

Databricks SQL y analítica

  • Lección 1 • Optimización de consultas para analítica

    Enseña el análisis del plan de consulta, estrategias de almacenamiento en caché y caché de resultados para cargas de trabajo SQL. Las consultas optimizadas reducen los costos del almacén y mejoran la experiencia del usuario.

  • Lección 2 • Construcción de dashboards y visualizaciones

    Cubre la creación de gráficos, dashboards y alertas dentro de Databricks SQL. Los dashboards permiten a los interesados del negocio consumir datos sin escribir código.

  • Lección 3 • Unity Catalog para gobernanza de datos

    Presenta el espacio de nombres de tres niveles de Unity Catalog, el control de acceso y el linaje de datos. La gobernanza es fundamental para una analítica segura y conforme a las normas entre equipos.

  • Lección 4 • Técnicas avanzadas de SQL en Databricks

    Enseña funciones de ventana, CTEs y funciones de orden superior para consultas analíticas complejas. Estas técnicas permiten un análisis sofisticado directamente dentro de Databricks SQL.

  • Lección 5 • Almacenes SQL y ejecución de consultas

    Cubre los tipos de almacenes SQL, su dimensionamiento y el enrutamiento de consultas. La configuración adecuada del almacén impacta directamente el rendimiento de las consultas y el costo de las cargas de trabajo analíticas.

Capítulo 7Ver detalles

Aprendizaje Automático con Databricks y MLflow

  • Lección 1 • Model Registry de MLflow

    Presenta el registro de modelos, las transiciones de etapa y la gestión de versiones en el Model Registry. El registro proporciona gobernanza y trazabilidad para los modelos en producción.

  • Lección 2 • Servicio de modelos e inferencia por lotes

    Cubre los endpoints de servicio de modelos en tiempo real y la inferencia por lotes con Spark. El despliegue de modelos en ambos modos garantiza flexibilidad para diversos requisitos de negocio.

  • Lección 3 • Entrenamiento de modelos a escala con Spark

    Cubre el entrenamiento distribuido usando UDFs pandas, Spark ML y Hyperopt para el ajuste. El entrenamiento distribuido reduce el tiempo para obtener información en conjuntos de datos grandes.

  • Lección 4 • Seguimiento de experimentos con MLflow

    Enseña el registro de parámetros, métricas y artefactos con MLflow Tracking. El seguimiento sistemático de experimentos permite la reproducibilidad y la selección informada de modelos.

  • Lección 5 • Databricks ML Runtime e ingeniería de características

    Cubre el entorno ML Runtime, las bibliotecas preinstaladas y los conceptos básicos de Feature Store. Un conjunto de características bien preparado es la base del entrenamiento de modelos reproducible.

Capítulo 8Ver detalles

Orquestación de flujos de trabajo y despliegue en producción

  • Lección 1 • Monitoreo, registro y gestión de costos

    Cubre los registros de eventos del clúster, las métricas de trabajos, los registros de auditoría y el seguimiento de costos de DBU. La observabilidad y el control de costos son esenciales para operaciones de producción sostenibles.

  • Lección 2 • Programación y activación de flujos de trabajo

    Enseña la programación basada en cron, los activadores por llegada de archivos y los activadores de API externa. La activación flexible asegura que las tuberías se ejecuten en el momento adecuado con una mínima intervención manual.

  • Lección 3 • Infraestructura como código con Terraform

    Presenta el aprovisionamiento de recursos de Databricks utilizando el proveedor de Terraform. La infraestructura como código asegura una configuración del entorno reproducible y auditable entre espacios de trabajo.

  • Lección 4 • Trabajos y orquestación de tareas en Databricks

    Cubre la creación de trabajos de múltiples tareas, el establecimiento de dependencias y la configuración de la computación para cada tarea. Los trabajos son el mecanismo principal para ejecutar cargas de trabajo de producción programadas.

  • Lección 5 • CI/CD para Databricks con Repos

    Cubre la integración de Git mediante Databricks Repos, las estrategias de ramas y el despliegue automatizado. Las prácticas de CI/CD reducen el riesgo de despliegue y aceleran la entrega de productos de datos.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Ingeniero de datos: listo para ir más allá de los pipelines básicos hacia una plataforma lakehouse unificada.

  • Analista de datos: quiere consultar y visualizar datos a escala usando Databricks SQL.

  • Científico de datos: necesita una plataforma confiable para ingeniería de características y despliegue de modelos.

  • Ingeniero analítico: construye capas de transformación al estilo dbt y explora alternativas nativas de Spark.

  • Ingeniero de nube: apoya a los equipos de datos y necesita un conocimiento más profundo de la infraestructura de Databricks.

  • Persona en transición de carrera: está migrando del desarrollo de software al campo de la ingeniería de datos moderna.

Lo que dicen nuestros alumnos

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en México?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF