
Databricks ML in Action Course
Domine el aprendizaje automático de extremo a extremo en la plataforma Databricks Lakehouse: desde la ingesta de datos e ingeniería de características hasta el entrenamiento distribuido, el servicio de modelos y MLOps en producción. Este curso práctico equipa a científicos de datos e ingenieros de aprendizaje automático con las herramientas, los flujos de trabajo y las prácticas de gobernanza que impulsan los sistemas reales de inteligencia artificial empresarial.
Lo que vas a aprender:
Configure clústeres de Databricks, integraciones de almacenamiento y Unity Catalog para flujos de trabajo de aprendizaje automático seguros.
Construya pipelines escalables de Delta Lake que entreguen datos limpios y versionados, listos para el entrenamiento de modelos.
Diseñe y gobierne tablas de características reutilizables usando Databricks Feature Store para eliminar la discrepancia entre entrenamiento y servicio.
Rastree, registre y promocione modelos a través de un ciclo de vida gobernado de MLflow, desde el experimento hasta producción.
Despliegue endpoints de inferencia en tiempo real y por lotes con lógica PyFunc personalizada y monitoreo automatizado.
Implemente pipelines de CI/CD, detección de deriva y reentrenamiento automatizado para operar sistemas de aprendizaje automático en producción de manera confiable.
Cómo estudias de forma práctica Databricks ML in Action Course
Cómo practicas Databricks ML in Action Course
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de la Plataforma Databricks
Fundamentos de la Plataforma Databricks
Lección 1 • Notebooks y Desarrollo Colaborativo
Introduce la creación de notebooks, comandos mágicos y funciones de coautoría. Establece hábitos de desarrollo reproducibles que se utilizan en todos los experimentos de ML posteriores.
Lección 2 • Arquitectura del Espacio de Trabajo y Navegación
Cubre el plano de control, el plano de datos y la interfaz de usuario del espacio de trabajo de Databricks. Prepara a los estudiantes en el entorno que usarán a lo largo de cada capítulo posterior.
Lección 3 • Acceso a Datos e Integración de Almacenamiento
Explica puntos de montaje, Unity Catalog y gestión de credenciales para almacenamiento en la nube. Permite un acceso a los datos seguro y consistente, requerido para los pipelines de ML.
Lección 4 • Databricks CLI y Fundamentos de la API REST
Introduce el control programático del espacio de trabajo a través de la CLI y los endpoints REST. Prepara a los estudiantes para automatizar tareas e integrar Databricks en cadenas de herramientas externas.
Lección 5 • Configuración y Gestión de Clústeres
Enseña tipos de clústeres, versiones de runtime y políticas de autoescalado. Los estudiantes configuran clústeres de trabajo e interactivos adecuados para cargas de trabajo de ML.
Capítulo 2OcultarOcultar detallesVer detallesIngeniería de Datos para Pipelines de ML
Ingeniería de Datos para Pipelines de ML
Lección 1 • Delta Live Tables para Orquestación de Pipelines
Introduce definiciones de pipelines declarativas, expectativas y seguimiento de linaje. Automatiza la aplicación de calidad de datos en múltiples etapas antes de que las características lleguen al entrenamiento del modelo.
Lección 2 • Transformación de Datos con Spark SQL
Cubre agregaciones, funciones de ventana y manejo de tipos complejos en Spark SQL. Transforma datos brutos en características estructuradas que consumen los modelos de ML.
Lección 3 • Conceptos Centrales de Apache Spark
Cubre RDDs, DataFrames y el modelo de ejecución de Spark. Proporciona la base computacional para todas las tareas de procesamiento de datos en los capítulos de ML posteriores.
Lección 4 • Delta Lake para Cargas de Trabajo de ML
Introduce transacciones ACID, viajes en el tiempo y optimización de tablas Delta. Garantiza la confiabilidad y reproducibilidad de los datos a lo largo de experimentos de ML iterativos.
Lección 5 • Patrones de Ingesta de Datos
Enseña ingesta batch y en streaming desde archivos, bases de datos y flujos de eventos. Los estudiantes construyen pipelines confiables desde la fuente hasta la zona de aterrizaje para la creación de características de ML.
Capítulo 3OcultarOcultar detallesVer detallesIngeniería de Características y el Feature Store
Ingeniería de Características y el Feature Store
Lección 1 • Eliminación del Sesgo Entre Entrenamiento y Serving
Aborda la consistencia entre los datos de entrenamiento offline y las características de serving online. Los estudiantes implementan conjuntos de datos de entrenamiento basados en búsqueda que reflejan las rutas de inferencia en producción.
Lección 2 • Arquitectura del Databricks Feature Store
Explica las tablas del Feature Store, los metadatos y la división offline-online. Los estudiantes entienden cómo se almacenan, versionan y recuperan las características para el entrenamiento y el serving.
Lección 3 • Escritura y Lectura de Tablas de Características
Enseña las API de escritura y lectura para actualizaciones batch y en streaming de características. Conecta los pipelines de ingesta del Capítulo 2 con los flujos de trabajo de entrenamiento de modelos posteriores.
Lección 4 • Fundamentos de Ingeniería de Características
Cubre codificación, escalado, imputación y términos de interacción usando Spark. Establece el vocabulario de características que se aplica a lo largo de los capítulos del Feature Store y de entrenamiento de modelos.
Lección 5 • Gobernanza y Reutilización de Características
Cubre el descubrimiento de características, el control de acceso y el uso compartido entre equipos a través de Unity Catalog. Reduce la duplicación de esfuerzos de ingeniería y hace cumplir el linaje de datos en todos los proyectos de ML.
Capítulo 4OcultarOcultar detallesVer detallesEntrenamiento de Modelos con MLflow
Entrenamiento de Modelos con MLflow
Lección 1 • Entrenamiento de Modelos de Aprendizaje Profundo
Introduce bucles de entrenamiento de TensorFlow y PyTorch integrados con el registro de MLflow. Prepara a los estudiantes para el aprendizaje profundo distribuido que se cubre en el capítulo de entrenamiento avanzado.
Lección 2 • Ajuste de Hiperparámetros con Hyperopt
Enseña optimización bayesiana y búsqueda paralela usando Hyperopt y SparkTrials. Los estudiantes mejoran sistemáticamente el rendimiento del modelo más allá de la búsqueda manual en cuadrícula.
Lección 3 • Fundamentos de Seguimiento en MLflow
Introduce experimentos, ejecuciones, parámetros, métricas y etiquetas en MLflow. Establece la disciplina de registro que sustenta el ML reproducible a lo largo del curso.
Lección 4 • Entrenamiento de Modelos Scikit-learn y Spark ML
Cubre la construcción de pipelines, validación cruzada y registro automático de MLflow para ambos frameworks. Los estudiantes entrenan y registran modelos de línea base que sirven como referencia para técnicas avanzadas.
Lección 5 • Proyectos MLflow y Reproducibilidad
Cubre Proyectos MLflow, puntos de entrada y especificaciones de entorno para entrenamiento portátil. Permite a los equipos reproducir cualquier ejecución de experimento en cualquier clúster compatible.
Capítulo 5OcultarOcultar detallesVer detallesRegistro de Modelos y Gestión del Ciclo de Vida
Registro de Modelos y Gestión del Ciclo de Vida
Lección 1 • Registro y Versionamiento de Modelos
Enseña el registro de modelos programático y basado en la interfaz de usuario desde las ejecuciones de MLflow. Los estudiantes establecen una disciplina de versionamiento consistente para todos los modelos entrenados.
Lección 2 • Transiciones de Etapa y Flujos de Trabajo de Aprobación
Cubre las transiciones a Staging, Production y Archived con notificaciones basadas en webhooks. Implementa un proceso de promoción controlado que refleja los estándares empresariales de MLOps.
Lección 3 • Registro de Modelos en Unity Catalog
Explica el Registro de Modelos respaldado por Unity Catalog para la gobernanza entre espacios de trabajo. Los estudiantes migran de la gestión de modelos a nivel de espacio de trabajo a la de nivel de catálogo para una escala empresarial.
Lección 4 • Firmas de Modelo y Ejemplos de Entrada
Introduce las firmas de modelo de MLflow, los ejemplos de entrada y la imposición de esquemas. Previene errores de tipo en tiempo de ejecución y documenta las interfaces de modelo esperadas para los consumidores downstream.
Lección 5 • Descripción General del Registro de Modelos de MLflow
Explica los modelos registrados, las versiones, las etapas y los alias en el Registro de Modelos. Conecta las ejecuciones de experimentos del Capítulo 4 con un pipeline de promoción gobernado.
Capítulo 6OcultarOcultar detallesVer detallesEntrenamiento de Modelos Escalable y Distribuido
Entrenamiento de Modelos Escalable y Distribuido
Lección 1 • Ajuste de Hiperparámetros Distribuido a Escala
Extiende SparkTrials de Hyperopt e introduce Optuna para búsqueda paralela a gran escala. Los estudiantes ajustan modelos de aprendizaje profundo en cientos de pruebas concurrentes de manera eficiente.
Lección 2 • TorchDistributor para Entrenamiento con PyTorch
Introduce TorchDistributor como la API nativa de Databricks para PyTorch distribuido. Los estudiantes lanzan trabajos de PyTorch multi-GPU y multi-nodo sin configuración manual del clúster.
Lección 3 • Conceptos de Entrenamiento Distribuido
Cubre paralelismo de datos, paralelismo de modelos y estrategias de sincronización de gradientes. Proporciona la base teórica necesaria antes de implementar frameworks distribuidos.
Lección 4 • Horovod para Aprendizaje Profundo Distribuido
Enseña la inicialización de Horovod, la fragmentación de datos por rango y HorovodRunner en Databricks. Los estudiantes convierten scripts de entrenamiento de un solo nodo en trabajos distribuidos multi-nodo.
Lección 5 • Pandas UDFs para Inferencia Distribuida
Cubre Pandas UDFs escalares, de mapa agrupado e iteradoras para aplicar modelos a escala Spark. Permite la inferencia batch en miles de millones de filas sin mover los datos del clúster.
Capítulo 7OcultarOcultar detallesVer detallesDespliegue de Modelos y Serving en Tiempo Real
Despliegue de Modelos y Serving en Tiempo Real
Lección 1 • Arquitectura de Databricks Model Serving
Explica el serving de modelos serverless, los tipos de endpoint y el enrutamiento de tráfico. Orienta a los estudiantes sobre la capa de serving antes de configurar y probar endpoints en vivo.
Lección 2 • Destinos de Despliegue Externos
Cubre la exportación de modelos a formato ONNX, contenedores Docker y plataformas de serving nativas de la nube. Prepara a los estudiantes para desplegar modelos entrenados en Databricks fuera del entorno de Databricks.
Lección 3 • Lógica de Inferencia Personalizada con PyFunc
Enseña el sabor PyFunc de MLflow para envolver lógica Python arbitraria como un modelo desplegable. Los estudiantes agregan lógica de preprocesamiento, posprocesamiento y ensamble a los endpoints de serving.
Lección 4 • Despliegue de Modelos de MLflow en Endpoints
Cubre la creación de endpoints, el fijado de versiones de modelo y la invocación de la API REST. Los estudiantes despliegan modelos registrados del Capítulo 5 y validan respuestas de extremo a extremo.
Lección 5 • Pipelines de Inferencia Batch
Implementa puntuación batch programada usando Databricks Jobs y mlflow.pyfunc.spark_udf. Complementa el serving en tiempo real para casos de uso de alto rendimiento y tolerantes a la latencia.
Capítulo 8OcultarOcultar detallesVer detallesMLOps, Monitoreo y Gobernanza en Producción
MLOps, Monitoreo y Gobernanza en Producción
Lección 1 • Auditoría, Linaje y Cumplimiento
Cubre el linaje de Unity Catalog, los registros de auditoría de MLflow y la gobernanza de acceso para entornos regulados. Los estudiantes documentan la procedencia del modelo para satisfacer los requisitos de auditoría internos y externos.
Lección 2 • Lakehouse Monitoring para ML
Presenta Databricks Lakehouse Monitoring para el cálculo automatizado de métricas en tablas de inferencia. Proporciona paneles de control listos para usar para la calidad del modelo y la salud de los datos.
Lección 3 • Principios y Niveles de Madurez de MLOps
Define la madurez de MLOps desde la experimentación manual hasta los pipelines completamente automatizados. Enmarca los objetivos de gobernanza y automatización que los estudiantes implementan en las secciones siguientes.
Lección 4 • Detección de Drift de Datos y Modelos
Cubre pruebas estadísticas para cambio de covariables, drift de etiquetas y drift de predicción. Los estudiantes implementan alertas de drift que desencadenan pipelines de reentrenamiento automáticamente.
Lección 5 • Pipelines de Reentrenamiento Automatizado
Construye flujos de trabajo de reentrenamiento basados en desencadenadores y programados usando Databricks Jobs y Delta Live Tables. Mantiene los modelos de producción actualizados sin intervención manual.
Tu certificado válido de finalización
Este curso es para ti:
Científicos de datos listos para pasar de los notebooks locales al aprendizaje automático a escala en la nube.
Ingenieros de aprendizaje automático que buscan flujos de trabajo estructurados para desplegar y monitorear modelos.
Ingenieros de software en transición hacia roles de aprendizaje automático en plataformas en la nube.
Ingenieros de analítica que desean extender sus pipelines de datos hacia el entrenamiento de modelos.
Estudiantes de posgrado que aplican conocimientos académicos de aprendizaje automático a entornos empresariales reales.
Desarrolladores de inteligencia de negocios con curiosidad por construir sistemas predictivos sobre sus datos.
Lo que dicen nuestros estudiantes
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Colombia?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















