
Curso de Databricks ML Aplicado
Dominá el aprendizaje automático de punta a punta en la Plataforma Databricks Lakehouse: desde la ingesta de datos y la ingeniería de features hasta el entrenamiento distribuido, el serving de modelos y MLOps en producción. Este curso práctico equipa a científicos de datos e ingenieros de ML con las herramientas, los flujos de trabajo y las prácticas de gobernanza que potencian los sistemas reales de IA empresarial.
Qué vas a aprender:
Configurá los clústeres de Databricks, las integraciones de almacenamiento y el Catálogo Unity para flujos de trabajo seguros de aprendizaje automático.
Construir pipelines de Delta Lake escalables que entreguen datos limpios y versionados, listos para el entrenamiento de modelos.
Diseñar y gobernar tablas de features reutilizables usando Databricks Feature Store para eliminar el sesgo entre entrenamiento y serving.
Registrar, hacer seguimiento y promover modelos a través de un ciclo de vida gobernado de MLflow, desde la experimentación hasta producción.
Desplegar endpoints de inferencia en tiempo real y por lotes con lógica PyFunc personalizada y monitoreo automatizado.
Implementar pipelines de CI/CD, detección de drift y reentrenamiento automatizado para operar sistemas de ML en producción de manera confiable.
Cómo estudiás de forma práctica Curso de Databricks ML Aplicado
Cómo practicás Curso de Databricks ML Aplicado
Para vos que sos empresa y querés capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de la Plataforma Databricks
Fundamentos de la Plataforma Databricks
Lección 1 • Notebooks y Desarrollo Colaborativo
Presenta la creación de notebooks, comandos mágicos y funciones de coautoría. Establece hábitos de desarrollo reproducibles que se usan en todos los experimentos de ML posteriores.
Lección 2 • Arquitectura del Workspace y Navegación
Cubre el plano de control, el plano de datos y la interfaz de usuario del workspace de Databricks. Brinda a los estudiantes una base en el entorno que usarán a lo largo de cada capítulo subsiguiente.
Lección 3 • Acceso a Datos e Integración de Almacenamiento
Explica los puntos de montaje, Unity Catalog y la gestión de credenciales para el almacenamiento en la nube. Permite un acceso a datos seguro y coherente, necesario para los pipelines de ML.
Lección 4 • Conceptos Básicos de CLI y API REST de Databricks
Presenta el control programático del workspace mediante endpoints de CLI y REST. Prepara a los estudiantes para automatizar tareas e integrar Databricks en cadenas de herramientas externas.
Lección 5 • Configuración y Gestión de Clústeres
Enseña los tipos de clúster, las versiones de runtime y las políticas de autoescalado. Los estudiantes configuran clústeres interactivos y de trabajo adecuados para cargas de trabajo de ML.
Capítulo 2OcultarOcultar detallesVer detallesIngeniería de Datos para Pipelines de ML
Ingeniería de Datos para Pipelines de ML
Lección 1 • Delta Live Tables para Orquestación de Pipelines
Presenta las definiciones declarativas de pipelines, las expectativas y el seguimiento de linaje. Automatiza la aplicación de calidad de datos en múltiples etapas antes de que las features lleguen al entrenamiento del modelo.
Lección 2 • Transformación de Datos con Spark SQL
Cubre agregaciones, funciones de ventana y manejo de tipos complejos en Spark SQL. Transforma datos en crudo en features estructuradas que consumen los modelos de ML.
Lección 3 • Conceptos Fundamentales de Apache Spark
Cubre RDDs, DataFrames y el modelo de ejecución de Spark. Proporciona la base computacional para todas las tareas de procesamiento de datos en los capítulos posteriores de ML.
Lección 4 • Delta Lake para Cargas de Trabajo de ML
Presenta las transacciones ACID, el viaje en el tiempo y la optimización de tablas Delta. Asegura la confiabilidad y reproducibilidad de los datos en experimentos iterativos de ML.
Lección 5 • Patrones de Ingesta de Datos
Enseña la ingesta batch y en streaming desde archivos, bases de datos y flujos de eventos. Los estudiantes construyen pipelines confiables desde el origen hasta la zona de aterrizaje para la creación de features de ML.
Capítulo 3OcultarOcultar detallesVer detallesIngeniería de Features y el Feature Store
Ingeniería de Features y el Feature Store
Lección 1 • Eliminando el Sesgo de Entrenamiento-Producción
Aborda la coherencia entre los datos de entrenamiento offline y las features de inferencia en producción. Los estudiantes implementan conjuntos de entrenamiento basados en búsquedas que reflejan las rutas de inferencia en producción.
Lección 2 • Arquitectura del Feature Store de Databricks
Explica las tablas del Feature Store, los metadatos y la división offline-online. Los estudiantes entienden cómo se almacenan, versionan y recuperan las features para el entrenamiento y la inferencia.
Lección 3 • Escritura y Lectura de Tablas de Features
Enseña las API de escritura y lectura para actualizaciones de features batch y en streaming. Conecta los pipelines de ingesta del Capítulo 2 con los flujos de trabajo de entrenamiento de modelos posteriores.
Lección 4 • Fundamentos de Ingeniería de Features
Cubre codificación, escalado, imputación y términos de interacción usando Spark. Establece el vocabulario de features que se aplica en los capítulos del Feature Store y de entrenamiento de modelos.
Lección 5 • Gobernanza y Reutilización de Features
Cubre el descubrimiento de features, el control de acceso y el uso compartido entre equipos a través de Unity Catalog. Reduce la duplicación de esfuerzos de ingeniería y aplica el linaje de datos en todos los proyectos de ML.
Capítulo 4OcultarOcultar detallesVer detallesEntrenamiento de Modelos con MLflow
Entrenamiento de Modelos con MLflow
Lección 1 • Entrenamiento de Modelos de Aprendizaje Profundo
Presenta bucles de entrenamiento de TensorFlow y PyTorch integrados con el registro de MLflow. Prepara a los estudiantes para el aprendizaje profundo distribuido que se trata en el capítulo de entrenamiento avanzado.
Lección 2 • Ajuste de Hiperparámetros con Hyperopt
Enseña la optimización bayesiana y la búsqueda en paralelo usando Hyperopt y SparkTrials. Los estudiantes mejoran sistemáticamente el rendimiento del modelo más allá de la búsqueda manual en cuadrícula (grid search).
Lección 3 • Fundamentos del Registro en MLflow
Presenta experimentos, ejecuciones (runs), parámetros, métricas y etiquetas en MLflow. Establece la disciplina de registro que sustenta el ML reproducible a lo largo del curso.
Lección 4 • Entrenamiento de Modelos Scikit-learn y Spark ML
Cubre la construcción de pipelines, la validación cruzada y el autologging de MLflow para ambos frameworks. Los estudiantes entrenan y registran modelos de referencia que sirven como benchmarks para técnicas avanzadas.
Lección 5 • Proyectos de MLflow y Reproducibilidad
Cubre los proyectos de MLflow, puntos de entrada y especificaciones de entorno para un entrenamiento portable. Permite a los equipos reproducir cualquier ejecución de experimento en cualquier clúster compatible.
Capítulo 5OcultarOcultar detallesVer detallesRegistro de Modelos y Gestión del Ciclo de Vida
Registro de Modelos y Gestión del Ciclo de Vida
Lección 1 • Registro y Versionado de Modelos
Enseña el registro de modelos desde ejecuciones de MLflow de manera programática y mediante la interfaz de usuario. Los estudiantes establecen una disciplina de versionado coherente para todos los modelos entrenados.
Lección 2 • Transiciones de Etapa y Flujos de Trabajo de Aprobación
Cubre las transiciones a Staging, Production y Archived con notificaciones basadas en webhooks. Implementa un proceso de promoción controlado que refleja los estándares de MLOps empresariales.
Lección 3 • Registro de Modelos de Unity Catalog
Explica el Registro de Modelos respaldado por Unity Catalog para la gobernanza entre workspaces. Los estudiantes migran de la gestión de modelos a nivel de workspace a la de catálogo para escalar a nivel empresarial.
Lección 4 • Firmas de Modelo y Ejemplos de Entrada
Presenta las firmas de modelo de MLflow, los ejemplos de entrada y la aplicación de esquemas. Previene errores de tipo en tiempo de ejecución y documenta las interfaces de modelo esperadas para los consumidores posteriores.
Lección 5 • Descripción General del Registro de Modelos de MLflow
Explica modelos registrados, versiones, etapas y alias en el Registro de Modelos. Conecta las ejecuciones de experimentos del Capítulo 4 con un pipeline de promoción gobernado.
Capítulo 6OcultarOcultar detallesVer detallesEntrenamiento de Modelos Escalable y Distribuido
Entrenamiento de Modelos Escalable y Distribuido
Lección 1 • Ajuste Distribuido de Hiperparámetros a Gran Escala
Extiende SparkTrials de Hyperopt e introduce Optuna para la búsqueda en paralelo a gran escala. Los estudiantes ajustan modelos de aprendizaje profundo de manera eficiente en cientos de pruebas simultáneas.
Lección 2 • TorchDistributor para Entrenamiento con PyTorch
Presenta TorchDistributor como la API nativa de Databricks para PyTorch distribuido. Los estudiantes lanzan trabajos PyTorch multi-GPU y multi-nodo sin configuración manual del clúster.
Lección 3 • Conceptos de Entrenamiento Distribuido
Cubre el paralelismo de datos, el paralelismo de modelos y las estrategias de sincronización de gradientes. Proporciona la base teórica necesaria antes de implementar frameworks distribuidos.
Lección 4 • Horovod para Aprendizaje Profundo Distribuido
Enseña la inicialización de Horovod, el particionamiento de datos por rango y HorovodRunner en Databricks. Los estudiantes convierten scripts de entrenamiento de un solo nodo en trabajos distribuidos multi-nodo.
Lección 5 • Pandas UDFs para Inferencia Distribuida
Cubre Pandas UDFs escalares, de mapa agrupado (grouped map) e iteradoras para aplicar modelos a escala de Spark. Permite la inferencia por lotes en miles de millones de filas sin mover los datos fuera del clúster.
Capítulo 7OcultarOcultar detallesVer detallesDespliegue de Modelos e Inferencia en Tiempo Real
Despliegue de Modelos e Inferencia en Tiempo Real
Lección 1 • Arquitectura de Model Serving de Databricks
Explica Model Serving sin servidor (serverless), tipos de endpoint y enrutamiento de tráfico. Orienta a los estudiantes en la capa de servicios antes de configurar y probar endpoints activos.
Lección 2 • Destinos de Despliegue Externos
Cubre la exportación de modelos a ONNX, contenedores Docker y plataformas de inferencia nativas de la nube. Prepara a los estudiantes para desplegar modelos entrenados en Databricks fuera del entorno de Databricks.
Lección 3 • Lógica de Inferencia Personalizada con PyFunc
Enseña el flavor PyFunc de MLflow para envolver lógica Python arbitraria como un modelo desplegable. Los estudiantes agregan lógica de preprocesamiento, posprocesamiento y ensamblado a los endpoints de inferencia.
Lección 4 • Despliegue de Modelos de MLflow en Endpoints
Cubre la creación de endpoints, la fijación de versiones de modelo y la invocación de la API REST. Los estudiantes despliegan modelos registrados del Capítulo 5 y validan las respuestas de extremo a extremo.
Lección 5 • Pipelines de Inferencia por Lotes
Implementa la calificación por lotes (batch scoring) programada usando Databricks Jobs y mlflow.pyfunc.spark_udf. Complementa la inferencia en tiempo real para casos de uso de alto rendimiento y tolerantes a la latencia.
Capítulo 8OcultarOcultar detallesVer detallesMLOps, Monitoreo y Gobernanza en Producción
MLOps, Monitoreo y Gobernanza en Producción
Lección 1 • Auditoría, Linaje y Cumplimiento
Cubre el linaje de Unity Catalog, los registros de auditoría de MLflow y la gobernanza de acceso para entornos regulados. Los estudiantes documentan la procedencia del modelo para satisfacer los requisitos de auditoría interna y externa.
Lección 2 • Lakehouse Monitoring para ML
Presenta Databricks Lakehouse Monitoring para el cálculo automatizado de métricas en tablas de inferencia. Proporciona dashboards listos para usar sobre la calidad del modelo y la salud de los datos.
Lección 3 • Principios de MLOps y Niveles de Madurez
Define la madurez de MLOps, desde la experimentación manual hasta los pipelines completamente automatizados. Enmarca los objetivos de gobernanza y automatización que los estudiantes implementan en las secciones siguientes.
Lección 4 • Detección de Deriva de Datos y Modelos
Cubre pruebas estadísticas para el cambio de covariables, la deriva de etiquetas y la deriva de predicciones. Los estudiantes implementan alertas de deriva que disparan pipelines de reentrenamiento automáticamente.
Lección 5 • Pipelines de Reentrenamiento Automatizado
Construye flujos de trabajo de reentrenamiento basados en disparadores y programados usando Databricks Jobs y Delta Live Tables. Mantiene los modelos en producción actualizados sin intervención manual.
Tu certificado válido de finalización
Este curso es para vos:
Científicos de datos listos para ir más allá de los notebooks locales hacia el aprendizaje automático a escala en la nube.
Ingenieros de ML que buscan flujos de trabajo estructurados para desplegar y monitorear modelos.
Ingenieros de software que están migrando hacia roles de aprendizaje automático en plataformas en la nube.
Ingenieros de analítica que quieren extender sus pipelines de datos hacia el entrenamiento de modelos.
Estudiantes de posgrado que aplican conocimiento académico de ML en entornos empresariales reales.
Desarrolladores de BI con curiosidad por construir sistemas predictivos sobre sus datos.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los recomendé a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltear contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en Argentina?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















