
Curso de Machine Learning con Databricks
Domina el aprendizaje automático de extremo a extremo en la Plataforma Databricks Lakehouse: desde la ingesta de datos e ingeniería de funcionalidades hasta el entrenamiento distribuido, el servicio de modelos y MLOps en producción. Este curso práctico dota a los científicos de datos e ingenieros de aprendizaje automático con las herramientas, flujos de trabajo y prácticas de gobernanza que impulsan los sistemas empresariales reales de inteligencia artificial.
Lo que vas a aprender:
Configura clústeres de Databricks, integraciones de almacenamiento y Unity Catalog para flujos de trabajo seguros de aprendizaje automático.
Construye pipelines escalables de Delta Lake que entreguen datos limpios y versionados, listos para el entrenamiento de modelos.
Diseña y gobierna tablas de funcionalidades reutilizables utilizando Databricks Feature Store para eliminar el sesgo entre entrenamiento y servicio.
Rastrea, registra y promueve modelos a través de un ciclo de vida gobernado de MLflow, desde el experimento hasta producción.
Despliega endpoints de inferencia en tiempo real y por batch con lógica PyFunc personalizada y monitoreo automatizado.
Implementa pipelines de CI/CD, detección de drift y reentrenamiento automatizado para operar sistemas de aprendizaje automático en producción de manera confiable.
Cómo estudias de forma práctica Curso de Machine Learning con Databricks
Cómo practicas Curso de Machine Learning con Databricks
Para ti que eres empresa y quieres capacitar a tu equipo
En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.
Contenido del curso
8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)
Capítulo 1OcultarOcultar detallesVer detallesFundamentos de la Plataforma Databricks
Fundamentos de la Plataforma Databricks
Lección 1 • Notebooks y Desarrollo Colaborativo
Presenta la creación de notebooks, comandos mágicos y funciones de coautoría. Establece hábitos de desarrollo reproducibles que se usarán en todos los experimentos de ML posteriores.
Lección 2 • Arquitectura del Workspace y Navegación
Cubre el plano de control, el plano de datos y la IU del workspace de Databricks. Proporciona a los estudiantes la base sobre el entorno que usarán en cada capítulo subsiguiente.
Lección 3 • Acceso a Datos e Integración de Almacenamiento
Explica los puntos de montaje, Unity Catalog y la gestión de credenciales para el almacenamiento en la nube. Habilita el acceso a datos seguro y consistente requerido para los pipelines de ML.
Lección 4 • Fundamentos de CLI de Databricks y API REST
Presenta el control programático del workspace a través de la CLI y endpoints REST. Prepara a los estudiantes para automatizar tareas e integrar Databricks en cadenas de herramientas externas.
Lección 5 • Configuración y Gestión de Clústeres
Enseña los tipos de clúster, versiones de runtime y políticas de autoescalado. Los estudiantes configuran clústeres de trabajo e interactivos adecuados para cargas de trabajo de ML.
Capítulo 2OcultarOcultar detallesVer detallesIngeniería de Datos para Pipelines de ML
Ingeniería de Datos para Pipelines de ML
Lección 1 • Delta Live Tables para Orquestación de Pipelines
Presenta definiciones declarativas de pipelines, expectativas y seguimiento de linaje. Automatiza la aplicación de calidad de datos en múltiples etapas antes de que las características lleguen al entrenamiento del modelo.
Lección 2 • Transformación de Datos con Spark SQL
Cubre agregaciones, funciones de ventana y manejo de tipos complejos en Spark SQL. Transforma datos crudos en características estructuradas consumidas por los modelos de ML.
Lección 3 • Conceptos Básicos de Apache Spark
Cubre los RDDs, DataFrames y el modelo de ejecución de Spark. Proporciona la base computacional para todas las tareas de procesamiento de datos en capítulos posteriores de ML.
Lección 4 • Delta Lake para Cargas de Trabajo de ML
Presenta las transacciones ACID, el viaje en el tiempo y la optimización de tablas Delta. Asegura la confiabilidad y reproducibilidad de los datos en experimentos de ML iterativos.
Lección 5 • Patrones de Ingesta de Datos
Enseña la ingesta por lotes y en streaming desde archivos, bases de datos y flujos de eventos. Los estudiantes construyen pipelines confiables desde el origen hasta la zona de aterrizaje para la creación de características de ML.
Capítulo 3OcultarOcultar detallesVer detallesIngeniería de Características y el Feature Store
Ingeniería de Características y el Feature Store
Lección 1 • Eliminación del Sesgo de Entrenamiento-Servicio
Aborda la consistencia entre los datos de entrenamiento offline y las características de servicio online. Los estudiantes implementan conjuntos de entrenamiento basados en búsqueda que reflejan las rutas de inferencia en producción.
Lección 2 • Arquitectura de Databricks Feature Store
Explica las tablas del Feature Store, los metadatos y la división offline-online. Los estudiantes comprenden cómo se almacenan, versionan y recuperan las características para el entrenamiento y el servicio.
Lección 3 • Escritura y Lectura de Tablas de Características
Enseña las API de escritura y lectura para actualizaciones de características por lotes y en streaming. Conecta los pipelines de ingesta del Capítulo 2 con los flujos de trabajo de entrenamiento de modelos posteriores.
Lección 4 • Fundamentos de Ingeniería de Características
Cubre codificación, escalado, imputación y términos de interacción usando Spark. Establece el vocabulario de características aplicado a lo largo de los capítulos del Feature Store y de entrenamiento de modelos.
Lección 5 • Gobernanza y Reutilización de Características
Cubre el descubrimiento de características, el control de acceso y el uso compartido entre equipos a través de Unity Catalog. Reduce la duplicación de esfuerzos de ingeniería y aplica el linaje de datos en todos los proyectos de ML.
Capítulo 4OcultarOcultar detallesVer detallesEntrenamiento de Modelos con MLflow
Entrenamiento de Modelos con MLflow
Lección 1 • Entrenamiento de Modelos de Aprendizaje Profundo
Presenta los bucles de entrenamiento de TensorFlow y PyTorch integrados con el registro de MLflow. Prepara a los estudiantes para el aprendizaje profundo distribuido que se cubre en el capítulo de entrenamiento avanzado.
Lección 2 • Ajuste de Hiperparámetros con Hyperopt
Enseña la optimización bayesiana y la búsqueda paralela usando Hyperopt y SparkTrials. Los estudiantes mejoran sistemáticamente el rendimiento del modelo más allá de la búsqueda manual en cuadrícula.
Lección 3 • Fundamentos de Seguimiento de MLflow
Presenta experimentos, ejecuciones, parámetros, métricas y etiquetas en MLflow. Establece la disciplina de registro que sustenta el ML reproducible a lo largo del curso.
Lección 4 • Entrenamiento de Modelos con Scikit-learn y Spark ML
Cubre la construcción de pipelines, la validación cruzada y el registro automático de MLflow para ambos frameworks. Los estudiantes entrenan y registran modelos de referencia que sirven como punto de comparación para técnicas avanzadas.
Lección 5 • Proyectos MLflow y Reproducibilidad
Cubre los Proyectos MLflow, los puntos de entrada y las especificaciones de entorno para el entrenamiento portable. Permite a los equipos reproducir cualquier ejecución de experimento en cualquier clúster compatible.
Capítulo 5OcultarOcultar detallesVer detallesRegistro de Modelos y Gestión del Ciclo de Vida
Registro de Modelos y Gestión del Ciclo de Vida
Lección 1 • Registro y Versionado de Modelos
Enseña el registro programático y a través de la IU de modelos desde las ejecuciones de MLflow. Los estudiantes establecen una disciplina de versionado consistente para todos los modelos entrenados.
Lección 2 • Transiciones de Etapa y Flujos de Trabajo de Aprobación
Cubre las transiciones a Staging, Production y Archived con notificaciones basadas en webhooks. Implementa un proceso de promoción controlado que refleja los estándares empresariales de MLOps.
Lección 3 • Registro de Modelos de Unity Catalog
Explica el Registro de Modelos respaldado por Unity Catalog para la gobernanza entre workspaces. Los estudiantes migran de la gestión de modelos a nivel de workspace a nivel de catálogo para escala empresarial.
Lección 4 • Firmas de Modelos y Ejemplos de Entrada
Presenta las firmas de modelos de MLflow, los ejemplos de entrada y la aplicación de esquemas. Previene errores de tipo en tiempo de ejecución y documenta las interfaces de modelo esperadas para los consumidores downstream.
Lección 5 • Descripción General del Registro de Modelos de MLflow
Explica los modelos registrados, las versiones, las etapas y los alias en el Registro de Modelos. Conecta las ejecuciones de experimentos del Capítulo 4 con un pipeline de promoción gobernado.
Capítulo 6OcultarOcultar detallesVer detallesEntrenamiento de Modelos Escalable y Distribuido
Entrenamiento de Modelos Escalable y Distribuido
Lección 1 • Ajuste de Hiperparámetros Distribuido a Escala
Extiende SparkTrials de Hyperopt e introduce Optuna para la búsqueda paralela a gran escala. Los estudiantes ajustan modelos de aprendizaje profundo a través de cientos de pruebas concurrentes de manera eficiente.
Lección 2 • TorchDistributor para Entrenamiento con PyTorch
Presenta TorchDistributor como la API nativa de Databricks para PyTorch distribuido. Los estudiantes lanzan trabajos de PyTorch multi-GPU y multi-nodo sin configuración manual del clúster.
Lección 3 • Conceptos de Entrenamiento Distribuido
Cubre el paralelismo de datos, el paralelismo de modelos y las estrategias de sincronización de gradientes. Proporciona la base teórica necesaria antes de implementar frameworks distribuidos.
Lección 4 • Horovod para Aprendizaje Profundo Distribuido
Enseña la inicialización de Horovod, la fragmentación de datos por rango y HorovodRunner en Databricks. Los estudiantes convierten scripts de entrenamiento de un solo nodo en trabajos distribuidos multi-nodo.
Lección 5 • UDFs de Pandas para Inferencia Distribuida
Cubre las UDFs de Pandas escalares, de mapa agrupado y de iterador para aplicar modelos a escala de Spark. Permite la inferencia por lotes en miles de millones de filas sin mover los datos fuera del clúster.
Capítulo 7OcultarOcultar detallesVer detallesDespliegue de Modelos y Servicio en Tiempo Real
Despliegue de Modelos y Servicio en Tiempo Real
Lección 1 • Arquitectura de Model Serving de Databricks
Explica el servicio de modelos sin servidor, los tipos de endpoint y el enrutamiento de tráfico. Orienta a los estudiantes sobre la capa de servicio antes de configurar y probar endpoints en vivo.
Lección 2 • Destinos de Despliegue Externos
Cubre la exportación de modelos a formato ONNX, contenedores Docker y plataformas de servicio nativas de la nube. Prepara a los estudiantes para desplegar modelos entrenados en Databricks fuera del entorno de Databricks.
Lección 3 • Lógica de Inferencia Personalizada con PyFunc
Enseña el sabor PyFunc de MLflow para envolver lógica arbitraria de Python como un modelo desplegable. Los estudiantes añaden lógica de preprocesamiento, postprocesamiento y ensamblaje a los endpoints de servicio.
Lección 4 • Despliegue de Modelos de MLflow en Endpoints
Cubre la creación de endpoints, la fijación de versiones de modelo y la invocación de la API REST. Los estudiantes despliegan modelos registrados del Capítulo 5 y validan las respuestas de extremo a extremo.
Lección 5 • Pipelines de Inferencia por Lotes
Implementa la puntuación por lotes programada usando Databricks Jobs y mlflow.pyfunc.spark_udf. Complementa el servicio en tiempo real para casos de uso de alto throughput y tolerantes a la latencia.
Capítulo 8OcultarOcultar detallesVer detallesMLOps, Monitoreo y Gobernanza en Producción
MLOps, Monitoreo y Gobernanza en Producción
Lección 1 • Auditoría, Linaje y Cumplimiento
Cubre el linaje de Unity Catalog, los registros de auditoría de MLflow y la gobernanza de acceso para entornos regulados. Los estudiantes documentan la procedencia del modelo para satisfacer los requisitos de auditoría internos y externos.
Lección 2 • Monitoreo Lakehouse para ML
Presenta Databricks Lakehouse Monitoring para el cálculo automatizado de métricas en tablas de inferencia. Proporciona dashboards listos para usar sobre la calidad del modelo y la salud de los datos.
Lección 3 • Principios y Niveles de Madurez de MLOps
Define la madurez de MLOps desde la experimentación manual hasta los pipelines totalmente automatizados. Enmarca los objetivos de gobernanza y automatización que los estudiantes implementan en las secciones siguientes.
Lección 4 • Detección de Deriva de Datos y Modelos
Cubre pruebas estadísticas para el cambio de covariables, la deriva de etiquetas y la deriva de predicción. Los estudiantes implementan alertas de deriva que desencadenan pipelines de reentrenamiento automáticamente.
Lección 5 • Pipelines de Reentrenamiento Automatizado
Construye flujos de trabajo de reentrenamiento programados y basados en desencadenadores usando Databricks Jobs y Delta Live Tables. Mantiene los modelos en producción actualizados sin intervención manual.
Tu certificado válido de finalización
Este curso es para ti:
Científicos de datos listos para ir más allá de los notebooks locales hacia el aprendizaje automático a escala en la nube.
Ingenieros de aprendizaje automático que buscan flujos de trabajo estructurados para desplegar y monitorear modelos.
Ingenieros de software en transición hacia roles de aprendizaje automático en plataformas en la nube.
Ingenieros de analítica que desean extender sus pipelines de datos hacia el entrenamiento de modelos.
Estudiantes de posgrado que aplican conocimientos académicos de aprendizaje automático a entornos empresariales reales.
Desarrolladores de inteligencia de negocios interesados en construir sistemas predictivos sobre sus datos.
Lo que dicen nuestros alumnos
Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... agradezco todo lo que hacen, ya los he recomendado a otras personas...

Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.

Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!

La plataforma es rápida, simple de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.

Principales capacitaciones
Preguntas frecuentes
¿Quién es Dedika?
¿El certificado es válido en México?
¿Los cursos son gratuitos?
¿Cuál es la carga horaria del curso?
¿Cómo son los cursos?
¿Cómo funcionan los cursos?
¿Cuál es la duración de los cursos?
¿Cuál es el costo o precio de los cursos?
¿Qué es un curso EAD u online y cómo funciona?
Curso en PDF




















