Elige tu idioma
Curso de Machine Learning con Databricks
+ de 400 mil profesionales en la plataforma
Exclusivo para empresas

Curso de Machine Learning con Databricks

Domina el aprendizaje automático de extremo a extremo en la Plataforma Databricks Lakehouse: desde la ingesta de datos e ingeniería de funcionalidades hasta el entrenamiento distribuido, el servicio de modelos y MLOps en producción. Este curso práctico dota a los científicos de datos e ingenieros de aprendizaje automático con las herramientas, flujos de trabajo y prácticas de gobernanza que impulsan los sistemas empresariales reales de inteligencia artificial.

Dedika para alumnos

Lo que tu equipo va a dominar:

  • Configura clústeres de Databricks, integraciones de almacenamiento y Unity Catalog para flujos de trabajo seguros de aprendizaje automático.

  • Construye pipelines escalables de Delta Lake que entreguen datos limpios y versionados, listos para el entrenamiento de modelos.

  • Diseña y gobierna tablas de funcionalidades reutilizables utilizando Databricks Feature Store para eliminar el sesgo entre entrenamiento y servicio.

  • Rastrea, registra y promueve modelos a través de un ciclo de vida gobernado de MLflow, desde el experimento hasta producción.

  • Despliega endpoints de inferencia en tiempo real y por batch con lógica PyFunc personalizada y monitoreo automatizado.

  • Implementa pipelines de CI/CD, detección de drift y reentrenamiento automatizado para operar sistemas de aprendizaje automático en producción de manera confiable.

Cómo estudia tu equipo de forma práctica Curso de Machine Learning con Databricks

Cómo practica tu equipo Curso de Machine Learning con Databricks

Profesionales de estas empresas estudian en Dedika

ActemiumFR
Nunner LogisticsNL
GT Constructora GeotécnicaCR
Sydel StarBR
Metrô de São PauloBR
Aguas AndinasCL
DSMIN
MeridianbetRS
CDHCN

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de la Plataforma Databricks

  • Lección 1 • Notebooks y Desarrollo Colaborativo

    Presenta la creación de notebooks, comandos mágicos y funciones de coautoría. Establece hábitos de desarrollo reproducibles que se usarán en todos los experimentos de ML posteriores.

  • Lección 2 • Arquitectura del Workspace y Navegación

    Cubre el plano de control, el plano de datos y la IU del workspace de Databricks. Proporciona a los estudiantes la base sobre el entorno que usarán en cada capítulo subsiguiente.

  • Lección 3 • Acceso a Datos e Integración de Almacenamiento

    Explica los puntos de montaje, Unity Catalog y la gestión de credenciales para el almacenamiento en la nube. Habilita el acceso a datos seguro y consistente requerido para los pipelines de ML.

  • Lección 4 • Fundamentos de CLI de Databricks y API REST

    Presenta el control programático del workspace a través de la CLI y endpoints REST. Prepara a los estudiantes para automatizar tareas e integrar Databricks en cadenas de herramientas externas.

  • Lección 5 • Configuración y Gestión de Clústeres

    Enseña los tipos de clúster, versiones de runtime y políticas de autoescalado. Los estudiantes configuran clústeres de trabajo e interactivos adecuados para cargas de trabajo de ML.

Capítulo 2Ver detalles

Ingeniería de Datos para Pipelines de ML

  • Lección 1 • Delta Live Tables para Orquestación de Pipelines

    Presenta definiciones declarativas de pipelines, expectativas y seguimiento de linaje. Automatiza la aplicación de calidad de datos en múltiples etapas antes de que las características lleguen al entrenamiento del modelo.

  • Lección 2 • Transformación de Datos con Spark SQL

    Cubre agregaciones, funciones de ventana y manejo de tipos complejos en Spark SQL. Transforma datos crudos en características estructuradas consumidas por los modelos de ML.

  • Lección 3 • Conceptos Básicos de Apache Spark

    Cubre los RDDs, DataFrames y el modelo de ejecución de Spark. Proporciona la base computacional para todas las tareas de procesamiento de datos en capítulos posteriores de ML.

  • Lección 4 • Delta Lake para Cargas de Trabajo de ML

    Presenta las transacciones ACID, el viaje en el tiempo y la optimización de tablas Delta. Asegura la confiabilidad y reproducibilidad de los datos en experimentos de ML iterativos.

  • Lección 5 • Patrones de Ingesta de Datos

    Enseña la ingesta por lotes y en streaming desde archivos, bases de datos y flujos de eventos. Los estudiantes construyen pipelines confiables desde el origen hasta la zona de aterrizaje para la creación de características de ML.

Capítulo 3Ver detalles

Ingeniería de Características y el Feature Store

  • Lección 1 • Eliminación del Sesgo de Entrenamiento-Servicio

    Aborda la consistencia entre los datos de entrenamiento offline y las características de servicio online. Los estudiantes implementan conjuntos de entrenamiento basados en búsqueda que reflejan las rutas de inferencia en producción.

  • Lección 2 • Arquitectura de Databricks Feature Store

    Explica las tablas del Feature Store, los metadatos y la división offline-online. Los estudiantes comprenden cómo se almacenan, versionan y recuperan las características para el entrenamiento y el servicio.

  • Lección 3 • Escritura y Lectura de Tablas de Características

    Enseña las API de escritura y lectura para actualizaciones de características por lotes y en streaming. Conecta los pipelines de ingesta del Capítulo 2 con los flujos de trabajo de entrenamiento de modelos posteriores.

  • Lección 4 • Fundamentos de Ingeniería de Características

    Cubre codificación, escalado, imputación y términos de interacción usando Spark. Establece el vocabulario de características aplicado a lo largo de los capítulos del Feature Store y de entrenamiento de modelos.

  • Lección 5 • Gobernanza y Reutilización de Características

    Cubre el descubrimiento de características, el control de acceso y el uso compartido entre equipos a través de Unity Catalog. Reduce la duplicación de esfuerzos de ingeniería y aplica el linaje de datos en todos los proyectos de ML.

Capítulo 4Ver detalles

Entrenamiento de Modelos con MLflow

  • Lección 1 • Entrenamiento de Modelos de Aprendizaje Profundo

    Presenta los bucles de entrenamiento de TensorFlow y PyTorch integrados con el registro de MLflow. Prepara a los estudiantes para el aprendizaje profundo distribuido que se cubre en el capítulo de entrenamiento avanzado.

  • Lección 2 • Ajuste de Hiperparámetros con Hyperopt

    Enseña la optimización bayesiana y la búsqueda paralela usando Hyperopt y SparkTrials. Los estudiantes mejoran sistemáticamente el rendimiento del modelo más allá de la búsqueda manual en cuadrícula.

  • Lección 3 • Fundamentos de Seguimiento de MLflow

    Presenta experimentos, ejecuciones, parámetros, métricas y etiquetas en MLflow. Establece la disciplina de registro que sustenta el ML reproducible a lo largo del curso.

  • Lección 4 • Entrenamiento de Modelos con Scikit-learn y Spark ML

    Cubre la construcción de pipelines, la validación cruzada y el registro automático de MLflow para ambos frameworks. Los estudiantes entrenan y registran modelos de referencia que sirven como punto de comparación para técnicas avanzadas.

  • Lección 5 • Proyectos MLflow y Reproducibilidad

    Cubre los Proyectos MLflow, los puntos de entrada y las especificaciones de entorno para el entrenamiento portable. Permite a los equipos reproducir cualquier ejecución de experimento en cualquier clúster compatible.

Capítulo 5Ver detalles

Registro de Modelos y Gestión del Ciclo de Vida

  • Lección 1 • Registro y Versionado de Modelos

    Enseña el registro programático y a través de la IU de modelos desde las ejecuciones de MLflow. Los estudiantes establecen una disciplina de versionado consistente para todos los modelos entrenados.

  • Lección 2 • Transiciones de Etapa y Flujos de Trabajo de Aprobación

    Cubre las transiciones a Staging, Production y Archived con notificaciones basadas en webhooks. Implementa un proceso de promoción controlado que refleja los estándares empresariales de MLOps.

  • Lección 3 • Registro de Modelos de Unity Catalog

    Explica el Registro de Modelos respaldado por Unity Catalog para la gobernanza entre workspaces. Los estudiantes migran de la gestión de modelos a nivel de workspace a nivel de catálogo para escala empresarial.

  • Lección 4 • Firmas de Modelos y Ejemplos de Entrada

    Presenta las firmas de modelos de MLflow, los ejemplos de entrada y la aplicación de esquemas. Previene errores de tipo en tiempo de ejecución y documenta las interfaces de modelo esperadas para los consumidores downstream.

  • Lección 5 • Descripción General del Registro de Modelos de MLflow

    Explica los modelos registrados, las versiones, las etapas y los alias en el Registro de Modelos. Conecta las ejecuciones de experimentos del Capítulo 4 con un pipeline de promoción gobernado.

Capítulo 6Ver detalles

Entrenamiento de Modelos Escalable y Distribuido

  • Lección 1 • Ajuste de Hiperparámetros Distribuido a Escala

    Extiende SparkTrials de Hyperopt e introduce Optuna para la búsqueda paralela a gran escala. Los estudiantes ajustan modelos de aprendizaje profundo a través de cientos de pruebas concurrentes de manera eficiente.

  • Lección 2 • TorchDistributor para Entrenamiento con PyTorch

    Presenta TorchDistributor como la API nativa de Databricks para PyTorch distribuido. Los estudiantes lanzan trabajos de PyTorch multi-GPU y multi-nodo sin configuración manual del clúster.

  • Lección 3 • Conceptos de Entrenamiento Distribuido

    Cubre el paralelismo de datos, el paralelismo de modelos y las estrategias de sincronización de gradientes. Proporciona la base teórica necesaria antes de implementar frameworks distribuidos.

  • Lección 4 • Horovod para Aprendizaje Profundo Distribuido

    Enseña la inicialización de Horovod, la fragmentación de datos por rango y HorovodRunner en Databricks. Los estudiantes convierten scripts de entrenamiento de un solo nodo en trabajos distribuidos multi-nodo.

  • Lección 5 • UDFs de Pandas para Inferencia Distribuida

    Cubre las UDFs de Pandas escalares, de mapa agrupado y de iterador para aplicar modelos a escala de Spark. Permite la inferencia por lotes en miles de millones de filas sin mover los datos fuera del clúster.

Capítulo 7Ver detalles

Despliegue de Modelos y Servicio en Tiempo Real

  • Lección 1 • Arquitectura de Model Serving de Databricks

    Explica el servicio de modelos sin servidor, los tipos de endpoint y el enrutamiento de tráfico. Orienta a los estudiantes sobre la capa de servicio antes de configurar y probar endpoints en vivo.

  • Lección 2 • Destinos de Despliegue Externos

    Cubre la exportación de modelos a formato ONNX, contenedores Docker y plataformas de servicio nativas de la nube. Prepara a los estudiantes para desplegar modelos entrenados en Databricks fuera del entorno de Databricks.

  • Lección 3 • Lógica de Inferencia Personalizada con PyFunc

    Enseña el sabor PyFunc de MLflow para envolver lógica arbitraria de Python como un modelo desplegable. Los estudiantes añaden lógica de preprocesamiento, postprocesamiento y ensamblaje a los endpoints de servicio.

  • Lección 4 • Despliegue de Modelos de MLflow en Endpoints

    Cubre la creación de endpoints, la fijación de versiones de modelo y la invocación de la API REST. Los estudiantes despliegan modelos registrados del Capítulo 5 y validan las respuestas de extremo a extremo.

  • Lección 5 • Pipelines de Inferencia por Lotes

    Implementa la puntuación por lotes programada usando Databricks Jobs y mlflow.pyfunc.spark_udf. Complementa el servicio en tiempo real para casos de uso de alto throughput y tolerantes a la latencia.

Capítulo 8Ver detalles

MLOps, Monitoreo y Gobernanza en Producción

  • Lección 1 • Auditoría, Linaje y Cumplimiento

    Cubre el linaje de Unity Catalog, los registros de auditoría de MLflow y la gobernanza de acceso para entornos regulados. Los estudiantes documentan la procedencia del modelo para satisfacer los requisitos de auditoría internos y externos.

  • Lección 2 • Monitoreo Lakehouse para ML

    Presenta Databricks Lakehouse Monitoring para el cálculo automatizado de métricas en tablas de inferencia. Proporciona dashboards listos para usar sobre la calidad del modelo y la salud de los datos.

  • Lección 3 • Principios y Niveles de Madurez de MLOps

    Define la madurez de MLOps desde la experimentación manual hasta los pipelines totalmente automatizados. Enmarca los objetivos de gobernanza y automatización que los estudiantes implementan en las secciones siguientes.

  • Lección 4 • Detección de Deriva de Datos y Modelos

    Cubre pruebas estadísticas para el cambio de covariables, la deriva de etiquetas y la deriva de predicción. Los estudiantes implementan alertas de deriva que desencadenan pipelines de reentrenamiento automáticamente.

  • Lección 5 • Pipelines de Reentrenamiento Automatizado

    Construye flujos de trabajo de reentrenamiento programados y basados en desencadenadores usando Databricks Jobs y Delta Live Tables. Mantiene los modelos en producción actualizados sin intervención manual.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Científicos de datos listos para ir más allá de los notebooks locales hacia el aprendizaje automático a escala en la nube.

  • Ingenieros de aprendizaje automático que buscan flujos de trabajo estructurados para desplegar y monitorear modelos.

  • Ingenieros de software en transición hacia roles de aprendizaje automático en plataformas en la nube.

  • Ingenieros de analítica que desean extender sus pipelines de datos hacia el entrenamiento de modelos.

  • Estudiantes de posgrado que aplican conocimientos académicos de aprendizaje automático a entornos empresariales reales.

  • Desarrolladores de inteligencia de negocios interesados en construir sistemas predictivos sobre sus datos.

Cursos relacionados

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en México?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF