Elige tu idioma
Databricks ML in Action Course
Más de 2 millones de estudiantes en todo el mundo

Databricks ML in Action Course

Domine el aprendizaje automático de extremo a extremo en la plataforma Databricks Lakehouse: desde la ingesta de datos e ingeniería de características hasta el entrenamiento distribuido, el servicio de modelos y MLOps en producción. Este curso práctico equipa a científicos de datos e ingenieros de aprendizaje automático con las herramientas, los flujos de trabajo y las prácticas de gobernanza que impulsan los sistemas reales de inteligencia artificial empresarial.

Dedika para empresas

Lo que vas a aprender:

  • Configure clústeres de Databricks, integraciones de almacenamiento y Unity Catalog para flujos de trabajo de aprendizaje automático seguros.

  • Construya pipelines escalables de Delta Lake que entreguen datos limpios y versionados, listos para el entrenamiento de modelos.

  • Diseñe y gobierne tablas de características reutilizables usando Databricks Feature Store para eliminar la discrepancia entre entrenamiento y servicio.

  • Rastree, registre y promocione modelos a través de un ciclo de vida gobernado de MLflow, desde el experimento hasta producción.

  • Despliegue endpoints de inferencia en tiempo real y por lotes con lógica PyFunc personalizada y monitoreo automatizado.

  • Implemente pipelines de CI/CD, detección de deriva y reentrenamiento automatizado para operar sistemas de aprendizaje automático en producción de manera confiable.

Cómo estudias de forma práctica Databricks ML in Action Course

Cómo practicas Databricks ML in Action Course

Para ti que eres empresa y quieres capacitar a tu equipo

En Dedika para empresas, el curso incluye ejercicios y ejemplos adaptados a tu propio negocio y a las necesidades de tu empresa.

Haz clic aquí

Contenido del curso

8 Capítulos • 40 LeccionesDuración entre 4 y 360 horas (tú decides)

Capítulo 1Ver detalles

Fundamentos de la Plataforma Databricks

  • Lección 1 • Notebooks y Desarrollo Colaborativo

    Introduce la creación de notebooks, comandos mágicos y funciones de coautoría. Establece hábitos de desarrollo reproducibles que se utilizan en todos los experimentos de ML posteriores.

  • Lección 2 • Arquitectura del Espacio de Trabajo y Navegación

    Cubre el plano de control, el plano de datos y la interfaz de usuario del espacio de trabajo de Databricks. Prepara a los estudiantes en el entorno que usarán a lo largo de cada capítulo posterior.

  • Lección 3 • Acceso a Datos e Integración de Almacenamiento

    Explica puntos de montaje, Unity Catalog y gestión de credenciales para almacenamiento en la nube. Permite un acceso a los datos seguro y consistente, requerido para los pipelines de ML.

  • Lección 4 • Databricks CLI y Fundamentos de la API REST

    Introduce el control programático del espacio de trabajo a través de la CLI y los endpoints REST. Prepara a los estudiantes para automatizar tareas e integrar Databricks en cadenas de herramientas externas.

  • Lección 5 • Configuración y Gestión de Clústeres

    Enseña tipos de clústeres, versiones de runtime y políticas de autoescalado. Los estudiantes configuran clústeres de trabajo e interactivos adecuados para cargas de trabajo de ML.

Capítulo 2Ver detalles

Ingeniería de Datos para Pipelines de ML

  • Lección 1 • Delta Live Tables para Orquestación de Pipelines

    Introduce definiciones de pipelines declarativas, expectativas y seguimiento de linaje. Automatiza la aplicación de calidad de datos en múltiples etapas antes de que las características lleguen al entrenamiento del modelo.

  • Lección 2 • Transformación de Datos con Spark SQL

    Cubre agregaciones, funciones de ventana y manejo de tipos complejos en Spark SQL. Transforma datos brutos en características estructuradas que consumen los modelos de ML.

  • Lección 3 • Conceptos Centrales de Apache Spark

    Cubre RDDs, DataFrames y el modelo de ejecución de Spark. Proporciona la base computacional para todas las tareas de procesamiento de datos en los capítulos de ML posteriores.

  • Lección 4 • Delta Lake para Cargas de Trabajo de ML

    Introduce transacciones ACID, viajes en el tiempo y optimización de tablas Delta. Garantiza la confiabilidad y reproducibilidad de los datos a lo largo de experimentos de ML iterativos.

  • Lección 5 • Patrones de Ingesta de Datos

    Enseña ingesta batch y en streaming desde archivos, bases de datos y flujos de eventos. Los estudiantes construyen pipelines confiables desde la fuente hasta la zona de aterrizaje para la creación de características de ML.

Capítulo 3Ver detalles

Ingeniería de Características y el Feature Store

  • Lección 1 • Eliminación del Sesgo Entre Entrenamiento y Serving

    Aborda la consistencia entre los datos de entrenamiento offline y las características de serving online. Los estudiantes implementan conjuntos de datos de entrenamiento basados en búsqueda que reflejan las rutas de inferencia en producción.

  • Lección 2 • Arquitectura del Databricks Feature Store

    Explica las tablas del Feature Store, los metadatos y la división offline-online. Los estudiantes entienden cómo se almacenan, versionan y recuperan las características para el entrenamiento y el serving.

  • Lección 3 • Escritura y Lectura de Tablas de Características

    Enseña las API de escritura y lectura para actualizaciones batch y en streaming de características. Conecta los pipelines de ingesta del Capítulo 2 con los flujos de trabajo de entrenamiento de modelos posteriores.

  • Lección 4 • Fundamentos de Ingeniería de Características

    Cubre codificación, escalado, imputación y términos de interacción usando Spark. Establece el vocabulario de características que se aplica a lo largo de los capítulos del Feature Store y de entrenamiento de modelos.

  • Lección 5 • Gobernanza y Reutilización de Características

    Cubre el descubrimiento de características, el control de acceso y el uso compartido entre equipos a través de Unity Catalog. Reduce la duplicación de esfuerzos de ingeniería y hace cumplir el linaje de datos en todos los proyectos de ML.

Capítulo 4Ver detalles

Entrenamiento de Modelos con MLflow

  • Lección 1 • Entrenamiento de Modelos de Aprendizaje Profundo

    Introduce bucles de entrenamiento de TensorFlow y PyTorch integrados con el registro de MLflow. Prepara a los estudiantes para el aprendizaje profundo distribuido que se cubre en el capítulo de entrenamiento avanzado.

  • Lección 2 • Ajuste de Hiperparámetros con Hyperopt

    Enseña optimización bayesiana y búsqueda paralela usando Hyperopt y SparkTrials. Los estudiantes mejoran sistemáticamente el rendimiento del modelo más allá de la búsqueda manual en cuadrícula.

  • Lección 3 • Fundamentos de Seguimiento en MLflow

    Introduce experimentos, ejecuciones, parámetros, métricas y etiquetas en MLflow. Establece la disciplina de registro que sustenta el ML reproducible a lo largo del curso.

  • Lección 4 • Entrenamiento de Modelos Scikit-learn y Spark ML

    Cubre la construcción de pipelines, validación cruzada y registro automático de MLflow para ambos frameworks. Los estudiantes entrenan y registran modelos de línea base que sirven como referencia para técnicas avanzadas.

  • Lección 5 • Proyectos MLflow y Reproducibilidad

    Cubre Proyectos MLflow, puntos de entrada y especificaciones de entorno para entrenamiento portátil. Permite a los equipos reproducir cualquier ejecución de experimento en cualquier clúster compatible.

Capítulo 5Ver detalles

Registro de Modelos y Gestión del Ciclo de Vida

  • Lección 1 • Registro y Versionamiento de Modelos

    Enseña el registro de modelos programático y basado en la interfaz de usuario desde las ejecuciones de MLflow. Los estudiantes establecen una disciplina de versionamiento consistente para todos los modelos entrenados.

  • Lección 2 • Transiciones de Etapa y Flujos de Trabajo de Aprobación

    Cubre las transiciones a Staging, Production y Archived con notificaciones basadas en webhooks. Implementa un proceso de promoción controlado que refleja los estándares empresariales de MLOps.

  • Lección 3 • Registro de Modelos en Unity Catalog

    Explica el Registro de Modelos respaldado por Unity Catalog para la gobernanza entre espacios de trabajo. Los estudiantes migran de la gestión de modelos a nivel de espacio de trabajo a la de nivel de catálogo para una escala empresarial.

  • Lección 4 • Firmas de Modelo y Ejemplos de Entrada

    Introduce las firmas de modelo de MLflow, los ejemplos de entrada y la imposición de esquemas. Previene errores de tipo en tiempo de ejecución y documenta las interfaces de modelo esperadas para los consumidores downstream.

  • Lección 5 • Descripción General del Registro de Modelos de MLflow

    Explica los modelos registrados, las versiones, las etapas y los alias en el Registro de Modelos. Conecta las ejecuciones de experimentos del Capítulo 4 con un pipeline de promoción gobernado.

Capítulo 6Ver detalles

Entrenamiento de Modelos Escalable y Distribuido

  • Lección 1 • Ajuste de Hiperparámetros Distribuido a Escala

    Extiende SparkTrials de Hyperopt e introduce Optuna para búsqueda paralela a gran escala. Los estudiantes ajustan modelos de aprendizaje profundo en cientos de pruebas concurrentes de manera eficiente.

  • Lección 2 • TorchDistributor para Entrenamiento con PyTorch

    Introduce TorchDistributor como la API nativa de Databricks para PyTorch distribuido. Los estudiantes lanzan trabajos de PyTorch multi-GPU y multi-nodo sin configuración manual del clúster.

  • Lección 3 • Conceptos de Entrenamiento Distribuido

    Cubre paralelismo de datos, paralelismo de modelos y estrategias de sincronización de gradientes. Proporciona la base teórica necesaria antes de implementar frameworks distribuidos.

  • Lección 4 • Horovod para Aprendizaje Profundo Distribuido

    Enseña la inicialización de Horovod, la fragmentación de datos por rango y HorovodRunner en Databricks. Los estudiantes convierten scripts de entrenamiento de un solo nodo en trabajos distribuidos multi-nodo.

  • Lección 5 • Pandas UDFs para Inferencia Distribuida

    Cubre Pandas UDFs escalares, de mapa agrupado e iteradoras para aplicar modelos a escala Spark. Permite la inferencia batch en miles de millones de filas sin mover los datos del clúster.

Capítulo 7Ver detalles

Despliegue de Modelos y Serving en Tiempo Real

  • Lección 1 • Arquitectura de Databricks Model Serving

    Explica el serving de modelos serverless, los tipos de endpoint y el enrutamiento de tráfico. Orienta a los estudiantes sobre la capa de serving antes de configurar y probar endpoints en vivo.

  • Lección 2 • Destinos de Despliegue Externos

    Cubre la exportación de modelos a formato ONNX, contenedores Docker y plataformas de serving nativas de la nube. Prepara a los estudiantes para desplegar modelos entrenados en Databricks fuera del entorno de Databricks.

  • Lección 3 • Lógica de Inferencia Personalizada con PyFunc

    Enseña el sabor PyFunc de MLflow para envolver lógica Python arbitraria como un modelo desplegable. Los estudiantes agregan lógica de preprocesamiento, posprocesamiento y ensamble a los endpoints de serving.

  • Lección 4 • Despliegue de Modelos de MLflow en Endpoints

    Cubre la creación de endpoints, el fijado de versiones de modelo y la invocación de la API REST. Los estudiantes despliegan modelos registrados del Capítulo 5 y validan respuestas de extremo a extremo.

  • Lección 5 • Pipelines de Inferencia Batch

    Implementa puntuación batch programada usando Databricks Jobs y mlflow.pyfunc.spark_udf. Complementa el serving en tiempo real para casos de uso de alto rendimiento y tolerantes a la latencia.

Capítulo 8Ver detalles

MLOps, Monitoreo y Gobernanza en Producción

  • Lección 1 • Auditoría, Linaje y Cumplimiento

    Cubre el linaje de Unity Catalog, los registros de auditoría de MLflow y la gobernanza de acceso para entornos regulados. Los estudiantes documentan la procedencia del modelo para satisfacer los requisitos de auditoría internos y externos.

  • Lección 2 • Lakehouse Monitoring para ML

    Presenta Databricks Lakehouse Monitoring para el cálculo automatizado de métricas en tablas de inferencia. Proporciona paneles de control listos para usar para la calidad del modelo y la salud de los datos.

  • Lección 3 • Principios y Niveles de Madurez de MLOps

    Define la madurez de MLOps desde la experimentación manual hasta los pipelines completamente automatizados. Enmarca los objetivos de gobernanza y automatización que los estudiantes implementan en las secciones siguientes.

  • Lección 4 • Detección de Drift de Datos y Modelos

    Cubre pruebas estadísticas para cambio de covariables, drift de etiquetas y drift de predicción. Los estudiantes implementan alertas de drift que desencadenan pipelines de reentrenamiento automáticamente.

  • Lección 5 • Pipelines de Reentrenamiento Automatizado

    Construye flujos de trabajo de reentrenamiento basados en desencadenadores y programados usando Databricks Jobs y Delta Live Tables. Mantiene los modelos de producción actualizados sin intervención manual.

Certificación

Tu certificado válido de finalización

Este curso es para ti:

  • Científicos de datos listos para pasar de los notebooks locales al aprendizaje automático a escala en la nube.

  • Ingenieros de aprendizaje automático que buscan flujos de trabajo estructurados para desplegar y monitorear modelos.

  • Ingenieros de software en transición hacia roles de aprendizaje automático en plataformas en la nube.

  • Ingenieros de analítica que desean extender sus pipelines de datos hacia el entrenamiento de modelos.

  • Estudiantes de posgrado que aplican conocimientos académicos de aprendizaje automático a entornos empresariales reales.

  • Desarrolladores de inteligencia de negocios con curiosidad por construir sistemas predictivos sobre sus datos.

Lo que dicen nuestros estudiantes

Sus clases son perfectas. Adquirí el paquete de un año y, finalmente, tengo la oportunidad de seguir diversos temas de mi interés sin necesidad de cambiar de plataforma... les agradezco por todo lo que hacen, ya los he recomendado a otras personas...
Giulio Carlo
Giulio CarloEstudiante de Marketing Digital
Me gusta cómo las lecciones van directo al grano y cómo puedo cambiar capítulos y saltar contenidos que no necesito.
Mariana Ferres
Mariana FerresEstudiante de Fotografía
Me gusta el contenido y la forma de presentación y transcripción de videos, ¡lo que acelera el proceso!
Luciana Alvarenga
Luciana AlvarengaEstudiante de Diseño de Uñas
La plataforma es rápida, fácil de usar. La diversidad de contenido y los videos complementarios ayudan mucho en el aprendizaje.
André Felipe
André FelipeEstudiante de Ingeniería de Prompt

Principales capacitaciones

Preguntas frecuentes

¿Quién es Dedika?

¿El certificado es válido en Colombia?

¿Los cursos son gratuitos?

¿Cuál es la carga horaria del curso?

¿Cómo son los cursos?

¿Cómo funcionan los cursos?

¿Cuál es la duración de los cursos?

¿Cuál es el costo o precio de los cursos?

¿Qué es un curso EAD u online y cómo funciona?

Curso en PDF