Choisissez votre langue
Formation Databricks ML Appliqué
Plus de 2 millions d'étudiants dans le monde

Formation Databricks ML Appliqué

Maîtrisez l'apprentissage automatique de bout en bout sur la Databricks Lakehouse Platform — de l'ingestion de données et de l'ingénierie des fonctionnalités à l'entraînement distribué, au service de modèles et au MLOps de production. Ce cours pratique dote les data scientists et les ingénieurs ML des outils, des flux de travail et des pratiques de gouvernance qui alimentent les véritables systèmes d'IA d'entreprise.

Dedika pour les entreprises

Ce que vous allez apprendre:

  • Configurez les clusters Databricks, les intégrations de stockage et Unity Catalog pour des flux de travail ML sécurisés.

  • Créez des pipelines Delta Lake évolutifs qui livrent des données propres et versionnées, prêtes pour l'entraînement de modèles.

  • Concevez et gérez des tableaux de fonctionnalités réutilisables à l'aide de Databricks Feature Store pour éliminer le décalage entre l'entraînement et le service.

  • Suivez, enregistrez et promouvez des modèles via un cycle de vie MLflow gouverné, de l'expérimentation à la production.

  • Déployez des points de terminaison d'inférence en temps réel et par lots avec une logique PyFunc personnalisée et une surveillance automatisée.

  • Implémentez des pipelines CI/CD, la détection de dérive et le réentraînement automatisé pour exploiter des systèmes ML de production de manière fiable.

Comment vous étudiez de façon pratique Formation Databricks ML Appliqué

Comment vous pratiquez Formation Databricks ML Appliqué

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations de la plateforme Databricks

  • Leçon 1 • Notebooks et développement collaboratif

    Présente la création de notebooks, les commandes magiques et les fonctionnalités de co-écriture. Établit des habitudes de développement reproductibles utilisées dans toutes les expériences de ML ultérieures.

  • Leçon 2 • Architecture de l'espace de travail et navigation

    Couvre le plan de contrôle Databricks, le plan de données et l'interface utilisateur de l'espace de travail. Ancre les étudiants dans l'environnement qu'ils utiliseront tout au long de chaque chapitre suivant.

  • Leçon 3 • Accès aux données et intégration du stockage

    Explique les points de montage, Unity Catalog et la gestion des identifiants pour le stockage dans le cloud. Permet un accès aux données sécurisé et cohérent requis pour les pipelines de ML.

  • Leçon 4 • Bases de la CLI et de l'API REST Databricks

    Présente le contrôle programmatique de l'espace de travail via la CLI et les points de terminaison REST. Prépare les étudiants à automatiser les tâches et à intégrer Databricks dans des chaînes d'outils externes.

  • Leçon 5 • Configuration et gestion des clusters

    Enseigne les types de clusters, les versions d'exécution et les politiques d'auto-évolutivité. Les étudiants configurent des clusters de travail et interactifs adaptés aux charges de travail de ML.

Chapitre 2Voir les détails

Ingénierie des données pour les pipelines de ML

  • Leçon 1 • Delta Live Tables pour l'orchestration de pipelines

    Présente les définitions de pipelines déclaratifs, les attentes et le suivi de la lignée. Automatise l'application de la qualité des données à plusieurs étapes avant que les fonctionnalités n'atteignent l'entraînement du modèle.

  • Leçon 2 • Transformation des données avec Spark SQL

    Couvre les agrégations, les fonctions de fenêtrage et la gestion des types complexes dans Spark SQL. Transforme les données brutes en fonctionnalités structurées consommées par les modèles de ML.

  • Leçon 3 • Concepts fondamentaux d'Apache Spark

    Couvre les RDD, DataFrames et le modèle d'exécution Spark. Fournit la base de calcul pour toutes les tâches de traitement de données dans les chapitres ultérieurs sur le ML.

  • Leçon 4 • Delta Lake pour les charges de travail de ML

    Présente les transactions ACID, le voyage dans le temps et l'optimisation des tables Delta. Garantit la fiabilité et la reproductibilité des données lors d'expériences de ML itératives.

  • Leçon 5 • Modèles d'ingestion de données

    Enseigne l'ingestion par lots et en continu à partir de fichiers, de bases de données et de flux d'événements. Les étudiants créent des pipelines fiables de la source vers la zone d'atterrissage pour la création de fonctionnalités de ML.

Chapitre 3Voir les détails

Ingénierie des fonctionnalités et Feature Store

  • Leçon 1 • Élimination du décalage entraînement-service

    Traite de la cohérence entre les données d'entraînement hors ligne et les fonctionnalités de service en ligne. Les étudiants implémentent des ensembles d'entraînement basés sur la recherche qui reflètent les chemins d'inférence de production.

  • Leçon 2 • Architecture du Feature Store Databricks

    Explique les tables du Feature Store, les métadonnées et la division hors ligne/en ligne. Les étudiants comprennent comment les fonctionnalités sont stockées, versionnées et récupérées pour l'entraînement et le service.

  • Leçon 3 • Écriture et lecture des tables de fonctionnalités

    Enseigne les API d'écriture et de lecture pour les mises à jour de fonctionnalités par lots et en continu. Connecte les pipelines d'ingestion du chapitre 2 aux workflows d'entraînement de modèles en aval.

  • Leçon 4 • Fondamentaux de l'ingénierie des fonctionnalités

    Couvre l'encodage, la mise à l'échelle, l'imputation et les termes d'interaction avec Spark. Établit le vocabulaire des fonctionnalités appliqué tout au long des chapitres sur le Feature Store et l'entraînement des modèles.

  • Leçon 5 • Gouvernance et réutilisation des fonctionnalités

    Couvre la découverte des fonctionnalités, le contrôle d'accès et le partage entre équipes via Unity Catalog. Réduit les efforts d'ingénierie en double et applique la lignée des données dans les projets de ML.

Chapitre 4Voir les détails

Entraînement de modèles avec MLflow

  • Leçon 1 • Entraînement de modèles de Deep Learning

    Présente les boucles d'entraînement TensorFlow et PyTorch intégrées à la journalisation MLflow. Prépare les étudiants pour le Deep Learning distribué couvert dans le chapitre avancé sur l'entraînement.

  • Leçon 2 • Réglage des hyperparamètres avec Hyperopt

    Enseigne l'optimisation bayésienne et la recherche parallèle à l'aide d'Hyperopt et SparkTrials. Les étudiants améliorent systématiquement les performances des modèles au-delà de la recherche manuelle par grille.

  • Leçon 3 • Fondamentaux du suivi MLflow

    Présente les expériences, les runs, les paramètres, les métriques et les tags dans MLflow. Établit la discipline de journalisation qui sous-tend le ML reproductible tout au long du cours.

  • Leçon 4 • Entraînement de modèles Scikit-learn et Spark ML

    Couvre la construction de pipelines, la validation croisée et la journalisation automatique MLflow pour les deux frameworks. Les étudiants entraînent et journalisent des modèles de base qui servent de références pour les techniques avancées.

  • Leçon 5 • Projets MLflow et reproductibilité

    Couvre les Projets MLflow, les points d'entrée et les spécifications d'environnement pour un entraînement portable. Permet aux équipes de reproduire n'importe quel run d'expérience sur n'importe quel cluster compatible.

Chapitre 5Voir les détails

Registry de modèles et gestion du cycle de vie

  • Leçon 1 • Enregistrement et versionnage des modèles

    Enseigne l'enregistrement programmatique et via l'interface utilisateur des modèles à partir des runs MLflow. Les étudiants établissent une discipline de versionnage cohérente pour tous les modèles entraînés.

  • Leçon 2 • Transitions d'étapes et workflows d'approbation

    Couvre les transitions Staging, Production et Archivé avec des notifications basées sur des webhooks. Implémente un processus de promotion contrôlé qui reflète les normes MLOps d'entreprise.

  • Leçon 3 • Registry de modèles Unity Catalog

    Explique le Registry de modèles basé sur Unity Catalog pour la gouvernance entre espaces de travail. Les étudiants migrent de la gestion de modèles au niveau de l'espace de travail vers la gestion au niveau du catalogue pour une échelle d'entreprise.

  • Leçon 4 • Signatures de modèles et exemples d'entrée

    Présente les signatures de modèles MLflow, les exemples d'entrée et l'application du schéma. Empêche les erreurs de type à l'exécution et documente les interfaces de modèles attendues pour les consommateurs en aval.

  • Leçon 5 • Présentation du Registry de modèles MLflow

    Explique les modèles enregistrés, les versions, les étapes et les alias dans le Registry de modèles. Connecte les runs d'expériences du chapitre 4 à un pipeline de promotion gouverné.

Chapitre 6Voir les détails

Entraînement de modèles évolutif et distribué

  • Leçon 1 • Réglage distribué des hyperparamètres à grande échelle

    Étend Hyperopt SparkTrials et introduit Optuna pour la recherche parallèle à grande échelle. Les étudiants règlent efficacement des modèles de Deep Learning sur des centaines d'essais simultanés.

  • Leçon 2 • TorchDistributor pour l'entraînement PyTorch

    Présente TorchDistributor comme l'API Databricks native pour PyTorch distribué. Les étudiants lancent des jobs PyTorch multi-GPU et multi-nœuds sans configuration manuelle du cluster.

  • Leçon 3 • Concepts d'entraînement distribué

    Couvre le parallélisme des données, le parallélisme des modèles et les stratégies de synchronisation des gradients. Fournit les bases théoriques nécessaires avant d'implémenter des frameworks distribués.

  • Leçon 4 • Horovod pour le Deep Learning distribué

    Enseigne l'initialisation Horovod, le partitionnement des données par rang et HorovodRunner sur Databricks. Les étudiants convertissent des scripts d'entraînement sur un seul nœud en jobs distribués multi-nœuds.

  • Leçon 5 • UDF Pandas pour l'inférence distribuée

    Couvre les UDF Pandas scalaires, map groupé et itérateur pour appliquer des modèles à l'échelle Spark. Permet l'inférence par lots sur des milliards de lignes sans déplacer les données hors du cluster.

Chapitre 7Voir les détails

Déploiement de modèles et service en temps réel

  • Leçon 1 • Architecture de Model Serving Databricks

    Explique le service de modèles sans serveur, les types de points de terminaison et le routage du trafic. Oriente les étudiants vers la couche de service avant de configurer et de tester des points de terminaison en direct.

  • Leçon 2 • Cibles de déploiement externes

    Couvre l'exportation de modèles vers ONNX, les conteneurs Docker et les plateformes de service cloud natives. Prépare les étudiants à déployer des modèles entraînés sur Databricks en dehors de l'environnement Databricks.

  • Leçon 3 • Logique d'inférence personnalisée avec PyFunc

    Enseigne la saveur PyFunc MLflow pour encapsuler une logique Python arbitraire en tant que modèle déployable. Les étudiants ajoutent du prétraitement, du post-traitement et de la logique d'ensemble aux points de terminaison de service.

  • Leçon 4 • Déploiement de modèles MLflow vers des points de terminaison

    Couvre la création de points de terminaison, le verrouillage des versions de modèles et l'invocation de l'API REST. Les étudiants déploient des modèles enregistrés du chapitre 5 et valident les réponses de bout en bout.

  • Leçon 5 • Pipelines d'inférence par lots

    Implémente le scoring par lots planifié à l'aide de Databricks Jobs et de mlflow.pyfunc.spark_udf. Complète le service en temps réel pour les cas d'utilisation à haut débit et tolérants à la latence.

Chapitre 8Voir les détails

MLOps, surveillance et gouvernance de production

  • Leçon 1 • Audit, lignée et conformité

    Couvre la lignée Unity Catalog, les journaux d'audit MLflow et la gouvernance d'accès pour les environnements réglementés. Les étudiants documentent la provenance des modèles pour satisfaire aux exigences d'audit internes et externes.

  • Leçon 2 • Surveillance Lakehouse pour le ML

    Présente la surveillance Lakehouse Databricks pour le calcul automatisé de métriques sur les tables d'inférence. Fournit des tableaux de bord prêts à l'emploi pour la qualité des modèles et la santé des données.

  • Leçon 3 • Principes MLOps et niveaux de maturité

    Définit la maturité MLOps, de l'expérimentation manuelle aux pipelines entièrement automatisés. Encadre les objectifs de gouvernance et d'automatisation que les étudiants implémentent dans les sections suivantes.

  • Leçon 4 • Détection de la dérive des données et des modèles

    Couvre les tests statistiques pour le changement de covariable, la dérive des étiquettes et la dérive des prédictions. Les étudiants implémentent des alertes de dérive qui déclenchent automatiquement les pipelines de réentraînement.

  • Leçon 5 • Pipelines de réentraînement automatisés

    Construit des workflows de réentraînement déclenchés et planifiés à l'aide de Databricks Jobs et Delta Live Tables. Maintient les modèles de production à jour sans intervention manuelle.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Data scientists prêts à dépasser les notebooks locaux pour passer à l'échelle du ML dans le cloud.

  • Ingénieurs ML recherchant des flux de travail structurés pour déployer et surveiller des modèles.

  • Ingénieurs logiciels en transition vers des rôles d'apprentissage automatique sur des plateformes cloud.

  • Ingénieurs en analytique souhaitant étendre leurs pipelines de données à l'entraînement de modèles.

  • Étudiants diplômés appliquant leurs connaissances académiques en ML à des environnements professionnels réels.

  • Développeurs BI curieux de construire des systèmes prédictifs sur la base de leurs données.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF