
Formation Databricks ML en pratique
Maîtrisez l'apprentissage automatique de bout en bout sur la plateforme Databricks Lakehouse — de l'ingestion de données et de l'ingénierie des caractéristiques à l'entraînement distribué, au service de modèles et au MLOps de production. Ce cours pratique équipe les data scientists et les ingénieurs ML avec les outils, les workflows et les pratiques de gouvernance qui alimentent les véritables systèmes d'IA d'entreprise.
Ce que vous allez apprendre:
Configurez les clusters Databricks, les intégrations de stockage et Unity Catalog pour des workflows ML sécurisés.
Construisez des pipelines Delta Lake évolutifs qui fournissent des données propres et versionnées prêtes pour l'entraînement de modèles.
Concevez et gérez des tables de caractéristiques réutilisables à l'aide de Databricks Feature Store pour éliminer le décalage entre l'entraînement et le service.
Suivez, enregistrez et promouvez des modèles à travers un cycle de vie MLflow gouverné, de l'expérimentation à la production.
Déployez des points de terminaison d'inférence en temps réel et par lots avec une logique PyFunc personnalisée et une surveillance automatisée.
Mettez en œuvre des pipelines CI/CD, la détection de dérive et le réentraînement automatisé pour exploiter des systèmes ML de production de manière fiable.
Comment vous étudiez de façon pratique Formation Databricks ML en pratique
Comment vous pratiquez Formation Databricks ML en pratique
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations de la Plateforme Databricks
Fondations de la Plateforme Databricks
Leçon 1 • Notebooks et Développement Collaboratif
Présente la création de notebooks, les commandes magiques et les fonctionnalités de co-écriture. Établit des habitudes de développement reproductibles utilisées dans toutes les expériences ML ultérieures.
Leçon 2 • Architecture de l'Espace de Travail et Navigation
Couvre le plan de contrôle Databricks, le plan de données et l'interface utilisateur de l'espace de travail. Forme les étudiants à l'environnement qu'ils utiliseront dans tous les chapitres suivants.
Leçon 3 • Accès aux Données et Intégration du Stockage
Explique les points de montage, Unity Catalog et la gestion des identifiants pour le stockage en nuage. Permet un accès aux données sécurisé et cohérent requis pour les pipelines de ML.
Leçon 4 • Bases de la CLI et de l'API REST Databricks
Présente le contrôle programmatique de l'espace de travail via la CLI et les points de terminaison REST. Prépare les étudiants à automatiser les tâches et à intégrer Databricks dans des chaînes d'outils externes.
Leçon 5 • Configuration et Gestion des Clusters
Enseigne les types de clusters, les versions d'exécution et les politiques de mise à l'échelle automatique. Les étudiants configurent des clusters de travail et interactifs adaptés aux charges de travail ML.
Chapitre 2MasquerCacher les détailsVoir les détailsIngénierie des Données pour les Pipelines ML
Ingénierie des Données pour les Pipelines ML
Leçon 1 • Delta Live Tables pour l'Orchestration de Pipelines
Présente les définitions déclaratives de pipelines, les attentes et le suivi de la lignée. Automatise le contrôle de qualité des données en plusieurs étapes avant que les caractéristiques n'atteignent l'entraînement des modèles.
Leçon 2 • Transformation de Données avec Spark SQL
Couvre les agrégations, les fonctions de fenêtre et la gestion des types complexes dans Spark SQL. Transforme les données brutes en caractéristiques structurées consommées par les modèles ML.
Leçon 3 • Concepts Fondamentaux d'Apache Spark
Couvre les RDD, les DataFrames et le modèle d'exécution de Spark. Fournit la base de calcul pour toutes les tâches de traitement de données dans les chapitres ML ultérieurs.
Leçon 4 • Delta Lake pour les Charges de Travail ML
Présente les transactions ACID, le voyage dans le temps et l'optimisation des tables Delta. Assure la fiabilité et la reproductibilité des données à travers des expériences ML itératives.
Leçon 5 • Modèles d'Ingestion de Données
Enseigne l'ingestion par lots et en continu à partir de fichiers, bases de données et flux d'événements. Les étudiants construisent des pipelines fiables de la source vers la zone d'atterrissage pour la création de caractéristiques ML.
Chapitre 3MasquerCacher les détailsVoir les détailsIngénierie des Caractéristiques et le Feature Store
Ingénierie des Caractéristiques et le Feature Store
Leçon 1 • Élimination du Décalage Entraînement-Service
Aborde la cohérence entre les données d'entraînement hors ligne et les caractéristiques de service en ligne. Les étudiants implémentent des ensembles d'entraînement basés sur la recherche qui reflètent les chemins d'inférence de production.
Leçon 2 • Architecture de Databricks Feature Store
Explique les tables du Feature Store, les métadonnées et la répartition hors ligne/en ligne. Les étudiants comprennent comment les caractéristiques sont stockées, versionnées et récupérées pour l'entraînement et le service.
Leçon 3 • Écriture et Lecture des Tables de Caractéristiques
Enseigne les API d'écriture et de lecture pour les mises à jour par lots et en continu des caractéristiques. Connecte les pipelines d'ingestion du Chapitre 2 aux workflows d'entraînement de modèles en aval.
Leçon 4 • Fondamentaux de l'Ingénierie des Caractéristiques
Couvre l'encodage, la mise à l'échelle, l'imputation et les termes d'interaction avec Spark. Établit le vocabulaire des caractéristiques appliqué tout au long des chapitres sur le Feature Store et l'entraînement de modèles.
Leçon 5 • Gouvernance et Réutilisation des Caractéristiques
Couvre la découverte des caractéristiques, le contrôle d'accès et le partage entre équipes via Unity Catalog. Réduit l'effort d'ingénierie dupliqué et applique la lignée des données à travers les projets ML.
Chapitre 4MasquerCacher les détailsVoir les détailsEntraînement de Modèles avec MLflow
Entraînement de Modèles avec MLflow
Leçon 1 • Entraînement de Modèles d'Apprentissage Profond
Présente les boucles d'entraînement TensorFlow et PyTorch intégrées à la journalisation MLflow. Prépare les étudiants à l'apprentissage profond distribué abordé dans le chapitre sur l'entraînement avancé.
Leçon 2 • Réglage des Hyperparamètres avec Hyperopt
Enseigne l'optimisation bayésienne et la recherche parallèle avec Hyperopt et SparkTrials. Les étudiants améliorent systématiquement les performances des modèles au-delà de la recherche manuelle par grille.
Leçon 3 • Fondamentaux du Suivi MLflow
Présente les expériences, les runs, les paramètres, les métriques et les tags dans MLflow. Établit la discipline de journalisation qui sous-tend le ML reproductible tout au long du cours.
Leçon 4 • Entraînement de Modèles Scikit-learn et Spark ML
Couvre la construction de pipelines, la validation croisée et la journalisation automatique MLflow pour les deux frameworks. Les étudiants entraînent et enregistrent des modèles de base qui servent de références pour les techniques avancées.
Leçon 5 • Projets MLflow et Reproductibilité
Couvre les projets MLflow, les points d'entrée et les spécifications d'environnement pour un entraînement portable. Permet aux équipes de reproduire n'importe quelle run d'expérience sur n'importe quel cluster compatible.
Chapitre 5MasquerCacher les détailsVoir les détailsRegistre de Modèles et Gestion du Cycle de Vie
Registre de Modèles et Gestion du Cycle de Vie
Leçon 1 • Enregistrement et Versionnage des Modèles
Enseigne l'enregistrement programmatique et via l'interface utilisateur des modèles à partir des runs MLflow. Les étudiants établissent une discipline de versionnage cohérente pour tous les modèles entraînés.
Leçon 2 • Transitions d'Étapes et Workflows d'Approbation
Couvre les transitions Staging, Production et Archivées avec des notifications basées sur des webhooks. Implémente un processus de promotion contrôlé qui reflète les normes MLOps d'entreprise.
Leçon 3 • Registre de Modèles Unity Catalog
Explique le registre de modèles basé sur Unity Catalog pour la gouvernance entre espaces de travail. Les étudiants migrent de la gestion des modèles au niveau de l'espace de travail à la gestion au niveau du catalogue pour une échelle d'entreprise.
Leçon 4 • Signatures de Modèles et Exemples d'Entrée
Introduit les signatures de modèle MLflow, les exemples d'entrée et l'application du schéma. Empêche les erreurs de type à l'exécution et documente les interfaces de modèle attendues pour les consommateurs en aval.
Leçon 5 • Aperçu du Registre de Modèles MLflow
Explique les modèles enregistrés, les versions, les étapes et les alias dans le Registre de Modèles. Relie les runs d'expérience du Chapitre 4 à un pipeline de promotion gouverné.
Chapitre 6MasquerCacher les détailsVoir les détailsEntraînement de Modèles Distribué et Évolutif
Entraînement de Modèles Distribué et Évolutif
Leçon 1 • Réglage d'Hyperparamètres Distribué à Grande Échelle
Étend SparkTrials Hyperopt et introduit Optuna pour la recherche parallèle à grande échelle. Les étudiants règlent efficacement les modèles d'apprentissage profond sur des centaines d'essais simultanés.
Leçon 2 • TorchDistributor pour l'Entraînement PyTorch
Introduit TorchDistributor comme l'API native Databricks pour PyTorch distribué. Les étudiants lancent des travaux PyTorch multi-GPU et multi-nœuds sans configuration manuelle du cluster.
Leçon 3 • Concepts d'Entraînement Distribué
Couvre le parallélisme des données, le parallélisme des modèles et les stratégies de synchronisation des gradients. Fournit la base théorique nécessaire avant d'implémenter des frameworks distribués.
Leçon 4 • Horovod pour l'Apprentissage Profond Distribué
Enseigne l'initialisation Horovod, le partitionnement des données basé sur le rang et HorovodRunner sur Databricks. Les étudiants convertissent des scripts d'entraînement sur un seul nœud en travaux distribués multi-nœuds.
Leçon 5 • Pandas UDF pour l'Inférence Distribuée
Couvre les Pandas UDF scalaires, de groupe mappé et d'itérateur pour appliquer des modèles à l'échelle Spark. Permet l'inférence par lots sur des milliards de lignes sans déplacer les données du cluster.
Chapitre 7MasquerCacher les détailsVoir les détailsDéploiement de Modèles et Service en Temps Réel
Déploiement de Modèles et Service en Temps Réel
Leçon 1 • Architecture de Service de Modèles Databricks
Explique le service de modèles sans serveur, les types de points de terminaison et le routage du trafic. Oriente les étudiants vers la couche de service avant de configurer et de tester des points de terminaison en direct.
Leçon 2 • Cibles de Déploiement Externes
Couvre l'exportation de modèles vers ONNX, les conteneurs Docker et les plateformes de service natives du cloud. Prépare les étudiants à déployer des modèles formés sur Databricks en dehors de l'environnement Databricks.
Leçon 3 • Logique d'Inférence Personnalisée avec PyFunc
Enseigne la saveur PyFunc MLflow pour envelopper une logique Python arbitraire en tant que modèle déployable. Les étudiants ajoutent du prétraitement, du post-traitement et de la logique d'ensemble aux points de terminaison de service.
Leçon 4 • Déploiement de Modèles MLflow vers les Points de Terminaison
Couvre la création de points de terminaison, l'épinglage de versions de modèles et l'invocation de l'API REST. Les étudiants déploient des modèles enregistrés du Chapitre 5 et valident les réponses de bout en bout.
Leçon 5 • Pipelines d'Inférence par Lots
Implémente la notation par lots planifiée à l'aide de Databricks Jobs et mlflow.pyfunc.spark_udf. Complète le service en temps réel pour les cas d'utilisation à haut débit et tolérants à la latence.
Chapitre 8MasquerCacher les détailsVoir les détailsMLOps, Surveillance et Gouvernance de Production
MLOps, Surveillance et Gouvernance de Production
Leçon 1 • Audit, Lignée et Conformité
Couvre la lignée Unity Catalog, les journaux d'audit MLflow et la gouvernance d'accès pour les environnements réglementés. Les étudiants documentent la provenance des modèles pour satisfaire aux exigences d'audit internes et externes.
Leçon 2 • Lakehouse Monitoring pour le Machine Learning
Introduit Databricks Lakehouse Monitoring pour le calcul automatisé de métriques sur les tables d'inférence. Fournit des tableaux de bord prêts à l'emploi pour la qualité des modèles et l'état des données.
Leçon 3 • Principes MLOps et Niveaux de Maturité
Définit la maturité MLOps, de l'expérimentation manuelle aux pipelines entièrement automatisés. Encadre les objectifs de gouvernance et d'automatisation que les étudiants implémentent dans les sections suivantes.
Leçon 4 • Détection de la Dérive des Données et des Modèles
Couvre les tests statistiques pour le changement de covariable, la dérive des étiquettes et la dérive des prédictions. Les étudiants implémentent des alertes de dérive qui déclenchent automatiquement des pipelines de réentraînement.
Leçon 5 • Pipelines de Réentraînement Automatisé
Construit des workflows de réentraînement déclenchés et planifiés à l'aide de Databricks Jobs et Delta Live Tables. Maintient les modèles de production à jour sans intervention manuelle.
Votre certificat valide de réussite
Ce cours est pour vous :
Data scientists prêts à dépasser les notebooks locaux pour passer à un ML à l'échelle du cloud.
Ingénieurs en ML cherchant des workflows structurés pour déployer et surveiller des modèles.
Ingénieurs logiciels effectuant une transition vers des rôles d'apprentissage automatique sur des plateformes cloud.
Ingénieurs d'analytique souhaitant étendre leurs pipelines de données à l'entraînement de modèles.
Étudiants diplômés appliquant leurs connaissances académiques en ML à des environnements d'entreprise réels.
Développeurs BI curieux de construire des systèmes prédictifs sur leurs données.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Côte d’Ivoire ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















