
Formation Databricks ML Appliqué
Maîtrisez l'apprentissage automatique de bout en bout sur la Databricks Lakehouse Platform — de l'ingestion de données et de l'ingénierie des fonctionnalités à l'entraînement distribué, au service de modèles et au MLOps de production. Ce cours pratique dote les data scientists et les ingénieurs ML des outils, des flux de travail et des pratiques de gouvernance qui alimentent les véritables systèmes d'IA d'entreprise.
Ce que vous allez apprendre:
Configurez les clusters Databricks, les intégrations de stockage et Unity Catalog pour des flux de travail ML sécurisés.
Créez des pipelines Delta Lake évolutifs qui livrent des données propres et versionnées, prêtes pour l'entraînement de modèles.
Concevez et gérez des tableaux de fonctionnalités réutilisables à l'aide de Databricks Feature Store pour éliminer le décalage entre l'entraînement et le service.
Suivez, enregistrez et promouvez des modèles via un cycle de vie MLflow gouverné, de l'expérimentation à la production.
Déployez des points de terminaison d'inférence en temps réel et par lots avec une logique PyFunc personnalisée et une surveillance automatisée.
Implémentez des pipelines CI/CD, la détection de dérive et le réentraînement automatisé pour exploiter des systèmes ML de production de manière fiable.
Comment vous étudiez de façon pratique Formation Databricks ML Appliqué
Comment vous pratiquez Formation Databricks ML Appliqué
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations de la plateforme Databricks
Fondations de la plateforme Databricks
Leçon 1 • Notebooks et développement collaboratif
Présente la création de notebooks, les commandes magiques et les fonctionnalités de co-écriture. Établit des habitudes de développement reproductibles utilisées dans toutes les expériences de ML ultérieures.
Leçon 2 • Architecture de l'espace de travail et navigation
Couvre le plan de contrôle Databricks, le plan de données et l'interface utilisateur de l'espace de travail. Ancre les étudiants dans l'environnement qu'ils utiliseront tout au long de chaque chapitre suivant.
Leçon 3 • Accès aux données et intégration du stockage
Explique les points de montage, Unity Catalog et la gestion des identifiants pour le stockage dans le cloud. Permet un accès aux données sécurisé et cohérent requis pour les pipelines de ML.
Leçon 4 • Bases de la CLI et de l'API REST Databricks
Présente le contrôle programmatique de l'espace de travail via la CLI et les points de terminaison REST. Prépare les étudiants à automatiser les tâches et à intégrer Databricks dans des chaînes d'outils externes.
Leçon 5 • Configuration et gestion des clusters
Enseigne les types de clusters, les versions d'exécution et les politiques d'auto-évolutivité. Les étudiants configurent des clusters de travail et interactifs adaptés aux charges de travail de ML.
Chapitre 2MasquerCacher les détailsVoir les détailsIngénierie des données pour les pipelines de ML
Ingénierie des données pour les pipelines de ML
Leçon 1 • Delta Live Tables pour l'orchestration de pipelines
Présente les définitions de pipelines déclaratifs, les attentes et le suivi de la lignée. Automatise l'application de la qualité des données à plusieurs étapes avant que les fonctionnalités n'atteignent l'entraînement du modèle.
Leçon 2 • Transformation des données avec Spark SQL
Couvre les agrégations, les fonctions de fenêtrage et la gestion des types complexes dans Spark SQL. Transforme les données brutes en fonctionnalités structurées consommées par les modèles de ML.
Leçon 3 • Concepts fondamentaux d'Apache Spark
Couvre les RDD, DataFrames et le modèle d'exécution Spark. Fournit la base de calcul pour toutes les tâches de traitement de données dans les chapitres ultérieurs sur le ML.
Leçon 4 • Delta Lake pour les charges de travail de ML
Présente les transactions ACID, le voyage dans le temps et l'optimisation des tables Delta. Garantit la fiabilité et la reproductibilité des données lors d'expériences de ML itératives.
Leçon 5 • Modèles d'ingestion de données
Enseigne l'ingestion par lots et en continu à partir de fichiers, de bases de données et de flux d'événements. Les étudiants créent des pipelines fiables de la source vers la zone d'atterrissage pour la création de fonctionnalités de ML.
Chapitre 3MasquerCacher les détailsVoir les détailsIngénierie des fonctionnalités et Feature Store
Ingénierie des fonctionnalités et Feature Store
Leçon 1 • Élimination du décalage entraînement-service
Traite de la cohérence entre les données d'entraînement hors ligne et les fonctionnalités de service en ligne. Les étudiants implémentent des ensembles d'entraînement basés sur la recherche qui reflètent les chemins d'inférence de production.
Leçon 2 • Architecture du Feature Store Databricks
Explique les tables du Feature Store, les métadonnées et la division hors ligne/en ligne. Les étudiants comprennent comment les fonctionnalités sont stockées, versionnées et récupérées pour l'entraînement et le service.
Leçon 3 • Écriture et lecture des tables de fonctionnalités
Enseigne les API d'écriture et de lecture pour les mises à jour de fonctionnalités par lots et en continu. Connecte les pipelines d'ingestion du chapitre 2 aux workflows d'entraînement de modèles en aval.
Leçon 4 • Fondamentaux de l'ingénierie des fonctionnalités
Couvre l'encodage, la mise à l'échelle, l'imputation et les termes d'interaction avec Spark. Établit le vocabulaire des fonctionnalités appliqué tout au long des chapitres sur le Feature Store et l'entraînement des modèles.
Leçon 5 • Gouvernance et réutilisation des fonctionnalités
Couvre la découverte des fonctionnalités, le contrôle d'accès et le partage entre équipes via Unity Catalog. Réduit les efforts d'ingénierie en double et applique la lignée des données dans les projets de ML.
Chapitre 4MasquerCacher les détailsVoir les détailsEntraînement de modèles avec MLflow
Entraînement de modèles avec MLflow
Leçon 1 • Entraînement de modèles de Deep Learning
Présente les boucles d'entraînement TensorFlow et PyTorch intégrées à la journalisation MLflow. Prépare les étudiants pour le Deep Learning distribué couvert dans le chapitre avancé sur l'entraînement.
Leçon 2 • Réglage des hyperparamètres avec Hyperopt
Enseigne l'optimisation bayésienne et la recherche parallèle à l'aide d'Hyperopt et SparkTrials. Les étudiants améliorent systématiquement les performances des modèles au-delà de la recherche manuelle par grille.
Leçon 3 • Fondamentaux du suivi MLflow
Présente les expériences, les runs, les paramètres, les métriques et les tags dans MLflow. Établit la discipline de journalisation qui sous-tend le ML reproductible tout au long du cours.
Leçon 4 • Entraînement de modèles Scikit-learn et Spark ML
Couvre la construction de pipelines, la validation croisée et la journalisation automatique MLflow pour les deux frameworks. Les étudiants entraînent et journalisent des modèles de base qui servent de références pour les techniques avancées.
Leçon 5 • Projets MLflow et reproductibilité
Couvre les Projets MLflow, les points d'entrée et les spécifications d'environnement pour un entraînement portable. Permet aux équipes de reproduire n'importe quel run d'expérience sur n'importe quel cluster compatible.
Chapitre 5MasquerCacher les détailsVoir les détailsRegistry de modèles et gestion du cycle de vie
Registry de modèles et gestion du cycle de vie
Leçon 1 • Enregistrement et versionnage des modèles
Enseigne l'enregistrement programmatique et via l'interface utilisateur des modèles à partir des runs MLflow. Les étudiants établissent une discipline de versionnage cohérente pour tous les modèles entraînés.
Leçon 2 • Transitions d'étapes et workflows d'approbation
Couvre les transitions Staging, Production et Archivé avec des notifications basées sur des webhooks. Implémente un processus de promotion contrôlé qui reflète les normes MLOps d'entreprise.
Leçon 3 • Registry de modèles Unity Catalog
Explique le Registry de modèles basé sur Unity Catalog pour la gouvernance entre espaces de travail. Les étudiants migrent de la gestion de modèles au niveau de l'espace de travail vers la gestion au niveau du catalogue pour une échelle d'entreprise.
Leçon 4 • Signatures de modèles et exemples d'entrée
Présente les signatures de modèles MLflow, les exemples d'entrée et l'application du schéma. Empêche les erreurs de type à l'exécution et documente les interfaces de modèles attendues pour les consommateurs en aval.
Leçon 5 • Présentation du Registry de modèles MLflow
Explique les modèles enregistrés, les versions, les étapes et les alias dans le Registry de modèles. Connecte les runs d'expériences du chapitre 4 à un pipeline de promotion gouverné.
Chapitre 6MasquerCacher les détailsVoir les détailsEntraînement de modèles évolutif et distribué
Entraînement de modèles évolutif et distribué
Leçon 1 • Réglage distribué des hyperparamètres à grande échelle
Étend Hyperopt SparkTrials et introduit Optuna pour la recherche parallèle à grande échelle. Les étudiants règlent efficacement des modèles de Deep Learning sur des centaines d'essais simultanés.
Leçon 2 • TorchDistributor pour l'entraînement PyTorch
Présente TorchDistributor comme l'API Databricks native pour PyTorch distribué. Les étudiants lancent des jobs PyTorch multi-GPU et multi-nœuds sans configuration manuelle du cluster.
Leçon 3 • Concepts d'entraînement distribué
Couvre le parallélisme des données, le parallélisme des modèles et les stratégies de synchronisation des gradients. Fournit les bases théoriques nécessaires avant d'implémenter des frameworks distribués.
Leçon 4 • Horovod pour le Deep Learning distribué
Enseigne l'initialisation Horovod, le partitionnement des données par rang et HorovodRunner sur Databricks. Les étudiants convertissent des scripts d'entraînement sur un seul nœud en jobs distribués multi-nœuds.
Leçon 5 • UDF Pandas pour l'inférence distribuée
Couvre les UDF Pandas scalaires, map groupé et itérateur pour appliquer des modèles à l'échelle Spark. Permet l'inférence par lots sur des milliards de lignes sans déplacer les données hors du cluster.
Chapitre 7MasquerCacher les détailsVoir les détailsDéploiement de modèles et service en temps réel
Déploiement de modèles et service en temps réel
Leçon 1 • Architecture de Model Serving Databricks
Explique le service de modèles sans serveur, les types de points de terminaison et le routage du trafic. Oriente les étudiants vers la couche de service avant de configurer et de tester des points de terminaison en direct.
Leçon 2 • Cibles de déploiement externes
Couvre l'exportation de modèles vers ONNX, les conteneurs Docker et les plateformes de service cloud natives. Prépare les étudiants à déployer des modèles entraînés sur Databricks en dehors de l'environnement Databricks.
Leçon 3 • Logique d'inférence personnalisée avec PyFunc
Enseigne la saveur PyFunc MLflow pour encapsuler une logique Python arbitraire en tant que modèle déployable. Les étudiants ajoutent du prétraitement, du post-traitement et de la logique d'ensemble aux points de terminaison de service.
Leçon 4 • Déploiement de modèles MLflow vers des points de terminaison
Couvre la création de points de terminaison, le verrouillage des versions de modèles et l'invocation de l'API REST. Les étudiants déploient des modèles enregistrés du chapitre 5 et valident les réponses de bout en bout.
Leçon 5 • Pipelines d'inférence par lots
Implémente le scoring par lots planifié à l'aide de Databricks Jobs et de mlflow.pyfunc.spark_udf. Complète le service en temps réel pour les cas d'utilisation à haut débit et tolérants à la latence.
Chapitre 8MasquerCacher les détailsVoir les détailsMLOps, surveillance et gouvernance de production
MLOps, surveillance et gouvernance de production
Leçon 1 • Audit, lignée et conformité
Couvre la lignée Unity Catalog, les journaux d'audit MLflow et la gouvernance d'accès pour les environnements réglementés. Les étudiants documentent la provenance des modèles pour satisfaire aux exigences d'audit internes et externes.
Leçon 2 • Surveillance Lakehouse pour le ML
Présente la surveillance Lakehouse Databricks pour le calcul automatisé de métriques sur les tables d'inférence. Fournit des tableaux de bord prêts à l'emploi pour la qualité des modèles et la santé des données.
Leçon 3 • Principes MLOps et niveaux de maturité
Définit la maturité MLOps, de l'expérimentation manuelle aux pipelines entièrement automatisés. Encadre les objectifs de gouvernance et d'automatisation que les étudiants implémentent dans les sections suivantes.
Leçon 4 • Détection de la dérive des données et des modèles
Couvre les tests statistiques pour le changement de covariable, la dérive des étiquettes et la dérive des prédictions. Les étudiants implémentent des alertes de dérive qui déclenchent automatiquement les pipelines de réentraînement.
Leçon 5 • Pipelines de réentraînement automatisés
Construit des workflows de réentraînement déclenchés et planifiés à l'aide de Databricks Jobs et Delta Live Tables. Maintient les modèles de production à jour sans intervention manuelle.
Votre certificat valide de réussite
Ce cours est pour vous :
Data scientists prêts à dépasser les notebooks locaux pour passer à l'échelle du ML dans le cloud.
Ingénieurs ML recherchant des flux de travail structurés pour déployer et surveiller des modèles.
Ingénieurs logiciels en transition vers des rôles d'apprentissage automatique sur des plateformes cloud.
Ingénieurs en analytique souhaitant étendre leurs pipelines de données à l'entraînement de modèles.
Étudiants diplômés appliquant leurs connaissances académiques en ML à des environnements professionnels réels.
Développeurs BI curieux de construire des systèmes prédictifs sur la base de leurs données.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Algérie ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















