
Formation Data Engineering avec Databricks
Maîtrisez l'ensemble du stack d'ingénierie des données Databricks — des fondamentaux d'Apache Spark et de l'architecture Delta Lake à l'orchestration de pipelines de niveau production et à la gouvernance d'entreprise. Ce cours vous équipe des compétences pratiques pour concevoir, optimiser et exploiter des plateformes de données fiables et évolutives. Que vous débutiez dans l'ingénierie des données ou que vous perfectionniez votre expertise du lakehouse, il s'agit de la formation Databricks de référence.
Ce que vous allez apprendre:
Configurez et gérez les clusters, les espaces de travail et les ressources de calcul Databricks de manière efficace.
Construisez des pipelines ELT évolutifs à l'aide d'Auto Loader, de Structured Streaming et d'architecture en médaillon.
Implémentez des tables Delta Lake avec des transactions ACID, le voyage dans le temps et l'évolution du schéma.
Créez des pipelines déclaratifs auto-réparateurs avec Delta Live Tables et des exigences de qualité.
Appliquez des techniques avancées d'optimisation Spark, notamment AQE, les stratégies de partitionnement et le moteur Photon.
Appliquez la gouvernance des données d'entreprise, le contrôle d'accès et le suivi de la lignée à l'aide d'Unity Catalog.
Comment vous étudiez de façon pratique Formation Data Engineering avec Databricks
Comment vous pratiquez Formation Data Engineering avec Databricks
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations de la plateforme Databricks
Fondations de la plateforme Databricks
Leçon 1 • Configuration et gestion des clusters
Enseigne la création de clusters, le dimensionnement, l'autoscaling et les politiques de terminaison. Les apprenants obtiennent le contrôle sur les coûts de calcul et les performances dès le départ.
Leçon 2 • Présentation de l'architecture Databricks
Couvre le plan de contrôle, le plan de données et l'architecture des clusters qui sous-tendent Databricks. Ancre toute utilisation ultérieure de la plateforme dans un modèle mental clair.
Leçon 3 • Navigation et configuration dans l'espace de travail
Présente l'interface utilisateur Databricks, la structure des dossiers et les paramètres utilisateur. Permet aux apprenants d'organiser les projets et de gérer efficacement les environnements personnels.
Leçon 4 • Notions de base de la CLI Databricks et de l'API REST
Présente l'accès programmatique à la plateforme via la CLI et l'API REST. Prépare les apprenants aux tâches d'automatisation couvertes dans les chapitres suivants.
Leçon 5 • Notebooks et développement collaboratif
Explore la création de notebooks, les commandes magiques et les fonctionnalités de collaboration en temps réel. Établit l'interface de développement principale utilisée tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsConcepts fondamentaux d'Apache Spark
Concepts fondamentaux d'Apache Spark
Leçon 1 • Transformations et actions
Distingue les transformations étroites des transformations larges et explique les déclencheurs d'action. Les apprenants apprennent à raisonner sur les coûts de shuffle et les limites d'exécution.
Leçon 2 • Modèle d'exécution distribué de Spark
Explique les RDD, les DAG, les étages et les tâches au sein du moteur d'exécution de Spark. Fournit la base conceptuelle pour écrire du code distribué efficace.
Leçon 3 • Fondamentaux de l'API DataFrame
Couvre la création de DataFrames, l'inférence de schéma et les transformations principales. Les apprenants appliquent ces opérations comme interface principale de manipulation des données.
Leçon 4 • Fondamentaux des performances Spark
Présente l'interface utilisateur Spark, les plans d'exécution et les leviers de réglage de base. Équipe les apprenants pour diagnostiquer et résoudre les goulots d'étranglement de performance courants.
Leçon 5 • Spark SQL et catalogue
Enseigne les requêtes SQL sur les DataFrames et le catalogue Spark pour la gestion des métadonnées. Fait le pont entre les connaissances SQL et l'utilisation programmatique de Spark.
Chapitre 3MasquerCacher les détailsVoir les détailsArchitecture et opérations de Delta Lake
Architecture et opérations de Delta Lake
Leçon 1 • Format de stockage de Delta Lake
Explique les fichiers Parquet, le journal des transactions et les fichiers de point de contrôle qui forment Delta Lake. Les apprenants comprennent pourquoi Delta offre une fiabilité par rapport aux formats de fichiers bruts.
Leçon 2 • Création et gestion des tables Delta
Couvre le DDL pour créer, modifier et supprimer des tables Delta. Établit les compétences de gestion des tables requises pour tout le travail de pipeline à venir.
Leçon 3 • Transactions ACID et concurrence
Enseigne le contrôle de concurrence optimiste, les niveaux d'isolation et la résolution de conflits dans Delta. Les apprenants peuvent concevoir des pipelines qui gèrent en toute sécurité les écritures concurrentes.
Leçon 4 • Techniques d'optimisation de Delta Lake
Couvre OPTIMIZE, le Z-ordering et la compaction de fichiers pour améliorer les performances des requêtes. Les apprenants appliquent ces techniques aux tables Delta de qualité production.
Leçon 5 • Voyage dans le temps et versionnage des données
Démontre l'interrogation des versions historiques des tables et la restauration des états antérieurs. Permet les motifs d'audit, de retour en arrière et de reproductibilité dans les pipelines de données.
Chapitre 4MasquerCacher les détailsVoir les détailsIngestion de données et motifs ELT
Ingestion de données et motifs ELT
Leçon 1 • Motifs de conception ELT
Présente l'architecture médaillon et les stratégies de chargement incrémental pour l'ELT structuré. Les apprenants conçoivent des pipelines multi-sauts qui séparent les couches brutes, nettoyées et organisées.
Leçon 2 • Ingestion par lots à partir de sources courantes
Enseigne la lecture à partir du stockage objet dans le cloud, des bases de données JDBC et des formats de fichiers. Fournit la base d'ingestion pour tous les motifs de pipeline de ce chapitre.
Leçon 3 • Application de la qualité des données lors de l'ingestion
Enseigne la validation basée sur des contraintes, les motifs de quarantaine et les cadres d'attentes. Garantit que la qualité des données est appliquée avant que les données n'atteignent les consommateurs en aval.
Leçon 4 • Fondamentaux du streaming structuré
Couvre les DataFrames en streaming, les déclencheurs et les modes de sortie pour le traitement continu des données. Relie les concepts de streaming au récepteur Delta Lake utilisé en production.
Leçon 5 • Auto Loader pour l'ingestion incrémentale
Présente les modes de notification de fichiers et de listage de répertoires d'Auto Loader pour des charges incrémentales évolutives. Les apprenants configurent le point de contrôle et l'évolution du schéma d'Auto Loader.
Chapitre 5MasquerCacher les détailsVoir les détailsDelta Live Tables et orchestration de pipelines
Delta Live Tables et orchestration de pipelines
Leçon 1 • Configuration et déploiement des pipelines
Enseigne les paramètres de pipeline, les politiques de cluster et le déploiement via l'interface utilisateur et l'API. Les apprenants configurent des pipelines prêts pour la production avec des paramètres de calcul et de stockage appropriés.
Leçon 2 • Surveillance et dépannage de DLT
Explore le journal des événements, les métriques de l'interface utilisateur du pipeline et les motifs d'échec courants. Les apprenants diagnostiquent et résolvent les problèmes de pipeline à l'aide d'outils d'observabilité intégrés.
Leçon 3 • Qualité des données avec les attentes
Couvre les contraintes EXPECT, EXPECT OR DROP et EXPECT OR FAIL dans DLT. Les apprenants intègrent des règles de qualité directement dans les définitions de pipeline pour une application automatisée.
Leçon 4 • Orchestration de pipelines avec Databricks Workflows
Intègre les pipelines DLT dans les Databricks Workflows multi-tâches avec des dépendances et une planification. Les apprenants construisent des produits de données orchestrés de bout en bout.
Leçon 5 • Concepts fondamentaux de Delta Live Tables
Présente la syntaxe DLT, les live tables, les streaming live tables et le graphe du pipeline. Établit le paradigme déclaratif qui distingue DLT du code Spark impératif.
Chapitre 6MasquerCacher les détailsVoir les détailsUnity Catalog et gouvernance des données
Unity Catalog et gouvernance des données
Leçon 1 • Gestion des identités et des accès
Couvre les utilisateurs, les groupes, les principaux de service et les octrois de privilèges dans Unity Catalog. Les apprenants mettent en œuvre des modèles d'accès avec le moindre privilège pour les actifs de données.
Leçon 2 • Architecture d'Unity Catalog
Explique la hiérarchie metastore, catalogue, schéma et table dans Unity Catalog. Fournit la compréhension structurelle nécessaire pour concevoir des espaces de noms gouvernés.
Leçon 3 • Partage de données avec Delta Sharing
Présente le protocole ouvert Delta Sharing pour le partage de données multiplateforme et inter-organisationnel. Les apprenants publient et consomment des ensembles de données partagés de manière sécurisée.
Leçon 4 • Audit et conformité
Enseigne l'accès aux journaux d'audit, l'historique des requêtes et les motifs de reporting de conformité. Les apprenants configurent la surveillance pour satisfaire aux exigences d'audit de l'entreprise.
Leçon 5 • Lignée et découverte des données
Démontre la capture automatique de la lignée et l'explorateur de données pour la découverte des actifs. Les apprenants utilisent la lignée pour tracer le flux de données et soutenir l'analyse d'impact.
Chapitre 7MasquerCacher les détailsVoir les détailsOptimisation et réglage avancés de Spark
Optimisation et réglage avancés de Spark
Leçon 1 • Optimisation basée sur les coûts et statistiques
Couvre ANALYZE TABLE, les statistiques de colonne et le réordonnancement des jointures par l'optimiseur basé sur les coûts. Les apprenants collectent et exploitent les statistiques pour améliorer la qualité des plans.
Leçon 2 • Gestion de la mémoire et spill
Couvre les régions mémoire de Spark, le dimensionnement des exécuteurs, ainsi que la détection et l'atténuation du spill. Les apprenants configurent les paramètres mémoire pour éliminer le spill coûteux sur disque.
Leçon 3 • Moteur Photon et exécution vectorisée
Présente le moteur Databricks Photon et ses avantages d'exécution vectorisée. Les apprenants identifient les charges de travail qui bénéficient le plus de Photon et l'activent de manière appropriée.
Leçon 4 • Stratégies de partitionnement et de shuffle
Enseigne les nombres de partitions optimaux, repartition vs coalesce et le réglage du shuffle. Les apprenants éliminent l'asymétrie des données et réduisent la surcharge de shuffle dans les pipelines complexes.
Leçon 5 • Exécution adaptative des requêtes
Explique les ajustements de plan à l'exécution d'AQE pour les jointures, l'asymétrie et le coalescing. Les apprenants activent et configurent AQE pour réduire la surcharge de réglage manuel.
Chapitre 8MasquerCacher les détailsVoir les détailsPratiques d'ingénierie des données en production
Pratiques d'ingénierie des données en production
Leçon 1 • Gestion des coûts et FinOps
Couvre l'analyse de la consommation DBU, le dimensionnement correct des clusters et les stratégies d'instances ponctuelles. Les apprenants réduisent les coûts de calcul sans sacrifier la fiabilité du pipeline.
Leçon 2 • CI/CD pour les projets Databricks
Enseigne les Databricks Asset Bundles, l'automatisation du déploiement et la promotion d'environnement. Les apprenants mettent en œuvre un pipeline CI/CD complet du développement à la production.
Leçon 3 • Renforcement de la sécurité et bonnes pratiques
Enseigne l'isolation réseau, la gestion des secrets et la gestion sécurisée des identifiants. Les apprenants appliquent les principes de défense en profondeur pour protéger les actifs de données en production.
Leçon 4 • Test des pipelines de données
Couvre les tests unitaires avec pytest, les stratégies de test d'intégration et la gestion des données de test. Les apprenants construisent une suite de tests qui valide la logique du pipeline avant le déploiement.
Leçon 5 • Observabilité et surveillance des pipelines
Présente les cadres de journalisation, l'émission de métriques et l'alerte pour les pipelines de données. Les apprenants instrumentent les pipelines pour détecter de manière proactive les échecs et les violations des SLA.
Votre certificat valide de réussite
Ce cours est pour vous :
Analystes de données : prêts à passer de l'interrogation des données à l'ingénierie de pipelines fiables.
Développeurs back-end : cherchant à faire pivoter leurs compétences en codage vers le domaine des plateformes de données.
Ingénieurs de données juniors : recherchant un parcours structuré vers une expertise Databricks de niveau production.
Développeurs BI : souhaitant moderniser leur travail ETL à l'aide d'outils natifs du lac de données.
Ingénieurs DevOps : élargissant leur périmètre pour inclure l'infrastructure de données et l'automatisation des pipelines.
Étudiants diplômés : développant des compétences en ingénierie de données prêtes à l'emploi avant d'entrer sur le marché du travail.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Côte d’Ivoire ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















