
Formation Data Engineering avec Databricks
Maîtrisez l'ensemble de la pile d'ingénierie de données Databricks – des fondamentaux d'Apache Spark et de l'architecture Delta Lake à l'orchestration de pipelines de niveau production et à la gouvernance d'entreprise. Ce cours vous dote des compétences pratiques nécessaires pour concevoir, optimiser et exploiter des plateformes de données fiables et évolutives. Que vous débutiez dans l'ingénierie des données ou que vous souhaitiez perfectionner votre expertise du lakehouse, il s'agit de la formation Databricks de référence.
Ce que votre équipe va maîtriser:
Configurez et gérez efficacement les clusters, espaces de travail et ressources de calcul Databricks.
Créez des pipelines ELT évolutifs à l'aide d'Auto Loader, Structured Streaming et de l'architecture en médaillon.
Implémentez des tables Delta Lake avec des transactions ACID, le voyage dans le temps et l'évolution du schéma.
Créez des pipelines déclaratifs et auto-cicatrisants avec Delta Live Tables et des attentes de qualité.
Appliquez des techniques avancées d'optimisation Spark, notamment AQE, des stratégies de partitionnement et le moteur Photon.
Appliquez la gouvernance d'entreprise des données, le contrôle d'accès et le suivi de la traçabilité à l'aide d'Unity Catalog.
Comment votre équipe apprend de façon pratique Formation Data Engineering avec Databricks
Comment votre équipe s’exerce Formation Data Engineering avec Databricks
Des professionnels de ces entreprises apprennent sur Dedika









Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations de la plateforme Databricks
Fondations de la plateforme Databricks
Leçon 1 • Configuration et gestion des clusters
Enseigne la création, le dimensionnement, l'auto-scaling et les règles d'arrêt des clusters. Les étudiants obtiennent un contrôle sur les coûts de calcul et les performances dès le départ.
Leçon 2 • Présentation de l'architecture Databricks
Couvre le plan de contrôle, le plan de données et l'architecture de cluster qui sous-tendent Databricks. Ancre toute l'utilisation ultérieure de la plateforme dans un modèle mental clair.
Leçon 3 • Navigation et configuration de l'espace de travail
Présente l'interface utilisateur Databricks, la structure des dossiers et les paramètres utilisateur. Permet aux étudiants d'organiser leurs projets et de gérer efficacement leurs environnements personnels.
Leçon 4 • Bases de la CLI et de l'API REST Databricks
Présente l'accès programmatique à la plateforme via la CLI et l'API REST. Prépare les étudiants aux tâches d'automatisation couvertes dans les chapitres suivants.
Leçon 5 • Notebooks et développement collaboratif
Explore la création de notebooks, les commandes magiques et les fonctionnalités de collaboration en temps réel. Établit l'interface de développement principale utilisée tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsConcepts fondamentaux d'Apache Spark
Concepts fondamentaux d'Apache Spark
Leçon 1 • Transformations et actions
Distingue les transformations étroites des transformations larges et explique les déclencheurs d'actions. Les étudiants apprennent à raisonner sur les coûts de shuffle et les limites d'exécution.
Leçon 2 • Modèle d'exécution distribuée de Spark
Explique les RDD, DAG, étapes et tâches dans le moteur d'exécution de Spark. Fournit la base conceptuelle pour écrire du code distribué efficace.
Leçon 3 • Fondamentaux de l'API DataFrame
Couvre la création de DataFrames, l'inférence de schéma et les transformations de base. Les étudiants appliquent ces opérations comme interface principale de manipulation des données.
Leçon 4 • Fondamentaux des performances Spark
Présente l'interface utilisateur Spark, les plans d'exécution et les leviers de réglage de base. Équipe les étudiants pour diagnostiquer et résoudre les goulots d'étranglement courants.
Leçon 5 • Spark SQL et catalogue
Enseigne les requêtes SQL sur les DataFrames et le catalogue Spark pour la gestion des métadonnées. Fait le pont entre les connaissances SQL et l'utilisation programmatique de Spark.
Chapitre 3MasquerCacher les détailsVoir les détailsArchitecture et opérations de Delta Lake
Architecture et opérations de Delta Lake
Leçon 1 • Format de stockage de Delta Lake
Explique les fichiers Parquet, le journal de transactions et les points de contrôle qui constituent Delta Lake. Les étudiants comprennent pourquoi Delta apporte de la fiabilité par rapport aux formats de fichiers bruts.
Leçon 2 • Création et gestion des tables Delta
Couvre les DDL pour créer, modifier et supprimer des tables Delta. Établit les compétences de gestion de tables nécessaires pour tout le travail de pipeline à venir.
Leçon 3 • Transactions ACID et concurrence
Enseigne le contrôle de concurrence optimiste, les niveaux d'isolation et la résolution de conflits dans Delta. Les étudiants peuvent concevoir des pipelines qui gèrent en toute sécurité les écritures concurrentes.
Leçon 4 • Techniques d'optimisation de Delta Lake
Couvre OPTIMIZE, le Z-ordering et la compaction de fichiers pour améliorer les performances des requêtes. Les étudiants appliquent ces techniques à des tables Delta de niveau production.
Leçon 5 • Voyage dans le temps et versionnage des données
Montre comment interroger les versions historiques des tables et restaurer les états antérieurs. Permet les modèles d'audit, de rollback et de reproductibilité dans les pipelines de données.
Chapitre 4MasquerCacher les détailsVoir les détailsIngestion de données et modèles ELT
Ingestion de données et modèles ELT
Leçon 1 • Modèles de conception ELT
Présente l'architecture en médaillon et les stratégies de chargement incrémental pour l'ELT structuré. Les étudiants conçoivent des pipelines multi-étapes qui séparent les couches brutes, nettoyées et enrichies.
Leçon 2 • Ingestion par lots à partir de sources courantes
Enseigne la lecture à partir du stockage objet cloud, des bases de données JDBC et des formats de fichiers. Fournit la base d'ingestion pour tous les modèles de pipeline de ce chapitre.
Leçon 3 • Application de la qualité des données lors de l'ingestion
Enseigne la validation basée sur des contraintes, les modèles de quarantaine et les cadres d'attentes. Assure que la qualité des données est appliquée avant que les données n'atteignent les consommateurs en aval.
Leçon 4 • Fondamentaux du streaming structuré
Couvre les DataFrames de streaming, les déclencheurs et les modes de sortie pour le traitement continu des données. Relie les concepts de streaming au récepteur Delta Lake utilisé en production.
Leçon 5 • Auto Loader pour l'ingestion incrémentale
Présente les modes de notification de fichiers et de listage de répertoires d'Auto Loader pour des chargements incrémentaux évolutifs. Les étudiants configurent le checkpointing et l'évolution de schéma d'Auto Loader.
Chapitre 5MasquerCacher les détailsVoir les détailsDelta Live Tables et orchestration de pipelines
Delta Live Tables et orchestration de pipelines
Leçon 1 • Configuration et déploiement de pipelines
Enseigne les paramètres de pipeline, les politiques de cluster et le déploiement via l'interface utilisateur et l'API. Les étudiants configurent des pipelines prêts pour la production avec des paramètres de calcul et de stockage appropriés.
Leçon 2 • Surveillance et dépannage de DLT
Explore le journal des événements, les métriques de l'interface utilisateur du pipeline et les modèles d'échec courants. Les étudiants diagnostiquent et résolvent les problèmes de pipeline à l'aide des outils d'observabilité intégrés.
Leçon 3 • Qualité des données avec les attentes
Couvre les contraintes EXPECT, EXPECT OR DROP et EXPECT OR FAIL dans DLT. Les étudiants intègrent des règles de qualité directement dans les définitions de pipeline pour une application automatisée.
Leçon 4 • Orchestration de pipelines avec les workflows Databricks
Intègre les pipelines DLT dans les workflows Databricks multitâches avec dépendances et planification. Les étudiants construisent des produits de données orchestrés de bout en bout.
Leçon 5 • Concepts fondamentaux de Delta Live Tables
Présente la syntaxe DLT, les tables live, les tables live de streaming et le graphe de pipeline. Établit le paradigme déclaratif qui distingue DLT du code Spark impératif.
Chapitre 6MasquerCacher les détailsVoir les détailsUnity Catalog et gouvernance des données
Unity Catalog et gouvernance des données
Leçon 1 • Gestion des identités et des accès
Couvre les utilisateurs, les groupes, les principaux de service et les octrois de privilèges dans Unity Catalog. Les étudiants mettent en œuvre des modèles d'accès à privilèges minimaux pour les actifs de données.
Leçon 2 • Architecture d'Unity Catalog
Explique le metastore, le catalogue, le schéma et la hiérarchie des tables dans Unity Catalog. Fournit la compréhension structurelle nécessaire pour concevoir des espaces de noms gouvernés.
Leçon 3 • Partage de données avec Delta Sharing
Présente le protocole ouvert Delta Sharing pour le partage de données multiplateforme et inter-organisationnel. Les étudiants publient et consomment des ensembles de données partagés en toute sécurité.
Leçon 4 • Audit et conformité
Enseigne l'accès aux journaux d'audit, l'historique des requêtes et les modèles de reporting de conformité. Les étudiants configurent la surveillance pour satisfaire aux exigences d'audit de l'entreprise.
Leçon 5 • Lignée et découverte des données
Démontre la capture automatique de la lignée et l'explorateur de données pour la découverte des actifs. Les étudiants utilisent la lignée pour retracer le flux de données et soutenir l'analyse d'impact.
Chapitre 7MasquerCacher les détailsVoir les détailsOptimisation et réglage avancés de Spark
Optimisation et réglage avancés de Spark
Leçon 1 • Optimisation basée sur les coûts et statistiques
Couvre ANALYZE TABLE, les statistiques de colonnes et le réordonnancement des jointures par l'optimiseur basé sur les coûts. Les étudiants collectent et exploitent les statistiques pour améliorer la qualité du plan.
Leçon 2 • Gestion de la mémoire et spill
Couvre les régions mémoire de Spark, le dimensionnement des exécuteurs et la détection et l'atténuation des spill. Les étudiants configurent les paramètres mémoire pour éliminer les spill coûteux sur disque.
Leçon 3 • Moteur Photon et exécution vectorisée
Présente le moteur Databricks Photon et ses avantages en matière d'exécution vectorisée. Les étudiants identifient les workloads qui bénéficient le plus de Photon et l'activent de manière appropriée.
Leçon 4 • Stratégies de partitionnement et de shuffle
Enseigne les nombres de partitions optimaux, les compromis entre repartition et coalesce, et le réglage du shuffle. Les étudiants éliminent le skew des données et réduisent la surcharge du shuffle dans les pipelines complexes.
Leçon 5 • Exécution adaptative des requêtes
Explique les ajustements de plan à l'exécution d'AQE pour les jointures, le skew et le coalescing. Les étudiants activent et configurent AQE pour réduire la surcharge de réglage manuel.
Chapitre 8MasquerCacher les détailsVoir les détailsPratiques d'ingénierie des données en production
Pratiques d'ingénierie des données en production
Leçon 1 • Gestion des coûts et FinOps
Couvre l'analyse de la consommation DBU, le dimensionnement correct des clusters et les stratégies d'instances spot. Les étudiants réduisent les coûts de calcul sans sacrifier la fiabilité des pipelines.
Leçon 2 • CI/CD pour les projets Databricks
Enseigne les Databricks Asset Bundles, l'automatisation du déploiement et la promotion entre environnements. Les étudiants mettent en œuvre un pipeline CI/CD complet, du développement à la production.
Leçon 3 • Renforcement de la sécurité et meilleures pratiques
Enseigne l'isolation réseau, la gestion des secrets et le traitement sécurisé des identifiants. Les étudiants appliquent les principes de défense en profondeur pour protéger les actifs de données en production.
Leçon 4 • Test des pipelines de données
Couvre les tests unitaires avec pytest, les stratégies de test d'intégration et la gestion des données de test. Les étudiants construisent une suite de tests qui valide la logique du pipeline avant le déploiement.
Leçon 5 • Observabilité et surveillance des pipelines
Présente les frameworks de journalisation, l'émission de métriques et les alertes pour les pipelines de données. Les étudiants instrumentent les pipelines pour détecter proactivement les échecs et les violations de SLA.
Votre certificat valide de réussite
Ce cours est fait pour vous :
Analystes de données : prêts à passer de l'interrogation des données à l'ingénierie de pipelines fiables.
Développeurs backend : souhaitant faire évoluer leurs compétences en codage vers le domaine des plateformes de données.
Ingénieurs de données juniors : cherchant un parcours structuré vers une expertise Databricks de niveau production.
Développeurs BI : voulant moderniser leur travail ETL à l'aide d'outils natifs du lakehouse.
Ingénieurs DevOps : élargissant leur périmètre pour inclure l'infrastructure de données et l'automatisation des pipelines.
Étudiants diplômés : développant des compétences en ingénierie de données prêtes à l'emploi avant d'entrer sur le marché du travail.
Cours associés
FAQ
Qui est Dedika ?
Le certificat est-il valable en France ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF



















