Choisissez votre langue
Formation Data Engineering avec Databricks
Plus de 2 millions d'apprenants dans le monde

Formation Data Engineering avec Databricks

Maîtrisez l'ensemble du stack d'ingénierie des données Databricks — des fondamentaux d'Apache Spark et de l'architecture Delta Lake à l'orchestration de pipelines de niveau production et à la gouvernance d'entreprise. Ce cours vous équipe des compétences pratiques pour concevoir, optimiser et exploiter des plateformes de données fiables et évolutives. Que vous débutiez dans l'ingénierie des données ou que vous perfectionniez votre expertise du lakehouse, il s'agit de la formation Databricks de référence.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Configurez et gérez les clusters, les espaces de travail et les ressources de calcul Databricks de manière efficace.

  • Construisez des pipelines ELT évolutifs à l'aide d'Auto Loader, de Structured Streaming et d'architecture en médaillon.

  • Implémentez des tables Delta Lake avec des transactions ACID, le voyage dans le temps et l'évolution du schéma.

  • Créez des pipelines déclaratifs auto-réparateurs avec Delta Live Tables et des exigences de qualité.

  • Appliquez des techniques avancées d'optimisation Spark, notamment AQE, les stratégies de partitionnement et le moteur Photon.

  • Appliquez la gouvernance des données d'entreprise, le contrôle d'accès et le suivi de la lignée à l'aide d'Unity Catalog.

Comment vous étudiez de façon pratique Formation Data Engineering avec Databricks

Comment vous pratiquez Formation Data Engineering avec Databricks

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations de la plateforme Databricks

  • Leçon 1 • Configuration et gestion des clusters

    Enseigne la création de clusters, le dimensionnement, l'autoscaling et les politiques de terminaison. Les apprenants obtiennent le contrôle sur les coûts de calcul et les performances dès le départ.

  • Leçon 2 • Présentation de l'architecture Databricks

    Couvre le plan de contrôle, le plan de données et l'architecture des clusters qui sous-tendent Databricks. Ancre toute utilisation ultérieure de la plateforme dans un modèle mental clair.

  • Leçon 3 • Navigation et configuration dans l'espace de travail

    Présente l'interface utilisateur Databricks, la structure des dossiers et les paramètres utilisateur. Permet aux apprenants d'organiser les projets et de gérer efficacement les environnements personnels.

  • Leçon 4 • Notions de base de la CLI Databricks et de l'API REST

    Présente l'accès programmatique à la plateforme via la CLI et l'API REST. Prépare les apprenants aux tâches d'automatisation couvertes dans les chapitres suivants.

  • Leçon 5 • Notebooks et développement collaboratif

    Explore la création de notebooks, les commandes magiques et les fonctionnalités de collaboration en temps réel. Établit l'interface de développement principale utilisée tout au long du cours.

Chapitre 2Voir les détails

Concepts fondamentaux d'Apache Spark

  • Leçon 1 • Transformations et actions

    Distingue les transformations étroites des transformations larges et explique les déclencheurs d'action. Les apprenants apprennent à raisonner sur les coûts de shuffle et les limites d'exécution.

  • Leçon 2 • Modèle d'exécution distribué de Spark

    Explique les RDD, les DAG, les étages et les tâches au sein du moteur d'exécution de Spark. Fournit la base conceptuelle pour écrire du code distribué efficace.

  • Leçon 3 • Fondamentaux de l'API DataFrame

    Couvre la création de DataFrames, l'inférence de schéma et les transformations principales. Les apprenants appliquent ces opérations comme interface principale de manipulation des données.

  • Leçon 4 • Fondamentaux des performances Spark

    Présente l'interface utilisateur Spark, les plans d'exécution et les leviers de réglage de base. Équipe les apprenants pour diagnostiquer et résoudre les goulots d'étranglement de performance courants.

  • Leçon 5 • Spark SQL et catalogue

    Enseigne les requêtes SQL sur les DataFrames et le catalogue Spark pour la gestion des métadonnées. Fait le pont entre les connaissances SQL et l'utilisation programmatique de Spark.

Chapitre 3Voir les détails

Architecture et opérations de Delta Lake

  • Leçon 1 • Format de stockage de Delta Lake

    Explique les fichiers Parquet, le journal des transactions et les fichiers de point de contrôle qui forment Delta Lake. Les apprenants comprennent pourquoi Delta offre une fiabilité par rapport aux formats de fichiers bruts.

  • Leçon 2 • Création et gestion des tables Delta

    Couvre le DDL pour créer, modifier et supprimer des tables Delta. Établit les compétences de gestion des tables requises pour tout le travail de pipeline à venir.

  • Leçon 3 • Transactions ACID et concurrence

    Enseigne le contrôle de concurrence optimiste, les niveaux d'isolation et la résolution de conflits dans Delta. Les apprenants peuvent concevoir des pipelines qui gèrent en toute sécurité les écritures concurrentes.

  • Leçon 4 • Techniques d'optimisation de Delta Lake

    Couvre OPTIMIZE, le Z-ordering et la compaction de fichiers pour améliorer les performances des requêtes. Les apprenants appliquent ces techniques aux tables Delta de qualité production.

  • Leçon 5 • Voyage dans le temps et versionnage des données

    Démontre l'interrogation des versions historiques des tables et la restauration des états antérieurs. Permet les motifs d'audit, de retour en arrière et de reproductibilité dans les pipelines de données.

Chapitre 4Voir les détails

Ingestion de données et motifs ELT

  • Leçon 1 • Motifs de conception ELT

    Présente l'architecture médaillon et les stratégies de chargement incrémental pour l'ELT structuré. Les apprenants conçoivent des pipelines multi-sauts qui séparent les couches brutes, nettoyées et organisées.

  • Leçon 2 • Ingestion par lots à partir de sources courantes

    Enseigne la lecture à partir du stockage objet dans le cloud, des bases de données JDBC et des formats de fichiers. Fournit la base d'ingestion pour tous les motifs de pipeline de ce chapitre.

  • Leçon 3 • Application de la qualité des données lors de l'ingestion

    Enseigne la validation basée sur des contraintes, les motifs de quarantaine et les cadres d'attentes. Garantit que la qualité des données est appliquée avant que les données n'atteignent les consommateurs en aval.

  • Leçon 4 • Fondamentaux du streaming structuré

    Couvre les DataFrames en streaming, les déclencheurs et les modes de sortie pour le traitement continu des données. Relie les concepts de streaming au récepteur Delta Lake utilisé en production.

  • Leçon 5 • Auto Loader pour l'ingestion incrémentale

    Présente les modes de notification de fichiers et de listage de répertoires d'Auto Loader pour des charges incrémentales évolutives. Les apprenants configurent le point de contrôle et l'évolution du schéma d'Auto Loader.

Chapitre 5Voir les détails

Delta Live Tables et orchestration de pipelines

  • Leçon 1 • Configuration et déploiement des pipelines

    Enseigne les paramètres de pipeline, les politiques de cluster et le déploiement via l'interface utilisateur et l'API. Les apprenants configurent des pipelines prêts pour la production avec des paramètres de calcul et de stockage appropriés.

  • Leçon 2 • Surveillance et dépannage de DLT

    Explore le journal des événements, les métriques de l'interface utilisateur du pipeline et les motifs d'échec courants. Les apprenants diagnostiquent et résolvent les problèmes de pipeline à l'aide d'outils d'observabilité intégrés.

  • Leçon 3 • Qualité des données avec les attentes

    Couvre les contraintes EXPECT, EXPECT OR DROP et EXPECT OR FAIL dans DLT. Les apprenants intègrent des règles de qualité directement dans les définitions de pipeline pour une application automatisée.

  • Leçon 4 • Orchestration de pipelines avec Databricks Workflows

    Intègre les pipelines DLT dans les Databricks Workflows multi-tâches avec des dépendances et une planification. Les apprenants construisent des produits de données orchestrés de bout en bout.

  • Leçon 5 • Concepts fondamentaux de Delta Live Tables

    Présente la syntaxe DLT, les live tables, les streaming live tables et le graphe du pipeline. Établit le paradigme déclaratif qui distingue DLT du code Spark impératif.

Chapitre 6Voir les détails

Unity Catalog et gouvernance des données

  • Leçon 1 • Gestion des identités et des accès

    Couvre les utilisateurs, les groupes, les principaux de service et les octrois de privilèges dans Unity Catalog. Les apprenants mettent en œuvre des modèles d'accès avec le moindre privilège pour les actifs de données.

  • Leçon 2 • Architecture d'Unity Catalog

    Explique la hiérarchie metastore, catalogue, schéma et table dans Unity Catalog. Fournit la compréhension structurelle nécessaire pour concevoir des espaces de noms gouvernés.

  • Leçon 3 • Partage de données avec Delta Sharing

    Présente le protocole ouvert Delta Sharing pour le partage de données multiplateforme et inter-organisationnel. Les apprenants publient et consomment des ensembles de données partagés de manière sécurisée.

  • Leçon 4 • Audit et conformité

    Enseigne l'accès aux journaux d'audit, l'historique des requêtes et les motifs de reporting de conformité. Les apprenants configurent la surveillance pour satisfaire aux exigences d'audit de l'entreprise.

  • Leçon 5 • Lignée et découverte des données

    Démontre la capture automatique de la lignée et l'explorateur de données pour la découverte des actifs. Les apprenants utilisent la lignée pour tracer le flux de données et soutenir l'analyse d'impact.

Chapitre 7Voir les détails

Optimisation et réglage avancés de Spark

  • Leçon 1 • Optimisation basée sur les coûts et statistiques

    Couvre ANALYZE TABLE, les statistiques de colonne et le réordonnancement des jointures par l'optimiseur basé sur les coûts. Les apprenants collectent et exploitent les statistiques pour améliorer la qualité des plans.

  • Leçon 2 • Gestion de la mémoire et spill

    Couvre les régions mémoire de Spark, le dimensionnement des exécuteurs, ainsi que la détection et l'atténuation du spill. Les apprenants configurent les paramètres mémoire pour éliminer le spill coûteux sur disque.

  • Leçon 3 • Moteur Photon et exécution vectorisée

    Présente le moteur Databricks Photon et ses avantages d'exécution vectorisée. Les apprenants identifient les charges de travail qui bénéficient le plus de Photon et l'activent de manière appropriée.

  • Leçon 4 • Stratégies de partitionnement et de shuffle

    Enseigne les nombres de partitions optimaux, repartition vs coalesce et le réglage du shuffle. Les apprenants éliminent l'asymétrie des données et réduisent la surcharge de shuffle dans les pipelines complexes.

  • Leçon 5 • Exécution adaptative des requêtes

    Explique les ajustements de plan à l'exécution d'AQE pour les jointures, l'asymétrie et le coalescing. Les apprenants activent et configurent AQE pour réduire la surcharge de réglage manuel.

Chapitre 8Voir les détails

Pratiques d'ingénierie des données en production

  • Leçon 1 • Gestion des coûts et FinOps

    Couvre l'analyse de la consommation DBU, le dimensionnement correct des clusters et les stratégies d'instances ponctuelles. Les apprenants réduisent les coûts de calcul sans sacrifier la fiabilité du pipeline.

  • Leçon 2 • CI/CD pour les projets Databricks

    Enseigne les Databricks Asset Bundles, l'automatisation du déploiement et la promotion d'environnement. Les apprenants mettent en œuvre un pipeline CI/CD complet du développement à la production.

  • Leçon 3 • Renforcement de la sécurité et bonnes pratiques

    Enseigne l'isolation réseau, la gestion des secrets et la gestion sécurisée des identifiants. Les apprenants appliquent les principes de défense en profondeur pour protéger les actifs de données en production.

  • Leçon 4 • Test des pipelines de données

    Couvre les tests unitaires avec pytest, les stratégies de test d'intégration et la gestion des données de test. Les apprenants construisent une suite de tests qui valide la logique du pipeline avant le déploiement.

  • Leçon 5 • Observabilité et surveillance des pipelines

    Présente les cadres de journalisation, l'émission de métriques et l'alerte pour les pipelines de données. Les apprenants instrumentent les pipelines pour détecter de manière proactive les échecs et les violations des SLA.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analystes de données : prêts à passer de l'interrogation des données à l'ingénierie de pipelines fiables.

  • Développeurs back-end : cherchant à faire pivoter leurs compétences en codage vers le domaine des plateformes de données.

  • Ingénieurs de données juniors : recherchant un parcours structuré vers une expertise Databricks de niveau production.

  • Développeurs BI : souhaitant moderniser leur travail ETL à l'aide d'outils natifs du lac de données.

  • Ingénieurs DevOps : élargissant leur périmètre pour inclure l'infrastructure de données et l'automatisation des pipelines.

  • Étudiants diplômés : développant des compétences en ingénierie de données prêtes à l'emploi avant d'entrer sur le marché du travail.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en Côte d’Ivoire ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF