Choisissez votre langue
Formation Data Engineering avec Databricks
Plus de 2 millions d'apprenants dans le monde

Formation Data Engineering avec Databricks

Maîtrisez l'ensemble de la pile d'ingénierie de données Databricks — des fondamentaux d'Apache Spark et de l'architecture Delta Lake à l'orchestration de pipelines de qualité production et à la gouvernance d'entreprise. Ce cours vous dote des compétences pratiques pour concevoir, optimiser et exploiter des plateformes de données fiables et évolutives. Que vous débutiez dans l'ingénierie de données ou que vous perfectionniez votre expertise en lakehouse, il s'agit de la formation Databricks de référence.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Configurez et gérez efficacement les clusters, les espaces de travail et les ressources de calcul Databricks.

  • Construisez des pipelines ELT évolutifs à l'aide d'Auto Loader, Structured Streaming et de l'architecture en médaillon.

  • Mettez en œuvre des tables Delta Lake avec des transactions ACID, le voyage dans le temps et l'évolution de schéma.

  • Créez des pipelines déclaratifs et auto-réparants avec Delta Live Tables et des attentes de qualité.

  • Appliquez des techniques avancées d'optimisation Spark, notamment AQE, les stratégies de partitionnement et le moteur Photon.

  • Appliquez la gouvernance des données d'entreprise, le contrôle d'accès et le suivi de la lignée à l'aide d'Unity Catalog.

Comment vous étudiez de façon pratique Formation Data Engineering avec Databricks

Comment vous pratiquez Formation Data Engineering avec Databricks

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations de la Plateforme Databricks

  • Leçon 1 • Configuration et Gestion des Clusters

    Enseigne la création de clusters, le dimensionnement, l'autoscaling et les politiques de terminaison. Les participants obtiennent le contrôle des coûts de calcul et des performances dès le départ.

  • Leçon 2 • Présentation de l'Architecture Databricks

    Couvre le plan de contrôle, le plan de données et l'architecture des clusters qui sous-tendent Databricks. Ancre toute l'utilisation ultérieure de la plateforme dans un modèle mental clair.

  • Leçon 3 • Navigation et Configuration dans l'Espace de Travail

    Présente l'interface utilisateur Databricks, la structure des dossiers et les paramètres utilisateur. Permet aux participants d'organiser des projets et de gérer efficacement leurs environnements personnels.

  • Leçon 4 • Fondamentaux de la CLI et de l'API REST Databricks

    Présente l'accès programmatique à la plateforme via la CLI et l'API REST. Prépare les participants aux tâches d'automatisation couvertes dans les chapitres suivants.

  • Leçon 5 • Notebooks et Développement Collaboratif

    Explore la création de notebooks, les commandes magiques et les fonctionnalités de collaboration en temps réel. Établit l'interface de développement principale utilisée tout au long du cours.

Chapitre 2Voir les détails

Concepts Fondamentaux d'Apache Spark

  • Leçon 1 • Transformations et Actions

    Distingue les transformations étroites des transformations larges et explique les déclencheurs d'action. Les participants apprennent à raisonner sur les coûts de shuffle et les limites d'exécution.

  • Leçon 2 • Modèle d'Exécution Distribuée de Spark

    Explique les RDD, les DAG, les étages et les tâches au sein du moteur d'exécution de Spark. Fournit la base conceptuelle pour écrire du code distribué efficace.

  • Leçon 3 • Fondamentaux de l'API DataFrame

    Couvre la création de DataFrames, l'inférence de schéma et les transformations fondamentales. Les participants appliquent ces opérations comme interface principale de manipulation de données.

  • Leçon 4 • Fondamentaux des Performances Spark

    Présente l'interface utilisateur Spark, les plans d'exécution et les leviers de réglage de base. Équipe les participants pour diagnostiquer et traiter les goulots d'étranglement de performance courants.

  • Leçon 5 • Spark SQL et Catalogue

    Enseigne les requêtes SQL sur les DataFrames et le catalogue Spark pour la gestion des métadonnées. Fait le pont entre les connaissances SQL et l'utilisation programmatique de Spark.

Chapitre 3Voir les détails

Architecture et Opérations Delta Lake

  • Leçon 1 • Format de Stockage Delta Lake

    Explique les fichiers Parquet, le journal des transactions et les fichiers de point de contrôle qui forment Delta Lake. Les participants comprennent pourquoi Delta offre une fiabilité par rapport aux formats de fichiers bruts.

  • Leçon 2 • Création et Gestion des Tables Delta

    Couvre le DDL pour créer, modifier et supprimer des tables Delta. Établit les compétences de gestion de tables requises pour tout le travail de pipeline à venir.

  • Leçon 3 • Transactions ACID et Concurrence

    Enseigne le contrôle de concurrence optimiste, les niveaux d'isolation et la résolution de conflits dans Delta. Les participants peuvent concevoir des pipelines qui gèrent en toute sécurité les écritures concurrentes.

  • Leçon 4 • Techniques d'Optimisation Delta Lake

    Couvre OPTIMIZE, le Z-ordering et la compaction de fichiers pour améliorer les performances des requêtes. Les participants appliquent ces techniques à des tables Delta de qualité production.

  • Leçon 5 • Voyage dans le Temps et Gestion de Versions des Données

    Démontre l'interrogation des versions historiques de tables et la restauration d'états antérieurs. Permet les modèles d'audit, de restauration et de reproductibilité dans les pipelines de données.

Chapitre 4Voir les détails

Ingestion de Données et Modèles ELT

  • Leçon 1 • Modèles de Conception ELT

    Présente l'architecture médaillon et les stratégies de chargement incrémental pour l'ELT structuré. Les participants conçoivent des pipelines multi-sauts qui séparent les couches brutes, nettoyées et organisées.

  • Leçon 2 • Ingestion par Lots à partir de Sources Courantes

    Enseigne la lecture à partir du stockage objet dans le cloud, des bases de données JDBC et des formats de fichiers. Fournit la base d'ingestion pour tous les modèles de pipeline de ce chapitre.

  • Leçon 3 • Application de la Qualité des Données à l'Ingestion

    Enseigne la validation basée sur des contraintes, les modèles de quarantaine et les frameworks d'attentes. Assure que la qualité des données est appliquée avant que les données n'atteignent les consommateurs en aval.

  • Leçon 4 • Fondamentaux du Structured Streaming

    Couvre les DataFrames en continu, les déclencheurs et les modes de sortie pour le traitement continu des données. Relie les concepts de streaming au sink Delta Lake utilisé en production.

  • Leçon 5 • Auto Loader pour l'Ingestion Incrémentale

    Présente les modes de notification de fichier et de listage de répertoires d'Auto Loader pour des charges incrémentales évolutives. Les participants configurent le point de contrôle et l'évolution de schéma d'Auto Loader.

Chapitre 5Voir les détails

Delta Live Tables et Orchestration de Pipelines

  • Leçon 1 • Configuration et Déploiement du Pipeline

    Enseigne les paramètres de pipeline, les politiques de cluster et le déploiement via l'interface utilisateur et l'API. Les participants configurent des pipelines prêts pour la production avec des paramètres de calcul et de stockage appropriés.

  • Leçon 2 • Surveillance et Dépannage des DLT

    Explore le journal des événements, les métriques de l'interface utilisateur du pipeline et les modèles d'échec courants. Les participants diagnostiquent et résolvent les problèmes de pipeline à l'aide d'outils d'observabilité intégrés.

  • Leçon 3 • Qualité des Données avec les Attentes

    Couvre les contraintes EXPECT, EXPECT OR DROP et EXPECT OR FAIL dans DLT. Les participants intègrent des règles de qualité directement dans les définitions de pipeline pour une application automatisée.

  • Leçon 4 • Orchestration des Pipelines avec les Workflows Databricks

    Intègre les pipelines DLT dans les Workflows Databricks multi-tâches avec des dépendances et une planification. Les participants construisent des produits de données orchestrés de bout en bout.

  • Leçon 5 • Concepts fondamentaux des Tables Delta Live

    Présente la syntaxe DLT, les live tables, les streaming live tables et le graphe du pipeline. Établit le paradigme déclaratif qui distingue DLT du code Spark impératif.

Chapitre 6Voir les détails

Unity Catalog et Gouvernance des Données

  • Leçon 1 • Gestion des Identités et des Accès

    Couvre les utilisateurs, les groupes, les principaux de service et les octrois de privilèges dans Unity Catalog. Les participants implémentent des modèles d'accès au moindre privilège pour les actifs de données.

  • Leçon 2 • Architecture Unity Catalog

    Explique la hiérarchie metastore, catalogue, schéma et table dans Unity Catalog. Fournit la compréhension structurelle nécessaire pour concevoir des espaces de noms gouvernés.

  • Leçon 3 • Partage de Données avec Delta Sharing

    Présente le protocole ouvert Delta Sharing pour le partage de données multiplateforme et inter-organisationnel. Les participants publient et consomment des ensembles de données partagés en toute sécurité.

  • Leçon 4 • Audit et Conformité

    Enseigne l'accès au journal d'audit, l'historique des requêtes et les modèles de reporting de conformité. Les participants configurent la surveillance pour répondre aux exigences d'audit de l'entreprise.

  • Leçon 5 • Lignée et Découverte des Données

    Démontre la capture automatique de lignée et l'explorateur de données pour la découverte d'actifs. Les participants utilisent la lignée pour tracer le flux de données et soutenir l'analyse d'impact.

Chapitre 7Voir les détails

Optimisation et Réglage Avancés de Spark

  • Leçon 1 • Optimisation Basée sur les Coûts et Statistiques

    Couvre ANALYZE TABLE, les statistiques de colonnes et le réordonnancement de jointure de l'optimiseur basé sur les coûts. Les participants collectent et exploitent les statistiques pour améliorer la qualité des plans.

  • Leçon 2 • Gestion de la Mémoire et Spill

    Couvre les régions mémoire de Spark, le dimensionnement des exécuteurs et la détection et l'atténuation du spill. Les participants configurent les paramètres mémoire pour éliminer le spill coûteux sur disque.

  • Leçon 3 • Moteur Photon et Exécution Vectorisée

    Présente le moteur Databricks Photon et ses avantages d'exécution vectorisée. Les participants identifient les charges de travail qui bénéficient le plus de Photon et l'activent de manière appropriée.

  • Leçon 4 • Stratégies de Partitionnement et de Shuffle

    Enseigne les nombres de partitions optimaux, le repartition vs. coalesce et le réglage du shuffle. Les participants éliminent le déséquilibre des données et réduisent la surcharge de shuffle dans les pipelines complexes.

  • Leçon 5 • Exécution Adaptative de Requêtes

    Explique les ajustements de plan à l'exécution de l'AQE pour les jointures, le déséquilibre et le coalescing. Les participants activent et configurent l'AQE pour réduire la charge de réglage manuel.

Chapitre 8Voir les détails

Pratiques de Génie des Données en Production

  • Leçon 1 • Gestion des Coûts et FinOps

    Couvre l'analyse de la consommation DBU, le dimensionnement correct des clusters et les stratégies d'instances spot. Les participants réduisent les coûts de calcul sans sacrifier la fiabilité des pipelines.

  • Leçon 2 • CI/CD pour les Projets Databricks

    Enseigne les Databricks Asset Bundles, l'automatisation du déploiement et la promotion d'environnement. Les participants implémentent un pipeline CI/CD complet du développement à la production.

  • Leçon 3 • Renforcement de la Sécurité et Bonnes Pratiques

    Enseigne l'isolation réseau, la gestion des secrets et la gestion sécurisée des identifiants. Les participants appliquent des principes de défense en profondeur pour protéger les actifs de données en production.

  • Leçon 4 • Test des Pipelines de Données

    Couvre les tests unitaires avec pytest, les stratégies de tests d'intégration et la gestion des données de test. Les participants construisent une suite de tests qui valide la logique du pipeline avant le déploiement.

  • Leçon 5 • Observabilité et Surveillance des Pipelines

    Présente les frameworks de journalisation, l'émission de métriques et l'alerting pour les pipelines de données. Les participants instrumentent les pipelines pour détecter proactivement les échecs et les violations de SLA.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analystes de données : prêts à passer de l'interrogation des données à la conception de pipelines fiables.

  • Développeurs back-end : cherchant à faire pivoter leurs compétences en codage vers l'espace des plateformes de données.

  • Ingénieurs de données juniors : recherchant un parcours structuré vers une expertise Databricks de niveau production.

  • Développeurs BI : souhaitant moderniser leur travail ETL à l'aide d'outils natifs du lakehouse.

  • Ingénieurs DevOps : élargissant leur périmètre pour inclure l'infrastructure de données et l'automatisation des pipelines.

  • Étudiants diplômés : développant des compétences en ingénierie de données prêtes à l'emploi avant d'entrer sur le marché du travail.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Cameroun ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF