Choisissez votre langue
Formation Data Engineering avec Databricks
+ de 400 000 professionnels sur la plateforme
Exclusif aux entreprises

Formation Data Engineering avec Databricks

Maîtrisez l'ensemble de la pile d'ingénierie de données Databricks – des fondamentaux d'Apache Spark et de l'architecture Delta Lake à l'orchestration de pipelines de niveau production et à la gouvernance d'entreprise. Ce cours vous dote des compétences pratiques nécessaires pour concevoir, optimiser et exploiter des plateformes de données fiables et évolutives. Que vous débutiez dans l'ingénierie des données ou que vous souhaitiez perfectionner votre expertise du lakehouse, il s'agit de la formation Databricks de référence.

Dedika pour les apprenants

Ce que votre équipe va maîtriser:

  • Configurez et gérez efficacement les clusters, espaces de travail et ressources de calcul Databricks.

  • Créez des pipelines ELT évolutifs à l'aide d'Auto Loader, Structured Streaming et de l'architecture en médaillon.

  • Implémentez des tables Delta Lake avec des transactions ACID, le voyage dans le temps et l'évolution du schéma.

  • Créez des pipelines déclaratifs et auto-cicatrisants avec Delta Live Tables et des attentes de qualité.

  • Appliquez des techniques avancées d'optimisation Spark, notamment AQE, des stratégies de partitionnement et le moteur Photon.

  • Appliquez la gouvernance d'entreprise des données, le contrôle d'accès et le suivi de la traçabilité à l'aide d'Unity Catalog.

Comment votre équipe apprend de façon pratique Formation Data Engineering avec Databricks

Comment votre équipe s’exerce Formation Data Engineering avec Databricks

Des professionnels de ces entreprises apprennent sur Dedika

ActemiumFR
Nunner LogisticsNL
GT Constructora GeotécnicaCR
Sydel StarBR
Metrô de São PauloBR
Aguas AndinasCL
DSMIN
MeridianbetRS
CDHCN

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations de la plateforme Databricks

  • Leçon 1 • Configuration et gestion des clusters

    Enseigne la création, le dimensionnement, l'auto-scaling et les règles d'arrêt des clusters. Les étudiants obtiennent un contrôle sur les coûts de calcul et les performances dès le départ.

  • Leçon 2 • Présentation de l'architecture Databricks

    Couvre le plan de contrôle, le plan de données et l'architecture de cluster qui sous-tendent Databricks. Ancre toute l'utilisation ultérieure de la plateforme dans un modèle mental clair.

  • Leçon 3 • Navigation et configuration de l'espace de travail

    Présente l'interface utilisateur Databricks, la structure des dossiers et les paramètres utilisateur. Permet aux étudiants d'organiser leurs projets et de gérer efficacement leurs environnements personnels.

  • Leçon 4 • Bases de la CLI et de l'API REST Databricks

    Présente l'accès programmatique à la plateforme via la CLI et l'API REST. Prépare les étudiants aux tâches d'automatisation couvertes dans les chapitres suivants.

  • Leçon 5 • Notebooks et développement collaboratif

    Explore la création de notebooks, les commandes magiques et les fonctionnalités de collaboration en temps réel. Établit l'interface de développement principale utilisée tout au long du cours.

Chapitre 2Voir les détails

Concepts fondamentaux d'Apache Spark

  • Leçon 1 • Transformations et actions

    Distingue les transformations étroites des transformations larges et explique les déclencheurs d'actions. Les étudiants apprennent à raisonner sur les coûts de shuffle et les limites d'exécution.

  • Leçon 2 • Modèle d'exécution distribuée de Spark

    Explique les RDD, DAG, étapes et tâches dans le moteur d'exécution de Spark. Fournit la base conceptuelle pour écrire du code distribué efficace.

  • Leçon 3 • Fondamentaux de l'API DataFrame

    Couvre la création de DataFrames, l'inférence de schéma et les transformations de base. Les étudiants appliquent ces opérations comme interface principale de manipulation des données.

  • Leçon 4 • Fondamentaux des performances Spark

    Présente l'interface utilisateur Spark, les plans d'exécution et les leviers de réglage de base. Équipe les étudiants pour diagnostiquer et résoudre les goulots d'étranglement courants.

  • Leçon 5 • Spark SQL et catalogue

    Enseigne les requêtes SQL sur les DataFrames et le catalogue Spark pour la gestion des métadonnées. Fait le pont entre les connaissances SQL et l'utilisation programmatique de Spark.

Chapitre 3Voir les détails

Architecture et opérations de Delta Lake

  • Leçon 1 • Format de stockage de Delta Lake

    Explique les fichiers Parquet, le journal de transactions et les points de contrôle qui constituent Delta Lake. Les étudiants comprennent pourquoi Delta apporte de la fiabilité par rapport aux formats de fichiers bruts.

  • Leçon 2 • Création et gestion des tables Delta

    Couvre les DDL pour créer, modifier et supprimer des tables Delta. Établit les compétences de gestion de tables nécessaires pour tout le travail de pipeline à venir.

  • Leçon 3 • Transactions ACID et concurrence

    Enseigne le contrôle de concurrence optimiste, les niveaux d'isolation et la résolution de conflits dans Delta. Les étudiants peuvent concevoir des pipelines qui gèrent en toute sécurité les écritures concurrentes.

  • Leçon 4 • Techniques d'optimisation de Delta Lake

    Couvre OPTIMIZE, le Z-ordering et la compaction de fichiers pour améliorer les performances des requêtes. Les étudiants appliquent ces techniques à des tables Delta de niveau production.

  • Leçon 5 • Voyage dans le temps et versionnage des données

    Montre comment interroger les versions historiques des tables et restaurer les états antérieurs. Permet les modèles d'audit, de rollback et de reproductibilité dans les pipelines de données.

Chapitre 4Voir les détails

Ingestion de données et modèles ELT

  • Leçon 1 • Modèles de conception ELT

    Présente l'architecture en médaillon et les stratégies de chargement incrémental pour l'ELT structuré. Les étudiants conçoivent des pipelines multi-étapes qui séparent les couches brutes, nettoyées et enrichies.

  • Leçon 2 • Ingestion par lots à partir de sources courantes

    Enseigne la lecture à partir du stockage objet cloud, des bases de données JDBC et des formats de fichiers. Fournit la base d'ingestion pour tous les modèles de pipeline de ce chapitre.

  • Leçon 3 • Application de la qualité des données lors de l'ingestion

    Enseigne la validation basée sur des contraintes, les modèles de quarantaine et les cadres d'attentes. Assure que la qualité des données est appliquée avant que les données n'atteignent les consommateurs en aval.

  • Leçon 4 • Fondamentaux du streaming structuré

    Couvre les DataFrames de streaming, les déclencheurs et les modes de sortie pour le traitement continu des données. Relie les concepts de streaming au récepteur Delta Lake utilisé en production.

  • Leçon 5 • Auto Loader pour l'ingestion incrémentale

    Présente les modes de notification de fichiers et de listage de répertoires d'Auto Loader pour des chargements incrémentaux évolutifs. Les étudiants configurent le checkpointing et l'évolution de schéma d'Auto Loader.

Chapitre 5Voir les détails

Delta Live Tables et orchestration de pipelines

  • Leçon 1 • Configuration et déploiement de pipelines

    Enseigne les paramètres de pipeline, les politiques de cluster et le déploiement via l'interface utilisateur et l'API. Les étudiants configurent des pipelines prêts pour la production avec des paramètres de calcul et de stockage appropriés.

  • Leçon 2 • Surveillance et dépannage de DLT

    Explore le journal des événements, les métriques de l'interface utilisateur du pipeline et les modèles d'échec courants. Les étudiants diagnostiquent et résolvent les problèmes de pipeline à l'aide des outils d'observabilité intégrés.

  • Leçon 3 • Qualité des données avec les attentes

    Couvre les contraintes EXPECT, EXPECT OR DROP et EXPECT OR FAIL dans DLT. Les étudiants intègrent des règles de qualité directement dans les définitions de pipeline pour une application automatisée.

  • Leçon 4 • Orchestration de pipelines avec les workflows Databricks

    Intègre les pipelines DLT dans les workflows Databricks multitâches avec dépendances et planification. Les étudiants construisent des produits de données orchestrés de bout en bout.

  • Leçon 5 • Concepts fondamentaux de Delta Live Tables

    Présente la syntaxe DLT, les tables live, les tables live de streaming et le graphe de pipeline. Établit le paradigme déclaratif qui distingue DLT du code Spark impératif.

Chapitre 6Voir les détails

Unity Catalog et gouvernance des données

  • Leçon 1 • Gestion des identités et des accès

    Couvre les utilisateurs, les groupes, les principaux de service et les octrois de privilèges dans Unity Catalog. Les étudiants mettent en œuvre des modèles d'accès à privilèges minimaux pour les actifs de données.

  • Leçon 2 • Architecture d'Unity Catalog

    Explique le metastore, le catalogue, le schéma et la hiérarchie des tables dans Unity Catalog. Fournit la compréhension structurelle nécessaire pour concevoir des espaces de noms gouvernés.

  • Leçon 3 • Partage de données avec Delta Sharing

    Présente le protocole ouvert Delta Sharing pour le partage de données multiplateforme et inter-organisationnel. Les étudiants publient et consomment des ensembles de données partagés en toute sécurité.

  • Leçon 4 • Audit et conformité

    Enseigne l'accès aux journaux d'audit, l'historique des requêtes et les modèles de reporting de conformité. Les étudiants configurent la surveillance pour satisfaire aux exigences d'audit de l'entreprise.

  • Leçon 5 • Lignée et découverte des données

    Démontre la capture automatique de la lignée et l'explorateur de données pour la découverte des actifs. Les étudiants utilisent la lignée pour retracer le flux de données et soutenir l'analyse d'impact.

Chapitre 7Voir les détails

Optimisation et réglage avancés de Spark

  • Leçon 1 • Optimisation basée sur les coûts et statistiques

    Couvre ANALYZE TABLE, les statistiques de colonnes et le réordonnancement des jointures par l'optimiseur basé sur les coûts. Les étudiants collectent et exploitent les statistiques pour améliorer la qualité du plan.

  • Leçon 2 • Gestion de la mémoire et spill

    Couvre les régions mémoire de Spark, le dimensionnement des exécuteurs et la détection et l'atténuation des spill. Les étudiants configurent les paramètres mémoire pour éliminer les spill coûteux sur disque.

  • Leçon 3 • Moteur Photon et exécution vectorisée

    Présente le moteur Databricks Photon et ses avantages en matière d'exécution vectorisée. Les étudiants identifient les workloads qui bénéficient le plus de Photon et l'activent de manière appropriée.

  • Leçon 4 • Stratégies de partitionnement et de shuffle

    Enseigne les nombres de partitions optimaux, les compromis entre repartition et coalesce, et le réglage du shuffle. Les étudiants éliminent le skew des données et réduisent la surcharge du shuffle dans les pipelines complexes.

  • Leçon 5 • Exécution adaptative des requêtes

    Explique les ajustements de plan à l'exécution d'AQE pour les jointures, le skew et le coalescing. Les étudiants activent et configurent AQE pour réduire la surcharge de réglage manuel.

Chapitre 8Voir les détails

Pratiques d'ingénierie des données en production

  • Leçon 1 • Gestion des coûts et FinOps

    Couvre l'analyse de la consommation DBU, le dimensionnement correct des clusters et les stratégies d'instances spot. Les étudiants réduisent les coûts de calcul sans sacrifier la fiabilité des pipelines.

  • Leçon 2 • CI/CD pour les projets Databricks

    Enseigne les Databricks Asset Bundles, l'automatisation du déploiement et la promotion entre environnements. Les étudiants mettent en œuvre un pipeline CI/CD complet, du développement à la production.

  • Leçon 3 • Renforcement de la sécurité et meilleures pratiques

    Enseigne l'isolation réseau, la gestion des secrets et le traitement sécurisé des identifiants. Les étudiants appliquent les principes de défense en profondeur pour protéger les actifs de données en production.

  • Leçon 4 • Test des pipelines de données

    Couvre les tests unitaires avec pytest, les stratégies de test d'intégration et la gestion des données de test. Les étudiants construisent une suite de tests qui valide la logique du pipeline avant le déploiement.

  • Leçon 5 • Observabilité et surveillance des pipelines

    Présente les frameworks de journalisation, l'émission de métriques et les alertes pour les pipelines de données. Les étudiants instrumentent les pipelines pour détecter proactivement les échecs et les violations de SLA.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Analystes de données : prêts à passer de l'interrogation des données à l'ingénierie de pipelines fiables.

  • Développeurs backend : souhaitant faire évoluer leurs compétences en codage vers le domaine des plateformes de données.

  • Ingénieurs de données juniors : cherchant un parcours structuré vers une expertise Databricks de niveau production.

  • Développeurs BI : voulant moderniser leur travail ETL à l'aide d'outils natifs du lakehouse.

  • Ingénieurs DevOps : élargissant leur périmètre pour inclure l'infrastructure de données et l'automatisation des pipelines.

  • Étudiants diplômés : développant des compétences en ingénierie de données prêtes à l'emploi avant d'entrer sur le marché du travail.

Cours associés

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF