Choisissez votre langue
Formation Databricks
Plus de 2 millions d'apprenants dans le monde

Formation Databricks

Maîtrisez la plateforme Databricks de A à Z, en couvrant l'architecture lakehouse, Apache Spark, Delta Lake et les workflows de ML. Cette formation donne aux ingénieurs de données, analystes et data scientists les compétences pratiques nécessaires pour construire des pipelines et des solutions analytiques de qualité professionnelle. Si vous travaillez avec des données à grande échelle, cette formation est celle qui fait avancer votre carrière.

Dedika pour entreprises

Ce que vous allez apprendre:

Ce cours couvre chaque couche majeure de la plateforme Databricks, en commençant par l'architecture lakehouse et les fondamentaux de l'espace de travail. Vous écrirez et optimiserez des tâches Apache Spark, gérerez des tables Delta Lake et construirez des pipelines ETL fiables à l'aide d'Auto Loader et de Delta Live Tables. Vous appliquerez l'architecture en médaillon pour organiser les données en couches Bronze, Argent et Or. Le cours couvre également Databricks SQL pour l'analyse, MLflow pour la gestion du cycle de vie des modèles d'apprentissage automatique et l'orchestration des flux de travail pour les déploiements en production. Les sujets avancés incluent le réglage des performances Spark, la gouvernance Unity Catalog, le streaming Kafka en temps réel et l'IA générative avec Mosaic AI.

Comment vous étudiez de façon pratique Formation Databricks

Comment vous pratiquez Formation Databricks

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Introduction à Databricks et au Lakehouse

  • Leçon 1 • Navigation dans l'espace de travail Databricks

    Couvre l'interface utilisateur de l'espace de travail, l'organisation des ressources et les rôles utilisateur. Les apprenants acquièrent une familiarité pratique avec l'environnement avant d'écrire du code.

  • Leçon 2 • Connexion aux sources de données

    Démontre le montage du stockage en nuage et la connexion aux bases de données externes. Établit les schémas d'accès aux données requis pour toutes les tâches d'ingénierie et d'analytique des données.

  • Leçon 3 • Qu'est-ce que l'architecture Lakehouse

    Définit le paradigme lakehouse et le contraste avec les entrepôts de données et les lacs de données. Établit le contexte architectural pour tout travail ultérieur sur Databricks.

  • Leçon 4 • Travailler avec les notebooks Databricks

    Présente la création de notebooks, les commandes magiques et le support multilingue. Les notebooks sont l'interface de développement principale utilisée dans tous les chapitres suivants.

  • Leçon 5 • Clusters : configuration et gestion

    Explique les types de clusters, les options de configuration et la gestion du cycle de vie. Une configuration correcte du cluster est essentielle pour une utilisation efficace des ressources tout au long de la formation.

Chapitre 2Voir les détails

Fondamentaux d'Apache Spark dans Databricks

  • Leçon 1 • Lecture et écriture de formats de données

    Couvre la lecture et l'écriture des formats Parquet, JSON, CSV et Delta avec des options. Une gestion correcte des formats est fondamentale pour tous les pipelines d'ingestion et de sortie.

  • Leçon 2 • DataFrames et l'API DataFrame

    Couvre la création de DataFrames, l'inférence de schéma et les transformations de base. Les DataFrames sont l'abstraction principale utilisée dans tous les chapitres de traitement des données.

  • Leçon 3 • Bases des performances Spark

    Présente le partitionnement, la mise en cache et les jointures broadcast pour l'optimisation des performances. Ces techniques sont appliquées dans les chapitres d'optimisation avancée plus tard dans la formation.

  • Leçon 4 • Architecture et modèle d'exécution Spark

    Explique les drivers, les executors, les DAG et l'évaluation paresseuse. Comprendre le flux d'exécution est essentiel pour écrire du code Spark efficace dans les chapitres suivants.

  • Leçon 5 • Spark SQL pour l'interrogation des données

    Enseigne l'interrogation basée sur SQL avec Spark en utilisant des vues temporaires et des tables de catalogue. Fait le pont entre les compétences SQL et le moteur d'exécution Spark.

Chapitre 3Voir les détails

Delta Lake : stockage de données fiable

  • Leçon 1 • Opérations DML sur les tables Delta

    Enseigne les opérations INSERT, UPDATE, DELETE et MERGE sur les tables Delta. Permet aux apprenants de mettre en œuvre des schémas d'upsert essentiels pour les pipelines de données incrémentiels.

  • Leçon 2 • Optimisation des tables Delta

    Couvre les commandes OPTIMIZE, ZORDER et VACUUM pour la gestion des performances et du stockage. Ces opérations sont essentielles pour maintenir des tables Delta de qualité production.

  • Leçon 3 • Voyage dans le temps et gestion de version des données

    Démontre l'interrogation des versions historiques des tables et la restauration des états antérieurs. Le voyage dans le temps prend en charge l'audit et la récupération d'erreurs dans les pipelines de données de production.

  • Leçon 4 • Création et gestion des tables Delta

    Couvre les opérations DDL, les propriétés des tables et les tables gérées vs. externes. Ces compétences sont nécessaires pour créer des couches de données structurées dans les chapitres de pipeline ultérieurs.

  • Leçon 5 • Concepts fondamentaux de Delta Lake

    Explique le journal des transactions Delta, les garanties ACID et comment Delta diffère du Parquet simple. Fournit la base conceptuelle pour toutes les opérations sur les tables Delta.

Chapitre 4Voir les détails

Ingestion de données et pipelines ETL

  • Leçon 1 • Auto Loader pour l'ingestion incrémentielle

    Présente les modes de notification de fichiers et de listage de répertoires d'Auto Loader pour une ingestion évolutive. Auto Loader est le schéma Databricks recommandé pour l'ingestion continue basée sur les fichiers.

  • Leçon 2 • Schémas d'ingestion par lots

    Couvre les stratégies de chargement complet et incrémentiel par lots avec Spark et Delta. Établit les schémas d'ingestion qui sous-tendent toutes les architectures de pipeline dans ce chapitre.

  • Leçon 3 • Construction de logique de transformation

    Couvre les schémas de transformation en plusieurs étapes, y compris le nettoyage, l'enrichissement et la déduplication. La logique de transformation est la couche à valeur ajoutée centrale de tout pipeline ETL.

  • Leçon 4 • Delta Live Tables pour l'orchestration de pipelines

    Présente Delta Live Tables (DLT) pour la définition déclarative de pipelines et l'application de la qualité. DLT simplifie la gestion des pipelines et s'intègre à l'architecture médaillon.

  • Leçon 5 • Fondamentaux du streaming structuré

    Enseigne le micro-batch et le streaming continu avec Spark Structured Streaming. Fournit les bases du streaming nécessaires pour les sections de pipelines en temps réel à venir.

Chapitre 5Voir les détails

Modélisation des données et architecture médaillon

  • Leçon 1 • Principes de l'architecture médaillon

    Définit les responsabilités des couches Bronze, Argent et Or et les contrats de données. Fournit le cadre structurel appliqué dans toutes les sections de modélisation et de pipeline suivantes.

  • Leçon 2 • Conception de la couche Bronze

    Couvre l'atterrissage des données brutes, le schema-on-read et la préservation de la fidélité source. Une couche Bronze bien conçue garantit une auditabilité complète et une capacité de retraitement.

  • Leçon 3 • Construction des agrégats de la couche Or

    Couvre la création de tables pré-agrégées et dénormalisées optimisées pour la BI et le reporting. Les tables Or réduisent la complexité des requêtes et améliorent les performances des tableaux de bord.

  • Leçon 4 • Construction de la couche Argent

    Enseigne le nettoyage, le typage, la déduplication et la conformité des données à un schéma unifié. La couche Argent est la source principale pour les charges de travail analytiques et de ML.

  • Leçon 5 • Qualité des données et attentes

    Présente l'application de contraintes, les schémas de quarantaine et le suivi des métriques de qualité. L'intégration de contrôles de qualité à chaque couche empêche les mauvaises données de se propager en aval.

Chapitre 6Voir les détails

Databricks SQL et analytique

  • Leçon 1 • Optimisation des requêtes pour l'analytique

    Enseigne l'analyse des plans de requête, les stratégies de mise en cache et la mise en cache des résultats pour les charges de travail SQL. Les requêtes optimisées réduisent les coûts des entrepôts et améliorent l'expérience utilisateur.

  • Leçon 2 • Construction de tableaux de bord et visualisations

    Couvre la création de graphiques, de tableaux de bord et d'alertes dans Databricks SQL. Les tableaux de bord permettent aux parties prenantes métier de consommer les données sans écrire de code.

  • Leçon 3 • Unity Catalog pour la gouvernance des données

    Présente l'espace de noms à trois niveaux d'Unity Catalog, le contrôle d'accès et la traçabilité des données. La gouvernance est fondamentale pour une analytique sécurisée et conforme entre les équipes.

  • Leçon 4 • Techniques SQL avancées dans Databricks

    Enseigne les fonctions de fenêtre, les CTE et les fonctions d'ordre supérieur pour les requêtes analytiques complexes. Ces techniques permettent une analyse sophistiquée directement dans Databricks SQL.

  • Leçon 5 • Entrepôts SQL et exécution de requêtes

    Couvre les types d'entrepôts SQL, le dimensionnement et le routage des requêtes. Une configuration correcte de l'entrepôt a un impact direct sur les performances des requêtes et les coûts pour les charges de travail analytiques.

Chapitre 7Voir les détails

Apprentissage automatique avec Databricks et MLflow

  • Leçon 1 • Registre de modèles MLflow

    Présente l'enregistrement des modèles, les transitions d'étape et la gestion de version dans le registre de modèles. Le registre offre une gouvernance et une traçabilité pour les modèles de production.

  • Leçon 2 • Déploiement de modèles et inférence par lots

    Couvre les points de terminaison de déploiement de modèles en temps réel et l'inférence par lots avec Spark. Le déploiement de modèles dans les deux modes garantit une flexibilité pour divers besoins métier.

  • Leçon 3 • Entraînement de modèles à grande échelle avec Spark

    Couvre l'entraînement distribué avec les pandas UDF, Spark ML et Hyperopt pour le réglage. L'entraînement distribué réduit le temps d'obtention d'informations sur les grands ensembles de données.

  • Leçon 4 • Suivi des expériences avec MLflow

    Enseigne la journalisation des paramètres, des métriques et des artefacts avec MLflow Tracking. Un suivi systématique des expériences permet la reproductibilité et une sélection éclairée des modèles.

  • Leçon 5 • ML Runtime Databricks et ingénierie des caractéristiques

    Couvre l'environnement ML Runtime, les bibliothèques pré-installées et les bases du Feature Store. Un ensemble de caractéristiques bien préparé est la base d'un entraînement de modèle reproductible.

Chapitre 8Voir les détails

Orchestration des workflows et déploiement en production

  • Leçon 1 • Surveillance, journalisation et gestion des coûts

    Couvre les journaux d'événements de clusters, les métriques de tâches, les journaux d'audit et le suivi des coûts DBU. L'observabilité et le contrôle des coûts sont essentiels pour des opérations de production durables.

  • Leçon 2 • Planification et déclenchement de workflows

    Enseigne la planification basée sur cron, les déclencheurs d'arrivée de fichiers et les déclencheurs d'API externes. Un déclenchement flexible garantit que les pipelines s'exécutent au bon moment avec une intervention manuelle minimale.

  • Leçon 3 • Infrastructure en tant que code avec Terraform

    Présente le provisionnement des ressources Databricks en utilisant le fournisseur Terraform. L'infrastructure en tant que code garantit une configuration d'environnement reproductible et auditée entre les espaces de travail.

  • Leçon 4 • Tâches et orchestration de tâches Databricks

    Couvre la création de tâches multi-tâches, la définition des dépendances et la configuration du calcul pour chaque tâche. Les tâches sont le mécanisme principal pour exécuter des charges de travail de production selon un planning.

  • Leçon 5 • CI/CD pour Databricks avec Repos

    Couvre l'intégration Git via Databricks Repos, les stratégies de branches et le déploiement automatisé. Les pratiques CI/CD réduisent les risques de déploiement et accélèrent la livraison des produits de données.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieur de données : prêt à dépasser les pipelines de base vers une plateforme lakehouse unifiée.

  • Analyste de données : souhaite interroger et visualiser des données à grande échelle avec Databricks SQL.

  • Data Scientist : a besoin d'une plateforme fiable pour l'ingénierie des caractéristiques et le déploiement de modèles.

  • Ingénieur d'analyse : construit des couches de transformation de type dbt et explore les alternatives natives Spark.

  • Ingénieur cloud : soutient les équipes de données et a besoin de connaissances approfondies sur l'infrastructure Databricks.

  • Reconversion professionnelle : transition du développement logiciel vers le domaine moderne de l'ingénierie des données.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en Côte d’Ivoire ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF