Choisissez votre langue
Cours Data Lake
Plus de 2 millions d'apprenants dans le monde

Cours Data Lake

Maîtrise chaque couche de l'ingénierie moderne des lacs de données, de l'ingestion brute aux lakehouses gouvernés et prêts pour l'analyse. Ce cours couvre l'architecture, le stockage, le traitement, la sécurité et les DataOps dans un seul programme complet. Que tu construises ton premier lac ou que tu passes à l'échelle d'une plateforme d'entreprise, tu acquerras l'expertise pratique nécessaire pour offrir une réelle valeur commerciale.

Dedika pour entreprises

Ce que vous allez apprendre:

Tu apprendras à concevoir et à exploiter des lacs de données de qualité production, en commençant par les concepts d'architecture de base et en progressant vers les formats de stockage, les pipelines d'ingestion, la gestion des métadonnées et la gouvernance. Tu mettras en œuvre des formats de table ouverts, notamment Delta Lake, Apache Iceberg et Apache Hudi, pour apporter des transactions ACID et le voyage dans le temps au stockage en lac. Le cours couvre également le traitement distribué, la configuration du moteur de requêtes, les architectures de flux et l'intégration ML. Tu appliqueras des pratiques DataOps telles que CI/CD, l'infrastructure en tant que code et les contrats de données pour automatiser la livraison des pipelines. Enfin, tu apprendras la gestion des coûts, l'observabilité et comment communiquer la valeur du lac de données aux parties prenantes exécutives.

Comment vous étudiez de façon pratique Cours Data Lake

Comment vous pratiquez Cours Data Lake

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'architecture d'un lac de données

  • Leçon 1 • Qu'est-ce qu'un lac de données

    Définit les lacs de données et les oppose aux entrepôts de données et aux magasins de données. Fournit la base conceptuelle pour toutes les décisions architecturales ultérieures.

  • Leçon 2 • Pièges courants et problème du marécage de données

    Identifie les défaillances de gouvernance qui transforment les lacs de données en marécages de données inutilisables. La connaissance de ces risques motive les meilleures pratiques présentées plus tard.

  • Leçon 3 • Cas d'utilisation des lacs de données et valeur commerciale

    Associe des scénarios concrets — analytique, apprentissage automatique, archivage — aux capacités des lacs de données. Les étudiants relient les caractéristiques techniques à des résultats commerciaux mesurables.

  • Leçon 4 • Caractéristiques principales des lacs de données

    Examine le schéma à la lecture, l'ingestion multi-format et l'évolutivité comme traits distinctifs. Ces propriétés expliquent pourquoi les lacs de données conviennent à diverses charges de travail analytiques.

Chapitre 2Voir les détails

Stockage des lacs de données et formats de fichiers

  • Leçon 1 • Hiérarchisation du stockage et optimisation des coûts

    Explique les niveaux de stockage à chaud, tiède et froid ainsi que les politiques de hiérarchisation automatisée. Les étudiants conçoivent des stratégies de rétention rentables alignées sur les modèles d'accès.

  • Leçon 2 • Stratégies de compression pour les lacs de données

    Couvre les compromis entre Snappy, Gzip, Zstd et LZ4 pour le taux de compression et la vitesse. Une compression appropriée réduit les coûts de stockage sans dégrader la performance des requêtes.

  • Leçon 3 • Formats de fichiers colonnaires et en lignes

    Compare Parquet, ORC, Avro, CSV et JSON pour les charges de travail analytiques. Le choix du format a un impact direct sur la vitesse des requêtes et l'efficacité du stockage.

  • Leçon 4 • Le stockage d'objets comme fondation

    Explique la mécanique du stockage d'objets, l'organisation des compartiments et les garanties de durabilité. Le stockage d'objets est la couche physique dominante pour les lacs de données modernes.

  • Leçon 5 • Partitionnement et meilleures pratiques de taille de fichier

    Enseigne la sélection des clés de partition, l'élagage des partitions et les tailles de fichier optimales. Ces techniques évitent les problèmes de petits fichiers et accélèrent les requêtes analytiques.

Chapitre 3Voir les détails

Modèles et pipelines d'ingestion de données

  • Leçon 1 • Fiabilité des pipelines et surveillance

    Enseigne les files d'attente de lettres mortes, les contrôles de qualité des données à l'ingestion et l'observabilité des pipelines. Des pipelines fiables évitent la perte silencieuse de données et la corruption en aval.

  • Leçon 2 • Principes fondamentaux de l'ingestion en continu

    Présente les concepts de flux d'événements, les courtiers de messages et la sémantique de livraison exactement une fois. L'ingestion en continu permet l'analytique quasi en temps réel sur des données arrivant en continu.

  • Leçon 3 • Aperçu de l'architecture d'ingestion

    Associe les modèles d'ingestion aux types de source et aux exigences de latence. Cet aperçu encadre les décisions de conception couvertes tout au long du chapitre.

  • Leçon 4 • Ingestion à partir de divers types de sources

    Aborde les bases de données, les API, les fichiers, les appareils IoT et les plateformes SaaS comme sources d'ingestion. Chaque type de source nécessite des connecteurs et des stratégies de gestion de schéma spécifiques.

  • Leçon 5 • Conception de l'ingestion par lots

    Couvre l'extraction planifiée, les chargements complets et incrémentiels et la capture des changements de données. L'ingestion par lots reste le modèle le plus courant pour les systèmes sources structurés.

Chapitre 4Voir les détails

Organisation des lacs de données et gestion des métadonnées

  • Leçon 1 • Métadonnées techniques et métier

    Différencie les métadonnées techniques (schéma, lignée) des métadonnées métier (propriété, glossaire). Les deux types sont nécessaires pour une découverte et une gouvernance efficaces des données.

  • Leçon 2 • Architecture de lac basée sur des zones

    Présente les zones brutes, nettoyées, organisées et bac à sable avec des critères de promotion clairs. La séparation en zones applique les limites de qualité des données et le contrôle d'accès.

  • Leçon 3 • Suivi de la lignée des données

    Explique la capture et la visualisation de la lignée au niveau des colonnes et des ensembles de données. La lignée permet l'analyse d'impact et renforce la confiance des consommateurs dans les actifs de données.

  • Leçon 4 • Conventions de nommage et structures de dossiers

    Établit des normes pour les noms de compartiments, les préfixes et les identifiants d'ensembles de données. Un nommage cohérent permet l'automatisation, la découverte et la gouvernance à grande échelle.

  • Leçon 5 • Conception et mise en œuvre d'un catalogue de données

    Couvre l'architecture du catalogue, les robots d'exploration et les interfaces de recherche pour la découverte des ensembles de données. Un catalogue bien conçu réduit le temps nécessaire aux consommateurs de données pour obtenir des informations.

Chapitre 5Voir les détails

Gouvernance et sécurité des données dans les lacs de données

  • Leçon 1 • Modèles de contrôle d'accès pour les lacs de données

    Compare les modèles de contrôle d'accès basés sur les rôles, sur les attributs et au niveau des lignes/colonnes. Le choix du bon modèle équilibre la sécurité avec la flexibilité opérationnelle.

  • Leçon 2 • Masquage et anonymisation des données

    Couvre le masquage statique, le masquage dynamique, la tokenisation et les techniques de pseudonymisation. Ces méthodes protègent les données sensibles tout en préservant l'utilité analytique.

  • Leçon 3 • Chiffrement au repos et en transit

    Explique le chiffrement côté serveur, le chiffrement côté client et TLS pour les données en mouvement. Le chiffrement est le contrôle de base pour protéger les données du lac contre les accès non autorisés.

  • Leçon 4 • Journalisation d'audit et rapports de conformité

    Conçoit des pipelines de journaux d'audit, des politiques de conservation et des tableaux de bord de conformité. Les pistes d'audit démontrent l'efficacité des contrôles aux examinateurs internes et externes.

  • Leçon 5 • Classification des données et étiquetage de sensibilité

    Définit les niveaux de classification — public, interne, confidentiel, restreint — et les flux de travail d'étiquetage. La classification détermine les décisions d'accès et de masquage en aval.

Chapitre 6Voir les détails

Traitement et transformation des données à grande échelle

  • Leçon 1 • Principes fondamentaux du traitement distribué

    Présente les modèles d'exécution distribuée, les DAG et les opérations de brassage. La compréhension de ces mécanismes est un prérequis pour optimiser tout travail de transformation à grande échelle.

  • Leçon 2 • Règles de transformation de la qualité des données

    Met en œuvre la validation, la normalisation, la déduplication et l'enrichissement comme étapes de transformation. L'intégration de règles de qualité dans les pipelines empêche les mauvaises données d'atteindre les consommateurs.

  • Leçon 3 • Optimisation de la performance des pipelines

    Applique la mise en cache, l'élagage des partitions, le prédicat pushdown et le réglage des travaux pour réduire le temps d'exécution. Les pipelines optimisés réduisent les coûts de calcul et répondent aux exigences des ANS.

  • Leçon 4 • Modèles de transformation en continu

    Enseigne le traitement de flux avec état, les repères et la gestion des données en retard. Les transformations en continu permettent l'analytique continue sur des flux de données en temps réel.

  • Leçon 5 • Modèles de transformation par lots

    Couvre les opérations de filtre, jointure, agrégation et fenêtrage sur de grands ensembles de données. Ces modèles constituent les éléments de base de tous les pipelines de transformation analytique.

Chapitre 7Voir les détails

Formats de table ouverts et architecture lakehouse

  • Leçon 1 • Conception de l'architecture lakehouse

    Intègre les formats de table ouverts avec les moteurs de requêtes, les outils BI et les plateformes ML dans un lakehouse unifié. Cette architecture élimine le besoin d'un entrepôt de données distinct dans de nombreux scénarios.

  • Leçon 2 • Apache Iceberg et Apache Hudi

    Compare le partitionnement caché d'Iceberg et les mises à jour au niveau des enregistrements de Hudi à Delta Lake. Les étudiants sélectionnent le bon format en fonction de la charge de travail et des exigences de l'écosystème.

  • Leçon 3 • Limitations des lacs de données traditionnels

    Identifie les lacunes en matière de cohérence, de mise à jour et de voyage dans le temps dans les lacs de stockage d'objets simples. Ces limitations motivent l'adoption de formats de table ouverts.

  • Leçon 4 • Concepts des formats de table ouverts

    Explique les couches de métadonnées, les journaux de transactions et l'isolation par instantané communs à tous les formats ouverts. Un modèle conceptuel partagé simplifie la comparaison des implémentations spécifiques.

  • Leçon 5 • Plongée approfondie dans Delta Lake

    Couvre la mécanique du journal Delta, les opérations MERGE, l'ordre Z et les commandes de vide. Delta Lake est largement adopté et sert de référence principale pour la mise en œuvre.

Chapitre 8Voir les détails

Opérations sur les lacs de données et gouvernance stratégique

  • Leçon 1 • Conservation des données et gouvernance du cycle de vie

    Conçoit des calendriers de conservation, des flux de travail de suppression et des processus de conservation légale. La gouvernance du cycle de vie réduit les risques et les coûts de stockage tout en satisfaisant aux obligations réglementaires.

  • Leçon 2 • Maillage de données et propriété fédérée

    Applique les principes du maillage de données — propriété par domaine, produits de données et gouvernance fédérée — aux grands lacs. Les modèles fédérés font évoluer la gouvernance au-delà de la capacité de l'équipe centrale.

  • Leçon 3 • Planification de la feuille de route et évaluation de la maturité

    Utilise des modèles de maturité pour évaluer les capacités actuelles du lac et prioriser les initiatives d'amélioration. Une feuille de route structurée aligne les investissements techniques sur la stratégie commerciale.

  • Leçon 4 • Gestion des coûts et FinOps pour les lacs de données

    Applique l'étiquetage, le showback, le chargeback et le redimensionnement pour contrôler les dépenses du lac. La visibilité des coûts favorise la responsabilisation et empêche la croissance incontrôlée du stockage et du calcul.

  • Leçon 5 • Observabilité et surveillance

    Construit des piles de surveillance couvrant la santé des pipelines, la fraîcheur des données et les mesures de stockage. L'observabilité permet une résolution proactive des problèmes avant que les consommateurs ne soient impactés.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieurs de données qui veulent aller au-delà du travail de base sur les pipelines.

  • Architectes de nuage qui conçoivent des solutions de stockage évolutives pour les équipes d'analyse.

  • Développeurs BI dont les besoins de rapport dépassent les limites des entrepôts traditionnels.

  • Ingénieurs logiciels qui font la transition vers des rôles d'infrastructure de données et de plateforme.

  • Gestionnaires TI qui supervisent la stratégie de données et ont besoin rapidement de profondeur technique.

  • Ingénieurs analytiques qui construisent des ensembles de données reproductibles prêts pour le ML à partir de sources brutes.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF