
Cours Data Lake
Maîtrisez chaque couche de l'ingénierie moderne des lacs de données, de l'ingestion brute aux lakehouses prêts pour l'analyse et gouvernés. Ce cours couvre l'architecture, le stockage, le traitement, la sécurité et le DataOps dans un seul programme complet. Que vous construisiez votre premier lac ou que vous passiez à l'échelle d'une plateforme d'entreprise, vous acquerrez l'expertise pratique nécessaire pour apporter une réelle valeur commerciale.
Ce que vous allez apprendre:
Vous apprendrez à concevoir et à exploiter des lacs de données de niveau production, en commençant par les concepts d'architecture de base et en progressant vers les formats de stockage, les pipelines d'ingestion, la gestion des métadonnées et la gouvernance. Vous implémenterez des formats de table ouverts, notamment Delta Lake, Apache Iceberg et Apache Hudi, pour apporter des transactions ACID et le voyage dans le temps au stockage lac. Le cours couvre également le traitement distribué, la configuration du moteur de requête, les architectures de streaming et l'intégration ML. Vous appliquerez des pratiques DataOps telles que l'IC/CD, l'infrastructure en tant que code et les contrats de données pour automatiser la livraison des pipelines. Enfin, vous apprendrez la gestion des coûts, l'observabilité et comment communiquer la valeur du lac de données aux parties prenantes exécutives.
Comment vous étudiez de façon pratique Cours Data Lake
Comment vous pratiquez Cours Data Lake
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux de l'architecture d'un lac de données
Fondamentaux de l'architecture d'un lac de données
Leçon 1 • Qu'est-ce qu'un lac de données
Définit les lacs de données et les distingue des entrepôts de données et des magasins de données. Fournit la base conceptuelle pour toutes les décisions architecturales ultérieures.
Leçon 2 • Pièges courants et problème du marécage de données
Identifie les défaillances de gouvernance qui transforment les lacs de données en marécages de données inutilisables. La connaissance de ces risques motive les bonnes pratiques présentées plus tard.
Leçon 3 • Cas d'usage et valeur métier des lacs de données
Associe des scénarios concrets (analytique, apprentissage automatique, archivage) aux capacités des lacs de données. Les étudiants relient les fonctionnalités techniques à des résultats métier mesurables.
Leçon 4 • Caractéristiques principales des lacs de données
Examine le schéma à la lecture, l'ingestion multi-format et la scalabilité comme traits distinctifs. Ces propriétés expliquent pourquoi les lacs de données conviennent à des charges de travail analytiques variées.
Chapitre 2MasquerCacher les détailsVoir les détailsStockage et formats de fichiers des lacs de données
Stockage et formats de fichiers des lacs de données
Leçon 1 • Hiérarchisation du stockage et optimisation des coûts
Explique les niveaux de stockage chaud, tiède et froid ainsi que les politiques de hiérarchisation automatisée. Les étudiants conçoivent des stratégies de rétention rentables alignées sur les modes d'accès.
Leçon 2 • Stratégies de compression pour les lacs de données
Couvre les compromis entre Snappy, Gzip, Zstd et LZ4 concernant le taux de compression et la vitesse. Une compression adaptée réduit le coût de stockage sans dégrader la performance des requêtes.
Leçon 3 • Formats de fichiers columnaires et ligne par ligne
Compare Parquet, ORC, Avro, CSV et JSON pour les charges de travail analytiques. Le choix du format a un impact direct sur la vitesse des requêtes et l'efficacité du stockage.
Leçon 4 • Le stockage objet comme fondation
Explique les mécanismes du stockage objet, l'organisation des buckets et les garanties de durabilité. Le stockage objet est la couche physique dominante pour les lacs de données modernes.
Leçon 5 • Bonnes pratiques de partitionnement et de dimensionnement des fichiers
Enseigne la sélection des clés de partition, l'élagage des partitions et les tailles de fichiers optimales. Ces techniques évitent les problèmes de petits fichiers et accélèrent les requêtes analytiques.
Chapitre 3MasquerCacher les détailsVoir les détailsSchémas et pipelines d'ingestion de données
Schémas et pipelines d'ingestion de données
Leçon 1 • Fiabilité et surveillance des pipelines
Enseigne les files d'attente de lettres mortes, les contrôles de qualité des données à l'ingestion et l'observabilité des pipelines. Des pipelines fiables évitent les pertes de données silencieuses et la corruption en aval.
Leçon 2 • Fondamentaux de l'ingestion en flux continu
Introduit les concepts de flux d'événements, les courtiers en messages et la sémantique de livraison unique exacte. L'ingestion en flux continu permet l'analytique quasi temps réel sur des données arrivant en continu.
Leçon 3 • Vue d'ensemble de l'architecture d'ingestion
Associe les schémas d'ingestion aux types de sources et aux exigences de latence. Cette vue d'ensemble encadre les décisions de conception abordées dans le chapitre.
Leçon 4 • Ingestion à partir de divers types de sources
Aborde les bases de données, les API, les fichiers, les dispositifs IoT et les plateformes SaaS comme sources d'ingestion. Chaque type de source nécessite des connecteurs et des stratégies de gestion de schéma spécifiques.
Leçon 5 • Conception de l'ingestion par lots
Couvre l'extraction planifiée, les chargements complets et incrémentaux, et la capture de données modifiées. L'ingestion par lots reste le schéma le plus courant pour les systèmes sources structurés.
Chapitre 4MasquerCacher les détailsVoir les détailsOrganisation du lac de données et gestion des métadonnées
Organisation du lac de données et gestion des métadonnées
Leçon 1 • Métadonnées techniques et métier
Distingue les métadonnées techniques (schéma, lignée) des métadonnées métier (propriété, glossaire). Les deux types sont nécessaires pour une découverte et une gouvernance efficaces des données.
Leçon 2 • Architecture du lac basée sur des zones
Introduit les zones brutes, nettoyées, organisées et sandbox avec des critères de promotion clairs. La séparation en zones applique des frontières de qualité des données et de contrôle d'accès.
Leçon 3 • Traçabilité de la lignée des données
Explique la capture et la visualisation de la lignée au niveau des colonnes et des ensembles de données. La lignée permet l'analyse d'impact et renforce la confiance des consommateurs dans les actifs de données.
Leçon 4 • Conventions de nommage et structures de dossiers
Établit des normes pour les noms de buckets, les préfixes et les identifiants d'ensembles de données. Un nommage cohérent permet l'automatisation, la découverte et la gouvernance à grande échelle.
Leçon 5 • Conception et mise en œuvre d'un catalogue de données
Couvre l'architecture du catalogue, les explorateurs automatiques et les interfaces de recherche pour la découverte des ensembles de données. Un catalogue bien conçu réduit le temps nécessaire aux consommateurs de données pour obtenir des informations.
Chapitre 5MasquerCacher les détailsVoir les détailsGouvernance et sécurité des données dans les lacs de données
Gouvernance et sécurité des données dans les lacs de données
Leçon 1 • Modèles de contrôle d'accès pour les lacs de données
Compare les modèles de contrôle d'accès basés sur les rôles, basés sur les attributs et au niveau des lignes et des colonnes. Le choix du bon modèle équilibre la sécurité et la flexibilité opérationnelle.
Leçon 2 • Masquage et anonymisation des données
Couvre le masquage statique, le masquage dynamique, la tokenisation et les techniques de pseudonymisation. Ces méthodes protègent les données sensibles tout en préservant l'utilité analytique.
Leçon 3 • Chiffrement au repos et en transit
Explique le chiffrement côté serveur, le chiffrement côté client et TLS pour les données en mouvement. Le chiffrement est le contrôle de base pour protéger les données du lac contre les accès non autorisés.
Leçon 4 • Enregistrement des audits et rapports de conformité
Conçoit des pipelines de journaux d'audit, des politiques de rétention et des tableaux de bord de conformité. Les pistes d'audit démontrent l'efficacité des contrôles aux examinateurs internes et externes.
Leçon 5 • Classification des données et étiquetage de sensibilité
Définit les niveaux de classification (public, interne, confidentiel, restreint) et les processus d'étiquetage. La classification détermine les décisions d'accès et de masquage en aval.
Chapitre 6MasquerCacher les détailsVoir les détailsTraitement et transformation des données à grande échelle
Traitement et transformation des données à grande échelle
Leçon 1 • Fondamentaux du traitement distribué
Introduit les modèles d'exécution distribuée, les DAG et les opérations de brassage. La compréhension de ces mécanismes est un prérequis pour optimiser toute tâche de transformation à grande échelle.
Leçon 2 • Règles de transformation pour la qualité des données
Met en œuvre la validation, la normalisation, la déduplication et l'enrichissement comme étapes de transformation. L'intégration de règles de qualité dans les pipelines empêche les mauvaises données d'atteindre les consommateurs.
Leçon 3 • Optimisation des performances des pipelines
Applique la mise en cache, l'élagage des partitions, la descente de prédicats et le réglage des tâches pour réduire le temps d'exécution. Les pipelines optimisés réduisent les coûts de calcul et respectent les exigences des accords de niveau de service.
Leçon 4 • Schémas de transformation en flux continu
Enseigne le traitement de flux avec état, les marqueurs d'eau et la gestion des données arrivant tardivement. Les transformations en flux continu permettent l'analytique continue sur des flux de données en temps réel.
Leçon 5 • Schémas de transformation par lots
Couvre les opérations de filtre, jointure, agrégation et fenêtrage sur de grands ensembles de données. Ces schémas constituent les éléments de base de tous les pipelines de transformation analytique.
Chapitre 7MasquerCacher les détailsVoir les détailsTable des formats ouverts et architecture Lakehouse
Table des formats ouverts et architecture Lakehouse
Leçon 1 • Conception d'une architecture lakehouse
Intègre les formats de table ouverts avec les moteurs de requêtes, les outils de BI et les plateformes de ML dans un lakehouse unifié. Cette architecture élimine le besoin d'un entrepôt de données séparé dans de nombreux scénarios.
Leçon 2 • Apache Iceberg et Apache Hudi
Compare le partitionnement caché d'Iceberg et les mises à jour au niveau des enregistrements de Hudi à Delta Lake. Les étudiants sélectionnent le format approprié en fonction de la charge de travail et des exigences de l'écosystème.
Leçon 3 • Limites des lacs de données traditionnels
Identifie les lacunes en matière de cohérence, de mise à jour et de voyage dans le temps dans les lacs de stockage objet simples. Ces limitations motivent l'adoption de formats de table ouverts.
Leçon 4 • Concepts des formats de table ouverts
Explique les couches de métadonnées, les journaux de transactions et l'isolation par instantané communs à tous les formats ouverts. Un modèle conceptuel partagé simplifie la comparaison des implémentations spécifiques.
Leçon 5 • Plongée approfondie dans Delta Lake
Couvre les mécanismes du journal Delta, les opérations MERGE, le Z-ordering et les commandes de vidage. Delta Lake est largement adopté et sert de référence d'implémentation principale.
Chapitre 8MasquerCacher les détailsVoir les détailsOpérations et gouvernance stratégique des lacs de données
Opérations et gouvernance stratégique des lacs de données
Leçon 1 • Rétention des données et gouvernance du cycle de vie
Conçoit des calendriers de rétention, des processus de suppression et des procédures de blocage légal. La gouvernance du cycle de vie réduit les risques et les coûts de stockage tout en satisfaisant aux obligations réglementaires.
Leçon 2 • Data mesh et propriété fédérée
Applique les principes du data mesh (propriété par domaine, produits de données, gouvernance fédérée) aux grands lacs. Les modèles fédérés étendent la gouvernance au-delà de la capacité de l'équipe centrale.
Leçon 3 • Planification de la feuille de route et évaluation de la maturité
Utilise des modèles de maturité pour évaluer les capacités actuelles du lac et prioriser les initiatives d'amélioration. Une feuille de route structurée aligne les investissements techniques sur la stratégie métier.
Leçon 4 • Gestion des coûts et FinOps pour les lacs de données
Applique l'étiquetage, le showback, le chargeback et le rightsizing pour maîtriser les dépenses du lac. La visibilité sur les coûts favorise la responsabilisation et empêche la croissance incontrôlée du stockage et du calcul.
Leçon 5 • Observabilité et surveillance
Construit des piles de surveillance couvrant la santé des pipelines, la fraîcheur des données et les métriques de stockage. L'observabilité permet une résolution proactive des problèmes avant que les consommateurs ne soient impactés.
Votre certificat valide de réussite
Ce cours est pour vous :
Ingénieurs de données qui souhaitent dépasser le travail de pipeline de base.
Architectes cloud concevant des solutions de stockage évolutives pour les équipes d'analyse.
Développeurs BI dont les besoins de reporting dépassent les limites des entrepôts traditionnels.
Ingénieurs logiciels en transition vers des rôles d'infrastructure de données et de plateforme.
Responsables informatiques supervisant la stratégie de données et ayant besoin rapidement de profondeur technique.
Ingénieurs analytiques construisant des ensembles de données reproductibles prêts pour le ML à partir de sources brutes.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Algérie ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















