
Cours d'intégration Big Data
Maîtrisez chaque couche de l'intégration moderne des big data, de l'ingestion et du stockage aux pipelines de streaming et à la gouvernance. Ce cours donne aux ingénieurs et architectes de données la profondeur technique nécessaire pour construire des systèmes de production capables de gérer des données massives et complexes à grande échelle. Que vous conceviez des pipelines cloud-natifs ou que vous appliquiez des politiques de conformité, vous en sortirez avec des compétences qui se traduisent directement par un impact concret.
Ce que vous allez apprendre:
Vous apprendrez à concevoir et mettre en œuvre des pipelines de données par lots et en temps réel à l'aide de patrons architecturaux standard du secteur, notamment l'ETL, l'ELT et l'intégration pilotée par les événements. Le cours couvre les systèmes de stockage de données tels que les lacs de données, les entrepôts de données et les paradigmes NoSQL, ainsi que les bonnes pratiques pour la gestion des schémas et la modélisation des données. Vous acquerrez des connaissances pratiques sur les frameworks de qualité des données, l'orchestration des pipelines et les techniques d'observabilité utilisées dans les environnements de production. Les sujets avancés incluent les plateformes d'intégration cloud-natives, l'ingestion pilotée par API, l'intégration des pipelines d'apprentissage automatique et l'architecture en data mesh. À la fin, vous serez équipé pour construire, surveiller et gouverner des systèmes d'intégration de données à l'échelle de l'entreprise.
Comment vous étudiez de façon pratique Cours d'intégration Big Data
Comment vous pratiquez Cours d'intégration Big Data
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'intégration des mégadonnées
Fondements de l'intégration des mégadonnées
Leçon 1 • Métadonnées et catalogues de données
Explique les rôles des métadonnées techniques, métiers et opérationnelles. Établit la gestion des métadonnées comme une préoccupation transversale pour tout travail d'intégration.
Leçon 2 • Aperçu du paysage des mégadonnées
Définit les caractéristiques des mégadonnées et le problème de l'intégration. Ancre les sujets techniques ultérieurs dans un contexte métier concret.
Leçon 3 • Styles architecturaux d'intégration de données
Passe en revue les schémas ETL, ELT, de virtualisation des données et événementiels. Fournit un cadre de décision utilisé tout au long du cours.
Leçon 4 • Bases des sources de données et de l'ingestion
Catalogue les types de sources courants et les mécanismes d'ingestion. Prépare les apprenants à concevoir des couches d'ingestion dans les chapitres suivants.
Chapitre 2MasquerCacher les détailsVoir les détailsSystèmes de stockage de données pour l'intégration
Systèmes de stockage de données pour l'intégration
Leçon 1 • Systèmes de fichiers distribués
Couvre les principes de stockage distribué au niveau des blocs et la sémantique des systèmes de fichiers. Relie l'architecture de stockage aux décisions d'ingestion et de traitement prises ultérieurement.
Leçon 2 • Sélection du format de stockage
Compare les formats ligne, colonne et imbriqué pour les charges de travail d'intégration. Influence directement la conception du schéma et les décisions de transformation à venir.
Leçon 3 • Stockage objet et niveaux cloud
Explique la sémantique du stockage objet et la hiérarchisation native au cloud. Prépare les apprenants aux architectures d'intégration basées sur le cloud dans les chapitres suivants.
Leçon 4 • Entrepôts de données et lacs de données
Oppose les entrepôts en « schema-on-write » aux lacs en « schema-on-read ». Guide la sélection du stockage en fonction des modèles de requêtes et des besoins d'intégration.
Leçon 5 • Paradigmes de stockage NoSQL
Examine les magasins de type clé-valeur, document, famille de colonnes et graphe. Aligne chaque paradigme avec les cas d'usage d'intégration présentés au chapitre 1.
Chapitre 3MasquerCacher les détailsVoir les détailsIngestion par lots et pipelines ETL
Ingestion par lots et pipelines ETL
Leçon 1 • Principes fondamentaux de la transformation de données
Couvre les transformations de filtrage, d'agrégation, de jointure et d'enrichissement. Développe les compétences en transformation approfondies dans les chapitres avancés.
Leçon 2 • Chargement des données et schémas cibles
Explique les stratégies de chargement upsert, merge et de dimension à évolution lente. Relie la logique de chargement au stockage dans l'entrepôt et le lac abordé au chapitre 2.
Leçon 3 • Schémas de conception pour l'ingestion par lots
Couvre les stratégies d'ingestion par chargement complet, incrémental et par capture de données modifiées. Établit la couche d'ingestion qui alimente tout le travail de transformation en aval.
Leçon 4 • Techniques d'extraction de données
Enseigne l'extraction à grande échelle à partir de bases de données relationnelles, de fichiers et d'API. Fournit des schémas d'extraction réutilisables appliqués dans les travaux pratiques sur les pipelines.
Leçon 5 • Bases de l'orchestration de pipelines
Présente l'orchestration de workflows basée sur des DAG pour les pipelines par lots. Prépare les apprenants à l'orchestration et à la supervision avancées dans les chapitres suivants.
Chapitre 4MasquerCacher les détailsVoir les détailsIntégration en temps réel et par flux
Intégration en temps réel et par flux
Leçon 1 • Traitement de flux sans état et avec état
Enseigne le filtrage, le mapping, le fenêtrage et l'agrégation sur des flux en direct. Développe la logique de traitement qui alimente les tableaux de bord en temps réel et les systèmes en aval.
Leçon 2 • Concepts de flux et systèmes de messagerie
Définit les flux d'événements, les sujets, les partitions et les groupes de consommateurs. Établit la base de messagerie pour tout travail sur les pipelines de flux.
Leçon 3 • Architectures Lambda et Kappa
Compare les architectures d'intégration par lots-plus-flux et par flux uniquement. Guide les décisions architecturales pour les charges de travail hybrides rencontrées en pratique.
Leçon 4 • Livraison flux-vers-stockage
Explique les connecteurs de réception, le dépôt de micro-lots et les stratégies de compaction. Relie la sortie du flux aux systèmes de stockage abordés au chapitre 2.
Leçon 5 • Schémas d'ingestion par flux
Couvre les connecteurs source, le registre de schémas et la sérialisation pour l'ingestion par flux. Étend les schémas d'ingestion par lots du chapitre 3 aux flux de données continus.
Chapitre 5MasquerCacher les détailsVoir les détailsGestion des schémas et modélisation des données
Gestion des schémas et modélisation des données
Leçon 1 • Gestion des données de référence et des données de base
Définit les domaines de données de base, les enregistrements d'or et la gouvernance des données de référence. Fournit la base de cohérence des données pour les scénarios d'intégration multi-sources.
Leçon 2 • Conception de schémas pour les lacs de données
Explique le « schema-on-read », l'architecture en zones et les conventions de nommage des dossiers pour les lacs. Étend les concepts de stockage en lac du chapitre 2 avec des conseils de conception pratiques.
Leçon 3 • Modélisation conceptuelle et logique des données
Couvre la modélisation entité-relation et la normalisation pour les contextes d'intégration. Fournit la base de modélisation pour la conception de schémas physiques à venir.
Leçon 4 • Évolution et compatibilité des schémas
Couvre les stratégies de compatibilité ascendante, descendante et totale pour l'évolution des schémas. Empêche les défaillances de pipeline causées par la dérive des schémas dans les systèmes de production.
Leçon 5 • Modélisation dimensionnelle pour l'analyse
Enseigne les schémas en étoile et en flocon, les tables de faits et les hiérarchies de dimensions. Soutient directement les schémas de chargement dans l'entrepôt présentés au chapitre 3.
Chapitre 6MasquerCacher les détailsVoir les détailsQualité des données et nettoyage dans les pipelines
Qualité des données et nettoyage dans les pipelines
Leçon 1 • Règles de qualité et frameworks de validation
Explique la validation par règles, les suites d'attentes et les schémas de quarantaine. Intègre des contrôles de qualité dans les pipelines par lots et en flux construits précédemment.
Leçon 2 • Supervision de la qualité des données et SLA
Couvre la supervision continue de la qualité, les alertes et le suivi des accords de niveau de service. Relie les métriques de qualité aux tableaux de bord opérationnels et aux processus de gouvernance.
Leçon 3 • Profilage et détection d'anomalies
Couvre les techniques de profilage statistique, d'analyse de schémas et de détection de valeurs aberrantes. Fournit des outils de diagnostic utilisés avant et pendant l'exécution du pipeline.
Leçon 4 • Techniques de nettoyage des données
Enseigne les transformations de standardisation, déduplication, imputation et analyse syntaxique. Étend les compétences en transformation du chapitre 3 avec une logique axée sur la qualité.
Leçon 5 • Dimensions et métriques de la qualité des données
Définit les métriques de complétude, exactitude, cohérence, actualité et unicité. Établit des objectifs de qualité mesurables appliqués tout au long de la conception du pipeline.
Chapitre 7MasquerCacher les détailsVoir les détailsOrchestration et supervision des pipelines
Orchestration et supervision des pipelines
Leçon 1 • Observabilité et journalisation des pipelines
Enseigne la journalisation structurée, le traçage distribué et la collecte de métriques pour les pipelines. Fournit la visibilité nécessaire pour diagnostiquer les défaillances dans les flux d'intégration complexes.
Leçon 2 • Orchestration avancée des workflows
Couvre les DAG dynamiques, les dépendances inter-pipelines et la planification pilotée par les SLA. Étend l'orchestration de base du chapitre 3 aux workflows à l'échelle de l'entreprise.
Leçon 3 • Tests de pipelines et CI/CD
Explique les stratégies de test unitaire, d'intégration et de bout en bout pour les pipelines de données. Intègre l'assurance qualité dans le cycle de vie de déploiement du code d'intégration.
Leçon 4 • Réglage des performances et planification de capacité
Couvre l'identification des goulots d'étranglement, le dimensionnement des ressources et les stratégies de mise à l'échelle pour les pipelines. Garantit que les systèmes d'intégration respectent les SLA de débit et de latence sous charge.
Leçon 5 • Alertes et réponse aux incidents
Couvre les alertes basées sur des seuils et des anomalies, les runbooks d'astreinte et les post-mortems. Relie les données de supervision à des réponses opérationnelles actionnables.
Chapitre 8MasquerCacher les détailsVoir les détailsGouvernance, sécurité et conformité dans l'intégration
Gouvernance, sécurité et conformité dans l'intégration
Leçon 1 • Conformité réglementaire et pistes d'audit
Explique la conservation des données, le droit à l'effacement, la gestion du consentement et la journalisation d'audit. Aligne les pipelines d'intégration avec les obligations de protection des données transversales à l'industrie.
Leçon 2 • Contrôle d'accès et gestion des identités
Couvre le contrôle d'accès basé sur les rôles et les attributs pour les plateformes de données. Sécurise les actifs de données à travers les couches de stockage et de pipeline construites dans les chapitres précédents.
Leçon 3 • Chiffrement et transport sécurisé des données
Couvre le chiffrement au repos, en transit et la gestion des clés pour les systèmes d'intégration. Protège les données à travers toutes les opérations de mouvement et de stockage dans le pipeline.
Leçon 4 • Frameworks de gouvernance des données pour l'intégration
Définit les rôles de gouvernance, les politiques et les modèles de gestion des actifs de données intégrés. Fournit la structure organisationnelle qui soutient tous les contrôles de gouvernance technique.
Leçon 5 • Confidentialité et anonymisation des données
Enseigne les techniques de masquage, de tokenisation, de pseudonymisation et de confidentialité différentielle. Permet le traitement conforme des données sensibles dans les pipelines d'intégration.
Votre certificat valide de réussite
Ce cours est fait pour vous :
Ingénieur de données : prêt à passer du travail sur un seul pipeline à la conception de systèmes complets.
Ingénieur analytique : souhaite approfondir ses connaissances de l'infrastructure sous-jacente aux modèles de données qu'il construit.
Ingénieur logiciel : en transition vers des rôles back-end axés sur les données nécessitant une expertise en pipelines.
Architecte de données : a besoin d'une remise à niveau structurée sur les patrons et outils d'intégration modernes.
Développeur BI : cherche à étendre ses compétences en amont vers les pipelines qui alimentent ses rapports.
Chef de projet technique : supervise des équipes de données et a besoin d'une maîtrise des concepts d'intégration.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en France ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















