
Cours d'intégration Big Data
Maîtrise toutes les couches de l'intégration moderne des mégadonnées, de l'ingestion et du stockage aux pipelines en continu et à la gouvernance. Ce cours offre aux ingénieurs de données et aux architectes la profondeur technique nécessaire pour construire des systèmes de production capables de gérer des données massives et complexes à grande échelle. Que tu conçoives des pipelines en nuage natifs ou que tu appliques des politiques de conformité, tu repartiras avec des compétences qui se traduisent directement en impact concret.
Ce que vous allez apprendre:
Tu apprendras à concevoir et à mettre en œuvre des pipelines de données par lots et en temps réel à l'aide de schémas architecturaux standard de l'industrie, notamment ETL, ELT et l'intégration pilotée par les événements. Le cours couvre les systèmes de stockage de données tels que les lacs de données, les entrepôts de données et les paradigmes NoSQL, ainsi que les meilleures pratiques pour la gestion des schémas et la modélisation des données. Tu acquerras des connaissances pratiques sur les cadres de qualité des données, l'orchestration des pipelines et les techniques d'observabilité utilisées dans les environnements de production. Les sujets avancés incluent les plateformes d'intégration en nuage natives, l'ingestion via API, l'intégration de pipelines d'apprentissage automatique et l'architecture de maillage de données. À la fin, tu seras équipé pour construire, surveiller et gouverner des systèmes d'intégration de données à l'échelle de l'entreprise.
Comment vous étudiez de façon pratique Cours d'intégration Big Data
Comment vous pratiquez Cours d'intégration Big Data
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'intégration du Big Data
Fondements de l'intégration du Big Data
Leçon 1 • Métadonnées et catalogues de données
Explique les rôles des métadonnées techniques, opérationnelles et métier. Établit la gestion des métadonnées comme une préoccupation transversale pour tout travail d'intégration.
Leçon 2 • Aperçu du paysage du Big Data
Définit les caractéristiques du Big Data et le champ des problèmes d'intégration. Ancre les sujets techniques ultérieurs dans un contexte métier réel.
Leçon 3 • Styles architecturaux d'intégration de données
Passe en revue les modèles ETL, ELT, de virtualisation des données et pilotés par les événements. Fournit un cadre décisionnel utilisé tout au long du cours.
Leçon 4 • Sources de données et notions de base sur l'ingestion
Catalogue les types de sources courantes et les mécanismes d'ingestion. Prépare les étudiants à concevoir des couches d'ingestion dans les chapitres ultérieurs.
Chapitre 2MasquerCacher les détailsVoir les détailsSystèmes de stockage de données pour l'intégration
Systèmes de stockage de données pour l'intégration
Leçon 1 • Systèmes de fichiers distribués
Couvre les principes de stockage distribué au niveau des blocs et la sémantique des systèmes de fichiers. Relie l'architecture de stockage aux décisions d'ingestion et de traitement prises ultérieurement.
Leçon 2 • Sélection du format de stockage
Compare les formats lignes, colonnes et imbriqués pour les charges de travail d'intégration. Informe directement la conception du schéma et les décisions de transformation à venir.
Leçon 3 • Stockage objet et niveaux infonuagiques
Explique la sémantique du stockage objet et la hiérarchisation infonuagique native. Prépare les étudiants aux architectures d'intégration infonuagiques des chapitres ultérieurs.
Leçon 4 • Entrepôts de données et lacs de données
Oppose les entrepôts à schéma à l'écriture aux lacs à schéma à la lecture. Guide le choix du stockage en fonction des modèles de requête et des exigences d'intégration.
Leçon 5 • Paradigmes de stockage NoSQL
Examine les magasins clé-valeur, documents, famille de colonnes et graphes. Aligne chaque paradigme avec les cas d'utilisation d'intégration présentés au chapitre 1.
Chapitre 3MasquerCacher les détailsVoir les détailsIngestion par lots et pipelines ETL
Ingestion par lots et pipelines ETL
Leçon 1 • Principes fondamentaux de la transformation de données
Couvre les transformations de filtrage, d'agrégation, de jointure et d'enrichissement. Développe les compétences en transformation qui seront approfondies dans les chapitres avancés.
Leçon 2 • Modèles de chargement et de ciblage des données
Explique les stratégies de chargement par insertion, mise à jour-insertion et dimension à évolution lente. Relie la logique de chargement au stockage d'entrepôt et de lac couvert au chapitre 2.
Leçon 3 • Modèles de conception d'ingestion par lots
Couvre les stratégies d'ingestion par chargement complet, incrémental et capture de données de modification. Établit la couche d'ingestion qui alimente tout le travail de transformation en aval.
Leçon 4 • Techniques d'extraction de données
Enseigne l'extraction à grande échelle à partir de bases de données relationnelles, de fichiers et d'API. Fournit des modèles d'extraction réutilisables appliqués dans les laboratoires de pipelines.
Leçon 5 • Notions de base sur l'orchestration de pipelines
Introduit l'orchestration de workflows basée sur DAG pour les pipelines par lots. Prépare les étudiants à l'orchestration et à la surveillance avancées dans les chapitres ultérieurs.
Chapitre 4MasquerCacher les détailsVoir les détailsIntégration en temps réel et en continu
Intégration en temps réel et en continu
Leçon 1 • Traitement de flux sans état et avec état
Enseigne le filtrage, le mappage, le fenêtrage et l'agrégation sur des flux en direct. Construit une logique de traitement qui alimente les tableaux de bord en temps réel et les systèmes en aval.
Leçon 2 • Concepts de streaming et systèmes de messagerie
Définit les flux d'événements, les sujets, les partitions et les groupes de consommateurs. Établit la base de messagerie pour tout travail de pipeline de streaming.
Leçon 3 • Architectures Lambda et Kappa
Compare les architectures d'intégration par lots-plus-streaming et streaming uniquement. Guide les décisions architecturales pour les charges de travail hybrides rencontrées dans la pratique.
Leçon 4 • Livraison du flux vers le stockage
Explique les connecteurs de récepteur, le dépôt par micro-lots et les stratégies de compaction. Relie la sortie du streaming aux systèmes de stockage couverts au chapitre 2.
Leçon 5 • Modèles d'ingestion de flux
Couvre les connecteurs source, le registre de schémas et la sérialisation pour l'ingestion en continu. Étend les modèles d'ingestion par lots du chapitre 3 aux flux de données continus.
Chapitre 5MasquerCacher les détailsVoir les détailsGestion des schémas et modélisation des données
Gestion des schémas et modélisation des données
Leçon 1 • Gestion des données de référence et des données de référence
Définit les domaines de données de référence, les enregistrements d'or et la gouvernance des données de référence. Fournit la base de cohérence des données pour les scénarios d'intégration multi-sources.
Leçon 2 • Conception de schémas pour les lacs de données
Explique le schéma à la lecture, l'architecture de zones et les conventions de dossiers pour les lacs. Étend les concepts de stockage de lac du chapitre 2 avec des conseils de conception pratiques.
Leçon 3 • Modélisation conceptuelle et logique des données
Couvre la modélisation entité-relation et la normalisation pour les contextes d'intégration. Fournit la base de modélisation pour la conception de schémas physiques à venir.
Leçon 4 • Évolution et compatibilité des schémas
Couvre les stratégies de compatibilité ascendante, descendante et totale pour l'évolution des schémas. Empêche les pannes de pipeline causées par la dérive des schémas dans les systèmes de production.
Leçon 5 • Modélisation dimensionnelle pour l'analyse
Enseigne les schémas en étoile et en flocon, les tables de faits et les hiérarchies de dimensions. Soutient directement les modèles de chargement d'entrepôt présentés au chapitre 3.
Chapitre 6MasquerCacher les détailsVoir les détailsQualité des données et nettoyage dans les pipelines
Qualité des données et nettoyage dans les pipelines
Leçon 1 • Règles de qualité et frameworks de validation
Explique la validation basée sur des règles, les suites d'attentes et les modèles de quarantaine. Intègre des contrôles de qualité dans les pipelines par lots et en continu construits précédemment.
Leçon 2 • Surveillance de la qualité des données et accords de niveau de service
Couvre la surveillance continue de la qualité, les alertes et le suivi des accords de niveau de service. Relie les mesures de qualité aux tableaux de bord opérationnels et aux processus de gouvernance.
Leçon 3 • Profilage et détection d'anomalies
Couvre les techniques de profilage statistique, d'analyse des modèles et de détection des valeurs aberrantes. Fournit des outils de diagnostic utilisés avant et pendant l'exécution du pipeline.
Leçon 4 • Techniques de nettoyage des données
Enseigne les transformations de normalisation, de déduplication, d'imputation et d'analyse. Étend les compétences en transformation du chapitre 3 avec une logique axée sur la qualité.
Leçon 5 • Dimensions et mesures de la qualité des données
Définit les mesures d'exhaustivité, d'exactitude, de cohérence, d'actualité et d'unicité. Établit des cibles de qualité mesurables appliquées tout au long de la conception du pipeline.
Chapitre 7MasquerCacher les détailsVoir les détailsOrchestration et surveillance des pipelines
Orchestration et surveillance des pipelines
Leçon 1 • Observabilité et journalisation des pipelines
Enseigne la journalisation structurée, le traçage distribué et la collecte de mesures pour les pipelines. Fournit la visibilité nécessaire pour diagnostiquer les pannes dans les flux d'intégration complexes.
Leçon 2 • Orchestration avancée de workflows
Couvre les DAG dynamiques, les dépendances entre pipelines et la planification pilotée par les accords de niveau de service. Étend l'orchestration de base du chapitre 3 aux workflows à l'échelle de l'entreprise.
Leçon 3 • Test de pipeline et CI/CD
Explique les stratégies de test unitaire, d'intégration et de bout en bout pour les pipelines de données. Intègre l'assurance qualité dans le cycle de vie de déploiement du code d'intégration.
Leçon 4 • Réglage des performances et planification de la capacité
Couvre l'identification des goulots d'étranglement, le dimensionnement des ressources et les stratégies de mise à l'échelle pour les pipelines. Garantit que les systèmes d'intégration respectent les accords de niveau de service de débit et de latence sous charge.
Leçon 5 • Alertes et réponse aux incidents
Couvre les alertes basées sur des seuils et des anomalies, les runbooks d'astreinte et les comptes rendus post-incident. Relie les données de surveillance à des réponses opérationnelles exploitables.
Chapitre 8MasquerCacher les détailsVoir les détailsGouvernance, sécurité et conformité dans l'intégration
Gouvernance, sécurité et conformité dans l'intégration
Leçon 1 • Conformité réglementaire et pistes de vérification
Explique la rétention des données, le droit à l'effacement, la gestion du consentement et la journalisation de vérification. Aligne les pipelines d'intégration avec les obligations de protection des données intersectorielles.
Leçon 2 • Contrôle d'accès et gestion des identités
Couvre le contrôle d'accès basé sur les rôles et les attributs pour les plateformes de données. Sécurise les actifs de données dans les couches de stockage et de pipeline construites dans les chapitres précédents.
Leçon 3 • Chiffrement et transport sécurisé des données
Couvre le chiffrement au repos, en transit et la gestion des clés pour les systèmes d'intégration. Protège les données dans toutes les opérations de déplacement et de stockage du pipeline.
Leçon 4 • Frameworks de gouvernance des données pour l'intégration
Définit les rôles, les politiques et les modèles de stewardship pour les actifs de données intégrés. Fournit la structure organisationnelle qui soutient tous les contrôles de gouvernance technique.
Leçon 5 • Confidentialité et anonymisation des données
Enseigne les techniques de masquage, de tokenisation, de pseudonymisation et de confidentialité différentielle. Permet le traitement conforme des données sensibles dans les pipelines d'intégration.
Votre certificat valide de réussite
Ce cours est pour vous :
Ingénieur de données : prêt à passer du travail sur un seul pipeline à la conception de systèmes complets.
Ingénieur analytique : veut des connaissances plus approfondies sur l'infrastructure derrière les modèles de données qu'il construit.
Ingénieur logiciel : en transition vers des rôles back-end axés sur les données nécessitant une expertise en pipelines.
Architecte de données : a besoin d'une mise à jour structurée sur les schémas et les outils d'intégration modernes.
Développeur BI : cherche à étendre son travail en amont vers les pipelines qui alimentent ses rapports.
Chargé de projet technique : supervise des équipes de données et a besoin d'une maîtrise des concepts d'intégration.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















