Choisissez votre langue
Cours d'intégration Big Data
+ de 400 000 professionnels sur la plateforme
Exclusif aux entreprises

Cours d'intégration Big Data

Maîtrisez chaque couche de l'intégration moderne des big data, de l'ingestion et du stockage aux pipelines de streaming et à la gouvernance. Ce cours donne aux ingénieurs et architectes de données la profondeur technique nécessaire pour construire des systèmes de production capables de gérer des données massives et complexes à grande échelle. Que vous conceviez des pipelines cloud-natifs ou que vous appliquiez des politiques de conformité, vous en sortirez avec des compétences qui se traduisent directement par un impact concret.

Dedika pour les apprenants

Ce que votre équipe va maîtriser:

Vous apprendrez à concevoir et mettre en œuvre des pipelines de données par lots et en temps réel à l'aide de patrons architecturaux standard du secteur, notamment l'ETL, l'ELT et l'intégration pilotée par les événements. Le cours couvre les systèmes de stockage de données tels que les lacs de données, les entrepôts de données et les paradigmes NoSQL, ainsi que les bonnes pratiques pour la gestion des schémas et la modélisation des données. Vous acquerrez des connaissances pratiques sur les frameworks de qualité des données, l'orchestration des pipelines et les techniques d'observabilité utilisées dans les environnements de production. Les sujets avancés incluent les plateformes d'intégration cloud-natives, l'ingestion pilotée par API, l'intégration des pipelines d'apprentissage automatique et l'architecture en data mesh. À la fin, vous serez équipé pour construire, surveiller et gouverner des systèmes d'intégration de données à l'échelle de l'entreprise.

Comment votre équipe apprend de façon pratique Cours d'intégration Big Data

Comment votre équipe s’exerce Cours d'intégration Big Data

Des professionnels de ces entreprises apprennent sur Dedika

ActemiumFR
Nunner LogisticsNL
GT Constructora GeotécnicaCR
Sydel StarBR
Metrô de São PauloBR
Aguas AndinasCL
DSMIN
MeridianbetRS
CDHCN

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'intégration des mégadonnées

  • Leçon 1 • Métadonnées et catalogues de données

    Explique les rôles des métadonnées techniques, métiers et opérationnelles. Établit la gestion des métadonnées comme une préoccupation transversale pour tout travail d'intégration.

  • Leçon 2 • Aperçu du paysage des mégadonnées

    Définit les caractéristiques des mégadonnées et le problème de l'intégration. Ancre les sujets techniques ultérieurs dans un contexte métier concret.

  • Leçon 3 • Styles architecturaux d'intégration de données

    Passe en revue les schémas ETL, ELT, de virtualisation des données et événementiels. Fournit un cadre de décision utilisé tout au long du cours.

  • Leçon 4 • Bases des sources de données et de l'ingestion

    Catalogue les types de sources courants et les mécanismes d'ingestion. Prépare les apprenants à concevoir des couches d'ingestion dans les chapitres suivants.

Chapitre 2Voir les détails

Systèmes de stockage de données pour l'intégration

  • Leçon 1 • Systèmes de fichiers distribués

    Couvre les principes de stockage distribué au niveau des blocs et la sémantique des systèmes de fichiers. Relie l'architecture de stockage aux décisions d'ingestion et de traitement prises ultérieurement.

  • Leçon 2 • Sélection du format de stockage

    Compare les formats ligne, colonne et imbriqué pour les charges de travail d'intégration. Influence directement la conception du schéma et les décisions de transformation à venir.

  • Leçon 3 • Stockage objet et niveaux cloud

    Explique la sémantique du stockage objet et la hiérarchisation native au cloud. Prépare les apprenants aux architectures d'intégration basées sur le cloud dans les chapitres suivants.

  • Leçon 4 • Entrepôts de données et lacs de données

    Oppose les entrepôts en « schema-on-write » aux lacs en « schema-on-read ». Guide la sélection du stockage en fonction des modèles de requêtes et des besoins d'intégration.

  • Leçon 5 • Paradigmes de stockage NoSQL

    Examine les magasins de type clé-valeur, document, famille de colonnes et graphe. Aligne chaque paradigme avec les cas d'usage d'intégration présentés au chapitre 1.

Chapitre 3Voir les détails

Ingestion par lots et pipelines ETL

  • Leçon 1 • Principes fondamentaux de la transformation de données

    Couvre les transformations de filtrage, d'agrégation, de jointure et d'enrichissement. Développe les compétences en transformation approfondies dans les chapitres avancés.

  • Leçon 2 • Chargement des données et schémas cibles

    Explique les stratégies de chargement upsert, merge et de dimension à évolution lente. Relie la logique de chargement au stockage dans l'entrepôt et le lac abordé au chapitre 2.

  • Leçon 3 • Schémas de conception pour l'ingestion par lots

    Couvre les stratégies d'ingestion par chargement complet, incrémental et par capture de données modifiées. Établit la couche d'ingestion qui alimente tout le travail de transformation en aval.

  • Leçon 4 • Techniques d'extraction de données

    Enseigne l'extraction à grande échelle à partir de bases de données relationnelles, de fichiers et d'API. Fournit des schémas d'extraction réutilisables appliqués dans les travaux pratiques sur les pipelines.

  • Leçon 5 • Bases de l'orchestration de pipelines

    Présente l'orchestration de workflows basée sur des DAG pour les pipelines par lots. Prépare les apprenants à l'orchestration et à la supervision avancées dans les chapitres suivants.

Chapitre 4Voir les détails

Intégration en temps réel et par flux

  • Leçon 1 • Traitement de flux sans état et avec état

    Enseigne le filtrage, le mapping, le fenêtrage et l'agrégation sur des flux en direct. Développe la logique de traitement qui alimente les tableaux de bord en temps réel et les systèmes en aval.

  • Leçon 2 • Concepts de flux et systèmes de messagerie

    Définit les flux d'événements, les sujets, les partitions et les groupes de consommateurs. Établit la base de messagerie pour tout travail sur les pipelines de flux.

  • Leçon 3 • Architectures Lambda et Kappa

    Compare les architectures d'intégration par lots-plus-flux et par flux uniquement. Guide les décisions architecturales pour les charges de travail hybrides rencontrées en pratique.

  • Leçon 4 • Livraison flux-vers-stockage

    Explique les connecteurs de réception, le dépôt de micro-lots et les stratégies de compaction. Relie la sortie du flux aux systèmes de stockage abordés au chapitre 2.

  • Leçon 5 • Schémas d'ingestion par flux

    Couvre les connecteurs source, le registre de schémas et la sérialisation pour l'ingestion par flux. Étend les schémas d'ingestion par lots du chapitre 3 aux flux de données continus.

Chapitre 5Voir les détails

Gestion des schémas et modélisation des données

  • Leçon 1 • Gestion des données de référence et des données de base

    Définit les domaines de données de base, les enregistrements d'or et la gouvernance des données de référence. Fournit la base de cohérence des données pour les scénarios d'intégration multi-sources.

  • Leçon 2 • Conception de schémas pour les lacs de données

    Explique le « schema-on-read », l'architecture en zones et les conventions de nommage des dossiers pour les lacs. Étend les concepts de stockage en lac du chapitre 2 avec des conseils de conception pratiques.

  • Leçon 3 • Modélisation conceptuelle et logique des données

    Couvre la modélisation entité-relation et la normalisation pour les contextes d'intégration. Fournit la base de modélisation pour la conception de schémas physiques à venir.

  • Leçon 4 • Évolution et compatibilité des schémas

    Couvre les stratégies de compatibilité ascendante, descendante et totale pour l'évolution des schémas. Empêche les défaillances de pipeline causées par la dérive des schémas dans les systèmes de production.

  • Leçon 5 • Modélisation dimensionnelle pour l'analyse

    Enseigne les schémas en étoile et en flocon, les tables de faits et les hiérarchies de dimensions. Soutient directement les schémas de chargement dans l'entrepôt présentés au chapitre 3.

Chapitre 6Voir les détails

Qualité des données et nettoyage dans les pipelines

  • Leçon 1 • Règles de qualité et frameworks de validation

    Explique la validation par règles, les suites d'attentes et les schémas de quarantaine. Intègre des contrôles de qualité dans les pipelines par lots et en flux construits précédemment.

  • Leçon 2 • Supervision de la qualité des données et SLA

    Couvre la supervision continue de la qualité, les alertes et le suivi des accords de niveau de service. Relie les métriques de qualité aux tableaux de bord opérationnels et aux processus de gouvernance.

  • Leçon 3 • Profilage et détection d'anomalies

    Couvre les techniques de profilage statistique, d'analyse de schémas et de détection de valeurs aberrantes. Fournit des outils de diagnostic utilisés avant et pendant l'exécution du pipeline.

  • Leçon 4 • Techniques de nettoyage des données

    Enseigne les transformations de standardisation, déduplication, imputation et analyse syntaxique. Étend les compétences en transformation du chapitre 3 avec une logique axée sur la qualité.

  • Leçon 5 • Dimensions et métriques de la qualité des données

    Définit les métriques de complétude, exactitude, cohérence, actualité et unicité. Établit des objectifs de qualité mesurables appliqués tout au long de la conception du pipeline.

Chapitre 7Voir les détails

Orchestration et supervision des pipelines

  • Leçon 1 • Observabilité et journalisation des pipelines

    Enseigne la journalisation structurée, le traçage distribué et la collecte de métriques pour les pipelines. Fournit la visibilité nécessaire pour diagnostiquer les défaillances dans les flux d'intégration complexes.

  • Leçon 2 • Orchestration avancée des workflows

    Couvre les DAG dynamiques, les dépendances inter-pipelines et la planification pilotée par les SLA. Étend l'orchestration de base du chapitre 3 aux workflows à l'échelle de l'entreprise.

  • Leçon 3 • Tests de pipelines et CI/CD

    Explique les stratégies de test unitaire, d'intégration et de bout en bout pour les pipelines de données. Intègre l'assurance qualité dans le cycle de vie de déploiement du code d'intégration.

  • Leçon 4 • Réglage des performances et planification de capacité

    Couvre l'identification des goulots d'étranglement, le dimensionnement des ressources et les stratégies de mise à l'échelle pour les pipelines. Garantit que les systèmes d'intégration respectent les SLA de débit et de latence sous charge.

  • Leçon 5 • Alertes et réponse aux incidents

    Couvre les alertes basées sur des seuils et des anomalies, les runbooks d'astreinte et les post-mortems. Relie les données de supervision à des réponses opérationnelles actionnables.

Chapitre 8Voir les détails

Gouvernance, sécurité et conformité dans l'intégration

  • Leçon 1 • Conformité réglementaire et pistes d'audit

    Explique la conservation des données, le droit à l'effacement, la gestion du consentement et la journalisation d'audit. Aligne les pipelines d'intégration avec les obligations de protection des données transversales à l'industrie.

  • Leçon 2 • Contrôle d'accès et gestion des identités

    Couvre le contrôle d'accès basé sur les rôles et les attributs pour les plateformes de données. Sécurise les actifs de données à travers les couches de stockage et de pipeline construites dans les chapitres précédents.

  • Leçon 3 • Chiffrement et transport sécurisé des données

    Couvre le chiffrement au repos, en transit et la gestion des clés pour les systèmes d'intégration. Protège les données à travers toutes les opérations de mouvement et de stockage dans le pipeline.

  • Leçon 4 • Frameworks de gouvernance des données pour l'intégration

    Définit les rôles de gouvernance, les politiques et les modèles de gestion des actifs de données intégrés. Fournit la structure organisationnelle qui soutient tous les contrôles de gouvernance technique.

  • Leçon 5 • Confidentialité et anonymisation des données

    Enseigne les techniques de masquage, de tokenisation, de pseudonymisation et de confidentialité différentielle. Permet le traitement conforme des données sensibles dans les pipelines d'intégration.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Ingénieur de données : prêt à passer du travail sur un seul pipeline à la conception de systèmes complets.

  • Ingénieur analytique : souhaite approfondir ses connaissances de l'infrastructure sous-jacente aux modèles de données qu'il construit.

  • Ingénieur logiciel : en transition vers des rôles back-end axés sur les données nécessitant une expertise en pipelines.

  • Architecte de données : a besoin d'une remise à niveau structurée sur les patrons et outils d'intégration modernes.

  • Développeur BI : cherche à étendre ses compétences en amont vers les pipelines qui alimentent ses rapports.

  • Chef de projet technique : supervise des équipes de données et a besoin d'une maîtrise des concepts d'intégration.

Cours associés

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF