Choisissez votre langue
Formation data engineering
Plus de 2 millions d'étudiants dans le monde

Formation data engineering

4,4

Maîtrisez toutes les couches de l'ingénierie des données moderne, de l'ingestion et de la transformation à l'orchestration, au streaming et à la gouvernance. Ce cours vous offre la profondeur technique et les compétences pratiques nécessaires pour concevoir des plateformes de données de qualité professionnelle dans le cloud. Que vous débutiez dans le domaine ou que vous cherchiez à monter en compétences, vous sortirez prêt à construire des systèmes sur lesquels les organisations réelles comptent.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous commencerez par maîtriser SQL, la modélisation relationnelle des données et la conception d'entrepôts de données dans le cloud, puis vous passerez à la création de pipelines d'ingestion fiables pour des sources par lots et en continu. Vous apprendrez à transformer des données brutes en ensembles de données prêts pour l'analyse à l'aide d'outils basés sur SQL et de Python, et à automatiser des flux de travail complexes avec des frameworks d'orchestration basés sur des DAG. Le cours couvre le traitement de flux en temps réel, le contrôle de la qualité des données et la gouvernance de la plateforme, y compris le contrôle d'accès et la conformité réglementaire. Vous explorerez également l'infrastructure en tant que code, les pratiques DataOps, les pipelines de données pour l'apprentissage automatique et les tendances émergentes comme le data mesh et l'ingénierie assistée par IA. Chaque sujet est directement lié aux décisions et aux compromis que vous rencontrerez dans un rôle professionnel d'ingénieur de données.

Comment vous étudiez de façon pratique Formation data engineering

Comment vous pratiquez Formation data engineering

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux de l'ingénierie des données

  • Leçon 1 • Le paysage de l'ingénierie des données

    Définit le périmètre de l'ingénierie des données, en la distinguant de la science des données et de l'analyse. Établit le vocabulaire utilisé tout au long du cours.

  • Leçon 2 • Composants principaux de l'infrastructure de données

    Présente les bases de données, les entrepôts de données, les lacs de données et les lakehouses comme des modèles d'infrastructure distincts. Prépare les étudiants à sélectionner les architectures de stockage appropriées.

  • Leçon 3 • Pipelines de données et concepts de workflow

    Explique ce qu'est un pipeline de données, ses étapes et comment l'orchestration relie les étapes entre elles. Ancre les étudiants dans la réflexion sur les pipelines avant la mise en œuvre pratique.

  • Leçon 4 • Types de données et fondamentaux du stockage

    Couvre les formats de données structurées, semi-structurées et non structurées ainsi que leurs implications en matière de stockage. Relie les choix de stockage aux besoins de traitement en aval.

Chapitre 2Voir les détails

Modélisation des données SQL et relationnelles

  • Leçon 1 • Modélisation dimensionnelle pour l'analyse

    Couvre les schémas en étoile et en flocon, les tables de faits et les tables de dimensions pour les charges de travail analytiques. Fait le lien entre la théorie relationnelle et la conception d'entrepôts dans les chapitres suivants.

  • Leçon 2 • Techniques SQL avancées

    Enseigne les fonctions de fenêtrage, les CTE et les opérations ensemblistes pour les requêtes analytiques complexes. Permet aux étudiants de gérer des logiques de reporting et de transformation réalistes.

  • Leçon 3 • Performance et optimisation SQL

    Examine les plans d'exécution des requêtes, les stratégies de partitionnement et d'indexation pour améliorer la vitesse des requêtes. Prépare les étudiants à écrire du SQL de niveau production à grande échelle.

  • Leçon 4 • Principes de modélisation des données relationnelles

    Introduit les formes normales et la modélisation entité-relation pour les systèmes transactionnels. Fournit les bases de la conception de schémas nécessaires avant la modélisation analytique.

  • Leçon 5 • Fondamentaux des requêtes SQL

    Couvre SELECT, le filtrage, l'agrégation et les jointures comme éléments de base de la récupération de données. Soutient directement tout le travail de transformation ultérieur dans le cours.

Chapitre 3Voir les détails

Ingestion de données et systèmes sources

  • Leçon 1 • Notions fondamentales sur l'ingestion streaming

    Introduit les concepts de streaming d'événements, les producteurs, les consommateurs et les sujets pour l'ingestion en temps réel. Pose les bases du chapitre sur le traitement streaming qui suit.

  • Leçon 2 • Techniques d'ingestion batch

    Couvre les modèles de chargement complet, incrémental et de capture de données modifiées (CDC) pour l'extraction batch. Apprend aux étudiants à équilibrer l'exhaustivité avec le coût d'ingestion.

  • Leçon 3 • Ingestion de données depuis les API et le Web

    Montre comment extraire des données d'API REST, gérer la pagination, l'authentification et les limites de débit. Se connecte à des scénarios réels d'intégration de données SaaS et tierces.

  • Leçon 4 • Comprendre les modèles de systèmes sources

    Passe en revue les bases de données OLTP, les API, les flux d'événements et les fichiers plats comme sources de données courantes. Définit le contexte pour choisir la stratégie d'ingestion appropriée par type de source.

  • Leçon 5 • Fiabilité des pipelines d'ingestion

    Traite de la gestion des erreurs, de l'évolution des schémas et de la supervision pour les pipelines d'ingestion de production. Garantit que les étudiants peuvent construire des systèmes d'ingestion résilients et observables.

Chapitre 4Voir les détails

Conception d'entrepôt de données et de stockage en nuage

  • Leçon 1 • Architecture d'entrepôt de données en nuage

    Examine la séparation du calcul et du stockage, les moteurs de requêtes MPP et la mise à l'échelle de la concurrence. Fournit le contexte architectural pour toutes les décisions de conception d'entrepôt.

  • Leçon 2 • Conception de lac de données et de stockage objet

    Couvre la hiérarchie des dossiers, la sélection des formats de fichiers et l'élagage des partitions dans les environnements de stockage objet. Prépare les étudiants à gérer les zones brutes et organisées dans un lac de données.

  • Leçon 3 • Modèles de conception de schémas d'entrepôt

    Applique la modélisation dimensionnelle du Chapitre 2 à la conception physique du schéma d'entrepôt avec partitionnement et clustering. Fait le lien entre la théorie et la mise en œuvre d'un entrepôt de production.

  • Leçon 4 • Formats de table et standards ouverts

    Introduit les formats de table ouverts qui ajoutent des transactions ACID et l'évolution des schémas aux lacs de données. Permet aux étudiants de mettre en œuvre des modèles lakehouse sur le stockage objet en nuage.

  • Leçon 5 • Gestion de la rétention et du cycle de vie des données

    Traite du stockage hiérarchisé, des politiques d'archivage et des règles d'expiration des données pour le coût et la conformité. Relie la conception du stockage aux exigences opérationnelles et réglementaires.

Chapitre 5Voir les détails

Transformation et traitement des données

  • Leçon 1 • Transformation de données avec Python

    Introduit pandas et PySpark pour la transformation programmatique de grands ensembles de données. Élargit la boîte à outils des étudiants au-delà de SQL pour les transformations complexes ou non relationnelles.

  • Leçon 2 • Transformation avec des outils basés sur SQL

    Enseigne la transformation SQL modulaire en utilisant des conventions de modélisation en couches telles que les couches de staging, intermédiaire et de marts. Relie les compétences SQL du Chapitre 2 aux workflows de production.

  • Leçon 3 • Nettoyage des données et contrôle qualité

    Couvre la déduplication, la gestion des valeurs nulles, le transtypage et la validation des contraintes pendant la transformation. Améliore directement la fiabilité des sorties analytiques en aval.

  • Leçon 4 • Paradigmes ETL vs. ELT

    Compare les architectures extract-transform-load et extract-load-transform ainsi que leurs compromis. Guide les étudiants dans le choix du paradigme approprié pour une plateforme donnée.

  • Leçon 5 • Test et validation des transformations

    Établit les tests unitaires, la validation des contrats de données et la réconciliation des comptages de lignes pour la logique de transformation. Garantit que le code de transformation est vérifiable et maintenable.

Chapitre 6Voir les détails

Orchestration de pipelines et automatisation des workflows

  • Leçon 1 • Construction et configuration de DAG

    Couvre la création de DAG avec des opérateurs, des capteurs et des hooks pour les tâches de données courantes. Traduit les concepts d'orchestration en code de pipeline fonctionnel.

  • Leçon 2 • Concepts et modèles d'orchestration

    Définit les DAG, les dépendances de tâches, les déclencheurs et les intervalles de planification comme primitives d'orchestration. Établit le modèle mental pour tout le travail pratique d'orchestration.

  • Leçon 3 • Supervision et observabilité des pipelines

    Établit les stratégies de journalisation, de collecte de métriques et d'alertes pour les pipelines orchestrés. Prépare les étudiants à maintenir la santé des pipelines en production.

  • Leçon 4 • Gestion de la planification et des dépendances

    Enseigne la planification basée sur cron, les dépendances entre DAG et les modèles de planification tenant compte des données. Permet aux étudiants de coordonner des workflows complexes multi-pipelines.

  • Leçon 5 • Gestion des erreurs et logique de relance

    Met en œuvre des politiques de relance, des configurations de délai d'attente et des callbacks en cas d'échec pour des pipelines résilients. Réduit directement les interventions manuelles dans les environnements de production.

Chapitre 7Voir les détails

Ingénierie des données en streaming

  • Leçon 1 • Opérations de traitement de flux

    Enseigne le filtrage, le mappage, l'agrégation et la jointure sur des flux d'événements non bornés. Permet aux étudiants de mettre en œuvre une logique de transformation de base dans un contexte streaming.

  • Leçon 2 • Fondamentaux de l'architecture streaming

    Contrast le streaming avec le traitement batch et introduit les modèles d'architecture Lambda et Kappa. Fournit le vocabulaire de conception pour tout le travail de mise en œuvre du streaming.

  • Leçon 3 • Intégration et sortie des pipelines streaming

    Couvre l'envoi des flux traités vers des bases de données, des entrepôts et des sujets en aval. Relie les sorties streaming à la plateforme de données plus large construite dans les chapitres précédents.

  • Leçon 4 • Streaming avec état et tolérance aux pannes

    Traite des magasins d'état, du checkpointing et des watermarks pour un traitement streaming fiable avec état. Garantit que les étudiants peuvent construire des pipelines streaming qui survivent aux pannes.

  • Leçon 5 • Courtiers de messages et files d'événements

    Couvre les concepts de courtier de messages distribués, y compris les sujets, les partitions, les offsets et les groupes de consommateurs. S'appuie sur les concepts d'ingestion du Chapitre 3 avec des détails opérationnels plus approfondis.

Chapitre 8Voir les détails

Qualité des données, gouvernance et sécurité

  • Leçon 1 • Conformité réglementaire et confidentialité des données

    Traite de la résidence des données, des obligations de rétention, de la gestion du consentement et du droit à l'effacement. Prépare les étudiants à construire des plateformes qui répondent aux exigences de confidentialité et de conformité.

  • Leçon 2 • Catalogue de données et gestion des métadonnées

    Couvre la découverte des données, le suivi de la lignée et la gestion du glossaire métier dans un catalogue de données. Permet aux équipes de trouver, comprendre et faire confiance aux actifs de données.

  • Leçon 3 • Contrôle d'accès et sécurité des données

    Met en œuvre le contrôle d'accès basé sur les rôles, le masquage de colonnes et la sécurité au niveau des lignes sur les actifs de données. Protège les données sensibles tout en permettant un accès analytique approprié.

  • Leçon 4 • Contrats de données et attentes

    Introduit les contrats de schéma, les attentes au niveau des colonnes et les contrôles qualité automatisés dans les pipelines. Empêche les mauvaises données de se propager aux consommateurs en aval.

  • Leçon 5 • Dimensions et métriques de la qualité des données

    Définit l'exhaustivité, l'exactitude, la cohérence, l'actualité et l'unicité comme des dimensions de qualité mesurables. Donne aux étudiants un cadre pour évaluer et rapporter la santé des données.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Développeurs de logiciels prêts à se spécialiser dans l'infrastructure de données et les pipelines.

  • Analystes de données qui souhaitent passer des tableaux de bord aux rôles d'ingénierie.

  • Ingénieurs back-end curieux de savoir comment fonctionnent réellement les systèmes de données à grande échelle.

  • Jeunes diplômés cherchant une voie structurée vers une carrière technique très demandée.

  • Professionnels de la business intelligence dont les outils et responsabilités actuels deviennent trop limités.

  • Personnes en reconversion professionnelle avec un bagage technique souhaitant entrer dans le domaine des données.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF