
Formation data engineer
Maîtrisez l'ensemble de la pile d'ingénierie des données — de SQL et Python à Kafka, Spark et dbt. Ce cours vous guide à travers chaque couche de l'infrastructure de données moderne, vous donnant les compétences pratiques que les employeurs recherchent activement. Construisez des pipelines réels, travaillez avec des outils standards de l'industrie et soyez prêt à livrer dès le premier jour.
Ce que vous allez apprendre:
Vous apprendrez à concevoir et à mettre en œuvre des pipelines de données de bout en bout qui déplacent, transforment et servent les données à grande échelle. Le cours couvre la modélisation relationnelle, le SQL avancé, les scripts Python et l'ingénierie des entrepôts de données cloud. Vous travaillerez avec des outils comme Apache Airflow, dbt, Apache Kafka et Apache Spark. Les sujets abordés incluent les modèles d'ingestion de données, les architectures de streaming, les pratiques DataOps et les cadres de gouvernance des données. À la fin, vous aurez la profondeur technique et l'expérience pratique nécessaires pour exercer en tant qu'ingénieur de données professionnel dans toute organisation moderne axée sur les données.
Comment vous étudiez de façon pratique Formation data engineer
Comment vous pratiquez Formation data engineer
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations de l'ingénierie des données
Fondations de l'ingénierie des données
Leçon 1 • Introduction aux modèles d'architecture de données
Passe en revue les styles architecturaux fondamentaux, notamment les entrepôts de données, les lacs de données et les lakehouses. Relie les choix architecturaux aux besoins métier et aux objectifs d'évolutivité.
Leçon 2 • Concepts clés et terminologie des données
Présente les types de données structurées, semi-structurées et non structurées ainsi que les principales abstractions de stockage. Assure un vocabulaire partagé avant de plonger dans l'architecture et les outils.
Leçon 3 • Aperçu du cycle de vie de l'ingénierie des données
Cartographie le parcours de bout en bout des données, de la source à la consommation. Fournit un modèle mental qui encadre chaque sujet technique abordé plus tard dans la formation.
Leçon 4 • Le rôle de l'ingénieur de données
Définit les responsabilités de l'ingénieur de données au sein des équipes données et des contextes métier. Établit la base professionnelle nécessaire pour tous les chapitres techniques suivants.
Chapitre 2MasquerCacher les détailsVoir les détailsSQL et modélisation de données relationnelles
SQL et modélisation de données relationnelles
Leçon 1 • SQL avancé pour l'ingénierie des données
Présente les fonctions de fenêtrage, les CTE et les opérations ensemblistes pour des transformations analytiques complexes. Prépare les apprenants à écrire du SQL de niveau production utilisé dans les pipelines et les couches de reporting.
Leçon 2 • Modélisation dimensionnelle pour l'analyse
Applique les modèles de schémas en étoile et en flocon de neige pour concevoir des modèles de données prêts pour l'analyse. Permet directement le travail sur l'entrepôt de données et la transformation couvert dans les chapitres suivants.
Leçon 3 • Techniques de requêtage SQL de base
Enseigne SELECT, le filtrage, l'agrégation et les jointures multi-tables pour la récupération de données. Ces compétences sous-tendent chaque charge de travail de transformation et d'analyse dans la formation.
Leçon 4 • Fondamentaux des bases de données relationnelles
Couvre les tables, les clés, les contraintes et les relations comme éléments de base des systèmes relationnels. Ancre les apprenants dans la théorie nécessaire pour une conception de schéma efficace.
Chapitre 3MasquerCacher les détailsVoir les détailsPython pour l'ingénierie des données
Python pour l'ingénierie des données
Leçon 1 • L'essentiel de Python pour le travail sur les données
Passe en revue la syntaxe Python, les structures de données et le flux de contrôle pertinents pour les tâches de manipulation de données. Établit les bases de programmation nécessaires pour l'écriture de scripts de pipeline tout au long de la formation.
Leçon 2 • Gestion des fichiers et des formats de données
Enseigne la lecture et l'écriture de fichiers CSV, JSON, Parquet et Avro à l'aide de bibliothèques Python. Soutient directement les tâches d'ingestion et de sérialisation dans les chapitres sur le développement de pipelines.
Leçon 3 • Bonnes pratiques d'automatisation et de script
Présente la journalisation, la gestion de la configuration et le packaging pour des scripts Python prêts pour la production. Prépare les apprenants à écrire du code maintenable qui s'intègre dans des pipelines orchestrés.
Leçon 4 • Manipulation de données avec Pandas
Couvre les opérations sur les DataFrames, la fusion, le remodelage et le nettoyage à l'aide de la bibliothèque Pandas. Fournit la boîte à outils de transformation utilisée dans le traitement par lots et le travail exploratoire sur les données.
Leçon 5 • Connexion de Python aux bases de données et aux API
Démontre la connectivité aux bases de données via des pilotes SQL et la consommation d'API REST à l'aide de Python. Fait le pont entre les compétences en script et l'intégration de sources de données réelles couverte dans les chapitres sur l'ingestion.
Chapitre 4MasquerCacher les détailsVoir les détailsIngestion de données et conception de pipelines
Ingestion de données et conception de pipelines
Leçon 1 • Extraction de données à partir de sources relationnelles
Couvre la capture de données modifiées (CDC), l'extraction basée sur des horodatages et les extractions basées sur des requêtes à partir de bases de données relationnelles. S'appuie sur les compétences SQL pour mettre en œuvre des stratégies d'extraction fiables et à faible impact.
Leçon 2 • Principes de conception de pipelines
Présente la modularité, l'idempotence, la gestion des erreurs et l'observabilité comme piliers de la conception de pipelines. Établit les normes d'ingénierie appliquées dans tous les chapitres suivants sur les pipelines.
Leçon 3 • Modèles d'ingestion et types de sources
Passe en revue les sources de données courantes, y compris les bases de données, les API, les fichiers et les flux d'événements. Encadre les décisions de conception d'ingestion qui déterminent les choix d'architecture de pipeline.
Leçon 4 • Ingestion à partir d'API et de sources de fichiers
Enseigne des approches structurées pour consommer des API REST, des sources FTP et des fichiers de stockage en nuage. Étend les compétences Python en API vers des modèles de pipeline d'ingestion de production.
Leçon 5 • Validation des données et contrôles de qualité
Met en œuvre la validation de schéma, les contrôles de nullité et le profilage statistique dans les pipelines d'ingestion. Garantit que la qualité des données est appliquée au point d'entrée avant le traitement en aval.
Chapitre 5MasquerCacher les détailsVoir les détailsStockage de données et ingénierie d'entrepôt
Stockage de données et ingénierie d'entrepôt
Leçon 1 • Formats de table et normes de stockage ouvertes
Présente les formats de table ouverts qui permettent les transactions ACID et l'évolution du schéma sur le stockage d'objets. Prépare les apprenants aux implémentations lakehouse couvertes dans les chapitres avancés.
Leçon 2 • Architecture d'un entrepôt de données en nuage
Examine le stockage columnar, les moteurs de requête MPP et la séparation du calcul et du stockage. Relie les aspects internes de l'entrepôt aux décisions de performance des requêtes et d'optimisation des coûts.
Leçon 3 • Modélisation des données dans l'entrepôt
Applique les techniques de modélisation dimensionnelle et de data vault dans les environnements d'entrepôt en nuage. S'appuie sur les compétences en modélisation relationnelle pour produire des couches d'entrepôt prêtes pour l'analyse.
Leçon 4 • Fondamentaux du stockage d'objets en nuage
Explique les concepts de stockage d'objets, l'organisation des buckets, le partitionnement et le contrôle d'accès. Fournit la base de stockage sous-jacente aux architectures de lacs de données et de lakehouses.
Leçon 5 • Performance de l'entrepôt et optimisation des coûts
Couvre le profilage des requêtes, les vues matérialisées, la mise en cache et les stratégies de dimensionnement de l'entrepôt. Équipe les apprenants pour équilibrer performance et coût dans les environnements d'entrepôt de production.
Chapitre 6MasquerCacher les détailsVoir les détailsTransformation de données et dbt
Transformation de données et dbt
Leçon 1 • Modèles dbt avancés
Couvre les macros, le templating Jinja, les packages et les stratégies incrémentielles pour des cas d'utilisation complexes. Étend les compétences de base en dbt pour gérer des besoins de transformation à grande échelle et dynamiques.
Leçon 2 • Tests et documentation dans dbt
Met en œuvre des tests de schéma, des tests personnalisés et de la documentation générée automatiquement dans les projets dbt. Applique les normes de qualité des données et de maintenabilité dans les pipelines de transformation.
Leçon 3 • Architecture de la couche de transformation
Définit les couches de transformation de staging, intermédiaire et de marts ainsi que leurs responsabilités. Établit le modèle de conception en couches qui structure tout le travail du projet dbt dans ce chapitre.
Leçon 4 • Construction de modèles dbt
Enseigne l'écriture de modèles SQL, la configuration des matérialisations et la gestion des dépendances de modèles dans dbt. Traduit les compétences SQL en un flux de travail de transformation modulaire et versionné.
Chapitre 7MasquerCacher les détailsVoir les détailsOrchestration de pipelines et gestion des flux de travail
Orchestration de pipelines et gestion des flux de travail
Leçon 1 • Surveillance et observabilité des pipelines
Établit des pratiques de journalisation, de métriques et de suivi de lignée pour la visibilité des pipelines orchestrés. Relie l'outillage d'observabilité aux thèmes de qualité des données et de gouvernance de la formation.
Leçon 2 • Alternatives modernes d'orchestration
Passe en revue Prefect, Dagster et l'orchestration pilotée par les événements comme alternatives à Airflow. Équipe les apprenants pour évaluer les outils d'orchestration en fonction des exigences du projet et des contraintes de l'équipe.
Leçon 3 • Stratégies de gestion des erreurs et de nouvelles tentatives
Met en œuvre les nouvelles tentatives, les SLA, l'alerting et les callbacks d'échec dans les flux de travail orchestrés. Garantit que les pipelines répondent aux normes de fiabilité requises dans les environnements de données de production.
Leçon 4 • Concepts et modèles d'orchestration
Présente la planification basée sur les DAG, la résolution des dépendances et la séparation de l'orchestration et de l'exécution. Encadre la couche d'orchestration qui relie l'ingestion, le stockage et la transformation.
Leçon 5 • Construction de flux de travail avec Apache Airflow
Couvre l'architecture d'Airflow, les opérateurs, les hooks et la création de DAG en Python. Fournit une expérience pratique avec l'outil d'orchestration standard de l'industrie pour les pipelines de données.
Chapitre 8MasquerCacher les détailsVoir les détailsIngénierie des données en streaming
Ingénierie des données en streaming
Leçon 1 • Stockage et mise à disposition des données en streaming
Traite de l'écriture des sorties de streaming vers les lacs de données, les entrepôts et les magasins de mise à disposition en temps réel. Relie les pipelines de streaming aux couches de stockage et de consommation construites dans les chapitres précédents.
Leçon 2 • Fiabilité et mise à l'échelle des pipelines de streaming
Couvre la contrepression, le registre des schémas, les sujets de lettres mortes et la mise à l'échelle horizontale pour les systèmes de streaming. Garantit que les apprenants peuvent exploiter les pipelines de streaming de manière fiable à l'échelle de la production.
Leçon 3 • Traitement de flux avec Apache Flink
Enseigne le traitement de flux avec état, le fenêtrage et la gestion du temps d'événement avec Apache Flink. S'appuie sur les connaissances de Kafka pour mettre en œuvre une logique de transformation et d'agrégation en temps réel.
Leçon 4 • Fondamentaux du streaming et cas d'utilisation
Contraste le streaming avec le traitement par lots et identifie les cas d'utilisation où les données en temps réel sont nécessaires. Établit les bases conceptuelles pour toutes les décisions d'architecture et d'outillage de streaming.
Leçon 5 • Architecture et opérations d'Apache Kafka
Couvre les brokers Kafka, les sujets, les partitions, les groupes de consommateurs et les API producteur/consommateur. Fournit les connaissances de la colonne vertébrale de messagerie nécessaires pour toutes les implémentations de pipelines de streaming.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste métier : prêt à passer de la consommation de données à leur ingénierie.
Développeur BI : souhaite posséder la couche pipeline derrière les tableaux de bord.
Développeur logiciel : cherche à se spécialiser dans l'infrastructure et les outils de données.
Jeune diplômé : entre sur le marché du travail avec un focus sur les rôles de données.
Analyste de données : vise à évoluer vers un poste d'ingénieur à plus fort impact.
Personne en reconversion : vient de l'informatique ou des opérations et pivote vers l'ingénierie des données.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Côte d’Ivoire ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















