
Formation data engineer
Maîtrise l'ensemble de la pile technologique d'ingénierie des données — de SQL et Python à Kafka, Spark et dbt. Ce cours te guide à travers chaque couche de l'infrastructure de données moderne, en te donnant les compétences pratiques que les employeurs recherchent activement. Construis de véritables pipelines, travaille avec des outils de l'industrie et sois prêt à livrer dès le premier jour.
Ce que vous allez apprendre:
Tu apprendras à concevoir et à mettre en œuvre des pipelines de données de bout en bout qui déplacent, transforment et servent les données à grande échelle. Le cours couvre la modélisation relationnelle, le SQL avancé, le script Python et l'ingénierie d'entrepôt de données en nuage. Tu travailleras avec des outils comme Apache Airflow, dbt, Apache Kafka et Apache Spark. Les sujets abordés incluent les modèles d'ingestion de données, les architectures de streaming, les pratiques DataOps et les cadres de gouvernance des données. À la fin, tu auras la profondeur technique et l'expérience pratique nécessaires pour travailler en tant qu'ingénieur de données professionnel dans toute organisation moderne axée sur les données.
Comment vous étudiez de façon pratique Formation data engineer
Comment vous pratiquez Formation data engineer
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'ingénierie des données
Fondements de l'ingénierie des données
Leçon 1 • Introduction aux patrons d'architecture de données
Examine les styles architecturaux fondamentaux, notamment les entrepôts de données, les lacs de données et les lakehouses. Établit des liens entre les choix architecturaux, les exigences d'affaires et les objectifs d'évolutivité.
Leçon 2 • Concepts fondamentaux et terminologie des données
Présente les types de données structurées, semi-structurées et non structurées, ainsi que les principales abstractions de stockage. Assure un vocabulaire commun avant d'aborder l'architecture et les outils.
Leçon 3 • Aperçu du cycle de vie de l'ingénierie des données
Cartographie le parcours de bout en bout des données, de la source à la consommation. Fournit un modèle mental qui encadre chaque sujet technique abordé plus tard dans le cours.
Leçon 4 • Le rôle de l'ingénieur de données
Définit les responsabilités de l'ingénieur de données au sein des équipes de données et des contextes d'affaires. Établit la base professionnelle nécessaire à tous les chapitres techniques ultérieurs.
Chapitre 2MasquerCacher les détailsVoir les détailsSQL et modélisation de données relationnelles
SQL et modélisation de données relationnelles
Leçon 1 • SQL avancé pour l'ingénierie des données
Présente les fonctions de fenêtre, les CTE et les opérations sur les ensembles pour les transformations analytiques complexes. Prépare les étudiants à rédiger du SQL de niveau professionnel utilisé dans les pipelines et les couches de création de rapports.
Leçon 2 • Modélisation dimensionnelle pour l'analyse
Applique les patrons de schémas en étoile et en flocon de neige pour concevoir des modèles de données prêts pour l'analyse. Permet directement le travail sur l'entrepôt de données et la transformation couvert dans les chapitres suivants.
Leçon 3 • Techniques d'interrogation SQL de base
Enseigne SELECT, le filtrage, l'agrégation et les jointures multi-tables pour la récupération de données. Ces compétences sous-tendent chaque charge de travail de transformation et d'analyse dans le cours.
Leçon 4 • Notions fondamentales sur les bases de données relationnelles
Couvre les tables, les clés, les contraintes et les relations en tant qu'éléments constitutifs des systèmes relationnels. Ancre les étudiants dans la théorie nécessaire à une conception de schéma efficace.
Chapitre 3MasquerCacher les détailsVoir les détailsPython pour l'ingénierie des données
Python pour l'ingénierie des données
Leçon 1 • Principes essentiels de Python pour le travail sur les données
Passe en revue la syntaxe Python, les structures de données et le flux de contrôle pertinents pour les tâches de manipulation de données. Établit la base de programmation nécessaire à la création de scripts de pipeline tout au long du cours.
Leçon 2 • Gestion des fichiers et des formats de données
Enseigne la lecture et l'écriture de fichiers CSV, JSON, Parquet et Avro à l'aide de bibliothèques Python. Soutient directement les tâches d'ingestion et de sérialisation dans les chapitres sur le développement de pipelines.
Leçon 3 • Automatisation et bonnes pratiques de script
Présente la journalisation, la gestion de la configuration et l'empaquetage pour les scripts Python prêts pour la production. Prépare les étudiants à rédiger du code maintenable qui s'intègre dans des pipelines orchestrés.
Leçon 4 • Manipulation de données avec Pandas
Couvre les opérations sur les DataFrames, la fusion, le remodelage et le nettoyage à l'aide de la bibliothèque Pandas. Fournit la boîte à outils de transformation utilisée dans le traitement par lots et le travail exploratoire sur les données.
Leçon 5 • Connexion de Python aux bases de données et aux API
Démontre la connectivité aux bases de données via des pilotes SQL et la consommation d'API REST à l'aide de Python. Établit un pont entre les compétences en script et l'intégration de sources de données du monde réel couverte dans les chapitres sur l'ingestion.
Chapitre 4MasquerCacher les détailsVoir les détailsIngestion de données et conception de pipelines
Ingestion de données et conception de pipelines
Leçon 1 • Extraction de données à partir de sources relationnelles
Couvre la CDC, l'extraction basée sur des horodatages et les extractions basées sur des requêtes à partir de bases de données relationnelles. S'appuie sur les compétences SQL pour mettre en œuvre des stratégies d'extraction fiables et à faible impact.
Leçon 2 • Principes de conception de pipelines
Présente la modularité, l'idempotence, la gestion des erreurs et l'observabilité comme piliers de la conception de pipelines. Établit les normes d'ingénierie appliquées dans tous les chapitres suivants sur les pipelines.
Leçon 3 • Patrons d'ingestion et types de sources
Examine les sources de données courantes, notamment les bases de données, les API, les fichiers et les flux d'événements. Encadre les décisions de conception d'ingestion qui orientent les choix d'architecture de pipeline.
Leçon 4 • Ingestion à partir d'API et de sources de fichiers
Enseigne des approches structurées pour consommer les API REST, les sources FTP et les fichiers de stockage en nuage. Étend les compétences en API Python vers des patrons de pipelines d'ingestion de production.
Leçon 5 • Validation des données et contrôles de qualité
Met en œuvre la validation de schéma, les contrôles de valeurs nulles et le profilage statistique dans les pipelines d'ingestion. Assure que la qualité des données est appliquée au point d'entrée avant le traitement en aval.
Chapitre 5MasquerCacher les détailsVoir les détailsStockage de données et ingénierie des entrepôts de données
Stockage de données et ingénierie des entrepôts de données
Leçon 1 • Formats de table et normes de stockage ouvert
Présente les formats de table ouverts qui permettent les transactions ACID et l'évolution de schéma sur le stockage d'objets. Prépare les étudiants aux implémentations de lakehouse couvertes dans les chapitres avancés.
Leçon 2 • Architecture d'entrepôt de données en nuage
Examine le stockage en colonnes, les moteurs de requête MPP et la séparation du calcul et du stockage. Établit des liens entre les éléments internes de l'entrepôt et les décisions d'optimisation des performances et des coûts des requêtes.
Leçon 3 • Modélisation des données dans l'entrepôt
Applique des techniques de modélisation dimensionnelle et en voûte dans les environnements d'entrepôt en nuage. S'appuie sur les compétences en modélisation relationnelle pour produire des couches d'entrepôt prêtes pour l'analyse.
Leçon 4 • Notions fondamentales sur le stockage d'objets en nuage
Explique les concepts de stockage d'objets, l'organisation des compartiments, le partitionnement et le contrôle d'accès. Fournit la base de stockage qui sous-tend les lacs de données et les architectures lakehouse.
Leçon 5 • Optimisation des performances et des coûts des entrepôts
Couvre le profilage des requêtes, les vues matérialisées, la mise en cache et les stratégies de dimensionnement des entrepôts. Équipe les étudiants pour équilibrer les performances et les coûts dans les environnements d'entrepôt de production.
Chapitre 6MasquerCacher les détailsVoir les détailsTransformation des données et dbt
Transformation des données et dbt
Leçon 1 • Patrons dbt avancés
Couvre les macros, le templating Jinja, les packages et les stratégies incrémentielles pour les cas d'utilisation complexes. Étend les compétences de base de dbt pour gérer des exigences de transformation à grande échelle et dynamiques.
Leçon 2 • Tests et documentation dans dbt
Met en œuvre des tests de schéma, des tests personnalisés et de la documentation générée automatiquement dans les projets dbt. Applique les normes de qualité des données et de maintenabilité dans les pipelines de transformation.
Leçon 3 • Architecture de la couche de transformation
Définit les couches de transformation de préparation, intermédiaire et de magasin ainsi que leurs responsabilités. Établit le patron de conception en couches qui structure tout le travail sur les projets dbt dans ce chapitre.
Leçon 4 • Construction de modèles dbt
Enseigne la rédaction de modèles SQL, la configuration des matérialisations et la gestion des dépendances entre les modèles dans dbt. Traduit les compétences SQL en un flux de travail de transformation modulaire et sous contrôle de version.
Chapitre 7MasquerCacher les détailsVoir les détailsOrchestration de pipelines et gestion des flux de travail
Orchestration de pipelines et gestion des flux de travail
Leçon 1 • Surveillance et observabilité des pipelines
Établit des pratiques de journalisation, de métriques et de suivi de la lignée pour la visibilité des pipelines orchestrés. Établit des liens entre les outils d'observabilité et les thèmes de la qualité des données et de la gouvernance du cours.
Leçon 2 • Alternatives modernes d'orchestration
Examine Prefect, Dagster et l'orchestration pilotée par les événements comme alternatives à Airflow. Équipe les étudiants pour évaluer les outils d'orchestration en fonction des exigences du projet et des contraintes de l'équipe.
Leçon 3 • Gestion des erreurs et stratégies de nouvelle tentative
Met en œuvre des nouvelles tentatives, des SLA, des alertes et des rappels d'échec dans les flux de travail orchestrés. Assure que les pipelines répondent aux normes de fiabilité requises dans les environnements de données de production.
Leçon 4 • Concepts et patrons d'orchestration
Présente la planification basée sur les DAG, la résolution des dépendances et la séparation de l'orchestration et de l'exécution. Encadre la couche d'orchestration qui relie l'ingestion, le stockage et la transformation.
Leçon 5 • Construction de flux de travail avec Apache Airflow
Couvre l'architecture Airflow, les opérateurs, les hooks et la création de DAG en Python. Fournit une expérience pratique avec l'outil d'orchestration standard de l'industrie pour les pipelines de données.
Chapitre 8MasquerCacher les détailsVoir les détailsIngénierie des données en flux
Ingénierie des données en flux
Leçon 1 • Stockage et service des données en flux
Aborde l'écriture des sorties de flux vers les lacs de données, les entrepôts et les magasins de service en temps réel. Établit des liens entre les pipelines de flux et les couches de stockage et de consommation construites dans les chapitres précédents.
Leçon 2 • Fiabilité et mise à l'échelle des pipelines de flux
Couvre la contre-pression, le registre de schémas, les sujets de lettres mortes et la mise à l'échelle horizontale pour les systèmes de flux. Assure que les étudiants peuvent exploiter les pipelines de flux de manière fiable à l'échelle de la production.
Leçon 3 • Traitement de flux avec Apache Flink
Enseigne le traitement de flux avec état, le fenêtrage et la gestion du temps d'événement à l'aide d'Apache Flink. S'appuie sur les connaissances de Kafka pour mettre en œuvre une logique de transformation et d'agrégation en temps réel.
Leçon 4 • Notions fondamentales sur les flux et cas d'utilisation
Oppose le traitement en flux au traitement par lots et identifie les cas d'utilisation où des données en temps réel sont nécessaires. Établit les bases conceptuelles pour toutes les décisions relatives à l'architecture et aux outils de flux.
Leçon 5 • Architecture et opérations d'Apache Kafka
Couvre les courtiers Kafka, les sujets, les partitions, les groupes de consommateurs et les API producteur/consommateur. Fournit les connaissances de base sur les systèmes de messagerie nécessaires à toutes les implémentations de pipelines de flux.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste d'affaires : prêt à passer de la consommation de données à leur ingénierie.
Développeur BI : souhaite posséder la couche pipeline derrière les tableaux de bord.
Développeur logiciel : cherche à se spécialiser dans l'infrastructure et les outils de données.
Diplômé récent : entre sur le marché du travail en se concentrant sur les rôles liés aux données.
Analyste de données : vise à passer à un poste d'ingénierie à plus fort impact.
Reconversion professionnelle : vient des TI ou des opérations et pivote vers l'ingénierie des données.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















