Choisissez votre langue
Formation data engineer
Plus de 2 millions d'apprenants dans le monde

Formation data engineer

4,6

Maîtrise l'ensemble de la pile technologique d'ingénierie des données — de SQL et Python à Kafka, Spark et dbt. Ce cours te guide à travers chaque couche de l'infrastructure de données moderne, en te donnant les compétences pratiques que les employeurs recherchent activement. Construis de véritables pipelines, travaille avec des outils de l'industrie et sois prêt à livrer dès le premier jour.

Dedika pour entreprises

Ce que vous allez apprendre:

Tu apprendras à concevoir et à mettre en œuvre des pipelines de données de bout en bout qui déplacent, transforment et servent les données à grande échelle. Le cours couvre la modélisation relationnelle, le SQL avancé, le script Python et l'ingénierie d'entrepôt de données en nuage. Tu travailleras avec des outils comme Apache Airflow, dbt, Apache Kafka et Apache Spark. Les sujets abordés incluent les modèles d'ingestion de données, les architectures de streaming, les pratiques DataOps et les cadres de gouvernance des données. À la fin, tu auras la profondeur technique et l'expérience pratique nécessaires pour travailler en tant qu'ingénieur de données professionnel dans toute organisation moderne axée sur les données.

Comment vous étudiez de façon pratique Formation data engineer

Comment vous pratiquez Formation data engineer

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'ingénierie des données

  • Leçon 1 • Introduction aux patrons d'architecture de données

    Examine les styles architecturaux fondamentaux, notamment les entrepôts de données, les lacs de données et les lakehouses. Établit des liens entre les choix architecturaux, les exigences d'affaires et les objectifs d'évolutivité.

  • Leçon 2 • Concepts fondamentaux et terminologie des données

    Présente les types de données structurées, semi-structurées et non structurées, ainsi que les principales abstractions de stockage. Assure un vocabulaire commun avant d'aborder l'architecture et les outils.

  • Leçon 3 • Aperçu du cycle de vie de l'ingénierie des données

    Cartographie le parcours de bout en bout des données, de la source à la consommation. Fournit un modèle mental qui encadre chaque sujet technique abordé plus tard dans le cours.

  • Leçon 4 • Le rôle de l'ingénieur de données

    Définit les responsabilités de l'ingénieur de données au sein des équipes de données et des contextes d'affaires. Établit la base professionnelle nécessaire à tous les chapitres techniques ultérieurs.

Chapitre 2Voir les détails

SQL et modélisation de données relationnelles

  • Leçon 1 • SQL avancé pour l'ingénierie des données

    Présente les fonctions de fenêtre, les CTE et les opérations sur les ensembles pour les transformations analytiques complexes. Prépare les étudiants à rédiger du SQL de niveau professionnel utilisé dans les pipelines et les couches de création de rapports.

  • Leçon 2 • Modélisation dimensionnelle pour l'analyse

    Applique les patrons de schémas en étoile et en flocon de neige pour concevoir des modèles de données prêts pour l'analyse. Permet directement le travail sur l'entrepôt de données et la transformation couvert dans les chapitres suivants.

  • Leçon 3 • Techniques d'interrogation SQL de base

    Enseigne SELECT, le filtrage, l'agrégation et les jointures multi-tables pour la récupération de données. Ces compétences sous-tendent chaque charge de travail de transformation et d'analyse dans le cours.

  • Leçon 4 • Notions fondamentales sur les bases de données relationnelles

    Couvre les tables, les clés, les contraintes et les relations en tant qu'éléments constitutifs des systèmes relationnels. Ancre les étudiants dans la théorie nécessaire à une conception de schéma efficace.

Chapitre 3Voir les détails

Python pour l'ingénierie des données

  • Leçon 1 • Principes essentiels de Python pour le travail sur les données

    Passe en revue la syntaxe Python, les structures de données et le flux de contrôle pertinents pour les tâches de manipulation de données. Établit la base de programmation nécessaire à la création de scripts de pipeline tout au long du cours.

  • Leçon 2 • Gestion des fichiers et des formats de données

    Enseigne la lecture et l'écriture de fichiers CSV, JSON, Parquet et Avro à l'aide de bibliothèques Python. Soutient directement les tâches d'ingestion et de sérialisation dans les chapitres sur le développement de pipelines.

  • Leçon 3 • Automatisation et bonnes pratiques de script

    Présente la journalisation, la gestion de la configuration et l'empaquetage pour les scripts Python prêts pour la production. Prépare les étudiants à rédiger du code maintenable qui s'intègre dans des pipelines orchestrés.

  • Leçon 4 • Manipulation de données avec Pandas

    Couvre les opérations sur les DataFrames, la fusion, le remodelage et le nettoyage à l'aide de la bibliothèque Pandas. Fournit la boîte à outils de transformation utilisée dans le traitement par lots et le travail exploratoire sur les données.

  • Leçon 5 • Connexion de Python aux bases de données et aux API

    Démontre la connectivité aux bases de données via des pilotes SQL et la consommation d'API REST à l'aide de Python. Établit un pont entre les compétences en script et l'intégration de sources de données du monde réel couverte dans les chapitres sur l'ingestion.

Chapitre 4Voir les détails

Ingestion de données et conception de pipelines

  • Leçon 1 • Extraction de données à partir de sources relationnelles

    Couvre la CDC, l'extraction basée sur des horodatages et les extractions basées sur des requêtes à partir de bases de données relationnelles. S'appuie sur les compétences SQL pour mettre en œuvre des stratégies d'extraction fiables et à faible impact.

  • Leçon 2 • Principes de conception de pipelines

    Présente la modularité, l'idempotence, la gestion des erreurs et l'observabilité comme piliers de la conception de pipelines. Établit les normes d'ingénierie appliquées dans tous les chapitres suivants sur les pipelines.

  • Leçon 3 • Patrons d'ingestion et types de sources

    Examine les sources de données courantes, notamment les bases de données, les API, les fichiers et les flux d'événements. Encadre les décisions de conception d'ingestion qui orientent les choix d'architecture de pipeline.

  • Leçon 4 • Ingestion à partir d'API et de sources de fichiers

    Enseigne des approches structurées pour consommer les API REST, les sources FTP et les fichiers de stockage en nuage. Étend les compétences en API Python vers des patrons de pipelines d'ingestion de production.

  • Leçon 5 • Validation des données et contrôles de qualité

    Met en œuvre la validation de schéma, les contrôles de valeurs nulles et le profilage statistique dans les pipelines d'ingestion. Assure que la qualité des données est appliquée au point d'entrée avant le traitement en aval.

Chapitre 5Voir les détails

Stockage de données et ingénierie des entrepôts de données

  • Leçon 1 • Formats de table et normes de stockage ouvert

    Présente les formats de table ouverts qui permettent les transactions ACID et l'évolution de schéma sur le stockage d'objets. Prépare les étudiants aux implémentations de lakehouse couvertes dans les chapitres avancés.

  • Leçon 2 • Architecture d'entrepôt de données en nuage

    Examine le stockage en colonnes, les moteurs de requête MPP et la séparation du calcul et du stockage. Établit des liens entre les éléments internes de l'entrepôt et les décisions d'optimisation des performances et des coûts des requêtes.

  • Leçon 3 • Modélisation des données dans l'entrepôt

    Applique des techniques de modélisation dimensionnelle et en voûte dans les environnements d'entrepôt en nuage. S'appuie sur les compétences en modélisation relationnelle pour produire des couches d'entrepôt prêtes pour l'analyse.

  • Leçon 4 • Notions fondamentales sur le stockage d'objets en nuage

    Explique les concepts de stockage d'objets, l'organisation des compartiments, le partitionnement et le contrôle d'accès. Fournit la base de stockage qui sous-tend les lacs de données et les architectures lakehouse.

  • Leçon 5 • Optimisation des performances et des coûts des entrepôts

    Couvre le profilage des requêtes, les vues matérialisées, la mise en cache et les stratégies de dimensionnement des entrepôts. Équipe les étudiants pour équilibrer les performances et les coûts dans les environnements d'entrepôt de production.

Chapitre 6Voir les détails

Transformation des données et dbt

  • Leçon 1 • Patrons dbt avancés

    Couvre les macros, le templating Jinja, les packages et les stratégies incrémentielles pour les cas d'utilisation complexes. Étend les compétences de base de dbt pour gérer des exigences de transformation à grande échelle et dynamiques.

  • Leçon 2 • Tests et documentation dans dbt

    Met en œuvre des tests de schéma, des tests personnalisés et de la documentation générée automatiquement dans les projets dbt. Applique les normes de qualité des données et de maintenabilité dans les pipelines de transformation.

  • Leçon 3 • Architecture de la couche de transformation

    Définit les couches de transformation de préparation, intermédiaire et de magasin ainsi que leurs responsabilités. Établit le patron de conception en couches qui structure tout le travail sur les projets dbt dans ce chapitre.

  • Leçon 4 • Construction de modèles dbt

    Enseigne la rédaction de modèles SQL, la configuration des matérialisations et la gestion des dépendances entre les modèles dans dbt. Traduit les compétences SQL en un flux de travail de transformation modulaire et sous contrôle de version.

Chapitre 7Voir les détails

Orchestration de pipelines et gestion des flux de travail

  • Leçon 1 • Surveillance et observabilité des pipelines

    Établit des pratiques de journalisation, de métriques et de suivi de la lignée pour la visibilité des pipelines orchestrés. Établit des liens entre les outils d'observabilité et les thèmes de la qualité des données et de la gouvernance du cours.

  • Leçon 2 • Alternatives modernes d'orchestration

    Examine Prefect, Dagster et l'orchestration pilotée par les événements comme alternatives à Airflow. Équipe les étudiants pour évaluer les outils d'orchestration en fonction des exigences du projet et des contraintes de l'équipe.

  • Leçon 3 • Gestion des erreurs et stratégies de nouvelle tentative

    Met en œuvre des nouvelles tentatives, des SLA, des alertes et des rappels d'échec dans les flux de travail orchestrés. Assure que les pipelines répondent aux normes de fiabilité requises dans les environnements de données de production.

  • Leçon 4 • Concepts et patrons d'orchestration

    Présente la planification basée sur les DAG, la résolution des dépendances et la séparation de l'orchestration et de l'exécution. Encadre la couche d'orchestration qui relie l'ingestion, le stockage et la transformation.

  • Leçon 5 • Construction de flux de travail avec Apache Airflow

    Couvre l'architecture Airflow, les opérateurs, les hooks et la création de DAG en Python. Fournit une expérience pratique avec l'outil d'orchestration standard de l'industrie pour les pipelines de données.

Chapitre 8Voir les détails

Ingénierie des données en flux

  • Leçon 1 • Stockage et service des données en flux

    Aborde l'écriture des sorties de flux vers les lacs de données, les entrepôts et les magasins de service en temps réel. Établit des liens entre les pipelines de flux et les couches de stockage et de consommation construites dans les chapitres précédents.

  • Leçon 2 • Fiabilité et mise à l'échelle des pipelines de flux

    Couvre la contre-pression, le registre de schémas, les sujets de lettres mortes et la mise à l'échelle horizontale pour les systèmes de flux. Assure que les étudiants peuvent exploiter les pipelines de flux de manière fiable à l'échelle de la production.

  • Leçon 3 • Traitement de flux avec Apache Flink

    Enseigne le traitement de flux avec état, le fenêtrage et la gestion du temps d'événement à l'aide d'Apache Flink. S'appuie sur les connaissances de Kafka pour mettre en œuvre une logique de transformation et d'agrégation en temps réel.

  • Leçon 4 • Notions fondamentales sur les flux et cas d'utilisation

    Oppose le traitement en flux au traitement par lots et identifie les cas d'utilisation où des données en temps réel sont nécessaires. Établit les bases conceptuelles pour toutes les décisions relatives à l'architecture et aux outils de flux.

  • Leçon 5 • Architecture et opérations d'Apache Kafka

    Couvre les courtiers Kafka, les sujets, les partitions, les groupes de consommateurs et les API producteur/consommateur. Fournit les connaissances de base sur les systèmes de messagerie nécessaires à toutes les implémentations de pipelines de flux.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste d'affaires : prêt à passer de la consommation de données à leur ingénierie.

  • Développeur BI : souhaite posséder la couche pipeline derrière les tableaux de bord.

  • Développeur logiciel : cherche à se spécialiser dans l'infrastructure et les outils de données.

  • Diplômé récent : entre sur le marché du travail en se concentrant sur les rôles liés aux données.

  • Analyste de données : vise à passer à un poste d'ingénierie à plus fort impact.

  • Reconversion professionnelle : vient des TI ou des opérations et pivote vers l'ingénierie des données.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF