Choisissez votre langue
Formation Ingénieur Big Data
Plus de 2 millions d'étudiants dans le monde

Formation Ingénieur Big Data

Maîtrisez l'ensemble de la stack d'ingénierie des données — du stockage distribué et d'Apache Spark au streaming temps réel avec Kafka et Flink. Ce cours vous donne les compétences pratiques pour concevoir, construire et exploiter des pipelines de données de production à grande échelle. Si vous êtes sérieux au sujet d'une carrière en ingénierie des données, c'est par là qu'il faut commencer.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous développerez une compréhension approfondie des fondamentaux du big data, du stockage distribué avec HDFS et de l'intégration du stockage objet dans le cloud. Vous réaliserez des traitements par lots prêts pour la production avec Apache Spark et des pipelines temps réel avec Apache Flink et Spark Structured Streaming. Le cours couvre l'ingestion de données avec Kafka et la capture de données modifiées (CDC), la conception d'entrepôts et de lacs de données avec Delta Lake, Iceberg et dbt, ainsi que l'orchestration complète des pipelines avec Apache Airflow. Vous acquerrez également des compétences pratiques dans le déploiement Kubernetes, la gouvernance des données et l'infrastructure ML. À la fin, vous aurez la profondeur technique et l'étendue des outils qu'exigent les rôles modernes en ingénierie des données.

Comment vous étudiez de façon pratique Formation Ingénieur Big Data

Comment vous pratiquez Formation Ingénieur Big Data

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux du Big Data et écosystème

  • Leçon 1 • Rôle et responsabilités du Data Engineer

    Définit le périmètre du data engineer par rapport aux data scientists et aux analystes. Clarifie la responsabilité des pipelines, de la fiabilité et de la qualité des données.

  • Leçon 2 • Patrons d'architecture Big Data

    Présente les architectures Lambda et Kappa ainsi que leurs compromis. Fournit le contexte structurel pour tous les designs de pipelines abordés ultérieurement.

  • Leçon 3 • Définition du Big Data et de ses dimensions

    Couvre le framework des 5 V et les moteurs réels de croissance des données. Établit le vocabulaire utilisé tout au long du cours.

  • Leçon 4 • La stack moderne de data engineering

    Fait correspondre les principales catégories d'outils (ingestion, stockage, traitement et orchestration) aux rôles d'ingénierie. Les étudiants acquièrent un modèle mental pour l'ensemble du cours.

Chapitre 2Voir les détails

Bases de Linux, du réseau et du cloud

  • Leçon 1 • Concepts réseau pour le data engineering

    Explique TCP/IP, DNS, les ports et les pare-feu dans le contexte des systèmes distribués. Permet aux étudiants de résoudre les problèmes de connectivité dans les environnements de cluster.

  • Leçon 2 • Fondamentaux de l'infrastructure cloud

    Présente les primitives de calcul, de stockage et de réseau chez les principaux fournisseurs de cloud. Les étudiants peuvent déployer et configurer des machines virtuelles et des buckets de stockage d'objets.

  • Leçon 3 • Conteneurisation avec Docker

    Enseigne la création et l'exécution de conteneurs pour des environnements de data engineering reproductibles. Les conteneurs sont utilisés dans les travaux pratiques à partir du chapitre suivant.

  • Leçon 4 • Bases essentielles de la ligne de commande Linux

    Couvre la navigation dans le système de fichiers, les permissions et les bases du scripting shell. Ces compétences sous-tendent la gestion des clusters et les tâches d'automatisation tout au long du cours.

Chapitre 3Voir les détails

Stockage distribué et HDFS

  • Leçon 1 • Architecture HDFS et mécanismes internes

    Explique les rôles NameNode et DataNode, la réplication des blocs et la tolérance aux pannes. Fournit les fondations du stockage nécessaires avant d'introduire les frameworks de traitement.

  • Leçon 2 • Formats de données pour le stockage distribué

    Compare les formats lignes et colonnes, notamment Avro, Parquet et ORC. Le choix du format a un impact direct sur les performances des requêtes dans les chapitres ultérieurs sur le traitement.

  • Leçon 3 • Intégration du stockage d'objets cloud

    Montre comment utiliser le stockage d'objets cloud comme un remplacement direct de HDFS. Prépare les étudiants aux architectures de pipelines cloud-natives présentées ultérieurement.

  • Leçon 4 • Principes de conception d'un data lake

    Présente l'architecture du data lake basée sur des zones : couches brutes, enrichies et de consommation. Les étudiants conçoivent des agencements de stockage qui prennent en charge les pipelines d'analyse en aval.

  • Leçon 5 • Opérations et administration HDFS

    Couvre la CLI HDFS, la gestion des quotas et la surveillance de la santé du cluster. Les étudiants acquièrent des compétences pratiques pour l'administration quotidienne du stockage.

Chapitre 4Voir les détails

Traitement par lots avec Apache Spark

  • Leçon 1 • Réglage des performances Spark

    Aborde le partitionnement, la mise en cache, la sérialisation et la gestion de la mémoire pour les jobs de production. Les étudiants réduisent considérablement les temps d'exécution des jobs et les coûts des ressources.

  • Leçon 2 • Architecture et modèle d'exécution Spark

    Explique le driver, l'executor, le planificateur DAG et l'exécution des tâches. La compréhension des mécanismes internes est un prérequis pour écrire du code Spark efficace.

  • Leçon 3 • RDD, DataFrames et Datasets

    Couvre les trois couches d'abstraction Spark et le moment d'utiliser chacune d'elles. Va des opérations RDD de bas niveau aux transformations DataFrame de haut niveau.

  • Leçon 4 • Spark SQL et manipulation des données

    Enseigne les requêtes SQL, les fonctions de fenêtrage et les agrégations complexes sur les DataFrames. Permet aux analystes devenus ingénieurs d'exploiter leurs compétences SQL existantes dans Spark.

  • Leçon 5 • Lecture et écriture de sources de données

    Couvre les connecteurs pour HDFS, le stockage d'objets, JDBC, Kafka et Delta Lake. Connecte Spark aux couches de stockage et de streaming construites dans les chapitres précédents.

Chapitre 5Voir les détails

Systèmes d'ingestion et de messagerie

  • Leçon 1 • Ingestion par lots avec Apache Sqoop et alternatives

    Couvre l'extraction en masse de bases de données relationnelles à l'aide de Sqoop et d'alternatives modernes. Complète la boîte à outils d'ingestion pour les systèmes sources en continu et par lots.

  • Leçon 2 • Production et consommation de messages

    Couvre les paramètres d'accusé de réception du producteur, la gestion des offsets du consommateur et la sémantique exactly-once. Les étudiants écrivent des producteurs et des consommateurs fiables en Python et Java.

  • Leçon 3 • Techniques de Change Data Capture

    Présente la CDC à l'aide des journaux de transactions de bases de données pour capturer les modifications au niveau des lignes. Permet une synchronisation quasi temps réel entre les bases de données opérationnelles et le data lake.

  • Leçon 4 • Architecture Apache Kafka

    Explique les brokers, les topics, les partitions, les groupes de consommateurs et la réplication. Cette architecture sous-tend tous les pipelines en continu construits dans les chapitres suivants.

  • Leçon 5 • Kafka Connect pour l'ingestion par lots

    Montre les connecteurs source et sink pour les bases de données, le stockage d'objets et les systèmes de fichiers. Réduit le code personnalisé pour les modèles d'ingestion courants.

Chapitre 6Voir les détails

Traitement en continu avec Apache Flink et Spark Streaming

  • Leçon 1 • Fiabilité et surveillance des pipelines de streaming

    Aborde la contre-pression, le retard du consommateur, la reprise après panne et les alertes pour les jobs de streaming. Garantit que les étudiants peuvent exploiter des pipelines de streaming en production.

  • Leçon 2 • Architecture et API Apache Flink

    Couvre le JobManager, le TaskManager, l'API DataStream et l'API Table de Flink. Les étudiants écrivent des jobs de streaming avec état garantissant la sémantique exactly-once.

  • Leçon 3 • Fondamentaux du traitement en continu

    Définit le temps d'événement, le temps de traitement, les watermarks et la sémantique des fenêtres. Ces concepts sont un prérequis pour écrire des applications de streaming correctes.

  • Leçon 4 • Streaming Structuré Spark

    Enseigne les modes de traitement micro-batch et continu de Spark Structured Streaming. Exploite les compétences existantes sur les DataFrames Spark pour les charges de travail de streaming.

  • Leçon 5 • Patrons de traitement en continu avec état

    Met en œuvre la déduplication, la sessionisation et la détection de motifs à l'aide d'un état géré. Prépare les étudiants à des cas d'usage de streaming complexes du monde réel.

Chapitre 7Voir les détails

Architectures d'entrepôt de données et de lakehouse

  • Leçon 1 • Plateformes cloud d'entrepôt de données

    Compare les architectures d'entrepôt cloud MPP et leurs modèles de séparation calcul-stockage. Les étudiants chargent, transforment et interrogent de grands ensembles de données à l'aide du SQL d'entrepôt.

  • Leçon 2 • Formats Apache Iceberg et Hudi

    Couvre le partitionnement caché d'Iceberg et les capacités d'upsert de Hudi comme alternatives à Delta Lake. Les étudiants sélectionnent le format de table ouvert adapté à leur cas d'usage.

  • Leçon 3 • Delta Lake et formats de table

    Présente les transactions ACID, le voyage dans le temps et l'application du schéma dans Delta Lake. Fait le pont entre le stockage brut du data lake et la fiabilité de type entrepôt de données.

  • Leçon 4 • Fondamentaux de la modélisation d'entrepôt de données

    Couvre le schéma en étoile, le schéma en flocon, les dimensions à évolution lente et la conception de tables de faits. Fournit le vocabulaire de modélisation utilisé dans les implémentations d'entrepôts de données et de lakehouses.

  • Leçon 5 • Transformation ELT avec dbt

    Enseigne la création de pipelines de transformation SQL modulaires à l'aide de dbt dans l'entrepôt. Connecte les données brutes ingérées aux modèles prêts pour l'analyse.

Chapitre 8Voir les détails

Orchestration de pipelines et DataOps

  • Leçon 1 • Architecture Apache Airflow et DAG

    Couvre le planificateur, l'exécuteur, la base de données de métadonnées et la création de DAG d'Airflow. Établit les fondations d'orchestration pour toute l'automatisation des pipelines dans ce chapitre.

  • Leçon 2 • CI/CD et Infrastructure as Code pour les pipelines

    Applique les workflows Git, les tests automatisés et Terraform au déploiement de pipelines. Les étudiants livrent les modifications en production de manière sûre et reproductible.

  • Leçon 3 • Patrons de conception avancés pour les DAG

    Enseigne la génération dynamique de DAG, le branchement et les dépendances entre DAG. Permet aux étudiants de construire des patrons d'orchestration flexibles et réutilisables.

  • Leçon 4 • Qualité des données et tests de pipeline

    Met en œuvre des contrôles de qualité des données à l'aide de Great Expectations et des tests dbt dans les pipelines. Empêche la propagation de mauvaises données aux consommateurs aval.

  • Leçon 5 • Orchestration moderne avec Prefect et Dagster

    Présente les flows Prefect et les assets Dagster comme alternatives à Airflow. Les étudiants évaluent les outils d'orchestration en fonction de la complexité des pipelines et des besoins de l'équipe.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Développeurs logiciels prêts à se spécialiser dans les rôles d'infrastructure de données à grande échelle.

  • Analystes de données qui souhaitent remonter en amont et posséder les pipelines dont ils dépendent.

  • Ingénieurs back-end curieux des systèmes distribués et du traitement de données en temps réel.

  • Jeunes diplômés en informatique visant des postes d'ingénierie des données très recherchés.

  • Professionnels DevOps cherchant à évoluer vers l'ingénierie de plateformes de données cloud-native.

  • Développeurs BI qui souhaitent une propriété technique plus profonde au-delà des tableaux de bord et des rapports.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF