Choisissez votre langue
Formation Ingénieur Big Data
Plus de 2 millions d'apprenants dans le monde

Formation Ingénieur Big Data

Maîtrisez l'ensemble de la pile d'ingénierie big data — du stockage distribué et Apache Spark au streaming en temps réel avec Kafka et Flink. Ce cours vous donne les compétences pratiques pour concevoir, construire et exploiter des pipelines de données de qualité production à grande échelle. Si vous êtes sérieux au sujet d'une carrière dans l'ingénierie des données, c'est par là qu'il faut commencer.

Dedika pour entreprises

Ce que vous allez apprendre:

Vous allez acquérir une compréhension approfondie des fondamentaux du big data, du stockage distribué avec HDFS et de l'intégration du stockage objet dans le cloud. Vous développerez des traitements par lots prêts pour la production avec Apache Spark et des pipelines en temps réel avec Apache Flink et Spark Structured Streaming. Le cours couvre l'ingestion de données avec Kafka et la capture de données modifiées, la conception d'entrepôts et de lacs de données avec Delta Lake, Iceberg et dbt, et l'orchestration complète des pipelines avec Apache Airflow. Vous acquerrez également des compétences pratiques dans le déploiement Kubernetes, la gouvernance des données et l'infrastructure ML. À la fin, vous aurez la profondeur technique et l'étendue des outils exigées par les rôles modernes d'ingénierie des données.

Comment vous étudiez de façon pratique Formation Ingénieur Big Data

Comment vous pratiquez Formation Ingénieur Big Data

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux du Big Data et écosystème

  • Leçon 1 • Rôle et responsabilités du data engineer

    Définit le périmètre du data engineer par rapport aux data scientists et analystes. Clarifie la propriété des pipelines, la fiabilité et la qualité des données.

  • Leçon 2 • Patterns d'architecture Big Data

    Présente les architectures Lambda et Kappa et leurs compromis. Fournit le contexte structurel pour tous les designs de pipelines abordés plus tard.

  • Leçon 3 • Définir le Big Data et ses dimensions

    Couvre le framework des 5 V et les moteurs de croissance des données réelles. Établit le vocabulaire utilisé tout au long du cours.

  • Leçon 4 • La pile moderne de data engineering

    Mappe les principales catégories d'outils — ingestion, stockage, traitement et orchestration — aux rôles d'ingénierie. Les apprenants acquièrent un modèle mental pour l'ensemble du cours.

Chapitre 2Voir les détails

Bases de Linux, Réseaux et Cloud

  • Leçon 1 • Concepts réseau pour data engineers

    Explique TCP/IP, DNS, les ports et les pare-feu dans le contexte des systèmes distribués. Permet aux apprenants de résoudre les problèmes de connectivité dans les environnements cluster.

  • Leçon 2 • Fondamentaux de l'infrastructure Cloud

    Présente les primitives de calcul, de stockage et de réseau chez les principaux fournisseurs de cloud. Les apprenants peuvent déployer et configurer des machines virtuelles et des buckets de stockage d'objets.

  • Leçon 3 • Conteneurisation avec Docker

    Enseigne la construction et l'exécution de conteneurs pour des environnements de data engineering reproductibles. Les conteneurs sont utilisés dans les laboratoires à partir du chapitre suivant.

  • Leçon 4 • Essentiels de la ligne de commande Linux

    Couvre la navigation dans le système de fichiers, les permissions et les bases du shell scripting. Ces compétences sous-tendent la gestion des clusters et les tâches d'automatisation tout au long du cours.

Chapitre 3Voir les détails

Stockage distribué et HDFS

  • Leçon 1 • Architecture et fonctionnement interne de HDFS

    Explique les rôles NameNode, DataNode, la réplication des blocs et la tolérance aux pannes. Fournit la base de stockage requise avant d'introduire les frameworks de traitement.

  • Leçon 2 • Formats de données pour le stockage distribué

    Compare les formats lignes et colonnes incluant Avro, Parquet et ORC. Le choix du format impacte directement les performances des requêtes dans les chapitres de traitement ultérieurs.

  • Leçon 3 • Intégration du stockage d'objets cloud

    Démontre l'utilisation du stockage d'objets cloud comme remplacement direct de HDFS. Prépare les apprenants aux architectures de pipelines cloud natives introduites plus tard.

  • Leçon 4 • Principes de conception du Data Lake

    Présente l'architecture de data lake basée sur les zones : brutes, organisées et de consommation. Les apprenants conçoivent des dispositions de stockage qui soutiennent les pipelines d'analyse en aval.

  • Leçon 5 • Opérations et administration HDFS

    Couvre l'interface en ligne de commande HDFS, la gestion des quotas et la surveillance de la santé du cluster. Les apprenants acquièrent des compétences pratiques pour l'administration quotidienne du stockage.

Chapitre 4Voir les détails

Traitement par lots avec Apache Spark

  • Leçon 1 • Optimisation des performances Spark

    Aborde le partitionnement, la mise en cache, la sérialisation et la gestion de la mémoire pour les jobs de production. Les apprenants réduisent considérablement les temps d'exécution des jobs et les coûts des ressources.

  • Leçon 2 • Architecture et modèle d'exécution Spark

    Explique le driver, l'exécuteur, le planificateur DAG et l'exécution des tâches. Comprendre le fonctionnement interne est un prérequis pour écrire du code Spark efficace.

  • Leçon 3 • RDD, DataFrames et Datasets

    Couvre les trois couches d'abstraction Spark et quand les utiliser. Part des opérations RDD de bas niveau pour aller vers les transformations DataFrame de haut niveau.

  • Leçon 4 • Spark SQL et manipulation de données

    Enseigne les requêtes SQL, les fonctions de fenêtrage et les agrégations complexes sur les DataFrames. Permet aux analystes devenus ingénieurs d'exploiter leurs compétences SQL existantes dans Spark.

  • Leçon 5 • Lecture et écriture de sources de données

    Couvre les connecteurs pour HDFS, le stockage d'objets, JDBC, Kafka et Delta Lake. Connecte Spark aux couches de stockage et de streaming construites dans les chapitres précédents.

Chapitre 5Voir les détails

Systèmes d'ingestion et de messagerie de données

  • Leçon 1 • Ingestion par lots avec Apache Sqoop et alternatives

    Couvre l'extraction en masse de bases de données relationnelles avec Sqoop et les alternatives modernes. Complète la boîte à outils d'ingestion pour les systèmes source en flux et par lots.

  • Leçon 2 • Production et consommation de messages

    Couvre les paramètres d'accusé de réception du producteur, la gestion des décalages des consommateurs et la sémantique exactement-une-fois. Les apprenants écrivent des producteurs et des consommateurs fiables en Python et Java.

  • Leçon 3 • Techniques de capture de changement de données

    Présente la CDC à l'aide des journaux de transaction de base de données pour capturer les modifications au niveau des lignes. Permet une synchronisation quasi en temps réel entre les bases de données opérationnelles et le data lake.

  • Leçon 4 • Architecture Apache Kafka

    Explique les brokers, les topics, les partitions, les groupes de consommateurs et la réplication. Cette architecture sous-tend tous les pipelines de streaming construits dans les chapitres suivants.

  • Leçon 5 • Kafka Connect pour l'ingestion par lots

    Démontre les connecteurs source et sink pour les bases de données, le stockage d'objets et les systèmes de fichiers. Réduit le code personnalisé pour les modèles d'ingestion courants.

Chapitre 6Voir les détails

Traitement de flux avec Apache Flink et Spark Streaming

  • Leçon 1 • Fiabilité et surveillance des pipelines de streaming

    Aborde la contre-pression, le retard des consommateurs, la reprise après échec et les alertes pour les jobs de streaming. Garantit que les apprenants peuvent exploiter des pipelines de streaming en production.

  • Leçon 2 • Architecture et API Apache Flink

    Couvre le JobManager, le TaskManager, l'API DataStream et l'API Table de Flink. Les apprenants écrivent des jobs de streaming avec état avec des garanties exactement-une-fois.

  • Leçon 3 • Fondamentaux du traitement de flux

    Définit le temps d'événement, le temps de traitement, les watermarks et la sémantique de fenêtrage. Ces concepts sont un prérequis pour écrire des applications de streaming correctes.

  • Leçon 4 • Streaming structuré Spark

    Enseigne les modes de traitement micro-batch et continu de Spark Structured Streaming. Exploite les compétences existantes en Spark DataFrame pour les charges de travail de streaming.

  • Leçon 5 • Patterns de traitement de flux avec état

    Implémente la déduplication, la sessionisation et la détection de motifs à l'aide d'un état géré. Prépare les apprenants à des cas d'utilisation de streaming complexes et réels.

Chapitre 7Voir les détails

Architectures Data Warehouse et Lakehouse

  • Leçon 1 • Plateformes de Data Warehouse Cloud

    Compare les architectures de data warehouse MPP cloud et leurs modèles de séparation calcul-stockage. Les apprenants chargent, transforment et interrogent de grands ensembles de données à l'aide du SQL warehouse.

  • Leçon 2 • Formats Apache Iceberg et Hudi

    Couvre le partitionnement caché d'Iceberg et les capacités d'insertion-mise à jour de Hudi comme alternatives à Delta Lake. Les apprenants sélectionnent le bon format de table ouvert pour leur cas d'utilisation.

  • Leçon 3 • Delta Lake et formats de table

    Présente les transactions ACID, le voyage dans le temps et l'application du schéma dans Delta Lake. Fait le pont entre le stockage brut du data lake et la fiabilité de niveau warehouse.

  • Leçon 4 • Fondamentaux de la modélisation Data Warehouse

    Couvre le schéma en étoile, le schéma en flocon de neige, les dimensions à évolution lente et la conception des tables de faits. Fournit le vocabulaire de modélisation utilisé dans les implémentations de warehouse et lakehouse.

  • Leçon 5 • Transformation ELT avec dbt

    Enseigne la construction de pipelines de transformation SQL modulaires avec dbt dans le warehouse. Connecte les données brutes ingérées aux modèles prêts pour l'analyse.

Chapitre 8Voir les détails

Orchestration de pipelines et DataOps

  • Leçon 1 • Architecture Apache Airflow et DAG

    Couvre le planificateur, l'exécuteur, la base de données de métadonnées et la création de DAG d'Airflow. Établit la base d'orchestration pour toute l'automatisation des pipelines dans ce chapitre.

  • Leçon 2 • CI/CD et Infrastructure en tant que Code pour pipelines

    Applique les workflows Git, les tests automatisés et Terraform au déploiement des pipelines. Les apprenants livrent des changements en production de manière sûre et reproductible.

  • Leçon 3 • Patterns avancés de conception de DAG

    Enseigne la génération dynamique de DAG, le branchement et les dépendances inter-DAG. Permet aux apprenants de construire des patterns d'orchestration flexibles et réutilisables.

  • Leçon 4 • Qualité des données et tests de pipelines

    Implémente des contrôles de qualité des données avec Great Expectations et des tests dbt dans les pipelines. Empêche les mauvaises données de se propager aux consommateurs en aval.

  • Leçon 5 • Orchestration moderne avec Prefect et Dagster

    Présente les flows Prefect et les assets Dagster comme alternatives à Airflow. Les apprenants évaluent les outils d'orchestration en fonction de la complexité des pipelines et des besoins de l'équipe.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Développeurs de logiciels prêts à se spécialiser dans les rôles d'infrastructure de données à grande échelle.

  • Analystes de données qui souhaitent remonter la chaîne et prendre en charge les pipelines dont ils dépendent.

  • Ingénieurs backend curieux des systèmes distribués et du traitement des données en temps réel.

  • Jeunes diplômés en informatique visant des postes très demandés en ingénierie des données.

  • Professionnels DevOps souhaitant se développer vers l'ingénierie des plateformes de données cloud-native.

  • Développeurs BI qui veulent une plus grande maîtrise technique au-delà des tableaux de bord et des rapports.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en Côte d’Ivoire ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF