
Formation Ingénieur Big Data
Maîtrisez l'ensemble de la pile d'ingénierie big data — du stockage distribué et Apache Spark au streaming en temps réel avec Kafka et Flink. Ce cours vous donne les compétences pratiques pour concevoir, construire et exploiter des pipelines de données de qualité production à grande échelle. Si vous êtes sérieux au sujet d'une carrière dans l'ingénierie des données, c'est par là qu'il faut commencer.
Ce que vous allez apprendre:
Vous allez acquérir une compréhension approfondie des fondamentaux du big data, du stockage distribué avec HDFS et de l'intégration du stockage objet dans le cloud. Vous développerez des traitements par lots prêts pour la production avec Apache Spark et des pipelines en temps réel avec Apache Flink et Spark Structured Streaming. Le cours couvre l'ingestion de données avec Kafka et la capture de données modifiées, la conception d'entrepôts et de lacs de données avec Delta Lake, Iceberg et dbt, et l'orchestration complète des pipelines avec Apache Airflow. Vous acquerrez également des compétences pratiques dans le déploiement Kubernetes, la gouvernance des données et l'infrastructure ML. À la fin, vous aurez la profondeur technique et l'étendue des outils exigées par les rôles modernes d'ingénierie des données.
Comment vous étudiez de façon pratique Formation Ingénieur Big Data
Comment vous pratiquez Formation Ingénieur Big Data
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux du Big Data et écosystème
Fondamentaux du Big Data et écosystème
Leçon 1 • Rôle et responsabilités du data engineer
Définit le périmètre du data engineer par rapport aux data scientists et analystes. Clarifie la propriété des pipelines, la fiabilité et la qualité des données.
Leçon 2 • Patterns d'architecture Big Data
Présente les architectures Lambda et Kappa et leurs compromis. Fournit le contexte structurel pour tous les designs de pipelines abordés plus tard.
Leçon 3 • Définir le Big Data et ses dimensions
Couvre le framework des 5 V et les moteurs de croissance des données réelles. Établit le vocabulaire utilisé tout au long du cours.
Leçon 4 • La pile moderne de data engineering
Mappe les principales catégories d'outils — ingestion, stockage, traitement et orchestration — aux rôles d'ingénierie. Les apprenants acquièrent un modèle mental pour l'ensemble du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsBases de Linux, Réseaux et Cloud
Bases de Linux, Réseaux et Cloud
Leçon 1 • Concepts réseau pour data engineers
Explique TCP/IP, DNS, les ports et les pare-feu dans le contexte des systèmes distribués. Permet aux apprenants de résoudre les problèmes de connectivité dans les environnements cluster.
Leçon 2 • Fondamentaux de l'infrastructure Cloud
Présente les primitives de calcul, de stockage et de réseau chez les principaux fournisseurs de cloud. Les apprenants peuvent déployer et configurer des machines virtuelles et des buckets de stockage d'objets.
Leçon 3 • Conteneurisation avec Docker
Enseigne la construction et l'exécution de conteneurs pour des environnements de data engineering reproductibles. Les conteneurs sont utilisés dans les laboratoires à partir du chapitre suivant.
Leçon 4 • Essentiels de la ligne de commande Linux
Couvre la navigation dans le système de fichiers, les permissions et les bases du shell scripting. Ces compétences sous-tendent la gestion des clusters et les tâches d'automatisation tout au long du cours.
Chapitre 3MasquerCacher les détailsVoir les détailsStockage distribué et HDFS
Stockage distribué et HDFS
Leçon 1 • Architecture et fonctionnement interne de HDFS
Explique les rôles NameNode, DataNode, la réplication des blocs et la tolérance aux pannes. Fournit la base de stockage requise avant d'introduire les frameworks de traitement.
Leçon 2 • Formats de données pour le stockage distribué
Compare les formats lignes et colonnes incluant Avro, Parquet et ORC. Le choix du format impacte directement les performances des requêtes dans les chapitres de traitement ultérieurs.
Leçon 3 • Intégration du stockage d'objets cloud
Démontre l'utilisation du stockage d'objets cloud comme remplacement direct de HDFS. Prépare les apprenants aux architectures de pipelines cloud natives introduites plus tard.
Leçon 4 • Principes de conception du Data Lake
Présente l'architecture de data lake basée sur les zones : brutes, organisées et de consommation. Les apprenants conçoivent des dispositions de stockage qui soutiennent les pipelines d'analyse en aval.
Leçon 5 • Opérations et administration HDFS
Couvre l'interface en ligne de commande HDFS, la gestion des quotas et la surveillance de la santé du cluster. Les apprenants acquièrent des compétences pratiques pour l'administration quotidienne du stockage.
Chapitre 4MasquerCacher les détailsVoir les détailsTraitement par lots avec Apache Spark
Traitement par lots avec Apache Spark
Leçon 1 • Optimisation des performances Spark
Aborde le partitionnement, la mise en cache, la sérialisation et la gestion de la mémoire pour les jobs de production. Les apprenants réduisent considérablement les temps d'exécution des jobs et les coûts des ressources.
Leçon 2 • Architecture et modèle d'exécution Spark
Explique le driver, l'exécuteur, le planificateur DAG et l'exécution des tâches. Comprendre le fonctionnement interne est un prérequis pour écrire du code Spark efficace.
Leçon 3 • RDD, DataFrames et Datasets
Couvre les trois couches d'abstraction Spark et quand les utiliser. Part des opérations RDD de bas niveau pour aller vers les transformations DataFrame de haut niveau.
Leçon 4 • Spark SQL et manipulation de données
Enseigne les requêtes SQL, les fonctions de fenêtrage et les agrégations complexes sur les DataFrames. Permet aux analystes devenus ingénieurs d'exploiter leurs compétences SQL existantes dans Spark.
Leçon 5 • Lecture et écriture de sources de données
Couvre les connecteurs pour HDFS, le stockage d'objets, JDBC, Kafka et Delta Lake. Connecte Spark aux couches de stockage et de streaming construites dans les chapitres précédents.
Chapitre 5MasquerCacher les détailsVoir les détailsSystèmes d'ingestion et de messagerie de données
Systèmes d'ingestion et de messagerie de données
Leçon 1 • Ingestion par lots avec Apache Sqoop et alternatives
Couvre l'extraction en masse de bases de données relationnelles avec Sqoop et les alternatives modernes. Complète la boîte à outils d'ingestion pour les systèmes source en flux et par lots.
Leçon 2 • Production et consommation de messages
Couvre les paramètres d'accusé de réception du producteur, la gestion des décalages des consommateurs et la sémantique exactement-une-fois. Les apprenants écrivent des producteurs et des consommateurs fiables en Python et Java.
Leçon 3 • Techniques de capture de changement de données
Présente la CDC à l'aide des journaux de transaction de base de données pour capturer les modifications au niveau des lignes. Permet une synchronisation quasi en temps réel entre les bases de données opérationnelles et le data lake.
Leçon 4 • Architecture Apache Kafka
Explique les brokers, les topics, les partitions, les groupes de consommateurs et la réplication. Cette architecture sous-tend tous les pipelines de streaming construits dans les chapitres suivants.
Leçon 5 • Kafka Connect pour l'ingestion par lots
Démontre les connecteurs source et sink pour les bases de données, le stockage d'objets et les systèmes de fichiers. Réduit le code personnalisé pour les modèles d'ingestion courants.
Chapitre 6MasquerCacher les détailsVoir les détailsTraitement de flux avec Apache Flink et Spark Streaming
Traitement de flux avec Apache Flink et Spark Streaming
Leçon 1 • Fiabilité et surveillance des pipelines de streaming
Aborde la contre-pression, le retard des consommateurs, la reprise après échec et les alertes pour les jobs de streaming. Garantit que les apprenants peuvent exploiter des pipelines de streaming en production.
Leçon 2 • Architecture et API Apache Flink
Couvre le JobManager, le TaskManager, l'API DataStream et l'API Table de Flink. Les apprenants écrivent des jobs de streaming avec état avec des garanties exactement-une-fois.
Leçon 3 • Fondamentaux du traitement de flux
Définit le temps d'événement, le temps de traitement, les watermarks et la sémantique de fenêtrage. Ces concepts sont un prérequis pour écrire des applications de streaming correctes.
Leçon 4 • Streaming structuré Spark
Enseigne les modes de traitement micro-batch et continu de Spark Structured Streaming. Exploite les compétences existantes en Spark DataFrame pour les charges de travail de streaming.
Leçon 5 • Patterns de traitement de flux avec état
Implémente la déduplication, la sessionisation et la détection de motifs à l'aide d'un état géré. Prépare les apprenants à des cas d'utilisation de streaming complexes et réels.
Chapitre 7MasquerCacher les détailsVoir les détailsArchitectures Data Warehouse et Lakehouse
Architectures Data Warehouse et Lakehouse
Leçon 1 • Plateformes de Data Warehouse Cloud
Compare les architectures de data warehouse MPP cloud et leurs modèles de séparation calcul-stockage. Les apprenants chargent, transforment et interrogent de grands ensembles de données à l'aide du SQL warehouse.
Leçon 2 • Formats Apache Iceberg et Hudi
Couvre le partitionnement caché d'Iceberg et les capacités d'insertion-mise à jour de Hudi comme alternatives à Delta Lake. Les apprenants sélectionnent le bon format de table ouvert pour leur cas d'utilisation.
Leçon 3 • Delta Lake et formats de table
Présente les transactions ACID, le voyage dans le temps et l'application du schéma dans Delta Lake. Fait le pont entre le stockage brut du data lake et la fiabilité de niveau warehouse.
Leçon 4 • Fondamentaux de la modélisation Data Warehouse
Couvre le schéma en étoile, le schéma en flocon de neige, les dimensions à évolution lente et la conception des tables de faits. Fournit le vocabulaire de modélisation utilisé dans les implémentations de warehouse et lakehouse.
Leçon 5 • Transformation ELT avec dbt
Enseigne la construction de pipelines de transformation SQL modulaires avec dbt dans le warehouse. Connecte les données brutes ingérées aux modèles prêts pour l'analyse.
Chapitre 8MasquerCacher les détailsVoir les détailsOrchestration de pipelines et DataOps
Orchestration de pipelines et DataOps
Leçon 1 • Architecture Apache Airflow et DAG
Couvre le planificateur, l'exécuteur, la base de données de métadonnées et la création de DAG d'Airflow. Établit la base d'orchestration pour toute l'automatisation des pipelines dans ce chapitre.
Leçon 2 • CI/CD et Infrastructure en tant que Code pour pipelines
Applique les workflows Git, les tests automatisés et Terraform au déploiement des pipelines. Les apprenants livrent des changements en production de manière sûre et reproductible.
Leçon 3 • Patterns avancés de conception de DAG
Enseigne la génération dynamique de DAG, le branchement et les dépendances inter-DAG. Permet aux apprenants de construire des patterns d'orchestration flexibles et réutilisables.
Leçon 4 • Qualité des données et tests de pipelines
Implémente des contrôles de qualité des données avec Great Expectations et des tests dbt dans les pipelines. Empêche les mauvaises données de se propager aux consommateurs en aval.
Leçon 5 • Orchestration moderne avec Prefect et Dagster
Présente les flows Prefect et les assets Dagster comme alternatives à Airflow. Les apprenants évaluent les outils d'orchestration en fonction de la complexité des pipelines et des besoins de l'équipe.
Votre certificat valide de réussite
Ce cours est pour vous :
Développeurs de logiciels prêts à se spécialiser dans les rôles d'infrastructure de données à grande échelle.
Analystes de données qui souhaitent remonter la chaîne et prendre en charge les pipelines dont ils dépendent.
Ingénieurs backend curieux des systèmes distribués et du traitement des données en temps réel.
Jeunes diplômés en informatique visant des postes très demandés en ingénierie des données.
Professionnels DevOps souhaitant se développer vers l'ingénierie des plateformes de données cloud-native.
Développeurs BI qui veulent une plus grande maîtrise technique au-delà des tableaux de bord et des rapports.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Côte d’Ivoire ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















