
Formation Ingénieur Big Data
Maîtrisez l'ensemble de la stack d'ingénierie des données — du stockage distribué et d'Apache Spark au streaming temps réel avec Kafka et Flink. Ce cours vous donne les compétences pratiques pour concevoir, construire et exploiter des pipelines de données de production à grande échelle. Si vous êtes sérieux au sujet d'une carrière en ingénierie des données, c'est par là qu'il faut commencer.
Ce que vous allez apprendre:
Vous développerez une compréhension approfondie des fondamentaux du big data, du stockage distribué avec HDFS et de l'intégration du stockage objet dans le cloud. Vous réaliserez des traitements par lots prêts pour la production avec Apache Spark et des pipelines temps réel avec Apache Flink et Spark Structured Streaming. Le cours couvre l'ingestion de données avec Kafka et la capture de données modifiées (CDC), la conception d'entrepôts et de lacs de données avec Delta Lake, Iceberg et dbt, ainsi que l'orchestration complète des pipelines avec Apache Airflow. Vous acquerrez également des compétences pratiques dans le déploiement Kubernetes, la gouvernance des données et l'infrastructure ML. À la fin, vous aurez la profondeur technique et l'étendue des outils qu'exigent les rôles modernes en ingénierie des données.
Comment vous étudiez de façon pratique Formation Ingénieur Big Data
Comment vous pratiquez Formation Ingénieur Big Data
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux du Big Data et écosystème
Fondamentaux du Big Data et écosystème
Leçon 1 • Rôle et responsabilités du Data Engineer
Définit le périmètre du data engineer par rapport aux data scientists et aux analystes. Clarifie la responsabilité des pipelines, de la fiabilité et de la qualité des données.
Leçon 2 • Patrons d'architecture Big Data
Présente les architectures Lambda et Kappa ainsi que leurs compromis. Fournit le contexte structurel pour tous les designs de pipelines abordés ultérieurement.
Leçon 3 • Définition du Big Data et de ses dimensions
Couvre le framework des 5 V et les moteurs réels de croissance des données. Établit le vocabulaire utilisé tout au long du cours.
Leçon 4 • La stack moderne de data engineering
Fait correspondre les principales catégories d'outils (ingestion, stockage, traitement et orchestration) aux rôles d'ingénierie. Les étudiants acquièrent un modèle mental pour l'ensemble du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsBases de Linux, du réseau et du cloud
Bases de Linux, du réseau et du cloud
Leçon 1 • Concepts réseau pour le data engineering
Explique TCP/IP, DNS, les ports et les pare-feu dans le contexte des systèmes distribués. Permet aux étudiants de résoudre les problèmes de connectivité dans les environnements de cluster.
Leçon 2 • Fondamentaux de l'infrastructure cloud
Présente les primitives de calcul, de stockage et de réseau chez les principaux fournisseurs de cloud. Les étudiants peuvent déployer et configurer des machines virtuelles et des buckets de stockage d'objets.
Leçon 3 • Conteneurisation avec Docker
Enseigne la création et l'exécution de conteneurs pour des environnements de data engineering reproductibles. Les conteneurs sont utilisés dans les travaux pratiques à partir du chapitre suivant.
Leçon 4 • Bases essentielles de la ligne de commande Linux
Couvre la navigation dans le système de fichiers, les permissions et les bases du scripting shell. Ces compétences sous-tendent la gestion des clusters et les tâches d'automatisation tout au long du cours.
Chapitre 3MasquerCacher les détailsVoir les détailsStockage distribué et HDFS
Stockage distribué et HDFS
Leçon 1 • Architecture HDFS et mécanismes internes
Explique les rôles NameNode et DataNode, la réplication des blocs et la tolérance aux pannes. Fournit les fondations du stockage nécessaires avant d'introduire les frameworks de traitement.
Leçon 2 • Formats de données pour le stockage distribué
Compare les formats lignes et colonnes, notamment Avro, Parquet et ORC. Le choix du format a un impact direct sur les performances des requêtes dans les chapitres ultérieurs sur le traitement.
Leçon 3 • Intégration du stockage d'objets cloud
Montre comment utiliser le stockage d'objets cloud comme un remplacement direct de HDFS. Prépare les étudiants aux architectures de pipelines cloud-natives présentées ultérieurement.
Leçon 4 • Principes de conception d'un data lake
Présente l'architecture du data lake basée sur des zones : couches brutes, enrichies et de consommation. Les étudiants conçoivent des agencements de stockage qui prennent en charge les pipelines d'analyse en aval.
Leçon 5 • Opérations et administration HDFS
Couvre la CLI HDFS, la gestion des quotas et la surveillance de la santé du cluster. Les étudiants acquièrent des compétences pratiques pour l'administration quotidienne du stockage.
Chapitre 4MasquerCacher les détailsVoir les détailsTraitement par lots avec Apache Spark
Traitement par lots avec Apache Spark
Leçon 1 • Réglage des performances Spark
Aborde le partitionnement, la mise en cache, la sérialisation et la gestion de la mémoire pour les jobs de production. Les étudiants réduisent considérablement les temps d'exécution des jobs et les coûts des ressources.
Leçon 2 • Architecture et modèle d'exécution Spark
Explique le driver, l'executor, le planificateur DAG et l'exécution des tâches. La compréhension des mécanismes internes est un prérequis pour écrire du code Spark efficace.
Leçon 3 • RDD, DataFrames et Datasets
Couvre les trois couches d'abstraction Spark et le moment d'utiliser chacune d'elles. Va des opérations RDD de bas niveau aux transformations DataFrame de haut niveau.
Leçon 4 • Spark SQL et manipulation des données
Enseigne les requêtes SQL, les fonctions de fenêtrage et les agrégations complexes sur les DataFrames. Permet aux analystes devenus ingénieurs d'exploiter leurs compétences SQL existantes dans Spark.
Leçon 5 • Lecture et écriture de sources de données
Couvre les connecteurs pour HDFS, le stockage d'objets, JDBC, Kafka et Delta Lake. Connecte Spark aux couches de stockage et de streaming construites dans les chapitres précédents.
Chapitre 5MasquerCacher les détailsVoir les détailsSystèmes d'ingestion et de messagerie
Systèmes d'ingestion et de messagerie
Leçon 1 • Ingestion par lots avec Apache Sqoop et alternatives
Couvre l'extraction en masse de bases de données relationnelles à l'aide de Sqoop et d'alternatives modernes. Complète la boîte à outils d'ingestion pour les systèmes sources en continu et par lots.
Leçon 2 • Production et consommation de messages
Couvre les paramètres d'accusé de réception du producteur, la gestion des offsets du consommateur et la sémantique exactly-once. Les étudiants écrivent des producteurs et des consommateurs fiables en Python et Java.
Leçon 3 • Techniques de Change Data Capture
Présente la CDC à l'aide des journaux de transactions de bases de données pour capturer les modifications au niveau des lignes. Permet une synchronisation quasi temps réel entre les bases de données opérationnelles et le data lake.
Leçon 4 • Architecture Apache Kafka
Explique les brokers, les topics, les partitions, les groupes de consommateurs et la réplication. Cette architecture sous-tend tous les pipelines en continu construits dans les chapitres suivants.
Leçon 5 • Kafka Connect pour l'ingestion par lots
Montre les connecteurs source et sink pour les bases de données, le stockage d'objets et les systèmes de fichiers. Réduit le code personnalisé pour les modèles d'ingestion courants.
Chapitre 6MasquerCacher les détailsVoir les détailsTraitement en continu avec Apache Flink et Spark Streaming
Traitement en continu avec Apache Flink et Spark Streaming
Leçon 1 • Fiabilité et surveillance des pipelines de streaming
Aborde la contre-pression, le retard du consommateur, la reprise après panne et les alertes pour les jobs de streaming. Garantit que les étudiants peuvent exploiter des pipelines de streaming en production.
Leçon 2 • Architecture et API Apache Flink
Couvre le JobManager, le TaskManager, l'API DataStream et l'API Table de Flink. Les étudiants écrivent des jobs de streaming avec état garantissant la sémantique exactly-once.
Leçon 3 • Fondamentaux du traitement en continu
Définit le temps d'événement, le temps de traitement, les watermarks et la sémantique des fenêtres. Ces concepts sont un prérequis pour écrire des applications de streaming correctes.
Leçon 4 • Streaming Structuré Spark
Enseigne les modes de traitement micro-batch et continu de Spark Structured Streaming. Exploite les compétences existantes sur les DataFrames Spark pour les charges de travail de streaming.
Leçon 5 • Patrons de traitement en continu avec état
Met en œuvre la déduplication, la sessionisation et la détection de motifs à l'aide d'un état géré. Prépare les étudiants à des cas d'usage de streaming complexes du monde réel.
Chapitre 7MasquerCacher les détailsVoir les détailsArchitectures d'entrepôt de données et de lakehouse
Architectures d'entrepôt de données et de lakehouse
Leçon 1 • Plateformes cloud d'entrepôt de données
Compare les architectures d'entrepôt cloud MPP et leurs modèles de séparation calcul-stockage. Les étudiants chargent, transforment et interrogent de grands ensembles de données à l'aide du SQL d'entrepôt.
Leçon 2 • Formats Apache Iceberg et Hudi
Couvre le partitionnement caché d'Iceberg et les capacités d'upsert de Hudi comme alternatives à Delta Lake. Les étudiants sélectionnent le format de table ouvert adapté à leur cas d'usage.
Leçon 3 • Delta Lake et formats de table
Présente les transactions ACID, le voyage dans le temps et l'application du schéma dans Delta Lake. Fait le pont entre le stockage brut du data lake et la fiabilité de type entrepôt de données.
Leçon 4 • Fondamentaux de la modélisation d'entrepôt de données
Couvre le schéma en étoile, le schéma en flocon, les dimensions à évolution lente et la conception de tables de faits. Fournit le vocabulaire de modélisation utilisé dans les implémentations d'entrepôts de données et de lakehouses.
Leçon 5 • Transformation ELT avec dbt
Enseigne la création de pipelines de transformation SQL modulaires à l'aide de dbt dans l'entrepôt. Connecte les données brutes ingérées aux modèles prêts pour l'analyse.
Chapitre 8MasquerCacher les détailsVoir les détailsOrchestration de pipelines et DataOps
Orchestration de pipelines et DataOps
Leçon 1 • Architecture Apache Airflow et DAG
Couvre le planificateur, l'exécuteur, la base de données de métadonnées et la création de DAG d'Airflow. Établit les fondations d'orchestration pour toute l'automatisation des pipelines dans ce chapitre.
Leçon 2 • CI/CD et Infrastructure as Code pour les pipelines
Applique les workflows Git, les tests automatisés et Terraform au déploiement de pipelines. Les étudiants livrent les modifications en production de manière sûre et reproductible.
Leçon 3 • Patrons de conception avancés pour les DAG
Enseigne la génération dynamique de DAG, le branchement et les dépendances entre DAG. Permet aux étudiants de construire des patrons d'orchestration flexibles et réutilisables.
Leçon 4 • Qualité des données et tests de pipeline
Met en œuvre des contrôles de qualité des données à l'aide de Great Expectations et des tests dbt dans les pipelines. Empêche la propagation de mauvaises données aux consommateurs aval.
Leçon 5 • Orchestration moderne avec Prefect et Dagster
Présente les flows Prefect et les assets Dagster comme alternatives à Airflow. Les étudiants évaluent les outils d'orchestration en fonction de la complexité des pipelines et des besoins de l'équipe.
Votre certificat valide de réussite
Ce cours est fait pour vous :
Développeurs logiciels prêts à se spécialiser dans les rôles d'infrastructure de données à grande échelle.
Analystes de données qui souhaitent remonter en amont et posséder les pipelines dont ils dépendent.
Ingénieurs back-end curieux des systèmes distribués et du traitement de données en temps réel.
Jeunes diplômés en informatique visant des postes d'ingénierie des données très recherchés.
Professionnels DevOps cherchant à évoluer vers l'ingénierie de plateformes de données cloud-native.
Développeurs BI qui souhaitent une propriété technique plus profonde au-delà des tableaux de bord et des rapports.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en France ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















