Choisissez votre langue
Formation ingénieur Big Data
Plus de 2 millions d'apprenants dans le monde

Formation ingénieur Big Data

Maîtrise toute la pile technologique du big data, du stockage distribué et d'Apache Spark au streaming en temps réel avec Kafka et Flink. Ce cours te donne les compétences pratiques pour concevoir, construire et exploiter des pipelines de données de production à grande échelle. Si tu es sérieux au sujet d'une carrière en ingénierie des données, c'est par ici que ça commence.

Dedika pour entreprises

Ce que vous allez apprendre:

Tu développeras une compréhension approfondie des fondamentaux du big data, du stockage distribué avec HDFS et de l'intégration de stockage d'objets infonuagique. Tu créeras des traitements par lots prêts pour la production avec Apache Spark et des pipelines en temps réel avec Apache Flink et Spark Structured Streaming. Le cours couvre l'ingestion de données avec Kafka et la capture de changements, la conception d'entrepôts et de lacs de données avec Delta Lake, Iceberg et dbt, et l'orchestration complète des pipelines avec Apache Airflow. Tu acquerras également des compétences pratiques dans le déploiement Kubernetes, la gouvernance des données et l'infrastructure de ML. À la fin, tu auras la profondeur technique et l'étendue des outils exigées par les rôles modernes en ingénierie des données.

Comment vous étudiez de façon pratique Formation ingénieur Big Data

Comment vous pratiquez Formation ingénieur Big Data

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux et écosystème du Big Data

  • Leçon 1 • Rôle et responsabilités de l'ingénieur de données

    Définit le champ d'application de l'ingénieur de données par rapport aux scientifiques et analystes de données. Clarifie la propriété des pipelines, la fiabilité et la qualité des données.

  • Leçon 2 • Modèles d'architecture Big Data

    Présente les architectures Lambda et Kappa et leurs compromis. Fournit le contexte structurel pour toutes les conceptions de pipelines abordées plus loin.

  • Leçon 3 • Définir le Big Data et ses dimensions

    Couvre le cadre des 5 V et les moteurs de croissance des données réelles. Établit le vocabulaire utilisé dans tout le cours.

  • Leçon 4 • La pile moderne d'ingénierie des données

    Mappe les principales catégories d'outils (ingestion, stockage, traitement et orchestration) aux rôles d'ingénierie. Les étudiants acquièrent un modèle mental pour l'ensemble du cours.

Chapitre 2Voir les détails

Notions de base sur Linux, les réseaux et le nuage

  • Leçon 1 • Concepts de réseautique pour les ingénieurs de données

    Explique TCP/IP, DNS, les ports et les pare-feux dans le contexte des systèmes distribués. Permet aux étudiants de résoudre les problèmes de connectivité dans les environnements de grappes.

  • Leçon 2 • Notions fondamentales de l'infrastructure infonuagique

    Présente les primitives de calcul, de stockage et de réseautique chez les principaux fournisseurs de nuage. Les étudiants peuvent déployer et configurer des machines virtuelles et des compartiments de stockage d'objets.

  • Leçon 3 • Conteneurisation avec Docker

    Enseigne la construction et l'exécution de conteneurs pour des environnements d'ingénierie des données reproductibles. Les conteneurs sont utilisés dans les laboratoires à partir du chapitre suivant.

  • Leçon 4 • Notions essentielles de la ligne de commande Linux

    Couvre la navigation dans le système de fichiers, les permissions et les notions de base de l'écriture de scripts shell. Ces compétences sous-tendent la gestion des grappes et les tâches d'automatisation tout au long du cours.

Chapitre 3Voir les détails

Stockage distribué et HDFS

  • Leçon 1 • Architecture et fonctionnement interne du HDFS

    Explique les rôles de NameNode et DataNode, la réplication des blocs et la tolérance aux pannes. Fournit la base de stockage nécessaire avant d'introduire les frameworks de traitement.

  • Leçon 2 • Formats de données pour le stockage distribué

    Compare les formats lignes et colonnes, notamment Avro, Parquet et ORC. Le choix du format a un impact direct sur les performances des requêtes dans les chapitres de traitement ultérieurs.

  • Leçon 3 • Intégration du stockage d'objets dans le nuage

    Montre comment utiliser le stockage d'objets dans le nuage comme remplacement direct du HDFS. Prépare les étudiants aux architectures de pipelines natifs du nuage présentées plus loin.

  • Leçon 4 • Principes de conception d'un lac de données

    Présente l'architecture de lac de données en zones : zones brutes, traitées et de consommation. Les étudiants conçoivent des agencements de stockage qui prennent en charge les pipelines d'analyse en aval.

  • Leçon 5 • Opérations et administration du HDFS

    Couvre l'interface CLI du HDFS, la gestion des quotas et la surveillance de la santé des grappes. Les étudiants acquièrent des compétences pratiques pour l'administration quotidienne du stockage.

Chapitre 4Voir les détails

Traitement par lots avec Apache Spark

  • Leçon 1 • Réglage des performances de Spark

    Aborde le partitionnement, la mise en cache, la sérialisation et la gestion de la mémoire pour les tâches de production. Les étudiants réduisent considérablement les temps d'exécution des tâches et les coûts de ressources.

  • Leçon 2 • Architecture et modèle d'exécution de Spark

    Explique le conducteur, l'exécuteur, le planificateur DAG et l'exécution des tâches. Comprendre le fonctionnement interne est un prérequis pour écrire du code Spark efficace.

  • Leçon 3 • RDD, DataFrames et Datasets

    Couvre les trois couches d'abstraction de Spark et quand utiliser chacune. Passe des opérations RDD de bas niveau aux transformations DataFrame de haut niveau.

  • Leçon 4 • Spark SQL et manipulation de données

    Enseigne les requêtes SQL, les fonctions de fenêtrage et les agrégations complexes sur les DataFrames. Permet aux analystes devenus ingénieurs d'exploiter leurs compétences SQL existantes dans Spark.

  • Leçon 5 • Lecture et écriture de sources de données

    Couvre les connecteurs pour HDFS, le stockage d'objets, JDBC, Kafka et Delta Lake. Relie Spark aux couches de stockage et de diffusion construites dans les chapitres précédents.

Chapitre 5Voir les détails

Systèmes d'ingestion et de messagerie de données

  • Leçon 1 • Ingestion par lots avec Apache Sqoop et alternatives

    Couvre l'extraction en masse de bases de données relationnelles à l'aide de Sqoop et d'alternatives modernes. Complète la trousse à outils d'ingestion pour les systèmes sources en continu et par lots.

  • Leçon 2 • Production et consommation de messages

    Couvre les paramètres d'accusé de réception du producteur, la gestion des décalages du consommateur et la sémantique exactement une fois. Les étudiants écrivent des producteurs et des consommateurs fiables en Python et en Java.

  • Leçon 3 • Techniques de capture de données de changement (CDC)

    Présente la CDC à l'aide des journaux de transactions de base de données pour capturer les modifications au niveau des lignes. Permet une synchronisation quasi en temps réel entre les bases de données opérationnelles et le lac de données.

  • Leçon 4 • Architecture Apache Kafka

    Explique les courtiers, les sujets, les partitions, les groupes de consommateurs et la réplication. Cette architecture sous-tend tous les pipelines de diffusion construits dans les chapitres suivants.

  • Leçon 5 • Kafka Connect pour l'ingestion par lots

    Montre les connecteurs source et récepteur pour les bases de données, le stockage d'objets et les systèmes de fichiers. Réduit le code personnalisé pour les modèles d'ingestion courants.

Chapitre 6Voir les détails

Traitement en continu avec Apache Flink et Spark Streaming

  • Leçon 1 • Fiabilité et surveillance des pipelines de diffusion en continu

    Aborde la contre-pression, le retard du consommateur, la reprise après échec et les alertes pour les tâches de diffusion. Garantit que les étudiants peuvent exploiter les pipelines de diffusion en production.

  • Leçon 2 • Architecture et API d'Apache Flink

    Couvre le JobManager, le TaskManager, l'API DataStream et l'API Table de Flink. Les étudiants écrivent des tâches de diffusion avec état garantissant la sémantique exactement une fois.

  • Leçon 3 • Notions fondamentales du traitement en continu

    Définit le temps d'événement, le temps de traitement, les marques d'eau et la sémantique de fenêtrage. Ces concepts sont des prérequis pour écrire des applications de diffusion correctes.

  • Leçon 4 • Spark Structured Streaming

    Enseigne les modes de micro-lots et de traitement continu de Spark Structured Streaming. Exploite les compétences existantes en DataFrame Spark pour les charges de travail de diffusion.

  • Leçon 5 • Modèles de traitement en continu avec état

    Implémente la déduplication, la sessionnalisation et la détection de motifs à l'aide d'état géré. Prépare les étudiants à des cas d'utilisation de diffusion complexes dans le monde réel.

Chapitre 7Voir les détails

Architectures d'entrepôt de données et de lakehouse

  • Leçon 1 • Plateformes d'entrepôt de données dans le nuage

    Compare les architectures d'entrepôt de nuage MPP et leurs modèles de séparation stockage-calcul. Les étudiants chargent, transforment et interrogent de grands ensembles de données à l'aide du SQL d'entrepôt.

  • Leçon 2 • Formats Apache Iceberg et Hudi

    Couvre le partitionnement caché d'Iceberg et les capacités d'upsert de Hudi comme alternatives à Delta Lake. Les étudiants sélectionnent le bon format de table ouvert pour leur cas d'utilisation.

  • Leçon 3 • Delta Lake et formats de table

    Présente les transactions ACID, le voyage dans le temps et l'application du schéma dans Delta Lake. Fait le pont entre le stockage brut du lac de données et la fiabilité de type entrepôt.

  • Leçon 4 • Notions fondamentales de la modélisation d'entrepôt de données

    Couvre le schéma en étoile, le schéma en flocon, les dimensions à changement lent et la conception des tables de faits. Fournit le vocabulaire de modélisation utilisé dans les implémentations d'entrepôt et de lakehouse.

  • Leçon 5 • Transformation ELT avec dbt

    Enseigne la construction de pipelines de transformation SQL modulaires à l'aide de dbt dans l'entrepôt. Relie les données brutes ingérées aux modèles prêts pour l'analyse.

Chapitre 8Voir les détails

Orchestration de pipelines et DataOps

  • Leçon 1 • Architecture Apache Airflow et DAG

    Couvre le planificateur, l'exécuteur, la base de données de métadonnées et la création de DAG d'Airflow. Établit la base d'orchestration pour toute l'automatisation des pipelines dans ce chapitre.

  • Leçon 2 • CI/CD et infrastructure en tant que code pour les pipelines

    Applique les workflows Git, les tests automatisés et Terraform au déploiement de pipelines. Les étudiants livrent des changements en production de manière sécurisée et reproductible.

  • Leçon 3 • Modèles de conception avancés de DAG

    Enseigne la génération dynamique de DAG, le branchement et les dépendances entre DAG. Permet aux étudiants de construire des modèles d'orchestration flexibles et réutilisables.

  • Leçon 4 • Qualité des données et tests de pipelines

    Implémente des vérifications de qualité des données à l'aide de Great Expectations et de tests dbt dans les pipelines. Empêche la propagation de données erronées aux consommateurs en aval.

  • Leçon 5 • Orchestration moderne avec Prefect et Dagster

    Présente les flux Prefect et les actifs Dagster comme alternatives à Airflow. Les étudiants évaluent les outils d'orchestration en fonction de la complexité des pipelines et des besoins de l'équipe.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Développeurs de logiciels prêts à se spécialiser dans l'infrastructure de données à grande échelle.

  • Analystes de données qui souhaitent remonter la chaîne et prendre en charge les pipelines dont ils dépendent.

  • Ingénieurs backend curieux des systèmes distribués et du traitement des données en temps réel.

  • Récents diplômés en informatique visant les postes très demandés en ingénierie des données.

  • Professionnels DevOps qui souhaitent étendre leurs compétences à l'ingénierie de plateformes de données infonuagiques.

  • Développeurs BI qui veulent une plus grande appropriation technique au-delà des tableaux de bord et des rapports.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF