Choisissez votre langue
Formation analyse Big Data
Plus de 2 millions d'étudiants dans le monde

Formation analyse Big Data

Maîtrisez l'ensemble de la stack big data, du stockage distribué et du traitement par lots au streaming en temps réel et à l'apprentissage automatique à grande échelle. Ce cours vous offre une expertise pratique avec des outils reconnus dans le secteur comme Hadoop, Spark, Kafka et Airflow. Que vous débutiez dans l'ingénierie des données ou que vous souhaitiez perfectionner vos compétences actuelles, vous serez prêt à construire des systèmes big data prêts pour la production.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous allez acquérir une compréhension complète des écosystèmes de big data, en commençant par les concepts fondamentaux et le cadre des 5 V, puis en passant au stockage distribué avec HDFS et les bases de données NoSQL. Vous écrirez et optimiserez des jobs MapReduce, exécuterez des requêtes SQL sur des moteurs distribués comme Hive et Presto, et développerez des applications Spark avancées en utilisant RDD, DataFrames et Spark SQL. Ce cours couvre le traitement de flux en temps réel avec Kafka, Spark Structured Streaming et Apache Flink. Vous concevrez des pipelines de données fiables, appliquerez des règles de qualité des données et mettrez en œuvre l'apprentissage automatique à grande échelle avec Spark MLlib et les workflows MLOps. Les plateformes cloud, la gouvernance des données, la sécurité et les tendances émergentes comme le data mesh et l'ingénierie augmentée par l'IA complètent votre palette de compétences.

Comment vous étudiez de façon pratique Formation analyse Big Data

Comment vous pratiquez Formation analyse Big Data

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux du Big Data

  • Leçon 1 • Types et formats de données

    Couvre les données structurées, semi-structurées et non structurées avec les formats de fichiers courants. Prépare les étudiants à sélectionner les stratégies de stockage et de traitement appropriées.

  • Leçon 2 • Définition des concepts du Big Data

    Présente le cadre des 5 V et distingue le big data des données traditionnelles. Ancre tous les sujets techniques ultérieurs dans une terminologie partagée.

  • Leçon 3 • Facteurs métier et cas d'usage

    Examine les motivations sectorielles pour l'adoption du big data et les objectifs analytiques courants. Relie les concepts techniques à des résultats métier mesurables.

  • Leçon 4 • Aperçu de l'écosystème Big Data

    Cartographie les principaux composants d'une plateforme big data, de l'ingestion à la visualisation. Fournit un modèle mental pour l'ensemble du pipeline couvert dans les chapitres suivants.

Chapitre 2Voir les détails

Systèmes de stockage distribué

  • Leçon 1 • Principes des systèmes de fichiers distribués

    Explique la réplication, la tolérance aux pannes et le stockage par blocs dans les systèmes distribués. Établit les fondations de stockage nécessaires pour tous les frameworks de traitement à venir.

  • Leçon 2 • Système de fichiers distribués Hadoop

    Couvre l'architecture HDFS, la configuration et les opérations de base pour le stockage de grands ensembles de données. Permet directement un travail pratique avec le traitement basé sur Hadoop dans les chapitres suivants.

  • Leçon 3 • Fondamentaux des bases de données NoSQL

    Passe en revue les modèles NoSQL clé-valeur, document, famille de colonnes et graphe. Équipe les étudiants pour faire correspondre la technologie de stockage à la structure des données et aux besoins de requêtes.

  • Leçon 4 • Stockage objet pour le Big Data

    Présente le stockage objet cloud natif comme alternative évolutive à HDFS. Prépare les étudiants à architecturer des solutions de lacs de données hybrides et cloud-first.

  • Leçon 5 • Techniques d'optimisation du stockage

    Aborde la compression, le partitionnement et le stockage hiérarchisé pour réduire les coûts et améliorer les performances. Directement applicable aux décisions de conception de stockage dans les environnements de production.

Chapitre 3Voir les détails

Traitement par lots avec MapReduce

  • Leçon 1 • Modèle de programmation MapReduce

    Explique les phases map, shuffle et reduce avec des diagrammes de flux de données. Fournit le noyau conceptuel nécessaire avant d'écrire du code de traitement distribué.

  • Leçon 2 • Réglage des performances MapReduce

    Couvre les paramètres mémoire, l'exécution spéculative et le parallélisme des tâches pour des jobs plus rapides. Relie les connaissances théoriques à des améliorations de performance mesurables.

  • Leçon 3 • Écriture de jobs MapReduce

    Guide les étudiants dans le codage des fonctions mapper et reducer avec des exemples pratiques. Construit les bases de programmation pour tous les frameworks de traitement ultérieurs.

  • Leçon 4 • Combinaisons et partitionneurs

    Présente les combinaisons pour l'agrégation locale et les partitionneurs personnalisés pour la distribution des données. Améliore directement l'efficacité des jobs et prépare les étudiants aux sujets d'optimisation.

Chapitre 4Voir les détails

Traitement du Big Data basé sur SQL

  • Leçon 1 • Moteurs de requêtes SQL distribués

    Présente les moteurs de requêtes MPP qui exécutent SQL directement sur le stockage distribué. Élargit la boîte à outils des étudiants au-delà de Hive pour l'analytique interactive et ad hoc.

  • Leçon 2 • Conception de schémas pour l'analytique

    Enseigne les schémas en étoile et en flocon de neige, la dénormalisation et les modèles schema-on-read. Prépare les étudiants à concevoir des structures d'entrepôt de données sur des plateformes big data.

  • Leçon 3 • Architecture et modèle de données Hive

    Explique le metastore Hive, les tables et HiveQL comme abstraction SQL sur HDFS. Permet aux étudiants de tirer parti de leurs compétences SQL existantes dans un contexte distribué.

  • Leçon 4 • Optimisation des requêtes dans Hive

    Couvre les plans d'exécution, la vectorisation et l'optimisation basée sur les coûts pour les requêtes Hive. Réduit directement la latence des requêtes dans les pipelines analytiques construits dans ce chapitre.

  • Leçon 5 • Architecture Lakehouse de données

    Fusionne la flexibilité du lac de données avec la fiabilité de l'entrepôt de données en utilisant des formats de table ouverts. Positionne les étudiants pour concevoir des architectures analytiques unifiées modernes.

Chapitre 5Voir les détails

Traitement du Big Data avec Apache Spark

  • Leçon 1 • Modèle d'architecture et d'exécution de Spark

    Explique les rôles du driver, des exécuteurs, du planificateur DAG et de l'exécution des tâches dans les clusters Spark. Fournit la compréhension architecturale nécessaire pour écrire et optimiser des jobs Spark efficaces.

  • Leçon 2 • DataFrames et Spark SQL

    Présente l'API DataFrame et Spark SQL pour le traitement de données structurées à grande échelle. Relie les connaissances SQL du chapitre 4 au moteur d'exécution optimisé de Spark.

  • Leçon 3 • Opérations Spark avancées

    Couvre les jointures, les agrégations, les fonctions de fenêtrage et les fonctions définies par l'utilisateur dans Spark. Permet aux étudiants de gérer des transformations analytiques complexes dans des pipelines de production.

  • Leçon 4 • RDD et transformations de base

    Couvre les Resilient Distributed Datasets, l'évaluation paresseuse et les opérations clés de transformation. Construit le modèle de programmation Spark fondamental avant les API de plus haut niveau.

  • Leçon 5 • Réglage des performances Spark

    Aborde le partitionnement, la gestion de la mémoire et les diagnostics de l'interface utilisateur Spark pour l'optimisation. Traduit les connaissances architecturales en améliorations mesurables des performances des jobs.

Chapitre 6Voir les détails

Traitement de flux en temps réel

  • Leçon 1 • File d'attente de messages avec Kafka

    Couvre les sujets Kafka, les partitions, les producteurs et les consommateurs en tant qu'épine dorsale du streaming. Fournit la couche d'ingestion requise par tous les processeurs de flux en aval.

  • Leçon 2 • Spark Structured Streaming d'Apache

    Enseigne le streaming par micro-lots et continu avec l'API DataFrame unifiée de Spark. Exploite les compétences Spark des chapitres batch et les étend aux charges de travail de streaming.

  • Leçon 3 • Traitement de flux Apache Flink

    Présente le modèle de streaming natif de Flink, les backends d'état et le traitement du temps d'événement. Fournit une alternative à Spark pour les applications de streaming avec état et à faible latence.

  • Leçon 4 • Modèles de conception de pipelines en temps réel

    Présente les architectures Lambda, Kappa et CQRS pour combiner traitement par lots et streaming. Équipe les étudiants pour architecturer des systèmes de données en temps réel de bout en bout.

  • Leçon 5 • Fondamentaux du traitement de flux

    Définit les flux d'événements, les sémantiques temporelles et les différences entre traitement par lots et en continu. Établit la base conceptuelle pour tous les frameworks de streaming de ce chapitre.

Chapitre 7Voir les détails

Ingénierie des pipelines de données

  • Leçon 1 • Qualité et validation des données

    Présente le profilage des données, la validation des schémas et les contrôles de qualité automatisés dans les pipelines. Garantit que les sorties analytiques sont fiables et dignes de confiance pour les consommateurs en aval.

  • Leçon 2 • Orchestration des workflows avec Airflow

    Enseigne la création de DAG, la planification et la gestion des dépendances dans Apache Airflow. Fournit la couche d'orchestration qui coordonne tous les composants du pipeline.

  • Leçon 3 • Stratégies d'ingestion de données

    Couvre l'ingestion par lots, la capture de données modifiées et les modèles d'ingestion pilotés par les événements. Établit le point d'entrée pour toutes les données entrant dans les pipelines construits dans ce chapitre.

  • Leçon 4 • Fiabilité et surveillance des pipelines

    Couvre l'idempotence, la logique de nouvelle tentative, les files d'attente de lettres mortes et l'observabilité des pipelines. Prépare les étudiants à maintenir une infrastructure de données de qualité production.

  • Leçon 5 • Modèles de transformation de données

    Présente les compromis ELT vs ETL, la logique de transformation et les frameworks de transformation réutilisables. Relie les couches d'ingestion et de stockage en produits de données analytiques cohérents.

Chapitre 8Voir les détails

Analytique avancée et Machine Learning à grande échelle

  • Leçon 1 • MLOps pour les pipelines Big Data

    Présente l'entraînement continu, les registres de caractéristiques et le suivi des expériences pour des opérations ML évolutives. Permet aux étudiants de maintenir et d'améliorer les modèles dans les environnements de production.

  • Leçon 2 • Déploiement et service des modèles

    Couvre le scoring par lots, l'inférence en temps réel et les modèles de registre de modèles pour le ML de production. Comble le fossé entre l'entraînement des modèles et la valeur métier opérationnelle.

  • Leçon 3 • Concepts de Machine Learning distribué

    Explique le parallélisme des données, le parallélisme des modèles et la descente de gradient distribuée. Établit les fondations théoriques pour tous les frameworks de ML couverts dans ce chapitre.

  • Leçon 4 • Analytique de graphes à grande échelle

    Présente les modèles de données de graphe et le traitement distribué de graphes pour l'analyse de réseaux. Étend les capacités analytiques aux problèmes big data centrés sur les relations.

  • Leçon 5 • Apprentissage automatique avec Spark MLlib

    Couvre l'ingénierie des caractéristiques, l'API de pipeline et les algorithmes de base dans Spark MLlib. Exploite les compétences Spark du chapitre 6 pour construire des workflows ML de bout en bout.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Développeur logiciel : souhaite se spécialiser dans l'infrastructure de données et les systèmes distribués.

  • Analyste de données : prêt à passer des requêtes à l'ingénierie de workflows de données évolutifs.

  • Ingénieur backend : cherche à étendre son expertise aux environnements de traitement de données à grand volume.

  • Étudiant en informatique : acquiert des compétences pratiques pour entrer sur le marché du travail de l'ingénierie des données.

  • Développeur BI : cherche à approfondir ses connaissances techniques sous les tableaux de bord et les couches de reporting.

  • Personne en reconversion professionnelle venant des opérations IT : attirée par l'ingénierie des données grâce à son expérience en infrastructure.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Maroc ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF