
Formation analyse Big Data
Maîtrisez l'ensemble de la stack big data, du stockage distribué et du traitement par lots au streaming en temps réel et à l'apprentissage automatique à grande échelle. Ce cours vous offre une expertise pratique avec des outils reconnus dans le secteur comme Hadoop, Spark, Kafka et Airflow. Que vous débutiez dans l'ingénierie des données ou que vous souhaitiez perfectionner vos compétences actuelles, vous serez prêt à construire des systèmes big data prêts pour la production.
Ce que vous allez apprendre:
Vous allez acquérir une compréhension complète des écosystèmes de big data, en commençant par les concepts fondamentaux et le cadre des 5 V, puis en passant au stockage distribué avec HDFS et les bases de données NoSQL. Vous écrirez et optimiserez des jobs MapReduce, exécuterez des requêtes SQL sur des moteurs distribués comme Hive et Presto, et développerez des applications Spark avancées en utilisant RDD, DataFrames et Spark SQL. Ce cours couvre le traitement de flux en temps réel avec Kafka, Spark Structured Streaming et Apache Flink. Vous concevrez des pipelines de données fiables, appliquerez des règles de qualité des données et mettrez en œuvre l'apprentissage automatique à grande échelle avec Spark MLlib et les workflows MLOps. Les plateformes cloud, la gouvernance des données, la sécurité et les tendances émergentes comme le data mesh et l'ingénierie augmentée par l'IA complètent votre palette de compétences.
Comment vous étudiez de façon pratique Formation analyse Big Data
Comment vous pratiquez Formation analyse Big Data
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux du Big Data
Fondamentaux du Big Data
Leçon 1 • Types et formats de données
Couvre les données structurées, semi-structurées et non structurées avec les formats de fichiers courants. Prépare les étudiants à sélectionner les stratégies de stockage et de traitement appropriées.
Leçon 2 • Définition des concepts du Big Data
Présente le cadre des 5 V et distingue le big data des données traditionnelles. Ancre tous les sujets techniques ultérieurs dans une terminologie partagée.
Leçon 3 • Facteurs métier et cas d'usage
Examine les motivations sectorielles pour l'adoption du big data et les objectifs analytiques courants. Relie les concepts techniques à des résultats métier mesurables.
Leçon 4 • Aperçu de l'écosystème Big Data
Cartographie les principaux composants d'une plateforme big data, de l'ingestion à la visualisation. Fournit un modèle mental pour l'ensemble du pipeline couvert dans les chapitres suivants.
Chapitre 2MasquerCacher les détailsVoir les détailsSystèmes de stockage distribué
Systèmes de stockage distribué
Leçon 1 • Principes des systèmes de fichiers distribués
Explique la réplication, la tolérance aux pannes et le stockage par blocs dans les systèmes distribués. Établit les fondations de stockage nécessaires pour tous les frameworks de traitement à venir.
Leçon 2 • Système de fichiers distribués Hadoop
Couvre l'architecture HDFS, la configuration et les opérations de base pour le stockage de grands ensembles de données. Permet directement un travail pratique avec le traitement basé sur Hadoop dans les chapitres suivants.
Leçon 3 • Fondamentaux des bases de données NoSQL
Passe en revue les modèles NoSQL clé-valeur, document, famille de colonnes et graphe. Équipe les étudiants pour faire correspondre la technologie de stockage à la structure des données et aux besoins de requêtes.
Leçon 4 • Stockage objet pour le Big Data
Présente le stockage objet cloud natif comme alternative évolutive à HDFS. Prépare les étudiants à architecturer des solutions de lacs de données hybrides et cloud-first.
Leçon 5 • Techniques d'optimisation du stockage
Aborde la compression, le partitionnement et le stockage hiérarchisé pour réduire les coûts et améliorer les performances. Directement applicable aux décisions de conception de stockage dans les environnements de production.
Chapitre 3MasquerCacher les détailsVoir les détailsTraitement par lots avec MapReduce
Traitement par lots avec MapReduce
Leçon 1 • Modèle de programmation MapReduce
Explique les phases map, shuffle et reduce avec des diagrammes de flux de données. Fournit le noyau conceptuel nécessaire avant d'écrire du code de traitement distribué.
Leçon 2 • Réglage des performances MapReduce
Couvre les paramètres mémoire, l'exécution spéculative et le parallélisme des tâches pour des jobs plus rapides. Relie les connaissances théoriques à des améliorations de performance mesurables.
Leçon 3 • Écriture de jobs MapReduce
Guide les étudiants dans le codage des fonctions mapper et reducer avec des exemples pratiques. Construit les bases de programmation pour tous les frameworks de traitement ultérieurs.
Leçon 4 • Combinaisons et partitionneurs
Présente les combinaisons pour l'agrégation locale et les partitionneurs personnalisés pour la distribution des données. Améliore directement l'efficacité des jobs et prépare les étudiants aux sujets d'optimisation.
Chapitre 4MasquerCacher les détailsVoir les détailsTraitement du Big Data basé sur SQL
Traitement du Big Data basé sur SQL
Leçon 1 • Moteurs de requêtes SQL distribués
Présente les moteurs de requêtes MPP qui exécutent SQL directement sur le stockage distribué. Élargit la boîte à outils des étudiants au-delà de Hive pour l'analytique interactive et ad hoc.
Leçon 2 • Conception de schémas pour l'analytique
Enseigne les schémas en étoile et en flocon de neige, la dénormalisation et les modèles schema-on-read. Prépare les étudiants à concevoir des structures d'entrepôt de données sur des plateformes big data.
Leçon 3 • Architecture et modèle de données Hive
Explique le metastore Hive, les tables et HiveQL comme abstraction SQL sur HDFS. Permet aux étudiants de tirer parti de leurs compétences SQL existantes dans un contexte distribué.
Leçon 4 • Optimisation des requêtes dans Hive
Couvre les plans d'exécution, la vectorisation et l'optimisation basée sur les coûts pour les requêtes Hive. Réduit directement la latence des requêtes dans les pipelines analytiques construits dans ce chapitre.
Leçon 5 • Architecture Lakehouse de données
Fusionne la flexibilité du lac de données avec la fiabilité de l'entrepôt de données en utilisant des formats de table ouverts. Positionne les étudiants pour concevoir des architectures analytiques unifiées modernes.
Chapitre 5MasquerCacher les détailsVoir les détailsTraitement du Big Data avec Apache Spark
Traitement du Big Data avec Apache Spark
Leçon 1 • Modèle d'architecture et d'exécution de Spark
Explique les rôles du driver, des exécuteurs, du planificateur DAG et de l'exécution des tâches dans les clusters Spark. Fournit la compréhension architecturale nécessaire pour écrire et optimiser des jobs Spark efficaces.
Leçon 2 • DataFrames et Spark SQL
Présente l'API DataFrame et Spark SQL pour le traitement de données structurées à grande échelle. Relie les connaissances SQL du chapitre 4 au moteur d'exécution optimisé de Spark.
Leçon 3 • Opérations Spark avancées
Couvre les jointures, les agrégations, les fonctions de fenêtrage et les fonctions définies par l'utilisateur dans Spark. Permet aux étudiants de gérer des transformations analytiques complexes dans des pipelines de production.
Leçon 4 • RDD et transformations de base
Couvre les Resilient Distributed Datasets, l'évaluation paresseuse et les opérations clés de transformation. Construit le modèle de programmation Spark fondamental avant les API de plus haut niveau.
Leçon 5 • Réglage des performances Spark
Aborde le partitionnement, la gestion de la mémoire et les diagnostics de l'interface utilisateur Spark pour l'optimisation. Traduit les connaissances architecturales en améliorations mesurables des performances des jobs.
Chapitre 6MasquerCacher les détailsVoir les détailsTraitement de flux en temps réel
Traitement de flux en temps réel
Leçon 1 • File d'attente de messages avec Kafka
Couvre les sujets Kafka, les partitions, les producteurs et les consommateurs en tant qu'épine dorsale du streaming. Fournit la couche d'ingestion requise par tous les processeurs de flux en aval.
Leçon 2 • Spark Structured Streaming d'Apache
Enseigne le streaming par micro-lots et continu avec l'API DataFrame unifiée de Spark. Exploite les compétences Spark des chapitres batch et les étend aux charges de travail de streaming.
Leçon 3 • Traitement de flux Apache Flink
Présente le modèle de streaming natif de Flink, les backends d'état et le traitement du temps d'événement. Fournit une alternative à Spark pour les applications de streaming avec état et à faible latence.
Leçon 4 • Modèles de conception de pipelines en temps réel
Présente les architectures Lambda, Kappa et CQRS pour combiner traitement par lots et streaming. Équipe les étudiants pour architecturer des systèmes de données en temps réel de bout en bout.
Leçon 5 • Fondamentaux du traitement de flux
Définit les flux d'événements, les sémantiques temporelles et les différences entre traitement par lots et en continu. Établit la base conceptuelle pour tous les frameworks de streaming de ce chapitre.
Chapitre 7MasquerCacher les détailsVoir les détailsIngénierie des pipelines de données
Ingénierie des pipelines de données
Leçon 1 • Qualité et validation des données
Présente le profilage des données, la validation des schémas et les contrôles de qualité automatisés dans les pipelines. Garantit que les sorties analytiques sont fiables et dignes de confiance pour les consommateurs en aval.
Leçon 2 • Orchestration des workflows avec Airflow
Enseigne la création de DAG, la planification et la gestion des dépendances dans Apache Airflow. Fournit la couche d'orchestration qui coordonne tous les composants du pipeline.
Leçon 3 • Stratégies d'ingestion de données
Couvre l'ingestion par lots, la capture de données modifiées et les modèles d'ingestion pilotés par les événements. Établit le point d'entrée pour toutes les données entrant dans les pipelines construits dans ce chapitre.
Leçon 4 • Fiabilité et surveillance des pipelines
Couvre l'idempotence, la logique de nouvelle tentative, les files d'attente de lettres mortes et l'observabilité des pipelines. Prépare les étudiants à maintenir une infrastructure de données de qualité production.
Leçon 5 • Modèles de transformation de données
Présente les compromis ELT vs ETL, la logique de transformation et les frameworks de transformation réutilisables. Relie les couches d'ingestion et de stockage en produits de données analytiques cohérents.
Chapitre 8MasquerCacher les détailsVoir les détailsAnalytique avancée et Machine Learning à grande échelle
Analytique avancée et Machine Learning à grande échelle
Leçon 1 • MLOps pour les pipelines Big Data
Présente l'entraînement continu, les registres de caractéristiques et le suivi des expériences pour des opérations ML évolutives. Permet aux étudiants de maintenir et d'améliorer les modèles dans les environnements de production.
Leçon 2 • Déploiement et service des modèles
Couvre le scoring par lots, l'inférence en temps réel et les modèles de registre de modèles pour le ML de production. Comble le fossé entre l'entraînement des modèles et la valeur métier opérationnelle.
Leçon 3 • Concepts de Machine Learning distribué
Explique le parallélisme des données, le parallélisme des modèles et la descente de gradient distribuée. Établit les fondations théoriques pour tous les frameworks de ML couverts dans ce chapitre.
Leçon 4 • Analytique de graphes à grande échelle
Présente les modèles de données de graphe et le traitement distribué de graphes pour l'analyse de réseaux. Étend les capacités analytiques aux problèmes big data centrés sur les relations.
Leçon 5 • Apprentissage automatique avec Spark MLlib
Couvre l'ingénierie des caractéristiques, l'API de pipeline et les algorithmes de base dans Spark MLlib. Exploite les compétences Spark du chapitre 6 pour construire des workflows ML de bout en bout.
Votre certificat valide de réussite
Ce cours est pour vous :
Développeur logiciel : souhaite se spécialiser dans l'infrastructure de données et les systèmes distribués.
Analyste de données : prêt à passer des requêtes à l'ingénierie de workflows de données évolutifs.
Ingénieur backend : cherche à étendre son expertise aux environnements de traitement de données à grand volume.
Étudiant en informatique : acquiert des compétences pratiques pour entrer sur le marché du travail de l'ingénierie des données.
Développeur BI : cherche à approfondir ses connaissances techniques sous les tableaux de bord et les couches de reporting.
Personne en reconversion professionnelle venant des opérations IT : attirée par l'ingénierie des données grâce à son expérience en infrastructure.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Maroc ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















