
Cours PySpark
Maîtrisez PySpark de A à Z et traitez des données à une échelle que les machines seules ne peuvent tout simplement pas gérer. Ce cours vous mène des concepts fondamentaux du calcul distribué aux pipelines prêts pour la production, en passant par les DataFrames, Spark SQL, le réglage des performances et le déploiement cloud. Que vous fassiez vos débuts dans l'ingénierie des données ou que vous montiez en compétences sur le big data, cette formation pratique est celle qu'il vous faut.
Ce que vous allez apprendre:
Vous commencerez par l'architecture Spark et les RDD, puis vous passerez à l'API DataFrame, Spark SQL et aux opérations avancées comme les jointures, les fonctions de fenêtrage et les agrégations. Vous apprendrez à nettoyer des données réelles et désordonnées, à lire et écrire plusieurs formats de fichiers, et à connecter PySpark à des systèmes de stockage cloud. Ce cours couvre l'optimisation des performances à l'aide de l'optimiseur Catalyst, les stratégies de mise en cache et les UDF vectorisées. Vous explorerez également Structured Streaming, Delta Lake et MLlib pour le machine learning à grande échelle. À la fin, vous construirez des pipelines PySpark complets, testables et orchestrés, prêts pour la production.
Comment vous étudiez de façon pratique Cours PySpark
Comment vous pratiquez Cours PySpark
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsIntroduction à PySpark et au Big Data
Introduction à PySpark et au Big Data
Leçon 1 • Présentation de l'architecture Apache Spark
Explique le modèle driver-executor de Spark, les gestionnaires de cluster et le moteur d'exécution DAG. Fournit le modèle mental nécessaire aux étudiants pour raisonner sur le comportement des jobs PySpark.
Leçon 2 • Concepts et défis du Big Data
Couvre le volume, la vélocité et la variété comme moteurs des besoins de traitement distribué. Établit pourquoi les outils traditionnels échouent à grande échelle, motivant l'approche PySpark.
Leçon 3 • Bases de SparkSession et SparkContext
Présente SparkSession comme le point d'entrée unifié pour toutes les fonctionnalités de Spark. Les étudiants créent des sessions, définissent des configurations et comprennent la hiérarchie des contextes.
Leçon 4 • Configuration de l'environnement PySpark
Guide l'installation de Java, Python et PySpark en local et via des notebooks cloud. Les étudiants vérifient leur installation en exécutant un contexte Spark minimal.
Leçon 5 • Exécution de votre premier job PySpark
Parcourt la lecture d'un fichier, l'application d'une transformation et la collecte des résultats. Relie les concepts d'architecture à l'exécution observable des jobs dans l'interface utilisateur Spark.
Chapitre 2MasquerCacher les détailsVoir les détailsJeux de données résilients et distribués (RDDs)
Jeux de données résilients et distribués (RDDs)
Leçon 1 • Création de RDD à partir de diverses sources
Montre la parallélisation de collections Python et la lecture à partir de fichiers et de systèmes externes. Les étudiants s'exercent à créer des RDD avec un nombre de partitions contrôlé.
Leçon 2 • Actions et persistance des RDD
Explique comment les actions déclenchent l'exécution et comment la mise en cache évite les recalculs redondants. Les étudiants choisissent des niveaux de stockage appropriés pour les charges de travail itératives.
Leçon 3 • Transformations : map, filter et flatMap
Couvre les transformations paresseuses fondamentales qui remodèlent le contenu des RDD élément par élément. Les étudiants construisent des chaînes de transformations et inspectent le DAG résultant.
Leçon 4 • RDD clé-valeur et opérations sur les paires
Présente les RDD de paires et les opérations basées sur le shuffle comme groupByKey et reduceByKey. Les étudiants apprennent à minimiser les shuffles pour de meilleures performances.
Leçon 5 • Fondamentaux et propriétés des RDD
Définit les RDD comme des collections immuables, partitionnées et tolérantes aux pannes. Explique les graphes de lignée et comment Spark reconstruit automatiquement les partitions perdues.
Chapitre 3MasquerCacher les détailsVoir les détailsDataFrames et l'API Spark SQL
DataFrames et l'API Spark SQL
Leçon 1 • Spark SQL : interrogation avec la syntaxe SQL
Enregistre les DataFrames en tant que vues temporaires et les interroge avec du SQL standard. Les étudiants combinent des appels SQL et à l'API DataFrame dans le même pipeline.
Leçon 2 • Agrégations et regroupement
Applique groupBy, agg et les fonctions de fenêtrage pour résumer les données à différentes granularités. Les étudiants produisent des métriques métier à partir de données d'événements brutes.
Leçon 3 • Création de DataFrames à partir de plusieurs sources
Couvre la lecture de sources CSV, JSON, Parquet et JDBC dans des DataFrames. Les étudiants configurent les options de lecture et gèrent gracieusement les enregistrements malformés.
Leçon 4 • Transformations DataFrame et opérations sur les colonnes
Enseigne la sélection, le filtrage, le renommage, le casting et la dérivation de colonnes à l'aide de l'API Column. Les étudiants construisent des pipelines de transformation réutilisables.
Leçon 5 • Concepts DataFrame et schéma
Compare les DataFrames aux RDD, en mettant l'accent sur l'application du schéma et les avantages de l'optimiseur Catalyst. Les étudiants inspectent et définissent des schémas par programmation.
Chapitre 4MasquerCacher les détailsVoir les détailsTechniques de nettoyage et de transformation des données
Techniques de nettoyage et de transformation des données
Leçon 1 • Types complexes : tableaux, maps et structures
Manipule des données imbriquées et semi-structurées à l'aide de explode, de fonctions de tableau et d'accès aux structures. Les étudiants aplatissent et remodèlent des colonnes de type JSON pour une analyse tabulaire.
Leçon 2 • Déduplication et validation des données
Supprime les enregistrements en double et applique des règles métier via des vérifications de type assertion. Les étudiants construisent des couches de validation qui révèlent rapidement les problèmes de qualité des données.
Leçon 3 • Manipulation de chaînes et expressions régulières
Utilise des fonctions de chaîne intégrées et des motifs regex pour nettoyer et standardiser les champs de texte. Les étudiants normalisent des formats incohérents tels que les numéros de téléphone et les catégories.
Leçon 4 • Traitement des dates et des timestamps
Analyse, formatage et calculs arithmétiques sur les dates à l'aide des fonctions de date de Spark. Les étudiants extraient des caractéristiques temporelles pour les analyses aval.
Leçon 5 • Gestion des valeurs manquantes et nulles
Identifie les motifs de nullité et applique des stratégies de suppression, de remplissage et d'imputation. Les étudiants évaluent les compromis entre la suppression et l'imputation en fonction du contexte des données.
Chapitre 5MasquerCacher les détailsVoir les détailsJointures, agrégations et fonctions de fenêtrage
Jointures, agrégations et fonctions de fenêtrage
Leçon 1 • Modèles d'agrégation avancés
Applique un regroupement multi-niveaux, une agrégation conditionnelle et des fonctions approximatives à grande échelle. Les étudiants équilibrent précision et performance pour les charges de travail d'agrégation importantes.
Leçon 2 • Fonctions de fenêtrage : classement et ordre
Présente les spécifications de fenêtre et les fonctions de classement comme row_number, rank et dense_rank. Les étudiants attribuent des rangs ordonnés au sein des partitions pour des analyses de type classement.
Leçon 3 • Fonctions de fenêtrage : totaux cumulés et lag/lead
Calcule les sommes cumulées, les moyennes mobiles et les comparaisons de période à période à l'aide de limites de fenêtre. Les étudiants construisent des métriques de séries temporelles sans auto-jointure.
Leçon 4 • Types et stratégies de jointure
Couvre les jointures internes, gauches, droites, externes complètes, semi et anti avec des exemples pratiques. Les étudiants sélectionnent les types de jointure en fonction de la logique métier et de la cardinalité des données.
Leçon 5 • Optimisation des opérations lourdes en shuffle
Diagnostique les goulots d'étranglement de shuffle à l'aide de l'interface utilisateur Spark et applique les stratégies de repartition, coalesce et bucketing. Les étudiants réduisent le temps d'exécution des jobs grâce à une réduction ciblée du shuffle.
Chapitre 6MasquerCacher les détailsVoir les détailsLecture, écriture et gestion des sources de données
Lecture, écriture et gestion des sources de données
Leçon 1 • Écriture de DataFrames avec les modes de sauvegarde
Explique les modes de sauvegarde overwrite, append, ignore et error et leurs implications en production. Les étudiants implémentent des modèles d'écriture idempotents pour des pipelines fiables.
Leçon 2 • Connexion au stockage cloud et distribué
Configure PySpark pour lire et écrire vers le stockage objet et les systèmes de fichiers distribués. Les étudiants s'authentifient de manière sécurisée et paramètrent les paramètres d'E/S pour les environnements cloud.
Leçon 3 • Formats de fichiers : Parquet, ORC, Avro et Delta
Compare les formats columnar et row-based sur les performances de lecture, la compression et l'évolution du schéma. Les étudiants choisissent des formats en fonction des modèles d'accès à la charge de travail.
Leçon 4 • Stratégies de partitionnement et de bucketing
Applique le partitionnement à l'écriture et le bucketing pour réduire les coûts d'analyse sur les grands ensembles de données. Les étudiants conçoivent des schémas de partitionnement alignés sur les prédicats de requête courants.
Leçon 5 • Introduction aux sources de données streaming
Prévisualise Structured Streaming en lisant à partir de sources de fichiers et de sockets en mode micro-batch. Les étudiants relient les compétences DataFrame par lots au paradigme du streaming.
Chapitre 7MasquerCacher les détailsVoir les détailsRéglage des performances et optimisation
Réglage des performances et optimisation
Leçon 1 • Mise en cache et variables broadcast
Applique la mise en cache des DataFrames et les variables broadcast pour éliminer les calculs redondants et les transferts réseau. Les étudiants mesurent les taux de succès du cache et le comportement d'éviction.
Leçon 2 • Compréhension de l'optimiseur Catalyst
Trace comment Catalyst transforme les plans logiques en plans physiques optimisés via des passes basées sur des règles et sur le coût. Les étudiants lisent la sortie explain pour vérifier les optimisations.
Leçon 3 • Gestion de la mémoire et ramasse-miettes
Explique les régions de mémoire des exécuteurs, le stockage hors tas et l'impact du GC JVM sur les jobs Spark. Les étudiants ajustent les fractions mémoire pour réduire le spill et les pauses GC.
Leçon 4 • Partitionnement pour le parallélisme
Aligne le nombre de partitions sur les cœurs du cluster pour maximiser le parallélisme sans surcharge excessive. Les étudiants appliquent l'exécution de requêtes adaptative pour automatiser le dimensionnement des partitions.
Leçon 5 • Fonctions définies par l'utilisateur (UDF) et UDF vectorisées
Compare les UDF Python, les UDF pandas et les fonctions intégrées sur le coût de sérialisation et le débit. Les étudiants réécrivent les UDF lentes en UDF pandas vectorisées pour des accélérations d'un ordre de grandeur.
Chapitre 8MasquerCacher les détailsVoir les détailsConstruction de pipelines PySpark de bout en bout
Construction de pipelines PySpark de bout en bout
Leçon 1 • Journalisation, surveillance et gestion des erreurs
Implémente la journalisation structurée, la gestion des exceptions et l'émission de métriques dans les jobs PySpark. Les étudiants construisent des pipelines observables qui révèlent les échecs et les régressions de performance.
Leçon 2 • Test du code PySpark
Applique les modèles de test unitaire et d'intégration à l'aide de pytest et de petits DataFrames en mémoire. Les étudiants construisent des suites de tests qui détectent les régressions avant le déploiement en production.
Leçon 3 • Orchestration de workflows avec Airflow
Planifie et surveille les jobs PySpark à l'aide d'une orchestration basée sur DAG avec gestion des dépendances. Les étudiants construisent un DAG de pipeline multi-étapes avec logique de relance et d'alerte.
Leçon 4 • Architecture des pipelines et patrons de conception
Présente l'architecture Medallion, la conception modulaire des pipelines et la séparation des couches d'ingestion, de transformation et de service. Les étudiants traduisent les exigences métier en étapes de pipeline.
Leçon 5 • Soumission de jobs avec spark-submit
Empaquette les applications PySpark et les soumet aux gestionnaires de cluster avec des configurations de ressources. Les étudiants paramètrent les jobs pour une réutilisation dans différents environnements.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste de données : prêt à dépasser les limites des feuilles de calcul et du traitement sur une seule machine.
Développeur Python : souhaite ajouter le traitement distribué des données à sa boîte à outils professionnelle.
Ingénieur de données junior : nécessite une formation structurée et pratique pour gérer des charges de travail à l'échelle de la production.
Développeur en intelligence d’affaires : cherchant à moderniser les pipelines avec des approches évolutives et centrées sur le code.
Reconversion professionnelle : transition vers l'ingénierie des données à partir d'un bagage en développement logiciel ou en analyse.
Étudiant diplômé : développer des compétences appliquées en big data pour renforcer la compétitivité sur le marché du travail.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Maroc ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















