Choisissez votre langue
Cours PySpark
Plus de 2 millions d'étudiants dans le monde

Cours PySpark

5

Maîtrisez PySpark de A à Z et traitez des données à une échelle que les machines seules ne peuvent tout simplement pas gérer. Ce cours vous mène des concepts fondamentaux du calcul distribué aux pipelines prêts pour la production, en passant par les DataFrames, Spark SQL, le réglage des performances et le déploiement cloud. Que vous fassiez vos débuts dans l'ingénierie des données ou que vous montiez en compétences sur le big data, cette formation pratique est celle qu'il vous faut.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous commencerez par l'architecture Spark et les RDD, puis vous passerez à l'API DataFrame, Spark SQL et aux opérations avancées comme les jointures, les fonctions de fenêtrage et les agrégations. Vous apprendrez à nettoyer des données réelles et désordonnées, à lire et écrire plusieurs formats de fichiers, et à connecter PySpark à des systèmes de stockage cloud. Ce cours couvre l'optimisation des performances à l'aide de l'optimiseur Catalyst, les stratégies de mise en cache et les UDF vectorisées. Vous explorerez également Structured Streaming, Delta Lake et MLlib pour le machine learning à grande échelle. À la fin, vous construirez des pipelines PySpark complets, testables et orchestrés, prêts pour la production.

Comment vous étudiez de façon pratique Cours PySpark

Comment vous pratiquez Cours PySpark

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Introduction à PySpark et au Big Data

  • Leçon 1 • Présentation de l'architecture Apache Spark

    Explique le modèle driver-executor de Spark, les gestionnaires de cluster et le moteur d'exécution DAG. Fournit le modèle mental nécessaire aux étudiants pour raisonner sur le comportement des jobs PySpark.

  • Leçon 2 • Concepts et défis du Big Data

    Couvre le volume, la vélocité et la variété comme moteurs des besoins de traitement distribué. Établit pourquoi les outils traditionnels échouent à grande échelle, motivant l'approche PySpark.

  • Leçon 3 • Bases de SparkSession et SparkContext

    Présente SparkSession comme le point d'entrée unifié pour toutes les fonctionnalités de Spark. Les étudiants créent des sessions, définissent des configurations et comprennent la hiérarchie des contextes.

  • Leçon 4 • Configuration de l'environnement PySpark

    Guide l'installation de Java, Python et PySpark en local et via des notebooks cloud. Les étudiants vérifient leur installation en exécutant un contexte Spark minimal.

  • Leçon 5 • Exécution de votre premier job PySpark

    Parcourt la lecture d'un fichier, l'application d'une transformation et la collecte des résultats. Relie les concepts d'architecture à l'exécution observable des jobs dans l'interface utilisateur Spark.

Chapitre 2Voir les détails

Jeux de données résilients et distribués (RDDs)

  • Leçon 1 • Création de RDD à partir de diverses sources

    Montre la parallélisation de collections Python et la lecture à partir de fichiers et de systèmes externes. Les étudiants s'exercent à créer des RDD avec un nombre de partitions contrôlé.

  • Leçon 2 • Actions et persistance des RDD

    Explique comment les actions déclenchent l'exécution et comment la mise en cache évite les recalculs redondants. Les étudiants choisissent des niveaux de stockage appropriés pour les charges de travail itératives.

  • Leçon 3 • Transformations : map, filter et flatMap

    Couvre les transformations paresseuses fondamentales qui remodèlent le contenu des RDD élément par élément. Les étudiants construisent des chaînes de transformations et inspectent le DAG résultant.

  • Leçon 4 • RDD clé-valeur et opérations sur les paires

    Présente les RDD de paires et les opérations basées sur le shuffle comme groupByKey et reduceByKey. Les étudiants apprennent à minimiser les shuffles pour de meilleures performances.

  • Leçon 5 • Fondamentaux et propriétés des RDD

    Définit les RDD comme des collections immuables, partitionnées et tolérantes aux pannes. Explique les graphes de lignée et comment Spark reconstruit automatiquement les partitions perdues.

Chapitre 3Voir les détails

DataFrames et l'API Spark SQL

  • Leçon 1 • Spark SQL : interrogation avec la syntaxe SQL

    Enregistre les DataFrames en tant que vues temporaires et les interroge avec du SQL standard. Les étudiants combinent des appels SQL et à l'API DataFrame dans le même pipeline.

  • Leçon 2 • Agrégations et regroupement

    Applique groupBy, agg et les fonctions de fenêtrage pour résumer les données à différentes granularités. Les étudiants produisent des métriques métier à partir de données d'événements brutes.

  • Leçon 3 • Création de DataFrames à partir de plusieurs sources

    Couvre la lecture de sources CSV, JSON, Parquet et JDBC dans des DataFrames. Les étudiants configurent les options de lecture et gèrent gracieusement les enregistrements malformés.

  • Leçon 4 • Transformations DataFrame et opérations sur les colonnes

    Enseigne la sélection, le filtrage, le renommage, le casting et la dérivation de colonnes à l'aide de l'API Column. Les étudiants construisent des pipelines de transformation réutilisables.

  • Leçon 5 • Concepts DataFrame et schéma

    Compare les DataFrames aux RDD, en mettant l'accent sur l'application du schéma et les avantages de l'optimiseur Catalyst. Les étudiants inspectent et définissent des schémas par programmation.

Chapitre 4Voir les détails

Techniques de nettoyage et de transformation des données

  • Leçon 1 • Types complexes : tableaux, maps et structures

    Manipule des données imbriquées et semi-structurées à l'aide de explode, de fonctions de tableau et d'accès aux structures. Les étudiants aplatissent et remodèlent des colonnes de type JSON pour une analyse tabulaire.

  • Leçon 2 • Déduplication et validation des données

    Supprime les enregistrements en double et applique des règles métier via des vérifications de type assertion. Les étudiants construisent des couches de validation qui révèlent rapidement les problèmes de qualité des données.

  • Leçon 3 • Manipulation de chaînes et expressions régulières

    Utilise des fonctions de chaîne intégrées et des motifs regex pour nettoyer et standardiser les champs de texte. Les étudiants normalisent des formats incohérents tels que les numéros de téléphone et les catégories.

  • Leçon 4 • Traitement des dates et des timestamps

    Analyse, formatage et calculs arithmétiques sur les dates à l'aide des fonctions de date de Spark. Les étudiants extraient des caractéristiques temporelles pour les analyses aval.

  • Leçon 5 • Gestion des valeurs manquantes et nulles

    Identifie les motifs de nullité et applique des stratégies de suppression, de remplissage et d'imputation. Les étudiants évaluent les compromis entre la suppression et l'imputation en fonction du contexte des données.

Chapitre 5Voir les détails

Jointures, agrégations et fonctions de fenêtrage

  • Leçon 1 • Modèles d'agrégation avancés

    Applique un regroupement multi-niveaux, une agrégation conditionnelle et des fonctions approximatives à grande échelle. Les étudiants équilibrent précision et performance pour les charges de travail d'agrégation importantes.

  • Leçon 2 • Fonctions de fenêtrage : classement et ordre

    Présente les spécifications de fenêtre et les fonctions de classement comme row_number, rank et dense_rank. Les étudiants attribuent des rangs ordonnés au sein des partitions pour des analyses de type classement.

  • Leçon 3 • Fonctions de fenêtrage : totaux cumulés et lag/lead

    Calcule les sommes cumulées, les moyennes mobiles et les comparaisons de période à période à l'aide de limites de fenêtre. Les étudiants construisent des métriques de séries temporelles sans auto-jointure.

  • Leçon 4 • Types et stratégies de jointure

    Couvre les jointures internes, gauches, droites, externes complètes, semi et anti avec des exemples pratiques. Les étudiants sélectionnent les types de jointure en fonction de la logique métier et de la cardinalité des données.

  • Leçon 5 • Optimisation des opérations lourdes en shuffle

    Diagnostique les goulots d'étranglement de shuffle à l'aide de l'interface utilisateur Spark et applique les stratégies de repartition, coalesce et bucketing. Les étudiants réduisent le temps d'exécution des jobs grâce à une réduction ciblée du shuffle.

Chapitre 6Voir les détails

Lecture, écriture et gestion des sources de données

  • Leçon 1 • Écriture de DataFrames avec les modes de sauvegarde

    Explique les modes de sauvegarde overwrite, append, ignore et error et leurs implications en production. Les étudiants implémentent des modèles d'écriture idempotents pour des pipelines fiables.

  • Leçon 2 • Connexion au stockage cloud et distribué

    Configure PySpark pour lire et écrire vers le stockage objet et les systèmes de fichiers distribués. Les étudiants s'authentifient de manière sécurisée et paramètrent les paramètres d'E/S pour les environnements cloud.

  • Leçon 3 • Formats de fichiers : Parquet, ORC, Avro et Delta

    Compare les formats columnar et row-based sur les performances de lecture, la compression et l'évolution du schéma. Les étudiants choisissent des formats en fonction des modèles d'accès à la charge de travail.

  • Leçon 4 • Stratégies de partitionnement et de bucketing

    Applique le partitionnement à l'écriture et le bucketing pour réduire les coûts d'analyse sur les grands ensembles de données. Les étudiants conçoivent des schémas de partitionnement alignés sur les prédicats de requête courants.

  • Leçon 5 • Introduction aux sources de données streaming

    Prévisualise Structured Streaming en lisant à partir de sources de fichiers et de sockets en mode micro-batch. Les étudiants relient les compétences DataFrame par lots au paradigme du streaming.

Chapitre 7Voir les détails

Réglage des performances et optimisation

  • Leçon 1 • Mise en cache et variables broadcast

    Applique la mise en cache des DataFrames et les variables broadcast pour éliminer les calculs redondants et les transferts réseau. Les étudiants mesurent les taux de succès du cache et le comportement d'éviction.

  • Leçon 2 • Compréhension de l'optimiseur Catalyst

    Trace comment Catalyst transforme les plans logiques en plans physiques optimisés via des passes basées sur des règles et sur le coût. Les étudiants lisent la sortie explain pour vérifier les optimisations.

  • Leçon 3 • Gestion de la mémoire et ramasse-miettes

    Explique les régions de mémoire des exécuteurs, le stockage hors tas et l'impact du GC JVM sur les jobs Spark. Les étudiants ajustent les fractions mémoire pour réduire le spill et les pauses GC.

  • Leçon 4 • Partitionnement pour le parallélisme

    Aligne le nombre de partitions sur les cœurs du cluster pour maximiser le parallélisme sans surcharge excessive. Les étudiants appliquent l'exécution de requêtes adaptative pour automatiser le dimensionnement des partitions.

  • Leçon 5 • Fonctions définies par l'utilisateur (UDF) et UDF vectorisées

    Compare les UDF Python, les UDF pandas et les fonctions intégrées sur le coût de sérialisation et le débit. Les étudiants réécrivent les UDF lentes en UDF pandas vectorisées pour des accélérations d'un ordre de grandeur.

Chapitre 8Voir les détails

Construction de pipelines PySpark de bout en bout

  • Leçon 1 • Journalisation, surveillance et gestion des erreurs

    Implémente la journalisation structurée, la gestion des exceptions et l'émission de métriques dans les jobs PySpark. Les étudiants construisent des pipelines observables qui révèlent les échecs et les régressions de performance.

  • Leçon 2 • Test du code PySpark

    Applique les modèles de test unitaire et d'intégration à l'aide de pytest et de petits DataFrames en mémoire. Les étudiants construisent des suites de tests qui détectent les régressions avant le déploiement en production.

  • Leçon 3 • Orchestration de workflows avec Airflow

    Planifie et surveille les jobs PySpark à l'aide d'une orchestration basée sur DAG avec gestion des dépendances. Les étudiants construisent un DAG de pipeline multi-étapes avec logique de relance et d'alerte.

  • Leçon 4 • Architecture des pipelines et patrons de conception

    Présente l'architecture Medallion, la conception modulaire des pipelines et la séparation des couches d'ingestion, de transformation et de service. Les étudiants traduisent les exigences métier en étapes de pipeline.

  • Leçon 5 • Soumission de jobs avec spark-submit

    Empaquette les applications PySpark et les soumet aux gestionnaires de cluster avec des configurations de ressources. Les étudiants paramètrent les jobs pour une réutilisation dans différents environnements.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Analyste de données : prêt à dépasser les limites des feuilles de calcul et du traitement sur une seule machine.

  • Développeur Python : souhaite ajouter le traitement distribué des données à sa boîte à outils professionnelle.

  • Ingénieur de données junior : nécessite une formation structurée et pratique pour gérer des charges de travail à l'échelle de la production.

  • Développeur en intelligence d’affaires : cherchant à moderniser les pipelines avec des approches évolutives et centrées sur le code.

  • Reconversion professionnelle : transition vers l'ingénierie des données à partir d'un bagage en développement logiciel ou en analyse.

  • Étudiant diplômé : développer des compétences appliquées en big data pour renforcer la compétitivité sur le marché du travail.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail des cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF