Choisissez votre langue
Formation Apache PySpark
Plus de 2 millions d'apprenants dans le monde

Formation Apache PySpark

5

Maîtrisez PySpark de A à Z et traitez des données à une échelle que de simples machines ne peuvent tout simplement pas gérer. Ce cours vous amène des concepts fondamentaux de l'informatique distribuée aux pipelines prêts pour la production, en couvrant les DataFrames, Spark SQL, le réglage du rendement et le déploiement en nuage. Que vous fassiez votre entrée dans l'ingénierie des données ou que vous perfectionniez vos compétences en mégadonnées, il s'agit de la formation pratique dont vous avez besoin.

Dedika pour entreprises

Ce que vous allez apprendre:

Vous commencerez avec l'architecture Spark et les RDD, puis passerez à l'API DataFrame, Spark SQL et aux opérations avancées comme les jointures, les fonctions de fenêtre et les agrégations. Vous apprendrez à nettoyer des données réelles désordonnées, à lire et écrire plusieurs formats de fichiers, et à connecter PySpark à des systèmes de stockage en nuage. Le cours couvre l'optimisation du rendement à l'aide de l'optimiseur Catalyst, des stratégies de mise en cache et des UDF vectorisées. Vous explorerez également Structured Streaming, Delta Lake et MLlib pour l'apprentissage automatique à grande échelle. À la fin, vous créerez des pipelines PySpark complets, testables et orchestrés, prêts pour la production.

Comment vous étudiez de façon pratique Formation Apache PySpark

Comment vous pratiquez Formation Apache PySpark

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Introduction à PySpark et aux mégadonnées

  • Leçon 1 • Aperçu de l'architecture Apache Spark

    Explique le modèle pilote-exécuteur de Spark, les gestionnaires de grappes et le moteur d'exécution DAG. Fournit le modèle mental dont les étudiants ont besoin pour raisonner sur le comportement des travaux PySpark.

  • Leçon 2 • Concepts et défis des mégadonnées

    Couvre le volume, la vélocité et la variété comme moteurs des besoins de traitement distribué. Établit pourquoi les outils traditionnels échouent à grande échelle, motivant l'approche PySpark.

  • Leçon 3 • Notions de base de SparkSession et SparkContext

    Présente SparkSession comme point d'entrée unifié pour toutes les fonctionnalités Spark. Les étudiants créent des sessions, définissent des configurations et comprennent la hiérarchie des contextes.

  • Leçon 4 • Configuration de l'environnement PySpark

    Guide l'installation de Java, Python et PySpark localement et via des carnets en nuage. Les étudiants vérifient leur configuration en exécutant un contexte Spark minimal.

  • Leçon 5 • Exécution de votre premier travail PySpark

    Parcourt la lecture d'un fichier, l'application d'une transformation et la collecte des résultats. Relie les concepts d'architecture à l'exécution observable des travaux dans l'interface utilisateur Spark.

Chapitre 2Voir les détails

Ensembles de données distribués résilients (RDD)

  • Leçon 1 • Création de RDD à partir de diverses sources

    Démontre la parallélisation de collections Python et la lecture à partir de fichiers et de systèmes externes. Les étudiants s'exercent à créer des RDD avec des nombres de partitions contrôlés.

  • Leçon 2 • Actions et persistance des RDD

    Explique comment les actions déclenchent l'exécution et comment la mise en cache évite les recalculs redondants. Les étudiants choisissent des niveaux de stockage appropriés pour les charges de travail itératives.

  • Leçon 3 • Transformations : map, filter et flatMap

    Couvre les transformations paresseuses de base qui remodèlent le contenu des RDD élément par élément. Les étudiants construisent des chaînes de transformation et inspectent le DAG résultant.

  • Leçon 4 • RDD clé-valeur et opérations sur paires

    Présente les RDD de paires et les opérations basées sur le brassage comme groupByKey et reduceByKey. Les étudiants apprennent à minimiser les brassages pour un meilleur rendement.

  • Leçon 5 • Fondements et propriétés des RDD

    Définit les RDD comme des collections immuables, partitionnées et tolérantes aux pannes. Explique les graphes de lignée et comment Spark reconstitue automatiquement les partitions perdues.

Chapitre 3Voir les détails

DataFrames et l'API Spark SQL

  • Leçon 1 • Spark SQL : interrogation avec la syntaxe SQL

    Enregistre les DataFrames en tant que vues temporaires et les interroge avec du SQL standard. Les étudiants combinent des appels SQL et d'API DataFrame dans le même pipeline.

  • Leçon 2 • Agrégations et regroupement

    Applique groupBy, agg et les fonctions de fenêtre pour résumer les données à différentes granularités. Les étudiants produisent des mesures de niveau opérationnel à partir de données d'événements brutes.

  • Leçon 3 • Création de DataFrames à partir de multiples sources

    Couvre la lecture de sources CSV, JSON, Parquet et JDBC dans des DataFrames. Les étudiants configurent les options de lecture et traitent les enregistrements mal formés avec élégance.

  • Leçon 4 • Transformations DataFrame et opérations sur les colonnes

    Enseigne la sélection, le filtrage, le renommage, le transtypage et la dérivation de colonnes à l'aide de l'API Column. Les étudiants construisent des pipelines de transformation réutilisables.

  • Leçon 5 • Concepts et schéma des DataFrames

    Contraste les DataFrames avec les RDD, en mettant l'accent sur l'application du schéma et les avantages de l'optimiseur Catalyst. Les étudiants inspectent et définissent les schémas par programmation.

Chapitre 4Voir les détails

Techniques de nettoyage et de transformation des données

  • Leçon 1 • Types complexes : tableaux, dictionnaires et structures

    Manipule les données imbriquées et semi-structurées à l'aide de explode, de fonctions de tableau et d'accès aux structures. Les étudiants aplanissent et remodèlent les colonnes de type JSON pour une analyse tabulaire.

  • Leçon 2 • Déduplication et validation des données

    Supprime les enregistrements en double et applique les règles opérationnelles par le biais de vérifications de type assertion. Les étudiants construisent des couches de validation qui révèlent les problèmes de qualité des données dès le début.

  • Leçon 3 • Manipulation de chaînes et expressions régulières

    Utilise des fonctions de chaîne intégrées et des modèles d'expressions régulières pour nettoyer et normaliser les champs de texte. Les étudiants normalisent les formats incohérents tels que les numéros de téléphone et les catégories.

  • Leçon 4 • Traitement des dates et des horodatages

    Analyse, formatage et calculs arithmétiques sur les dates à l'aide des fonctions de date de Spark. Les étudiants extraient des caractéristiques temporelles pour l'analyse en aval.

  • Leçon 5 • Gestion des valeurs manquantes et nulles

    Identifie les modèles de valeurs nulles et applique des stratégies de suppression, de remplissage et d'imputation. Les étudiants évaluent les compromis entre la suppression et l'imputation en fonction du contexte des données.

Chapitre 5Voir les détails

Jointures, agrégations et fonctions de fenêtre

  • Leçon 1 • Modèles d'agrégation avancés

    Applique un regroupement à plusieurs niveaux, une agrégation conditionnelle et des fonctions approximatives à grande échelle. Les étudiants équilibrent la précision et le rendement pour les charges de travail d'agrégation importantes.

  • Leçon 2 • Fonctions de fenêtre : classement et ordonnancement

    Présente les spécifications de fenêtre et les fonctions de classement comme row_number, rank et dense_rank. Les étudiants attribuent des rangs ordonnés au sein de partitions pour des analyses de type classement.

  • Leçon 3 • Fonctions de fenêtre : totaux cumulatifs et décalage/avance

    Calcule les sommes cumulatives, les moyennes mobiles et les comparaisons de période en période à l'aide des limites de trame. Les étudiants construisent des mesures de séries temporelles sans auto-jointures.

  • Leçon 4 • Types de jointure et stratégies

    Couvre les jointures internes, gauches, droites, externes complètes, semi et anti avec des exemples pratiques. Les étudiants sélectionnent les types de jointure en fonction de la logique opérationnelle et de la cardinalité des données.

  • Leçon 5 • Optimisation des opérations à fort brassage

    Diagnostique les goulots d'étranglement du brassage à l'aide de l'interface utilisateur Spark et applique des stratégies de repartition, coalesce et bucketing. Les étudiants réduisent le temps d'exécution des travaux grâce à une réduction ciblée du brassage.

Chapitre 6Voir les détails

Lecture, écriture et gestion des sources de données

  • Leçon 1 • Écriture de DataFrames avec des modes de sauvegarde

    Explique les modes de sauvegarde overwrite, append, ignore et error ainsi que leurs implications en production. Les étudiants mettent en œuvre des modèles d'écriture idempotents pour des pipelines fiables.

  • Leçon 2 • Connexion au stockage en nuage et distribué

    Configure PySpark pour lire et écrire dans un stockage d'objets et des systèmes de fichiers distribués. Les étudiants s'authentifient de manière sécurisée et optimisent les paramètres d'entrée-sortie pour les environnements en nuage.

  • Leçon 3 • Formats de fichiers : Parquet, ORC, Avro et Delta

    Compare les formats columnaires et lignes sur le rendement de lecture, la compression et l'évolution du schéma. Les étudiants choisissent les formats en fonction des modèles d'accès à la charge de travail.

  • Leçon 4 • Stratégies de partitionnement et de mise en buckets

    Applique le partitionnement et la mise en buckets au moment de l'écriture pour réduire les coûts d'analyse des grands ensembles de données. Les étudiants conçoivent des schémas de partitionnement alignés sur les prédicats de requête courants.

  • Leçon 5 • Introduction aux sources de données en continu

    Donne un aperçu de Structured Streaming en lisant à partir de sources de fichiers et de sockets en mode micro-lot. Les étudiants relient les compétences des DataFrames par lots au paradigme de la diffusion en continu.

Chapitre 7Voir les détails

Réglage du rendement et optimisation

  • Leçon 1 • Mise en cache et variables broadcast

    Applique la mise en cache des DataFrames et les variables broadcast pour éliminer les calculs redondants et les transferts réseau. Les étudiants mesurent les taux de succès du cache et le comportement d'éviction.

  • Leçon 2 • Comprendre l'optimiseur Catalyst

    Montre comment Catalyst transforme les plans logiques en plans physiques optimisés par des passes basées sur des règles et des coûts. Les étudiants lisent la sortie explain pour vérifier les optimisations.

  • Leçon 3 • Gestion de la mémoire et ramasse-miettes

    Explique les régions mémoire de l'exécuteur, le stockage hors tas et l'impact du ramasse-miettes JVM sur les travaux Spark. Les étudiants ajustent les fractions mémoire pour réduire le déversement et les pauses du ramasse-miettes.

  • Leçon 4 • Partitionnement pour le parallélisme

    Aligne le nombre de partitions avec les cœurs de la grappe pour maximiser le parallélisme sans surcharge excessive. Les étudiants appliquent l'exécution adaptative des requêtes pour automatiser le dimensionnement des partitions.

  • Leçon 5 • Fonctions définies par l'utilisateur et UDF vectorisées

    Compare les UDF Python, les UDF pandas et les fonctions intégrées sur le coût de sérialisation et le débit. Les étudiants réécrivent les UDF lentes en UDF pandas vectorisées pour des accélérations d'un ordre de grandeur.

Chapitre 8Voir les détails

Construction de pipelines PySpark de bout en bout

  • Leçon 1 • Journalisation, surveillance et gestion des erreurs

    Met en œuvre la journalisation structurée, la gestion des exceptions et l'émission de mesures dans les travaux PySpark. Les étudiants construisent des pipelines observables qui révèlent les défaillances et les régressions de rendement.

  • Leçon 2 • Test du code PySpark

    Applique des modèles de tests unitaires et d'intégration à l'aide de pytest et de petits DataFrames en mémoire. Les étudiants construisent des suites de tests qui détectent les régressions avant le déploiement en production.

  • Leçon 3 • Orchestration des flux de travail avec Airflow

    Planifie et surveille les travaux PySpark à l'aide d'une orchestration basée sur DAG avec gestion des dépendances. Les étudiants construisent un DAG de pipeline en plusieurs étapes avec une logique de nouvelle tentative et d'alerte.

  • Leçon 4 • Architecture de pipeline et patrons de conception

    Présente l'architecture médaillon, la conception modulaire de pipeline et la séparation des couches d'ingestion, de transformation et de service. Les étudiants font correspondre les exigences opérationnelles aux étapes du pipeline.

  • Leçon 5 • Soumission de travaux avec spark-submit

    Empaquette les applications PySpark et les soumet aux gestionnaires de grappes avec des configurations de ressources. Les étudiants paramètrent les travaux pour une réutilisation dans différents environnements.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste de données : prêt à dépasser les limites des feuilles de calcul et du traitement sur machine unique.

  • Développeur Python : souhaite ajouter le traitement distribué des données à sa boîte à outils professionnelle.

  • Ingénieur de données junior : a besoin d'une formation structurée et pratique pour gérer des charges de travail à l'échelle de la production.

  • Développeur ou développeuse d’intelligence d’affaires : cherchant à moderniser les pipelines avec des approches évolutives et axées d’abord sur le code.

  • Reconversion professionnelle : transition vers le génie des données à partir d'un bagage en logiciel ou en analytique.

  • Étudiant diplômé : acquérir des compétences appliquées en données massives pour renforcer la compétitivité sur le marché du travail.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF