
Formation Apache PySpark
Maîtrisez PySpark de A à Z et traitez des données à une échelle que de simples machines ne peuvent tout simplement pas gérer. Ce cours vous amène des concepts fondamentaux de l'informatique distribuée aux pipelines prêts pour la production, en couvrant les DataFrames, Spark SQL, le réglage du rendement et le déploiement en nuage. Que vous fassiez votre entrée dans l'ingénierie des données ou que vous perfectionniez vos compétences en mégadonnées, il s'agit de la formation pratique dont vous avez besoin.
Ce que vous allez apprendre:
Vous commencerez avec l'architecture Spark et les RDD, puis passerez à l'API DataFrame, Spark SQL et aux opérations avancées comme les jointures, les fonctions de fenêtre et les agrégations. Vous apprendrez à nettoyer des données réelles désordonnées, à lire et écrire plusieurs formats de fichiers, et à connecter PySpark à des systèmes de stockage en nuage. Le cours couvre l'optimisation du rendement à l'aide de l'optimiseur Catalyst, des stratégies de mise en cache et des UDF vectorisées. Vous explorerez également Structured Streaming, Delta Lake et MLlib pour l'apprentissage automatique à grande échelle. À la fin, vous créerez des pipelines PySpark complets, testables et orchestrés, prêts pour la production.
Comment vous étudiez de façon pratique Formation Apache PySpark
Comment vous pratiquez Formation Apache PySpark
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsIntroduction à PySpark et aux mégadonnées
Introduction à PySpark et aux mégadonnées
Leçon 1 • Aperçu de l'architecture Apache Spark
Explique le modèle pilote-exécuteur de Spark, les gestionnaires de grappes et le moteur d'exécution DAG. Fournit le modèle mental dont les étudiants ont besoin pour raisonner sur le comportement des travaux PySpark.
Leçon 2 • Concepts et défis des mégadonnées
Couvre le volume, la vélocité et la variété comme moteurs des besoins de traitement distribué. Établit pourquoi les outils traditionnels échouent à grande échelle, motivant l'approche PySpark.
Leçon 3 • Notions de base de SparkSession et SparkContext
Présente SparkSession comme point d'entrée unifié pour toutes les fonctionnalités Spark. Les étudiants créent des sessions, définissent des configurations et comprennent la hiérarchie des contextes.
Leçon 4 • Configuration de l'environnement PySpark
Guide l'installation de Java, Python et PySpark localement et via des carnets en nuage. Les étudiants vérifient leur configuration en exécutant un contexte Spark minimal.
Leçon 5 • Exécution de votre premier travail PySpark
Parcourt la lecture d'un fichier, l'application d'une transformation et la collecte des résultats. Relie les concepts d'architecture à l'exécution observable des travaux dans l'interface utilisateur Spark.
Chapitre 2MasquerCacher les détailsVoir les détailsEnsembles de données distribués résilients (RDD)
Ensembles de données distribués résilients (RDD)
Leçon 1 • Création de RDD à partir de diverses sources
Démontre la parallélisation de collections Python et la lecture à partir de fichiers et de systèmes externes. Les étudiants s'exercent à créer des RDD avec des nombres de partitions contrôlés.
Leçon 2 • Actions et persistance des RDD
Explique comment les actions déclenchent l'exécution et comment la mise en cache évite les recalculs redondants. Les étudiants choisissent des niveaux de stockage appropriés pour les charges de travail itératives.
Leçon 3 • Transformations : map, filter et flatMap
Couvre les transformations paresseuses de base qui remodèlent le contenu des RDD élément par élément. Les étudiants construisent des chaînes de transformation et inspectent le DAG résultant.
Leçon 4 • RDD clé-valeur et opérations sur paires
Présente les RDD de paires et les opérations basées sur le brassage comme groupByKey et reduceByKey. Les étudiants apprennent à minimiser les brassages pour un meilleur rendement.
Leçon 5 • Fondements et propriétés des RDD
Définit les RDD comme des collections immuables, partitionnées et tolérantes aux pannes. Explique les graphes de lignée et comment Spark reconstitue automatiquement les partitions perdues.
Chapitre 3MasquerCacher les détailsVoir les détailsDataFrames et l'API Spark SQL
DataFrames et l'API Spark SQL
Leçon 1 • Spark SQL : interrogation avec la syntaxe SQL
Enregistre les DataFrames en tant que vues temporaires et les interroge avec du SQL standard. Les étudiants combinent des appels SQL et d'API DataFrame dans le même pipeline.
Leçon 2 • Agrégations et regroupement
Applique groupBy, agg et les fonctions de fenêtre pour résumer les données à différentes granularités. Les étudiants produisent des mesures de niveau opérationnel à partir de données d'événements brutes.
Leçon 3 • Création de DataFrames à partir de multiples sources
Couvre la lecture de sources CSV, JSON, Parquet et JDBC dans des DataFrames. Les étudiants configurent les options de lecture et traitent les enregistrements mal formés avec élégance.
Leçon 4 • Transformations DataFrame et opérations sur les colonnes
Enseigne la sélection, le filtrage, le renommage, le transtypage et la dérivation de colonnes à l'aide de l'API Column. Les étudiants construisent des pipelines de transformation réutilisables.
Leçon 5 • Concepts et schéma des DataFrames
Contraste les DataFrames avec les RDD, en mettant l'accent sur l'application du schéma et les avantages de l'optimiseur Catalyst. Les étudiants inspectent et définissent les schémas par programmation.
Chapitre 4MasquerCacher les détailsVoir les détailsTechniques de nettoyage et de transformation des données
Techniques de nettoyage et de transformation des données
Leçon 1 • Types complexes : tableaux, dictionnaires et structures
Manipule les données imbriquées et semi-structurées à l'aide de explode, de fonctions de tableau et d'accès aux structures. Les étudiants aplanissent et remodèlent les colonnes de type JSON pour une analyse tabulaire.
Leçon 2 • Déduplication et validation des données
Supprime les enregistrements en double et applique les règles opérationnelles par le biais de vérifications de type assertion. Les étudiants construisent des couches de validation qui révèlent les problèmes de qualité des données dès le début.
Leçon 3 • Manipulation de chaînes et expressions régulières
Utilise des fonctions de chaîne intégrées et des modèles d'expressions régulières pour nettoyer et normaliser les champs de texte. Les étudiants normalisent les formats incohérents tels que les numéros de téléphone et les catégories.
Leçon 4 • Traitement des dates et des horodatages
Analyse, formatage et calculs arithmétiques sur les dates à l'aide des fonctions de date de Spark. Les étudiants extraient des caractéristiques temporelles pour l'analyse en aval.
Leçon 5 • Gestion des valeurs manquantes et nulles
Identifie les modèles de valeurs nulles et applique des stratégies de suppression, de remplissage et d'imputation. Les étudiants évaluent les compromis entre la suppression et l'imputation en fonction du contexte des données.
Chapitre 5MasquerCacher les détailsVoir les détailsJointures, agrégations et fonctions de fenêtre
Jointures, agrégations et fonctions de fenêtre
Leçon 1 • Modèles d'agrégation avancés
Applique un regroupement à plusieurs niveaux, une agrégation conditionnelle et des fonctions approximatives à grande échelle. Les étudiants équilibrent la précision et le rendement pour les charges de travail d'agrégation importantes.
Leçon 2 • Fonctions de fenêtre : classement et ordonnancement
Présente les spécifications de fenêtre et les fonctions de classement comme row_number, rank et dense_rank. Les étudiants attribuent des rangs ordonnés au sein de partitions pour des analyses de type classement.
Leçon 3 • Fonctions de fenêtre : totaux cumulatifs et décalage/avance
Calcule les sommes cumulatives, les moyennes mobiles et les comparaisons de période en période à l'aide des limites de trame. Les étudiants construisent des mesures de séries temporelles sans auto-jointures.
Leçon 4 • Types de jointure et stratégies
Couvre les jointures internes, gauches, droites, externes complètes, semi et anti avec des exemples pratiques. Les étudiants sélectionnent les types de jointure en fonction de la logique opérationnelle et de la cardinalité des données.
Leçon 5 • Optimisation des opérations à fort brassage
Diagnostique les goulots d'étranglement du brassage à l'aide de l'interface utilisateur Spark et applique des stratégies de repartition, coalesce et bucketing. Les étudiants réduisent le temps d'exécution des travaux grâce à une réduction ciblée du brassage.
Chapitre 6MasquerCacher les détailsVoir les détailsLecture, écriture et gestion des sources de données
Lecture, écriture et gestion des sources de données
Leçon 1 • Écriture de DataFrames avec des modes de sauvegarde
Explique les modes de sauvegarde overwrite, append, ignore et error ainsi que leurs implications en production. Les étudiants mettent en œuvre des modèles d'écriture idempotents pour des pipelines fiables.
Leçon 2 • Connexion au stockage en nuage et distribué
Configure PySpark pour lire et écrire dans un stockage d'objets et des systèmes de fichiers distribués. Les étudiants s'authentifient de manière sécurisée et optimisent les paramètres d'entrée-sortie pour les environnements en nuage.
Leçon 3 • Formats de fichiers : Parquet, ORC, Avro et Delta
Compare les formats columnaires et lignes sur le rendement de lecture, la compression et l'évolution du schéma. Les étudiants choisissent les formats en fonction des modèles d'accès à la charge de travail.
Leçon 4 • Stratégies de partitionnement et de mise en buckets
Applique le partitionnement et la mise en buckets au moment de l'écriture pour réduire les coûts d'analyse des grands ensembles de données. Les étudiants conçoivent des schémas de partitionnement alignés sur les prédicats de requête courants.
Leçon 5 • Introduction aux sources de données en continu
Donne un aperçu de Structured Streaming en lisant à partir de sources de fichiers et de sockets en mode micro-lot. Les étudiants relient les compétences des DataFrames par lots au paradigme de la diffusion en continu.
Chapitre 7MasquerCacher les détailsVoir les détailsRéglage du rendement et optimisation
Réglage du rendement et optimisation
Leçon 1 • Mise en cache et variables broadcast
Applique la mise en cache des DataFrames et les variables broadcast pour éliminer les calculs redondants et les transferts réseau. Les étudiants mesurent les taux de succès du cache et le comportement d'éviction.
Leçon 2 • Comprendre l'optimiseur Catalyst
Montre comment Catalyst transforme les plans logiques en plans physiques optimisés par des passes basées sur des règles et des coûts. Les étudiants lisent la sortie explain pour vérifier les optimisations.
Leçon 3 • Gestion de la mémoire et ramasse-miettes
Explique les régions mémoire de l'exécuteur, le stockage hors tas et l'impact du ramasse-miettes JVM sur les travaux Spark. Les étudiants ajustent les fractions mémoire pour réduire le déversement et les pauses du ramasse-miettes.
Leçon 4 • Partitionnement pour le parallélisme
Aligne le nombre de partitions avec les cœurs de la grappe pour maximiser le parallélisme sans surcharge excessive. Les étudiants appliquent l'exécution adaptative des requêtes pour automatiser le dimensionnement des partitions.
Leçon 5 • Fonctions définies par l'utilisateur et UDF vectorisées
Compare les UDF Python, les UDF pandas et les fonctions intégrées sur le coût de sérialisation et le débit. Les étudiants réécrivent les UDF lentes en UDF pandas vectorisées pour des accélérations d'un ordre de grandeur.
Chapitre 8MasquerCacher les détailsVoir les détailsConstruction de pipelines PySpark de bout en bout
Construction de pipelines PySpark de bout en bout
Leçon 1 • Journalisation, surveillance et gestion des erreurs
Met en œuvre la journalisation structurée, la gestion des exceptions et l'émission de mesures dans les travaux PySpark. Les étudiants construisent des pipelines observables qui révèlent les défaillances et les régressions de rendement.
Leçon 2 • Test du code PySpark
Applique des modèles de tests unitaires et d'intégration à l'aide de pytest et de petits DataFrames en mémoire. Les étudiants construisent des suites de tests qui détectent les régressions avant le déploiement en production.
Leçon 3 • Orchestration des flux de travail avec Airflow
Planifie et surveille les travaux PySpark à l'aide d'une orchestration basée sur DAG avec gestion des dépendances. Les étudiants construisent un DAG de pipeline en plusieurs étapes avec une logique de nouvelle tentative et d'alerte.
Leçon 4 • Architecture de pipeline et patrons de conception
Présente l'architecture médaillon, la conception modulaire de pipeline et la séparation des couches d'ingestion, de transformation et de service. Les étudiants font correspondre les exigences opérationnelles aux étapes du pipeline.
Leçon 5 • Soumission de travaux avec spark-submit
Empaquette les applications PySpark et les soumet aux gestionnaires de grappes avec des configurations de ressources. Les étudiants paramètrent les travaux pour une réutilisation dans différents environnements.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste de données : prêt à dépasser les limites des feuilles de calcul et du traitement sur machine unique.
Développeur Python : souhaite ajouter le traitement distribué des données à sa boîte à outils professionnelle.
Ingénieur de données junior : a besoin d'une formation structurée et pratique pour gérer des charges de travail à l'échelle de la production.
Développeur ou développeuse d’intelligence d’affaires : cherchant à moderniser les pipelines avec des approches évolutives et axées d’abord sur le code.
Reconversion professionnelle : transition vers le génie des données à partir d'un bagage en logiciel ou en analytique.
Étudiant diplômé : acquérir des compétences appliquées en données massives pour renforcer la compétitivité sur le marché du travail.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















