
Formation Python pour Data Engineer
Maîtrisez les compétences Python que les ingénieurs de données utilisent chaque jour — de la création de pipelines ETL et de la connexion aux bases de données à l'orchestration de workflows et au déploiement de code prêt pour la production. Ce cours vous fait passer des fondamentaux de Python aux schémas avancés d'ingénierie des données utilisés à grande échelle.
Ce que vous allez apprendre:
Vous apprendrez à écrire des scripts Python qui extraient des données depuis des API, des fichiers et des bases de données, puis les transforment et les chargent dans des bases de données relationnelles, des entrepôts de données et du stockage cloud. Vous travaillerez avec Pandas pour la manipulation des données, SQLAlchemy pour la connectivité aux bases de données et Apache Airflow pour l'orchestration des pipelines. Ce cours couvre la validation de la qualité des données, l'optimisation des performances, le traitement parallèle et les pratiques CI/CD pour le déploiement de pipelines. Vous explorerez également PySpark pour le traitement distribué, Kafka pour les pipelines de streaming et les bonnes pratiques de sécurité pour protéger les données sensibles dans les environnements de production.
Comment vous étudiez de façon pratique Formation Python pour Data Engineer
Comment vous pratiquez Formation Python pour Data Engineer
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations Python pour ingénieurs de données
Fondations Python pour ingénieurs de données
Leçon 1 • Flux de contrôle et itération
Appliquez des conditionnelles, des boucles et des compréhensions pour traiter des séquences d'enregistrements de données. Correspond directement à la logique de transformation au niveau ligne utilisée dans les pipelines ETL.
Leçon 2 • Fonctions et gestion des erreurs
Définissez des fonctions réutilisables avec des arguments, des valeurs par défaut et des valeurs de retour, puis gérez les exceptions avec élégance. Permet d'écrire un code de pipeline modulaire et tolérant aux pannes.
Leçon 3 • Syntaxe Python fondamentale et types de données
Couvre les variables, les opérateurs et les types natifs, y compris les chaînes, les entiers, les flottants et les booléens. Fournit la base syntaxique pour écrire toute logique de pipeline de données.
Leçon 4 • Collections : listes, tuples, dictionnaires, ensembles
Explorez les types de collections mutables et immuables ainsi que leurs compromis de performance. Ces structures sous-tendent la manipulation des données en mémoire tout au long du cours.
Leçon 5 • Mise en place de l'environnement Python
Installez Python, configurez des environnements virtuels et sélectionnez un IDE adapté au travail sur les données. Établit l'espace de travail reproductible dont dépendent tous les chapitres suivants.
Chapitre 2MasquerCacher les détailsVoir les détailsEntrées-sorties de fichiers et sérialisation des données
Entrées-sorties de fichiers et sérialisation des données
Leçon 1 • Formats binaires : Parquet et Avro
Lisez et écrivez des fichiers Parquet columnaires et Avro orientés lignes à l'aide de bibliothèques Python. Ces formats sont standards dans les architectures modernes de lacs de données.
Leçon 2 • Utilisation des fichiers texte et CSV
Ouvrez, lisez et écrivez des fichiers texte à l'aide de gestionnaires de contexte, puis analysez les CSV avec la bibliothèque standard. Couvre le format de données brutes le plus courant dans les pipelines par lots.
Leçon 3 • Opérations sur le système de fichiers et les chemins
Naviguez dans les répertoires, globez les fichiers et gérez les chemins à l'aide des modules pathlib et os. Automatise les étapes de découverte de fichiers courantes dans les workflows d'ingestion par lots.
Leçon 4 • Formats de données JSON et XML
Analysez et sérialisez des charges utiles JSON et naviguez dans des arbres XML pour le traitement d'API et de fichiers de configuration. Connecte à l'ingestion réelle de réponses d'API REST.
Chapitre 3MasquerCacher les détailsVoir les détailsManipulation de données avec Pandas
Manipulation de données avec Pandas
Leçon 1 • Fondamentaux des DataFrames et des Series
Créez des DataFrames à partir de dictionnaires, de CSV et de JSON, puis inspectez la structure et les types de données. Forme la base de tout travail de transformation basé sur Pandas.
Leçon 2 • Filtrage, tri et sélection
Appliquez des masques booléens, des sélecteurs loc/iloc et des opérations de tri pour isoler des sous-ensembles de données pertinents. Soutient directement le filtrage de la qualité des données dans les étapes du pipeline.
Leçon 3 • Agrégation, regroupement et pivotement
Résumez les données avec les opérations groupby, agg et pivot pour produire des résultats analytiques. Permet le calcul de métriques et le reporting dans les workflows de pipeline.
Leçon 4 • Nettoyage des données et coercition de type
Gérez les valeurs manquantes, les doublons et les types incorrects pour produire des ensembles de données propres et cohérents. Le nettoyage est l'étape la plus chronophage dans les pipelines de données réels.
Leçon 5 • Fusion et jointure de DataFrames
Combinez des ensembles de données à l'aide de merge, join et concat pour reproduire la logique relationnelle de type SQL. Essentiel pour dénormaliser les données avant de les charger dans des magasins analytiques.
Chapitre 4MasquerCacher les détailsVoir les détailsConnectivité aux bases de données et intégration SQL
Connectivité aux bases de données et intégration SQL
Leçon 1 • Utilisation des bases de données NoSQL
Connectez-vous aux magasins de documents et de clés-valeurs, effectuez des opérations CRUD et mappez les résultats sur des objets Python. Étend la connectivité des pipelines au-delà des systèmes relationnels.
Leçon 2 • Bases de données relationnelles avec SQLAlchemy
Établissez des connexions, reflétez les schémas et exécutez du SQL brut à l'aide de l'API de base de SQLAlchemy. Fournit une couche d'accès aux bases de données indépendante du système pour le code de pipeline.
Leçon 3 • Gestion de pool de connexions et bonnes pratiques
Configurez les pools de connexions, gérez les identifiants de manière sécurisée et évitez les anti-patrons courants. Garantit la fiabilité et la sécurité de niveau production dans le code d'accès aux bases de données.
Leçon 4 • Écriture et mise à jour/insertion de données
Insérez, mettez à jour et insérez/mettez à jour des enregistrements par programmation à l'aide de SQLAlchemy et de la méthode to_sql de Pandas. Couvre le chemin d'écriture requis pour charger les sorties du pipeline dans les bases de données.
Chapitre 5MasquerCacher les détailsVoir les détailsConstruction de pipelines ETL en Python
Construction de pipelines ETL en Python
Leçon 1 • Journalisation et observabilité des pipelines
Instrumentez les pipelines avec une journalisation structurée, des métriques et des alertes pour permettre une surveillance opérationnelle. Transforme les scripts en processus observables, prêts pour la production.
Leçon 2 • Logique de transformation et règles métier
Implémentez les mappages de champs, les colonnes dérivées et les règles de validation sous forme de fonctions Python pures. Encapsule la logique métier dans des unités de transformation testables et réutilisables.
Leçon 3 • Chargement des données vers les systèmes cibles
Écrivez les données transformées vers des bases de données, des entrepôts de données et un stockage d'objets à l'aide de connecteurs Python. Achève le pipeline en livrant les données nettoyées à leur destination.
Leçon 4 • Architecture ETL et patrons de conception
Comprenez les étapes du pipeline, le flux de données et les patrons de conception courants tels que ELT et l'architecture médaillon. Définit le cadre conceptuel pour tout travail d'implémentation de pipeline.
Leçon 5 • Extraction de données à partir d'API
Récupérez des données à partir d'API REST à l'aide de la bibliothèque requests, gérez la pagination et les limites de débit. Couvre la source de données moderne la plus courante pour les pipelines d'ingestion.
Chapitre 6MasquerCacher les détailsVoir les détailsUtilisation du stockage cloud et des services
Utilisation du stockage cloud et des services
Leçon 1 • Infrastructure en tant que code pour les pipelines de données
Définissez des ressources cloud par programmation à l'aide d'outils IaC basés sur Python pour automatiser la configuration de l'environnement. Réduit le provisionnement manuel et garantit une infrastructure de pipeline reproductible.
Leçon 2 • Ingestion pilotée par les événements avec les files de messages
Produisez et consommez des messages à partir de files d'attente et de sujets de streaming pour déclencher l'exécution du pipeline. Connecte les pipelines Python aux architectures de données pilotées par les événements et en temps réel.
Leçon 3 • Interaction avec les entrepôts de données gérés
Connectez-vous aux entrepôts de données cloud via des connecteurs Python, exécutez des requêtes et chargez les données efficacement. Permet aux pipelines Python de servir des workloads analytiques à grande échelle.
Leçon 4 • Stockage d'objets cloud avec les SDK Python
Téléchargez, téléchargez vers le bas, listez et supprimez des objets dans des buckets de stockage cloud à l'aide des SDK des fournisseurs. Le stockage d'objets est la zone de réception principale pour les données brutes dans les pipelines cloud.
Chapitre 7MasquerCacher les détailsVoir les détailsOrchestration et planification des pipelines
Orchestration et planification des pipelines
Leçon 1 • Gestion des erreurs et stratégies de nouvelle tentative
Configurez les nouvelles tentatives, les délais d'attente et les alertes SLA pour rendre les pipelines orchestrés résilients aux pannes transitoires. Réduit directement l'intervention manuelle dans les environnements de production.
Leçon 2 • DAG dynamiques et paramétrage
Générez des DAG par programmation et passez des paramètres d'exécution aux tâches pour une exécution flexible des pipelines. Permet l'orchestration scalable de nombreuses variantes de pipelines similaires.
Leçon 3 • Concepts d'orchestration et paysage des outils
Comprenez les DAG, les dépendances de tâches et le rôle des orchestrateurs dans l'ingénierie des données. Fournit les bases conceptuelles avant de mettre en œuvre le code d'orchestration.
Leçon 4 • Construction de DAG avec Apache Airflow
Définissez des DAG, des opérateurs et des dépendances de tâches dans Airflow à l'aide de Python pour planifier les exécutions de pipeline. Airflow est l'orchestrateur le plus largement déployé dans l'ingénierie des données.
Leçon 5 • Surveillance et alertes dans l'orchestration
Utilisez les interfaces utilisateur de l'orchestrateur, les journaux et les intégrations d'alertes externes pour suivre la santé du pipeline. Boucle la boucle d'observabilité pour les opérations de pipeline de bout en bout.
Chapitre 8MasquerCacher les détailsVoir les détailsPerformance, tests et préparation à la production
Performance, tests et préparation à la production
Leçon 1 • Qualité du code et empaquetage
Appliquez le style avec des linters, vérifiez les types avec mypy et empaquetez le code du pipeline sous forme de modules Python installables. Élève la maintenabilité du code aux normes professionnelles du génie logiciel.
Leçon 2 • Tests unitaires et d'intégration pour les pipelines
Écrivez des tests unitaires basés sur pytest pour les fonctions de transformation et des tests d'intégration pour les interactions avec les bases de données. Les tests préviennent les régressions et valident l'exactitude du pipeline.
Leçon 3 • Traitement parallèle et concurrent
Appliquez les modèles multiprocessing, threading et async pour paralléliser les tâches de pipeline liées aux E/S et au CPU. Réduit significativement le temps d'exécution de bout en bout du pipeline.
Leçon 4 • Profilage et optimisation du code Python
Identifiez les goulots d'étranglement à l'aide d'outils de profilage et appliquez la vectorisation, le découpage en morceaux et la mise en cache pour améliorer le débit. L'optimisation des performances est critique pour les pipelines de données à grande échelle.
Leçon 5 • CI/CD pour le déploiement de pipelines de données
Automatisez les tests, le linting et le déploiement du code de pipeline à l'aide de pipelines CI/CD déclenchés par des événements de contrôle de version. Permet des mises en production sûres et reproductibles.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste de données junior : prêt à automatiser les flux de données répétitifs avec Python.
SQL developer souhaitant étendre ses compétences à la construction de pipelines programmatiques.
Développeur logiciel : faire une transition vers l'ingénierie des données à partir d'un bagage général en programmation.
Ingénieur en business intelligence : cherchant à posséder l'intégralité du pipeline de données de bout en bout.
Jeune diplômé en informatique à la recherche d'une expérience pratique et prête à l'emploi en ingénierie des données.
Programmeur autodidacte : passionné par les données et visant un rôle d'ingénieur.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Maroc ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















