
Formation Python pour Data Engineer
Maîtrisez les compétences Python que les ingénieurs de données utilisent chaque jour — de la création de pipelines ETL et de la connexion aux bases de données à l'orchestration de flux de travail et au déploiement de code prêt pour la production. Ce cours vous fait passer des notions de base de Python aux schémas avancés d'ingénierie des données utilisés à grande échelle.
Ce que vous allez apprendre:
Vous apprendrez à écrire des scripts Python qui extraient des données à partir d'API, de fichiers et de bases de données, puis à les transformer et à les charger dans des bases de données relationnelles, des entrepôts de données et un stockage en nuage. Vous travaillerez avec Pandas pour la manipulation des données, SQLAlchemy pour la connectivité aux bases de données et Apache Airflow pour l'orchestration de pipelines. Le cours couvre la validation de la qualité des données, l'optimisation du rendement, le traitement parallèle et les pratiques d'intégration continue et de déploiement continu pour le déploiement de pipelines. Vous explorerez également PySpark pour le traitement distribué, Kafka pour les pipelines en continu et les meilleures pratiques de sécurité pour protéger les données sensibles dans les environnements de production.
Comment vous étudiez de façon pratique Formation Python pour Data Engineer
Comment vous pratiquez Formation Python pour Data Engineer
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations Python pour ingénieurs de données
Fondations Python pour ingénieurs de données
Leçon 1 • Flux de contrôle et itération
Appliquez des conditionnelles, des boucles et des compréhensions pour traiter des séquences d'enregistrements de données. Correspond directement à la logique de transformation au niveau des lignes utilisée dans les pipelines ETL.
Leçon 2 • Fonctions et gestion des exceptions
Définissez des fonctions réutilisables avec des arguments, des valeurs par défaut et des valeurs de retour, puis gérez les exceptions avec élégance. Permet un code de pipeline modulaire et tolérant aux pannes.
Leçon 3 • Syntaxe Python de base et types de données
Couvre les variables, les opérateurs et les types intégrés, y compris les chaînes, les entiers, les flottants et les booléens. Fournit la base syntaxique pour écrire toute logique de pipeline de données.
Leçon 4 • Collections : listes, tuples, dictionnaires, ensembles
Explorez les types de collections mutables et immutables ainsi que leurs compromis de rendement. Ces structures sous-tendent la manipulation de données en mémoire tout au long du cours.
Leçon 5 • Configuration de l'environnement Python
Installez Python, configurez des environnements virtuels et sélectionnez un IDE adapté au travail avec les données. Établit l'espace de travail reproductible dont dépendent tous les chapitres suivants.
Chapitre 2MasquerCacher les détailsVoir les détailsEntrées-sorties de fichiers et sérialisation de données
Entrées-sorties de fichiers et sérialisation de données
Leçon 1 • Formats binaires : Parquet et Avro
Lisez et écrivez des fichiers Parquet columnaires et Avro basés sur des lignes à l'aide de bibliothèques Python. Ces formats sont courants dans les architectures modernes de lacs de données.
Leçon 2 • Travailler avec des fichiers texte et CSV
Ouvrez, lisez et écrivez des fichiers texte à l'aide de gestionnaires de contexte, puis analysez le CSV avec la bibliothèque standard. Couvre le format de données brutes le plus courant dans les pipelines par lots.
Leçon 3 • Opérations sur le système de fichiers et les chemins
Parcourez les répertoires, globez les fichiers et gérez les chemins à l'aide des modules pathlib et os. Automatise les étapes de découverte de fichiers courantes dans les flux d'ingestion par lots.
Leçon 4 • Formats de données JSON et XML
Analysez et sérialisez des charges utiles JSON et parcourez des arbres XML pour le traitement des API et des fichiers de configuration. Fait le lien avec l'ingestion réelle de réponses d'API REST.
Chapitre 3MasquerCacher les détailsVoir les détailsManipulation de données avec Pandas
Manipulation de données avec Pandas
Leçon 1 • Notions fondamentales sur DataFrames et Series
Créez des DataFrames à partir de dictionnaires, CSV et JSON, puis inspectez la structure et les types de données. Forme la base de tout travail de transformation basé sur Pandas.
Leçon 2 • Filtrage, tri et sélection
Appliquez des masques booléens, des sélecteurs loc/iloc et des opérations de tri pour isoler des sous-ensembles de données pertinents. Soutient directement le filtrage de la qualité des données dans les étapes du pipeline.
Leçon 3 • Agrégation, regroupement et pivotement
Résumez les données avec les opérations groupby, agg et pivot pour produire des résultats analytiques. Permet le calcul de métriques et la génération de rapports dans les flux de pipeline.
Leçon 4 • Nettoyage des données et coercition de types
Gérez les valeurs manquantes, les doublons et les types incorrects pour produire des ensembles de données propres et cohérents. Le nettoyage est l'étape la plus chronophage dans les pipelines de données réels.
Leçon 5 • Fusion et jointure de DataFrames
Combinez des ensembles de données à l'aide de merge, join et concat pour reproduire une logique relationnelle de style SQL. Essentiel pour dénormaliser les données avant de les charger dans des magasins analytiques.
Chapitre 4MasquerCacher les détailsVoir les détailsConnectivité aux bases de données et intégration SQL
Connectivité aux bases de données et intégration SQL
Leçon 1 • Travailler avec des bases de données NoSQL
Connectez-vous aux magasins de documents et de clés-valeurs, effectuez des opérations CRUD et mappez les résultats vers des objets Python. Étend la connectivité du pipeline au-delà des systèmes relationnels.
Leçon 2 • Bases de données relationnelles avec SQLAlchemy
Établissez des connexions, reflétez des schémas et exécutez du SQL brut à l'aide de l'API centrale de SQLAlchemy. Fournit une couche d'accès aux bases de données indépendante du système pour le code de pipeline.
Leçon 3 • Gestion de pool de connexions et meilleures pratiques
Configurez des pools de connexions, gérez les identifiants de manière sécurisée et évitez les anti-patrons courants. Assure une fiabilité et une sécurité de qualité production dans le code d'accès aux bases de données.
Leçon 4 • Écriture et mise à jour/insertion de données
Insérez, mettez à jour et mettez à jour/insérez des enregistrements par programmation à l'aide de SQLAlchemy et de la méthode to_sql de Pandas. Couvre le chemin d'écriture requis pour charger les sorties du pipeline dans les bases de données.
Chapitre 5MasquerCacher les détailsVoir les détailsConstruction de pipelines ETL en Python
Construction de pipelines ETL en Python
Leçon 1 • Journalisation et observabilité des pipelines
Instrumentez les pipelines avec une journalisation structurée, des métriques et des alertes pour permettre la surveillance opérationnelle. Transforme les scripts en processus observables et prêts pour la production.
Leçon 2 • Logique de transformation et règles métier
Implémentez des mappages de champs, des colonnes dérivées et des règles de validation sous forme de fonctions Python pures. Encapsule la logique métier dans des unités de transformation testables et réutilisables.
Leçon 3 • Chargement de données vers des systèmes cibles
Écrivez les données transformées vers des bases de données, des entrepôts de données et du stockage d'objets à l'aide de connecteurs Python. Complète le pipeline en livrant les données nettoyées à leur destination.
Leçon 4 • Architecture ETL et patrons de conception
Comprenez les étapes du pipeline, le flux de données et les patrons de conception courants comme ELT et l'architecture médaille d'or. Établit le cadre conceptuel pour tout travail de mise en œuvre de pipeline.
Leçon 5 • Extraction de données à partir d'API
Récupérez des données d'API REST à l'aide de la bibliothèque requests, gérez la pagination et gérez les limites de débit. Couvre la source de données moderne la plus courante pour les pipelines d'ingestion.
Chapitre 6MasquerCacher les détailsVoir les détailsTravailler avec le stockage et les services dans le nuage
Travailler avec le stockage et les services dans le nuage
Leçon 1 • Infrastructure en tant que code pour les pipelines de données
Définissez des ressources dans le nuage par programmation à l'aide d'outils IaC basés sur Python pour automatiser la configuration de l'environnement. Réduit le provisionnement manuel et assure une infrastructure de pipeline reproductible.
Leçon 2 • Ingestion pilotée par les événements avec files de messages
Produisez et consommez des messages à partir de files d'attente et de sujets de diffusion en continu pour déclencher l'exécution du pipeline. Connecte les pipelines Python aux architectures de données pilotées par les événements et en temps réel.
Leçon 3 • Interaction avec les entrepôts de données gérés
Connectez-vous aux entrepôts de données dans le nuage via des connecteurs Python, exécutez des requêtes et chargez les données efficacement. Permet aux pipelines Python de servir des charges de travail analytiques à grande échelle.
Leçon 4 • Stockage d'objets dans le nuage avec SDK Python
Téléchargez, téléchargez, listez et supprimez des objets dans des compartiments de stockage dans le nuage à l'aide de SDK de fournisseurs. Le stockage d'objets est la zone de réception principale des données brutes dans les pipelines dans le nuage.
Chapitre 7MasquerCacher les détailsVoir les détailsOrchestration et ordonnancement des pipelines
Orchestration et ordonnancement des pipelines
Leçon 1 • Gestion des erreurs et stratégies de nouvelles tentatives
Configurez les nouvelles tentatives, les délais d'attente et les alertes SLA pour rendre les pipelines orchestrés résilients aux défaillances transitoires. Réduit directement l'intervention manuelle dans les environnements de production.
Leçon 2 • DAG dynamiques et paramétrage
Générez des DAG par programmation et transmettez des paramètres d'exécution aux tâches pour une exécution flexible du pipeline. Permet l'orchestration évolutive de nombreuses variantes de pipeline similaires.
Leçon 3 • Concepts d'orchestration et paysage des outils
Comprenez les DAG, les dépendances de tâches et le rôle des orchestrateurs dans l'ingénierie des données. Fournit la base conceptuelle avant de mettre en œuvre le code d'orchestration.
Leçon 4 • Construction de DAG avec Apache Airflow
Définissez des DAG, des opérateurs et des dépendances de tâches dans Airflow à l'aide de Python pour planifier les exécutions de pipeline. Airflow est l'orchestrateur le plus déployé en ingénierie des données.
Leçon 5 • Surveillance et alertes dans l'orchestration
Utilisez les interfaces utilisateur de l'orchestrateur, les journaux et les intégrations d'alertes externes pour suivre la santé du pipeline. Ferme la boucle d'observabilité pour les opérations de pipeline de bout en bout.
Chapitre 8MasquerCacher les détailsVoir les détailsRendement, tests et préparation à la production
Rendement, tests et préparation à la production
Leçon 1 • Qualité du code et empaquetage
Appliquez le style avec des linters, vérifiez les types avec mypy et empaquetez le code du pipeline en modules Python installables. Élève la maintenabilité du code aux normes professionnelles du génie logiciel.
Leçon 2 • Tests unitaires et d'intégration pour les pipelines
Rédigez des tests unitaires basés sur pytest pour les fonctions de transformation et des tests d'intégration pour les interactions avec les bases de données. Les tests préviennent les régressions et valident l'exactitude du pipeline.
Leçon 3 • Traitement parallèle et concurrent
Appliquez les patrons multiprocessing, threading et async pour paralléliser les tâches de pipeline liées aux E/S et au CPU. Réduit considérablement le temps d'exécution de bout en bout du pipeline.
Leçon 4 • Profilage et optimisation du code Python
Identifiez les goulots d'étranglement à l'aide d'outils de profilage et appliquez la vectorisation, le découpage en lots et la mise en cache pour améliorer le débit. L'optimisation du rendement est essentielle pour les pipelines de données à grande échelle.
Leçon 5 • CI/CD pour le déploiement de pipelines de données
Automatisez les tests, le linting et le déploiement du code de pipeline à l'aide de pipelines CI/CD déclenchés par des événements de gestion de versions. Permet des mises en production sécurisées et reproductibles.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste de données junior : prêt à automatiser les flux de travail de données répétitifs avec Python.
Développeur SQL : souhaitant approfondir ses compétences dans la construction programmatique de pipelines.
Développeur logiciel : faire la transition vers l'ingénierie des données à partir d'une formation générale en programmation.
Ingénieur ou ingénieure en intelligence d'affaires : cherchant à posséder l'ensemble du pipeline de données de bout en bout.
Récent diplômé en informatique : cherchant une expérience pratique en ingénierie des données prête pour l'emploi.
Programmeur autodidacte : passionné par les données et visant un poste d'ingénieur.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















