Choisissez votre langue
Formation Python pour Data Engineer
Plus de 2 millions d'étudiants dans le monde

Formation Python pour Data Engineer

Maîtrisez les compétences Python que les ingénieurs de données utilisent chaque jour — de la création de pipelines ETL et de la connexion aux bases de données à l'orchestration de workflows et au déploiement de code prêt pour la production. Ce cours vous fait passer des fondamentaux de Python aux schémas avancés d'ingénierie des données utilisés à grande échelle.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous apprendrez à écrire des scripts Python qui extraient des données depuis des API, des fichiers et des bases de données, puis les transforment et les chargent dans des bases de données relationnelles, des entrepôts de données et du stockage cloud. Vous travaillerez avec Pandas pour la manipulation des données, SQLAlchemy pour la connectivité aux bases de données et Apache Airflow pour l'orchestration des pipelines. Ce cours couvre la validation de la qualité des données, l'optimisation des performances, le traitement parallèle et les pratiques CI/CD pour le déploiement de pipelines. Vous explorerez également PySpark pour le traitement distribué, Kafka pour les pipelines de streaming et les bonnes pratiques de sécurité pour protéger les données sensibles dans les environnements de production.

Comment vous étudiez de façon pratique Formation Python pour Data Engineer

Comment vous pratiquez Formation Python pour Data Engineer

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations Python pour ingénieurs de données

  • Leçon 1 • Flux de contrôle et itération

    Appliquez des conditionnelles, des boucles et des compréhensions pour traiter des séquences d'enregistrements de données. Correspond directement à la logique de transformation au niveau ligne utilisée dans les pipelines ETL.

  • Leçon 2 • Fonctions et gestion des erreurs

    Définissez des fonctions réutilisables avec des arguments, des valeurs par défaut et des valeurs de retour, puis gérez les exceptions avec élégance. Permet d'écrire un code de pipeline modulaire et tolérant aux pannes.

  • Leçon 3 • Syntaxe Python fondamentale et types de données

    Couvre les variables, les opérateurs et les types natifs, y compris les chaînes, les entiers, les flottants et les booléens. Fournit la base syntaxique pour écrire toute logique de pipeline de données.

  • Leçon 4 • Collections : listes, tuples, dictionnaires, ensembles

    Explorez les types de collections mutables et immuables ainsi que leurs compromis de performance. Ces structures sous-tendent la manipulation des données en mémoire tout au long du cours.

  • Leçon 5 • Mise en place de l'environnement Python

    Installez Python, configurez des environnements virtuels et sélectionnez un IDE adapté au travail sur les données. Établit l'espace de travail reproductible dont dépendent tous les chapitres suivants.

Chapitre 2Voir les détails

Entrées-sorties de fichiers et sérialisation des données

  • Leçon 1 • Formats binaires : Parquet et Avro

    Lisez et écrivez des fichiers Parquet columnaires et Avro orientés lignes à l'aide de bibliothèques Python. Ces formats sont standards dans les architectures modernes de lacs de données.

  • Leçon 2 • Utilisation des fichiers texte et CSV

    Ouvrez, lisez et écrivez des fichiers texte à l'aide de gestionnaires de contexte, puis analysez les CSV avec la bibliothèque standard. Couvre le format de données brutes le plus courant dans les pipelines par lots.

  • Leçon 3 • Opérations sur le système de fichiers et les chemins

    Naviguez dans les répertoires, globez les fichiers et gérez les chemins à l'aide des modules pathlib et os. Automatise les étapes de découverte de fichiers courantes dans les workflows d'ingestion par lots.

  • Leçon 4 • Formats de données JSON et XML

    Analysez et sérialisez des charges utiles JSON et naviguez dans des arbres XML pour le traitement d'API et de fichiers de configuration. Connecte à l'ingestion réelle de réponses d'API REST.

Chapitre 3Voir les détails

Manipulation de données avec Pandas

  • Leçon 1 • Fondamentaux des DataFrames et des Series

    Créez des DataFrames à partir de dictionnaires, de CSV et de JSON, puis inspectez la structure et les types de données. Forme la base de tout travail de transformation basé sur Pandas.

  • Leçon 2 • Filtrage, tri et sélection

    Appliquez des masques booléens, des sélecteurs loc/iloc et des opérations de tri pour isoler des sous-ensembles de données pertinents. Soutient directement le filtrage de la qualité des données dans les étapes du pipeline.

  • Leçon 3 • Agrégation, regroupement et pivotement

    Résumez les données avec les opérations groupby, agg et pivot pour produire des résultats analytiques. Permet le calcul de métriques et le reporting dans les workflows de pipeline.

  • Leçon 4 • Nettoyage des données et coercition de type

    Gérez les valeurs manquantes, les doublons et les types incorrects pour produire des ensembles de données propres et cohérents. Le nettoyage est l'étape la plus chronophage dans les pipelines de données réels.

  • Leçon 5 • Fusion et jointure de DataFrames

    Combinez des ensembles de données à l'aide de merge, join et concat pour reproduire la logique relationnelle de type SQL. Essentiel pour dénormaliser les données avant de les charger dans des magasins analytiques.

Chapitre 4Voir les détails

Connectivité aux bases de données et intégration SQL

  • Leçon 1 • Utilisation des bases de données NoSQL

    Connectez-vous aux magasins de documents et de clés-valeurs, effectuez des opérations CRUD et mappez les résultats sur des objets Python. Étend la connectivité des pipelines au-delà des systèmes relationnels.

  • Leçon 2 • Bases de données relationnelles avec SQLAlchemy

    Établissez des connexions, reflétez les schémas et exécutez du SQL brut à l'aide de l'API de base de SQLAlchemy. Fournit une couche d'accès aux bases de données indépendante du système pour le code de pipeline.

  • Leçon 3 • Gestion de pool de connexions et bonnes pratiques

    Configurez les pools de connexions, gérez les identifiants de manière sécurisée et évitez les anti-patrons courants. Garantit la fiabilité et la sécurité de niveau production dans le code d'accès aux bases de données.

  • Leçon 4 • Écriture et mise à jour/insertion de données

    Insérez, mettez à jour et insérez/mettez à jour des enregistrements par programmation à l'aide de SQLAlchemy et de la méthode to_sql de Pandas. Couvre le chemin d'écriture requis pour charger les sorties du pipeline dans les bases de données.

Chapitre 5Voir les détails

Construction de pipelines ETL en Python

  • Leçon 1 • Journalisation et observabilité des pipelines

    Instrumentez les pipelines avec une journalisation structurée, des métriques et des alertes pour permettre une surveillance opérationnelle. Transforme les scripts en processus observables, prêts pour la production.

  • Leçon 2 • Logique de transformation et règles métier

    Implémentez les mappages de champs, les colonnes dérivées et les règles de validation sous forme de fonctions Python pures. Encapsule la logique métier dans des unités de transformation testables et réutilisables.

  • Leçon 3 • Chargement des données vers les systèmes cibles

    Écrivez les données transformées vers des bases de données, des entrepôts de données et un stockage d'objets à l'aide de connecteurs Python. Achève le pipeline en livrant les données nettoyées à leur destination.

  • Leçon 4 • Architecture ETL et patrons de conception

    Comprenez les étapes du pipeline, le flux de données et les patrons de conception courants tels que ELT et l'architecture médaillon. Définit le cadre conceptuel pour tout travail d'implémentation de pipeline.

  • Leçon 5 • Extraction de données à partir d'API

    Récupérez des données à partir d'API REST à l'aide de la bibliothèque requests, gérez la pagination et les limites de débit. Couvre la source de données moderne la plus courante pour les pipelines d'ingestion.

Chapitre 6Voir les détails

Utilisation du stockage cloud et des services

  • Leçon 1 • Infrastructure en tant que code pour les pipelines de données

    Définissez des ressources cloud par programmation à l'aide d'outils IaC basés sur Python pour automatiser la configuration de l'environnement. Réduit le provisionnement manuel et garantit une infrastructure de pipeline reproductible.

  • Leçon 2 • Ingestion pilotée par les événements avec les files de messages

    Produisez et consommez des messages à partir de files d'attente et de sujets de streaming pour déclencher l'exécution du pipeline. Connecte les pipelines Python aux architectures de données pilotées par les événements et en temps réel.

  • Leçon 3 • Interaction avec les entrepôts de données gérés

    Connectez-vous aux entrepôts de données cloud via des connecteurs Python, exécutez des requêtes et chargez les données efficacement. Permet aux pipelines Python de servir des workloads analytiques à grande échelle.

  • Leçon 4 • Stockage d'objets cloud avec les SDK Python

    Téléchargez, téléchargez vers le bas, listez et supprimez des objets dans des buckets de stockage cloud à l'aide des SDK des fournisseurs. Le stockage d'objets est la zone de réception principale pour les données brutes dans les pipelines cloud.

Chapitre 7Voir les détails

Orchestration et planification des pipelines

  • Leçon 1 • Gestion des erreurs et stratégies de nouvelle tentative

    Configurez les nouvelles tentatives, les délais d'attente et les alertes SLA pour rendre les pipelines orchestrés résilients aux pannes transitoires. Réduit directement l'intervention manuelle dans les environnements de production.

  • Leçon 2 • DAG dynamiques et paramétrage

    Générez des DAG par programmation et passez des paramètres d'exécution aux tâches pour une exécution flexible des pipelines. Permet l'orchestration scalable de nombreuses variantes de pipelines similaires.

  • Leçon 3 • Concepts d'orchestration et paysage des outils

    Comprenez les DAG, les dépendances de tâches et le rôle des orchestrateurs dans l'ingénierie des données. Fournit les bases conceptuelles avant de mettre en œuvre le code d'orchestration.

  • Leçon 4 • Construction de DAG avec Apache Airflow

    Définissez des DAG, des opérateurs et des dépendances de tâches dans Airflow à l'aide de Python pour planifier les exécutions de pipeline. Airflow est l'orchestrateur le plus largement déployé dans l'ingénierie des données.

  • Leçon 5 • Surveillance et alertes dans l'orchestration

    Utilisez les interfaces utilisateur de l'orchestrateur, les journaux et les intégrations d'alertes externes pour suivre la santé du pipeline. Boucle la boucle d'observabilité pour les opérations de pipeline de bout en bout.

Chapitre 8Voir les détails

Performance, tests et préparation à la production

  • Leçon 1 • Qualité du code et empaquetage

    Appliquez le style avec des linters, vérifiez les types avec mypy et empaquetez le code du pipeline sous forme de modules Python installables. Élève la maintenabilité du code aux normes professionnelles du génie logiciel.

  • Leçon 2 • Tests unitaires et d'intégration pour les pipelines

    Écrivez des tests unitaires basés sur pytest pour les fonctions de transformation et des tests d'intégration pour les interactions avec les bases de données. Les tests préviennent les régressions et valident l'exactitude du pipeline.

  • Leçon 3 • Traitement parallèle et concurrent

    Appliquez les modèles multiprocessing, threading et async pour paralléliser les tâches de pipeline liées aux E/S et au CPU. Réduit significativement le temps d'exécution de bout en bout du pipeline.

  • Leçon 4 • Profilage et optimisation du code Python

    Identifiez les goulots d'étranglement à l'aide d'outils de profilage et appliquez la vectorisation, le découpage en morceaux et la mise en cache pour améliorer le débit. L'optimisation des performances est critique pour les pipelines de données à grande échelle.

  • Leçon 5 • CI/CD pour le déploiement de pipelines de données

    Automatisez les tests, le linting et le déploiement du code de pipeline à l'aide de pipelines CI/CD déclenchés par des événements de contrôle de version. Permet des mises en production sûres et reproductibles.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Analyste de données junior : prêt à automatiser les flux de données répétitifs avec Python.

  • SQL developer souhaitant étendre ses compétences à la construction de pipelines programmatiques.

  • Développeur logiciel : faire une transition vers l'ingénierie des données à partir d'un bagage général en programmation.

  • Ingénieur en business intelligence : cherchant à posséder l'intégralité du pipeline de données de bout en bout.

  • Jeune diplômé en informatique à la recherche d'une expérience pratique et prête à l'emploi en ingénierie des données.

  • Programmeur autodidacte : passionné par les données et visant un rôle d'ingénieur.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail des cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF