Choisissez votre langue
Formation Python pour Data Engineer
Plus de 2 millions d'apprenants dans le monde

Formation Python pour Data Engineer

Maîtrisez les compétences Python que les ingénieurs de données utilisent chaque jour — de la création de pipelines ETL et de la connexion aux bases de données à l'orchestration de flux de travail et au déploiement de code prêt pour la production. Ce cours vous fait passer des notions de base de Python aux schémas avancés d'ingénierie des données utilisés à grande échelle.

Dedika pour entreprises

Ce que vous allez apprendre:

Vous apprendrez à écrire des scripts Python qui extraient des données à partir d'API, de fichiers et de bases de données, puis à les transformer et à les charger dans des bases de données relationnelles, des entrepôts de données et un stockage en nuage. Vous travaillerez avec Pandas pour la manipulation des données, SQLAlchemy pour la connectivité aux bases de données et Apache Airflow pour l'orchestration de pipelines. Le cours couvre la validation de la qualité des données, l'optimisation du rendement, le traitement parallèle et les pratiques d'intégration continue et de déploiement continu pour le déploiement de pipelines. Vous explorerez également PySpark pour le traitement distribué, Kafka pour les pipelines en continu et les meilleures pratiques de sécurité pour protéger les données sensibles dans les environnements de production.

Comment vous étudiez de façon pratique Formation Python pour Data Engineer

Comment vous pratiquez Formation Python pour Data Engineer

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations Python pour ingénieurs de données

  • Leçon 1 • Flux de contrôle et itération

    Appliquez des conditionnelles, des boucles et des compréhensions pour traiter des séquences d'enregistrements de données. Correspond directement à la logique de transformation au niveau des lignes utilisée dans les pipelines ETL.

  • Leçon 2 • Fonctions et gestion des exceptions

    Définissez des fonctions réutilisables avec des arguments, des valeurs par défaut et des valeurs de retour, puis gérez les exceptions avec élégance. Permet un code de pipeline modulaire et tolérant aux pannes.

  • Leçon 3 • Syntaxe Python de base et types de données

    Couvre les variables, les opérateurs et les types intégrés, y compris les chaînes, les entiers, les flottants et les booléens. Fournit la base syntaxique pour écrire toute logique de pipeline de données.

  • Leçon 4 • Collections : listes, tuples, dictionnaires, ensembles

    Explorez les types de collections mutables et immutables ainsi que leurs compromis de rendement. Ces structures sous-tendent la manipulation de données en mémoire tout au long du cours.

  • Leçon 5 • Configuration de l'environnement Python

    Installez Python, configurez des environnements virtuels et sélectionnez un IDE adapté au travail avec les données. Établit l'espace de travail reproductible dont dépendent tous les chapitres suivants.

Chapitre 2Voir les détails

Entrées-sorties de fichiers et sérialisation de données

  • Leçon 1 • Formats binaires : Parquet et Avro

    Lisez et écrivez des fichiers Parquet columnaires et Avro basés sur des lignes à l'aide de bibliothèques Python. Ces formats sont courants dans les architectures modernes de lacs de données.

  • Leçon 2 • Travailler avec des fichiers texte et CSV

    Ouvrez, lisez et écrivez des fichiers texte à l'aide de gestionnaires de contexte, puis analysez le CSV avec la bibliothèque standard. Couvre le format de données brutes le plus courant dans les pipelines par lots.

  • Leçon 3 • Opérations sur le système de fichiers et les chemins

    Parcourez les répertoires, globez les fichiers et gérez les chemins à l'aide des modules pathlib et os. Automatise les étapes de découverte de fichiers courantes dans les flux d'ingestion par lots.

  • Leçon 4 • Formats de données JSON et XML

    Analysez et sérialisez des charges utiles JSON et parcourez des arbres XML pour le traitement des API et des fichiers de configuration. Fait le lien avec l'ingestion réelle de réponses d'API REST.

Chapitre 3Voir les détails

Manipulation de données avec Pandas

  • Leçon 1 • Notions fondamentales sur DataFrames et Series

    Créez des DataFrames à partir de dictionnaires, CSV et JSON, puis inspectez la structure et les types de données. Forme la base de tout travail de transformation basé sur Pandas.

  • Leçon 2 • Filtrage, tri et sélection

    Appliquez des masques booléens, des sélecteurs loc/iloc et des opérations de tri pour isoler des sous-ensembles de données pertinents. Soutient directement le filtrage de la qualité des données dans les étapes du pipeline.

  • Leçon 3 • Agrégation, regroupement et pivotement

    Résumez les données avec les opérations groupby, agg et pivot pour produire des résultats analytiques. Permet le calcul de métriques et la génération de rapports dans les flux de pipeline.

  • Leçon 4 • Nettoyage des données et coercition de types

    Gérez les valeurs manquantes, les doublons et les types incorrects pour produire des ensembles de données propres et cohérents. Le nettoyage est l'étape la plus chronophage dans les pipelines de données réels.

  • Leçon 5 • Fusion et jointure de DataFrames

    Combinez des ensembles de données à l'aide de merge, join et concat pour reproduire une logique relationnelle de style SQL. Essentiel pour dénormaliser les données avant de les charger dans des magasins analytiques.

Chapitre 4Voir les détails

Connectivité aux bases de données et intégration SQL

  • Leçon 1 • Travailler avec des bases de données NoSQL

    Connectez-vous aux magasins de documents et de clés-valeurs, effectuez des opérations CRUD et mappez les résultats vers des objets Python. Étend la connectivité du pipeline au-delà des systèmes relationnels.

  • Leçon 2 • Bases de données relationnelles avec SQLAlchemy

    Établissez des connexions, reflétez des schémas et exécutez du SQL brut à l'aide de l'API centrale de SQLAlchemy. Fournit une couche d'accès aux bases de données indépendante du système pour le code de pipeline.

  • Leçon 3 • Gestion de pool de connexions et meilleures pratiques

    Configurez des pools de connexions, gérez les identifiants de manière sécurisée et évitez les anti-patrons courants. Assure une fiabilité et une sécurité de qualité production dans le code d'accès aux bases de données.

  • Leçon 4 • Écriture et mise à jour/insertion de données

    Insérez, mettez à jour et mettez à jour/insérez des enregistrements par programmation à l'aide de SQLAlchemy et de la méthode to_sql de Pandas. Couvre le chemin d'écriture requis pour charger les sorties du pipeline dans les bases de données.

Chapitre 5Voir les détails

Construction de pipelines ETL en Python

  • Leçon 1 • Journalisation et observabilité des pipelines

    Instrumentez les pipelines avec une journalisation structurée, des métriques et des alertes pour permettre la surveillance opérationnelle. Transforme les scripts en processus observables et prêts pour la production.

  • Leçon 2 • Logique de transformation et règles métier

    Implémentez des mappages de champs, des colonnes dérivées et des règles de validation sous forme de fonctions Python pures. Encapsule la logique métier dans des unités de transformation testables et réutilisables.

  • Leçon 3 • Chargement de données vers des systèmes cibles

    Écrivez les données transformées vers des bases de données, des entrepôts de données et du stockage d'objets à l'aide de connecteurs Python. Complète le pipeline en livrant les données nettoyées à leur destination.

  • Leçon 4 • Architecture ETL et patrons de conception

    Comprenez les étapes du pipeline, le flux de données et les patrons de conception courants comme ELT et l'architecture médaille d'or. Établit le cadre conceptuel pour tout travail de mise en œuvre de pipeline.

  • Leçon 5 • Extraction de données à partir d'API

    Récupérez des données d'API REST à l'aide de la bibliothèque requests, gérez la pagination et gérez les limites de débit. Couvre la source de données moderne la plus courante pour les pipelines d'ingestion.

Chapitre 6Voir les détails

Travailler avec le stockage et les services dans le nuage

  • Leçon 1 • Infrastructure en tant que code pour les pipelines de données

    Définissez des ressources dans le nuage par programmation à l'aide d'outils IaC basés sur Python pour automatiser la configuration de l'environnement. Réduit le provisionnement manuel et assure une infrastructure de pipeline reproductible.

  • Leçon 2 • Ingestion pilotée par les événements avec files de messages

    Produisez et consommez des messages à partir de files d'attente et de sujets de diffusion en continu pour déclencher l'exécution du pipeline. Connecte les pipelines Python aux architectures de données pilotées par les événements et en temps réel.

  • Leçon 3 • Interaction avec les entrepôts de données gérés

    Connectez-vous aux entrepôts de données dans le nuage via des connecteurs Python, exécutez des requêtes et chargez les données efficacement. Permet aux pipelines Python de servir des charges de travail analytiques à grande échelle.

  • Leçon 4 • Stockage d'objets dans le nuage avec SDK Python

    Téléchargez, téléchargez, listez et supprimez des objets dans des compartiments de stockage dans le nuage à l'aide de SDK de fournisseurs. Le stockage d'objets est la zone de réception principale des données brutes dans les pipelines dans le nuage.

Chapitre 7Voir les détails

Orchestration et ordonnancement des pipelines

  • Leçon 1 • Gestion des erreurs et stratégies de nouvelles tentatives

    Configurez les nouvelles tentatives, les délais d'attente et les alertes SLA pour rendre les pipelines orchestrés résilients aux défaillances transitoires. Réduit directement l'intervention manuelle dans les environnements de production.

  • Leçon 2 • DAG dynamiques et paramétrage

    Générez des DAG par programmation et transmettez des paramètres d'exécution aux tâches pour une exécution flexible du pipeline. Permet l'orchestration évolutive de nombreuses variantes de pipeline similaires.

  • Leçon 3 • Concepts d'orchestration et paysage des outils

    Comprenez les DAG, les dépendances de tâches et le rôle des orchestrateurs dans l'ingénierie des données. Fournit la base conceptuelle avant de mettre en œuvre le code d'orchestration.

  • Leçon 4 • Construction de DAG avec Apache Airflow

    Définissez des DAG, des opérateurs et des dépendances de tâches dans Airflow à l'aide de Python pour planifier les exécutions de pipeline. Airflow est l'orchestrateur le plus déployé en ingénierie des données.

  • Leçon 5 • Surveillance et alertes dans l'orchestration

    Utilisez les interfaces utilisateur de l'orchestrateur, les journaux et les intégrations d'alertes externes pour suivre la santé du pipeline. Ferme la boucle d'observabilité pour les opérations de pipeline de bout en bout.

Chapitre 8Voir les détails

Rendement, tests et préparation à la production

  • Leçon 1 • Qualité du code et empaquetage

    Appliquez le style avec des linters, vérifiez les types avec mypy et empaquetez le code du pipeline en modules Python installables. Élève la maintenabilité du code aux normes professionnelles du génie logiciel.

  • Leçon 2 • Tests unitaires et d'intégration pour les pipelines

    Rédigez des tests unitaires basés sur pytest pour les fonctions de transformation et des tests d'intégration pour les interactions avec les bases de données. Les tests préviennent les régressions et valident l'exactitude du pipeline.

  • Leçon 3 • Traitement parallèle et concurrent

    Appliquez les patrons multiprocessing, threading et async pour paralléliser les tâches de pipeline liées aux E/S et au CPU. Réduit considérablement le temps d'exécution de bout en bout du pipeline.

  • Leçon 4 • Profilage et optimisation du code Python

    Identifiez les goulots d'étranglement à l'aide d'outils de profilage et appliquez la vectorisation, le découpage en lots et la mise en cache pour améliorer le débit. L'optimisation du rendement est essentielle pour les pipelines de données à grande échelle.

  • Leçon 5 • CI/CD pour le déploiement de pipelines de données

    Automatisez les tests, le linting et le déploiement du code de pipeline à l'aide de pipelines CI/CD déclenchés par des événements de gestion de versions. Permet des mises en production sécurisées et reproductibles.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste de données junior : prêt à automatiser les flux de travail de données répétitifs avec Python.

  • Développeur SQL : souhaitant approfondir ses compétences dans la construction programmatique de pipelines.

  • Développeur logiciel : faire la transition vers l'ingénierie des données à partir d'une formation générale en programmation.

  • Ingénieur ou ingénieure en intelligence d'affaires : cherchant à posséder l'ensemble du pipeline de données de bout en bout.

  • Récent diplômé en informatique : cherchant une expérience pratique en ingénierie des données prête pour l'emploi.

  • Programmeur autodidacte : passionné par les données et visant un poste d'ingénieur.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF