
Formation data engineering
Maîtrisez toutes les couches de l'ingénierie des données moderne, de l'ingestion et de la transformation à l'orchestration, au streaming et à la gouvernance. Ce cours vous offre la profondeur technique et les compétences pratiques nécessaires pour concevoir des plateformes de données de qualité professionnelle dans le cloud. Que vous débutiez dans le domaine ou que vous cherchiez à monter en compétences, vous sortirez prêt à construire des systèmes sur lesquels les organisations réelles comptent.
Ce que vous allez apprendre:
Vous commencerez par maîtriser SQL, la modélisation relationnelle des données et la conception d'entrepôts de données dans le cloud, puis vous passerez à la création de pipelines d'ingestion fiables pour des sources par lots et en continu. Vous apprendrez à transformer des données brutes en ensembles de données prêts pour l'analyse à l'aide d'outils basés sur SQL et de Python, et à automatiser des flux de travail complexes avec des frameworks d'orchestration basés sur des DAG. Le cours couvre le traitement de flux en temps réel, le contrôle de la qualité des données et la gouvernance de la plateforme, y compris le contrôle d'accès et la conformité réglementaire. Vous explorerez également l'infrastructure en tant que code, les pratiques DataOps, les pipelines de données pour l'apprentissage automatique et les tendances émergentes comme le data mesh et l'ingénierie assistée par IA. Chaque sujet est directement lié aux décisions et aux compromis que vous rencontrerez dans un rôle professionnel d'ingénieur de données.
Comment vous étudiez de façon pratique Formation data engineering
Comment vous pratiquez Formation data engineering
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux de l'ingénierie des données
Fondamentaux de l'ingénierie des données
Leçon 1 • Le paysage de l'ingénierie des données
Définit le périmètre de l'ingénierie des données, en la distinguant de la science des données et de l'analyse. Établit le vocabulaire utilisé tout au long du cours.
Leçon 2 • Composants principaux de l'infrastructure de données
Présente les bases de données, les entrepôts de données, les lacs de données et les lakehouses comme des modèles d'infrastructure distincts. Prépare les étudiants à sélectionner les architectures de stockage appropriées.
Leçon 3 • Pipelines de données et concepts de workflow
Explique ce qu'est un pipeline de données, ses étapes et comment l'orchestration relie les étapes entre elles. Ancre les étudiants dans la réflexion sur les pipelines avant la mise en œuvre pratique.
Leçon 4 • Types de données et fondamentaux du stockage
Couvre les formats de données structurées, semi-structurées et non structurées ainsi que leurs implications en matière de stockage. Relie les choix de stockage aux besoins de traitement en aval.
Chapitre 2MasquerCacher les détailsVoir les détailsModélisation des données SQL et relationnelles
Modélisation des données SQL et relationnelles
Leçon 1 • Modélisation dimensionnelle pour l'analyse
Couvre les schémas en étoile et en flocon, les tables de faits et les tables de dimensions pour les charges de travail analytiques. Fait le lien entre la théorie relationnelle et la conception d'entrepôts dans les chapitres suivants.
Leçon 2 • Techniques SQL avancées
Enseigne les fonctions de fenêtrage, les CTE et les opérations ensemblistes pour les requêtes analytiques complexes. Permet aux étudiants de gérer des logiques de reporting et de transformation réalistes.
Leçon 3 • Performance et optimisation SQL
Examine les plans d'exécution des requêtes, les stratégies de partitionnement et d'indexation pour améliorer la vitesse des requêtes. Prépare les étudiants à écrire du SQL de niveau production à grande échelle.
Leçon 4 • Principes de modélisation des données relationnelles
Introduit les formes normales et la modélisation entité-relation pour les systèmes transactionnels. Fournit les bases de la conception de schémas nécessaires avant la modélisation analytique.
Leçon 5 • Fondamentaux des requêtes SQL
Couvre SELECT, le filtrage, l'agrégation et les jointures comme éléments de base de la récupération de données. Soutient directement tout le travail de transformation ultérieur dans le cours.
Chapitre 3MasquerCacher les détailsVoir les détailsIngestion de données et systèmes sources
Ingestion de données et systèmes sources
Leçon 1 • Notions fondamentales sur l'ingestion streaming
Introduit les concepts de streaming d'événements, les producteurs, les consommateurs et les sujets pour l'ingestion en temps réel. Pose les bases du chapitre sur le traitement streaming qui suit.
Leçon 2 • Techniques d'ingestion batch
Couvre les modèles de chargement complet, incrémental et de capture de données modifiées (CDC) pour l'extraction batch. Apprend aux étudiants à équilibrer l'exhaustivité avec le coût d'ingestion.
Leçon 3 • Ingestion de données depuis les API et le Web
Montre comment extraire des données d'API REST, gérer la pagination, l'authentification et les limites de débit. Se connecte à des scénarios réels d'intégration de données SaaS et tierces.
Leçon 4 • Comprendre les modèles de systèmes sources
Passe en revue les bases de données OLTP, les API, les flux d'événements et les fichiers plats comme sources de données courantes. Définit le contexte pour choisir la stratégie d'ingestion appropriée par type de source.
Leçon 5 • Fiabilité des pipelines d'ingestion
Traite de la gestion des erreurs, de l'évolution des schémas et de la supervision pour les pipelines d'ingestion de production. Garantit que les étudiants peuvent construire des systèmes d'ingestion résilients et observables.
Chapitre 4MasquerCacher les détailsVoir les détailsConception d'entrepôt de données et de stockage en nuage
Conception d'entrepôt de données et de stockage en nuage
Leçon 1 • Architecture d'entrepôt de données en nuage
Examine la séparation du calcul et du stockage, les moteurs de requêtes MPP et la mise à l'échelle de la concurrence. Fournit le contexte architectural pour toutes les décisions de conception d'entrepôt.
Leçon 2 • Conception de lac de données et de stockage objet
Couvre la hiérarchie des dossiers, la sélection des formats de fichiers et l'élagage des partitions dans les environnements de stockage objet. Prépare les étudiants à gérer les zones brutes et organisées dans un lac de données.
Leçon 3 • Modèles de conception de schémas d'entrepôt
Applique la modélisation dimensionnelle du Chapitre 2 à la conception physique du schéma d'entrepôt avec partitionnement et clustering. Fait le lien entre la théorie et la mise en œuvre d'un entrepôt de production.
Leçon 4 • Formats de table et standards ouverts
Introduit les formats de table ouverts qui ajoutent des transactions ACID et l'évolution des schémas aux lacs de données. Permet aux étudiants de mettre en œuvre des modèles lakehouse sur le stockage objet en nuage.
Leçon 5 • Gestion de la rétention et du cycle de vie des données
Traite du stockage hiérarchisé, des politiques d'archivage et des règles d'expiration des données pour le coût et la conformité. Relie la conception du stockage aux exigences opérationnelles et réglementaires.
Chapitre 5MasquerCacher les détailsVoir les détailsTransformation et traitement des données
Transformation et traitement des données
Leçon 1 • Transformation de données avec Python
Introduit pandas et PySpark pour la transformation programmatique de grands ensembles de données. Élargit la boîte à outils des étudiants au-delà de SQL pour les transformations complexes ou non relationnelles.
Leçon 2 • Transformation avec des outils basés sur SQL
Enseigne la transformation SQL modulaire en utilisant des conventions de modélisation en couches telles que les couches de staging, intermédiaire et de marts. Relie les compétences SQL du Chapitre 2 aux workflows de production.
Leçon 3 • Nettoyage des données et contrôle qualité
Couvre la déduplication, la gestion des valeurs nulles, le transtypage et la validation des contraintes pendant la transformation. Améliore directement la fiabilité des sorties analytiques en aval.
Leçon 4 • Paradigmes ETL vs. ELT
Compare les architectures extract-transform-load et extract-load-transform ainsi que leurs compromis. Guide les étudiants dans le choix du paradigme approprié pour une plateforme donnée.
Leçon 5 • Test et validation des transformations
Établit les tests unitaires, la validation des contrats de données et la réconciliation des comptages de lignes pour la logique de transformation. Garantit que le code de transformation est vérifiable et maintenable.
Chapitre 6MasquerCacher les détailsVoir les détailsOrchestration de pipelines et automatisation des workflows
Orchestration de pipelines et automatisation des workflows
Leçon 1 • Construction et configuration de DAG
Couvre la création de DAG avec des opérateurs, des capteurs et des hooks pour les tâches de données courantes. Traduit les concepts d'orchestration en code de pipeline fonctionnel.
Leçon 2 • Concepts et modèles d'orchestration
Définit les DAG, les dépendances de tâches, les déclencheurs et les intervalles de planification comme primitives d'orchestration. Établit le modèle mental pour tout le travail pratique d'orchestration.
Leçon 3 • Supervision et observabilité des pipelines
Établit les stratégies de journalisation, de collecte de métriques et d'alertes pour les pipelines orchestrés. Prépare les étudiants à maintenir la santé des pipelines en production.
Leçon 4 • Gestion de la planification et des dépendances
Enseigne la planification basée sur cron, les dépendances entre DAG et les modèles de planification tenant compte des données. Permet aux étudiants de coordonner des workflows complexes multi-pipelines.
Leçon 5 • Gestion des erreurs et logique de relance
Met en œuvre des politiques de relance, des configurations de délai d'attente et des callbacks en cas d'échec pour des pipelines résilients. Réduit directement les interventions manuelles dans les environnements de production.
Chapitre 7MasquerCacher les détailsVoir les détailsIngénierie des données en streaming
Ingénierie des données en streaming
Leçon 1 • Opérations de traitement de flux
Enseigne le filtrage, le mappage, l'agrégation et la jointure sur des flux d'événements non bornés. Permet aux étudiants de mettre en œuvre une logique de transformation de base dans un contexte streaming.
Leçon 2 • Fondamentaux de l'architecture streaming
Contrast le streaming avec le traitement batch et introduit les modèles d'architecture Lambda et Kappa. Fournit le vocabulaire de conception pour tout le travail de mise en œuvre du streaming.
Leçon 3 • Intégration et sortie des pipelines streaming
Couvre l'envoi des flux traités vers des bases de données, des entrepôts et des sujets en aval. Relie les sorties streaming à la plateforme de données plus large construite dans les chapitres précédents.
Leçon 4 • Streaming avec état et tolérance aux pannes
Traite des magasins d'état, du checkpointing et des watermarks pour un traitement streaming fiable avec état. Garantit que les étudiants peuvent construire des pipelines streaming qui survivent aux pannes.
Leçon 5 • Courtiers de messages et files d'événements
Couvre les concepts de courtier de messages distribués, y compris les sujets, les partitions, les offsets et les groupes de consommateurs. S'appuie sur les concepts d'ingestion du Chapitre 3 avec des détails opérationnels plus approfondis.
Chapitre 8MasquerCacher les détailsVoir les détailsQualité des données, gouvernance et sécurité
Qualité des données, gouvernance et sécurité
Leçon 1 • Conformité réglementaire et confidentialité des données
Traite de la résidence des données, des obligations de rétention, de la gestion du consentement et du droit à l'effacement. Prépare les étudiants à construire des plateformes qui répondent aux exigences de confidentialité et de conformité.
Leçon 2 • Catalogue de données et gestion des métadonnées
Couvre la découverte des données, le suivi de la lignée et la gestion du glossaire métier dans un catalogue de données. Permet aux équipes de trouver, comprendre et faire confiance aux actifs de données.
Leçon 3 • Contrôle d'accès et sécurité des données
Met en œuvre le contrôle d'accès basé sur les rôles, le masquage de colonnes et la sécurité au niveau des lignes sur les actifs de données. Protège les données sensibles tout en permettant un accès analytique approprié.
Leçon 4 • Contrats de données et attentes
Introduit les contrats de schéma, les attentes au niveau des colonnes et les contrôles qualité automatisés dans les pipelines. Empêche les mauvaises données de se propager aux consommateurs en aval.
Leçon 5 • Dimensions et métriques de la qualité des données
Définit l'exhaustivité, l'exactitude, la cohérence, l'actualité et l'unicité comme des dimensions de qualité mesurables. Donne aux étudiants un cadre pour évaluer et rapporter la santé des données.
Votre certificat valide de réussite
Ce cours est pour vous :
Développeurs de logiciels prêts à se spécialiser dans l'infrastructure de données et les pipelines.
Analystes de données qui souhaitent passer des tableaux de bord aux rôles d'ingénierie.
Ingénieurs back-end curieux de savoir comment fonctionnent réellement les systèmes de données à grande échelle.
Jeunes diplômés cherchant une voie structurée vers une carrière technique très demandée.
Professionnels de la business intelligence dont les outils et responsabilités actuels deviennent trop limités.
Personnes en reconversion professionnelle avec un bagage technique souhaitant entrer dans le domaine des données.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Algérie ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















