Choisissez votre langue
Formation Cloud Data Engineer
Plus de 2 millions d'étudiants dans le monde

Formation Cloud Data Engineer

Maîtrisez l'ensemble de la stack d'ingénierie des données cloud, du stockage et de l'ingestion au traitement en temps réel et aux opérations de production. Cette formation vous donne les compétences pratiques pour concevoir des plateformes de données évolutives, mettre en œuvre des cadres de gouvernance et exploiter des pipelines fiables. Développez l'expertise qu'exigent les rôles modernes en ingénierie des données.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous apprendrez à architecturer et gérer des plateformes de données cloud à l'aide d'outils et frameworks standard du secteur. Le cours couvre les fondamentaux de l'infrastructure cloud, les systèmes de stockage relationnel et NoSQL, les schémas d'ingestion par lots et en continu, ainsi que le traitement distribué avec Apache Spark. Vous mettrez en œuvre des pratiques de validation de la qualité des données, de traçabilité des lignées et d'observabilité pour maintenir la fiabilité des pipelines en production. Les sujets avancés incluent le streaming en temps réel avec Apache Flink, l'infrastructure en tant que code, les workflows DataOps et les architectures modernes comme le lakehouse et le data mesh. Vous acquerrez également des compétences pratiques en Python, en optimisation SQL et en intégration de pipelines ML.

Comment vous étudiez de façon pratique Formation Cloud Data Engineer

Comment vous pratiquez Formation Cloud Data Engineer

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 37 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations de l'informatique en nuage pour les ingénieurs de données

  • Leçon 1 • Modèles de service cloud et types de déploiement

    Couvre les distinctions entre IaaS, PaaS et SaaS ainsi que les déploiements publics, privés et hybrides. Ancre toutes les décisions ultérieures concernant les services de données cloud dans un contexte architectural.

  • Leçon 2 • Composants fondamentaux de l'infrastructure cloud

    Présente les primitives de calcul, de stockage, de réseau et d'identité utilisées sur les principales plateformes cloud. Fournit le vocabulaire nécessaire pour concevoir et discuter de l'infrastructure de données.

  • Leçon 3 • Fondamentaux de la sécurité et de la conformité dans le cloud

    Couvre le chiffrement au repos et en transit, la gestion des clés et les cadres de conformité réglementaire pour les données. Établit les bonnes pratiques de sécurité appliquées tout au long du cours.

  • Leçon 4 • Notions de base sur la tarification et la gestion des coûts du cloud

    Explique les modèles de tarification à l'usage, la capacité réservée et les tarifs spot pertinents pour les charges de travail de données. Permet des décisions architecturales tenant compte des coûts dès le départ.

Chapitre 2Voir les détails

Systèmes de stockage de données dans le cloud

  • Leçon 1 • Choisir le stockage adapté à chaque cas d'usage

    Applique un cadre décisionnel pour faire correspondre les systèmes de stockage aux exigences de latence, de débit et de coût. Synthétise toutes les options de stockage pour fournir des conseils pratiques de sélection.

  • Leçon 2 • Options de store NoSQL et clé-valeur

    Couvre les modèles de bases de données document, colonne large, clé-valeur et graphe disponibles en tant que services cloud. Guide la sélection en fonction des modèles d'accès et des exigences de cohérence.

  • Leçon 3 • Services de bases de données relationnelles cloud

    Examine les offres de bases de données relationnelles managées, les configurations haute disponibilité et les réplicas en lecture. Relie les fondamentaux SQL aux modèles de déploiement managé dans le cloud.

  • Leçon 4 • L'entreposage de données en tant que service cloud

    Présente le stockage columnar, l'architecture MPP, et le provisionnement et la mise à l'échelle des entrepôts de données cloud. Prépare les étudiants aux charges de travail de requêtes analytiques couvertes dans les chapitres suivants.

  • Leçon 5 • Stockage objet et lacs de données

    Explique l'architecture du stockage objet, les politiques de bucket, les règles de cycle de vie et les modèles d'organisation des lacs de données. Constitue la base de tout travail d'ingestion et de stockage de données à grande échelle.

Chapitre 3Voir les détails

Fondamentaux de l'ingestion de données et des pipelines

  • Leçon 1 • Modèles et outils d'ingestion par lots

    Couvre les transferts de fichiers planifiés, l'ingestion par API en masse et les stratégies de chargement incrémental pour les pipelines par lots. Établit le modèle d'ingestion le plus courant avant d'introduire le streaming.

  • Leçon 2 • Techniques de capture de changements de données

    Explique les méthodes CDC basées sur les journaux, les déclencheurs et les horodatages pour capturer les changements de base de données. Permet une réplication quasi en temps réel sans analyses complètes de table.

  • Leçon 3 • Fondamentaux de l'ingestion en continu

    Présente les concepts de streaming d'événements, producteurs, consommateurs, topics et partitions pour le flux de données en temps réel. Fait le pont entre les connaissances d'ingestion par lots et le traitement continu des données.

  • Leçon 4 • Notions d'orchestration de pipelines

    Couvre l'orchestration basée sur les DAG, les dépendances de tâches, les tentatives et les alertes pour la gestion des pipelines de données. Fournit le socle opérationnel pour tous les types de pipelines construits dans ce cours.

Chapitre 4Voir les détails

Transformation et traitement des données à grande échelle

  • Leçon 1 • Orchestration des flux de transformation

    Applique des outils d'orchestration pour planifier, surveiller et versionner les tâches de transformation à grande échelle. Étend les fondamentaux de l'orchestration de pipelines aux flux de transformation complexes en plusieurs étapes.

  • Leçon 2 • Modélisation des données pour l'analyse

    Présente le schéma en étoile, le schéma en flocon et la modélisation en data vault pour les charges de travail analytiques. Garantit que les sorties de transformation sont structurées pour une interrogation aval efficace.

  • Leçon 3 • Modèles de transformation basés sur SQL

    Couvre les fonctions de fenêtre, les CTE, les modèles incrémentaux et l'optimisation des requêtes pour les transformations SQL à grande échelle. Relie les compétences SQL aux moteurs de requête d'entrepôt de données cloud et de lacs de données.

  • Leçon 4 • Traitement distribué par lots avec Spark

    Enseigne les API RDD et DataFrame, le partitionnement, le brassage et l'optimisation des jobs dans Apache Spark. Établit le moteur de traitement distribué principal utilisé tout au long du cours.

  • Leçon 5 • Réglage des performances pour les jobs à grande échelle

    Aborde la mise en cache, les jointures broadcast, la sélection des formats de fichier et le dimensionnement des clusters pour les performances de transformation. Prépare les étudiants à diagnostiquer et résoudre les goulots d'étranglement dans les pipelines de production.

Chapitre 5Voir les détails

Traitement des données en continu et pipelines en temps réel

  • Leçon 1 • Fenêtrage et sémantique temporelle

    Couvre les fenêtres basculantes, glissantes et de session ainsi que le temps d'événement, le temps de traitement et les jalons d'eau. Permet des agrégations précises sur des flux d'événements désordonnés et arrivant tardivement.

  • Leçon 2 • Modèles de conception de pipelines de streaming

    Applique les architectures lambda, kappa et streaming-first à des scénarios concrets d'ingénierie des données. Relie la connaissance des frameworks aux décisions de conception de pipelines de bout en bout.

  • Leçon 3 • Traitement de flux avec état

    Explique l'état clé, l'état d'opérateur, le point de contrôle et les backends d'état pour les jobs de streaming tolérants aux pannes. Permet la détection d'événements complexes et les agrégations en cours sur des flux non bornés.

  • Leçon 4 • Présentation des frameworks de traitement de flux

    Compare Apache Flink, Spark Structured Streaming et les services de streaming cloud managés par capacité. Guide la sélection du framework en fonction des besoins de latence, d'état et opérationnels.

Chapitre 6Voir les détails

Qualité des données, gouvernance et observabilité

  • Leçon 1 • Contrats de données et gestion des schémas

    Définit les contrats de données entre producteurs et consommateurs et couvre l'utilisation du registre de schémas et leur évolution. Empêche la propagation de modifications cassantes à travers les systèmes de données dépendants.

  • Leçon 2 • Cadres de validation de la qualité des données

    Couvre la validation du schéma, les contrôles de nullité, l'intégrité référentielle et le profilage statistique pour la qualité des données. Intègre des contrôles de qualité directement dans les pipelines d'ingestion et de transformation.

  • Leçon 3 • Lignée des données et catalogage

    Explique la traçabilité au niveau des colonnes, le catalogage des métadonnées et les outils de découverte des données pour la conformité de la gouvernance. Permet aux équipes de retracer les origines des données et de comprendre l'impact aval des modifications.

  • Leçon 4 • Observabilité et surveillance des pipelines

    Présente les métriques, les journaux, les traces et le suivi des SLA pour la surveillance de l'état de santé des pipelines de bout en bout. Fournit la visibilité opérationnelle nécessaire pour maintenir les systèmes de données de production de manière fiable.

  • Leçon 5 • Contrôle d'accès aux données et confidentialité

    Couvre le contrôle d'accès basé sur les rôles, la sécurité au niveau des lignes, le masquage des données et les techniques de préservation de la confidentialité pour les données sensibles. Aligne les modèles d'accès aux données avec les exigences réglementaires et organisationnelles.

Chapitre 7Voir les détails

Architecture et conception de plateformes de données cloud

  • Leçon 1 • Conception pour les environnements multi-cloud et hybrides

    Couvre la portabilité des données, la mise en réseau inter-cloud et les outils indépendants des fournisseurs pour les plateformes de données multi-cloud. Prépare les étudiants à concevoir des plateformes qui évitent l'enfermement propriétaire.

  • Leçon 2 • Modèles d'évolutivité et de fiabilité

    Aborde la mise à l'échelle horizontale, la tolérance aux pannes, l'idempotence et la reprise après sinistre pour les composants de la plateforme de données. Garantit que les conceptions de plateforme répondent aux exigences de fiabilité et de disponibilité de la production.

  • Leçon 3 • Stratégies d'optimisation des coûts de la plateforme

    Applique le dimensionnement adapté, l'utilisation spot, le nivellement du stockage et les contrôles de coûts des requêtes pour réduire les dépenses de la plateforme. Relie les décisions architecturales directement à des résultats de coûts mesurables.

  • Leçon 4 • Architectures de référence modernes pour plateformes de données

    Examine les architectures medallion, data mesh et lakehouse comme plans directeurs pour les plateformes de données cloud. Fournit le vocabulaire architectural et les modèles pour les exercices de conception qui suivent.

  • Leçon 5 • Infrastructure en tant que code pour les plateformes de données

    Couvre le provisionnement déclaratif de l'infrastructure, les modules, la gestion d'état et les CI/CD pour les ressources de données cloud. Permet un déploiement reproductible et versionné de tous les composants de l'infrastructure de données.

Chapitre 8Voir les détails

DataOps, déploiement et opérations de production

  • Leçon 1 • Planification de capacité et gestion des performances

    Applique les tests de charge, la prévision des ressources et l'analyse comparative des performances aux décisions de capacité de la plateforme de données. Garantit que les plateformes évoluent de manière proactive plutôt que réactive face à des volumes de données croissants.

  • Leçon 2 • Culture DataOps et amélioration continue

    Présente les principes DataOps, les boucles de rétroaction, le versionnage des pipelines et les pratiques de collaboration d'équipe. Intègre un état d'esprit d'amélioration continue dans les opérations quotidiennes d'ingénierie des données.

  • Leçon 3 • Gestion des environnements et configuration

    Couvre la parité des environnements de développement, de recette et de production, la gestion des secrets et les configurations spécifiques à l'environnement. Empêche la dérive de configuration et l'exposition des identifiants entre les environnements de déploiement.

  • Leçon 4 • Pipelines CI/CD pour l'ingénierie des données

    Construit des flux de travail automatisés de test, d'analyse statique, de déploiement et de retour arrière pour le code des pipelines de données. Applique les pratiques de livraison du génie logiciel au cycle de vie de l'ingénierie des données.

  • Leçon 5 • Réponse aux incidents pour les systèmes de données

    Définit les niveaux de gravité des incidents, les manuels opérationnels, l'analyse des causes profondes et les processus de post-mortem pour les pannes de données. Développe la discipline opérationnelle nécessaire pour maintenir les SLA de données en condition de défaillance.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste de données : prêt à évoluer vers l'amont et à prendre en charge les pipelines qui alimentent ses rapports.

  • Ingénieur logiciel : souhaite se spécialiser dans l'infrastructure de données et les systèmes distribués.

  • Développeur BI : cherche à dépasser les tableaux de bord pour se tourner vers l'ingénierie de plateformes de données évolutives.

  • Ingénieur données junior : cherche un programme structuré pour combler rapidement les lacunes critiques.

  • Développeur back-end : en transition vers des rôles cloud natifs dans des entreprises axées sur les données.

  • Ingénieur analytique : vise à approfondir son expertise en ingestion, streaming et opérations de production.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en Algérie ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF