Choisissez votre langue
Formation Data Engineering
Plus de 2 millions d'étudiants dans le monde

Formation Data Engineering

Maîtrisez l'ensemble de la stack d'ingénierie en science des données — des fondements statistiques à l'apprentissage automatique en passant par l'apprentissage profond et les MLOps de production. Cette formation vous dote de la profondeur technique et des compétences pratiques que les employeurs recherchent dans les équipes de données modernes. Construisez de véritables pipelines, déployez de vrais modèles et résolvez de réels problèmes métier.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous développerez un ensemble de compétences complet et professionnel en science des données couvrant les statistiques, la programmation Python, l'apprentissage automatique, l'apprentissage profond et le déploiement de modèles. Vous apprendrez à collecter et nettoyer des données désordonnées, à concevoir des fonctionnalités à fort impact et à sélectionner les bons algorithmes pour les tâches de régression, classification et clustering. Vous implémenterez des réseaux de neurones, y compris les CNN, RNN et transformeurs, et appliquerez des techniques de traitement du langage naturel à des données textuelles réelles. Vous construirez également des pipelines MLOps prêts pour la production avec suivi des expériences, automatisation CI/CD et surveillance de la dérive. Des modules supplémentaires couvrent SQL avancé, les prévisions de séries temporelles, la visualisation de données, l'éthique et la communication avec les parties prenantes pour vous préparer à toutes les dimensions d'une carrière en science des données.

Comment vous étudiez de façon pratique Formation Data Engineering

Comment vous pratiquez Formation Data Engineering

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 36 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de la science des données

  • Leçon 1 • Types de données et formats de stockage

    Couvre les formats de données structurées, semi-structurées et non structurées ainsi que leurs systèmes de stockage. Prépare les étudiants à ingérer diverses sources de données.

  • Leçon 2 • Remise à niveau en mathématiques et statistiques

    Revise l'algèbre linéaire, le calcul infinitésimal et les probabilités essentiels pour la modélisation. Fournit les bases quantitatives nécessaires à tous les chapitres suivants.

  • Leçon 3 • Python pour la science des données

    Introduit la syntaxe Python, les structures de données et les bibliothèques scientifiques. Permet aux étudiants d'écrire des scripts d'analyse reproductibles dès le premier jour.

  • Leçon 4 • Le paysage de la science des données

    Définit la science des données, ses sous-domaines et en quoi elle diffère de l'analyse de données et de l'ingénierie des données. Établit le vocabulaire utilisé tout au long du cours.

Chapitre 2Voir les détails

Acquisition et nettoyage des données

  • Leçon 1 • Transformation et remodelage des données

    Applique l'agrégation, le pivotement, la fusion et l'encodage pour restructurer les données en vue de l'analyse. Fait le pont entre les données brutes et les formats prêts pour les caractéristiques.

  • Leçon 2 • Analyse exploratoire des données

    Enseigne le profilage systématique des ensembles de données pour détecter les distributions, les valeurs aberrantes et les relations. Guide les décisions éclairées concernant le nettoyage et l'ingénierie des caractéristiques.

  • Leçon 3 • Méthodes de collecte de données

    Couvre l'extraction de données web, les appels API et les requêtes de base de données comme stratégies principales d'acquisition de données. Relie la source des données à la conception du pipeline en aval.

  • Leçon 4 • Nettoyage et imputation des données

    Traite les valeurs manquantes, les doublons, les formats incohérents et les entrées erronées. Garantit l'intégrité des données avant le début de la modélisation.

  • Leçon 5 • Construction de pipelines de données reproductibles

    Introduit les concepts d'orchestration de pipeline et la conception de code modulaire pour des workflows reproductibles. Prépare les étudiants à l'ingénierie des données de niveau production.

Chapitre 3Voir les détails

Inférence statistique et expérimentation

  • Leçon 1 • Tests A/B et expérimentation

    Conçoit des expériences contrôlées, calcule les tailles d'échantillon et interprète correctement les résultats. Directement applicable aux rôles d'analyse de produits et d'entreprise.

  • Leçon 2 • Fondamentaux de l'inférence bayésienne

    Introduit les distributions a priori et a posteriori et la mise à jour bayésienne comme paradigme d'inférence alternatif. Prépare les étudiants à la modélisation probabiliste dans les chapitres suivants.

  • Leçon 3 • Cadre des tests d'hypothèse

    Couvre les hypothèses nulle et alternative, les valeurs p et les types d'erreur pour des tests rigoureux. Relie la signification statistique à la prise de décision pratique.

  • Leçon 4 • Théorie des probabilités et échantillonnage

    Formalise les règles de probabilité, la probabilité conditionnelle et les distributions d'échantillonnage. Sous-tend toutes les méthodes inférentielles couvertes dans ce chapitre.

Chapitre 4Voir les détails

Apprentissage automatique supervisé

  • Leçon 1 • Modèles de classification

    Entraîne la régression logistique, les arbres de décision et les machines à vecteurs de support pour des cibles catégorielles. Aborde le déséquilibre des classes et la sélection du seuil.

  • Leçon 2 • Fondamentaux de l'apprentissage automatique

    Définit l'apprentissage supervisé, le compromis biais-variance et le paradigme de séparation entraînement-test. Établit le cadre conceptuel pour tous les chapitres de modélisation.

  • Leçon 3 • Modèles de régression

    Couvre la régression linéaire, polynomiale et régularisée pour la prédiction d'une cible continue. Développe l'intuition pour les coefficients du modèle et les pénalités de régularisation.

  • Leçon 4 • Réglage des hyperparamètres et sélection de modèles

    Applique la recherche par grille, la recherche aléatoire et l'optimisation bayésienne pour maximiser les performances du modèle. Enseigne la comparaison et la sélection de modèles de manière structurée.

  • Leçon 5 • Méthodes d'ensemble

    Applique le bagging, le boosting et le stacking pour améliorer les performances prédictives au-delà des modèles uniques. Introduit le gradient boosting comme une technique de pointe.

Chapitre 5Voir les détails

Apprentissage non supervisé et réduction de dimensionnalité

  • Leçon 1 • Apprentissage des règles d'association

    Extrait les itemsets fréquents et les règles d'association pour révéler les modèles de cooccurrence. Prend en charge les applications de recommandation et d'analyse du panier d'achat.

  • Leçon 2 • Techniques de réduction de dimensionnalité

    Applique l'ACP, le t-SNE et l'UMAP pour réduire l'espace des caractéristiques tout en préservant la structure. Permet la visualisation et accélère la modélisation en aval.

  • Leçon 3 • Détection d'anomalies

    Identifie les valeurs aberrantes et les événements rares à l'aide d'approches statistiques et basées sur des modèles. S'applique directement aux scénarios de détection de fraude et de contrôle qualité.

  • Leçon 4 • Algorithmes de clustering

    Couvre le clustering k-means, hiérarchique et basé sur la densité pour regrouper des données non étiquetées. Relie l'analyse de clustering aux cas d'utilisation de segmentation commerciale.

Chapitre 6Voir les détails

Ingénierie des caractéristiques et interprétabilité des modèles

  • Leçon 1 • Méthodes de sélection des caractéristiques

    Applique des méthodes de filtrage, d'encapsulation et intégrées pour identifier les caractéristiques les plus prédictives. Réduit la dimensionnalité et prévient le surapprentissage.

  • Leçon 2 • Audit de l'équité et des biais

    Détecte et atténue les biais démographiques dans les prédictions du modèle à l'aide de métriques d'équité. Garantit que les modèles respectent les normes éthiques et organisationnelles.

  • Leçon 3 • Interprétabilité indépendante du modèle

    Utilise SHAP et LIME pour expliquer les prédictions individuelles et le comportement global du modèle. Renforce la confiance des parties prenantes et soutient la conformité réglementaire.

  • Leçon 4 • Ingénierie avancée des caractéristiques

    Construit des caractéristiques axées sur le domaine, d'interaction et basées sur le temps pour améliorer les performances du modèle. Démontre l'impact de la qualité des caractéristiques sur la précision prédictive.

Chapitre 7Voir les détails

Apprentissage profond et réseaux de neurones

  • Leçon 1 • Fondamentaux des réseaux de neurones

    Explique les perceptrons, les fonctions d'activation, la propagation avant et la rétropropagation. Fournit les bases mathématiques pour toutes les architectures d'apprentissage profond.

  • Leçon 2 • Réseaux de neurones récurrents et séquences

    Entraîne les RNN, LSTM et GRU pour les données séquentielles et de séries temporelles. Relie la modélisation de séquences aux applications de TALN et de prévision.

  • Leçon 3 • Architecture Transformer et mécanisme d'attention

    Introduit l'auto-attention, l'attention multi-têtes et le bloc transformer comme base du TALN moderne. Prépare les étudiants au fine-tuning des grands modèles de langage.

  • Leçon 4 • Optimisation et régularisation de l'entraînement

    Applique la normalisation par lots, le dropout, la planification du taux d'apprentissage et l'arrêt précoce pour stabiliser l'entraînement. Réduit le surapprentissage dans les modèles profonds.

  • Leçon 5 • Réseaux de neurones convolutionnels

    Construit des CNN pour la classification d'images et la détection d'objets à l'aide de couches de convolution et de pooling. Démontre l'apprentissage par transfert pour accélérer l'entraînement sur des données limitées.

Chapitre 8Voir les détails

MLOps et déploiement en production

  • Leçon 1 • Surveillance des modèles et détection de dérive

    Suit la qualité des prédictions, la dérive des données et la dérive du concept en production pour maintenir la fiabilité du modèle. Déclenche des alertes et un réentraînement lorsque les performances se dégradent.

  • Leçon 2 • CI/CD pour l'apprentissage automatique

    Automatise les tests, la validation et le déploiement des pipelines ML à l'aide de pratiques d'intégration continue. Réduit les erreurs manuelles et accélère les cycles de publication.

  • Leçon 3 • Infrastructure ML scalable

    Conçoit une infrastructure d'entraînement et d'inférence distribuée à l'aide d'outils cloud natifs et d'orchestration. Prépare les étudiants à la conception de systèmes ML à l'échelle de l'entreprise.

  • Leçon 4 • Suivi des expériences et registre de modèles

    Enregistre les paramètres, les métriques et les artefacts à l'aide d'outils de suivi d'expériences et de registres de modèles. Permet la reproductibilité et la collaboration en équipe sur le développement de modèles.

  • Leçon 5 • Empaquetage et service des modèles

    Empaquète les modèles en tant qu'API REST et services conteneurisés pour l'inférence en temps réel et par lots. Couvre les formats de sérialisation et les frameworks de service.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Développeur logiciel : prêt à pivoter vers des rôles d'ingénierie centrés sur les données.

  • Diplômé récent en STEM : souhaitant transformer ses connaissances académiques en compétences opérationnelles.

  • Analyste d'affaires : désireux d'aller au-delà des tableaux de bord vers la modélisation prédictive.

  • Aspirant data scientist : construisant un parcours structuré de la curiosité à la compétence.

  • Analyste de données : désireux d'ajouter des compétences en apprentissage automatique et en déploiement à sa boîte à outils.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF