
Formation Data Engineering
Maîtrisez l'ensemble de la stack d'ingénierie en science des données — des fondements statistiques à l'apprentissage automatique en passant par l'apprentissage profond et les MLOps de production. Cette formation vous dote de la profondeur technique et des compétences pratiques que les employeurs recherchent dans les équipes de données modernes. Construisez de véritables pipelines, déployez de vrais modèles et résolvez de réels problèmes métier.
Ce que vous allez apprendre:
Vous développerez un ensemble de compétences complet et professionnel en science des données couvrant les statistiques, la programmation Python, l'apprentissage automatique, l'apprentissage profond et le déploiement de modèles. Vous apprendrez à collecter et nettoyer des données désordonnées, à concevoir des fonctionnalités à fort impact et à sélectionner les bons algorithmes pour les tâches de régression, classification et clustering. Vous implémenterez des réseaux de neurones, y compris les CNN, RNN et transformeurs, et appliquerez des techniques de traitement du langage naturel à des données textuelles réelles. Vous construirez également des pipelines MLOps prêts pour la production avec suivi des expériences, automatisation CI/CD et surveillance de la dérive. Des modules supplémentaires couvrent SQL avancé, les prévisions de séries temporelles, la visualisation de données, l'éthique et la communication avec les parties prenantes pour vous préparer à toutes les dimensions d'une carrière en science des données.
Comment vous étudiez de façon pratique Formation Data Engineering
Comment vous pratiquez Formation Data Engineering
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 36 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de la science des données
Fondements de la science des données
Leçon 1 • Types de données et formats de stockage
Couvre les formats de données structurées, semi-structurées et non structurées ainsi que leurs systèmes de stockage. Prépare les étudiants à ingérer diverses sources de données.
Leçon 2 • Remise à niveau en mathématiques et statistiques
Revise l'algèbre linéaire, le calcul infinitésimal et les probabilités essentiels pour la modélisation. Fournit les bases quantitatives nécessaires à tous les chapitres suivants.
Leçon 3 • Python pour la science des données
Introduit la syntaxe Python, les structures de données et les bibliothèques scientifiques. Permet aux étudiants d'écrire des scripts d'analyse reproductibles dès le premier jour.
Leçon 4 • Le paysage de la science des données
Définit la science des données, ses sous-domaines et en quoi elle diffère de l'analyse de données et de l'ingénierie des données. Établit le vocabulaire utilisé tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsAcquisition et nettoyage des données
Acquisition et nettoyage des données
Leçon 1 • Transformation et remodelage des données
Applique l'agrégation, le pivotement, la fusion et l'encodage pour restructurer les données en vue de l'analyse. Fait le pont entre les données brutes et les formats prêts pour les caractéristiques.
Leçon 2 • Analyse exploratoire des données
Enseigne le profilage systématique des ensembles de données pour détecter les distributions, les valeurs aberrantes et les relations. Guide les décisions éclairées concernant le nettoyage et l'ingénierie des caractéristiques.
Leçon 3 • Méthodes de collecte de données
Couvre l'extraction de données web, les appels API et les requêtes de base de données comme stratégies principales d'acquisition de données. Relie la source des données à la conception du pipeline en aval.
Leçon 4 • Nettoyage et imputation des données
Traite les valeurs manquantes, les doublons, les formats incohérents et les entrées erronées. Garantit l'intégrité des données avant le début de la modélisation.
Leçon 5 • Construction de pipelines de données reproductibles
Introduit les concepts d'orchestration de pipeline et la conception de code modulaire pour des workflows reproductibles. Prépare les étudiants à l'ingénierie des données de niveau production.
Chapitre 3MasquerCacher les détailsVoir les détailsInférence statistique et expérimentation
Inférence statistique et expérimentation
Leçon 1 • Tests A/B et expérimentation
Conçoit des expériences contrôlées, calcule les tailles d'échantillon et interprète correctement les résultats. Directement applicable aux rôles d'analyse de produits et d'entreprise.
Leçon 2 • Fondamentaux de l'inférence bayésienne
Introduit les distributions a priori et a posteriori et la mise à jour bayésienne comme paradigme d'inférence alternatif. Prépare les étudiants à la modélisation probabiliste dans les chapitres suivants.
Leçon 3 • Cadre des tests d'hypothèse
Couvre les hypothèses nulle et alternative, les valeurs p et les types d'erreur pour des tests rigoureux. Relie la signification statistique à la prise de décision pratique.
Leçon 4 • Théorie des probabilités et échantillonnage
Formalise les règles de probabilité, la probabilité conditionnelle et les distributions d'échantillonnage. Sous-tend toutes les méthodes inférentielles couvertes dans ce chapitre.
Chapitre 4MasquerCacher les détailsVoir les détailsApprentissage automatique supervisé
Apprentissage automatique supervisé
Leçon 1 • Modèles de classification
Entraîne la régression logistique, les arbres de décision et les machines à vecteurs de support pour des cibles catégorielles. Aborde le déséquilibre des classes et la sélection du seuil.
Leçon 2 • Fondamentaux de l'apprentissage automatique
Définit l'apprentissage supervisé, le compromis biais-variance et le paradigme de séparation entraînement-test. Établit le cadre conceptuel pour tous les chapitres de modélisation.
Leçon 3 • Modèles de régression
Couvre la régression linéaire, polynomiale et régularisée pour la prédiction d'une cible continue. Développe l'intuition pour les coefficients du modèle et les pénalités de régularisation.
Leçon 4 • Réglage des hyperparamètres et sélection de modèles
Applique la recherche par grille, la recherche aléatoire et l'optimisation bayésienne pour maximiser les performances du modèle. Enseigne la comparaison et la sélection de modèles de manière structurée.
Leçon 5 • Méthodes d'ensemble
Applique le bagging, le boosting et le stacking pour améliorer les performances prédictives au-delà des modèles uniques. Introduit le gradient boosting comme une technique de pointe.
Chapitre 5MasquerCacher les détailsVoir les détailsApprentissage non supervisé et réduction de dimensionnalité
Apprentissage non supervisé et réduction de dimensionnalité
Leçon 1 • Apprentissage des règles d'association
Extrait les itemsets fréquents et les règles d'association pour révéler les modèles de cooccurrence. Prend en charge les applications de recommandation et d'analyse du panier d'achat.
Leçon 2 • Techniques de réduction de dimensionnalité
Applique l'ACP, le t-SNE et l'UMAP pour réduire l'espace des caractéristiques tout en préservant la structure. Permet la visualisation et accélère la modélisation en aval.
Leçon 3 • Détection d'anomalies
Identifie les valeurs aberrantes et les événements rares à l'aide d'approches statistiques et basées sur des modèles. S'applique directement aux scénarios de détection de fraude et de contrôle qualité.
Leçon 4 • Algorithmes de clustering
Couvre le clustering k-means, hiérarchique et basé sur la densité pour regrouper des données non étiquetées. Relie l'analyse de clustering aux cas d'utilisation de segmentation commerciale.
Chapitre 6MasquerCacher les détailsVoir les détailsIngénierie des caractéristiques et interprétabilité des modèles
Ingénierie des caractéristiques et interprétabilité des modèles
Leçon 1 • Méthodes de sélection des caractéristiques
Applique des méthodes de filtrage, d'encapsulation et intégrées pour identifier les caractéristiques les plus prédictives. Réduit la dimensionnalité et prévient le surapprentissage.
Leçon 2 • Audit de l'équité et des biais
Détecte et atténue les biais démographiques dans les prédictions du modèle à l'aide de métriques d'équité. Garantit que les modèles respectent les normes éthiques et organisationnelles.
Leçon 3 • Interprétabilité indépendante du modèle
Utilise SHAP et LIME pour expliquer les prédictions individuelles et le comportement global du modèle. Renforce la confiance des parties prenantes et soutient la conformité réglementaire.
Leçon 4 • Ingénierie avancée des caractéristiques
Construit des caractéristiques axées sur le domaine, d'interaction et basées sur le temps pour améliorer les performances du modèle. Démontre l'impact de la qualité des caractéristiques sur la précision prédictive.
Chapitre 7MasquerCacher les détailsVoir les détailsApprentissage profond et réseaux de neurones
Apprentissage profond et réseaux de neurones
Leçon 1 • Fondamentaux des réseaux de neurones
Explique les perceptrons, les fonctions d'activation, la propagation avant et la rétropropagation. Fournit les bases mathématiques pour toutes les architectures d'apprentissage profond.
Leçon 2 • Réseaux de neurones récurrents et séquences
Entraîne les RNN, LSTM et GRU pour les données séquentielles et de séries temporelles. Relie la modélisation de séquences aux applications de TALN et de prévision.
Leçon 3 • Architecture Transformer et mécanisme d'attention
Introduit l'auto-attention, l'attention multi-têtes et le bloc transformer comme base du TALN moderne. Prépare les étudiants au fine-tuning des grands modèles de langage.
Leçon 4 • Optimisation et régularisation de l'entraînement
Applique la normalisation par lots, le dropout, la planification du taux d'apprentissage et l'arrêt précoce pour stabiliser l'entraînement. Réduit le surapprentissage dans les modèles profonds.
Leçon 5 • Réseaux de neurones convolutionnels
Construit des CNN pour la classification d'images et la détection d'objets à l'aide de couches de convolution et de pooling. Démontre l'apprentissage par transfert pour accélérer l'entraînement sur des données limitées.
Chapitre 8MasquerCacher les détailsVoir les détailsMLOps et déploiement en production
MLOps et déploiement en production
Leçon 1 • Surveillance des modèles et détection de dérive
Suit la qualité des prédictions, la dérive des données et la dérive du concept en production pour maintenir la fiabilité du modèle. Déclenche des alertes et un réentraînement lorsque les performances se dégradent.
Leçon 2 • CI/CD pour l'apprentissage automatique
Automatise les tests, la validation et le déploiement des pipelines ML à l'aide de pratiques d'intégration continue. Réduit les erreurs manuelles et accélère les cycles de publication.
Leçon 3 • Infrastructure ML scalable
Conçoit une infrastructure d'entraînement et d'inférence distribuée à l'aide d'outils cloud natifs et d'orchestration. Prépare les étudiants à la conception de systèmes ML à l'échelle de l'entreprise.
Leçon 4 • Suivi des expériences et registre de modèles
Enregistre les paramètres, les métriques et les artefacts à l'aide d'outils de suivi d'expériences et de registres de modèles. Permet la reproductibilité et la collaboration en équipe sur le développement de modèles.
Leçon 5 • Empaquetage et service des modèles
Empaquète les modèles en tant qu'API REST et services conteneurisés pour l'inférence en temps réel et par lots. Couvre les formats de sérialisation et les frameworks de service.
Votre certificat valide de réussite
Ce cours est fait pour vous :
Développeur logiciel : prêt à pivoter vers des rôles d'ingénierie centrés sur les données.
Diplômé récent en STEM : souhaitant transformer ses connaissances académiques en compétences opérationnelles.
Analyste d'affaires : désireux d'aller au-delà des tableaux de bord vers la modélisation prédictive.
Aspirant data scientist : construisant un parcours structuré de la curiosité à la compétence.
Analyste de données : désireux d'ajouter des compétences en apprentissage automatique et en déploiement à sa boîte à outils.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en France ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















