
Cours de manipulation de données en Data Science
Maîtrisez le flux de travail complet de la science des données — de la collecte de données brutes aux modèles d'apprentissage automatique déployés. Ce cours vous dote de compétences pratiques en Python, SQL, ingénierie des caractéristiques et surveillance des modèles. Que vous fassiez votre entrée dans le domaine ou que vous montiez en compétences professionnellement, vous construirez la base technique que les employeurs exigent en réalité.
Ce que vous allez apprendre:
Construisez et automatisez des pipelines de données de bout en bout qui ingèrent, nettoient et stockent les données de manière fiable.
Appliquez des algorithmes d'apprentissage automatique supervisés et non supervisés pour résoudre des problèmes métier réels.
Concevez, sélectionnez et mettez à l'échelle des caractéristiques pour maximiser les performances du modèle prédictif.
Menez une analyse exploratoire approfondie des données à l'aide de résumés statistiques et de visualisations convaincantes.
Déployez des modèles entraînés sous forme d'API REST et surveillez-les pour détecter la dérive et la dégradation en production.
Communiquez clairement les conclusions des données et les résultats des modèles aux parties prenantes techniques et non techniques.
Comment vous étudiez de façon pratique Cours de manipulation de données en Data Science
Comment vous pratiquez Cours de manipulation de données en Data Science
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de la Science des Données
Fondements de la Science des Données
Leçon 1 • Configuration des Outils et de l'Environnement
Présente la chaîne d'outils standard de la science des données et configure un environnement de travail reproductible. Garantit que tous les étudiants opèrent à partir d'une base technique cohérente.
Leçon 2 • Le Cycle de Vie de la Science des Données
Trace un projet, du problème métier aux informations déployées. Fournit un modèle mental reproductible pour structurer tout engagement en science des données.
Leçon 3 • Types de Données et de Problèmes
Catégorise les données structurées, non structurées et semi-structurées et les associe à chaque type de problème. Guide le choix de méthode appropriée dès le départ.
Leçon 4 • Ce qu'est la Science des Données
Définit la science des données, la distingue des domaines connexes et cartographie ses composantes principales. Établit un vocabulaire partagé utilisé tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsCollecte et Stockage des Données
Collecte et Stockage des Données
Leçon 1 • Sources et Formats de Données
Passe en revue les origines de données et les formats de fichiers courants rencontrés en pratique. Prépare les étudiants à traiter tout format de données entrant avec confiance.
Leçon 2 • Consommation d'API et de Données Web
Couvre les appels d'API REST, l'authentification et le scraping HTML pour la collecte de données. Élargit l'éventail des sources de données auxquelles les étudiants peuvent accéder par programmation.
Leçon 3 • Stratégies de Stockage des Données
Compare les fichiers plats, les bases de données relationnelles et les magasins columnaires pour différentes charges de travail. Les étudiants sélectionnent le stockage approprié en fonction du volume et des modèles de requêtes.
Leçon 4 • Interrogation de Bases de Données Relationnelles
Enseigne les fondamentaux de SQL pour extraire et filtrer les données des magasins relationnels. Permet directement les tâches de récupération de données dans chaque chapitre suivant.
Leçon 5 • Construction d'un Pipeline de Données Simple
Intègre les concepts de collecte et de stockage dans un pipeline d'ingestion de bout en bout. Renforce la pensée cyclique introduite au Chapitre 1.
Chapitre 3MasquerCacher les détailsVoir les détailsNettoyage et Préparation des Données
Nettoyage et Préparation des Données
Leçon 1 • Conversion de Type de Données et Formatage
Aborde l'analyse des dates, l'encodage des catégories et la standardisation des champs de texte. Garantit que les outils en aval reçoivent des entrées de type correct.
Leçon 2 • Remodelage et Fusion d'Ensembles de Données
Enseigne le pivotement, la fusion et la jonction de plusieurs tables en un ensemble de données analytique unifié. Prépare directement les données pour l'analyse exploratoire dans le chapitre suivant.
Leçon 3 • Détection et Traitement des Valeurs Aberrantes
Couvre les méthodes statistiques et visuelles pour identifier les valeurs anormales et décider du traitement. Protège la performance du modèle contre les entrées déformées.
Leçon 4 • Gestion des Données Manquantes
Explique les mécanismes de l'absence de données et les stratégies appropriées d'imputation ou de suppression. Empêche les biais introduits par un traitement naïf des valeurs manquantes.
Leçon 5 • Évaluation de la Qualité des Données
Introduit des méthodes de profilage pour quantifier l'exhaustivité, la cohérence et l'exactitude. Établit une base de diagnostic avant toute transformation.
Chapitre 4MasquerCacher les détailsVoir les détailsAnalyse Exploratoire des Données (EDA)
Analyse Exploratoire des Données (EDA)
Leçon 1 • Analyse Visuelle Univariate
Enseigne les histogrammes, les diagrammes en boîtes et les diagrammes de densité pour les distributions à une seule variable. Développe la culture visuelle appliquée tout au long du cours.
Leçon 2 • Analyse Bivariée et Multivariée
Explore les relations entre deux ou plusieurs variables à l'aide de nuages de points, de heatmaps et de diagrammes en paires. Révèle les corrélations et les interactions pertinentes pour la modélisation.
Leçon 3 • Exploration des Données Catégorielles
Analyse les distributions de fréquence et les tableaux croisés pour les variables catégorielles. Complète la boîte à outils EDA pour les types de données mixtes.
Leçon 4 • Statistiques Descriptives
Couvre la tendance centrale, la dispersion et la forme de la distribution pour les variables numériques. Fournit la base quantitative pour toute analyse visuelle ultérieure.
Leçon 5 • Génération d'Hypothèses et Rapport d'EDA
Traduit les résultats de l'EDA en hypothèses testables et en un rapport de synthèse structuré. Fait le pont entre l'exploration et les décisions de modélisation prises dans les chapitres suivants.
Chapitre 5MasquerCacher les détailsVoir les détailsIngénierie et Sélection de Caractéristiques (Features)
Ingénierie et Sélection de Caractéristiques (Features)
Leçon 1 • Mise à l'Échelle et Normalisation
Applique la mise à l'échelle min-max, la standardisation et la mise à l'échelle robuste aux caractéristiques numériques. Garantit que les modèles basés sur la distance et le gradient reçoivent des entrées comparables.
Leçon 2 • Encodage des Variables Catégorielles
Couvre l'encodage one-hot, ordinal et cible pour convertir les catégories en entrées numériques. Empêche les biais induits par l'encodage dans les modèles en aval.
Leçon 3 • Réduction de Dimensionnalité
Introduit l'ACP et d'autres techniques de réduction pour compresser les espaces de caractéristiques de haute dimension. Réduit le risque de surajustement et le coût de calcul avant la modélisation.
Leçon 4 • Création de Nouvelles Caractéristiques
Dérive des termes d'interaction, des caractéristiques polynomiales et des agrégats spécifiques au domaine. Élargit l'espace des caractéristiques avec des signaux non présents dans les colonnes brutes.
Leçon 5 • Méthodes de Sélection de Caractéristiques
Applique les méthodes de filtre, d'enveloppe et intégrées pour identifier les caractéristiques les plus prédictives. Produit des modèles plus légers, plus interprétables et avec moins de bruit.
Chapitre 6MasquerCacher les détailsVoir les détailsApprentissage Automatique Supervisé
Apprentissage Automatique Supervisé
Leçon 1 • Validation Croisée et Surajustement
Applique la validation croisée k-fold et stratifiée pour détecter le surajustement et estimer la généralisation. Produit des estimations de performance fiables avant la sélection finale du modèle.
Leçon 2 • Algorithmes de Classification
Introduit la régression logistique, les arbres de décision, les forêts aléatoires et les machines à vecteurs de support pour les cibles catégorielles. Étend le workflow supervisé aux résultats discrets.
Leçon 3 • Réglage des Hyperparamètres
Utilise la recherche par grille, la recherche aléatoire et l'optimisation bayésienne pour trouver les configurations de modèle optimales. Maximise la performance du modèle dans les contraintes de calcul.
Leçon 4 • Métriques d'Évaluation de Modèle
Définit l'exactitude, la précision, le rappel, le F1, le ROC-AUC, le RMSE et le R-carré pour évaluer la qualité du modèle. Permet une comparaison objective entre les algorithmes et les configurations.
Leçon 5 • Algorithmes de Régression
Couvre la régression linéaire, ridge, lasso et basée sur les arbres pour la prédiction de cibles continues. Établit le workflow d'apprentissage supervisé appliqué à tous les algorithmes suivants.
Chapitre 7MasquerCacher les détailsVoir les détailsApprentissage Non Supervisé et Clustering
Apprentissage Non Supervisé et Clustering
Leçon 1 • Évaluation des Solutions de Clustering
Applique des métriques de validation internes et externes pour évaluer et comparer les solutions de clustering. Permet une sélection défendable des clusters sans étiquettes de vérité terrain.
Leçon 2 • Clustering Densité et Hiérarchique
Applique DBSCAN pour le clustering tolérant au bruit et les méthodes hiérarchiques pour la segmentation basée sur les dendrogrammes. Gère les structures de clusters non sphériques et imbriquées.
Leçon 3 • Fondamentaux du Clustering
Explique le paradigme de l'apprentissage non supervisé et le rôle des métriques de distance dans le regroupement. Fournit les bases conceptuelles pour tous les algorithmes de clustering couverts.
Leçon 4 • Interprétation et Utilisation des Sorties de Clustering
Profile les caractéristiques des clusters et intègre les étiquettes de cluster comme caractéristiques pour les modèles supervisés. Relie les découvertes non supervisées aux décisions métier et aux pipelines en aval.
Leçon 5 • Clustering Basé sur les Centres (Centroïdes)
Implémente les algorithmes k-moyennes et k-médoïdes et évalue les résultats avec les scores d'inertie et de silhouette. Couvre la famille de clustering la plus utilisée en pratique.
Chapitre 8MasquerCacher les détailsVoir les détailsDéploiement et Monitoring de Modèle
Déploiement et Monitoring de Modèle
Leçon 1 • Gouvernance et Documentation de Modèle
Établit des fiches de modèle, des pistes d'audit et des contrôles d'accès pour une utilisation responsable en production. Satisfait aux exigences de responsabilité organisationnelle et réglementaire.
Leçon 2 • Surveillance de la Performance du Modèle
Suit la qualité des prédictions, la dérive des données et les métriques de santé du système en production. Détecte la dégradation avant qu'elle n'affecte les résultats métier.
Leçon 3 • Conteneurisation et Pipelines de Déploiement
Empaquète les services de modèle dans des conteneurs et automatise le déploiement via des pipelines CI/CD. Réduit les erreurs de déploiement manuelles et accélère les cycles d'itération.
Leçon 4 • Préparation des Modèles pour la Production
Couvre la sérialisation, la gestion des dépendances et les exigences de reproductibilité pour le transfert en production. Garantit que les modèles se comportent de manière identique en dehors de l'environnement de développement.
Leçon 5 • Service de Modèles via des API
Construit des points de terminaison REST pour exposer les prédictions du modèle aux applications et aux systèmes en aval. Permet la consommation d'inférence en temps réel par les équipes non spécialisées en science des données.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste d'affaires : prêt à aller au-delà des tableaux de bord pour se lancer dans le travail de modélisation prédictive.
Développeur logiciel : souhaite ajouter des capacités d'apprentissage automatique à son ensemble de compétences existant.
Jeune diplômé en STEM : recherche une expérience pratique et pertinente aux yeux des employeurs en projet de science des données.
Professionnel du marketing ou des opérations : utilise les données quotidiennement, mais manque de connaissances formelles en modélisation.
Personne en reconversion professionnelle : se tourne vers la science des données à partir d'un parcours professionnel non technique.
Chercheur académique : a besoin de méthodes reproductibles, basées sur le code, pour analyser les ensembles de données d'étude.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Cameroun ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















