
Cours de manipulation de données en Data Science
Maîtrisez l'ensemble du flux de travail de la science des données, de la collecte de données brutes au déploiement de modèles d'apprentissage automatique. Ce cours vous donne des compétences pratiques en Python, SQL, ingénierie des caractéristiques et surveillance des modèles. Que vous débutiez dans le domaine ou que vous montiez en compétences professionnellement, vous construirez la base technique que les employeurs exigent en réalité.
Ce que vous allez apprendre:
Construisez et automatisez des pipelines de données de bout en bout qui ingèrent, nettoient et stockent les données de manière fiable.
Appliquez des algorithmes d'apprentissage automatique supervisé et non supervisé pour résoudre des problèmes métier réels.
Concevez, sélectionnez et mettez à l'échelle des caractéristiques pour maximiser les performances du modèle prédictif.
Menez une analyse exploratoire des données approfondie à l'aide de résumés statistiques et de visualisations convaincantes.
Déployez des modèles entraînés sous forme d'API REST et surveillez leur dérive et leur dégradation en production.
Communiquez clairement les résultats des données et les résultats des modèles aux parties prenantes techniques et non techniques.
Comment vous étudiez de façon pratique Cours de manipulation de données en Data Science
Comment vous pratiquez Cours de manipulation de données en Data Science
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondations de la Science des Données
Fondations de la Science des Données
Leçon 1 • Configuration des Outils et de l'Environnement
Présente la chaîne d'outils standard de la science des données et configure un environnement de travail reproductible. Garantit que tous les étudiants opèrent à partir d'une base technique cohérente.
Leçon 2 • Le Cycle de Vie de la Science des Données
Trace un projet du problème métier à l'information déployée. Fournit un modèle mental reproductible pour structurer tout engagement en science des données.
Leçon 3 • Types de Données et de Problèmes
Catégorise les données structurées, non structurées et semi-structurées et les associe à des types de problèmes. Guide la sélection de méthodes appropriées dès le départ.
Leçon 4 • Ce qu'est la Science des Données
Définit la science des données, la distingue des domaines connexes et cartographie ses composants essentiels. Établit le vocabulaire partagé utilisé tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsCollecte et Stockage des Données
Collecte et Stockage des Données
Leçon 1 • Sources et Formats de Données
Passe en revue les origines de données et les formats de fichiers courants rencontrés dans la pratique. Prépare les étudiants à gérer en toute confiance tout format de données entrant.
Leçon 2 • Consommation d'API et de Données Web
Couvre les appels d'API REST, l'authentification et le scraping HTML pour la collecte de données. Élargit la gamme de sources de données auxquelles les étudiants peuvent accéder par programmation.
Leçon 3 • Stratégies de Stockage de Données
Compare les fichiers plats, les bases de données relationnelles et les magasins columnaires pour différentes charges de travail. Les étudiants sélectionnent le stockage approprié en fonction du volume et des modèles de requêtes.
Leçon 4 • Interrogation des Bases de Données Relationnelles
Enseigne les fondamentaux de SQL pour extraire et filtrer les données à partir de magasins relationnels. Permet directement les tâches de récupération de données dans chaque chapitre suivant.
Leçon 5 • Construction d'un Pipeline de Données Simple
Intègre les concepts de collecte et de stockage dans un pipeline d'ingestion de bout en bout. Renforce la réflexion sur le cycle de vie introduite au chapitre 1.
Chapitre 3MasquerCacher les détailsVoir les détailsNettoyage et Préparation des Données
Nettoyage et Préparation des Données
Leçon 1 • Conversion de Type de Données et Mise en Forme
Aborde l'analyse des dates, l'encodage des catégories et la standardisation des champs de texte. Garantit que les outils en aval reçoivent des entrées de type correct.
Leçon 2 • Remodelage et Fusion d'Ensembles de Données
Enseigne le pivotement, la fusion et la jointure de plusieurs tables en un seul ensemble de données analytique unifié. Prépare directement les données pour l'analyse exploratoire du chapitre suivant.
Leçon 3 • Détection et Traitement des Valeurs Aberrantes
Couvre les méthodes statistiques et visuelles pour identifier les valeurs anormales et décider du traitement. Protège les performances du modèle des entrées déformées.
Leçon 4 • Gestion des Données Manquantes
Explique les mécanismes de la manquance et les stratégies d'imputation ou de suppression appropriées. Empêche les biais introduits par un traitement naïf des valeurs manquantes.
Leçon 5 • Évaluation de la Qualité des Données
Introduit des méthodes de profilage pour quantifier l'exhaustivité, la cohérence et l'exactitude. Établit une base de référence de diagnostic avant toute transformation.
Chapitre 4MasquerCacher les détailsVoir les détailsAnalyse Exploratoire des Données (AED)
Analyse Exploratoire des Données (AED)
Leçon 1 • Analyse Visuelle Univariée
Enseigne les histogrammes, les diagrammes en boîte et les diagrammes de densité pour les distributions à variable unique. Développe la littératie visuelle appliquée tout au long du cours.
Leçon 2 • Analyse Bivariée et Multivariée
Explore les relations entre deux ou plusieurs variables à l'aide de nuages de points, de cartes de chaleur et de diagrammes en paires. Révèle les corrélations et les interactions pertinentes pour la modélisation.
Leçon 3 • Exploration des Données Catégorielles
Analyse les distributions de fréquence et les tableaux croisés pour les variables catégorielles. Complète la boîte à outils AED pour les types de données mixtes.
Leçon 4 • Statistiques Descriptives
Couvre la tendance centrale, la dispersion et la forme de la distribution pour les variables numériques. Fournit la base quantitative pour toute analyse visuelle ultérieure.
Leçon 5 • Génération d'Hypothèses et Rapport AED
Traduit les résultats de l'AED en hypothèses testables et en un rapport sommaire structuré. Fait le pont entre l'exploration et les décisions de modélisation prises dans les chapitres ultérieurs.
Chapitre 5MasquerCacher les détailsVoir les détailsIngénierie et Sélection de Caractéristiques
Ingénierie et Sélection de Caractéristiques
Leçon 1 • Mise à l'Échelle et Normalisation
Applique la mise à l'échelle min-max, la standardisation et la mise à l'échelle robuste aux caractéristiques numériques. Garantit que les modèles basés sur la distance et le gradient reçoivent des entrées comparables.
Leçon 2 • Encodage des Variables Catégorielles
Couvre l'encodage one-hot, ordinal et cible pour convertir les catégories en entrées numériques. Empêche les biais induits par l'encodage dans les modèles en aval.
Leçon 3 • Réduction de Dimensionnalité
Introduit l'ACP et d'autres techniques de réduction pour compresser les espaces de caractéristiques de haute dimension. Réduit le risque de surapprentissage et le coût de calcul avant la modélisation.
Leçon 4 • Création de Nouvelles Caractéristiques
Dérive des termes d'interaction, des caractéristiques polynomiales et des agrégats spécifiques au domaine. Élargit l'espace des caractéristiques avec des signaux non présents dans les colonnes brutes.
Leçon 5 • Méthodes de Sélection de Caractéristiques
Applique des méthodes de filtre, d'enveloppe et intégrées pour identifier les caractéristiques les plus prédictives. Produit des modèles plus légers, plus interprétables et avec moins de bruit.
Chapitre 6MasquerCacher les détailsVoir les détailsApprentissage Automatique Supervisé
Apprentissage Automatique Supervisé
Leçon 1 • Validation Croisée et Surapprentissage
Applique la validation croisée k-fold et stratifiée pour détecter le surapprentissage et estimer la généralisation. Produit des estimations de performance fiables avant la sélection finale du modèle.
Leçon 2 • Algorithmes de Classification
Introduit la régression logistique, les arbres de décision, les forêts aléatoires et les machines à vecteurs de support pour les cibles catégorielles. Étend le workflow supervisé aux résultats discrets.
Leçon 3 • Réglage des Hyperparamètres
Utilise la recherche par grille, la recherche aléatoire et l'optimisation bayésienne pour trouver des configurations de modèle optimales. Maximise les performances du modèle dans les contraintes de calcul.
Leçon 4 • Métriques d'Évaluation du Modèle
Définit l'exactitude, la précision, le rappel, le F1, ROC-AUC, RMSE et le R-carré pour évaluer la qualité du modèle. Permet une comparaison objective entre les algorithmes et les configurations.
Leçon 5 • Algorithmes de Régression
Couvre la régression linéaire, ridge, lasso et basée sur les arbres pour la prédiction de cibles continues. Établit le workflow d'apprentissage supervisé appliqué à tous les algorithmes ultérieurs.
Chapitre 7MasquerCacher les détailsVoir les détailsApprentissage Non Supervisé et Clustering
Apprentissage Non Supervisé et Clustering
Leçon 1 • Évaluation des Solutions de Clustering
Applique des métriques de validation internes et externes pour évaluer et comparer les solutions de clustering. Permet une sélection de cluster défendable sans étiquettes de vérité terrain.
Leçon 2 • Clustering Densitaire et Hiérarchique
Applique DBSCAN pour le clustering tolérant au bruit et les méthodes hiérarchiques pour la segmentation basée sur les dendrogrammes. Gère les structures de clusters non sphériques et imbriquées.
Leçon 3 • Fondamentaux du Clustering
Explique le paradigme de l'apprentissage non supervisé et le rôle des métriques de distance dans le regroupement. Fournit la base conceptuelle pour tous les algorithmes de clustering couverts.
Leçon 4 • Interprétation et Utilisation des Sorties de Clustering
Profile les caractéristiques des clusters et intègre les étiquettes de cluster comme caractéristiques pour les modèles supervisés. Relie les résultats non supervisés aux décisions métier et aux pipelines en aval.
Leçon 5 • Clustering Basé sur les Centroïdes
Implémente les algorithmes k-means et k-medoids et évalue les résultats avec l'inertie et le score de silhouette. Couvre la famille de clustering la plus utilisée en pratique.
Chapitre 8MasquerCacher les détailsVoir les détailsDéploiement et Surveillance du Modèle
Déploiement et Surveillance du Modèle
Leçon 1 • Gouvernance et Documentation du Modèle
Établit des fiches de modèle, des pistes d'audit et des contrôles d'accès pour une utilisation responsable en production. Satisfait aux exigences de responsabilité organisationnelle et réglementaire.
Leçon 2 • Surveillance des Performances du Modèle
Suit la qualité des prédictions, la dérive des données et les métriques de santé du système en production. Détecte la dégradation avant qu'elle n'affecte les résultats métier.
Leçon 3 • Conteneurisation et Pipelines de Déploiement
Empaquette les services de modèle dans des conteneurs et automatise le déploiement via des pipelines CI/CD. Réduit les erreurs de déploiement manuelles et accélère les cycles d'itération.
Leçon 4 • Préparation des Modèles pour la Production
Couvre la sérialisation, la gestion des dépendances et les exigences de reproductibilité pour la remise en production. Garantit que les modèles se comportent de manière identique en dehors de l'environnement de développement.
Leçon 5 • Service de Modèles via des API
Construit des points de terminaison REST pour exposer les prédictions du modèle aux applications et aux systèmes en aval. Permet la consommation d'inférence en temps réel par les équipes non spécialisées en science des données.
Votre certificat valide de réussite
Ce cours est pour vous :
Analyste d'affaires : prêt à dépasser les tableaux de bord pour se lancer dans le travail de modélisation prédictive.
Développeur de logiciels : souhaite ajouter des capacités d'apprentissage automatique à son ensemble de compétences existant.
Jeune diplômé en STEM : cherche une expérience pratique en projet de science des données pertinente pour les employeurs.
Professionnel du marketing ou des opérations : utilise les données quotidiennement mais manque de connaissances formelles en modélisation.
Personne en reconversion professionnelle : se tourne vers la science des données à partir d'un parcours professionnel non technique.
Chercheur académique : a besoin de méthodes reproductibles et basées sur du code pour analyser les ensembles de données d'étude.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en Côte d’Ivoire ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















