Choisissez votre langue
Cours de manipulation de données en Data Science
Plus de 2 millions d'apprenants dans le monde

Cours de manipulation de données en Data Science

Maîtrisez le flux de travail complet de la science des données — de la collecte de données brutes aux modèles d'apprentissage automatique déployés. Ce cours vous dote de compétences pratiques en Python, SQL, ingénierie des caractéristiques et surveillance des modèles. Que vous fassiez votre entrée dans le domaine ou que vous montiez en compétences professionnellement, vous construirez la base technique que les employeurs exigent en réalité.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Construisez et automatisez des pipelines de données de bout en bout qui ingèrent, nettoient et stockent les données de manière fiable.

  • Appliquez des algorithmes d'apprentissage automatique supervisés et non supervisés pour résoudre des problèmes métier réels.

  • Concevez, sélectionnez et mettez à l'échelle des caractéristiques pour maximiser les performances du modèle prédictif.

  • Menez une analyse exploratoire approfondie des données à l'aide de résumés statistiques et de visualisations convaincantes.

  • Déployez des modèles entraînés sous forme d'API REST et surveillez-les pour détecter la dérive et la dégradation en production.

  • Communiquez clairement les conclusions des données et les résultats des modèles aux parties prenantes techniques et non techniques.

Comment vous étudiez de façon pratique Cours de manipulation de données en Data Science

Comment vous pratiquez Cours de manipulation de données en Data Science

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de la Science des Données

  • Leçon 1 • Configuration des Outils et de l'Environnement

    Présente la chaîne d'outils standard de la science des données et configure un environnement de travail reproductible. Garantit que tous les étudiants opèrent à partir d'une base technique cohérente.

  • Leçon 2 • Le Cycle de Vie de la Science des Données

    Trace un projet, du problème métier aux informations déployées. Fournit un modèle mental reproductible pour structurer tout engagement en science des données.

  • Leçon 3 • Types de Données et de Problèmes

    Catégorise les données structurées, non structurées et semi-structurées et les associe à chaque type de problème. Guide le choix de méthode appropriée dès le départ.

  • Leçon 4 • Ce qu'est la Science des Données

    Définit la science des données, la distingue des domaines connexes et cartographie ses composantes principales. Établit un vocabulaire partagé utilisé tout au long du cours.

Chapitre 2Voir les détails

Collecte et Stockage des Données

  • Leçon 1 • Sources et Formats de Données

    Passe en revue les origines de données et les formats de fichiers courants rencontrés en pratique. Prépare les étudiants à traiter tout format de données entrant avec confiance.

  • Leçon 2 • Consommation d'API et de Données Web

    Couvre les appels d'API REST, l'authentification et le scraping HTML pour la collecte de données. Élargit l'éventail des sources de données auxquelles les étudiants peuvent accéder par programmation.

  • Leçon 3 • Stratégies de Stockage des Données

    Compare les fichiers plats, les bases de données relationnelles et les magasins columnaires pour différentes charges de travail. Les étudiants sélectionnent le stockage approprié en fonction du volume et des modèles de requêtes.

  • Leçon 4 • Interrogation de Bases de Données Relationnelles

    Enseigne les fondamentaux de SQL pour extraire et filtrer les données des magasins relationnels. Permet directement les tâches de récupération de données dans chaque chapitre suivant.

  • Leçon 5 • Construction d'un Pipeline de Données Simple

    Intègre les concepts de collecte et de stockage dans un pipeline d'ingestion de bout en bout. Renforce la pensée cyclique introduite au Chapitre 1.

Chapitre 3Voir les détails

Nettoyage et Préparation des Données

  • Leçon 1 • Conversion de Type de Données et Formatage

    Aborde l'analyse des dates, l'encodage des catégories et la standardisation des champs de texte. Garantit que les outils en aval reçoivent des entrées de type correct.

  • Leçon 2 • Remodelage et Fusion d'Ensembles de Données

    Enseigne le pivotement, la fusion et la jonction de plusieurs tables en un ensemble de données analytique unifié. Prépare directement les données pour l'analyse exploratoire dans le chapitre suivant.

  • Leçon 3 • Détection et Traitement des Valeurs Aberrantes

    Couvre les méthodes statistiques et visuelles pour identifier les valeurs anormales et décider du traitement. Protège la performance du modèle contre les entrées déformées.

  • Leçon 4 • Gestion des Données Manquantes

    Explique les mécanismes de l'absence de données et les stratégies appropriées d'imputation ou de suppression. Empêche les biais introduits par un traitement naïf des valeurs manquantes.

  • Leçon 5 • Évaluation de la Qualité des Données

    Introduit des méthodes de profilage pour quantifier l'exhaustivité, la cohérence et l'exactitude. Établit une base de diagnostic avant toute transformation.

Chapitre 4Voir les détails

Analyse Exploratoire des Données (EDA)

  • Leçon 1 • Analyse Visuelle Univariate

    Enseigne les histogrammes, les diagrammes en boîtes et les diagrammes de densité pour les distributions à une seule variable. Développe la culture visuelle appliquée tout au long du cours.

  • Leçon 2 • Analyse Bivariée et Multivariée

    Explore les relations entre deux ou plusieurs variables à l'aide de nuages de points, de heatmaps et de diagrammes en paires. Révèle les corrélations et les interactions pertinentes pour la modélisation.

  • Leçon 3 • Exploration des Données Catégorielles

    Analyse les distributions de fréquence et les tableaux croisés pour les variables catégorielles. Complète la boîte à outils EDA pour les types de données mixtes.

  • Leçon 4 • Statistiques Descriptives

    Couvre la tendance centrale, la dispersion et la forme de la distribution pour les variables numériques. Fournit la base quantitative pour toute analyse visuelle ultérieure.

  • Leçon 5 • Génération d'Hypothèses et Rapport d'EDA

    Traduit les résultats de l'EDA en hypothèses testables et en un rapport de synthèse structuré. Fait le pont entre l'exploration et les décisions de modélisation prises dans les chapitres suivants.

Chapitre 5Voir les détails

Ingénierie et Sélection de Caractéristiques (Features)

  • Leçon 1 • Mise à l'Échelle et Normalisation

    Applique la mise à l'échelle min-max, la standardisation et la mise à l'échelle robuste aux caractéristiques numériques. Garantit que les modèles basés sur la distance et le gradient reçoivent des entrées comparables.

  • Leçon 2 • Encodage des Variables Catégorielles

    Couvre l'encodage one-hot, ordinal et cible pour convertir les catégories en entrées numériques. Empêche les biais induits par l'encodage dans les modèles en aval.

  • Leçon 3 • Réduction de Dimensionnalité

    Introduit l'ACP et d'autres techniques de réduction pour compresser les espaces de caractéristiques de haute dimension. Réduit le risque de surajustement et le coût de calcul avant la modélisation.

  • Leçon 4 • Création de Nouvelles Caractéristiques

    Dérive des termes d'interaction, des caractéristiques polynomiales et des agrégats spécifiques au domaine. Élargit l'espace des caractéristiques avec des signaux non présents dans les colonnes brutes.

  • Leçon 5 • Méthodes de Sélection de Caractéristiques

    Applique les méthodes de filtre, d'enveloppe et intégrées pour identifier les caractéristiques les plus prédictives. Produit des modèles plus légers, plus interprétables et avec moins de bruit.

Chapitre 6Voir les détails

Apprentissage Automatique Supervisé

  • Leçon 1 • Validation Croisée et Surajustement

    Applique la validation croisée k-fold et stratifiée pour détecter le surajustement et estimer la généralisation. Produit des estimations de performance fiables avant la sélection finale du modèle.

  • Leçon 2 • Algorithmes de Classification

    Introduit la régression logistique, les arbres de décision, les forêts aléatoires et les machines à vecteurs de support pour les cibles catégorielles. Étend le workflow supervisé aux résultats discrets.

  • Leçon 3 • Réglage des Hyperparamètres

    Utilise la recherche par grille, la recherche aléatoire et l'optimisation bayésienne pour trouver les configurations de modèle optimales. Maximise la performance du modèle dans les contraintes de calcul.

  • Leçon 4 • Métriques d'Évaluation de Modèle

    Définit l'exactitude, la précision, le rappel, le F1, le ROC-AUC, le RMSE et le R-carré pour évaluer la qualité du modèle. Permet une comparaison objective entre les algorithmes et les configurations.

  • Leçon 5 • Algorithmes de Régression

    Couvre la régression linéaire, ridge, lasso et basée sur les arbres pour la prédiction de cibles continues. Établit le workflow d'apprentissage supervisé appliqué à tous les algorithmes suivants.

Chapitre 7Voir les détails

Apprentissage Non Supervisé et Clustering

  • Leçon 1 • Évaluation des Solutions de Clustering

    Applique des métriques de validation internes et externes pour évaluer et comparer les solutions de clustering. Permet une sélection défendable des clusters sans étiquettes de vérité terrain.

  • Leçon 2 • Clustering Densité et Hiérarchique

    Applique DBSCAN pour le clustering tolérant au bruit et les méthodes hiérarchiques pour la segmentation basée sur les dendrogrammes. Gère les structures de clusters non sphériques et imbriquées.

  • Leçon 3 • Fondamentaux du Clustering

    Explique le paradigme de l'apprentissage non supervisé et le rôle des métriques de distance dans le regroupement. Fournit les bases conceptuelles pour tous les algorithmes de clustering couverts.

  • Leçon 4 • Interprétation et Utilisation des Sorties de Clustering

    Profile les caractéristiques des clusters et intègre les étiquettes de cluster comme caractéristiques pour les modèles supervisés. Relie les découvertes non supervisées aux décisions métier et aux pipelines en aval.

  • Leçon 5 • Clustering Basé sur les Centres (Centroïdes)

    Implémente les algorithmes k-moyennes et k-médoïdes et évalue les résultats avec les scores d'inertie et de silhouette. Couvre la famille de clustering la plus utilisée en pratique.

Chapitre 8Voir les détails

Déploiement et Monitoring de Modèle

  • Leçon 1 • Gouvernance et Documentation de Modèle

    Établit des fiches de modèle, des pistes d'audit et des contrôles d'accès pour une utilisation responsable en production. Satisfait aux exigences de responsabilité organisationnelle et réglementaire.

  • Leçon 2 • Surveillance de la Performance du Modèle

    Suit la qualité des prédictions, la dérive des données et les métriques de santé du système en production. Détecte la dégradation avant qu'elle n'affecte les résultats métier.

  • Leçon 3 • Conteneurisation et Pipelines de Déploiement

    Empaquète les services de modèle dans des conteneurs et automatise le déploiement via des pipelines CI/CD. Réduit les erreurs de déploiement manuelles et accélère les cycles d'itération.

  • Leçon 4 • Préparation des Modèles pour la Production

    Couvre la sérialisation, la gestion des dépendances et les exigences de reproductibilité pour le transfert en production. Garantit que les modèles se comportent de manière identique en dehors de l'environnement de développement.

  • Leçon 5 • Service de Modèles via des API

    Construit des points de terminaison REST pour exposer les prédictions du modèle aux applications et aux systèmes en aval. Permet la consommation d'inférence en temps réel par les équipes non spécialisées en science des données.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste d'affaires : prêt à aller au-delà des tableaux de bord pour se lancer dans le travail de modélisation prédictive.

  • Développeur logiciel : souhaite ajouter des capacités d'apprentissage automatique à son ensemble de compétences existant.

  • Jeune diplômé en STEM : recherche une expérience pratique et pertinente aux yeux des employeurs en projet de science des données.

  • Professionnel du marketing ou des opérations : utilise les données quotidiennement, mais manque de connaissances formelles en modélisation.

  • Personne en reconversion professionnelle : se tourne vers la science des données à partir d'un parcours professionnel non technique.

  • Chercheur académique : a besoin de méthodes reproductibles, basées sur le code, pour analyser les ensembles de données d'étude.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Cameroun ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF