Choisissez votre langue
Cours de manipulation de données en Data Science
Plus de 2 millions d'apprenants dans le monde

Cours de manipulation de données en Data Science

Maîtrisez l'ensemble du flux de travail de la science des données, de la collecte de données brutes au déploiement de modèles d'apprentissage automatique. Ce cours vous donne des compétences pratiques en Python, SQL, ingénierie des caractéristiques et surveillance des modèles. Que vous débutiez dans le domaine ou que vous montiez en compétences professionnellement, vous construirez la base technique que les employeurs exigent en réalité.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Construisez et automatisez des pipelines de données de bout en bout qui ingèrent, nettoient et stockent les données de manière fiable.

  • Appliquez des algorithmes d'apprentissage automatique supervisé et non supervisé pour résoudre des problèmes métier réels.

  • Concevez, sélectionnez et mettez à l'échelle des caractéristiques pour maximiser les performances du modèle prédictif.

  • Menez une analyse exploratoire des données approfondie à l'aide de résumés statistiques et de visualisations convaincantes.

  • Déployez des modèles entraînés sous forme d'API REST et surveillez leur dérive et leur dégradation en production.

  • Communiquez clairement les résultats des données et les résultats des modèles aux parties prenantes techniques et non techniques.

Comment vous étudiez de façon pratique Cours de manipulation de données en Data Science

Comment vous pratiquez Cours de manipulation de données en Data Science

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondations de la Science des Données

  • Leçon 1 • Configuration des Outils et de l'Environnement

    Présente la chaîne d'outils standard de la science des données et configure un environnement de travail reproductible. Garantit que tous les étudiants opèrent à partir d'une base technique cohérente.

  • Leçon 2 • Le Cycle de Vie de la Science des Données

    Trace un projet du problème métier à l'information déployée. Fournit un modèle mental reproductible pour structurer tout engagement en science des données.

  • Leçon 3 • Types de Données et de Problèmes

    Catégorise les données structurées, non structurées et semi-structurées et les associe à des types de problèmes. Guide la sélection de méthodes appropriées dès le départ.

  • Leçon 4 • Ce qu'est la Science des Données

    Définit la science des données, la distingue des domaines connexes et cartographie ses composants essentiels. Établit le vocabulaire partagé utilisé tout au long du cours.

Chapitre 2Voir les détails

Collecte et Stockage des Données

  • Leçon 1 • Sources et Formats de Données

    Passe en revue les origines de données et les formats de fichiers courants rencontrés dans la pratique. Prépare les étudiants à gérer en toute confiance tout format de données entrant.

  • Leçon 2 • Consommation d'API et de Données Web

    Couvre les appels d'API REST, l'authentification et le scraping HTML pour la collecte de données. Élargit la gamme de sources de données auxquelles les étudiants peuvent accéder par programmation.

  • Leçon 3 • Stratégies de Stockage de Données

    Compare les fichiers plats, les bases de données relationnelles et les magasins columnaires pour différentes charges de travail. Les étudiants sélectionnent le stockage approprié en fonction du volume et des modèles de requêtes.

  • Leçon 4 • Interrogation des Bases de Données Relationnelles

    Enseigne les fondamentaux de SQL pour extraire et filtrer les données à partir de magasins relationnels. Permet directement les tâches de récupération de données dans chaque chapitre suivant.

  • Leçon 5 • Construction d'un Pipeline de Données Simple

    Intègre les concepts de collecte et de stockage dans un pipeline d'ingestion de bout en bout. Renforce la réflexion sur le cycle de vie introduite au chapitre 1.

Chapitre 3Voir les détails

Nettoyage et Préparation des Données

  • Leçon 1 • Conversion de Type de Données et Mise en Forme

    Aborde l'analyse des dates, l'encodage des catégories et la standardisation des champs de texte. Garantit que les outils en aval reçoivent des entrées de type correct.

  • Leçon 2 • Remodelage et Fusion d'Ensembles de Données

    Enseigne le pivotement, la fusion et la jointure de plusieurs tables en un seul ensemble de données analytique unifié. Prépare directement les données pour l'analyse exploratoire du chapitre suivant.

  • Leçon 3 • Détection et Traitement des Valeurs Aberrantes

    Couvre les méthodes statistiques et visuelles pour identifier les valeurs anormales et décider du traitement. Protège les performances du modèle des entrées déformées.

  • Leçon 4 • Gestion des Données Manquantes

    Explique les mécanismes de la manquance et les stratégies d'imputation ou de suppression appropriées. Empêche les biais introduits par un traitement naïf des valeurs manquantes.

  • Leçon 5 • Évaluation de la Qualité des Données

    Introduit des méthodes de profilage pour quantifier l'exhaustivité, la cohérence et l'exactitude. Établit une base de référence de diagnostic avant toute transformation.

Chapitre 4Voir les détails

Analyse Exploratoire des Données (AED)

  • Leçon 1 • Analyse Visuelle Univariée

    Enseigne les histogrammes, les diagrammes en boîte et les diagrammes de densité pour les distributions à variable unique. Développe la littératie visuelle appliquée tout au long du cours.

  • Leçon 2 • Analyse Bivariée et Multivariée

    Explore les relations entre deux ou plusieurs variables à l'aide de nuages de points, de cartes de chaleur et de diagrammes en paires. Révèle les corrélations et les interactions pertinentes pour la modélisation.

  • Leçon 3 • Exploration des Données Catégorielles

    Analyse les distributions de fréquence et les tableaux croisés pour les variables catégorielles. Complète la boîte à outils AED pour les types de données mixtes.

  • Leçon 4 • Statistiques Descriptives

    Couvre la tendance centrale, la dispersion et la forme de la distribution pour les variables numériques. Fournit la base quantitative pour toute analyse visuelle ultérieure.

  • Leçon 5 • Génération d'Hypothèses et Rapport AED

    Traduit les résultats de l'AED en hypothèses testables et en un rapport sommaire structuré. Fait le pont entre l'exploration et les décisions de modélisation prises dans les chapitres ultérieurs.

Chapitre 5Voir les détails

Ingénierie et Sélection de Caractéristiques

  • Leçon 1 • Mise à l'Échelle et Normalisation

    Applique la mise à l'échelle min-max, la standardisation et la mise à l'échelle robuste aux caractéristiques numériques. Garantit que les modèles basés sur la distance et le gradient reçoivent des entrées comparables.

  • Leçon 2 • Encodage des Variables Catégorielles

    Couvre l'encodage one-hot, ordinal et cible pour convertir les catégories en entrées numériques. Empêche les biais induits par l'encodage dans les modèles en aval.

  • Leçon 3 • Réduction de Dimensionnalité

    Introduit l'ACP et d'autres techniques de réduction pour compresser les espaces de caractéristiques de haute dimension. Réduit le risque de surapprentissage et le coût de calcul avant la modélisation.

  • Leçon 4 • Création de Nouvelles Caractéristiques

    Dérive des termes d'interaction, des caractéristiques polynomiales et des agrégats spécifiques au domaine. Élargit l'espace des caractéristiques avec des signaux non présents dans les colonnes brutes.

  • Leçon 5 • Méthodes de Sélection de Caractéristiques

    Applique des méthodes de filtre, d'enveloppe et intégrées pour identifier les caractéristiques les plus prédictives. Produit des modèles plus légers, plus interprétables et avec moins de bruit.

Chapitre 6Voir les détails

Apprentissage Automatique Supervisé

  • Leçon 1 • Validation Croisée et Surapprentissage

    Applique la validation croisée k-fold et stratifiée pour détecter le surapprentissage et estimer la généralisation. Produit des estimations de performance fiables avant la sélection finale du modèle.

  • Leçon 2 • Algorithmes de Classification

    Introduit la régression logistique, les arbres de décision, les forêts aléatoires et les machines à vecteurs de support pour les cibles catégorielles. Étend le workflow supervisé aux résultats discrets.

  • Leçon 3 • Réglage des Hyperparamètres

    Utilise la recherche par grille, la recherche aléatoire et l'optimisation bayésienne pour trouver des configurations de modèle optimales. Maximise les performances du modèle dans les contraintes de calcul.

  • Leçon 4 • Métriques d'Évaluation du Modèle

    Définit l'exactitude, la précision, le rappel, le F1, ROC-AUC, RMSE et le R-carré pour évaluer la qualité du modèle. Permet une comparaison objective entre les algorithmes et les configurations.

  • Leçon 5 • Algorithmes de Régression

    Couvre la régression linéaire, ridge, lasso et basée sur les arbres pour la prédiction de cibles continues. Établit le workflow d'apprentissage supervisé appliqué à tous les algorithmes ultérieurs.

Chapitre 7Voir les détails

Apprentissage Non Supervisé et Clustering

  • Leçon 1 • Évaluation des Solutions de Clustering

    Applique des métriques de validation internes et externes pour évaluer et comparer les solutions de clustering. Permet une sélection de cluster défendable sans étiquettes de vérité terrain.

  • Leçon 2 • Clustering Densitaire et Hiérarchique

    Applique DBSCAN pour le clustering tolérant au bruit et les méthodes hiérarchiques pour la segmentation basée sur les dendrogrammes. Gère les structures de clusters non sphériques et imbriquées.

  • Leçon 3 • Fondamentaux du Clustering

    Explique le paradigme de l'apprentissage non supervisé et le rôle des métriques de distance dans le regroupement. Fournit la base conceptuelle pour tous les algorithmes de clustering couverts.

  • Leçon 4 • Interprétation et Utilisation des Sorties de Clustering

    Profile les caractéristiques des clusters et intègre les étiquettes de cluster comme caractéristiques pour les modèles supervisés. Relie les résultats non supervisés aux décisions métier et aux pipelines en aval.

  • Leçon 5 • Clustering Basé sur les Centroïdes

    Implémente les algorithmes k-means et k-medoids et évalue les résultats avec l'inertie et le score de silhouette. Couvre la famille de clustering la plus utilisée en pratique.

Chapitre 8Voir les détails

Déploiement et Surveillance du Modèle

  • Leçon 1 • Gouvernance et Documentation du Modèle

    Établit des fiches de modèle, des pistes d'audit et des contrôles d'accès pour une utilisation responsable en production. Satisfait aux exigences de responsabilité organisationnelle et réglementaire.

  • Leçon 2 • Surveillance des Performances du Modèle

    Suit la qualité des prédictions, la dérive des données et les métriques de santé du système en production. Détecte la dégradation avant qu'elle n'affecte les résultats métier.

  • Leçon 3 • Conteneurisation et Pipelines de Déploiement

    Empaquette les services de modèle dans des conteneurs et automatise le déploiement via des pipelines CI/CD. Réduit les erreurs de déploiement manuelles et accélère les cycles d'itération.

  • Leçon 4 • Préparation des Modèles pour la Production

    Couvre la sérialisation, la gestion des dépendances et les exigences de reproductibilité pour la remise en production. Garantit que les modèles se comportent de manière identique en dehors de l'environnement de développement.

  • Leçon 5 • Service de Modèles via des API

    Construit des points de terminaison REST pour exposer les prédictions du modèle aux applications et aux systèmes en aval. Permet la consommation d'inférence en temps réel par les équipes non spécialisées en science des données.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Analyste d'affaires : prêt à dépasser les tableaux de bord pour se lancer dans le travail de modélisation prédictive.

  • Développeur de logiciels : souhaite ajouter des capacités d'apprentissage automatique à son ensemble de compétences existant.

  • Jeune diplômé en STEM : cherche une expérience pratique en projet de science des données pertinente pour les employeurs.

  • Professionnel du marketing ou des opérations : utilise les données quotidiennement mais manque de connaissances formelles en modélisation.

  • Personne en reconversion professionnelle : se tourne vers la science des données à partir d'un parcours professionnel non technique.

  • Chercheur académique : a besoin de méthodes reproductibles et basées sur du code pour analyser les ensembles de données d'étude.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en Côte d’Ivoire ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF