Choisissez votre langue
Formation de base en science des données
Plus de 2 millions d'apprenants dans le monde

Formation de base en science des données

Lance ta carrière en science des données avec un programme complet qui t'emmène des bases de Python jusqu'au déploiement de modèles d'apprentissage automatique. Tu maîtriseras le nettoyage des données, l'analyse statistique et la construction de modèles à l'aide d'outils standard de l'industrie. Ce cours te donne les compétences pratiques que les employeurs recherchent activement dès maintenant.

Dedika pour entreprises

Ce que vous allez apprendre:

Tu construiras un ensemble de compétences complet en science des données, en commençant par la programmation Python et en progressant vers le nettoyage des données, les bases statistiques et l'analyse exploratoire. Tu entraîneras et évalueras des modèles d'apprentissage automatique supervisé à l'aide de scikit-learn, puis tu étendras tes compétences à l'apprentissage non supervisé et à l'ingénierie des caractéristiques. Le cours couvre également SQL, les fondamentaux de l'apprentissage profond et le traitement du langage naturel. Tu apprendras à déployer des modèles en tant qu'API, à les surveiller en production et à communiquer clairement les résultats aux parties prenantes de l'entreprise. À la fin, tu auras un projet prêt à être présenté dans un portfolio et les compétences techniques d'entrevue pour postuler à de vrais postes en science des données.

Comment vous étudiez de façon pratique Formation de base en science des données

Comment vous pratiquez Formation de base en science des données

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Introduction à la science des données

  • Leçon 1 • Configuration d'un environnement de science des données

    Installe et configure les outils essentiels pour une analyse reproductible. Assure que chaque étudiant dispose d'un environnement de travail fonctionnel avant de commencer à coder.

  • Leçon 2 • Le cycle de vie de la science des données

    Trace un projet du problème d'affaires à la solution déployée. Fournit un modèle mental pour organiser toutes les compétences techniques subséquentes.

  • Leçon 3 • Ce qu'est la science des données

    Définit la science des données, la distingue des domaines connexes et cartographie ses composantes principales. Établit le vocabulaire commun utilisé tout au long du cours.

  • Leçon 4 • Types de données et de problèmes

    Catégorise les données structurées, non structurées et semi-structurées et les associe à des types de problèmes. Guide la sélection de techniques appropriées plus tard dans le cours.

Chapitre 2Voir les détails

Programmation Python pour la science des données

  • Leçon 1 • Manipulation de données avec pandas

    Enseigne la création de DataFrames, l'indexation, le filtrage et la transformation. Soutient directement les chapitres sur le nettoyage des données et l'ingénierie des caractéristiques à venir.

  • Leçon 2 • Entrées-sorties de fichiers et chargement de données

    Lit et écrit des fichiers CSV, JSON et Excel et se connecte à des bases de données SQL. Prépare les étudiants à ingérer des ensembles de données du monde réel dans n'importe quel format.

  • Leçon 3 • Travailler avec les tableaux NumPy

    Présente le calcul numérique vectorisé à l'aide de NumPy. Permet des opérations rapides sur les tableaux qui sous-tendent pandas et les bibliothèques d'apprentissage automatique.

  • Leçon 4 • Écrire du code Python réutilisable

    Applique les fonctions, les modules et la gestion des erreurs pour créer des scripts faciles à maintenir. Établit des pratiques de codage qui s'adaptent aux pipelines de projets complets.

  • Leçon 5 • Syntaxe Python et structures de données

    Couvre les variables, le flux de contrôle et les collections intégrées. Forme l'épine dorsale de la programmation pour tout le travail ultérieur sur les données.

Chapitre 3Voir les détails

Préparation et nettoyage des données

  • Leçon 1 • Gestion des données manquantes

    Compare les stratégies de suppression, d'imputation et d'indicateur pour les valeurs manquantes. Enseigne les compromis qui affectent la performance du modèle en aval.

  • Leçon 2 • Évaluation de la qualité des données

    Identifie les valeurs manquantes, les doublons et les incohérences par profilage. Établit un processus d'audit systématique avant de commencer toute transformation.

  • Leçon 3 • Transformation et normalisation des données

    Applique la conversion de type, la normalisation et l'encodage aux colonnes brutes. Produit des formats cohérents requis par les modèles statistiques et d'apprentissage automatique.

  • Leçon 4 • Création de pipelines de données reproductibles

    Encapsule les étapes de nettoyage dans des fonctions et des objets de pipeline réutilisables. Assure un prétraitement cohérent entre les ensembles de données d'entraînement et de production.

  • Leçon 5 • Détection et traitement des valeurs aberrantes

    Utilise des méthodes statistiques et visuelles pour trouver et gérer les valeurs extrêmes. Empêche les valeurs aberrantes de fausser l'entraînement des modèles et les statistiques récapitulatives.

Chapitre 4Voir les détails

Fondements statistiques pour la modélisation

  • Leçon 1 • Tests statistiques courants

    Applique les tests t, le test du khi-carré et l'ANOVA à des ensembles de données réels. Équipe les étudiants pour choisir et exécuter le test approprié pour chaque scénario de données.

  • Leçon 2 • Corrélation et relations linéaires

    Quantifie les associations linéaires à l'aide des corrélations de Pearson et de Spearman. Jette les bases de la modélisation par régression dans le prochain chapitre.

  • Leçon 3 • Notions essentielles de probabilité

    Couvre les règles de probabilité, la probabilité conditionnelle et les distributions courantes. Fournit le langage mathématique utilisé dans tous les modèles probabilistes.

  • Leçon 4 • Principes de conception d'expériences

    Couvre les expériences contrôlées, la randomisation et les cadres de tests A/B. Prépare les étudiants à concevoir des tests valides pour une prise de décision fondée sur les données.

  • Leçon 5 • Notions de base de l'inférence statistique

    Présente les distributions d'échantillonnage, les intervalles de confiance et les tests d'hypothèses. Permet une évaluation rigoureuse pour savoir si les tendances observées sont statistiquement significatives.

Chapitre 5Voir les détails

Analyse exploratoire des données et visualisation

  • Leçon 1 • Notions fondamentales des statistiques descriptives

    Calcule les mesures de tendance centrale, de dispersion et de forme pour les variables numériques. Fournit la base quantitative pour interpréter toutes les visualisations.

  • Leçon 2 • Analyse univariée et bivariée

    Examine les distributions d'une seule variable et les relations par paires entre les variables. Révèle le comportement des caractéristiques et les signaux prédictifs potentiels.

  • Leçon 3 • Pratiques exemplaires en visualisation

    Applique les principes de conception pour créer des graphiques clairs, précis et adaptés au public. Empêche les visuels trompeurs et améliore la communication avec les parties prenantes.

  • Leçon 4 • Informations sur les caractéristiques issues de l'EDA

    Traduit les constats de l'EDA en décisions exploitables concernant l'ingénierie des caractéristiques et la modélisation. Fait le pont entre le travail exploratoire et les chapitres sur l'apprentissage automatique à venir.

  • Leçon 5 • Techniques d'exploration multivariée

    Étend l'analyse aux interactions entre trois variables ou plus simultanément. Met en lumière des tendances complexes que l'analyse bivariée manque.

Chapitre 6Voir les détails

Apprentissage automatique supervisé

  • Leçon 1 • Algorithmes de classification

    Entraîne des classificateurs de régression logistique, d'arbres de décision, de k-plus proches voisins et naïfs bayésiens. Relie le choix de l'algorithme aux caractéristiques des données et aux besoins d'affaires.

  • Leçon 2 • Évaluation du modèle et mesures

    Applique l'exactitude, la précision, le rappel, le F1, la courbe ROC-AUC et l'erreur quadratique moyenne pour évaluer la qualité du modèle. Enseigne la sélection des mesures en fonction du déséquilibre des classes et des compromis liés aux coûts d'affaires.

  • Leçon 3 • Algorithmes de régression

    Couvre la régression linéaire, ridge, lasso et par arbre de décision pour les cibles continues. Enseigne quand et pourquoi appliquer la régularisation pour réduire le surapprentissage.

  • Leçon 4 • Processus d'apprentissage automatique

    Établit le processus de bout en bout, de la division des données à l'évaluation du modèle. Fournit un cadre reproductible appliqué à chaque algorithme de ce chapitre.

  • Leçon 5 • Ajustement des hyperparamètres

    Utilise la recherche par grille et la recherche aléatoire pour optimiser systématiquement les hyperparamètres du modèle. Empêche le surapprentissage tout en maximisant la généralisation sur des données non vues.

Chapitre 7Voir les détails

Apprentissage non supervisé et ingénierie des caractéristiques

  • Leçon 1 • Réduction de la dimensionnalité

    Réduit l'espace des caractéristiques à l'aide de l'ACP et du t-SNE tout en préservant une variance significative. Améliore la visualisation, accélère l'entraînement et atténue la malédiction de la dimensionnalité.

  • Leçon 2 • Méthodes de sélection des caractéristiques

    Supprime les caractéristiques non pertinentes et redondantes à l'aide de méthodes de filtre, d'encapsulation et intégrées. Réduit le surapprentissage et accélère l'entraînement du modèle.

  • Leçon 3 • Techniques d'ingénierie des caractéristiques

    Crée de nouvelles caractéristiques informatives à partir de colonnes existantes par transformation et interaction. Améliore directement le pouvoir prédictif des modèles construits dans le chapitre précédent.

  • Leçon 4 • Algorithmes de regroupement

    Applique les regroupements k-moyennes, hiérarchique et DBSCAN pour découvrir des groupements naturels. Permet la segmentation de la clientèle, la détection d'anomalies et le résumé des données.

  • Leçon 5 • Notions fondamentales de la détection d'anomalies

    Détecte les observations rares et inhabituelles à l'aide d'approches statistiques et basées sur des modèles. Soutient les cas d'utilisation de détection de fraude, de contrôle de la qualité et de nettoyage des données.

Chapitre 8Voir les détails

Déploiement et communication des modèles

  • Leçon 1 • Construction d'une API de modèle

    Encapsule un modèle entraîné dans une API REST à l'aide de Flask ou FastAPI. Permet à d'autres applications et services de consommer les prédictions par programme.

  • Leçon 2 • Sauvegarde et versionnement des modèles

    Sérialise les modèles entraînés et suit les expériences avec des outils de versionnement. Assure la reproductibilité et permet le retour en arrière lorsque les modèles de production se dégradent.

  • Leçon 3 • Surveillance et maintenance des modèles

    Suit la dérive des prédictions, la dérive des données et la dégradation de la performance en production. Établit des processus pour réentraîner et mettre à jour les modèles déployés.

  • Leçon 4 • Communication des résultats aux parties prenantes

    Traduit les constats techniques en récits clairs et en tableaux de bord visuels pour les publics d'affaires. Comble l'écart entre la sortie du modèle et la prise de décision organisationnelle.

  • Leçon 5 • Notions de base sur la conteneurisation et le déploiement

    Empaquète l'API du modèle dans un conteneur Docker pour un déploiement cohérent. Introduit les concepts de déploiement infonuagique sans nécessiter une expertise approfondie en infrastructure.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Personnes en réorientation professionnelle : cherchant un parcours structuré vers une profession axée sur les données.

  • Analystes d'affaires : souhaitant dépasser les tableurs pour faire du travail de modélisation prédictive.

  • Jeunes diplômés : cherchant à ajouter des compétences techniques appliquées à leur formation académique.

  • Professionnels du marketing ou des opérations : visant à prendre des décisions fondées sur les données de manière autonome.

  • Programmeurs amateurs : prêts à canaliser leur curiosité vers un ensemble de compétences en science des données commercialisables.

  • Scientifiques ou chercheurs : espérant automatiser l'analyse et appliquer l'apprentissage automatique à leur domaine.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF