Choisissez votre langue
Cours d'évaluation des LLM et tests statistiques
Plus de 2 millions d'étudiants dans le monde

Cours d'évaluation des LLM et tests statistiques

Maîtrisez chaque couche de l'évaluation des LLM — des métriques automatisées et des études humaines aux tests de signification statistique et aux audits de sécurité. Ce cours offre aux praticiens de l'IA un framework rigoureux de bout en bout pour prouver si un modèle fonctionne réellement. Arrêtez de deviner et commencez à prendre des décisions fondées sur des preuves auxquelles les parties prenantes font confiance.

Dedika pour les entreprises

Ce que vous allez apprendre:

  • Concevez des ensembles de test robustes qui sont représentatifs, impartiaux et exempts de contamination des données.

  • Sélectionnez, calculez et interprétez de manière critique des métriques automatisées, notamment BLEU, ROUGE et BERTScore.

  • Construisez et validez des pipelines LLM-en-tant-que-juge calibrés par rapport aux évaluations humaines de vérité terrain.

  • Appliquez des tests de signification paramétriques et non paramétriques pour confirmer les différences de performance réelles.

  • Évaluez les LLM pour la toxicité, le biais démographique et l'équité à l'aide de méthodologies structurées de test d'intrusion en équipe rouge.

  • Intégrez des méthodes automatisées, humaines et statistiques dans une stratégie d'évaluation cohérente et reproductible.

Comment vous étudiez de façon pratique Cours d'évaluation des LLM et tests statistiques

Comment vous pratiquez Cours d'évaluation des LLM et tests statistiques

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'évaluation des LLM

  • Leçon 1 • Ce que signifie l'évaluation des LLM

    Définit l'évaluation dans le contexte des modèles de langue et la distingue du benchmarking général en ML. Ancre la portée et le vocabulaire du chapitre.

  • Leçon 2 • Aperçu du cycle de vie de l'évaluation

    Cartographie les activités d'évaluation à travers les phases de développement, de déploiement et de surveillance des modèles. Montre où chaque sujet du cours s'insère dans un flux de travail réel.

  • Leçon 3 • Dimensions fondamentales de la qualité

    Présente les axes principaux — précision, aisance, sécurité et utilité — utilisés pour juger les sorties des modèles. Fournit la taxonomie appliquée tout au long du cours.

  • Leçon 4 • Types de tâches des LLM

    Passe en revue les tâches de génération, classification, résumé et raisonnement pour montrer comment les critères d'évaluation varient selon le type de tâche. Prépare les apprenants à associer les métriques aux tâches.

Chapitre 2Voir les détails

Conception d'ensembles de test robustes

  • Leçon 1 • Éviter les écueils de l'évaluation

    Identifie les fuites, les biais de sélection et le bruit d'étiquetage comme menaces à la validité des ensembles de test. Donne aux apprenants les moyens d'auditer et de corriger les ensembles de test défectueux.

  • Leçon 2 • Recherche et conservation d'invites

    Enseigne des méthodes pour collecter, filtrer et annoter des invites provenant de sources réelles et synthétiques. Alimente directement les ensembles de test utilisés dans les exercices d'évaluation ultérieurs.

  • Leçon 3 • Principes de conception d'ensembles de test

    Couvre les stratégies d'échantillonnage, les exigences de couverture et les risques de contamination. Établit le niveau de qualité pour toutes les données de test créées dans les chapitres suivants.

  • Leçon 4 • Construction de réponses de référence

    Explique comment créer des réponses de référence de qualité or et quand les références ne sont pas nécessaires. Fait le lien avec la sélection de métriques dans le chapitre suivant.

  • Leçon 5 • Formats d'ensembles de test spécialisés

    Aborde la construction d'ensembles de test contradictoires, multilingues et spécifiques à un domaine. Étend les compétences fondamentales de conception à des scénarios d'évaluation à forts enjeux.

Chapitre 3Voir les détails

Métriques et notation automatisées

  • Leçon 1 • Fiabilité et validité des métriques

    Examine la corrélation avec le jugement humain, la sensibilité des métriques et les biais systématiques. Permet aux apprenants de justifier leurs choix de métriques auprès d'audiences techniques et non techniques.

  • Leçon 2 • Métriques de similarité sémantique

    Présente les métriques basées sur les plongements telles que BERTScore et les mesures de similarité textuelle sémantique. Montre quand les métriques sémantiques surpassent les métriques lexicales.

  • Leçon 3 • Combinaison de plusieurs métriques

    Enseigne la notation composite, les ensembles de métriques et la visualisation des compromis. Prépare les apprenants à construire des tableaux de bord utilisés dans les flux de travail d'évaluation appliqués.

  • Leçon 4 • Métriques de chevauchement lexical

    Couvre BLEU, ROUGE, METEOR et les métriques n-grammes associées, y compris leurs hypothèses et modes d'échec. Forme les apprenants aux scores les plus largement rapportés.

  • Leçon 5 • Métriques automatisées spécifiques aux tâches

    Présente la précision, F1, la correspondance exacte et la perplexité comme métriques alignées sur les tâches. Fait le lien entre le choix de la métrique et la taxonomie des tâches introduite au chapitre 1.

Chapitre 4Voir les détails

Méthodes d'évaluation humaine

  • Leçon 1 • Recrutement et formation des annotateurs

    Aborde la recherche, la sélection et la calibration des annotateurs humains pour les tâches d'évaluation des LLM. Impacte directement la fiabilité des jugements collectés dans les sections ultérieures.

  • Leçon 2 • Études de préférence et de classement

    Explique la préférence par paire, le classement du meilleur parmi N et les systèmes de notation Elo pour comparer les modèles. Fait le lien avec les flux de travail de comparaison de modèles du chapitre 5.

  • Leçon 3 • Conception d'études d'évaluation humaine

    Couvre les échelles de notation, les protocoles d'évaluation et le cadrage des tâches pour les juges humains. Établit la rigueur méthodologique requise pour une évaluation humaine crédible.

  • Leçon 4 • Accord inter-annotateurs

    Enseigne le kappa de Cohen, l'alpha de Krippendorff et le pourcentage d'accord pour mesurer la cohérence entre évaluateurs. Fournit la base statistique pour valider les données d'évaluation humaine.

  • Leçon 5 • Biais et équité dans l'évaluation humaine

    Identifie le biais de position, le biais de verbosité et les effets démographiques dans les évaluations humaines. Donne aux apprenants les moyens de détecter et d'atténuer les distorsions systématiques dans les données d'évaluation.

Chapitre 5Voir les détails

Évaluation LLM comme juge

  • Leçon 1 • Principes du LLM comme juge

    Explique la logique, les hypothèses et les modes d'échec connus de l'utilisation des LLM pour évaluer les sorties des LLM. Définit les attentes quant aux situations où cette approche est appropriée ou non.

  • Leçon 2 • Détection des biais dans les juges LLM

    Identifie les biais de verbosité, d'auto-préférence et de position spécifiques aux juges LLM. Étend les concepts de biais de l'évaluation humaine du chapitre 4 aux juges automatisés.

  • Leçon 3 • Calibration des modèles juges

    Enseigne l'alignement des scores des juges sur les évaluations humaines à l'aide d'ensembles de données de calibration et de réglage fin. Garantit que les sorties des juges sont fiables avant le déploiement.

  • Leçon 4 • Ingénierie d'invites pour les juges

    Couvre les invites basées sur une grille d'évaluation, la notation par chaîne de pensée et les invites d'évaluation guidées par une référence. Détermine directement la qualité des jugements automatisés produits.

  • Leçon 5 • Validation des pipelines de juges

    Présente l'analyse de corrélation, le sondage contradictoire et les audits avec intervention humaine pour la validation des juges. Produit un pipeline validé prêt pour les tests de signification au chapitre 6.

Chapitre 6Voir les détails

Tests de signification statistique

  • Leçon 1 • Comparaisons multiples et corrections

    Aborde le contrôle de l'erreur de famille, Bonferroni, Benjamini-Hochberg et le taux d'erreur par famille lors du test de nombreux modèles. Empêche les fausses découvertes dans les campagnes d'évaluation à grande échelle.

  • Leçon 2 • Taille d'effet et signification pratique

    Enseigne le d de Cohen, les rapports de cotes et les métriques d'amélioration relative pour quantifier l'ampleur des différences. Fait le pont entre la signification statistique et commerciale pour les rapports aux parties prenantes.

  • Leçon 3 • Tests de signification paramétriques

    Couvre les tests t appariés et l'ANOVA pour comparer les scores de modèles sous hypothèses de normalité. Fait le lien avec les données de métriques collectées aux chapitres 3 et 4.

  • Leçon 4 • Tests de signification non paramétriques

    Présente le test des rangs signés de Wilcoxon, le test de McNemar et les tests de permutation pour les données d'évaluation non normales. Élargit la boîte à outils de l'apprenant au-delà des hypothèses paramétriques.

  • Leçon 5 • Fondements statistiques pour l'évaluation

    Passe en revue les tests d'hypothèse, les valeurs p, les intervalles de confiance et les erreurs de type I/II dans le contexte de l'évaluation des LLM. Fournit le vocabulaire statistique utilisé tout au long de ce chapitre.

Chapitre 7Voir les détails

Évaluation de la sécurité, des biais et de l'équité

  • Leçon 1 • Critères d'équité et compromis

    Explique la parité démographique, l'égalité des chances et la calibration comme définitions concurrentes de l'équité. Donne aux apprenants les moyens de sélectionner et de justifier les critères d'équité pour des cas d'utilisation spécifiques.

  • Leçon 2 • Mesure des biais démographiques

    Enseigne l'augmentation de données contrefactuelles, les benchmarks de stéréotypes et les métriques de disparité pour détecter les biais. Fait le lien entre la taxonomie des préjudices et la mesure quantitative des biais.

  • Leçon 3 • Méthodologies de red-teaming

    Couvre le sondage contradictoire structuré, les tests de jailbreak et les pipelines de red-teaming automatisés. Développe des compétences pratiques pour découvrir les vulnérabilités des modèles avant le déploiement.

  • Leçon 4 • Rapport d'évaluation de la sécurité

    Structure les résultats de sécurité en fiches de modèle, registres de risques et résumés exécutifs. Traduit les résultats techniques de sécurité en conseils exploitables pour les décideurs.

  • Leçon 5 • Taxonomie des préjudices des LLM

    Classe les sorties préjudiciables en catégories de toxicité, désinformation, fuite de confidentialité et manipulation. Fournit la taxonomie des préjudices appliquée dans toutes les sections suivantes sur la sécurité.

Chapitre 8Voir les détails

Stratégie d'évaluation de bout en bout

  • Leçon 1 • Évaluation et surveillance continues

    Conçoit des boucles d'évaluation continues pour détecter la dérive du modèle, le changement de distribution des données et les modes d'échec émergents. Étend l'évaluation ponctuelle à une pratique opérationnelle durable.

  • Leçon 2 • Communication des résultats d'évaluation

    Enseigne la visualisation, le cadrage narratif et les rapports spécifiques aux parties prenantes pour les résultats d'évaluation. Garantit que les résultats orientent les décisions plutôt que de rester dans des rapports techniques.

  • Leçon 3 • Infrastructure et outils d'évaluation

    Couvre le suivi des expériences, le stockage des résultats et les outils de reproductibilité pour les pipelines d'évaluation. Garantit que les flux de travail d'évaluation sont évolutifs et audités.

  • Leçon 4 • Sélection et combinaison de méthodes

    Fournit un cadre de décision pour choisir entre les méthodes automatisées, humaines et LLM comme juge. Synthétise tous les chapitres précédents en un processus unifié de sélection de méthode.

  • Leçon 5 • Définition des objectifs d'évaluation

    Guide les apprenants pour traduire les exigences commerciales en objectifs d'évaluation mesurables et en critères de succès. Ancre l'ensemble de la stratégie d'évaluation aux besoins des parties prenantes.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Ingénieur ML : souhaite dépasser l'intuition lors de la comparaison de versions de modèles.

  • Chercheur en NLP : a besoin de méthodes structurées pour valider les résultats expérimentaux de manière crédible.

  • Responsable produit IA : doit traduire les données de performance des modèles en décisions de mise en production en toute confiance.

  • Data Scientist : prêt à ajouter des flux de travail d'évaluation formels à ses compétences existantes en modélisation.

  • Consultant IA : conseille des clients qui exigent une preuve documentée des améliorations de qualité de leurs modèles.

  • Ingénieur logiciel : effectue une transition vers le développement de LLM et acquiert les connaissances fondamentales en évaluation.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF