
Cours d'évaluation des LLM et tests statistiques
Maîtrisez chaque couche de l'évaluation des LLM — des métriques automatisées et des études humaines aux tests de signification statistique et aux audits de sécurité. Ce cours offre aux praticiens de l'IA un framework rigoureux de bout en bout pour prouver si un modèle fonctionne réellement. Arrêtez de deviner et commencez à prendre des décisions fondées sur des preuves auxquelles les parties prenantes font confiance.
Ce que vous allez apprendre:
Concevez des ensembles de test robustes qui sont représentatifs, impartiaux et exempts de contamination des données.
Sélectionnez, calculez et interprétez de manière critique des métriques automatisées, notamment BLEU, ROUGE et BERTScore.
Construisez et validez des pipelines LLM-en-tant-que-juge calibrés par rapport aux évaluations humaines de vérité terrain.
Appliquez des tests de signification paramétriques et non paramétriques pour confirmer les différences de performance réelles.
Évaluez les LLM pour la toxicité, le biais démographique et l'équité à l'aide de méthodologies structurées de test d'intrusion en équipe rouge.
Intégrez des méthodes automatisées, humaines et statistiques dans une stratégie d'évaluation cohérente et reproductible.
Comment vous étudiez de façon pratique Cours d'évaluation des LLM et tests statistiques
Comment vous pratiquez Cours d'évaluation des LLM et tests statistiques
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'évaluation des LLM
Fondements de l'évaluation des LLM
Leçon 1 • Ce que signifie l'évaluation des LLM
Définit l'évaluation dans le contexte des modèles de langue et la distingue du benchmarking général en ML. Ancre la portée et le vocabulaire du chapitre.
Leçon 2 • Aperçu du cycle de vie de l'évaluation
Cartographie les activités d'évaluation à travers les phases de développement, de déploiement et de surveillance des modèles. Montre où chaque sujet du cours s'insère dans un flux de travail réel.
Leçon 3 • Dimensions fondamentales de la qualité
Présente les axes principaux — précision, aisance, sécurité et utilité — utilisés pour juger les sorties des modèles. Fournit la taxonomie appliquée tout au long du cours.
Leçon 4 • Types de tâches des LLM
Passe en revue les tâches de génération, classification, résumé et raisonnement pour montrer comment les critères d'évaluation varient selon le type de tâche. Prépare les apprenants à associer les métriques aux tâches.
Chapitre 2MasquerCacher les détailsVoir les détailsConception d'ensembles de test robustes
Conception d'ensembles de test robustes
Leçon 1 • Éviter les écueils de l'évaluation
Identifie les fuites, les biais de sélection et le bruit d'étiquetage comme menaces à la validité des ensembles de test. Donne aux apprenants les moyens d'auditer et de corriger les ensembles de test défectueux.
Leçon 2 • Recherche et conservation d'invites
Enseigne des méthodes pour collecter, filtrer et annoter des invites provenant de sources réelles et synthétiques. Alimente directement les ensembles de test utilisés dans les exercices d'évaluation ultérieurs.
Leçon 3 • Principes de conception d'ensembles de test
Couvre les stratégies d'échantillonnage, les exigences de couverture et les risques de contamination. Établit le niveau de qualité pour toutes les données de test créées dans les chapitres suivants.
Leçon 4 • Construction de réponses de référence
Explique comment créer des réponses de référence de qualité or et quand les références ne sont pas nécessaires. Fait le lien avec la sélection de métriques dans le chapitre suivant.
Leçon 5 • Formats d'ensembles de test spécialisés
Aborde la construction d'ensembles de test contradictoires, multilingues et spécifiques à un domaine. Étend les compétences fondamentales de conception à des scénarios d'évaluation à forts enjeux.
Chapitre 3MasquerCacher les détailsVoir les détailsMétriques et notation automatisées
Métriques et notation automatisées
Leçon 1 • Fiabilité et validité des métriques
Examine la corrélation avec le jugement humain, la sensibilité des métriques et les biais systématiques. Permet aux apprenants de justifier leurs choix de métriques auprès d'audiences techniques et non techniques.
Leçon 2 • Métriques de similarité sémantique
Présente les métriques basées sur les plongements telles que BERTScore et les mesures de similarité textuelle sémantique. Montre quand les métriques sémantiques surpassent les métriques lexicales.
Leçon 3 • Combinaison de plusieurs métriques
Enseigne la notation composite, les ensembles de métriques et la visualisation des compromis. Prépare les apprenants à construire des tableaux de bord utilisés dans les flux de travail d'évaluation appliqués.
Leçon 4 • Métriques de chevauchement lexical
Couvre BLEU, ROUGE, METEOR et les métriques n-grammes associées, y compris leurs hypothèses et modes d'échec. Forme les apprenants aux scores les plus largement rapportés.
Leçon 5 • Métriques automatisées spécifiques aux tâches
Présente la précision, F1, la correspondance exacte et la perplexité comme métriques alignées sur les tâches. Fait le lien entre le choix de la métrique et la taxonomie des tâches introduite au chapitre 1.
Chapitre 4MasquerCacher les détailsVoir les détailsMéthodes d'évaluation humaine
Méthodes d'évaluation humaine
Leçon 1 • Recrutement et formation des annotateurs
Aborde la recherche, la sélection et la calibration des annotateurs humains pour les tâches d'évaluation des LLM. Impacte directement la fiabilité des jugements collectés dans les sections ultérieures.
Leçon 2 • Études de préférence et de classement
Explique la préférence par paire, le classement du meilleur parmi N et les systèmes de notation Elo pour comparer les modèles. Fait le lien avec les flux de travail de comparaison de modèles du chapitre 5.
Leçon 3 • Conception d'études d'évaluation humaine
Couvre les échelles de notation, les protocoles d'évaluation et le cadrage des tâches pour les juges humains. Établit la rigueur méthodologique requise pour une évaluation humaine crédible.
Leçon 4 • Accord inter-annotateurs
Enseigne le kappa de Cohen, l'alpha de Krippendorff et le pourcentage d'accord pour mesurer la cohérence entre évaluateurs. Fournit la base statistique pour valider les données d'évaluation humaine.
Leçon 5 • Biais et équité dans l'évaluation humaine
Identifie le biais de position, le biais de verbosité et les effets démographiques dans les évaluations humaines. Donne aux apprenants les moyens de détecter et d'atténuer les distorsions systématiques dans les données d'évaluation.
Chapitre 5MasquerCacher les détailsVoir les détailsÉvaluation LLM comme juge
Évaluation LLM comme juge
Leçon 1 • Principes du LLM comme juge
Explique la logique, les hypothèses et les modes d'échec connus de l'utilisation des LLM pour évaluer les sorties des LLM. Définit les attentes quant aux situations où cette approche est appropriée ou non.
Leçon 2 • Détection des biais dans les juges LLM
Identifie les biais de verbosité, d'auto-préférence et de position spécifiques aux juges LLM. Étend les concepts de biais de l'évaluation humaine du chapitre 4 aux juges automatisés.
Leçon 3 • Calibration des modèles juges
Enseigne l'alignement des scores des juges sur les évaluations humaines à l'aide d'ensembles de données de calibration et de réglage fin. Garantit que les sorties des juges sont fiables avant le déploiement.
Leçon 4 • Ingénierie d'invites pour les juges
Couvre les invites basées sur une grille d'évaluation, la notation par chaîne de pensée et les invites d'évaluation guidées par une référence. Détermine directement la qualité des jugements automatisés produits.
Leçon 5 • Validation des pipelines de juges
Présente l'analyse de corrélation, le sondage contradictoire et les audits avec intervention humaine pour la validation des juges. Produit un pipeline validé prêt pour les tests de signification au chapitre 6.
Chapitre 6MasquerCacher les détailsVoir les détailsTests de signification statistique
Tests de signification statistique
Leçon 1 • Comparaisons multiples et corrections
Aborde le contrôle de l'erreur de famille, Bonferroni, Benjamini-Hochberg et le taux d'erreur par famille lors du test de nombreux modèles. Empêche les fausses découvertes dans les campagnes d'évaluation à grande échelle.
Leçon 2 • Taille d'effet et signification pratique
Enseigne le d de Cohen, les rapports de cotes et les métriques d'amélioration relative pour quantifier l'ampleur des différences. Fait le pont entre la signification statistique et commerciale pour les rapports aux parties prenantes.
Leçon 3 • Tests de signification paramétriques
Couvre les tests t appariés et l'ANOVA pour comparer les scores de modèles sous hypothèses de normalité. Fait le lien avec les données de métriques collectées aux chapitres 3 et 4.
Leçon 4 • Tests de signification non paramétriques
Présente le test des rangs signés de Wilcoxon, le test de McNemar et les tests de permutation pour les données d'évaluation non normales. Élargit la boîte à outils de l'apprenant au-delà des hypothèses paramétriques.
Leçon 5 • Fondements statistiques pour l'évaluation
Passe en revue les tests d'hypothèse, les valeurs p, les intervalles de confiance et les erreurs de type I/II dans le contexte de l'évaluation des LLM. Fournit le vocabulaire statistique utilisé tout au long de ce chapitre.
Chapitre 7MasquerCacher les détailsVoir les détailsÉvaluation de la sécurité, des biais et de l'équité
Évaluation de la sécurité, des biais et de l'équité
Leçon 1 • Critères d'équité et compromis
Explique la parité démographique, l'égalité des chances et la calibration comme définitions concurrentes de l'équité. Donne aux apprenants les moyens de sélectionner et de justifier les critères d'équité pour des cas d'utilisation spécifiques.
Leçon 2 • Mesure des biais démographiques
Enseigne l'augmentation de données contrefactuelles, les benchmarks de stéréotypes et les métriques de disparité pour détecter les biais. Fait le lien entre la taxonomie des préjudices et la mesure quantitative des biais.
Leçon 3 • Méthodologies de red-teaming
Couvre le sondage contradictoire structuré, les tests de jailbreak et les pipelines de red-teaming automatisés. Développe des compétences pratiques pour découvrir les vulnérabilités des modèles avant le déploiement.
Leçon 4 • Rapport d'évaluation de la sécurité
Structure les résultats de sécurité en fiches de modèle, registres de risques et résumés exécutifs. Traduit les résultats techniques de sécurité en conseils exploitables pour les décideurs.
Leçon 5 • Taxonomie des préjudices des LLM
Classe les sorties préjudiciables en catégories de toxicité, désinformation, fuite de confidentialité et manipulation. Fournit la taxonomie des préjudices appliquée dans toutes les sections suivantes sur la sécurité.
Chapitre 8MasquerCacher les détailsVoir les détailsStratégie d'évaluation de bout en bout
Stratégie d'évaluation de bout en bout
Leçon 1 • Évaluation et surveillance continues
Conçoit des boucles d'évaluation continues pour détecter la dérive du modèle, le changement de distribution des données et les modes d'échec émergents. Étend l'évaluation ponctuelle à une pratique opérationnelle durable.
Leçon 2 • Communication des résultats d'évaluation
Enseigne la visualisation, le cadrage narratif et les rapports spécifiques aux parties prenantes pour les résultats d'évaluation. Garantit que les résultats orientent les décisions plutôt que de rester dans des rapports techniques.
Leçon 3 • Infrastructure et outils d'évaluation
Couvre le suivi des expériences, le stockage des résultats et les outils de reproductibilité pour les pipelines d'évaluation. Garantit que les flux de travail d'évaluation sont évolutifs et audités.
Leçon 4 • Sélection et combinaison de méthodes
Fournit un cadre de décision pour choisir entre les méthodes automatisées, humaines et LLM comme juge. Synthétise tous les chapitres précédents en un processus unifié de sélection de méthode.
Leçon 5 • Définition des objectifs d'évaluation
Guide les apprenants pour traduire les exigences commerciales en objectifs d'évaluation mesurables et en critères de succès. Ancre l'ensemble de la stratégie d'évaluation aux besoins des parties prenantes.
Votre certificat valide de réussite
Ce cours est fait pour vous :
Ingénieur ML : souhaite dépasser l'intuition lors de la comparaison de versions de modèles.
Chercheur en NLP : a besoin de méthodes structurées pour valider les résultats expérimentaux de manière crédible.
Responsable produit IA : doit traduire les données de performance des modèles en décisions de mise en production en toute confiance.
Data Scientist : prêt à ajouter des flux de travail d'évaluation formels à ses compétences existantes en modélisation.
Consultant IA : conseille des clients qui exigent une preuve documentée des améliorations de qualité de leurs modèles.
Ingénieur logiciel : effectue une transition vers le développement de LLM et acquiert les connaissances fondamentales en évaluation.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en France ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















