Choisissez votre langue
Formation Évaluation et Optimisation LLM
Plus de 2 millions d'étudiants dans le monde

Formation Évaluation et Optimisation LLM

Maîtrisez chaque couche de l'évaluation des LLM — des métriques automatisées et de l'annotation humaine au fine-tuning et à la surveillance en production. Ce cours offre aux praticiens de l'IA un framework rigoureux et complet pour diagnostiquer les échecs, optimiser les performances et maintenir la fiabilité des modèles à grande échelle. Arrêtez de deviner pourquoi votre modèle sous-performe et commencez à le corriger avec des preuves.

Dedika pour les entreprises

Ce que vous allez apprendre:

  • Concevez et validez des jeux de données de référence qui exposent des cas limites et des modes de défaillance adversariaux.

  • Appliquez des métriques lexicales, sémantiques et basées sur un modèle pour évaluer la qualité des sorties des LLM à grande échelle.

  • Menez des études d'évaluation humaine structurées avec des mesures de sécurité contre les biais et une analyse de la fiabilité inter-évaluateurs.

  • Diagnostiquez les hallucinations, les échecs de suivi des instructions et les erreurs de raisonnement à l'aide de frameworks d'analyse des causes racines.

  • Optimisez le comportement du modèle grâce à l'ingénierie des invites, au fine-tuning efficace en termes de paramètres et aux techniques RLHF.

  • Construisez des pipelines d'observabilité en production avec détection de dérive, portes de qualité et workflows d'amélioration continue.

Comment vous étudiez de façon pratique Formation Évaluation et Optimisation LLM

Comment vous pratiquez Formation Évaluation et Optimisation LLM

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'évaluation des LLM

  • Leçon 1 • Objectifs d'évaluation et parties prenantes

    Établit la correspondance entre les objectifs d'évaluation et les besoins des parties prenantes métier, de recherche et de conformité. Clarifie la manière dont l'alignement des objectifs façonne la sélection des métriques et le reporting.

  • Leçon 2 • Taxonomie des méthodes d'évaluation

    Passe en revue les approches d'évaluation humaine, automatisée et hybride à un niveau élevé. Prépare le terrain pour des analyses approfondies dans les chapitres suivants.

  • Leçon 3 • Comment les LLM génèrent du texte

    Couvre la prédiction de jetons, les stratégies d'échantillonnage et les effets de la température sur la variabilité des sorties. Ancre tout le travail d'évaluation ultérieur dans les mécaniques du comportement du modèle.

  • Leçon 4 • Dimensions de qualité fondamentales

    Définit la fluidité, la cohérence, l'exactitude factuelle, la pertinence et la sécurité comme axes d'évaluation principaux. Fournit un vocabulaire partagé utilisé tout au long du cours.

Chapitre 2Voir les détails

Conception de jeux de données d'évaluation robustes

  • Leçon 1 • Workflows d'annotation et d'étiquetage

    Couvre les consignes d'annotation, l'accord inter-annotateurs et les processus de contrôle qualité. Produit des données de vérité terrain annotées requises pour les métriques d'évaluation supervisées.

  • Leçon 2 • Gestion des versions et gouvernance des jeux de données

    Établit des pratiques pour versionner, documenter et auditer les jeux de données d'évaluation dans le temps. Assure la reproductibilité et la traçabilité à travers les itérations de modèle.

  • Leçon 3 • Tests adverses et de résistance

    Introduit l'injection de prompts, les tentatives de jailbreak et les entrées de condition limite comme tests de résistance. Prépare les étudiants à exposer systématiquement les vulnérabilités des modèles.

  • Leçon 4 • Diversité des entrées et cas limites

    Techniques de génération de prompts diversifiés, incluant les domaines rares, les requêtes ambiguës et les entrées multilingues. Garantit que l'évaluation révèle les modes de défaillance réels.

  • Leçon 5 • Principes de conception de benchmarks

    Couvre la validité, la fiabilité et la représentativité en tant que propriétés fondamentales des jeux de données. Relie la qualité des jeux de données directement à des résultats d'évaluation fiables.

Chapitre 3Voir les détails

Métriques d'évaluation automatisées

  • Leçon 1 • Métriques sans référence et basées sur un modèle

    Explore la perplexité, les scores de cohérence et les approches LLM-en-tant-que-juge qui ne nécessitent pas de référence en or. Met en évidence les cas où l'évaluation sans référence est nécessaire.

  • Leçon 2 • Agrégation et reporting des métriques

    Enseigne la notation composite, les intervalles de confiance et les tests de signification statistique pour les résultats des métriques. Permet un reporting de performance défendable et reproductible.

  • Leçon 3 • Métriques de chevauchement lexical

    Couvre BLEU, ROUGE, METEOR et CIDEr comme mesures de similarité basées sur les n-grammes. Explique leurs hypothèses, forces et limitations bien documentées.

  • Leçon 4 • Métriques automatisées spécifiques aux tâches

    Couvre l'exactitude, le F1, la correspondance exacte et les taux de réussite d'exécution de code pour les tâches de classification, de QA et de codage. Aligne le choix de la métrique sur la structure de la tâche.

  • Leçon 5 • Métriques de similarité sémantique

    Introduit les métriques basées sur les plongements telles que BERTScore et la similarité textuelle sémantique. Montre comment elles capturent le sens au-delà du chevauchement lexical de surface.

Chapitre 4Voir les détails

Méthodes d'évaluation humaine

  • Leçon 1 • Recrutement et formation des annotateurs

    Aborde les critères de qualification des annotateurs, l'intégration et les exercices de calibrage. Réduit la variance introduite par l'arrière-plan des annotateurs et les différences d'interprétation.

  • Leçon 2 • Analyse de la fiabilité inter-évaluateurs

    Applique le kappa de Cohen, l'alpha de Krippendorff et le kappa de Fleiss pour mesurer l'accord entre annotateurs. Guide les décisions sur le moment d'arbitrer ou d'écarter les désaccords.

  • Leçon 3 • Conception d'études d'évaluation humaine

    Couvre les échelles de notation, la comparaison par paires et les paradigmes de classement pour recueillir des jugements humains. Relie les choix de conception de l'étude à la puissance statistique et à la fiabilité.

  • Leçon 4 • Passage à l'échelle de l'évaluation humaine efficacement

    Couvre l'échantillonnage par apprentissage actif, l'annotation stratifiée et les pipelines hybrides humain-automatisés pour réduire les coûts. Maintient la qualité tout en passant à l'échelle pour de grands ensembles de sorties.

  • Leçon 5 • Contrôle des biais et des facteurs de confusion

    Identifie le biais de position, le biais de verbosité et les effets d'ancrage dans l'évaluation humaine. Applique des techniques de randomisation et d'insu pour minimiser la distorsion systématique.

Chapitre 5Voir les détails

Diagnostic des modes de défaillance des LLM

  • Leçon 1 • Défaillances liées aux biais et à l'équité

    Couvre les biais démographiques, représentationnels et de stéréotypage détectables dans les sorties des modèles. Relie le diagnostic des biais aux préjudices en aval et à la planification des mesures d'atténuation.

  • Leçon 2 • Défaillances dans le suivi des instructions

    Analyse les cas où les modèles ignorent les contraintes, les exigences de format ou les spécifications de la tâche. Développe des suites de tests ciblées pour mesurer l'adhérence aux instructions.

  • Leçon 3 • Attribution de la cause profonde

    Établit la correspondance entre les défaillances observées et les causes liées aux données d'entraînement, à la conception des prompts ou aux paramètres de décodage. Permet des corrections ciblées plutôt que des correctifs par essais-erreurs.

  • Leçon 4 • Erreurs de raisonnement et de logique

    Identifie les défaillances de raisonnement en plusieurs étapes, les erreurs arithmétiques et les incohérences logiques dans les sorties des LLM. Applique le sondage par chaîne de pensée pour révéler les ruptures de raisonnement.

  • Leçon 5 • Types d'hallucination et détection

    Distingue l'hallucination intrinsèque de l'hallucination extrinsèque et couvre les heuristiques de détection et les vérificateurs automatisés. Construit le vocabulaire diagnostique pour l'analyse des défaillances factuelles.

Chapitre 6Voir les détails

Ingénierie des prompts pour la performance

  • Leçon 1 • Sensibilité et robustesse des prompts

    Mesure comment de petites variations de prompt provoquent de grands changements de sortie et applique des tests de robustesse. Produit des prompts stables qui fonctionnent de manière cohérente à travers les paraphrases.

  • Leçon 2 • Expérimentation systématique des prompts

    Applique les tests A/B, les plans factoriels et la recherche automatisée de prompts pour optimiser les variables de prompt. Relie la rigueur expérimentale à des améliorations de performance reproductibles.

  • Leçon 3 • Structure et anatomie du prompt

    Décompose les instructions système, le contexte, les exemples et les directives de format de sortie en tant que composants du prompt. Établit un modèle structuré pour une construction cohérente des prompts.

  • Leçon 4 • Prompting few-shot et chaîne de pensée

    Couvre la sélection d'exemples, les effets d'ordre et l'élicitation du raisonnement via des schémas de chaîne de pensée. Démontre des gains d'exactitude mesurables sur des tâches complexes.

  • Leçon 5 • Modèles de prompts et réutilisabilité

    Conçoit des modèles de prompts modulaires et paramétrés pour une réutilisation entre tâches et équipes. Réduit la dérive des prompts et assure des bases de référence d'évaluation cohérentes.

Chapitre 7Voir les détails

Optimisation par fine-tuning et alignement

  • Leçon 1 • Évaluation post-optimisation

    Applique des comparaisons d'évaluation pré/post, des tests de régression et des vérifications de préservation des capacités après optimisation. Garantit que les améliorations dans les domaines ciblés ne dégradent pas d'autres capacités.

  • Leçon 2 • Apprentissage par renforcement à partir du feedback humain

    Explique l'entraînement du modèle de récompense, l'optimisation PPO et la collecte de données de préférence pour les pipelines RLHF. Aligne le comportement du modèle avec les jugements humains de qualité à grande échelle.

  • Leçon 3 • Méthodes de fine-tuning efficaces en paramètres

    Introduit LoRA, le préfixe tuning et les couches d'adaptation comme alternatives peu coûteuses au fine-tuning complet. Permet l'optimisation sous contraintes de calcul et de données.

  • Leçon 4 • Optimisation directe des préférences

    Couvre la DPO comme une alternative plus simple au RLHF qui utilise des paires de préférence sans modèle de récompense séparé. Compare la DPO et le RLHF sur la stabilité, le coût et la qualité des sorties.

  • Leçon 5 • Fondamentaux du fine-tuning

    Couvre les besoins en données pour le fine-tuning supervisé, la sélection du taux d'apprentissage et les risques de surapprentissage. Relie directement les décisions de fine-tuning aux faiblesses identifiées par l'évaluation.

Chapitre 8Voir les détails

Surveillance en production et amélioration continue

  • Leçon 1 • Détection de dérive des données et du concept

    Applique des tests statistiques et une surveillance de l'espace de plongement pour détecter la dérive de la distribution d'entrée et de la qualité des sorties. Déclenche un réentraînement ou des mises à jour de prompts en temps utile avant que la dégradation ne s'aggrave.

  • Leçon 2 • Passerelles qualité automatisées et alertes

    Implémente des passerelles qualité basées sur des seuils et la détection d'anomalies qui bloquent ou signalent les sorties dégradées. Réduit le temps moyen de détection des incidents de qualité en production.

  • Leçon 3 • Workflows d'amélioration continue

    Établit des cycles de réentraînement pilotés par l'évaluation, des cadences de mise à jour des prompts et une gouvernance du versionnement des modèles. Opérationnalise une boucle durable allant du signal de surveillance à l'amélioration déployée.

  • Leçon 4 • Collecte et analyse des retours utilisateurs

    Conçoit des mécanismes de feedback par pouce levé/baissé, notation explicite et comportement implicite. Convertit les signaux utilisateurs en données d'évaluation exploitables pour l'amélioration continue.

  • Leçon 5 • Architecture d'observabilité en production

    Couvre l'infrastructure de journalisation, de traçage et de collecte de métriques pour les systèmes LLM déployés. Établit la fondation d'observabilité requise pour toutes les activités de surveillance.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Ingénieur ML : souhaite des méthodes structurées pour évaluer le comportement d'un modèle déployé.

  • Data Scientist : doit dépasser l'intuition pour comparer les sorties des modèles.

  • Manager IA Produit : doit traduire la qualité du modèle en décisions opérationnelles.

  • Chercheur en TALN : cherche des protocoles d'évaluation reproductibles pour des comparaisons expérimentales.

  • Ingénieur logiciel : construit des fonctionnalités basées sur de grands modèles de langage et a besoin d'une assurance de fiabilité.

  • Consultant IA : conseille ses clients sur des stratégies responsables et mesurables de déploiement de modèles.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail des cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF