
Formation en évaluation et optimisation des LLM
Maîtrisez chaque couche de l'évaluation des LLM — des métriques automatisées et de l'annotation humaine au fine-tuning et à la surveillance en production. Ce cours offre aux praticiens de l'IA un framework rigoureux et de bout en bout pour diagnostiquer les défaillances, optimiser les performances et maintenir la fiabilité des modèles à grande échelle. Arrêtez de deviner pourquoi votre modèle sous-performe et commencez à le corriger avec des preuves.
Ce que vous allez apprendre:
Concevez et validez des ensembles de données de référence qui exposent les cas limites et les modes de défaillance adverses.
Appliquez des métriques lexicales, sémantiques et basées sur des modèles pour évaluer la qualité des résultats des LLM à grande échelle.
Menez des études d'évaluation humaine structurées avec des contrôles de biais et une analyse de la fiabilité inter-évaluateurs.
Diagnostiquez les hallucinations, les échecs de suivi d'instructions et les erreurs de raisonnement à l'aide de frameworks d'analyse des causes profondes.
Optimisez le comportement du modèle grâce à l'ingénierie des prompts, au fine-tuning paramétrique efficace et aux techniques RLHF.
Construisez des pipelines d'observabilité de production avec détection de dérive, passerelles de qualité et workflows d'amélioration continue.
Comment vous étudiez de façon pratique Formation en évaluation et optimisation des LLM
Comment vous pratiquez Formation en évaluation et optimisation des LLM
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'Évaluation des LLM
Fondements de l'Évaluation des LLM
Leçon 1 • Objectifs de l'Évaluation et Parties Prenantes
Établit une correspondance entre les objectifs d'évaluation et les besoins des parties prenantes métier, de recherche et de conformité. Clarifie comment l'alignement des objectifs façonne la sélection des métriques et le reporting.
Leçon 2 • Taxonomie des Méthodes d'Évaluation
Passe en revue les approches d'évaluation humaine, automatisée et hybride à un haut niveau. Prépare le terrain pour des approfondissements dans les chapitres suivants.
Leçon 3 • Comment les LLM Génèrent du Texte
Couvre la prédiction de jetons, les stratégies d'échantillonnage et les effets de la température sur la variabilité des sorties. Ancre tout le travail d'évaluation ultérieur dans la mécanique du comportement du modèle.
Leçon 4 • Dimensions Fondamentales de la Qualité
Définit la fluence, la cohérence, l'exactitude factuelle, la pertinence et la sécurité comme axes principaux d'évaluation. Fournit un vocabulaire commun utilisé tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsConception de Jeux de Données d'Évaluation Robustes
Conception de Jeux de Données d'Évaluation Robustes
Leçon 1 • Workflows d'Annotation et d'Étiquetage
Couvre les directives d'annotation, l'accord inter-annotateurs et les processus de contrôle qualité. Produit des données de vérité terrain étiquetées requises pour les métriques d'évaluation supervisées.
Leçon 2 • Gestion de Versions et Gouvernance des Jeux de Données
Établit des pratiques pour la gestion de versions, la documentation et l'audit des jeux de données d'évaluation dans le temps. Assure la reproductibilité et la traçabilité à travers les itérations du modèle.
Leçon 3 • Tests Adverses et de Stress
Introduit l'injection d'invites, les tentatives de jailbreak et les entrées de conditions limites comme tests de stress. Prépare les étudiants à exposer systématiquement les vulnérabilités du modèle.
Leçon 4 • Diversité des Entrées et Cas Limites
Techniques pour générer des invites diverses, y compris des domaines rares, des requêtes ambiguës et des entrées multilingues. Assure que l'évaluation fait surface des modes de défaillance du monde réel.
Leçon 5 • Principes de Conception de Benchmark
Couvre la validité, la fiabilité et la représentativité comme propriétés fondamentales du jeu de données. Connecte directement la qualité du jeu de données à des résultats d'évaluation dignes de confiance.
Chapitre 3MasquerCacher les détailsVoir les détailsMétriques d'Évaluation Automatisées
Métriques d'Évaluation Automatisées
Leçon 1 • Métriques Sans Référence et Basées sur un Modèle
Explore la perplexité, les scores de cohérence et les approches LLM-en-tant-que-juge qui ne nécessitent aucune référence en or. Met en évidence quand l'évaluation sans référence est nécessaire.
Leçon 2 • Agrégation et Reporting des Métriques
Enseigne la notation composite, les intervalles de confiance et les tests de signification statistique pour les résultats des métriques. Permet un reporting de performance défendable et reproductible.
Leçon 3 • Métriques de Chevauchement Lexical
Couvre BLEU, ROUGE, METEOR et CIDEr comme mesures de similarité basées sur les n-grammes. Explique leurs hypothèses, forces et limitations bien documentées.
Leçon 4 • Métriques Automatisées Spécifiques aux Tâches
Couvre la précision, le F1, la correspondance exacte et les taux de réussite d'exécution de code pour les tâches de classification, de QA et de codage. Aligne le choix de la métrique sur la structure de la tâche.
Leçon 5 • Métriques de Similarité Sémantique
Introduit les métriques basées sur les plongements telles que BERTScore et la similarité textuelle sémantique. Montre comment elles capturent le sens au-delà du chevauchement de mots de surface.
Chapitre 4MasquerCacher les détailsVoir les détailsMéthodes d'Évaluation Humaine
Méthodes d'Évaluation Humaine
Leçon 1 • Recrutement et Formation des Annotateurs
Aborde les critères de qualification des annotateurs, l'intégration et les exercices de calibrage. Réduit la variance introduite par les différences de parcours et d'interprétation des annotateurs.
Leçon 2 • Analyse de la Fiabilité Inter-Annotateurs
Applique le kappa de Cohen, l'alpha de Krippendorff et le kappa de Fleiss pour mesurer l'accord entre annotateurs. Guide les décisions sur le moment d'arbitrer ou d'écarter les désaccords.
Leçon 3 • Conception d'Étude d'Évaluation Humaine
Couvre les échelles de notation, la comparaison par paires et les paradigmes de classement pour collecter les jugements humains. Relie les choix de conception de l'étude à la puissance statistique et à la fiabilité.
Leçon 4 • Passage à l'échelle de l'évaluation humaine de manière efficace
Couvre l'échantillonnage par apprentissage actif, l'annotation stratifiée et les pipelines hybrides humain-automatisés pour réduire les coûts. Maintient la qualité tout en passant à l'échelle sur de grands ensembles de sorties.
Leçon 5 • Contrôle des biais et des facteurs de confusion
Identifie le biais de position, le biais de verbosité et les effets d'ancrage dans l'évaluation humaine. Applique des techniques de randomisation et de mise en aveugle pour minimiser la distorsion systématique.
Chapitre 5MasquerCacher les détailsVoir les détailsDiagnostic des modes de défaillance des LLM
Diagnostic des modes de défaillance des LLM
Leçon 1 • Défaillances liées aux biais et à l'équité
Couvre les biais démographiques, représentationnels et de stéréotypage détectables dans les sorties du modèle. Relie le diagnostic des biais aux préjudices en aval et à la planification de l'atténuation.
Leçon 2 • Défaillances de suivi d'instructions
Analyse les cas où les modèles ignorent les contraintes, les exigences de format ou les spécifications de la tâche. Développe des suites de tests ciblées pour mesurer l'adhésion aux instructions.
Leçon 3 • Attribution de la cause racine
Mappe les défaillances observées aux données d'entraînement, à la conception de l'invite ou aux causes liées aux paramètres de décodage. Permet une remédiation ciblée plutôt que des correctifs par essais et erreurs.
Leçon 4 • Erreurs de raisonnement et de logique
Identifie les défaillances de raisonnement en plusieurs étapes, les erreurs arithmétiques et les incohérences logiques dans les sorties des LLM. Applique le sondage par chaîne de pensée pour faire surface des ruptures de raisonnement.
Leçon 5 • Types d'hallucination et détection
Distingue l'hallucination intrinsèque de l'extrinsèque et couvre les heuristiques de détection et les vérificateurs automatisés. Construit le vocabulaire de diagnostic pour l'analyse des défaillances factuelles.
Chapitre 6MasquerCacher les détailsVoir les détailsIngénierie d'invite pour la performance
Ingénierie d'invite pour la performance
Leçon 1 • Sensibilité et robustesse des invites
Mesure comment de petites variations d'invite provoquent de grands changements de sortie et applique des tests de robustesse. Produit des invites stables qui fonctionnent de manière cohérente à travers les paraphrases.
Leçon 2 • Expérimentation systématique d'invites
Applique les tests A/B, la conception factorielle et la recherche automatisée d'invites pour optimiser les variables d'invite. Relie la rigueur de l'expérimentation à des améliorations de performance reproductibles.
Leçon 3 • Structure et anatomie de l'invite
Décompose les instructions système, le contexte, les exemples et les directives de format de sortie comme composants de l'invite. Établit un modèle structuré pour une construction cohérente d'invite.
Leçon 4 • Invites few-shot et par chaîne de pensée
Couvre la sélection d'exemples, les effets d'ordre et la sollicitation du raisonnement à travers des schémas de chaîne de pensée. Démontre des gains de précision mesurables sur des tâches complexes.
Leçon 5 • Modèles d'invite et réutilisabilité
Conçoit des modèles d'invite modulaires et paramétrés pour une réutilisation à travers les tâches et les équipes. Réduit la dérive des invites et assure des bases de référence d'évaluation cohérentes.
Chapitre 7MasquerCacher les détailsVoir les détailsOptimisation par fine-tuning et alignment
Optimisation par fine-tuning et alignment
Leçon 1 • Évaluation post-optimisation
Applique des comparaisons d'évaluation pré/post, des tests de régression et des vérifications de préservation des capacités après optimisation. Garantit que les améliorations dans les domaines ciblés ne dégradent pas les autres capacités.
Leçon 2 • Apprentissage par renforcement à partir du retour humain
Explique l'entraînement du modèle de récompense, l'optimisation PPO et la collecte de données de préférence pour les pipelines RLHF. Aligne le comportement du modèle avec les jugements humains de qualité à grande échelle.
Leçon 3 • Méthodes de fine-tuning efficaces en paramètres
Introduit LoRA, le réglage de préfixe et les couches d'adaptateur comme alternatives peu coûteuses au fine-tuning complet. Permet l'optimisation sous contraintes de calcul et de données.
Leçon 4 • Optimisation directe des préférences
Couvre le DPO comme alternative plus simple au RLHF qui utilise des paires de préférence sans modèle de récompense séparé. Compare le DPO et le RLHF sur la stabilité, le coût et la qualité de sortie.
Leçon 5 • Fondamentaux du fine-tuning
Couvre les exigences en données du fine-tuning supervisé, la sélection du taux d'apprentissage et les risques de surapprentissage. Relie les décisions de fine-tuning directement aux faiblesses identifiées par l'évaluation.
Chapitre 8MasquerCacher les détailsVoir les détailsSurveillance de la Production et Amélioration Continue
Surveillance de la Production et Amélioration Continue
Leçon 1 • Détection de la Dérive des Données et du Concept
Applique des tests statistiques et une surveillance de l'espace de plongement pour détecter la dérive de la distribution d'entrée et de la qualité de sortie. Déclenche un réentraînement ou des mises à jour d'invite en temps opportun avant que la dégradation ne se cumule.
Leçon 2 • Passerelles de Qualité Automatisées et Alertes
Implémente des passerelles de qualité basées sur des seuils et la détection d'anomalies qui bloquent ou signalent les sorties dégradées. Réduit le temps moyen de détection des incidents de qualité en production.
Leçon 3 • Workflows d'Amélioration Continue
Établit des cycles de réentraînement guidés par l'évaluation, des cadences de mise à jour d'invite et une gouvernance de la gestion de versions des modèles. Opérationnalise une boucle durable allant du signal de surveillance à l'amélioration déployée.
Leçon 4 • Collecte et Analyse des Retours Utilisateurs
Conçoit des mécanismes de retour pouce vers le haut/pouce vers le bas, de notation explicite et de retour comportemental implicite. Convertit les signaux utilisateur en données d'évaluation exploitables pour l'amélioration continue.
Leçon 5 • Architecture d'Observabilité en Production
Couvre l'infrastructure de journalisation, de traçage et de collecte de métriques pour les systèmes LLM déployés. Établit la base d'observabilité requise pour toutes les activités de surveillance.
Votre certificat valide de réussite
Ce cours est pour vous :
Ingénieur ML : souhaite des méthodes structurées pour évaluer le comportement du modèle déployé.
Data Scientist : doit dépasser l'intuition lors de la comparaison des sorties du modèle.
Chef de produit IA : doit traduire la qualité du modèle en décisions exploitables pour l'entreprise.
Chercheur en TALN : cherche des protocoles d'évaluation reproductibles pour des comparaisons expérimentales.
Ingénieur logiciel : développe des fonctionnalités basées sur des LLM et a besoin d'une assurance de fiabilité.
Consultant en IA : conseille les clients sur des stratégies de déploiement de modèles responsables et mesurables.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Cameroun ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















