Choisissez votre langue
Formation en évaluation et optimisation des LLM
Plus de 2 millions d'apprenants dans le monde

Formation en évaluation et optimisation des LLM

Maîtrisez chaque couche de l'évaluation des LLM — des métriques automatisées et de l'annotation humaine au fine-tuning et à la surveillance en production. Ce cours offre aux praticiens de l'IA un framework rigoureux et de bout en bout pour diagnostiquer les défaillances, optimiser les performances et maintenir la fiabilité des modèles à grande échelle. Arrêtez de deviner pourquoi votre modèle sous-performe et commencez à le corriger avec des preuves.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Concevez et validez des ensembles de données de référence qui exposent les cas limites et les modes de défaillance adverses.

  • Appliquez des métriques lexicales, sémantiques et basées sur des modèles pour évaluer la qualité des résultats des LLM à grande échelle.

  • Menez des études d'évaluation humaine structurées avec des contrôles de biais et une analyse de la fiabilité inter-évaluateurs.

  • Diagnostiquez les hallucinations, les échecs de suivi d'instructions et les erreurs de raisonnement à l'aide de frameworks d'analyse des causes profondes.

  • Optimisez le comportement du modèle grâce à l'ingénierie des prompts, au fine-tuning paramétrique efficace et aux techniques RLHF.

  • Construisez des pipelines d'observabilité de production avec détection de dérive, passerelles de qualité et workflows d'amélioration continue.

Comment vous étudiez de façon pratique Formation en évaluation et optimisation des LLM

Comment vous pratiquez Formation en évaluation et optimisation des LLM

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'Évaluation des LLM

  • Leçon 1 • Objectifs de l'Évaluation et Parties Prenantes

    Établit une correspondance entre les objectifs d'évaluation et les besoins des parties prenantes métier, de recherche et de conformité. Clarifie comment l'alignement des objectifs façonne la sélection des métriques et le reporting.

  • Leçon 2 • Taxonomie des Méthodes d'Évaluation

    Passe en revue les approches d'évaluation humaine, automatisée et hybride à un haut niveau. Prépare le terrain pour des approfondissements dans les chapitres suivants.

  • Leçon 3 • Comment les LLM Génèrent du Texte

    Couvre la prédiction de jetons, les stratégies d'échantillonnage et les effets de la température sur la variabilité des sorties. Ancre tout le travail d'évaluation ultérieur dans la mécanique du comportement du modèle.

  • Leçon 4 • Dimensions Fondamentales de la Qualité

    Définit la fluence, la cohérence, l'exactitude factuelle, la pertinence et la sécurité comme axes principaux d'évaluation. Fournit un vocabulaire commun utilisé tout au long du cours.

Chapitre 2Voir les détails

Conception de Jeux de Données d'Évaluation Robustes

  • Leçon 1 • Workflows d'Annotation et d'Étiquetage

    Couvre les directives d'annotation, l'accord inter-annotateurs et les processus de contrôle qualité. Produit des données de vérité terrain étiquetées requises pour les métriques d'évaluation supervisées.

  • Leçon 2 • Gestion de Versions et Gouvernance des Jeux de Données

    Établit des pratiques pour la gestion de versions, la documentation et l'audit des jeux de données d'évaluation dans le temps. Assure la reproductibilité et la traçabilité à travers les itérations du modèle.

  • Leçon 3 • Tests Adverses et de Stress

    Introduit l'injection d'invites, les tentatives de jailbreak et les entrées de conditions limites comme tests de stress. Prépare les étudiants à exposer systématiquement les vulnérabilités du modèle.

  • Leçon 4 • Diversité des Entrées et Cas Limites

    Techniques pour générer des invites diverses, y compris des domaines rares, des requêtes ambiguës et des entrées multilingues. Assure que l'évaluation fait surface des modes de défaillance du monde réel.

  • Leçon 5 • Principes de Conception de Benchmark

    Couvre la validité, la fiabilité et la représentativité comme propriétés fondamentales du jeu de données. Connecte directement la qualité du jeu de données à des résultats d'évaluation dignes de confiance.

Chapitre 3Voir les détails

Métriques d'Évaluation Automatisées

  • Leçon 1 • Métriques Sans Référence et Basées sur un Modèle

    Explore la perplexité, les scores de cohérence et les approches LLM-en-tant-que-juge qui ne nécessitent aucune référence en or. Met en évidence quand l'évaluation sans référence est nécessaire.

  • Leçon 2 • Agrégation et Reporting des Métriques

    Enseigne la notation composite, les intervalles de confiance et les tests de signification statistique pour les résultats des métriques. Permet un reporting de performance défendable et reproductible.

  • Leçon 3 • Métriques de Chevauchement Lexical

    Couvre BLEU, ROUGE, METEOR et CIDEr comme mesures de similarité basées sur les n-grammes. Explique leurs hypothèses, forces et limitations bien documentées.

  • Leçon 4 • Métriques Automatisées Spécifiques aux Tâches

    Couvre la précision, le F1, la correspondance exacte et les taux de réussite d'exécution de code pour les tâches de classification, de QA et de codage. Aligne le choix de la métrique sur la structure de la tâche.

  • Leçon 5 • Métriques de Similarité Sémantique

    Introduit les métriques basées sur les plongements telles que BERTScore et la similarité textuelle sémantique. Montre comment elles capturent le sens au-delà du chevauchement de mots de surface.

Chapitre 4Voir les détails

Méthodes d'Évaluation Humaine

  • Leçon 1 • Recrutement et Formation des Annotateurs

    Aborde les critères de qualification des annotateurs, l'intégration et les exercices de calibrage. Réduit la variance introduite par les différences de parcours et d'interprétation des annotateurs.

  • Leçon 2 • Analyse de la Fiabilité Inter-Annotateurs

    Applique le kappa de Cohen, l'alpha de Krippendorff et le kappa de Fleiss pour mesurer l'accord entre annotateurs. Guide les décisions sur le moment d'arbitrer ou d'écarter les désaccords.

  • Leçon 3 • Conception d'Étude d'Évaluation Humaine

    Couvre les échelles de notation, la comparaison par paires et les paradigmes de classement pour collecter les jugements humains. Relie les choix de conception de l'étude à la puissance statistique et à la fiabilité.

  • Leçon 4 • Passage à l'échelle de l'évaluation humaine de manière efficace

    Couvre l'échantillonnage par apprentissage actif, l'annotation stratifiée et les pipelines hybrides humain-automatisés pour réduire les coûts. Maintient la qualité tout en passant à l'échelle sur de grands ensembles de sorties.

  • Leçon 5 • Contrôle des biais et des facteurs de confusion

    Identifie le biais de position, le biais de verbosité et les effets d'ancrage dans l'évaluation humaine. Applique des techniques de randomisation et de mise en aveugle pour minimiser la distorsion systématique.

Chapitre 5Voir les détails

Diagnostic des modes de défaillance des LLM

  • Leçon 1 • Défaillances liées aux biais et à l'équité

    Couvre les biais démographiques, représentationnels et de stéréotypage détectables dans les sorties du modèle. Relie le diagnostic des biais aux préjudices en aval et à la planification de l'atténuation.

  • Leçon 2 • Défaillances de suivi d'instructions

    Analyse les cas où les modèles ignorent les contraintes, les exigences de format ou les spécifications de la tâche. Développe des suites de tests ciblées pour mesurer l'adhésion aux instructions.

  • Leçon 3 • Attribution de la cause racine

    Mappe les défaillances observées aux données d'entraînement, à la conception de l'invite ou aux causes liées aux paramètres de décodage. Permet une remédiation ciblée plutôt que des correctifs par essais et erreurs.

  • Leçon 4 • Erreurs de raisonnement et de logique

    Identifie les défaillances de raisonnement en plusieurs étapes, les erreurs arithmétiques et les incohérences logiques dans les sorties des LLM. Applique le sondage par chaîne de pensée pour faire surface des ruptures de raisonnement.

  • Leçon 5 • Types d'hallucination et détection

    Distingue l'hallucination intrinsèque de l'extrinsèque et couvre les heuristiques de détection et les vérificateurs automatisés. Construit le vocabulaire de diagnostic pour l'analyse des défaillances factuelles.

Chapitre 6Voir les détails

Ingénierie d'invite pour la performance

  • Leçon 1 • Sensibilité et robustesse des invites

    Mesure comment de petites variations d'invite provoquent de grands changements de sortie et applique des tests de robustesse. Produit des invites stables qui fonctionnent de manière cohérente à travers les paraphrases.

  • Leçon 2 • Expérimentation systématique d'invites

    Applique les tests A/B, la conception factorielle et la recherche automatisée d'invites pour optimiser les variables d'invite. Relie la rigueur de l'expérimentation à des améliorations de performance reproductibles.

  • Leçon 3 • Structure et anatomie de l'invite

    Décompose les instructions système, le contexte, les exemples et les directives de format de sortie comme composants de l'invite. Établit un modèle structuré pour une construction cohérente d'invite.

  • Leçon 4 • Invites few-shot et par chaîne de pensée

    Couvre la sélection d'exemples, les effets d'ordre et la sollicitation du raisonnement à travers des schémas de chaîne de pensée. Démontre des gains de précision mesurables sur des tâches complexes.

  • Leçon 5 • Modèles d'invite et réutilisabilité

    Conçoit des modèles d'invite modulaires et paramétrés pour une réutilisation à travers les tâches et les équipes. Réduit la dérive des invites et assure des bases de référence d'évaluation cohérentes.

Chapitre 7Voir les détails

Optimisation par fine-tuning et alignment

  • Leçon 1 • Évaluation post-optimisation

    Applique des comparaisons d'évaluation pré/post, des tests de régression et des vérifications de préservation des capacités après optimisation. Garantit que les améliorations dans les domaines ciblés ne dégradent pas les autres capacités.

  • Leçon 2 • Apprentissage par renforcement à partir du retour humain

    Explique l'entraînement du modèle de récompense, l'optimisation PPO et la collecte de données de préférence pour les pipelines RLHF. Aligne le comportement du modèle avec les jugements humains de qualité à grande échelle.

  • Leçon 3 • Méthodes de fine-tuning efficaces en paramètres

    Introduit LoRA, le réglage de préfixe et les couches d'adaptateur comme alternatives peu coûteuses au fine-tuning complet. Permet l'optimisation sous contraintes de calcul et de données.

  • Leçon 4 • Optimisation directe des préférences

    Couvre le DPO comme alternative plus simple au RLHF qui utilise des paires de préférence sans modèle de récompense séparé. Compare le DPO et le RLHF sur la stabilité, le coût et la qualité de sortie.

  • Leçon 5 • Fondamentaux du fine-tuning

    Couvre les exigences en données du fine-tuning supervisé, la sélection du taux d'apprentissage et les risques de surapprentissage. Relie les décisions de fine-tuning directement aux faiblesses identifiées par l'évaluation.

Chapitre 8Voir les détails

Surveillance de la Production et Amélioration Continue

  • Leçon 1 • Détection de la Dérive des Données et du Concept

    Applique des tests statistiques et une surveillance de l'espace de plongement pour détecter la dérive de la distribution d'entrée et de la qualité de sortie. Déclenche un réentraînement ou des mises à jour d'invite en temps opportun avant que la dégradation ne se cumule.

  • Leçon 2 • Passerelles de Qualité Automatisées et Alertes

    Implémente des passerelles de qualité basées sur des seuils et la détection d'anomalies qui bloquent ou signalent les sorties dégradées. Réduit le temps moyen de détection des incidents de qualité en production.

  • Leçon 3 • Workflows d'Amélioration Continue

    Établit des cycles de réentraînement guidés par l'évaluation, des cadences de mise à jour d'invite et une gouvernance de la gestion de versions des modèles. Opérationnalise une boucle durable allant du signal de surveillance à l'amélioration déployée.

  • Leçon 4 • Collecte et Analyse des Retours Utilisateurs

    Conçoit des mécanismes de retour pouce vers le haut/pouce vers le bas, de notation explicite et de retour comportemental implicite. Convertit les signaux utilisateur en données d'évaluation exploitables pour l'amélioration continue.

  • Leçon 5 • Architecture d'Observabilité en Production

    Couvre l'infrastructure de journalisation, de traçage et de collecte de métriques pour les systèmes LLM déployés. Établit la base d'observabilité requise pour toutes les activités de surveillance.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieur ML : souhaite des méthodes structurées pour évaluer le comportement du modèle déployé.

  • Data Scientist : doit dépasser l'intuition lors de la comparaison des sorties du modèle.

  • Chef de produit IA : doit traduire la qualité du modèle en décisions exploitables pour l'entreprise.

  • Chercheur en TALN : cherche des protocoles d'évaluation reproductibles pour des comparaisons expérimentales.

  • Ingénieur logiciel : développe des fonctionnalités basées sur des LLM et a besoin d'une assurance de fiabilité.

  • Consultant en IA : conseille les clients sur des stratégies de déploiement de modèles responsables et mesurables.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Cameroun ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF