
Formation en évaluation des performances LLM
Maîtrisez chaque dimension de l'évaluation des LLM — de la conception de benchmarks et des métriques automatisées aux tests de sécurité et au profilage de l'efficacité. Ce cours offre aux praticiens de l'IA et aux équipes ML les frameworks rigoureux nécessaires pour mesurer ce que les modèles font réellement, et non seulement ce qu'ils prétendent faire. Arrêtez de deviner et commencez à prendre des décisions fondées sur les données pour chaque modèle que vous déployez.
Ce que vous allez apprendre:
Concevez des benchmarks et des jeux de données d'évaluation rigoureux qui résistent à la contamination et au surapprentissage.
Appliquez des métriques automatisées, une notation sémantique et des méthodes de LLM-comme-juge pour évaluer la qualité des sorties.
Mesurez la latence d'inférence, le débit, l'utilisation de la mémoire et le coût total de possession pour les déploiements de LLM.
Construisez des suites de tests de sécurité et d'équité couvrant la toxicité, les biais, la robustesse contradictoire et l'hallucination.
Construisez des pipelines d'évaluation évolutifs et reproductibles intégrés dans les workflows de développement CI/CD.
Communiquez clairement les résultats de l'évaluation aux parties prenantes de l'ingénierie, des produits et de la direction.
Comment vous étudiez de façon pratique Formation en évaluation des performances LLM
Comment vous pratiquez Formation en évaluation des performances LLM
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l’évaluation des LLM
Fondements de l’évaluation des LLM
Leçon 1 • L’état d’esprit d’évaluation
Introduit la distinction entre capacité, fiabilité et sécurité comme dimensions d’évaluation. Cadre l’évaluation comme un processus scientifique nécessitant des hypothèses et des contrôles.
Leçon 2 • Périmètre et contraintes de l’évaluation
Définit les limites d’un projet d’évaluation, y compris les contraintes budgétaires, temporelles et d’accès. Apprend aux étudiants à cadrer les évaluations de manière réaliste avant de sélectionner les méthodes.
Leçon 3 • Ce que sont les LLM et comment ils fonctionnent
Couvre l’architecture des transformeurs, la génération de jetons et les distributions de probabilités à un niveau accessible. Ancre tous les concepts d’évaluation ultérieurs dans la manière dont les modèles produisent réellement des sorties.
Leçon 4 • Types de tâches et de sorties des LLM
Catalogue les tâches de génération, classification, extraction et raisonnement ainsi que leurs types de sorties distincts. Relie le type de tâche à la stratégie d’évaluation appropriée utilisée dans les chapitres suivants.
Leçon 5 • Sources d’échec des LLM
Cartographie les modes d’échec courants — hallucination, refus, dérive et biais — à leurs causes profondes. Fournit un vocabulaire de diagnostic utilisé tout au long du cours.
Chapitre 2MasquerCacher les détailsVoir les détailsConception de référentiels et construction d’ensembles de données
Conception de référentiels et construction d’ensembles de données
Leçon 1 • Maintenance des référentiels dans le temps
Aborde la dégradation des référentiels, la saturation des modèles et la nécessité d’un rafraîchissement continu des ensembles de données. Prépare les étudiants à maintenir la qualité de l’évaluation à mesure que les modèles s’améliorent.
Leçon 2 • Prévention de la contamination des données
Explique comment la fuite de données d’entraînement invalide les référentiels et comment la détecter et la prévenir. Aborde directement une menace critique pour la validité de l’évaluation.
Leçon 3 • Principes de bonne conception des référentiels
Couvre la validité, la fiabilité et la couverture comme les trois piliers de la qualité d’un référentiel. Relie les principes de conception aux modes d’échec identifiés au chapitre 1.
Leçon 4 • Workflows d’annotation et d’étiquetage
Couvre les pipelines d’annotation humaine, l’accord inter-annotateurs et le contrôle qualité des ensembles de données étiquetés. Produit des étiquettes de référence fiables nécessaires pour les métriques automatisées.
Leçon 5 • Sourcing et curation des données d’évaluation
Enseigne les méthodes de collecte, filtrage et équilibrage des exemples d’évaluation à partir de sources réelles et synthétiques. Met l’accent sur la qualité des données plutôt que sur la quantité.
Chapitre 3MasquerCacher les détailsVoir les détailsMétriques automatisées pour la qualité textuelle
Métriques automatisées pour la qualité textuelle
Leçon 1 • Sélection et combinaison de métriques
Fournit un cadre décisionnel pour choisir et combiner les métriques en scores d’évaluation composites. Empêche une dépendance excessive à une seule métrique.
Leçon 2 • Évaluation par LLM en tant que juge
Enseigne l’utilisation d’un LLM séparé pour noter les sorties via des invites structurées, y compris les risques de biais et la calibration. Représente une alternative évolutive à l’évaluation humaine.
Leçon 3 • Métriques automatisées spécifiques aux tâches
Couvre la précision, le F1, la correspondance exacte et la perplexité comme métriques appropriées pour les tâches de classification, de questions-réponses et de génération. Relie le choix des métriques au type de tâche du chapitre 1.
Leçon 4 • Métriques lexicales basées sur des références
Couvre BLEU, ROUGE, METEOR et ChrF comme métriques de chevauchement et leurs fondements mathématiques. Établit une littératie de base en matière de métriques avant d’introduire des approches plus complexes.
Leçon 5 • Métriques de similarité sémantique
Introduit les métriques basées sur les plongements telles que BERTScore et les mesures de similarité textuelle sémantique. Comble l’écart entre le chevauchement de surface et l’évaluation au niveau du sens.
Chapitre 4MasquerCacher les détailsVoir les détailsMéthodes d’évaluation humaine
Méthodes d’évaluation humaine
Leçon 1 • Conception de l’étude d’évaluation
Couvre les plans expérimentaux incluant la comparaison par paires, la notation Likert et les protocoles de classement. Enseigne comment les choix de conception affectent la puissance statistique et le biais.
Leçon 2 • Analyse et rapport des jugements humains
Couvre l’analyse statistique des données de notation, la fiabilité inter-évaluateurs et la communication des résultats. Relie les résultats de l’évaluation humaine aux décisions exploitables d’amélioration du modèle.
Leçon 3 • Quand l’évaluation humaine est nécessaire
Identifie les tâches où les métriques automatisées échouent et où le jugement humain est irremplaçable. Prépare le terrain pour la conception d’études humaines rentables.
Leçon 4 • Biais et facteurs de confusion dans les études humaines
Identifie les effets d’ancrage, d’ordre et de présentation qui faussent les notations humaines. Enseigne des stratégies d’atténuation pour améliorer la validité des études.
Leçon 5 • Recrutement et gestion des évaluateurs
Aborde le sourcing d’évaluateurs experts et crowdsourcés, leur formation et la gestion de la qualité. Impacte directement la fiabilité des jugements collectés.
Chapitre 5MasquerCacher les détailsVoir les détailsMesure de l’efficacité des LLM
Mesure de l’efficacité des LLM
Leçon 1 • Tests de débit et de concurrence
Couvre les tests de requêtes par seconde, de jetons par seconde et de charge utilisateur concurrente pour les API LLM. Relie les métriques de débit à la planification de capacité de service réelle.
Leçon 2 • Utilisation de la mémoire et du matériel
Explique l’allocation de mémoire GPU, le dimensionnement du cache KV et les métriques d’utilisation du matériel pendant l’inférence. Permet aux étudiants de diagnostiquer les goulots d’étranglement mémoire et d’optimiser l’utilisation des ressources.
Leçon 3 • Modélisation des coûts pour les déploiements de LLM
Construit des modèles de coûts couvrant la tarification des API, les infrastructures auto-hébergées et le coût total de possession. Équipe les étudiants pour prendre des décisions éclairées entre construire et acheter.
Leçon 4 • Profilage de la latence d’inférence
Enseigne la mesure du temps jusqu’au premier jeton, de la latence inter-jetons et de la latence de bout en bout sous charge réaliste. Fournit des techniques de profilage pratiques applicables à toute pile de service.
Leçon 5 • Dimensions et compromis de l’efficacité
Définit la latence, le débit, l’empreinte mémoire et le coût comme les quatre axes de l’efficacité des LLM. Cadre l’efficacité comme un problème d’optimisation multi-objectifs.
Chapitre 6MasquerCacher les détailsVoir les détailsÉvaluation de la sécurité, de l’équité et de la robustesse
Évaluation de la sécurité, de l’équité et de la robustesse
Leçon 1 • Évaluation de la robustesse et adversarial
Mesure la sensibilité du modèle aux perturbations d’entrée, aux reformulations et aux invites hors distribution. Révèle la fragilité que les référentiels standard manquent.
Leçon 2 • Définir la sécurité dans les sorties des LLM
Établit une taxonomie des sorties nuisibles incluant la toxicité, la désinformation et les fuites de confidentialité. Fournit la base conceptuelle pour toutes les méthodes d’évaluation de la sécurité dans ce chapitre.
Leçon 3 • Méthodes automatisées de test de sécurité
Couvre la construction d’invites de red-teaming, le sondage adversarial et les classifieurs automatisés pour détecter les sorties non sécurisées. Échelle l’évaluation de la sécurité au-delà de ce que la révision manuelle seule peut atteindre.
Leçon 4 • Rapport des résultats de sécurité et d’équité
Couvre les fiches techniques des modèles, les fiches de données de sécurité et les formats de divulgation structurés pour communiquer les risques. Prépare les étudiants à présenter les résultats à des publics techniques et non techniques.
Leçon 5 • Mesure des biais et de l’équité
Enseigne les tests d’équité contrefactuels, les vérifications de parité démographique et le sondage des stéréotypes entre groupes. Relie les métriques d’équité aux engagements d’équité organisationnelle.
Chapitre 7MasquerCacher les détailsVoir les détailsInfrastructure et outils d’évaluation
Infrastructure et outils d’évaluation
Leçon 1 • Suivi des expériences et reproductibilité
Couvre la journalisation des hyperparamètres, des invites, des graines et des résultats pour garantir des exécutions d’évaluation reproductibles. Empêche l’échec courant des résultats de référentiels non reproductibles.
Leçon 2 • Passage à l’échelle de l’évaluation entre modèles
Aborde la parallélisation, la mise en cache et l’optimisation des coûts pour évaluer de nombreux modèles ou configurations. Prépare les étudiants à mener efficacement des campagnes d’évaluation à grande échelle.
Leçon 3 • Évaluation continue en CI/CD
Intègre des passerelles d’évaluation dans les pipelines d’intégration continue pour détecter automatiquement les régressions. Déplace l’évaluation vers la gauche dans le cycle de développement.
Leçon 4 • Frameworks d’évaluation open-source
Passe en revue les principales bibliothèques d’évaluation open-source, leurs API et leurs modèles d’intégration. Permet aux étudiants de sélectionner et d’adopter des outils sans dépendance à un fournisseur.
Leçon 5 • Architecture du pipeline d’évaluation
Conçoit des pipelines d’évaluation modulaires couvrant l’ingestion de données, l’inférence de modèles, la notation et le rapport. Établit la base technique pour tous les outils couverts dans ce chapitre.
Chapitre 8MasquerCacher les détailsVoir les détailsÉvaluation stratégique et prise de décision
Évaluation stratégique et prise de décision
Leçon 1 • Ingénierie d’invite pilotée par l’évaluation
Utilise les métriques d’évaluation comme signaux de retour pour améliorer itérativement les invites et les instructions système. Boucle la boucle entre la mesure et l’amélioration du comportement du modèle.
Leçon 2 • Cadres de sélection et de comparaison de modèles
Construit des cadres décisionnels multi-critères pour comparer les modèles sur les dimensions de qualité, d’efficacité et de risque. Synthétise toutes les compétences d’évaluation antérieures dans un processus de sélection unifié.
Leçon 3 • Construire une culture d’évaluation
Aborde les pratiques organisationnelles, les rôles d’équipe et les structures d’incitation qui soutiennent une évaluation rigoureuse. Transforme l’évaluation d’une activité ponctuelle en une discipline continue.
Leçon 4 • Communication des résultats d’évaluation
Enseigne la structuration des rapports d’évaluation pour les publics d’ingénierie, produit et direction. Garantit que les résultats de l’évaluation se traduisent en actions organisationnelles.
Leçon 5 • Feuilles de route d’évaluation et priorisation
Enseigne comment prioriser les investissements d’évaluation en fonction du risque, de l’impact et de la disponibilité des ressources. Produit des feuilles de route d’évaluation exploitables alignées sur les cycles de développement produit.
Votre certificat valide de réussite
Ce cours est pour vous :
Ingénieurs en apprentissage automatique qui déploient des modèles sans pratiques d'évaluation structurées.
Gestionnaires de produits IA qui ont besoin d'interpréter la performance des modèles avec confiance.
Scientifiques des données passant de l'entraînement de modèles à l'assurance qualité en production.
Ingénieurs de recherche construisant des outils LLM internes pour des applications d'entreprise.
Professionnels de la sécurité IA élargissant leur ensemble de compétences en évaluation technique.
Ingénieurs logiciels faisant la transition vers des rôles d'opérations d'apprentissage automatique.
Ce que disent nos apprenants
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable au Cameroun ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















