Choisissez votre langue
Formation en évaluation des performances LLM
Plus de 2 millions d'apprenants dans le monde

Formation en évaluation des performances LLM

Maîtrisez chaque dimension de l'évaluation des LLM — de la conception de benchmarks et des métriques automatisées aux tests de sécurité et au profilage de l'efficacité. Ce cours offre aux praticiens de l'IA et aux équipes ML les frameworks rigoureux nécessaires pour mesurer ce que les modèles font réellement, et non seulement ce qu'ils prétendent faire. Arrêtez de deviner et commencez à prendre des décisions fondées sur les données pour chaque modèle que vous déployez.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Concevez des benchmarks et des jeux de données d'évaluation rigoureux qui résistent à la contamination et au surapprentissage.

  • Appliquez des métriques automatisées, une notation sémantique et des méthodes de LLM-comme-juge pour évaluer la qualité des sorties.

  • Mesurez la latence d'inférence, le débit, l'utilisation de la mémoire et le coût total de possession pour les déploiements de LLM.

  • Construisez des suites de tests de sécurité et d'équité couvrant la toxicité, les biais, la robustesse contradictoire et l'hallucination.

  • Construisez des pipelines d'évaluation évolutifs et reproductibles intégrés dans les workflows de développement CI/CD.

  • Communiquez clairement les résultats de l'évaluation aux parties prenantes de l'ingénierie, des produits et de la direction.

Comment vous étudiez de façon pratique Formation en évaluation des performances LLM

Comment vous pratiquez Formation en évaluation des performances LLM

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre propre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l’évaluation des LLM

  • Leçon 1 • L’état d’esprit d’évaluation

    Introduit la distinction entre capacité, fiabilité et sécurité comme dimensions d’évaluation. Cadre l’évaluation comme un processus scientifique nécessitant des hypothèses et des contrôles.

  • Leçon 2 • Périmètre et contraintes de l’évaluation

    Définit les limites d’un projet d’évaluation, y compris les contraintes budgétaires, temporelles et d’accès. Apprend aux étudiants à cadrer les évaluations de manière réaliste avant de sélectionner les méthodes.

  • Leçon 3 • Ce que sont les LLM et comment ils fonctionnent

    Couvre l’architecture des transformeurs, la génération de jetons et les distributions de probabilités à un niveau accessible. Ancre tous les concepts d’évaluation ultérieurs dans la manière dont les modèles produisent réellement des sorties.

  • Leçon 4 • Types de tâches et de sorties des LLM

    Catalogue les tâches de génération, classification, extraction et raisonnement ainsi que leurs types de sorties distincts. Relie le type de tâche à la stratégie d’évaluation appropriée utilisée dans les chapitres suivants.

  • Leçon 5 • Sources d’échec des LLM

    Cartographie les modes d’échec courants — hallucination, refus, dérive et biais — à leurs causes profondes. Fournit un vocabulaire de diagnostic utilisé tout au long du cours.

Chapitre 2Voir les détails

Conception de référentiels et construction d’ensembles de données

  • Leçon 1 • Maintenance des référentiels dans le temps

    Aborde la dégradation des référentiels, la saturation des modèles et la nécessité d’un rafraîchissement continu des ensembles de données. Prépare les étudiants à maintenir la qualité de l’évaluation à mesure que les modèles s’améliorent.

  • Leçon 2 • Prévention de la contamination des données

    Explique comment la fuite de données d’entraînement invalide les référentiels et comment la détecter et la prévenir. Aborde directement une menace critique pour la validité de l’évaluation.

  • Leçon 3 • Principes de bonne conception des référentiels

    Couvre la validité, la fiabilité et la couverture comme les trois piliers de la qualité d’un référentiel. Relie les principes de conception aux modes d’échec identifiés au chapitre 1.

  • Leçon 4 • Workflows d’annotation et d’étiquetage

    Couvre les pipelines d’annotation humaine, l’accord inter-annotateurs et le contrôle qualité des ensembles de données étiquetés. Produit des étiquettes de référence fiables nécessaires pour les métriques automatisées.

  • Leçon 5 • Sourcing et curation des données d’évaluation

    Enseigne les méthodes de collecte, filtrage et équilibrage des exemples d’évaluation à partir de sources réelles et synthétiques. Met l’accent sur la qualité des données plutôt que sur la quantité.

Chapitre 3Voir les détails

Métriques automatisées pour la qualité textuelle

  • Leçon 1 • Sélection et combinaison de métriques

    Fournit un cadre décisionnel pour choisir et combiner les métriques en scores d’évaluation composites. Empêche une dépendance excessive à une seule métrique.

  • Leçon 2 • Évaluation par LLM en tant que juge

    Enseigne l’utilisation d’un LLM séparé pour noter les sorties via des invites structurées, y compris les risques de biais et la calibration. Représente une alternative évolutive à l’évaluation humaine.

  • Leçon 3 • Métriques automatisées spécifiques aux tâches

    Couvre la précision, le F1, la correspondance exacte et la perplexité comme métriques appropriées pour les tâches de classification, de questions-réponses et de génération. Relie le choix des métriques au type de tâche du chapitre 1.

  • Leçon 4 • Métriques lexicales basées sur des références

    Couvre BLEU, ROUGE, METEOR et ChrF comme métriques de chevauchement et leurs fondements mathématiques. Établit une littératie de base en matière de métriques avant d’introduire des approches plus complexes.

  • Leçon 5 • Métriques de similarité sémantique

    Introduit les métriques basées sur les plongements telles que BERTScore et les mesures de similarité textuelle sémantique. Comble l’écart entre le chevauchement de surface et l’évaluation au niveau du sens.

Chapitre 4Voir les détails

Méthodes d’évaluation humaine

  • Leçon 1 • Conception de l’étude d’évaluation

    Couvre les plans expérimentaux incluant la comparaison par paires, la notation Likert et les protocoles de classement. Enseigne comment les choix de conception affectent la puissance statistique et le biais.

  • Leçon 2 • Analyse et rapport des jugements humains

    Couvre l’analyse statistique des données de notation, la fiabilité inter-évaluateurs et la communication des résultats. Relie les résultats de l’évaluation humaine aux décisions exploitables d’amélioration du modèle.

  • Leçon 3 • Quand l’évaluation humaine est nécessaire

    Identifie les tâches où les métriques automatisées échouent et où le jugement humain est irremplaçable. Prépare le terrain pour la conception d’études humaines rentables.

  • Leçon 4 • Biais et facteurs de confusion dans les études humaines

    Identifie les effets d’ancrage, d’ordre et de présentation qui faussent les notations humaines. Enseigne des stratégies d’atténuation pour améliorer la validité des études.

  • Leçon 5 • Recrutement et gestion des évaluateurs

    Aborde le sourcing d’évaluateurs experts et crowdsourcés, leur formation et la gestion de la qualité. Impacte directement la fiabilité des jugements collectés.

Chapitre 5Voir les détails

Mesure de l’efficacité des LLM

  • Leçon 1 • Tests de débit et de concurrence

    Couvre les tests de requêtes par seconde, de jetons par seconde et de charge utilisateur concurrente pour les API LLM. Relie les métriques de débit à la planification de capacité de service réelle.

  • Leçon 2 • Utilisation de la mémoire et du matériel

    Explique l’allocation de mémoire GPU, le dimensionnement du cache KV et les métriques d’utilisation du matériel pendant l’inférence. Permet aux étudiants de diagnostiquer les goulots d’étranglement mémoire et d’optimiser l’utilisation des ressources.

  • Leçon 3 • Modélisation des coûts pour les déploiements de LLM

    Construit des modèles de coûts couvrant la tarification des API, les infrastructures auto-hébergées et le coût total de possession. Équipe les étudiants pour prendre des décisions éclairées entre construire et acheter.

  • Leçon 4 • Profilage de la latence d’inférence

    Enseigne la mesure du temps jusqu’au premier jeton, de la latence inter-jetons et de la latence de bout en bout sous charge réaliste. Fournit des techniques de profilage pratiques applicables à toute pile de service.

  • Leçon 5 • Dimensions et compromis de l’efficacité

    Définit la latence, le débit, l’empreinte mémoire et le coût comme les quatre axes de l’efficacité des LLM. Cadre l’efficacité comme un problème d’optimisation multi-objectifs.

Chapitre 6Voir les détails

Évaluation de la sécurité, de l’équité et de la robustesse

  • Leçon 1 • Évaluation de la robustesse et adversarial

    Mesure la sensibilité du modèle aux perturbations d’entrée, aux reformulations et aux invites hors distribution. Révèle la fragilité que les référentiels standard manquent.

  • Leçon 2 • Définir la sécurité dans les sorties des LLM

    Établit une taxonomie des sorties nuisibles incluant la toxicité, la désinformation et les fuites de confidentialité. Fournit la base conceptuelle pour toutes les méthodes d’évaluation de la sécurité dans ce chapitre.

  • Leçon 3 • Méthodes automatisées de test de sécurité

    Couvre la construction d’invites de red-teaming, le sondage adversarial et les classifieurs automatisés pour détecter les sorties non sécurisées. Échelle l’évaluation de la sécurité au-delà de ce que la révision manuelle seule peut atteindre.

  • Leçon 4 • Rapport des résultats de sécurité et d’équité

    Couvre les fiches techniques des modèles, les fiches de données de sécurité et les formats de divulgation structurés pour communiquer les risques. Prépare les étudiants à présenter les résultats à des publics techniques et non techniques.

  • Leçon 5 • Mesure des biais et de l’équité

    Enseigne les tests d’équité contrefactuels, les vérifications de parité démographique et le sondage des stéréotypes entre groupes. Relie les métriques d’équité aux engagements d’équité organisationnelle.

Chapitre 7Voir les détails

Infrastructure et outils d’évaluation

  • Leçon 1 • Suivi des expériences et reproductibilité

    Couvre la journalisation des hyperparamètres, des invites, des graines et des résultats pour garantir des exécutions d’évaluation reproductibles. Empêche l’échec courant des résultats de référentiels non reproductibles.

  • Leçon 2 • Passage à l’échelle de l’évaluation entre modèles

    Aborde la parallélisation, la mise en cache et l’optimisation des coûts pour évaluer de nombreux modèles ou configurations. Prépare les étudiants à mener efficacement des campagnes d’évaluation à grande échelle.

  • Leçon 3 • Évaluation continue en CI/CD

    Intègre des passerelles d’évaluation dans les pipelines d’intégration continue pour détecter automatiquement les régressions. Déplace l’évaluation vers la gauche dans le cycle de développement.

  • Leçon 4 • Frameworks d’évaluation open-source

    Passe en revue les principales bibliothèques d’évaluation open-source, leurs API et leurs modèles d’intégration. Permet aux étudiants de sélectionner et d’adopter des outils sans dépendance à un fournisseur.

  • Leçon 5 • Architecture du pipeline d’évaluation

    Conçoit des pipelines d’évaluation modulaires couvrant l’ingestion de données, l’inférence de modèles, la notation et le rapport. Établit la base technique pour tous les outils couverts dans ce chapitre.

Chapitre 8Voir les détails

Évaluation stratégique et prise de décision

  • Leçon 1 • Ingénierie d’invite pilotée par l’évaluation

    Utilise les métriques d’évaluation comme signaux de retour pour améliorer itérativement les invites et les instructions système. Boucle la boucle entre la mesure et l’amélioration du comportement du modèle.

  • Leçon 2 • Cadres de sélection et de comparaison de modèles

    Construit des cadres décisionnels multi-critères pour comparer les modèles sur les dimensions de qualité, d’efficacité et de risque. Synthétise toutes les compétences d’évaluation antérieures dans un processus de sélection unifié.

  • Leçon 3 • Construire une culture d’évaluation

    Aborde les pratiques organisationnelles, les rôles d’équipe et les structures d’incitation qui soutiennent une évaluation rigoureuse. Transforme l’évaluation d’une activité ponctuelle en une discipline continue.

  • Leçon 4 • Communication des résultats d’évaluation

    Enseigne la structuration des rapports d’évaluation pour les publics d’ingénierie, produit et direction. Garantit que les résultats de l’évaluation se traduisent en actions organisationnelles.

  • Leçon 5 • Feuilles de route d’évaluation et priorisation

    Enseigne comment prioriser les investissements d’évaluation en fonction du risque, de l’impact et de la disponibilité des ressources. Produit des feuilles de route d’évaluation exploitables alignées sur les cycles de développement produit.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieurs en apprentissage automatique qui déploient des modèles sans pratiques d'évaluation structurées.

  • Gestionnaires de produits IA qui ont besoin d'interpréter la performance des modèles avec confiance.

  • Scientifiques des données passant de l'entraînement de modèles à l'assurance qualité en production.

  • Ingénieurs de recherche construisant des outils LLM internes pour des applications d'entreprise.

  • Professionnels de la sécurité IA élargissant leur ensemble de compétences en évaluation technique.

  • Ingénieurs logiciels faisant la transition vers des rôles d'opérations d'apprentissage automatique.

Ce que disent nos apprenants

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable au Cameroun ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF