Évaluation (benchmarks)
Comment on note un modèle de langage : des jeux de questions, des duels arbitrés par des humains ou par un autre modèle, et tout ce qui peut faire mentir un score.
En une phrase
Section intitulée « En une phrase »Évaluer un modèle, c’est lui faire passer un examen dont on connaît les réponses, ou soumettre ses réponses au vote de juges, pour en tirer un score ; ce score ne vaut que par le protocole qui l’a produit.
L’analogie
Section intitulée « L’analogie »Pense au baccalauréat. Une note de 16 dit quelque chose, mais pas tout : l’épreuve était-elle un QCM ou une dissertation ? Le candidat avait-il droit à la calculatrice ? Deux heures ou quatre ? Et surtout, le sujet avait-il fuité la veille ?
Un benchmark, c’est ce sujet d’examen, et le modèle est le candidat. Sauf qu’ici le candidat a lu une bonne partie d’internet avant l’épreuve, que chaque fabricant choisit ses conditions d’examen, et qu’il publie lui-même sa note.
Comment ça marche
Section intitulée « Comment ça marche »Trois façons de noter
Section intitulée « Trois façons de noter »Un benchmark (en français officiel « test de performance », un terme hérité de l’informatique classique, où il désigne plutôt une mesure de vitesse) réunit un jeu fixe de tâches, une façon de vérifier chaque réponse et une métrique. On fait passer le modèle, on agrège un score. Trois familles dominent.
- Les réponses vérifiables. Un QCM, un résultat numérique exact, un programme qui doit passer des tests : la correction est automatique. MMLU (2020) pose des questions à quatre choix dans 57 matières, des mathématiques élémentaires au droit ; GSM8K (2021), 8 500 problèmes de mathématiques de niveau école primaire ; HumanEval (2021), 164 exercices de programmation Python écrits à la main.
- La préférence humaine. Sur une arène comme Chatbot Arena, lancée en mai 2023 par l’équipe de recherche LMSYS, tu poses une question, deux modèles anonymes répondent, tu votes pour la meilleure réponse et leurs noms s’affichent ensuite. Les votes accumulés donnent un classement de type Elo, le système de points des échecs.
- Le modèle juge. Un modèle puissant note ou compare les réponses d’un autre. En 2023, Lianmin Zheng et ses coauteurs mesurent plus de 80 % d’accord entre GPT-4 juge et des humains, un niveau comparable à l’accord des humains entre eux. Mais ce juge a ses penchants : il favorise la réponse placée à une certaine position, la plus longue, et ses propres réponses.
Le protocole change le chiffre
Section intitulée « Le protocole change le chiffre »Un score n’est comparable qu’à conditions identiques, et les conditions varient beaucoup d’une annonce à l’autre.
- Les exemples fournis. On peut donner au modèle quelques questions déjà résolues dans le prompt avant la vraie question : c’est le « 5-shot » pour cinq exemples, le « 0-shot » pour aucun.
- Le raisonnement autorisé. Laisser le modèle écrire ses étapes avant de répondre fait monter les scores. Meta donne pour Llama 3 405B 87,3 % sur MMLU en 5-shot sans raisonnement, et 88,6 % en 0-shot avec.
- Le nombre d’essais. En programmation, « pass@k » compte un problème comme résolu si au moins une des k tentatives réussit. Le même modèle Codex, sur le même test, résout 28,8 % des problèmes en un essai et 70,2 % en cent.
- Le sous-ensemble. SWE-bench réunit 2 294 vrais problèmes signalés sur des projets Python publics de GitHub, que le modèle doit corriger dans le code ; SWE-bench Verified n’en garde que 500, triés à la main. Deux scores « SWE-bench » peuvent ne pas porter sur le même examen.
La fuite du sujet : la contamination
Section intitulée « La fuite du sujet : la contamination »Un modèle est entraîné sur une énorme partie du web, et les questions des benchmarks publics y circulent, souvent avec leurs corrigés. Si elles se retrouvent dans les données d’entraînement, le modèle peut réciter au lieu de résoudre : on parle de contamination. Les auteurs d’HumanEval ont écrit leurs exercices à la main précisément pour cette raison, GitHub contenant déjà des solutions à beaucoup de problèmes connus.
Les fabricants cherchent ces fuites en repérant les suites de mots communes au test et au corpus. Meta a appliqué cette méthode à Llama 3 et la juge elle-même imparfaite, avec des faux positifs et des faux négatifs. Pour les modèles fermés, dont les données ne sont pas publiées, personne à l’extérieur ne peut vérifier.
L’usure : la saturation
Section intitulée « L’usure : la saturation »Quand les meilleurs modèles frôlent le maximum, un benchmark ne distingue plus personne. MMLU affichait 43,9 % pour GPT-3 en 2020 ; les modèles de raisonnement de début 2025 dépassent 90 %, au-delà des 89,8 % attribués à un expert humain moyen. GSM8K plafonne autour de 97 %.
La réponse habituelle est un examen plus dur. Humanity’s Last Exam (HLE), publié en janvier 2025, réunit 2 500 questions de pointe écrites par environ un millier d’experts et filtrées pour résister aux meilleurs modèles du moment : GPT-4o y obtenait 2,7 %. Relevé en septembre 2026 sur le site du projet, le meilleur modèle listé atteint 38,3 %. Une autre parade consiste à renouveler les questions chaque mois, comme LiveBench, pour qu’aucune n’ait eu le temps de fuiter.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Llama 4 et l’arène. En avril 2025, Meta annonce la deuxième place de Llama 4 Maverick sur LMArena, le nouveau nom de Chatbot Arena. La version classée était une variante expérimentale « optimisée pour la conversation » ; celle que Meta a publiée s’est classée 32ᵉ. Une étude parue le même mois, The Leaderboard Illusion, relève qu’environ 27 variantes privées avaient été testées sur l’arène avant la sortie.
- compar:IA, l’arène francophone. Ouverte en octobre 2024 par le ministère de la Culture, elle reprend le principe du duel anonyme, en français. Après le vote, elle affiche les caractéristiques des deux modèles et une estimation de leur impact environnemental. Ses conversations et ses votes sont publiés en données ouvertes, et comblent un manque : dans le corpus de conversations publié par LMSYS, le français ne pesait que 1,5 %, et compar:IA dit multiplier cette ressource par dix.
- La fin d’un classement. Hugging Face a arrêté en mars 2025 son Open LLM Leaderboard, après plus de 13 000 modèles à poids ouverts évalués en deux ans, en expliquant qu’il risquait de pousser le domaine à courir après des points sur des critères sans intérêt.
- Un institut public. La France a annoncé en janvier 2025 l’INESIA, l’Institut national pour l’évaluation et la sécurité de l’intelligence artificielle, qui fédère notamment l’ANSSI, Inria et le Laboratoire national de métrologie et d’essais.
Idées reçues
Section intitulée « Idées reçues »- « Un meilleur score prouve que le modèle raisonne mieux. » Pas si les questions étaient dans ses données. Sur GSM1k, un clone inédit de GSM8K de même difficulté, Scale AI a mesuré des baisses d’exactitude allant jusqu’à 8 points, plus fortes chez les modèles qui reproduisaient volontiers des exemples de GSM8K. Meta estime qu’un autre test, HellaSwag, est contaminé à 85 % dans son corpus, avec un gain de 14,8 points pour Llama 3 8B.
- « Le classement de l’arène dit quel modèle a le plus souvent raison. » Il mesure une préférence entre deux réponses, et la forme pèse sur le vote. L’arène a dû ajouter en 2024 un « contrôle du style », qui neutralise la longueur des réponses, les titres, le gras et les listes : plusieurs modèles ont reculé, d’autres ont monté.
- « La réponse de référence d’un benchmark est forcément juste. » En 2024, Aryo Pradipta Gema et ses coauteurs estiment à environ 6,5 % la part des questions de MMLU qui posent problème, et à 57 % dans la section de virologie. Au sommet du classement, un point de plus peut vouloir dire que le modèle reproduit l’erreur du corrigé.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- ComparIA : améliorer les IA conversationnelles sur les usages francophones — ministère de la Culture (FR) : l’arène publique en français, sa méthode et ses objectifs.
- « Test de performance » — FranceTerme (FR) : le terme officiel pour benchmark, et le sens qu’il avait avant les modèles de langage.
- « Measuring Massive Multitask Language Understanding » — Hendrycks et al., 2020 (EN) : le papier de MMLU, le benchmark le plus cité des annonces.
- « Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference » — Chiang et al., 2024 (EN) : comment fonctionne une arène et ce que valent ses votes.
- « A Careful Examination of Large Language Model Performance on Grade School Arithmetic » — Zhang et al., 2024 (EN) : la contamination mesurée avec un examen inédit.
- « The Leaderboard Illusion » — Singh et al., 2025 (EN) : les biais structurels d’un classement très suivi.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- EntraînementDonnées d'entraînementLes textes sur lesquels on a réglé les poids d'un modèle : d'où ils viennent, ce qu'on en jette, et pourquoi ils décident de ce qu'il saura dire.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- ÉthiqueBiais (d'un modèle)Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.
- ÉcosystèmePoids ouverts (open weights)Un modèle dont on peut télécharger les poids : il tourne chez toi, se modifie, se compresse — sans que tu saches forcément comment il a été fabriqué.
- ÉcosystèmeAgent (IA)Un LLM à qui on laisse choisir la suite : il observe, décide d'une action, l'exécute avec un outil, lit le résultat, et recommence jusqu'à ce qu'il juge la tâche finie.
- EntraînementRLHFL'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
- EntraînementLois d'échelle (scaling laws)Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- FondamentauxPerplexité (PPL)La mesure mathématique intrinsèque qui évalue la surprise d'un modèle de langage face à un texte : plus elle est basse, mieux le modèle prédit la langue.