Aller au contenu
Fondamentaux

Évaluation (benchmarks)

Comment on note un modèle de langage : des jeux de questions, des duels arbitrés par des humains ou par un autre modèle, et tout ce qui peut faire mentir un score.

7 min de lecture
  • #évaluation
  • #benchmarks
  • #classement
  • #contamination

Évaluer un modèle, c’est lui faire passer un examen dont on connaît les réponses, ou soumettre ses réponses au vote de juges, pour en tirer un score ; ce score ne vaut que par le protocole qui l’a produit.

Pense au baccalauréat. Une note de 16 dit quelque chose, mais pas tout : l’épreuve était-elle un QCM ou une dissertation ? Le candidat avait-il droit à la calculatrice ? Deux heures ou quatre ? Et surtout, le sujet avait-il fuité la veille ?

Un benchmark, c’est ce sujet d’examen, et le modèle est le candidat. Sauf qu’ici le candidat a lu une bonne partie d’internet avant l’épreuve, que chaque fabricant choisit ses conditions d’examen, et qu’il publie lui-même sa note.

Un benchmark (en français officiel « test de performance », un terme hérité de l’informatique classique, où il désigne plutôt une mesure de vitesse) réunit un jeu fixe de tâches, une façon de vérifier chaque réponse et une métrique. On fait passer le modèle, on agrège un score. Trois familles dominent.

  • Les réponses vérifiables. Un QCM, un résultat numérique exact, un programme qui doit passer des tests : la correction est automatique. MMLU (2020) pose des questions à quatre choix dans 57 matières, des mathématiques élémentaires au droit ; GSM8K (2021), 8 500 problèmes de mathématiques de niveau école primaire ; HumanEval (2021), 164 exercices de programmation Python écrits à la main.
  • La préférence humaine. Sur une arène comme Chatbot Arena, lancée en mai 2023 par l’équipe de recherche LMSYS, tu poses une question, deux modèles anonymes répondent, tu votes pour la meilleure réponse et leurs noms s’affichent ensuite. Les votes accumulés donnent un classement de type Elo, le système de points des échecs.
  • Le modèle juge. Un modèle puissant note ou compare les réponses d’un autre. En 2023, Lianmin Zheng et ses coauteurs mesurent plus de 80 % d’accord entre GPT-4 juge et des humains, un niveau comparable à l’accord des humains entre eux. Mais ce juge a ses penchants : il favorise la réponse placée à une certaine position, la plus longue, et ses propres réponses.

Un score n’est comparable qu’à conditions identiques, et les conditions varient beaucoup d’une annonce à l’autre.

  • Les exemples fournis. On peut donner au modèle quelques questions déjà résolues dans le prompt avant la vraie question : c’est le « 5-shot » pour cinq exemples, le « 0-shot » pour aucun.
  • Le raisonnement autorisé. Laisser le modèle écrire ses étapes avant de répondre fait monter les scores. Meta donne pour Llama 3 405B 87,3 % sur MMLU en 5-shot sans raisonnement, et 88,6 % en 0-shot avec.
  • Le nombre d’essais. En programmation, « pass@k » compte un problème comme résolu si au moins une des k tentatives réussit. Le même modèle Codex, sur le même test, résout 28,8 % des problèmes en un essai et 70,2 % en cent.
  • Le sous-ensemble. SWE-bench réunit 2 294 vrais problèmes signalés sur des projets Python publics de GitHub, que le modèle doit corriger dans le code ; SWE-bench Verified n’en garde que 500, triés à la main. Deux scores « SWE-bench » peuvent ne pas porter sur le même examen.

Un modèle est entraîné sur une énorme partie du web, et les questions des benchmarks publics y circulent, souvent avec leurs corrigés. Si elles se retrouvent dans les données d’entraînement, le modèle peut réciter au lieu de résoudre : on parle de contamination. Les auteurs d’HumanEval ont écrit leurs exercices à la main précisément pour cette raison, GitHub contenant déjà des solutions à beaucoup de problèmes connus.

Les fabricants cherchent ces fuites en repérant les suites de mots communes au test et au corpus. Meta a appliqué cette méthode à Llama 3 et la juge elle-même imparfaite, avec des faux positifs et des faux négatifs. Pour les modèles fermés, dont les données ne sont pas publiées, personne à l’extérieur ne peut vérifier.

Quand les meilleurs modèles frôlent le maximum, un benchmark ne distingue plus personne. MMLU affichait 43,9 % pour GPT-3 en 2020 ; les modèles de raisonnement de début 2025 dépassent 90 %, au-delà des 89,8 % attribués à un expert humain moyen. GSM8K plafonne autour de 97 %.

La réponse habituelle est un examen plus dur. Humanity’s Last Exam (HLE), publié en janvier 2025, réunit 2 500 questions de pointe écrites par environ un millier d’experts et filtrées pour résister aux meilleurs modèles du moment : GPT-4o y obtenait 2,7 %. Relevé en septembre 2026 sur le site du projet, le meilleur modèle listé atteint 38,3 %. Une autre parade consiste à renouveler les questions chaque mois, comme LiveBench, pour qu’aucune n’ait eu le temps de fuiter.

  • Llama 4 et l’arène. En avril 2025, Meta annonce la deuxième place de Llama 4 Maverick sur LMArena, le nouveau nom de Chatbot Arena. La version classée était une variante expérimentale « optimisée pour la conversation » ; celle que Meta a publiée s’est classée 32ᵉ. Une étude parue le même mois, The Leaderboard Illusion, relève qu’environ 27 variantes privées avaient été testées sur l’arène avant la sortie.
  • compar:IA, l’arène francophone. Ouverte en octobre 2024 par le ministère de la Culture, elle reprend le principe du duel anonyme, en français. Après le vote, elle affiche les caractéristiques des deux modèles et une estimation de leur impact environnemental. Ses conversations et ses votes sont publiés en données ouvertes, et comblent un manque : dans le corpus de conversations publié par LMSYS, le français ne pesait que 1,5 %, et compar:IA dit multiplier cette ressource par dix.
  • La fin d’un classement. Hugging Face a arrêté en mars 2025 son Open LLM Leaderboard, après plus de 13 000 modèles à poids ouverts évalués en deux ans, en expliquant qu’il risquait de pousser le domaine à courir après des points sur des critères sans intérêt.
  • Un institut public. La France a annoncé en janvier 2025 l’INESIA, l’Institut national pour l’évaluation et la sécurité de l’intelligence artificielle, qui fédère notamment l’ANSSI, Inria et le Laboratoire national de métrologie et d’essais.
  • « Un meilleur score prouve que le modèle raisonne mieux. » Pas si les questions étaient dans ses données. Sur GSM1k, un clone inédit de GSM8K de même difficulté, Scale AI a mesuré des baisses d’exactitude allant jusqu’à 8 points, plus fortes chez les modèles qui reproduisaient volontiers des exemples de GSM8K. Meta estime qu’un autre test, HellaSwag, est contaminé à 85 % dans son corpus, avec un gain de 14,8 points pour Llama 3 8B.
  • « Le classement de l’arène dit quel modèle a le plus souvent raison. » Il mesure une préférence entre deux réponses, et la forme pèse sur le vote. L’arène a dû ajouter en 2024 un « contrôle du style », qui neutralise la longueur des réponses, les titres, le gras et les listes : plusieurs modèles ont reculé, d’autres ont monté.
  • « La réponse de référence d’un benchmark est forcément juste. » En 2024, Aryo Pradipta Gema et ses coauteurs estiment à environ 6,5 % la part des questions de MMLU qui posent problème, et à 57 % dans la section de virologie. Au sommet du classement, un point de plus peut vouloir dire que le modèle reproduit l’erreur du corrigé.

Voir aussi