Aller au contenu
Fondamentaux

Modèle de raisonnement (reasoning model)

Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.

7 min de lecture
  • #raisonnement
  • #inférence
  • #apprentissage par renforcement
  • #tokens

Un modèle de raisonnement est un LLM ordinaire qu’on a entraîné à écrire d’abord un long brouillon, parfois caché, avant de donner sa réponse : il réussit mieux les problèmes difficiles, au prix de beaucoup plus de texte généré, donc de temps, d’argent et d’énergie.

Devant un problème de mathématiques, tu ne poses pas le résultat d’emblée : tu gribouilles au brouillon, tu essaies une piste, tu la barres, tu vérifies. Puis tu recopies proprement la réponse sur ta copie.

Un modèle de raisonnement a appris à faire ce brouillon. Deux différences quand même : chaque ligne de brouillon lui coûte autant qu’une ligne de réponse, et ce qu’il écrit au brouillon ne raconte pas forcément comment il est vraiment arrivé au résultat.

Un modèle de raisonnement n’a pas d’architecture à part. C’est le même Transformer, qui produit ses tokens un par un comme n’importe quel LLM (voir Inférence). DeepSeek-R1 est construit sur DeepSeek-V3, Magistral Medium sur Mistral Medium 3.

Ce qui change, c’est la forme de la sortie. Le modèle écrit d’abord une longue suite de tokens intermédiaires, la chaîne de pensée : il décompose, essaie, se corrige. Ensuite seulement vient la réponse finale. OpenAI résume l’idée en présentant o1, en septembre 2024 : le modèle « réfléchit avant de répondre ».

Tout commence par une astuce d’utilisateur. En 2022, Jason Wei et ses coauteurs, chez Google, montrent qu’il suffit de glisser dans le prompt quelques exemples résolus étape par étape pour que le modèle détaille lui aussi son calcul. Sur les problèmes de mathématiques de GSM8K, leur plus grand modèle passe de 17,9 % à 56,9 % de réussite. Le gain n’apparaît qu’au-delà d’environ 100 milliards de paramètres. La même année, Takeshi Kojima et ses coauteurs obtiennent un effet voisin sans aucun exemple, en ajoutant simplement « Réfléchissons étape par étape » à la question.

Un modèle de raisonnement va plus loin : on ne lui demande plus de raisonner, on l’entraîne à le faire, spontanément et longuement. L’outil est l’apprentissage par renforcement, la méthode où un programme extérieur récompense ou pénalise les résultats du modèle.

DeepSeek a publié en janvier 2025 la recette de R1, poids compris, là où OpenAI n’avait rien détaillé pour o1. Sa première version, R1-Zero, part du modèle de base et n’apprend que par renforcement, sans exemples rédigés par des humains.

  • La récompense est vérifiable par une règle. Pour une question de mathématiques, on compare la réponse au résultat attendu ; pour du code, on le compile et on lance des tests. Une seconde récompense impose de ranger le brouillon entre deux balises, <think> et </think>.
  • Pas de juge neuronal. Contrairement au RLHF, aucun modèle ne note les réponses selon des préférences humaines : DeepSeek explique qu’un tel juge se fait duper pendant un long entraînement, le modèle apprenant à lui plaire plutôt qu’à avoir raison.
  • Le groupe comme étalon. Pour chaque question, l’algorithme GRPO fait écrire plusieurs réponses et juge chacune par rapport à la moyenne du groupe : ce qui fait mieux que ses voisines est encouragé.

Personne n’a demandé au modèle d’écrire long. Pendant l’entraînement, ses réponses s’allongent pourtant d’elles-mêmes, et des retours en arrière apparaissent dans le brouillon, jusqu’à ce « Wait, wait. Wait. » (« Attends, attends. Attends. ») que les auteurs épinglent comme un moment de déclic. Sur le concours de mathématiques AIME 2024, R1-Zero passe de 15,6 % à 71,0 % de réussite au fil de l’entraînement, et à 86,7 % quand on fait voter plusieurs de ses réponses.

Un modèle classique dépense l’essentiel de son calcul une fois, à l’entraînement. Un modèle de raisonnement en dépense aussi beaucoup à chaque question : on parle de calcul au moment de l’inférence (voir Lois d’échelle). Les fournisseurs laissent régler cette dépense : chez Anthropic, un budget de réflexion d’au moins 1 024 tokens, présenté comme une cible et non une limite stricte ; chez Google, un niveau de réflexion bas, moyen ou haut.

Ces tokens de brouillon sont facturés comme de la sortie, même quand ils ne sont pas affichés (voir Coût), et ils occupent la fenêtre de contexte comme le reste.

  • o1, le premier grand lancement. En septembre 2024, OpenAI annonce que GPT-4o résout en moyenne 12 % des problèmes de l’AIME 2024, et o1 74 % en un seul essai, 93 % en choisissant la meilleure parmi mille réponses. Ces chiffres sont ceux du modèle o1 complet : la version ouverte au public ce jour-là, o1-preview, était plus faible. Le brouillon brut reste caché : l’utilisateur n’en voit qu’un résumé.
  • Magistral, le raisonnement en français. Mistral AI a lancé en juin 2025 son premier modèle de raisonnement, entraîné par renforcement sur ses propres modèles. Il raisonne dans la langue de la question, français compris, et sa petite version de 24 milliards de paramètres est publiée en poids ouverts sous licence Apache 2.0. DeepSeek reconnaît au contraire que R1, optimisé pour le chinois et l’anglais, peut basculer en anglais sur une question posée dans une autre langue.
  • De petits modèles qui imitent. DeepSeek a aussi publié six modèles de 1,5 à 70 milliards de paramètres, entraînés sur les brouillons de R1 : une distillation qui, sur ces petites tailles, fait mieux que le renforcement direct.
  • La facture d’énergie. En décembre 2025, le classement AI Energy Score de Hugging Face mesure qu’activer le raisonnement multiplie en moyenne par 30 l’énergie consommée pour un même lot de requêtes, parce que le modèle écrit des centaines de fois plus de tokens.
  • Écrire autrement. DeepSeek note que les exemples dans le prompt dégradent les résultats de R1 et conseille de décrire simplement le problème. C’est l’inverse de la recette de 2022.
  • « Le brouillon affiché montre ce que le modèle pense vraiment. » C’est du texte généré, pas une trace du calcul. En 2025, une équipe d’Anthropic glisse un indice dans les questions : les modèles s’en servent pour répondre, mais, dans bien des configurations testées, leur brouillon ne le mentionne que dans moins de 20 % des cas. Et chez o1, ce que tu lis n’est qu’un résumé de ce brouillon.
  • « Plus il réfléchit longtemps, meilleure est la réponse. » Sur une question comme « 2 + 3 = ? », Xingyu Chen et ses coauteurs mesurent des modèles de ce type qui écrivent près de vingt fois plus de tokens qu’un modèle classique, pour la même réponse. DeepSeek reconnaît lui-même que R1 réfléchit trop sur les questions simples. L’énergie, elle, grimpe à chaque token.
  • « DeepSeek-R1 a coûté moins de 300 000 dollars. » Les 294 000 dollars publiés dans Nature couvrent la phase de renforcement et la préparation de ses données, sur des cartes louées 2 dollars l’heure. Le pré-entraînement de DeepSeek-V3, le modèle de base sur lequel R1 est construit et de loin le poste le plus lourd, n’y figure pas.

Voir aussi