Modèle de raisonnement (reasoning model)
Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
En une phrase
Section intitulée « En une phrase »Un modèle de raisonnement est un LLM ordinaire qu’on a entraîné à écrire d’abord un long brouillon, parfois caché, avant de donner sa réponse : il réussit mieux les problèmes difficiles, au prix de beaucoup plus de texte généré, donc de temps, d’argent et d’énergie.
L’analogie
Section intitulée « L’analogie »Devant un problème de mathématiques, tu ne poses pas le résultat d’emblée : tu gribouilles au brouillon, tu essaies une piste, tu la barres, tu vérifies. Puis tu recopies proprement la réponse sur ta copie.
Un modèle de raisonnement a appris à faire ce brouillon. Deux différences quand même : chaque ligne de brouillon lui coûte autant qu’une ligne de réponse, et ce qu’il écrit au brouillon ne raconte pas forcément comment il est vraiment arrivé au résultat.
Comment ça marche
Section intitulée « Comment ça marche »Même machine, autre usage du temps
Section intitulée « Même machine, autre usage du temps »Un modèle de raisonnement n’a pas d’architecture à part. C’est le même Transformer, qui produit ses tokens un par un comme n’importe quel LLM (voir Inférence). DeepSeek-R1 est construit sur DeepSeek-V3, Magistral Medium sur Mistral Medium 3.
Ce qui change, c’est la forme de la sortie. Le modèle écrit d’abord une longue suite de tokens intermédiaires, la chaîne de pensée : il décompose, essaie, se corrige. Ensuite seulement vient la réponse finale. OpenAI résume l’idée en présentant o1, en septembre 2024 : le modèle « réfléchit avant de répondre ».
D’une astuce de prompt à un entraînement
Section intitulée « D’une astuce de prompt à un entraînement »Tout commence par une astuce d’utilisateur. En 2022, Jason Wei et ses coauteurs, chez Google, montrent qu’il suffit de glisser dans le prompt quelques exemples résolus étape par étape pour que le modèle détaille lui aussi son calcul. Sur les problèmes de mathématiques de GSM8K, leur plus grand modèle passe de 17,9 % à 56,9 % de réussite. Le gain n’apparaît qu’au-delà d’environ 100 milliards de paramètres. La même année, Takeshi Kojima et ses coauteurs obtiennent un effet voisin sans aucun exemple, en ajoutant simplement « Réfléchissons étape par étape » à la question.
Un modèle de raisonnement va plus loin : on ne lui demande plus de raisonner, on l’entraîne à le faire, spontanément et longuement. L’outil est l’apprentissage par renforcement, la méthode où un programme extérieur récompense ou pénalise les résultats du modèle.
Des récompenses qu’on peut vérifier
Section intitulée « Des récompenses qu’on peut vérifier »DeepSeek a publié en janvier 2025 la recette de R1, poids compris, là où OpenAI n’avait rien détaillé pour o1. Sa première version, R1-Zero, part du modèle de base et n’apprend que par renforcement, sans exemples rédigés par des humains.
- La récompense est vérifiable par une règle. Pour une question de mathématiques, on compare la réponse au résultat attendu ; pour du code, on le compile et on lance des tests. Une seconde récompense impose de ranger le brouillon entre deux balises,
<think>et</think>. - Pas de juge neuronal. Contrairement au RLHF, aucun modèle ne note les réponses selon des préférences humaines : DeepSeek explique qu’un tel juge se fait duper pendant un long entraînement, le modèle apprenant à lui plaire plutôt qu’à avoir raison.
- Le groupe comme étalon. Pour chaque question, l’algorithme GRPO fait écrire plusieurs réponses et juge chacune par rapport à la moyenne du groupe : ce qui fait mieux que ses voisines est encouragé.
Personne n’a demandé au modèle d’écrire long. Pendant l’entraînement, ses réponses s’allongent pourtant d’elles-mêmes, et des retours en arrière apparaissent dans le brouillon, jusqu’à ce « Wait, wait. Wait. » (« Attends, attends. Attends. ») que les auteurs épinglent comme un moment de déclic. Sur le concours de mathématiques AIME 2024, R1-Zero passe de 15,6 % à 71,0 % de réussite au fil de l’entraînement, et à 86,7 % quand on fait voter plusieurs de ses réponses.
Le calcul change de moment
Section intitulée « Le calcul change de moment »Un modèle classique dépense l’essentiel de son calcul une fois, à l’entraînement. Un modèle de raisonnement en dépense aussi beaucoup à chaque question : on parle de calcul au moment de l’inférence (voir Lois d’échelle). Les fournisseurs laissent régler cette dépense : chez Anthropic, un budget de réflexion d’au moins 1 024 tokens, présenté comme une cible et non une limite stricte ; chez Google, un niveau de réflexion bas, moyen ou haut.
Ces tokens de brouillon sont facturés comme de la sortie, même quand ils ne sont pas affichés (voir Coût), et ils occupent la fenêtre de contexte comme le reste.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- o1, le premier grand lancement. En septembre 2024, OpenAI annonce que GPT-4o résout en moyenne 12 % des problèmes de l’AIME 2024, et o1 74 % en un seul essai, 93 % en choisissant la meilleure parmi mille réponses. Ces chiffres sont ceux du modèle o1 complet : la version ouverte au public ce jour-là, o1-preview, était plus faible. Le brouillon brut reste caché : l’utilisateur n’en voit qu’un résumé.
- Magistral, le raisonnement en français. Mistral AI a lancé en juin 2025 son premier modèle de raisonnement, entraîné par renforcement sur ses propres modèles. Il raisonne dans la langue de la question, français compris, et sa petite version de 24 milliards de paramètres est publiée en poids ouverts sous licence Apache 2.0. DeepSeek reconnaît au contraire que R1, optimisé pour le chinois et l’anglais, peut basculer en anglais sur une question posée dans une autre langue.
- De petits modèles qui imitent. DeepSeek a aussi publié six modèles de 1,5 à 70 milliards de paramètres, entraînés sur les brouillons de R1 : une distillation qui, sur ces petites tailles, fait mieux que le renforcement direct.
- La facture d’énergie. En décembre 2025, le classement AI Energy Score de Hugging Face mesure qu’activer le raisonnement multiplie en moyenne par 30 l’énergie consommée pour un même lot de requêtes, parce que le modèle écrit des centaines de fois plus de tokens.
- Écrire autrement. DeepSeek note que les exemples dans le prompt dégradent les résultats de R1 et conseille de décrire simplement le problème. C’est l’inverse de la recette de 2022.
Idées reçues
Section intitulée « Idées reçues »- « Le brouillon affiché montre ce que le modèle pense vraiment. » C’est du texte généré, pas une trace du calcul. En 2025, une équipe d’Anthropic glisse un indice dans les questions : les modèles s’en servent pour répondre, mais, dans bien des configurations testées, leur brouillon ne le mentionne que dans moins de 20 % des cas. Et chez o1, ce que tu lis n’est qu’un résumé de ce brouillon.
- « Plus il réfléchit longtemps, meilleure est la réponse. » Sur une question comme « 2 + 3 = ? », Xingyu Chen et ses coauteurs mesurent des modèles de ce type qui écrivent près de vingt fois plus de tokens qu’un modèle classique, pour la même réponse. DeepSeek reconnaît lui-même que R1 réfléchit trop sur les questions simples. L’énergie, elle, grimpe à chaque token.
- « DeepSeek-R1 a coûté moins de 300 000 dollars. » Les 294 000 dollars publiés dans Nature couvrent la phase de renforcement et la préparation de ses données, sur des cartes louées 2 dollars l’heure. Le pré-entraînement de DeepSeek-V3, le modèle de base sur lequel R1 est construit et de loin le poste le plus lourd, n’y figure pas.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Les 4 étapes pour entraîner un LLM » — David Louapre, Science Étonnante, 2025 (FR) : le renforcement à récompenses vérifiables et GRPO, expliqués simplement.
- « Magistral » — Mistral AI, 2025 (EN) : l’annonce du premier modèle de raisonnement français.
- « Chain-of-Thought Prompting Elicits Reasoning in Large Language Models » — Wei et al., 2022 (EN) : l’astuce de prompt d’où tout est parti.
- « DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning » — DeepSeek-AI, 2025 (EN) : la recette complète, récompenses, GRPO et coûts.
- « Reasoning Models Don’t Always Say What They Think » — Chen et al., 2025 (EN) : ce que le brouillon tait.
- « Do NOT Think That Much for 2+3=? » — Chen et al., 2024 (EN) : la surréflexion mesurée.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- FondamentauxPrompt (instruction générative)Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.
- EntraînementRLHFL'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
- EntraînementDistillationEntraîner un petit modèle à imiter les réponses d'un grand, pour garder l'essentiel de ses capacités à une fraction de sa taille.
- ÉcosystèmeCoût (tarification)Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.
- FondamentauxÉvaluation (benchmarks)Comment on note un modèle de langage : des jeux de questions, des duels arbitrés par des humains ou par un autre modèle, et tout ce qui peut faire mentir un score.
- EntraînementLois d'échelle (scaling laws)Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- ÉcosystèmeAgent (IA)Un LLM à qui on laisse choisir la suite : il observe, décide d'une action, l'exécute avec un outil, lit le résultat, et recommence jusqu'à ce qu'il juge la tâche finie.
- ÉcosystèmePoids ouverts (open weights)Un modèle dont on peut télécharger les poids : il tourne chez toi, se modifie, se compresse — sans que tu saches forcément comment il a été fabriqué.
- ÉthiqueEmpreinte environnementaleCe que coûtent à l'environnement la fabrication du matériel, l'entraînement d'un modèle et chacune de ses réponses : électricité, carbone, eau, métaux, et pourquoi les chiffres qui circulent divergent autant.