Aller au contenu
Fondamentaux

Fenêtre de contexte

La quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».

6 min de lecture
  • #mémoire
  • #tokens
  • #limites

La fenêtre de contexte est la quantité maximale de texte qu’un modèle peut prendre en compte d’un coup : sa mémoire de travail immédiate, mesurée en tokens, et qui contient aussi bien ta question que la réponse en train de s’écrire.

Imagine un bureau. La fenêtre de contexte, c’est la surface de ce bureau : tout ce qui tient dessus (tes notes, la question, les documents ouverts) est visible d’un coup d’œil et utilisable. Ce qui ne tient pas reste dans un tiroir, et le modèle ne peut plus s’en servir.

Deux détails comptent. La réponse qu’il rédige s’étale elle aussi sur ce bureau : elle prend donc de la place, sur la même surface. Et le bureau est débarrassé entre deux séances, sans que personne ne range rien pour plus tard.

La fenêtre se mesure en tokens, pas en mots ni en caractères. Ce budget couvre tout ce qui entre et tout ce qui sort : les consignes du système, l’historique complet de la conversation, les documents collés, les résultats d’outils, et la réponse en cours de génération. Si ta question occupe déjà presque toute la fenêtre, il ne reste plus de place pour y répondre.

Les ordres de grandeur, à l’été 2026 : les modèles courants tiennent entre 128 000 et 200 000 tokens, les modèles de pointe annoncent 1 million, quelques-uns dix fois plus. Ces chiffres vieillissent en quelques mois : retiens plutôt la marche d’escalier franchie depuis 2022, où 4 096 tokens était la norme. Pour convertir, compte grossièrement 1,5 à 2 tokens par mot en français, un peu plus qu’en anglais sur lequel les découpeurs sont optimisés. 128 000 tokens, c’est donc de l’ordre de 70 000 mots : un roman entier.

Les poids sont figés : rien de ce que tu écris ne s’y inscrit. Le modèle est sans état, il ne « garde » pas la conversation d’un message à l’autre. À chaque tour, le logiciel qui l’entoure lui renvoie l’intégralité de l’échange, du premier mot au dernier, et il relit tout avant de répondre. L’impression de continuité ne vient donc pas d’une mémoire, mais d’une relecture recommencée à chaque fois. C’est précisément pour cette raison que la place disponible pèse autant.

L’attention compare chaque token à tous les autres : doubler la longueur du texte quadruple le travail de cette étape. C’est le coût quadratique. Sur un texte court il reste discret, le reste du réseau pèse plus lourd, mais il devient l’obstacle dominant sur les très longs contextes.

S’ajoute un coût de mémoire, moins connu. Pour éviter de tout recalculer à chaque nouveau mot produit, le modèle conserve des résultats intermédiaires pour chaque token déjà lu : c’est le cache clés-valeurs. Il grossit proportionnellement à la longueur du contexte et, sur les très grandes fenêtres, il finit par occuper plus de mémoire que les poids eux-mêmes. C’est souvent lui, et non le calcul, qui fixe la longueur réellement tenable sur une machine donnée.

Une grande fenêtre n’est pas une fenêtre bien utilisée

Section intitulée « Une grande fenêtre n’est pas une fenêtre bien utilisée »

La taille annoncée est une capacité, pas une garantie. Trois résultats convergent :

  • « Lost in the middle » (Liu et al., 2023) : la précision suit une courbe en U. Une information placée au début ou à la fin du contexte est bien retrouvée ; la même, noyée au milieu, l’est nettement moins.
  • RULER (Hsieh et al., 2024) : dès qu’on demande un peu plus que « retrouve cette phrase », presque tous les modèles testés décrochaient avant d’atteindre la longueur qu’ils annonçaient.
  • La dégradation progressive : la qualité baisse graduellement avec la longueur, bien avant la saturation. Une fenêtre de 200 000 tokens peut déjà mal se comporter à 50 000.

Sur un document long, la position de l’information compte donc autant que sa présence. Et un modèle qui perd le fil ne le signale pas : il continue de répondre, du même ton assuré, en comblant les trous. C’est une porte d’entrée directe vers l’hallucination.

  • Le RAG : plutôt que tout verser dans la fenêtre, on n’y place que les passages pertinents. Le bureau reste dégagé, et la qualité y gagne souvent.
  • Le résumé : condenser les vieux tours de conversation pour n’en garder que la substance. Certaines API le font maintenant côté serveur.
  • Le glissement : les messages les plus anciens sortent de la fenêtre et disparaissent. C’est le comportement des interfaces de discussion ; une API, elle, refuse plutôt la requête avec une erreur que de couper en silence.
  • Une conversation qui dure depuis deux heures et « oublie » la consigne donnée au tout début : les premiers messages ont glissé hors de la fenêtre.
  • Un assistant de code branché sur un dépôt de plusieurs milliers de fichiers ne peut pas tout lire d’un coup. Il choisit quoi ouvrir, et ce choix explique une bonne part de ses réussites comme de ses erreurs.
  • Coller un rapport annuel de 200 pages et demander une synthèse : ça tient dans les fenêtres actuelles, mais les points enfouis au milieu ressortent moins bien que l’introduction et la conclusion.
  • Les API facturent au token, et l’historique est renvoyé en entier à chaque tour : un contexte long se paie donc à chaque message, pas une seule fois. Certains fournisseurs majorent même le tarif au-delà d’un seuil de longueur.
  • « Plus la fenêtre est grande, mieux c’est. » Précieux pour les gros documents, mais au prix du calcul, de la mémoire et de la fiabilité. Quelques pages bien choisies battent régulièrement un contexte géant rempli à ras bord.
  • « Le modèle se souvient de nos conversations précédentes. » Il ne se souvient de rien. Les fonctions « mémoire » des assistants grand public notent quelques phrases à ton sujet dans une base extérieure, puis les recollent au début de chaque nouvelle conversation. C’est du texte réinjecté dans la fenêtre, pas un souvenir logé dans le modèle.
  • « La fenêtre, c’est la mémoire du modèle. » C’est sa mémoire de travail : temporaire, et remise à zéro. Ce qu’il sait durablement tient dans ses poids, et rien de ce qui traverse la fenêtre ne s’y écrit.

Voir aussi