Fenêtre de contexte
La quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
En une phrase
Section intitulée « En une phrase »La fenêtre de contexte est la quantité maximale de texte qu’un modèle peut prendre en compte d’un coup : sa mémoire de travail immédiate, mesurée en tokens, et qui contient aussi bien ta question que la réponse en train de s’écrire.
L’analogie
Section intitulée « L’analogie »Imagine un bureau. La fenêtre de contexte, c’est la surface de ce bureau : tout ce qui tient dessus (tes notes, la question, les documents ouverts) est visible d’un coup d’œil et utilisable. Ce qui ne tient pas reste dans un tiroir, et le modèle ne peut plus s’en servir.
Deux détails comptent. La réponse qu’il rédige s’étale elle aussi sur ce bureau : elle prend donc de la place, sur la même surface. Et le bureau est débarrassé entre deux séances, sans que personne ne range rien pour plus tard.
Comment ça marche
Section intitulée « Comment ça marche »Un budget de tokens, partagé
Section intitulée « Un budget de tokens, partagé »La fenêtre se mesure en tokens, pas en mots ni en caractères. Ce budget couvre tout ce qui entre et tout ce qui sort : les consignes du système, l’historique complet de la conversation, les documents collés, les résultats d’outils, et la réponse en cours de génération. Si ta question occupe déjà presque toute la fenêtre, il ne reste plus de place pour y répondre.
Les ordres de grandeur, à l’été 2026 : les modèles courants tiennent entre 128 000 et 200 000 tokens, les modèles de pointe annoncent 1 million, quelques-uns dix fois plus. Ces chiffres vieillissent en quelques mois : retiens plutôt la marche d’escalier franchie depuis 2022, où 4 096 tokens était la norme. Pour convertir, compte grossièrement 1,5 à 2 tokens par mot en français, un peu plus qu’en anglais sur lequel les découpeurs sont optimisés. 128 000 tokens, c’est donc de l’ordre de 70 000 mots : un roman entier.
Le modèle ne retient rien entre deux messages
Section intitulée « Le modèle ne retient rien entre deux messages »Les poids sont figés : rien de ce que tu écris ne s’y inscrit. Le modèle est sans état, il ne « garde » pas la conversation d’un message à l’autre. À chaque tour, le logiciel qui l’entoure lui renvoie l’intégralité de l’échange, du premier mot au dernier, et il relit tout avant de répondre. L’impression de continuité ne vient donc pas d’une mémoire, mais d’une relecture recommencée à chaque fois. C’est précisément pour cette raison que la place disponible pèse autant.
Pourquoi ça coûte cher
Section intitulée « Pourquoi ça coûte cher »L’attention compare chaque token à tous les autres : doubler la longueur du texte quadruple le travail de cette étape. C’est le coût quadratique. Sur un texte court il reste discret, le reste du réseau pèse plus lourd, mais il devient l’obstacle dominant sur les très longs contextes.
Le cache qui gonfle
Section intitulée « Le cache qui gonfle »S’ajoute un coût de mémoire, moins connu. Pour éviter de tout recalculer à chaque nouveau mot produit, le modèle conserve des résultats intermédiaires pour chaque token déjà lu : c’est le cache clés-valeurs. Il grossit proportionnellement à la longueur du contexte et, sur les très grandes fenêtres, il finit par occuper plus de mémoire que les poids eux-mêmes. C’est souvent lui, et non le calcul, qui fixe la longueur réellement tenable sur une machine donnée.
Une grande fenêtre n’est pas une fenêtre bien utilisée
Section intitulée « Une grande fenêtre n’est pas une fenêtre bien utilisée »La taille annoncée est une capacité, pas une garantie. Trois résultats convergent :
- « Lost in the middle » (Liu et al., 2023) : la précision suit une courbe en U. Une information placée au début ou à la fin du contexte est bien retrouvée ; la même, noyée au milieu, l’est nettement moins.
- RULER (Hsieh et al., 2024) : dès qu’on demande un peu plus que « retrouve cette phrase », presque tous les modèles testés décrochaient avant d’atteindre la longueur qu’ils annonçaient.
- La dégradation progressive : la qualité baisse graduellement avec la longueur, bien avant la saturation. Une fenêtre de 200 000 tokens peut déjà mal se comporter à 50 000.
Sur un document long, la position de l’information compte donc autant que sa présence. Et un modèle qui perd le fil ne le signale pas : il continue de répondre, du même ton assuré, en comblant les trous. C’est une porte d’entrée directe vers l’hallucination.
Que faire quand ça déborde
Section intitulée « Que faire quand ça déborde »- Le RAG : plutôt que tout verser dans la fenêtre, on n’y place que les passages pertinents. Le bureau reste dégagé, et la qualité y gagne souvent.
- Le résumé : condenser les vieux tours de conversation pour n’en garder que la substance. Certaines API le font maintenant côté serveur.
- Le glissement : les messages les plus anciens sortent de la fenêtre et disparaissent. C’est le comportement des interfaces de discussion ; une API, elle, refuse plutôt la requête avec une erreur que de couper en silence.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Une conversation qui dure depuis deux heures et « oublie » la consigne donnée au tout début : les premiers messages ont glissé hors de la fenêtre.
- Un assistant de code branché sur un dépôt de plusieurs milliers de fichiers ne peut pas tout lire d’un coup. Il choisit quoi ouvrir, et ce choix explique une bonne part de ses réussites comme de ses erreurs.
- Coller un rapport annuel de 200 pages et demander une synthèse : ça tient dans les fenêtres actuelles, mais les points enfouis au milieu ressortent moins bien que l’introduction et la conclusion.
- Les API facturent au token, et l’historique est renvoyé en entier à chaque tour : un contexte long se paie donc à chaque message, pas une seule fois. Certains fournisseurs majorent même le tarif au-delà d’un seuil de longueur.
Idées reçues
Section intitulée « Idées reçues »- « Plus la fenêtre est grande, mieux c’est. » Précieux pour les gros documents, mais au prix du calcul, de la mémoire et de la fiabilité. Quelques pages bien choisies battent régulièrement un contexte géant rempli à ras bord.
- « Le modèle se souvient de nos conversations précédentes. » Il ne se souvient de rien. Les fonctions « mémoire » des assistants grand public notent quelques phrases à ton sujet dans une base extérieure, puis les recollent au début de chaque nouvelle conversation. C’est du texte réinjecté dans la fenêtre, pas un souvenir logé dans le modèle.
- « La fenêtre, c’est la mémoire du modèle. » C’est sa mémoire de travail : temporaire, et remise à zéro. Ce qu’il sait durablement tient dans ses poids, et rien de ce qui traverse la fenêtre ne s’y écrit.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Lost in the Middle: How Language Models Use Long Contexts » — Liu et al., 2023 (EN) : l’étude qui a mis en évidence la courbe en U
- « RULER: What’s the Real Context Size of Your Long-Context Language Models? » — Hsieh et al., 2024 (EN) : le protocole qui mesure la longueur réellement exploitable
- « Context Rot » — Chroma, 2025 (EN) : une série d’expériences sur la dégradation de la qualité à mesure que l’entrée s’allonge
- Qu’est-ce qu’une fenêtre contextuelle ? — LeMagIT (FR) : une définition courte
- Fenêtre de contexte — Wikipédia (FR) : un historique des tailles de fenêtre modèle par modèle
- La documentation d’Anthropic sur la fenêtre de contexte — Anthropic (EN) : pour voir comment un fournisseur compte concrètement les tokens
- Pourquoi le cache clés-valeurs sature la mémoire sur les longs contextes — Sebastian Raschka (EN) : la réponse détaillée
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxTokenLe morceau de texte, mot, bout de mot ou caractère, que le modèle lit et génère, un par un.
- FondamentauxPoids (paramètres)Les milliards de nombres qui stockent tout ce qu'un modèle a appris pendant son entraînement.
- ArchitectureAttention (self-attention)Le mécanisme qui permet à chaque token de regarder les autres pour décider lesquels comptent pour son propre sens.
- ÉcosystèmeRAG (génération augmentée par la recherche)Aller chercher des documents pertinents dans une base de connaissances et les donner au modèle pour qu'il réponde avec des informations à jour et sourcées.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- FondamentauxPrompt (instruction générative)Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.
- ArchitectureMultimodalitéQuand un modèle ne lit plus seulement du texte : image et son sont découpés à leur tour, projetés dans le même espace que les mots, et traités par la même machine.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.