Coût (tarification)
Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.
En une phrase
Section intitulée « En une phrase »Utiliser un modèle par API, c’est-à-dire en interrogeant depuis un programme les serveurs d’un fournisseur, se paie au token, avec un prix pour ce que tu lui envoies et un autre, plus élevé, pour ce qu’il écrit ; l’héberger toi-même déplace la facture vers le matériel, sans la faire disparaître.
L’analogie
Section intitulée « L’analogie »Pense à un taxi. Il y a la prise en charge, le compteur qui tourne pendant la course, et les suppléments : les bagages, la nuit, l’aéroport. Le tarif affiché sur la portière ne dit presque rien de ce que tu paieras : tout dépend du trajet.
Une API de modèle fonctionne pareil. Le prix au million de tokens est le tarif sur la portière ; ta facture, elle, dépend de la longueur de ce que tu envoies, de ce que le modèle écrit, y compris ce que tu ne vois pas, et des options que tu coches. Acheter ta propre voiture, c’est l’auto-hébergement : plus de compteur, mais un véhicule à payer, même quand il reste au garage.
Comment ça marche
Section intitulée « Comment ça marche »Deux compteurs : l’entrée et la sortie
Section intitulée « Deux compteurs : l’entrée et la sortie »Les fournisseurs facturent au token, l’unité de découpage du texte. C’est même écrit dans la définition officielle : pour FranceTerme, le nombre de « jetons textuels » permet « d’estimer et de facturer le coût de fonctionnement » des grands modèles commerciaux.
Chaque requête a deux compteurs. Les tokens d’entrée : ta question, mais aussi les consignes du système, les documents joints, les définitions d’outils et tout l’historique de la conversation. Les tokens de sortie : ce que le modèle génère. La facture est la somme des deux, chacun multiplié par son prix, exprimé presque partout par million de tokens.
La sortie coûte plus cher, et de loin. Relevé en septembre 2026 sur les grilles publiques : cinq fois le prix de l’entrée chez Anthropic et OpenAI, six fois sur le haut de gamme de Google, trois à cinq fois chez Mistral AI. Seuls quelques très petits modèles facturent les deux au même prix. La fiche Inférence explique l’écart : l’entrée est lue d’un seul bloc, la sortie s’écrit un token à la fois, chacun demandant un passage complet dans le modèle.
Ce que tu paies sans le voir
Section intitulée « Ce que tu paies sans le voir »- L’historique. Le modèle ne se souvient de rien entre deux messages : toute la conversation lui est renvoyée à chaque tour, et refacturée en entrée (voir Fenêtre de contexte). Le vingtième message d’une longue discussion coûte bien plus cher que le premier.
- Le raisonnement. Un modèle qui « réfléchit » avant de répondre produit des tokens de réflexion, facturés comme de la sortie, même quand ils ne sont pas affichés. OpenAI l’écrit en toutes lettres : invisibles dans l’API, ils sont « facturés comme des tokens de sortie ». Anthropic prévient que le nombre de tokens facturés « ne correspond pas » au nombre de tokens visibles dans la réponse.
- Les outils. Chez Anthropic, déclarer des outils ajoute à lui seul quelques centaines de tokens de consignes à chaque requête. Un agent qui enchaîne dix tours paie dix fois ce supplément, et son contexte qui grossit.
Ce qui fait baisser la note
Section intitulée « Ce qui fait baisser la note »- Le cache. Quand plusieurs requêtes commencent par le même long préfixe — un règlement intérieur, une documentation —, le fournisseur peut le garder en mémoire. Relire un préfixe en cache coûte environ un dixième du prix normal chez Anthropic, OpenAI, Google et Mistral AI. Mais l’écriture initiale est majorée chez Anthropic, et Google facture en plus le stockage à l’heure : le cache ne rapporte que si le même début sert souvent.
- Les lots. Envoyer ses requêtes en différé, à traiter quand le fournisseur a de la place, divise la facture par deux chez Anthropic, OpenAI et Mistral AI.
À l’inverse, certaines options se paient : environ 10 % de plus pour garantir que le calcul reste dans une région donnée, chez ces trois mêmes fournisseurs, et un tarif majoré chez Google au-delà de 200 000 tokens de contexte.
Un token n’est pas une unité fixe
Section intitulée « Un token n’est pas une unité fixe »Comparer deux prix au million de tokens suppose que les tokens se valent. Ce n’est pas le cas. Chaque modèle a son propre découpage : Anthropic indique que le tokeniseur de ses modèles récents produit environ 30 % de tokens de plus pour le même texte que l’ancien. Et la langue compte : en 2023, Aleksandar Petrov et ses coauteurs ont mesuré, pour un même texte traduit, des écarts de longueur allant jusqu’à quinze fois d’une langue à l’autre. À prix affiché égal, deux langues ne paient pas la même chose.
Héberger soi-même
Section intitulée « Héberger soi-même »Un modèle à poids ouverts ne facture aucun token, mais il faut une carte graphique assez grande pour le contenir. Llama 3.1 70B demande 140 Go de mémoire en 16 bits rien que pour ses poids : plus qu’une carte H100 de 80 Go. Quantifié en 4 bits (voir Quantification), il descend à 35 Go et tient sur une carte de 48 Go, avant de compter la mémoire de travail qui grossit avec la longueur du contexte, le cache clés-valeurs (voir Fenêtre de contexte).
Relevé en septembre 2026 chez le loueur français Scaleway, une H100 de 80 Go coûte environ 2,87 euros hors taxes de l’heure, soit un peu plus de 2 000 euros par mois en continu. Le prix par token qui en découle dépend de tout le reste : combien d’utilisateurs se partagent la carte, et combien de temps elle reste inactive, payée quand même.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- L’écart entre gammes est vertigineux. Relevé le même jour de septembre 2026, un million de tokens de sortie coûte 50 dollars sur les modèles les plus puissants et 10 centimes sur les plus petits : un facteur 500. Choisir le plus petit modèle qui suffit à la tâche est souvent le premier levier d’économie.
- Les prix baissent, à capacité égale. Selon le rapport AI Index 2025 de Stanford, obtenir le niveau de GPT-3.5 coûtait 20 dollars par million de tokens en novembre 2022, et 7 centimes en octobre 2024 : plus de 280 fois moins. La baisse ne vaut pas pour chaque nouvelle version : il arrive qu’une gamme récente coûte plus cher que la précédente.
- L’entraînement est une autre facture. Payé une fois par le fabricant, il ne se voit pas dans la grille d’une API. Ben Cottier et ses coauteurs estiment qu’il est multiplié par 2,4 chaque année depuis 2016 pour les plus gros modèles (voir Entraînement).
Idées reçues
Section intitulée « Idées reçues »- « On paie seulement la réponse qu’on lit. » Avec un modèle qui raisonne, les tokens de réflexion sont facturés comme de la sortie sans être affichés : Google intitule même sa colonne « prix de sortie, tokens de réflexion inclus ». Et l’entrée, historique complet compris, repasse au compteur à chaque message.
- « Le prix au million de tokens suffit pour comparer deux modèles. » Il faut aussi regarder combien de tokens chaque modèle fabrique pour le même texte, combien il en écrit pour réfléchir, et si ton usage profite du cache ou des lots. Le modèle le moins cher au token peut coûter plus cher à la tâche.
- « DeepSeek-V3 a été entraîné pour 5,6 millions de dollars. » Ce chiffre multiplie les 2,788 millions d’heures de calcul du seul entraînement final par un tarif de location supposé de 2 dollars l’heure. Les auteurs précisent eux-mêmes qu’il exclut la recherche et les expériences préalables ; l’achat des puces et les salaires, que Cottier et ses coauteurs identifient comme les plus gros postes, n’y figurent pas davantage.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Jeton textuel » — FranceTerme, Journal officiel du 6 septembre 2024 (FR) : la définition officielle, facturation comprise.
- Tarifs des instances GPU — Scaleway (FR) : le prix horaire du matériel, pour chiffrer un auto-hébergement.
- Pricing — documentation de l’API d’Anthropic (EN) : une grille complète, cache, lots et exemples de calcul compris.
- « AI Index 2025: State of AI in 10 Charts » — Stanford HAI, 2025 (EN) : la baisse du coût à capacité égale.
- « Language Model Tokenizers Introduce Unfairness Between Languages » — Petrov et al., 2023 (EN) : pourquoi toutes les langues ne paient pas pareil.
- « The rising costs of training frontier AI models » — Cottier et al., 2024 (EN) : ce que coûte un entraînement, poste par poste.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxTokenLe morceau de texte, mot, bout de mot ou caractère, que le modèle lit et génère, un par un.
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- ÉcosystèmePoids ouverts (open weights)Un modèle dont on peut télécharger les poids : il tourne chez toi, se modifie, se compresse — sans que tu saches forcément comment il a été fabriqué.
- OptimisationQuantificationRéduire la précision des poids d'un modèle pour le rendre plus léger, plus rapide et utilisable sur du matériel grand public.
- EntraînementEntraînementLa boucle qui règle les poids d'un modèle : mesurer son erreur, calculer dans quel sens corriger chaque nombre, faire un petit pas, et recommencer.
- FondamentauxPrompt (instruction générative)Le texte que le modèle a sous les yeux au moment de répondre, et le seul levier qui reste une fois qu'il est entraîné.
- ÉcosystèmeAgent (IA)Un LLM à qui on laisse choisir la suite : il observe, décide d'une action, l'exécute avec un outil, lit le résultat, et recommence jusqu'à ce qu'il juge la tâche finie.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- ÉthiqueEmpreinte environnementaleCe que coûtent à l'environnement la fabrication du matériel, l'entraînement d'un modèle et chacune de ses réponses : électricité, carbone, eau, métaux, et pourquoi les chiffres qui circulent divergent autant.
- ÉcosystèmeInterface de programmation (API)Le protocole réseau standardisé qui permet aux développeurs d'envoyer des requêtes à un modèle d'intelligence artificielle distant et d'en recevoir les réponses.