Empreinte environnementale
Ce que coûtent à l'environnement la fabrication du matériel, l'entraînement d'un modèle et chacune de ses réponses : électricité, carbone, eau, métaux, et pourquoi les chiffres qui circulent divergent autant.
En une phrase
Section intitulée « En une phrase »L’empreinte environnementale d’un modèle, c’est l’addition de tout ce qu’il pèse sur la planète, de la fabrication des puces à chacune de ses réponses en passant par son entraînement, mesurée en électricité, en gaz à effet de serre, en eau et en métaux ; un chiffre isolé ne veut rien dire sans ce qu’il compte.
L’analogie
Section intitulée « L’analogie »Pense à une voiture. Son empreinte ne se résume pas à ce qui sort du pot d’échappement : il a fallu extraire des métaux et l’assembler en usine avant le premier kilomètre, puis chaque trajet brûle du carburant, plus ou moins polluant selon ce qu’on met dans le réservoir.
Un modèle d’IA suit le même schéma, en trois temps : fabriquer les serveurs et les puces, entraîner le modèle une fois, puis le faire répondre des millions de fois. Selon qu’un chiffre compte l’usine, le carburant ou les deux, il ne raconte pas la même histoire de la même machine.
Comment ça marche
Section intitulée « Comment ça marche »Trois postes, trois logiques
Section intitulée « Trois postes, trois logiques »- La fabrication du matériel. Extraire des minerais, graver les puces, assembler les serveurs, construire les bâtiments. On parle d’émissions « intrinsèques », réparties sur la durée de vie du matériel. C’est le poste le plus mal connu : il n’existe pas encore d’inventaire fiable du cycle de vie des cartes graphiques, écrit Mistral AI en 2025, qui a dû estimer des impacts pesant pourtant « une part significative » du total.
- L’entraînement. Un coût ponctuel et concentré : des semaines ou des mois de calcul sur des milliers de cartes (voir Pré-entraînement). Il comprend aussi les essais ratés et les modèles intermédiaires, souvent oubliés.
- L’inférence. Un coût répété à chaque requête, qui dépend du nombre de paramètres actifs, du nombre de tokens écrits et du matériel. Chaque réponse pèse peu ; multipliée par des millions d’utilisateurs, la somme peut finir par dépasser l’entraînement.
Une formule simple, un multiplicateur énorme
Section intitulée « Une formule simple, un multiplicateur énorme »Pour l’électricité, l’énergie, c’est la durée de calcul multipliée par le nombre de puces, leur puissance, et le PUE (power usage effectiveness) du centre de données : le rapport entre l’énergie totale du bâtiment, refroidissement compris, et celle des seules machines. En 2022, David Patterson et ses coauteurs, chez Google, donnent 1,58 pour la moyenne du secteur en 2020, et environ 1,10 pour les grands fournisseurs de nuage.
Les émissions, c’est cette énergie multipliée par l’intensité carbone du réseau électrique, et c’est là que tout se joue. BLOOM, un modèle ouvert de 176 milliards de paramètres, a été entraîné en France en 2022 sur le supercalculateur Jean Zay, avec une électricité à 57 grammes d’équivalent CO₂ par kilowattheure. GPT-3, le modèle d’OpenAI de 2020, l’a été sur un réseau estimé à 429 grammes. Selon les estimations réunies par Alexandra Sasha Luccioni et ses coauteurs, BLOOM a demandé environ trois fois moins d’énergie, et émis près de vingt fois moins.
L’eau : prélever n’est pas consommer
Section intitulée « L’eau : prélever n’est pas consommer »Un centre de données boit de trois façons : l’eau évaporée sur place pour refroidir les machines, celle des centrales qui produisent son électricité, et l’eau ultra-pure qu’exige la fabrication des puces. En 2023, Pengfei Li et ses coauteurs insistent sur une distinction que les titres de presse écrasent souvent : l’eau prélevée peut être rendue au milieu, l’eau consommée ne l’est pas, le plus souvent parce qu’elle s’est évaporée. Et un litre ne pèse pas pareil dans une région humide et dans une région en sécheresse.
Le chiffre dépend de ce qu’on compte
Section intitulée « Le chiffre dépend de ce qu’on compte »Deux chiffres « par requête » ne se comparent qu’à périmètre égal. Il faut au moins savoir :
- s’ils comptent la fabrication du matériel, ou seulement l’électricité ;
- quelle électricité : celle du réseau réel où tourne le calcul, ou celle que l’entreprise a achetée sous forme de contrats d’énergie renouvelable, qui peut ramener ses émissions « nettes » presque à zéro ;
- s’il s’agit d’une moyenne ou d’une médiane : une minorité de requêtes très longues, avec images ou avec raisonnement, peut peser lourd dans la moyenne sans bouger la médiane ;
- qui a mesuré, et si quelqu’un d’extérieur a vérifié.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- BLOOM, un bilan complet. L’équipe de Luccioni estime son empreinte à 50,5 tonnes d’équivalent CO₂ : 24,7 tonnes pour le calcul lui-même, 14,6 tonnes pour les machines allumées sans calculer, 11,2 tonnes pour la fabrication du matériel. Les modèles intermédiaires du projet ont émis plus que le modèle final. En service, BLOOM émettait environ 19 kilogrammes par jour, et les trois quarts de son énergie servaient seulement à garder le modèle chargé en mémoire.
- Mistral Large 2, la première analyse de cycle de vie d’un fournisseur. Menée avec Carbone 4 et le soutien de l’ADEME, publiée en juillet 2025, elle chiffre « l’empreinte environnementale de l’entraînement de Mistral Large 2 : en janvier 2025, et après 18 mois d’utilisation » à 20 400 tonnes d’équivalent CO₂, 281 000 m³ d’eau consommée et 660 kg d’équivalent antimoine, l’unité de l’épuisement des métaux, fabrication des serveurs comprise ; le billet ne sépare pas l’entraînement de l’usage. L’impact marginal d’une réponse de 400 tokens dans Le Chat, hors terminal de l’utilisateur, est de 1,14 gramme d’équivalent CO₂ et 45 mL d’eau.
- Google, une médiane mesurée en production. En août 2025, Google publie pour une requête texte médiane de son assistant Gemini 0,24 wattheure, 0,03 gramme d’équivalent CO₂ et 0,26 mL d’eau. Le périmètre n’est pas celui de Mistral : une médiane de requêtes texte, et un carbone compté après déduction des achats d’électricité décarbonée de Google : 94 grammes par kilowattheure en 2024, au lieu des 345 du réseau réellement utilisé. Aucune vérification extérieure non plus, de l’aveu même de l’entreprise. Mettre les deux chiffres côte à côte n’a pas de sens.
- L’échelle mondiale. L’Agence internationale de l’énergie estime qu’en 2024 les centres de données, tous usages confondus, ont consommé environ 415 térawattheures, 1,5 % de l’électricité mondiale. Son scénario de référence en prévoit environ 945 en 2030, avec l’IA pour principal moteur.
- Les leviers. Choisir le plus petit modèle qui suffit : Mistral constate un impact à peu près proportionnel à la taille. Préférer une architecture qui active peu de paramètres (voir Mélange d’experts), quantifier ou distiller (voir Quantification et Distillation), calculer sur un réseau peu carboné. Et ne pas activer le raisonnement sans besoin : en moyenne, il multiplie l’énergie par 30 (voir Modèle de raisonnement).
Idées reçues
Section intitulée « Idées reçues »- « Entraîner un modèle d’IA émet autant que cinq voitures sur toute leur vie. » Le chiffre vient d’une étude de 2019 et portait sur une recherche d’architecture automatisée, pas sur un entraînement ordinaire, qui ne pesait qu’environ 87 kg dans le même tableau. C’était aussi une extrapolation : Google, qui avait mené cette recherche, a mesuré des émissions 88 fois plus faibles. Il ne dit rien pour autant des LLM récents, bien plus gros : 552 tonnes estimées pour GPT-3.
- « L’essentiel de l’impact, c’est l’entraînement : ensuite, l’utiliser ne coûte presque rien. » Chez Google, de 2019 à 2021, environ trois cinquièmes de l’énergie consacrée à l’apprentissage automatique servaient à l’inférence. Pour de petits modèles de la famille BLOOM, Luccioni et ses coauteurs calculent que l’énergie de l’usage rattrape celle de leur entraînement, ajustement compris, après 200 à 590 millions de requêtes, un volume vite atteint par un service grand public.
- « Chaque question à un chatbot consomme dix fois plus qu’une recherche web, 3 wattheures. » Ce chiffre date de 2023 et reposait sur des hypothèses devenues pessimistes. L’institut Epoch AI estime une requête typique à GPT-4o autour de 0,3 wattheure en 2025. Mais il n’existe pas « une » consommation par requête : Epoch compte de 2,5 à 40 wattheures pour de très longs documents en entrée.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Notre contribution à un standard environnemental mondial pour l’IA » — Mistral AI, 2025 (FR) : la première analyse de cycle de vie publiée par un fournisseur de modèles.
- « Empreinte en gaz à effet de serre » — FranceTerme (FR) : le terme officiel, et sa différence avec l’empreinte carbone.
- Le référentiel AFNOR pour une IA frugale — Numérique écoresponsable, gouvernement français, 2024 (FR) : la méthode française d’évaluation et ses bonnes pratiques.
- « Estimating the Carbon Footprint of BLOOM » — Luccioni, Viguier et Ligozat, 2022 (EN) : fabrication, entraînement, veille et inférence d’un même modèle.
- « Power Hungry Processing: Watts Driving the Cost of AI Deployment? » — Luccioni, Jernite et Strubell, 2023 (EN) : l’inférence mesurée sur 88 modèles.
- Energy and AI — Agence internationale de l’énergie, 2025 (EN) : la consommation des centres de données et ses scénarios.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- ÉcosystèmeCoût (tarification)Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.
- FondamentauxModèle de raisonnement (reasoning model)Un LLM entraîné à écrire un long brouillon avant de répondre : ce qu'il gagne sur les problèmes difficiles, ce qu'il coûte, et pourquoi son brouillon n'est pas une fenêtre sur sa pensée.
- ArchitectureMélange d'experts (MoE)Une architecture où chaque token ne passe que par quelques sous-réseaux choisis parmi beaucoup : le modèle grossit sans que chaque mot coûte plus cher à calculer.
- OptimisationQuantificationRéduire la précision des poids d'un modèle pour le rendre plus léger, plus rapide et utilisable sur du matériel grand public.
- EntraînementDistillationEntraîner un petit modèle à imiter les réponses d'un grand, pour garder l'essentiel de ses capacités à une fraction de sa taille.
- EntraînementLois d'échelle (scaling laws)Les régularités mesurées qui relient la taille d'un modèle, le volume de ses données et le calcul dépensé à la qualité de ses prédictions, et ce qu'elles ne permettent pas de prédire.
- EntraînementPré-entraînementLa première phase de la vie d'un LLM, et de loin la plus chère : des semaines de calcul à deviner le token suivant sur des milliers de milliards de tokens, pour obtenir un modèle de base.
- ÉcosystèmePoids ouverts (open weights)Un modèle dont on peut télécharger les poids : il tourne chez toi, se modifie, se compresse — sans que tu saches forcément comment il a été fabriqué.