Aller au contenu
Éthique

Empreinte environnementale

Ce que coûtent à l'environnement la fabrication du matériel, l'entraînement d'un modèle et chacune de ses réponses : électricité, carbone, eau, métaux, et pourquoi les chiffres qui circulent divergent autant.

7 min de lecture
  • #énergie
  • #carbone
  • #eau
  • #cycle de vie

L’empreinte environnementale d’un modèle, c’est l’addition de tout ce qu’il pèse sur la planète, de la fabrication des puces à chacune de ses réponses en passant par son entraînement, mesurée en électricité, en gaz à effet de serre, en eau et en métaux ; un chiffre isolé ne veut rien dire sans ce qu’il compte.

Pense à une voiture. Son empreinte ne se résume pas à ce qui sort du pot d’échappement : il a fallu extraire des métaux et l’assembler en usine avant le premier kilomètre, puis chaque trajet brûle du carburant, plus ou moins polluant selon ce qu’on met dans le réservoir.

Un modèle d’IA suit le même schéma, en trois temps : fabriquer les serveurs et les puces, entraîner le modèle une fois, puis le faire répondre des millions de fois. Selon qu’un chiffre compte l’usine, le carburant ou les deux, il ne raconte pas la même histoire de la même machine.

  • La fabrication du matériel. Extraire des minerais, graver les puces, assembler les serveurs, construire les bâtiments. On parle d’émissions « intrinsèques », réparties sur la durée de vie du matériel. C’est le poste le plus mal connu : il n’existe pas encore d’inventaire fiable du cycle de vie des cartes graphiques, écrit Mistral AI en 2025, qui a dû estimer des impacts pesant pourtant « une part significative » du total.
  • L’entraînement. Un coût ponctuel et concentré : des semaines ou des mois de calcul sur des milliers de cartes (voir Pré-entraînement). Il comprend aussi les essais ratés et les modèles intermédiaires, souvent oubliés.
  • L’inférence. Un coût répété à chaque requête, qui dépend du nombre de paramètres actifs, du nombre de tokens écrits et du matériel. Chaque réponse pèse peu ; multipliée par des millions d’utilisateurs, la somme peut finir par dépasser l’entraînement.

Pour l’électricité, l’énergie, c’est la durée de calcul multipliée par le nombre de puces, leur puissance, et le PUE (power usage effectiveness) du centre de données : le rapport entre l’énergie totale du bâtiment, refroidissement compris, et celle des seules machines. En 2022, David Patterson et ses coauteurs, chez Google, donnent 1,58 pour la moyenne du secteur en 2020, et environ 1,10 pour les grands fournisseurs de nuage.

Les émissions, c’est cette énergie multipliée par l’intensité carbone du réseau électrique, et c’est là que tout se joue. BLOOM, un modèle ouvert de 176 milliards de paramètres, a été entraîné en France en 2022 sur le supercalculateur Jean Zay, avec une électricité à 57 grammes d’équivalent CO₂ par kilowattheure. GPT-3, le modèle d’OpenAI de 2020, l’a été sur un réseau estimé à 429 grammes. Selon les estimations réunies par Alexandra Sasha Luccioni et ses coauteurs, BLOOM a demandé environ trois fois moins d’énergie, et émis près de vingt fois moins.

Un centre de données boit de trois façons : l’eau évaporée sur place pour refroidir les machines, celle des centrales qui produisent son électricité, et l’eau ultra-pure qu’exige la fabrication des puces. En 2023, Pengfei Li et ses coauteurs insistent sur une distinction que les titres de presse écrasent souvent : l’eau prélevée peut être rendue au milieu, l’eau consommée ne l’est pas, le plus souvent parce qu’elle s’est évaporée. Et un litre ne pèse pas pareil dans une région humide et dans une région en sécheresse.

Deux chiffres « par requête » ne se comparent qu’à périmètre égal. Il faut au moins savoir :

  • s’ils comptent la fabrication du matériel, ou seulement l’électricité ;
  • quelle électricité : celle du réseau réel où tourne le calcul, ou celle que l’entreprise a achetée sous forme de contrats d’énergie renouvelable, qui peut ramener ses émissions « nettes » presque à zéro ;
  • s’il s’agit d’une moyenne ou d’une médiane : une minorité de requêtes très longues, avec images ou avec raisonnement, peut peser lourd dans la moyenne sans bouger la médiane ;
  • qui a mesuré, et si quelqu’un d’extérieur a vérifié.
  • BLOOM, un bilan complet. L’équipe de Luccioni estime son empreinte à 50,5 tonnes d’équivalent CO₂ : 24,7 tonnes pour le calcul lui-même, 14,6 tonnes pour les machines allumées sans calculer, 11,2 tonnes pour la fabrication du matériel. Les modèles intermédiaires du projet ont émis plus que le modèle final. En service, BLOOM émettait environ 19 kilogrammes par jour, et les trois quarts de son énergie servaient seulement à garder le modèle chargé en mémoire.
  • Mistral Large 2, la première analyse de cycle de vie d’un fournisseur. Menée avec Carbone 4 et le soutien de l’ADEME, publiée en juillet 2025, elle chiffre « l’empreinte environnementale de l’entraînement de Mistral Large 2 : en janvier 2025, et après 18 mois d’utilisation » à 20 400 tonnes d’équivalent CO₂, 281 000 m³ d’eau consommée et 660 kg d’équivalent antimoine, l’unité de l’épuisement des métaux, fabrication des serveurs comprise ; le billet ne sépare pas l’entraînement de l’usage. L’impact marginal d’une réponse de 400 tokens dans Le Chat, hors terminal de l’utilisateur, est de 1,14 gramme d’équivalent CO₂ et 45 mL d’eau.
  • Google, une médiane mesurée en production. En août 2025, Google publie pour une requête texte médiane de son assistant Gemini 0,24 wattheure, 0,03 gramme d’équivalent CO₂ et 0,26 mL d’eau. Le périmètre n’est pas celui de Mistral : une médiane de requêtes texte, et un carbone compté après déduction des achats d’électricité décarbonée de Google : 94 grammes par kilowattheure en 2024, au lieu des 345 du réseau réellement utilisé. Aucune vérification extérieure non plus, de l’aveu même de l’entreprise. Mettre les deux chiffres côte à côte n’a pas de sens.
  • L’échelle mondiale. L’Agence internationale de l’énergie estime qu’en 2024 les centres de données, tous usages confondus, ont consommé environ 415 térawattheures, 1,5 % de l’électricité mondiale. Son scénario de référence en prévoit environ 945 en 2030, avec l’IA pour principal moteur.
  • Les leviers. Choisir le plus petit modèle qui suffit : Mistral constate un impact à peu près proportionnel à la taille. Préférer une architecture qui active peu de paramètres (voir Mélange d’experts), quantifier ou distiller (voir Quantification et Distillation), calculer sur un réseau peu carboné. Et ne pas activer le raisonnement sans besoin : en moyenne, il multiplie l’énergie par 30 (voir Modèle de raisonnement).
  • « Entraîner un modèle d’IA émet autant que cinq voitures sur toute leur vie. » Le chiffre vient d’une étude de 2019 et portait sur une recherche d’architecture automatisée, pas sur un entraînement ordinaire, qui ne pesait qu’environ 87 kg dans le même tableau. C’était aussi une extrapolation : Google, qui avait mené cette recherche, a mesuré des émissions 88 fois plus faibles. Il ne dit rien pour autant des LLM récents, bien plus gros : 552 tonnes estimées pour GPT-3.
  • « L’essentiel de l’impact, c’est l’entraînement : ensuite, l’utiliser ne coûte presque rien. » Chez Google, de 2019 à 2021, environ trois cinquièmes de l’énergie consacrée à l’apprentissage automatique servaient à l’inférence. Pour de petits modèles de la famille BLOOM, Luccioni et ses coauteurs calculent que l’énergie de l’usage rattrape celle de leur entraînement, ajustement compris, après 200 à 590 millions de requêtes, un volume vite atteint par un service grand public.
  • « Chaque question à un chatbot consomme dix fois plus qu’une recherche web, 3 wattheures. » Ce chiffre date de 2023 et reposait sur des hypothèses devenues pessimistes. L’institut Epoch AI estime une requête typique à GPT-4o autour de 0,3 wattheure en 2025. Mais il n’existe pas « une » consommation par requête : Epoch compte de 2,5 à 40 wattheures pour de très longs documents en entrée.

Voir aussi