Biais (d'un modèle)
Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.
En une phrase
Section intitulée « En une phrase »Un biais, c’est une erreur qui se répète toujours dans le même sens : le modèle ne se trompe pas au hasard, il penche — parce que les textes dont on a tiré ses poids penchaient déjà, et parce que les corrections qu’on lui applique ensuite penchent à leur tour.
L’analogie
Section intitulée « L’analogie »Une balance de salle de bain qui affiche deux kilos de trop n’est pas cassée. Elle est parfaitement régulière, et c’est exactement ce qui la rend traître : tu ne t’en aperçois jamais en la regardant, seulement en la comparant à une autre.
Sauf qu’ici, personne n’a déréglé la balance exprès. On l’a fabriquée en moyennant des milliards de textes écrits par des gens, à une époque, dans des pays et dans des langues donnés. Le modèle ne fait pas de statistique sur le monde ; il en fait sur ce qui a été écrit du monde, publié, et resté en ligne assez longtemps pour être aspiré.
Comment ça marche
Section intitulée « Comment ça marche »Trois endroits où le biais entre
Section intitulée « Trois endroits où le biais entre »- Les données. Le web n’est pas un échantillon du monde. Certaines langues, certains pays, certaines générations et certains milieux y écrivent beaucoup plus que d’autres, et ce déséquilibre est le point de départ.
- L’entraînement. Une régularité fréquente devient une réponse par défaut. Pire : le modèle a souvent tendance à amplifier la fréquence plutôt qu’à la reproduire — si 70 % des textes associent un métier à un genre, la sortie peut monter bien plus haut.
- L’alignement. Le RLHF corrige selon les préférences d’un panel d’annotateurs recruté quelque part, à un moment, et selon une charte écrite par quelqu’un. C’est un correctif, et c’est aussi une couche de jugements supplémentaires.
On l’a mesuré d’abord sur les plongements
Section intitulée « On l’a mesuré d’abord sur les plongements »Avant les assistants, le biais s’est vu dans les embeddings. Bolukbasi et ses co-auteurs montrent en 2016 que l’analogie « homme → informaticien » rend « femme → femme au foyer » : la géométrie de l’espace encode le stéréotype.
Caliskan, Bryson et Narayanan vont plus loin en 2017 dans Science : ils rejouent sur des vecteurs de mots les tests d’association implicite de la psychologie, et retrouvent les mêmes associations que chez les humains — y compris les associations parfaitement neutres, comme « fleurs / agréable ». C’est la démonstration que le mécanisme n’est pas moral, il est statistique. Le modèle n’a pas d’opinion ; il a des fréquences.
Puis sur les réponses, avec des jeux de test
Section intitulée « Puis sur les réponses, avec des jeux de test »- BBQ (Parrish et al., 2022) pose des questions où la bonne réponse est « on ne peut pas savoir », et mesure à quelle fréquence le modèle tranche quand même, et dans quel sens.
- Gender Shades (Buolamwini et Gebru, 2018), côté vision : jusqu’à 34 points d’écart de taux d’erreur entre les hommes à peau claire et les femmes à peau foncée, sur des outils commerciaux déjà vendus.
- Stable Bias (Luccioni et al., 2023), côté images générées : demander un métier sans autre précision produit des résultats bien plus tranchés que la réalité statistique de ce métier.
Ces jeux de test ne sont pas des preuves de neutralité quand ils passent. Ils repèrent ce qu’ils ont été conçus pour repérer, dans une langue, sur des catégories choisies.
Corriger déplace le problème
Section intitulée « Corriger déplace le problème »Quatre leviers — filtrer les données, réécrire, aligner, ajouter une consigne système — et quatre séries d’effets de bord. L’illustration la plus commentée reste la déroute de Gemini en février 2024 : une consigne de diversité appliquée uniformément, sans égard au contexte, a produit des images historiques absurdes. Le correctif était sincère ; son application aveugle a fabriqué une autre erreur.
Ce que le droit en dit
Section intitulée « Ce que le droit en dit »Le droit français ne sanctionne pas un biais, il sanctionne une discrimination : un effet concret sur une personne, dans l’emploi, le logement, l’éducation ou l’accès à un service, et sur un critère protégé. La nuance est utile — un écart mesuré dans un test n’est pas encore un délit, et un système « globalement équilibré » peut parfaitement discriminer dans un cas d’usage précis.
Le Défenseur des droits et la CNIL alertaient dès 2020 sur l’automatisation des discriminations. Le règlement européen sur l’IA, adopté en 2024, y ajoute des obligations de gouvernance des données et d’évaluation pour les systèmes classés à haut risque — dont le tri de candidatures.
Dans la vraie vie
Section intitulée « Dans la vraie vie »- Amazon a développé entre 2014 et 2017 un outil de tri de CV entraîné sur dix ans de candidatures reçues. Il a appris à pénaliser le mot « women’s » et les diplômes de deux universités féminines. Le projet a été abandonné (Reuters, 2018).
- La traduction depuis une langue sans genre grammatical : « the nurse » devient « l’infirmière », « the doctor » devient « le médecin ». Test que tu peux faire toi-même en trente secondes, et qui reste le plus parlant.
- Demander une image de « PDG », puis de « personne qui fait le ménage », et comparer.
- Les langues : un modèle est bien meilleur en anglais qu’en wolof ou en breton, parce qu’il y a mille fois plus d’anglais dans les données. Ce n’est pas une opinion sur ces langues, c’est un déséquilibre de corpus — avec des conséquences très concrètes sur qui peut se servir de ces outils.
- Le prompt système de neutralité d’un assistant grand public est un choix éditorial d’entreprise, pas une propriété du modèle.
Idées reçues
Section intitulée « Idées reçues »- « Un algorithme est neutre, c’est une machine. » La neutralité supposerait qu’il n’ait rien appris de personne. Ses poids sont la moyenne pondérée de textes écrits par des humains situés, et le filtrage, l’alignement et le prompt système ajoutent trois séries de décisions humaines par-dessus. Le Défenseur des droits et la CNIL le disaient dès 2020 : c’est justement l’apparence de neutralité qui rend ces effets difficiles à contester.
- « Il suffit de retirer les données problématiques. » Le filtrage automatique retire aussi ce qu’il ne comprend pas : en auditant le corpus C4, Dodge et ses co-auteurs ont montré en 2021 que les listes de mots interdits supprimaient massivement des textes écrits par et pour des personnes LGBT+, ainsi que des documents en anglais afro-américain. On corrige un biais en en fabriquant un autre.
- « Un biais, c’est la même chose qu’une hallucination. » Une hallucination est ponctuelle et imprévisible ; un biais est régulier et prévisible — c’est sa définition même. D’où deux façons de les débusquer : on repère une hallucination en vérifiant une réponse, on ne repère un biais qu’en comparant beaucoup de réponses entre elles.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- « Algorithmes : prévenir l’automatisation des discriminations » — Défenseur des droits et CNIL, 2020 (FR).
- « Man is to Computer Programmer as Woman is to Homemaker? » — Bolukbasi et al., 2016 (EN).
- « Semantics derived automatically from language corpora contain human-like biases » — Caliskan, Bryson et Narayanan, Science, 2017 (EN).
- « Gender Shades » — Buolamwini et Gebru, 2018 (EN).
- « Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus » — Dodge et al., 2021 (EN) : ce que le filtrage supprime au passage.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxEmbedding (plongement)La traduction d'un mot ou d'un texte en une liste de nombres qui capture son sens : des coordonnées dans l'espace du sens.
- EntraînementRLHFL'entraînement par comparaison de réponses, qui apprend à un modèle non pas à répondre juste, mais à répondre comme on l'attend.
- EntraînementFine-tuning (réglage fin)Poursuivre l'entraînement d'un modèle déjà entraîné sur tes propres données pour lui apprendre un style, un domaine ou une tâche.
- FondamentauxHallucinationQuand un LLM affirme avec aplomb des choses fausses ou inventées : sources, faits ou références imaginaires.
- ArchitectureMultimodalitéQuand un modèle ne lit plus seulement du texte : image et son sont découpés à leur tour, projetés dans le même espace que les mots, et traités par la même machine.
- EntraînementDonnées d'entraînementLes textes sur lesquels on a réglé les poids d'un modèle : d'où ils viennent, ce qu'on en jette, et pourquoi ils décident de ce qu'il saura dire.
- EntraînementAlignement des modèlesLe processus mathématique et éthique visant à faire respecter par un modèle de langage des consignes de sécurité, d'utilité et de retenue : le triptyque HHH, l'IA constitutionnelle et le refus excessif.