Aller au contenu
Éthique

Biais (d'un modèle)

Un écart systématique dans les réponses d'un modèle, hérité des textes qui ont fixé ses poids et des choix faits pour l'aligner — pas une erreur au hasard, mais toujours la même, dans le même sens.

6 min de lecture
  • #discrimination
  • #données d'entraînement
  • #évaluation
  • #alignement

Un biais, c’est une erreur qui se répète toujours dans le même sens : le modèle ne se trompe pas au hasard, il penche — parce que les textes dont on a tiré ses poids penchaient déjà, et parce que les corrections qu’on lui applique ensuite penchent à leur tour.

Une balance de salle de bain qui affiche deux kilos de trop n’est pas cassée. Elle est parfaitement régulière, et c’est exactement ce qui la rend traître : tu ne t’en aperçois jamais en la regardant, seulement en la comparant à une autre.

Sauf qu’ici, personne n’a déréglé la balance exprès. On l’a fabriquée en moyennant des milliards de textes écrits par des gens, à une époque, dans des pays et dans des langues donnés. Le modèle ne fait pas de statistique sur le monde ; il en fait sur ce qui a été écrit du monde, publié, et resté en ligne assez longtemps pour être aspiré.

  • Les données. Le web n’est pas un échantillon du monde. Certaines langues, certains pays, certaines générations et certains milieux y écrivent beaucoup plus que d’autres, et ce déséquilibre est le point de départ.
  • L’entraînement. Une régularité fréquente devient une réponse par défaut. Pire : le modèle a souvent tendance à amplifier la fréquence plutôt qu’à la reproduire — si 70 % des textes associent un métier à un genre, la sortie peut monter bien plus haut.
  • L’alignement. Le RLHF corrige selon les préférences d’un panel d’annotateurs recruté quelque part, à un moment, et selon une charte écrite par quelqu’un. C’est un correctif, et c’est aussi une couche de jugements supplémentaires.

Avant les assistants, le biais s’est vu dans les embeddings. Bolukbasi et ses co-auteurs montrent en 2016 que l’analogie « homme → informaticien » rend « femme → femme au foyer » : la géométrie de l’espace encode le stéréotype.

Caliskan, Bryson et Narayanan vont plus loin en 2017 dans Science : ils rejouent sur des vecteurs de mots les tests d’association implicite de la psychologie, et retrouvent les mêmes associations que chez les humains — y compris les associations parfaitement neutres, comme « fleurs / agréable ». C’est la démonstration que le mécanisme n’est pas moral, il est statistique. Le modèle n’a pas d’opinion ; il a des fréquences.

  • BBQ (Parrish et al., 2022) pose des questions où la bonne réponse est « on ne peut pas savoir », et mesure à quelle fréquence le modèle tranche quand même, et dans quel sens.
  • Gender Shades (Buolamwini et Gebru, 2018), côté vision : jusqu’à 34 points d’écart de taux d’erreur entre les hommes à peau claire et les femmes à peau foncée, sur des outils commerciaux déjà vendus.
  • Stable Bias (Luccioni et al., 2023), côté images générées : demander un métier sans autre précision produit des résultats bien plus tranchés que la réalité statistique de ce métier.

Ces jeux de test ne sont pas des preuves de neutralité quand ils passent. Ils repèrent ce qu’ils ont été conçus pour repérer, dans une langue, sur des catégories choisies.

Quatre leviers — filtrer les données, réécrire, aligner, ajouter une consigne système — et quatre séries d’effets de bord. L’illustration la plus commentée reste la déroute de Gemini en février 2024 : une consigne de diversité appliquée uniformément, sans égard au contexte, a produit des images historiques absurdes. Le correctif était sincère ; son application aveugle a fabriqué une autre erreur.

Le droit français ne sanctionne pas un biais, il sanctionne une discrimination : un effet concret sur une personne, dans l’emploi, le logement, l’éducation ou l’accès à un service, et sur un critère protégé. La nuance est utile — un écart mesuré dans un test n’est pas encore un délit, et un système « globalement équilibré » peut parfaitement discriminer dans un cas d’usage précis.

Le Défenseur des droits et la CNIL alertaient dès 2020 sur l’automatisation des discriminations. Le règlement européen sur l’IA, adopté en 2024, y ajoute des obligations de gouvernance des données et d’évaluation pour les systèmes classés à haut risque — dont le tri de candidatures.

  • Amazon a développé entre 2014 et 2017 un outil de tri de CV entraîné sur dix ans de candidatures reçues. Il a appris à pénaliser le mot « women’s » et les diplômes de deux universités féminines. Le projet a été abandonné (Reuters, 2018).
  • La traduction depuis une langue sans genre grammatical : « the nurse » devient « l’infirmière », « the doctor » devient « le médecin ». Test que tu peux faire toi-même en trente secondes, et qui reste le plus parlant.
  • Demander une image de « PDG », puis de « personne qui fait le ménage », et comparer.
  • Les langues : un modèle est bien meilleur en anglais qu’en wolof ou en breton, parce qu’il y a mille fois plus d’anglais dans les données. Ce n’est pas une opinion sur ces langues, c’est un déséquilibre de corpus — avec des conséquences très concrètes sur qui peut se servir de ces outils.
  • Le prompt système de neutralité d’un assistant grand public est un choix éditorial d’entreprise, pas une propriété du modèle.
  • « Un algorithme est neutre, c’est une machine. » La neutralité supposerait qu’il n’ait rien appris de personne. Ses poids sont la moyenne pondérée de textes écrits par des humains situés, et le filtrage, l’alignement et le prompt système ajoutent trois séries de décisions humaines par-dessus. Le Défenseur des droits et la CNIL le disaient dès 2020 : c’est justement l’apparence de neutralité qui rend ces effets difficiles à contester.
  • « Il suffit de retirer les données problématiques. » Le filtrage automatique retire aussi ce qu’il ne comprend pas : en auditant le corpus C4, Dodge et ses co-auteurs ont montré en 2021 que les listes de mots interdits supprimaient massivement des textes écrits par et pour des personnes LGBT+, ainsi que des documents en anglais afro-américain. On corrige un biais en en fabriquant un autre.
  • « Un biais, c’est la même chose qu’une hallucination. » Une hallucination est ponctuelle et imprévisible ; un biais est régulier et prévisible — c’est sa définition même. D’où deux façons de les débusquer : on repère une hallucination en vérifiant une réponse, on ne repère un biais qu’en comparant beaucoup de réponses entre elles.

Voir aussi