Aller au contenu
Éthique

Détection de texte généré

Le fonctionnement des détecteurs de texte d'IA, leurs limites théoriques et leur biais prouvé contre les rédacteurs non anglophones natifs.

6 min de lecture
  • #éthique
  • #détection
  • #école
  • #statistiques

La détection de texte généré regroupe les méthodes logicielles qui tentent de deviner si un écrit provient d’un être humain ou d’un grand modèle de langage en analysant la régularité statistique de ses mots.

Imagine un critique musical qui prétend savoir si une mélodie de violon a été jouée par un concertiste en chair et en os ou synthétisée par une boîte à rythmes électronique. Pour trancher, le critique écoute le tempo : si chaque mesure tombe au centième de seconde près sans la moindre hésitation, il en déduit que c’est une machine. Si le morceau alterne des accélérations brutales, des soupirs et de légers frottements d’archet imprévus, il applaudit l’interprétation humaine.

Mais imagine maintenant un élève de conservatoire exceptionnellement rigoureux et appliqué. Il joue la partition avec une méticulosité absolue, respectant le métronome à la perfection. Le critique, n’entendant aucun écart, déclare avec mépris : « C’est un robot ! ». L’élève est injustement accusé de tricherie simplement parce qu’il a joué proprement.

Les détecteurs de texte IA fonctionnent exactement comme ce critique : ils traquent la régularité statistique du vocabulaire. Dès qu’un être humain rédige un texte formel, soigné ou convenu, le logiciel s’affole et crie au plagiat algorithmique.

Face à l’avalanche de devoirs scolaires et d’articles générés par des outils comme ChatGPT, une myriade de logiciels commerciaux ont promis aux enseignants et aux universités de déceler les faux textes en un clic.

Leur mécanisme ne repose sur aucune magie cryptographique : ils évaluent des propriétés statistiques de surface.

La méthode la plus courante consiste à faire relire le texte soumis par un second modèle de langage pour mesurer deux grandeurs clés :

  1. La perplexité : C’est le degré d’étonnement du modèle face à chaque mot. Un grand modèle de langage cherche par conception à minimiser l’entropie : il favorise les mots les plus probables et les plus prévisibles dans le contexte. Un texte généré par une IA présente donc une perplexité très basse et uniforme. À l’inverse, un rédacteur humain saute d’une idée à l’autre, emploie des métaphores surprenantes ou des tournures rares, ce qui fait bondir la perplexité.
  2. La variabilité de structure (Burstiness) : Les humains alternent naturellement des phrases très longues et foisonnantes avec des phrases courtes et percutantes. Les modèles de langage, eux, ont tendance à lisser leur style, produisant des paragraphes aux longueurs de phrases et aux cadences étrangement régulières.

Si un texte aligne des phrases de taille moyenne avec un vocabulaire très prévisible, le détecteur lui attribue un score élevé de probabilité d’origine artificielle.

Des chercheurs en mathématiques et en informatique théorique (notamment Sadasivan et son équipe en 2023) ont apporté la preuve formelle des limites de cette approche : il est fondamentalement impossible de concevoir un détecteur statistique infaillible.

Pourquoi ? Parce que l’objectif même de l’entraînement des LLM est d’imiter à la perfection la distribution statistique du langage humain. Plus les modèles deviennent intelligents et performants, plus leurs écrits ressemblent à ceux des meilleurs auteurs, et plus la frontière mathématique entre production humaine et artificielle disparaît. À terme, la détection statistique revient à tirer à pile ou face.

Cette dépendance à la prévisibilité lexicale a engendré une discrimination grave et scientifiquement documentée.

Une équipe de recherche de l’Université de Stanford (Liang et al., 2023) a passé au crible sept détecteurs commerciaux très répandus en leur soumettant des copies rédigées par des étudiants humains. Le résultat a été édifiant :

  • Sur des rédactions écrites par des lycéens américains anglophones natifs, les outils ont été précis.
  • Mais sur des essais authentiques rédigés par des étudiants étrangers passant le test d’anglais TOEFL, les détecteurs ont accusé à tort plus de 60 % des étudiants humains d’avoir triché avec une IA.

Pourquoi une telle injustice ? Parce qu’un apprenant qui écrit dans une langue seconde utilise un vocabulaire plus simple, des tournures conventionnelles et des structures sans fioritures. Aux yeux de l’algorithme, cette clarté sans excentricité ressemble trait pour trait à la production d’un robot.

L’alternative : le tatouage numérique (Watermarking)

Section intitulée « L’alternative : le tatouage numérique (Watermarking) »

Constatant la faillite des détecteurs après coup, les laboratoires s’orientent vers le tatouage numérique statistique (watermarking, Kirchenbauer et al., 2023).

Cette technique intervient directement au moment où le modèle fabrique le texte : à chaque étape de calcul, une clé pseudo-aléatoire divise le vocabulaire en une « liste verte » de mots favorisés et une « liste rouge » de mots légèrement pénalisés. Le texte reste fluide et lisible pour l’humain, mais un algorithme connaissant la clé secrète peut vérifier mathématiquement que la proportion de mots verts dépasse anormalement le hasard, prouvant l’origine artificielle sans faux positif sur les textes humains.

Le manque de fiabilité de la détection a provoqué des crises majeures dans le monde éducatif :

  • Le retrait officiel d’OpenAI : En juillet 2023, OpenAI a fermé son propre outil officiel AI Text Classifier six mois après son lancement, reconnaissant un taux de succès dérisoire de 26 % et un taux de faux positifs inacceptable.
  • Directives universitaires françaises : De nombreuses universités et grandes écoles (comme Sciences Po ou l’Université de Lorraine) interdisent formellement aux enseignants d’utiliser les scores de ces logiciels pour sanctionner des étudiants, rappelant qu’un score de 80 % ne constitue en aucun cas une preuve juridique.
  • Accusations abusives aux États-Unis : Plusieurs scandales médiatisés ont éclaté où des professeurs ont menacé de refuser le diplôme d’étudiants brillants sur la seule base d’un rapport de détection en ligne, contraignant les universités à réhabiliter les élèves après audit de l’historique de frappe de leurs documents Word.
  • « Un détecteur statistique peut certifier à 100 % qu’un devoir scolaire a été généré par ChatGPT. » C’est une illusion totale. Aucun outil de détection a posteriori ne possède de valeur scientifique ou juridique probante ; ils ne mesurent qu’une monotonie de style.
  • « Un élève natif et un élève étranger ont le même risque d’être accusés à tort de triche. » Les études scientifiques prouvent que les élèves écrivant dans une langue qui n’est pas leur langue maternelle sont massivement plus ciblés par les faux positifs en raison de leur lexique plus prévisible.
  • « Il suffit d’ajouter quelques fautes d’orthographe ou d’utiliser un synonyme pour tromper la détection. » C’est tout à fait vrai, et cela prouve précisément la futilité technique de ces détecteurs : modifier trois adjectifs suffit à faire chuter le score d’alerte sans changer le fond du texte.

Voir aussi