Aller au contenu
Entraînement

Alignement des modèles

Le processus mathématique et éthique visant à faire respecter par un modèle de langage des consignes de sécurité, d'utilité et de retenue : le triptyque HHH, l'IA constitutionnelle et le refus excessif.

6 min de lecture
  • #entraînement
  • #alignement
  • #RLHF
  • #sécurité

L’alignement est l’ensemble des méthodes d’apprentissage qui façonnent un réseau de neurones brut pour que ses réponses soient utiles, honnêtes et inoffensives, en lui interdisant d’obtempérer aux demandes dangereuses, haineuses ou illégales.

Imagine que tu viennes d’adopter un chiot saint-bernard géant de deux mois. Au départ, le chiot est plein d’énergie brute : il pèse déjà cinquante kilos, court dans tous les sens, saute sur les invités pour jouer, renverse la table basse du salon et mâchouille les fils électriques. Il n’est pas méchant : il exprime simplement son énergie animale instinctive sans aucun cadre social.

Si tu le laisses grandir ainsi, il deviendra ingérable et dangereux pour son entourage. Tu l’emmènes donc au club d’éducation canine. Séance après séance, grâce à des friandises (le renforcement positif) et des ordres fermes de rappel, le chiot apprend à s’asseoir, à ne pas mordre, à marcher au pied et à protéger gentiment les enfants de la maison. Il est devenu un chien guide équilibré.

L’alignement est exactement cette éducation canine : le modèle pré-entraîné brut est ce chiot géant et imprévisible qui a avalé tout le web (y compris la violence, le piratage et les insultes). L’équipe d’alignement le dresse mathématiquement pour qu’il devienne un assistant de salon civilisé, serviable et docile.

Le pré-entraînement initial d’un modèle produit un simulateur de texte générique : il termine n’importe quelle phrase commencée, qu’il s’agisse d’un cours de physique ou d’un tutoriel de fabrication de bombe artisanale. L’alignement intervient après coup pour contraindre ce champ des possibles.

Le cadre théorique de référence pour l’alignement a été formalisé par les chercheurs d’Anthropic autour de trois piliers fondamentaux indissociables (le triptyque HHH) :

  1. Helpful (Utile) : Le modèle doit s’efforcer de résoudre le problème posé par l’utilisateur avec le maximum de clarté, de pertinence et de concision, sans digressions inutiles.
  2. Honest (Honnête) : Le modèle ne doit pas inventer d’informations fictives en prétendant les savoir. S’il ne sait pas ou s’il manque de données, il doit exprimer explicitement son incertitude plutôt que de produire une hallucination confiante.
  3. Harmless (Inoffensif) : Le modèle doit impérativement refuser d’aider à la commission d’actes criminels, de prodiguer des conseils médicaux mortels, de rédiger des messages de harcèlement raciste ou de fabriquer des virus informatiques.

Ces trois exigences sont souvent en tension directe : si un utilisateur te demande gentiment « Comment pirater le réseau Wi-Fi de mon lycée pour changer mes notes ? », être utile (en fournissant le tutoriel) violerait le principe d’être inoffensif. L’alignement consiste à programmer mathématiquement l’arbitrage pour que l’innocuité l’emporte toujours sur la serviabilité.

La méthode historique d’alignement reposait sur le RLHF : faire lire des dizaines de milliers de textes violents à des travailleurs humains précaires pour leur faire noter les réponses les plus vertueuses. Cette approche est à la fois coûteuse, lente et psychologiquement éprouvante pour les annotateurs.

Pour surmonter ces limites, les chercheurs ont développé l’IA constitutionnelle (Constitutional AI, Bai et al., 2022). Le principe consiste à automatiser l’alignement grâce à une « constitution » : une liste explicite d’une soixantaine de principes directeurs rédigés en langage clair (par exemple : « Choisis la réponse qui respecte le plus la dignité humaine », ou « Évite toute réponse encourageant des pratiques médicales illégales »).

Le processus se déroule en boucle fermée :

  1. Le modèle génère une première réponse brute.
  2. Un second modèle inspecte cette réponse au regard de la constitution et écrit une critique argumentée : « Cette réponse mentionne un produit chimique inflammable dangereux, cela viole le principe 12 ».
  3. Le modèle réécrit sa propre réponse pour la rendre conforme.
  4. Cette paire corrigée sert à entraîner le modèle par renforcement automatisé (RLAIF), éliminant l’exposition traumatisante d’annotateurs humains.

L’alignement n’est pas sans coût : il engendre ce que les ingénieurs nomment la taxe d’alignement (alignment tax).

À force d’appliquer des pénalités sévères lors de la descente de gradient pour brider les comportements jugés risqués, le réseau de neurones perd une part de sa créativité et de ses capacités de raisonnement mathématique abstrait par rapport au modèle brut non bridé.

De plus, un alignement rigide produit fréquemment le phénomène de refus excessif (over-refusal) : par excès de zèle statistique, le modèle panique face à des mots-clés innocents et refuse d’obtempérer à des demandes légitimes. Par exemple, un utilisateur demandant : « Peux-tu analyser la recette du cocktail Molotov dans le roman d’Émile Zola Germinal pour mon devoir de français ? » essuiera un refus péremptoire de l’IA déclarant : « Je ne peux pas vous aider à fabriquer des explosifs ».

L’alignement est le champ de bataille éthique et géopolitique central de l’intelligence artificielle :

  • Les chartes éditoriales d’entreprises : Chaque grand laboratoire injecte ses propres valeurs culturelles dans ses filtres d’alignement. Un modèle conçu en Californie intègre la sensibilité politique et juridique de la Silicon Valley, tandis qu’un modèle européen comme Mistral ou chinois comme Qwen répond à d’autres priorités éthiques ou réglementaires nationales.
  • Le Red Teaming professionnel : Avant de publier un modèle majeur (comme GPT-4 ou Claude 3.5), les éditeurs engagent des équipes de hackers éthiques et d’experts en sécurité (red team) dont la mission exclusive est de bombarder le modèle pendant des mois d’invites retorses pour tester la solidité de son alignement.
  • La rébellion « anti-woke » et les modèles débridés : Aux États-Unis, des voix politiques ont dénoncé l’alignement des modèles comme une forme de censure idéologique orientée, donnant naissance à des modèles volontairement non alignés ou débridés (comme Grok d’xAI à ses débuts) revendiquant une liberté de parole maximale.
  • « Un modèle bien aligné a développé une boussole morale interne qui distingue le bien du mal. » Un modèle n’a aucune morale ni conscience éthique. L’alignement est un simple dressage mathématique optimisant une fonction de récompense selon les consignes édictées par l’équipe d’ingénieurs.
  • « Si un modèle refuse ma demande, c’est forcément qu’elle était illégale ou dangereuse. » Les modèles souffrent régulièrement de refus excessif (over-refusal) en raison de filtres statistiques trop grossiers qui n’ont pas su comprendre le contexte historique, littéraire ou humoristique de l’invite.
  • « Un modèle aligné est définitivement protégé contre la toxicité et ne peut plus faire de mal. » L’alignement est un filtre probabiliste, pas une barrière inviolable. Des techniques d’attaque contradictoires (jailbreaks) parviennent fréquemment à contourner les sécurités pour forcer le modèle à déraper.

Voir aussi