Aller au contenu
Fondamentaux

Perplexité (PPL)

La mesure mathématique intrinsèque qui évalue la surprise d'un modèle de langage face à un texte : plus elle est basse, mieux le modèle prédit la langue.

6 min de lecture
  • #statistiques
  • #évaluation
  • #perplexité
  • #tokens

La perplexité est un indicateur mathématique qui mesure à quel point un modèle de langage est surpris ou hésitant lorsqu’il lit un texte d’épreuve : plus ce score est bas, plus le modèle anticipe avec précision les mots naturels d’une langue.

Imagine un jeu télévisé où un candidat doit deviner la suite d’une phrase mot après mot. L’animateur commence : « Le ciel est bleu et les oiseaux… ».

Si le candidat hésite longuement et se dit intérieurement : « Les oiseaux quoi ? Les oiseaux mangent ? Dorment ? Chantent ? Tombent ? Volent ? », et qu’il a l’impression d’avoir devant lui un dé à cent faces avec cent possibilités équiprobables, son niveau de perplexité est de 100. Il est très incertain.

En revanche, si un linguiste hors pair écoute la même phrase et se dit : « À 80 % de chance le mot suivant est “chantent”, à 15 % “volent”, et les 5 % restants se partagent entre quelques verbes rares », son hésitation réelle ne porte que sur deux ou trois choix évidents. Son niveau de perplexité est alors proche de 2 ou 3.

La perplexité d’un grand modèle de langage calcule exactement cela : elle représente le nombre moyen d’options équivalentes entre lesquelles le réseau hésite à chaque frappe de clavier lorsqu’il essaie de deviner la suite d’un livre qu’il n’a jamais lu.

La perplexité plonge ses racines dans la théorie de l’information formulée par le mathématicien américain Claude Shannon en 1948. Elle est la soeur jumelle de l’entropie croisée, qui est la fonction de perte calculée à chaque seconde pendant le pré-entraînement d’un réseau de neurones.

Lorsqu’on donne à un modèle un échantillon de texte de test composé de N tokens consécutifs (x₁, x₂, …, xₙ), le modèle calcule pour chaque token la probabilité conditionnelle P(xᵢ | x₁...xᵢ₋₁) qu’il avait de deviner juste d’après tout le début de la phrase.

On effectue la moyenne de ces logarithmes de probabilités, ce qui donne la perte moyenne d’entropie croisée par token, notée $H(X)$. La perplexité est tout simplement l’exponentielle de cette perte :

PPL(X) = exp(H(X)) = exp(-1/N · ∑ log P(xᵢ | x₁...xᵢ₋₁))

Trois propriétés fondamentales découlent de cette formule :

  1. La perfection théorique (PPL = 1) : Si le modèle assigne une probabilité de 100 % au mot exact qui apparaît effectivement dans le texte pour chaque position, la perte est de zéro et l’exponentielle vaut 1. Le modèle n’a aucune surprise.
  2. L’échec absolu (PPL tend vers l’infini) : Si le modèle prédit qu’un mot est totalement impossible (probabilité zéro) et que ce mot apparaît dans le texte de test, le logarithme plonge vers $-\infty$, et la perplexité explose vers l’infini. Le modèle a été pris en défaut d’aveuglement.
  3. Le hasard complet : Pour un modèle qui choisirait ses tokens de façon purement aléatoire et uniforme parmi un vocabulaire de 32 000 tokens, la perplexité serait exactement égale à 32 000.

Le piège de la comparaison entre modèles différents

Section intitulée « Le piège de la comparaison entre modèles différents »

La perplexité est la mesure la plus pure et la plus élégante pour suivre les progrès d’un modèle au cours de son propre entraînement, ou pour vérifier qu’une quantification ne détériore pas les poids : si la perplexité passe de 5,12 en précision originale à 5,25 après compression en 4 bits, on sait avec certitude que la dégradation est imperceptible.

Toutefois, il est méthodologiquement interdit de comparer la perplexité brute de deux modèles différents (par exemple Llama 3 et Mistral 7B) sans précaution :

  • Llama 3 utilise un dictionnaire de 128 000 tokens, tandis que Mistral 7B s’appuie sur un dictionnaire de 32 000 tokens.
  • Un mot français long ou complexe peut être découpé en trois tokens chez Mistral, mais en un seul token chez Llama.
  • Comme la perplexité calcule une moyenne par token, diviser la surprise par trois petits morceaux de mot fausse complètement l’arithmétique.

Pour comparer loyalement deux modèles aux vocabulaires différents, les chercheurs calculent la perte d’information normalisée par octet réel (Bits Per Byte ou BPB), qui rétablit une égalité absolue de mesure indépendamment du découpage lexical.

La perplexité est un outil incontournable dans les coulisses de l’ingénierie de l’IA :

  • Le contrôle qualité de la compression (Quantification) : Les créateurs d’outils comme llama.cpp calculent la perplexité sur un texte de référence (souvent un chapitre de Wikipédia) à chaque nouvelle recette de quantification. Si une version 3-bit fait bondir la perplexité au-delà d’un seuil critique, la recette est rejetée car le modèle produira des incohérences.
  • La détection de données corrompues : Lors du nettoyage des jeux de données d’entraînement, les ingénieurs font lire des pages web par un petit modèle rapide : si la perplexité est anormalement élevée, cela indique un texte corrompu (charabia, spams de mots-clés, erreurs de codage de caractères) qui est immédiatement jeté à la corbeille.
  • L’arrêt optimal de l’entraînement (Early Stopping) : Pendant les mois que dure le pré-entraînement d’un grand modèle, on mesure la perplexité sur un corpus de validation tenu secret : dès que la perplexité cesse de baisser et commence à stagner, on sait que continuer à brûler de l’électricité ne rendra plus le modèle meilleur.
  • « Un modèle qui a une excellente perplexité ne dit jamais de bêtises. » C’est une confusion fréquente entre la fluidité linguistique et la véracité factuelle. Un modèle peut prédire avec une certitude absolue et une très faible perplexité une phrase d’une élégance littéraire parfaite qui affirme que la Terre est plate.
  • « La perplexité est un examen scolaire comme le baccalauréat pour les IA. » La perplexité ne teste aucune consigne, ne pose aucune question et n’évalue aucune logique. Elle mesure simplement la capacité mathématique passive du réseau à compresser et anticiper les régularités statistiques du texte.

Voir aussi