Aller au contenu
Écosystème

Interface de programmation (API)

Le protocole réseau standardisé qui permet aux développeurs d'envoyer des requêtes à un modèle d'intelligence artificielle distant et d'en recevoir les réponses.

6 min de lecture
  • #écosystème
  • #API
  • #inférence
  • #développement

Une interface de programmation (API) est une porte d’entrée réseau standardisée qui permet à un logiciel d’envoyer du texte ou des instructions à un modèle d’intelligence artificielle distant et de récupérer ses réponses sous forme de données exploitables.

Pense à un restaurant gastronomique réputé. En tant que client attablé dans la salle à manger, tu n’as pas le droit d’entrer directement en cuisine, de manipuler les fourneaux ou de parler aux chefs qui préparent les plats.

Pour te faire servir, tu passes par un intermédiaire : le serveur. Il te présente un menu strict avec des plats bien définis, prend ta commande formulée selon les règles du restaurant, la transmet en cuisine, puis revient te déposer ton assiette sur la table dès qu’elle est prête.

L’API joue exactement le rôle de ce serveur : la cuisine représente les grappes de serveurs géants et les puces graphiques sur lesquelles tourne le modèle. Ton application mobile ou ton script Python est le client assis en salle. L’API reçoit ta commande (ton prompt et tes paramètres), l’apporte aux cartes de calcul, et te rapporte le résultat token par token sans que tu n’aies jamais besoin de gérer la machinerie interne.

Lorsqu’une entreprise ou un laboratoire met un modèle de langage à disposition du monde, elle ne demande pas à chaque utilisateur de télécharger des centaines de gigaoctets de poids synaptiques sur son ordinateur personnel. Elle déploie ce modèle sur des grappes de serveurs spécialisés et expose une API accessible via Internet.

La quasi-totalité des API de modèles de langage s’appuie sur le protocole web standard HTTP et communique au format JSON. Lorsqu’un programme informatique souhaite solliciter un modèle, il émet une requête réseau de type POST vers une adresse web sécurisée (le point d’accès ou endpoint).

Cette requête transporte une charge utile (payload) qui configure précisément l’expérience :

  • Le modèle cible : le nom exact de la version sollicitée (par exemple mistral-large-latest ou gpt-4o).
  • L’historique des messages : une liste ordonnée d’objets précisant le texte et le rôle de chaque participant (system pour poser les consignes d’autorité, user pour l’humain, assistant pour les tours précédents du modèle, et tool pour les réponses d’outils).
  • Les hyperparamètres de décodage : des curseurs numériques comme la temperature (qui régule l’audace statistique du choix des jetons) ou le max_tokens (qui borne la longueur maximale de la réponse pour éviter les débordements budgétaires).

C’est l’une des caractéristiques les plus méconnues des API d’intelligence artificielle : elles ne possèdent aucune mémoire interne. Le serveur qui reçoit ta requête traite chaque appel de manière totalement isolée et hermétique.

Lorsque tu discutes avec un assistant sur une application web et que tu lui écris « Pourquoi ? », le serveur ne se souvient pas de ce que tu lui as demandé deux secondes auparavant. C’est l’application cliente sur ton téléphone qui conserve l’historique localement et renvoie l’intégralité des échanges précédents dans la nouvelle requête. Si ton script omet de renvoyer le premier message lors du second tour, le modèle répondra dans le vide sans aucun contexte.

Cette absence d’état a des conséquences directes sur la consommation de jetons et la tarification : à mesure qu’une conversation s’allonge, chaque nouveau message coûte de plus en plus cher, car il oblige le serveur à relire l’historique complet depuis le début.

Attendre qu’un modèle finisse de générer une dissertation de 800 mots avant de renvoyer le moindre caractère prendrait de nombreuses secondes, donnant l’impression que le système est figé. Pour offrir une expérience interactive et fluide, les API proposent un mode de transmission en continu appelé streaming.

Ce mode s’appuie sur la norme web Server-Sent Events (SSE). Au lieu d’attendre la fin du calcul, le serveur d’API maintient la connexion HTTP ouverte et expédie de petits fragments de texte au client au fur et à mesure que chaque jeton est sélectionné par la passe avant. Ton interface graphique peut ainsi afficher les mots un par un sur ton écran en temps réel, reproduisant le rythme d’une frappe humaine.

L’utilisation d’API est le standard absolu de l’industrie pour intégrer l’intelligence artificielle dans des produits réels :

  • Intégration dans des applications mobiles et web : Des outils de productivité comme Notion, des plateformes d’apprentissage comme Duolingo ou des logiciels de service client connectent leurs serveurs aux API de grands modèles pour générer des résumés, corriger des devoirs ou orienter des usagers.
  • Scripts d’automatisation et pipelines de données : Des développeurs écrivent de petits scripts Python qui appellent l’API en boucle pour classifier des milliers d’e-mails entrants, extraire automatiquement le montant et la date de factures scannées, ou traduire un catalogue entier de produits.
  • Agents autonomes et chaînes de traitement : Des orchestrateurs logiciels appellent l’API pour décomposer un objectif complexe en sous-tâches, exécuter des vérifications intermédiaires et synthétiser des rapports complets.
  • Fournisseurs d’infrastructure cloud : En Europe, des acteurs du cloud comme Scaleway ou OVHcloud fournissent des passerelles d’API compatibles avec les standards du marché pour héberger et servir des modèles en poids ouverts sur des serveurs garantissant la souveraineté des données.
  • « L’API conserve une copie de ma mémoire de discussion pour savoir qui je suis au message suivant. » C’est rigoureusement inexact. Les API de modèles sont intégralement sans état (stateless). C’est le programme qui envoie la requête qui a la charge de renvoyer tout le fil de conversation à chaque appel.
  • « Régler la température à zéro sur une API garantit une réponse identique au caractère près à chaque essai. » Même avec une température nulle et un échantillonnage glouton, les calculs massifs en virgule flottante parallélisés sur des dizaines de processeurs graphiques peuvent induire d’infimes variations d’arrondi, provoquant parfois des bifurcations dans le texte produit.
  • « Passer par une API coûte forcément plus cher que d’acheter ses propres serveurs de calcul. » L’API fonctionne sur un modèle de facturation au jeton réel consommé. Pour une petite entreprise ou un particulier, acheter, refroidir et maintenir un serveur dédié équipé de cartes GPU professionnelles 24 heures sur 24 est infiniment plus dispendieux qu’une consommation ponctuelle par API.

Voir aussi