Interface de programmation (API)
Le protocole réseau standardisé qui permet aux développeurs d'envoyer des requêtes à un modèle d'intelligence artificielle distant et d'en recevoir les réponses.
En une phrase
Section intitulée « En une phrase »Une interface de programmation (API) est une porte d’entrée réseau standardisée qui permet à un logiciel d’envoyer du texte ou des instructions à un modèle d’intelligence artificielle distant et de récupérer ses réponses sous forme de données exploitables.
L’analogie
Section intitulée « L’analogie »Pense à un restaurant gastronomique réputé. En tant que client attablé dans la salle à manger, tu n’as pas le droit d’entrer directement en cuisine, de manipuler les fourneaux ou de parler aux chefs qui préparent les plats.
Pour te faire servir, tu passes par un intermédiaire : le serveur. Il te présente un menu strict avec des plats bien définis, prend ta commande formulée selon les règles du restaurant, la transmet en cuisine, puis revient te déposer ton assiette sur la table dès qu’elle est prête.
L’API joue exactement le rôle de ce serveur : la cuisine représente les grappes de serveurs géants et les puces graphiques sur lesquelles tourne le modèle. Ton application mobile ou ton script Python est le client assis en salle. L’API reçoit ta commande (ton prompt et tes paramètres), l’apporte aux cartes de calcul, et te rapporte le résultat token par token sans que tu n’aies jamais besoin de gérer la machinerie interne.
Comment ça marche
Section intitulée « Comment ça marche »Lorsqu’une entreprise ou un laboratoire met un modèle de langage à disposition du monde, elle ne demande pas à chaque utilisateur de télécharger des centaines de gigaoctets de poids synaptiques sur son ordinateur personnel. Elle déploie ce modèle sur des grappes de serveurs spécialisés et expose une API accessible via Internet.
Le protocole HTTP et la charge utile JSON
Section intitulée « Le protocole HTTP et la charge utile JSON »La quasi-totalité des API de modèles de langage s’appuie sur le protocole web standard HTTP et communique au format JSON. Lorsqu’un programme informatique souhaite solliciter un modèle, il émet une requête réseau de type POST vers une adresse web sécurisée (le point d’accès ou endpoint).
Cette requête transporte une charge utile (payload) qui configure précisément l’expérience :
- Le modèle cible : le nom exact de la version sollicitée (par exemple
mistral-large-latestougpt-4o). - L’historique des messages : une liste ordonnée d’objets précisant le texte et le rôle de chaque participant (
systempour poser les consignes d’autorité,userpour l’humain,assistantpour les tours précédents du modèle, ettoolpour les réponses d’outils). - Les hyperparamètres de décodage : des curseurs numériques comme la
temperature(qui régule l’audace statistique du choix des jetons) ou lemax_tokens(qui borne la longueur maximale de la réponse pour éviter les débordements budgétaires).
La nature fondamentale sans état (stateless)
Section intitulée « La nature fondamentale sans état (stateless) »C’est l’une des caractéristiques les plus méconnues des API d’intelligence artificielle : elles ne possèdent aucune mémoire interne. Le serveur qui reçoit ta requête traite chaque appel de manière totalement isolée et hermétique.
Lorsque tu discutes avec un assistant sur une application web et que tu lui écris « Pourquoi ? », le serveur ne se souvient pas de ce que tu lui as demandé deux secondes auparavant. C’est l’application cliente sur ton téléphone qui conserve l’historique localement et renvoie l’intégralité des échanges précédents dans la nouvelle requête. Si ton script omet de renvoyer le premier message lors du second tour, le modèle répondra dans le vide sans aucun contexte.
Cette absence d’état a des conséquences directes sur la consommation de jetons et la tarification : à mesure qu’une conversation s’allonge, chaque nouveau message coûte de plus en plus cher, car il oblige le serveur à relire l’historique complet depuis le début.
Le streaming en continu par Server-Sent Events
Section intitulée « Le streaming en continu par Server-Sent Events »Attendre qu’un modèle finisse de générer une dissertation de 800 mots avant de renvoyer le moindre caractère prendrait de nombreuses secondes, donnant l’impression que le système est figé. Pour offrir une expérience interactive et fluide, les API proposent un mode de transmission en continu appelé streaming.
Ce mode s’appuie sur la norme web Server-Sent Events (SSE). Au lieu d’attendre la fin du calcul, le serveur d’API maintient la connexion HTTP ouverte et expédie de petits fragments de texte au client au fur et à mesure que chaque jeton est sélectionné par la passe avant. Ton interface graphique peut ainsi afficher les mots un par un sur ton écran en temps réel, reproduisant le rythme d’une frappe humaine.
Dans la vraie vie
Section intitulée « Dans la vraie vie »L’utilisation d’API est le standard absolu de l’industrie pour intégrer l’intelligence artificielle dans des produits réels :
- Intégration dans des applications mobiles et web : Des outils de productivité comme Notion, des plateformes d’apprentissage comme Duolingo ou des logiciels de service client connectent leurs serveurs aux API de grands modèles pour générer des résumés, corriger des devoirs ou orienter des usagers.
- Scripts d’automatisation et pipelines de données : Des développeurs écrivent de petits scripts Python qui appellent l’API en boucle pour classifier des milliers d’e-mails entrants, extraire automatiquement le montant et la date de factures scannées, ou traduire un catalogue entier de produits.
- Agents autonomes et chaînes de traitement : Des orchestrateurs logiciels appellent l’API pour décomposer un objectif complexe en sous-tâches, exécuter des vérifications intermédiaires et synthétiser des rapports complets.
- Fournisseurs d’infrastructure cloud : En Europe, des acteurs du cloud comme Scaleway ou OVHcloud fournissent des passerelles d’API compatibles avec les standards du marché pour héberger et servir des modèles en poids ouverts sur des serveurs garantissant la souveraineté des données.
Idées reçues
Section intitulée « Idées reçues »- « L’API conserve une copie de ma mémoire de discussion pour savoir qui je suis au message suivant. » C’est rigoureusement inexact. Les API de modèles sont intégralement sans état (stateless). C’est le programme qui envoie la requête qui a la charge de renvoyer tout le fil de conversation à chaque appel.
- « Régler la température à zéro sur une API garantit une réponse identique au caractère près à chaque essai. » Même avec une température nulle et un échantillonnage glouton, les calculs massifs en virgule flottante parallélisés sur des dizaines de processeurs graphiques peuvent induire d’infimes variations d’arrondi, provoquant parfois des bifurcations dans le texte produit.
- « Passer par une API coûte forcément plus cher que d’acheter ses propres serveurs de calcul. » L’API fonctionne sur un modèle de facturation au jeton réel consommé. Pour une petite entreprise ou un particulier, acheter, refroidir et maintenir un serveur dédié équipé de cartes GPU professionnelles 24 heures sur 24 est infiniment plus dispendieux qu’une consommation ponctuelle par API.
Pour aller plus loin
Section intitulée « Pour aller plus loin »- Référence officielle de l’API OpenAI Chat Completions — OpenAI, 2024 (EN) : La spécification technique détaillée des paramètres, charges utiles JSON et codes de retour devenue le standard de facto de l’industrie.
- Documentation de la plateforme Mistral AI — Mistral AI, 2024 (FR) : Guide complet d’utilisation de l’API européenne pour les modèles propriétaires et en poids ouverts avec exemples en Python et cURL.
- RFC 8895 : Server-Sent Events — IETF, 2020 (EN) : Le standard officiel décrivant le fonctionnement des flux unidirectionnels HTTP utilisés pour le streaming temps réel de jetons.
Voir aussi
Section intitulée « Voir aussi »Voir aussi
- FondamentauxInférenceLe moment où le modèle tourne pour de vrai : la boucle qui écrit le texte, un token à la fois, par opposition à l'entraînement où il apprend.
- ÉcosystèmeCoût (tarification)Ce que coûte vraiment une réponse de modèle : des tokens facturés à l'entrée et à la sortie, des remises, des pièges, et le prix du matériel quand on l'héberge soi-même.
- FondamentauxFenêtre de contexteLa quantité maximale de texte qu'un modèle peut prendre en compte d'un coup : sa « mémoire de travail ».
- ÉcosystèmeAppel d'outilsLe mécanisme qui permet à un modèle de langage d'émettre des requêtes structurées pour faire exécuter du code, interroger des bases de données ou consulter des API externes.