Intégrer une IA dans son site web : technique, coûts et quotas
Ajouter une IA à un site web tient en quelques dizaines de lignes de code. Ce qui prend du temps, c’est tout le reste : empêcher que votre clé d’accès se retrouve dans le navigateur d’un visiteur, comprendre ce que vous allez réellement payer, et éviter qu’un robot ne vous facture cinq cents euros en une nuit.
Cet article couvre la mise en œuvre technique, le calcul du coût réel avec les tarifs de septembre 2026, les quotas des différents fournisseurs et les pièges qui font exploser une facture.
Les tarifs cités ont été relevés le 28 septembre 2026. Ils changent souvent : OpenAI a baissé les siens fin juillet, Anthropic a sorti un nouveau modèle moins cher le 22 septembre. Vérifiez-les sur les pages officielles avant de bâtir un budget.
Trois façons d’intégrer, une seule à retenir
Techniquement, trois architectures sont possibles. Une seule est défendable.
L’appel depuis le navigateur. Votre JavaScript contacte directement l’API du fournisseur. C’est le plus simple à écrire, et c’est une faute grave : votre clé est alors visible par n’importe qui ouvrant les outils de développement. Quelqu’un la récupère, l’utilise pour ses propres besoins, et vous payez. Des robots parcourent le web à la recherche de ces clés.
L’appel depuis votre serveur. Le navigateur interroge votre site, votre site interroge l’IA, la réponse redescend. La clé ne quitte jamais le serveur. C’est l’architecture normale, et celle que couvre le reste de cet article.
L’agent autonome. L’IA appelle elle-même des fonctions que vous exposez — consulter une base, envoyer un courriel. Puissant, nettement plus complexe, et à réserver à un second temps.
La règle tient en une phrase : votre clé d’API ne doit jamais atteindre le navigateur. Ni dans le JavaScript, ni dans le HTML, ni dans une variable de configuration côté client.
Ce que vous achetez réellement : des tokens
Les fournisseurs facturent au token, pas à la requête ni au caractère.
Un token représente environ trois quarts d’un mot en anglais, un peu moins en français — comptez plutôt deux tokens pour trois mots. Un article de mille mots pèse donc environ 1 400 tokens.
Deux compteurs distincts, et c’est là que les budgets dérapent :
- les tokens d’entrée, tout ce que vous envoyez — instruction système, historique de conversation, documents joints, question de l’utilisateur ;
- les tokens de sortie, ce que le modèle répond.
La sortie coûte environ cinq fois l’entrée chez tous les fournisseurs. Mais c’est presque toujours l’entrée qui domine la facture, parce qu’on renvoie à chaque requête un contexte qui grossit : l’instruction système, les documents de référence, et tout l’historique de la conversation.
Un agent conversationnel au dixième échange renvoie les neuf précédents. Le coût d’une conversation croît donc de façon quadratique, pas linéaire.
Les tarifs en septembre 2026
Prix en dollars par million de tokens, entrée et sortie.
| Fournisseur | Modèle | Entrée | Sortie |
|---|---|---|---|
| Mistral | Ministral 3 3B | 0,10 $ | 0,10 $ |
| Small 4 | 0,15 $ | 0,60 $ | |
| Large 3 | 0,50 $ | 1,50 $ | |
| OpenAI | GPT-5.6 Luna | 0,20 $ | 1,20 $ |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ | |
| GPT-5.6 Sol | 4,00 $ | 20,00 $ | |
| Anthropic | Claude Haiku 4.5 | 1,00 $ | 5,00 $ |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ | |
| Claude Opus 5.5 | 4,00 $ | 20,00 $ |
Trois observations sur ce tableau.
L’écart entre le moins cher et le plus cher va de un à quarante en entrée. Le choix du modèle est de loin le premier levier sur votre facture — bien avant toute optimisation de code.
Mistral est sensiblement moins cher, et héberge en Europe, ce qui simplifie la conformité au RGPD. Ses modèles légers conviennent parfaitement à de la classification, de l’extraction ou de la reformulation.
Ces prix bougent vite. Le tarif de GPT-5.6 Sol est promotionnel et annoncé jusqu’à fin novembre. Anthropic a sorti Opus 5.5 le 22 septembre, 20 % moins cher que le modèle qu’il remplace. Ne construisez pas un budget sur un chiffre mémorisé.
Calculer ce que ça va vous coûter
Prenons un cas concret : une aide à la rédaction sur un site, 500 utilisations par mois. Chaque appel envoie 1 500 tokens — instruction, contexte, demande — et produit 400 tokens.
| Modèle | Entrée (750 k) | Sortie (200 k) | Total mensuel |
|---|---|---|---|
| Mistral Small 4 | 0,11 $ | 0,12 $ | 0,23 $ |
| GPT-5.6 Luna | 0,15 $ | 0,24 $ | 0,39 $ |
| Claude Haiku 4.5 | 0,75 $ | 1,00 $ | 1,75 $ |
| Claude Sonnet 5 | 1,50 $ | 2,00 $ | 3,50 $ |
| Claude Opus 5.5 | 3,00 $ | 4,00 $ | 7,00 $ |
À cette échelle, tous les modèles sont abordables et le choix se fait sur la qualité, pas sur le prix. Multipliez le trafic par cent et l’arbitrage s’inverse : 700 dollars mensuels contre 23.
La méthode est toujours la même. Comptez les tokens d’un appel type, multipliez par le volume attendu, et faites le calcul pour deux ou trois modèles. Les fournisseurs proposent tous un compteur de tokens ; à défaut, divisez le nombre de caractères par trois pour une estimation française acceptable.
Quatre leviers pour diviser la facture
Le cache d’invite. Si vos appels partagent un préfixe constant — instruction système, documentation, catalogue — les fournisseurs facturent sa relecture à 10 % du prix normal, parfois moins. Sur un agent conversationnel dont 80 % de l’entrée est un contexte fixe, l’économie dépasse la moitié de la facture. C’est le levier le plus rentable, et il demande seulement de placer la partie stable en tête de l’invite.
Le traitement par lots. Pour ce qui n’est pas interactif — résumés nocturnes, enrichissement de catalogue, traduction en masse — les API de lot appliquent 50 % de remise en échange d’un délai pouvant aller jusqu’à 24 heures.
Le bon modèle pour chaque tâche. Rien n’oblige à tout traiter avec le même. Classer un message, extraire une date, corriger une tournure : un modèle léger suffit. Réservez le modèle haut de gamme aux tâches qui l’exigent. Un aiguillage simple sur la longueur ou le type de demande fait souvent chuter la facture de 70 %.
Le plafond de sortie. Fixez systématiquement une limite au nombre de tokens produits. Sans elle, une question mal formulée peut déclencher une réponse de plusieurs milliers de tokens — facturée au tarif fort.
Quotas et limites de débit
Tous les fournisseurs plafonnent le débit, généralement selon deux compteurs simultanés : requêtes par minute et tokens par minute. Le second est souvent le plus contraignant.
Ces limites montent par paliers, en fonction de votre ancienneté et de vos dépenses cumulées. Un compte neuf démarre bas, ce qui suffit à un site modeste mais pas à une mise en production soudaine — pensez-y avant un lancement.
Le dépassement se manifeste par une erreur HTTP 429. Votre code doit la traiter, et la bonne réponse n’est pas de réessayer immédiatement : cela aggrave la saturation.
- Réessai avec recul exponentiel : attendre 1 seconde, puis 2, puis 4, avec trois tentatives au maximum ;
- lire l’en-tête
Retry-Afterquand le fournisseur le renvoie, plutôt que de deviner ; - prévoir un repli : message d’attente, mise en file, ou bascule vers un modèle moins chargé.
Ce qui vous concerne plus encore qu’un quota fournisseur, c’est votre propre limitation. Une fonction d’IA ouverte sans restriction sur un site public est une invitation : un script peut lancer des milliers d’appels en une nuit, à vos frais. Trois protections, toutes indispensables :
- un plafond par utilisateur et par jour, stocké côté serveur ;
- un plafond global sur le site, qui coupe la fonction au-delà d’un seuil ;
- une alerte de dépense configurée chez le fournisseur, avec coupure automatique.
La dernière est celle qu’on oublie, et c’est la seule qui fonctionne quand les deux autres ont été contournées.
Les spécifications qui comptent vraiment
Le délai d’attente. Une génération longue peut dépasser trente secondes. Le délai par défaut de la plupart des bibliothèques HTTP est trop court : prévoyez soixante secondes côté serveur, et assurez-vous que votre hébergement le permet — certaines configurations mutualisées coupent avant.
Le streaming. Recevoir la réponse mot à mot plutôt que d’attendre la fin change complètement la perception. Une attente de vingt secondes paraît interminable ; le même délai avec un texte qui s’écrit progressivement passe inaperçu. Le surcoût de mise en œuvre est modeste et le gain est réel.
L’idempotence. Si un utilisateur clique deux fois, envoyez-vous deux requêtes facturées ? Désactivez le bouton pendant le traitement, et côté serveur, utilisez une clé d’idempotence quand le fournisseur la propose.
La journalisation. Enregistrez pour chaque appel le modèle, les tokens consommés en entrée et en sortie, et la durée. Sans ces données, vous découvrirez le problème sur la facture, un mois plus tard, sans savoir d’où il vient.
La gestion d’erreur. Une API distante tombe, ralentit, refuse. Votre site doit continuer de fonctionner : la fonction d’IA est un supplément, pas un point de passage obligé.
RGPD : ce qu’il faut regarder
Dès que les données envoyées concernent une personne identifiable, vous devenez responsable d’un transfert.
Trois points à vérifier avant de choisir un fournisseur.
Où sont traitées les données. Mistral héberge en Europe. OpenAI et Anthropic proposent des options de résidence des données, à vérifier selon l’offre souscrite. Un traitement hors de l’Union suppose des garanties appropriées.
Ce qu’il advient des données envoyées. Les principaux fournisseurs s’engagent à ne pas réutiliser les données d’API pour entraîner leurs modèles, contrairement à leurs interfaces grand public. C’est une différence majeure, et elle justifie de passer par l’API plutôt que de laisser vos équipes coller des documents dans une interface publique.
Ce que vous devez déclarer. Le recours à un sous-traitant doit figurer dans votre registre des traitements et votre politique de confidentialité. Et si vos utilisateurs saisissent du texte libre, ils peuvent y mettre n’importe quoi : prévenez-les que leur saisie est transmise à un service tiers.
Une précaution simple élimine l’essentiel du risque : n’envoyez que ce qui est nécessaire. Un identifiant client plutôt qu’un nom, un extrait plutôt qu’un dossier complet.
Les coûts qu’on oublie
Le prix des tokens n’est qu’une partie de la note.
- Le développement : une intégration soignée, avec gestion d’erreur, limitation et journalisation, représente plusieurs jours, pas quelques heures ;
- les essais : la mise au point d’une invite consomme des centaines d’appels, parfois sur le modèle le plus cher ;
- la maintenance : les modèles sont retirés. Celui que vous intégrez aujourd’hui sera obsolète dans un an, et le remplaçant ne se comportera pas exactement pareil ;
- le change : les tarifs sont en dollars, votre facture aussi. Un euro faible renchérit tout.
Sur un petit projet, le développement coûte souvent cent fois les tokens de la première année. Cela déplace la question : le bon arbitrage n’est pas de choisir le modèle le moins cher, mais de vérifier que la fonctionnalité mérite d’exister.
Un cas concret : l’assistant de Sportwhen
Pour sortir de la théorie, voici comment nous avons procédé sur Sportwhen, une plateforme de mise en relation sportive, dont l’assistant conversationnel tourne en production depuis le 27 septembre 2026.
Le choix du modèle. Mistral Small, en paiement à l’usage. Trois raisons : l’hébergement européen, qui simplifie la conformité ; un tarif d’entrée à 0,15 $ le million de tokens, soit le tiers du modèle léger le moins cher de la concurrence ; et une qualité largement suffisante pour répondre à des questions sur un catalogue de terrains et de moniteurs. Le modèle haut de gamme n’aurait rien apporté sur cette tâche, pour dix fois le prix.
Le piège de la passerelle. L’application a été construite avec un outil de développement assisté qui propose sa propre passerelle vers les modèles d’IA. C’est commode en développement : aucune clé à gérer, cela fonctionne immédiatement.
C’est aussi un enfermement. Cette passerelle facture selon les règles de la plateforme, pas selon celles du fournisseur, et l’application ne fonctionne plus si on la quitte. Le passage en production s’est donc fait avec un appel direct à l’API Mistral, depuis notre propre serveur, avec notre propre clé et notre propre facture.
La leçon vaut au-delà de ce cas : une passerelle intégrée à un outil de développement rend service pendant la construction et devient un coût subi ensuite. Prévoyez la sortie dès le départ — concrètement, isolez l’appel à l’IA dans une seule fonction de votre code, pour n’avoir qu’un endroit à modifier.
Deux environnements, deux comptes. Le développement continue de passer par la passerelle, la production par l’API directe. Cette séparation a un mérite inattendu : les essais de mise au point, qui consomment beaucoup, ne polluent pas la facture de production, et l’on mesure le coût réel du service sans le bruit du développement.
Par où commencer
Un ordre qui évite les mauvaises surprises.
- Définissez une tâche précise. « Mettre de l’IA sur le site » n’est pas un projet ; « proposer trois titres à partir d’un article » en est un ;
- testez l’invite à la main dans l’interface du fournisseur avant d’écrire une ligne de code — vous saurez en dix minutes si le résultat vaut l’effort ;
- commencez par un modèle léger. Vous monterez en gamme si la qualité ne suffit pas ; l’inverse n’arrive jamais ;
- posez vos plafonds dès le premier jour, pas après le premier incident ;
- mesurez avant d’optimiser. La journalisation des tokens dira où part l’argent, et ce sera rarement là où vous pensiez.
En résumé
- la clé d’API ne va jamais dans le navigateur : l’appel passe par votre serveur, sans exception ;
- on paie des tokens, entrée et sortie séparément — et c’est l’entrée qui domine, parce que le contexte se renvoie à chaque appel ;
- l’écart de prix entre modèles va de un à quarante : le choix du modèle prime sur toute optimisation ;
- cache d’invite et traitement par lots divisent la facture sans toucher à la qualité ;
- plafonnez toujours les tokens de sortie ;
- traitez les erreurs 429 avec un recul exponentiel, jamais par un réessai immédiat ;
- posez une limite par utilisateur, une limite globale et une alerte de dépense avant la mise en ligne ;
- le streaming transforme la perception de l’attente pour un coût de développement modeste ;
- n’envoyez que les données nécessaires, et déclarez le sous-traitant ;
- le développement coûte généralement bien plus que les tokens.
Les tarifs de cet article seront périmés d’ici quelques mois — trois des neuf modèles cités ont changé de prix ou sont apparus depuis juillet. La méthode de calcul, elle, restera valable : comptez vos tokens, multipliez par votre volume, et posez vos plafonds avant d’ouvrir la fonction au public.