Le vrai coût de l'IA : ce que montre la facture, et ce qu'elle cache
Le prix par million de tokens n'est qu'un début. La facture réelle dépend du cache, de l'effort de raisonnement, des nouvelles tentatives et de choix d'architecture faits avant le premier prompt. Voici comment nous la calculons.
En 2026, les prix de l'IA ont bougé dans deux directions : un palier premium à 10 $ / 50 $ par million de tokens est apparu (Claude Fable 5.1, GPT-6 Astra) pendant que le milieu de gamme baissait (GPT-6 Sol à 2 $ / 10 $, Claude Opus 5.5 20 % sous Opus 5). Mais la facture dépend moins du prix catalogue que du cache, des tokens de raisonnement, des remises batch et des majorations.
Notre règle : mesurez le coût par tâche résolue, pas le prix au token, actionnez les leviers dans l'ordre et faites le calcul local contre API avec vos volumes avant d'acheter du matériel.
Comment l'IA est facturée en 2026
Sept compteurs tournent sur chaque facture ; la plupart des équipes en regardent deux.
| Compteur | Fonctionnement | Exemples |
|---|---|---|
| Entrée et sortie | La sortie coûte cinq à six fois l'entrée | Claude Opus 5.5 : 4 / 20 ; GPT-6 Sol : 2 / 10 ; Gemini 3.5 Flash : 1,50 / 9 |
| Tokens de raisonnement | Facturés comme de la sortie, même si vous ne voyez qu'un résumé | OpenAI et Google le documentent ; l'effort fixe le volume |
| Entrée en cache | Préfixes réutilisés à une fraction du prix ; écrire le cache coûte en plus | Lecture à 10 % de l'entrée chez Anthropic (5 % sur Opus 5.5), pour la famille GPT-5 d'OpenAI et Gemini 3.5 Flash ; écriture à 1,25x ou 2x chez Anthropic |
| Batch | Tâches asynchrones à moitié prix | 50 % de remise chez Anthropic, OpenAI et Google |
| Contexte long | Majoration au-delà d'un seuil, selon le fournisseur | OpenAI (GPT-5.5 et suivants) : 2x l'entrée et 1,5x la sortie au-delà de 272K ; Gemini 3.1 Pro : 4 / 18 au-delà de 200K ; Claude 4.6 et suivants : aucune |
| Résidence des données | Prime pour garder l'inférence dans une région | OpenAI : +10 % sur les modèles depuis le 5 mars 2026 ; Anthropic, États-Unis uniquement : 1,1x ; endpoints régionaux Bedrock et Vertex : +10 % |
| Médias et outils | À l'image, à la seconde ou à l'appel | Nano Banana 2 : 0,067 $ l'image 1K ; Veo 3.1 : 0,40 $ la seconde ; recherche web de Claude : 10 $ les 1 000 |
Les prix se séparent, ils ne font pas que baisser
La tendance dépend du palier que vous achetez.
2026 a créé un palier premium à 10 $ / 50 $ : Claude Fable 5 (9 juin), Fable 5.1 (1er septembre) et GPT-6 Astra (3 septembre). Le milieu de gamme a baissé : GPT-6 Sol (2 $ / 10 $) et Luna (0,10 $ / 0,50 $) sont sortis le 22 septembre à la moitié ou moins des prix promotionnels de leurs prédécesseurs GPT-5.6.
À capacité égale, la chute est forte. Epoch AI a constaté que le prix pour atteindre un niveau de performance donné a baissé de 9 à 900 fois par an selon le seuil, les baisses les plus rapides étant les moins sûres de durer. Selon les données d'ARC Prize, Claude Opus 4.6 obtenait 64,6 % sur ARC-AGI-2 pour 2,25 $ par tâche en février 2026 ; DeepSeek V4 Flash, 61,4 % pour 0,042 $ en juillet.
Le décompte des tokens bouge aussi : le tokenizer qu'Anthropic utilise depuis Claude Opus 4.7 produit environ 30 % de tokens en plus pour le même texte. Un prix au token plus bas peut donc donner une facture plus élevée.
Le coût par tâche résolue, pas le prix au token
L'unité qui compte, c'est le travail terminé.
Un token moins cher qui exige deux nouvelles tentatives n'est pas moins cher. Notre formule de travail : coût par tâche résolue = dépense d'une route ÷ tâches qui passent votre évaluation. Elle capte les nouvelles tentatives, le raisonnement et les appels d'outils qu'une grille tarifaire ignore.
L'effort montre l'écart possible. Sur le classement ARC-AGI-2 d'ARC Prize, Claude Opus 5.5 coûte 0,241 $ par tâche en effort low (70,1 %), 0,408 $ en high (93,3 %) et 1,85 $ en max (91,7 %) : max coûte 7,7 fois low et 4,5 fois high, pour un score inférieur à high.
Méfiez-vous de tout coût par tâche que vous n'avez pas mesuré : vérifiez-le avec vos propres evals et réglez l'effort comme expliqué dans quand payer pour réfléchir.
Les leviers, dans l'ordre où nous les actionnons
D'abord ceux qui ne touchent pas à la qualité ; ensuite ceux qui la négocient, et seulement avec une eval avant et après.
| Levier | Effet documenté | Point de vigilance |
|---|---|---|
| 1. Cache | Lecture à 10 % de l'entrée (5 % sur Opus 5.5) ; dans une étude de cas de 2026, 99,3 % de succès de cache ont réduit la dépense API de 88,6 % | Exige un préfixe stable ; chez Anthropic, changer l'effort invalide le cache |
| 2. Hygiène des prompts et des outils | Anthropic a réduit un flux d'agent de 150 000 à 2 000 tokens en appelant les outils MCP depuis du code | Les définitions d'outils sont facturées : le toolset d'usage de l'ordinateur de Claude ajoute environ 4 500 tokens par requête |
| 3. Longueur de sortie | Le paramètre de verbosité d'OpenAI a donné 560, 849 ou 1 288 tokens pour une même tâche | Sur Opus 5, l'effort ne raccourcit pas les réponses de façon fiable : demandez la longueur dans le prompt |
| 4. Batch | 50 % de remise chez les trois grands ; cumulable avec le cache chez Anthropic | Asynchrone ; incompatible avec le mode rapide d'Anthropic |
| 5. Effort | Opus 5.5 sur ARC-AGI-2 : 0,241 $ par tâche en low, 1,85 $ en max | Moins d'effort peut coûter de la qualité ; fixez-le par route |
| 6. Routage et cascades | RouteLLM a réduit le coût de plus de 85 % sur MT Bench en gardant 95 % de la qualité de GPT-4 ; Cursor affirme que son routeur bat Opus 4.8 pour 41 % de coût en moins | Un routeur a besoin de ses propres evals et d'un repli |
| 7. Modèles plus petits | GPT-6 Luna coûte vingt fois moins que GPT-6 Sol ; gpt-oss-120b coûte 0,15 $ / 0,60 $ chez Groq et Together | Écarts sur les tâches difficiles et en espagnol ou en français |
| 8. Distillation | DeepSeek affirme que son modèle distillé de 8B égale Qwen3-235B-thinking sur AIME 2024 | Exige données, entraînement et evals ; Anthropic bloque l'extraction du raisonnement d'Opus 5.5 |
Les coûts absents de la facture de tokens
Budgétez-les dès le premier jour.
- Evals et observabilité. Chaque changement de modèle ou de prompt impose de relancer les tests ; notre guide des evals chiffre une passe complète entre 16 $ et 32 $ dans son exemple.
- Temps d'ingénierie. Dans la même étude de cas de 2026, l'installation locale en modèles ouverts affichait un taux de commits correctifs de 74,9 % contre 45,9 % avec le modèle en API.
- Nouvelles tentatives, refus et garde-fous. Les tentatives ratées sont facturées, certains refus de Fable 5 le sont depuis le 24 septembre 2026, et chaque garde-fou est un appel de modèle de plus.
- Frais d'exécution. Claude Managed Agents facture 0,08 $ par heure de session et la recherche web 10 $ les 1 000 recherches.
- Dépendance. Une directive américaine de contrôle des exportations a contraint Anthropic à retirer Fable 5 à tous ses utilisateurs du 12 juin au 1er juillet 2026.
- Changements de prix programmés. Gemini 3.6 à 3.8 Flash doublent à 1,50 $ / 7,50 $ le 1er janvier 2027 ; les 4 $ / 20 $ de GPT-5.6 Sol sont promotionnels au moins jusqu'au 21 novembre 2026.
Local ou API : calculer le seuil de rentabilité
Tout dépend de la référence choisie et du taux d'occupation de la machine.
Coût local mensuel = matériel ÷ mois de durée de vie + énergie + temps d'exploitation. Seuil = coût local mensuel ÷ coût par requête de l'API. Vérifiez ensuite que la machine peut servir ce volume et que le modèle local passe la même eval.
Un exemple illustratif, pas un devis : un poste de travail avec une NVIDIA RTX 5090 (prix de lancement 1 999 $, 575 W) qui fait tourner gpt-oss-20b, mesuré par LMSYS sur cette carte à 8 519 tokens par seconde en lecture et 205 en écriture. Hypothèses : 1 000 $ pour le reste de la machine, 36 mois de durée de vie, 0,7 kW, 8 heures par jour 20 jours par mois à 0,15 $ le kWh (comme Pan et al.), 8 heures d'exploitation par mois à 50 $ de l'heure, et des requêtes de 2 000 tokens en entrée et 500 en sortie.
| API comparée | Coût par requête | Requêtes par mois pour égaler 500 $ | Dans la capacité locale ? |
|---|---|---|---|
| Claude Opus 5.5 (4 $ / 20 $) | 0,018 $ | Environ 27 800 | Oui |
| GPT-6 Sol (2 $ / 10 $) | 0,009 $ | Environ 55 600 | Oui |
| GPT-6 Luna (0,10 $ / 0,50 $) | 0,00045 $ | Environ 1,1 million | Non |
| gpt-oss-20b chez Groq (0,075 $ / 0,30 $) | 0,0003 $ | Environ 1,7 million | Non |
Face à une API de pointe, le poste se rentabilise avec quelques dizaines de milliers de requêtes par mois, si un modèle de 20B passe vos evals. Face au même modèle ouvert servi par API, il ne se rentabilise pas à ce taux d'usage. L'exploitation est la plus grosse ligne : sans elle, le seuil face à GPT-6 Sol tombe à environ 11 100 requêtes.
Les études confirment l'allure. Pan et al. (2025) voient le local rentable surtout au-delà de 50 millions de tokens par mois ou sous contrainte de résidence, et l'étude de cas de 2026 a mesuré des appels API en cache à environ 0,57 $ par million de tokens, sous les 2,83 $ d'une fraction de GPU locale partagée. Epoch AI ajoute que la performance par dollar des puces d'IA progresse d'environ 49 % par an : le matériel possédé vieillit vite.
Refaites ce calcul avec vos volumes, vos taux de réussite en eval et votre coût de main-d'œuvre. La conformité peut justifier à elle seule l'inférence locale ; le coût, rarement, hors volumes élevés et stables. Les options sont dans notre guide du matériel pour l'IA locale.
FinOps pour l'IA : budgets, alertes et revues
Maîtriser les coûts est une routine, pas un projet.
- Étiquetez chaque appel avec la route, la fonctionnalité, le client, le modèle, l'effort et le succès de cache.
- Des tableaux de bord par route : coût par tâche résolue, taux de succès du cache, tokens de sortie par tâche, nouvelles tentatives.
- Alertes et quotas : dépense quotidienne comparée à une référence et plafonds par clé et par équipe. Les agents consomment vite : selon OpenAI, l'usage quotidien de tokens de son chercheur médian, au prix de l'API, dépasse 600 $.
- Discipline sur l'effort : fixez-le par route, pas par requête ; chez Anthropic, le changer invalide le cache.
- Une revue mensuelle du mix de modèles, des taux de réussite, des changements de prix et des dates de retrait, avec un responsable qui peut dire non.
Achats : notes pour la Colombie et l'Europe
La devise, la résidence et les conditions de sortie pèsent autant que la grille tarifaire.
Devise. Les grilles tarifaires sont en dollars : un budget en euros ou en pesos ajoute un risque de change au risque d'usage. Budgétez en dollars avec une marge, révisez chaque mois et faites confirmer par votre conseil fiscal le traitement des services numériques étrangers dans votre cas ; nous ne modélisons pas la fiscalité ici.
Résidence. Garder l'inférence dans une région coûte plus cher : +10 % pour le traitement régional d'OpenAI et pour les endpoints régionaux de Bedrock ou Vertex, 1,1x pour l'inférence limitée aux États-Unis chez Anthropic. Acheter Claude via AWS, Google Cloud ou Microsoft permet d'utiliser des engagements cloud existants.
Retraits et sortie. Anthropic publie des dates minimales de disponibilité (Opus 5.5 pas avant le 22 septembre 2027 ; Haiku 4.5 seulement jusqu'au 15 octobre 2026 au moins). Négociez des préavis pour les retraits et les changements de prix, un accompagnement de migration et des conditions de conservation des données, et gardez un repli testé chez un second fournisseur. Nous vous accompagnons en conseil en IA.
L'essentiel
- Le prix au token n'est que la base : le cache, le raisonnement facturé comme sortie, le batch et les majorations pour contexte long ou résidence changent la facture.
- 2026 a scindé le marché : un palier premium à 10 $ / 50 $ est apparu pendant que le milieu de gamme baissait, et le prix par capacité continue de chuter.
- Mesurez le coût par tâche résolue : sur ARC-AGI-2, Opus 5.5 en effort max coûte 7,7 fois le low et obtient moins que le high.
- Commencez par le cache et le batch ; effort, routage, petits modèles et distillation échangent de la qualité contre du coût et exigent une eval avant et après.
- Le local ne bat l'API qu'avec un volume élevé et stable ou pour la conformité ; le temps d'exploitation est souvent la plus grosse ligne.
Sources
- Pricing
- Effort
- Models overview
- API pricing
- Introducing GPT-6 Sol and GPT-6 Luna
- Gemini API pricing
- ARC-AGI leaderboard
- LLM inference prices have fallen rapidly but unequally across tasks
- RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing
- Code execution with MCP
- A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services
- GeForce RTX 5090
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Pourquoi la sortie coûte-t-elle plus cher que l'entrée ?
Les fournisseurs facturent davantage la génération que la lecture : sur les modèles actuels, la sortie coûte cinq à six fois l'entrée (Claude Opus 5.5 à 4 $ / 20 $, GPT-6 Sol à 2 $ / 10 $, Gemini 3.5 Flash à 1,50 $ / 9 $). OpenAI et Google facturent les tokens de raisonnement comme de la sortie : l'effort pèse donc sur la facture.
Combien le cache de prompt fait-il économiser ?
La lecture en cache coûte 10 % du prix d'entrée chez Anthropic, pour la famille GPT-5 d'OpenAI et pour Gemini 3.5 Flash, et 5 % sur Claude Opus 5.5. L'écriture coûte plus cher (1,25x ou 2x chez Anthropic) : le cache est rentable quand le même préfixe est réutilisé pendant sa durée de vie.
L'API Batch vaut-elle le coup ?
Pour tout ce qui n'exige pas de réponse immédiate, oui : Anthropic, OpenAI et Google facturent 50 % de moins les tâches en batch, et chez Anthropic cette remise se cumule avec celle du cache.
Quand l'inférence locale bat-elle l'API ?
Avec un volume élevé et stable face à des API chères, ou quand la conformité l'exige. Dans notre exemple illustratif, un poste avec une RTX 5090 égale GPT-6 Sol vers 55 600 requêtes par mois, mais jamais le même modèle ouvert servi par API.
Comment budgéter l'IA en dollars depuis l'Europe ?
Budgétez en dollars avec une marge pour le taux de change, fixez quotas et alertes par route, faites une revue mensuelle en tenant compte des changements de prix annoncés et faites confirmer par votre conseil fiscal le traitement des services numériques étrangers.
D'autres analyses à lire
Claude Opus 5.5 : ce qui change pour les entreprises
Lancé le 22 septembre 2026 : moins cher qu'Opus 5, niveau Fable 5.1 selon Anthropic. Prix, benchmarks, changements techniques et cas d'usage.
ModèlesModèles de raisonnement : quand payer pour réfléchir
Réfléchir coûte des tokens et des secondes. Comment Anthropic, OpenAI et Google exposent l'effort, où il paie, où non, et comment le régler au coût par tâche résolue.
IA locale et open sourceIA locale en 2026 : quel matériel acheter et ce qui tourne dessus
RTX 5090, RTX PRO 6000, DGX Spark, Ryzen AI Max+ et Mac Studio M5 : calcul de mémoire, quel modèle tient où, acheter ou louer et choix par taille d'équipe.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.