Stratégie et régulation · Septembre 2026

Le vrai coût de l'IA : ce que montre la facture, et ce qu'elle cache

Le prix par million de tokens n'est qu'un début. La facture réelle dépend du cache, de l'effort de raisonnement, des nouvelles tentatives et de choix d'architecture faits avant le premier prompt. Voici comment nous la calculons.

10 $ / 50 $ nouveau palier premium par million de tokens7,7x coût par tâche, effort max contre low sur Opus 5.550 % remise batch chez Anthropic, OpenAI et Google
En bref

En 2026, les prix de l'IA ont bougé dans deux directions : un palier premium à 10 $ / 50 $ par million de tokens est apparu (Claude Fable 5.1, GPT-6 Astra) pendant que le milieu de gamme baissait (GPT-6 Sol à 2 $ / 10 $, Claude Opus 5.5 20 % sous Opus 5). Mais la facture dépend moins du prix catalogue que du cache, des tokens de raisonnement, des remises batch et des majorations.

Notre règle : mesurez le coût par tâche résolue, pas le prix au token, actionnez les leviers dans l'ordre et faites le calcul local contre API avec vos volumes avant d'acheter du matériel.

Comment l'IA est facturée en 2026

Sept compteurs tournent sur chaque facture ; la plupart des équipes en regardent deux.

Pages de prix et documentation des fournisseurs, consultées le 26 septembre 2026. Dollars par million de tokens sauf mention contraire.
CompteurFonctionnementExemples
Entrée et sortieLa sortie coûte cinq à six fois l'entréeClaude Opus 5.5 : 4 / 20 ; GPT-6 Sol : 2 / 10 ; Gemini 3.5 Flash : 1,50 / 9
Tokens de raisonnementFacturés comme de la sortie, même si vous ne voyez qu'un résuméOpenAI et Google le documentent ; l'effort fixe le volume
Entrée en cachePréfixes réutilisés à une fraction du prix ; écrire le cache coûte en plusLecture à 10 % de l'entrée chez Anthropic (5 % sur Opus 5.5), pour la famille GPT-5 d'OpenAI et Gemini 3.5 Flash ; écriture à 1,25x ou 2x chez Anthropic
BatchTâches asynchrones à moitié prix50 % de remise chez Anthropic, OpenAI et Google
Contexte longMajoration au-delà d'un seuil, selon le fournisseurOpenAI (GPT-5.5 et suivants) : 2x l'entrée et 1,5x la sortie au-delà de 272K ; Gemini 3.1 Pro : 4 / 18 au-delà de 200K ; Claude 4.6 et suivants : aucune
Résidence des donnéesPrime pour garder l'inférence dans une régionOpenAI : +10 % sur les modèles depuis le 5 mars 2026 ; Anthropic, États-Unis uniquement : 1,1x ; endpoints régionaux Bedrock et Vertex : +10 %
Médias et outilsÀ l'image, à la seconde ou à l'appelNano Banana 2 : 0,067 $ l'image 1K ; Veo 3.1 : 0,40 $ la seconde ; recherche web de Claude : 10 $ les 1 000

La tendance dépend du palier que vous achetez.

2026 a créé un palier premium à 10 $ / 50 $ : Claude Fable 5 (9 juin), Fable 5.1 (1er septembre) et GPT-6 Astra (3 septembre). Le milieu de gamme a baissé : GPT-6 Sol (2 $ / 10 $) et Luna (0,10 $ / 0,50 $) sont sortis le 22 septembre à la moitié ou moins des prix promotionnels de leurs prédécesseurs GPT-5.6.

À capacité égale, la chute est forte. Epoch AI a constaté que le prix pour atteindre un niveau de performance donné a baissé de 9 à 900 fois par an selon le seuil, les baisses les plus rapides étant les moins sûres de durer. Selon les données d'ARC Prize, Claude Opus 4.6 obtenait 64,6 % sur ARC-AGI-2 pour 2,25 $ par tâche en février 2026 ; DeepSeek V4 Flash, 61,4 % pour 0,042 $ en juillet.

Le décompte des tokens bouge aussi : le tokenizer qu'Anthropic utilise depuis Claude Opus 4.7 produit environ 30 % de tokens en plus pour le même texte. Un prix au token plus bas peut donc donner une facture plus élevée.

Le coût par tâche résolue, pas le prix au token

L'unité qui compte, c'est le travail terminé.

Un token moins cher qui exige deux nouvelles tentatives n'est pas moins cher. Notre formule de travail : coût par tâche résolue = dépense d'une route ÷ tâches qui passent votre évaluation. Elle capte les nouvelles tentatives, le raisonnement et les appels d'outils qu'une grille tarifaire ignore.

L'effort montre l'écart possible. Sur le classement ARC-AGI-2 d'ARC Prize, Claude Opus 5.5 coûte 0,241 $ par tâche en effort low (70,1 %), 0,408 $ en high (93,3 %) et 1,85 $ en max (91,7 %) : max coûte 7,7 fois low et 4,5 fois high, pour un score inférieur à high.

Méfiez-vous de tout coût par tâche que vous n'avez pas mesuré : vérifiez-le avec vos propres evals et réglez l'effort comme expliqué dans quand payer pour réfléchir.

Les leviers, dans l'ordre où nous les actionnons

D'abord ceux qui ne touchent pas à la qualité ; ensuite ceux qui la négocient, et seulement avec une eval avant et après.

Effets rapportés par chaque source sur sa propre charge ; les vôtres différeront.
LevierEffet documentéPoint de vigilance
1. CacheLecture à 10 % de l'entrée (5 % sur Opus 5.5) ; dans une étude de cas de 2026, 99,3 % de succès de cache ont réduit la dépense API de 88,6 %Exige un préfixe stable ; chez Anthropic, changer l'effort invalide le cache
2. Hygiène des prompts et des outilsAnthropic a réduit un flux d'agent de 150 000 à 2 000 tokens en appelant les outils MCP depuis du codeLes définitions d'outils sont facturées : le toolset d'usage de l'ordinateur de Claude ajoute environ 4 500 tokens par requête
3. Longueur de sortieLe paramètre de verbosité d'OpenAI a donné 560, 849 ou 1 288 tokens pour une même tâcheSur Opus 5, l'effort ne raccourcit pas les réponses de façon fiable : demandez la longueur dans le prompt
4. Batch50 % de remise chez les trois grands ; cumulable avec le cache chez AnthropicAsynchrone ; incompatible avec le mode rapide d'Anthropic
5. EffortOpus 5.5 sur ARC-AGI-2 : 0,241 $ par tâche en low, 1,85 $ en maxMoins d'effort peut coûter de la qualité ; fixez-le par route
6. Routage et cascadesRouteLLM a réduit le coût de plus de 85 % sur MT Bench en gardant 95 % de la qualité de GPT-4 ; Cursor affirme que son routeur bat Opus 4.8 pour 41 % de coût en moinsUn routeur a besoin de ses propres evals et d'un repli
7. Modèles plus petitsGPT-6 Luna coûte vingt fois moins que GPT-6 Sol ; gpt-oss-120b coûte 0,15 $ / 0,60 $ chez Groq et TogetherÉcarts sur les tâches difficiles et en espagnol ou en français
8. DistillationDeepSeek affirme que son modèle distillé de 8B égale Qwen3-235B-thinking sur AIME 2024Exige données, entraînement et evals ; Anthropic bloque l'extraction du raisonnement d'Opus 5.5

Les coûts absents de la facture de tokens

Budgétez-les dès le premier jour.

  • Evals et observabilité. Chaque changement de modèle ou de prompt impose de relancer les tests ; notre guide des evals chiffre une passe complète entre 16 $ et 32 $ dans son exemple.
  • Temps d'ingénierie. Dans la même étude de cas de 2026, l'installation locale en modèles ouverts affichait un taux de commits correctifs de 74,9 % contre 45,9 % avec le modèle en API.
  • Nouvelles tentatives, refus et garde-fous. Les tentatives ratées sont facturées, certains refus de Fable 5 le sont depuis le 24 septembre 2026, et chaque garde-fou est un appel de modèle de plus.
  • Frais d'exécution. Claude Managed Agents facture 0,08 $ par heure de session et la recherche web 10 $ les 1 000 recherches.
  • Dépendance. Une directive américaine de contrôle des exportations a contraint Anthropic à retirer Fable 5 à tous ses utilisateurs du 12 juin au 1er juillet 2026.
  • Changements de prix programmés. Gemini 3.6 à 3.8 Flash doublent à 1,50 $ / 7,50 $ le 1er janvier 2027 ; les 4 $ / 20 $ de GPT-5.6 Sol sont promotionnels au moins jusqu'au 21 novembre 2026.

Local ou API : calculer le seuil de rentabilité

Tout dépend de la référence choisie et du taux d'occupation de la machine.

Coût local mensuel = matériel ÷ mois de durée de vie + énergie + temps d'exploitation. Seuil = coût local mensuel ÷ coût par requête de l'API. Vérifiez ensuite que la machine peut servir ce volume et que le modèle local passe la même eval.

Un exemple illustratif, pas un devis : un poste de travail avec une NVIDIA RTX 5090 (prix de lancement 1 999 $, 575 W) qui fait tourner gpt-oss-20b, mesuré par LMSYS sur cette carte à 8 519 tokens par seconde en lecture et 205 en écriture. Hypothèses : 1 000 $ pour le reste de la machine, 36 mois de durée de vie, 0,7 kW, 8 heures par jour 20 jours par mois à 0,15 $ le kWh (comme Pan et al.), 8 heures d'exploitation par mois à 50 $ de l'heure, et des requêtes de 2 000 tokens en entrée et 500 en sortie.

Coût local mensuel : matériel 83 $ + énergie 17 $ + exploitation 400 $ = environ 500 $. Capacité sur un seul flux : environ 215 000 requêtes par mois.
API comparéeCoût par requêteRequêtes par mois pour égaler 500 $Dans la capacité locale ?
Claude Opus 5.5 (4 $ / 20 $)0,018 $Environ 27 800Oui
GPT-6 Sol (2 $ / 10 $)0,009 $Environ 55 600Oui
GPT-6 Luna (0,10 $ / 0,50 $)0,00045 $Environ 1,1 millionNon
gpt-oss-20b chez Groq (0,075 $ / 0,30 $)0,0003 $Environ 1,7 millionNon

Face à une API de pointe, le poste se rentabilise avec quelques dizaines de milliers de requêtes par mois, si un modèle de 20B passe vos evals. Face au même modèle ouvert servi par API, il ne se rentabilise pas à ce taux d'usage. L'exploitation est la plus grosse ligne : sans elle, le seuil face à GPT-6 Sol tombe à environ 11 100 requêtes.

Les études confirment l'allure. Pan et al. (2025) voient le local rentable surtout au-delà de 50 millions de tokens par mois ou sous contrainte de résidence, et l'étude de cas de 2026 a mesuré des appels API en cache à environ 0,57 $ par million de tokens, sous les 2,83 $ d'une fraction de GPU locale partagée. Epoch AI ajoute que la performance par dollar des puces d'IA progresse d'environ 49 % par an : le matériel possédé vieillit vite.

Avant d'acheter

Refaites ce calcul avec vos volumes, vos taux de réussite en eval et votre coût de main-d'œuvre. La conformité peut justifier à elle seule l'inférence locale ; le coût, rarement, hors volumes élevés et stables. Les options sont dans notre guide du matériel pour l'IA locale.

FinOps pour l'IA : budgets, alertes et revues

Maîtriser les coûts est une routine, pas un projet.

  • Étiquetez chaque appel avec la route, la fonctionnalité, le client, le modèle, l'effort et le succès de cache.
  • Des tableaux de bord par route : coût par tâche résolue, taux de succès du cache, tokens de sortie par tâche, nouvelles tentatives.
  • Alertes et quotas : dépense quotidienne comparée à une référence et plafonds par clé et par équipe. Les agents consomment vite : selon OpenAI, l'usage quotidien de tokens de son chercheur médian, au prix de l'API, dépasse 600 $.
  • Discipline sur l'effort : fixez-le par route, pas par requête ; chez Anthropic, le changer invalide le cache.
  • Une revue mensuelle du mix de modèles, des taux de réussite, des changements de prix et des dates de retrait, avec un responsable qui peut dire non.

Achats : notes pour la Colombie et l'Europe

La devise, la résidence et les conditions de sortie pèsent autant que la grille tarifaire.

Devise. Les grilles tarifaires sont en dollars : un budget en euros ou en pesos ajoute un risque de change au risque d'usage. Budgétez en dollars avec une marge, révisez chaque mois et faites confirmer par votre conseil fiscal le traitement des services numériques étrangers dans votre cas ; nous ne modélisons pas la fiscalité ici.

Résidence. Garder l'inférence dans une région coûte plus cher : +10 % pour le traitement régional d'OpenAI et pour les endpoints régionaux de Bedrock ou Vertex, 1,1x pour l'inférence limitée aux États-Unis chez Anthropic. Acheter Claude via AWS, Google Cloud ou Microsoft permet d'utiliser des engagements cloud existants.

Retraits et sortie. Anthropic publie des dates minimales de disponibilité (Opus 5.5 pas avant le 22 septembre 2027 ; Haiku 4.5 seulement jusqu'au 15 octobre 2026 au moins). Négociez des préavis pour les retraits et les changements de prix, un accompagnement de migration et des conditions de conservation des données, et gardez un repli testé chez un second fournisseur. Nous vous accompagnons en conseil en IA.

L'essentiel

  • Le prix au token n'est que la base : le cache, le raisonnement facturé comme sortie, le batch et les majorations pour contexte long ou résidence changent la facture.
  • 2026 a scindé le marché : un palier premium à 10 $ / 50 $ est apparu pendant que le milieu de gamme baissait, et le prix par capacité continue de chuter.
  • Mesurez le coût par tâche résolue : sur ARC-AGI-2, Opus 5.5 en effort max coûte 7,7 fois le low et obtient moins que le high.
  • Commencez par le cache et le batch ; effort, routage, petits modèles et distillation échangent de la qualité contre du coût et exigent une eval avant et après.
  • Le local ne bat l'API qu'avec un volume élevé et stable ou pour la conformité ; le temps d'exploitation est souvent la plus grosse ligne.

Sources

  1. Pricing · Anthropic documentation, 2026-09
  2. Effort · Anthropic documentation, 2026-09
  3. Models overview · Anthropic documentation, 2026-09
  4. API pricing · OpenAI, 2026-09
  5. Introducing GPT-6 Sol and GPT-6 Luna · OpenAI, 2026-09-22
  6. Gemini API pricing · Google, 2026-09
  7. ARC-AGI leaderboard · ARC Prize, 2026-09-26
  8. LLM inference prices have fallen rapidly but unequally across tasks · Epoch AI, 2025-03-12
  9. RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing · LMSYS, 2024-07-01
  10. Code execution with MCP · Anthropic, 2025-11-04
  11. A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services · Pan et al., arXiv, 2025-08-30
  12. GeForce RTX 5090 · NVIDIA, 2025-01-06

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Pourquoi la sortie coûte-t-elle plus cher que l'entrée ?

Les fournisseurs facturent davantage la génération que la lecture : sur les modèles actuels, la sortie coûte cinq à six fois l'entrée (Claude Opus 5.5 à 4 $ / 20 $, GPT-6 Sol à 2 $ / 10 $, Gemini 3.5 Flash à 1,50 $ / 9 $). OpenAI et Google facturent les tokens de raisonnement comme de la sortie : l'effort pèse donc sur la facture.

Combien le cache de prompt fait-il économiser ?

La lecture en cache coûte 10 % du prix d'entrée chez Anthropic, pour la famille GPT-5 d'OpenAI et pour Gemini 3.5 Flash, et 5 % sur Claude Opus 5.5. L'écriture coûte plus cher (1,25x ou 2x chez Anthropic) : le cache est rentable quand le même préfixe est réutilisé pendant sa durée de vie.

L'API Batch vaut-elle le coup ?

Pour tout ce qui n'exige pas de réponse immédiate, oui : Anthropic, OpenAI et Google facturent 50 % de moins les tâches en batch, et chez Anthropic cette remise se cumule avec celle du cache.

Quand l'inférence locale bat-elle l'API ?

Avec un volume élevé et stable face à des API chères, ou quand la conformité l'exige. Dans notre exemple illustratif, un poste avec une RTX 5090 égale GPT-6 Sol vers 55 600 requêtes par mois, mais jamais le même modèle ouvert servi par API.

Comment budgéter l'IA en dollars depuis l'Europe ?

Budgétez en dollars avec une marge pour le taux de change, fixez quotas et alertes par route, faites une revue mensuelle en tenant compte des changements de prix annoncés et faites confirmer par votre conseil fiscal le traitement des services numériques étrangers.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban