Modèles de raisonnement : quand la réflexion vaut son prix
Les principaux modèles d'Anthropic, d'OpenAI et de Google raisonnent désormais avant de répondre, et ce raisonnement se paie en tokens de sortie. Sur un benchmark public, le même modèle coûte près de huit fois plus par tâche à son niveau le plus élevé qu'au plus bas. Voici comment décider où la réflexion supplémentaire vaut son prix.
Les modèles de raisonnement dépensent des tokens supplémentaires à réfléchir avant de répondre. En septembre 2026, cette réflexion est un réglage des modèles principaux (effort de low à max chez Claude, de none à max sur GPT-6 Sol et Luna, niveaux sur Gemini 3.8 Flash) et elle est facturée en tokens de sortie, visible ou non.
Notre règle : payez la réflexion là où elle augmente la part de tâches résolues (code, mathématiques, planification, agents multi-étapes), gardez-la basse pour la classification, l'extraction et la voix en temps réel, et réglez-la par route d'après le coût par tâche résolue sur votre propre jeu d'évaluation.
Ce que « réfléchir » veut dire, simplement
Un modèle de raisonnement écrit des étapes intermédiaires avant sa réponse finale : il décompose le problème, essaie une approche, la vérifie et recommence parfois. Le terme technique est calcul à l'inférence (test-time compute) : plutôt qu'un modèle plus gros, on dépense plus de calcul sur chaque question.
Ces étapes sont des tokens. Vous en voyez en général un résumé, ou rien, mais vous les payez toutes au tarif de sortie, et leur génération prend du temps. Réfléchir davantage aide surtout sur les problèmes à nombreuses étapes dépendantes, et peu quand la réponse est une recherche ou une étiquette.
L'emballage a changé. En décembre 2024, OpenAI vendait le raisonnement comme un modèle à part, o1, à 15 $/60 $ par million de tokens ; en 2026, c'est un réglage des modèles principaux et OpenAI classe la série o en legacy. Sur Claude Opus 5.5 et Fable 5.1, la réflexion ne peut même plus être désactivée : l'effort est le seul levier.
Comment les éditeurs l'exposent en septembre 2026
La même idée, avec des noms, des niveaux et des valeurs par défaut différents.
| Modèle | Contrôle | Niveaux | Par défaut |
|---|---|---|---|
| Claude Opus 5.5 | effort ; réflexion toujours active | low, medium, high, xhigh, max | medium |
| Claude Fable 5.1 | effort ; réflexion toujours active | de low à max | high |
| Claude Haiku 4.5 | réflexion étendue avec budget de tokens | budget en tokens | effort non pris en charge |
| GPT-6 Sol, GPT-6 Luna, GPT-5.6 | reasoning effort | none, low, medium, high, xhigh, max | medium |
| GPT-6 Astra | reasoning effort | de low à max | medium |
| Gemini 3.8 Flash | thinking_level ; impossible à désactiver | low, medium, high | medium |
Claude Sonnet 5 associe aussi réflexion adaptative et effort (high par défaut), et Gemini 3 Deep Think reste un mode à part pour les abonnés Google AI Ultra et l'accès anticipé par API. Deux détails comptent plus que les étiquettes. Les niveaux ne se transposent pas d'un modèle à l'autre : Anthropic indique qu'Opus 5.5 réfléchit davantage par tour qu'Opus 5 au même niveau, et qu'Opus 5.5 en medium dépasse Opus 5 en high sur ses évaluations de code et de travail intellectuel. Et l'effort agit aussi sur les actions : avec moins d'effort, Claude fait des appels d'outils moins nombreux et plus concis.
La mécanique du coût et de la latence
La réflexion est facturée en sortie, le côté cher de la grille tarifaire.
Anthropic, OpenAI et Google facturent les tokens de réflexion au tarif de sortie, cinq fois le tarif d'entrée sur Claude Opus 5.5 (4 $/20 $), GPT-6 Sol (2 $/10 $) et Gemini 3.8 Flash (0,75 $/3,75 $). La sortie est générée token par token : la réflexion retarde donc aussi le premier mot utile, et dans un agent ce délai se répète à chaque tour.
ARC Prize publie le score et le coût par tâche de chaque modèle et niveau d'effort, ce qui rend le compromis visible :
| Modèle et effort | Score | Coût par tâche |
|---|---|---|
| Claude Opus 5.5, low | 70,1 % | 0,241 $ |
| Claude Opus 5.5, high | 93,3 % | 0,408 $ |
| Claude Opus 5.5, max | 91,7 % | 1,85 $ |
| GPT-6 Astra, max | 95,0 % | 1,12 $ |
| Gemini 3.8 Flash, high | 89,2 % | 0,40 $ |
| GPT-6 Luna, max | 59,3 % | 0,062 $ |
| Gemini 3 Deep Think (février 2026) | 84,6 % | 13,62 $ |
De low à high, Opus 5.5 gagne 23 points pour 1,7 fois le coût ; de high à max, le coût est multiplié par 4,5 et le score baisse de 1,6 point. Les énigmes d'ARC ne sont pas votre charge de travail, mais cette forme (une forte hausse, puis un plateau à coût croissant) est celle qu'il faut chercher dans vos propres données.
Les éditeurs décrivent le même schéma. Anthropic indiquait en novembre 2025 que Claude Opus 4.5 en effort medium égalait le meilleur score de Sonnet 4.5 sur SWE-bench Verified avec 76 % de tokens de sortie en moins ; OpenAI affirme que GPT-6 Sol en xhigh obtient 33,2 % sur AutomationBench à 0,27 $ par tâche, contre 26,9 % pour Claude Opus 5 en max, pour 11,1 fois ce coût.
Où la réflexion paie, et où elle ne paie pas
La réflexion paie quand une tâche comporte de nombreuses étapes dépendantes et un résultat vérifiable : mathématiques, modifications de code sur plusieurs fichiers, planification, analyse combinant outils et données, agents multi-étapes où une erreur précoce ruine l'exécution. Là, plus d'effort augmente la part de tâches résolues, et c'est cela que vous achetez.
Elle paie rarement pour la classification, l'extraction, le routage, les réponses courtes de FAQ ou la réécriture, où le modèle connaît la réponse ou non. Elle nuit à la voix en temps réel, où la réflexion cachée retarde le premier mot prononcé ; Google propose Gemini 3.8 Live et une variante distincte Live Extended Thinking, ce qui fait de ce compromis un choix explicite.
| Type de tâche | Commencer à | Monter quand |
|---|---|---|
| Classification, étiquetage, routage | Le niveau le plus bas : none sur GPT-6 Sol et Luna, low sur Claude et Gemini 3.8 Flash | Les erreurs se concentrent sur les cas ambigus |
| Extraction vers un schéma | Low | Les champs exigent des déductions entre pages |
| FAQ et chat de service client | Low | Les réponses dépendent de règles ou de plusieurs recherches |
| Voix en temps réel | Le niveau le plus bas, ou un modèle audio temps réel | Rarement : envoyez les cas difficiles vers un flux asynchrone |
| Réponses RAG sur documents | De low à medium | Les sources se contredisent ou il faut synthétiser |
| Modifications de code, débogage | Medium | Les tests échouent encore ou le changement touche de nombreux fichiers |
| Agents multi-étapes avec outils | Medium | L'agent stagne ; baissez si le coût monte sans plus de tâches résolues |
| Mathématiques, planification, analyse difficile | High | Xhigh ou max seulement avec des preuves issues de vos évaluations, idéalement en batch |
Régler l'effort en cinq étapes
- Constituez un jeu d'évaluation. 30 à 50 tâches réelles par route, avec des contrôles automatiques de réussite ou d'échec ; Anthropic recommande de commencer avec 20 à 50 tâches tirées d'échecs réels (voir notre guide des évaluations).
- Balayez les niveaux. Testez chaque candidat à deux ou trois niveaux d'effort, plusieurs fois par tâche, en relevant réussites, tokens et latence.
- Calculez le coût par tâche résolue. Divisez la dépense par les tâches résolues, pas par les requêtes : un réglage bon marché qui échoue une fois sur deux peut coûter plus cher par tâche résolue.
- Fixez l'effort par route, explicitement. Gardez le niveau le plus bas compatible avec votre tolérance de qualité et écrivez-le dans le code, car les valeurs par défaut changent (high sur Opus 5, medium sur Opus 5.5).
- Surveillez. Journalisez tokens de réflexion et motifs d'arrêt, alertez quand le coût par tâche dérive, et relancez le balayage à chaque changement de modèle.
Deux mécanismes surprennent les équipes. Le plafond de sortie inclut la réflexion : avec un max_tokens (Claude) ou un max_output_tokens (OpenAI, Gemini) trop serré, le modèle peut épuiser le budget à réfléchir et renvoyer une réponse tronquée ou vide ; gardez de la marge et traitez un motif d'arrêt max_tokens ou une réponse incomplète comme une erreur. Et chez Claude, changer l'effort global entre deux requêtes invalide le cache de prompt (l'effort par message, en bêta sur les modèles récents, le préserve) : gardez un effort stable dans une conversation mise en cache.
Choisissez la combinaison modèle plus effort la moins chère qui atteint votre seuil de réussite sur votre propre jeu d'évaluation. La valeur par défaut de l'éditeur est un point de départ, pas une recommandation pour votre tâche.
Les pièges à éviter
- Trop réfléchir. Plus d'effort signifie des tours plus longs, plus d'appels d'outils et, comme le montrent les données d'ARC-AGI-2, parfois un score plus bas pour un coût plus élevé. Anthropic note aussi que sur Opus 5 l'effort ne raccourcit pas de façon fiable les réponses visibles : demandez la longueur dans le prompt ; OpenAI propose un réglage de verbosité séparé.
- Reporter d'anciens réglages. Sur Opus 5.5, la réflexion ne peut plus être désactivée, l'appel forcé d'outils renvoie une erreur et l'effort par défaut est passé de high à medium ; Google a rendu obsolètes temperature, top_p et top_k dans l'API Gemini le 21 juillet 2026. Refaites le balayage au lieu de copier les paramètres.
- Demander au modèle de dévoiler son raisonnement. Opus 5.5 ajoute une catégorie de refus
reasoning_extractionqui bloque les tentatives d'extraction de son raisonnement interne (renvoyée sous la formestop_reason: refusal). Pour la traçabilité, demandez une courte justification dans la réponse, journalisez les appels d'outils et orientez les refus vers un modèle de repli. - Prendre la réflexion pour un journal fidèle. OpenAI indique que le raisonnement écrit de GPT-6 Astra a été plus difficile à surveiller que celui de GPT-5.6 Sol lors de ses tests et, après l'incident Hugging Face, a consacré plus de calcul à la surveillance de la chaîne de pensée. Auditez les actions, les appels d'outils et les sorties.
- Oublier les tokens de réflexion dans les tableaux de bord. Une vue des coûts limitée à l'entrée et à la sortie visible masque la part de la facture que pilote l'effort.
Ce que cela change pour les budgets, en Colombie et en Europe
Les éditeurs facturent en dollars : nous budgétons donc le raisonnement en USD et convertissons à la facture ; pour les équipes colombiennes, le taux de change est une variable de plus qu'elles ne maîtrisent pas. L'unité qui compte est le coût par tâche résolue, par route.
Une illustration avec les chiffres d'ARC Prize ci-dessus, pas une prévision : à 10 000 tâches par mois, Opus 5.5 coûterait environ 2 410 $ en effort low, 4 080 $ en high et 18 500 $ en max, et sur ce test le passage à max n'apporte rien.
Trois leviers gardent la réflexion abordable : les API batch (50 % de remise chez Anthropic, OpenAI et Google) pour le travail à effort élevé qui peut attendre, le cache pour le contexte que les agents renvoient à chaque tour, et un routage qui n'envoie que les cas difficiles vers un effort élevé. Les équipes européennes qui ont besoin d'un traitement régional paient 10 % de plus chez OpenAI ou sur les endpoints régionaux de Claude dans le cloud, sur une facture déjà gonflée par la réflexion. Plus de détails dans notre guide des coûts de l'IA ; Slash AI Lab évalue les modèles avant chaque déploiement.
L'essentiel
- En 2026, la réflexion est un réglage des modèles principaux, facturé en tokens de sortie même quand vous ne la voyez pas.
- Claude Opus 5.5 réfléchit toujours, en effort medium par défaut ; GPT-6 Sol et Luna vont de none à max ; Gemini 3.8 Flash utilise des niveaux, medium par défaut.
- Sur ARC-AGI-2, Opus 5.5 coûte 0,241 $ par tâche en effort low et 1,85 $ en max, et high a obtenu un meilleur score que max.
- Payez la réflexion pour le code, les mathématiques, la planification et les agents multi-étapes ; gardez-la au minimum pour la classification, l'extraction et la voix en temps réel.
- Réglez par route selon le coût par tâche résolue, gardez de la marge sur le plafond de sortie et un effort stable pour préserver le cache.
Sources
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Qu'est-ce que l'effort de raisonnement ?
Un réglage qui contrôle combien un modèle réfléchit avant de répondre. Un effort plus élevé résout en général plus de tâches difficiles à plusieurs étapes, mais génère plus de tokens de sortie et prend plus de temps.
Les tokens de réflexion sont-ils facturés ?
Oui. Anthropic, OpenAI et Google les facturent comme des tokens de sortie, même si vous n'en voyez qu'un résumé, ou rien.
Peut-on désactiver la réflexion sur Claude Opus 5.5 ?
Non. La réflexion est toujours active sur Opus 5.5 et Fable 5.1. Le levier est le paramètre effort, de low à max, avec medium par défaut sur Opus 5.5.
Par quel niveau d'effort commencer ?
Le plus bas pour la classification et l'extraction, medium pour le code et les agents, high pour les mathématiques et la planification. Balayez ensuite les niveaux sur votre propre jeu d'évaluation et gardez le moins cher qui atteint votre seuil de qualité.
Les modèles de la série o d'OpenAI valent-ils encore la peine ?
Ils figurent toujours dans la grille tarifaire d'OpenAI (o3 à 2 $/8 $, par exemple), mais sont désormais legacy. Pour un nouveau projet, testez d'abord GPT-6 Sol ou Luna avec un niveau d'effort explicite.
D'autres analyses à lire
Claude Opus 5.5 : ce qui change pour les entreprises
Lancé le 22 septembre 2026 : moins cher qu'Opus 5, niveau Fable 5.1 selon Anthropic. Prix, benchmarks, changements techniques et cas d'usage.
Stratégie et régulationLe vrai coût de l'IA
Comment l'IA est facturée, pourquoi le coût par tâche résolue compte plus que le prix au token, leviers chiffrés, coûts cachés et seuil local ou API.
Agents et ingénierieEvals : tester un système à base de LLM
Pourquoi tester à l'intuition échoue : jeu de référence en espagnol et en français, juges LLM calibrés, seuils bloquants en CI, outils et coût des evals.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.