Modèles · Septembre 2026

Modèles de raisonnement : quand la réflexion vaut son prix

Les principaux modèles d'Anthropic, d'OpenAI et de Google raisonnent désormais avant de répondre, et ce raisonnement se paie en tokens de sortie. Sur un benchmark public, le même modèle coûte près de huit fois plus par tâche à son niveau le plus élevé qu'au plus bas. Voici comment décider où la réflexion supplémentaire vaut son prix.

7,7x coût par tâche, max contre low (Opus 5.5)medium effort par défaut d'Opus 5.5 et GPT-6 Sol5 niveaux d'effort chez Claude, de low à max
En bref

Les modèles de raisonnement dépensent des tokens supplémentaires à réfléchir avant de répondre. En septembre 2026, cette réflexion est un réglage des modèles principaux (effort de low à max chez Claude, de none à max sur GPT-6 Sol et Luna, niveaux sur Gemini 3.8 Flash) et elle est facturée en tokens de sortie, visible ou non.

Notre règle : payez la réflexion là où elle augmente la part de tâches résolues (code, mathématiques, planification, agents multi-étapes), gardez-la basse pour la classification, l'extraction et la voix en temps réel, et réglez-la par route d'après le coût par tâche résolue sur votre propre jeu d'évaluation.

Ce que « réfléchir » veut dire, simplement

Un modèle de raisonnement écrit des étapes intermédiaires avant sa réponse finale : il décompose le problème, essaie une approche, la vérifie et recommence parfois. Le terme technique est calcul à l'inférence (test-time compute) : plutôt qu'un modèle plus gros, on dépense plus de calcul sur chaque question.

Ces étapes sont des tokens. Vous en voyez en général un résumé, ou rien, mais vous les payez toutes au tarif de sortie, et leur génération prend du temps. Réfléchir davantage aide surtout sur les problèmes à nombreuses étapes dépendantes, et peu quand la réponse est une recherche ou une étiquette.

L'emballage a changé. En décembre 2024, OpenAI vendait le raisonnement comme un modèle à part, o1, à 15 $/60 $ par million de tokens ; en 2026, c'est un réglage des modèles principaux et OpenAI classe la série o en legacy. Sur Claude Opus 5.5 et Fable 5.1, la réflexion ne peut même plus être désactivée : l'effort est le seul levier.

Comment les éditeurs l'exposent en septembre 2026

La même idée, avec des noms, des niveaux et des valeurs par défaut différents.

D'après la documentation des éditeurs, consultée les 25 et 26 septembre 2026.
ModèleContrôleNiveauxPar défaut
Claude Opus 5.5effort ; réflexion toujours activelow, medium, high, xhigh, maxmedium
Claude Fable 5.1effort ; réflexion toujours activede low à maxhigh
Claude Haiku 4.5réflexion étendue avec budget de tokensbudget en tokenseffort non pris en charge
GPT-6 Sol, GPT-6 Luna, GPT-5.6reasoning effortnone, low, medium, high, xhigh, maxmedium
GPT-6 Astrareasoning effortde low à maxmedium
Gemini 3.8 Flashthinking_level ; impossible à désactiverlow, medium, highmedium

Claude Sonnet 5 associe aussi réflexion adaptative et effort (high par défaut), et Gemini 3 Deep Think reste un mode à part pour les abonnés Google AI Ultra et l'accès anticipé par API. Deux détails comptent plus que les étiquettes. Les niveaux ne se transposent pas d'un modèle à l'autre : Anthropic indique qu'Opus 5.5 réfléchit davantage par tour qu'Opus 5 au même niveau, et qu'Opus 5.5 en medium dépasse Opus 5 en high sur ses évaluations de code et de travail intellectuel. Et l'effort agit aussi sur les actions : avec moins d'effort, Claude fait des appels d'outils moins nombreux et plus concis.

La mécanique du coût et de la latence

La réflexion est facturée en sortie, le côté cher de la grille tarifaire.

Anthropic, OpenAI et Google facturent les tokens de réflexion au tarif de sortie, cinq fois le tarif d'entrée sur Claude Opus 5.5 (4 $/20 $), GPT-6 Sol (2 $/10 $) et Gemini 3.8 Flash (0,75 $/3,75 $). La sortie est générée token par token : la réflexion retarde donc aussi le premier mot utile, et dans un agent ce délai se répète à chaque tour.

ARC Prize publie le score et le coût par tâche de chaque modèle et niveau d'effort, ce qui rend le compromis visible :

ARC-AGI-2 (énigmes de raisonnement abstrait), classement ARC Prize, 26 septembre 2026.
Modèle et effortScoreCoût par tâche
Claude Opus 5.5, low70,1 %0,241 $
Claude Opus 5.5, high93,3 %0,408 $
Claude Opus 5.5, max91,7 %1,85 $
GPT-6 Astra, max95,0 %1,12 $
Gemini 3.8 Flash, high89,2 %0,40 $
GPT-6 Luna, max59,3 %0,062 $
Gemini 3 Deep Think (février 2026)84,6 %13,62 $

De low à high, Opus 5.5 gagne 23 points pour 1,7 fois le coût ; de high à max, le coût est multiplié par 4,5 et le score baisse de 1,6 point. Les énigmes d'ARC ne sont pas votre charge de travail, mais cette forme (une forte hausse, puis un plateau à coût croissant) est celle qu'il faut chercher dans vos propres données.

Les éditeurs décrivent le même schéma. Anthropic indiquait en novembre 2025 que Claude Opus 4.5 en effort medium égalait le meilleur score de Sonnet 4.5 sur SWE-bench Verified avec 76 % de tokens de sortie en moins ; OpenAI affirme que GPT-6 Sol en xhigh obtient 33,2 % sur AutomationBench à 0,27 $ par tâche, contre 26,9 % pour Claude Opus 5 en max, pour 11,1 fois ce coût.

Où la réflexion paie, et où elle ne paie pas

La réflexion paie quand une tâche comporte de nombreuses étapes dépendantes et un résultat vérifiable : mathématiques, modifications de code sur plusieurs fichiers, planification, analyse combinant outils et données, agents multi-étapes où une erreur précoce ruine l'exécution. Là, plus d'effort augmente la part de tâches résolues, et c'est cela que vous achetez.

Elle paie rarement pour la classification, l'extraction, le routage, les réponses courtes de FAQ ou la réécriture, où le modèle connaît la réponse ou non. Elle nuit à la voix en temps réel, où la réflexion cachée retarde le premier mot prononcé ; Google propose Gemini 3.8 Live et une variante distincte Live Extended Thinking, ce qui fait de ce compromis un choix explicite.

Règle empirique de Slash pour un premier réglage, avant toute mesure. Votre jeu d'évaluation a le dernier mot.
Type de tâcheCommencer àMonter quand
Classification, étiquetage, routageLe niveau le plus bas : none sur GPT-6 Sol et Luna, low sur Claude et Gemini 3.8 FlashLes erreurs se concentrent sur les cas ambigus
Extraction vers un schémaLowLes champs exigent des déductions entre pages
FAQ et chat de service clientLowLes réponses dépendent de règles ou de plusieurs recherches
Voix en temps réelLe niveau le plus bas, ou un modèle audio temps réelRarement : envoyez les cas difficiles vers un flux asynchrone
Réponses RAG sur documentsDe low à mediumLes sources se contredisent ou il faut synthétiser
Modifications de code, débogageMediumLes tests échouent encore ou le changement touche de nombreux fichiers
Agents multi-étapes avec outilsMediumL'agent stagne ; baissez si le coût monte sans plus de tâches résolues
Mathématiques, planification, analyse difficileHighXhigh ou max seulement avec des preuves issues de vos évaluations, idéalement en batch

Régler l'effort en cinq étapes

  1. Constituez un jeu d'évaluation. 30 à 50 tâches réelles par route, avec des contrôles automatiques de réussite ou d'échec ; Anthropic recommande de commencer avec 20 à 50 tâches tirées d'échecs réels (voir notre guide des évaluations).
  2. Balayez les niveaux. Testez chaque candidat à deux ou trois niveaux d'effort, plusieurs fois par tâche, en relevant réussites, tokens et latence.
  3. Calculez le coût par tâche résolue. Divisez la dépense par les tâches résolues, pas par les requêtes : un réglage bon marché qui échoue une fois sur deux peut coûter plus cher par tâche résolue.
  4. Fixez l'effort par route, explicitement. Gardez le niveau le plus bas compatible avec votre tolérance de qualité et écrivez-le dans le code, car les valeurs par défaut changent (high sur Opus 5, medium sur Opus 5.5).
  5. Surveillez. Journalisez tokens de réflexion et motifs d'arrêt, alertez quand le coût par tâche dérive, et relancez le balayage à chaque changement de modèle.

Deux mécanismes surprennent les équipes. Le plafond de sortie inclut la réflexion : avec un max_tokens (Claude) ou un max_output_tokens (OpenAI, Gemini) trop serré, le modèle peut épuiser le budget à réfléchir et renvoyer une réponse tronquée ou vide ; gardez de la marge et traitez un motif d'arrêt max_tokens ou une réponse incomplète comme une erreur. Et chez Claude, changer l'effort global entre deux requêtes invalide le cache de prompt (l'effort par message, en bêta sur les modèles récents, le préserve) : gardez un effort stable dans une conversation mise en cache.

Notre règle

Choisissez la combinaison modèle plus effort la moins chère qui atteint votre seuil de réussite sur votre propre jeu d'évaluation. La valeur par défaut de l'éditeur est un point de départ, pas une recommandation pour votre tâche.

Les pièges à éviter

  • Trop réfléchir. Plus d'effort signifie des tours plus longs, plus d'appels d'outils et, comme le montrent les données d'ARC-AGI-2, parfois un score plus bas pour un coût plus élevé. Anthropic note aussi que sur Opus 5 l'effort ne raccourcit pas de façon fiable les réponses visibles : demandez la longueur dans le prompt ; OpenAI propose un réglage de verbosité séparé.
  • Reporter d'anciens réglages. Sur Opus 5.5, la réflexion ne peut plus être désactivée, l'appel forcé d'outils renvoie une erreur et l'effort par défaut est passé de high à medium ; Google a rendu obsolètes temperature, top_p et top_k dans l'API Gemini le 21 juillet 2026. Refaites le balayage au lieu de copier les paramètres.
  • Demander au modèle de dévoiler son raisonnement. Opus 5.5 ajoute une catégorie de refus reasoning_extraction qui bloque les tentatives d'extraction de son raisonnement interne (renvoyée sous la forme stop_reason: refusal). Pour la traçabilité, demandez une courte justification dans la réponse, journalisez les appels d'outils et orientez les refus vers un modèle de repli.
  • Prendre la réflexion pour un journal fidèle. OpenAI indique que le raisonnement écrit de GPT-6 Astra a été plus difficile à surveiller que celui de GPT-5.6 Sol lors de ses tests et, après l'incident Hugging Face, a consacré plus de calcul à la surveillance de la chaîne de pensée. Auditez les actions, les appels d'outils et les sorties.
  • Oublier les tokens de réflexion dans les tableaux de bord. Une vue des coûts limitée à l'entrée et à la sortie visible masque la part de la facture que pilote l'effort.

Ce que cela change pour les budgets, en Colombie et en Europe

Les éditeurs facturent en dollars : nous budgétons donc le raisonnement en USD et convertissons à la facture ; pour les équipes colombiennes, le taux de change est une variable de plus qu'elles ne maîtrisent pas. L'unité qui compte est le coût par tâche résolue, par route.

Une illustration avec les chiffres d'ARC Prize ci-dessus, pas une prévision : à 10 000 tâches par mois, Opus 5.5 coûterait environ 2 410 $ en effort low, 4 080 $ en high et 18 500 $ en max, et sur ce test le passage à max n'apporte rien.

Trois leviers gardent la réflexion abordable : les API batch (50 % de remise chez Anthropic, OpenAI et Google) pour le travail à effort élevé qui peut attendre, le cache pour le contexte que les agents renvoient à chaque tour, et un routage qui n'envoie que les cas difficiles vers un effort élevé. Les équipes européennes qui ont besoin d'un traitement régional paient 10 % de plus chez OpenAI ou sur les endpoints régionaux de Claude dans le cloud, sur une facture déjà gonflée par la réflexion. Plus de détails dans notre guide des coûts de l'IA ; Slash AI Lab évalue les modèles avant chaque déploiement.

L'essentiel

  • En 2026, la réflexion est un réglage des modèles principaux, facturé en tokens de sortie même quand vous ne la voyez pas.
  • Claude Opus 5.5 réfléchit toujours, en effort medium par défaut ; GPT-6 Sol et Luna vont de none à max ; Gemini 3.8 Flash utilise des niveaux, medium par défaut.
  • Sur ARC-AGI-2, Opus 5.5 coûte 0,241 $ par tâche en effort low et 1,85 $ en max, et high a obtenu un meilleur score que max.
  • Payez la réflexion pour le code, les mathématiques, la planification et les agents multi-étapes ; gardez-la au minimum pour la classification, l'extraction et la voix en temps réel.
  • Réglez par route selon le coût par tâche résolue, gardez de la marge sur le plafond de sortie et un effort stable pour préserver le cache.

Sources

  1. Effort · Anthropic documentation, 2026-09
  2. Models overview · Anthropic documentation, 2026-09
  3. What's new in Claude Opus 5.5 · Anthropic documentation, 2026-09-22
  4. Introducing Claude Opus 5.5 · Anthropic, 2026-09-22
  5. Introducing Claude Opus 4.5 · Anthropic, 2025-11-24
  6. Reasoning models · OpenAI API documentation, 2026-09
  7. GPT-6 Sol · OpenAI API documentation, 2026-09-22
  8. GPT-6 Astra · OpenAI, 2026-09-03
  9. Introducing GPT-6 Sol and GPT-6 Luna · OpenAI, 2026-09-22
  10. Gemini thinking · Google AI for Developers, 2026-09-25
  11. ARC-AGI leaderboard · ARC Prize, 2026-09-26
  12. Demystifying evals for AI agents · Anthropic, 2026-01-09

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Qu'est-ce que l'effort de raisonnement ?

Un réglage qui contrôle combien un modèle réfléchit avant de répondre. Un effort plus élevé résout en général plus de tâches difficiles à plusieurs étapes, mais génère plus de tokens de sortie et prend plus de temps.

Les tokens de réflexion sont-ils facturés ?

Oui. Anthropic, OpenAI et Google les facturent comme des tokens de sortie, même si vous n'en voyez qu'un résumé, ou rien.

Peut-on désactiver la réflexion sur Claude Opus 5.5 ?

Non. La réflexion est toujours active sur Opus 5.5 et Fable 5.1. Le levier est le paramètre effort, de low à max, avec medium par défaut sur Opus 5.5.

Par quel niveau d'effort commencer ?

Le plus bas pour la classification et l'extraction, medium pour le code et les agents, high pour les mathématiques et la planification. Balayez ensuite les niveaux sur votre propre jeu d'évaluation et gardez le moins cher qui atteint votre seuil de qualité.

Les modèles de la série o d'OpenAI valent-ils encore la peine ?

Ils figurent toujours dans la grille tarifaire d'OpenAI (o3 à 2 $/8 $, par exemple), mais sont désormais legacy. Pour un nouveau projet, testez d'abord GPT-6 Sol ou Luna avec un niveau d'effort explicite.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban