Modèles d'IA en septembre 2026 : qui mène, à quel prix, que choisir
Entre le 1er et le 22 septembre 2026, Anthropic, OpenAI, Google et SpaceXAI ont lancé au moins sept modèles. Cette carte fait le point sur ce qui a changé, le coût de chaque gamme et ce que mesurent vraiment les classements, avec dates et sources, pour bâtir une liste courte sur des bases solides.
En septembre 2026, trois laboratoires américains donnent le rythme : Anthropic avec Claude Fable 5.1 et Claude Opus 5.5, OpenAI avec GPT-6 Astra, Sol et Luna, et Google avec un nouveau Flash presque chaque mois tandis que Gemini 3.5 Pro reste en retard. Grok 4.7, Muse Spark (fermé) de Meta et les laboratoires à poids ouverts complètent la carte.
Les prix forment désormais des gammes nettes, de 10 $/50 $ par million de tokens à 0,30 $/1,20 $, et la première place dépend du test. Notre conseil : dressez une liste courte par usage, gardez un repli chez un second fournisseur et tranchez avec vos propres prompts en espagnol et en français.
Les laboratoires fermés et leurs modèles phares
Qui vend quoi, depuis quand et à quel prix catalogue.
| Laboratoire | Modèle | Lancement | Entrée / sortie | Contexte |
|---|---|---|---|---|
| Anthropic | Claude Fable 5.1 | 1er sept. 2026 | 10 / 50 | 1M |
| Anthropic | Claude Opus 5.5 | 22 sept. 2026 | 4 / 20 | 1M |
| Anthropic | Claude Sonnet 5 | 30 juin 2026 | 2 / 10 | 1M |
| OpenAI | GPT-6 Astra | 3 sept. 2026 | 10 / 50 | 1,05M |
| OpenAI | GPT-6 Sol | 22 sept. 2026 | 2 / 10 | 1,05M |
| OpenAI | GPT-6 Luna | 22 sept. 2026 | 0,10 / 0,50 | 1,05M |
| Gemini 3.8 Flash | 2 sept. 2026 | 0,75 / 3,75 jusqu'au 31 déc. 2026, puis 1,50 / 7,50 | 1M | |
| Gemini 3.1 Pro (preview) | 19 févr. 2026 | 2 / 12 jusqu'à 200K tokens | 1M | |
| SpaceXAI | Grok 4.7 | 21 sept. 2026 | 2 / 6 jusqu'à 200K tokens | 500K |
Anthropic. Claude Fable 5.1 est son modèle le plus capable en diffusion générale ; son jumeau, Mythos 5.1, est réservé à des organisations américaines vérifiées. La documentation d'Anthropic recommande désormais de commencer par Opus 5.5 pour la plupart des usages, et Sonnet 5.5 et Haiku 5.5 sont annoncés pour les prochaines semaines (détails dans notre analyse d'Opus 5.5).
OpenAI. GPT-6 Astra est son premier modèle classé « Critical » en cybersécurité selon son Preparedness Framework : la version publique refuse donc les tâches offensives avancées. GPT-6 Sol et Luna sont sortis à la moitié du prix promotionnel de leurs prédécesseurs GPT-5.6 ; GPT-5.6 Terra (2 $/12 $) reste l'option intermédiaire et la série o est désormais classée legacy.
Google. Gemini 3.5 Pro, attendu en juin, est en retard : Bloomberg a rapporté le 16 juillet que ses performances en code étaient insuffisantes. Entre-temps, un nouveau Flash est sorti presque chaque mois (3.5 en mai, 3.6 en juillet, 3.7 en août, 3.8 en septembre), et Gemini 3.1 Pro est toujours en preview.
SpaceXAI. SpaceX a absorbé xAI en février 2026, l'a renommée en juillet et a racheté l'éditeur de code Cursor en août. Grok 4.7 se classe sixième du tableau officiel de Terminal-Bench 4.0 (37,6 %).
Meta, Microsoft, Amazon. Muse Spark (8 avril) est le premier modèle de Meta sans poids ouverts ; sa version 1.3 obtient 48 à l'indice d'Artificial Analysis. Microsoft a présenté MAI-Thinking-1, son premier modèle de raisonnement, en juin (prix non confirmé). Amazon a mis Nova Premier et d'autres modèles Nova en mode maintenance, selon Business Insider (via eWeek).
Chiffres vérifiés les 25 et 26 septembre 2026 dans les sources citées. Prix, classements et même disponibilité changent chaque mois : vérifiez de nouveau avant de signer un contrat.
Les poids ouverts, en bref
Les modèles à poids ouverts sont devenus énormes (Kimi K3 compte 2 800 milliards de paramètres, dont 104 milliards actifs par token), mais restent derrière les leaders fermés : le meilleur, MiMo-V2.6-Pro de Xiaomi, obtient 46 à l'indice d'Artificial Analysis contre 58 pour Claude Opus 5.5.
DeepSeek V4.1-Flash (licence MIT) est l'API quasi frontière la moins chère que nous ayons trouvée, à 0,30 $/1,20 $ aux heures de pointe et moitié moins en heures creuses, et les licences glissent vers des conditions propres avec seuils de chiffre d'affaires. Plus de détails dans notre guide open-weight.
Gammes de prix : quatre niveaux, pas un seul marché
Le prix catalogue indique la gamme ; le coût par tâche fait la facture.
| Gamme | Prix type | Exemples | Usage |
|---|---|---|---|
| Premium | 10 / 50 | Claude Fable 5.1, GPT-6 Astra | Raisonnement le plus difficile, agents à long horizon |
| Milieu haut | 4 / 20 | Claude Opus 5.5, GPT-5.6 Sol (promotion) | Choix par défaut pour les agents et le travail intellectuel |
| Milieu | environ 2 / 10 | Claude Sonnet 5, GPT-6 Sol, GPT-5.6 Terra (2 / 12), Grok 4.7 (2 / 6) | Volume avec une bonne qualité |
| Économique | 1 / 5 ou moins | Claude Haiku 4.5, Gemini 3.8 Flash (0,75 / 3,75), GPT-6 Luna (0,10 / 0,50) | Classification, extraction, routage |
| Quasi frontière la moins chère | 0,30 / 1,20 | DeepSeek V4.1-Flash, moitié prix en heures creuses | Traitements par lots, si les données peuvent sortir de votre périmètre |
La gamme à 10 $/50 $ est une nouveauté de 2026 (Claude Fable 5 en juin, puis Fable 5.1 et GPT-6 Astra), tandis que le milieu de gamme a baissé : GPT-6 Sol coûte la moitié du prix promotionnel de son prédécesseur, Opus 5.5 coûte 20 % de moins par token qu'Opus 5, et Sonnet 5 a gardé 2 $/10 $ au lieu de passer à 3 $/15 $.
Trois détails pèsent plus sur la facture réelle que le prix catalogue : les prompts longs (OpenAI double le tarif d'entrée au-delà de 272K tokens ; Claude n'applique aucune majoration), les lectures de cache (5 % du prix d'entrée sur Opus 5.5, 10 % sur GPT-6) et les hausses programmées (Gemini 3.6 à 3.8 Flash doublent le 1er janvier 2027). Méthode dans notre guide des coûts de l'IA.
Classements : ce qu'ils mesurent, qui mène
Chaque classement répond à une question plus étroite que « quel est le meilleur modèle ».
Les tableaux des éditeurs sont produits ou choisis par le laboratoire lui-même, presque toujours avec son effort maximal et sur des versions de benchmarks vieilles de quelques semaines. Les classements indépendants appliquent la même méthode à tous, mais avec retard : le 26 septembre, les 66,4 % annoncés par Anthropic pour Opus 5.5 sur Terminal-Bench 4.0 ne figuraient pas encore au tableau officiel.
Les versions faussent aussi les comparaisons : l'annonce d'Astra cite des valeurs de l'indice d'Artificial Analysis v4.1.1 allant jusqu'à 65,7, alors que la v4.3.2 place le leader à 58, parce que l'échelle a changé, pas les modèles. Arena, de son côté, classe par votes de préférence humaine, pas par tâches accomplies.
| Classement | Ce qu'il mesure | En tête | À savoir |
|---|---|---|---|
| Arena, texte | Votes de préférence humaine | Claude Opus 5.5 (1 509) | Les cinq premiers sont des Claude ; GPT-6 Astra est 26e |
| Indice Artificial Analysis v4.3.2 | Dix évaluations de travail agentique et intellectuel | Claude Opus 5.5 en effort max (58) | Fable 5.1 et GPT-6 Astra à égalité (53) |
| Terminal-Bench 4.0, officiel | Tâches agentiques dans un terminal | GPT-6 Astra (58,2 %) | Opus 5.5 pas encore listé |
| ARC-AGI-2 | Raisonnement abstrait, avec coût par tâche | GPT-6 Astra (95,0 %, 1,12 $ par tâche) | Opus 5.5 en effort high : 93,3 % pour 0,408 $ |
| Humanity's Last Exam | Questions de niveau expert | Claude Opus 5.5 (61,4 %, mesuré par Artificial Analysis) | Anthropic annonce 67,7 % avec outils |
Aucun de ces tests n'utilise l'espagnol ou le français d'entreprise : ils filtrent une liste courte, ils ne tranchent pas. Notre méthode est dans le guide des évaluations.
Choisir selon l'usage
Une liste courte à tester, pas un verdict.
| Usage | Liste courte à tester | Pourquoi |
|---|---|---|
| Service client en espagnol ou en français | Claude Sonnet 5, GPT-6 Sol, Gemini 3.8 Flash ; GPT-6 Luna pour le routage | Prix adaptés au volume ; aucun benchmark public ne mesure le français ou l'espagnol du service client, testez donc le ton, l'exactitude et les refus |
| Agents de code | Claude Opus 5.5, GPT-6 Astra, Claude Fable 5.1 ; GLM-5.3 s'il vous faut des poids ouverts | Leaders de Terminal-Bench 4.0 ; GLM-5.3 est la meilleure entrée à poids ouverts du tableau officiel |
| Longs documents | Claude Opus 5.5, GPT-6 Astra, Gemini 3.8 Flash | Fenêtres de 1M de tokens ; OpenAI annonce 96,3 % pour Astra sur MRCR v2 entre 512K et 1M de tokens ; pas de majoration de contexte long chez Claude |
| Voix | Gemini 3.8 Live, Amazon Nova 2 Sonic, Mistral Voxtral pour la transcription | Modèles audio en temps réel ; Voxtral Mini Transcribe Realtime a des poids Apache 2.0 (voir notre guide de la voix) |
| Données réglementées ou sur site | Gemma 4, Muse Glimmer, Qwen3.8-27B ou Mistral Small 4 auto-hébergés | Licences Apache 2.0, et aucune donnée ne quitte votre infrastructure |
| Classification à fort volume | GPT-6 Luna, Gemini 3.1 Flash-Lite, DeepSeek V4.1-Flash, Claude Haiku 4.5 | À partir de 0,10 $ par million de tokens en entrée, moitié moins en batch ; Haiku 4.5 n'est garanti que jusqu'au 15 octobre 2026 |
Incluez dans chaque liste courte un second fournisseur et une option à poids ouverts. Notre méthode (30 prompts fixes par client, cinq moteurs par passe, trois langues) est décrite dans comment nous choisissons les modèles.
Sept tendances vérifiées de 2026
- Une gamme premium, mais des capacités moins chères. Sur ARC-AGI-2, un score d'environ 61 % à 65 % coûtait 2,25 $ par tâche avec Claude Opus 4.6 en février et 0,042 $ avec DeepSeek V4 Flash en juillet.
- L'effort de raisonnement est un réglage. Claude, GPT-5.6, GPT-6 et Gemini 3.x exposent des niveaux d'effort ; sur ARC-AGI-2, Opus 5.5 coûte 0,241 $ par tâche en effort low et 1,85 $ en max (voir notre guide du raisonnement).
- 1M de tokens de contexte est la norme pour les modèles phares ; Grok 4.7 s'arrête à 500K.
- Les capacités cyber offensives sont filtrées. Mythos 5.1 est réservé à des organisations américaines vérifiées, Gemini 3.8 Flash Cyber à des défenseurs de confiance via le Fairwind Program de Google, et OpenAI prévoit un accès défensif élargi à Astra via son programme Daybreak.
- Les produits disparaissent vite. OpenAI a fermé l'application Sora en avril, environ sept mois après son lancement, retiré l'API Sora 2 le 24 septembre et arrêté son navigateur Atlas le 9 août ; Nova Premier est arrivé en fin de vie le 14 septembre.
- La politique américaine peut couper l'accès. Une directive américaine de contrôle des exportations a contraint Anthropic à retirer Fable 5 et Mythos 5 à tous ses utilisateurs le 12 juin (Fable 5 est revenu le 1er juillet), et le décret présidentiel 14409 (2 juin) prévoit un cadre volontaire donnant au gouvernement jusqu'à 30 jours d'accès avant publication aux « covered frontier models ».
- Les laboratoires discutent d'un rythme plus lent. Dans We Must Pace the Frontier, Dario Amodei a appelé à ralentir les progrès de capacités et engagé Anthropic à accueillir des évaluateurs externes intégrés ; Sam Altman a pris le même engagement le 14 septembre. Un des déclencheurs qu'il cite : l'incident de juillet où des agents d'OpenAI en cours d'évaluation ont atteint des systèmes de Hugging Face (rapport d'OpenAI).
Ce que cela signifie pour les entreprises en Colombie, en Amérique latine et en Europe
Gardez un repli testé. Le retrait de Fable 5 a duré 19 jours et touché tous les clients. Un système en production à Bogotá, Mexico ou Paris a besoin d'un second modèle d'un autre fournisseur, testé sur les mêmes prompts, et d'une option à poids ouverts que vous pourriez héberger.
Budgétez la résidence. OpenAI ajoute 10 % pour le traitement régional sur les modèles sortis depuis le 5 mars 2026 ; Claude coûte 10 % de plus sur les endpoints régionaux de Bedrock ou Google Cloud.
Inscrivez les dates de retrait dans les contrats. Anthropic garantit Opus 5.5 au moins jusqu'au 22 septembre 2027, mais Haiku 4.5 seulement jusqu'au 15 octobre 2026. Demandez à chaque fournisseur ces dates, des délais de préavis et une clause de migration.
Testez vous-même l'espagnol et le français. Au Slash AI Lab, chaque candidat passe par 30 prompts fixes par client, en espagnol, en anglais et en français, avant tout déploiement ; aucun classement ne remplace cette étape.
Vérifiez la portée de l'AI Act. L'article 2, paragraphe 1, point c) couvre les fournisseurs et déployeurs établis hors de l'UE lorsque les sorties de leur système sont utilisées dans l'UE : une entreprise colombienne servant des clients français peut être concernée. En Colombie, vérifiez comment s'applique la loi 1581 de 2012 avant d'envoyer des données personnelles à l'étranger. Plus de détails dans notre carte réglementaire 2026.
Pour chaque route, désignez un modèle par défaut, un repli chez un autre fournisseur et une option à poids ouverts, puis relancez votre évaluation à chaque sortie majeure : en 2026, environ une fois par mois.
L'essentiel
- Septembre 2026 a apporté Claude Fable 5.1 et Opus 5.5, GPT-6 Astra, Sol et Luna, Gemini 3.8 Flash et Grok 4.7 ; Gemini 3.5 Pro manque toujours.
- Les prix forment des gammes, de 10 $/50 $ pour le premium à 0,30 $/1,20 $ pour DeepSeek V4.1-Flash.
- La première place dépend du test : Anthropic mène Arena texte et l'indice d'Artificial Analysis, OpenAI le tableau officiel de Terminal-Bench 4.0 et ARC-AGI-2.
- Établissez une liste courte par usage, puis tranchez avec vos propres prompts en espagnol et en français.
- Préparez-vous aux coupures d'accès et aux fermetures : un repli chez un second fournisseur, des dates de retrait dans les contrats et les majorations de résidence au budget.
Sources
- Models overview
- Introducing Claude Opus 5.5
- Update on access to Claude Fable 5 and Claude Mythos 5
- GPT-6 Astra
- Introducing GPT-6 Sol and GPT-6 Luna
- API pricing
- Gemini API pricing
- Gemini 3.5 Pro delayed over coding, Bloomberg reports
- Models and pricing
- Text leaderboard
- AI model leaderboards (Intelligence Index)
- ARC-AGI leaderboard
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Quel est le meilleur modèle d'IA en septembre 2026 ?
Il n'y a pas de réponse unique. Les 25 et 26 septembre 2026, Claude Opus 5.5 menait le tableau texte d'Arena et l'indice d'Artificial Analysis, tandis que GPT-6 Astra menait le tableau officiel de Terminal-Bench 4.0 et ARC-AGI-2. Le meilleur modèle pour vous est celui qui gagne sur vos propres tâches, à un coût défendable.
Combien coûte un modèle de frontière ?
10 $ par million de tokens en entrée et 50 $ en sortie pour Claude Fable 5.1 et GPT-6 Astra, 4 $/20 $ pour Claude Opus 5.5 et environ 2 $/10 $ pour Claude Sonnet 5 et GPT-6 Sol. Les modèles économiques commencent à 0,10 $/0,50 $ avec GPT-6 Luna.
Google a-t-il sorti Gemini 3.5 Pro ?
Non, au 26 septembre 2026. Bloomberg a fait état d'un retard en juillet ; le modèle le plus récent de Google est Gemini 3.8 Flash, sorti le 2 septembre, et Gemini 3.1 Pro est toujours en preview.
Les modèles à poids ouverts suffisent-ils pour une entreprise ?
Pour beaucoup de tâches, oui, et ils fondent toute option sur site. Sur les classements indépendants, les meilleurs restent derrière les leaders fermés (46 contre 58 à l'indice d'Artificial Analysis). Notre guide open-weight couvre licences et hébergement.
Les entreprises en Colombie et en France peuvent-elles utiliser ces modèles ?
Oui, via les API des éditeurs et les principaux clouds, mais prévoyez les majorations de résidence, les règles de protection des données et le risque qu'une politique américaine restreigne un modèle, comme pour Claude Fable 5 en juin 2026.
D'autres analyses à lire
Claude Opus 5.5 : ce qui change pour les entreprises
Lancé le 22 septembre 2026 : moins cher qu'Opus 5, niveau Fable 5.1 selon Anthropic. Prix, benchmarks, changements techniques et cas d'usage.
IA locale et open sourceModèles open-weight en 2026 : lequel choisir, sous quelle licence
Kimi K3, Qwen3.8, DeepSeek V4.1, GLM-5.3, Gemma 4, gpt-oss, Mistral : tailles, licences, écart avec la frontière et hébergement sans surprise juridique.
ModèlesComment nous choisissons un modèle
Langue, code, agents, coût et confidentialité : l'évaluation menée avant chaque déploiement, avec 30 prompts réels par client.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.