Modelos de IA en septiembre de 2026: quién lidera, cuánto cuesta, qué elegir
Entre el 1 y el 22 de septiembre de 2026, Anthropic, OpenAI, Google y SpaceXAI lanzaron al menos siete modelos. Este mapa ordena lo que cambió, lo que cuesta cada franja y lo que miden de verdad los rankings, con fechas y fuentes, para que armes una lista corta con criterio.
En septiembre de 2026, tres laboratorios de EE. UU. marcan el ritmo: Anthropic con Claude Fable 5.1 y Claude Opus 5.5, OpenAI con GPT-6 Astra, Sol y Luna, y Google con un Flash nuevo casi cada mes mientras Gemini 3.5 Pro sigue retrasado. Grok 4.7, el Muse Spark cerrado de Meta y los laboratorios de pesos abiertos completan el mapa.
Los precios forman franjas claras, de USD 10/50 por millón de tokens a USD 0,30/1,20, y el liderazgo depende de la prueba. Nuestro consejo: arma una lista corta por caso de uso, ten un respaldo de otro proveedor y decide con tus propios prompts en español y francés.
Los laboratorios cerrados y sus modelos insignia
Quién vende qué, desde cuándo y a qué precio de lista.
| Laboratorio | Modelo | Lanzamiento | Entrada / salida | Contexto |
|---|---|---|---|---|
| Anthropic | Claude Fable 5.1 | 1 sept. 2026 | 10 / 50 | 1M |
| Anthropic | Claude Opus 5.5 | 22 sept. 2026 | 4 / 20 | 1M |
| Anthropic | Claude Sonnet 5 | 30 jun. 2026 | 2 / 10 | 1M |
| OpenAI | GPT-6 Astra | 3 sept. 2026 | 10 / 50 | 1,05M |
| OpenAI | GPT-6 Sol | 22 sept. 2026 | 2 / 10 | 1,05M |
| OpenAI | GPT-6 Luna | 22 sept. 2026 | 0,10 / 0,50 | 1,05M |
| Gemini 3.8 Flash | 2 sept. 2026 | 0,75 / 3,75 hasta el 31 dic. 2026, luego 1,50 / 7,50 | 1M | |
| Gemini 3.1 Pro (preview) | 19 feb. 2026 | 2 / 12 hasta 200K tokens | 1M | |
| SpaceXAI | Grok 4.7 | 21 sept. 2026 | 2 / 6 hasta 200K tokens | 500K |
Anthropic. Claude Fable 5.1 es su modelo más capaz de distribución general; su gemelo, Mythos 5.1, está limitado a organizaciones verificadas de EE. UU. Su documentación recomienda ahora empezar por Opus 5.5 en la mayoría de las cargas, y Sonnet 5.5 y Haiku 5.5 están anunciados para las próximas semanas (ver nuestro análisis de Opus 5.5).
OpenAI. GPT-6 Astra es su primer modelo clasificado como "Critical" en ciberseguridad según su Preparedness Framework, por lo que la versión pública rechaza tareas ofensivas avanzadas. GPT-6 Sol y Luna salieron a la mitad del precio promocional de sus antecesores GPT-5.6; GPT-5.6 Terra (USD 2/12) sigue como opción intermedia y la serie o quedó como heredada.
Google. Gemini 3.5 Pro, esperado para junio, está atrasado: Bloomberg informó el 16 de julio que su rendimiento en código se quedaba corto. Mientras tanto salió un Flash nuevo casi cada mes (3.5 en mayo, 3.6 en julio, 3.7 en agosto, 3.8 en septiembre), y Gemini 3.1 Pro sigue en preview.
SpaceXAI. SpaceX absorbió xAI en febrero de 2026, la rebautizó en julio y compró el editor de código Cursor en agosto. Grok 4.7 es sexto en la tabla oficial de Terminal-Bench 4.0 (37,6 %).
Meta, Microsoft, Amazon. Muse Spark (8 de abril) fue el primer modelo de Meta sin pesos abiertos; su versión 1.3 marca 48 en el índice de Artificial Analysis. Microsoft presentó MAI-Thinking-1, su primer modelo de razonamiento, en junio (precio sin confirmar). Amazon pasó Nova Premier y otros modelos Nova a modo de mantenimiento, según Business Insider (vía eWeek).
Cifras verificadas el 25 y 26 de septiembre de 2026 en las fuentes citadas. Precios, posiciones y disponibilidad cambian cada mes: verifica antes de firmar un contrato.
Los pesos abiertos, en breve
Los modelos de pesos abiertos crecieron mucho (Kimi K3 tiene 2,8 billones de parámetros, 104.000 millones activos por token), pero siguen detrás de los líderes cerrados: el mejor, MiMo-V2.6-Pro de Xiaomi, marca 46 en el índice de Artificial Analysis frente a 58 de Claude Opus 5.5.
DeepSeek V4.1-Flash (licencia MIT) es la API casi de frontera más barata que encontramos, a USD 0,30/1,20 en horas pico y la mitad fuera de ellas, y las licencias se desplazan hacia términos propios con umbrales de ingresos. Más en nuestra guía open-weight.
Franjas de precio: cuatro niveles, no un solo mercado
El precio de lista te dice la franja; el costo por tarea te dice la factura.
| Franja | Precio típico | Ejemplos | Para qué |
|---|---|---|---|
| Premium | 10 / 50 | Claude Fable 5.1, GPT-6 Astra | Razonamiento más difícil, agentes de horizonte largo |
| Media alta | 4 / 20 | Claude Opus 5.5, GPT-5.6 Sol (promocional) | Opción por defecto para agentes y trabajo de conocimiento |
| Media | cerca de 2 / 10 | Claude Sonnet 5, GPT-6 Sol, GPT-5.6 Terra (2 / 12), Grok 4.7 (2 / 6) | Volumen con buena calidad |
| Económica | 1 / 5 o menos | Claude Haiku 4.5, Gemini 3.8 Flash (0,75 / 3,75), GPT-6 Luna (0,10 / 0,50) | Clasificación, extracción, enrutamiento |
| Casi frontera más barata | 0,30 / 1,20 | DeepSeek V4.1-Flash, mitad de precio fuera de horas pico | Lotes con datos que pueden salir de tu perímetro |
La franja de USD 10/50 es una novedad de 2026 (Claude Fable 5 en junio, luego Fable 5.1 y GPT-6 Astra), mientras la gama media se abarató: GPT-6 Sol cuesta la mitad del precio promocional de su antecesor, Opus 5.5 es un 20 % más barato por token que Opus 5 y Sonnet 5 mantuvo USD 2/10 en lugar de subir a USD 3/15.
Tres detalles mueven la factura real más que el precio de lista: los prompts largos (OpenAI duplica la tarifa de entrada por encima de 272K tokens; Claude no cobra recargo), las lecturas de caché (5 % del precio de entrada en Opus 5.5, 10 % en GPT-6) y las subidas programadas (Gemini 3.6 a 3.8 Flash duplican su precio el 1 de enero de 2027). Método en nuestra guía de costos de IA.
Rankings: qué miden y quién lidera
Cada ranking responde una pregunta más estrecha que "cuál es el mejor modelo".
Las tablas de los fabricantes las elige el propio laboratorio, casi siempre con su esfuerzo más alto y con versiones de benchmarks de pocas semanas. Las tablas independientes aplican el mismo método a todos, pero llegan tarde: el 26 de septiembre, el 66,4 % que Anthropic reporta para Opus 5.5 en Terminal-Bench 4.0 aún no figuraba en la tabla oficial.
Las versiones también rompen las comparaciones: el anuncio de Astra cita valores del índice de Artificial Analysis v4.1.1 de hasta 65,7, mientras la v4.3.2 tiene al líder en 58, porque cambió la escala, no los modelos. Arena, por su parte, ordena por votos de preferencia humana, no por tareas completadas.
| Tabla | Qué mide | Líder | Para tener en cuenta |
|---|---|---|---|
| Arena, texto | Votos de preferencia humana | Claude Opus 5.5 (1.509) | Los cinco primeros son Claude; GPT-6 Astra es 26.º |
| Índice Artificial Analysis v4.3.2 | Diez evaluaciones de trabajo agéntico y de conocimiento | Claude Opus 5.5 con esfuerzo max (58) | Fable 5.1 y GPT-6 Astra empatan en 53 |
| Terminal-Bench 4.0, oficial | Tareas agénticas en una terminal | GPT-6 Astra (58,2 %) | Opus 5.5 aún no aparece |
| ARC-AGI-2 | Razonamiento abstracto, con costo por tarea | GPT-6 Astra (95,0 %, USD 1,12 por tarea) | Opus 5.5 con esfuerzo high: 93,3 % por USD 0,408 |
| Humanity's Last Exam | Preguntas de nivel experto | Claude Opus 5.5 (61,4 %, medido por Artificial Analysis) | Anthropic reporta 67,7 % con herramientas |
Ninguna de estas pruebas usa español o francés de empresa: filtran la lista corta, no deciden. Nuestro método está en la guía de evals.
Cómo elegir según el caso de uso
Una lista corta para probar, no un veredicto.
| Caso de uso | Lista corta para probar | Por qué |
|---|---|---|
| Servicio al cliente en español | Claude Sonnet 5, GPT-6 Sol, Gemini 3.8 Flash; GPT-6 Luna para enrutar | Precio para volumen; ningún benchmark público mide el español de servicio latinoamericano: prueba tono, exactitud y rechazos |
| Agentes de código | Claude Opus 5.5, GPT-6 Astra, Claude Fable 5.1; GLM-5.3 si necesitas pesos abiertos | Líderes en Terminal-Bench 4.0; GLM-5.3 es la mejor entrada de pesos abiertos en la tabla oficial |
| Documentos largos | Claude Opus 5.5, GPT-6 Astra, Gemini 3.8 Flash | Ventanas de 1M de tokens; OpenAI reporta 96,3 % para Astra en MRCR v2 entre 512K y 1M de tokens; Claude no cobra recargo por contexto largo |
| Voz | Gemini 3.8 Live, Amazon Nova 2 Sonic, Mistral Voxtral para transcripción | Modelos de audio en vivo; Voxtral Mini Transcribe Realtime tiene pesos Apache 2.0 (ver nuestra guía de voz) |
| Datos regulados u on-premise | Gemma 4, Muse Glimmer, Qwen3.8-27B o Mistral Small 4 autoalojados | Licencias Apache 2.0, y ningún dato sale de tu infraestructura |
| Clasificación a gran volumen | GPT-6 Luna, Gemini 3.1 Flash-Lite, DeepSeek V4.1-Flash, Claude Haiku 4.5 | Desde USD 0,10 por millón de tokens de entrada, la mitad en lotes; Haiku 4.5 solo está garantizado hasta el 15 de octubre de 2026 |
Incluye en cada lista corta un segundo proveedor y una opción de pesos abiertos. Nuestro método (30 prompts fijos por cliente, cinco motores por corrida, tres idiomas) está en cómo elegimos modelos.
Siete tendencias verificadas de 2026
- Un nivel premium, pero capacidad más barata. En ARC-AGI-2, una nota de entre 61 % y 65 % costaba USD 2,25 por tarea con Claude Opus 4.6 en febrero y USD 0,042 con DeepSeek V4 Flash en julio.
- El esfuerzo de razonamiento es un ajuste. Claude, GPT-5.6, GPT-6 y Gemini 3.x exponen niveles de esfuerzo; en ARC-AGI-2, Opus 5.5 cuesta USD 0,241 por tarea con esfuerzo low y USD 1,85 con max (ver nuestra guía de razonamiento).
- 1M de tokens de contexto es la norma en los modelos insignia; Grok 4.7 se queda en 500K.
- La ciberseguridad ofensiva tiene acceso restringido. Mythos 5.1 está limitado a organizaciones verificadas de EE. UU., Gemini 3.8 Flash Cyber a defensores de confianza del Fairwind Program de Google, y OpenAI planea ampliar el acceso defensivo a Astra con su programa Daybreak.
- Los productos desaparecen rápido. OpenAI cerró la app de Sora en abril, unos siete meses tras su lanzamiento, retiró la API de Sora 2 el 24 de septiembre y cerró su navegador Atlas el 9 de agosto; Nova Premier llegó al fin de vida el 14 de septiembre.
- La política de EE. UU. puede cortar el acceso. Una directiva de control de exportaciones obligó a Anthropic a retirar Fable 5 y Mythos 5 a todos sus usuarios el 12 de junio (Fable 5 volvió el 1 de julio), y la Orden Ejecutiva 14409 (2 de junio) prevé un marco voluntario que da al gobierno hasta 30 días de acceso previo a los "covered frontier models".
- Los laboratorios discuten un ritmo más lento. En We Must Pace the Frontier, Dario Amodei pidió frenar el avance de las capacidades y comprometió a Anthropic con evaluadores externos integrados; Sam Altman asumió el mismo compromiso el 14 de septiembre. Un detonante que cita: el incidente de julio en que agentes de OpenAI en evaluación llegaron a sistemas de Hugging Face (informe de OpenAI).
Qué significa para empresas en Colombia, América Latina y Europa
Ten un respaldo probado. El retiro de Fable 5 duró 19 días y afectó a todos los clientes. Un sistema en producción en Bogotá, Ciudad de México o París necesita un segundo modelo de otro proveedor, probado con los mismos prompts, y una opción de pesos abiertos alojable.
Presupuesta la residencia. OpenAI suma un 10 % por procesamiento regional en los modelos lanzados desde el 5 de marzo de 2026; Claude cuesta un 10 % más en endpoints regionales de Bedrock o Google Cloud.
Pon las fechas de retiro en los contratos. Anthropic garantiza Opus 5.5 al menos hasta el 22 de septiembre de 2027, pero Haiku 4.5 solo hasta el 15 de octubre de 2026. Exige a cada proveedor esas fechas, preaviso y una cláusula de migración.
Prueba tú mismo el español y el francés. En Slash AI Lab cada candidato pasa por 30 prompts fijos por cliente en español, inglés y francés antes de desplegarse; ningún ranking reemplaza ese paso.
Revisa el alcance del AI Act europeo. El artículo 2(1)(c) cubre a proveedores y responsables del despliegue fuera de la UE cuando la salida de su sistema se usa en la UE: una empresa colombiana con clientes franceses puede quedar dentro. En Colombia, revisa cómo aplica la Ley 1581 de 2012 antes de enviar datos personales al exterior. Más en nuestro mapa regulatorio de 2026.
Para cada ruta, define un modelo por defecto, un respaldo de otro proveedor y una opción de pesos abiertos, y repite tu evaluación en cada lanzamiento importante: en 2026, casi una vez al mes.
Lo esencial
- Septiembre de 2026 trajo Claude Fable 5.1 y Opus 5.5, GPT-6 Astra, Sol y Luna, Gemini 3.8 Flash y Grok 4.7; Gemini 3.5 Pro no llega.
- Los precios forman franjas, de USD 10/50 en el nivel premium a USD 0,30/1,20 para DeepSeek V4.1-Flash.
- El liderazgo depende de la prueba: Anthropic lidera Arena texto y el índice de Artificial Analysis; OpenAI, la tabla oficial de Terminal-Bench 4.0 y ARC-AGI-2.
- Arma una lista corta por caso de uso y decide con tus propios prompts en español y francés.
- Prepárate para cortes de acceso y cierres: un respaldo de otro proveedor, fechas de retiro en los contratos y recargos de residencia en el presupuesto.
Fuentes
- Models overview
- Introducing Claude Opus 5.5
- Update on access to Claude Fable 5 and Claude Mythos 5
- GPT-6 Astra
- Introducing GPT-6 Sol and GPT-6 Luna
- API pricing
- Gemini API pricing
- Gemini 3.5 Pro delayed over coding, Bloomberg reports
- Models and pricing
- Text leaderboard
- AI model leaderboards (Intelligence Index)
- ARC-AGI leaderboard
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Cuál es el mejor modelo de IA en septiembre de 2026?
No hay una sola respuesta. El 25 y 26 de septiembre de 2026, Claude Opus 5.5 lideraba la tabla de texto de Arena y el índice de Artificial Analysis, mientras GPT-6 Astra lideraba la tabla oficial de Terminal-Bench 4.0 y ARC-AGI-2. El mejor modelo para ti es el que gana en tus propias tareas a un costo que puedas defender.
¿Cuánto cuesta un modelo de frontera?
USD 10 por millón de tokens de entrada y USD 50 por millón de salida para Claude Fable 5.1 y GPT-6 Astra, USD 4/20 para Claude Opus 5.5 y cerca de USD 2/10 para Claude Sonnet 5 y GPT-6 Sol. Los modelos económicos empiezan en USD 0,10/0,50 con GPT-6 Luna.
¿Google ya lanzó Gemini 3.5 Pro?
No, al 26 de septiembre de 2026. Bloomberg informó un retraso en julio; el modelo más reciente de Google es Gemini 3.8 Flash, lanzado el 2 de septiembre, y Gemini 3.1 Pro sigue en preview.
¿Los modelos de pesos abiertos sirven para una empresa?
Para muchas tareas, sí, y son la base de cualquier opción on-premise. En las tablas independientes los mejores siguen detrás de los líderes cerrados (46 frente a 58 en el índice de Artificial Analysis). Nuestra guía open-weight cubre licencias y alojamiento.
¿Pueden usar estos modelos las empresas en Colombia y Francia?
Sí, por las API de los fabricantes y las principales nubes, pero prevé recargos de residencia, reglas de protección de datos y la posibilidad de que la política de EE. UU. restrinja un modelo, como pasó con Claude Fable 5 en junio de 2026.
Más análisis para seguir
Claude Opus 5.5: qué cambia para las empresas
Lanzado el 22 de septiembre de 2026: más barato que Opus 5, nivel Fable 5.1 según Anthropic. Precio, benchmarks, cambios técnicos y cuándo usarlo.
IA local y open sourceModelos open-weight en 2026: cuál usar y con qué licencia
Kimi K3, Qwen3.8, DeepSeek V4.1, GLM-5.3, Gemma 4, gpt-oss, Mistral: tamaños, licencias, distancia a la frontera y cómo alojarlos sin sorpresas legales.
ModelosCómo elegimos un modelo
Idioma, código, agentes, coste y privacidad: la evaluación que corre antes de cada despliegue, con 30 prompts reales por cliente.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.