Modelos · Septiembre 2026

Modelos de IA en septiembre de 2026: quién lidera, cuánto cuesta, qué elegir

Entre el 1 y el 22 de septiembre de 2026, Anthropic, OpenAI, Google y SpaceXAI lanzaron al menos siete modelos. Este mapa ordena lo que cambió, lo que cuesta cada franja y lo que miden de verdad los rankings, con fechas y fuentes, para que armes una lista corta con criterio.

USD 10 / 50 el nuevo nivel premium1M tokens de contexto, la norma26 sept. 2026 fecha de corte
En resumen

En septiembre de 2026, tres laboratorios de EE. UU. marcan el ritmo: Anthropic con Claude Fable 5.1 y Claude Opus 5.5, OpenAI con GPT-6 Astra, Sol y Luna, y Google con un Flash nuevo casi cada mes mientras Gemini 3.5 Pro sigue retrasado. Grok 4.7, el Muse Spark cerrado de Meta y los laboratorios de pesos abiertos completan el mapa.

Los precios forman franjas claras, de USD 10/50 por millón de tokens a USD 0,30/1,20, y el liderazgo depende de la prueba. Nuestro consejo: arma una lista corta por caso de uso, ten un respaldo de otro proveedor y decide con tus propios prompts en español y francés.

Los laboratorios cerrados y sus modelos insignia

Quién vende qué, desde cuándo y a qué precio de lista.

USD por millón de tokens de entrada / salida, nivel estándar, al 26 de septiembre de 2026.
LaboratorioModeloLanzamientoEntrada / salidaContexto
AnthropicClaude Fable 5.11 sept. 202610 / 501M
AnthropicClaude Opus 5.522 sept. 20264 / 201M
AnthropicClaude Sonnet 530 jun. 20262 / 101M
OpenAIGPT-6 Astra3 sept. 202610 / 501,05M
OpenAIGPT-6 Sol22 sept. 20262 / 101,05M
OpenAIGPT-6 Luna22 sept. 20260,10 / 0,501,05M
GoogleGemini 3.8 Flash2 sept. 20260,75 / 3,75 hasta el 31 dic. 2026, luego 1,50 / 7,501M
GoogleGemini 3.1 Pro (preview)19 feb. 20262 / 12 hasta 200K tokens1M
SpaceXAIGrok 4.721 sept. 20262 / 6 hasta 200K tokens500K

Anthropic. Claude Fable 5.1 es su modelo más capaz de distribución general; su gemelo, Mythos 5.1, está limitado a organizaciones verificadas de EE. UU. Su documentación recomienda ahora empezar por Opus 5.5 en la mayoría de las cargas, y Sonnet 5.5 y Haiku 5.5 están anunciados para las próximas semanas (ver nuestro análisis de Opus 5.5).

OpenAI. GPT-6 Astra es su primer modelo clasificado como "Critical" en ciberseguridad según su Preparedness Framework, por lo que la versión pública rechaza tareas ofensivas avanzadas. GPT-6 Sol y Luna salieron a la mitad del precio promocional de sus antecesores GPT-5.6; GPT-5.6 Terra (USD 2/12) sigue como opción intermedia y la serie o quedó como heredada.

Google. Gemini 3.5 Pro, esperado para junio, está atrasado: Bloomberg informó el 16 de julio que su rendimiento en código se quedaba corto. Mientras tanto salió un Flash nuevo casi cada mes (3.5 en mayo, 3.6 en julio, 3.7 en agosto, 3.8 en septiembre), y Gemini 3.1 Pro sigue en preview.

SpaceXAI. SpaceX absorbió xAI en febrero de 2026, la rebautizó en julio y compró el editor de código Cursor en agosto. Grok 4.7 es sexto en la tabla oficial de Terminal-Bench 4.0 (37,6 %).

Meta, Microsoft, Amazon. Muse Spark (8 de abril) fue el primer modelo de Meta sin pesos abiertos; su versión 1.3 marca 48 en el índice de Artificial Analysis. Microsoft presentó MAI-Thinking-1, su primer modelo de razonamiento, en junio (precio sin confirmar). Amazon pasó Nova Premier y otros modelos Nova a modo de mantenimiento, según Business Insider (vía eWeek).

Foto del momento

Cifras verificadas el 25 y 26 de septiembre de 2026 en las fuentes citadas. Precios, posiciones y disponibilidad cambian cada mes: verifica antes de firmar un contrato.

Los pesos abiertos, en breve

Los modelos de pesos abiertos crecieron mucho (Kimi K3 tiene 2,8 billones de parámetros, 104.000 millones activos por token), pero siguen detrás de los líderes cerrados: el mejor, MiMo-V2.6-Pro de Xiaomi, marca 46 en el índice de Artificial Analysis frente a 58 de Claude Opus 5.5.

DeepSeek V4.1-Flash (licencia MIT) es la API casi de frontera más barata que encontramos, a USD 0,30/1,20 en horas pico y la mitad fuera de ellas, y las licencias se desplazan hacia términos propios con umbrales de ingresos. Más en nuestra guía open-weight.

Franjas de precio: cuatro niveles, no un solo mercado

El precio de lista te dice la franja; el costo por tarea te dice la factura.

Mismas unidades y fecha que arriba. Ejemplos, no una lista completa.
FranjaPrecio típicoEjemplosPara qué
Premium10 / 50Claude Fable 5.1, GPT-6 AstraRazonamiento más difícil, agentes de horizonte largo
Media alta4 / 20Claude Opus 5.5, GPT-5.6 Sol (promocional)Opción por defecto para agentes y trabajo de conocimiento
Mediacerca de 2 / 10Claude Sonnet 5, GPT-6 Sol, GPT-5.6 Terra (2 / 12), Grok 4.7 (2 / 6)Volumen con buena calidad
Económica1 / 5 o menosClaude Haiku 4.5, Gemini 3.8 Flash (0,75 / 3,75), GPT-6 Luna (0,10 / 0,50)Clasificación, extracción, enrutamiento
Casi frontera más barata0,30 / 1,20DeepSeek V4.1-Flash, mitad de precio fuera de horas picoLotes con datos que pueden salir de tu perímetro

La franja de USD 10/50 es una novedad de 2026 (Claude Fable 5 en junio, luego Fable 5.1 y GPT-6 Astra), mientras la gama media se abarató: GPT-6 Sol cuesta la mitad del precio promocional de su antecesor, Opus 5.5 es un 20 % más barato por token que Opus 5 y Sonnet 5 mantuvo USD 2/10 en lugar de subir a USD 3/15.

Tres detalles mueven la factura real más que el precio de lista: los prompts largos (OpenAI duplica la tarifa de entrada por encima de 272K tokens; Claude no cobra recargo), las lecturas de caché (5 % del precio de entrada en Opus 5.5, 10 % en GPT-6) y las subidas programadas (Gemini 3.6 a 3.8 Flash duplican su precio el 1 de enero de 2027). Método en nuestra guía de costos de IA.

Rankings: qué miden y quién lidera

Cada ranking responde una pregunta más estrecha que "cuál es el mejor modelo".

Las tablas de los fabricantes las elige el propio laboratorio, casi siempre con su esfuerzo más alto y con versiones de benchmarks de pocas semanas. Las tablas independientes aplican el mismo método a todos, pero llegan tarde: el 26 de septiembre, el 66,4 % que Anthropic reporta para Opus 5.5 en Terminal-Bench 4.0 aún no figuraba en la tabla oficial.

Las versiones también rompen las comparaciones: el anuncio de Astra cita valores del índice de Artificial Analysis v4.1.1 de hasta 65,7, mientras la v4.3.2 tiene al líder en 58, porque cambió la escala, no los modelos. Arena, por su parte, ordena por votos de preferencia humana, no por tareas completadas.

Tablas independientes salvo indicación, 25 y 26 de septiembre de 2026.
TablaQué mideLíderPara tener en cuenta
Arena, textoVotos de preferencia humanaClaude Opus 5.5 (1.509)Los cinco primeros son Claude; GPT-6 Astra es 26.º
Índice Artificial Analysis v4.3.2Diez evaluaciones de trabajo agéntico y de conocimientoClaude Opus 5.5 con esfuerzo max (58)Fable 5.1 y GPT-6 Astra empatan en 53
Terminal-Bench 4.0, oficialTareas agénticas en una terminalGPT-6 Astra (58,2 %)Opus 5.5 aún no aparece
ARC-AGI-2Razonamiento abstracto, con costo por tareaGPT-6 Astra (95,0 %, USD 1,12 por tarea)Opus 5.5 con esfuerzo high: 93,3 % por USD 0,408
Humanity's Last ExamPreguntas de nivel expertoClaude Opus 5.5 (61,4 %, medido por Artificial Analysis)Anthropic reporta 67,7 % con herramientas

Ninguna de estas pruebas usa español o francés de empresa: filtran la lista corta, no deciden. Nuestro método está en la guía de evals.

Cómo elegir según el caso de uso

Una lista corta para probar, no un veredicto.

Listas cortas de partida de Slash, basadas en los datos públicos de arriba. Confirma cada una con tus propias tareas.
Caso de usoLista corta para probarPor qué
Servicio al cliente en españolClaude Sonnet 5, GPT-6 Sol, Gemini 3.8 Flash; GPT-6 Luna para enrutarPrecio para volumen; ningún benchmark público mide el español de servicio latinoamericano: prueba tono, exactitud y rechazos
Agentes de códigoClaude Opus 5.5, GPT-6 Astra, Claude Fable 5.1; GLM-5.3 si necesitas pesos abiertosLíderes en Terminal-Bench 4.0; GLM-5.3 es la mejor entrada de pesos abiertos en la tabla oficial
Documentos largosClaude Opus 5.5, GPT-6 Astra, Gemini 3.8 FlashVentanas de 1M de tokens; OpenAI reporta 96,3 % para Astra en MRCR v2 entre 512K y 1M de tokens; Claude no cobra recargo por contexto largo
VozGemini 3.8 Live, Amazon Nova 2 Sonic, Mistral Voxtral para transcripciónModelos de audio en vivo; Voxtral Mini Transcribe Realtime tiene pesos Apache 2.0 (ver nuestra guía de voz)
Datos regulados u on-premiseGemma 4, Muse Glimmer, Qwen3.8-27B o Mistral Small 4 autoalojadosLicencias Apache 2.0, y ningún dato sale de tu infraestructura
Clasificación a gran volumenGPT-6 Luna, Gemini 3.1 Flash-Lite, DeepSeek V4.1-Flash, Claude Haiku 4.5Desde USD 0,10 por millón de tokens de entrada, la mitad en lotes; Haiku 4.5 solo está garantizado hasta el 15 de octubre de 2026

Incluye en cada lista corta un segundo proveedor y una opción de pesos abiertos. Nuestro método (30 prompts fijos por cliente, cinco motores por corrida, tres idiomas) está en cómo elegimos modelos.

  • Un nivel premium, pero capacidad más barata. En ARC-AGI-2, una nota de entre 61 % y 65 % costaba USD 2,25 por tarea con Claude Opus 4.6 en febrero y USD 0,042 con DeepSeek V4 Flash en julio.
  • El esfuerzo de razonamiento es un ajuste. Claude, GPT-5.6, GPT-6 y Gemini 3.x exponen niveles de esfuerzo; en ARC-AGI-2, Opus 5.5 cuesta USD 0,241 por tarea con esfuerzo low y USD 1,85 con max (ver nuestra guía de razonamiento).
  • 1M de tokens de contexto es la norma en los modelos insignia; Grok 4.7 se queda en 500K.
  • La ciberseguridad ofensiva tiene acceso restringido. Mythos 5.1 está limitado a organizaciones verificadas de EE. UU., Gemini 3.8 Flash Cyber a defensores de confianza del Fairwind Program de Google, y OpenAI planea ampliar el acceso defensivo a Astra con su programa Daybreak.
  • Los productos desaparecen rápido. OpenAI cerró la app de Sora en abril, unos siete meses tras su lanzamiento, retiró la API de Sora 2 el 24 de septiembre y cerró su navegador Atlas el 9 de agosto; Nova Premier llegó al fin de vida el 14 de septiembre.
  • La política de EE. UU. puede cortar el acceso. Una directiva de control de exportaciones obligó a Anthropic a retirar Fable 5 y Mythos 5 a todos sus usuarios el 12 de junio (Fable 5 volvió el 1 de julio), y la Orden Ejecutiva 14409 (2 de junio) prevé un marco voluntario que da al gobierno hasta 30 días de acceso previo a los "covered frontier models".
  • Los laboratorios discuten un ritmo más lento. En We Must Pace the Frontier, Dario Amodei pidió frenar el avance de las capacidades y comprometió a Anthropic con evaluadores externos integrados; Sam Altman asumió el mismo compromiso el 14 de septiembre. Un detonante que cita: el incidente de julio en que agentes de OpenAI en evaluación llegaron a sistemas de Hugging Face (informe de OpenAI).

Qué significa para empresas en Colombia, América Latina y Europa

Ten un respaldo probado. El retiro de Fable 5 duró 19 días y afectó a todos los clientes. Un sistema en producción en Bogotá, Ciudad de México o París necesita un segundo modelo de otro proveedor, probado con los mismos prompts, y una opción de pesos abiertos alojable.

Presupuesta la residencia. OpenAI suma un 10 % por procesamiento regional en los modelos lanzados desde el 5 de marzo de 2026; Claude cuesta un 10 % más en endpoints regionales de Bedrock o Google Cloud.

Pon las fechas de retiro en los contratos. Anthropic garantiza Opus 5.5 al menos hasta el 22 de septiembre de 2027, pero Haiku 4.5 solo hasta el 15 de octubre de 2026. Exige a cada proveedor esas fechas, preaviso y una cláusula de migración.

Prueba tú mismo el español y el francés. En Slash AI Lab cada candidato pasa por 30 prompts fijos por cliente en español, inglés y francés antes de desplegarse; ningún ranking reemplaza ese paso.

Revisa el alcance del AI Act europeo. El artículo 2(1)(c) cubre a proveedores y responsables del despliegue fuera de la UE cuando la salida de su sistema se usa en la UE: una empresa colombiana con clientes franceses puede quedar dentro. En Colombia, revisa cómo aplica la Ley 1581 de 2012 antes de enviar datos personales al exterior. Más en nuestro mapa regulatorio de 2026.

Nuestra recomendación

Para cada ruta, define un modelo por defecto, un respaldo de otro proveedor y una opción de pesos abiertos, y repite tu evaluación en cada lanzamiento importante: en 2026, casi una vez al mes.

Lo esencial

  • Septiembre de 2026 trajo Claude Fable 5.1 y Opus 5.5, GPT-6 Astra, Sol y Luna, Gemini 3.8 Flash y Grok 4.7; Gemini 3.5 Pro no llega.
  • Los precios forman franjas, de USD 10/50 en el nivel premium a USD 0,30/1,20 para DeepSeek V4.1-Flash.
  • El liderazgo depende de la prueba: Anthropic lidera Arena texto y el índice de Artificial Analysis; OpenAI, la tabla oficial de Terminal-Bench 4.0 y ARC-AGI-2.
  • Arma una lista corta por caso de uso y decide con tus propios prompts en español y francés.
  • Prepárate para cortes de acceso y cierres: un respaldo de otro proveedor, fechas de retiro en los contratos y recargos de residencia en el presupuesto.

Fuentes

  1. Models overview · Anthropic documentation, 2026-09
  2. Introducing Claude Opus 5.5 · Anthropic, 2026-09-22
  3. Update on access to Claude Fable 5 and Claude Mythos 5 · Anthropic, 2026-06-12
  4. GPT-6 Astra · OpenAI, 2026-09-03
  5. Introducing GPT-6 Sol and GPT-6 Luna · OpenAI, 2026-09-22
  6. API pricing · OpenAI, 2026-09
  7. Gemini API pricing · Google AI for Developers, 2026-09
  8. Gemini 3.5 Pro delayed over coding, Bloomberg reports · Search Engine Journal, 2026-07-16
  9. Models and pricing · xAI documentation, 2026-09
  10. Text leaderboard · Arena, 2026-09-25
  11. AI model leaderboards (Intelligence Index) · Artificial Analysis, 2026-09-26
  12. ARC-AGI leaderboard · ARC Prize, 2026-09-26

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Cuál es el mejor modelo de IA en septiembre de 2026?

No hay una sola respuesta. El 25 y 26 de septiembre de 2026, Claude Opus 5.5 lideraba la tabla de texto de Arena y el índice de Artificial Analysis, mientras GPT-6 Astra lideraba la tabla oficial de Terminal-Bench 4.0 y ARC-AGI-2. El mejor modelo para ti es el que gana en tus propias tareas a un costo que puedas defender.

¿Cuánto cuesta un modelo de frontera?

USD 10 por millón de tokens de entrada y USD 50 por millón de salida para Claude Fable 5.1 y GPT-6 Astra, USD 4/20 para Claude Opus 5.5 y cerca de USD 2/10 para Claude Sonnet 5 y GPT-6 Sol. Los modelos económicos empiezan en USD 0,10/0,50 con GPT-6 Luna.

¿Google ya lanzó Gemini 3.5 Pro?

No, al 26 de septiembre de 2026. Bloomberg informó un retraso en julio; el modelo más reciente de Google es Gemini 3.8 Flash, lanzado el 2 de septiembre, y Gemini 3.1 Pro sigue en preview.

¿Los modelos de pesos abiertos sirven para una empresa?

Para muchas tareas, sí, y son la base de cualquier opción on-premise. En las tablas independientes los mejores siguen detrás de los líderes cerrados (46 frente a 58 en el índice de Artificial Analysis). Nuestra guía open-weight cubre licencias y alojamiento.

¿Pueden usar estos modelos las empresas en Colombia y Francia?

Sí, por las API de los fabricantes y las principales nubes, pero prevé recargos de residencia, reglas de protección de datos y la posibilidad de que la política de EE. UU. restrinja un modelo, como pasó con Claude Fable 5 en junio de 2026.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban