Modelos · Septiembre 2026

Modelos de razonamiento: cuándo vale la pena pagar por pensar

Los modelos principales de Anthropic, OpenAI y Google ya razonan antes de responder, y ese razonamiento se paga como tokens de salida. En un benchmark público, el mismo modelo cuesta casi ocho veces más por tarea en su nivel más alto que en el más bajo. Así decides dónde el razonamiento extra se gana su precio.

7,7x costo por tarea, max frente a low (Opus 5.5)medium esfuerzo por defecto en Opus 5.5 y GPT-6 Sol5 niveles de esfuerzo en Claude, de low a max
En resumen

Los modelos de razonamiento gastan tokens adicionales pensando antes de responder. En septiembre de 2026 ese razonamiento es un ajuste de los modelos principales (esfuerzo de low a max en Claude, de none a max en GPT-6 Sol y Luna, niveles en Gemini 3.8 Flash) y se factura como tokens de salida, se vea o no.

Nuestra regla: paga por pensar donde sube la proporción de tareas resueltas (código, matemáticas, planificación, agentes de varios pasos), mantenlo bajo en clasificación, extracción y voz en tiempo real, y fíjalo por ruta según el costo por tarea resuelta en tu propio set de evaluación.

Qué es "pensar", en palabras simples

Un modelo de razonamiento escribe pasos intermedios antes de su respuesta final: descompone el problema, prueba un enfoque, lo verifica y a veces vuelve a empezar. El término técnico es cómputo en inferencia (test-time compute): en lugar de un modelo más grande, gastas más cómputo en cada pregunta.

Esos pasos son tokens. Normalmente ves un resumen o nada, pero los pagas todos a la tarifa de salida, y generarlos toma tiempo. Pensar más ayuda sobre todo en problemas con muchos pasos dependientes, y poco cuando la respuesta es una consulta o una etiqueta.

El empaque cambió. En diciembre de 2024, OpenAI vendía el razonamiento como un modelo aparte, o1, a USD 15/60 por millón de tokens; en 2026 es un control de los modelos principales y OpenAI clasifica la serie o como heredada. En Claude Opus 5.5 y Fable 5.1 el razonamiento ni siquiera se puede apagar: el esfuerzo es la única palanca.

Cómo lo exponen los proveedores en septiembre de 2026

La misma idea, con nombres, niveles y valores por defecto distintos.

Según la documentación de los proveedores, consultada el 25 y 26 de septiembre de 2026.
ModeloControlNivelesPor defecto
Claude Opus 5.5effort; razonamiento siempre activolow, medium, high, xhigh, maxmedium
Claude Fable 5.1effort; razonamiento siempre activode low a maxhigh
Claude Haiku 4.5razonamiento extendido con presupuesto de tokenspresupuesto en tokensno admite effort
GPT-6 Sol, GPT-6 Luna, GPT-5.6reasoning effortnone, low, medium, high, xhigh, maxmedium
GPT-6 Astrareasoning effortde low a maxmedium
Gemini 3.8 Flashthinking_level; no se puede apagarlow, medium, highmedium

Claude Sonnet 5 también combina razonamiento adaptativo con effort (high por defecto), y Gemini 3 Deep Think sigue siendo un modo aparte para suscriptores de Google AI Ultra y acceso anticipado por API. Dos detalles pesan más que las etiquetas. Los niveles no se trasladan entre modelos: Anthropic dice que Opus 5.5 piensa más por turno que Opus 5 en el mismo nivel, y que Opus 5.5 en medium supera a Opus 5 en high en sus evaluaciones de código y trabajo de conocimiento. Y el esfuerzo también cambia las acciones: con menos esfuerzo, Claude hace menos llamadas a herramientas, y más escuetas.

La mecánica del costo y la latencia

El razonamiento se factura como salida, el lado caro de la lista de precios.

Anthropic, OpenAI y Google facturan los tokens de razonamiento a la tarifa de salida, cinco veces la de entrada en Claude Opus 5.5 (USD 4/20), GPT-6 Sol (USD 2/10) y Gemini 3.8 Flash (USD 0,75/3,75). La salida se genera token a token, así que pensar también retrasa la primera palabra útil, y en un agente esa espera se repite en cada turno.

ARC Prize publica la nota y el costo por tarea de cada modelo y nivel de esfuerzo, lo que hace visible el equilibrio:

ARC-AGI-2 (acertijos de razonamiento abstracto), tabla de ARC Prize, 26 de septiembre de 2026. Costo por tarea en USD.
Modelo y esfuerzoNotaCosto por tarea
Claude Opus 5.5, low70,1 %0,241
Claude Opus 5.5, high93,3 %0,408
Claude Opus 5.5, max91,7 %1,85
GPT-6 Astra, max95,0 %1,12
Gemini 3.8 Flash, high89,2 %0,40
GPT-6 Luna, max59,3 %0,062
Gemini 3 Deep Think (febrero de 2026)84,6 %13,62

De low a high, Opus 5.5 ganó 23 puntos por 1,7 veces el costo; de high a max, el costo se multiplicó por 4,5 y la nota bajó 1,6 puntos. Los acertijos de ARC no son tu carga de trabajo, pero esa forma (una subida fuerte y luego una meseta con costo creciente) es la que debes buscar en tus propios datos.

Los fabricantes describen el mismo patrón. Anthropic reportó en noviembre de 2025 que Claude Opus 4.5 con esfuerzo medium igualaba la mejor nota de Sonnet 4.5 en SWE-bench Verified con un 76 % menos de tokens de salida; OpenAI dice que GPT-6 Sol en xhigh logra 33,2 % en AutomationBench a USD 0,27 por tarea, frente a 26,9 % de Claude Opus 5 en max a 11,1 veces ese costo.

Dónde rinde pensar y dónde no

Pensar rinde cuando una tarea tiene muchos pasos dependientes y un resultado verificable: matemáticas, cambios de código en varios archivos, planificación, análisis que combina herramientas y datos, y agentes de varios pasos donde un error temprano arruina la corrida. Ahí, más esfuerzo sube la proporción de tareas resueltas, que es lo que estás comprando.

Rara vez rinde en clasificación, extracción, enrutamiento, respuestas cortas de FAQ o reescritura, donde el modelo sabe la respuesta o no. Y perjudica la voz en tiempo real, donde el razonamiento oculto retrasa la primera palabra hablada; Google ofrece Gemini 3.8 Live junto a una variante Live Extended Thinking aparte, lo que vuelve ese equilibrio una elección explícita.

Regla práctica de Slash para un primer ajuste, antes de medir. Tu set de evaluación tiene la última palabra.
Tipo de tareaEmpieza enSúbelo cuando
Clasificación, etiquetado, enrutamientoEl nivel más bajo: none en GPT-6 Sol y Luna, low en Claude y Gemini 3.8 FlashLos errores se concentran en casos ambiguos
Extracción a un esquemaLowLos campos exigen inferir entre páginas
FAQ y chat de servicio al clienteLowLas respuestas dependen de reglas o de varias consultas
Voz en tiempo realEl nivel más bajo, o un modelo de audio en vivoCasi nunca: manda lo difícil a un flujo asíncrono
Respuestas RAG sobre documentosDe low a mediumLas fuentes se contradicen o hay que sintetizar
Cambios de código, depuraciónMediumLas pruebas siguen fallando o el cambio toca muchos archivos
Agentes de varios pasos con herramientasMediumEl agente se estanca; bájalo si el costo sube sin más tareas resueltas
Matemáticas, planificación, análisis difícilHighPasa a xhigh o max solo con evidencia de tus evals, idealmente en lotes

Cómo ajustar el esfuerzo en cinco pasos

  1. Arma un set de evaluación. De 30 a 50 tareas reales por ruta, con verificaciones automáticas de acierto o fallo; Anthropic recomienda empezar con 20 a 50 tareas tomadas de fallos reales (ver nuestra guía de evals).
  2. Barre los niveles. Corre cada candidato en dos o tres niveles de esfuerzo, varias veces por tarea, y registra aciertos, tokens y latencia.
  3. Calcula el costo por tarea resuelta. Divide el gasto entre las tareas resueltas, no entre las solicitudes: un ajuste barato que falla la mitad de las veces puede salir más caro por tarea resuelta.
  4. Fija el esfuerzo por ruta, de forma explícita. Quédate con el nivel más bajo dentro de tu tolerancia de calidad y escríbelo en el código, porque los valores por defecto cambian (high en Opus 5, medium en Opus 5.5).
  5. Monitorea. Registra tokens de razonamiento y motivos de parada, crea alertas cuando el costo por tarea se desvíe y repite el barrido con cada cambio de modelo.

Dos mecánicas sorprenden a los equipos. El tope de salida incluye el razonamiento: con un max_tokens (Claude) o un max_output_tokens (OpenAI, Gemini) ajustado, el modelo puede gastar el presupuesto pensando y devolver una respuesta cortada o vacía; deja margen y trata un motivo de parada max_tokens o una respuesta incompleta como un error. Y en Claude, cambiar el esfuerzo global entre solicitudes invalida la caché de prompts (el esfuerzo por mensaje, en beta en los modelos recientes, la conserva): mantén el esfuerzo estable dentro de una conversación en caché.

Nuestra regla

Elige la combinación más barata de modelo y esfuerzo que cumpla tu umbral de éxito en tu propio set de evaluación. El valor por defecto del proveedor es un punto de partida, no una recomendación para tu tarea.

Errores que conviene evitar

  • Pensar de más. Más esfuerzo implica turnos más largos, más llamadas a herramientas y, como muestran los datos de ARC-AGI-2, a veces una nota más baja a un costo mayor. Anthropic señala además que en Opus 5 el esfuerzo no acorta de forma fiable las respuestas visibles: pide la extensión en el prompt; OpenAI ofrece un parámetro de verbosidad aparte.
  • Copiar ajustes viejos. En Opus 5.5 el razonamiento ya no se puede desactivar, el uso forzado de herramientas devuelve un error y el esfuerzo por defecto bajó de high a medium; Google declaró obsoletos temperature, top_p y top_k en la API de Gemini el 21 de julio de 2026. Repite el barrido en lugar de copiar parámetros.
  • Pedirle al modelo que revele su razonamiento. Opus 5.5 añade una categoría de rechazo reasoning_extraction que bloquea los intentos de extraer su razonamiento interno (devuelta como stop_reason: refusal). Para tener trazabilidad, pide una justificación breve en la respuesta, registra las llamadas a herramientas y envía los rechazos a un modelo de respaldo.
  • Tomar el razonamiento como un registro fiel. OpenAI dice que el razonamiento escrito de GPT-6 Astra fue más difícil de monitorear que el de GPT-5.6 Sol en sus pruebas y, tras el incidente de Hugging Face, destinó más cómputo a monitorear la cadena de pensamiento. Audita acciones, llamadas a herramientas y salidas.
  • Dejar los tokens de razonamiento fuera de los tableros. Una vista de costos con solo entrada y salida visible esconde la parte de la factura que controla el esfuerzo.

Qué significa para los presupuestos en Colombia y Europa

Los proveedores facturan en dólares, así que presupuestamos el razonamiento en USD y convertimos al facturar; para los equipos colombianos, la tasa de cambio es una variable más que no controlan. La unidad que importa es el costo por tarea resuelta, por ruta.

Una ilustración con las cifras de ARC Prize de arriba, no una proyección: con 10.000 tareas al mes, Opus 5.5 costaría cerca de USD 2.410 con esfuerzo low, USD 4.080 con high y USD 18.500 con max, y en esa prueba el paso a max no compra nada.

Tres palancas mantienen el razonamiento asequible: las API de lotes (50 % de descuento en Anthropic, OpenAI y Google) para el trabajo con esfuerzo alto que puede esperar, la caché para el contexto que los agentes reenvían en cada turno y un enrutamiento que manda solo los casos difíciles al esfuerzo alto. Los equipos en la UE que necesitan procesamiento regional pagan un 10 % más con OpenAI o en los endpoints regionales de Claude en la nube, sobre una factura que el razonamiento ya infló. Más en nuestra guía de costos de IA; Slash AI Lab evalúa los modelos antes de cada despliegue.

Lo esencial

  • En 2026 el razonamiento es un ajuste de los modelos principales y se factura como tokens de salida aunque no lo veas.
  • Claude Opus 5.5 siempre razona y usa medium por defecto; GPT-6 Sol y Luna van de none a max; Gemini 3.8 Flash usa niveles, con medium por defecto.
  • En ARC-AGI-2, Opus 5.5 cuesta USD 0,241 por tarea con esfuerzo low y USD 1,85 con max, y high sacó mejor nota que max.
  • Paga por pensar en código, matemáticas, planificación y agentes de varios pasos; mantenlo al mínimo en clasificación, extracción y voz en tiempo real.
  • Ajusta por ruta según el costo por tarea resuelta, deja margen en el tope de salida y mantén el esfuerzo estable para proteger la caché.

Fuentes

  1. Effort · Anthropic documentation, 2026-09
  2. Models overview · Anthropic documentation, 2026-09
  3. What's new in Claude Opus 5.5 · Anthropic documentation, 2026-09-22
  4. Introducing Claude Opus 5.5 · Anthropic, 2026-09-22
  5. Introducing Claude Opus 4.5 · Anthropic, 2025-11-24
  6. Reasoning models · OpenAI API documentation, 2026-09
  7. GPT-6 Sol · OpenAI API documentation, 2026-09-22
  8. GPT-6 Astra · OpenAI, 2026-09-03
  9. Introducing GPT-6 Sol and GPT-6 Luna · OpenAI, 2026-09-22
  10. Gemini thinking · Google AI for Developers, 2026-09-25
  11. ARC-AGI leaderboard · ARC Prize, 2026-09-26
  12. Demystifying evals for AI agents · Anthropic, 2026-01-09

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Qué es el esfuerzo de razonamiento?

Un ajuste que controla cuánto piensa un modelo antes de responder. Más esfuerzo suele resolver más tareas difíciles de varios pasos, pero genera más tokens de salida y tarda más.

¿Se cobran los tokens de razonamiento?

Sí. Anthropic, OpenAI y Google los facturan como tokens de salida, aunque solo veas un resumen o nada.

¿Puedo apagar el razonamiento en Claude Opus 5.5?

No. El razonamiento siempre está activo en Opus 5.5 y Fable 5.1. La palanca es el parámetro effort, de low a max, con medium por defecto en Opus 5.5.

¿Con qué nivel de esfuerzo empiezo?

El nivel más bajo para clasificación y extracción, medium para código y agentes, high para matemáticas y planificación. Luego barre los niveles con tu propio set de evaluación y quédate con el más barato que cumpla tu umbral de calidad.

¿Vale la pena usar todavía la serie o de OpenAI?

Sigue en la lista de precios de OpenAI (o3 a USD 2/8, por ejemplo), pero ya es heredada. Para proyectos nuevos, prueba primero GPT-6 Sol o Luna con un nivel de esfuerzo explícito.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban