Modelos de razonamiento: cuándo vale la pena pagar por pensar
Los modelos principales de Anthropic, OpenAI y Google ya razonan antes de responder, y ese razonamiento se paga como tokens de salida. En un benchmark público, el mismo modelo cuesta casi ocho veces más por tarea en su nivel más alto que en el más bajo. Así decides dónde el razonamiento extra se gana su precio.
Los modelos de razonamiento gastan tokens adicionales pensando antes de responder. En septiembre de 2026 ese razonamiento es un ajuste de los modelos principales (esfuerzo de low a max en Claude, de none a max en GPT-6 Sol y Luna, niveles en Gemini 3.8 Flash) y se factura como tokens de salida, se vea o no.
Nuestra regla: paga por pensar donde sube la proporción de tareas resueltas (código, matemáticas, planificación, agentes de varios pasos), mantenlo bajo en clasificación, extracción y voz en tiempo real, y fíjalo por ruta según el costo por tarea resuelta en tu propio set de evaluación.
Qué es "pensar", en palabras simples
Un modelo de razonamiento escribe pasos intermedios antes de su respuesta final: descompone el problema, prueba un enfoque, lo verifica y a veces vuelve a empezar. El término técnico es cómputo en inferencia (test-time compute): en lugar de un modelo más grande, gastas más cómputo en cada pregunta.
Esos pasos son tokens. Normalmente ves un resumen o nada, pero los pagas todos a la tarifa de salida, y generarlos toma tiempo. Pensar más ayuda sobre todo en problemas con muchos pasos dependientes, y poco cuando la respuesta es una consulta o una etiqueta.
El empaque cambió. En diciembre de 2024, OpenAI vendía el razonamiento como un modelo aparte, o1, a USD 15/60 por millón de tokens; en 2026 es un control de los modelos principales y OpenAI clasifica la serie o como heredada. En Claude Opus 5.5 y Fable 5.1 el razonamiento ni siquiera se puede apagar: el esfuerzo es la única palanca.
Cómo lo exponen los proveedores en septiembre de 2026
La misma idea, con nombres, niveles y valores por defecto distintos.
| Modelo | Control | Niveles | Por defecto |
|---|---|---|---|
| Claude Opus 5.5 | effort; razonamiento siempre activo | low, medium, high, xhigh, max | medium |
| Claude Fable 5.1 | effort; razonamiento siempre activo | de low a max | high |
| Claude Haiku 4.5 | razonamiento extendido con presupuesto de tokens | presupuesto en tokens | no admite effort |
| GPT-6 Sol, GPT-6 Luna, GPT-5.6 | reasoning effort | none, low, medium, high, xhigh, max | medium |
| GPT-6 Astra | reasoning effort | de low a max | medium |
| Gemini 3.8 Flash | thinking_level; no se puede apagar | low, medium, high | medium |
Claude Sonnet 5 también combina razonamiento adaptativo con effort (high por defecto), y Gemini 3 Deep Think sigue siendo un modo aparte para suscriptores de Google AI Ultra y acceso anticipado por API. Dos detalles pesan más que las etiquetas. Los niveles no se trasladan entre modelos: Anthropic dice que Opus 5.5 piensa más por turno que Opus 5 en el mismo nivel, y que Opus 5.5 en medium supera a Opus 5 en high en sus evaluaciones de código y trabajo de conocimiento. Y el esfuerzo también cambia las acciones: con menos esfuerzo, Claude hace menos llamadas a herramientas, y más escuetas.
La mecánica del costo y la latencia
El razonamiento se factura como salida, el lado caro de la lista de precios.
Anthropic, OpenAI y Google facturan los tokens de razonamiento a la tarifa de salida, cinco veces la de entrada en Claude Opus 5.5 (USD 4/20), GPT-6 Sol (USD 2/10) y Gemini 3.8 Flash (USD 0,75/3,75). La salida se genera token a token, así que pensar también retrasa la primera palabra útil, y en un agente esa espera se repite en cada turno.
ARC Prize publica la nota y el costo por tarea de cada modelo y nivel de esfuerzo, lo que hace visible el equilibrio:
| Modelo y esfuerzo | Nota | Costo por tarea |
|---|---|---|
| Claude Opus 5.5, low | 70,1 % | 0,241 |
| Claude Opus 5.5, high | 93,3 % | 0,408 |
| Claude Opus 5.5, max | 91,7 % | 1,85 |
| GPT-6 Astra, max | 95,0 % | 1,12 |
| Gemini 3.8 Flash, high | 89,2 % | 0,40 |
| GPT-6 Luna, max | 59,3 % | 0,062 |
| Gemini 3 Deep Think (febrero de 2026) | 84,6 % | 13,62 |
De low a high, Opus 5.5 ganó 23 puntos por 1,7 veces el costo; de high a max, el costo se multiplicó por 4,5 y la nota bajó 1,6 puntos. Los acertijos de ARC no son tu carga de trabajo, pero esa forma (una subida fuerte y luego una meseta con costo creciente) es la que debes buscar en tus propios datos.
Los fabricantes describen el mismo patrón. Anthropic reportó en noviembre de 2025 que Claude Opus 4.5 con esfuerzo medium igualaba la mejor nota de Sonnet 4.5 en SWE-bench Verified con un 76 % menos de tokens de salida; OpenAI dice que GPT-6 Sol en xhigh logra 33,2 % en AutomationBench a USD 0,27 por tarea, frente a 26,9 % de Claude Opus 5 en max a 11,1 veces ese costo.
Dónde rinde pensar y dónde no
Pensar rinde cuando una tarea tiene muchos pasos dependientes y un resultado verificable: matemáticas, cambios de código en varios archivos, planificación, análisis que combina herramientas y datos, y agentes de varios pasos donde un error temprano arruina la corrida. Ahí, más esfuerzo sube la proporción de tareas resueltas, que es lo que estás comprando.
Rara vez rinde en clasificación, extracción, enrutamiento, respuestas cortas de FAQ o reescritura, donde el modelo sabe la respuesta o no. Y perjudica la voz en tiempo real, donde el razonamiento oculto retrasa la primera palabra hablada; Google ofrece Gemini 3.8 Live junto a una variante Live Extended Thinking aparte, lo que vuelve ese equilibrio una elección explícita.
| Tipo de tarea | Empieza en | Súbelo cuando |
|---|---|---|
| Clasificación, etiquetado, enrutamiento | El nivel más bajo: none en GPT-6 Sol y Luna, low en Claude y Gemini 3.8 Flash | Los errores se concentran en casos ambiguos |
| Extracción a un esquema | Low | Los campos exigen inferir entre páginas |
| FAQ y chat de servicio al cliente | Low | Las respuestas dependen de reglas o de varias consultas |
| Voz en tiempo real | El nivel más bajo, o un modelo de audio en vivo | Casi nunca: manda lo difícil a un flujo asíncrono |
| Respuestas RAG sobre documentos | De low a medium | Las fuentes se contradicen o hay que sintetizar |
| Cambios de código, depuración | Medium | Las pruebas siguen fallando o el cambio toca muchos archivos |
| Agentes de varios pasos con herramientas | Medium | El agente se estanca; bájalo si el costo sube sin más tareas resueltas |
| Matemáticas, planificación, análisis difícil | High | Pasa a xhigh o max solo con evidencia de tus evals, idealmente en lotes |
Cómo ajustar el esfuerzo en cinco pasos
- Arma un set de evaluación. De 30 a 50 tareas reales por ruta, con verificaciones automáticas de acierto o fallo; Anthropic recomienda empezar con 20 a 50 tareas tomadas de fallos reales (ver nuestra guía de evals).
- Barre los niveles. Corre cada candidato en dos o tres niveles de esfuerzo, varias veces por tarea, y registra aciertos, tokens y latencia.
- Calcula el costo por tarea resuelta. Divide el gasto entre las tareas resueltas, no entre las solicitudes: un ajuste barato que falla la mitad de las veces puede salir más caro por tarea resuelta.
- Fija el esfuerzo por ruta, de forma explícita. Quédate con el nivel más bajo dentro de tu tolerancia de calidad y escríbelo en el código, porque los valores por defecto cambian (high en Opus 5, medium en Opus 5.5).
- Monitorea. Registra tokens de razonamiento y motivos de parada, crea alertas cuando el costo por tarea se desvíe y repite el barrido con cada cambio de modelo.
Dos mecánicas sorprenden a los equipos. El tope de salida incluye el razonamiento: con un max_tokens (Claude) o un max_output_tokens (OpenAI, Gemini) ajustado, el modelo puede gastar el presupuesto pensando y devolver una respuesta cortada o vacía; deja margen y trata un motivo de parada max_tokens o una respuesta incompleta como un error. Y en Claude, cambiar el esfuerzo global entre solicitudes invalida la caché de prompts (el esfuerzo por mensaje, en beta en los modelos recientes, la conserva): mantén el esfuerzo estable dentro de una conversación en caché.
Elige la combinación más barata de modelo y esfuerzo que cumpla tu umbral de éxito en tu propio set de evaluación. El valor por defecto del proveedor es un punto de partida, no una recomendación para tu tarea.
Errores que conviene evitar
- Pensar de más. Más esfuerzo implica turnos más largos, más llamadas a herramientas y, como muestran los datos de ARC-AGI-2, a veces una nota más baja a un costo mayor. Anthropic señala además que en Opus 5 el esfuerzo no acorta de forma fiable las respuestas visibles: pide la extensión en el prompt; OpenAI ofrece un parámetro de verbosidad aparte.
- Copiar ajustes viejos. En Opus 5.5 el razonamiento ya no se puede desactivar, el uso forzado de herramientas devuelve un error y el esfuerzo por defecto bajó de high a medium; Google declaró obsoletos temperature, top_p y top_k en la API de Gemini el 21 de julio de 2026. Repite el barrido en lugar de copiar parámetros.
- Pedirle al modelo que revele su razonamiento. Opus 5.5 añade una categoría de rechazo
reasoning_extractionque bloquea los intentos de extraer su razonamiento interno (devuelta comostop_reason: refusal). Para tener trazabilidad, pide una justificación breve en la respuesta, registra las llamadas a herramientas y envía los rechazos a un modelo de respaldo. - Tomar el razonamiento como un registro fiel. OpenAI dice que el razonamiento escrito de GPT-6 Astra fue más difícil de monitorear que el de GPT-5.6 Sol en sus pruebas y, tras el incidente de Hugging Face, destinó más cómputo a monitorear la cadena de pensamiento. Audita acciones, llamadas a herramientas y salidas.
- Dejar los tokens de razonamiento fuera de los tableros. Una vista de costos con solo entrada y salida visible esconde la parte de la factura que controla el esfuerzo.
Qué significa para los presupuestos en Colombia y Europa
Los proveedores facturan en dólares, así que presupuestamos el razonamiento en USD y convertimos al facturar; para los equipos colombianos, la tasa de cambio es una variable más que no controlan. La unidad que importa es el costo por tarea resuelta, por ruta.
Una ilustración con las cifras de ARC Prize de arriba, no una proyección: con 10.000 tareas al mes, Opus 5.5 costaría cerca de USD 2.410 con esfuerzo low, USD 4.080 con high y USD 18.500 con max, y en esa prueba el paso a max no compra nada.
Tres palancas mantienen el razonamiento asequible: las API de lotes (50 % de descuento en Anthropic, OpenAI y Google) para el trabajo con esfuerzo alto que puede esperar, la caché para el contexto que los agentes reenvían en cada turno y un enrutamiento que manda solo los casos difíciles al esfuerzo alto. Los equipos en la UE que necesitan procesamiento regional pagan un 10 % más con OpenAI o en los endpoints regionales de Claude en la nube, sobre una factura que el razonamiento ya infló. Más en nuestra guía de costos de IA; Slash AI Lab evalúa los modelos antes de cada despliegue.
Lo esencial
- En 2026 el razonamiento es un ajuste de los modelos principales y se factura como tokens de salida aunque no lo veas.
- Claude Opus 5.5 siempre razona y usa medium por defecto; GPT-6 Sol y Luna van de none a max; Gemini 3.8 Flash usa niveles, con medium por defecto.
- En ARC-AGI-2, Opus 5.5 cuesta USD 0,241 por tarea con esfuerzo low y USD 1,85 con max, y high sacó mejor nota que max.
- Paga por pensar en código, matemáticas, planificación y agentes de varios pasos; mantenlo al mínimo en clasificación, extracción y voz en tiempo real.
- Ajusta por ruta según el costo por tarea resuelta, deja margen en el tope de salida y mantén el esfuerzo estable para proteger la caché.
Fuentes
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Qué es el esfuerzo de razonamiento?
Un ajuste que controla cuánto piensa un modelo antes de responder. Más esfuerzo suele resolver más tareas difíciles de varios pasos, pero genera más tokens de salida y tarda más.
¿Se cobran los tokens de razonamiento?
Sí. Anthropic, OpenAI y Google los facturan como tokens de salida, aunque solo veas un resumen o nada.
¿Puedo apagar el razonamiento en Claude Opus 5.5?
No. El razonamiento siempre está activo en Opus 5.5 y Fable 5.1. La palanca es el parámetro effort, de low a max, con medium por defecto en Opus 5.5.
¿Con qué nivel de esfuerzo empiezo?
El nivel más bajo para clasificación y extracción, medium para código y agentes, high para matemáticas y planificación. Luego barre los niveles con tu propio set de evaluación y quédate con el más barato que cumpla tu umbral de calidad.
¿Vale la pena usar todavía la serie o de OpenAI?
Sigue en la lista de precios de OpenAI (o3 a USD 2/8, por ejemplo), pero ya es heredada. Para proyectos nuevos, prueba primero GPT-6 Sol o Luna con un nivel de esfuerzo explícito.
Más análisis para seguir
Claude Opus 5.5: qué cambia para las empresas
Lanzado el 22 de septiembre de 2026: más barato que Opus 5, nivel Fable 5.1 según Anthropic. Precio, benchmarks, cambios técnicos y cuándo usarlo.
Estrategia y regulaciónEl costo real de la IA
Cómo se cobra hoy la IA, por qué importa el costo por tarea resuelta, palancas de ahorro con cifras, costos ocultos y un cálculo de local frente a API.
Agentes e ingenieríaEvals: cómo probar un sistema con LLM
Por qué probar a ojo falla: set de oro en español y francés, jueces LLM calibrados, gates de regresión en CI, herramientas y cuánto cuesta evaluar.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.