El costo real de la IA: lo que muestra la factura y lo que esconde
El precio por millón de tokens es solo el comienzo. La factura real depende de la caché, del esfuerzo de razonamiento, de los reintentos y de decisiones de arquitectura que se toman antes del primer prompt. Así la calculamos.
En 2026 los precios de la IA se movieron en dos direcciones: apareció un nivel premium de USD 10 / 50 por millón de tokens (Claude Fable 5.1, GPT-6 Astra) mientras bajaba el segmento medio (GPT-6 Sol a USD 2 / 10, Claude Opus 5.5 un 20 % por debajo de Opus 5). Pero la factura depende menos del precio de lista que de la caché, los tokens de razonamiento, los descuentos por lotes y los recargos.
Nuestra regla: mide el costo por tarea resuelta, no el precio por token, aplica las palancas en orden y haz las cuentas de local frente a API con tus volúmenes antes de comprar hardware.
Cómo se cobra la IA en 2026
Siete medidores corren en cada factura; la mayoría de los equipos mira dos.
| Medidor | Cómo funciona | Ejemplos |
|---|---|---|
| Entrada y salida | La salida cuesta entre cinco y seis veces la entrada | Claude Opus 5.5: 4 / 20; GPT-6 Sol: 2 / 10; Gemini 3.5 Flash: 1,50 / 9 |
| Tokens de razonamiento | Se cobran como salida, aunque solo veas un resumen | OpenAI y Google lo documentan; el esfuerzo fija el volumen |
| Entrada en caché | Prefijos reutilizados a una fracción del precio; escribir la caché cuesta aparte | Lectura al 10 % de la entrada en Anthropic (5 % en Opus 5.5), la familia GPT-5 de OpenAI y Gemini 3.5 Flash; Anthropic cobra la escritura a 1,25x o 2x |
| Lotes | Trabajos asíncronos a mitad de precio | 50 % menos en Anthropic, OpenAI y Google |
| Contexto largo | Recargo por encima de un umbral, según el proveedor | OpenAI (GPT-5.5 y posteriores): 2x la entrada y 1,5x la salida por encima de 272K; Gemini 3.1 Pro: 4 / 18 por encima de 200K; Claude 4.6 y posteriores: sin recargo |
| Residencia de datos | Prima por mantener la inferencia en una región | OpenAI: +10 % en modelos desde el 5 de marzo de 2026; Anthropic solo EE. UU.: 1,1x; endpoints regionales de Bedrock y Vertex: +10 % |
| Medios y herramientas | Por imagen, por segundo o por llamada | Nano Banana 2: USD 0,067 por imagen 1K; Veo 3.1: USD 0,40 por segundo; búsqueda web de Claude: USD 10 por 1.000 |
Los precios se separan, no solo bajan
La tendencia depende del nivel que compres.
2026 creó un nivel premium de USD 10 / 50: Claude Fable 5 (9 de junio), Fable 5.1 (1 de septiembre) y GPT-6 Astra (3 de septiembre). El segmento medio se abarató: GPT-6 Sol (USD 2 / 10) y Luna (USD 0,10 / 0,50) salieron el 22 de septiembre a la mitad o menos de los precios promocionales de sus antecesores GPT-5.6.
Por unidad de capacidad, la caída es fuerte. Epoch AI encontró que el precio de alcanzar un nivel fijo de desempeño cayó entre 9 y 900 veces por año según el umbral, y que las caídas más rápidas son las menos seguras de durar. Con datos de ARC Prize, Claude Opus 4.6 logró 64,6 % en ARC-AGI-2 por USD 2,25 por tarea en febrero de 2026; DeepSeek V4 Flash logró 61,4 % por USD 0,042 en julio.
El conteo de tokens también se mueve: el tokenizador que Anthropic usa desde Claude Opus 4.7 produce cerca de un 30 % más de tokens para el mismo texto, así que un precio por token más bajo puede terminar en una factura mayor.
Costo por tarea resuelta, no precio por token
La unidad que importa es el trabajo terminado.
Un token más barato que necesita dos reintentos no es más barato. Nuestra fórmula de trabajo: costo por tarea resuelta = gasto de una ruta ÷ tareas que pasan tu evaluación. Captura reintentos, razonamiento y llamadas a herramientas que una lista de precios ignora.
El esfuerzo muestra cuánto pueden divergir. En la tabla de ARC-AGI-2 de ARC Prize, Claude Opus 5.5 cuesta USD 0,241 por tarea en esfuerzo low (70,1 %), USD 0,408 en high (93,3 %) y USD 1,85 en max (91,7 %): max cuesta 7,7 veces lo de low y 4,5 veces lo de high, con un puntaje menor que high.
Desconfía de cualquier cifra de costo por tarea que no hayas medido: verifícala con tus propias evals y ajusta el esfuerzo como explicamos en cuándo pagar por pensar.
Las palancas, en el orden en que las aplicamos
Primero las que no tocan la calidad; al final las que la negocian, y solo con una eval de antes y después.
| Palanca | Efecto documentado | Cuidado con |
|---|---|---|
| 1. Caché | Lectura al 10 % de la entrada (5 % en Opus 5.5); en un estudio de caso de 2026, un 99,3 % de aciertos de caché bajó el gasto en API un 88,6 % | Exige un prefijo estable; en Anthropic, cambiar el esfuerzo invalida la caché |
| 2. Higiene de prompts y herramientas | Anthropic redujo un flujo de agente de 150.000 a 2.000 tokens llamando herramientas MCP desde código | Las definiciones de herramientas se cobran: el toolset de uso de computador de Claude suma unos 4.500 tokens por petición |
| 3. Longitud de salida | El parámetro de verbosidad de OpenAI dio 560, 849 o 1.288 tokens en una misma tarea | En Opus 5, el esfuerzo no acorta las respuestas de forma confiable: pide la longitud en el prompt |
| 4. Lotes | 50 % menos en los tres grandes; en Anthropic se acumula con la caché | Asíncrono; no se combina con el modo rápido de Anthropic |
| 5. Esfuerzo | Opus 5.5 en ARC-AGI-2: USD 0,241 por tarea en low, 1,85 en max | Menos esfuerzo puede costar calidad; fíjalo por ruta |
| 6. Routing y cascadas | RouteLLM bajó el costo más de un 85 % en MT Bench conservando el 95 % de la calidad de GPT-4; Cursor afirma que su router supera a Opus 4.8 con un 41 % menos de costo | Los routers necesitan sus propias evals y un respaldo |
| 7. Modelos más pequeños | GPT-6 Luna cuesta la vigésima parte de GPT-6 Sol; gpt-oss-120b cuesta USD 0,15 / 0,60 en Groq y Together | Brechas en tareas difíciles y en español o francés |
| 8. Destilación | DeepSeek afirma que su modelo destilado de 8B iguala a Qwen3-235B-thinking en AIME 2024 | Requiere datos, entrenamiento y evals; Anthropic bloquea la extracción del razonamiento de Opus 5.5 |
Los costos que no aparecen en la factura de tokens
Presupuéstalos desde el primer día.
- Evals y observabilidad. Cada cambio de modelo o de prompt exige volver a correr las pruebas; nuestra guía de evals estima una corrida completa entre USD 16 y 32 en su ejemplo.
- Tiempo de ingeniería. En el mismo estudio de caso de 2026, la instalación local con modelos abiertos tuvo una tasa de commits de corrección del 74,9 % frente al 45,9 % con el modelo por API.
- Reintentos, rechazos y guardrails. Los intentos fallidos se cobran, algunos rechazos de Fable 5 se cobran desde el 24 de septiembre de 2026 y cada guardrail es una llamada más a un modelo.
- Tarifas de ejecución. Claude Managed Agents cobra USD 0,08 por hora de sesión y la búsqueda web USD 10 por 1.000 búsquedas.
- Dependencia. Una directiva de control de exportaciones de EE. UU. obligó a Anthropic a retirar Fable 5 a todos sus usuarios entre el 12 de junio y el 1 de julio de 2026.
- Cambios de precio programados. Gemini 3.6 a 3.8 Flash duplican su precio a USD 1,50 / 7,50 el 1 de enero de 2027; los USD 4 / 20 de GPT-5.6 Sol son promocionales al menos hasta el 21 de noviembre de 2026.
Local o API: cómo calcular el punto de equilibrio
Depende de contra qué comparas y de cuánto trabaja la máquina.
Costo local mensual = hardware ÷ meses de vida útil + energía + tiempo de operación. Punto de equilibrio = costo local mensual ÷ costo por petición en la API. Después verifica que la máquina pueda atender ese volumen y que el modelo local pase la misma eval.
Un ejemplo ilustrativo, no una cotización: un computador con una NVIDIA RTX 5090 (precio de lanzamiento USD 1.999, 575 W) que corre gpt-oss-20b, que LMSYS midió en esa tarjeta a 8.519 tokens por segundo de lectura y 205 de escritura. Supuestos: USD 1.000 para el resto del equipo, 36 meses de vida, 0,7 kW, 8 horas al día durante 20 días al mes a USD 0,15 por kWh (como en Pan et al.), 8 horas de operación al mes a USD 50 la hora y peticiones de 2.000 tokens de entrada y 500 de salida.
| API comparada | Costo por petición | Peticiones al mes para igualar USD 500 | ¿Cabe en la capacidad local? |
|---|---|---|---|
| Claude Opus 5.5 (USD 4 / 20) | USD 0,018 | Unas 27.800 | Sí |
| GPT-6 Sol (USD 2 / 10) | USD 0,009 | Unas 55.600 | Sí |
| GPT-6 Luna (USD 0,10 / 0,50) | USD 0,00045 | Unos 1,1 millones | No |
| gpt-oss-20b en Groq (USD 0,075 / 0,30) | USD 0,0003 | Unos 1,7 millones | No |
Frente a una API de frontera, el equipo se paga con decenas de miles de peticiones al mes, si un modelo de 20B pasa tus evals. Frente al mismo modelo abierto servido por API, no se paga con este uso. La operación es la línea más grande: sin ella, el equilibrio frente a GPT-6 Sol baja a unas 11.100 peticiones.
Los estudios coinciden en la forma. Pan et al. (2025) ven que lo local compensa sobre todo por encima de 50 millones de tokens al mes o con exigencias de residencia, y el estudio de caso de 2026 midió llamadas a la API con caché a unos USD 0,57 por millón de tokens, por debajo de los USD 2,83 de una fracción de GPU local compartida. Epoch AI agrega que el desempeño por dólar de los chips de IA sube cerca de un 49 % al año: el hardware propio envejece rápido.
Rehaz este cálculo con tus volúmenes, tus tasas de aprobación en evals y tu costo de personal. El cumplimiento normativo puede justificar lo local por sí solo; el costo, rara vez, salvo con volumen alto y estable. Opciones en nuestra guía de hardware para IA local.
FinOps para IA: presupuestos, alertas y revisiones
Controlar el costo es una rutina, no un proyecto.
- Etiqueta cada llamada con ruta, funcionalidad, cliente, modelo, esfuerzo y acierto de caché.
- Tableros por ruta: costo por tarea resuelta, tasa de aciertos de caché, tokens de salida por tarea, reintentos.
- Alertas y cuotas: gasto diario frente a una línea base y topes por clave y por equipo. Los agentes queman presupuesto rápido: OpenAI dice que el uso diario de tokens de su investigador mediano, a precios de API, supera los USD 600.
- Disciplina de esfuerzo: fíjalo por ruta, no por petición; en Anthropic, cambiarlo invalida la caché.
- Una revisión mensual de la mezcla de modelos, las tasas de aprobación, los cambios de precio y las fechas de retiro, con un responsable que pueda decir que no.
Compras: notas para Colombia y Europa
La moneda, la residencia y las condiciones de salida pesan tanto como la tarifa.
Moneda. Las tarifas están en dólares, así que un presupuesto en pesos o en euros suma riesgo cambiario al riesgo de uso. Presupuesta en USD con un margen, revisa cada mes y pide a tu asesor tributario que confirme cómo se gravan los servicios digitales del exterior en tu caso; aquí no modelamos impuestos.
Residencia. Mantener la inferencia en una región cuesta más: +10 % en el procesamiento regional de OpenAI y en los endpoints regionales de Bedrock o Vertex, 1,1x en la inferencia solo en EE. UU. de Anthropic. Comprar Claude por AWS, Google Cloud o Microsoft permite usar compromisos de nube ya existentes.
Retiros y salida. Anthropic publica fechas mínimas de disponibilidad (Opus 5.5 no antes del 22 de septiembre de 2027; Haiku 4.5 solo hasta el 15 de octubre de 2026 como mínimo). Negocia plazos de aviso para retiros y cambios de precio, apoyo de migración y condiciones de retención de datos, y mantén un respaldo probado de un segundo proveedor. Te acompañamos en consultoría de IA.
Lo esencial
- El precio por token es solo la base: la caché, el razonamiento cobrado como salida, los lotes y los recargos por contexto largo o residencia cambian la factura.
- 2026 partió el mercado: apareció un nivel premium de USD 10 / 50 mientras bajaba el segmento medio, y el precio por capacidad sigue cayendo.
- Mide el costo por tarea resuelta: en ARC-AGI-2, Opus 5.5 en esfuerzo max cuesta 7,7 veces lo de low y puntúa por debajo de high.
- Aplica primero caché y lotes; esfuerzo, routing, modelos pequeños y destilación cambian calidad por costo y exigen una eval de antes y después.
- Lo local le gana a la API solo con volumen alto y estable o por cumplimiento; el tiempo de operación suele ser la línea más grande.
Fuentes
- Pricing
- Effort
- Models overview
- API pricing
- Introducing GPT-6 Sol and GPT-6 Luna
- Gemini API pricing
- ARC-AGI leaderboard
- LLM inference prices have fallen rapidly but unequally across tasks
- RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing
- Code execution with MCP
- A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services
- GeForce RTX 5090
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Por qué la salida cuesta más que la entrada?
Los proveedores cobran más por generar que por leer: en los modelos actuales la salida cuesta entre cinco y seis veces la entrada (Claude Opus 5.5 a USD 4 / 20, GPT-6 Sol a 2 / 10, Gemini 3.5 Flash a 1,50 / 9). OpenAI y Google cobran los tokens de razonamiento como salida, así que el esfuerzo pesa en la factura.
¿Cuánto ahorra la caché de prompts?
La lectura de caché cuesta el 10 % del precio de entrada en Anthropic, en la familia GPT-5 de OpenAI y en Gemini 3.5 Flash, y el 5 % en Claude Opus 5.5. La escritura cuesta más (1,25x o 2x en Anthropic), así que conviene cuando el mismo prefijo se reutiliza mientras la caché sigue viva.
¿Vale la pena la API de lotes?
Para todo lo que no necesita respuesta inmediata, sí: Anthropic, OpenAI y Google cobran un 50 % menos por los trabajos en lotes, y en Anthropic ese descuento se acumula con el de la caché.
¿Cuándo le gana la inferencia local a la API?
Con volumen alto y estable frente a API caras, o cuando el cumplimiento lo exige. En nuestro ejemplo ilustrativo, un computador con una RTX 5090 iguala a GPT-6 Sol hacia 55.600 peticiones al mes, pero nunca al mismo modelo abierto servido por API.
¿Cómo presupuestar IA en dólares desde Colombia?
Presupuesta en USD con un margen para la tasa de cambio, fija cuotas y alertas por ruta, revisa cada mes teniendo en cuenta los cambios de precio anunciados y pide a tu asesor tributario que confirme el tratamiento de los servicios digitales del exterior.
Más análisis para seguir
Claude Opus 5.5: qué cambia para las empresas
Lanzado el 22 de septiembre de 2026: más barato que Opus 5, nivel Fable 5.1 según Anthropic. Precio, benchmarks, cambios técnicos y cuándo usarlo.
ModelosModelos de razonamiento: cuándo pagar por pensar
Pensar cuesta tokens y segundos. Cómo exponen el esfuerzo Anthropic, OpenAI y Google, dónde rinde, dónde no y cómo ajustarlo con el costo por tarea resuelta.
IA local y open sourceIA local en 2026: qué hardware comprar y qué corre en cada uno
RTX 5090, RTX PRO 6000, DGX Spark, Ryzen AI Max+ y Mac Studio M5: cálculo de memoria, qué modelo cabe dónde, comprar o alquilar y opciones por tamaño de equipo.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.