Estrategia y regulación · Septiembre 2026

El costo real de la IA: lo que muestra la factura y lo que esconde

El precio por millón de tokens es solo el comienzo. La factura real depende de la caché, del esfuerzo de razonamiento, de los reintentos y de decisiones de arquitectura que se toman antes del primer prompt. Así la calculamos.

USD 10 / 50 nuevo nivel premium por millón de tokens7,7x costo por tarea de max frente a low en Opus 5.550 % descuento por lotes en Anthropic, OpenAI y Google
En resumen

En 2026 los precios de la IA se movieron en dos direcciones: apareció un nivel premium de USD 10 / 50 por millón de tokens (Claude Fable 5.1, GPT-6 Astra) mientras bajaba el segmento medio (GPT-6 Sol a USD 2 / 10, Claude Opus 5.5 un 20 % por debajo de Opus 5). Pero la factura depende menos del precio de lista que de la caché, los tokens de razonamiento, los descuentos por lotes y los recargos.

Nuestra regla: mide el costo por tarea resuelta, no el precio por token, aplica las palancas en orden y haz las cuentas de local frente a API con tus volúmenes antes de comprar hardware.

Cómo se cobra la IA en 2026

Siete medidores corren en cada factura; la mayoría de los equipos mira dos.

Páginas de precios y documentación de los proveedores, consultadas el 26 de septiembre de 2026. USD por millón de tokens salvo indicación.
MedidorCómo funcionaEjemplos
Entrada y salidaLa salida cuesta entre cinco y seis veces la entradaClaude Opus 5.5: 4 / 20; GPT-6 Sol: 2 / 10; Gemini 3.5 Flash: 1,50 / 9
Tokens de razonamientoSe cobran como salida, aunque solo veas un resumenOpenAI y Google lo documentan; el esfuerzo fija el volumen
Entrada en cachéPrefijos reutilizados a una fracción del precio; escribir la caché cuesta aparteLectura al 10 % de la entrada en Anthropic (5 % en Opus 5.5), la familia GPT-5 de OpenAI y Gemini 3.5 Flash; Anthropic cobra la escritura a 1,25x o 2x
LotesTrabajos asíncronos a mitad de precio50 % menos en Anthropic, OpenAI y Google
Contexto largoRecargo por encima de un umbral, según el proveedorOpenAI (GPT-5.5 y posteriores): 2x la entrada y 1,5x la salida por encima de 272K; Gemini 3.1 Pro: 4 / 18 por encima de 200K; Claude 4.6 y posteriores: sin recargo
Residencia de datosPrima por mantener la inferencia en una regiónOpenAI: +10 % en modelos desde el 5 de marzo de 2026; Anthropic solo EE. UU.: 1,1x; endpoints regionales de Bedrock y Vertex: +10 %
Medios y herramientasPor imagen, por segundo o por llamadaNano Banana 2: USD 0,067 por imagen 1K; Veo 3.1: USD 0,40 por segundo; búsqueda web de Claude: USD 10 por 1.000

La tendencia depende del nivel que compres.

2026 creó un nivel premium de USD 10 / 50: Claude Fable 5 (9 de junio), Fable 5.1 (1 de septiembre) y GPT-6 Astra (3 de septiembre). El segmento medio se abarató: GPT-6 Sol (USD 2 / 10) y Luna (USD 0,10 / 0,50) salieron el 22 de septiembre a la mitad o menos de los precios promocionales de sus antecesores GPT-5.6.

Por unidad de capacidad, la caída es fuerte. Epoch AI encontró que el precio de alcanzar un nivel fijo de desempeño cayó entre 9 y 900 veces por año según el umbral, y que las caídas más rápidas son las menos seguras de durar. Con datos de ARC Prize, Claude Opus 4.6 logró 64,6 % en ARC-AGI-2 por USD 2,25 por tarea en febrero de 2026; DeepSeek V4 Flash logró 61,4 % por USD 0,042 en julio.

El conteo de tokens también se mueve: el tokenizador que Anthropic usa desde Claude Opus 4.7 produce cerca de un 30 % más de tokens para el mismo texto, así que un precio por token más bajo puede terminar en una factura mayor.

Costo por tarea resuelta, no precio por token

La unidad que importa es el trabajo terminado.

Un token más barato que necesita dos reintentos no es más barato. Nuestra fórmula de trabajo: costo por tarea resuelta = gasto de una ruta ÷ tareas que pasan tu evaluación. Captura reintentos, razonamiento y llamadas a herramientas que una lista de precios ignora.

El esfuerzo muestra cuánto pueden divergir. En la tabla de ARC-AGI-2 de ARC Prize, Claude Opus 5.5 cuesta USD 0,241 por tarea en esfuerzo low (70,1 %), USD 0,408 en high (93,3 %) y USD 1,85 en max (91,7 %): max cuesta 7,7 veces lo de low y 4,5 veces lo de high, con un puntaje menor que high.

Desconfía de cualquier cifra de costo por tarea que no hayas medido: verifícala con tus propias evals y ajusta el esfuerzo como explicamos en cuándo pagar por pensar.

Las palancas, en el orden en que las aplicamos

Primero las que no tocan la calidad; al final las que la negocian, y solo con una eval de antes y después.

Efectos reportados por cada fuente sobre su propia carga; los tuyos serán distintos.
PalancaEfecto documentadoCuidado con
1. CachéLectura al 10 % de la entrada (5 % en Opus 5.5); en un estudio de caso de 2026, un 99,3 % de aciertos de caché bajó el gasto en API un 88,6 %Exige un prefijo estable; en Anthropic, cambiar el esfuerzo invalida la caché
2. Higiene de prompts y herramientasAnthropic redujo un flujo de agente de 150.000 a 2.000 tokens llamando herramientas MCP desde códigoLas definiciones de herramientas se cobran: el toolset de uso de computador de Claude suma unos 4.500 tokens por petición
3. Longitud de salidaEl parámetro de verbosidad de OpenAI dio 560, 849 o 1.288 tokens en una misma tareaEn Opus 5, el esfuerzo no acorta las respuestas de forma confiable: pide la longitud en el prompt
4. Lotes50 % menos en los tres grandes; en Anthropic se acumula con la cachéAsíncrono; no se combina con el modo rápido de Anthropic
5. EsfuerzoOpus 5.5 en ARC-AGI-2: USD 0,241 por tarea en low, 1,85 en maxMenos esfuerzo puede costar calidad; fíjalo por ruta
6. Routing y cascadasRouteLLM bajó el costo más de un 85 % en MT Bench conservando el 95 % de la calidad de GPT-4; Cursor afirma que su router supera a Opus 4.8 con un 41 % menos de costoLos routers necesitan sus propias evals y un respaldo
7. Modelos más pequeñosGPT-6 Luna cuesta la vigésima parte de GPT-6 Sol; gpt-oss-120b cuesta USD 0,15 / 0,60 en Groq y TogetherBrechas en tareas difíciles y en español o francés
8. DestilaciónDeepSeek afirma que su modelo destilado de 8B iguala a Qwen3-235B-thinking en AIME 2024Requiere datos, entrenamiento y evals; Anthropic bloquea la extracción del razonamiento de Opus 5.5

Los costos que no aparecen en la factura de tokens

Presupuéstalos desde el primer día.

  • Evals y observabilidad. Cada cambio de modelo o de prompt exige volver a correr las pruebas; nuestra guía de evals estima una corrida completa entre USD 16 y 32 en su ejemplo.
  • Tiempo de ingeniería. En el mismo estudio de caso de 2026, la instalación local con modelos abiertos tuvo una tasa de commits de corrección del 74,9 % frente al 45,9 % con el modelo por API.
  • Reintentos, rechazos y guardrails. Los intentos fallidos se cobran, algunos rechazos de Fable 5 se cobran desde el 24 de septiembre de 2026 y cada guardrail es una llamada más a un modelo.
  • Tarifas de ejecución. Claude Managed Agents cobra USD 0,08 por hora de sesión y la búsqueda web USD 10 por 1.000 búsquedas.
  • Dependencia. Una directiva de control de exportaciones de EE. UU. obligó a Anthropic a retirar Fable 5 a todos sus usuarios entre el 12 de junio y el 1 de julio de 2026.
  • Cambios de precio programados. Gemini 3.6 a 3.8 Flash duplican su precio a USD 1,50 / 7,50 el 1 de enero de 2027; los USD 4 / 20 de GPT-5.6 Sol son promocionales al menos hasta el 21 de noviembre de 2026.

Local o API: cómo calcular el punto de equilibrio

Depende de contra qué comparas y de cuánto trabaja la máquina.

Costo local mensual = hardware ÷ meses de vida útil + energía + tiempo de operación. Punto de equilibrio = costo local mensual ÷ costo por petición en la API. Después verifica que la máquina pueda atender ese volumen y que el modelo local pase la misma eval.

Un ejemplo ilustrativo, no una cotización: un computador con una NVIDIA RTX 5090 (precio de lanzamiento USD 1.999, 575 W) que corre gpt-oss-20b, que LMSYS midió en esa tarjeta a 8.519 tokens por segundo de lectura y 205 de escritura. Supuestos: USD 1.000 para el resto del equipo, 36 meses de vida, 0,7 kW, 8 horas al día durante 20 días al mes a USD 0,15 por kWh (como en Pan et al.), 8 horas de operación al mes a USD 50 la hora y peticiones de 2.000 tokens de entrada y 500 de salida.

Costo local por mes: hardware USD 83 + energía USD 17 + operación USD 400 = unos USD 500. Capacidad en un solo flujo: unas 215.000 peticiones al mes.
API comparadaCosto por peticiónPeticiones al mes para igualar USD 500¿Cabe en la capacidad local?
Claude Opus 5.5 (USD 4 / 20)USD 0,018Unas 27.800Sí
GPT-6 Sol (USD 2 / 10)USD 0,009Unas 55.600Sí
GPT-6 Luna (USD 0,10 / 0,50)USD 0,00045Unos 1,1 millonesNo
gpt-oss-20b en Groq (USD 0,075 / 0,30)USD 0,0003Unos 1,7 millonesNo

Frente a una API de frontera, el equipo se paga con decenas de miles de peticiones al mes, si un modelo de 20B pasa tus evals. Frente al mismo modelo abierto servido por API, no se paga con este uso. La operación es la línea más grande: sin ella, el equilibrio frente a GPT-6 Sol baja a unas 11.100 peticiones.

Los estudios coinciden en la forma. Pan et al. (2025) ven que lo local compensa sobre todo por encima de 50 millones de tokens al mes o con exigencias de residencia, y el estudio de caso de 2026 midió llamadas a la API con caché a unos USD 0,57 por millón de tokens, por debajo de los USD 2,83 de una fracción de GPU local compartida. Epoch AI agrega que el desempeño por dólar de los chips de IA sube cerca de un 49 % al año: el hardware propio envejece rápido.

Antes de comprar

Rehaz este cálculo con tus volúmenes, tus tasas de aprobación en evals y tu costo de personal. El cumplimiento normativo puede justificar lo local por sí solo; el costo, rara vez, salvo con volumen alto y estable. Opciones en nuestra guía de hardware para IA local.

FinOps para IA: presupuestos, alertas y revisiones

Controlar el costo es una rutina, no un proyecto.

  • Etiqueta cada llamada con ruta, funcionalidad, cliente, modelo, esfuerzo y acierto de caché.
  • Tableros por ruta: costo por tarea resuelta, tasa de aciertos de caché, tokens de salida por tarea, reintentos.
  • Alertas y cuotas: gasto diario frente a una línea base y topes por clave y por equipo. Los agentes queman presupuesto rápido: OpenAI dice que el uso diario de tokens de su investigador mediano, a precios de API, supera los USD 600.
  • Disciplina de esfuerzo: fíjalo por ruta, no por petición; en Anthropic, cambiarlo invalida la caché.
  • Una revisión mensual de la mezcla de modelos, las tasas de aprobación, los cambios de precio y las fechas de retiro, con un responsable que pueda decir que no.

Compras: notas para Colombia y Europa

La moneda, la residencia y las condiciones de salida pesan tanto como la tarifa.

Moneda. Las tarifas están en dólares, así que un presupuesto en pesos o en euros suma riesgo cambiario al riesgo de uso. Presupuesta en USD con un margen, revisa cada mes y pide a tu asesor tributario que confirme cómo se gravan los servicios digitales del exterior en tu caso; aquí no modelamos impuestos.

Residencia. Mantener la inferencia en una región cuesta más: +10 % en el procesamiento regional de OpenAI y en los endpoints regionales de Bedrock o Vertex, 1,1x en la inferencia solo en EE. UU. de Anthropic. Comprar Claude por AWS, Google Cloud o Microsoft permite usar compromisos de nube ya existentes.

Retiros y salida. Anthropic publica fechas mínimas de disponibilidad (Opus 5.5 no antes del 22 de septiembre de 2027; Haiku 4.5 solo hasta el 15 de octubre de 2026 como mínimo). Negocia plazos de aviso para retiros y cambios de precio, apoyo de migración y condiciones de retención de datos, y mantén un respaldo probado de un segundo proveedor. Te acompañamos en consultoría de IA.

Lo esencial

  • El precio por token es solo la base: la caché, el razonamiento cobrado como salida, los lotes y los recargos por contexto largo o residencia cambian la factura.
  • 2026 partió el mercado: apareció un nivel premium de USD 10 / 50 mientras bajaba el segmento medio, y el precio por capacidad sigue cayendo.
  • Mide el costo por tarea resuelta: en ARC-AGI-2, Opus 5.5 en esfuerzo max cuesta 7,7 veces lo de low y puntúa por debajo de high.
  • Aplica primero caché y lotes; esfuerzo, routing, modelos pequeños y destilación cambian calidad por costo y exigen una eval de antes y después.
  • Lo local le gana a la API solo con volumen alto y estable o por cumplimiento; el tiempo de operación suele ser la línea más grande.

Fuentes

  1. Pricing · Anthropic documentation, 2026-09
  2. Effort · Anthropic documentation, 2026-09
  3. Models overview · Anthropic documentation, 2026-09
  4. API pricing · OpenAI, 2026-09
  5. Introducing GPT-6 Sol and GPT-6 Luna · OpenAI, 2026-09-22
  6. Gemini API pricing · Google, 2026-09
  7. ARC-AGI leaderboard · ARC Prize, 2026-09-26
  8. LLM inference prices have fallen rapidly but unequally across tasks · Epoch AI, 2025-03-12
  9. RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing · LMSYS, 2024-07-01
  10. Code execution with MCP · Anthropic, 2025-11-04
  11. A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services · Pan et al., arXiv, 2025-08-30
  12. GeForce RTX 5090 · NVIDIA, 2025-01-06

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Por qué la salida cuesta más que la entrada?

Los proveedores cobran más por generar que por leer: en los modelos actuales la salida cuesta entre cinco y seis veces la entrada (Claude Opus 5.5 a USD 4 / 20, GPT-6 Sol a 2 / 10, Gemini 3.5 Flash a 1,50 / 9). OpenAI y Google cobran los tokens de razonamiento como salida, así que el esfuerzo pesa en la factura.

¿Cuánto ahorra la caché de prompts?

La lectura de caché cuesta el 10 % del precio de entrada en Anthropic, en la familia GPT-5 de OpenAI y en Gemini 3.5 Flash, y el 5 % en Claude Opus 5.5. La escritura cuesta más (1,25x o 2x en Anthropic), así que conviene cuando el mismo prefijo se reutiliza mientras la caché sigue viva.

¿Vale la pena la API de lotes?

Para todo lo que no necesita respuesta inmediata, sí: Anthropic, OpenAI y Google cobran un 50 % menos por los trabajos en lotes, y en Anthropic ese descuento se acumula con el de la caché.

¿Cuándo le gana la inferencia local a la API?

Con volumen alto y estable frente a API caras, o cuando el cumplimiento lo exige. En nuestro ejemplo ilustrativo, un computador con una RTX 5090 iguala a GPT-6 Sol hacia 55.600 peticiones al mes, pero nunca al mismo modelo abierto servido por API.

¿Cómo presupuestar IA en dólares desde Colombia?

Presupuesta en USD con un margen para la tasa de cambio, fija cuotas y alertas por ruta, revisa cada mes teniendo en cuenta los cambios de precio anunciados y pide a tu asesor tributario que confirme el tratamiento de los servicios digitales del exterior.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban