Hardware para IA local en 2026: primero memoria, después ancho de banda
Lo que puedes correr en local depende menos de la marca que de dos números: cuánta memoria tiene el modelo y a qué velocidad se puede leer. Aquí tienes especificaciones y precios verificados, la fórmula de memoria con un ejemplo resuelto y nuestras recomendaciones por tamaño de equipo.
La capacidad de memoria fija qué modelo cabe y el ancho de banda, qué tan rápido responde: la generación para un usuario se acerca como máximo al ancho de banda dividido por los bytes leídos por token. Los modelos de mezcla de expertos (MoE) solo leen sus parámetros activos: un DGX Spark de 128 GB corre gpt-oss-120b a unos 61 tokens por segundo, pero un modelo denso de 70B a 2,7.
Nuestras opciones: una RTX 5090 de 32 GB (USD 1.999 en su lanzamiento) para un desarrollador, tarjetas RTX PRO 6000 de 96 GB para un equipo y GPU alquiladas antes de comprar para producción. Comprar solo compensa con volumen alto y estable o con reglas estrictas de residencia.
Por qué manda la memoria: capacidad y luego ancho de banda
La capacidad decide si un modelo cabe: sus pesos más la memoria de trabajo de la conversación. El ancho de banda decide qué tan rápido responde, porque cada token generado obliga a leer otra vez los pesos; NVIDIA señala que en esta fase de decodificación domina la transferencia de memoria, no el cómputo.
Regla práctica: la velocidad para un usuario llega como máximo a cerca del ancho de banda dividido por los bytes leídos por token, y los sistemas reales solo alcanzan una parte (Databricks mide esa fracción como utilización del ancho de banda). Con el mismo modelo de 7B en 4 bits, un M5 Pro (307 GB/s) genera unos 66 tokens por segundo y un M5 Max (614 GB/s), unos 120, según las pruebas de la comunidad. Leer el prompt (prefill) depende más del cómputo que del ancho de banda.
Los modelos de mezcla de expertos solo leen sus parámetros activos. En el mismo DGX Spark (273 GB/s), LMSYS midió un Llama 3.1 70B denso en FP8 a 2,7 tokens por segundo; las pruebas de llama.cpp muestran gpt-oss-120b, con 5.100 millones de parámetros activos, a unos 61. Los equipos con mucha memoria y ancho de banda moderado sirven para MoE, no para modelos densos grandes.
La fórmula de memoria, con un ejemplo resuelto
La memoria necesaria es, a grandes rasgos, los pesos más la caché KV (la memoria por token de la conversación) más un margen:
pesos (GB) ≈ parámetros (miles de millones) × bits por peso ÷ 8
caché KV por token (bytes) = 2 × capas × cabezas KV × dimensión de cabeza × bytes por valor
total ≈ pesos + caché KV por token × tokens de contexto + un margen de 20 %
Bits por peso: 16 en BF16, unos 8,5 en Q8_0 y unos 4,8 en Q4_K_M (según los archivos de Granite 4.2 de IBM). El margen es una heurística de EleutherAI y la caché KV sale del config.json del modelo.
| Concepto | Contexto de 131K tokens | Contexto de 262K tokens |
|---|---|---|
| Pesos en Q4_K_M | 16,5 GB | 16,5 GB |
| Caché KV en 16 bits (64 KiB por token) | 8,6 GB | 17,2 GB |
| Total antes del margen | 25,1 GB | 33,7 GB |
| ¿Cabe en 32 GB? | Sí, con holgura | No: caché KV en 8 bits (8,6 GB) o una tarjeta más grande |
Solo 16 de las 64 capas del modelo usan atención completa, de ahí los 64 KiB por token; el anterior Qwen3-32B necesita 256 KiB, es decir, 32 GiB con 131K tokens, más que toda la tarjeta. Según Ollama, una caché KV de 8 bits reduce esa memoria a la mitad con una pérdida de precisión muy pequeña.
Quédate en 4 bits o más para producción: un estudio de Cohere encontró que las métricas automáticas ocultaban casi toda la pérdida en francés (-0,3 % en benchmarks, -16,6 % en evaluación humana, para un modelo de 103B en 4 bits). Más en nuestra guía de cuantización.
Escalones de hardware en septiembre de 2026
Especificaciones de los fabricantes y precios de lanzamiento en EE. UU.
| Equipo | Memoria | Ancho de banda | Precio de lanzamiento (USD) |
|---|---|---|---|
| GeForce RTX 5060 Ti 16 GB | 16 GB | 448 GB/s | 429 |
| GeForce RTX 5070 Ti | 16 GB | 896 GB/s | 749 |
| GeForce RTX 5090 | 32 GB | 1.792 GB/s | 1.999 |
| RTX PRO 6000 Blackwell (Workstation o Max-Q) | 96 GB, ECC | 1.792 GB/s | No publicado |
| DGX Spark (GB10) y versiones OEM | 128 GB unificada | 273 GB/s | Según fabricante |
| PC con Ryzen AI Max+ | Hasta 128 GB unificada | No figura en el anuncio de AMD | Según fabricante |
| Mac Studio M5 Max | 36 a 128 GB unificada | 460 o 614 GB/s | Desde 2.499 |
| Mac Studio M5 Ultra | 96 a 512 GB unificada | 1.200 GB/s | Desde 5.499 |
La RTX 5090 y la RTX PRO 6000 comparten 1.792 GB/s y generan a velocidad parecida con modelos que caben en ambas (unos 205 y 215 tokens por segundo con gpt-oss-20b, según LMSYS); la PRO suma el triple de memoria, con ECC, y la RTX PRO 5000 (48 o 72 GB, 1.344 GB/s) queda en medio. DGX Spark, los PC con Ryzen AI Max+ y los Mac cambian ancho de banda por capacidad; solo el M5 Ultra se acerca a una GPU dedicada.
Estado del mercado: el Mac Studio M5 salió el 22 de septiembre de 2026, el nuevo M6 arranca en el Mac mini con hasta 32 GB y la RTX 5090 Laptop trae 24 GB. Por encima del escritorio, Microsoft anunció para el cuarto trimestre de 2026 un DGX Station (GB300) con Windows que, según dice, corre modelos de hasta un billón de parámetros. En centros de datos: H100 (80 GB), H200 (141 GB), B200 y B300 de NVIDIA, e Instinct MI300X (192 GB) y MI355X (288 GB) de AMD.
Qué corre en cada escalón
Tamaños de archivo publicados; suma la caché KV y un margen.
| Escalón | Ejemplos que caben | Qué esperar |
|---|---|---|
| GPU de 16 GB | gpt-oss-20b (12,1 GB), Gemma 4 12B QAT (7,0 GB) | Modelos pequeños rápidos |
| GPU de 32 GB (RTX 5090) | Qwen3.8-27B Q4_K_M (16,5 GB), Gemma 4 31B QAT (17,7 GB), Muse Glimmer Q4_K_M (16,8 GB) | Ideal para un usuario |
| GPU de 96 GB (RTX PRO 6000) | gpt-oss-120b (63,4 GB), Mistral Small 4 en unos 4 bits (71,8 a 73,8 GB), Qwen3.5-122B-A10B Q4_K_M (76,5 GB) | Plena velocidad; sirve a un equipo |
| 128 GB unificada (DGX Spark, Ryzen AI Max+, M5 Max) | Además, Nemotron 3 Super NVFP4 (84,3 GB) y Step-3.5-Flash en 4 bits (111,5 GB, justo) | MoE a velocidad moderada; un denso de 70B se arrastra |
| 256 a 512 GB unificada (M5 Ultra) | Qwen3.5-397B-A17B Q4_K_M (294,1 GB), Kimi K2.5 en 2 bits (375 GB) | Poca concurrencia; por debajo de 4 bits, prueba el uso de herramientas |
| Servidor de 8 GPU (clase H100, H200, B200) | Familia GLM-5 (8 GPU según Z.ai), Mistral Large 3 (un nodo de 8 H100) | Clase frontera; Kimi K3 pide 64 aceleradores o más |
Caber no es ir rápido: en los equipos de 128 GB, prefiere modelos con pocos parámetros activos. Y las cifras de los fabricantes son techos: NVIDIA y AMD hablan de hasta 200.000 millones de parámetros para DGX Spark y Ryzen AI Max+, que en 4 bits ya son unos 100 GB de pesos.
Comprar, alquilar o pagar por token: un método de TCO
Compara el costo mensual del mismo trabajo, a igual calidad: hardware repartido en su vida útil, energía y horas de mantenimiento, frente a la factura de la API por los mismos tokens. Ejemplo ilustrativo: las cifras de hardware, energía y mano de obra son supuestos nuestros; los precios de API son de lista al 26 de septiembre de 2026.
| Concepto | USD al mes |
|---|---|
| Estación con RTX 5090, USD 3.500 en 36 meses (tarjeta de USD 1.999 más USD 1.500 supuestos) | 97 |
| Energía: 0,7 kW, 176 horas, USD 0,15 por kWh | 18 |
| Operación: 4 horas a USD 40 | 160 |
| Total local | 275 |
| Qwen3.8-27B en Groq (USD 0,80 / 4,00) | 128 |
| gpt-oss-120b en Groq (USD 0,15 / 0,60) | 21 |
| Claude Opus 5.5 (USD 4 / 20) | 640 |
Con este volumen, el equipo local cuesta cerca del doble que el mismo modelo en Groq y solo le gana a una API de frontera si un modelo de 27B basta. El equilibrio frente a Groq llega cerca de 170 millones de tokens al mes con esta mezcla, si un motor con batching puede atender esa carga. La operación, no la GPU, es lo que pesa: sin ella, lo local cuesta USD 115.
Pan et al. calculan que un modelo pequeño en una RTX 5090 se paga frente a las APIs comerciales en unos tres meses, pero que lo on-premise compensa sobre todo por encima de 50 millones de tokens al mes o con reglas estrictas de residencia. Peng et al. (2026) encontraron que la caché de prompts dejó una API por debajo del costo de una GPU on-premise compartida, y el rendimiento por dólar de las GPU mejora cerca de 49 % al año (Epoch AI).
Consumo, ruido y disponibilidad
Consumo y ruido. La RTX 5090 consume hasta 575 W (NVIDIA recomienda una fuente de 1.000 W) y la RTX PRO 6000, 600 W, o 300 W en su versión Max-Q con la misma memoria y ancho de banda. DGX Spark funciona con 240 W en una caja de 15 cm de lado y 1,2 kg. No encontramos mediciones de ruido comparables; nuestra regla: una tarjeta de 575 a 600 W va en un cuarto ventilado o en un rack.
Disponibilidad y software. DGX Spark también se vende en versiones OEM de Acer, ASUS, Dell, GIGABYTE, HP, Lenovo y MSI. Revisa el soporte de formatos: NVFP4 requiere GPU Blackwell y MLX necesita macOS 26.2 o posterior para los aceleradores del M5.
Comprar desde Colombia y desde Europa
Colombia. Nuestros precios son de lanzamiento en EE. UU.; en Colombia, impuestos, transporte, margen del distribuidor y tasa de cambio mueven el costo final, así que no publicamos una cifra en pesos. Pide cotizaciones en USD y COP a por lo menos dos distribuidores, con garantía y tiempos de entrega; prefiere versiones OEM con factura y soporte locales, y revisa el circuito y la UPS antes de instalar una estación de 1.000 W.
Alquilar también es legal: la Ley 1581 permite transferir datos a los países de la lista de protección adecuada de la SIC, que incluye a Estados Unidos.
Europa. El hardware propio o un proveedor con calificación SecNumCloud, que la ANSSI diseñó frente a las leyes extraterritoriales, responde a la ley CLOUD de EE. UU., que alcanza los datos de proveedores estadounidenses estén donde estén. Para los modelos, mira modelos open-weight en 2026.
Nuestras recomendaciones por tamaño de equipo
Puntos de partida, para contrastar con tus propios modelos y volúmenes.
| Perfil | Hardware para empezar | Modelos | Software |
|---|---|---|---|
| Desarrollador individual | RTX 5090, o un equipo de 128 GB para MoE más grandes | Qwen3.8-27B, Gemma 4 31B o Muse Glimmer en 4 bits; gpt-oss-120b con 128 GB | llama.cpp, Ollama o LM Studio |
| Equipo de unas 20 personas | Servidor con una o dos RTX PRO 6000 (96 GB cada una) | gpt-oss-120b, Mistral Small 4 o Qwen3.5-122B-A10B en 4 bits | vLLM o SGLang con autenticación, y Open WebUI |
| Servicio en producción | Nodos de 8 GPU alquilados antes de comprar | GLM-5.3, MiMo-V2.6-Pro u otro MoE grande | vLLM o SGLang, con Dynamo o llm-d |
Para un equipo, la concurrencia importa más que la velocidad máxima: en la prueba de Red Hat con una A100, vLLM llegó a 793 tokens por segundo, mientras que Ollama con la configuración por defecto se estancó en 41. Para producción, alquila primero, mide la utilización real y compra solo si las GPU se mantienen ocupadas; el análisis patrocinado de Lenovo sitúa el umbral en unas cinco horas de uso al día frente a la nube bajo demanda. Más en cómo montar un servidor LLM local.
SentinelLABS y Censys contaron 175.108 servidores Ollama expuestos en internet, y la NVD registra decenas de vulnerabilidades de 2026 en vLLM, llama.cpp y Ollama. Pon autenticación, no expongas el puerto y aplica parches como en producción.
Lo esencial
- La capacidad decide qué modelo cabe; el ancho de banda, la velocidad de generación.
- Los MoE solo leen los parámetros activos: en un DGX Spark, gpt-oss-120b corre a unos 61 tokens por segundo y un denso de 70B a 2,7.
- Una RTX 5090 de 32 GB (USD 1.999 en su lanzamiento) corre Qwen3.8-27B en 4 bits con 131K de contexto; una RTX PRO 6000 de 96 GB sirve MoE de clase 120B a un equipo.
- Cuenta el tiempo de operación: en nuestro mes ilustrativo pesa más que el hardware, y las APIs baratas de modelos abiertos suelen ganar con poco volumen.
- Trata un servidor de IA local como infraestructura de producción: autenticación, nada expuesto a internet y parches regulares.
Fuentes
- GeForce RTX 5090
- Compare GeForce graphics cards
- RTX PRO 6000 Blackwell Workstation Edition
- DGX Spark
- Apple introduces new Mac Studio with M5 Max and M5 Ultra
- AMD at CES 2026: Ryzen, Ryzen AI and ROCm announcements
- NVIDIA DGX Spark review
- llama.cpp performance on DGX Spark (discussion #16578)
- LLM inference performance engineering: best practices
- A cost-benefit analysis of on-premise LLM deployment (Pan et al.)
- Ollama vs. vLLM: performance benchmarking
- Qwen3.8-27B model card
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Cuál es la mejor GPU para IA local en 2026?
Como tarjeta única, la RTX 5090 (32 GB, 1.792 GB/s, USD 1.999 en su lanzamiento) da la mejor velocidad por dólar según nuestras fuentes. Para modelos de más de unos 30B, mira una RTX PRO 6000 de 96 GB o un equipo de 128 GB de memoria unificada.
¿Un DGX Spark puede correr un modelo de 70B?
Cabe, pero LMSYS midió Llama 3.1 70B en FP8 a 2,7 tokens por segundo en ese equipo. Los MoE van mucho más rápido: unos 61 tokens por segundo para gpt-oss-120b en llama.cpp.
¿Cuánta VRAM necesita un modelo de 27B?
Unos 16,5 GB para los pesos de Qwen3.8-27B en Q4_K_M, más la caché KV: unos 8,6 GB más para 131K tokens de contexto en 16 bits. Una tarjeta de 24 GB sirve con contextos más cortos; 32 GB dejan margen.
¿Un Mac sirve para LLM locales?
Sí, para modelos grandes con poca concurrencia: el Mac Studio con M5 Ultra ofrece hasta 512 GB a 1,2 TB/s. Para muchos usuarios simultáneos escala mejor un servidor con GPU y vLLM.
¿La IA local sale más barata que una API?
Solo con volumen alto y estable, frente a APIs de frontera caras o con reglas estrictas de residencia. Las APIs baratas de modelos abiertos suelen ganar con poco volumen, y la caché de prompts puede inclinar la balanza. Haz las cuentas con tus propios volúmenes.
Más análisis para seguir
Cuantización sin mitos: GGUF, AWQ, FP8 y FP4
Qué cuestan de verdad 4, 5 u 8 bits en calidad, memoria y velocidad, qué formato corre dónde (GGUF, AWQ, EXL3, FP8, NVFP4) y cómo validar un cuantizado.
IA local y open sourceDel portátil al servidor: Ollama, llama.cpp, vLLM y SGLang
Qué motor para una persona, un equipo o producción, las técnicas que multiplican el rendimiento, cómo asegurarlo y medirlo, y cuándo sale más barata una API.
IA local y open sourceModelos open-weight en 2026: cuál usar y con qué licencia
Kimi K3, Qwen3.8, DeepSeek V4.1, GLM-5.3, Gemma 4, gpt-oss, Mistral: tamaños, licencias, distancia a la frontera y cómo alojarlos sin sorpresas legales.
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.