Modelos open-weight en 2026: casi en la frontera, no siempre tan abiertos
Los mejores modelos de pesos abiertos están a pocos meses de los cerrados y algunos corren en un solo computador. La letra pequeña está en otra parte: licencias que cambian entre versiones, flujos de datos que dependen de dónde los alojes y archivos de modelo que hay que tratar como software.
A 26 de septiembre de 2026, los modelos de pesos abiertos más fuertes vienen de laboratorios chinos (MiMo-V2.6-Pro de Xiaomi, GLM-5.3 de Z.ai, Kimi K3 de Moonshot) y marcan entre 44 y 46 puntos en el índice de Artificial Analysis, frente a 58 del mejor modelo cerrado; Epoch AI estima el retraso en unos cuatro meses.
La trampa está en la licencia: varios modelos insignia pasaron de MIT o Apache 2.0 a términos propios con umbrales de ingresos, atribución obligatoria o límites para vender el modelo como servicio. Nuestra regla: arma la lista corta con tu propia evaluación, lee la licencia de la versión exacta, decide por dónde circulan los datos y trata los archivos del modelo como software.
Pesos abiertos no es lo mismo que código abierto
Un modelo tiene tres partes: los pesos (los parámetros entrenados que descargas), el código para entrenarlo y ejecutarlo, y los datos con los que aprendió. "Open-weight" solo promete lo primero, bajo una licencia que puede ser permisiva o no. Los grandes lanzamientos de 2026, de DeepSeek, Qwen, Kimi o GLM, publican pesos y un informe técnico, no sus datos de entrenamiento.
Pocos proyectos lo publican todo: Olmo 3 y 3.1 de Ai2 (pesos, código, checkpoints y datasets bajo Apache 2.0) y Apertus v1.5 de la Swiss AI Initiative, que respeta la exclusión voluntaria de los titulares de datos y trae documentación para el AI Act.
Por qué importa: sin los datos no puedes auditar lo que aprendió el modelo, y el Comité Europeo de Protección de Datos advirtió en diciembre de 2024 que datos de entrenamiento tratados ilícitamente pueden afectar la licitud de un despliegue. La respuesta realista es documentar la procedencia y probar las salidas.
Las familias principales en septiembre de 2026
Tamaño, contexto y licencia, según la ficha de cada fabricante.
| Modelo (laboratorio, lanzamiento) | Totales / activos | Contexto | Licencia |
|---|---|---|---|
| Kimi K3 (Moonshot AI, julio de 2026) | 2,8T / 104B | 1M | Propia (Kimi K3 License) |
| Qwen3.8-2.4T-A95B (Alibaba, agosto de 2026) | 2,4T / 95B | 262K, hasta ~1M | Propia (Qwen3.8-Max License) |
| Qwen3.8-27B (Alibaba, agosto de 2026) | 27B, denso | 262K, hasta ~1M | Apache 2.0 |
| MiMo-V2.6-Pro (Xiaomi, septiembre de 2026) | 1,02T / 42B | 1M | MIT |
| DeepSeek V4-Pro (abril de 2026, actualizado en agosto) | 1,6T / 49B | 1M | MIT |
| DeepSeek V4.1-Flash (10 de septiembre de 2026) | 552B / 8B a 16B | 1M | MIT |
| GLM-5.3 (Z.ai, agosto de 2026) | 744B / 40B | 1M | Propia (GLM-5.3 License) |
| GLM-5.3-Flash (Z.ai, agosto de 2026) | 320B / 18B | 300K | MIT |
| MiniMax-M3 (junio de 2026) | ~428B / ~23B | 1M | Propia (MiniMax Community License) |
| Gemma 4 31B y 26B A4B (Google, abril de 2026) | 30,7B denso; 25,2B / 3,8B | 256K | Apache 2.0 |
| Muse Glimmer 30B (Meta, agosto de 2026) | ~30B, denso | 131K o más | Apache 2.0 |
| gpt-oss-120b y 20b (OpenAI, agosto de 2025) | 117B / 5,1B; 21B / 3,6B | 128K | Apache 2.0 |
| Mistral Small 4 (marzo de 2026) | 119B / ~6B | 256K | Apache 2.0 |
| Mistral Large 3 y Ministral 3 (diciembre de 2025) | 675B / 41B; densos de 3B a 14B | 256K (Ministral 14B) | Apache 2.0 |
Los modelos insignia llegan a entre 1 y 2,8 billones de parámetros y apuntan a servidores grandes: Moonshot recomienda 64 aceleradores o más para K3. El punto medio eficiente es MoE con pocos parámetros activos (DeepSeek V4.1-Flash, GLM-5.3-Flash, Mistral Small 4, gpt-oss-120b). Y una clase densa de 27B a 31B corre en una sola GPU de 32 GB una vez cuantizada, como muestra nuestra guía de hardware para IA local.
Fortalezas por uso: código, razonamiento, idiomas, visión
- Código y agentes. GLM-5.3 es el mejor modelo abierto de la tabla oficial de Terminal-Bench 4.0 (41,8 %, quinto en total). En Terminal-Bench 2.1, con cifras de los fabricantes, lideran DeepSeek V4.1-Flash (90,6), MiMo-V2.6-Pro (89,9) y Kimi K3 (88,3); Qwen3.8-27B reporta 61,7 en SWE-bench Pro.
- Razonamiento. Los fabricantes reportan hasta 93,5 en GPQA Diamond (Kimi K3), pero esa prueba está saturada (los mejores cerrados rondan el 94 a 96 %) y ya no separa a los modelos.
- Español y francés. La generación Qwen3.5 cubría 201 idiomas; Gemma 4 soporta más de 35 de fábrica; Mistral Large 3 declara más de 40 idiomas nativos, y Command A+ de Cohere (Apache 2.0) incluye ambos entre 48. También merecen una prueba opciones regionales como Latam-GPT, ALIA-40b (España) o Luciole (Francia).
- Visión y audio. Qwen3.8-27B, Gemma 4, Kimi K3, MiniMax-M3, GLM-5.3-Flash y DeepSeek V4.1-Flash aceptan imágenes; MiMo-V2.6 también recibe audio y video.
Los benchmarks de los fabricantes usan arneses y niveles de esfuerzo distintos. Sirven para armar una lista corta de tres modelos, nunca para elegir al ganador: eso sale de tus propios prompts en español, francés e inglés (ver cómo elegimos un modelo).
La distancia real con la frontera
Clasificaciones independientes, consultadas el 25 y 26 de septiembre de 2026.
| Clasificación | Mejor cerrado | Mejor abierto | Distancia |
|---|---|---|---|
| Índice de inteligencia de Artificial Analysis v4.3.2 | Claude Opus 5.5 (max): 58 | MiMo-V2.6-Pro: 46; GLM-5.3: 45; Kimi K3: 44 | 12 puntos |
| Arena, texto | Claude Opus 5.5 (high): 1.509 | Kimi K3 (max): 1.488; MiMo-V2.6-Pro: 1.480 | 21 a 29 puntos |
| Terminal-Bench 4.0, tabla oficial | GPT-6 Astra (max): 58,2 % | GLM-5.3 (max): 41,8 % | 16,4 puntos |
| ARC-AGI-2 | GPT-6 Astra (Max): 95,0 %, USD 1,12 por tarea | DeepSeek V4 Flash 0731 (Max): 61,4 %, USD 0,042 por tarea | 34 puntos, a 1/27 del costo |
Epoch AI midió un retraso medio de unos cuatro meses para los mejores modelos abiertos desde enero de 2026. La brecha es pequeña en preferencia de chat (Arena) y más amplia en tareas agénticas largas (Terminal-Bench), justo donde los modelos de frontera justifican su precio. Entre los pequeños, Qwen3.8-27B marca 34 en el índice de Artificial Analysis, muy por encima de Gemma 4 31B (19) y Muse Glimmer (17).
La deriva de las licencias y cómo revisar una
En 2025 la mayoría de los grandes modelos abiertos salían con MIT o Apache 2.0. En 2026 varios modelos insignia pasaron a licencias propias, mientras sus hermanos pequeños a menudo siguieron siendo permisivos (Qwen3.8-27B es Apache 2.0; GLM-5.3-Flash, MIT): uso libre para la mayoría, con condiciones que se activan a gran escala o en ciertos modelos de negocio.
- Kimi K3 (K2 era MIT modificada): mostrar el nombre por encima de 100 millones de usuarios mensuales o USD 20 millones de ingresos mensuales, y un acuerdo para negocios de modelo como servicio con más de USD 20 millones en 12 meses.
- Qwen3.8 insignia: la misma regla de visibilidad y una licencia aparte para negocios de modelo como servicio o de asistentes de trabajo con más de USD 50 millones de ingresos de grupo. Qwen3.8-Flash-Next la exige a esos negocios sin importar su tamaño.
- GLM-5.3 (GLM-5.2 era MIT): revisión de seguridad de Z.ai para operadores de modelo como servicio con ingresos de grupo de más de USD 10.000 millones.
- MiniMax-M3: atribución "Built with MiniMax M3", aviso o autorización previa según un umbral de USD 20 millones de ingresos anuales, y usos prohibidos como el militar; M2.7 era no comercial.
- Hy3-preview (Tencent) excluía la Unión Europea, el Reino Unido y Corea del Sur; el Hy3 definitivo es Apache 2.0.
- Lee el archivo LICENSE de la versión exacta, no los metadatos: la ficha de MiniMax-M2.5 decía "modified-mit" y su archivo añadía usos prohibidos y la ley de Singapur.
- Revisa el uso comercial y los umbrales de usuarios o ingresos, incluidos los del grupo.
- Revisa las cláusulas de modelo como servicio y de asistente de trabajo si revendes acceso o construyes un asistente.
- Anota atribución, territorio, usos prohibidos y ley aplicable.
- Guarda licencia, versión y hash del archivo en tu inventario de IA (AI BOM) y revisa en cada actualización.
Una licencia que sirve para una herramienta interna puede no servir para un producto. Si vendes acceso al modelo, directamente o dentro de un SaaS, pide a tu abogado que la lea primero.
Dónde correrlos y por dónde viajan tus datos
Los pesos abiertos te dan tres opciones de alojamiento, cada una con un flujo de datos distinto. Alojarlo tú mantiene prompts y respuestas dentro de tu perímetro: un modelo chino en tu servidor no envía nada a China, porque los pesos son solo archivos. Los proveedores de inferencia corren los mismos pesos con su propio contrato y jurisdicción. La API del laboratorio envía tus datos al laboratorio.
El segmento medio se volvió barato. El 26 de septiembre de 2026, gpt-oss-120b costaba USD 0,15 / 0,60 por millón de tokens de entrada y salida en Groq, Together o Fireworks; DeepSeek V4.1-Flash, USD 0,30 / 1,20 en la API de DeepSeek en horas pico y en Fireworks; Qwen3.8-27B, USD 0,80 / 4,00 en Groq. En Europa, la plataforma de Mistral también ofrece GLM-5.3 y GLM-5.2 de Z.ai: un modelo de origen chino bajo contrato con un proveedor francés; revisa la región de alojamiento.
La prueba legal es a dónde van los datos personales. En Colombia, la Ley 1581 permite transferir a los países de la lista de protección adecuada de la SIC, que incluye a Estados Unidos pero no a China; para otros destinos necesitas una excepción, como la autorización expresa del titular. En la Unión Europea, las transferencias fuera del Espacio Económico Europeo caen bajo el capítulo V del RGPD.
Riesgos: procedencia, ajuste de seguridad y archivos de modelo
Procedencia y geopolítica. Menlo Ventures estimó en diciembre de 2025 que los modelos abiertos chinos representaban cerca del 1 % del uso de APIs de LLM en las empresas estadounidenses. La ley de defensa de EE. UU. para el año fiscal 2026 exige retirar DeepSeek de los sistemas del Departamento de Defensa, y Zhipu (Z.ai) está en la Entity List de EE. UU. desde enero de 2025. Si vendes a gobiernos o sectores regulados, pregunta por el origen del modelo aunque lo alojes tú.
El ajuste de seguridad es delgado. Hay investigaciones que muestran que los rechazos de un modelo abierto se pueden borrar editando los pesos, y que el cambio funciona en varios idiomas; el Financial Times informó que las salvaguardas de Gemma 4 se eliminaron 90 minutos después de su lanzamiento. Añade un modelo de protección (Llama Guard 4 o gpt-oss-safeguard) y pruébalo en español y francés: ver guardrails en producción.
Los archivos de modelo son software. Los checkpoints en pickle pueden ejecutar código al cargarse, JFrog encontró en 2024 unos 100 modelos maliciosos en Hugging Face, y se pueden esconder instrucciones en la plantilla de chat de un GGUF. Prefiere safetensors de organizaciones oficiales, fija los hashes y mantén los servidores privados: SentinelLABS y Censys contaron 175.108 servidores Ollama expuestos. Más en seguridad de la cadena de suministro de IA.
El lado positivo: cuando los modelos comerciales rechazaron peticiones forenses durante una intrusión en julio de 2026, Hugging Face analizó los registros del atacante con el modelo abierto GLM-5.2 en sus propios servidores.
Cómo decidir, en Colombia y en Europa
- Nombra la restricción que manda: calidad, costo por tarea, latencia, residencia de datos u operación sin conexión.
- Arma una lista corta de tres modelos compatibles con tu licencia y tu hardware.
- Evalúalos con al menos 30 prompts reales en tus idiomas, frente a un modelo cerrado.
- Datos personales o confidenciales: modelo alojado por ti; el resto, con un proveedor bajo contrato.
- Registra licencia, versión y hashes, y añade un modelo de protección.
- Planea actualizaciones: modelos y licencias cambian cada pocos meses.
Colombia y América Latina. Los pesos abiertos son la vía más barata hacia la residencia de datos, y la circular de la SIC de 2024 sobre IA exige una evaluación de impacto en privacidad para los usos de alto riesgo. El camino práctico: un modelo abierto alojado por ti para los flujos sensibles y una API cerrada para las tareas más difíciles.
Unión Europea. El AI Act se aplica de forma general desde el 2 de agosto de 2026. Según las directrices de la Comisión, ajustar un modelo abierto solo te convierte en proveedor de un modelo de propósito general si usas más de un tercio del cómputo de entrenamiento original.
Nuestra recomendación: prueba Qwen3.8-27B o Gemma 4 31B alojados por ti para el trabajo interno y DeepSeek V4.1-Flash con un proveedor bajo contrato para el volumen, y guarda un modelo cerrado de frontera donde se note la brecha. Si un cliente excluye modelos de origen chino, Gemma 4, Muse Glimmer, gpt-oss y Mistral son las alternativas Apache 2.0.
Lo esencial
- Los mejores modelos abiertos marcan entre 44 y 46 en el índice de Artificial Analysis frente a 58 del mejor cerrado; Epoch AI estima el retraso en unos cuatro meses.
- Open-weight significa pesos, no datos: los modelos totalmente abiertos, como Olmo y Apertus, son la excepción.
- Las licencias están cambiando: Kimi K3, el Qwen3.8 insignia, GLM-5.3 y MiniMax-M3 añaden umbrales, atribución o límites al modelo como servicio.
- Alojar tú un modelo chino no envía datos a China; llamar a la API de un laboratorio es otro flujo de datos.
- Trata los archivos de modelo como software y las salvaguardas como tarea tuya, probadas en español y francés.
Fuentes
- Open weights models: Intelligence Index v4.3.2
- Text leaderboard
- Terminal-Bench leaderboard
- Gap between open-weight and closed models (Epoch Capabilities Index)
- Kimi K3 License
- Qwen3.8-2.4T-A95B model card
- GLM-5.3 License
- MiniMax Community License (MiniMax-M3)
- DeepSeek-V4.1-Flash release
- Gemma 4 model card
- Models overview
- LLM03:2025 Supply Chain
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Cuál es el mejor modelo open-weight en septiembre de 2026?
En el índice de inteligencia de Artificial Analysis v4.3.2 lideran MiMo-V2.6-Pro de Xiaomi (46), GLM-5.3 de Z.ai (45) y Kimi K3 de Moonshot (44). Para una sola GPU, Qwen3.8-27B (34, Apache 2.0) es el modelo pequeño más fuerte del mismo índice.
¿Open-weight es lo mismo que código abierto?
No. Los modelos open-weight publican sus parámetros entrenados bajo una licencia; los datos de entrenamiento, y a menudo el código, siguen siendo privados. Los modelos totalmente abiertos, como Olmo de Ai2 o Apertus, publican también datos y código.
¿Puedo usar Qwen, DeepSeek o Kimi con fines comerciales?
DeepSeek V4 y V4.1 (MIT) y Qwen3.8-27B (Apache 2.0) lo permiten con pocas condiciones. Kimi K3 y el Qwen3.8 insignia lo permiten, pero añaden obligaciones de mostrar el nombre y límites para negocios de modelo como servicio por encima de ciertos ingresos. Lee cada licencia.
¿Es seguro correr un modelo chino en mis servidores?
Los pesos por sí solos no envían datos a ninguna parte. Los riesgos están en los archivos (usa safetensors de fuentes oficiales), en la exposición del servidor de inferencia, en las salvaguardas débiles del modelo y en las políticas de tus clientes sobre el origen del modelo.
¿Qué modelos abiertos manejan bien el español y el francés?
Qwen3.5, Gemma 4, los modelos de Mistral y Command A+ de Cohere declaran soporte explícito para ambos. Lo que dice el fabricante no basta: prueba tus propios prompts, también después de cuantizar.
Más análisis para seguir
IA local en 2026: qué hardware comprar y qué corre en cada uno
RTX 5090, RTX PRO 6000, DGX Spark, Ryzen AI Max+ y Mac Studio M5: cálculo de memoria, qué modelo cabe dónde, comprar o alquilar y opciones por tamaño de equipo.
IA local y open sourceDel portátil al servidor: Ollama, llama.cpp, vLLM y SGLang
Qué motor para una persona, un equipo o producción, las técnicas que multiplican el rendimiento, cómo asegurarlo y medirlo, y cuándo sale más barata una API.
IA local y open sourceModelos sin censura: qué son y qué riesgos tienen
Qué significa quitarle las salvaguardas a un modelo, por qué existe ese ecosistema, qué se pierde, qué prohíbe la ley en 2026 y qué usar en su lugar.
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.