IA local y open source · Septiembre 2026

Modelos pequeños en el dispositivo: dónde bastan y dónde la nube sigue ganando

Apple, Google y Microsoft ya incluyen modelos de lenguaje pequeños en sus sistemas operativos, y los modelos abiertos de 1.000 a 4.000 millones de parámetros caben en pocos gigabytes. Para muchas funciones de una app bastan; para otras nunca bastarán. Así se distingue, función por función.

3B parámetros del modelo local de Apple2,9 GB Gemma 4 E2B en INT4Chrome 148 Prompt API estable en la web
En resumen

Los modelos de lenguaje pequeños (de 1.000 a 4.000 millones de parámetros en un celular) ya vienen dentro de las plataformas: el framework Foundation Models de Apple en iOS 27, Gemini Nano en Android y Chrome, Phi Silica en Windows. Resuelven bien clasificación, extracción, enrutamiento, reescritura y resúmenes cortos; fallan en razonamiento profundo, conocimiento amplio y tareas agénticas largas.

Nuestra regla: lleva al dispositivo las tareas acotadas, deja un respaldo en la nube y mide cuántas veces escalas. Se gana en privacidad, uso sin conexión y latencia más que en costo; se paga en batería, memoria y fragmentación.

Qué hacen bien los modelos pequeños y dónde se quedan cortos

Por modelo de lenguaje pequeño (SLM, por su sigla en inglés) entendemos hasta unos 10.000 millones de parámetros; en un celular, de 1.000 a 4.000 millones (el modelo local de Apple tiene 3.000 millones). Un modelo así cabe en pocos gigabytes, no necesita red y rinde bien en:

  • Clasificación y enrutamiento: intención, sentimiento, idioma, qué modelo atiende una petición.
  • Extracción a un formato fijo: campos de una factura, un correo o un formulario.
  • Reescritura, resúmenes cortos y autocompletado: una notificación, una reseña, una respuesta sugerida.
  • Asistentes sin conexión: Mu, modelo de Microsoft de 330 millones de parámetros, opera la Configuración de Windows en lenguaje natural.

Los límites aparecen rápido. En el índice de inteligencia de Artificial Analysis (26 de septiembre de 2026), los mejores modelos abiertos de hasta 4B marcan entre 6 y 16 puntos, frente a unos 58 del líder de frontera. Los modelos pequeños recuerdan poco, inventan respuestas a preguntas abiertas y planifican mal, así que los agentes de varios pasos se rompen.

Qué hay disponible en septiembre de 2026

Integrado en la plataforma

Sin modelo que distribuir ni factura por token; a cambio, no eliges el modelo, su versión ni los equipos que lo reciben.

Documentación de cada fabricante, consultada el 26 de septiembre de 2026.
PlataformaModeloEquiposAcceso y límites
Apple (iOS 27, macOS 27)AFM 3 Core, 3B, acepta imágenesiPhone 15 Pro o posterior; iPad y Mac con M1 o posteriorFramework Foundation Models; 8.192 tokens de contexto (ejemplo de la WWDC26)
AndroidGemini Nano, tres versiones según el celularPixel 9 a 11, Galaxy S25 a S26 y otros celulares recientesML Kit GenAI en beta; solo la app en primer plano, con cuota
Chrome (escritorio)Gemini Nano22 GB libres; GPU de más de 4 GB o 16 GB de RAMPrompt API desde Chrome 148 (mayo de 2026), con español y francés; no en celulares
Windows y EdgePhi Silica, reemplazado por Aion Instruct en noviembre de 2026; Phi-4-mini en EdgeCopilot+ PCWindows AI APIs, acceso limitado

Modelos abiertos que empaquetas tú

Eliges la versión y puedes ajustarla; lo pagas en descarga, memoria, actualizaciones y licencias.

Fichas de modelo, consultadas el 26 de septiembre de 2026.
ModeloTamañoLicenciaContexto y notas
Gemma 4 E2B / E4B (Google)2,3B / 4,5B efectivosApache 2.0128K; texto, imagen, audio
Qwen3.5 0.8B / 4B (Alibaba)0,8B / 4BApache 2.0262K; 201 idiomas y dialectos
Phi-4-mini-instruct (Microsoft)3,8BMIT128K; 23 idiomas
Ministral 3 (Mistral AI)3B, 8B, 14BApache 2.0256K en el de 14B
SmolLM3 (Hugging Face)3BApache 2.0128K; datos y receta abiertos
Granite 4.0 Nano, 4.2 3B (IBM)350M a 3BApache 2.032K a 128K; 12 idiomas
LFM2.5-1.2B (Liquid AI)1,2BLFM Open License32K; 8 idiomas
Tiny Aya (Cohere)3,35BCC BY-NC (no comercial)8K; más de 70 idiomas

Los ocho cubren español y francés, al menos en el papel. Ojo con las licencias: Tiny Aya no permite uso comercial y la licencia de LFM2 de Liquid solo autoriza el uso comercial gratuito por debajo de 10 millones de USD de ingresos. Para ejecutarlos: LiteRT-LM (Google), Core AI y MLX (Apple) o Foundry Local (Microsoft, unos 20 MB por app).

Hardware: NPU, memoria y navegador

Cifras de cada fabricante (Intel: cobertura de prensa).
ChipCifra publicada
Copilot+ PC (mínimo)NPU de 40+ TOPS
Snapdragon X2 Elite80 a 85 TOPS
AMD Ryzen AI 400 / Intel Core Ultra 200VHasta 60 / 48 TOPS
Apple M5153 GB/s; un Neural Accelerator en cada núcleo de GPU
Snapdragon 8 Elite Gen 5 (celulares)NPU un 37 % más rápida que la anterior

Los TOPS venden portátiles; la memoria y el ancho de banda deciden qué corre. Google calcula 2,9 GB para Gemma 4 E2B en INT4 (11,4 GB en BF16), y Apple reserva su modelo local más grande (AFM 3 Core Advanced, 20B disperso, de 1 a 4B activos) para sus iPhone más nuevos y para Mac e iPad recientes con al menos 12 GB. En las pruebas de Apple con MLX, la generación fue entre un 19 y un 27 % más rápida en M5 que en M4, en línea con un 28 % más de ancho de banda. Mira nuestra guía de cuantización.

En el navegador, Chrome comparte una descarga de Gemini Nano entre sitios, solo en escritorio; con LiteRT.js de Google corres tu propio modelo en CPU (WebAssembly), GPU (WebGPU) o, en modo experimental, NPU (WebNN), con una descarga por usuario. Más en hardware para IA local en 2026.

A favor: privacidad y latencia. En contra: batería, memoria y fragmentación

El argumento más fuerte es legal. Si los datos nunca salen del equipo, no hay un proveedor de IA que contratar como encargado (artículo 28 del RGPD) ni una transferencia internacional que justificar (capítulo V del RGPD, artículo 26 de la Ley 1581 en Colombia). Sigues respondiendo por lo que procesas, pero el cumplimiento se simplifica. En Android, según Google, AICore no tiene acceso directo a internet ni guarda registro de entradas o salidas.

Luego, latencia y uso sin conexión: Microsoft reporta más de 100 tokens por segundo para Mu en NPU de Copilot+ PC; Liquid AI, 70 para LFM2.5-1.2B en la CPU de un Galaxy S25 Ultra, con 719 MB. En contra:

  • Batería: Google midió un 0,75 % de la batería de un Pixel 9 Pro para 25 conversaciones con Gemma 3 270M en INT4; en una GPU de escritorio, un modelo de 7B gastó hasta 4,4 veces más energía por token que uno de 1B.
  • Almacenamiento y contexto: Chrome exige 22 GB libres para Gemini Nano y lo borra si quedan menos de 10 GB; el modelo de Apple admite unos pocos miles de tokens por sesión.
  • Actualizaciones y cobertura: Windows cambia Phi Silica por Aion Instruct en noviembre de 2026, la Prompt API de ML Kit es una beta sin SLA y Android solo atiende a la app en primer plano.
Atención

Diseña para el equipo que no tiene el modelo: cada función de IA necesita un respaldo desde el primer día (la nube, un modelo empaquetado o un camino sin IA).

Especializar un modelo pequeño: LoRA y destilación

Ajustado para una sola tarea, un generalista mediocre puede volverse suficiente. LoRA entrena pequeñas matrices adaptadoras sobre pesos congelados; la destilación pone a un modelo grande a producir los ejemplos de los que aprende uno pequeño. Las herramientas existen: mlx-lm admite LoRA en un Mac, y Apple ofrece desde 2025 un kit para entrenar adaptadores LoRA para su modelo local. DeepSeek entrenó Qwen3-8B con trazas de razonamiento de R1-0528 y afirma que iguala a Qwen3-235B en modo de razonamiento en AIME 2024.

  1. Elige una tarea acotada con una métrica de acierto o fallo (etiqueta correcta, campo correcto, JSON válido).
  2. Arma un conjunto de prueba con casos reales anonimizados y mide primero el modelo base; a veces basta un buen prompt.
  3. Genera los datos de entrenamiento con un modelo grande cuyas condiciones lo permitan, y haz que personas revisen una muestra.
  4. Entrena sobre la versión exacta del modelo base que distribuirás, cuantiza y vuelve a probar en equipos reales: en un estudio, los pesos en 4 bits conservaron el 93,5 % de la precisión en razonamiento con 1,5B y el 99,5 % con 32B.
  5. Lanza con respaldo en la nube y vuelve a entrenar cuando cambie el modelo base. Si lo que falta es conocimiento, mira fine-tuning o RAG.

Dispositivo, servidor o API de frontera

Se decide por función, no por app.

Regla práctica de Slash AI Lab, septiembre de 2026.
CriterioSLM en el dispositivoSLM en tu servidorAPI de frontera
TareasClasificar, extraer, reescribir, resúmenes cortosLo mismo con volumen, más contexto, RAG sencilloRazonamiento, conocimiento amplio, agentes largos
Datos personalesSe quedan en el equipoSe quedan en tu infraestructuraVan al proveedor
Sin conexiónSíNoNo
Costo marginalCero por tokenHoras de GPUEl más alto por token

El patrón híbrido: primero local, respaldo en la nube

  1. Comprueba en tiempo de ejecución que el modelo local está presente y admite el idioma del usuario.
  2. Enruta por tarea: lo acotado se queda en el equipo; las preguntas abiertas, los documentos largos y los agentes van a la nube.
  3. Restringe la salida local con generación estructurada (la generación guiada de Apple, los esquemas JSON de la Prompt API de Chrome) y valídala.
  4. Escala cuando la validación falla o la entrada supera el contexto local, si el usuario permite que los datos salgan del equipo.

Apple ya lo trae de fábrica: desde iOS 27, una misma API de sesión llega al modelo del dispositivo, a Private Cloud Compute (32.000 tokens; sin costo de API para desarrolladores con menos de 2 millones de primeras descargas) o, con el nuevo protocolo LanguageModel, a otros modelos; según Apple, Anthropic y Google publicarán paquetes Swift para Claude y Gemini.

Regla práctica: registra la tasa de escalamiento, sin contenido, por equipo y versión del sistema. Si se dispara tras una actualización, cambió el modelo de la plataforma: vuelve a correr tu evaluación.

Cuánto cuesta: un método con supuestos explícitos

Tomemos una función que clasifica y resume mensajes cortos: 1 millón de tareas al mes, con 500 tokens de entrada y 100 de salida cada una (supuestos ilustrativos, no mediciones).

Precios de lista, septiembre de 2026 (gpt-oss-20b: OpenRouter). Sin ingeniería, pruebas ni tráfico de respaldo.
OpciónPor millón de tokens (entrada / salida)Al mes
API de frontera: Claude Opus 5.5USD 4 / 20USD 4.000
API comercial pequeña: Claude Haiku 4.5USD 1 / 5USD 1.000
Modelo abierto por API: gpt-oss-20bUSD 0,018 / 0,09USD 18
En el dispositivoUSD 0USD 0

Frente a un modelo abierto servido por API, el ahorro es despreciable; frente a uno de frontera es real, pero rara vez decisivo. Los costos que deciden son la ingeniería y las pruebas por plataforma, el tráfico de respaldo y las descargas (2,9 GB por usuario para Gemma 4 E2B en INT4, en cada actualización). La misma lógica fija el punto de equilibrio: con USD 18 al mes, una GPU de USD 2.000 tardaría más de nueve años en pagarse. Más en el costo real de la IA.

Qué significa en Colombia, América Latina y Europa

Colombia y América Latina: diseña para el parque real de equipos. Los modelos integrados solo llegan a celulares recientes (Pixel 9, Galaxy S25, iPhone 15 Pro y posteriores); la gama media y los equipos más viejos necesitan otro camino. En apps móviles que se usan sin cobertura en ventas en campo, logística o agro, un modelo de 1B empaquetado (cerca de 1 GB en 4 bits) puede extraer datos sin conexión. Evita descargas pesadas por datos móviles: el propio Chrome espera una red sin cobro por consumo.

Colombia: menos preguntas sobre los datos. La SIC aplica la Ley 1581 a la IA (Circular Externa 002 de 2024). Estados Unidos figura en su lista de países adecuados, así que una API estadounidense no está prohibida, pero debes demostrar responsabilidad; en el dispositivo, esa pregunta desaparece.

Europa: minimización por diseño. Nada llega a tus servidores salvo que tú lo decidas, y un adaptador LoRA no te convierte en proveedor de un modelo de IA de uso general según el AI Act: las directrices de la Comisión ponen ese umbral en más de un tercio del cómputo de entrenamiento original.

Nuestra recomendación

Empieza por una función acotada con una métrica clara, como extraer campos o clasificar mensajes de soporte. Constrúyela primero en local con respaldo en la nube, y mide calidad, escalamientos y batería en los equipos reales de tus usuarios.

Lo esencial

  • Los modelos pequeños (de 1 a 4B en un celular) bastan para tareas acotadas: clasificar, extraer, enrutar, reescribir y resumir textos cortos.
  • No bastan para razonamiento profundo, conocimiento amplio ni agentes largos: los modelos abiertos de hasta 4B marcan de 6 a 16 en el índice de Artificial Analysis; la frontera, unos 58.
  • Los modelos integrados de Apple, Google y Microsoft no tienen factura por token, pero solo llegan a equipos recientes y cambian con cada actualización del sistema.
  • El dispositivo gana en privacidad, uso sin conexión y latencia más que en costo: la misma tarea con un modelo abierto por API puede costar USD 18 al mes.
  • Construye primero en local con respaldo en la nube, especializa con LoRA o destilación y sigue los escalamientos por equipo y versión del sistema.

Fuentes

  1. Introducing the third generation of Apple Foundation Models · Apple Machine Learning Research, 2026-06-08
  2. WWDC26 session 241: Foundation Models framework · Apple Developer, 2026-06
  3. Siri AI: a profoundly more capable and personal assistant is here · Apple Newsroom, 2026-09-14
  4. Gemini Nano on Android (AICore) · Android Developers, 2026-09-08
  5. ML Kit GenAI APIs · Google for Developers, 2026-09
  6. The Prompt API · Chrome for Developers, 2026-08-26
  7. Gemma 4 model card · Google AI for Developers, 2026
  8. Phi Silica in the Windows AI APIs · Microsoft Learn, 2026-07-15
  9. Introducing Gemma 3 270M · Google Developers Blog, 2025-08-14
  10. Exploring LLMs with MLX and the neural accelerators in the M5 GPU · Apple Machine Learning Research, 2025-11-19
  11. Tiny open-weights models: Intelligence Index · Artificial Analysis, 2026-09-26
  12. Circular Externa 002 de 2024: datos personales en sistemas de inteligencia artificial · Superintendencia de Industria y Comercio (SIC), 2024-08-21

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Qué se considera un modelo de lenguaje pequeño?

Hasta unos 10.000 millones de parámetros. En celulares, el rango práctico va de 1.000 a 4.000 millones; el modelo local de Apple tiene 3.000 millones.

¿Un modelo pequeño puede reemplazar a uno de frontera en mi app?

En tareas acotadas y bien definidas, muchas veces sí. En preguntas abiertas, documentos largos o agentes de varios pasos, no: mantén un modelo de frontera como respaldo.

¿Qué equipos pueden usar los modelos locales de Apple y Google?

Apple Intelligence requiere un iPhone 15 Pro o posterior, o un iPad o Mac con M1 o posterior. Las API de ML Kit GenAI de Google listan celulares recientes como los Pixel 9 a 11 y los Galaxy S25 a S26. Revisa las listas vigentes antes de comprometer una función.

¿La IA en el dispositivo hace que mi app cumpla el RGPD o la Ley 1581?

Saca de la ecuación al proveedor de IA y la transferencia internacional, lo que simplifica el cumplimiento. Sigues siendo responsable de lo que procesas, guardas y sincronizas, y de informar a los usuarios.

¿Puedo correr un modelo de lenguaje en el navegador?

Sí. Chrome de escritorio expone Gemini Nano con API integradas (la Prompt API desde Chrome 148), y entornos como LiteRT.js ejecutan tu propio modelo sobre WebAssembly o WebGPU. Chrome para Android e iOS todavía no admite las API integradas.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban