Modelos pequeños en el dispositivo: dónde bastan y dónde la nube sigue ganando
Apple, Google y Microsoft ya incluyen modelos de lenguaje pequeños en sus sistemas operativos, y los modelos abiertos de 1.000 a 4.000 millones de parámetros caben en pocos gigabytes. Para muchas funciones de una app bastan; para otras nunca bastarán. Así se distingue, función por función.
Los modelos de lenguaje pequeños (de 1.000 a 4.000 millones de parámetros en un celular) ya vienen dentro de las plataformas: el framework Foundation Models de Apple en iOS 27, Gemini Nano en Android y Chrome, Phi Silica en Windows. Resuelven bien clasificación, extracción, enrutamiento, reescritura y resúmenes cortos; fallan en razonamiento profundo, conocimiento amplio y tareas agénticas largas.
Nuestra regla: lleva al dispositivo las tareas acotadas, deja un respaldo en la nube y mide cuántas veces escalas. Se gana en privacidad, uso sin conexión y latencia más que en costo; se paga en batería, memoria y fragmentación.
Qué hacen bien los modelos pequeños y dónde se quedan cortos
Por modelo de lenguaje pequeño (SLM, por su sigla en inglés) entendemos hasta unos 10.000 millones de parámetros; en un celular, de 1.000 a 4.000 millones (el modelo local de Apple tiene 3.000 millones). Un modelo así cabe en pocos gigabytes, no necesita red y rinde bien en:
- Clasificación y enrutamiento: intención, sentimiento, idioma, qué modelo atiende una petición.
- Extracción a un formato fijo: campos de una factura, un correo o un formulario.
- Reescritura, resúmenes cortos y autocompletado: una notificación, una reseña, una respuesta sugerida.
- Asistentes sin conexión: Mu, modelo de Microsoft de 330 millones de parámetros, opera la Configuración de Windows en lenguaje natural.
Los límites aparecen rápido. En el índice de inteligencia de Artificial Analysis (26 de septiembre de 2026), los mejores modelos abiertos de hasta 4B marcan entre 6 y 16 puntos, frente a unos 58 del líder de frontera. Los modelos pequeños recuerdan poco, inventan respuestas a preguntas abiertas y planifican mal, así que los agentes de varios pasos se rompen.
Qué hay disponible en septiembre de 2026
Integrado en la plataforma
Sin modelo que distribuir ni factura por token; a cambio, no eliges el modelo, su versión ni los equipos que lo reciben.
| Plataforma | Modelo | Equipos | Acceso y límites |
|---|---|---|---|
| Apple (iOS 27, macOS 27) | AFM 3 Core, 3B, acepta imágenes | iPhone 15 Pro o posterior; iPad y Mac con M1 o posterior | Framework Foundation Models; 8.192 tokens de contexto (ejemplo de la WWDC26) |
| Android | Gemini Nano, tres versiones según el celular | Pixel 9 a 11, Galaxy S25 a S26 y otros celulares recientes | ML Kit GenAI en beta; solo la app en primer plano, con cuota |
| Chrome (escritorio) | Gemini Nano | 22 GB libres; GPU de más de 4 GB o 16 GB de RAM | Prompt API desde Chrome 148 (mayo de 2026), con español y francés; no en celulares |
| Windows y Edge | Phi Silica, reemplazado por Aion Instruct en noviembre de 2026; Phi-4-mini en Edge | Copilot+ PC | Windows AI APIs, acceso limitado |
Modelos abiertos que empaquetas tú
Eliges la versión y puedes ajustarla; lo pagas en descarga, memoria, actualizaciones y licencias.
| Modelo | Tamaño | Licencia | Contexto y notas |
|---|---|---|---|
| Gemma 4 E2B / E4B (Google) | 2,3B / 4,5B efectivos | Apache 2.0 | 128K; texto, imagen, audio |
| Qwen3.5 0.8B / 4B (Alibaba) | 0,8B / 4B | Apache 2.0 | 262K; 201 idiomas y dialectos |
| Phi-4-mini-instruct (Microsoft) | 3,8B | MIT | 128K; 23 idiomas |
| Ministral 3 (Mistral AI) | 3B, 8B, 14B | Apache 2.0 | 256K en el de 14B |
| SmolLM3 (Hugging Face) | 3B | Apache 2.0 | 128K; datos y receta abiertos |
| Granite 4.0 Nano, 4.2 3B (IBM) | 350M a 3B | Apache 2.0 | 32K a 128K; 12 idiomas |
| LFM2.5-1.2B (Liquid AI) | 1,2B | LFM Open License | 32K; 8 idiomas |
| Tiny Aya (Cohere) | 3,35B | CC BY-NC (no comercial) | 8K; más de 70 idiomas |
Los ocho cubren español y francés, al menos en el papel. Ojo con las licencias: Tiny Aya no permite uso comercial y la licencia de LFM2 de Liquid solo autoriza el uso comercial gratuito por debajo de 10 millones de USD de ingresos. Para ejecutarlos: LiteRT-LM (Google), Core AI y MLX (Apple) o Foundry Local (Microsoft, unos 20 MB por app).
Hardware: NPU, memoria y navegador
| Chip | Cifra publicada |
|---|---|
| Copilot+ PC (mínimo) | NPU de 40+ TOPS |
| Snapdragon X2 Elite | 80 a 85 TOPS |
| AMD Ryzen AI 400 / Intel Core Ultra 200V | Hasta 60 / 48 TOPS |
| Apple M5 | 153 GB/s; un Neural Accelerator en cada núcleo de GPU |
| Snapdragon 8 Elite Gen 5 (celulares) | NPU un 37 % más rápida que la anterior |
Los TOPS venden portátiles; la memoria y el ancho de banda deciden qué corre. Google calcula 2,9 GB para Gemma 4 E2B en INT4 (11,4 GB en BF16), y Apple reserva su modelo local más grande (AFM 3 Core Advanced, 20B disperso, de 1 a 4B activos) para sus iPhone más nuevos y para Mac e iPad recientes con al menos 12 GB. En las pruebas de Apple con MLX, la generación fue entre un 19 y un 27 % más rápida en M5 que en M4, en línea con un 28 % más de ancho de banda. Mira nuestra guía de cuantización.
En el navegador, Chrome comparte una descarga de Gemini Nano entre sitios, solo en escritorio; con LiteRT.js de Google corres tu propio modelo en CPU (WebAssembly), GPU (WebGPU) o, en modo experimental, NPU (WebNN), con una descarga por usuario. Más en hardware para IA local en 2026.
A favor: privacidad y latencia. En contra: batería, memoria y fragmentación
El argumento más fuerte es legal. Si los datos nunca salen del equipo, no hay un proveedor de IA que contratar como encargado (artículo 28 del RGPD) ni una transferencia internacional que justificar (capítulo V del RGPD, artículo 26 de la Ley 1581 en Colombia). Sigues respondiendo por lo que procesas, pero el cumplimiento se simplifica. En Android, según Google, AICore no tiene acceso directo a internet ni guarda registro de entradas o salidas.
Luego, latencia y uso sin conexión: Microsoft reporta más de 100 tokens por segundo para Mu en NPU de Copilot+ PC; Liquid AI, 70 para LFM2.5-1.2B en la CPU de un Galaxy S25 Ultra, con 719 MB. En contra:
- Batería: Google midió un 0,75 % de la batería de un Pixel 9 Pro para 25 conversaciones con Gemma 3 270M en INT4; en una GPU de escritorio, un modelo de 7B gastó hasta 4,4 veces más energía por token que uno de 1B.
- Almacenamiento y contexto: Chrome exige 22 GB libres para Gemini Nano y lo borra si quedan menos de 10 GB; el modelo de Apple admite unos pocos miles de tokens por sesión.
- Actualizaciones y cobertura: Windows cambia Phi Silica por Aion Instruct en noviembre de 2026, la Prompt API de ML Kit es una beta sin SLA y Android solo atiende a la app en primer plano.
Diseña para el equipo que no tiene el modelo: cada función de IA necesita un respaldo desde el primer día (la nube, un modelo empaquetado o un camino sin IA).
Especializar un modelo pequeño: LoRA y destilación
Ajustado para una sola tarea, un generalista mediocre puede volverse suficiente. LoRA entrena pequeñas matrices adaptadoras sobre pesos congelados; la destilación pone a un modelo grande a producir los ejemplos de los que aprende uno pequeño. Las herramientas existen: mlx-lm admite LoRA en un Mac, y Apple ofrece desde 2025 un kit para entrenar adaptadores LoRA para su modelo local. DeepSeek entrenó Qwen3-8B con trazas de razonamiento de R1-0528 y afirma que iguala a Qwen3-235B en modo de razonamiento en AIME 2024.
- Elige una tarea acotada con una métrica de acierto o fallo (etiqueta correcta, campo correcto, JSON válido).
- Arma un conjunto de prueba con casos reales anonimizados y mide primero el modelo base; a veces basta un buen prompt.
- Genera los datos de entrenamiento con un modelo grande cuyas condiciones lo permitan, y haz que personas revisen una muestra.
- Entrena sobre la versión exacta del modelo base que distribuirás, cuantiza y vuelve a probar en equipos reales: en un estudio, los pesos en 4 bits conservaron el 93,5 % de la precisión en razonamiento con 1,5B y el 99,5 % con 32B.
- Lanza con respaldo en la nube y vuelve a entrenar cuando cambie el modelo base. Si lo que falta es conocimiento, mira fine-tuning o RAG.
Dispositivo, servidor o API de frontera
Se decide por función, no por app.
| Criterio | SLM en el dispositivo | SLM en tu servidor | API de frontera |
|---|---|---|---|
| Tareas | Clasificar, extraer, reescribir, resúmenes cortos | Lo mismo con volumen, más contexto, RAG sencillo | Razonamiento, conocimiento amplio, agentes largos |
| Datos personales | Se quedan en el equipo | Se quedan en tu infraestructura | Van al proveedor |
| Sin conexión | Sí | No | No |
| Costo marginal | Cero por token | Horas de GPU | El más alto por token |
El patrón híbrido: primero local, respaldo en la nube
- Comprueba en tiempo de ejecución que el modelo local está presente y admite el idioma del usuario.
- Enruta por tarea: lo acotado se queda en el equipo; las preguntas abiertas, los documentos largos y los agentes van a la nube.
- Restringe la salida local con generación estructurada (la generación guiada de Apple, los esquemas JSON de la Prompt API de Chrome) y valídala.
- Escala cuando la validación falla o la entrada supera el contexto local, si el usuario permite que los datos salgan del equipo.
Apple ya lo trae de fábrica: desde iOS 27, una misma API de sesión llega al modelo del dispositivo, a Private Cloud Compute (32.000 tokens; sin costo de API para desarrolladores con menos de 2 millones de primeras descargas) o, con el nuevo protocolo LanguageModel, a otros modelos; según Apple, Anthropic y Google publicarán paquetes Swift para Claude y Gemini.
Regla práctica: registra la tasa de escalamiento, sin contenido, por equipo y versión del sistema. Si se dispara tras una actualización, cambió el modelo de la plataforma: vuelve a correr tu evaluación.
Cuánto cuesta: un método con supuestos explícitos
Tomemos una función que clasifica y resume mensajes cortos: 1 millón de tareas al mes, con 500 tokens de entrada y 100 de salida cada una (supuestos ilustrativos, no mediciones).
| Opción | Por millón de tokens (entrada / salida) | Al mes |
|---|---|---|
| API de frontera: Claude Opus 5.5 | USD 4 / 20 | USD 4.000 |
| API comercial pequeña: Claude Haiku 4.5 | USD 1 / 5 | USD 1.000 |
| Modelo abierto por API: gpt-oss-20b | USD 0,018 / 0,09 | USD 18 |
| En el dispositivo | USD 0 | USD 0 |
Frente a un modelo abierto servido por API, el ahorro es despreciable; frente a uno de frontera es real, pero rara vez decisivo. Los costos que deciden son la ingeniería y las pruebas por plataforma, el tráfico de respaldo y las descargas (2,9 GB por usuario para Gemma 4 E2B en INT4, en cada actualización). La misma lógica fija el punto de equilibrio: con USD 18 al mes, una GPU de USD 2.000 tardaría más de nueve años en pagarse. Más en el costo real de la IA.
Qué significa en Colombia, América Latina y Europa
Colombia y América Latina: diseña para el parque real de equipos. Los modelos integrados solo llegan a celulares recientes (Pixel 9, Galaxy S25, iPhone 15 Pro y posteriores); la gama media y los equipos más viejos necesitan otro camino. En apps móviles que se usan sin cobertura en ventas en campo, logística o agro, un modelo de 1B empaquetado (cerca de 1 GB en 4 bits) puede extraer datos sin conexión. Evita descargas pesadas por datos móviles: el propio Chrome espera una red sin cobro por consumo.
Colombia: menos preguntas sobre los datos. La SIC aplica la Ley 1581 a la IA (Circular Externa 002 de 2024). Estados Unidos figura en su lista de países adecuados, así que una API estadounidense no está prohibida, pero debes demostrar responsabilidad; en el dispositivo, esa pregunta desaparece.
Europa: minimización por diseño. Nada llega a tus servidores salvo que tú lo decidas, y un adaptador LoRA no te convierte en proveedor de un modelo de IA de uso general según el AI Act: las directrices de la Comisión ponen ese umbral en más de un tercio del cómputo de entrenamiento original.
Empieza por una función acotada con una métrica clara, como extraer campos o clasificar mensajes de soporte. Constrúyela primero en local con respaldo en la nube, y mide calidad, escalamientos y batería en los equipos reales de tus usuarios.
Lo esencial
- Los modelos pequeños (de 1 a 4B en un celular) bastan para tareas acotadas: clasificar, extraer, enrutar, reescribir y resumir textos cortos.
- No bastan para razonamiento profundo, conocimiento amplio ni agentes largos: los modelos abiertos de hasta 4B marcan de 6 a 16 en el índice de Artificial Analysis; la frontera, unos 58.
- Los modelos integrados de Apple, Google y Microsoft no tienen factura por token, pero solo llegan a equipos recientes y cambian con cada actualización del sistema.
- El dispositivo gana en privacidad, uso sin conexión y latencia más que en costo: la misma tarea con un modelo abierto por API puede costar USD 18 al mes.
- Construye primero en local con respaldo en la nube, especializa con LoRA o destilación y sigue los escalamientos por equipo y versión del sistema.
Fuentes
- Introducing the third generation of Apple Foundation Models
- WWDC26 session 241: Foundation Models framework
- Siri AI: a profoundly more capable and personal assistant is here
- Gemini Nano on Android (AICore)
- ML Kit GenAI APIs
- The Prompt API
- Gemma 4 model card
- Phi Silica in the Windows AI APIs
- Introducing Gemma 3 270M
- Exploring LLMs with MLX and the neural accelerators in the M5 GPU
- Tiny open-weights models: Intelligence Index
- Circular Externa 002 de 2024: datos personales en sistemas de inteligencia artificial
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Qué se considera un modelo de lenguaje pequeño?
Hasta unos 10.000 millones de parámetros. En celulares, el rango práctico va de 1.000 a 4.000 millones; el modelo local de Apple tiene 3.000 millones.
¿Un modelo pequeño puede reemplazar a uno de frontera en mi app?
En tareas acotadas y bien definidas, muchas veces sí. En preguntas abiertas, documentos largos o agentes de varios pasos, no: mantén un modelo de frontera como respaldo.
¿Qué equipos pueden usar los modelos locales de Apple y Google?
Apple Intelligence requiere un iPhone 15 Pro o posterior, o un iPad o Mac con M1 o posterior. Las API de ML Kit GenAI de Google listan celulares recientes como los Pixel 9 a 11 y los Galaxy S25 a S26. Revisa las listas vigentes antes de comprometer una función.
¿La IA en el dispositivo hace que mi app cumpla el RGPD o la Ley 1581?
Saca de la ecuación al proveedor de IA y la transferencia internacional, lo que simplifica el cumplimiento. Sigues siendo responsable de lo que procesas, guardas y sincronizas, y de informar a los usuarios.
¿Puedo correr un modelo de lenguaje en el navegador?
Sí. Chrome de escritorio expone Gemini Nano con API integradas (la Prompt API desde Chrome 148), y entornos como LiteRT.js ejecutan tu propio modelo sobre WebAssembly o WebGPU. Chrome para Android e iOS todavía no admite las API integradas.
Más análisis para seguir
IA local en 2026: qué hardware comprar y qué corre en cada uno
RTX 5090, RTX PRO 6000, DGX Spark, Ryzen AI Max+ y Mac Studio M5: cálculo de memoria, qué modelo cabe dónde, comprar o alquilar y opciones por tamaño de equipo.
IA local y open sourceCuantización sin mitos: GGUF, AWQ, FP8 y FP4
Qué cuestan de verdad 4, 5 u 8 bits en calidad, memoria y velocidad, qué formato corre dónde (GGUF, AWQ, EXL3, FP8, NVFP4) y cómo validar un cuantizado.
IA local y open sourceModelos open-weight en 2026: cuál usar y con qué licencia
Kimi K3, Qwen3.8, DeepSeek V4.1, GLM-5.3, Gemma 4, gpt-oss, Mistral: tamaños, licencias, distancia a la frontera y cómo alojarlos sin sorpresas legales.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.