IA locale et open source · Septembre 2026

Petits modèles sur l'appareil : où ils suffisent, où le cloud garde l'avantage

Apple, Google et Microsoft livrent désormais de petits modèles de langage dans leurs systèmes d'exploitation, et les modèles ouverts de 1 à 4 milliards de paramètres tiennent en quelques gigaoctets. Pour beaucoup de fonctions d'une app, ils suffisent ; pour d'autres, jamais. Voici comment trancher, fonction par fonction.

3B paramètres du modèle local d'Apple2,9 Go Gemma 4 E2B en INT4Chrome 148 Prompt API stable sur le web
En bref

Les petits modèles de langage (1 à 4 milliards de paramètres sur un téléphone) sont désormais intégrés aux plateformes : le framework Foundation Models d'Apple dans iOS 27, Gemini Nano dans Android et Chrome, Phi Silica dans Windows. Ils excellent en classification, extraction, routage, reformulation et résumés courts ; ils échouent sur le raisonnement profond, les connaissances étendues et les longues tâches agentiques.

Notre règle : confier à l'appareil les tâches bornées, garder un repli dans le cloud et mesurer la fréquence des escalades. Le gain porte sur la confidentialité, le hors-ligne et la latence plus que sur le coût ; le prix à payer : batterie, mémoire et fragmentation.

Ce que les petits modèles font bien, et où ils échouent

Par petit modèle de langage (SLM), nous entendons jusqu'à environ 10 milliards de paramètres ; sur un téléphone, 1 à 4 milliards (le modèle local d'Apple en compte 3 milliards). Un tel modèle tient en quelques gigaoctets, se passe de réseau et se montre efficace pour :

  • Classification et routage : intention, sentiment, langue, choix du modèle qui traite une requête.
  • Extraction vers un format fixe : champs d'une facture, d'un e-mail ou d'un formulaire.
  • Reformulation, résumés courts et autocomplétion : une notification, un avis, une réponse suggérée.
  • Assistants hors ligne : Mu, modèle de Microsoft de 330 millions de paramètres, pilote les Paramètres de Windows en langage courant.

Les limites apparaissent vite. Sur l'indice d'intelligence d'Artificial Analysis (26 septembre 2026), les meilleurs modèles ouverts jusqu'à 4B obtiennent de 6 à 16 points, contre environ 58 pour le premier modèle de pointe. Les petits modèles retiennent peu, inventent des réponses aux questions ouvertes et planifient mal : les agents à plusieurs étapes cassent.

Ce qui est disponible en septembre 2026

Intégré à la plateforme

Ni modèle à distribuer ni facture au token ; en contrepartie, vous ne choisissez ni le modèle, ni sa version, ni les appareils qui le reçoivent.

Documentation de chaque éditeur, consultée le 26 septembre 2026.
PlateformeModèleAppareilsAccès et limites
Apple (iOS 27, macOS 27)AFM 3 Core, 3B, accepte les imagesiPhone 15 Pro ou ultérieur ; iPad et Mac avec M1 ou ultérieurFramework Foundation Models ; contexte de 8 192 tokens (exemple de la WWDC26)
AndroidGemini Nano, trois versions selon le téléphonePixel 9 à 11, Galaxy S25 à S26 et autres téléphones récentsML Kit GenAI en bêta ; app au premier plan uniquement, avec quota
Chrome (ordinateur)Gemini Nano22 Go libres ; GPU de plus de 4 Go ou 16 Go de RAMPrompt API depuis Chrome 148 (mai 2026), espagnol et français inclus ; pas sur mobile
Windows et EdgePhi Silica, remplacé par Aion Instruct en novembre 2026 ; Phi-4-mini dans EdgePC Copilot+Windows AI APIs, accès limité

Les modèles ouverts que vous embarquez

Vous choisissez la version et pouvez l'affiner ; vous payez en téléchargement, mémoire, mises à jour et licences.

Fiches de modèle, consultées le 26 septembre 2026.
ModèleTailleLicenceContexte et notes
Gemma 4 E2B / E4B (Google)2,3B / 4,5B effectifsApache 2.0128K ; texte, image, audio
Qwen3.5 0.8B / 4B (Alibaba)0,8B / 4BApache 2.0262K ; 201 langues et dialectes
Phi-4-mini-instruct (Microsoft)3,8BMIT128K ; 23 langues
Ministral 3 (Mistral AI)3B, 8B, 14BApache 2.0256K pour le 14B
SmolLM3 (Hugging Face)3BApache 2.0128K ; données et recette ouvertes
Granite 4.0 Nano, 4.2 3B (IBM)350M à 3BApache 2.032K à 128K ; 12 langues
LFM2.5-1.2B (Liquid AI)1,2BLFM Open License32K ; 8 langues
Tiny Aya (Cohere)3,35BCC BY-NC (non commerciale)8K ; plus de 70 langues

Les huit couvrent l'espagnol et le français, du moins sur le papier. Attention aux licences : Tiny Aya exclut l'usage commercial, et la licence LFM2 de Liquid ne permet l'usage commercial gratuit que sous 10 millions de dollars de chiffre d'affaires. Pour les exécuter : LiteRT-LM (Google), Core AI et MLX (Apple) ou Foundry Local (Microsoft, environ 20 Mo par application).

Matériel : NPU, mémoire et navigateur

Chiffres des fabricants (Intel : couverture presse).
PuceChiffre publié
PC Copilot+ (minimum)NPU de 40+ TOPS
Snapdragon X2 Elite80 à 85 TOPS
AMD Ryzen AI 400 / Intel Core Ultra 200VJusqu'à 60 / 48 TOPS
Apple M5153 Go/s ; un Neural Accelerator dans chaque cœur GPU
Snapdragon 8 Elite Gen 5 (téléphones)NPU 37 % plus rapide que la précédente

Les TOPS font vendre les portables ; la mémoire et la bande passante décident de ce qui tourne. Google estime Gemma 4 E2B à 2,9 Go en INT4 (11,4 Go en BF16), et Apple réserve son plus grand modèle local (AFM 3 Core Advanced, parcimonieux, 20B dont 1 à 4B actifs) à ses iPhone les plus récents et aux Mac et iPad récents dotés d'au moins 12 Go. Dans les tests MLX d'Apple, la génération était de 19 à 27 % plus rapide sur M5 que sur M4, en ligne avec 28 % de bande passante en plus. Voir notre guide de la quantification.

Dans le navigateur, Chrome partage un téléchargement de Gemini Nano entre les sites, sur ordinateur uniquement ; LiteRT.js de Google fait tourner votre propre modèle sur CPU (WebAssembly), GPU (WebGPU) ou, à titre expérimental, NPU (WebNN), au prix d'un téléchargement par utilisateur. Plus de détails dans le matériel pour l'IA locale en 2026.

Pour : confidentialité et latence. Contre : batterie, mémoire, fragmentation

L'argument le plus fort est juridique. Si les données ne quittent jamais l'appareil, il n'y a ni fournisseur d'IA à encadrer comme sous-traitant (article 28 du RGPD), ni transfert international à justifier (chapitre V du RGPD, article 26 de la loi colombienne 1581). Vous restez responsable de vos traitements, mais la conformité se simplifie. Sur Android, selon Google, AICore n'a pas d'accès direct à internet et ne conserve aucune trace des entrées ni des sorties.

Ensuite, latence et hors-ligne : Microsoft annonce plus de 100 tokens par seconde pour Mu sur NPU de PC Copilot+ ; Liquid AI, 70 pour LFM2.5-1.2B sur le CPU d'un Galaxy S25 Ultra, avec 719 Mo. En face :

  • Batterie : Google a mesuré 0,75 % de la batterie d'un Pixel 9 Pro pour 25 conversations avec Gemma 3 270M en INT4 ; sur un GPU de bureau, un modèle de 7B a consommé jusqu'à 4,4 fois plus d'énergie par token qu'un modèle de 1B.
  • Stockage et contexte : Chrome exige 22 Go libres pour Gemini Nano et le supprime sous 10 Go ; le modèle d'Apple accepte quelques milliers de tokens par session.
  • Mises à jour et couverture : Windows remplace Phi Silica par Aion Instruct en novembre 2026, la Prompt API de ML Kit est une bêta sans SLA et Android ne sert que l'app au premier plan.
Attention

Concevez pour l'appareil qui n'a pas le modèle : chaque fonction d'IA a besoin d'un repli dès le premier jour (le cloud, un modèle embarqué ou un parcours sans IA).

Spécialiser un petit modèle : LoRA et distillation

Affiné pour une seule tâche, un généraliste moyen peut devenir suffisant. LoRA entraîne de petites matrices d'adaptation au-dessus de poids figés ; la distillation fait produire par un grand modèle les exemples dont un petit apprend. Les outils existent : mlx-lm prend en charge LoRA sur Mac, et Apple propose depuis 2025 un outil pour entraîner des adaptateurs LoRA pour son modèle local. DeepSeek a entraîné Qwen3-8B sur des traces de raisonnement de R1-0528 et affirme qu'il égale Qwen3-235B en mode raisonnement sur AIME 2024.

  1. Choisissez une tâche bornée avec une métrique de réussite ou d'échec (bonne étiquette, bon champ, JSON valide).
  2. Constituez un jeu de test de cas réels anonymisés et mesurez d'abord le modèle de base ; un bon prompt suffit parfois.
  3. Générez les données d'entraînement avec un grand modèle dont les conditions le permettent, et faites relire un échantillon par des personnes.
  4. Entraînez sur la version exacte du modèle de base que vous livrez, quantifiez, puis retestez sur de vrais appareils : dans une étude, des poids en 4 bits conservaient 93,5 % de la précision en raisonnement à 1,5B, contre 99,5 % à 32B.
  5. Déployez derrière un repli cloud et réentraînez quand le modèle de base change. S'il manque des connaissances, voyez fine-tuning ou RAG.

Appareil, serveur ou API de pointe

On décide fonction par fonction, pas application par application.

Règle pratique du Slash AI Lab, septembre 2026.
CritèreSLM sur l'appareilSLM sur votre serveurAPI de pointe
TâchesClasser, extraire, reformuler, résumés courtsIdem en volume, plus de contexte, RAG simpleRaisonnement, connaissances étendues, agents longs
Données personnellesRestent sur l'appareilRestent dans votre infrastructurePartent chez le fournisseur
Hors ligneOuiNonNon
Coût marginalNul par tokenHeures de GPULe plus élevé par token

Le schéma hybride : local d'abord, repli dans le cloud

  1. Vérifiez à l'exécution que le modèle local est présent et gère la langue de l'utilisateur.
  2. Routez par tâche : le travail borné reste local ; les questions ouvertes, les longs documents et les agents partent vers le cloud.
  3. Contraignez la sortie locale par la génération structurée (la génération guidée d'Apple, les schémas JSON de la Prompt API de Chrome) et validez-la.
  4. Escaladez quand la validation échoue ou que l'entrée dépasse le contexte local, si l'utilisateur accepte que ses données quittent l'appareil.

Apple l'intègre désormais : depuis iOS 27, une même API de session atteint le modèle de l'appareil, Private Cloud Compute (32 000 tokens ; sans coût d'API pour les développeurs sous 2 millions de premiers téléchargements) ou, via le nouveau protocole LanguageModel, d'autres modèles ; selon Apple, Anthropic et Google publieront des paquets Swift pour Claude et Gemini.

Règle pratique : journalisez le taux d'escalade, sans contenu, par appareil et version du système. S'il bondit après une mise à jour, le modèle de la plateforme a changé : relancez votre évaluation.

Ce que cela coûte : une méthode aux hypothèses explicites

Prenons une fonction qui classe et résume des messages courts : 1 million de tâches par mois, 500 tokens en entrée et 100 en sortie chacune (hypothèses illustratives, pas des mesures).

Prix catalogue, septembre 2026 (gpt-oss-20b : OpenRouter). Hors ingénierie, tests et trafic de repli.
OptionPar million de tokens (entrée / sortie)Par mois
API de pointe : Claude Opus 5.54 $ / 20 $4 000 $
Petite API commerciale : Claude Haiku 4.51 $ / 5 $1 000 $
Modèle ouvert par API : gpt-oss-20b0,018 $ / 0,09 $18 $
Sur l'appareil0 $0 $

Face à un modèle ouvert servi par API, l'économie est négligeable ; face à un modèle de pointe, elle est réelle mais rarement décisive. Les coûts qui tranchent sont l'ingénierie et les tests par plateforme, le trafic de repli et les téléchargements (2,9 Go par utilisateur pour Gemma 4 E2B en INT4, à chaque mise à jour). La même logique fixe le seuil de rentabilité : à 18 $ par mois, un GPU à 2 000 $ mettrait plus de neuf ans à s'amortir. D'autres leviers dans le vrai coût de l'IA.

Ce que cela signifie en Colombie, en Amérique latine et en Europe

Colombie et Amérique latine : concevoir pour le parc réel. Les modèles intégrés n'atteignent que les téléphones récents (Pixel 9, Galaxy S25, iPhone 15 Pro et suivants) ; le milieu de gamme et les appareils plus anciens ont besoin d'un autre chemin. Pour les applications mobiles utilisées sans réseau en vente terrain, logistique ou agriculture, un modèle de 1B embarqué (environ 1 Go en 4 bits) peut extraire des données hors ligne. Évitez les gros téléchargements sur données mobiles : Chrome lui-même attend une connexion non facturée à l'usage.

Colombie : moins de questions sur les données. La SIC applique la loi 1581 à l'IA (Circular Externa 002 de 2024). Les États-Unis figurent sur sa liste de pays adéquats : une API américaine n'est donc pas interdite, mais vous devez démontrer votre responsabilité ; sur l'appareil, la question disparaît.

Europe : la minimisation par construction. Rien n'atteint vos serveurs sans décision de votre part, et un adaptateur LoRA ne fait pas de vous un fournisseur de modèle d'IA à usage général au sens de l'AI Act : les lignes directrices de la Commission placent ce seuil au-delà d'un tiers du calcul d'entraînement d'origine.

Notre recommandation

Commencez par une fonction bornée avec une métrique claire, comme extraire des champs ou classer des messages de support. Construisez-la en local d'abord avec un repli cloud, et mesurez qualité, escalades et batterie sur les appareils réels de vos utilisateurs.

L'essentiel

  • Les petits modèles (1 à 4B sur un téléphone) suffisent pour les tâches bornées : classer, extraire, router, reformuler et résumer des textes courts.
  • Ils ne suffisent pas pour le raisonnement profond, les connaissances étendues ou les agents longs : les modèles ouverts jusqu'à 4B obtiennent 6 à 16 sur l'indice d'Artificial Analysis ; la pointe, environ 58.
  • Les modèles intégrés d'Apple, Google et Microsoft n'ont pas de facture au token, mais n'atteignent que les appareils récents et changent à chaque mise à jour du système.
  • L'appareil l'emporte sur la confidentialité, le hors-ligne et la latence plus que sur le coût : la même tâche sur un modèle ouvert par API peut coûter 18 $ par mois.
  • Construisez en local d'abord avec un repli cloud, spécialisez avec LoRA ou la distillation, et suivez les escalades par appareil et version du système.

Sources

  1. Introducing the third generation of Apple Foundation Models · Apple Machine Learning Research, 2026-06-08
  2. WWDC26 session 241: Foundation Models framework · Apple Developer, 2026-06
  3. Siri AI: a profoundly more capable and personal assistant is here · Apple Newsroom, 2026-09-14
  4. Gemini Nano on Android (AICore) · Android Developers, 2026-09-08
  5. ML Kit GenAI APIs · Google for Developers, 2026-09
  6. The Prompt API · Chrome for Developers, 2026-08-26
  7. Gemma 4 model card · Google AI for Developers, 2026
  8. Phi Silica in the Windows AI APIs · Microsoft Learn, 2026-07-15
  9. Introducing Gemma 3 270M · Google Developers Blog, 2025-08-14
  10. Exploring LLMs with MLX and the neural accelerators in the M5 GPU · Apple Machine Learning Research, 2025-11-19
  11. Tiny open-weights models: Intelligence Index · Artificial Analysis, 2026-09-26
  12. Circular Externa 002 de 2024: datos personales en sistemas de inteligencia artificial · Superintendencia de Industria y Comercio (SIC), 2024-08-21

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Qu'appelle-t-on un petit modèle de langage ?

Un modèle jusqu'à environ 10 milliards de paramètres. Sur téléphone, la fourchette pratique va de 1 à 4 milliards ; le modèle local d'Apple en compte 3 milliards.

Un petit modèle peut-il remplacer un modèle de pointe dans mon app ?

Pour des tâches bornées et bien définies, souvent oui. Pour des questions ouvertes, de longs documents ou des agents à plusieurs étapes, non : gardez un modèle de pointe en repli.

Quels appareils font tourner les modèles locaux d'Apple et de Google ?

Apple Intelligence exige un iPhone 15 Pro ou ultérieur, ou un iPad ou un Mac avec M1 ou ultérieur. Les API ML Kit GenAI de Google listent des téléphones récents comme les Pixel 9 à 11 et les Galaxy S25 à S26. Vérifiez les listes à jour avant d'engager une fonction.

L'IA embarquée rend-elle mon app conforme au RGPD ou à la loi 1581 ?

Elle retire de l'équation le fournisseur d'IA et le transfert international, ce qui simplifie la conformité. Vous restez responsable de ce que vous traitez, stockez et synchronisez, et de l'information des utilisateurs.

Peut-on faire tourner un modèle de langage dans le navigateur ?

Oui. Chrome sur ordinateur expose Gemini Nano via des API intégrées (la Prompt API depuis Chrome 148), et des environnements comme LiteRT.js exécutent votre propre modèle via WebAssembly ou WebGPU. Chrome pour Android et iOS ne prend pas encore en charge les API intégrées.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban