Petits modèles sur l'appareil : où ils suffisent, où le cloud garde l'avantage
Apple, Google et Microsoft livrent désormais de petits modèles de langage dans leurs systèmes d'exploitation, et les modèles ouverts de 1 à 4 milliards de paramètres tiennent en quelques gigaoctets. Pour beaucoup de fonctions d'une app, ils suffisent ; pour d'autres, jamais. Voici comment trancher, fonction par fonction.
Les petits modèles de langage (1 à 4 milliards de paramètres sur un téléphone) sont désormais intégrés aux plateformes : le framework Foundation Models d'Apple dans iOS 27, Gemini Nano dans Android et Chrome, Phi Silica dans Windows. Ils excellent en classification, extraction, routage, reformulation et résumés courts ; ils échouent sur le raisonnement profond, les connaissances étendues et les longues tâches agentiques.
Notre règle : confier à l'appareil les tâches bornées, garder un repli dans le cloud et mesurer la fréquence des escalades. Le gain porte sur la confidentialité, le hors-ligne et la latence plus que sur le coût ; le prix à payer : batterie, mémoire et fragmentation.
Ce que les petits modèles font bien, et où ils échouent
Par petit modèle de langage (SLM), nous entendons jusqu'à environ 10 milliards de paramètres ; sur un téléphone, 1 à 4 milliards (le modèle local d'Apple en compte 3 milliards). Un tel modèle tient en quelques gigaoctets, se passe de réseau et se montre efficace pour :
- Classification et routage : intention, sentiment, langue, choix du modèle qui traite une requête.
- Extraction vers un format fixe : champs d'une facture, d'un e-mail ou d'un formulaire.
- Reformulation, résumés courts et autocomplétion : une notification, un avis, une réponse suggérée.
- Assistants hors ligne : Mu, modèle de Microsoft de 330 millions de paramètres, pilote les Paramètres de Windows en langage courant.
Les limites apparaissent vite. Sur l'indice d'intelligence d'Artificial Analysis (26 septembre 2026), les meilleurs modèles ouverts jusqu'à 4B obtiennent de 6 à 16 points, contre environ 58 pour le premier modèle de pointe. Les petits modèles retiennent peu, inventent des réponses aux questions ouvertes et planifient mal : les agents à plusieurs étapes cassent.
Ce qui est disponible en septembre 2026
Intégré à la plateforme
Ni modèle à distribuer ni facture au token ; en contrepartie, vous ne choisissez ni le modèle, ni sa version, ni les appareils qui le reçoivent.
| Plateforme | Modèle | Appareils | Accès et limites |
|---|---|---|---|
| Apple (iOS 27, macOS 27) | AFM 3 Core, 3B, accepte les images | iPhone 15 Pro ou ultérieur ; iPad et Mac avec M1 ou ultérieur | Framework Foundation Models ; contexte de 8 192 tokens (exemple de la WWDC26) |
| Android | Gemini Nano, trois versions selon le téléphone | Pixel 9 à 11, Galaxy S25 à S26 et autres téléphones récents | ML Kit GenAI en bêta ; app au premier plan uniquement, avec quota |
| Chrome (ordinateur) | Gemini Nano | 22 Go libres ; GPU de plus de 4 Go ou 16 Go de RAM | Prompt API depuis Chrome 148 (mai 2026), espagnol et français inclus ; pas sur mobile |
| Windows et Edge | Phi Silica, remplacé par Aion Instruct en novembre 2026 ; Phi-4-mini dans Edge | PC Copilot+ | Windows AI APIs, accès limité |
Les modèles ouverts que vous embarquez
Vous choisissez la version et pouvez l'affiner ; vous payez en téléchargement, mémoire, mises à jour et licences.
| Modèle | Taille | Licence | Contexte et notes |
|---|---|---|---|
| Gemma 4 E2B / E4B (Google) | 2,3B / 4,5B effectifs | Apache 2.0 | 128K ; texte, image, audio |
| Qwen3.5 0.8B / 4B (Alibaba) | 0,8B / 4B | Apache 2.0 | 262K ; 201 langues et dialectes |
| Phi-4-mini-instruct (Microsoft) | 3,8B | MIT | 128K ; 23 langues |
| Ministral 3 (Mistral AI) | 3B, 8B, 14B | Apache 2.0 | 256K pour le 14B |
| SmolLM3 (Hugging Face) | 3B | Apache 2.0 | 128K ; données et recette ouvertes |
| Granite 4.0 Nano, 4.2 3B (IBM) | 350M à 3B | Apache 2.0 | 32K à 128K ; 12 langues |
| LFM2.5-1.2B (Liquid AI) | 1,2B | LFM Open License | 32K ; 8 langues |
| Tiny Aya (Cohere) | 3,35B | CC BY-NC (non commerciale) | 8K ; plus de 70 langues |
Les huit couvrent l'espagnol et le français, du moins sur le papier. Attention aux licences : Tiny Aya exclut l'usage commercial, et la licence LFM2 de Liquid ne permet l'usage commercial gratuit que sous 10 millions de dollars de chiffre d'affaires. Pour les exécuter : LiteRT-LM (Google), Core AI et MLX (Apple) ou Foundry Local (Microsoft, environ 20 Mo par application).
Matériel : NPU, mémoire et navigateur
| Puce | Chiffre publié |
|---|---|
| PC Copilot+ (minimum) | NPU de 40+ TOPS |
| Snapdragon X2 Elite | 80 à 85 TOPS |
| AMD Ryzen AI 400 / Intel Core Ultra 200V | Jusqu'à 60 / 48 TOPS |
| Apple M5 | 153 Go/s ; un Neural Accelerator dans chaque cœur GPU |
| Snapdragon 8 Elite Gen 5 (téléphones) | NPU 37 % plus rapide que la précédente |
Les TOPS font vendre les portables ; la mémoire et la bande passante décident de ce qui tourne. Google estime Gemma 4 E2B à 2,9 Go en INT4 (11,4 Go en BF16), et Apple réserve son plus grand modèle local (AFM 3 Core Advanced, parcimonieux, 20B dont 1 à 4B actifs) à ses iPhone les plus récents et aux Mac et iPad récents dotés d'au moins 12 Go. Dans les tests MLX d'Apple, la génération était de 19 à 27 % plus rapide sur M5 que sur M4, en ligne avec 28 % de bande passante en plus. Voir notre guide de la quantification.
Dans le navigateur, Chrome partage un téléchargement de Gemini Nano entre les sites, sur ordinateur uniquement ; LiteRT.js de Google fait tourner votre propre modèle sur CPU (WebAssembly), GPU (WebGPU) ou, à titre expérimental, NPU (WebNN), au prix d'un téléchargement par utilisateur. Plus de détails dans le matériel pour l'IA locale en 2026.
Pour : confidentialité et latence. Contre : batterie, mémoire, fragmentation
L'argument le plus fort est juridique. Si les données ne quittent jamais l'appareil, il n'y a ni fournisseur d'IA à encadrer comme sous-traitant (article 28 du RGPD), ni transfert international à justifier (chapitre V du RGPD, article 26 de la loi colombienne 1581). Vous restez responsable de vos traitements, mais la conformité se simplifie. Sur Android, selon Google, AICore n'a pas d'accès direct à internet et ne conserve aucune trace des entrées ni des sorties.
Ensuite, latence et hors-ligne : Microsoft annonce plus de 100 tokens par seconde pour Mu sur NPU de PC Copilot+ ; Liquid AI, 70 pour LFM2.5-1.2B sur le CPU d'un Galaxy S25 Ultra, avec 719 Mo. En face :
- Batterie : Google a mesuré 0,75 % de la batterie d'un Pixel 9 Pro pour 25 conversations avec Gemma 3 270M en INT4 ; sur un GPU de bureau, un modèle de 7B a consommé jusqu'à 4,4 fois plus d'énergie par token qu'un modèle de 1B.
- Stockage et contexte : Chrome exige 22 Go libres pour Gemini Nano et le supprime sous 10 Go ; le modèle d'Apple accepte quelques milliers de tokens par session.
- Mises à jour et couverture : Windows remplace Phi Silica par Aion Instruct en novembre 2026, la Prompt API de ML Kit est une bêta sans SLA et Android ne sert que l'app au premier plan.
Concevez pour l'appareil qui n'a pas le modèle : chaque fonction d'IA a besoin d'un repli dès le premier jour (le cloud, un modèle embarqué ou un parcours sans IA).
Spécialiser un petit modèle : LoRA et distillation
Affiné pour une seule tâche, un généraliste moyen peut devenir suffisant. LoRA entraîne de petites matrices d'adaptation au-dessus de poids figés ; la distillation fait produire par un grand modèle les exemples dont un petit apprend. Les outils existent : mlx-lm prend en charge LoRA sur Mac, et Apple propose depuis 2025 un outil pour entraîner des adaptateurs LoRA pour son modèle local. DeepSeek a entraîné Qwen3-8B sur des traces de raisonnement de R1-0528 et affirme qu'il égale Qwen3-235B en mode raisonnement sur AIME 2024.
- Choisissez une tâche bornée avec une métrique de réussite ou d'échec (bonne étiquette, bon champ, JSON valide).
- Constituez un jeu de test de cas réels anonymisés et mesurez d'abord le modèle de base ; un bon prompt suffit parfois.
- Générez les données d'entraînement avec un grand modèle dont les conditions le permettent, et faites relire un échantillon par des personnes.
- Entraînez sur la version exacte du modèle de base que vous livrez, quantifiez, puis retestez sur de vrais appareils : dans une étude, des poids en 4 bits conservaient 93,5 % de la précision en raisonnement à 1,5B, contre 99,5 % à 32B.
- Déployez derrière un repli cloud et réentraînez quand le modèle de base change. S'il manque des connaissances, voyez fine-tuning ou RAG.
Appareil, serveur ou API de pointe
On décide fonction par fonction, pas application par application.
| Critère | SLM sur l'appareil | SLM sur votre serveur | API de pointe |
|---|---|---|---|
| Tâches | Classer, extraire, reformuler, résumés courts | Idem en volume, plus de contexte, RAG simple | Raisonnement, connaissances étendues, agents longs |
| Données personnelles | Restent sur l'appareil | Restent dans votre infrastructure | Partent chez le fournisseur |
| Hors ligne | Oui | Non | Non |
| Coût marginal | Nul par token | Heures de GPU | Le plus élevé par token |
Le schéma hybride : local d'abord, repli dans le cloud
- Vérifiez à l'exécution que le modèle local est présent et gère la langue de l'utilisateur.
- Routez par tâche : le travail borné reste local ; les questions ouvertes, les longs documents et les agents partent vers le cloud.
- Contraignez la sortie locale par la génération structurée (la génération guidée d'Apple, les schémas JSON de la Prompt API de Chrome) et validez-la.
- Escaladez quand la validation échoue ou que l'entrée dépasse le contexte local, si l'utilisateur accepte que ses données quittent l'appareil.
Apple l'intègre désormais : depuis iOS 27, une même API de session atteint le modèle de l'appareil, Private Cloud Compute (32 000 tokens ; sans coût d'API pour les développeurs sous 2 millions de premiers téléchargements) ou, via le nouveau protocole LanguageModel, d'autres modèles ; selon Apple, Anthropic et Google publieront des paquets Swift pour Claude et Gemini.
Règle pratique : journalisez le taux d'escalade, sans contenu, par appareil et version du système. S'il bondit après une mise à jour, le modèle de la plateforme a changé : relancez votre évaluation.
Ce que cela coûte : une méthode aux hypothèses explicites
Prenons une fonction qui classe et résume des messages courts : 1 million de tâches par mois, 500 tokens en entrée et 100 en sortie chacune (hypothèses illustratives, pas des mesures).
| Option | Par million de tokens (entrée / sortie) | Par mois |
|---|---|---|
| API de pointe : Claude Opus 5.5 | 4 $ / 20 $ | 4 000 $ |
| Petite API commerciale : Claude Haiku 4.5 | 1 $ / 5 $ | 1 000 $ |
| Modèle ouvert par API : gpt-oss-20b | 0,018 $ / 0,09 $ | 18 $ |
| Sur l'appareil | 0 $ | 0 $ |
Face à un modèle ouvert servi par API, l'économie est négligeable ; face à un modèle de pointe, elle est réelle mais rarement décisive. Les coûts qui tranchent sont l'ingénierie et les tests par plateforme, le trafic de repli et les téléchargements (2,9 Go par utilisateur pour Gemma 4 E2B en INT4, à chaque mise à jour). La même logique fixe le seuil de rentabilité : à 18 $ par mois, un GPU à 2 000 $ mettrait plus de neuf ans à s'amortir. D'autres leviers dans le vrai coût de l'IA.
Ce que cela signifie en Colombie, en Amérique latine et en Europe
Colombie et Amérique latine : concevoir pour le parc réel. Les modèles intégrés n'atteignent que les téléphones récents (Pixel 9, Galaxy S25, iPhone 15 Pro et suivants) ; le milieu de gamme et les appareils plus anciens ont besoin d'un autre chemin. Pour les applications mobiles utilisées sans réseau en vente terrain, logistique ou agriculture, un modèle de 1B embarqué (environ 1 Go en 4 bits) peut extraire des données hors ligne. Évitez les gros téléchargements sur données mobiles : Chrome lui-même attend une connexion non facturée à l'usage.
Colombie : moins de questions sur les données. La SIC applique la loi 1581 à l'IA (Circular Externa 002 de 2024). Les États-Unis figurent sur sa liste de pays adéquats : une API américaine n'est donc pas interdite, mais vous devez démontrer votre responsabilité ; sur l'appareil, la question disparaît.
Europe : la minimisation par construction. Rien n'atteint vos serveurs sans décision de votre part, et un adaptateur LoRA ne fait pas de vous un fournisseur de modèle d'IA à usage général au sens de l'AI Act : les lignes directrices de la Commission placent ce seuil au-delà d'un tiers du calcul d'entraînement d'origine.
Commencez par une fonction bornée avec une métrique claire, comme extraire des champs ou classer des messages de support. Construisez-la en local d'abord avec un repli cloud, et mesurez qualité, escalades et batterie sur les appareils réels de vos utilisateurs.
L'essentiel
- Les petits modèles (1 à 4B sur un téléphone) suffisent pour les tâches bornées : classer, extraire, router, reformuler et résumer des textes courts.
- Ils ne suffisent pas pour le raisonnement profond, les connaissances étendues ou les agents longs : les modèles ouverts jusqu'à 4B obtiennent 6 à 16 sur l'indice d'Artificial Analysis ; la pointe, environ 58.
- Les modèles intégrés d'Apple, Google et Microsoft n'ont pas de facture au token, mais n'atteignent que les appareils récents et changent à chaque mise à jour du système.
- L'appareil l'emporte sur la confidentialité, le hors-ligne et la latence plus que sur le coût : la même tâche sur un modèle ouvert par API peut coûter 18 $ par mois.
- Construisez en local d'abord avec un repli cloud, spécialisez avec LoRA ou la distillation, et suivez les escalades par appareil et version du système.
Sources
- Introducing the third generation of Apple Foundation Models
- WWDC26 session 241: Foundation Models framework
- Siri AI: a profoundly more capable and personal assistant is here
- Gemini Nano on Android (AICore)
- ML Kit GenAI APIs
- The Prompt API
- Gemma 4 model card
- Phi Silica in the Windows AI APIs
- Introducing Gemma 3 270M
- Exploring LLMs with MLX and the neural accelerators in the M5 GPU
- Tiny open-weights models: Intelligence Index
- Circular Externa 002 de 2024: datos personales en sistemas de inteligencia artificial
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Qu'appelle-t-on un petit modèle de langage ?
Un modèle jusqu'à environ 10 milliards de paramètres. Sur téléphone, la fourchette pratique va de 1 à 4 milliards ; le modèle local d'Apple en compte 3 milliards.
Un petit modèle peut-il remplacer un modèle de pointe dans mon app ?
Pour des tâches bornées et bien définies, souvent oui. Pour des questions ouvertes, de longs documents ou des agents à plusieurs étapes, non : gardez un modèle de pointe en repli.
Quels appareils font tourner les modèles locaux d'Apple et de Google ?
Apple Intelligence exige un iPhone 15 Pro ou ultérieur, ou un iPad ou un Mac avec M1 ou ultérieur. Les API ML Kit GenAI de Google listent des téléphones récents comme les Pixel 9 à 11 et les Galaxy S25 à S26. Vérifiez les listes à jour avant d'engager une fonction.
L'IA embarquée rend-elle mon app conforme au RGPD ou à la loi 1581 ?
Elle retire de l'équation le fournisseur d'IA et le transfert international, ce qui simplifie la conformité. Vous restez responsable de ce que vous traitez, stockez et synchronisez, et de l'information des utilisateurs.
Peut-on faire tourner un modèle de langage dans le navigateur ?
Oui. Chrome sur ordinateur expose Gemini Nano via des API intégrées (la Prompt API depuis Chrome 148), et des environnements comme LiteRT.js exécutent votre propre modèle via WebAssembly ou WebGPU. Chrome pour Android et iOS ne prend pas encore en charge les API intégrées.
D'autres analyses à lire
IA locale en 2026 : quel matériel acheter et ce qui tourne dessus
RTX 5090, RTX PRO 6000, DGX Spark, Ryzen AI Max+ et Mac Studio M5 : calcul de mémoire, quel modèle tient où, acheter ou louer et choix par taille d'équipe.
IA locale et open sourceLa quantification sans mythes : GGUF, AWQ, FP8 et FP4
Ce que coûtent vraiment 4, 5 ou 8 bits en qualité, mémoire et vitesse, quel format tourne où (GGUF, AWQ, EXL3, FP8, NVFP4) et comment valider.
IA locale et open sourceModèles open-weight en 2026 : lequel choisir, sous quelle licence
Kimi K3, Qwen3.8, DeepSeek V4.1, GLM-5.3, Gemma 4, gpt-oss, Mistral : tailles, licences, écart avec la frontière et hébergement sans surprise juridique.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.