IA locale et open source · Septembre 2026

Matériel pour l'IA locale en 2026 : d'abord la mémoire, ensuite la bande passante

Ce que vous pouvez faire tourner en local dépend moins de la marque que de deux chiffres : la mémoire disponible pour le modèle et la vitesse à laquelle on peut la lire. Voici des caractéristiques et des prix vérifiés, la formule de mémoire avec un exemple chiffré et nos recommandations selon la taille de l'équipe.

1 792 Go/s bande passante des RTX 5090 et RTX PRO 6000512 Go mémoire unifiée maximale, Mac Studio M5 Ultra1 999 $ prix de lancement de la RTX 5090
En bref

La capacité mémoire fixe le modèle qui tient et la bande passante la vitesse de réponse : la génération pour un utilisateur plafonne autour de la bande passante divisée par les octets lus par token. Les modèles à mélange d'experts (MoE) ne lisent que leurs paramètres actifs : un DGX Spark de 128 Go fait tourner gpt-oss-120b à environ 61 tokens par seconde, mais un modèle dense de 70B à 2,7.

Nos choix : une RTX 5090 de 32 Go (1 999 $ au lancement) pour un développeur, des cartes RTX PRO 6000 de 96 Go pour une équipe et des GPU loués avant tout achat pour la production. Acheter n'est rentable qu'avec un volume élevé et stable ou sous des règles strictes de résidence.

Pourquoi la mémoire décide : capacité, puis bande passante

La capacité décide si un modèle tient : ses poids plus la mémoire de travail de la conversation. La bande passante décide de la vitesse de réponse, car chaque token généré oblige à relire les poids ; NVIDIA souligne qu'en phase de décodage, c'est le transfert mémoire qui domine la latence, pas le calcul.

Règle empirique : la vitesse pour un utilisateur plafonne vers la bande passante divisée par les octets lus par token, et les systèmes réels n'en atteignent qu'une partie (Databricks mesure cette part comme taux d'utilisation de la bande passante). Avec le même modèle de 7B en 4 bits, un M5 Pro (307 Go/s) génère environ 66 tokens par seconde et un M5 Max (614 Go/s) environ 120, selon les mesures de la communauté. La lecture du prompt (prefill) dépend davantage du calcul.

Les modèles à mélange d'experts ne lisent que leurs paramètres actifs. Sur le même DGX Spark (273 Go/s), LMSYS a mesuré un Llama 3.1 70B dense en FP8 à 2,7 tokens par seconde ; les mesures de llama.cpp donnent environ 61 pour gpt-oss-120b et ses 5,1 milliards de paramètres actifs. Les machines à grande mémoire et bande passante modeste conviennent aux MoE, pas aux gros modèles denses.

La formule de mémoire, avec un exemple chiffré

La mémoire nécessaire correspond grosso modo aux poids, plus le cache KV (la mémoire par token de la conversation), plus une marge :

poids (Go) ≈ paramètres (milliards) × bits par poids ÷ 8
cache KV par token (octets) = 2 × couches × têtes KV × dimension de tête × octets par valeur
total ≈ poids + cache KV par token × tokens de contexte + une marge d'environ 20 %

Bits par poids : 16 en BF16, environ 8,5 en Q8_0 et environ 4,8 en Q4_K_M (d'après les fichiers de Granite 4.2 d'IBM). La marge est une heuristique d'EleutherAI ; le cache KV se déduit du config.json du modèle.

Exemple chiffré, notre calcul : Qwen3.8-27B sur une RTX 5090 de 32 Go.
PosteContexte de 131K tokensContexte de 262K tokens
Poids en Q4_K_M16,5 Go16,5 Go
Cache KV en 16 bits (64 Kio par token)8,6 Go17,2 Go
Total avant marge25,1 Go33,7 Go
Tient dans 32 Go ?Oui, avec de la margeNon : cache KV en 8 bits (8,6 Go) ou carte plus grande

Seules 16 des 64 couches du modèle utilisent l'attention complète, d'où 64 Kio par token ; l'ancien Qwen3-32B demande 256 Kio, soit 32 Gio pour 131K tokens, plus que la carte entière. Selon Ollama, un cache KV en 8 bits divise cette mémoire par deux avec une très faible perte de précision.

Règle pratique

Restez à 4 bits ou plus en production : une étude de Cohere a montré que les métriques automatiques masquaient l'essentiel de la perte en français (-0,3 % sur les benchmarks, -16,6 % en évaluation humaine, pour un modèle de 103B en 4 bits). Voir notre guide de la quantification.

Les paliers de matériel en septembre 2026

Caractéristiques des constructeurs et prix de lancement aux États-Unis.

Sources : NVIDIA, AMD et Apple ; prix de la RTX 5060 Ti selon la presse. Prix hors taxes.
MatérielMémoireBande passantePrix de lancement (USD)
GeForce RTX 5060 Ti 16 Go16 Go448 Go/s429
GeForce RTX 5070 Ti16 Go896 Go/s749
GeForce RTX 509032 Go1 792 Go/s1 999
RTX PRO 6000 Blackwell (Workstation ou Max-Q)96 Go, ECC1 792 Go/sNon publié
DGX Spark (GB10) et versions OEM128 Go unifiés273 Go/sSelon le constructeur
PC avec Ryzen AI Max+Jusqu'à 128 Go unifiésAbsente de l'annonce d'AMDSelon le constructeur
Mac Studio M5 Max36 à 128 Go unifiés460 ou 614 Go/sÀ partir de 2 499
Mac Studio M5 Ultra96 à 512 Go unifiés1 200 Go/sÀ partir de 5 499

La RTX 5090 et la RTX PRO 6000 partagent 1 792 Go/s et génèrent à une vitesse proche sur les modèles qui tiennent dans les deux (environ 205 et 215 tokens par seconde avec gpt-oss-20b, selon LMSYS) ; la PRO apporte trois fois plus de mémoire, avec ECC, et la RTX PRO 5000 (48 ou 72 Go, 1 344 Go/s) se situe entre les deux. Le DGX Spark, les PC Ryzen AI Max+ et les Mac échangent de la bande passante contre de la capacité ; seul le M5 Ultra s'approche d'un GPU dédié.

Disponibilité : le Mac Studio M5 est sorti le 22 septembre 2026, la puce M6 débute dans le Mac mini avec 32 Go au plus et la RTX 5090 Laptop offre 24 Go. Au-dessus du poste de travail, Microsoft a annoncé pour le quatrième trimestre 2026 un DGX Station (GB300) sous Windows qui, selon lui, fait tourner des modèles jusqu'à 1 000 milliards de paramètres. En centre de données : H100 (80 Go), H200 (141 Go), B200 et B300 chez NVIDIA, Instinct MI300X (192 Go) et MI355X (288 Go) chez AMD.

Ce qui tourne sur chaque palier

Tailles de fichiers publiées ; ajoutez le cache KV et une marge.

Tailles de fichiers d'après Hugging Face et les fiches des modèles, septembre 2026.
PalierExemples qui tiennentÀ quoi s'attendre
GPU de 16 Gogpt-oss-20b (12,1 Go), Gemma 4 12B QAT (7,0 Go)Petits modèles rapides
GPU de 32 Go (RTX 5090)Qwen3.8-27B Q4_K_M (16,5 Go), Gemma 4 31B QAT (17,7 Go), Muse Glimmer Q4_K_M (16,8 Go)Idéal pour un utilisateur
GPU de 96 Go (RTX PRO 6000)gpt-oss-120b (63,4 Go), Mistral Small 4 en 4 bits environ (71,8 à 73,8 Go), Qwen3.5-122B-A10B Q4_K_M (76,5 Go)Pleine vitesse ; sert une équipe
128 Go unifiés (DGX Spark, Ryzen AI Max+, M5 Max)En plus, Nemotron 3 Super NVFP4 (84,3 Go) et Step-3.5-Flash en 4 bits (111,5 Go, juste)MoE à vitesse modérée ; un dense de 70B se traîne
256 à 512 Go unifiés (M5 Ultra)Qwen3.5-397B-A17B Q4_K_M (294,1 Go), Kimi K2.5 en 2 bits (375 Go)Faible concurrence ; sous 4 bits, testez l'appel d'outils
Serveur à 8 GPU (classe H100, H200, B200)Famille GLM-5 (8 GPU selon Z.ai), Mistral Large 3 (un nœud de 8 H100)Classe frontière ; Kimi K3 exige 64 accélérateurs ou plus

Tenir en mémoire ne veut pas dire aller vite : sur les machines de 128 Go, privilégiez les modèles à peu de paramètres actifs. Et les chiffres des constructeurs sont des plafonds : NVIDIA et AMD évoquent jusqu'à 200 milliards de paramètres pour le DGX Spark et les Ryzen AI Max+, soit déjà environ 100 Go de poids en 4 bits.

Acheter, louer ou payer au token : une méthode de TCO

Comparez le coût mensuel du même travail à qualité égale : matériel réparti sur sa durée de vie, énergie et heures de maintenance, face à la facture d'API pour les mêmes tokens. Exemple illustratif : les chiffres de matériel, d'énergie et de main-d'œuvre sont nos hypothèses ; les prix d'API sont des prix catalogue au 26 septembre 2026.

Mois illustratif : 60 millions de tokens en entrée et 20 millions en sortie.
PosteUSD par mois
Station RTX 5090, 3 500 $ sur 36 mois (carte à 1 999 $ plus 1 500 $ supposés)97
Énergie : 0,7 kW, 176 heures, 0,15 $ le kWh18
Exploitation : 4 heures à 40 $160
Total en local275
Qwen3.8-27B chez Groq (0,80 $ / 4,00 $)128
gpt-oss-120b chez Groq (0,15 $ / 0,60 $)21
Claude Opus 5.5 (4 $ / 20 $)640

À ce volume, la machine locale coûte environ deux fois plus que le même modèle chez Groq, et ne bat une API de frontière que si un modèle de 27B suffit. Le point mort face à Groq arrive vers 170 millions de tokens par mois avec cette répartition, si un moteur de traitement par lots peut absorber la charge. C'est l'exploitation, pas le GPU, qui pèse : sans elle, le local coûte 115 $.

Pan et al. estiment qu'un petit modèle sur une RTX 5090 est rentabilisé face aux API commerciales en trois mois environ, mais que le sur-site ne se justifie surtout qu'au-delà de 50 millions de tokens par mois ou sous des règles strictes de résidence. Peng et al. (2026) ont montré que le cache de prompts rendait une API moins chère qu'un GPU partagé sur site, et la performance par dollar des GPU progresse d'environ 49 % par an (Epoch AI).

Consommation, bruit et disponibilité

Consommation et bruit. La RTX 5090 consomme jusqu'à 575 W (NVIDIA recommande une alimentation de 1 000 W) et la RTX PRO 6000 600 W, ou 300 W en version Max-Q avec la même mémoire et la même bande passante. Le DGX Spark fonctionne avec 240 W dans un boîtier de 15 cm de côté et 1,2 kg. Nous n'avons pas trouvé de mesures de bruit comparables ; notre règle : une carte de 575 à 600 W a sa place dans une pièce ventilée ou une baie.

Disponibilité et logiciel. Le DGX Spark existe aussi en versions OEM d'Acer, ASUS, Dell, GIGABYTE, HP, Lenovo et MSI. Vérifiez le support des formats : NVFP4 exige des GPU Blackwell, et MLX demande macOS 26.2 ou plus récent pour les accélérateurs du M5.

Acheter depuis la Colombie et depuis l'Europe

Colombie. Nos prix sont des prix de lancement américains ; en Colombie, taxes, transport, marge du distributeur et taux de change font varier le coût final : nous ne publions donc pas de montant en pesos. Demandez des devis en USD et en COP à au moins deux distributeurs, avec garantie et délais ; privilégiez les versions OEM avec facturation et support locaux, et vérifiez le circuit et l'onduleur avant d'installer une station de 1 000 W.

Louer est aussi légal : la loi 1581 autorise les transferts vers les pays de la liste d'adéquation de la SIC, qui inclut les États-Unis.

Europe. Le matériel en propre ou un prestataire qualifié SecNumCloud, conçu par l'ANSSI face aux lois extraterritoriales, répond au CLOUD Act américain, qui atteint les données des fournisseurs américains où qu'elles soient stockées. Pour les modèles, voir les modèles open-weight en 2026.

Nos recommandations selon la taille de l'équipe

Des points de départ, à confronter à vos propres modèles et volumes.

Recommandations du Slash AI Lab en septembre 2026.
ProfilMatériel de départModèlesLogiciel
Développeur seulRTX 5090, ou une machine à 128 Go pour de plus grands MoEQwen3.8-27B, Gemma 4 31B ou Muse Glimmer en 4 bits ; gpt-oss-120b avec 128 Gollama.cpp, Ollama ou LM Studio
Équipe d'environ 20 personnesServeur avec une ou deux RTX PRO 6000 (96 Go chacune)gpt-oss-120b, Mistral Small 4 ou Qwen3.5-122B-A10B en 4 bitsvLLM ou SGLang derrière une authentification, avec Open WebUI
Service en productionNœuds de 8 GPU loués avant tout achatGLM-5.3, MiMo-V2.6-Pro ou un autre grand MoEvLLM ou SGLang, avec Dynamo ou llm-d

Pour une équipe, la concurrence compte plus que la vitesse de pointe : dans le test de Red Hat sur une A100, vLLM a atteint 793 tokens par seconde, tandis qu'Ollama avec ses réglages par défaut plafonnait à 41. En production, louez d'abord, mesurez l'utilisation réelle et n'achetez que si les GPU restent occupés ; l'analyse sponsorisée de Lenovo situe le seuil à environ cinq heures d'utilisation par jour face au cloud à la demande. Plus de détails dans comment monter un serveur LLM local.

Un serveur local reste un serveur

SentinelLABS et Censys ont compté 175 108 serveurs Ollama exposés sur internet, et la NVD recense des dizaines de vulnérabilités publiées en 2026 dans vLLM, llama.cpp et Ollama. Ajoutez une authentification, gardez le port privé et appliquez les correctifs comme en production.

L'essentiel

  • La capacité décide du modèle qui tient ; la bande passante, de la vitesse de génération.
  • Les MoE ne lisent que les paramètres actifs : sur un DGX Spark, gpt-oss-120b tourne à environ 61 tokens par seconde et un dense de 70B à 2,7.
  • Une RTX 5090 de 32 Go (1 999 $ au lancement) fait tourner Qwen3.8-27B en 4 bits avec 131K de contexte ; une RTX PRO 6000 de 96 Go sert des MoE de classe 120B à une équipe.
  • Comptez le temps d'exploitation : dans notre mois illustratif, il pèse plus que le matériel, et les API bon marché de modèles ouverts l'emportent souvent à faible volume.
  • Traitez un serveur d'IA local comme une infrastructure de production : authentification, aucune exposition publique et correctifs réguliers.

Sources

  1. GeForce RTX 5090 · NVIDIA, 2025-01-06
  2. Compare GeForce graphics cards · NVIDIA, 2025
  3. RTX PRO 6000 Blackwell Workstation Edition · NVIDIA, 2025-03-18
  4. DGX Spark · NVIDIA, 2025-10-13
  5. Apple introduces new Mac Studio with M5 Max and M5 Ultra · Apple Newsroom, 2026-08-25
  6. AMD at CES 2026: Ryzen, Ryzen AI and ROCm announcements · AMD, 2026-01-05
  7. NVIDIA DGX Spark review · LMSYS, 2025-10-13
  8. llama.cpp performance on DGX Spark (discussion #16578) · ggml-org, 2026-02-05
  9. LLM inference performance engineering: best practices · Databricks, 2023-10-12
  10. A cost-benefit analysis of on-premise LLM deployment (Pan et al.) · arXiv, 2025-08-30
  11. Ollama vs. vLLM: performance benchmarking · Red Hat Developer, 2025-08-08
  12. Qwen3.8-27B model card · Qwen (Hugging Face), 2026-08-14

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Quel est le meilleur GPU pour l'IA locale en 2026 ?

En carte unique, la RTX 5090 (32 Go, 1 792 Go/s, 1 999 $ au lancement) offre la meilleure vitesse par dollar dans nos sources. Au-delà d'environ 30B, regardez une RTX PRO 6000 de 96 Go ou une machine à 128 Go de mémoire unifiée.

Un DGX Spark peut-il faire tourner un modèle de 70B ?

Il tient, mais LMSYS a mesuré Llama 3.1 70B en FP8 à 2,7 tokens par seconde sur cette machine. Les MoE vont bien plus vite : environ 61 tokens par seconde pour gpt-oss-120b avec llama.cpp.

Combien de VRAM faut-il pour un modèle de 27B ?

Environ 16,5 Go pour les poids de Qwen3.8-27B en Q4_K_M, plus le cache KV : environ 8,6 Go de plus pour un contexte de 131K tokens en 16 bits. Une carte de 24 Go convient avec des contextes plus courts ; 32 Go laissent de la marge.

Un Mac convient-il aux LLM locaux ?

Oui pour les grands modèles à faible concurrence : le Mac Studio M5 Ultra offre jusqu'à 512 Go à 1,2 To/s. Pour de nombreux utilisateurs simultanés, un serveur GPU avec vLLM passe mieux à l'échelle.

L'IA locale coûte-t-elle moins cher qu'une API ?

Seulement avec un volume élevé et stable, face à des API de frontière coûteuses ou sous des règles strictes de résidence. Les API bon marché de modèles ouverts l'emportent souvent à faible volume, et le cache de prompts peut faire basculer le calcul. Faites le calcul avec vos propres volumes.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban