IA locale et open source · Septembre 2026

Modèles open-weight en 2026 : presque à la frontière, pas toujours si ouverts

Les meilleurs modèles à poids ouverts n'ont que quelques mois de retard sur les modèles fermés, et certains tournent sur un seul poste de travail. Les pièges sont ailleurs : des licences qui changent d'une version à l'autre, des flux de données qui dépendent de l'hébergement et des fichiers de modèle à traiter comme du logiciel.

46 contre 58 meilleur ouvert contre meilleur fermé (Artificial Analysis)2 800 milliards de paramètres pour Kimi K3, le plus grand4 mois de retard moyen sur la frontière (Epoch AI)
En bref

Au 26 septembre 2026, les modèles à poids ouverts les plus performants viennent de laboratoires chinois (MiMo-V2.6-Pro de Xiaomi, GLM-5.3 de Z.ai, Kimi K3 de Moonshot) et obtiennent 44 à 46 points à l'indice d'Artificial Analysis, contre 58 pour le meilleur modèle fermé ; Epoch AI estime le retard à environ quatre mois.

Le piège, c'est la licence : plusieurs modèles phares sont passés de MIT ou Apache 2.0 à des conditions maison avec seuils de chiffre d'affaires, attribution obligatoire ou limites à la vente du modèle en tant que service. Notre règle : constituez la liste courte avec votre propre évaluation, lisez la licence de la version exacte, décidez où circulent les données et traitez les fichiers de modèle comme du logiciel.

Poids ouverts ne veut pas dire open source

Un modèle comporte trois éléments : les poids (les paramètres entraînés que vous téléchargez), le code pour l'entraîner et l'exécuter, et les données dont il a appris. « Open-weight » ne promet que le premier, sous une licence plus ou moins permissive. Les grandes sorties de 2026, chez DeepSeek, Qwen, Kimi ou GLM, publient les poids et un rapport technique, pas leurs données d'entraînement.

Rares sont les projets qui publient tout : Olmo 3 et 3.1 d'Ai2 (poids, code, checkpoints et jeux de données sous Apache 2.0) et Apertus v1.5 de la Swiss AI Initiative, qui respecte les oppositions des titulaires de données et fournit une documentation pour l'AI Act.

Pourquoi c'est important : sans les données, impossible d'auditer ce que le modèle a appris, et le Comité européen de la protection des données a averti en décembre 2024 que des données d'entraînement traitées illicitement peuvent affecter la licéité d'un déploiement. La réponse réaliste : documenter la provenance et tester les sorties.

Les principales familles en septembre 2026

Taille, contexte et licence, d'après la fiche de chaque éditeur.

Vérifié le 26 septembre 2026. B = milliards, T = mille milliards ; « actifs » = paramètres utilisés par token dans les modèles à mélange d'experts (MoE).
Modèle (laboratoire, sortie)Totaux / actifsContexteLicence
Kimi K3 (Moonshot AI, juillet 2026)2,8T / 104B1MMaison (Kimi K3 License)
Qwen3.8-2.4T-A95B (Alibaba, août 2026)2,4T / 95B262K, jusqu'à ~1MMaison (Qwen3.8-Max License)
Qwen3.8-27B (Alibaba, août 2026)27B, dense262K, jusqu'à ~1MApache 2.0
MiMo-V2.6-Pro (Xiaomi, septembre 2026)1,02T / 42B1MMIT
DeepSeek V4-Pro (avril 2026, mis à jour en août)1,6T / 49B1MMIT
DeepSeek V4.1-Flash (10 septembre 2026)552B / 8B à 16B1MMIT
GLM-5.3 (Z.ai, août 2026)744B / 40B1MMaison (GLM-5.3 License)
GLM-5.3-Flash (Z.ai, août 2026)320B / 18B300KMIT
MiniMax-M3 (juin 2026)~428B / ~23B1MMaison (MiniMax Community License)
Gemma 4 31B et 26B A4B (Google, avril 2026)30,7B dense ; 25,2B / 3,8B256KApache 2.0
Muse Glimmer 30B (Meta, août 2026)~30B, dense131K et plusApache 2.0
gpt-oss-120b et 20b (OpenAI, août 2025)117B / 5,1B ; 21B / 3,6B128KApache 2.0
Mistral Small 4 (mars 2026)119B / ~6B256KApache 2.0
Mistral Large 3 et Ministral 3 (décembre 2025)675B / 41B ; denses de 3B à 14B256K (Ministral 14B)Apache 2.0

Les modèles phares atteignent 1 000 à 2 800 milliards de paramètres et visent de gros serveurs : Moonshot recommande 64 accélérateurs ou plus pour K3. Le juste milieu efficace, ce sont les MoE à peu de paramètres actifs (DeepSeek V4.1-Flash, GLM-5.3-Flash, Mistral Small 4, gpt-oss-120b). Enfin, une classe dense de 27B à 31B tourne sur un seul GPU de 32 Go une fois quantifiée, comme le montre notre guide du matériel pour l'IA locale.

Points forts par usage : code, raisonnement, langues, vision

  • Code et agents. GLM-5.3 est le meilleur modèle ouvert du classement officiel de Terminal-Bench 4.0 (41,8 %, cinquième au total). Sur Terminal-Bench 2.1, en chiffres des éditeurs, DeepSeek V4.1-Flash (90,6), MiMo-V2.6-Pro (89,9) et Kimi K3 (88,3) sont en tête ; Qwen3.8-27B annonce 61,7 sur SWE-bench Pro.
  • Raisonnement. Les éditeurs annoncent jusqu'à 93,5 sur GPQA Diamond (Kimi K3), mais ce test est saturé (les meilleurs modèles fermés tournent autour de 94 à 96 %) et ne départage plus les modèles.
  • Espagnol et français. La génération Qwen3.5 couvrait 201 langues ; Gemma 4 en prend en charge plus de 35 d'emblée ; Mistral Large 3 revendique plus de 40 langues natives, et Command A+ de Cohere (Apache 2.0) cite les deux parmi 48. Des options régionales comme Latam-GPT, ALIA-40b (Espagne) ou Luciole (France) méritent aussi un test.
  • Vision et audio. Qwen3.8-27B, Gemma 4, Kimi K3, MiniMax-M3, GLM-5.3-Flash et DeepSeek V4.1-Flash acceptent des images ; MiMo-V2.6 prend aussi l'audio et la vidéo.
Règle pratique

Les benchmarks des éditeurs reposent sur des protocoles et des niveaux d'effort différents. Ils servent à établir une liste courte de trois modèles, jamais à désigner le gagnant : celui-ci sort de vos propres prompts en espagnol, en français et en anglais (voir comment nous choisissons un modèle).

L'écart réel avec la frontière

Classements indépendants, consultés les 25 et 26 septembre 2026.

Meilleures entrées trouvées dans chaque classement. Les scores bougent chaque semaine.
ClassementMeilleur ferméMeilleur ouvertÉcart
Indice d'intelligence d'Artificial Analysis v4.3.2Claude Opus 5.5 (max) : 58MiMo-V2.6-Pro : 46 ; GLM-5.3 : 45 ; Kimi K3 : 4412 points
Arena, texteClaude Opus 5.5 (high) : 1 509Kimi K3 (max) : 1 488 ; MiMo-V2.6-Pro : 1 48021 à 29 points
Terminal-Bench 4.0, classement officielGPT-6 Astra (max) : 58,2 %GLM-5.3 (max) : 41,8 %16,4 points
ARC-AGI-2GPT-6 Astra (Max) : 95,0 %, 1,12 $ par tâcheDeepSeek V4 Flash 0731 (Max) : 61,4 %, 0,042 $ par tâche34 points, pour 1/27 du coût

Epoch AI a mesuré un retard moyen d'environ quatre mois pour les meilleurs modèles ouverts depuis janvier 2026. L'écart est faible sur la préférence en conversation (Arena) et plus large sur les longues tâches agentiques (Terminal-Bench), précisément là où les modèles de frontière justifient leur prix. Parmi les petits modèles, Qwen3.8-27B obtient 34 à l'indice d'Artificial Analysis, loin devant Gemma 4 31B (19) et Muse Glimmer (17).

La dérive des licences, et comment en vérifier une

En 2025, la plupart des grands modèles ouverts sortaient sous MIT ou Apache 2.0. En 2026, plusieurs modèles phares sont passés à des licences maison, tandis que leurs petits frères restaient souvent permissifs (Qwen3.8-27B sous Apache 2.0, GLM-5.3-Flash sous MIT) : usage libre pour la plupart, avec des conditions qui jouent à grande échelle ou pour certains modèles d'affaires.

  • Kimi K3 (K2 était sous MIT modifiée) : affichage du nom au-delà de 100 millions d'utilisateurs mensuels ou de 20 millions de dollars de revenus mensuels, et accord requis pour les activités de modèle en tant que service au-delà de 20 millions de dollars sur 12 mois.
  • Qwen3.8 phare : même règle d'affichage et licence distincte pour les activités de modèle en tant que service ou d'assistant de travail au-delà de 50 millions de dollars de chiffre d'affaires de groupe. Qwen3.8-Flash-Next l'exige pour ces activités quelle que soit leur taille.
  • GLM-5.3 (GLM-5.2 était sous MIT) : examen de sécurité de Z.ai pour les opérateurs de modèle en tant que service dont le chiffre d'affaires de groupe dépasse 10 milliards de dollars.
  • MiniMax-M3 : attribution « Built with MiniMax M3 », notification ou autorisation préalable selon un seuil de 20 millions de dollars de chiffre d'affaires annuel, et usages interdits comme le militaire ; M2.7 était non commercial.
  • Hy3-preview (Tencent) excluait l'Union européenne, le Royaume-Uni et la Corée du Sud ; le Hy3 définitif est sous Apache 2.0.
  1. Lisez le fichier LICENSE de la version exacte, pas les métadonnées : la fiche de MiniMax-M2.5 indiquait « modified-mit » alors que son fichier ajoutait des usages interdits et le droit de Singapour.
  2. Vérifiez l'usage commercial et les seuils d'utilisateurs ou de chiffre d'affaires, y compris de groupe.
  3. Vérifiez les clauses de modèle en tant que service et d'assistant de travail si vous revendez l'accès ou créez un assistant.
  4. Notez attribution, territoire, usages interdits et droit applicable.
  5. Conservez licence, version et empreinte du fichier dans votre inventaire d'IA (AI BOM) et revérifiez à chaque mise à jour.
Avant un lancement produit

Une licence acceptable pour un outil interne peut ne pas l'être pour un produit. Si vous vendez l'accès au modèle, directement ou dans un SaaS, faites-la d'abord lire par votre juriste.

Où les faire tourner, et où vont vos données

Les poids ouverts offrent trois options d'hébergement, chacune avec un flux de données différent. L'auto-hébergement garde prompts et réponses dans votre périmètre : un modèle chinois sur votre serveur n'envoie rien en Chine, car les poids ne sont que des fichiers. Les fournisseurs d'inférence font tourner les mêmes poids sous leur propre contrat et leur propre juridiction. L'API du laboratoire envoie vos données au laboratoire.

Le milieu de gamme est devenu bon marché. Au 26 septembre 2026, gpt-oss-120b coûtait 0,15 $ / 0,60 $ par million de tokens en entrée et en sortie chez Groq, Together ou Fireworks ; DeepSeek V4.1-Flash, 0,30 $ / 1,20 $ sur l'API de DeepSeek aux heures de pointe et chez Fireworks ; Qwen3.8-27B, 0,80 $ / 4,00 $ chez Groq. En Europe, la plateforme de Mistral propose aussi GLM-5.3 et GLM-5.2 de Z.ai : un modèle d'origine chinoise sous contrat avec un fournisseur français ; vérifiez la région d'hébergement.

Le critère juridique, c'est la destination des données personnelles. En Colombie, la loi 1581 autorise les transferts vers les pays de la liste d'adéquation de la SIC, qui inclut les États-Unis mais pas la Chine ; ailleurs, il faut une exception, comme l'autorisation expresse de la personne concernée. Dans l'UE, les transferts hors de l'EEE relèvent du chapitre V du RGPD.

Risques : provenance, réglages de sécurité et fichiers de modèle

Provenance et géopolitique. Menlo Ventures estimait en décembre 2025 que les modèles ouverts chinois représentaient environ 1 % de l'usage des API de LLM dans les entreprises américaines. La loi américaine d'autorisation de défense (NDAA) pour l'exercice 2026 impose de retirer DeepSeek des systèmes du département de la Défense, et Zhipu (Z.ai) figure sur l'Entity List américaine depuis janvier 2025. Si vous vendez à des administrations ou à des secteurs régulés, interrogez vos clients sur l'origine du modèle, même auto-hébergé.

Les réglages de sécurité sont minces. Des travaux montrent que les refus d'un modèle ouvert peuvent être effacés en modifiant ses poids, et que la modification vaut dans plusieurs langues ; le Financial Times a rapporté que les garde-fous de Gemma 4 avaient été retirés 90 minutes après sa sortie. Ajoutez un modèle de protection (Llama Guard 4 ou gpt-oss-safeguard) et testez-le en espagnol et en français : voir les garde-fous en production.

Les fichiers de modèle sont du logiciel. Les checkpoints pickle peuvent exécuter du code au chargement, JFrog a trouvé en 2024 une centaine de modèles malveillants sur Hugging Face, et des instructions peuvent se cacher dans le modèle de chat d'un GGUF. Préférez safetensors depuis les organisations officielles, figez les empreintes et gardez les serveurs privés : SentinelLABS et Censys ont compté 175 108 serveurs Ollama exposés. Plus de détails dans la sécurité de la chaîne d'approvisionnement de l'IA.

Le bon côté : quand des modèles commerciaux ont refusé des requêtes forensiques pendant une intrusion en juillet 2026, Hugging Face a analysé les journaux de l'attaquant avec le modèle ouvert GLM-5.2, sur ses propres serveurs.

Comment décider, en Colombie et en Europe

  1. Nommez la contrainte dominante : qualité, coût par tâche, latence, résidence des données ou fonctionnement hors ligne.
  2. Établissez une liste courte de trois modèles compatibles avec votre licence et votre matériel.
  3. Évaluez-les sur au moins 30 prompts réels dans vos langues, face à un modèle fermé.
  4. Données personnelles ou confidentielles : modèle auto-hébergé ; le reste, via un fournisseur sous contrat.
  5. Consignez licence, version et empreintes, et ajoutez un modèle de protection.
  6. Anticipez les mises à jour : modèles et licences changent tous les quelques mois.

Colombie et Amérique latine. Les poids ouverts sont la voie la moins chère vers la résidence des données, et la circulaire de la SIC de 2024 sur l'IA impose une analyse d'impact sur la vie privée pour les usages à haut risque. La voie pratique : un modèle ouvert auto-hébergé pour les flux sensibles et une API fermée pour les tâches les plus difficiles.

Union européenne. L'AI Act s'applique de manière générale depuis le 2 août 2026. Selon les lignes directrices de la Commission, affiner un modèle ouvert ne fait de vous un fournisseur de modèle d'IA à usage général que si vous mobilisez plus d'un tiers de la puissance de calcul de l'entraînement initial.

Notre recommandation : testez Qwen3.8-27B ou Gemma 4 31B en auto-hébergement pour le travail interne et DeepSeek V4.1-Flash via un fournisseur sous contrat pour le volume, et gardez un modèle fermé de frontière là où l'écart se voit. Si un client exclut les modèles d'origine chinoise, Gemma 4, Muse Glimmer, gpt-oss et Mistral sont les alternatives sous Apache 2.0.

L'essentiel

  • Les meilleurs modèles ouverts obtiennent 44 à 46 à l'indice d'Artificial Analysis contre 58 pour le meilleur fermé ; Epoch AI estime le retard à environ quatre mois.
  • Open-weight signifie poids, pas données : les modèles entièrement ouverts, comme Olmo et Apertus, restent l'exception.
  • Les licences dérivent : Kimi K3, le Qwen3.8 phare, GLM-5.3 et MiniMax-M3 ajoutent seuils, attribution ou limites au modèle en tant que service.
  • Auto-héberger un modèle chinois n'envoie aucune donnée en Chine ; appeler l'API d'un laboratoire est un autre flux de données.
  • Traitez les fichiers de modèle comme du logiciel et les garde-fous comme votre affaire, testés en espagnol et en français.

Sources

  1. Open weights models: Intelligence Index v4.3.2 · Artificial Analysis, 2026-09-26
  2. Text leaderboard · Arena, 2026-09-25
  3. Terminal-Bench leaderboard · Terminal-Bench, 2026-09-26
  4. Gap between open-weight and closed models (Epoch Capabilities Index) · Epoch AI, 2026-05-29
  5. Kimi K3 License · Moonshot AI (Hugging Face), 2026-07
  6. Qwen3.8-2.4T-A95B model card · Qwen (Hugging Face), 2026-08-12
  7. GLM-5.3 License · Z.ai (Hugging Face), 2026-08-25
  8. MiniMax Community License (MiniMax-M3) · MiniMax (Hugging Face), 2026-06
  9. DeepSeek-V4.1-Flash release · DeepSeek API Docs, 2026-09-10
  10. Gemma 4 model card · Google AI for Developers, 2026-07-30
  11. Models overview · Mistral AI documentation, 2026-09-26
  12. LLM03:2025 Supply Chain · OWASP Top 10 for LLM Applications, 2024-11

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Quel est le meilleur modèle open-weight en septembre 2026 ?

Sur l'indice d'intelligence d'Artificial Analysis v4.3.2, MiMo-V2.6-Pro de Xiaomi (46), GLM-5.3 de Z.ai (45) et Kimi K3 de Moonshot (44) sont en tête. Sur un seul GPU, Qwen3.8-27B (34, Apache 2.0) est le petit modèle le plus performant du même indice.

Open-weight veut-il dire open source ?

Non. Les modèles open-weight publient leurs paramètres entraînés sous licence ; les données d'entraînement, et souvent le code, restent privés. Les modèles entièrement ouverts, comme Olmo d'Ai2 ou Apertus, publient aussi données et code.

Puis-je utiliser Qwen, DeepSeek ou Kimi à des fins commerciales ?

DeepSeek V4 et V4.1 (MIT) et Qwen3.8-27B (Apache 2.0) le permettent avec peu de conditions. Kimi K3 et le Qwen3.8 phare le permettent, mais ajoutent des obligations d'affichage et des limites pour les activités de modèle en tant que service au-delà de certains seuils. Lisez chaque licence.

Est-il sûr de faire tourner un modèle chinois sur mes serveurs ?

Les poids n'envoient à eux seuls aucune donnée. Les risques tiennent aux fichiers (utilisez safetensors depuis les sources officielles), à l'exposition du serveur d'inférence, à la faiblesse des garde-fous intégrés et aux politiques de vos clients sur l'origine des modèles.

Quels modèles ouverts gèrent bien l'espagnol et le français ?

Qwen3.5, Gemma 4, les modèles de Mistral et Command A+ de Cohere les prennent explicitement en charge. Les déclarations des éditeurs ne suffisent pas : testez vos propres prompts, y compris après quantification.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban