Slash AI Lab · Septembre 2026

Comment nous choisissons un modèle

Un modèle ne se choisit pas pour le hype. Il se choisit par évaluation sur les prompts du client, le coût, la résidence des données et les échecs observés. Voici comment.

30 prompts fixes5 moteurs3 langues
En bref

Nous évaluons les candidats —OpenAI, Anthropic, Gemini, DeepSeek, GLM, Qwen, Mistral et open source local— sur les prompts réels du client, en espagnol, français et anglais. Un modèle ne se choisit pas à la mode : seuls les échecs observés et le coût défendable comptent.

Le cadre

Le cadre avant le classement

Cinq contraintes d'abord ; le classement ensuite.

Choisir un modèle en 2026 ne commence pas par un leaderboard : cela commence par vos contraintes. Un modèle premier sur un benchmark anglais peut échouer sur l'espagnol de votre métier, coûter le double au token ou ne pas résider où votre conformité l'exige.

Le cadre du Slash AI Lab : langue, code, agents, coût, confidentialité. Cinq axes, mesurés avec les prompts du client, contre le meilleur modèle générique disponible en référence.

Méthode

Comment se déroule l'évaluation

Reproductible par conception : tout le monde peut la relancer.

Nous réunissons 30 prompts fixes par client —tâches réelles du métier, pas des jouets— et les exécutons contre chaque candidat, en cloud et, quand c'est possible, en inférence locale.

Quatre choses sont mesurées par corrida : qualité (contre des critères convenus), échecs observés, coût par inférence et latence p95. Le résultat est une comparaison par axe avec une recommandation reproductible.

  • Prompts : 30 fixes par client, versionnés.
  • Moteurs : 5 dans la corrida actuelle (méthode publiée).
  • Langues : espagnol des affaires, français, anglais.
  • Sortie : comparaison par axe, recommandation reproductible.
Les échecs

Les échecs pèsent plus que les réussites

Le déploiement se décide sur ce qui casse, pas sur les réussites.

Un benchmark récompense le facile. Un déploiement se décide sur ce qui arrive quand le modèle se trompe : répond-il avec une fausse confiance, invente-t-il des sources, ignore-t-il la langue du client ?

L'évaluation inclut donc des cas hostiles : prompts adverses, données sales, outils tombés. Si le modèle échoue mal, il retourne au design — quel que soit son classement.

Limites

Ce que cette étude n'est PAS

Des limites déclarées, sans fumée.

Ce n'est pas un classement acheté ni sponsorisé ; il ne couvre pas tous les fournisseurs ; il ne remplace pas une évaluation sur vos propres prompts — c'est la base publique de la méthode Slash.

L'essentiel

  • Le cadre : langue, code, agents, coût, confidentialité — dans cet ordre de discussion.
  • 30 prompts fixes par client, versionnés et reproductibles.
  • Les échecs observés pèsent plus que les réussites du benchmark.
  • Inférence locale quand la conformité l'exige.
  • Ré-évaluation trimestrielle ou au gré du marché.
Questions fréquentes

Les questions qu'on nous pose souvent

Quels moteurs dans la corrida ?

OpenAI, Anthropic, Gemini, DeepSeek, GLM, Qwen, Mistral et open source local ; liste exacte documentée.

Pourquoi 30 prompts ?

Le minimum pour séparer la chance de la consistance sur des tâches réelles.

Pourquoi l'espagnol et le français ?

Parce que c'est là que les modèles cassent : langues de travail de Slash, pas des extras.

Est-ce un classement payé ?

Non. Méthodologie, prompts et limites sont publics.

Fréquence ?

Trimestrielle, ou à la moindre évolution majeure du marché.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.