Comment nous choisissons un modèle
Un modèle ne se choisit pas pour le hype. Il se choisit par évaluation sur les prompts du client, le coût, la résidence des données et les échecs observés. Voici comment.
Nous évaluons les candidats —OpenAI, Anthropic, Gemini, DeepSeek, GLM, Qwen, Mistral et open source local— sur les prompts réels du client, en espagnol, français et anglais. Un modèle ne se choisit pas à la mode : seuls les échecs observés et le coût défendable comptent.
Le cadre avant le classement
Cinq contraintes d'abord ; le classement ensuite.
Choisir un modèle en 2026 ne commence pas par un leaderboard : cela commence par vos contraintes. Un modèle premier sur un benchmark anglais peut échouer sur l'espagnol de votre métier, coûter le double au token ou ne pas résider où votre conformité l'exige.
Le cadre du Slash AI Lab : langue, code, agents, coût, confidentialité. Cinq axes, mesurés avec les prompts du client, contre le meilleur modèle générique disponible en référence.
Comment se déroule l'évaluation
Reproductible par conception : tout le monde peut la relancer.
Nous réunissons 30 prompts fixes par client —tâches réelles du métier, pas des jouets— et les exécutons contre chaque candidat, en cloud et, quand c'est possible, en inférence locale.
Quatre choses sont mesurées par corrida : qualité (contre des critères convenus), échecs observés, coût par inférence et latence p95. Le résultat est une comparaison par axe avec une recommandation reproductible.
- Prompts : 30 fixes par client, versionnés.
- Moteurs : 5 dans la corrida actuelle (méthode publiée).
- Langues : espagnol des affaires, français, anglais.
- Sortie : comparaison par axe, recommandation reproductible.
Les échecs pèsent plus que les réussites
Le déploiement se décide sur ce qui casse, pas sur les réussites.
Un benchmark récompense le facile. Un déploiement se décide sur ce qui arrive quand le modèle se trompe : répond-il avec une fausse confiance, invente-t-il des sources, ignore-t-il la langue du client ?
L'évaluation inclut donc des cas hostiles : prompts adverses, données sales, outils tombés. Si le modèle échoue mal, il retourne au design — quel que soit son classement.
Ce que cette étude n'est PAS
Des limites déclarées, sans fumée.
Ce n'est pas un classement acheté ni sponsorisé ; il ne couvre pas tous les fournisseurs ; il ne remplace pas une évaluation sur vos propres prompts — c'est la base publique de la méthode Slash.
L'essentiel
- Le cadre : langue, code, agents, coût, confidentialité — dans cet ordre de discussion.
- 30 prompts fixes par client, versionnés et reproductibles.
- Les échecs observés pèsent plus que les réussites du benchmark.
- Inférence locale quand la conformité l'exige.
- Ré-évaluation trimestrielle ou au gré du marché.
Les questions qu'on nous pose souvent
Quels moteurs dans la corrida ?
OpenAI, Anthropic, Gemini, DeepSeek, GLM, Qwen, Mistral et open source local ; liste exacte documentée.
Pourquoi 30 prompts ?
Le minimum pour séparer la chance de la consistance sur des tâches réelles.
Pourquoi l'espagnol et le français ?
Parce que c'est là que les modèles cassent : langues de travail de Slash, pas des extras.
Est-ce un classement payé ?
Non. Méthodologie, prompts et limites sont publics.
Fréquence ?
Trimestrielle, ou à la moindre évolution majeure du marché.
Et ensuite ?
Slash AI Lab
Le laboratoire où nous évaluons les modèles et publions la méthode.
En savoir plus→ Fine-tuningFine-tuning et RAG
Quand ajuster le modèle, quand lui donner du savoir. Du jugement, pas du hype.
En savoir plus→ IAIntelligence artificielle
IA appliquée aux opérations réelles : agents, RAG, vision, voix et automatisation.
En savoir plus→ RechercheRecherche
Nous publions notre méthode : modèles, RAG, pentest et visibilité LLM.
En savoir plus→Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.