Des garde-fous qui fonctionnent : classificateurs, politiques et modération en production
Aucun filtre ne tient seul. Les garde-fous qui fonctionnent forment une pile de couches, chacune mesurée sur vos données et dans vos langues. Voici la pile que nous recommandons, avec les modèles de garde disponibles en septembre 2026.
Un garde-fou n'est pas un filtre mais une pile de sept couches, du filtrage des entrées à la journalisation et à la surveillance. Les modèles de garde ouverts couvrent désormais la plupart de ces couches, et certains lisent votre politique en langage naturel, un atout quand elle est rédigée en français ou en espagnol.
La recherche sur les jailbreaks montre pourquoi les couches comptent : les attaques par contexte long, par échantillonnage répété ou sur plusieurs tours battent chacune un modèle ou un filtre isolé. Mesurez chaque couche sur votre propre jeu annoté, dans chaque langue : faux positifs, faux négatifs, latence et coût.
Sept couches, pas un filtre
Chaque couche attrape une défaillance différente ; ensemble, elles couvrent ce qu'aucun modèle ne couvre seul.
| Couche | Rôle | Outils types | Ce qu'elle attrape |
|---|---|---|---|
| 1. Filtrage des entrées | Classe la requête et les contenus récupérés en amont du modèle | Prompt Guard 2, Prompt Shields, Qwen3Guard | Jailbreaks, injection, demandes hors politique |
| 2. Politique système | Dit ce que le produit fait et refuse | Prompt système versionné comme du code | Dérive du périmètre |
| 3. Choix du modèle | Un modèle bien aligné et bien calibré pour la tâche | Votre batterie d'évaluation | Excès et défaut de refus à la source |
| 4. Classification des sorties | Vérifie chaque réponse au regard de la politique | Llama Guard 4, gpt-oss-safeguard, Shieldstral | Sorties nuisibles passées à travers |
| 5. Permissions des outils | Limite ce qu'un agent peut faire, quoi que décide le modèle | Moindre privilège, listes d'autorisation, confirmations | Les dégâts d'une injection réussie |
| 6. Revue humaine | Transmet les cas signalés ou à fort impact à une personne | File de revue | Cas ambigus, actions irréversibles |
| 7. Journalisation et surveillance | Enregistre entrées, sorties et verdicts | Traces, tableaux de bord, alertes | Attaques lentes sur plusieurs tours, dérive, abus |
Les couches 5 et 7 ne dépendent d'aucun modèle, et c'est pourquoi elles tiennent quand les autres cèdent. Le NCSC britannique dit la même chose de l'injection de prompt : la traiter comme un risque résiduel et en limiter l'impact par des contrôles déterministes, sans LLM.
Les modèles de garde disponibles en septembre 2026
| Modèle | Éditeur, date | Licence, déploiement | Langues | Périmètre et notes |
|---|---|---|---|---|
| Llama Guard 4 (12B) | Meta, avr. 2025 | Llama 4 Community ; auto-hébergé | Anglais + 7, dont français et espagnol | Entrées et réponses, texte et images, 14 catégories |
| Prompt Guard 2 (86M, 22M) | Meta, avr. 2025 | Llama 4 Community ; auto-hébergé | Multilingue ; moins bon en 22M | Attaques en entrée seulement ; vulnérable aux attaques adaptatives |
| ShieldGemma 2 (4B) | Google, avr. 2025 | Conditions Gemma ; auto-hébergé | Entraîné sur des données en anglais | Images seulement, trois politiques |
| Granite Guardian 4.1 (8B) | IBM, avr. 2026 | Apache 2.0 ; auto-hébergé | Anglais | Préjudice, jailbreak, ancrage RAG, appels d'outils ; critères sur mesure |
| Qwen3Guard-Gen (0.6B à 8B) | Alibaba, oct. 2025 | Apache 2.0 ; auto-hébergé | 119 langues et dialectes | Sûr, controversé ou dangereux |
| gpt-oss-safeguard (20B, 120B) | OpenAI, oct. 2025 | Apache 2.0 ; auto-hébergé | À vérifier | Lit votre politique ; verdicts argumentés |
| Shieldstral 1.0 (3B) | Mistral, août 2026 | Apache 2.0 ; un GPU de 16 Go | 12, dont français et espagnol | Lit votre politique ; texte et images |
| Moderation API | Mistral | API gérée | À vérifier | Une dizaine de catégories, entrées et sorties |
| NeMo Guardrails + NemoGuard | NVIDIA | Boîte à outils Apache 2.0 ; auto-hébergée | Selon les modèles | Rails en entrée, récupération, dialogue, exécution et sortie |
| Prompt Shields | Microsoft | Service Azure géré | À vérifier | Attaques directes et indirectes (dans les documents) |
| Constitutional Classifiers | Anthropic, 2025 et 2026 | Propriétaire ; uniquement dans Claude | Sans objet | Cascade en deux étapes |
À noter : « modèle de garde » recouvre des métiers différents. Prompt Guard 2 et Prompt Shields cherchent des attaques dans les entrées, ShieldGemma 2 modère des images, NeMo Guardrails orchestre d'autres modèles et les autres jugent un contenu au regard d'une politique. Chaque fiche liste aussi ses limites, de l'évaluation en anglais seul à une fiabilité moindre face aux entrées obscurcies.
Classificateurs à politique dans le prompt : un atout en français et en espagnol
Les modèles de garde classiques embarquent une taxonomie fixe dans leurs poids, comme les 14 catégories de risque de Llama Guard 4. Les classificateurs à politique dans le prompt (gpt-oss-safeguard, Shieldstral et le mode « apportez vos propres critères » de Granite Guardian) lisent votre politique en langage naturel au moment de l'inférence, à côté du contenu à juger. Changer de politique revient à modifier un texte, pas à collecter des données annotées et à réentraîner.
L'équipe juridique ou conformité propriétaire de la politique peut la rédiger dans la langue de l'entreprise, avec ses propres exemples : ce qui relève du conseil financier pour une banque colombienne, ou d'une allégation médicale pour un assureur français. Un seul modèle l'applique à tous les produits, et chaque changement est versionné et vérifiable.
Deux précautions. La précision dépend de la formulation : Google prévient que ShieldGemma 2 est très sensible à la rédaction des principes de sécurité. Et raisonner coûte : gpt-oss-safeguard propose un effort bas, moyen ou élevé, et Granite Guardian 4.1 un mode avec ou sans raisonnement ; d'où une cascade : un classificateur rapide en une passe d'abord, puis le juge qui raisonne pour les seuls contenus signalés ou ambigus.
Traitez la politique comme du code : un document court avec définitions et exemples par langue, un responsable, une version et des tests sur votre jeu annoté avant chaque déploiement.
Mesurer sur votre propre jeu annoté
Les chiffres des éditeurs disent qu'un modèle est plausible ; seules vos données disent s'il fonctionne.
Construisez le jeu à partir du trafic réel, dans chaque langue : demandes clairement autorisées, clairement interdites et surtout les cas limites, là où naissent les refus excessifs. Les benchmarks publics aident à l'amorcer (XSTest et OR-Bench pour les refus excessifs, SORRY-Bench pour les demandes dangereuses), mais ils sont surtout en anglais et ne connaissent pas votre politique.
| Indicateur | Pourquoi il compte | Comment le lire |
|---|---|---|
| Faux positifs (blocage excessif) | Des utilisateurs légitimes sont refusés et partent ou contournent | Par langue et par catégorie, pas seulement au global |
| Faux négatifs (préjudice manqué) | Des contenus ou actions nuisibles passent | Pondérés par gravité : un raté sur l'automutilation pèse plus que beaucoup sur la grossièreté |
| Latence | Chaque couche ajoute au moins un appel | 95e centile, de bout en bout, streaming compris |
| Coût | Les appels aux modèles de garde sont facturés comme les autres | Pour 1 000 conversations, cascade comprise |
Les chiffres des éditeurs montrent les arbitrages. Meta annonce 97,5 % de rappel pour 1 % de faux positifs avec Prompt Guard 2 86M. Les premiers Constitutional Classifiers d'Anthropic ont fait passer le succès des jailbreaks de 86 % à 4,4 % dans ses tests, pour 23,7 % de calcul et 0,38 point de refus en plus ; la cascade de 2026 a ramené les refus inutiles à environ 0,05 % et le surcoût à environ 1 %. Des repères utiles, mais aucun ne mesure votre politique dans vos langues : c'est le rôle de vos propres évaluations.
Ce que montre la recherche sur les jailbreaks
Quatre résultats, décrits au seul niveau conceptuel.
- Le many-shot jailbreaking (Anthropic, 2024) remplit un long contexte de faux dialogues où un assistant obtempère. Les réponses nuisibles augmentent avec le nombre d'exemples, et les plus grands modèles se sont montrés plus vulnérables. Entraîner le modèle à résister n'a fait que retarder l'effet ; classer et réécrire le prompt en amont a fait chuter le succès de l'attaque de 61 % à 2 % dans un test interne.
- Best-of-N (2024) renvoie une requête avec des variations de surface aléatoires jusqu'à ce que l'une passe, sans accès à l'intérieur du modèle. Avec assez d'essais, les auteurs rapportent 89 % de succès sur GPT-4o et 78 % sur Claude 3.5 Sonnet, et la méthode a aussi franchi des défenses comme les circuit breakers.
- Crescendo (Microsoft, 2024) monte en puissance sur plusieurs tours, chacun anodin pris isolément : 98 % de succès contre GPT-4 et 100 % contre Gemini Pro dans les tests de ses auteurs.
- Les bug bounties montrent ce qu'apportent les couches. Lors du défi d'Anthropic de février 2025, 339 chercheurs ont envoyé plus de 300 000 messages et un seul a trouvé un jailbreak universel. Contre le système de 2026, quelque 198 000 tentatives n'en avaient trouvé aucun en janvier 2026, avec des primes jusqu'à 35 000 $.
La leçon : le contexte long bat un modèle entraîné à la sécurité, l'échantillonnage répété bat un classificateur statique et l'escalade sur plusieurs tours bat le filtrage message par message. Classez des conversations entières, limitez le débit, surveillez les rafales de tentatives presque identiques et gardez des couches qui ne dépendent d'aucun modèle.
Un modèle de garde reste un modèle. Les fiches de Meta indiquent que Llama Guard 4 peut être sensible aux attaques adverses ou par injection de prompt, et que Prompt Guard 2 est vulnérable aux attaques adaptatives. Traitez chaque verdict comme un signal parmi d'autres, jamais comme une preuve de sécurité.
Deux architectures de référence
Un chatbot client risque surtout de mauvaises réponses ; un agent interne, de mauvaises actions.
| Étape | Chatbot face aux clients | Agent interne avec outils |
|---|---|---|
| Entrée | Classificateur léger d'injection et de jailbreak, plus un contrôle du contenu | Idem, et tout document, e-mail ou résultat d'outil est traité comme non fiable |
| Politique | Politique produit courte ; mention de l'IA dès la première interaction | Périmètre de la tâche, outils et données autorisés, dans le prompt système |
| Modèle | Bien calibré, mesuré sur les refus excessifs dans vos langues | Le modèle le plus puissant que votre évaluation justifie |
| Sortie | Classificateur à politique dans le prompt : autoriser, réécrire, bloquer ou transférer | Classificateur de sortie et contrôle de chaque appel d'outil au regard de la demande |
| Actions | Aucune au-delà de la réponse ; les changements de compte passent à un humain | Moindre privilège, listes de destinations autorisées, confirmation avant d'envoyer, payer ou supprimer |
| Supervision | Revue hebdomadaire par échantillon des refus et blocages | Validation humaine des actions à fort impact ; traces complètes |
Pour les agents, aucun classificateur ne remplace la limitation des capacités : un agent incapable d'envoyer un e-mail ne peut pas être manipulé pour exfiltrer des données par ce canal. D'autres patterns dans injection de prompt et sécurité des agents et les agents d'IA en production.
Ce que cela signifie pour les entreprises en Colombie et en Europe
Langues. Confrontez la couverture de chaque modèle de garde à votre trafic réel : Llama Guard 4 et Shieldstral incluent le français et l'espagnol, Qwen3Guard annonce 119 langues, et Granite Guardian 4.1 et ShieldGemma 2 ont été entraînés sur des données en anglais. Mesurez en français et en espagnol colombien, avec argot, fautes de frappe et mélange de langues, pas sur des benchmarks traduits.
Résidence des données. La plupart des modèles de garde ouverts sont sous Apache 2.0 et tournent sur votre propre infrastructure : le contenu filtré n'en sort pas. Leurs journaux contiennent les textes les plus sensibles de votre système : en Colombie ils relèvent de la loi 1581 de 2012, dans l'UE du RGPD, avec des règles de conservation et d'accès adaptées.
Réglementation. Dans l'UE, l'article 50 de l'AI Act impose depuis le 2 août 2026 d'informer les personnes qu'elles interagissent avec un système d'IA. À partir du 2 décembre 2026, un générateur d'images ou de vidéos capable de produire de façon prévisible et reproductible des images intimes non consenties ou des contenus pédocriminels doit disposer de garde-fous qui l'en empêchent de façon fiable, sous peine de tomber sous les nouvelles interdictions : les garde-fous deviennent alors une obligation légale. Détails dans notre carte réglementaire 2026.
Check-list de lancement
- Rédigez la politique : périmètre, définitions, exemples autorisés et interdits par langue, responsable et version.
- Constituez un jeu annoté à partir du trafic réel, cas limites compris, dans chaque langue servie.
- Choisissez les modèles de garde sur leurs erreurs, latence et coût mesurés, pas sur les tableaux des éditeurs.
- Placez d'abord un classificateur d'entrée léger et traitez tout contenu récupéré comme non fiable.
- Classez les sorties selon la même politique, avec une action définie par verdict : autoriser, réécrire, bloquer ou transférer.
- Donnez aux outils de l'agent le moindre privilège et exigez une confirmation pour les actions irréversibles.
- Journalisez entrées, sorties, verdicts et versions de modèle selon une politique de conservation ; alertez sur les rafales de tentatives et les conversations qui escaladent.
- Faites du red teaming avant le lancement, attaques sur plusieurs tours et à nombreuses tentatives comprises, puis après chaque changement de modèle ou de politique.
- Revoyez chaque semaine refus et blocages, et réinjectez les erreurs dans le jeu annoté.
L'essentiel
- Les garde-fous forment une pile de sept couches ; les permissions des outils et la journalisation tiennent même quand tous les modèles échouent.
- Les modèles de garde ouverts couvrent presque tout en 2026, plusieurs sous Apache 2.0 ; vérifiez les langues, certains ne sont entraînés qu'en anglais.
- Avec la politique dans le prompt, votre équipe juridique ou conformité la rédige et la versionne en français ou en espagnol, sans réentraînement.
- Mesurez faux positifs, faux négatifs, latence et coût sur votre propre jeu annoté ; les chiffres des éditeurs ne sont qu'un point de départ.
- Les attaques many-shot, Best-of-N et sur plusieurs tours battent chacune un filtre isolé : classez des conversations entières et surveillez les rafales de tentatives.
Sources
- Llama Guard 4 12B: model card
- Llama Prompt Guard 2 86M: model card
- Qwen3Guard-Gen-8B: model card
- Introducing gpt-oss-safeguard
- Granite Guardian 4.1 8B: model card
- Shieldstral 1.0 3B: model card
- Prompt Shields in Azure AI Content Safety
- NeMo Guardrails
- Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks
- Many-shot jailbreaking
- Best-of-N Jailbreaking
- Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Qu'est-ce qu'un modèle de garde ?
Un modèle entraîné ou paramétré pour classer des prompts, des réponses ou des images au regard d'une politique de sécurité, comme Llama Guard 4, Qwen3Guard ou gpt-oss-safeguard. Il entoure votre modèle principal et rend un verdict, pas une réponse pour l'utilisateur.
Quel modèle de garde tester en premier ?
Pour de l'auto-hébergement en français et en espagnol, comparez Llama Guard 4, Qwen3Guard et Shieldstral sur votre jeu annoté, et envisagez gpt-oss-safeguard comme juge qui raisonne pour les cas signalés. Gardez celui dont les erreurs sont les plus acceptables sur vos données.
Les garde-fous ralentissent-ils le chatbot ?
Chaque couche ajoute au moins un appel de modèle. Gardez un contrôle d'entrée léger, ne passez aux juges plus lourds que pour les contenus signalés et mesurez la latence au 95e centile de bout en bout.
Un modèle de garde peut-il être trompé ?
Oui. Les fiches de Meta elles-mêmes préviennent que Llama Guard 4 peut être sensible aux attaques adverses et Prompt Guard 2 aux attaques adaptatives. C'est pourquoi les classificateurs ne sont qu'une couche parmi d'autres, avec permissions, surveillance et revue humaine derrière.
Un bon prompt système suffit-il ?
Non. Il fixe la politique, mais les attaques many-shot, par échantillonnage répété et sur plusieurs tours sont conçues précisément pour la contourner. Associez-le à des classificateurs d'entrée et de sortie, à des limites sur les outils et à la journalisation.
D'autres analyses à lire
Injection de prompt et sécurité des agents : le risque numéro un
Pourquoi l'injection de prompt reste non résolue, ce que montrent les incidents de 2025–2026 et quels contrôles fonctionnent vraiment pour les agents.
IA locale et open sourceModèles non censurés : usages et risques
Ce que signifie retirer les garde-fous d'un modèle, pourquoi cet écosystème existe, ce qu'on y perd, ce que la loi interdit en 2026 et que faire à la place.
Agents et ingénierieAgents IA en production : ce qui marche en 2026
Workflow ou agent, les huit briques, données d'adoption et d'échec, usage de l'ordinateur, règles de conception, coûts, sécurité et check-list.
Et ensuite ?
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.