Cybersécurité · Septembre 2026

Des garde-fous qui fonctionnent : classificateurs, politiques et modération en production

Aucun filtre ne tient seul. Les garde-fous qui fonctionnent forment une pile de couches, chacune mesurée sur vos données et dans vos langues. Voici la pile que nous recommandons, avec les modèles de garde disponibles en septembre 2026.

86 % → 4,4 % succès des jailbreaks sans et avec classificateurs (Anthropic)0,05 % de refus inutiles dans la version 20267 couches dans une pile complète
En bref

Un garde-fou n'est pas un filtre mais une pile de sept couches, du filtrage des entrées à la journalisation et à la surveillance. Les modèles de garde ouverts couvrent désormais la plupart de ces couches, et certains lisent votre politique en langage naturel, un atout quand elle est rédigée en français ou en espagnol.

La recherche sur les jailbreaks montre pourquoi les couches comptent : les attaques par contexte long, par échantillonnage répété ou sur plusieurs tours battent chacune un modèle ou un filtre isolé. Mesurez chaque couche sur votre propre jeu annoté, dans chaque langue : faux positifs, faux négatifs, latence et coût.

Sept couches, pas un filtre

Chaque couche attrape une défaillance différente ; ensemble, elles couvrent ce qu'aucun modèle ne couvre seul.

Pile de référence recommandée par Slash. Tous les produits n'ont pas besoin de chaque couche à pleine puissance.
CoucheRôleOutils typesCe qu'elle attrape
1. Filtrage des entréesClasse la requête et les contenus récupérés en amont du modèlePrompt Guard 2, Prompt Shields, Qwen3GuardJailbreaks, injection, demandes hors politique
2. Politique systèmeDit ce que le produit fait et refusePrompt système versionné comme du codeDérive du périmètre
3. Choix du modèleUn modèle bien aligné et bien calibré pour la tâcheVotre batterie d'évaluationExcès et défaut de refus à la source
4. Classification des sortiesVérifie chaque réponse au regard de la politiqueLlama Guard 4, gpt-oss-safeguard, ShieldstralSorties nuisibles passées à travers
5. Permissions des outilsLimite ce qu'un agent peut faire, quoi que décide le modèleMoindre privilège, listes d'autorisation, confirmationsLes dégâts d'une injection réussie
6. Revue humaineTransmet les cas signalés ou à fort impact à une personneFile de revueCas ambigus, actions irréversibles
7. Journalisation et surveillanceEnregistre entrées, sorties et verdictsTraces, tableaux de bord, alertesAttaques lentes sur plusieurs tours, dérive, abus

Les couches 5 et 7 ne dépendent d'aucun modèle, et c'est pourquoi elles tiennent quand les autres cèdent. Le NCSC britannique dit la même chose de l'injection de prompt : la traiter comme un risque résiduel et en limiter l'impact par des contrôles déterministes, sans LLM.

Les modèles de garde disponibles en septembre 2026

Fiches de modèle et documentation des éditeurs, vérifiées en septembre 2026.
ModèleÉditeur, dateLicence, déploiementLanguesPérimètre et notes
Llama Guard 4 (12B)Meta, avr. 2025Llama 4 Community ; auto-hébergéAnglais + 7, dont français et espagnolEntrées et réponses, texte et images, 14 catégories
Prompt Guard 2 (86M, 22M)Meta, avr. 2025Llama 4 Community ; auto-hébergéMultilingue ; moins bon en 22MAttaques en entrée seulement ; vulnérable aux attaques adaptatives
ShieldGemma 2 (4B)Google, avr. 2025Conditions Gemma ; auto-hébergéEntraîné sur des données en anglaisImages seulement, trois politiques
Granite Guardian 4.1 (8B)IBM, avr. 2026Apache 2.0 ; auto-hébergéAnglaisPréjudice, jailbreak, ancrage RAG, appels d'outils ; critères sur mesure
Qwen3Guard-Gen (0.6B à 8B)Alibaba, oct. 2025Apache 2.0 ; auto-hébergé119 langues et dialectesSûr, controversé ou dangereux
gpt-oss-safeguard (20B, 120B)OpenAI, oct. 2025Apache 2.0 ; auto-hébergéÀ vérifierLit votre politique ; verdicts argumentés
Shieldstral 1.0 (3B)Mistral, août 2026Apache 2.0 ; un GPU de 16 Go12, dont français et espagnolLit votre politique ; texte et images
Moderation APIMistralAPI géréeÀ vérifierUne dizaine de catégories, entrées et sorties
NeMo Guardrails + NemoGuardNVIDIABoîte à outils Apache 2.0 ; auto-hébergéeSelon les modèlesRails en entrée, récupération, dialogue, exécution et sortie
Prompt ShieldsMicrosoftService Azure géréÀ vérifierAttaques directes et indirectes (dans les documents)
Constitutional ClassifiersAnthropic, 2025 et 2026Propriétaire ; uniquement dans ClaudeSans objetCascade en deux étapes

À noter : « modèle de garde » recouvre des métiers différents. Prompt Guard 2 et Prompt Shields cherchent des attaques dans les entrées, ShieldGemma 2 modère des images, NeMo Guardrails orchestre d'autres modèles et les autres jugent un contenu au regard d'une politique. Chaque fiche liste aussi ses limites, de l'évaluation en anglais seul à une fiabilité moindre face aux entrées obscurcies.

Classificateurs à politique dans le prompt : un atout en français et en espagnol

Les modèles de garde classiques embarquent une taxonomie fixe dans leurs poids, comme les 14 catégories de risque de Llama Guard 4. Les classificateurs à politique dans le prompt (gpt-oss-safeguard, Shieldstral et le mode « apportez vos propres critères » de Granite Guardian) lisent votre politique en langage naturel au moment de l'inférence, à côté du contenu à juger. Changer de politique revient à modifier un texte, pas à collecter des données annotées et à réentraîner.

L'équipe juridique ou conformité propriétaire de la politique peut la rédiger dans la langue de l'entreprise, avec ses propres exemples : ce qui relève du conseil financier pour une banque colombienne, ou d'une allégation médicale pour un assureur français. Un seul modèle l'applique à tous les produits, et chaque changement est versionné et vérifiable.

Deux précautions. La précision dépend de la formulation : Google prévient que ShieldGemma 2 est très sensible à la rédaction des principes de sécurité. Et raisonner coûte : gpt-oss-safeguard propose un effort bas, moyen ou élevé, et Granite Guardian 4.1 un mode avec ou sans raisonnement ; d'où une cascade : un classificateur rapide en une passe d'abord, puis le juge qui raisonne pour les seuls contenus signalés ou ambigus.

Règle pratique

Traitez la politique comme du code : un document court avec définitions et exemples par langue, un responsable, une version et des tests sur votre jeu annoté avant chaque déploiement.

Mesurer sur votre propre jeu annoté

Les chiffres des éditeurs disent qu'un modèle est plausible ; seules vos données disent s'il fonctionne.

Construisez le jeu à partir du trafic réel, dans chaque langue : demandes clairement autorisées, clairement interdites et surtout les cas limites, là où naissent les refus excessifs. Les benchmarks publics aident à l'amorcer (XSTest et OR-Bench pour les refus excessifs, SORRY-Bench pour les demandes dangereuses), mais ils sont surtout en anglais et ne connaissent pas votre politique.

Que mesurer pour chaque couche.
IndicateurPourquoi il compteComment le lire
Faux positifs (blocage excessif)Des utilisateurs légitimes sont refusés et partent ou contournentPar langue et par catégorie, pas seulement au global
Faux négatifs (préjudice manqué)Des contenus ou actions nuisibles passentPondérés par gravité : un raté sur l'automutilation pèse plus que beaucoup sur la grossièreté
LatenceChaque couche ajoute au moins un appel95e centile, de bout en bout, streaming compris
CoûtLes appels aux modèles de garde sont facturés comme les autresPour 1 000 conversations, cascade comprise

Les chiffres des éditeurs montrent les arbitrages. Meta annonce 97,5 % de rappel pour 1 % de faux positifs avec Prompt Guard 2 86M. Les premiers Constitutional Classifiers d'Anthropic ont fait passer le succès des jailbreaks de 86 % à 4,4 % dans ses tests, pour 23,7 % de calcul et 0,38 point de refus en plus ; la cascade de 2026 a ramené les refus inutiles à environ 0,05 % et le surcoût à environ 1 %. Des repères utiles, mais aucun ne mesure votre politique dans vos langues : c'est le rôle de vos propres évaluations.

Ce que montre la recherche sur les jailbreaks

Quatre résultats, décrits au seul niveau conceptuel.

  • Le many-shot jailbreaking (Anthropic, 2024) remplit un long contexte de faux dialogues où un assistant obtempère. Les réponses nuisibles augmentent avec le nombre d'exemples, et les plus grands modèles se sont montrés plus vulnérables. Entraîner le modèle à résister n'a fait que retarder l'effet ; classer et réécrire le prompt en amont a fait chuter le succès de l'attaque de 61 % à 2 % dans un test interne.
  • Best-of-N (2024) renvoie une requête avec des variations de surface aléatoires jusqu'à ce que l'une passe, sans accès à l'intérieur du modèle. Avec assez d'essais, les auteurs rapportent 89 % de succès sur GPT-4o et 78 % sur Claude 3.5 Sonnet, et la méthode a aussi franchi des défenses comme les circuit breakers.
  • Crescendo (Microsoft, 2024) monte en puissance sur plusieurs tours, chacun anodin pris isolément : 98 % de succès contre GPT-4 et 100 % contre Gemini Pro dans les tests de ses auteurs.
  • Les bug bounties montrent ce qu'apportent les couches. Lors du défi d'Anthropic de février 2025, 339 chercheurs ont envoyé plus de 300 000 messages et un seul a trouvé un jailbreak universel. Contre le système de 2026, quelque 198 000 tentatives n'en avaient trouvé aucun en janvier 2026, avec des primes jusqu'à 35 000 $.

La leçon : le contexte long bat un modèle entraîné à la sécurité, l'échantillonnage répété bat un classificateur statique et l'escalade sur plusieurs tours bat le filtrage message par message. Classez des conversations entières, limitez le débit, surveillez les rafales de tentatives presque identiques et gardez des couches qui ne dépendent d'aucun modèle.

Attention

Un modèle de garde reste un modèle. Les fiches de Meta indiquent que Llama Guard 4 peut être sensible aux attaques adverses ou par injection de prompt, et que Prompt Guard 2 est vulnérable aux attaques adaptatives. Traitez chaque verdict comme un signal parmi d'autres, jamais comme une preuve de sécurité.

Deux architectures de référence

Un chatbot client risque surtout de mauvaises réponses ; un agent interne, de mauvaises actions.

Conceptions de référence recommandées par Slash. Fixez les seuils d'après vos propres mesures.
ÉtapeChatbot face aux clientsAgent interne avec outils
EntréeClassificateur léger d'injection et de jailbreak, plus un contrôle du contenuIdem, et tout document, e-mail ou résultat d'outil est traité comme non fiable
PolitiquePolitique produit courte ; mention de l'IA dès la première interactionPérimètre de la tâche, outils et données autorisés, dans le prompt système
ModèleBien calibré, mesuré sur les refus excessifs dans vos languesLe modèle le plus puissant que votre évaluation justifie
SortieClassificateur à politique dans le prompt : autoriser, réécrire, bloquer ou transférerClassificateur de sortie et contrôle de chaque appel d'outil au regard de la demande
ActionsAucune au-delà de la réponse ; les changements de compte passent à un humainMoindre privilège, listes de destinations autorisées, confirmation avant d'envoyer, payer ou supprimer
SupervisionRevue hebdomadaire par échantillon des refus et blocagesValidation humaine des actions à fort impact ; traces complètes

Pour les agents, aucun classificateur ne remplace la limitation des capacités : un agent incapable d'envoyer un e-mail ne peut pas être manipulé pour exfiltrer des données par ce canal. D'autres patterns dans injection de prompt et sécurité des agents et les agents d'IA en production.

Ce que cela signifie pour les entreprises en Colombie et en Europe

Langues. Confrontez la couverture de chaque modèle de garde à votre trafic réel : Llama Guard 4 et Shieldstral incluent le français et l'espagnol, Qwen3Guard annonce 119 langues, et Granite Guardian 4.1 et ShieldGemma 2 ont été entraînés sur des données en anglais. Mesurez en français et en espagnol colombien, avec argot, fautes de frappe et mélange de langues, pas sur des benchmarks traduits.

Résidence des données. La plupart des modèles de garde ouverts sont sous Apache 2.0 et tournent sur votre propre infrastructure : le contenu filtré n'en sort pas. Leurs journaux contiennent les textes les plus sensibles de votre système : en Colombie ils relèvent de la loi 1581 de 2012, dans l'UE du RGPD, avec des règles de conservation et d'accès adaptées.

Réglementation. Dans l'UE, l'article 50 de l'AI Act impose depuis le 2 août 2026 d'informer les personnes qu'elles interagissent avec un système d'IA. À partir du 2 décembre 2026, un générateur d'images ou de vidéos capable de produire de façon prévisible et reproductible des images intimes non consenties ou des contenus pédocriminels doit disposer de garde-fous qui l'en empêchent de façon fiable, sous peine de tomber sous les nouvelles interdictions : les garde-fous deviennent alors une obligation légale. Détails dans notre carte réglementaire 2026.

Check-list de lancement

  1. Rédigez la politique : périmètre, définitions, exemples autorisés et interdits par langue, responsable et version.
  2. Constituez un jeu annoté à partir du trafic réel, cas limites compris, dans chaque langue servie.
  3. Choisissez les modèles de garde sur leurs erreurs, latence et coût mesurés, pas sur les tableaux des éditeurs.
  4. Placez d'abord un classificateur d'entrée léger et traitez tout contenu récupéré comme non fiable.
  5. Classez les sorties selon la même politique, avec une action définie par verdict : autoriser, réécrire, bloquer ou transférer.
  6. Donnez aux outils de l'agent le moindre privilège et exigez une confirmation pour les actions irréversibles.
  7. Journalisez entrées, sorties, verdicts et versions de modèle selon une politique de conservation ; alertez sur les rafales de tentatives et les conversations qui escaladent.
  8. Faites du red teaming avant le lancement, attaques sur plusieurs tours et à nombreuses tentatives comprises, puis après chaque changement de modèle ou de politique.
  9. Revoyez chaque semaine refus et blocages, et réinjectez les erreurs dans le jeu annoté.

L'essentiel

  • Les garde-fous forment une pile de sept couches ; les permissions des outils et la journalisation tiennent même quand tous les modèles échouent.
  • Les modèles de garde ouverts couvrent presque tout en 2026, plusieurs sous Apache 2.0 ; vérifiez les langues, certains ne sont entraînés qu'en anglais.
  • Avec la politique dans le prompt, votre équipe juridique ou conformité la rédige et la versionne en français ou en espagnol, sans réentraînement.
  • Mesurez faux positifs, faux négatifs, latence et coût sur votre propre jeu annoté ; les chiffres des éditeurs ne sont qu'un point de départ.
  • Les attaques many-shot, Best-of-N et sur plusieurs tours battent chacune un filtre isolé : classez des conversations entières et surveillez les rafales de tentatives.

Sources

  1. Llama Guard 4 12B: model card · Meta (Hugging Face), 2025-04-05
  2. Llama Prompt Guard 2 86M: model card · Meta (Hugging Face), 2025-04-05
  3. Qwen3Guard-Gen-8B: model card · Alibaba Qwen (Hugging Face), 2025-10-16
  4. Introducing gpt-oss-safeguard · OpenAI, 2025-10-29
  5. Granite Guardian 4.1 8B: model card · IBM (Hugging Face), 2026-04
  6. Shieldstral 1.0 3B: model card · Mistral AI (Hugging Face), 2026-08
  7. Prompt Shields in Azure AI Content Safety · Microsoft Learn, 2026-09-18
  8. NeMo Guardrails · NVIDIA (GitHub), 2026-09
  9. Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks · Anthropic, 2026-01-09
  10. Many-shot jailbreaking · Anthropic, 2024-04-02
  11. Best-of-N Jailbreaking · Hughes et al. (arXiv), 2024-12-04
  12. Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack · Russinovich, Salem and Eldan, Microsoft (arXiv), 2024-04-02

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Qu'est-ce qu'un modèle de garde ?

Un modèle entraîné ou paramétré pour classer des prompts, des réponses ou des images au regard d'une politique de sécurité, comme Llama Guard 4, Qwen3Guard ou gpt-oss-safeguard. Il entoure votre modèle principal et rend un verdict, pas une réponse pour l'utilisateur.

Quel modèle de garde tester en premier ?

Pour de l'auto-hébergement en français et en espagnol, comparez Llama Guard 4, Qwen3Guard et Shieldstral sur votre jeu annoté, et envisagez gpt-oss-safeguard comme juge qui raisonne pour les cas signalés. Gardez celui dont les erreurs sont les plus acceptables sur vos données.

Les garde-fous ralentissent-ils le chatbot ?

Chaque couche ajoute au moins un appel de modèle. Gardez un contrôle d'entrée léger, ne passez aux juges plus lourds que pour les contenus signalés et mesurez la latence au 95e centile de bout en bout.

Un modèle de garde peut-il être trompé ?

Oui. Les fiches de Meta elles-mêmes préviennent que Llama Guard 4 peut être sensible aux attaques adverses et Prompt Guard 2 aux attaques adaptatives. C'est pourquoi les classificateurs ne sont qu'une couche parmi d'autres, avec permissions, surveillance et revue humaine derrière.

Un bon prompt système suffit-il ?

Non. Il fixe la politique, mais les attaques many-shot, par échantillonnage répété et sur plusieurs tours sont conçues précisément pour la contourner. Associez-le à des classificateurs d'entrée et de sortie, à des limites sur les outils et à la journalisation.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban