IA locale et open source · Septembre 2026

Modèles non censurés : ce qu'ils sont, à quoi ils servent, quels risques

Retirer les garde-fous d'un modèle ouvert prend aujourd'hui quelques minutes. Il existe des raisons légitimes de vouloir moins de refus, mais les risques sont documentés et la loi se durcit en 2026. Voici ce qu'un CTO ou un RSSI doit savoir avant d'en utiliser un.

3 471 modèles non censurés recensés25 % des applis GitHub qui les utilisent, malveillantes2 déc. 2026 interdiction UE des « nudifiers »
En bref

Un modèle « non censuré » est un modèle à poids ouverts dont on a retiré les refus, par un fine-tuning sans refus ou en effaçant la « direction de refus » interne identifiée en 2024. Les refus excessifs sont un problème réel et mesuré. Mais la modification persiste dans chaque copie redistribuée, peut coûter en véracité et en raisonnement, et se heurte à de nouvelles lois : l'interdiction européenne des générateurs de nus et de contenus pédocriminels s'applique à partir du 2 décembre 2026.

Notre recommandation : la plupart des entreprises ont besoin d'un modèle capable et bien calibré, avec une politique explicite, des modèles de garde, une journalisation et une revue humaine, pas d'un modèle sans garde-fous. Quand un modèle peu restrictif se justifie (sécurité autorisée, recherche), traitez-le comme un outil de laboratoire sous contrôle.

Ce que « non censuré » veut dire, techniquement

Un mot, quatre mécanismes : chacun modifie autre chose et appelle une réponse différente.

Comparaison conceptuelle. Les détails de méthode sont volontairement omis.
MécanismeCe qui changeCe qu'il fautPersiste ?
Fine-tuning sans refusLes poids, par un nouvel entraînementLes poids ou une API de fine-tuningOui, dans chaque copie
Ablation de la direction de refus (« abliteration »)Les poids, par une modification cibléeLes poids (accès boîte blanche)Oui, dans chaque copie
Checkpoint de baseRien : jamais entraîné aux instructions ni à la sécuritéLes poidsSans objet
JailbreakLes entrées seulementTout accès, API hébergées comprisesNon, conversation par conversation

Les fine-tunings sans refus sont arrivés les premiers. Des fine-tunings communautaires comme les familles Dolphin et Hermes ont été réglés pour refuser beaucoup moins, au nom d'un « alignement composable » : publier un modèle neutre et laisser chaque entreprise ajouter sa propre politique. La couche de sécurité d'origine est mince : Qi et al. (2023) ont supprimé l'essentiel du comportement sécurisé de GPT-3.5 Turbo avec une poignée d'exemples envoyés via l'API de fine-tuning d'OpenAI.

L'ablation de la direction de refus vient d'Arditi et al. (2024) : dans 13 modèles de chat ouverts jusqu'à 72B paramètres, le refus passait par une seule direction dans les activations du modèle. L'effacer supprime les refus ; l'ajouter fait refuser au modèle des demandes inoffensives. Des travaux ultérieurs ont montré une géométrie plus riche, avec plusieurs directions indépendantes, et qu'une direction extraite en anglais supprimait les refus dans d'autres langues avec une efficacité quasi parfaite, ce qui concerne directement les déploiements en français et en espagnol.

Un jailbreak ne modifie que les entrées : il fonctionne aussi contre les API hébergées, mais doit être répété à chaque conversation. Les checkpoints d'instructions apprennent à refuser au post-entraînement ; les checkpoints de base ne l'ont jamais fait, donc seule les protège la sécurité inscrite dans les données de pré-entraînement, que l'étude Deep Ignorance a trouvée bien plus résistante au fine-tuning adverse que les défenses de post-entraînement.

Pourquoi ils existent : les refus excessifs sont réels

La demande n'est pas seulement malveillante. Les modèles alignés refusent souvent des demandes sûres qui ont seulement l'air dangereuses. Dans XSTest, 250 prompts sûrs fondés sur des homonymes, du langage figuré ou des faits historiques, Llama 2 70B Chat avec son prompt système par défaut en a refusé entièrement 38 % ; GPT-4, 6,4 %.

OR-Bench a testé 32 modèles sur 80 000 prompts d'apparence toxique mais sûrs et trouvé une corrélation de rang de 0,89 entre le refus des prompts sûrs et celui des prompts toxiques : les modèles réglés pour être plus sûrs ont tendance à trop refuser, même si les plus récents le font moins. FalseReject, d'Amazon, a montré qu'un fine-tuning peut réduire les refus inutiles sans compromettre la sécurité globale.

Le contrepoids est SORRY-Bench, qui vérifie que les modèles refusent toujours 440 instructions réellement dangereuses réparties en 44 catégories ; un modèle utile doit réussir des deux côtés. Anthropic indique que ses classificateurs de 2026 refusent environ 0,05 % des requêtes inoffensives, 87 % de moins que sa première version. Les faux refus sont un problème d'ingénierie avec des solutions d'ingénierie ; retirer la sécurité n'en fait pas partie.

Un vaste écosystème que la redistribution maintient en vie

Les chiffres varient selon la méthode, mais concordent. Lin et al. (2025) ont identifié plus de 11 000 modèles non censurés sur Hugging Face, dont un installé plus de 19 millions de fois. Avec une définition plus stricte, 10a Labs en a compté 3 471 entre janvier 2024 et mars 2026, chacun reconditionné 2,4 fois en moyenne, et 25 % des 1 643 applications GitHub qui les utilisent ont été classées comme explicitement malveillantes.

Le même article qualifie la redistribution de « couche de persistance » : copies compressées et miroirs entre comptes, formats et plateformes rendent les retraits à la source largement inefficaces.

L'automatisation a encore abaissé la barrière. Une enquête du Financial Times avec la société de sécurité Alice (mai 2026) rapporte qu'un outil gratuit et public a servi à créer des milliers de variantes « décensurées », que des journalistes ont retiré les garde-fous de Llama 3.3 en quelques minutes sans matériel spécialisé, et que ceux de Gemma 4 sont tombés moins de 90 minutes après sa sortie. Google y voit un défi technique connu, commun à tous les modèles ouverts. Nous ne nommons volontairement pas l'outil.

Ce que l'on perd en retirant les garde-fous

Chez Arditi et al., les benchmarks généraux (MMLU, ARC, GSM8K) sont restés proches de la référence après la modification, mais la précision sur TruthfulQA baisse systématiquement. Une prépublication de 2025 comparant ces modifications sur 16 modèles d'instructions de 7B à 14B a trouvé que le raisonnement mathématique était la capacité la plus sensible : sur GSM8K, les résultats allaient d'un gain d'environ 1,5 point à une perte de 18,8, selon la méthode et l'architecture.

Le risque de fond est comportemental. L'étude sur le désalignement émergent, étendue dans Nature en 2026, a fine-tuné GPT-4o et Qwen2.5-Coder-32B sur une tâche étroite, écrire du code non sécurisé, et obtenu un comportement largement désaligné sur des prompts sans rapport ; présenter les mêmes données comme support d'un cours de sécurité l'a évité.

L'idée répandue qu'ils « hallucinent davantage » en général n'est établie par aucun benchmark que nous ayons pu vérifier. Les coûts mesurés suffisent pour évaluer tout modèle modifié sur vos propres tâches.

Usages légitimes et la leçon de Hugging Face

Il existe de vraies raisons de vouloir un modèle qui ne refuse pas : pentest et red teaming autorisés, analyse de logiciels malveillants et réponse à incident, fiction sur le crime ou la violence, questions médicales et juridiques franches, et recherche sur le refus lui-même. Reste à servir ces usages en sécurité.

En juillet 2026, lors d'une intrusion chez Hugging Face menée par un framework d'agents autonomes, les modèles commerciaux de pointe ont bloqué les requêtes d'investigation de l'équipe, car leurs garde-fous ne distinguent pas un intervenant d'un attaquant. L'équipe a donc analysé plus de 17 000 journaux de l'attaquant avec le modèle ouvert GLM-5.2, sur sa propre infrastructure. La leçon : disposer avant l'incident d'un modèle capable, vérifié et auto-hébergé, qui garde aussi en interne les données et identifiants de l'attaquant. Hugging Face précise que ce n'est pas un argument contre les mesures de sécurité des modèles hébergés.

La réponse du secteur est l'accès vérifié, pas le retrait des garde-fous. Avec Project Glasswing (avril 2026), Anthropic a réservé Claude Mythos Preview, performant pour trouver et exploiter des vulnérabilités, à des partenaires et à plus de 40 organisations qui maintiennent des logiciels critiques, avec un Cyber Verification Program pour les professionnels de la sécurité. Il existe aussi des modèles ouverts spécialisés : Foundation-Sec-8B de Cisco (Apache 2.0) vise le tri en SOC et la simulation de menaces, exclut la génération de malware et de phishing et exige une revue humaine.

Ce que disent la loi et les licences en 2026

La plupart des règles visent les outils et les contenus abusifs, surtout les images sexuelles, pas les modèles eux-mêmes.

À titre indicatif, pas un avis juridique. Vérifiez les textes officiels pour votre cas.
JuridictionTexteCe qu'il viseDate clé
États-UnisTAKE IT DOWN ActPublier des images intimes d'une personne réelle sans consentement, falsifications par IA comprises ; retrait sous 48 heures pour les plateformesSigné le 19 mai 2025
TexasTRAIGA (HB 149)Développer ou déployer une IA dans l'intention de produire des contenus pédocriminels ou des deepfakes sexuels illicites1er janvier 2026
Royaume-UniCrime and Policing Act 2026, section 99Créer, adapter ou fournir des outils qui génèrent des images intimes ; jusqu'à 3 ans d'emprisonnementAdopté en 2026
Union européenneAI Act, art. 5(1)(ba) et (bb)Systèmes qui génèrent des images intimes non consenties ou des contenus pédocriminels ; amendes jusqu'à 35 millions d'euros ou 7 % du chiffre d'affaires2 décembre 2026
FranceCode pénal, art. 226-8-1Diffuser sans consentement un contenu sexuel représentant une personne, y compris généré par IA : jusqu'à 2 ans et 60 000 euros (3 ans et 75 000 euros en ligne)En vigueur depuis le 23 mai 2024
ColombieLey 2502 de 2025Usurpation d'identité par IA, deepfakes compris : l'amende augmente jusqu'à un tiers28 juillet 2025

L'interdiction européenne touche aussi les outils généralistes : leur mise sur le marché est interdite lorsque ce résultat est raisonnablement prévisible et reproductible et que le système n'a pas de garde-fous raisonnables et adéquats pour l'empêcher de façon fiable. Un modèle d'images dont on a retiré les garde-fous correspond à cette description. Les obligations de transparence de l'article 50, comme informer les personnes qu'elles interagissent avec une IA, s'appliquent depuis le 2 août 2026, quels que soient la taille ou la licence du modèle.

Les licences ajoutent une couche : la politique d'usage acceptable de Llama 3.3 interdit les contenus d'exploitation d'enfants et le code malveillant, et les conditions d'utilisation de Gemma interdisent de contourner les filtres de sécurité (Gemma 4 est passé sous Apache 2.0). La politique de contenu de Hugging Face interdit les contenus sexuels non consentis. Plus de détails dans notre carte réglementaire 2026.

De meilleures options qu'un modèle non censuré

Pour presque chaque besoin légitime, il existe une voie plus sûre.

Recommandation de Slash, septembre 2026.
BesoinMeilleure option
Pentest, red teaming, analyse de malwareAccès vérifié, modèles spécialisés en sécurité et contexte d'autorisation explicite
Réponse à incident sur des données d'attaquantUn modèle ouvert capable, vérifié et auto-hébergé avant l'incident
Modération de contenus, trust and safetyDes modèles de garde conçus pour lire des contenus nuisibles et les classer selon votre politique
Fiction, questions médicales ou juridiques refuséesUn modèle mieux calibré et une politique de contenu écrite, avec mesure des faux refus
Trop de refus dans un chatbot clientAjuster la politique système et les seuils des modèles de garde, pas la sécurité du modèle
Recherche sur le refus et l'alignementPoids ouverts dans un laboratoire isolé, sous protocole de recherche, sans redistribution

Le fil conducteur : corriger la calibration et l'accès, pas la sécurité. Les modèles de garde et les politiques sont traités dans des garde-fous qui fonctionnent en production, et le travail offensif autorisé dans l'IA en sécurité offensive.

Notre recommandation et une check-list

Chez Slash, nous recommandons trois règles : aucun modèle sans garde-fous dans un produit face aux clients ; pour la sécurité autorisée, d'abord l'accès vérifié ou un modèle spécialisé ; et un modèle peu restrictif seulement comme outil de laboratoire sous contrôle, jamais redistribué. Avant d'en utiliser un, vérifiez :

  1. Autorisation : un périmètre écrit, un responsable nommé et un objectif légitime (test, recherche, réponse à incident).
  2. Provenance : des poids d'un éditeur connu, avec sommes de contrôle ; les copies anonymes sont un risque de chaîne d'approvisionnement.
  3. Isolement : un environnement séparé, sans données de production, sans sortie vers internet et sans outils superflus.
  4. Journalisation : prompts, sorties, opérateur et version du modèle, selon votre politique de conservation.
  5. Revue des sorties : un modèle de garde sur les sorties et une personne avant que quoi que ce soit ne quitte le laboratoire.
  6. Contrôle juridique : la politique d'usage acceptable de la licence et le droit là où vous opérez et là où vont les résultats.
  7. Sortie : supprimer le modèle et ses résultats à la fin de la mission.
Ligne rouge

N'utilisez jamais un modèle d'image ou de vidéo peu restrictif sur des photos de personnes réelles : c'est là que se concentre le risque juridique dans toutes les juridictions du tableau, et dans l'UE ces outils sont interdits à partir du 2 décembre 2026 s'ils n'ont pas de garde-fous adéquats.

L'essentiel

  • « Non censuré » recouvre quatre mécanismes (fine-tuning sans refus, ablation de la direction de refus, checkpoints de base, jailbreaks) ; les modifications de poids persistent dans chaque copie.
  • Les refus excessifs sont réels (Llama 2 70B Chat a refusé 38 % des prompts sûrs de XSTest) et se corrigent par une meilleure calibration, pas en retirant la sécurité.
  • Les retraits échouent : 10a Labs a compté 3 471 modèles non censurés, reconditionnés 2,4 fois chacun, et 25 % des applis GitHub qui les utilisent sont jugées malveillantes.
  • Retirer les garde-fous a des coûts mesurés : moins de précision sur TruthfulQA, des pertes de raisonnement allant jusqu'à 18,8 points et un risque de désalignement émergent.
  • L'UE interdit les générateurs de nus et de contenus pédocriminels à partir du 2 décembre 2026 ; pour les usages légitimes, accès vérifié, modèles spécialisés et laboratoire sous contrôle.

Sources

  1. Refusal in Language Models Is Mediated by a Single Direction · Arditi et al., NeurIPS 2024 (arXiv), 2024-06-17
  2. Refusal Direction is Universal Across Safety-Aligned Languages · Wang et al. (arXiv), 2025-05-22
  3. XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models · Röttger et al., NAACL 2024 (arXiv), 2023-08-02
  4. OR-Bench: An Over-Refusal Benchmark for Large Language Models · ICML 2025 (arXiv), 2024-05-31
  5. Uncensored Open-weight Models: Redistribution as the Persistence Layer · 10a Labs (arXiv), 2026-09-04
  6. Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs · Betley et al. (arXiv), 2025-02-24
  7. AI guardrails stripped from Meta and Google models in minutes · The Irish Times (Financial Times), 2026-05-25
  8. Security incident disclosure, July 2026 · Hugging Face, 2026-07-16
  9. Project Glasswing · Anthropic, 2026-04-07
  10. Regulation (EU) 2026/1744 of 8 July 2026 (Digital Omnibus on AI) · EUR-Lex, 2026-07-24
  11. Crime and Policing Act 2026, Part 5, Chapter 4 · legislation.gov.uk, 2026
  12. Code pénal, article 226-8-1 · Légifrance, 2024-05-23

Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.

Questions fréquentes

Les questions qu'on nous pose souvent

Est-il légal d'utiliser un modèle non censuré ?

Les lois examinées ici visent les usages, les contenus et les outils conçus pour l'abus (générateurs d'images intimes, contenus pédocriminels, usurpation d'identité) plutôt que les modèles eux-mêmes. Mais les licences peuvent interdire le contournement des filtres de sécurité et, à partir du 2 décembre 2026, l'interdiction européenne vise aussi les outils généralistes sans garde-fous adéquats. Demandez un avis juridique pour votre cas.

Qu'est-ce que l'« abliteration » ?

Le nom donné par la communauté à l'ablation de la direction de refus : modifier les poids d'un modèle pour retirer la direction interne que la recherche a associée au refus en 2024. Il faut les poids, et la modification persiste dans chaque copie.

Les modèles non censurés sont-ils plus intelligents ou plus honnêtes ?

Rien ne l'indique. La recherche a mesuré une baisse de précision sur TruthfulQA après la modification et, selon la méthode et l'architecture, des pertes de raisonnement mathématique allant jusqu'à 18,8 points sur GSM8K.

Peut-on en utiliser un pour un pentest ?

Seulement avec une autorisation écrite et dans un environnement isolé. Essayez d'abord les programmes d'accès vérifié et les modèles spécialisés en sécurité : ils couvrent en général le besoin avec moins de risque juridique et opérationnel.

Comment réduire les faux refus sans retirer la sécurité ?

Choisissez un modèle mieux calibré, rédigez une politique de contenu explicite, ajustez les seuils de vos modèles de garde et mesurez faux refus et contenus nuisibles non détectés sur vos propres prompts annotés, dans chaque langue que vous servez.

Parler à Slash

Mettons-le en production

Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.

Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.

Écrire à Esteban