IA local y open source · Septiembre 2026

Modelos sin censura: qué son, para qué sirven y qué riesgos tienen

Quitarle las salvaguardas a un modelo abierto hoy toma minutos. Hay razones legítimas para querer menos rechazos, pero los riesgos están documentados y la ley se endurece en 2026. Esto es lo que un CTO o un CISO debe saber antes de usar uno.

3.471 modelos sin censura rastreados25 % de las apps de GitHub que los usan, maliciosas2 dic. 2026 veto de la UE a apps para desnudar
En resumen

Un modelo “sin censura” es un modelo de pesos abiertos al que le quitaron los rechazos, con un ajuste fino sin negativas o borrando la “dirección de rechazo” interna identificada en 2024. El exceso de rechazos es un problema real y medido. Pero el cambio persiste en cada copia redistribuida, puede costar veracidad y razonamiento y choca con leyes nuevas: la prohibición europea de los generadores de desnudos y de abuso sexual infantil aplica desde el 2 de diciembre de 2026.

Nuestra recomendación: la mayoría de las empresas necesita un modelo capaz y bien calibrado, con una política explícita, modelos guardianes, registros y revisión humana, no un modelo sin salvaguardas. Cuando uno con pocos rechazos se justifica (seguridad autorizada, investigación), trátalo como una herramienta de laboratorio controlada.

Qué significa “sin censura”, técnicamente

Una palabra, cuatro mecanismos: cada uno cambia algo distinto y pide una respuesta distinta.

Comparación conceptual. Omitimos a propósito los detalles de método.
MecanismoQué cambiaQué requiere¿Persiste?
Ajuste fino sin rechazosLos pesos, con un nuevo entrenamientoLos pesos o una API de ajuste finoSí, en cada copia
Ablación de la dirección de rechazo (“abliteration”)Los pesos, con una edición puntualLos pesos (acceso de caja blanca)Sí, en cada copia
Checkpoint baseNada: nunca tuvo ajuste de instrucciones ni de seguridadLos pesosNo aplica
JailbreakSolo las entradasCualquier acceso, incluidas las API alojadasNo, conversación por conversación

Los ajustes finos sin rechazos llegaron primero. Ajustes comunitarios como las familias Dolphin y Hermes se entrenaron para rechazar mucho menos, con el argumento de la “alineación componible”: publicar un modelo neutro y que cada empresa añada su propia política. La capa de seguridad original es delgada: Qi et al. (2023) eliminaron la mayor parte del comportamiento seguro de GPT-3.5 Turbo con un puñado de ejemplos enviados por la API de ajuste fino de OpenAI.

La ablación de la dirección de rechazo viene de Arditi et al. (2024): en 13 modelos de chat abiertos de hasta 72B parámetros, el rechazo dependía de una sola dirección en las activaciones del modelo. Borrarla suprime los rechazos; sumarla hace que el modelo rechace pedidos inofensivos. Trabajos posteriores encontraron una geometría más rica, con varias direcciones independientes, y mostraron que una dirección extraída en inglés suprimía los rechazos en otros idiomas con una eficacia casi perfecta, algo que concierne directamente a los despliegues en español y francés.

Un jailbreak cambia solo las entradas: funciona también contra las API alojadas, pero hay que repetirlo en cada conversación. Los checkpoints de instrucciones aprenden a rechazar en el postentrenamiento; los checkpoints base nunca lo hicieron, así que solo los protege la seguridad incorporada en los datos de preentrenamiento, que el estudio Deep Ignorance encontró mucho más resistente al ajuste fino adversarial que las defensas de postentrenamiento.

Por qué existen: el exceso de rechazos es real

La demanda no es solo maliciosa. Los modelos alineados rechazan a menudo pedidos seguros que solo parecen peligrosos. En XSTest, 250 prompts seguros con homónimos, lenguaje figurado o hechos históricos, Llama 2 70B Chat con su prompt de sistema por defecto rechazó por completo el 38 %; GPT-4, el 6,4 %.

OR-Bench probó 32 modelos con 80.000 prompts de apariencia tóxica pero seguros y encontró una correlación de rangos de 0,89 entre rechazar prompts seguros y tóxicos: los modelos ajustados para ser más seguros tienden a rechazar de más, aunque los más recientes lo hacen menos. FalseReject, de Amazon, mostró que un ajuste fino puede reducir los rechazos innecesarios sin comprometer la seguridad general.

El contrapeso es SORRY-Bench, que verifica que los modelos sigan rechazando 440 instrucciones realmente inseguras en 44 categorías; un modelo útil debe salir bien en ambos lados. Anthropic reporta que sus clasificadores de 2026 rechazan cerca del 0,05 % de las consultas inofensivas, un 87 % menos que su primera versión. Los falsos rechazos son un problema de ingeniería con soluciones de ingeniería; quitar la seguridad no es una de ellas.

Un ecosistema grande que la redistribución mantiene vivo

Las cifras varían según el método, pero coinciden. Lin et al. (2025) identificaron más de 11.000 modelos sin censura en Hugging Face, uno con más de 19 millones de instalaciones. Con una definición más estricta, 10a Labs contó 3.471 entre enero de 2024 y marzo de 2026, cada uno reempaquetado 2,4 veces en promedio, y el 25 % de las 1.643 aplicaciones de GitHub que los usan se clasificó como explícitamente maliciosa.

El mismo artículo llama a la redistribución “la capa de persistencia”: las copias comprimidas y los espejos entre cuentas, formatos y plataformas vuelven casi inútiles las bajas en el origen.

La automatización bajó aún más la barrera. Una investigación del Financial Times con la firma de seguridad Alice (mayo de 2026) reportó que una herramienta gratuita y pública sirvió para crear miles de variantes “descensuradas”, que los periodistas quitaron las salvaguardas de Llama 3.3 en minutos sin hardware especializado y que las de Gemma 4 cayeron menos de 90 minutos después de su lanzamiento. Google lo calificó como un desafío técnico conocido que enfrentan todos los modelos abiertos. A propósito, no nombramos la herramienta.

Lo que se pierde al quitar las salvaguardas

En Arditi et al., los benchmarks generales (MMLU, ARC, GSM8K) se mantuvieron cerca de la línea base tras la edición, pero la precisión en TruthfulQA cae de forma consistente. Un preprint de 2025 que comparó ediciones de este tipo en 16 modelos de instrucciones de 7B a 14B encontró que el razonamiento matemático es la capacidad más sensible: en GSM8K, los resultados iban de una ganancia de unos 1,5 puntos a una pérdida de 18,8, según método y arquitectura.

El riesgo de fondo es de comportamiento. El estudio sobre desalineación emergente, ampliado en Nature en 2026, ajustó GPT-4o y Qwen2.5-Coder-32B en una tarea estrecha, escribir código inseguro, y obtuvo un comportamiento desalineado en prompts sin relación; presentar los mismos datos como material de un curso de seguridad lo evitó.

Ningún benchmark que pudiéramos verificar respalda la idea de que “alucinan más” en general; los costos medidos bastan para evaluar cualquier modelo modificado con tus propias tareas.

Usos legítimos y la lección de Hugging Face

Hay razones reales para querer un modelo que no se niegue: pentest y red teaming autorizados, análisis de malware y respuesta a incidentes, ficción sobre el crimen o la violencia, preguntas médicas y legales francas, y la investigación sobre el propio rechazo. La pregunta es cómo atender esos usos de forma segura.

En julio de 2026, durante una intrusión en Hugging Face ejecutada por un framework de agentes autónomos, los modelos comerciales de frontera bloquearon las peticiones forenses del equipo porque sus guardrails no distinguen a quien responde a un incidente de un atacante. El equipo analizó entonces más de 17.000 registros del atacante con el modelo abierto GLM-5.2, en su propia infraestructura. La lección: tener listo, antes del incidente, un modelo capaz, verificado y autoalojado, que además deja en casa los datos y credenciales del atacante. Hugging Face aclara que no es un argumento contra las medidas de seguridad de los modelos alojados.

La respuesta de la industria es el acceso verificado, no quitar salvaguardas. Con Project Glasswing (abril de 2026), Anthropic restringió Claude Mythos Preview, fuerte para encontrar y explotar vulnerabilidades, a socios y a más de 40 organizaciones que mantienen software crítico, con un Cyber Verification Program para profesionales de seguridad. También hay modelos abiertos especializados: Foundation-Sec-8B de Cisco (Apache 2.0) apunta al triaje en el SOC y la simulación de amenazas, excluye la generación de malware y phishing y exige revisión humana.

Qué dicen la ley y las licencias en 2026

Casi todas las normas apuntan a herramientas y resultados abusivos, sobre todo imágenes sexuales, no a los modelos.

Solo orientación, no es asesoría legal. Revisa los textos oficiales para tu caso.
JurisdicciónNormaQué atacaFecha clave
Estados UnidosTAKE IT DOWN ActPublicar imágenes íntimas de una persona real sin consentimiento, incluidas las falsificaciones con IA; retiro en 48 horas para las plataformasFirmada el 19 de mayo de 2025
TexasTRAIGA (HB 149)Desarrollar o desplegar IA con la intención de producir material de abuso sexual infantil o deepfakes sexuales ilegales1 de enero de 2026
Reino UnidoCrime and Policing Act 2026, sección 99Crear, adaptar o suministrar herramientas que generan imágenes íntimas; hasta 3 años de prisiónPromulgada en 2026
Unión EuropeaAI Act, art. 5(1)(ba) y (bb)Sistemas que generan imágenes íntimas sin consentimiento o material de abuso sexual infantil; multas de hasta 35 millones de euros o el 7 % de la facturación2 de diciembre de 2026
FranciaCode pénal, art. 226-8-1Difundir sin consentimiento contenido sexual de una persona, incluido el generado con IA: hasta 2 años y 60.000 euros (3 años y 75.000 en línea)Vigente desde el 23 de mayo de 2024
ColombiaLey 2502 de 2025Suplantación con IA, incluidos los deepfakes: la multa aumenta hasta en una tercera parte28 de julio de 2025

La prohibición europea alcanza también a las herramientas de uso general: queda prohibido comercializar una si ese resultado es razonablemente previsible y reproducible y el sistema no tiene salvaguardas razonables y adecuadas para impedirlo de forma fiable. Un modelo de imágenes al que le quitaron las salvaguardas encaja en esa descripción. Las obligaciones de transparencia del artículo 50, como avisar a las personas de que interactúan con una IA, aplican desde el 2 de agosto de 2026, sin importar el tamaño ni la licencia del modelo.

Las licencias suman otra capa: la política de uso aceptable de Llama 3.3 prohíbe el contenido de explotación infantil y el código malicioso, y los términos de uso de Gemma prohíben intentar anular o eludir los filtros de seguridad (Gemma 4 pasó a Apache 2.0). La política de contenido de Hugging Face prohíbe el contenido sexual sin consentimiento. Más en nuestro mapa regulatorio de 2026.

Mejores opciones que un modelo sin censura

Para casi cada necesidad legítima hay un camino más seguro.

Recomendación de Slash, septiembre de 2026.
NecesidadMejor opción
Pentest, red teaming, análisis de malwareAcceso verificado, modelos especializados en seguridad y un contexto de autorización explícito
Respuesta a incidentes con datos del atacanteUn modelo abierto capaz, verificado y autoalojado antes del incidente
Moderación de contenido, trust and safetyModelos guardianes hechos para leer contenido dañino y clasificarlo según tu política
Ficción o preguntas médicas y legales rechazadasUn modelo mejor calibrado y una política de contenido escrita, midiendo los falsos rechazos
Demasiados rechazos en un chatbot de clientesAjustar la política del sistema y los umbrales de los guardianes, no la seguridad del modelo
Investigación sobre rechazo y alineaciónPesos abiertos en un laboratorio aislado, con protocolo de investigación y sin redistribución

El hilo común: corregir la calibración y el acceso, no la seguridad. Los modelos guardianes y las políticas están en guardrails que funcionan en producción y el trabajo ofensivo autorizado en IA en seguridad ofensiva.

Nuestra recomendación y una checklist

En Slash recomendamos tres reglas: ningún modelo sin salvaguardas en productos de cara al cliente; para seguridad autorizada, primero acceso verificado o un modelo especializado; y un modelo con pocos rechazos solo como herramienta de laboratorio controlada, nunca redistribuida. Antes de usar uno, revisa:

  1. Autorización: un alcance escrito, un responsable con nombre y un propósito legítimo (prueba, investigación, respuesta a incidentes).
  2. Procedencia: pesos de un publicador conocido, con sumas de verificación; las copias anónimas son un riesgo de cadena de suministro.
  3. Aislamiento: un entorno separado, sin datos de producción, sin salida a internet y sin herramientas innecesarias.
  4. Registro: prompts, respuestas, operador y versión del modelo, según tu política de retención.
  5. Revisión de salidas: un modelo guardián sobre las respuestas y una persona antes de que algo salga del laboratorio.
  6. Revisión legal: la política de uso aceptable de la licencia y la ley donde operas y donde se usan los resultados.
  7. Cierre: borrar el modelo y sus resultados al terminar el trabajo.
Línea roja

Nunca uses un modelo de imagen o video con pocos rechazos sobre fotos de personas reales: ahí se concentra la exposición legal en todas las jurisdicciones de la tabla, y en la UE esas herramientas quedan prohibidas desde el 2 de diciembre de 2026 si no tienen salvaguardas adecuadas.

Lo esencial

  • “Sin censura” abarca cuatro mecanismos (ajuste fino sin rechazos, ablación de la dirección de rechazo, checkpoints base, jailbreaks); las ediciones de pesos persisten en cada copia.
  • El exceso de rechazos es real (Llama 2 70B Chat rechazó el 38 % de los prompts seguros de XSTest) y se corrige calibrando mejor, no quitando la seguridad.
  • Las bajas no funcionan: 10a Labs contó 3.471 modelos sin censura, reempaquetados 2,4 veces cada uno, y el 25 % de las apps de GitHub que los usan resultó maliciosa.
  • Quitar salvaguardas tiene costos medidos: menos precisión en TruthfulQA, pérdidas de razonamiento de hasta 18,8 puntos y riesgo de desalineación emergente.
  • La UE prohíbe los generadores de desnudos y de abuso sexual infantil desde el 2 de diciembre de 2026; para usos legítimos, acceso verificado, modelos especializados y un laboratorio controlado.

Fuentes

  1. Refusal in Language Models Is Mediated by a Single Direction · Arditi et al., NeurIPS 2024 (arXiv), 2024-06-17
  2. Refusal Direction is Universal Across Safety-Aligned Languages · Wang et al. (arXiv), 2025-05-22
  3. XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models · Röttger et al., NAACL 2024 (arXiv), 2023-08-02
  4. OR-Bench: An Over-Refusal Benchmark for Large Language Models · ICML 2025 (arXiv), 2024-05-31
  5. Uncensored Open-weight Models: Redistribution as the Persistence Layer · 10a Labs (arXiv), 2026-09-04
  6. Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs · Betley et al. (arXiv), 2025-02-24
  7. AI guardrails stripped from Meta and Google models in minutes · The Irish Times (Financial Times), 2026-05-25
  8. Security incident disclosure, July 2026 · Hugging Face, 2026-07-16
  9. Project Glasswing · Anthropic, 2026-04-07
  10. Regulation (EU) 2026/1744 of 8 July 2026 (Digital Omnibus on AI) · EUR-Lex, 2026-07-24
  11. Crime and Policing Act 2026, Part 5, Chapter 4 · legislation.gov.uk, 2026
  12. Code pénal, article 226-8-1 · Légifrance, 2024-05-23

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Es legal usar un modelo sin censura?

Las leyes revisadas aquí apuntan a usos, resultados y herramientas hechas para el abuso (generadores de imágenes íntimas, material de abuso sexual infantil, suplantación) más que a los modelos en sí. Pero las licencias pueden prohibir eludir los filtros de seguridad y, desde el 2 de diciembre de 2026, la prohibición de la UE alcanza también herramientas generales sin salvaguardas adecuadas. Busca asesoría legal para tu caso.

¿Qué es la “abliteration”?

El nombre que la comunidad da a la ablación de la dirección de rechazo: editar los pesos de un modelo para quitar la dirección interna que la investigación asoció al rechazo en 2024. Requiere los pesos, y el cambio persiste en cada copia.

¿Los modelos sin censura son más inteligentes o más honestos?

No hay evidencia de eso. La investigación encontró menos precisión en TruthfulQA tras la edición y, según el método y la arquitectura, pérdidas de razonamiento matemático de hasta 18,8 puntos en GSM8K.

¿Podemos usar uno para un pentest?

Solo con autorización escrita y en un entorno aislado. Prueba antes los programas de acceso verificado y los modelos especializados en seguridad: suelen cubrir la necesidad con menos riesgo legal y operativo.

¿Cómo reducimos los falsos rechazos sin quitar la seguridad?

Elige un modelo mejor calibrado, escribe una política de contenido explícita, ajusta los umbrales de tus modelos guardianes y mide falsos rechazos y daños no detectados con tus propios prompts etiquetados, en cada idioma que atiendes.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban