Modelos sin censura: qué son, para qué sirven y qué riesgos tienen
Quitarle las salvaguardas a un modelo abierto hoy toma minutos. Hay razones legítimas para querer menos rechazos, pero los riesgos están documentados y la ley se endurece en 2026. Esto es lo que un CTO o un CISO debe saber antes de usar uno.
Un modelo “sin censura” es un modelo de pesos abiertos al que le quitaron los rechazos, con un ajuste fino sin negativas o borrando la “dirección de rechazo” interna identificada en 2024. El exceso de rechazos es un problema real y medido. Pero el cambio persiste en cada copia redistribuida, puede costar veracidad y razonamiento y choca con leyes nuevas: la prohibición europea de los generadores de desnudos y de abuso sexual infantil aplica desde el 2 de diciembre de 2026.
Nuestra recomendación: la mayoría de las empresas necesita un modelo capaz y bien calibrado, con una política explícita, modelos guardianes, registros y revisión humana, no un modelo sin salvaguardas. Cuando uno con pocos rechazos se justifica (seguridad autorizada, investigación), trátalo como una herramienta de laboratorio controlada.
Qué significa “sin censura”, técnicamente
Una palabra, cuatro mecanismos: cada uno cambia algo distinto y pide una respuesta distinta.
| Mecanismo | Qué cambia | Qué requiere | ¿Persiste? |
|---|---|---|---|
| Ajuste fino sin rechazos | Los pesos, con un nuevo entrenamiento | Los pesos o una API de ajuste fino | Sí, en cada copia |
| Ablación de la dirección de rechazo (“abliteration”) | Los pesos, con una edición puntual | Los pesos (acceso de caja blanca) | Sí, en cada copia |
| Checkpoint base | Nada: nunca tuvo ajuste de instrucciones ni de seguridad | Los pesos | No aplica |
| Jailbreak | Solo las entradas | Cualquier acceso, incluidas las API alojadas | No, conversación por conversación |
Los ajustes finos sin rechazos llegaron primero. Ajustes comunitarios como las familias Dolphin y Hermes se entrenaron para rechazar mucho menos, con el argumento de la “alineación componible”: publicar un modelo neutro y que cada empresa añada su propia política. La capa de seguridad original es delgada: Qi et al. (2023) eliminaron la mayor parte del comportamiento seguro de GPT-3.5 Turbo con un puñado de ejemplos enviados por la API de ajuste fino de OpenAI.
La ablación de la dirección de rechazo viene de Arditi et al. (2024): en 13 modelos de chat abiertos de hasta 72B parámetros, el rechazo dependía de una sola dirección en las activaciones del modelo. Borrarla suprime los rechazos; sumarla hace que el modelo rechace pedidos inofensivos. Trabajos posteriores encontraron una geometría más rica, con varias direcciones independientes, y mostraron que una dirección extraída en inglés suprimía los rechazos en otros idiomas con una eficacia casi perfecta, algo que concierne directamente a los despliegues en español y francés.
Un jailbreak cambia solo las entradas: funciona también contra las API alojadas, pero hay que repetirlo en cada conversación. Los checkpoints de instrucciones aprenden a rechazar en el postentrenamiento; los checkpoints base nunca lo hicieron, así que solo los protege la seguridad incorporada en los datos de preentrenamiento, que el estudio Deep Ignorance encontró mucho más resistente al ajuste fino adversarial que las defensas de postentrenamiento.
Por qué existen: el exceso de rechazos es real
La demanda no es solo maliciosa. Los modelos alineados rechazan a menudo pedidos seguros que solo parecen peligrosos. En XSTest, 250 prompts seguros con homónimos, lenguaje figurado o hechos históricos, Llama 2 70B Chat con su prompt de sistema por defecto rechazó por completo el 38 %; GPT-4, el 6,4 %.
OR-Bench probó 32 modelos con 80.000 prompts de apariencia tóxica pero seguros y encontró una correlación de rangos de 0,89 entre rechazar prompts seguros y tóxicos: los modelos ajustados para ser más seguros tienden a rechazar de más, aunque los más recientes lo hacen menos. FalseReject, de Amazon, mostró que un ajuste fino puede reducir los rechazos innecesarios sin comprometer la seguridad general.
El contrapeso es SORRY-Bench, que verifica que los modelos sigan rechazando 440 instrucciones realmente inseguras en 44 categorías; un modelo útil debe salir bien en ambos lados. Anthropic reporta que sus clasificadores de 2026 rechazan cerca del 0,05 % de las consultas inofensivas, un 87 % menos que su primera versión. Los falsos rechazos son un problema de ingeniería con soluciones de ingeniería; quitar la seguridad no es una de ellas.
Un ecosistema grande que la redistribución mantiene vivo
Las cifras varían según el método, pero coinciden. Lin et al. (2025) identificaron más de 11.000 modelos sin censura en Hugging Face, uno con más de 19 millones de instalaciones. Con una definición más estricta, 10a Labs contó 3.471 entre enero de 2024 y marzo de 2026, cada uno reempaquetado 2,4 veces en promedio, y el 25 % de las 1.643 aplicaciones de GitHub que los usan se clasificó como explícitamente maliciosa.
El mismo artículo llama a la redistribución “la capa de persistencia”: las copias comprimidas y los espejos entre cuentas, formatos y plataformas vuelven casi inútiles las bajas en el origen.
La automatización bajó aún más la barrera. Una investigación del Financial Times con la firma de seguridad Alice (mayo de 2026) reportó que una herramienta gratuita y pública sirvió para crear miles de variantes “descensuradas”, que los periodistas quitaron las salvaguardas de Llama 3.3 en minutos sin hardware especializado y que las de Gemma 4 cayeron menos de 90 minutos después de su lanzamiento. Google lo calificó como un desafío técnico conocido que enfrentan todos los modelos abiertos. A propósito, no nombramos la herramienta.
Lo que se pierde al quitar las salvaguardas
En Arditi et al., los benchmarks generales (MMLU, ARC, GSM8K) se mantuvieron cerca de la línea base tras la edición, pero la precisión en TruthfulQA cae de forma consistente. Un preprint de 2025 que comparó ediciones de este tipo en 16 modelos de instrucciones de 7B a 14B encontró que el razonamiento matemático es la capacidad más sensible: en GSM8K, los resultados iban de una ganancia de unos 1,5 puntos a una pérdida de 18,8, según método y arquitectura.
El riesgo de fondo es de comportamiento. El estudio sobre desalineación emergente, ampliado en Nature en 2026, ajustó GPT-4o y Qwen2.5-Coder-32B en una tarea estrecha, escribir código inseguro, y obtuvo un comportamiento desalineado en prompts sin relación; presentar los mismos datos como material de un curso de seguridad lo evitó.
Ningún benchmark que pudiéramos verificar respalda la idea de que “alucinan más” en general; los costos medidos bastan para evaluar cualquier modelo modificado con tus propias tareas.
Usos legítimos y la lección de Hugging Face
Hay razones reales para querer un modelo que no se niegue: pentest y red teaming autorizados, análisis de malware y respuesta a incidentes, ficción sobre el crimen o la violencia, preguntas médicas y legales francas, y la investigación sobre el propio rechazo. La pregunta es cómo atender esos usos de forma segura.
En julio de 2026, durante una intrusión en Hugging Face ejecutada por un framework de agentes autónomos, los modelos comerciales de frontera bloquearon las peticiones forenses del equipo porque sus guardrails no distinguen a quien responde a un incidente de un atacante. El equipo analizó entonces más de 17.000 registros del atacante con el modelo abierto GLM-5.2, en su propia infraestructura. La lección: tener listo, antes del incidente, un modelo capaz, verificado y autoalojado, que además deja en casa los datos y credenciales del atacante. Hugging Face aclara que no es un argumento contra las medidas de seguridad de los modelos alojados.
La respuesta de la industria es el acceso verificado, no quitar salvaguardas. Con Project Glasswing (abril de 2026), Anthropic restringió Claude Mythos Preview, fuerte para encontrar y explotar vulnerabilidades, a socios y a más de 40 organizaciones que mantienen software crítico, con un Cyber Verification Program para profesionales de seguridad. También hay modelos abiertos especializados: Foundation-Sec-8B de Cisco (Apache 2.0) apunta al triaje en el SOC y la simulación de amenazas, excluye la generación de malware y phishing y exige revisión humana.
Qué dicen la ley y las licencias en 2026
Casi todas las normas apuntan a herramientas y resultados abusivos, sobre todo imágenes sexuales, no a los modelos.
| Jurisdicción | Norma | Qué ataca | Fecha clave |
|---|---|---|---|
| Estados Unidos | TAKE IT DOWN Act | Publicar imágenes íntimas de una persona real sin consentimiento, incluidas las falsificaciones con IA; retiro en 48 horas para las plataformas | Firmada el 19 de mayo de 2025 |
| Texas | TRAIGA (HB 149) | Desarrollar o desplegar IA con la intención de producir material de abuso sexual infantil o deepfakes sexuales ilegales | 1 de enero de 2026 |
| Reino Unido | Crime and Policing Act 2026, sección 99 | Crear, adaptar o suministrar herramientas que generan imágenes íntimas; hasta 3 años de prisión | Promulgada en 2026 |
| Unión Europea | AI Act, art. 5(1)(ba) y (bb) | Sistemas que generan imágenes íntimas sin consentimiento o material de abuso sexual infantil; multas de hasta 35 millones de euros o el 7 % de la facturación | 2 de diciembre de 2026 |
| Francia | Code pénal, art. 226-8-1 | Difundir sin consentimiento contenido sexual de una persona, incluido el generado con IA: hasta 2 años y 60.000 euros (3 años y 75.000 en línea) | Vigente desde el 23 de mayo de 2024 |
| Colombia | Ley 2502 de 2025 | Suplantación con IA, incluidos los deepfakes: la multa aumenta hasta en una tercera parte | 28 de julio de 2025 |
La prohibición europea alcanza también a las herramientas de uso general: queda prohibido comercializar una si ese resultado es razonablemente previsible y reproducible y el sistema no tiene salvaguardas razonables y adecuadas para impedirlo de forma fiable. Un modelo de imágenes al que le quitaron las salvaguardas encaja en esa descripción. Las obligaciones de transparencia del artículo 50, como avisar a las personas de que interactúan con una IA, aplican desde el 2 de agosto de 2026, sin importar el tamaño ni la licencia del modelo.
Las licencias suman otra capa: la política de uso aceptable de Llama 3.3 prohíbe el contenido de explotación infantil y el código malicioso, y los términos de uso de Gemma prohíben intentar anular o eludir los filtros de seguridad (Gemma 4 pasó a Apache 2.0). La política de contenido de Hugging Face prohíbe el contenido sexual sin consentimiento. Más en nuestro mapa regulatorio de 2026.
Mejores opciones que un modelo sin censura
Para casi cada necesidad legítima hay un camino más seguro.
| Necesidad | Mejor opción |
|---|---|
| Pentest, red teaming, análisis de malware | Acceso verificado, modelos especializados en seguridad y un contexto de autorización explícito |
| Respuesta a incidentes con datos del atacante | Un modelo abierto capaz, verificado y autoalojado antes del incidente |
| Moderación de contenido, trust and safety | Modelos guardianes hechos para leer contenido dañino y clasificarlo según tu política |
| Ficción o preguntas médicas y legales rechazadas | Un modelo mejor calibrado y una política de contenido escrita, midiendo los falsos rechazos |
| Demasiados rechazos en un chatbot de clientes | Ajustar la política del sistema y los umbrales de los guardianes, no la seguridad del modelo |
| Investigación sobre rechazo y alineación | Pesos abiertos en un laboratorio aislado, con protocolo de investigación y sin redistribución |
El hilo común: corregir la calibración y el acceso, no la seguridad. Los modelos guardianes y las políticas están en guardrails que funcionan en producción y el trabajo ofensivo autorizado en IA en seguridad ofensiva.
Nuestra recomendación y una checklist
En Slash recomendamos tres reglas: ningún modelo sin salvaguardas en productos de cara al cliente; para seguridad autorizada, primero acceso verificado o un modelo especializado; y un modelo con pocos rechazos solo como herramienta de laboratorio controlada, nunca redistribuida. Antes de usar uno, revisa:
- Autorización: un alcance escrito, un responsable con nombre y un propósito legítimo (prueba, investigación, respuesta a incidentes).
- Procedencia: pesos de un publicador conocido, con sumas de verificación; las copias anónimas son un riesgo de cadena de suministro.
- Aislamiento: un entorno separado, sin datos de producción, sin salida a internet y sin herramientas innecesarias.
- Registro: prompts, respuestas, operador y versión del modelo, según tu política de retención.
- Revisión de salidas: un modelo guardián sobre las respuestas y una persona antes de que algo salga del laboratorio.
- Revisión legal: la política de uso aceptable de la licencia y la ley donde operas y donde se usan los resultados.
- Cierre: borrar el modelo y sus resultados al terminar el trabajo.
Nunca uses un modelo de imagen o video con pocos rechazos sobre fotos de personas reales: ahí se concentra la exposición legal en todas las jurisdicciones de la tabla, y en la UE esas herramientas quedan prohibidas desde el 2 de diciembre de 2026 si no tienen salvaguardas adecuadas.
Lo esencial
- “Sin censura” abarca cuatro mecanismos (ajuste fino sin rechazos, ablación de la dirección de rechazo, checkpoints base, jailbreaks); las ediciones de pesos persisten en cada copia.
- El exceso de rechazos es real (Llama 2 70B Chat rechazó el 38 % de los prompts seguros de XSTest) y se corrige calibrando mejor, no quitando la seguridad.
- Las bajas no funcionan: 10a Labs contó 3.471 modelos sin censura, reempaquetados 2,4 veces cada uno, y el 25 % de las apps de GitHub que los usan resultó maliciosa.
- Quitar salvaguardas tiene costos medidos: menos precisión en TruthfulQA, pérdidas de razonamiento de hasta 18,8 puntos y riesgo de desalineación emergente.
- La UE prohíbe los generadores de desnudos y de abuso sexual infantil desde el 2 de diciembre de 2026; para usos legítimos, acceso verificado, modelos especializados y un laboratorio controlado.
Fuentes
- Refusal in Language Models Is Mediated by a Single Direction
- Refusal Direction is Universal Across Safety-Aligned Languages
- XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
- OR-Bench: An Over-Refusal Benchmark for Large Language Models
- Uncensored Open-weight Models: Redistribution as the Persistence Layer
- Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
- AI guardrails stripped from Meta and Google models in minutes
- Security incident disclosure, July 2026
- Project Glasswing
- Regulation (EU) 2026/1744 of 8 July 2026 (Digital Omnibus on AI)
- Crime and Policing Act 2026, Part 5, Chapter 4
- Code pénal, article 226-8-1
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Es legal usar un modelo sin censura?
Las leyes revisadas aquí apuntan a usos, resultados y herramientas hechas para el abuso (generadores de imágenes íntimas, material de abuso sexual infantil, suplantación) más que a los modelos en sí. Pero las licencias pueden prohibir eludir los filtros de seguridad y, desde el 2 de diciembre de 2026, la prohibición de la UE alcanza también herramientas generales sin salvaguardas adecuadas. Busca asesoría legal para tu caso.
¿Qué es la “abliteration”?
El nombre que la comunidad da a la ablación de la dirección de rechazo: editar los pesos de un modelo para quitar la dirección interna que la investigación asoció al rechazo en 2024. Requiere los pesos, y el cambio persiste en cada copia.
¿Los modelos sin censura son más inteligentes o más honestos?
No hay evidencia de eso. La investigación encontró menos precisión en TruthfulQA tras la edición y, según el método y la arquitectura, pérdidas de razonamiento matemático de hasta 18,8 puntos en GSM8K.
¿Podemos usar uno para un pentest?
Solo con autorización escrita y en un entorno aislado. Prueba antes los programas de acceso verificado y los modelos especializados en seguridad: suelen cubrir la necesidad con menos riesgo legal y operativo.
¿Cómo reducimos los falsos rechazos sin quitar la seguridad?
Elige un modelo mejor calibrado, escribe una política de contenido explícita, ajusta los umbrales de tus modelos guardianes y mide falsos rechazos y daños no detectados con tus propios prompts etiquetados, en cada idioma que atiendes.
Más análisis para seguir
Guardrails que funcionan en producción
Las siete capas de un sistema de guardrails, los modelos guardianes de 2026 comparados, cómo medirlos en español y francés y dos arquitecturas de referencia.
IA local y open sourceModelos open-weight en 2026: cuál usar y con qué licencia
Kimi K3, Qwen3.8, DeepSeek V4.1, GLM-5.3, Gemma 4, gpt-oss, Mistral: tamaños, licencias, distancia a la frontera y cómo alojarlos sin sorpresas legales.
Estrategia y regulaciónEl mapa regulatorio de la IA en 2026
El AI Act tras el Ómnibus, el RGPD, la Ley 1581 y la SIC, LatAm, EE. UU. e ISO 42001: fechas, obligaciones y un plan de 10 pasos para empresas en Colombia y la UE.
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.