Guardrails que funcionan: clasificadores, políticas y moderación en producción
Ningún filtro aguanta solo. Los guardrails que funcionan son una pila de capas, cada una medida con tus datos y en tus idiomas. Esta es la pila que recomendamos, con los modelos guardianes disponibles en septiembre de 2026.
Un guardrail no es un filtro, es una pila de siete capas, de la revisión de entradas al registro con monitoreo. Los modelos guardianes abiertos ya cubren la mayoría de esas capas, y algunos leen tu política como texto en lenguaje natural, lo que ayuda cuando está escrita en español o francés.
La investigación sobre jailbreaks muestra por qué importan las capas: los ataques de contexto largo, de muestreo repetido y de varios turnos vencen cada uno a un modelo o a un filtro aislado. Mide cada capa con tu propio conjunto etiquetado, en cada idioma: falsos positivos, falsos negativos, latencia y costo.
Siete capas, no un filtro
Cada capa atrapa una falla distinta; juntas cubren lo que ningún modelo cubre solo.
| Capa | Qué hace | Herramientas típicas | Qué atrapa |
|---|---|---|---|
| 1. Revisión de entradas | Clasifica la petición y el contenido recuperado antes del modelo | Prompt Guard 2, Prompt Shields, Qwen3Guard | Jailbreaks, inyección, peticiones fuera de política |
| 2. Política de sistema | Define qué hace y qué no hace el producto | Prompt de sistema versionado como código | Desvíos de alcance |
| 3. Elección del modelo | Un modelo bien alineado y bien calibrado para la tarea | Tu batería de evaluación | Exceso y falta de rechazos en el origen |
| 4. Clasificación de salidas | Revisa cada respuesta contra la política | Llama Guard 4, gpt-oss-safeguard, Shieldstral | Respuestas dañinas que pasaron |
| 5. Permisos de herramientas | Limita lo que un agente puede hacer, decida lo que decida el modelo | Mínimo privilegio, listas permitidas, confirmaciones | El daño de una inyección exitosa |
| 6. Revisión humana | Envía los casos marcados o de alto impacto a una persona | Cola de revisión | Casos ambiguos, acciones irreversibles |
| 7. Registro y monitoreo | Guarda entradas, salidas y veredictos | Trazas, tableros, alertas | Ataques lentos de varios turnos, deriva, abuso |
Las capas 5 y 7 no dependen de que un modelo acierte, y por eso aguantan cuando las demás fallan. El NCSC británico dice lo mismo sobre la inyección de prompts: trátala como un riesgo residual y limita su impacto con controles deterministas, sin LLM.
Los modelos guardianes disponibles en septiembre de 2026
| Modelo | Fabricante, fecha | Licencia, despliegue | Idiomas | Alcance y notas |
|---|---|---|---|---|
| Llama Guard 4 (12B) | Meta, abr. 2025 | Llama 4 Community; autoalojado | Inglés + 7, con español y francés | Entradas y respuestas, texto e imágenes, 14 categorías |
| Prompt Guard 2 (86M, 22M) | Meta, abr. 2025 | Llama 4 Community; autoalojado | Multilingüe; más brechas en el 22M | Solo ataques en la entrada; vulnerable a ataques adaptativos |
| ShieldGemma 2 (4B) | Google, abr. 2025 | Términos de Gemma; autoalojado | Entrenado con datos en inglés | Solo imágenes, tres políticas |
| Granite Guardian 4.1 (8B) | IBM, abr. 2026 | Apache 2.0; autoalojado | Inglés | Daño, jailbreak, fundamentación RAG, llamadas a herramientas; criterios propios |
| Qwen3Guard-Gen (0.6B a 8B) | Alibaba, oct. 2025 | Apache 2.0; autoalojado | 119 idiomas y dialectos | Seguro, controvertido o inseguro |
| gpt-oss-safeguard (20B, 120B) | OpenAI, oct. 2025 | Apache 2.0; autoalojado | A verificar | Lee tu política; veredictos razonados |
| Shieldstral 1.0 (3B) | Mistral, ago. 2026 | Apache 2.0; una GPU de 16 GB | 12, con español y francés | Lee tu política; texto e imágenes |
| Moderation API | Mistral | API gestionada | A verificar | Unas 10 categorías, entradas y salidas |
| NeMo Guardrails + NemoGuard | NVIDIA | Kit Apache 2.0; autoalojado | Según los modelos | Rieles en entrada, recuperación, diálogo, ejecución y salida |
| Prompt Shields | Microsoft | Servicio gestionado de Azure | A verificar | Ataques directos e indirectos (en documentos) |
| Constitutional Classifiers | Anthropic, 2025 y 2026 | Propietario; solo dentro de Claude | No aplica | Cascada en dos etapas |
Ojo: “modelo guardián” abarca trabajos distintos. Prompt Guard 2 y Prompt Shields buscan ataques en las entradas, ShieldGemma 2 modera imágenes, NeMo Guardrails orquesta otros modelos y los demás juzgan contenido contra una política. Cada ficha declara además sus límites, desde evaluaciones solo en inglés hasta menos fiabilidad ante entradas ofuscadas.
Clasificadores con la política en el prompt: una ayuda en español y francés
Los modelos guardianes clásicos llevan una taxonomía fija en sus pesos, como las 14 categorías de riesgo de Llama Guard 4. Los clasificadores con la política en el prompt (gpt-oss-safeguard, Shieldstral y el modo “trae tus propios criterios” de Granite Guardian) leen tu política en lenguaje natural en el momento de la inferencia, junto al contenido que juzgan. Cambiar la política es editar un texto, no reunir datos etiquetados y reentrenar.
El equipo legal o de cumplimiento dueño de la política puede redactarla en el idioma del negocio, con sus propios ejemplos: qué cuenta como asesoría financiera para un banco colombiano o como promesa médica para una aseguradora francesa. Un solo modelo la aplica en todos los productos, y cada cambio queda versionado y revisable.
Dos cautelas. La precisión depende de la redacción: Google advierte que ShieldGemma 2 es muy sensible a cómo se describen los principios de seguridad. Y razonar cuesta: gpt-oss-safeguard ofrece esfuerzo bajo, medio y alto, y Granite Guardian 4.1 un modo con y sin razonamiento, de ahí la cascada habitual: primero un clasificador rápido de una sola pasada y el juez que razona solo para lo marcado o ambiguo.
Trata la política como código: un documento corto con definiciones y ejemplos por idioma, un responsable, una versión y pruebas con tu conjunto etiquetado antes de cada despliegue.
Mide con tu propio conjunto etiquetado
Las cifras del fabricante dicen que un modelo es plausible; solo tus datos dicen si funciona.
Arma el conjunto con tráfico real, en cada idioma: peticiones claramente permitidas, claramente prohibidas y, sobre todo, los casos límite donde vive el exceso de rechazos. Los benchmarks públicos ayudan a sembrarlo (XSTest y OR-Bench para el exceso de rechazos, SORRY-Bench para peticiones inseguras), pero están sobre todo en inglés y no conocen tu política.
| Métrica | Por qué importa | Cómo leerla |
|---|---|---|
| Falsos positivos (bloqueo de más) | Usuarios legítimos reciben rechazos y se van o te esquivan | Por idioma y por categoría, no solo en total |
| Falsos negativos (daño no detectado) | Pasan contenidos o acciones dañinas | Ponderados por gravedad: un fallo en autolesiones pesa más que muchos en groserías |
| Latencia | Cada capa suma al menos una llamada | Percentil 95, de punta a punta, con streaming |
| Costo | Las llamadas a los guardianes se facturan como cualquier otra | Por cada 1.000 conversaciones, cascada incluida |
Las cifras de los fabricantes muestran los compromisos. Meta reporta un 97,5 % de recall con un 1 % de falsos positivos para Prompt Guard 2 86M. Los primeros Constitutional Classifiers de Anthropic bajaron el éxito de los jailbreaks del 86 % al 4,4 % en sus pruebas, con un 23,7 % más de cómputo y 0,38 puntos más de rechazos; la cascada de 2026 llevó los rechazos innecesarios a cerca del 0,05 % y el sobrecosto a un 1 %, aproximadamente. Referencias útiles, pero ninguna mide tu política en tus idiomas: eso les toca a tus propias evaluaciones.
Lo que muestra la investigación sobre jailbreaks
Cuatro resultados, descritos solo a nivel conceptual.
- Many-shot jailbreaking (Anthropic, 2024) llena un contexto largo con diálogos falsos en los que un asistente accede. Las respuestas dañinas aumentan con el número de ejemplos, y los modelos más grandes resultaron más vulnerables. Entrenar al modelo para resistir solo retrasó el efecto; clasificar y reescribir el prompt antes bajó el éxito del ataque del 61 % al 2 % en una prueba interna.
- Best-of-N (2024) reenvía una petición con variaciones superficiales aleatorias hasta que una pasa, sin acceso al interior del modelo. Con suficientes intentos, los autores reportan 89 % de éxito en GPT-4o y 78 % en Claude 3.5 Sonnet, y el método también superó defensas como los circuit breakers.
- Crescendo (Microsoft, 2024) escala a lo largo de varios turnos, cada uno inofensivo por sí solo: 98 % de éxito contra GPT-4 y 100 % contra Gemini Pro en las pruebas de sus autores.
- Los bug bounties muestran lo que aportan las capas. En el reto de Anthropic de febrero de 2025, 339 investigadores enviaron más de 300.000 mensajes y uno encontró un jailbreak universal. Contra el sistema de 2026, unos 198.000 intentos no habían encontrado ninguno a enero de 2026, con recompensas de hasta USD 35.000.
La lección: el contexto largo vence a un modelo entrenado en seguridad, el muestreo repetido vence a un clasificador estático y la escalada en varios turnos vence al filtrado mensaje a mensaje. Clasifica conversaciones completas, limita la tasa de peticiones, vigila ráfagas de reintentos casi idénticos y mantén capas que no dependan de ningún modelo.
Un modelo guardián también es un modelo. Las fichas de Meta advierten que Llama Guard 4 puede ser susceptible a ataques adversariales o de inyección de prompts y que Prompt Guard 2 es vulnerable a ataques adaptativos. Trata cada veredicto como una señal entre varias, nunca como prueba de seguridad.
Dos arquitecturas de referencia
Un chatbot de clientes arriesga sobre todo malas respuestas; un agente interno, malas acciones.
| Etapa | Chatbot de cara al cliente | Agente interno con herramientas |
|---|---|---|
| Entrada | Clasificador liviano de inyección y jailbreak, más una revisión de contenido | Igual, y todo documento, correo o resultado de herramienta se trata como no confiable |
| Política | Política corta del producto; aviso de IA en la primera interacción | Alcance de la tarea y herramientas y datos permitidos, en el prompt de sistema |
| Modelo | Bien calibrado, medido en exceso de rechazos en tus idiomas | El modelo más fuerte que tu evaluación justifique |
| Salida | Clasificador con la política en el prompt: permitir, reescribir, bloquear o derivar | Clasificador de salida y control de que cada llamada a herramientas coincida con el pedido |
| Acciones | Ninguna aparte de responder; los cambios de cuenta pasan a una persona | Mínimo privilegio, listas de destinos permitidos, confirmación antes de enviar, pagar o borrar |
| Supervisión | Revisión semanal por muestreo de rechazos y bloqueos | Aprobación humana para acciones de alto impacto; trazas completas |
En los agentes, ningún clasificador reemplaza los límites de capacidad: un agente que no puede enviar correos no puede ser engañado para filtrar datos por correo. Más patrones en prompt injection y seguridad de agentes y en agentes de IA en producción.
Qué significa para empresas en Colombia y en Europa
Idiomas. Contrasta la cobertura de cada modelo guardián con tu tráfico real: Llama Guard 4 y Shieldstral incluyen español y francés, Qwen3Guard declara 119 idiomas, y Granite Guardian 4.1 y ShieldGemma 2 se entrenaron con datos en inglés. Mide en español colombiano y en francés, con jerga, errores de digitación y mezcla de idiomas, no con benchmarks traducidos.
Residencia de datos. La mayoría de los modelos guardianes abiertos usa Apache 2.0 y corre en tu propia infraestructura, así que el contenido revisado no sale de ella. Sus registros contienen el texto más sensible de tu sistema: en Colombia están sujetos a la Ley 1581 de 2012 y en la UE al RGPD, con reglas de retención y acceso acordes.
Regulación. En la UE, el artículo 50 del AI Act exige desde el 2 de agosto de 2026 informar a las personas de que interactúan con un sistema de IA. Desde el 2 de diciembre de 2026, un generador de imagen o video que pueda producir de forma previsible y reproducible imágenes íntimas sin consentimiento o material de abuso sexual infantil necesita salvaguardas que lo impidan de forma fiable, o cae en las nuevas prohibiciones: ahí los guardrails pasan a ser obligación legal. Detalles en nuestro mapa regulatorio de 2026.
Checklist de lanzamiento
- Escribe la política: alcance, definiciones, ejemplos permitidos y prohibidos por idioma, responsable y versión.
- Arma un conjunto etiquetado con tráfico real, casos límite incluidos, en cada idioma que atiendes.
- Elige los modelos guardianes por sus errores, latencia y costo medidos, no por las tablas del fabricante.
- Pon primero un clasificador de entrada liviano y trata todo contenido recuperado como no confiable.
- Clasifica las salidas con la misma política y una acción definida por veredicto: permitir, reescribir, bloquear o derivar.
- Da a las herramientas del agente el mínimo privilegio y exige confirmación para acciones irreversibles.
- Registra entradas, salidas, veredictos y versiones de modelo con una política de retención; alerta ante ráfagas de reintentos y conversaciones que escalan.
- Haz red teaming antes del lanzamiento, con ataques de varios turnos y de muchos intentos, y repítelo tras cada cambio de modelo o de política.
- Revisa rechazos y bloqueos cada semana y devuelve los errores al conjunto etiquetado.
Lo esencial
- Los guardrails son una pila de siete capas; los permisos de herramientas y el registro aguantan aunque todos los modelos fallen.
- Los modelos guardianes abiertos cubren casi todo en 2026, varios con Apache 2.0; revisa los idiomas: algunos se entrenaron solo en inglés.
- Con la política en el prompt, tu equipo legal o de cumplimiento puede escribirla y versionarla en español o francés sin reentrenar.
- Mide falsos positivos, falsos negativos, latencia y costo con tu propio conjunto etiquetado; las cifras del fabricante son solo un punto de partida.
- Los ataques many-shot, Best-of-N y de varios turnos vencen cada uno a un filtro aislado: clasifica conversaciones completas y vigila las ráfagas de reintentos.
Fuentes
- Llama Guard 4 12B: model card
- Llama Prompt Guard 2 86M: model card
- Qwen3Guard-Gen-8B: model card
- Introducing gpt-oss-safeguard
- Granite Guardian 4.1 8B: model card
- Shieldstral 1.0 3B: model card
- Prompt Shields in Azure AI Content Safety
- NeMo Guardrails
- Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks
- Many-shot jailbreaking
- Best-of-N Jailbreaking
- Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Qué es un modelo guardián?
Un modelo entrenado o instruido para clasificar prompts, respuestas o imágenes según una política de seguridad, como Llama Guard 4, Qwen3Guard o gpt-oss-safeguard. Se ubica alrededor de tu modelo principal y devuelve un veredicto, no una respuesta para el usuario.
¿Qué modelo guardián probamos primero?
Para autoalojar en español y francés, compara Llama Guard 4, Qwen3Guard y Shieldstral con tu conjunto etiquetado, y considera gpt-oss-safeguard como juez que razona para los casos marcados. Quédate con el que cometa los errores más aceptables con tus datos.
¿Los guardrails vuelven lento el chatbot?
Cada capa suma al menos una llamada a un modelo. Mantén liviana la revisión de entrada, pasa a jueces más pesados solo con el contenido marcado y mide la latencia del percentil 95 de punta a punta.
¿Se puede engañar a un modelo guardián?
Sí. Las propias fichas de Meta advierten que Llama Guard 4 puede ser susceptible a ataques adversariales y Prompt Guard 2 a ataques adaptativos. Por eso los clasificadores son una capa entre varias, con permisos, monitoreo y revisión humana detrás.
¿Basta con un buen prompt de sistema?
No. Fija la política, pero los ataques many-shot, de muestreo repetido y de varios turnos están diseñados justamente para sortearla. Combínalo con clasificadores de entrada y salida, límites a las herramientas y registro.
Más análisis para seguir
Prompt injection y seguridad de agentes: el riesgo número uno
Por qué la inyección de prompts sigue sin resolverse, qué muestran los incidentes de 2025–2026 y qué controles funcionan de verdad en agentes y chatbots.
IA local y open sourceModelos sin censura: qué son y qué riesgos tienen
Qué significa quitarle las salvaguardas a un modelo, por qué existe ese ecosistema, qué se pierde, qué prohíbe la ley en 2026 y qué usar en su lugar.
Agentes e ingenieríaAgentes de IA en producción: lo que funciona en 2026
Flujo o agente, los ocho componentes, datos de adopción y fracaso, uso de computador, reglas de diseño, costos, seguridad y checklist de lanzamiento.
¿Y después de esto?
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.