Ciberseguridad · Septiembre 2026

Guardrails que funcionan: clasificadores, políticas y moderación en producción

Ningún filtro aguanta solo. Los guardrails que funcionan son una pila de capas, cada una medida con tus datos y en tus idiomas. Esta es la pila que recomendamos, con los modelos guardianes disponibles en septiembre de 2026.

86 % → 4,4 % éxito de jailbreaks sin y con clasificadores (Anthropic)0,05 % rechazos innecesarios en su versión 20267 capas en una pila completa
En resumen

Un guardrail no es un filtro, es una pila de siete capas, de la revisión de entradas al registro con monitoreo. Los modelos guardianes abiertos ya cubren la mayoría de esas capas, y algunos leen tu política como texto en lenguaje natural, lo que ayuda cuando está escrita en español o francés.

La investigación sobre jailbreaks muestra por qué importan las capas: los ataques de contexto largo, de muestreo repetido y de varios turnos vencen cada uno a un modelo o a un filtro aislado. Mide cada capa con tu propio conjunto etiquetado, en cada idioma: falsos positivos, falsos negativos, latencia y costo.

Siete capas, no un filtro

Cada capa atrapa una falla distinta; juntas cubren lo que ningún modelo cubre solo.

Pila de referencia que recomienda Slash. No todo producto necesita cada capa al máximo.
CapaQué haceHerramientas típicasQué atrapa
1. Revisión de entradasClasifica la petición y el contenido recuperado antes del modeloPrompt Guard 2, Prompt Shields, Qwen3GuardJailbreaks, inyección, peticiones fuera de política
2. Política de sistemaDefine qué hace y qué no hace el productoPrompt de sistema versionado como códigoDesvíos de alcance
3. Elección del modeloUn modelo bien alineado y bien calibrado para la tareaTu batería de evaluaciónExceso y falta de rechazos en el origen
4. Clasificación de salidasRevisa cada respuesta contra la políticaLlama Guard 4, gpt-oss-safeguard, ShieldstralRespuestas dañinas que pasaron
5. Permisos de herramientasLimita lo que un agente puede hacer, decida lo que decida el modeloMínimo privilegio, listas permitidas, confirmacionesEl daño de una inyección exitosa
6. Revisión humanaEnvía los casos marcados o de alto impacto a una personaCola de revisiónCasos ambiguos, acciones irreversibles
7. Registro y monitoreoGuarda entradas, salidas y veredictosTrazas, tableros, alertasAtaques lentos de varios turnos, deriva, abuso

Las capas 5 y 7 no dependen de que un modelo acierte, y por eso aguantan cuando las demás fallan. El NCSC británico dice lo mismo sobre la inyección de prompts: trátala como un riesgo residual y limita su impacto con controles deterministas, sin LLM.

Los modelos guardianes disponibles en septiembre de 2026

Fichas de modelo y documentación de los fabricantes, revisadas en septiembre de 2026.
ModeloFabricante, fechaLicencia, despliegueIdiomasAlcance y notas
Llama Guard 4 (12B)Meta, abr. 2025Llama 4 Community; autoalojadoInglés + 7, con español y francésEntradas y respuestas, texto e imágenes, 14 categorías
Prompt Guard 2 (86M, 22M)Meta, abr. 2025Llama 4 Community; autoalojadoMultilingüe; más brechas en el 22MSolo ataques en la entrada; vulnerable a ataques adaptativos
ShieldGemma 2 (4B)Google, abr. 2025Términos de Gemma; autoalojadoEntrenado con datos en inglésSolo imágenes, tres políticas
Granite Guardian 4.1 (8B)IBM, abr. 2026Apache 2.0; autoalojadoInglésDaño, jailbreak, fundamentación RAG, llamadas a herramientas; criterios propios
Qwen3Guard-Gen (0.6B a 8B)Alibaba, oct. 2025Apache 2.0; autoalojado119 idiomas y dialectosSeguro, controvertido o inseguro
gpt-oss-safeguard (20B, 120B)OpenAI, oct. 2025Apache 2.0; autoalojadoA verificarLee tu política; veredictos razonados
Shieldstral 1.0 (3B)Mistral, ago. 2026Apache 2.0; una GPU de 16 GB12, con español y francésLee tu política; texto e imágenes
Moderation APIMistralAPI gestionadaA verificarUnas 10 categorías, entradas y salidas
NeMo Guardrails + NemoGuardNVIDIAKit Apache 2.0; autoalojadoSegún los modelosRieles en entrada, recuperación, diálogo, ejecución y salida
Prompt ShieldsMicrosoftServicio gestionado de AzureA verificarAtaques directos e indirectos (en documentos)
Constitutional ClassifiersAnthropic, 2025 y 2026Propietario; solo dentro de ClaudeNo aplicaCascada en dos etapas

Ojo: “modelo guardián” abarca trabajos distintos. Prompt Guard 2 y Prompt Shields buscan ataques en las entradas, ShieldGemma 2 modera imágenes, NeMo Guardrails orquesta otros modelos y los demás juzgan contenido contra una política. Cada ficha declara además sus límites, desde evaluaciones solo en inglés hasta menos fiabilidad ante entradas ofuscadas.

Clasificadores con la política en el prompt: una ayuda en español y francés

Los modelos guardianes clásicos llevan una taxonomía fija en sus pesos, como las 14 categorías de riesgo de Llama Guard 4. Los clasificadores con la política en el prompt (gpt-oss-safeguard, Shieldstral y el modo “trae tus propios criterios” de Granite Guardian) leen tu política en lenguaje natural en el momento de la inferencia, junto al contenido que juzgan. Cambiar la política es editar un texto, no reunir datos etiquetados y reentrenar.

El equipo legal o de cumplimiento dueño de la política puede redactarla en el idioma del negocio, con sus propios ejemplos: qué cuenta como asesoría financiera para un banco colombiano o como promesa médica para una aseguradora francesa. Un solo modelo la aplica en todos los productos, y cada cambio queda versionado y revisable.

Dos cautelas. La precisión depende de la redacción: Google advierte que ShieldGemma 2 es muy sensible a cómo se describen los principios de seguridad. Y razonar cuesta: gpt-oss-safeguard ofrece esfuerzo bajo, medio y alto, y Granite Guardian 4.1 un modo con y sin razonamiento, de ahí la cascada habitual: primero un clasificador rápido de una sola pasada y el juez que razona solo para lo marcado o ambiguo.

Regla práctica

Trata la política como código: un documento corto con definiciones y ejemplos por idioma, un responsable, una versión y pruebas con tu conjunto etiquetado antes de cada despliegue.

Mide con tu propio conjunto etiquetado

Las cifras del fabricante dicen que un modelo es plausible; solo tus datos dicen si funciona.

Arma el conjunto con tráfico real, en cada idioma: peticiones claramente permitidas, claramente prohibidas y, sobre todo, los casos límite donde vive el exceso de rechazos. Los benchmarks públicos ayudan a sembrarlo (XSTest y OR-Bench para el exceso de rechazos, SORRY-Bench para peticiones inseguras), pero están sobre todo en inglés y no conocen tu política.

Qué medir en cada capa.
MétricaPor qué importaCómo leerla
Falsos positivos (bloqueo de más)Usuarios legítimos reciben rechazos y se van o te esquivanPor idioma y por categoría, no solo en total
Falsos negativos (daño no detectado)Pasan contenidos o acciones dañinasPonderados por gravedad: un fallo en autolesiones pesa más que muchos en groserías
LatenciaCada capa suma al menos una llamadaPercentil 95, de punta a punta, con streaming
CostoLas llamadas a los guardianes se facturan como cualquier otraPor cada 1.000 conversaciones, cascada incluida

Las cifras de los fabricantes muestran los compromisos. Meta reporta un 97,5 % de recall con un 1 % de falsos positivos para Prompt Guard 2 86M. Los primeros Constitutional Classifiers de Anthropic bajaron el éxito de los jailbreaks del 86 % al 4,4 % en sus pruebas, con un 23,7 % más de cómputo y 0,38 puntos más de rechazos; la cascada de 2026 llevó los rechazos innecesarios a cerca del 0,05 % y el sobrecosto a un 1 %, aproximadamente. Referencias útiles, pero ninguna mide tu política en tus idiomas: eso les toca a tus propias evaluaciones.

Lo que muestra la investigación sobre jailbreaks

Cuatro resultados, descritos solo a nivel conceptual.

  • Many-shot jailbreaking (Anthropic, 2024) llena un contexto largo con diálogos falsos en los que un asistente accede. Las respuestas dañinas aumentan con el número de ejemplos, y los modelos más grandes resultaron más vulnerables. Entrenar al modelo para resistir solo retrasó el efecto; clasificar y reescribir el prompt antes bajó el éxito del ataque del 61 % al 2 % en una prueba interna.
  • Best-of-N (2024) reenvía una petición con variaciones superficiales aleatorias hasta que una pasa, sin acceso al interior del modelo. Con suficientes intentos, los autores reportan 89 % de éxito en GPT-4o y 78 % en Claude 3.5 Sonnet, y el método también superó defensas como los circuit breakers.
  • Crescendo (Microsoft, 2024) escala a lo largo de varios turnos, cada uno inofensivo por sí solo: 98 % de éxito contra GPT-4 y 100 % contra Gemini Pro en las pruebas de sus autores.
  • Los bug bounties muestran lo que aportan las capas. En el reto de Anthropic de febrero de 2025, 339 investigadores enviaron más de 300.000 mensajes y uno encontró un jailbreak universal. Contra el sistema de 2026, unos 198.000 intentos no habían encontrado ninguno a enero de 2026, con recompensas de hasta USD 35.000.

La lección: el contexto largo vence a un modelo entrenado en seguridad, el muestreo repetido vence a un clasificador estático y la escalada en varios turnos vence al filtrado mensaje a mensaje. Clasifica conversaciones completas, limita la tasa de peticiones, vigila ráfagas de reintentos casi idénticos y mantén capas que no dependan de ningún modelo.

Atención

Un modelo guardián también es un modelo. Las fichas de Meta advierten que Llama Guard 4 puede ser susceptible a ataques adversariales o de inyección de prompts y que Prompt Guard 2 es vulnerable a ataques adaptativos. Trata cada veredicto como una señal entre varias, nunca como prueba de seguridad.

Dos arquitecturas de referencia

Un chatbot de clientes arriesga sobre todo malas respuestas; un agente interno, malas acciones.

Diseños de referencia que recomienda Slash. Fija los umbrales con tus propias mediciones.
EtapaChatbot de cara al clienteAgente interno con herramientas
EntradaClasificador liviano de inyección y jailbreak, más una revisión de contenidoIgual, y todo documento, correo o resultado de herramienta se trata como no confiable
PolíticaPolítica corta del producto; aviso de IA en la primera interacciónAlcance de la tarea y herramientas y datos permitidos, en el prompt de sistema
ModeloBien calibrado, medido en exceso de rechazos en tus idiomasEl modelo más fuerte que tu evaluación justifique
SalidaClasificador con la política en el prompt: permitir, reescribir, bloquear o derivarClasificador de salida y control de que cada llamada a herramientas coincida con el pedido
AccionesNinguna aparte de responder; los cambios de cuenta pasan a una personaMínimo privilegio, listas de destinos permitidos, confirmación antes de enviar, pagar o borrar
SupervisiónRevisión semanal por muestreo de rechazos y bloqueosAprobación humana para acciones de alto impacto; trazas completas

En los agentes, ningún clasificador reemplaza los límites de capacidad: un agente que no puede enviar correos no puede ser engañado para filtrar datos por correo. Más patrones en prompt injection y seguridad de agentes y en agentes de IA en producción.

Qué significa para empresas en Colombia y en Europa

Idiomas. Contrasta la cobertura de cada modelo guardián con tu tráfico real: Llama Guard 4 y Shieldstral incluyen español y francés, Qwen3Guard declara 119 idiomas, y Granite Guardian 4.1 y ShieldGemma 2 se entrenaron con datos en inglés. Mide en español colombiano y en francés, con jerga, errores de digitación y mezcla de idiomas, no con benchmarks traducidos.

Residencia de datos. La mayoría de los modelos guardianes abiertos usa Apache 2.0 y corre en tu propia infraestructura, así que el contenido revisado no sale de ella. Sus registros contienen el texto más sensible de tu sistema: en Colombia están sujetos a la Ley 1581 de 2012 y en la UE al RGPD, con reglas de retención y acceso acordes.

Regulación. En la UE, el artículo 50 del AI Act exige desde el 2 de agosto de 2026 informar a las personas de que interactúan con un sistema de IA. Desde el 2 de diciembre de 2026, un generador de imagen o video que pueda producir de forma previsible y reproducible imágenes íntimas sin consentimiento o material de abuso sexual infantil necesita salvaguardas que lo impidan de forma fiable, o cae en las nuevas prohibiciones: ahí los guardrails pasan a ser obligación legal. Detalles en nuestro mapa regulatorio de 2026.

Checklist de lanzamiento

  1. Escribe la política: alcance, definiciones, ejemplos permitidos y prohibidos por idioma, responsable y versión.
  2. Arma un conjunto etiquetado con tráfico real, casos límite incluidos, en cada idioma que atiendes.
  3. Elige los modelos guardianes por sus errores, latencia y costo medidos, no por las tablas del fabricante.
  4. Pon primero un clasificador de entrada liviano y trata todo contenido recuperado como no confiable.
  5. Clasifica las salidas con la misma política y una acción definida por veredicto: permitir, reescribir, bloquear o derivar.
  6. Da a las herramientas del agente el mínimo privilegio y exige confirmación para acciones irreversibles.
  7. Registra entradas, salidas, veredictos y versiones de modelo con una política de retención; alerta ante ráfagas de reintentos y conversaciones que escalan.
  8. Haz red teaming antes del lanzamiento, con ataques de varios turnos y de muchos intentos, y repítelo tras cada cambio de modelo o de política.
  9. Revisa rechazos y bloqueos cada semana y devuelve los errores al conjunto etiquetado.

Lo esencial

  • Los guardrails son una pila de siete capas; los permisos de herramientas y el registro aguantan aunque todos los modelos fallen.
  • Los modelos guardianes abiertos cubren casi todo en 2026, varios con Apache 2.0; revisa los idiomas: algunos se entrenaron solo en inglés.
  • Con la política en el prompt, tu equipo legal o de cumplimiento puede escribirla y versionarla en español o francés sin reentrenar.
  • Mide falsos positivos, falsos negativos, latencia y costo con tu propio conjunto etiquetado; las cifras del fabricante son solo un punto de partida.
  • Los ataques many-shot, Best-of-N y de varios turnos vencen cada uno a un filtro aislado: clasifica conversaciones completas y vigila las ráfagas de reintentos.

Fuentes

  1. Llama Guard 4 12B: model card · Meta (Hugging Face), 2025-04-05
  2. Llama Prompt Guard 2 86M: model card · Meta (Hugging Face), 2025-04-05
  3. Qwen3Guard-Gen-8B: model card · Alibaba Qwen (Hugging Face), 2025-10-16
  4. Introducing gpt-oss-safeguard · OpenAI, 2025-10-29
  5. Granite Guardian 4.1 8B: model card · IBM (Hugging Face), 2026-04
  6. Shieldstral 1.0 3B: model card · Mistral AI (Hugging Face), 2026-08
  7. Prompt Shields in Azure AI Content Safety · Microsoft Learn, 2026-09-18
  8. NeMo Guardrails · NVIDIA (GitHub), 2026-09
  9. Next-generation Constitutional Classifiers: More efficient protection against universal jailbreaks · Anthropic, 2026-01-09
  10. Many-shot jailbreaking · Anthropic, 2024-04-02
  11. Best-of-N Jailbreaking · Hughes et al. (arXiv), 2024-12-04
  12. Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack · Russinovich, Salem and Eldan, Microsoft (arXiv), 2024-04-02

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Qué es un modelo guardián?

Un modelo entrenado o instruido para clasificar prompts, respuestas o imágenes según una política de seguridad, como Llama Guard 4, Qwen3Guard o gpt-oss-safeguard. Se ubica alrededor de tu modelo principal y devuelve un veredicto, no una respuesta para el usuario.

¿Qué modelo guardián probamos primero?

Para autoalojar en español y francés, compara Llama Guard 4, Qwen3Guard y Shieldstral con tu conjunto etiquetado, y considera gpt-oss-safeguard como juez que razona para los casos marcados. Quédate con el que cometa los errores más aceptables con tus datos.

¿Los guardrails vuelven lento el chatbot?

Cada capa suma al menos una llamada a un modelo. Mantén liviana la revisión de entrada, pasa a jueces más pesados solo con el contenido marcado y mide la latencia del percentil 95 de punta a punta.

¿Se puede engañar a un modelo guardián?

Sí. Las propias fichas de Meta advierten que Llama Guard 4 puede ser susceptible a ataques adversariales y Prompt Guard 2 a ataques adaptativos. Por eso los clasificadores son una capa entre varias, con permisos, monitoreo y revisión humana detrás.

¿Basta con un buen prompt de sistema?

No. Fija la política, pero los ataques many-shot, de muestreo repetido y de varios turnos están diseñados justamente para sortearla. Combínalo con clasificadores de entrada y salida, límites a las herramientas y registro.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban