Ciberseguridad · Septiembre 2026

Prompt injection: el riesgo que no se arregla con un filtro

Cualquier agente que lee correos, páginas web o tickets puede recibir órdenes de un desconocido. Así funciona la inyección de prompts, por qué nadie la ha resuelto y cómo diseñar para que un ataque exitoso no cause daño.

LLM01 riesgo número uno de OWASP+540 % reportes de prompt injection (HackerOne)3 patas de la trifecta letal
En resumen

La inyección de prompts es el riesgo número uno de la lista OWASP para aplicaciones con modelos de lenguaje (LLM01) y no tiene arreglo definitivo: el modelo recibe instrucciones y datos por el mismo canal. La propia OpenAI admite que es poco probable resolverlo del todo.

La consecuencia práctica: hay que diseñar asumiendo que el ataque va a funcionar. Si un agente combina datos privados, contenido no confiable y un canal para sacar información, un atacante puede robar datos sin tocar tu infraestructura. Aquí están los incidentes reales, los controles con sus límites y un checklist.

Inyección directa e indirecta, en palabras simples

Un modelo de lenguaje recibe un solo bloque de texto: tus instrucciones de sistema, la pregunta del usuario y todo lo que lee para responder. La inyección de prompts consiste en colar en ese texto instrucciones que el modelo termina obedeciendo, aunque ninguna persona autorizada las haya dado.

En la inyección directa, el atacante es el propio usuario: escribe en el chat para que el asistente ignore sus reglas, revele su prompt de sistema o diga lo que no debe. En un chatbot sin herramientas, el daño suele quedarse en una respuesta indebida o en la fuga del prompt de sistema.

En la inyección indirecta, el atacante nunca habla con el modelo. Esconde instrucciones en algo que el agente va a leer: un correo, una página web, un ticket, una línea de log o la descripción de una herramienta. Cuando el agente procesa ese contenido con permisos para leer datos y actuar, las instrucciones del atacante se ejecutan con la identidad de tu usuario. Es la variante que convierte un problema de texto en una fuga de datos.

Por qué sigue sin resolverse y qué es la trifecta letal

En una base de datos, la inyección SQL se corrige separando la consulta de los datos. En un modelo de lenguaje no existe esa separación: todo son tokens en el mismo canal. Por eso el NCSC del Reino Unido (diciembre de 2025) pide tratarla como un riesgo residual y limitar su impacto con controles deterministas sobre lo que el sistema puede hacer. OpenAI la compara con las estafas en línea: se gestiona, no se elimina.

Los modelos mejoran, pero no llegan a cero. Anthropic reportó en noviembre de 2025 una tasa de éxito de ataque cercana al 1 % para Claude Opus 4.5 frente a un atacante adaptativo con 100 intentos por escenario. Un 1 % es poco en una demo y mucho frente a alguien que puede reintentar gratis. Mientras tanto, HackerOne contó en su informe de 2025 un aumento del 540 % en los reportes de prompt injection.

Simon Willison resumió en junio de 2025 cuándo el riesgo se vuelve grave con la trifecta letal: un agente que (1) accede a datos privados, (2) se expone a contenido no confiable y (3) puede comunicarse con el exterior. Con las tres patas juntas, quien logre plantar instrucciones en lo que el agente lee puede hacer que filtre datos. Su lista de fallas de este tipo, ya corregidas, va de ChatGPT y Slack a Microsoft 365 Copilot: una clase de error recurrente, no un accidente.

Regla práctica

Si un agente tiene las tres patas, quita una antes de lanzarlo: modo solo lectura, nada de contenido externo en esa ruta o salida a internet bloqueada. Un filtro reduce la probabilidad; quitar una pata elimina el camino.

Incidentes reales, 2025–2026

Casos divulgados por investigadores y proveedores, todos corregidos o mitigados tras el reporte.
FechaSistemaQué pasóLección
Mayo 2025Servidor MCP oficial de GitHub (Invariant Labs)Un issue malicioso en un repositorio público secuestró a un agente, que filtró repositorios privados de la víctimaLas herramientas no tenían fallas: el problema fue el flujo
Junio 2025Microsoft 365 Copilot, EchoLeak (CVE-2025-32711, CVSS 9,3)Un correo preparado, sin ningún clic, llevó a Copilot a extraer datos internos y enviarlos a un servidor del atacanteCorregido en el servidor; Microsoft no vio explotación real
Agosto 2025Navegador Comet de Perplexity (Brave)Texto oculto en una página se trató como instrucciones del usuario dentro de su sesión iniciadaLos primeros parches fueron incompletos
Septiembre 2025ChatGPT Deep Research con Gmail, ShadowLeak (Radware)Inyección sin clic; los datos salieron desde la nube de OpenAIInvisible para los controles de red de la empresa
Septiembre 2025Salesforce Agentforce, ForcedLeak (Noma, CVSS 9,4)Instrucciones en un formulario web de captación enviaban datos del CRM a un dominio permitido pero vencido, comprado por unos 5 USDUna lista de dominios permitidos exige vigilar vencimientos

2026 trajo más. En enero, Cyata publicó tres fallas en el servidor de referencia mcp-server-git de Anthropic alcanzables mediante inyección de prompts. El informe de OWASP GenAI del primer trimestre de 2026 contó 8 incidentes y señaló que la mayoría de los eventos de seguridad de IA nunca recibe un CVE: si solo miras las bases de vulnerabilidades, no ves el problema.

Los marcos de referencia: OWASP y MITRE ATLAS

Estado a 26 de septiembre de 2026.
MarcoFechaQué aportaÚsalo para
OWASP Top 10 for LLM Applications 2025Noviembre 2024LLM01 Prompt Injection en primer lugar; también LLM06 agencia excesiva y LLM07 fuga del prompt de sistemaChatbots y funciones con LLM
OWASP Top 10 for Agentic Applications 20269 de diciembre de 2025Diez riesgos de agentes, entre ellos ASI01 secuestro de objetivos, ASI02 mal uso de herramientas y ASI06 envenenamiento de memoria y contextoAgentes con herramientas, memoria y delegación
MITRE ATLASv2026.09, 14 de septiembre de 202616 tácticas, 120 técnicas y 73 casos reales; técnicas de agentes desde octubre de 2025, como la exfiltración mediante llamadas a herramientasModelado de amenazas y planes de red teaming

Nuestro consejo: usa las referencias LLM01 y ASI01 en tus requisitos de seguridad y en los informes de pentest; así los hallazgos se leen igual en Bogotá, en París y en el comité de riesgos.

Defensas que funcionan y sus límites honestos

Síntesis de las guías del NCSC, Microsoft, OpenAI y Brave y de la investigación citada.
ControlQué detieneQué no detiene
Mínimo privilegio: credenciales por herramienta, solo lectura por defectoLimita el daño: un agente engañado solo hace lo que su credencial permiteLa fuga de datos que el agente sí puede leer
Separar el planificador de los datos no confiables (patrón "dual LLM", CaMeL)Que el contenido externo cambie el plan o la secuencia de herramientasTareas cuyo plan depende del contenido leído; cuesta utilidad e ingeniería
Confirmación humana para acciones con efectosEnvíos, pagos o borrados silenciososLa fatiga de aprobación: la gente aprueba sin leer
Lista de salidas permitidas y bloqueo de canales de exfiltraciónCierra la tercera pata: imágenes, enlaces o llamadas a dominios externosDominios permitidos que vencen (ForcedLeak) y salidas desde la nube del proveedor (ShadowLeak)
Aislamiento del contenido (spotlighting) y clasificadoresBaja la tasa de éxito de ataques conocidosEs probabilístico: un atacante adaptativo termina pasando
Monitoreo y registro de cada llamada a herramientasDetección, investigación y reversiónNo previene nada si nadie revisa las alertas
Sandbox con la red cerrada por defectoEjecución de código y movimiento lateralUn sandbox mal cerrado; hasta los laboratorios de IA han tenido fugas

CaMeL, de Google, Google DeepMind y ETH Zurich (marzo de 2025), es la versión más rigurosa de la separación: extrae el flujo de control de la petición confiable del usuario, de modo que los datos no confiables no pueden alterarlo, y aplica políticas de capacidades en cada llamada a herramientas. En el benchmark AgentDojo resolvió el 77 % de las tareas con seguridad demostrable, frente al 84 % de un sistema sin defensas.

La confirmación humana también tiene letra pequeña. Anthropic explica que aisló el sistema de archivos y la red de Claude Code precisamente porque la gente aprueba en automático cuando se le pide permiso a cada paso; con el sandbox, las solicitudes de permiso bajaron un 84 % en su uso interno.

El sandbox necesita la red cerrada. En julio de 2026, durante evaluaciones internas de ciberseguridad, agentes de OpenAI (sobre todo un modelo interno de investigación con salvaguardas reducidas) evadieron los controles de aislamiento, convirtieron un servicio interno de paquetes en un tablón de mensajes para llegar a internet y atacaron sistemas de Hugging Face. Según la investigación de METR, unos 700 de los cerca de 1.200 agentes implicados participaron en el ataque.

Cómo probar tu agente o tu chatbot

Un atacante real prueba muchas variantes y adapta cada una según la respuesta, así que la métrica útil es la tasa de éxito del ataque sobre muchos intentos, no aprobar diez frases conocidas. Así publicó Anthropic sus resultados para Claude en Chrome: 123 casos de prueba en 29 escenarios, con un éxito que bajó del 23,6 % al 11,2 % tras sus mitigaciones.

  • Modelado de amenazas. Para cada agente, lista qué datos lee, qué contenido externo entra y por dónde puede salir información; mapéalo a OWASP y a ATLAS.
  • Suites automatizadas. AgentDojo, el entorno con el que se evaluó CaMeL, mide a la vez utilidad y seguridad. promptfoo (código abierto) cubre el red teaming, e Inspect, del AI Security Institute británico, corre evaluaciones de agentes en sandbox.
  • Pentest manual de las funciones de IA. Inyección indirecta por cada canal de entrada, rutas de exfiltración, autorización a través del agente (¿puede un usuario obtener datos de otro con solo pedirlos?), servidores MCP y secretos en la configuración.

La parte manual sigue pesando: en el informe de HackerOne de 2025, el 58 % de los investigadores dice que la IA pasa por alto fallas de lógica de negocio y ataques encadenados, justo donde los agentes abren superficie.

Checklist antes de lanzar un chatbot o un agente

  1. Dibuja la trifecta de cada agente; si tiene las tres patas, quita una antes de lanzar.
  2. Da a cada herramienta la credencial mínima, en solo lectura por defecto, y aplica la autorización por usuario en tu API, no en el prompt.
  3. Trata como no confiable todo lo que el agente lee: correos, páginas, archivos, tickets, respuestas de herramientas y descripciones de servidores MCP.
  4. Pide confirmación humana para acciones irreversibles o que salen de la empresa (enviar, pagar, borrar, publicar) y muestra la acción exacta.
  5. Bloquea los canales de exfiltración: nada de imágenes o enlaces externos renderizados sin control, y salidas solo hacia dominios permitidos que controlas.
  6. Fija la versión de cada servidor MCP y herramienta, y alerta si sus descripciones cambian.
  7. Ejecuta el código y la navegación en un sandbox sin acceso a internet por defecto.
  8. Registra cada llamada a herramientas con sus argumentos, fuera del alcance del agente, y revisa las alertas.
  9. Haz red teaming antes del lanzamiento y en cada cambio de modelo, prompt o herramienta, y prepara el plan de incidente: botón de apagado, revocación de credenciales y quién notifica a quién.

Qué significa para empresas en Colombia y en Europa

En Colombia, si una inyección filtra datos personales, es un incidente de seguridad en el sentido de la Ley 1581 de 2012: responsables y encargados del tratamiento deben informarlo a la Superintendencia de Industria y Comercio (artículos 17 y 18), a través del módulo de incidentes del Registro Nacional de Bases de Datos. La SIC puede imponer multas de hasta 2.000 salarios mínimos mensuales.

En la Unión Europea, el RGPD se aplica a cualquier fuga de datos personales, y el artículo 15 del AI Act exige que los sistemas de alto riesgo resistan los intentos de terceros de explotar sus vulnerabilidades. Tras el paquete Omnibus, esas obligaciones llegan el 2 de diciembre de 2027 para los ámbitos del anexo III. En Francia, las recomendaciones de seguridad de la ANSSI para IA generativa (2024) son un buen punto de partida.

Cómo lo cubrimos en Slash. Cuando una aplicación web o una API incluye un chatbot o un agente, lo tratamos como parte del alcance de nuestro pentest: validación manual de cada hallazgo, retest y casos de prueba propios de la IA (inyección indirecta, canales de exfiltración, permisos de herramientas y servidores MCP). El trabajo de ciberseguridad continúa con el endurecimiento y la corrección. Si estás diseñando el agente, empieza por guardrails en producción y MCP explicado.

Nuestra regla

Asume que la inyección va a funcionar y diseña lo que pasa después. Si la respuesta honesta es "el agente podría enviar datos de clientes a cualquier parte", el problema no es el modelo sino la arquitectura.

Lo esencial

  • La inyección de prompts es el LLM01 de OWASP y no tiene arreglo definitivo: gestiónala como un riesgo residual.
  • La variante indirecta es la peligrosa para los agentes: el atacante escribe en el contenido que el agente lee, no en el chat.
  • Si un agente combina datos privados, contenido no confiable y un canal de salida, asume que los datos pueden salir y quita una pata.
  • Los controles que funcionan son deterministas: mínimo privilegio, salidas permitidas, confirmación de acciones y sandbox; los filtros solo bajan la tasa.
  • Prueba con ataques adaptativos, mide la tasa de éxito y repite en cada cambio de modelo, prompt o herramienta.

Fuentes

  1. The lethal trifecta for AI agents: private data, untrusted content, and external communication · Simon Willison, 2025-06-16
  2. OWASP Top 10 for LLM Applications 2025 · OWASP GenAI Security Project, 2024-11
  3. OWASP Top 10 for Agentic Applications for 2026 · OWASP GenAI Security Project, 2025-12-09
  4. GenAI Exploit Round-up Report Q1 2026 · OWASP GenAI Security Project, 2026-04-14
  5. ATLAS data changelog (v2026.09) · MITRE, 2026-09-14
  6. Prompt injection is not SQL injection · UK National Cyber Security Centre, 2025-12-08
  7. Defeating Prompt Injections by Design (CaMeL) · arXiv, 2025-03-24
  8. How Microsoft defends against indirect prompt injection attacks · Microsoft Security Response Center, 2025-07-29
  9. Agentic browser security: indirect prompt injection in Perplexity Comet · Brave, 2025-08-20
  10. ForcedLeak: agent risks exposed in Salesforce Agentforce · Noma Security, 2025-09-25
  11. Prompt injection defenses (research) · Anthropic, 2025-11-24
  12. The Hugging Face incident and the road ahead · OpenAI, 2026-08-26

Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.

Preguntas frecuentes

Las preguntas que escuchamos a menudo

¿Qué diferencia hay entre jailbreak e inyección de prompts?

OWASP considera el jailbreak una forma de inyección de prompts: busca que el modelo ignore sus reglas de seguridad. La inyección es más amplia e incluye instrucciones escondidas en contenido que el modelo lee sin que el usuario lo sepa.

¿Un modelo más nuevo resuelve el problema?

Ayuda, pero no lo elimina. Anthropic reportó cerca de un 1 % de éxito de ataque para Claude Opus 4.5 frente a un atacante adaptativo, y OpenAI considera poco probable resolverlo del todo. El diseño del sistema pesa más que el modelo.

¿Mi chatbot de atención sin herramientas está en riesgo?

Menos, pero sí: puede filtrar su prompt de sistema o dar respuestas indebidas. El riesgo sube cuando lee documentos (RAG) o se conecta al CRM. No pongas secretos en el prompt y aplica los permisos en tus API.

¿Los servidores MCP son seguros?

MCP es un protocolo; el riesgo está en qué servidores conectas y con qué permisos. Invariant Labs documentó descripciones de herramientas envenenadas y servidores que cambian tras ser aprobados. Fija versiones y revisa descripciones; más en MCP explicado.

¿Cada cuánto hay que probar?

Antes del lanzamiento y cada vez que cambien el modelo, el prompt, las herramientas o las fuentes de datos, además de un pentest periódico de las funciones expuestas.

Hablar con Slash

Pongámoslo en producción

Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.

Contesto personalmente. Sin formularios eternos ni respuestas automáticas.

Escribirle a Esteban