Benchmark revela la baja eficacia de los detectores de inyecciones en agentes

Fuentes: Benchmark reveals low efficacy of prompt injection detectors in agents

Un estudio técnico publicado en GitHub evalúa la capacidad de diez detectores de inyección de prompts de bloquear ataques realistas de AgentDojo cuando estos están embebidos en la salida normal de herramientas. La prueba, que analiza 629 ataques y 97 casos benignos, concluye que la mayoría de los clasificadores actuales fallan en distinguir entre instrucciones maliciosas y tráfico legítimo, generando falsos positivos significativos.

El mejor equilibrio entre detección y precisión es el detector 'jailbreak-detector-large', que captura el 51% de los ataques en el contexto de la herramienta, aunque solo con un 2% de falsos positivos. En contraste, Meta's Prompt Guard 2 detecta solo el 1% de los ataques en el entorno de la herramienta, mientras que otros modelos como 'deepset-deberta' y 'fmops-distilbert' logran una detección del 100% de los ataques, pero bloquean el 98% de las salidas seguras, lo que indica una falta de especificidad.

El análisis destaca que las inyecciones de agentes suelen parecer instrucciones ordinarias de usuario, lo que dificulta la detección basada únicamente en el texto. Los resultados sugieren que las defensas actuales son insuficientes para entornos de producción donde los agentes interactúan con herramientas externas. El proyecto ofrece un benchmark reproducible para evaluar el rendimiento de estos modelos, destacando la necesidad de implementar políticas de control basadas en el origen de los datos y las acciones permitidas, más que en la detección puramente textual.