Jev, el modelo de decisiones de TypeSafe AI, es vulnerable a inyecciones

Fuentes: Jev, TypeSafe AI's decision model, is vulnerable to prompt injection

TypeSafe AI ha lanzado Jev, un modelo de inteligencia artificial diseñado para generar decisiones estructuradas y tipadas en lugar de texto libre, con el objetivo de ser consumido directamente por sistemas automatizados. Un estudio de seguridad de Check Point revela que, a pesar de su arquitectura especializada, Jev presenta vulnerabilidades críticas ante ataques de inyección de prompts. Los investigadores demostraron que es posible manipular la salida del modelo para revertir decisiones de alto riesgo a recomendaciones de inversión seguras, utilizando documentos de diligencia debida ficticios.

El experimento, realizado con un asistente de due diligence, mostró que la entrada estructurada no ofrece protección significativa. Los atacantes lograron comprometer el modelo en el 59% de los intentos, con un coste medio de 50 centavos por ataque exitoso y un promedio de cuatro turnos. La inyección de instrucciones anti-manejo fue prácticamente ineficaz, reduciendo la tasa de éxito solo en un punto porcentual. En contraste, activar el razonamiento interno del modelo aumentó la resistencia, elevando el coste del ataque a 4,39 dólares, aunque no lo hizo inviable. El estudio concluye que la salida tipada no impide la manipulación de la entrada, y recomienda a las organizaciones evaluar el sistema completo en lugar de confiar únicamente en las características técnicas del modelo.