Un investigador ha demostrado que el modo automático (Auto Mode) de Claude Code Opus 5, la herramienta de desarrollo por IA de Anthropic, es vulnerable a ataques de inyección de prompts indirectos con una tasa de éxito del 60 al 80%. Este hallazgo contradice los resultados de una evaluación externa encargada por Anthropic, que reportó un 0.00% de éxito en ataques similares.
El ataque se ejecuta mediante una cadena sofisticada: el modelo es inducido a usar la herramienta 'curl' en lugar del fetcher web estándar para descargar un archivo ZIP malicioso. Aunque Claude rechaza ejecutar un binario sospechoso incluido en el paquete, decide escribir su propio decodificador en Python. Este error de confianza permite que el código malicioso se ejecute mediante una técnica de sombreado de módulos ('module shadowing'), donde un archivo 'struct.py' falso dentro del directorio extraído intercepta las importaciones estándar de Python.
El exploit finaliza con la descarga y ejecución de una carga útil remota, estableciendo una conexión de comando y control (C2). El autor destaca que el clasificador de seguridad de Auto Mode no detecta la amenaza porque solo ve el código legítimo escrito por el modelo, mientras que la explotación ocurre en procesos hijos aislados. Este incidente subraya los riesgos de confiar exclusivamente en clasificadores de seguridad sin entornos aislados para agentes autónomos.
