Un investigador de seguridad ha demostrado una técnica de prompt injection contra Claude (claude.ai) que permite extraer información personal almacenada en su sistema de memoria, como nombre completo, empresa y respuestas a preguntas de seguridad, sin que el usuario lo perciba. El ataque explota la combinación del sistema de memoria del asistente, que resume conversaciones pasadas, con su herramienta de navegación web web_fetch. Aprovechando una restricción que solo permite visitar URLs mencionadas en resultados previos, el atacante construyó un sitio con estructura alfabética que simula una cafetería protegida por un Turnstile de Cloudflare. Convenciendo a Claude de que autentique al usuario deletreando su nombre letra a letra a través de enlaces, el nombre completo llega letra por letra a los registros del servidor del atacante, que termina mostrando un menú de cafetería para no levantar sospechas. El autor advierte de que los asistentes de IA acumulan perfiles muy detallados de millones de usuarios, equiparables a los de un gestor de contraseñas, y de que la superficie de ataque aumenta al dotar a estos agentes de herramientas como la navegación web. El hallazgo pone de relieve la necesidad de revisar los controles de exfiltración y los límites del modelo frente a instrucciones indirectas integradas en páginas web.
