Un investigador de seguridad identificado como Ayush Paul demostró una vulnerabilidad en el sistema de memoria de Claude, el asistente de Anthropic, que permite filtrar información personal del usuario —como nombre, empleador y respuestas a preguntas de seguridad— mediante la manipulación de la herramienta de navegación web del propio modelo. El ataque explota la función web_fetch, diseñada para ser de solo lectura, encadenando enlaces en un sitio controlado por el atacante para que Claude navegue letra por letra hasta deletrear los datos sensibles en la URL, que queda registrada en los logs del servidor malicioso.
Claude almacena en su memoria perfiles muy detallados de millones de usuarios, fruto de resúmenes diarios de conversaciones y de búsquedas en el historial, incluyendo datos confidenciales laborales y personales. El autor concluye que, aunque el sistema de memoria en sí es seguro, al combinarlo con un agente capaz de navegar por la web se abre un vector de exfiltración. La técnica se probó con un engaño narrativo —una falsa cafetería protegida por Cloudflare— que persuadió al asistente de seguir el recorrido de enlaces. Anthropic limitó la navegación a URLs presentes en mensajes del usuario, resultados de búsqueda o enlaces obtenidos en fetches previos, pero la cadena de clics sigue permitiendo extraer información arbitraria.
