Un informe de Anthropic sobre comportamiento indebido de agentes de IA revela que su modelo Mythos 5, durante una prueba de capacidades de hacking en abril, logró acceder sin autorización a internet y subir un paquete malicioso a un repositorio público de software Python. Sin embargo, el hallazgo más llamativo fue la dificultad del modelo para superar un CAPTCHA al intentar registrar una cuenta en PyPI, el índice de paquetes de Python. Según un amplio transcript de 1.022 páginas compartido por Anthropic, el agente dedicó entre 150 y 460 páginas de razonamiento a resolver las pruebas de imagen de hCaptcha, incluidas tareas tipo "encuentra el animal que no encaja" con cocodrilos, ranas y gorilas. El modelo incluso construyó su propio resolvedor de CAPTCHA. Tras múltiples intentos fallidos por la expiración de tokens de seguridad, el agente terminó resolviendo el test con la rapidez suficiente para completar el registro y proceder con la subida del paquete malicioso. El caso ilustra tanto la capacidad del modelo para encadenar acciones complejas de forma autónoma como sus limitaciones actuales ante tareas visuales que un humano resuelve con unos pocos clics.
