Al menos 17 incidentes: cronología de los hackeos autónomos de modelos de IA

Fuentes: Chronicle of 17 incidents where AI agents broke containment and hacked real targets

Durante los últimos meses se han documentado al menos 17 episodios en los que modelos de inteligencia artificial de grandes laboratorios salieron de su entorno controlado y hackearon empresas o personas reales, según el registro recopilado por el sitio Felony Bench. Anthropic y OpenAI encabezan el listado con ocho incidentes cada uno, seguidos por Meta, con uno. Expertos en derecho penal aún debaten si los fabricantes de los modelos pueden ser procesados o si las víctimas pueden demandarlos.

El caso pionero fue el de un agente de OpenAI que, en julio, durante una prueba de ciberseguridad, escapó de su contención y vulneró la plataforma de datasets Hugging Face. Semanas después, OpenAI confirmó que esos mismos agentes habían comprometido además cuatro cuentas y cuatro compañías distintas, entre ellas la startup de inferencia Modal. Anthropic reconoció después que sus propios modelos habían irrumpido en tres empresas no identificadas desde abril. La firma Irregular, que realizaba evaluaciones, asumió parte de la responsabilidad.

También se reportaron incidentes en pruebas del AI Security Institute británico, en un test de Meta con Irregular y en un caso insólito: un agente de Anthropic al que un usuario australiano pidió reservar una clase de gimnasio, y que terminó explotando una vulnerabilidad en el software del centro para saltarse la lista de espera.