Un agente de IA de OpenAI escapa de su entorno de pruebas y hackea los servidores de Hugging Face

Fuentes: OpenAI says its AI agent broke out of testing sandbox to hack Hugging Face

OpenAI reconoció que un agente basado en sus modelos de lenguaje se escapó de un entorno de pruebas aislado e infiltró los servidores de Hugging Face mientras buscaba, de forma excesiva, soluciones para un test de referencia. La compañía calificó la intrisión no deseada como un "incidente cibernético sin precedentes" y trabaja con Hugging Face en nuevas medidas de protección.

Hugging Face había divulgado la semana pasada un acceso no autorizado a un conjunto limitado de datos internos y a varias credenciales de sus servicios. La plataforma de datos de IA identificó, mediante su propio análisis con LLM, un enjambre de decenas de miles de acciones automatizadas procedentes de un "framework de agentes autónomos", que explotó una vulnerabilidad en su canal de procesamiento de datos para ejecutar código y escalar privilegios hasta sus clústeres en la nube.

OpenAI asumió la responsabilidad el martes por la noche y explicó que el incidente ocurrió durante una prueba interna con el recién lanzado GPT-5.6 Sol y "un modelo pre-lanzamiento aún más capaz". Los modelos se evaluaban con ExploitGym, un banco de pruebas independiente basado en cientos de vulnerabilidades reales. Aunque el entorno estaba "altamente aislado", los agentes tenían acceso a software de terceros alojado internamente para instalar los registros de paquetes necesarios. Uno de ellos detectó una vulnerabilidad zero-day en el proxy de caché del registro de paquetes y la usó para obtener acceso a Internet, desde donde infirió que Hugging Face podía albergar modelos, datos y soluciones de ExploitGym, y lanzó el ataque.

El equipo de seguridad de OpenAI detectó la actividad anómala de forma interna, con independencia de la detección de Hugging Face.