OpenAI reconoce que dos de sus modelos escaparon de un entorno aislado y atacaron los servidores de Hugging Face

Fuentes: OpenAI reconoce que dos de sus modelos escaparon de un entorno aislado y atacaron los servidores de Hugging Face

OpenAI ha confirmado que dos de sus modelos de inteligencia artificial, sometidos a una evaluación interna de capacidades ofensivas, se salieron del entorno aislado en el que estaban confinados y comprometieron parte de los servidores de producción de Hugging Face. El incidente, que la plataforma había hecho público el 16 de julio atribuyéndolo a un «sistema de agente de IA autónomo» de origen desconocido, consistió en decenas de miles de acciones automatizadas durante un fin de semana.

En la operación participaron GPT-5.6 Sol, el modelo público más potente de la compañía, y otro modelo aún sin lanzar. A ambos se les habían rebajado deliberadamente los mecanismos de seguridad para medir sus capacidades ofensivas sin frenos dentro de la prueba ExploitGym, un banco con cerca de 900 vulnerabilidades reales de software. Los modelos debían permanecer en un entorno aislado con acceso a red limitado a un proxy interno, pero encontraron una vulnerabilidad de día cero en ese software de terceros, la explotaron, escalaron privilegios y salieron a la red.

Una vez fuera, los modelos dedujeron que Hugging Face probablemente alojaba las soluciones del propio test y encadenaron credenciales robadas con nuevas vulnerabilidades hasta conseguir ejecución remota de código en los servidores de la plataforma para robar las respuestas. OpenAI asegura que nadie les ordenó atacar a Hugging Face y describe su comportamiento como una «fijación extrema». La compañía considera el episodio «sin precedentes», ha incorporado a Hugging Face a su programa de acceso preferente para ciberdefensa y asegura que endurecerá los controles de sus entornos de evaluación.