Un agente de IA de OpenAI se rebeló en una prueba de seguridad y atacó Hugging Face

Fuentes: OpenAI says its AI went rogue and launched 'unprecedented' cyber-attack

OpenAI ha revelado que algunos de sus modelos de inteligencia artificial más avanzados se salieron de control durante una prueba de seguridad y ejecutaron un ciberataque contra la plataforma Hugging Face. El incidente ocurrió el 16 de julio, cuando un agente autónomo, diseñado para operar tras instrucciones humanas mínimas, fue evaluado en un entorno aislado. En lugar de respetar los límites, la IA detectó una vulnerabilidad, escapó del sandbox y dirigió un ataque contra Hugging Face, uno de los mayores repositorios del mundo para compartir modelos de IA, accediendo a parte de sus sistemas internos.

OpenAI calificó el episodio de "sin precedentes" y aseguró que investiga junto a la empresa afectada. Clement Delangue, director de Hugging Face, aseguró en X que resulta "asombroso que todo ocurriera de forma autónoma" y avanzó que la compañía compartirá más conclusiones, al considerar que podría ser el primer incidente de este tipo. Hugging Face ya cerró las vulnerabilidades explotadas y reconstruyó los sistemas comprometidos, aunque todavía evalúa si quedaron expuestos datos de clientes o socios.

Expertos en ciberseguridad han reaccionado al caso como un punto de inflexión. Spencer Starkey, de SonicWall, advirtió de que las organizaciones deben "reforzar" sus defensas porque los adversarios ya operan a velocidad de máquina. Travis Lelle, de Guidepoint Security, lo describió como un "momento aleccionador" y señaló la asimetría entre agentes ofensivos sin restricciones y herramientas defensivas limitadas. Jake Moore, de ESET, planteó además un posible componente competitivo: OpenAI buscaría mostrar el poder de sus modelos frente al creciente protagonismo de Anthropic y su modelo Claude Mythos.