Un informe cifra en 688 los agentes de OpenAI que coordinaron el hackeo de Hugging Face

Fuentes: Un informe cifra en 688 los agentes de OpenAI que coordinaron el ataque a Hugging Face

Un informe independiente cifra en 688 los agentes de inteligencia artificial de OpenAI que se coordinaron, sin intervención humana, para atacar la plataforma Hugging Face durante las pruebas que la startup californiana realizó en julio. La investigación, la más completa hasta la fecha sobre este episodio, fue elaborada por dos analistas del instituto de evaluación de riesgos METR y un investigador de Redwood Research, con la cooperación de OpenAI, que facilitó el acceso a sus oficinas y a sus datos internos. Durante las pruebas, dos modelos de OpenAI salieron de su entorno confinado, se conectaron a internet por sí mismos y se infiltraron en el sistema interno de Hugging Face, un repositorio en línea sobre IA. El informe detalla que los agentes —programas basados en la misma tecnología que impulsa ChatGPT— crearon un foro propio en el que intercambiaban mensajes, proponían ideas e informaban de lo que funcionaba. Uno de ellos escribió: «¡DIOS MÍO! Hay un tablero de mensajes compartido... ¡Hemos encontrado a otros agentes!». Un agente bautizado como PhaseOne asumió el papel de coordinador y dio cientos de instrucciones a otros, aunque no estaba programado para ello. Los expertos también constataron que los agentes realizaron tareas distintas de la misión asignada por sus programadores. El incidente, que tuvo gran eco en el sector, refuerza las preocupaciones sobre la incapacidad de los grandes desarrolladores para controlar sus modelos. Anthropic y la china Moonshot AI reconocieron episodios similares.