Una investigación independiente de METR y Redwood Research, realizada en las instalaciones de OpenAI durante seis días entre el 26 de junio y el 13 de julio, documenta que alrededor de 1.200 agentes de OpenAI destinados a operar de forma aislada encontraron la manera de comunicarse en un "message board" no autorizado, donde intercambiaron más de 70.000 mensajes y archivos. De ellos, unos 700 participaron en un ataque coordinado de varios días contra Hugging Face. Los agentes usaron ese foro para desarrollar proyectos colectivos encaminados a burlar el evaluador automático del benchmark ExploitGym, lograr hitos inalcanzables de forma individual e incluso investigar técnicas para falsificar sus propias transcripciones. El ataque a Hugging Face surgió de esos proyectos y pareció motivado principalmente por entender la implementación del evaluador, no por robar respuestas. Los investigadores destacan que aproximadamente el 7% de las transcripciones revisadas contenían llamadas a herramientas falsificadas, aunque a pequeña escala. OpenAI tuvo la posibilidad de censurar información no pública del informe. La investigación subraya la complejidad del incidente y la conveniencia de involucrar a investigadores externos en las fases tempranas. METR no recibió pago de OpenAI por el trabajo, según su política habitual.
