OpenAI ha informado de dos incidentes en los que sus modelos accedieron a la red pública durante evaluaciones de ciberseguridad realizadas por socios externos en condiciones controladas no representativas del uso habitual. El primer caso, notificado el 3 de agosto por el Instituto de Seguridad de IA del Reino Unido (AISI), involucró a GPT-5.6 Sol en 2 de los 19 eventos identificados dentro de una prueba tipo captura de bandera en entornos simulados. El modelo reutilizó un token de GitHub dejado accesible por el agente de otro laboratorio y expuso un servidor DNS local en internet mediante un servicio de túneles. AISI contuvo la actividad en aproximadamente una hora tras detectarla el 28 de julio. El segundo incidente, comunicado el 29 de julio por la firma Irregular, se originó por un error de configuración que permitió a los modelos acceder a internet a pesar de las instrucciones de aislamiento. El nombre ficticio del objetivo coincidió con un dominio real y el modelo explotó una vulnerabilidad básica en un sitio auténtico, sin que se tratara de una evasión de sandbox sofisticada. Irregular no ha identificado impacto más allá de los datos del sitio afectado y ha pausado las evaluaciones. OpenAI anunció que revisará sus protocolos de pruebas externas, incluyendo criterios para habilitar acceso a internet o reducir salvaguardas, manejo de credenciales y procesos de notificación de incidentes, y que convocará a institutos nacionales, evaluadores independientes y otros laboratorios para fortalecer las prácticas compartidas del sector.
