OpenAI ralentiza el entrenamiento de su modelo Astra para reforzar la seguridad y el alineamiento

Fuentes: Pacing model development in an era of cyber-critical capabilities

OpenAI ha reducido temporalmente el ritmo de escalado de sus modelos más avanzados tras detectar que su próximo sistema, Astra, podría alcanzar el umbral de capacidad cibernética crítica definido en su Preparedness Framework. La decisión se produce semanas después del incidente de seguridad entre OpenAI y Hugging Face, que expuso la necesidad de endurecer los entornos de investigación.

La compañía ha pausado durante dos semanas el entrenamiento de aprendizaje por refuerzo de sus modelos frontera y mantiene su mayor carrera de RL en espera mientras completa evaluaciones y evidencias de alineamiento. Entre las medidas implementadas figuran un mayor aislamiento de cargas de trabajo, aislamiento de red para procesos de alto riesgo, pruebas de seguridad continuas mediante agentes automatizados y un sistema de monitorización multietapa que examina la actividad interna del modelo en cada token muestreado. El sistema busca emitir alertas en menos de 30 minutos ante posibles violaciones de fronteras de seguridad críticas y, en su nivel máximo, pagina a los equipos de seguridad e investigación, que pueden suspender la actividad.

La monitorización, que se aplica a todos los entrenamientos e inferencias de Astra con herramientas, supone un sobrecoste aproximado del 20% del cómputo de inferencia monitorizado. OpenAI afirma que reforzará su Preparedness Framework con un enfoque más amplio que combine monitorización, alineamiento y seguridad, y prevé detallar el sistema de monitorización en una próxima publicación.