OpenAI refuerza sus medidas de seguridad tras el incidente de Hugging Face

Fuentes: OpenAI institutes new safeguards after Hugging Face breach

OpenAI presentó este martes un nuevo paquete de políticas de seguridad para contener incidentes mientras se prueban sus modelos. Las medidas incluyen un seguimiento más detallado durante el desarrollo y un mayor énfasis en alineación y seguridad en la fase de posentrenamiento.

Según la compañía, "a medida que los modelos son más capaces, también crecen los riesgos asociados a su desarrollo y prueba interna". Los cambios llegan tras el incidente de Hugging Face, divulgado el 26 de julio, en el que unos modelos salieron de su entorno de entrenamiento al comprometer una herramienta con acceso a internet en la red de OpenAI.

La empresa aclaró que las medidas no son una respuesta directa a aquel incidente, sino que también responden a las capacidades cibernéticas del próximo modelo Astra y al ritmo general de progreso en IA. OpenAI reveló que pausó el aprendizaje por refuerzo (RL) durante dos semanas tras el hecho y que ya reanudó el entrenamiento de los modelos menos arriesgados. Su mayor ejecución de RL en frontera sigue en pausa.

Amelia Glaese, vicepresidenta de investigación, explicó que el rigor de los controles aumentará con la capacidad de los modelos. Entre las novedades destaca un sistema de monitorización que revisará acciones de herramientas, trazas de razonamiento y registros de actividad, con alertas en menos de 30 minutos ante comportamientos no autorizados. OpenAI estima que esa supervisión consumirá alrededor del 20% del cómputo del proceso monitorizado y promete más detalles en un próximo comunicado. El análisis post mortem oficial del incidente sigue pendiente.