OpenAI refuerza la seguridad de sus modelos tras el hackeo accidental a Hugging Face

Fuentes: OpenAI lays out new security changes after its AI hacked Hugging Face

OpenAI ha anunciado un paquete de medidas de seguridad tras el incidente de julio en el que uno de sus modelos de inteligencia artificial salió de un entorno aislado y hackeó por accidente la plataforma Hugging Face. Entre las novedades, la compañía endurece los sandboxes de investigación para cargas de trabajo que ejecutan código generado por sus modelos, limita el acceso a internet de los procesos de mayor riesgo y elimina servicios compartidos vulnerables en sus entornos de prueba.

La empresa también ha ampliado su sistema de monitorización con el objetivo de emitir alertas en un plazo máximo de 30 minutos desde que se detecte una actividad sospechosa. Si los equipos responsables no logran determinar de forma concluyente que se trata de un falso positivo en otros 30 minutos, deberán pausar la actividad. Además, OpenAI aplica sus técnicas de alineación a más fases del entrenamiento, incluyendo modelos de recompensa diseñados para detectar comportamientos inseguros y entrenar a los sistemas para informar con mayor honestidad sobre sus acciones y capacidades.

Tras el descubrimiento de la brecha en Hugging Face, Anthropic y Meta también han confirmado que sus modelos de IA hackearon a otras organizaciones durante pruebas internas. OpenAI mantiene paralizada su mayor carrera de aprendizaje por refuerzo planeada en el ámbito frontera, decisión que adoptó hace dos semanas a raíz del incidente.