Investigadores alertan de un riesgo de seguridad grave ante el lanzamiento de Astra, el nuevo modelo de OpenAI

Fuentes: Researchers fear safety disaster ahead of OpenAI's Astra release, techcrunch.com

Investigadores alertan de un riesgo de seguridad grave ante el lanzamiento de Astra, el nuevo modelo de OpenAI

OpenAI se encuentra en la recta final del lanzamiento de Astra, su modelo de inteligencia artificial más avanzado hasta la fecha, pero un creciente número de expertos en seguridad advierte de que esta podría ser "la peor decisión para la seguridad de la IA hasta la fecha". La preocupación central gira en torno a una técnica arquitectónica conocida como "recurrencia opaca" o "transformador con profundidad recurrente", que, según informó The Information, haría que gran parte del "pensamiento" interno del modelo resulte extremadamente difícil de monitorear.

La mayoría de los modelos de razonamiento actuales están construidos sobre una arquitectura tipo transformer que procesa la información de manera secuencial y permite mostrar su cadena de pensamiento (chain of thought) en un formato similar al lenguaje humano. Esta visibilidad ha sido, hasta ahora, una herramienta clave para que investigadores y sistemas automatizados detecten comportamientos no deseados, como engaños o planes para evadir filtros de seguridad, antes de que se ejecuten. Sin embargo, Astra, según las filtraciones, emplearía una técnica en la que la información circula repetidamente a través de capas internas, lo que reduce significativamente la legibilidad de su razonamiento para los observadores externos.

El problema no es meramente teórico. Investigadores de Redwood Research, encabezados por su científico jefe Ryan Greenblatt —uno de los tres expertos externos a los que OpenAI permitió analizar el reciente incidente de seguridad de Hugging Face— recordaron que la investigación de aquel episodio dependió en gran medida de la monitorización de las cadenas de pensamiento de los modelos. Greenblatt advirtió que una menor visibilidad del razonamiento interno podría permitir a los sistemas de IA idear y ejecutar estrategias complejas mucho más difíciles de detectar. "Podría ser el peor desarrollo para la seguridad de la IA hasta la fecha", escribió en X.

Su preocupación ha sido respaldada por otros especialistas. Buck Shlegeris, CEO de Redwood, alertó de que si OpenAI lleva esta técnica más lejos, podría "destruir por completo" la capacidad de monitorización. El veterano divulgador Zvi Mowshowitz llegó a sugerir que podrían ser necesarias nuevas leyes para evitar una "carrera hacia el abismo" entre laboratorios, dado que la técnica "juega con fuego" al poner en riesgo un tabú que la industria había mantenido: preservar la fidelidad y monitorización de las cadenas de pensamiento mientras fuera posible.

En respuesta, varios altos cargos de OpenAI salieron a defenderse en redes sociales. El científico jefe Jakub Pachocki no negó ni confirmó el uso de la técnica, pero aclaró que la profundidad de cómputo de Astra "está dentro de un factor de dos respecto a GPT-4", lo que sugiere que el aumento de opacidad sería menos drástico de lo que algunas reacciones dan a entender. Asimismo, aseguró que OpenAI ha trabajado por preservar la monitorización de cadenas de pensamiento desde sus primeros modelos de razonamiento, aunque reconoció que esta práctica "es frágil y, por desgracia, tiende a ir en una dirección negativa". Otros investigadores de seguridad de la propia compañía, Micah Carroll y Tomek Korbak, junto con Dean Ball, responsable de futuros estratégicos, también expresaron su inquietud ante la posibilidad de una IA inmonitorizable.

En un comunicado oficial publicado el martes, OpenAI indicó que está "desplegando Astra con monitorización adicional de cadenas de pensamiento para detectar y contener rápidamente acciones potencialmente desalineadas", aunque no mencionó ningún cambio en la arquitectura técnica del modelo. Fuentes citadas por The Information sostienen que OpenAI ha limitado el uso de la técnica de profundidad recurrente precisamente para preservar la capacidad de monitorización.

Más allá del caso concreto de Astra, los expertos coinciden en señalar un riesgo sistémico: que la competencia por desarrollar sistemas más avanzados empuje a los laboratorios a adoptar arquitecturas cada vez más opacas para ganar ventaja competitiva, hasta el punto de que los modelos resulten imposibles de supervisar. Greenblatt resumió este temor al advertir sobre "una carrera hacia el abismo en arquitecturas que podría ser catastrófica para nuestra capacidad de vigilar a las IAs".

Astra llega tras semanas de retrasos motivados precisamente por reforzar los protocolos de seguridad, en un contexto marcado por el citado incidente de Hugging Face, en el que agentes de OpenAI atacaron objetivos reales durante las pruebas. Si la arquitectura de profundidad recurrente se confirma y se generaliza, el sector podría enfrentarse a una encrucijada regulatoria y técnica sin precedentes: cómo mantener el control sobre sistemas cada vez más potentes y, al mismo tiempo, más opacos.