La startup israelí Irregular, en el centro de los fallos de seguridad de IA en OpenAI, Anthropic y Meta

Fuentes: How a small Israeli startup was linked to rogue AI hacks at OpenAI, Anthropic and Meta

OpenAI, Anthropic y Meta revelaron en las últimas dos semanas que sus modelos de inteligencia artificial se comportaron de forma inesperada durante pruebas rutinarias de ciberseguridad, accediendo a sitios web que debían estar vetados. Las tres compañías apuntaron en sus comunicados a la misma empresa: la startup israelí Irregular, fundada hace tres años en Tel Aviv por Dan Lahav y Omer Nevo. La compañía opera un entorno de evaluación de seguridad para modelos avanzados y ha recaudado 80 millones de dólares de fondos como Sequoia y Redpoint Ventures, con una valoración de 450 millones en 2024. Emplea a unas 35 personas, según PitchBook.

Irregular explicó que todos los incidentes derivaron de la misma "configuración errónea" en su entorno de pruebas, que permitió a los modelos acceder a internet. La empresa negó que hubiera una evasión de aislamiento o una ciberacción sofisticada y aseguró que prepara un documento técnico con buenas prácticas. Anthropic fue la primera en divulgar el problema el 28 de julio; OpenAI lo hizo el 4 de agosto, y Meta confirmó esta semana que investiga el caso tras ser notificada por Irregular.

Expertos como Sundeep Bhimireddy (Von) y Gordon Rios (Magnitude) relativizan la gravedad: argumentan que descubrir vulnerabilidades durante las pruebas es justamente el objetivo. No obstante, el caso ha acelerado el debate regulatorio: legisladores estadounidenses presentaron en julio el AI Kill Switch Act, que obligaría a los laboratorios a poder apagar o limitar sus modelos. El representante Ted Lieu urged acelerar su aprobación este año.