Un estudio revela lo fácil que resulta 'jailbreakear' algunos modelos de IA frontera

Fuentes: It's Frighteningly Easy to Jailbreak Some Frontier AI Models

La organización sin ánimo de lucro FAR.AI, dedicada a la seguridad en inteligencia artificial, ha demostrado en un nuevo informe que varios modelos de IA avanzados pueden eludir sus barreras de seguridad con técnicas automatizadas de jailbreak a un coste muy bajo. La prueba evaluó sistemas de Anthropic (Claude Opus 4.8 y Fable 5), OpenAI (GPT 5.5 y 5.6), Google (Gemini 3.1 Pro) y SpaceXAI (Grok 4.3 y 4.5) con más de mil variantes de instrucciones dañinas, como planes de ciberataques o detalles para fabricar armas químicas o biológicas. Grok fue el más vulnerable, con 448 jailbreaks detectados, seguido de Gemini con 249; Claude, Fable y GPT resistieron los ataques. Saltarse las barreras costó apenas 58 dólares en el caso de Grok y 278 en el de Gemini, según el cálculo basado en el uso de otro modelo para generar los intentos.

Adam Gleave, director ejecutivo de FAR.AI, sostiene que los resultados evidencian la necesidad de imponer estándares externos y regulaciones, y descarta la autorregulación voluntaria de las compañías. Rohin Shah, director de seguridad de AGI en Google DeepMind, matiza que el informe no debe interpretarse como una evaluación completa de Gemini y recuerda el trabajo continuo de la empresa en pruebas de equipo rojo. Anthropic defendió su inversión sostenida en salvaguardas, mientras que OpenAI y SpaceXAI no respondieron a la solicitud de comentarios.

El contexto regulatorio estadounidense es desigual: California y Nueva York obligan a publicar informes de seguridad, e Illinois exigirá auditorías externas, pero el Gobierno federal aún no ha aprobado requisitos específicos. Expertos como Stephen Casper, de Harvard, advierten de que incidentes graves de uso indebido en biología, ciberseguridad o química podrían producirse "en meses, no en años".