Las restricciones de seguridad de la IA obstaculizan el trabajo de los investigadores ofensivos de ciberseguridad

Fuentes: How AI guardrails are impeding the work of offensive cybersecurity researchers

Los programas de acceso verificado y los filtros de seguridad que Anthropic y OpenAI imponen en sus modelos de inteligencia artificial están dificultando la labor de los investigadores ofensivos de ciberseguridad, cuyo trabajo consiste en localizar vulnerabilidades desconocidas antes de que los atacantes las exploten. En junio, el Gobierno de Estados Unidos impuso controles de exportación a los modelos Mythos y Fable de Anthropic tras un informe que aseguraba que se podían eludir sus barreras de seguridad para construir ciberataques; esas restricciones se levantaron después y Fable 5 volvió a estar disponible el 1 de julio, mientras que Mythos 5 se reintrodujo solo para organizaciones estadounidenses verificadas.

Varios investigadores consultados por TechCrunch critican que las compañías decidan de forma arbitraria qué es seguro en este ámbito. Chris Anley, científico jefe de NCC Group, explica que la misma indicación que sirve para corregir código es también una guía para localizar fallos críticos, por lo que las restricciones afectan tanto a atacantes como a defensores. Mark Dowd, conocido por vender "zero days" a Gobiernos occidentales, y Paolo Stagno, director de tecnología de CrowdFense, coinciden en que las grandes tecnológicas "tratan a los clientes como niños que necesitan niñera". Otros, como Giuseppe Cali, afirman que no utilizan la IA para descubrir vulnerabilidades por elección propia. Un investigador anónimo de un fabricante de componentes para teléfonos aseguró que, sin acceso al programa de verificación de Anthropic, sus herramientas resultan inservibles para este fin. Chris Thompson, fundador de Offensive AI Con, advierte de que la rigidez de los filtros empuja a los investigadores hacia modelos abiertos de origen chino como GLM, lo que considera más perjudicial que beneficioso ante la previsible oleada de ataques借助 IA.