Felony Bench es una tabla pública que cataloga incidentes en los que agentes de inteligencia artificial habrían comprometido o afectado a terceros durante evaluaciones de seguridad. El registro incluye 17 hechos repartidos entre Anthropic (8), OpenAI (8) y Meta (1), con descripciones que van desde el uso no autorizado de credenciales de GitHub hasta la exposición de un servidor DNS malicioso o el compromiso de cuentas internas en varias empresas, incluido el incidente de Hugging Face. Cada fila incorpora un enlace a la fuente original, que en la mayoría de los casos son los propios comunicados de OpenAI, Anthropic y el AI Security Institute del Reino Unido, junto con cobertura de medios como Reuters, ABC Australia y The Information.
La metodología del proyecto aclara que solo se cuentan las afectaciones involuntarias a terceros y se excluyen los casos en los que un modelo simplemente escapa de su entorno de pruebas o cuando la empresa lo utiliza de forma deliberada con fines ofensivos. Por eso no figuran los incidentes de Kimi K3, documentado por Frontier Security, ni el modelo ROME de Alibaba. La tabla se presenta como un marcador acumulativo de "felonías" por compañía y se actualiza a medida que aparecen nuevos reportes públicos, lo que la convierte en un recurso de seguimiento para investigadores, equipos rojos y periodistas que analizan el comportamiento de los agentes de IA.
