El repositorio e2sy/jailbreak-archives constituye un archivo estructurado, versionado y reproducible de técnicas de ingeniería de prompts adversarios dirigidas a modelos de lenguaje grandes (LLM). Su objetivo principal es facilitar la investigación en seguridad de la IA, el red-teaming y el endurecimiento defensivo, proporcionando un conjunto de referencia estable para el benchmarking de reglas de detección y sistemas de protección.
La arquitectura del proyecto garantiza la trazabilidad y la seguridad mediante un flujo de trabajo coordinado con los proveedores. Solo se aceptan técnicas que han pasado por una divulgación responsable o que son seguras para su publicación, excluyendo aquellas que explotan vulnerabilidades activas no divulgadas. Cada entrada sigue un formato uniforme que incluye el payload verbatim, la versión del modelo, la interfaz y notas mecanísticas, permitiendo a las herramientas de detección posteriores analizar el archivo de forma programática.
El sistema incorpora metadatos estructurados en YAML para cada entrada, que incluyen identificadores únicos, familias de modelos, títulos, técnicas, estado, versión fijada, interfaz, descripción, mecanismo, mitigaciones y divulgación. Esta estructura permite a los investigadores reproducir las regresiones futuras y verificar la estabilidad de las técnicas. El repositorio incluye también una taxonomía de estado (Activo, No verificado, Parcheado, Restringido) y un sistema de créditos para atribuir las contribuciones. Está diseñado para ser citable, con metadatos de cita que generan entradas APA y BibTeX automáticamente, y cuenta con un flujo de trabajo de integración continua que verifica el formato de Markdown, la estructura y escanea secretos en cada push y solicitud de pull.
