ReasonGate: una capa de seguridad auditable para aplicaciones basadas en LLM

Fuentes: ReasonGate: an explainable security gate for LLM applications

ReasonGate es una capa de seguridad de código abierto diseñada para interponerse delante de cualquier aplicación que utilice modelos de lenguaje grandes (LLM). Su propósito es bloquear ataques de inyección de prompts, incluida la inyección indirecta a través de documentos recuperados o resultados de herramientas, explicando en cada caso qué señal se activó y por qué se tomó la decisión.

La herramienta se presenta como respuesta a una limitación estructural de los LLM: al leer instrucciones y datos por el mismo canal, no pueden distinguir de forma fiable entre ambos. Por ello, la protección se sitúa fuera del modelo. ReasonGate envuelve cualquier función del tipo prompt → str, ya sea de OpenAI, Anthropic, un modelo local o una canalización RAG propia, e inspecciona tres superficies: el prompt del usuario, el contexto recuperado y la respuesta generada.

El núcleo, sin dependencias externas y escrito en Python puro, incluye normalización y desofuscación (caracteres de ancho cero, homoglifos cirílicos, leetspeak, base64), detección de inyección por reglas, escaneo de inyección indirecta, protección multi-turno con acumulación de riesgo entre mensajes y detectores de fuga de datos y de tokens canario. Un motor de política combina las señales mediante un modelo noisy-OR calibrado, de modo que varias señales débiles suman hasta producir un bloqueo mientras que el ruido aislado de un prompt legítimo no lo hace.

El repositorio publica una metodología de evaluación reproducible con métricas sobre conjuntos de prueba, validación cruzada y datos fuera de distribución, así como pruebas de robustez frente a obfuscaciones adversariales. La capa de detección basada en embeddings y el detector de procedencia se distribuyen como un complemento empresarial independiente; el núcleo funciona solo con reglas y se integra mediante pip install reasongate. Cada decisión produce un registro estructurado con identificador, marca temporal y evidencia por detector, apto para integrarse en flujos SOC, SIEM o de auditoría de cumplimiento.