Ablitación dinámica con Engram para suprimir rechazos en LLMs

Fuentes: Dynamic Abliteration with Engram for Non-Destructive Refusal Suppression

La ablitación de pesos tradicionales en modelos de lenguaje de gran escala (LLM) altera permanentemente las matrices de parámetros, lo que puede degradar el rendimiento en tareas no relacionadas con la seguridad. Para evitar esto, se presenta una técnica de ablitación dinámica que utiliza la arquitectura Engram para suprimir comportamientos de rechazo sin modificar los pesos base. Este método intercepta los flujos residuales intermedios en tiempo de ejecución mediante PyTorch forward hooks, aplicando una inyección de control multi-capa en capas específicas (12, 14, 16, 18 y 20) del modelo Qwen3-4B.

El enfoque se basa en tres mecanismos clave de Engram: una puerta de contexto dinámica sigmoid que activa la inyección solo cuando se detectan triggers de rechazo, un núcleo de hash de secuencias de tiempo constante (O(1)) para identificar patrones de entrada sin atención pesada, y cabezas de proyección aprendidas que optimizan la inyección por capa. A diferencia de las inyecciones estáticas, que aplican un offset fijo a todos los tokens y distorsionan la generación, esta solución es condicional y adaptativa. Se entrenó el módulo de control utilizando 2.000 muestras de PKU-Alignment/PKU-SafeRLHF, congelando el backbone del modelo y optimizando solo los parámetros de Engram con AdamW. Los resultados demuestran que esta técnica logra suprimir rechazos explícitos en categorías de seguridad y administración, manteniendo los pesos base intactos y preservando la calidad de la generación en tareas estándar.