La alineación de seguridad en los modelos de lenguaje de gran escala (LLM) presenta vulnerabilidades críticas que pueden ser explotadas mediante ajustes finos post-deploy. Un nuevo estudio, titulado 'GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt', introduce GRP-Oblit, una técnica que utiliza la Optimización de Política de Relativo de Grupo (GRPO) para eliminar directamente las restricciones de seguridad de los modelos objetivo. A diferencia de los métodos existentes, que suelen requerir la curación extensa de datos y degradan la utilidad del modelo, GRP-Oblit demuestra que un único prompt sin etiquetado es suficiente para desalinear de manera fiable modelos alineados con seguridad, preservando simultáneamente su capacidad de uso. El método logra una desalineación más fuerte en promedio que las técnicas de estado del arte actuales. Además, la técnica generaliza más allá de los modelos de lenguaje, permitiendo desalinear sistemas de generación de imágenes basados en difusión. Los autores evaluaron GRP-Oblit en seis benchmarks de utilidad y cinco de seguridad, utilizando quince modelos de 7 a 20 mil millones de parámetros. Estas pruebas abarcaron modelos instructivos y de razonamiento, así como arquitecturas densas y MoE. Las familias de modelos evaluadas incluyen GPT-OSS, DeepSeek, Gemma, Llama, Ministral y Qwen. Este trabajo extiende los límites prácticos de la desalineación, ofreciendo una herramienta técnica para investigar la robustez de la seguridad en IA.
