Un LoRA pequeño corrige el sesgo de los transformers

Fuentes: A Tiny LoRA Fixes the Premature Stopping in Transformers

Un estudio reciente revela que los modelos de transformers preentrenados subutilizan su profundidad arquitectónica al seguir referencias en el contexto. Los análisis indican que trece modelos base confían únicamente en 1,4 a 3,6 líneas de contexto, mientras que los bucles adicionales de preentrenamiento aportan mejoras marginales. Para superar esta limitación, los autores desarrollaron un LoRA de rango 8 entrenado para tareas específicas, aplicado en una capa temprana con todos los pesos del modelo congelados. Esta intervención permite extender significativamente la capacidad de cómputo del modelo sin modificar su estructura base.

Los resultados demuestran la eficacia de esta técnica: Qwen3-8B mejora su precisión exacta en cadenas de 24 líneas del 15,5% al 99%, mientras que un LoRA entrenado durante más tiempo alcanza las 50 líneas. En el caso de Ouro-1.4B, se logra alcanzar las 60 líneas tras cuatro bucles y al menos 160 líneas después de ocho. El mecanismo funciona mediante un 'relevo' de identidad de la cadena de programación a través de capas intermedias. Las cabezas congeladas leen progresivamente más hacia arriba en la cadena, y la eliminación de la atención a la línea padre detiene este proceso. Las mediciones en modelos de prueba localizan la última capa útil de intervención con precisión en tres de cuatro casos. Esta solución permite acceder a un cómputo mayor que las respuestas predeterminadas sugieren, ofreciendo una alternativa eficiente para mejorar el rendimiento de modelos de lenguaje en tareas de razonamiento complejo.