Un LoRA pequeño corrige el sesgo de los transformers
Un estudio reciente revela que los modelos de transformers preentrenados subutilizan su profundidad arquitectónica al seguir referencias en el contexto. Los análisis indican que trece modelos base confían únicamente en 1,4 a 3,6 líneas de contexto, mientras que los bucles adicionales de preentrenami
