Un nuevo estudio demuestra que los Modelos de Lenguaje Grandes (LLM) poseen una propiedad fundamental de linealidad oculta bajo la complejidad no lineal de su arquitectura. A través de la Superposición Lineal, los LLM generan una superposición de distribuciones de tokens futuros cuando se combinan linealmente entradas de textos distintos, un fenómeno que el autor denomina Hipótesis de Linealidad de Superposición.
El análisis revela que esta linealidad es intrínseca a la arquitectura Transformer y no un resultado emergente del entrenamiento. De hecho, la superposición tiende a disminuir a medida que avanza el preentrenamiento. Sin embargo, los autores muestran que es posible restaurar esta linealidad de manera significativa mediante un ajuste fino ligero, reduciendo la divergencia entre la distribución predicha y el promedio de las distribuciones individuales.
Además, el trabajo introduce un procedimiento de decodificación guiado que permite desentrelazar las salidas superpuestas. Esta técnica habilita la generación simultánea de dos continuaciones coherentes a partir de un solo paso de inferencia, lo que podría optimizar el procesamiento de múltiples flujos de texto en aplicaciones de IA.
