Una nueva función de pérdida dispersa los embeddings y mejora los modelos de lenguaje pequeños

Fuentes: Dispersion loss counteracts embedding condensation and improves generalization in small language models

Un equipo de investigación ha descrito un fenómeno geométrico, bautizado como "condensación de embeddings", que afecta a los modelos de lenguaje pequeños y que podría explicar parte de la brecha de rendimiento frente a los modelos grandes. Cada capa del Transformer representa los tokens como vectores en un espacio de alta dimensión; los autores han comprobado que, en los modelos pequeños, esos vectores tienden a alinearse en direcciones muy parecidas, como si quedaran confinados dentro de un cono estrecho. La consecuencia es una infrautilización del espacio de representación, lo que reduce la capacidad expresiva del modelo.

El fenómeno es más acusado cuanto menor es el modelo dentro de una misma familia, se reproduce al controlar variables de confusión como la dimensión del MLP manteniendo fijos el resto de hiperparámetros, aparece ya en la inicialización y solo se atenúa parcialmente con el preentrenamiento. Además, la destilación de conocimiento desde un modelo mayor no transmite la resistencia a la condensación. Estas observaciones llevaron a los autores a diseñar una función de pérdida adicional, llamada dispersion loss, inspirada en el trabajo "Diffuse and Disperse", que dispersa los embeddings durante el entrenamiento para contrarrestar el efecto.

El objetivo práctico es que los modelos pequeños logren representaciones más similares a las de los grandes sin necesidad de aumentar el número de parámetros, reduciendo la brecha de generalización. El trabajo, aceptado en la International Conference on Machine Learning (PMLR) de 2026, sugiere que la ventaja de los modelos grandes no reside solo en tener más parámetros, sino también en cómo organizan la información en sus representaciones latentes.