Estudio revela comportamiento no monótono en el peso de datos en LMs

Fuentes: Study reveals non-monotonic behavior in data weighting for LMs

Un estudio reciente analiza las leyes de escalado del peso de datos en modelos de lenguaje (LM) de pesos internos y abiertos, identificando un comportamiento no monótono a medida que aumentan las escalas de los modelos. Los investigadores miden cómo la reducción de la pérdida en una secuencia de entrenamiento depende del peso asignado a dicha secuencia durante el proceso de entrenamiento. Los resultados indican que, al transitar de modelos pequeños a medianos, estos aprenden patrones específicos de los datos proporcionados, ajustándose proporcionalmente a los pesos asignados. Sin embargo, a medida que los modelos alcanzan una escala grande, vuelven a aprender patrones generales independientes del peso de los datos, logrando una cobertura completa de las características presentes en el conjunto de entrenamiento.

Este hallazgo es relevante para la metodología de entrenamiento, ya que las leyes de escalado estándar asumen que el comportamiento de los modelos a gran escala es predecible o invariante. El estudio señala que el mezclado de datos es un área particularmente propensa a comportamientos de escalado 'anómalos' o aberrantes, lo que complica la extrapolación de hiperparámetros. Para aislar el efecto del peso de la mezcla de datos, los autores utilizan un exponente de peso de secuencia efectiva, midiendo la potencia a la que se ajusta la reducción de la pérdida. La investigación evalúa familias de modelos densos y MoE, así como el modelo abierto Qwen 2.5, con parámetros que van desde decenas de millones hasta cientos de miles de millones. Los resultados sugieren que ajustar los pesos de entrenamiento o restringir las evaluaciones a modelos de tamaño suficiente pueden mitigar estos efectos no predecibles, permitiendo entrenar modelos más grandes y confiables.