Un nuevo estudio sobre el entrenamiento por refuerzo (RL) de modelos de lenguaje grandes (LLMs) identifica un sesgo conocido como el 'Efecto Mateo', donde las mejoras en el rendimiento son proporcionales a la competencia inicial del modelo. Este fenómeno explica por qué los problemas fáciles se resuelven rápidamente, mientras que los difíciles permanecen estancados, similar a la dinámica de 'los ricos se enriquecen' en la ciencia de redes y la economía.
El artículo analiza cómo el tamaño del lote de muestreo (batch size) afecta la eficiencia del entrenamiento. Aunque un lote más grande podría ayudar a encontrar soluciones raras en problemas difíciles, también aumenta la probabilidad de encontrar soluciones incorrectas en problemas fáciles, lo que desperdicia recursos computacionales. Los autores demuestran que, en el punto de inflexión del entrenamiento, el costo de filtrar problemas fáciles supera al beneficio de encontrar respuestas correctas en los difíciles.
Para abordar esto, proponen 'Never Give Up' (NGU), un método de muestreo adaptativo para RL asíncrono. NGU utiliza un tamaño de lote pequeño para problemas fáciles, filtrando rápidamente las respuestas incorrectas, y un tamaño grande para problemas difíciles, permitiendo explorar más variaciones. Este enfoque optimiza el uso de la computación, reduciendo el desperdicio en tareas simples y acelerando la convergencia en las tareas complejas. Las pruebas en benchmarks como GSM8k muestran que NGU supera a las configuraciones estándar de GRPO, especialmente en los conjuntos de datos más difíciles, al equilibrar la exploración inicial con la eficiencia posterior.
