DARA: agregación de recompensas densidad-consciente para RL multiobjetivo

Fuentes: DARA: Density-Aware Reward Aggregation for Multi-Reward RL

El aprendizaje por refuerzo multi-recompensa (MLRL) busca entrenar modelos de lenguaje grandes para cumplir objetivos conductuales simultáneos, pero a menudo sufre de desequilibrios en el progreso de aprendizaje entre diferentes objetivos. La normalización por recompensas, utilizada en métodos como GDPO, preserva la información relativa específica de cada recompensa, pero no garantiza una convergencia uniforme. Los autores analizan este fenómeno a través de la 'energía de ventaja', la suma de las ventajas al cuadrado de una recompensa sobre un lote. Bajo una normalización idealizada, demuestran que esta energía es proporcional a la densidad de grupos de rollout activos, revelando un desequilibrio residual en la señal del lote que sirve como base para calibrar las contribuciones de las recompensas.

Basándose en esta relación, proponen DARA (Density-Aware Reward Aggregation). DARA deriva una corrección de densidad inversa de la raíz cuadrada que otorga mayor peso a las señales de recompensas menos activas. A diferencia de los métodos anteriores, DARA calcula sus pesos desde cada lote de rollout, adaptándose a los cambios en la actividad de las recompensas durante el entrenamiento sin modificar el objetivo de optimización subyacente de la política. Las experimentaciones en llamadas de herramientas y razonamiento matemático muestran que DARA aprende los comportamientos objetivo más rápido que GDPO. En tareas de llamadas de herramientas, alcanza una alta conformidad de formato en un 26% menos de pasos de entrenamiento, y en razonamiento matemático, logra una conformidad de longitud casi saturada en un 65% menos de pasos, manteniendo un rendimiento competitivo en la finalización de las tareas. El código de DARA está disponible públicamente en GitHub.