ProVer optimiza el aprendizaje por refuerzo agéntico mediante decisiones clave

Fuentes: ProVer optimizes agentic reinforcement learning by targeting pivotal decisions

El framework ProVer introduce un mecanismo de asignación de crédito granular en el aprendizaje por refuerzo agéntico, superando las limitaciones de la optimización de política relativa de grupo (GRPO). A diferencia de GRPO, que asigna ventajas uniformes a todos los tokens de la política, ProVer identifica decisiones pivamentales que determinan el éxito o el fracaso de las trayectorias. El sistema utiliza un juez agéntico para contrastar trayectorias exitosas y fallidas, proponiendo segmentos específicos responsables de la divergencia. En lugar de confiar ciegamente en esta selección, ProVer verifica la propuesta estimando la ventaja del segmento mediante la diferencia en las tasas de éxito terminal entre continuaciones de la política actual. Las estimaciones positivas se incorporan en las ventajas de GRPO dentro del segmento propuesto, permitiendo un entrenamiento más preciso sin evaluar exhaustivamente cada estado intermedio. En las pruebas realizadas en los entornos ALFWorld, WebShop y SearchQA, ProVer logró el mejor rendimiento promedio en ambas escalas de modelo. Para los modelos Qwen3.5-2B y Qwen3.5-4B, se observaron mejoras relativas del 9,91% y 7,12% sobre GRPO, respectivamente. Los análisis adicionales demuestran que la selección informada de segmentos mejora el entrenamiento de la política con un sobrecoste de generación modesto, incluso sin un modelo juez a escala de frontera, destacando la eficiencia y efectividad de este enfoque selectivo.