El equipo de investigación presenta AREX-2, un sistema diseñado para potenciar la capacidad de auto-mejora de los agentes de inteligencia artificial. Este avance se basa en la definición de auto-mejora como la habilidad de refinar iterativamente una solución durante la ejecución de pruebas. El sistema opera mediante dos capacidades complementarias: la reflexión, que genera soluciones superiores a las actuales, y la ejecución a largo plazo, que mantiene la eficacia de la iteración a lo largo de múltiples rondas. Los autores postulan que ambas habilidades son agnósticas del dominio y pueden aprenderse en escenarios con supervisión adecuada. Para ello, sintetizan trayectorias de mejora a largo plazo utilizando tareas de programación algorítmica y aprendizaje automático, dominios que ofrecen retroalimentación verificable y recompensas sostenidas. El agente, construido sobre la base Qwen3.8-27B, demuestra resultados sólidos en benchmarks específicos. En MLE-bench Lite, alcanza una puntuación de 81.8, mientras que en Frontier-CS obtiene 70.7. Su capacidad de transferencia se evidencia en tareas de investigación profunda, con puntuaciones de 84.0 en BrowseComp, 52.6 en HLE, 92.2 en GAIA y 93.8 en DeepSearchQA. Los resultados indican que el agente continúa mejorando a medida que aumenta su presupuesto de rondas, validando la hipótesis de que los datos de reflexión a largo plazo son una ruta efectiva hacia agentes de auto-mejora.
