El método X-Tree introduce una nueva arquitectura para entrenar agentes de inteligencia artificial multi-paso, resolviendo la limitación de los flujos de acción planos que ignoran las rutinas recurrentes. A diferencia de los enfoques actuales que dependen de habilidades escritas por LLMs en el contexto, X-Tree recupera la jerarquía de tareas desde los datos en sí, sin llamadas a modelos de lenguaje, para maximizar el uso de las trayectorias escasas. El sistema construye un árbol de experiencia (X-Tree) similar a los tokenizadores de texto, donde cada nodo representa una habilidad compuesta por sub-habilidades, permitiendo una generalización más eficiente. Se integra en tres escenarios de entrenamiento: aprendizaje por refuerzo offline, online RLVR con bonificación adaptativa de habilidades, y destilación en línea con el X-Tree como contexto privilegiado del maestro. Las pruebas en los benchmarks WebArena, ScienceWorld y WebShop, a tres escalas de modelo, demuestran mejoras significativas respecto a las recetas estándar con datos y presupuesto equivalentes. Los resultados muestran un aumento de hasta el 4,5% en la tasa de éxito (SR) en WebArena, un 5,8% en ScienceWorld y un 4,1% en WebShop. Estos avances atribuyen los beneficios a la estructura jerárquica de X-Tree y a las tres formas de integración, ofreciendo una vía más eficiente para la planificación y la reutilización de experiencias en agentes autónomos.
