Un estudio reciente evalúa la eficacia de los agentes de código para automatizar el planificación de tareas y movimiento (TAMP) en problemas generalizados. La investigación demuestra que modelos como Claude Code (Opus 5) y Codex (GPT-5.6 Sol y GPT-6 Astra) pueden sintetizar programas que generalizan soluciones a través de múltiples instancias, superando a los planificadores diseñados manualmente. El experimento se realizó en 28 entornos simulados de KinDER y PDDLStream, evaluando 980 programas generados en 100 instancias no vistas, lo que supuso 98.000 episodios de evaluación en total.
Los resultados indican que los agentes de código logran un éxito medio del 56% al 95%, frente al 47% de los planificadores tradicionales en las 16 entornos donde estos son aplicables. A medida que aumenta el número de objetos en la escena, los programas generados por los agentes mantienen una ventaja significativa, utilizando una orden de magnitud menos cómputo por instancia. Los registros muestran que los agentes utilizan la interacción con el entorno para calibrar modelos físicos, probar casos límite y refinar estrategias. El estudio concluye que los agentes de código constituyen una línea base sólida para el TAMP generalizado y publica todo el código, incluyendo los prompts completos, para facilitar la replicación y el análisis de estos hallazgos.
