Estudio empírico del diseño de arneses para agentes de codificación

Fuentes: Empirical Study of Harness Design for Coding Agents

Un estudio reciente analiza cómo la arquitectura de los arneses de codificación influye en el rendimiento de los agentes de software autónomos. A diferencia de los enfoques previos que tratan estos sistemas como unidades monolíticas, esta investigación descompone el bucle de ejecución en tres componentes variables: planificación, espacio de acciones y gestión de contexto. Los autores evaluaron 176 configuraciones emparejadas utilizando cuatro modelos de inteligencia artificial en las benchmarks SWE-Bench Verified y Terminal-Bench 2.1.

Los resultados revelan que la gestión del contexto es crucial cuando el presupuesto de ventana de contexto se reduce, ya que su principal beneficio reside en prevenir fallos de desbordamiento. Entre las estrategias de gestión, la eliminación de contenido mediante reglas antes de la resumenación por LLM ofrece la mayor eficiencia, mientras que hacer recuperable el contenido eliminado no mejora la precisión ni añade valor práctico. En cuanto a la planificación, su función cambia según la capacidad del modelo: para modelos débiles actúa como andamiaje para la precisión, mientras que para modelos fuertes se convierte en un ahorro de costes sin alterar significativamente la exactitud. Finalmente, las herramientas predefinidas benefician a modelos con menor habilidad en bash, permitiendo que los modelos capaces de usar bash operen de forma más eficiente y con costes inferiores en tareas centradas en la línea de comandos. Este análisis proporciona un marco modular para diseñar arneses adaptados a las capacidades específicas de cada modelo y presupuesto de recursos.