FrontierHarness Eval: evaluación comparativa de harnesses para ingeniería de software

Fuentes: FrontierHarness Eval

FrontierHarness Eval es un benchmark que mide el rendimiento y el coste de distintos harnesses —marcos que orquestan agentes de inteligencia artificial— en tareas de ingeniería de software ejecutadas en terminales. La evaluación v1.0 se centra exclusivamente en contextos de ingeniería de software y tareas basadas en línea de comandos, por lo que sus conclusiones podrían no generalizarse a otros ámbitos del trabajo de conocimiento.

La metodología emplea los runtimes de agentes de Runta como entorno común: todos los harnesses y el entorno de tareas se preparan una sola vez como un golden checkpoint y cada ejecución parte de un restore limpio con idéntica vCPU, memoria, tamaño de disco, contenido de disco y estado de memoria, lo que garantiza comparabilidad entre sistemas.

El estudio compara Codex (v0.148.0), DeepSeek Harness (v0.1.0-rc.8), Claude Code (v2.1.237), Pi (v0.84.2), Oh My Pi (v17.4.0), Kimi Code (v0.37.2), Exo Harness (v0.1.0), OpenCode (v1.18.19) y Hermes (v0.20.4), midiendo coste mediano por tarea y por tarea completada, tasa de acierto de caché y tiempo mediano por tarea. Los autores advierten de tres matices clave: la métrica de cache hit rate no equivale al coste (un fallo en 300 turnos puede gastar más con caché que un acierto corto sin caché), la calidad y el coste pueden divergir (Claude Code supera 19 tareas pero alcanza 18,34 dólares por tarea) y excluir los fallos infla las cifras (OpenCode aparece con bajo coste porque solo cubre 15 pases, pero al contar intentos fallidos el coste sube a 3,24 dólares por tarea).

El benchmark se ofrece como servicio: quien quiera probar su propio harness en Runta puede recibir 100 dólares en créditos iniciales.