Mid-Harness es una metodología diseñada para mejorar la fiabilidad de los agentes de terminal que operan mediante generaciones estocásticas de modelos de lenguaje. El problema central que aborda es la discrepancia entre la capacidad de un modelo para generar una acción válida y su capacidad para ejecutarla correctamente en un entorno real, donde errores menores como la instalación de paquetes incorrectos pueden degradar el rendimiento de manera irreversible. La técnica introduce una capa de verificación entre el generador de acciones y el entorno de ejecución (harness), permitiendo muestrear y validar candidatos antes de ejecutarlos, sin modificar la arquitectura base del modelo.
Los experimentos realizados con el modelo TMAX-9B y la plataforma TerminalBench-Lite demuestran que la asignación de cómputo en tiempo de prueba en esta frontera es crucial. Se observa que, bajo verificación débil, aumentar el muestreo de acciones no aporta beneficios significativos, mientras que un verificador capaz puede explotar alternativas útiles generadas por el mismo modelo. Por ejemplo, al usar un verificador GPT-5.6 Sol, la tasa de éxito (Pass@1) en TerminalBench-Lite aumentó del 50,00% al 68,03% al muestrear 8 acciones. La verificación par a par se identificó como el mecanismo más eficaz entre las evaluadas. Además, la destilación de respuestas del verificador más fuerte en el modelo TMAX-9B mejoró el rendimiento sin alterar al generador de acciones. Los resultados indican que combinar la escalabilidad de acciones y trayectorias logra mayores tasas de éxito a menor coste estimado en tokens que generar más trayectorias por separado, posicionando la escalabilidad de acciones como un objetivo prometedor para la optimización de agentes de terminal.
