Benchmark de Benzi: eficiencia en resolución de errores frente a Claude Code

Fuentes: Benzi Benchmark: Efficiency in Bug Resolution vs Claude Code

Benzi presenta una comparativa técnica detallada de su harness de inteligencia artificial para la corrección de errores de código, midiendo su rendimiento contra herramientas principales como Claude Code y DeepSeek Harness. La evaluación se basa en 24 issues reales de GitHub escritos en 10 lenguajes de programación distintos, analizando tres métricas clave: las líneas de código fuente leídas, el tiempo real de ejecución (wall clock) y el coste económico por reparación.

Los datos revelan que Benzi logra una mayor eficiencia en la lectura de código. En total, Benzi con Sonnet leyó 9.125 líneas frente a las 20.704 de Claude Code, mientras que la variante de DeepSeek Harness llegó a leer 43.598 líneas para los mismos problemas. Esta diferencia indica que el sistema de Benzi requiere menos exploración del código base para identificar y resolver fallos complejos.

En cuanto al coste, utilizando tarifas por token publicadas, Benzi con Sonnet resolvió los 24 errores por un total de 17,96 dólares, mientras que Claude Code costó 39,54 dólares. Las variantes basadas en DeepSeek fueron significativamente más baratas (2,66 y 2,70 dólares respectivamente), debido al menor coste del modelo subyacente. Además, Benzi afirma haber resuelto el 78,2% de los 500 issues de SWE-bench Verified a un coste inferior a 10 centavos por arreglo. La herramienta destaca por su capacidad de mantener una pendiente de coste y lectura más baja a medida que aumenta la dificultad del bug.