Databricks ha publicado los resultados de un benchmark interno diseñado para medir el rendimiento de agentes de programación con IA sobre tareas reales extraídas de su propia base de código, que supera varios millones de líneas en lenguajes como Python, Go, TypeScript y Scala. El ejercicio, llevado a cabo por ingenieros como Vinay Gaba, Ankit Mathur, Rishabh Singh, Patrick Wendell y Matei Zaharia, agrupó a modelos y entornos de ejecución en tres niveles de capacidad. En la franja alta, los modelos más inteligentes resuelven cualquier tipo de problema, pero a un coste elevado; los modelos medianos y pequeños, como Haiku y GPT-5.4 Mini, mantienen una eficacia alta en tareas comunes a un precio muy inferior.
El análisis resalta el caso de GLM 5.2, que quedó estadísticamente empatado en calidad con Opus 4.8 pero a 1,28 dólares por tarea frente a los 1,94 dólares de Opus, lo que llevó a la compañía a promoverlo como modelo de uso diario. Otro hallazgo clave es que el coste por token no predice el coste por tarea: Sonnet 5 es 1,7 veces más barato por token que Opus 4.8, pero terminó costando 2,09 dólares por tarea al consumir 1,9 veces más tokens. El estudio también comparó distintos harnesses con el mismo modelo y registró diferencias de coste de más del doble, atribuibles a la cantidad de contexto enviado en cada turno. Databricks construyó la prueba sobre pull requests reales fusionadas por sus ingenieros, con tareas verificadas manualmente y sin juez LLM, y la usó para redistribuir la carga hacia modelos más eficientes, apoyándose en su gateway Unity AI y en la herramienta Omnigent.
