El SWE-rebench Leaderboard es una tabla de clasificación que evalúa modelos de inteligencia artificial y agentes en tareas de ingeniería de software, midiendo la tasa de resolución (Resolved Rate), la métrica Pass@5, el coste por problema y los tokens consumidos por problema. En la cabeza de la clasificación figuran Fable 5 [high] con un 64,5 % de resolución y un 78,4 % en Pass@5, seguido de Grok 4.5 [high] (63,8 % / 77,5 %) y Opus 5 [high] (63,4 % / 74,8 %). GLM-5.2 [high] ocupa la cuarta posición con un 62,9 % de acierto, pero alcanza el Pass@5 más alto del ranking, 81,1 %. GPT-5.6 Sol [medium] cierra el top cinco con un 62,3 % de tasa de resolución a un coste muy inferior, 0,85 dólares por problema y 605.340 tokens. Entre los agentes específicos, Junie Agent lidera con un 61,8 %, seguido de Claude Code Agent (60,4 %), Codex Agent (58,0 %) y Cursor Agent (51,7 %). El modelo más eficiente en coste es MiMo V2.5 Pro, con 0,10 dólares por problema, aunque su tasa de resolución es del 46,5 %. La tabla incluye además decenas de modelos sin datos disponibles todavía —entre ellos varias versiones de Claude, DeepSeek, Gemini, GPT-5, GLM, Qwen, Kimi y Llama— pendientes de evaluación. La lista permite comparar de un vistazo rendimiento, coste y consumo, lo que resulta útil para equipos que deban elegir un modelo o agente para tareas de programación automatizada.
SWE-rebench Leaderboard: clasificación de modelos de IA en ingeniería de software
Fuentes:
SWE-rebench Leaderboard
