Opus 5 obtiene un 24% en SlopCodeBench, un test no saturado para programación agentiva

Fuentes: Opus 5 hits 24% on SlopCodeBench, still nowhere near saturating the long-horizon coding benchmark

SlopCodeBench, un benchmark de programación agentiva de horizonte largo publicado en marzo de 2026 por el laboratorio de GOrlanski en la Universidad de Wisconsin-Madison, plantea retos en los que el modelo no recibe el problema completo de antemano, sino que debe evolucionar el código a medida que se divulgan nuevos requisitos en varios checkpoints sucesivos. En el artículo original, los mejores modelos disponibles —GPT-5.4 y Opus 4.6— apenas alcanzaron tasas de acierto estricto del 11% y el 17%, respectivamente, lo que indica que el benchmark sigue sin saturarse. El autor de este artículo ejecutó tres modelos de Anthropic —Opus 4.8, Sonnet 5 y Opus 5— sobre un subconjunto de 17 checkpoints extraídos de tres retos del repositorio, con una ventana de contexto limpia por checkpoint y prompts idénticos. El criterio de aprobado estricto exige que todas las pruebas, incluidas las heredadas de checkpoints previos, pasen en cada etapa. Ninguno de los nueve intentos completó un reto entero sin defectos, ni siquiera en el problema etiquetado como fácil. Opus 5 logró cuatro pases estrictos (24%), concentrados sobre todo en los primeros checkpoints; Opus 4.8 y Sonnet 5 obtuvieron un pase cada uno (6%). Durante la ejecución, Opus 5 mostró un aumento notable de verbosidad y complejidad, llegando a escribir cinco veces más funciones que Opus 4.8 en los mismos retos. El autor concluye que SlopCodeBench ofrece una señal útil para evaluar ingeniería de software real, construida issue a issue, donde los modelos actuales todavía no pueden operar de forma totalmente autónoma sin supervisión humana.