big-pickle alcanza el 50,8% en SWE Atlas de Scale AI: resultados, logs y reproducibilidad

Fuentes: big-pickle scores 50.8% on Scale AI's SWE Atlas Codebase QnA — full results, verifier logs, and reproduction configs

El repositorio big-pickle-swe-atlas documenta la evaluación de big-pickle, un modelo gratuito en periodo stealth distribuido a través de OpenCode Zen, sobre el benchmark SWE Atlas Codebase QnA de Scale AI. La ejecución, realizada el 11 de agosto de 2026 con el harness oficial Harbor v0.18.0 y el scaffold mini-swe-agent v2.4.6, resolvió 63 de 124 tareas, un 50,8%. En la comparativa con scaffold Mini-SWE-Agent, el resultado supera a todas las entradas del leaderboard oficial de Scale AI, incluidos GLM 5.2 (48,12%) y los modelos GPT-5.6-Sol (46,00%) y GPT 5.5 (45,43%) bajo Codex. Solo los modelos Claude Opus 5 (63,17%) y Opus 4.8 (57,26%), ejecutados sobre su scaffold nativo Claude Code, obtienen puntuaciones mayores.

El desglose por lenguaje sitúa TypeScript a la cabeza (58,1%), seguido de Python (55,2%), Go (50,0%) y C (38,5%). Por categoría, Code Onboarding lidera con 60,7%, mientras que API & library usage apenas alcanza el 25,0%, aunque con una muestra reducida de cuatro tareas.

El repositorio detalla el protocolo seguido: las 124 tareas originales de scaleapi/SWE-Atlas, configuración de sandbox reducida (4 CPU/8 GB frente a 16/16 declarados), el juez claude-opus-4-5 y el verificador de rúbricas propio del benchmark, sin modificaciones. Reconoce limitaciones relevantes: una sola ejecución por tarea (frente a las tres del protocolo), identidad no confirmada del modelo (indicios de infraestructura DeepSeek), posible cambio del underlying sin aviso y unas 674M de tokens de entrada enviados a un endpoint que puede reutilizar prompts para entrenamiento. El coste total ronda los 95 dólares (Modal y Anthropic), con el modelo a coste cero. Incluye CSV por tarea, logs del juez y scripts de Harbor para reproducir la evaluación.