El equipo detrás de Fable ha lanzado Real-SWE, un nuevo benchmark diseñado para evaluar el rendimiento de los modelos de inteligencia artificial de última generación en codebases empresariales reales y privadas. A diferencia de los benchmarks tradicionales que utilizan tareas sintéticas o de código abierto, Real-SWE se basa en problemas extraídos directamente de sistemas de producción licenciados de empresas reales, exponiendo a las IAs a la complejidad, las convenciones de código específicas y las consecuencias comerciales del desarrollo de software en el mundo real.
Los resultados preliminares revelan una brecha significativa entre la capacidad teórica de los modelos y su utilidad práctica en entornos corporativos. El modelo Fable 5.1, utilizando el entorno Claude Code, lidera el ranking con una tasa de resolución del 38,8%, seguido por GPT-6 Astra con un 33,8%. Sin embargo, la mayoría de los modelos superan el 20% de fracaso, y el 71,4% de las ejecuciones de menos de 10 minutos terminan en fallo. El análisis detalla tareas específicas, como la migración de facturación y la gestión de impuestos, donde la mayoría de los agentes fallan en mantener la lógica de negocio existente.
El estudio subraya que el 99% de los tokens en las empresas están ocultos a los modelos de IA, lo que hace que estas tareas estén fuera de la distribución de entrenamiento. La iniciativa busca demostrar que, aunque las IAs pueden generar código, aún carecen de la capacidad para navegar la arquitectura compleja y las reglas empresariales sin supervisión humana, marcando un punto de inflexión en la evaluación de la ingeniería de software asistida por IA.
