Real-SWE evalúa IA en código empresarial privado con tasas de éxito bajas
El equipo detrás de Fable ha lanzado Real-SWE, un nuevo benchmark diseñado para evaluar el rendimiento de los modelos de inteligencia artificial de última generación en codebases empresariales reales y privadas. A diferencia de los benchmarks tradicionales que utilizan tareas sintéticas o de código
