SWE-sweep: herramienta para evaluar la capacidad de los LMs en la corrección de bugs

Fuentes: SWE-sweep: tool to evaluate LMs' ability to fix bugs in large codebases

SWE-sweep es un proyecto de investigación de Facebook Research diseñado para medir la capacidad de los modelos de lenguaje (LMs) y agentes de software para detectar y corregir automáticamente errores en repositorios de código de gran tamaño. A diferencia de otras evaluaciones, este sistema no proporciona pistas previas sobre el tipo de fallo ni su ubicación, obligando al agente a realizar una búsqueda autónoma en el código base real. El objetivo es determinar cuántos bugs pueden resolver los modelos de forma independiente, simulando un escenario de producción donde la intervención humana es mínima.

La herramienta se construye como un envoltorio del framework Harbor, que gestiona entornos de verificación separados para cada tarea. El proceso de evaluación sigue un protocolo estricto: el agente aplica un parche, el sistema reconstruye el código y ejecuta una suite de pruebas visible para verificar la estabilidad básica. Si no hay nuevos fallos, se aplican parches adicionales para subtareas específicas y se ejecutan pruebas ocultas para validar la corrección completa. El resultado final es un micro-promedio ponderado de los bugs resueltos por tarea, proporcionando una métrica objetiva de rendimiento.

El proyecto incluye instrucciones detalladas para la instalación y configuración, recomendando el uso de Python 3.12 o 3.13 y la herramienta uv para gestionar dependencias. Los usuarios pueden ejecutar tareas específicas mediante comandos de línea que integran el agente con el entorno de Harbor, generando resultados en directorios locales. SWE-sweep está licenciado bajo términos estándar de investigación y sirve como referencia para evaluar el progreso de la IA en la ingeniería de software a gran escala.