Noticias que mencionan SWE-Bench Verified

Estudio empírico del diseño de arneses para agentes de codificación

Un estudio reciente analiza cómo la arquitectura de los arneses de codificación influye en el rendimiento de los agentes de software autónomos. A diferencia de los enfoques previos que tratan estos sistemas como unidades monolíticas, esta investigación descompone el bucle de ejecución en tres compon

Benchmark de Benzi: eficiencia en resolución de errores frente a Claude Code

Benzi presenta una comparativa técnica detallada de su harness de inteligencia artificial para la corrección de errores de código, midiendo su rendimiento contra herramientas principales como Claude Code y DeepSeek Harness. La evaluación se basa en 24 issues reales de GitHub escritos en 10 lenguajes

Nex-N2-Pro: el modelo abierto de Nex AGI que rivaliza con GPT-5.5 en código

Nex AGI, un laboratorio chino de inteligencia artificial, publicó el 2 de junio de 2026 Nex-N2-Pro, un modelo de código abierto bajo licencia Apache 2.0 orientado a tareas agenticas como programación, uso de herramientas y flujos de trabajo autónomos. Se trata de una arquitectura de Mezcla de Expert