Noticias que mencionan mini-swe-agent

Comparativa de nueve herramientas de código para modelos locales

La sustitución de las llamadas a la API de las herramientas de programación por modelos locales a menudo resulta en una experiencia de desarrollo deficiente, un fenómeno que los benchmarks tradicionales no capturan. Un análisis técnico reciente evalúa el rendimiento de nueve herramientas (harnesses)

DeepSWE evalúa con mayor precisión a los agentes de IA en programación

DeepSWE, un nuevo benchmark desarrollado por Wenqi Huang y colegas, busca mejorar la evaluación de agentes de codificación de inteligencia artificial. Este nuevo conjunto de datos aborda las limitaciones de los benchmarks existentes, como la contaminación de datos y la falta de verificación fiable.