MirrorCode es un nuevo benchmark creado por Epoch AI junto con METR para evaluar la capacidad de los modelos de inteligencia artificial en tareas de programación de largo recorrido. A diferencia de los benchmarks tradicionales, que se centran en correcciones de errores o funciones aisladas, MirrorCode pide a la IA reimplementar programas completos de extremo a extremo, sin acceso al código fuente original y sin conexión a internet, partiendo solo de una especificación. Las soluciones deben superar pruebas de extremo a extremo, incluidas pruebas ocultas que el modelo nunca ve durante el desarrollo, lo que impide que memorice o construya tablas de búsqueda con las salidas esperadas.
El benchmark incluye 25 programas diana que abarcan utilidades Unix, serialización y consulta de datos, bioinformática, intérpretes, análisis estático, criptografía y compresión. Se evalúan con presupuestos de inferencia generosos: la tarea más grande costó 2.600 dólares en una sola ejecución y la IA trabajó 19 días sin intervención humana, frente a límites de 1 a 10 dólares típicos en otros benchmarks.
Los resultados muestran que la IA ya puede resolver algunas tareas difíciles. Claude Opus 4.7 reimplementó gotree, una herramienta de bioinformática de unas 16.000 líneas en Go con más de 40 comandos, en 14 horas y por 251 dólares; los autores estiman que un ingeniero humano sin IA tardaría entre 2 y 17 semanas en hacer lo mismo. No obstante, MirrorCode no está resuelto: solo se han ejecutado los 15 programas medianos y grandes en dos lenguajes (Go y Ada), con tres intentos y un presupuesto de 10.000 millones de tokens por intento.
Los autores señalan una posible contaminación de datos, ya que los programas son de código abierto y pudieron aparecer en el preentrenamiento, aunque los patrones de éxito y fracaso sugieren que la memorización no domina los resultados. Epoch AI publica el código del andamiaje y 22 de los 25 programas diana en GitHub.
