ProgramBench Vetted es una nueva versión, compuesta por 50 tareas, del benchmark ProgramBench publicado por Meta en mayo de 2026. La prueba plantea una pregunta central: ¿puede un agente de inteligencia artificial reconstruir el código fuente de un programa a partir únicamente de su binario ejecutable y de su documentación? El agente recibe una terminal sin acceso a internet, mil pasos y seis horas para producir un código que reproduzca el comportamiento observado, y es evaluado mediante tests conductuales generados de forma automática.
La versión Vetted no busca aumentar la dificultad, sino mejorar la calibración: que cada punto de recompensa refleje fielmente el comportamiento pretendido, sin recompensar interfaces superficiales ni exploits del sistema de evaluación. Para ello, el proceso de construcción incorpora agentes jueces que evalúan cada tarea, agentes doctores que reparan problemas detectables, comprobaciones deterministas para fallos medibles y agentes adversariales que intentan explotar el sistema. Los casos ambiguos se elevan a revisores humanos.
El conjunto original contaba con 200 tareas, pero tareas derivadas de repositorios públicos pueden haber aparecido en datos de preentrenamiento, lo que abre la paradoja de la memorización: haber visto el código no garantiza saber reconstruirlo desde su comportamiento. ProgramBench Vetted retiene 50 tareas reservadas para evaluación, con cobertura ampliada mediante hasta 15 ensayos de generación de tests por cinco modelos frontera, deduplicación posterior y revalidación continua.
