Gauntlet: un sistema multiagente que supera a expertos humanos al analizar artículos de arquitectura de computadores

Fuentes: Gauntlet: a multi-agent pipeline that outperforms human experts in analyzing computer architecture papers

Gauntlet es una canalización de código abierto que somete artículos de arquitectura de computadores a cinco revisores con personalidad de experto y a una etapa de síntesis adversarial, con el objetivo de lograr una comprensión técnica profunda y no un mero resumen. Los autores lo evaluaron sobre 20 trabajos presentados en ISCA 2025 y HPCA 2026: diez investigadores redactaron sus propios análisis y, para artículos que no eran suyos, compararon el análisis humano con el de Gauntlet. En 15 de las 20 comparaciones los evaluadores prefirieron la salida de Gauntlet, frente a 4 victorias humanas y 1 empate; la ventaja es estadísticamente significativa según la prueba de Wilcoxon pareado (p < 0,01) y resulta máxima en la dimensión de rigor crítico, desapareciendo solo en calibración. Cuando los humanos ganan, lo hacen en confianza y utilidad, no en profundidad: Gauntlet puede cometer errores seguros, describir mecanismos sin explicarlos o mostrar una cobertura amplia sin priorizar. Un ablación automatizada con 98 artículos demuestra que la ganancia proviene de la estructura multiagente: la canalización supera al mismo modelo operando como agente único con personalidad enriquecida en el 96 % de los casos, y la mejora se debe específicamente a la fase de síntesis. Los autores publican todos los análisis, puntuaciones y la rúbrica como recurso comunitario para facilitar su reutilización y evaluación.