La 'benchmarkpocalipsis': cómo los LLM facilitan inflar resultados en pruebas de rendimiento

Fuentes: The benchmarkpocalypse

El ingeniero danluu acuña el término "benchmarkpocalipsis" para describir cómo los modelos de lenguaje están facilitando prácticas que antes requerían gran especialización: optimizar software para superar benchmarks sin mejorar el rendimiento real. A partir de su propio experimento con FRE, un motor de regex generado por un agente de IA, demuestra que es trivial obtener ganancias aparentes del 40% en suites de referencia como rebar, mientras que en pruebas de validación no vistas (el corpus de ripgrep) el resultado es hasta 10 veces más lento o incluso no completa la ejecución. Con una técnica sencilla — informar al LLM de que existe un conjunto de holdout — se logra una generalización parcial, pero FRE sigue siendo 4 veces más lento en los casos relevantes. La conclusión es doble: por un lado, proliferan las afirmaciones falsas de rendimiento porque ya no hace falta experiencia profunda en algoritmos de cadenas, SIMD o compiladores para fabricar ellas; por otro, los LLM reducen drásticamente el coste de escribir software especializado para cargas concretas, lo que podría trasladarse a sistemas más complejos como bases de datos. El artículo matiza que FRE, como biblioteca de propósito general, no es utilizable, pero el fenómeno que ilustra — la sustitución de conocimiento humano caro y escaso por bucles de agentes — sí lo es.