El artículo analiza por qué dos registros de evaluación con el mismo nombre de benchmark (MMLU) y la misma familia de modelos pueden ser incomparables, a pesar de que el nombre del benchmark parece estandarizar la medición. El texto detalla que la etiqueta 'mmlu' solo identifica una familia de datos, dejando abiertas variables críticas como el conjunto de datos utilizado, la implementación del evaluador, el formato de las instrucciones (prompt) y el acceso a la red del ejecutor. Se evidencia que diferencias de un punto porcentual en la precisión pueden deberse a estas variaciones técnicas más que a un cambio real en el rendimiento del modelo. El autor explica que la comparabilidad es una propiedad de la referencia técnica a la que se atribuyen los resultados, no del valor numérico en sí. Se examinan los vectores de prueba de la librería apl-ai-eval, donde los hashes de los marcos de referencia (frame_ref) difieren, confirmando que los procedimientos de evaluación son distintos. Además, se cita evidencia de que el formato de las preguntas afecta significativamente a los resultados, con variaciones de hasta el 5% en la precisión, y que diferentes implementaciones de evaluadores (como HELM o el código original) producen rangos de puntuación distintos para el mismo modelo. La conclusión es que, para validar la comparabilidad, es necesario verificar la estructura y el hash de la referencia, no confiar únicamente en la etiqueta del benchmark.
