Un panel analítico de acceso abierto examina qué benchmarks reportan los principales laboratorios de inteligencia artificial en las fichas técnicas de sus modelos. La herramienta, publicada en el repositorio "benchmark-radar", clasifica los benchmarks por número de laboratorios que los mencionan al menos una vez, ofreciendo una medida indirecta de la adopción real de cada prueba en el sector.
El sistema funciona a partir de un registro curado de model cards: cada ficha contribuye con una única mención por benchmark, con independencia de cuántas configuraciones publique. Cuando la ficha original presenta la tabla de resultados como imagen, los datos se transcriben mediante OCR, y el proyecto enlaza al documento fuente para que cualquier cifra pueda verificarse. La página principal muestra una serie temporal con el primer reporte de cada laboratorio (marcado con un rombo naranja) y un "tapiz" con todos los avisos fechados, lo que permite visualizar cuándo un benchmark pasó de ser minoritario a convertirse en estándar compartido.
El proyecto advierte que el ranking refleja convenciones de reporte, no calidad del benchmark: un mismo conteo entre seis laboratorios sugiere un estándar compartido, mientras que un conteo concentrado en un único laboratorio indica un estilo propio. Para evitar lecturas erróneas, la iniciativa distingue entre saturación de reporte y saturación de resultados, y mantiene columnas separadas de cobertura, evidencia y salud de las fuentes. En caso de fallo de la base de datos validada, la página remite a los "issues" diarios como respaldo informativo.
