AGI Ranker publica seis correcciones consecutivas en su metodología v2 y su sitio web

Fuentes: AGI Ranker ships six post-v2 fixes: methodology claims, mobile UX and social previews

AGI Ranker, un proyecto que ofrece una puntuación abierta de inteligencia artificial general (AGI Score) para modelos de frontera, ha publicado en pocos días seis versiones de mantenimiento (de la v2.0.1 a la v2.0.6) centradas en subsanar errores de contenido y de experiencia de uso detectados tras el lanzamiento de su metodología v2.

Las correcciones afectan tanto a los datos del ranking como a la interfaz. En el plano metodológico, el equipo reconoce que el sitio afirmaba que tres o cuatro benchmarks contaban con un techo humano medido, cuando en realidad solo uno de los diez benchmarks de la tabla, GPQA Diamond (0,81), dispone de esa referencia; los otros nueve se puntúan sobre el máximo del benchmark, sin afirmación de paridad humana. Además, la disculpa publicada a DeepSeek por atribuirle un resultado de ARC-AGI-2 sin fuente cuenta ahora con una página propia accesible y corregida, y se ha ajustado el recuento de celdas anuladas (cinco en total, no tres). También se retiró OSWorld (0,72) por falta de cobertura actualizada y se aclaró que FrontierMath (0,35) y SimpleBench (0,837) aún no tienen datos cosechados.

En el plano técnico se rediseñó la navegación móvil, añadiendo una barra compacta y sticky con el indicador de versión y un carrusel de secciones; se añadieron estados de pulsación compatibles con iOS Safari, se colapsaron los avisos de metodología en pantallas pequeñas con un expansor accesible y se versioning las URL de las imágenes de previsualización social para evitar que las plataformas mostraran cifras obsoletas. El proyecto subraya que ningún modelo empeoró su puntuación: la revisión solo recalibra la escala y corrige afirmaciones previas.