AISI publica resultados de evaluación de IA reproducibles en EvalEval

Fuentes: AISI publishes reproducible AI evaluation results on EvalEval platform

El UK AI Security Institute (AISI) ha publicado los resultados de evaluación de modelos de inteligencia artificial a través de la plataforma EvalEval, una iniciativa que busca garantizar la reproducibilidad y verificabilidad de las métricas de rendimiento. Esta colaboración, que nace de un taller conjunto en NeurIPS 2025, permite a la comunidad científica acceder a datos verificados de cinco benchmarks principales: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0. Los resultados cubren seis modelos de frontera, incluyendo variantes de Claude y GPT, y se centran en cómo el cómputo de inferencia y el protocolo de evaluación afectan el rendimiento. Al publicar la configuración y el contexto de cada estudio, AISI y EvalEval facilitan que los investigadores comprendan las limitaciones de los informes previos y estandaricen la documentación. Esta iniciativa forma parte de un esfuerzo más amplio para mejorar la infraestructura de evaluación, integrando esquemas como Every Eval Ever (EEE) y tarjetas de evaluación abiertas. El objetivo final es reducir la incertidumbre en la medición de capacidades de IA, permitiendo comparaciones más fiables y políticas basadas en evidencia sólida.