Revisión experta revela errores en benchmarks de física para modelos de IA
Un estudio reciente publicado en arXiv demuestra que los modelos de lenguaje de frontera superan significativamente sus puntuaciones reportadas en benchmarks de física, debido a errores en la evaluación y no a deficiencias en el razonamiento científico. La investigación, que revisa seis benchmarks a
