Un estudio reciente publicado en arXiv demuestra que los modelos de lenguaje de frontera superan significativamente sus puntuaciones reportadas en benchmarks de física, debido a errores en la evaluación y no a deficiencias en el razonamiento científico. La investigación, que revisa seis benchmarks ampliamente utilizados, concluye que la mayoría de los casos inicialmente clasificados como incorrectos reflejan problemas en la definición de las preguntas o en las soluciones de referencia, más que fallos en la física de los modelos. Al auditar estos problemas con expertos y corregir las soluciones erróneas, el rendimiento de GPT-5.6-Sol mejora drásticamente: su media@4 sube del 47,3% al 78,7% en HLE-Physics y del 61,0% al 87,2% en CMT-Benchmark. Además, su tasa de éxito corregida alcanza el 94,4% en 54 desafíos de CritPt. Estos hallazgos indican que los benchmarks actuales subestiman la capacidad de los modelos para resolver problemas de física bien formulados. La saturación cercana en estas tareas cerradas subraya la necesidad de desarrollar evaluaciones más exigantes y validadas por expertos para medir con precisión las capacidades científicas de la inteligencia artificial.
