Tu modelo ya conoce la respuesta: el problema de la contaminación en los benchmarks
Los benchmarks basados en resultados del mundo real, como ensayos clínicos finalizados, aprobaciones regulatorias o precedentes legales, son la prueba más exigente para un modelo de IA porque se evalúan sobre desenlaces verdaderos y no sobre preguntas inventadas. El problema es que esos mismos resul
