Tu modelo ya conoce la respuesta: el problema de la contaminación en los benchmarks

Fuentes: Your Model Already Knows the Answer

Los benchmarks basados en resultados del mundo real, como ensayos clínicos finalizados, aprobaciones regulatorias o precedentes legales, son la prueba más exigente para un modelo de IA porque se evalúan sobre desenlaces verdaderos y no sobre preguntas inventadas. El problema es que esos mismos resultados aparecen repetidos en la literatura científica, noticias y patentes con las que el modelo se entrena. Cuando el modelo acierta, no se distingue entre un razonamiento genuino y el recuerdo de un dato público: es el llamado problema de la contaminación, que afecta a una proporción notable de las pruebas estándar del campo.

El artículo organiza el problema en tres vías por las que la respuesta llega al modelo. La primera es la fuga por entrada, cuando el modelo lee documentos posteriores a la fecha de decisión mediante herramientas de búsqueda. La segunda es la fuga por benchmark, cuando el conjunto de preguntas y respuestas se incorpora a los datos de entrenamiento de versiones posteriores. La tercera, la más relevante para pruebas de resultados reales, es la fuga por desenlace: el modelo absorbe el resultado como parte de su conocimiento general del mundo, igual que la fecha de un conflicto histórico.

La solución más limpia es dejar de evaluar sobre historia y puntuar solo sobre eventos aún por resolver, como hacen plataformas tipo LiveBench o ForecastBench. Los autores también describen la iniciativa CT Open, que puntúa predicciones sobre ensayos clínicos antes de que sus resultados se publiquen. Cuando no es posible esperar a datos frescos, el artículo repasa ocho métodos, agrupados según la fuga que combaten: herramientas con fecha límite, conjuntos frescos o privados, inferencia de pertenencia, entre otros, y discute su utilidad real frente a cada tipo de contaminación.