Un estudio liderado por investigadores de la Universidad de Princeton revela que los agentes de inteligencia artificial aún no son capaces de realizar investigaciones científicas abiertas y originales, lo que pone en duda las predicciones sobre una automejora recursiva acelerada. Aunque los modelos pueden resolver problemas de ingeniería complejos, carecen del juicio y la creatividad requeridos para formular hipótesis innovadoras o pivotar ante enfoques fallidos.
Para evaluar estas capacidades, los científicos utilizaron el método de «evaluación en la sombra», solicitando a Claude Opus 4.8 de Anthropic que resolviera preguntas de artículos no publicados destinados a la conferencia NeurIPS 2026. A pesar de disponer de presupuesto computacional y acceso a la web, los agentes fueron rechazados por los autores originales de los trabajos debido a la baja calidad de sus contribuciones y la falta de rigor en sus experimentos. Los resultados sugieren que, mientras la IA es eficiente en tareas con respuestas verificables mediante aprendizaje por refuerzo, el pensamiento divergente y la intuición siguen siendo barreras críticas que podrían retrasar la automatización total de la investigación en IA.
