Terminal-Bench-Science: nuevo benchmark para evaluar agentes de IA en investigación científica
Terminal-Bench-Science 0.1 es un benchmark de código abierto liderado por investigadores de la Universidad de Stanford y desarrollado por el equipo de Terminal-Bench junto a expertos de distintas disciplinas científicas. Su objetivo es medir las capacidades de los agentes de IA mediante flujos de tr
