Terminal-Bench-Science 0.1 es un benchmark de código abierto liderado por investigadores de la Universidad de Stanford y desarrollado por el equipo de Terminal-Bench junto a expertos de distintas disciplinas científicas. Su objetivo es medir las capacidades de los agentes de IA mediante flujos de trabajo reales aportados por científicos en ejercicio, no por desarrolladores de modelos ni proveedores de datos.
La primera versión incluye 70 tareas distribuidas entre ciencias de la vida, físicas, de la Tierra, matemáticas e ingenierías. Las tareas abarcan análisis de datos científicos, inferencia estadística, simulación, optimización, demostración de teoremas, reconstrucción de imágenes, procesamiento de señales, problemas inversos, calibración de sensores, ajuste de modelos, clasificación y aprendizaje automático científico. Cada tarea se evalúa en entornos realistas y se califica con pruebas reproducibles y específicas.
El proceso de selección fue exigente: de 920 propuestas recibidas, 464 fueron aprobadas para implementación y se abrieron 386 pull requests, pero solo 70 tareas llegaron a la versión final. El benchmark está concebido como una herramienta continua que evoluciona junto a los modelos frontera.
En los resultados, Claude Opus 5 con Claude Code obtuvo la mejor tasa de resolución con un 30,0%, seguido por GPT-5.6 Sol con Codex (22,4%) y Claude Fable 5 con Claude Code (21,4%). El mejor modelo abierto, GLM 5.3, alcanzó el 8,1%. El benchmark distingue entre sistemas con una resolución unos diez puntos porcentuales inferior a la de Terminal-Bench 3.0, un desfase deliberado para mantener el reto. Próximas versiones ampliarán la cobertura por dominios y retirarán tareas saturadas.
