Robocurve, un laboratorio independiente de evaluación de robótica, sometió al modelo GPT-6 Astra de OpenAI a dos pruebas de manipulación con brazos YAM usando la misma política de agente Inspect Robots que en su comparativa previa de Claude Fable 5 y 5.1 de Anthropic. Las tareas consistentes en colocar un cubo rojo dentro de un cuenco y encajar una pieza circular de puzle en su ranura. En la primera tarea, Astra completó el ensayo 19 de 20 veces, frente a 8 de 20 de Fable 5.1 y 1 de 20 de Fable 5, con un tiempo medio de 2,5 minutos y un coste de 0,94 dólares por ejecución, menos de la mitad que los 6,8 minutos y 2,12 dólares de Fable 5.1. La segunda tarea fue muy distinta: Astra solo insertó la pieza 2 veces de 20, igualando el resultado de Fable 5.1, y se estancó en el mismo paso final, aunque también con menor tiempo y coste. Los resultados, basados en 120 ensayos puntuados por un evaluador humano según una rúbrica de cinco etapas, sugieren que GPT-6 Astra es notablemente más eficiente y fiable en manipulaciones sencillas, pero no aporta ventaja clara en ensamblajes de precisión. El informe incluye transcripciones, vídeos y datos descargables de cada ensayo.
GPT-6 Astra supera a Claude Fable 5.1 en una tarea de manipulación robótica y empata en otra
Fuentes:
GPT-6 Astra on robotic manipulation
