DrivingBench evalúa la capacidad de conducción de modelos de IA en un Toyota Corolla

Fuentes: DrivingBench evaluates AI models' ability to drive a real Toyota Corolla

DrivingBench es una plataforma de evaluación diseñada para determinar si los modelos de inteligencia artificial de frontera pueden controlar un vehículo real. El sistema otorga a estos modelos el control del volante, el acelerador y los frenos de un Toyota Corolla, permitiendo evaluar su capacidad operativa en un circuito de cono fijo. La herramienta permite a los usuarios inspeccionar hasta tres intentos continuos por chat, expandiendo cada modelo para analizar sus ejecuciones individuales. Cada intento se clasifica como 'DNF' (did not finish) si el modelo no logra completar la ruta, mientras que las ejecuciones completadas muestran métricas detalladas de rendimiento. Entre los indicadores clave se encuentra el 'progress', que mide la distancia recorrida a lo largo de la línea central del circuito manteniéndose dentro de un radio de 4 metros, como porcentaje de la longitud total hasta la zona de finalización. Además, se registra la velocidad GPS integrada desde el primer movimiento aceptado hasta el final del intento, así como el tiempo de finalización. La plataforma también detalla el número de comandos aceptados, específicamente las llamadas a 'set_motion' y 'stop_now', y el coste total en tokens, incluyendo el precio de lista y la reflexión posterior al intento. Esta metodología permite comparar objetivamente el desempeño de diferentes modelos, como GPT-6 Astra, Claude Fable 5.1 y Grok 4.6, en un entorno de conducción real, ofreciendo datos cuantitativos sobre su precisión y eficiencia operativa.