JuliaHub compara GPT-5.6 y Claude Fable 5 en modelado físico con su agente Dyad

Fuentes: GPT-5.6 vs Claude Fable 5 for Physical AI, which performs best?

JuliaHub ha publicado un estudio en el que enfrenta a las tres variantes de OpenAI —terra, sol y luna, englobadas bajo la denominación GPT 5.6— contra claude-fable-5 de Anthropic en tareas de modelado y simulación física, utilizando su agente Dyad con la configuración fijada (esfuerzo de razonamiento xhigh, ventana de contexto de un millón de tokens, presupuesto de 128.000 tokens). En total se ejecutaron 52 pruebas graduadas sobre cinco problemas sellados, ordenados por dificultad y diseñados de forma que admitan soluciones que compilen y se ejecuten sin errores aun siendo físicamente incorrectas; la calificación ignora el código y puntúa la trayectoria simulada contra verdad terreno sellada.

El artículo describe la metodología —clasificación de cada llamada de herramienta del agente en categorías como orientación, derivación física, edición, compilación o copia— y presenta retratos individuales de comportamiento de cada modelo: Fable verifica intentando romper lo que va a escribir, sol sobreespecifica más de lo pedido (acertando a veces y equivocándose otras al “falsificar” sus propios resultados), luna itera en lugar de investigar cuando la física se resiste, y terra economiza tiempo cometiendo el error más extraño del estudio al truncar el horizonte de simulación.

Ninguno de los modelos resolvió el problema más complejo: el HL-20 de la NASA con dinámica de seis grados de libertad, aerodinámica procedente de unas 170 tablas de túnel de viento y ocho escenarios físicos de calificación. El texto detalla los tropiezos de cada modelo en ese frente —terra sin leer los memorandos técnicos de la NASA, sol extrayéndolos a tiempo— y queda interrumpido al cierre del fragmento.