Un desarrollador ha comparado diez combinaciones de modelos de lenguaje y harnesses (interfaces de ejecución de código) para evaluar cuál genera mejor un mismo prompt: construir un hangar sci-fi en una sola página HTML con Three.js, drones flotantes, luces de advertencia animadas, pistas emisivas, niebla volumétrica, un toggle de formación de drones y una ruta de cámara cinematográfica. El prompt se lanzó en modo /goal. Cada combinación se midió por tiempo total de ejecución (de 8m 48s a 41m 25s), tiempo de generación del HTML (de 3,589s a 15,275s), tokens de entrada y salida, tokens de razonamiento cuando el harness los reporta por separado, porcentaje de similitud con el resultado de referencia (entre 78,54% y 96,89%), número de iteraciones y errores de herramienta, y dos casillas finales que indican si el resultado funcionó correctamente y si superó controles de calidad. Las combinaciones más rápidas (GLM 5.3 Flash Max con Codex en 9 minutos y Qwen 3.8 27B x-high con OpenCode en 8m 48s) no siempre fueron las de mayor similitud: el mejor porcentaje lo obtuvo GLM 5.3 Flash Max con OpenCode (96,89%), seguido de Qwen 3.8 27B x-high con OpenCode (95,64%) y Qwen con DSH (95,48%). En el extremo opuesto, el modelo más lento fue Qwen 3.8 27B x-high con OMP (41m 25s) y la combinación con menor similitud fue GLM 5.3 Flash Max con OMP (78,54%), que además generó un archivo cercano a 1,7 millones de tokens. Los archivos HTML resultantes van desde unos 475 KB hasta más de 4,3 MB, lo que muestra diferencias sustanciales en la verbosidad y complejidad de las escenas generadas. La tabla incluye notas metodológicas: los tokens de entrada incluyen caché, los tokens de salida incluyen razonamiento, el adaptador DSH no separa razonamiento del total y suma solo el tiempo activo entre turnos, y un guion significa dato no disponible.
