El equipo de ShapeLearn ha publicado los modelos completos de optimización para Qwen 3.8 27B, superando en rendimiento a su versión anterior, ShapeLearn-Lite. Aunque la versión Lite, lanzada el 18 de agosto de 2026, mostró una buena estabilidad, los nuevos modelos de ShapeLearn sitúan a todos los cinco modelos en la frontera de calidad-velocidad en seis comparaciones de GPU distintas. Esta mejora se debe a un mayor presupuesto de optimización y a la inclusión de un cabezal de decodificación especulativa (MTP) en cada archivo GGUF, lo que aumenta el throughput en todas las tarjetas probadas, incluyendo RTX Pro 6000, RTX 5090, RTX 4090 y RTX 3090.
Los benchmarks comparan el rendimiento de ByteShape con otros cuantizadores populares como Unsloth Dynamic v3, ISTA-DASLab, Bartowski y AtomicChat. En las pruebas realizadas con GPUs de 96 GB (RTX Pro 6000) y 32 GB (RTX 5090), los modelos de ShapeLearn mantienen su posición en la frontera de eficiencia. Por ejemplo, en la RTX Pro 6000, el modelo IQ4_XS-3.84bpw alcanza una precisión del 0.9963 y un throughput de 90.42 TPS, mientras que el modelo de referencia de DFlash2 requiere más memoria y no soporta entradas multimodales. La recomendación técnica es utilizar DFlash2 para máxima velocidad en texto puro cuando la memoria lo permite, y MTP cuando la compatibilidad con imágenes o la VRAM es prioritaria. Este avance posiciona a ShapeLearn como una herramienta competitiva en la optimización de modelos densos de IA.
