Quesma Blog publica un análisis exhaustivo sobre cómo afecta la cuantización al rendimiento del modelo Qwen3.8 27B en distintas tareas. El modelo completo en BF16 ocupa 55 GB de VRAM, fuera del alcance de la mayoría del hardware de consumo. Los experimentos, ejecutados con llama.cpp sobre GPUs alquiladas en Modal (NVIDIA L40S, H100 y H200) con un coste aproximado de 3.000 dólares, evaluaron los cuantizados de Unsloth sobre tres benchmarks: GPQA Diamond (ciencia), IFBench (seguimiento de instrucciones) y Terminal-Bench 2.1 (programación agéntica con 89 tareas).
Los resultados muestran que el cuantizado Q4_K_M, de 17 GB, cabe en una tarjeta de 24 GB como la RTX 4090 con margen para unos 64k tokens de contexto y ofrece un rendimiento prácticamente idéntico al del modelo completo en los tres benchmarks. A 2 bits (UD-Q2_K_XL, menos de 11 GB) sigue siendo útil: iguala el nivel de Opus 4.7 o Gemini 3.1 Pro en Terminal-Bench 2.1, aunque escribe alrededor de un 25% más de tokens en las tareas resueltas.
El colapso llega con la cuantización de 1 bit: los modelos rinden cerca del azar en GPQA Diamond, y forzar un mayor esfuerzo de razonamiento (xhigh) empeora los resultados, porque el modelo agota el presupuesto de tokens y devuelve respuestas vacías. Unsloth afirma que sus cuantizados UD-IQ1_S conservan el 72% de precisión top-1, pero en estas pruebas ese 28% perdido resulta determinante.
El artículo también advierte de que el ajuste de esfuerzo de razonamiento es crítico: xhigh (el valor por defecto) consume unos 8.000 tokens de razonamiento en GPQA y puede provocar 'sobrepensamiento'. La conclusión práctica es elegir el mejor modelo que quepa en la VRAM disponible junto con el contexto necesario: Q4_K_M basta para la mayoría de tareas y UD-Q2_K_XL sirve para las más sencillas, sin perder calidad de forma apreciable.
