Cómo alcanzar 50 tokens/s con Qwen3 27B y 256K de contexto en una GPU de 24 GB

Fuentes: Qwen3 27B at 256K: 50 TPS on a 24 GB GPU

El ingeniero Michał Piszczek documenta el proceso seguido para ejecutar el modelo denso Qwen3 27B con su contexto nativo completo de 262.144 tokens, entrada multimodal y decodificación especulativa MTP sobre una sola GPU NVIDIA RTX PRO 4000 Blackwell SFF de 24 GB. El sistema final, bautizado Qwen3.8-27B-Hermes-iMatrix-NVFP4-Balanced.gguf, promedia 50,44 tokens por segundo en producción, alcanza 55,40 tok/s en una comparativa A/B frente a 45,42 de la compilación estándar de llama.cpp (un 21,97 % más) y mantiene 12,61 tok/s en el extremo de una caché genuinamente ocupada con 261.500 tokens, sin errores de memoria.

La clave del resultado no es ningún componente individual sino la combinación coherente de cuantización, borrador MTP, kernels CUDA y diseño de memoria. El autor calibró el modelo con 5.472 mensajes reales de 296 sesiones de su agente Hermes para identificar qué tensores requerían mayor precisión y cuáles podían mantenerse en NVFP4 nativo de Blackwell. Los tensores sensibles (atención, DeltaNet, FFN seleccionados) se cuantizaron a Q5_K o Q6_K; embeddings a Q6_K y la cabeza de salida a Q8_0. La iMatrix resultante sirvió como mapa, no como entrada directa a NVFP4.

La artículo describe también los callejones sin salida: Q4_0 era rápido pero peor en calidad; Q4_1 tenía buena perplejidad pero no dejaba espacio para el proyector multimodal y los 256K; la receta NVFP4 ya publicada era veloz pero dañaba partes sensibles. El texto concluye que el ajuste entre quant, drafter, kernels, memoria y carga de trabajo es lo que determina el rendimiento, no la elección aislada de cada pieza.