El repositorio Qwen/Qwen3.8-2.4T-A95B-FP8 en Hugging Face distribuye los pesos cuantizados en FP8 de un modelo MoE de 2,4 billones de parámetros con 95.000 millones activos, pensado para ejecutarse en vLLM, SGLang, TokenSpeed o mediante Docker. El cuantificado utiliza granularidad fina con bloques de 128 y mantiene un rendimiento casi idéntico al del modelo original.
El modelo es de tipo Causal LM, con 92 capas, dimensión oculta de 8.192, embeddings de 248.320 tokens, 512 expertos (10 enrutados más 1 compartido por paso) y predicción multi-token (MTP). Su longitud de contexto nativa es de 262.144 tokens, ampliable hasta 1.010.000. La arquitectura combina Gated DeltaNet (atención lineal) y Gated Attention (MoE) en grupos de 23, con rotary embeddings de dimensión 64.
Qwen3.8 introduce por primera vez una variante de clase Qwen-Max en release abierto, con mejoras en programación, trabajo profesional, investigación y tareas agentic de horizonte largo. Incorpora control flexible del razonamiento mediante reasoning_effort y preserve_thinking, además de mayor autonomía planificación y compatibilidad con harnesses y herramientas de desarrollo.
La página ofrece instrucciones de uso con Transformers, vLLM, SGLang, Docker Model Runner, Google Colab y Kaggle, incluyendo fragmentos de código y comandos curl sobre la API compatible con OpenAI. Para quienes prefieran un servicio gestionado, Qwen comercializa Qwen3.8-Max a través de Qwen Cloud, con entrada por visión, soporte de no-pensamiento, contexto de un millón de tokens y herramientas integradas. La tabla de benchmarks compara Qwen3.8-Max con Opus 4.8, Fable 5, GPT 5.6 Sol y Qwen3.7-Max en suites como Terminal Bench 2.1, SWE-bench Pro, DeepSWE, GPQA Diamond o HLE.
