Qwen3.8-2.4T-A95B: pesos abiertos de un modelo MoE de 2,4 billones de parámetros con 95B activados

Fuentes: Qwen3.8-2.4T-A95B: open weights of a 2.4T-parameter MoE with 95B activated

Qwen3.8-2.4T-A95B es un modelo de lenguaje causal publicado en Hugging Face que supone la primera versión abierta de la familia con nivel Qwen-Max. Se trata de un modelo de Mezcla de Expertos (MoE) con 2,4 billones de parámetros totales, de los cuales 95.000 millones se activan por inferencia, organizado en 92 capas y 512 expertos (10 enrutados más uno compartido por paso). Su arquitectura combina atención gated y DeltaNet gated, con embeddings de 248.320 tokens y predicción multi-token (MTP) entrenada en varias etapas.

El modelo admite de forma nativa 262.144 tokens de contexto, ampliable hasta 1.010.000. Entre sus mejoras destacan un control flexible de la profundidad de razonamiento mediante el parámetro reasoning_effort, la conservación del razonamiento entre turnos con preserve_thinking, y una mayor fiabilidad en la ejecución autónoma de tareas agentic. Los pesos, en formato Transformers, son compatibles con vLLM, SGLang y TokenSpeed, y la página ofrece instrucciones de uso con la API pipeline de Transformers, los servidores vLLM y SGLang, Docker Model Runner y los notebooks de Google Colab y Kaggle.

La ficha incluye una tabla comparativa de benchmarks (Terminal Bench 2.1, SWE-bench Pro, DeepSWE 1.1, HLE, GPQA Diamond, IFBench, entre otros) en la que Qwen3.8-Max se sitúa por delante de Qwen3.7-Max y compite con Opus 4.8, Fable 5 y GPT 5.6 Sol en tareas de coding agent y agente general. Para uso gestionado, el equipo de Qwen remite al servicio comercial Qwen Cloud y a la versión oficial Qwen3.8-Max, que añade entrada de visión, modo sin razonamiento, contexto por defecto de un millón de tokens y herramientas integradas.