NVIDIA ha presentado Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4, una variante optimizada para inferencia de su familia de modelos de lenguaje abiertos. El lanzamiento, fechado el 11 de agosto de 2026 según la ficha técnica publicada en Hugging Face, supone un paso más en la estrategia de la compañía por ofrecer modelos eficientes desplegables en hardware de consumo y de centro de datos.
El modelo emplea una arquitectura híbrida que combina Mamba-2 con capas de Mezcla de Expertos (MoE) y capas selectivas de Atención. En total dispone de 30.000 millones de parámetros, de los cuales solo 3.000 millones se activan por inferencia (de ahí la denominación A3B, "Active 3B"). Esta configuración busca un equilibrio entre capacidad representacional y coste computacional.
Una de las características más destacadas es su ventana de contexto de hasta un millón de tokens, una de las más largas del sector, y su capacidad de despliegue en una sola GPU. NVIDIA indica que el modelo puede correr en una sola H100, en una DGX Spark con chip GB10, en tarjetas Blackwell de mayor tamaño como GB200 o GeForce RTX 5090, e incluso en hardware Ampere mediante cuantización W4A16. La versión NVFP4 forma parte de una colección de 85 checkpoints optimizados para inferencia con la herramienta Model Optimizer de NVIDIA.
El modelo está preparado para uso comercial bajo la licencia OpenMDW 1.1, y soporta inglés, español, francés, alemán, italiano y japonés, además de lenguajes de programación. Los datos de preentrenamiento tienen corte en septiembre de 2025 y los de post-entrenamiento en mayo de 2026.
En cuanto al rendimiento, NVIDIA publicó una tabla comparativa entre la versión original en BF16 y la nueva cuantización NVFP4. En la mayoría de pruebas las diferencias son mínimas: MMLU Pro pasa de 81,94 a 81,62; GPQA Diamond mejora ligeramente de 75,44 a 75,57; SWE-bench Verified sube de 51,56 a 52,80. Sin embargo, en algunas tareas la cuantización NVFP4 muestra caídas más visibles, como HLE text-only (de 11,72 a 10,47) o SWE-bench Multilingual (de 39,33 a 36,47). En tareas agentivas y de razonamiento práctico el comportamiento se mantiene estable, e incluso mejora en GDPval-AA-V2 (de 832 a 865) y en τ³-bench Banking (de 9,28 a 9,48).
El modelo se publica junto con varias estrategias de decodificación especulativa pensadas para acelerar la generación de texto, incluyendo DSpark, Multi-Token Prediction (MTP) y DFlash. NVIDIA recomienda DSpark para flujos de trabajo de baja concurrencia en centro de datos y en DGX Spark. Los parámetros de muestreo sugeridos son temperatura 1,0 y Top_P 0,95.
En el plano de la implementación, el modelo está disponible a través de múltiples integraciones: Transformers de Hugging Face, vLLM, SGLang y Docker Model Runner. La propia ficha incluye ejemplos de código para servir el modelo con vLLM usando el backend MoE Marlin y caché KV en FP8, así como instrucciones para SGLang mediante Docker. Esta variedad de opciones facilita tanto la experimentación local como el despliegue en producción.
El lanzamiento se enmarca en la creciente competencia por ofrecer modelos abiertos cada vez más eficientes. La estrategia de NVIDIA con Nemotron combina arquitecturas no estándar (Mamba-2 + MoE + Atención), ventanas de contexto extensas y cuantizaciones agresivas como NVFP4, que reducen el uso de memoria y permiten ejecutar modelos grandes en hardware más accesible. Si la tendencia se mantiene, es esperable que en los próximos meses aparezcan más derivados optimizados y benchmarks independientes que permitan calibrar el rendimiento real del modelo fuera de las pruebas publicadas por la propia NVIDIA.
