NVIDIA lanza Nemotron 3.5 Lightning y NeMo Switchyard para agentes de IA más rápidos y eficientes

Fuentes: NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI, muycomputer.com

NVIDIA amplía su familia de modelos abiertos Nemotron 3 con el lanzamiento de Nemotron 3.5 Lightning y la biblioteca de código abierto NeMo Switchyard, dos piezas diseñadas para acelerar y abaratar el despliegue de agentes de inteligencia artificial autónomos en empresas. El anuncio refleja un giro estratégico del sector: el futuro de la IA no reside en un único modelo todopoderoso, sino en sistemas de modelos especializados que cooperan dentro de arquitecturas multi-agente.

Nemotron 3.5 Lightning es un modelo de 30.000 millones de parámetros basado en la arquitectura mixture-of-experts (MoE), lo que significa que solo activa una fracción de sus parámetros en cada inferencia para maximizar la eficiencia. Según NVIDIA, ofrece hasta cuatro veces más velocidad de salida y reduce un 30% el tiempo de finalización de tareas agentic en comparación con otros modelos de su categoría. Está pensado para tareas especializadas de alto volumen dentro de sistemas multi-agente: revisión de código, uso de herramientas, monitorización de alertas de seguridad o resolución de consultas de facturación, funciones que no requieren un modelo frontera sino rapidez y precisión sostenida.

El modelo se ha desarrollado con contribuciones de la Nemotron Coalition, una red de partners que aporta metodologías de evaluación, software de inferencia y conjuntos de datos. Además, NVIDIA publica la mayor cantidad posible de datos y técnicas de entrenamiento, lo que permite trazabilidad, auditoría y entrenamiento de modelos derivados. Junto a Lightning, la compañía ha publicado el dataset Nemotron-RL-Agentic-Terminal-Pivot, orientado al entrenamiento de capacidades de agente de codificación.

Empresas como CrowdStrike (ciberseguridad), Harvey con Trajectory (servicios jurídicos), CodeRabbit con Baseten (revisión de código), Lila Sciences (ciencias físicas y de la vida) y Fastino Labs (desarrollo de software, finanzas y salud) ya están adaptando Nemotron 3.5 Lightning a sus cargas de trabajo. En materia de despliegue, el modelo puede correr en PCs con RTX, estaciones DGX Spark y DGX Station, dispositivos Jetson en el edge, workstations RTX PRO, data centers o la nube, lo que da a las organizaciones control sobre privacidad e infraestructura.

La segunda pieza del anuncio es NeMo Switchyard, una biblioteca de código abierto que actúa como router inteligente dentro de herramientas agentic. Su función es dirigir cada petición al modelo más capaz y adecuado según la tarea, combinando modelos abiertos, propietarios y de NVIDIA sin que los desarrolladores tengan que reescribir sus aplicaciones. El enrutador se puede ajustar según prioridades como calidad, latencia o coste.

Los benchmarks internos de NVIDIA muestran que NeMo Switchyard mantiene una precisión cercana al nivel frontera mientras reduce el coste de finalización de tareas a aproximadamente un tercio del coste de usar Opus 4.8 en solitario. Partners como Boomi (100% de precisión en enrutamiento por dominio, 59% del tráfico redirigido a un modelo ajustado cinco veces más rápido, 21% menos de latencia en turnos tardíos), Cadence (9,9% más de eficiencia en verificación formal), Classmethod (27% de reducción de coste), Cognition (28% menos de coste medio en Devin Desktop), Kong (integración nativa en AI Gateway), LangChain (74% menos de coste en 145 tareas multi-turno con solo un 7% de llamadas a modelos frontera y un 6% de pérdida de precisión), LiteLLM, Nous Research y Ramp están integrando o evaluando la tecnología.

El movimiento de NVIDIA se inscribe en una tendencia más amplia: los agentes always-on, sistemas que operan de forma continua, funcionan cada vez más como conjuntos de modelos. Un modelo frontera como Nemotron 3 Ultra o GPT-5.6 puede planificar y orquestar flujos de trabajo, mientras que modelos más pequeños y especializados como Nemotron 3.5 Lightning ejecutan tareas concretas con menor latencia y coste. La combinación de un modelo eficiente y un router inteligente permite a las empresas construir agentes más baratos, rápidos y respetuosos con la privacidad, sin renunciar al control sobre dónde corre la IA ni a la posibilidad de personalizarla con datos propios mediante NVIDIA NeMo.

A corto plazo, cabe esperar una adopción creciente de arquitecturas multi-modelo en el segmento enterprise. La pregunta abierta es si los costes de integración y orquestación compensarán los ahorros frente al enfoque tradicional de un único modelo por defecto, pero los datos aportados por NVIDIA y sus partners sugieren que, al menos en cargas agentic de alto volumen, la eficiencia del enrutamiento marca una diferencia significativa.