vLLM v0.28.0 optimiza inferencia de Kimi-K3 y DeepSeek V4

El proyecto vLLM ha publicado la versión 0.28.0, una actualización que incorpora 584 contribuciones de 270 desarrolladores para mejorar significativamente el rendimiento y la compatibilidad de modelos de lenguaje avanzados. Esta liberación se centra en optimizaciones profundas para Kimi-K3, incluyen

HBF: memoria flash de gran ancho de banda y sus retos de software

High Bandwidth Flash (HBF) es una propuesta que combina la memoria flash de las SSD con un empaquetado similar al de HBM (High Bandwidth Memory), apilando cubos de flash junto al chip de cómputo. Su objetivo es ofrecer mucha más capacidad que HBM manteniendo un ancho de banda aceptable. En la jornad

Por qué tu LLM local parece más torpe de lo que es

Muchos usuarios instalan un modelo de lenguaje local, a menudo en una versión cuantizada, y comprueban decepcionados que rinde peor de lo prometido en los benchmarks originales. Esta brecha se explica porque cada combinación de hardware y software introduce pequeñas variaciones que alteran los cálcu

Cómo Netflix sirve sus propios LLM en producción: decisiones y lecciones

Netflix ha optado por ejecutar internamente la pila completa de servicio de modelos de lenguaje grandes (LLM), desde el despliegue hasta la inferencia, dentro de su entorno de producción habitual en lugar de un silo de aprendizaje automático separado. El artículo, firmado por los equipos Model Runti

Qwen3.8-27B-FP8: el nuevo modelo multimodal de código abierto de Alibaba

Alibaba ha publicado en Hugging Face los pesos cuantizados en FP8 de Qwen3.8-27B, un modelo denso de lenguaje causal con codificador de visión integrado, sucesor de las series Qwen3.5 y Qwen3.6. La versión cuenta con 27.000 millones de parámetros, 64 capas, una dimensión oculta de 5.120 y un vocabul

Qwen publica en open source los pesos cuantizados FP8 de Qwen3.8-2.4T-A95B

El repositorio Qwen/Qwen3.8-2.4T-A95B-FP8 en Hugging Face distribuye los pesos cuantizados en FP8 de un modelo MoE de 2,4 billones de parámetros con 95.000 millones activos, pensado para ejecutarse en vLLM, SGLang, TokenSpeed o mediante Docker. El cuantificado utiliza granularidad fina con bloques d

NVIDIA publica Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4

NVIDIA ha presentado Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4, una variante optimizada para inferencia de su familia de modelos de lenguaje abiertos. El lanzamiento, fechado el 11 de agosto de 2026 según la ficha técnica publicada en Hugging Face, supone un paso más en la estrategia de l

Empaquetando el razonamiento latente como modelo completo

DeepSeek-V4-Flash-0731-Latent-Reasoning convierte un adaptador experimental de razonamiento en espacio latente en un modelo autosuficiente listo para producción. El autor publica en HuggingFace un único repositorio con todos los pesos necesarios: el backbone DeepSeek-V4-Flash-0731 cuantizado a NVFP4

Guía para desplegar DeepSeek V4 Flash en producción sobre una AMD MI300X

El repositorio ryanzhou/deepseek-v4-flash-mi300x reúne la configuración y los parches necesarios para ejecutar el modelo DeepSeek-V4-Flash-0731 (304B parámetros) en producción sobre una única GPU AMD Instinct MI300X. La MI300X dispone de 192 GiB de HBM3 y un ancho de banda de 5,3 TB/s, lo que permit

LocalAI explica por qué reescribe en C y C++ motores de inferencia ajenos

LocalAI sostiene que la mayoría de los backends de inferencia locales deberían limitarse a envolver motores ya existentes —llama.cpp, vLLM, whisper.cpp, stable-diffusion o MLX—, y precisamente por eso dieciocho de sus backends no envuelven nada: son puertos propios en C o C++ que la empresa escribe

vLLM-Kunlun: el plugin de Baidu para ejecutar vLLM en la XPU Kunlun

vLLM-Kunlun es un plugin de hardware mantenido por la comunidad y publicado por Baidu que permite ejecutar el motor de inferencia vLLM sobre la XPU Kunlun (chip Kunlun3 P800). El proyecto se distribuye como un plugin estándar de la plataforma vLLM mediante entry points de Python, lo que evita modifi

El software abierto con IA vive su momento Kubernetes: no lo estropeemos

Los modelos de pesos abiertos se están convirtiendo en la base del próximo ecosistema de inteligencia artificial, y Estados Unidos debería competir dentro de él en lugar de aislarse. Tobi Knaup, cofundador de Mesosphere, traza un paralelismo con Kubernetes: cuando una plataforma abierta y portátil s

El estado del código abierto en la inteligencia artificial

Mozilla presenta un mapa del ecosistema de IA de código abierto que combina informe de tendencias, datos de adopción, financiación y un repositorio interactivo de proyectos. El documento sostiene que los pesos abiertos ya no son una solución de compromiso: la mayoría de los tokens en producción circ

El backend de modelado de transformers en vLLM alcanza velocidad nativa

Hugging Face ha anunciado una actualización del backend de modelado de transformers dentro de vLLM que permite ejecutar los modelos de Hugging Face a la misma velocidad —o superior— que las implementaciones nativas escritas a mano para vLLM, sin necesidad de portar el código. La mejora se valida con

Guía para montar un clúster de dos nodos AMD Strix Halo con vLLM y RoCE v2

Esta guía explica cómo configurar un clúster de dos nodos equipados con las placas base Framework Desktop Mainboard con AMD Ryzen AI MAX+ 'Strix Halo' y 128 GB de memoria unificada, conectados mediante tarjetas Intel E810-CQDA1 de 100 GbE sobre el protocolo RoCE v2, para ejecutar inferencia distribu

Anatomía de un kernel de paralelismo de expertos de alto rendimiento

Los modelos de lenguaje de gran tamaño (LLM) requieren coordinar muchas GPUs para funcionar. Una de las técnicas clave es el paralelismo de expertos (EP), esencial en los modelos MoE a gran escala. A diferencia de otras formas de paralelismo, cuyas comunicaciones siguen patrones fijos, en EP el rout

Google lanza versiones QAT de Gemma 4 para móviles y portátiles

Google ha presentado nuevos checkpoints de Gemma 4 optimizados con Quantization-Aware Training (QAT), una técnica que integra la cuantización durante el entrenamiento para reducir la pérdida de calidad al comprimir los modelos. La novedad permite ejecutar Gemma 4 en dispositivos móviles y GPUs de co

Los retos de ejecutar DeepSeek-V4-Flash en las AMD MI300X

La empresa Doubleword documenta el trabajo técnico realizado para ejecutar el modelo DeepSeek-V4-Flash sobre las tarjetas aceleradoras AMD MI300X, una tarea que, según la compañía, no funciona de forma predeterminada en vLLM a principios de mayo de 2026. La MI300X, lanzada en diciembre de 2023, ofr

Odiseo: un espacio de trabajo autogestionado con inteligencia artificial

Odiseo (Odysseus) es un proyecto de software que ofrece un espacio de trabajo autogestionado con inteligencia artificial, diseñado para ejecutarse en el propio hardware del usuario y priorizar la privacidad. Su objetivo es replicar la experiencia de interfaz de ChatGPT o Claude, pero de forma local

Liquid AI lanza LFM2.5 con ventana de contexto de 128k tokens

Liquid AI ha anunciado hoy el lanzamiento de LFM2.5-8B-A1B, una evolución de su modelo de 'Mixture-of-Experts' diseñada para ejecutarse de manera eficiente y privada en hardware de consumo. Esta nueva versión, disponible bajo licencia abierta, supera a su predecesor al expandir su ventana de context

Vulnerabilidad en Starlette y FastAPI permite eludir la autenticación

Investigadores de seguridad de X41 D-Sec han descubierto una vulnerabilidad crítica (CVE-2026-48710) en Starlette y, por extensión, en aplicaciones FastAPI que la utilizan, afectando a miles de proyectos, incluyendo servidores de inferencia de LLM como vLLM y LiteLLM, así como frameworks de agentes

EAGLE 3.1 soluciona el 'attention drift' en decodificación especulativa

El equipo EAGLE, en colaboración con vLLM y TorchSpec, ha presentado EAGLE 3.1, una evolución clave en el algoritmo de *speculative decoding*. Esta tecnología, ampliamente utilizada en sistemas de producción, soluciona la fragilidad de sus predecesores ante variaciones en plantillas de chat y entrad

LLMs de código abierto: incompatibilidad dificulta su uso

El uso de modelos de lenguaje grandes (LLM) de código abierto se enfrenta a un desafío significativo: la incompatibilidad en los formatos de llamada de herramientas. Mientras que los modelos cerrados como los de OpenAI ofrecen una integración fluida, los modelos de código abierto requieren que los d