vLLM v0.28.0 optimiza inferencia de Kimi-K3 y DeepSeek V4

El proyecto vLLM ha publicado la versión 0.28.0, una actualización que incorpora 584 contribuciones de 270 desarrolladores para mejorar significativamente el rendimiento y la compatibilidad de modelos de lenguaje avanzados. Esta liberación se centra en optimizaciones profundas para Kimi-K3, incluyen

Cómo exprimir varias GPU de desecho para ejecutar modelos de IA en casa

Este artículo explica, desde una perspectiva práctica y accesible, cómo aprovechar varios GPU reciclados para ejecutar modelos de lenguaje de gran tamaño en un servidor doméstico. Tras una introducción al funcionamiento básico de los transformers y al concepto de token, el texto repasa por qué la ge

Guía para desplegar DeepSeek V4 Flash en producción sobre una AMD MI300X

El repositorio ryanzhou/deepseek-v4-flash-mi300x reúne la configuración y los parches necesarios para ejecutar el modelo DeepSeek-V4-Flash-0731 (304B parámetros) en producción sobre una única GPU AMD Instinct MI300X. La MI300X dispone de 192 GiB de HBM3 y un ancho de banda de 5,3 TB/s, lo que permit

LTT Labs analiza el AMD Ryzen AI Halo, un mini-PC para desarrollo de IA

El AMD Ryzen AI Halo es un mini-PC compacto (15 × 15 cm, menos de 5 cm de alto y 1,2 kg) diseñado para el desarrollo de modelos de inteligencia artificial en local. Se basa en el procesador AMD Ryzen AI Max+ 395 (Zen 5, 16 núcleos y 32 hilos) con gráficos Radeon 8060S integrados (40 unidades de cómp

AMD adquiere MEXT para usar memoria flash como DRAM en sistemas de IA

AMD anunció el 15 de junio de 2026 la adquisición del especialista en gestión de memoria MEXT, una operación sin precio revelado que refuerza su estrategia de software para centros de datos. La tecnología de MEXT, denominada Predictive Memory, integra unidades flash NVMe en un mismo pool de memoria

Los retos de ejecutar DeepSeek-V4-Flash en las AMD MI300X

La empresa Doubleword documenta el trabajo técnico realizado para ejecutar el modelo DeepSeek-V4-Flash sobre las tarjetas aceleradoras AMD MI300X, una tarea que, según la compañía, no funciona de forma predeterminada en vLLM a principios de mayo de 2026. La MI300X, lanzada en diciembre de 2023, ofr

rocm y strix halo: optimiza la memoria de tu gpu

Un usuario ha compartido su experiencia al configurar ROCm y Strix Halo para optimizar el uso de memoria en un sistema con 128GB de RAM compartida entre la CPU y la GPU. El proceso, realizado en Ubuntu 24.04 LTS, incluyó una actualización del BIOS (necesaria para la detección de la GPU) y ajustes en