La frontera eficiente de la inferencia en modelos de lenguaje

La inferencia de modelos de lenguaje (LLM) se gobierna por una frontera eficiente que resume los compromisos entre latencia, rendimiento y coste, un concepto que la industria de la IA tomó prestado de la economía y que mide hasta dónde se puede llegar en capacidad a un coste dado. Este artículo expl

vLLM v0.28.0 optimiza inferencia de Kimi-K3 y DeepSeek V4

El proyecto vLLM ha publicado la versión 0.28.0, una actualización que incorpora 584 contribuciones de 270 desarrolladores para mejorar significativamente el rendimiento y la compatibilidad de modelos de lenguaje avanzados. Esta liberación se centra en optimizaciones profundas para Kimi-K3, incluyen

Aritmética del decodificado: por qué MLA y MTP no se llevan bien

Este artículo técnico explica por qué la combinación de MLA (atención de latente múltiple) con MTP (decodificado especulativo o multi-token prediction) tiende a perjudicar el rendimiento en las GPUs actuales, partiendo de un comentario del investigador Su Jianlin. La clave está en la intensidad arit

Cómo alcanzar 50 tokens/s con Qwen3 27B y 256K de contexto en una GPU de 24 GB

El ingeniero Michał Piszczek documenta el proceso seguido para ejecutar el modelo denso Qwen3 27B con su contexto nativo completo de 262.144 tokens, entrada multimodal y decodificación especulativa MTP sobre una sola GPU NVIDIA RTX PRO 4000 Blackwell SFF de 24 GB. El sistema final, bautizado Qwen3.8

NVIDIA publica Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4

NVIDIA ha presentado Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4, una variante optimizada para inferencia de su familia de modelos de lenguaje abiertos. El lanzamiento, fechado el 11 de agosto de 2026 según la ficha técnica publicada en Hugging Face, supone un paso más en la estrategia de l

Empaquetando el razonamiento latente como modelo completo

DeepSeek-V4-Flash-0731-Latent-Reasoning convierte un adaptador experimental de razonamiento en espacio latente en un modelo autosuficiente listo para producción. El autor publica en HuggingFace un único repositorio con todos los pesos necesarios: el backbone DeepSeek-V4-Flash-0731 cuantizado a NVFP4

Soup: ajuste fino de modelos de lenguaje con un único comando y sin SSH

Soup es una herramienta de línea de comandos pensada para simplificar el ajuste fino y el post-entrenamiento de modelos de lenguaje grandes (LLM). Su premisa es reducir entre el 30% y el 50% del tiempo que los equipos dedican a pelearse con la infraestructura, dedicándolo en su lugar a mejorar los m

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU La startup Fermion Research ha presentado Neutrino-1 8B, un modelo de inteligencia artificial de 8.000 millones de parámetros que destaca por una característica singular: se distribuye como un único archivo de 3,88 gigabytes capaz de ej

Reame: un servidor de inferencia LLM pensado para CPU, no para GPUs

Reame es un servidor de inferencia de modelos de lenguaje abierto construido sobre llama.cpp con una premisa clara: tratar el hardware CPU barato —servidores VPS compartidos, máquinas ARM de dos núcleos o incluso el nivel gratuito de Oracle Cloud— como ciudadano de primera clase, no como un recurso

Decodificación especulativa: por qué la profundidad supera al ancho en GPU

Este análisis técnico de Doubleword examina un dilema habitual en la inferencia de modelos de lenguaje: cuando se busca aumentar el rendimiento por segundo en una sola GPU, ¿conviene aumentar el tamaño de lote (ancho) o apostar por la decodificación especulativa (profundidad)? El trabajo parte de un

Montaje RTX 5080 + RTX 3090: más de 80 tokens/s con Qwen 3.6 27B Q8

El usuario describe cómo configurar dos GPUs NVIDIA, una RTX 5080 (16 GB) y una RTX 3090 (24 GB), para ejecutar modelos de lenguaje locales de gran tamaño, específicamente Qwen 3.6 27B en cuantización Q8. La combinación alcanza más de 80 tokens por segundo en inferencia al distribuir el trabajo entr

Cómo configurar un agente de codificación local en macOS

Montar un agente de codificación local en macOS permite ejecutar modelos de lenguaje de última generación sin depender de la nube. Este artículo explica cómo configurar una solución completa usando llama.cpp, Gemma 4 26B-A4B y el agente terminal Pi, tras la experiencia del autor con cortes de intern

La economía de la decodificación especulativa en modelos de lenguaje

La decodificación especulativa es una técnica de optimización en inferencia de modelos de lenguaje que acelera la generación de tokens sin pérdida de calidad. Su principio es simple: el modelo predice varios tokens futuros de forma barata y luego verifica solo los aceptados, aprovechando el ancho de

Speculative KV coding: compresión sin pérdidas de la caché KV de LLM

Speculative KV coding es un nuevo método para reducir el tamaño de la caché de clave-valor (KV cache) de los modelos de lenguaje grandes (LLM) hasta aproximadamente cuatro veces, sin pérdida de información, partiendo de una caché ya comprimida con pérdida en fp8. El contexto de los LLM crece de for

Cómo ejecutar Gemma 4 en un Xeon de 2016 sin GPU

## Cómo ejecutar Gemma 4 en un Xeon de 2016 sin GPU: la hazaña técnica que desafía el 'memory wall' Un experimento publicado en el blog técnico point.free demuestra que es posible ejecutar un modelo de inteligencia artificial de última generación, concretamente Gemma 4 en su versión 26B con arquite

EAGLE 3.1 soluciona el 'attention drift' en decodificación especulativa

El equipo EAGLE, en colaboración con vLLM y TorchSpec, ha presentado EAGLE 3.1, una evolución clave en el algoritmo de *speculative decoding*. Esta tecnología, ampliamente utilizada en sistemas de producción, soluciona la fragilidad de sus predecesores ante variaciones en plantillas de chat y entrad

ia: la lentitud de la generación de texto es un desafío

El campo de la inteligencia artificial, particularmente en modelos de lenguaje grandes (LLMs) como ChatGPT, se enfrenta a un desafío: la generación de texto es inherentemente lenta. El proceso de 'decodificación autoregresiva', que es la forma tradicional en que estos modelos generan texto, implica