WebLLM: motor de inferencia de LLM en el navegador con aceleración WebGPU

WebLLM es un motor de inferencia de modelos de lenguaje de gran tamaño que ejecuta la carga de trabajo directamente en el navegador web, sin necesidad de servidor, gracias a la aceleración por hardware mediante WebGPU. El proyecto, publicado como repositorio de código abierto por MLC AI, ofrece una

La frontera eficiente de la inferencia en modelos de lenguaje

La inferencia de modelos de lenguaje (LLM) se gobierna por una frontera eficiente que resume los compromisos entre latencia, rendimiento y coste, un concepto que la industria de la IA tomó prestado de la economía y que mide hasta dónde se puede llegar en capacidad a un coste dado. Este artículo expl

Aritmética del decodificado: por qué MLA y MTP no se llevan bien

Este artículo técnico explica por qué la combinación de MLA (atención de latente múltiple) con MTP (decodificado especulativo o multi-token prediction) tiende a perjudicar el rendimiento en las GPUs actuales, partiendo de un comentario del investigador Su Jianlin. La clave está en la intensidad arit

La CPU recupera protagonismo en la inferencia de modelos de lenguaje

La arquitectura tradicional de inferencia de modelos de lenguaje asigna a la GPU la mayor parte del cómputo y deja a la CPU en un papel secundario de coordinación. Sin embargo, la irrupción de la IA agéntica y el despliegue de modelos más pequeños y especializados está cuestionando esa división. En

La economía unitaria del software se reconfigura bajo la presión de la IA

El software contó durante décadas con una ventaja estructural única: producir el producto una vez y distribuirlo a un millón de usuarios costaba prácticamente lo mismo que a uno. Esa dinámica sustentó márgenes brutos del 75-85%, convirtió el crecimiento agresivo en gasto defendible y dio lugar al ma

AirLLM: cómo ejecutar modelos de 70B en una sola GPU de 4 GB

AirLLM es una biblioteca de Python de código abierto que reduce drásticamente el consumo de memoria durante la inferencia de modelos de lenguaje de gran tamaño, permitiendo ejecutar un modelo de 70B parámetros en una única GPU con apenas 4 GB de VRAM, sin recurrir a cuantización, destilación ni poda

Cuánta electricidad consumen los centros de datos y la inteligencia artificial

Los centros de datos absorbieron alrededor de 485 teravatios-hora (TWh) de electricidad en 2025, equivalentes a la generación anual de Alemania y a cerca del 1,5% del consumo eléctrico mundial, según la Agencia Internacional de la Energía (IEA). De ese total, dos tercios correspondieron a centros de

DGX Spark como equipo de uso diario: rendimiento, juegos y LLM locales

El NVIDIA DGX Spark es un ordenador compacto basado en ARM con una GPU equipada con el mismo número de núcleos CUDA que la RTX 5070, 128 GB de memoria unificada y un SSD de 4 TB. Funciona con DGX OS, una distribución basada en Ubuntu 24.04, aunque también puede instalarse Fedora u otras distribucion

El bucle agentic: tres bucles bajo un solo abrigo

Los agentes autónomos no se construyen con un único bucle, sino con tres bucles entrelazados que el artículo desgrana de forma didáctica. El primero es el bucle de inferencia: el sistema envía al modelo de lenguaje (LLM) un historial de mensajes y herramientas disponibles a través del endpoint de ch

Decodificación especulativa: por qué la profundidad supera al ancho en GPU

Este análisis técnico de Doubleword examina un dilema habitual en la inferencia de modelos de lenguaje: cuando se busca aumentar el rendimiento por segundo en una sola GPU, ¿conviene aumentar el tamaño de lote (ancho) o apostar por la decodificación especulativa (profundidad)? El trabajo parte de un

Anatomía de un kernel de paralelismo de expertos de alto rendimiento

Los modelos de lenguaje de gran tamaño (LLM) requieren coordinar muchas GPUs para funcionar. Una de las técnicas clave es el paralelismo de expertos (EP), esencial en los modelos MoE a gran escala. A diferencia de otras formas de paralelismo, cuyas comunicaciones siguen patrones fijos, en EP el rout

Speculative KV coding: compresión sin pérdidas de la caché KV de LLM

Speculative KV coding es un nuevo método para reducir el tamaño de la caché de clave-valor (KV cache) de los modelos de lenguaje grandes (LLM) hasta aproximadamente cuatro veces, sin pérdida de información, partiendo de una caché ya comprimida con pérdida en fp8. El contexto de los LLM crece de for