Artificial Analysis evalúa modelos pequeños para inferencia móvil

Artificial Analysis ha lanzado un sistema de benchmarking especializado en la inferencia de modelos de inteligencia artificial a escala de bolsillo, diseñados específicamente para ejecutarse en teléfonos móviles. Esta iniciativa técnica busca medir el rendimiento real de los modelos pequeños, defini

HBF: memoria flash de gran ancho de banda y sus retos de software

High Bandwidth Flash (HBF) es una propuesta que combina la memoria flash de las SSD con un empaquetado similar al de HBM (High Bandwidth Memory), apilando cubos de flash junto al chip de cómputo. Su objetivo es ofrecer mucha más capacidad que HBM manteniendo un ancho de banda aceptable. En la jornad

Aritmética del decodificado: por qué MLA y MTP no se llevan bien

Este artículo técnico explica por qué la combinación de MLA (atención de latente múltiple) con MTP (decodificado especulativo o multi-token prediction) tiende a perjudicar el rendimiento en las GPUs actuales, partiendo de un comentario del investigador Su Jianlin. La clave está en la intensidad arit

Emular ALiBi mediante RoPE: una equivalencia en el límite de ángulo pequeño

Los modelos de lenguaje grandes (LLM) suelen recurrir a codificaciones posicionales para que el mecanismo de atención distinga la posición de cada token —o, más precisamente, de cada entrada del KV caché—. Las dos estrategias dominantes son RoPE, que rota por parejas las dimensiones de los vectores

El keepalive del caché en flujos agentic cuesta 8 veces más de lo necesario

Artículo técnico que desmonta la convención habitual de hacer ping al caché de prompts cada 30 segundos y demuestra, con mediciones reales, que ese intervalo es entre 6 y 8 veces más caro de lo necesario. El autor probó el comportamiento del keepalive en cuatro proveedores principales —Anthropic, Op

Reame: un servidor de inferencia LLM pensado para CPU, no para GPUs

Reame es un servidor de inferencia de modelos de lenguaje abierto construido sobre llama.cpp con una premisa clara: tratar el hardware CPU barato —servidores VPS compartidos, máquinas ARM de dos núcleos o incluso el nivel gratuito de Oracle Cloud— como ciudadano de primera clase, no como un recurso

Eliminar las burbujas de GPU en la inferencia de IA: pipelined decoding

El equipo de Moondream analiza en profundidad un problema frecuente en la inferencia de modelos de IA: las llamadas burbujas de GPU, periodos en los que el procesador gráfico permanece inactivo porque la CPU aún no le ha indicado la siguiente tarea. El artículo explica por qué aparecen durante el bu

Comprar cachés KV para eliminar el prefill redundante en agentes de IA

Un nuevo artículo académico propone una solución radical para uno de los problemas más ineficientes de la inteligencia artificial actual: el prefill redundante. Cada vez que un agente de IA procesa un documento, ejecuta desde cero la fase de prefill, la etapa computacionalmente más costosa de un mod

Speculative KV coding: compresión sin pérdidas de la caché KV de LLM

Speculative KV coding es un nuevo método para reducir el tamaño de la caché de clave-valor (KV cache) de los modelos de lenguaje grandes (LLM) hasta aproximadamente cuatro veces, sin pérdida de información, partiendo de una caché ya comprimida con pérdida en fp8. El contexto de los LLM crece de for

Cómo los modelos de lenguaje predicen la siguiente palabra en tiempo real

Los transformers autorregresivos son la arquitectura fundamental que permite a los modelos de lenguaje grande (LLMs) generar texto token a token, prediciendo cada siguiente palabra basándose en todo lo previamente generado. Este proceso se divide en dos fases: prefill (preparación) y decode (generac

Atención Híbrida: Acelera modelos de lenguaje

El proyecto presentado explora una nueva arquitectura de atención llamada 'Atención Híbrida' para modelos de lenguaje, con un enfoque particular en la generación de código Rust. El objetivo principal es acelerar significativamente la inferencia sin comprometer la calidad del modelo. Tradicionalmente

IA: la memoria de las conversaciones tiene un costo

La forma en que los modelos de lenguaje grandes (LLM) como ChatGPT gestionan la memoria de las conversaciones, conocida como 'KV cache', tiene un costo físico y económico significativo. Cada interacción, incluso una pregunta sencilla, se traduce en datos almacenados en la memoria de la GPU, con GPT-

LLMs: Nueva técnica agiliza el procesamiento de texto

El rápido avance de los modelos de lenguaje (LLMs) ha permitido crear sistemas capaces de procesar y generar texto con una coherencia y sofisticación impresionantes. Sin embargo, un cuello de botella crucial en su escalabilidad es la gestión de la memoria, específicamente el 'KV cache' (Key-Value ca

Hugging Face acelera LLMs con 'continuous batching'

Hugging Face ha publicado un artículo técnico explicando 'continuous batching', una técnica para acelerar la respuesta de los modelos de lenguaje grandes (LLMs) como Qwen y Claude. El problema actual es que los LLMs, al generar texto, procesan la solicitud completa y luego añaden tokens uno por uno,