Reame: un servidor de inferencia LLM pensado para CPU, no para GPUs

Fuentes: Reame: a CPU-first LLM inference server on llama.cpp

Reame es un servidor de inferencia de modelos de lenguaje abierto construido sobre llama.cpp con una premisa clara: tratar el hardware CPU barato —servidores VPS compartidos, máquinas ARM de dos núcleos o incluso el nivel gratuito de Oracle Cloud— como ciudadano de primera clase, no como un recurso de respaldo. Su tesis es directa: en una CPU nunca debe calcularse dos veces lo mismo, y ahí donde un modelo pequeño puede competir con uno grande porque la respuesta está en el contexto que se le proporciona, no en su conocimiento general.

Entre sus mecanismos destaca una caché de prefijo compartida que persiste en disco en formato zstd, lo que permite que un mismo prefijo de prompt pague su coste de cálculo una sola vez y se reuse entre peticiones, reinicios y procesos. Incorpora Palimpsest, un archivo en disco de n-gramas generados que propone borradores a coste cero; Il Suggeritore, que usa la estructura del formato (listas, viñetas) para especular tokens; y un sistema de decodificación especulativa autorregulada, que mide si la especulación compensa en el hardware concreto y la desactiva cuando no es así. Su función Conclave permite lanzar N candidatos a la misma pregunta dentro de un mismo lote intercalado, clonar la caché de prefijo, y elegir al ganador por mayoría.

El proyecto incluye una API REST compatible con OpenAI, una CLI sin configuración —reame run qwen2.5-1.5b descarga el modelo y lo deja listo— y 210 tests aislados. Los autores publican mediciones reales, incluidos resultados negativos, y descartan explícitamente que Reame sustituya a un modelo frontera en razonamiento amplio o escritura creativa.