La memoria de los agentes debe ser determinista y vivir en el edge

Fuentes: Agents are moving to the edge. Their memory should too.

Las arquitecturas de agentes basadas en LLM suelen delegar en el modelo la gestión de su propia memoria: el agente relee textos antiguos para decidir si un dato es nuevo o corrige uno previo, si dos instrucciones se contradicen o si una preferencia ha cambiado. El autor, con experiencia en infraestructura en Google Cloud Storage, argumenta que estas decisiones son de esquema y no deberían dejarse al modelo. Propone una memoria tipada en la que la base de datos determina el significado de cada hecho mediante tipos y reglas de supersesión, de modo que el modelo solo extrae el dato y el esquema se encarga del resto.

La segunda pieza es dónde vive esa memoria. La mayoría de diseños asumen un clúster de búsqueda o una API gestionada al otro lado de la red, con índices vectoriales calientes en RAM o SSD, caros cuando las consultas son frías o infrecuentes. Frente a eso, el autor presenta polign_db, una base de datos tipada sobre un motor híbrido de vectores y BM25 que reside en object storage y no mantiene estado durable en el servidor. Como demostración, el buscador de Wikipedia ejecuta 12,5 millones de pasajes desde S3 con un consumo aproximado de 37 MiB RSS y cabe, junto al embedder y la aplicación web, en una máquina ARM de 2 GB.

El artículo describe la pila local esperada: LLM local, capa de memoria tipada con validación, supersesión, filtrado estructurado y recuperación semántica, y almacén durable en /var/lib/agent. El embedder y la base de datos ya funcionan en hardware modesto y, según el autor, a medida que mejoren los modelos locales, el agente completo podrá trasladarse al dispositivo sin depender de servicios externos de memoria.