Infinite-Parameter LLMs: generación de pesos en tiempo real

Fuentes: Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

El artículo 'Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data', presentado en arXiv en septiembre de 2026, propone una nueva arquitectura para modelos de lenguaje de gran escala (LLM) que supera las limitaciones de los datos de entrenamiento estáticos. A diferencia de las arquitecturas Mixture-of-Experts (MoE) actuales, que dependen de un banco de parámetros fijo, esta propuesta permite al modelo aprender y adaptarse directamente de la interacción en vivo, como los hechos proporcionados por el usuario o las correcciones en tiempo real.

El mecanismo central es un 'hypernetwork' compacto que genera una modulación de bajo rango para una red base compartida. Esto significa que los pesos de la red de propagación directa no se almacenan en una base fija, sino que se generan dinámicamente a partir de los datos de entrada en ejecución. La innovación clave reside en el uso de una creencia bayesiana sobre el código latente del generador de pesos, lo que permite actualizar la derivación de los pesos en línea durante la sesión, en lugar de congelarlos tras una única lectura del contexto.

Esta aproximación ofrece ventajas significativas: mantiene la huella de memoria almacenada fija, pero permite que los pesos efectivos sean infinitos. Al codificar el conocimiento en los pesos en lugar de en el prompt, el sistema amortiza el cómputo, libera la ventana de contexto y permite una generalización superior frente al uso de contexto en memoria. El artículo detalla un protocolo de evaluación para comparar este enfoque con el aprendizaje en contexto y la recuperación de información, posicionándolo como una alternativa más eficiente para tareas que requieren persistencia y adaptación continua.