HeteroFold optimiza la transferencia de caché KV entre modelos de IA

Fuentes: HeteroFold optimizes KV cache transfer between heterogeneous LLMs

El sistema de inteligencia artificial HeteroFold presenta una metodología para transferir la caché de clave-valor (KV) entre modelos de lenguaje de gran escala (LLM) de familias distintas sin necesidad de prellenar el contexto en el receptor. Esta técnica es crucial para los sistemas multiagente que combinan modelos heterogéneos para roles especializados, eliminando la redundancia de procesar el mismo texto dos veces. A diferencia de los métodos tradicionales, HeteroFold mantiene tanto el emisor como el receptor congelados, alineando las estructuras de los modelos y calibrando la caché para preservar el comportamiento del receptor. El método aborda las diferencias en tokenización, profundidad del modelo y representaciones de KV que complican la reutilización directa de la caché. En pruebas con seis direcciones de transferencia, HeteroFold superó a las baselines existentes en cuatro benchmarks de contexto largo y en la mayoría de los contextos cortos. Además, igualó el rendimiento de la comunicación basada en texto en benchmarks multiagente. En un escenario de contexto de 32K tokens, la transferencia de Llama-3.1-8B a Ministral-3-14B fue 10,7 veces más rápida que el prellenado nativo y entre 1,18 y 1,47 veces más rápida que las baselines de estado del arte, como Dense Latent y KV Ridge. Estos resultados demuestran que HeteroFold permite una reutilización eficiente de la caché entre familias de modelos sin la sobrecarga de prellenado, mejorando significativamente la eficiencia en sistemas de agentes de IA complejos.