El artículo 'Cache-to-Cache: Direct Semantic Communication Between Large Language Models' presenta un nuevo paradigma para mejorar la eficiencia y la precisión en sistemas que utilizan múltiples modelos de lenguaje de gran escala (LLM). A diferencia de los diseños actuales, que dependen de la generación de secuencias de tokens de texto para la comunicación entre modelos, esta propuesta permite una transferencia semántica directa entre las memorias de caché (KV-Cache) de los modelos. El objetivo es eliminar la pérdida de información semántica y la latencia asociada a la generación token por token, que son limitaciones inherentes a la comunicación por texto.
La técnica, denominada Cache-to-Cache (C2C), utiliza una red neuronal para proyectar y fusionar la caché KV del modelo fuente con la del modelo destino. Un mecanismo de puerta aprendible selecciona las capas objetivo que se benefician de esta comunicación. Los experimentos indican que C2C logra una precisión media un 6,4% a un 14,2% superior a la de los modelos individuales, superando además a la comunicación por texto en un 3,1% a un 5,4%. Además, ofrece una mejora de velocidad de latencia de 2,5 veces en comparación con los métodos tradicionales. El código del proyecto está disponible públicamente en GitHub, facilitando su implementación y evaluación por parte de la comunidad de investigación en inteligencia artificial.
