Optimización de caché n-gram en llama.cpp acelera la decodificación
Un desarrollador ha implementado optimizaciones en llama.cpp que aceleran la decodificación mediante búsqueda de prompts (prompt lookup decoding) hasta 42 veces más rápido y reducen el uso de memoria hasta 2,6 veces. Esta mejora se basa en técnicas de optimización de rendimiento inspiradas en el tra
