Cómo llegar por intuición a Kimi Delta Attention: una derivación paso a paso

Fuentes: You Could Have Come Up With Kimi Delta Attention

Este artículo técnico propone que la complejidad de Kimi Delta Attention (KDA), el mecanismo de atención lineal que emplea la familia de modelos Kimi, no es tan opaca como aparenta: un lector familiarizado con la familia DeltaNet podría haber deducido sus ecuaciones a partir de requisitos sencillos sobre el estado oculto.

El texto recorre el camino completo. Parte de la atención softmax causal estándar y muestra cómo, al eliminar el softmax, el mecanismo se reduce a una recurrencia lineal en la que la historia se acumula como suma de productos externos entre claves y valores. Esa representación, aunque eficiente, presenta un problema: la escritura es aditiva, de modo que cada nueva entrada interfiere con las anteriores en lugar de reemplazarlas.

Para corregirlo, el artículo presenta la regla delta introducida por DeltaNet: en lugar de almacenar el valor, se calcula el error entre lo que el estado predice y el valor real, y solo se escribe esa diferencia. Esa operación se interpreta simultáneamente como una operación de memoria, como un paso de aprendizaje en línea y como un producto externo de rango uno.

A continuación introduce Gated DeltaNet, que añade un olvido escalar global antes de aplicar la corrección, y finalmente KDA, que sustituye ese escalar por un vector de retención por canal: cada dimensión de la clave puede olvidarse de forma independiente. La consecuencia es que unas direcciones del estado pueden borrarse mientras otras se conservan.

El artículo cierra con los programas en Triton que ejecutan KDA de forma recurrente y por fragmentos, y advierte de que la brevedad de las derivaciones no resta rigor: cada paso se justifica formalmente y se enlaza con la literatura previa.