Extracción de vectores de steering a partir del espacio jacobiano de un LLM
Un experimento personal explora si es posible obtener vectores de steering —vectores de activación que modifican el comportamiento de un modelo de lenguaje— invirtiendo el Jacobiano, una herramienta de interpretabilidad que proyectaactivaciones internas en el espacio del vocabulario para verbalizarl
