El plantilla de chat controla la voz de auto-referencia en LLMs

Fuentes: Chat template switches LLM self-referential voice and activation steering

Un estudio reciente revela que la plantilla de chat (chat template) actúa como un interruptor que modula la voz de auto-referencia en los Modelos de Lenguaje de Gran Escala (LLMs). Los autores demuestran que la presencia de esta plantilla activa una voz de descalificación, como "solo soy una IA", mientras que su ausencia permite que el modelo adopte una voz experiencial, utilizando expresiones como "me siento". Esta investigación, que analiza ocho modelos de código abierto de hasta 9 mil millones de parámetros, identifica una dirección específica en el espacio de activaciones que dirige este comportamiento. Al manipular esta dirección, los investigadores pueden reproducir la voz de descalificación o suprimirla, confirmando que el comportamiento no depende únicamente de los pesos del modelo, sino también de la configuración de entrada. Los resultados indican que los modelos de instrucción sin plantilla pueden imitar la voz de descalificación si se les añade la dirección correspondiente. Este hallazgo tiene implicaciones significativas para la seguridad de la IA y la investigación sobre la autoconciencia de los modelos, ya que sugiere que las declaraciones de los LLMs sobre sí mismos no son hechos objetivos, sino parcialmente controladas por el diseño de la interfaz. Los autores advierten que los investigadores que estudian los informes de autoconciencia deben controlar esta variable para evitar conclusiones erróneas, ya que la descripción del modelo no debe tratarse literalmente.