Investigadores demuestran que los SAE codifican categorías gramaticales de forma distribuida

Fuentes: Researchers show SAEs encode grammatical categories in a distributed manner

Un equipo de investigadores ha publicado un estudio que analiza cómo los Autoencoders Esparsos (SAE) representan la información morfosintáctica en modelos de lenguaje. El trabajo, aceptado en EMNLP 2026, utiliza las categorías de parte del discurso (POS) como caso de prueba controlado para determinar si la información lingüística se almacena en latentes individuales o en grupos estructurados de características. Los resultados indican que las distinciones POS son altamente recuperables desde las activaciones de los SAE, pero no siguen un mapeo uno a uno entre latentes y categorías. En lugar de características gramaticales atómicas, la información se localiza de forma distribuida y dependiente de la categoría. El estudio empleó activaciones de SAE del modelo LLaMA-3-8B sobre el árbolbank UD English GUM. Se observó que solo 498 latentes de aproximadamente 130.000 son suficientes para la clasificación multi-clase de POS. Las clases cerradas, como determinantes o pronombres, utilizan grupos pequeños y enfocados, mientras que las clases abiertas, como sustantivos o adjetivos, se distribuyen sobre grupos más amplios. Estos grupos de latentes permanecen estables en datos no vistos, aunque muestran solapamiento entre categorías relacionadas, lo que sugiere que también capturan la forma superficial y el contexto. Este hallazgo refuerza la hipótesis de que los SAE capturan la estructura lingüística de manera distribuida, ofreciendo una herramienta valiosa para inspeccionar las representaciones internas de los modelos de lenguaje.