El estudio "A Mathematical Framework for Transformer Circuits" presenta un enfoque de interpretabilidad mecanicista para descomponer las operaciones internas de los modelos de lenguaje transformers. El objetivo es reverse-engineer los cálculos de estos modelos, similar a la descompilación de binarios, para explicar problemas de seguridad actuales y anticipar riesgos en modelos futuros. Dada la complejidad de arquitecturas modernas como GPT-3, que posee 96 capas, los autores inician el análisis con modelos simplificados de dos capas o menos, limitados exclusivamente a bloques de atención y sin capas MLP. Esta simplificación permite identificar patrones algorítmicos fundamentales que luego pueden extrapolarse a arquitecturas más grandes.
El texto introduce un marco matemático equivalente pero no estándar para conceptualizar la operación de los transformers, facilitando la interpretación humana frente a la eficiencia computacional. Un hallazgo central es la identificación de "induction heads" (cabezas de inducción), mecanismos específicos de atención que explican el aprendizaje en contexto (in-context learning) en estos modelos pequeños. Estos mecanismos solo se desarrollan en arquitecturas con al menos dos capas de atención. Los autores demuestran que el flujo de información a través del "residual stream" actúa como un espacio de memoria lineal donde las capas interactúan mediante pesos virtuales implícos.
Aunque este primer trabajo se centra en modelos de juguete (toy models) sin sesgos ni normalización de capas para claridad, los autores señalan que el marco y el concepto de induction heads mantienen relevancia parcial en modelos más grandes y realistas, como se detalla en un trabajo posterior. La ausencia de capas MLP en el análisis principal se reconoce como una limitación actual, ya que su interpretación sigue siendo un desafío técnico mayor, aunque se planea abordarlo en investigaciones futuras. Este enfoque sienta las bases para una comprensión sistemática de la arquitectura interna de los transformers.
