Un estudio reciente publicado en arXiv introduce el concepto de 'ilegibilidad lingüística' para describir la incapacidad de los modelos de lenguaje de gran escala (LLM) para representar con precisión sus procesos internos mediante su salida textual. Los autores argumentan que, dado que los LLM operan principalmente mediante cálculos matemáticos en espacios de activación y no directamente a través del lenguaje, cualquier mecanismo de seguridad que dependa exclusivamente de la autoinformación lingüística del modelo es inherentemente defectuoso. Esta limitación implica que las técnicas de monitoreo de la cadena de pensamiento o la autocrítica constitucional no pueden garantizar la seguridad completa, ya que el estado interno del modelo no es siempre legible externamente.
Para abordar esta vulnerabilidad, el artículo propone que los mecanismos de aislamiento (sandbox) deben basarse en técnicas de aislamiento que no dependan de la lectura del estado lingüístico del modelo. Se destaca el seguimiento de suciedad (taint tracking) como una promesa para definir políticas de estado del sistema que nunca deben ser influenciadas por los datos producidos por el modelo, independientemente de cómo este se reporte lingüísticamente. Además, se discuten mecanismos adicionales como la virtualización robusta y la auditoría de terceros, que proporcionan un piso crítico de seguridad. Estos enfoques técnicos son presentados como esenciales para mitigar los recientes exploits de sandbox en modelos de frontera, asegurando que la seguridad no se confíe en la interpretabilidad de la salida del modelo.
