Un investigador ha demostrado que los patrones geométricos en las representaciones de palabras pueden generarse aleatoriamente, desafiando la interpretación de que ciertas estructuras son intrínsecas al lenguaje. El experimento, basado en una apuesta con su colega Dhruva Karkada, consistió en encontrar un conjunto de diez palabras aparentemente aleatorias cuyas embeddings en un espacio de alta dimensión formaran un círculo y una matriz circulante, similar a la observada en los vectores de los meses del año.
El autor utilizó una búsqueda iterativa para seleccionar términos de un vocabulario de 25.000 palabras, optimizando una función objetivo que priorizaba la circularidad en la proyección de componentes principales (PCA) y la simetría de la matriz de Gram. El proceso, que duró una tarde y utilizó un agente de codificación, identificó un conjunto de palabras que cumplía con las condiciones geométricas de manera clara, aunque con una amplitud significativamente menor que la de los meses.
Este hallazgo tiene implicaciones importantes para la investigación en inteligencia artificial. Aunque no invalida los descubrimientos geométricos de Karkada, que se basaban en conjuntos de datos más grandes y estructurados, el resultado sugiere que los algoritmos automáticos de detección de características podrían ser engañados por patrones espurios si no se aplican restricciones estadísticas suficientes. El estudio destaca la necesidad de considerar la probabilidad estadística al interpretar la geometría de las representaciones de datos en modelos de lenguaje.
