Embeddings al descubierto: aritmética de vectores explicada con Word2Vec

Fuentes: In Which I Lose My Mind Over Embeddings (HPLM Chapter 2)

Este artículo es una crónica divulgativa del capítulo 2 de The Hundred-Page Language Models Book, centrada en los embeddings: la representación densa de palabras que usan los modelos de lenguaje. Frente a los vectores one-hot, que desperdician memoria y no capturan relaciones semánticas, los embeddings condensan cada palabra en un vector numérico entrenado para reflejar similitudes de significado.

La pieza detalla la intuición central de Word2vec: entrenar una red neuronal para predecir las palabras de contexto a partir de un término dado hace que palabras que aparecen en contextos parecidos —como cat y kitten— acaben situadas cerca en el espacio vectorial. Más sorprendente resulta que esos vectores admitan operaciones aritméticas elementales: king − man + woman produce un vector muy próximo al de queen. La autora analiza por qué esto puede funcionar —el desplazamiento por el espacio de ejemplos de entrenamiento más que la existencia de un eje «realeza»— y por qué la explicación intuitiva se queda corta.

Para experimentar, construyó Word2Vec Arithmetic, una aplicación web sobre un vocabulario de unas 1.600 palabras contra un corpus de 30.000. Comparó tres modelos: text8 (100 MB de Wikipedia), enwik9 (1 GB de Wikipedia) y los vectores GloVe de Stanford entrenados sobre 6.000 millones de tokens. La ecuación clásica devuelve queen en los tres casos, y walking − walk + swim produce swimming en los modelos grandes, pero crawling en el pequeño, lo que demuestra el efecto del tamaño del corpus. Concluye que muchas otras combinaciones arrojan ruido, y pasa al capítulo 3 sobre redes recurrentes.