Una serie para entender de cabo a rabo la pila tecnológica de los LLM

Fuentes: Holding the LLM Stack in Your Head

Una guía en forma de serie de artículos recorre, de forma ordenada por dependencias, la pila tecnológica completa de un modelo de lenguaje grande (LLM) actual. El recorrido va de los fundamentos de álgebra lineal —vectores, matrices y espacios vectoriales— hasta los protocolos de agentes que llegan al ecosistema en 2026, pasando por normas y productos punto, distribuciones y softmax, entropía cruzada, gradientes y backpropagation, optimizadores como Adam y el propio entrenamiento, las particularidades de las GPU y la precisión en coma flotante, y una breve prehistoria del procesamiento estadístico del lenguaje natural. Cada arco está pensado para asentar intuiciones que resistan el contacto con sistemas reales, más que para sustituir un manual académico.

El autor estructura el contenido en diez arcos con alrededor de ochenta entregas. Los dos primeros cubren vectores, normas, similitud coseno y proyecciones, omnipresentes en atención y en recuperación por embeddings. El tercero y el cuarto articulan softmax, distribuciones categóricas, regla de Bayes, regla de la cadena de la probabilidad, entropía cruzada y divergencia KL para entender la función de pérdida y la perplejidad. Los arcos quinto a séptimo abordan gradientes, retropropagación, SGD, optimizadores con momento y Adam, horarios de tasa de aprendizaje, y el papel de las GPU, IEEE 754 y la precisión mixta fp32/fp16/bfloat16. El arco octavo aporta contexto histórico desde los sistemas basados en reglas hasta la traducción automática estadística y los modelos log-lineales.

La guía incluye recomendaciones de entrada según el objetivo del lector: entender la atención, diagnosticar por qué la inferencia es lenta (con foco en la caché KV), construir sistemas de generación aumentada por recuperación o montar agentes. El texto es un primer borrador completo; el autor indica que seguirá trabajando en pulido y correcciones.