Este artículo del blog Stochastic Blog desgrana, paso a paso y desde cero, los tres pilares matemáticos sobre los que se apoya cualquier modelo de machine learning: el álgebra lineal, el cálculo y la optimización convexa. La pieza combina explicación didáctica con código práctico, usando el conjunto de datos MNIST —70.000 imágenes en escala de grises de 28×28 píxeles— como hilo conductor para ilustrar conceptos abstractos.
El recorrido comienza convirtiendo cada imagen en un vector de 784 dimensiones, lo que transforma el dataset en una nube de puntos en un espacio de alta dimensión. A partir de ahí se introducen las normas L1 y L2 —con valores concretos como 107,94 y 9,56 para una imagen ejemplo—, el producto escalar como medida de similitud, y la matriz de Gram para calcular similitudes en bloque. Se explican también el broadcasting de tensores en PyTorch y las proyecciones, mostrando cómo restar la media revela direcciones de mayor varianza.
El núcleo del artículo es la Descomposición en Valores Singulares (SVD): factorizar la matriz de datos en U, Σ y V^T permite identificar las direcciones que concentran más información. Los cinco primeros valores singulares de la matriz de covarianza (5,22; 3,89; 3,37; 2,87 y 2,61) revelan que una minoría de componentes captura la mayor parte de la varianza, y que el rango numérico efectivo es 626 sobre 784 dimensiones posibles. Esto demuestra que las imágenes de MNIST son de rango alto pero compresibles.
La pieza cierra la base conceptual para entender por qué el descenso de gradiente, la retropropagación y la regularización funcionan: cada operación sobre un modelo es, en esencia, una transformación de vectores y matrices guiada por derivadas y acotada por restricciones.
