El libro «Mathematics of Data Science», depositado en arXiv (cs.LG, referencia 2607.11938), repasa los fundamentos matemáticos que sostienen el campo moderno de la ciencia de datos. El texto, organizado en 15 capítulos más una introducción, está pensado como material didáctico de nivel avanzado que combina teoría, algoritmos y ejemplos aplicados.
La obra abre con una introducción general y aborda después las singularidades estadísticas de las altas dimensiones, donde conceptos como la maldición de la dimensionalidad dejan de ser una rareza para convertirse en la norma. A continuación, se desarrollan el álgebra lineal básica de la ciencia de datos mediante la descomposición en valores singulares (SVD) y el análisis de componentes principales (PCA), seguidas de los métodos de regresión lineal y las técnicas de regularización, pieza clave para evitar el sobreajuste.
Los capítulos siguientes abordan la teoría de grafos, redes y agrupamiento (clustering), antes de pasar a técnicas no lineales como los mapas de difusión. La reducción lineal de dimensión mediante proyecciones aleatorias abre la puerta al cuerpo teórico necesario para tratar problemas a gran escala, que conecta con el capítulo dedicado a la optimización en ciencia de datos. La clasificación se aborda como bloque temático propio, y al bloque fundamental se suma una introducción matemática al aprendizaje profundo, lo que incluye redes neuronales, funciones de activación y retropropagación.
Los últimos capítulos se adentran en materia más especializada: el límite asintótico de los laplacianos sobre grafos, análisis de comunidades, concentración de la medida y análisis gaussiano, desigualdades de concentración para matrices, muestreo compresivo y recuperación de matrices de bajo rango. Es una referencia útil para estudiantes de posgrado, investigadores y profesionales que busquen una panorámica unificada de las herramientas matemáticas sobre las que descansan los algoritmos contemporáneos de aprendizaje automático.
