Universalidad del entrenamiento de redes neuronales con descenso de gradiente

Fuentes: Universality of Gradient Descent Neural Network Training

Un artículo preprint publicado el 27 de julio de 2020 en arXiv (categoría cs.LG) aborda un problema conocido en el campo del aprendizaje profundo: las decisiones de diseño de una red neuronal suelen ser determinantes para que el descenso de gradiente la entrene con éxito. Los autores se preguntan si siempre es posible modificar la arquitectura de una red de modo que pueda entrenarse eficazmente mediante descenso de gradiente, y formulan un resultado de universalidad al respecto.

El teorema principal sostiene que, si para una red dada existe algún algoritmo capaz de encontrar buenos pesos para una tarea de clasificación, entonces existe una extensión de esa red que reproduce esos mismos pesos y la salida forward correspondiente únicamente mediante entrenamiento por descenso de gradiente. En otras palabras, cualquier solución encontrada por otro método puede recuperarse con una arquitectura ampliada entrenada con gradiente puro.

Los autores aclaran que la construcción no está pensada para cálculos prácticos, sino que ofrece una orientación teórica sobre las posibilidades del meta-aprendizaje y de enfoques relacionados. El trabajo se enmarca así en la línea de investigación que busca entender los límites y capacidades del descenso de gradiente como método universal de optimización en redes neuronales.