La paradoja de la destilación de modelos de difusión

Fuentes: The paradox of diffusion distillation

Los modelos de difusión descomponen la compleja tarea de generar datos a partir de una distribución de alta dimensionalidad en numerosos pasos de eliminación de ruido, cada uno mucho más sencillo. Esta estrategia de refinamiento iterativo, en la que el modelo predice una dirección local hacia regiones de alta verosimilitud y avanza en pasos pequeños, es la fuente de su potencia. Sin embargo, parte de la investigación reciente se ha centrado en reducir drásticamente el número de pasos necesarios, incluso hasta uno solo, lo que parece contradecir la lógica original.

Este artículo analiza en profundidad esa paradoja y repasa las distintas formas de destilación aplicadas a los modelos de difusión: entrenar un nuevo modelo (el estudiante) supervisándolo con las predicciones de otro (el profesor). Explica por qué se necesitan muchos pasos (la dirección predicha solo es válida localmente y, si se avanza demasiado, se obtiene el centroide borroso de una región de alta verosimilitud), cómo funcionan algoritmos clásicos como DDPM y DDIM, y qué papel desempeña la inyección de ruido entre pasos. También describe cómo técnicas inspiradas en optimización, como los métodos de orden superior (Heun de segundo orden), permiten reducir errores de aproximación sin añadir estocasticidad. El texto conecta ideas de muestreo con técnicas de gradiente estocástico y modelos de flujo, y prepara el terreno para examinar los métodos de destilación que permiten comprimir docenas o cientos de pasos en solo unos pocos.