El regreso de los modelos de difusión continua para lenguaje

Fuentes: The comeback of continuous diffusion language models

La investigación en modelos de difusión continua para el procesamiento del lenguaje natural experimenta un notable resurgimiento tras años de estancamiento, desafiando la dominancia histórica de los métodos discretos y autoregresivos. Aunque las técnicas de difusión discreta habían desplazado a las continuas debido a su mayor eficiencia computacional y alineación con el paradigma actual de los grandes modelos de lenguaje (LLM), recientes avances sugieren que el enfoque continuo recupera terreno por su capacidad para integrar herramientas desarrolladas en generación audiovisual.

Históricamente, la generación de texto se basaba en procesos autoregresivos que predecían un token a la vez. La difusión ofrecía una alternativa iterativa basada en la reversión de un proceso de corrupción del dato. En 2021, surgieron los primeros modelos discretos como D3PM y SUNDAE, pero fue en 2022 cuando Diffusion-LM popularizó el uso de vectores de embeddings continuos para aplicar ruido gaussiano directamente a datos categóricos. Este enfoque permitía aprovechar técnicas de muestreo y destilación probadas en imágenes.

Sin embargo, a finales de 2023, la investigación se inclinó casi exclusivamente hacia métodos discretos. Factores como el 'momento ChatGPT', que priorizó el rendimiento bruto sobre la elegancia teórica, y estudios como Plaid-1B que mostraron una eficiencia de entrenamiento 64 veces inferior en modelos continuos, contribuyeron a este cambio. No obstante, la comunidad científica vuelve ahora a explorar las ventajas del enfoque continuo para tareas de generación controlada y multimodalidad, marcando un nuevo capítulo en la evolución de los generadores de lenguaje.