Cómo construir un modelo de lenguaje por difusión: guía técnica

Fuentes: How to Build a Diffusion Language Model

Los modelos de lenguaje por difusión (DLM) representan una alternativa a los modelos autorregresivos que dominan el campo. Mientras los autorregresivos generan texto token a token de izquierda a derecha, los modelos de difusión parten de una secuencia completa ruidosa —en este caso, totalmente enmascarada— y la refinan iterativamente en paralelo. Este paralelismo permite ajustar el equilibrio entre velocidad y calidad mediante el número de pasos de refinamiento, corregir errores a lo largo del proceso y atender a contexto bidireccional en cada iteración. El artículo, basado en charlas impartidas en los talleres del ICLR 2026 y la MLSS 2026, explica los bloques técnicos de los DLM abiertos actuales. Partiendo de la difusión gaussiana para imágenes, los autores construyen la noción de difusión discreta por analogía: en lugar de añadir ruido gaussiano, se enmascaran tokens aleatorios con una programación de enmascarado. El modelo aprende un proceso inverso que, a partir de una secuencia totalmente enmascarada, recupera los tokens originales, lo que se puede entender como un «BERT generativo». El texto detalla la derivación formal del límite inferior de la evidencia (ELBO), muestra cómo esta pérdida conecta con la log-verosimilitud y explica cómo igualó las diferencias de perplejidad frente a los autorregresivos. También aborda extensiones prácticas clave: difusión por bloques para generar secuencias de longitud variable, técnicas de refinamiento iterativo para corregir errores y estrategias de post-entrenamiento que aceleran la inferencia. Se mencionan modelos abiertos recientes como Mercury 2 de Inception Labs y se apuntan aplicaciones en biología. La conclusión implícita es que, tras años como problema abierto, los modelos de lenguaje por difusión son ya una realidad competitiva.