DiffusionGemma: un modelo de lenguaje open-weight que genera texto por difusión discreta

Fuentes: DiffusionGemma: a discrete diffusion language model fine-tuned from Gemma 4

DiffusionGemma es un modelo de lenguaje experimental de pesos abiertos que utiliza difusión discreta para generar texto a gran velocidad, evitando el cuello de botella del decodificado secuencial propio de los grandes modelos de lenguaje autorregresivos (AR). En lugar de producir un token por paso, el modelo refina iterativamente bloques de 256 tokens en paralelo.

El sistema no se entrena desde cero, sino que se obtiene mediante ajuste fino del modelo Gemma 4, una arquitectura de mezcla de expertos con 3.800 millones de parámetros activados y un total de 25.200 millones. El entrenamiento emplea una canalización computacionalmente eficiente de dos etapas que consume menos del 10% del presupuesto total de tokens del modelo AR original: una primera fase de ajuste fino supervisado para enseñar el denoising bidireccional, y una segunda que combina aprendizaje por refuerzo con destilación del muestreador para mejorar calidad de generación y eficiencia de inferencia.

En la práctica, DiffusionGemma genera alrededor de 20 tokens por pasada directa y alcanza aproximadamente 1.500 tokens por segundo en una sola GPU NVIDIA H100, un ritmo muy superior al de los modelos AR incluso con decodificado especulativo de última generación. El modelo mantiene además las capacidades del Gemma 4 original: modo de razonamiento (thinking mode), entradas multimodales y contextos largos. Tras el ajuste fino, conserva la capacidad de generación autorregresiva con una degradación mínima del rendimiento, lo que apunta a una futura vía de decodificado híbrido difusión-AR. El informe técnico, fechado el 31 de julio de 2026, está firmado por Jean Tarbouriech y publicado en arXiv.