Un equipo de investigación ha presentado JiT-DDT, una nueva arquitectura de codificador-decodificador que permite entrenar modelos de texto a imagen con una velocidad 3,6 veces superior a la de los modelos basados en Latent Diffusion Models (LDM). Este avance resuelve el principal cuello de botella de la generación de video, que en el sistema anterior, Linum v2, requería 110.000 tokens para un clip de 5 segundos a 720p, una cifra que excede el contexto típico de los LLMs.
El problema radica en la complejidad cuadrática de la atención y la limitación de la compresión de los VAE estándar, que suelen alcanzar un máximo de 16x16 tokens. JiT-DDT elimina el VAE tradicional y utiliza un modelo unificado (JiT) para gestionar la compresión, logrando una reducción de 32x32 tokens. Para superar la inestabilidad asociada a la predicción de velocidad (v-prediction) en espacios de alta dimensión, la nueva arquitectura emplea la predicción de coordenadas (x-prediction) junto con la pérdida de flujo de matching (v-loss). Esto permite al modelo aprender de entradas de alta dimensionalidad sin caer en la maldición de la dimensionalidad.
Aunque JiT-DDT genera imágenes con cuatro veces más píxeles que el modelo de referencia, reduce drásticamente el coste computacional. El código y los pesos del modelo están disponibles bajo licencia Apache 2.0, aunque se trata de un artefacto de investigación y no de una liberación comercial completa. Este hallazgo sienta las bases para la próxima versión de Linum, Linum v3, optimizando la eficiencia en el entrenamiento de modelos generativos.
