Qwen-Image-2.1: modelo de generación de imágenes con transparencia

Fuentes: Qwen-Image-2.1: text-to-image model with native transparency

Qwen-Image-2.1 es un modelo de generación de imágenes de texto a imagen y edición que se integra en la familia Qwen. Con una arquitectura unificada de 7.000 millones de parámetros, el modelo combina la generación de imágenes con capacidades de edición nativa, destacando por su eficiencia computacional y versatilidad. El sistema utiliza 32 capas de Single-Stream DiT para equilibrar la calidad visual con un bajo coste de inferencia, incorporando mecanismos de atención de granularidad mixta y reutilización de caché KV para optimizar el rendimiento en dispositivos con recursos limitados.

Una de las características principales de esta versión es la transparencia nativa, lo que permite generar imágenes con canal alfa (RGBA) directamente desde el texto, así como editar capas transparentes y extraer sujetos de fotografías. El modelo soporta hasta diez imágenes de referencia para la edición, permitiendo especificar cambios locales mediante círculos, anotaciones pintadas o máscaras separadas, manteniendo la identidad de personas y productos. Además, ha mejorado la tipografía, la iluminación de retratos y los detalles finos para resultados más realistas. La instalación requiere Python 3.10 o superior, junto con las librerías torch, transformers, diffusers y accelerate. El modelo está disponible en Hugging Face, ModelScope y a través de aplicaciones locales como Draw Things y DiffusionBee, con una licencia de investigación que permite su uso para fines académicos y de desarrollo.