Qwen-Image-3.0-Pro: el modelo de generación de imágenes de Qwen para uso productivo

Fuentes: Qwen-Image-3.0-Pro: a productivity-oriented image generation model on QwenCloud

Qwen-Image-3.0-Pro es un modelo de generación de imágenes disponible en la nube de Qwen (QwenCloud) orientado a un uso productivo más allá del resultado estético. Admite entradas de hasta 4.500 tokens y permite componer en una sola pasada diseños complejos con imágenes dentro de imágenes, como periódicos, storyboards, menús o exámenes. En el plano del detalle, soporta la renderización precisa de texto a tamaños tan reducidos como 10 píxeles y reproduce elementos finos como microexpresiones, poros o mechones de cabello, con una calidad próxima a la fotografía real.

El modelo incorpora además un conocimiento extenso: renderiza de forma nativa textos en doce idiomas y más de veinte tipografías, y simula con realismo interfaces habituales como páginas web, videojuegos o retransmisiones en directo. Entre sus funciones técnicas figuran el modo de prefijo, que obliga al modelo a continuar exactamente desde un texto inicial proporcionado; function calling, para conectar el modelo con herramientas externas; context cache, que reduce la latencia y el coste al reutilizar prefijos compartidos en peticiones largas; y structured outputs, que garantiza respuestas en formato JSON.

En cuanto a precios, cada imagen de entrada de 1K o 2K cuesta 0,003 dólares, mientras que la generación de salida se tarifica a 0,04 dólares por imagen en 1K y a 0,075 dólares en 2K. El límite de uso es de una solicitud por minuto. El acceso se realiza a través de la API de DashScope sobre el endpoint de generación multimodal, autenticado con la clave DASHSCOPE_API_KEY.