Qwen-Image-2.1: el nuevo modelo de generación de imágenes

Alibaba ha presentado Qwen-Image-2.1, un modelo de código abierto que unifica la generación y edición de imágenes en una sola herramienta. Con solo 7.000 millones de parámetros, este modelo busca equilibrar calidad, velocidad y versatilidad, y ya está disponible para descargar en plataformas como Hugging Face y ModelScope.

[Haz clic en la imagen para ampliar]

Lo más llamativo es su capacidad para trabajar con transparencia nativa: puede crear imágenes con fondo transparente (formato RGBA) y editar capas transparentes sin necesidad de herramientas externas. Además, admite hasta 10 imágenes de referencia para composiciones complejas, lo que lo hace muy útil para diseñadores y creadores.

Características principales

  • Arquitectura ligera: con 7B de parámetros, ofrece un rendimiento superior a muchos modelos cerrados, con una inferencia acelerada para múltiples imágenes.
  • Transparencia nativa: genera y edita imágenes RGBA, permitiendo composiciones y edición de texto sobre fondos transparentes.
  • Edición versátil: soporta hasta 10 imágenes de referencia, control local preciso (círculos, máscaras) y mantiene la fidelidad en retratos y productos.
  • Amplia cobertura: destaca en panorámicas, infografías y pruebas de vestuario, con texturas realistas y tipografía elegante.

Rendimiento y compatibilidad

El modelo se integra con múltiples herramientas desde el primer día. Diffusers, ComfyUI, vLLM-Omni y SGLang ya ofrecen soporte nativo, lo que facilita su uso en diferentes entornos. Además, gracias a la pila de software FlagOS, es compatible con diversos chips de IA, incluyendo GPUs de AMD y otras plataformas, sin necesidad de modificar el código.

[Haz clic en la imagen para ampliar]

Para usuarios en China, la plataforma wuli.art ofrece acceso gratuito a todas las funciones de Qwen-Image-2.1, incluyendo la generación de imágenes con fondo transparente. ModelScope también lo soporta completamente, permitiendo descargas, generación en línea y entrenamiento de LoRA.

[Haz clic en la imagen para ampliar]

Cómo empezar

Para usar el modelo, se recomienda emplear los modelos de reescritura de prompts oficiales (Qwen3.5-VL 9B) para obtener descripciones detalladas. El código y los pesos están disponibles en GitHub, con ejemplos para generación de texto a imagen y edición. La inferencia se puede realizar con Diffusers, SGLang o LightX2V, dependiendo de tus necesidades de rendimiento.

Preguntas y respuestas

¿Qué es Qwen-Image-2.1?

Es un modelo de código abierto de Alibaba que unifica la generación y edición de imágenes, con 7B de parámetros y soporte para transparencia nativa (RGBA).

¿Cuántas imágenes de referencia admite?

Admite hasta 10 imágenes de referencia para composiciones multi-sujeto, manteniendo la identidad de personas y productos.

¿Es compatible con GPUs de AMD?

Sí, gracias a la pila FlagOS, es compatible con GPUs de AMD y otras plataformas, sin necesidad de modificar el código.