Puesto #1 Generación Local de Imágenes — Píxeles en tu Propio Equipo
Alibaba (Qwen Team)

Qwen-Image-2.1

Qwen-Image-2.1 es un modelo de imagen pequeño e ingenioso que puedes descargar y ejecutar tú mismo. Con un generador de imágenes de 7.000 millones de parámetros, crea imágenes normales y transparentes en 2K, edita fotos y combina hasta diez imágenes de referencia en una sola escena. La pega es legal, no técnica: a diferencia de los modelos de imagen Qwen anteriores, no tiene licencia para uso comercial.

Actualizado 27 de septiembre de 2026 7B DiTLocal ImageNative RGBA
Ideal para

Qwen-Image-2.1 es un modelo de imagen pequeño e ingenioso que puedes descargar y ejecutar tú mismo. Con un generador de imágenes de 7.000 millones de parámetros, crea imágenes normales y transparentes en 2K, edita fotos y combina hasta diez imágenes de referencia en una sola escena. La pega es legal, no técnica: a diferencia de los modelos de imagen Qwen anteriores, no tiene licencia para uso comercial.

Por qué gana

Generador visual compacto de 7.000 millones de parámetros (32 capas DiT de flujo único), mucho más pequeño que los modelos de 20.000 millones de la familia Qwen-Image anterior. Genera imágenes transparentes (RGBA) de forma nativa, edita capas transparentes y recorta sujetos de fotos. Acepta hasta 10 imágenes de referencia y ediciones locales marcadas con círculos, garabatos o máscaras. Salida nativa de 2048×2048, además de formatos panorámicos y verticales. Compatible desde el primer día con ComfyUI y Diffusers.

Ten en cuenta

Se publica bajo la Qwen Research License, no bajo Apache 2.0 como los modelos de imagen Qwen anteriores. El uso personal y de investigación está permitido; para vender imágenes o crear un producto de pago con él hace falta un acuerdo aparte con Alibaba. Por eso, los complementos de la comunidad (LoRA, ajustes finos) crecerán más despacio.

01

Lo que realmente es

Para quienes ejecutan IA en su propio ordenador, los modelos de imagen tenían una costumbre molesta: cada uno nuevo era mejor, y cada uno nuevo era más grande. Un texto mejor y unos detalles más nítidos solían significar necesitar una tarjeta gráfica más cara.

Qwen-Image-2.1, publicado por Alibaba el 20 de septiembre de 2026, rompe esa tendencia. Es más pequeño que los modelos de imagen Qwen anteriores y hace más cosas.

Pequeño y sorprendentemente capaz

La parte del modelo que realmente dibuja la imagen tiene 7.000 millones de parámetros. Es bastante menos que el generador de 20.000 millones que había detrás de los modelos Qwen-Image anteriores. Alibaba dice que lo consigue con un diseño simplificado —32 capas de «flujo único» que procesan texto e imagen juntos— y con trucos que evitan repetir el mismo trabajo dos veces.

Para ti, eso significa que el modelo es más ligero y más barato de ejecutar. Y trae más cosas dentro:

  • Imágenes transparentes. Pide una pegatina, un personaje de videojuego o un recorte de producto y puede generarlo con un fondo realmente transparente. La mayoría de los modelos pintan un fondo y te dejan a ti borrarlo, normalmente con un halo borroso alrededor del pelo o del cristal. Qwen-Image-2.1 también puede editar capas transparentes y extraer un sujeto de una foto existente.
  • Hasta diez referencias. Dale la foto de una persona, una chaqueta de una tienda online y la imagen de una habitación, y puede colocar a esa persona, con esa chaqueta, en esa habitación. Entre los ejemplos de la propia Alibaba hay una foto de grupo montada a partir de seis retratos distintos.
  • Señalar en vez de describir. Para cambiar una parte de una imagen, puedes rodearla con un círculo, garabatear encima o aportar una máscara, en lugar de intentar explicar con palabras dónde está «la cosa de la izquierda».
  • Salida en 2K. Genera de forma nativa a 2048×2048, además de formatos panorámicos, verticales y otros.

Desde el primer día funcionó en ComfyUI y Hugging Face Diffusers, las dos formas más populares de ejecutar modelos de imagen en local.

La pega: la licencia ha cambiado

Aquí es donde la buena noticia se complica.

Los modelos de imagen Qwen anteriores se publicaron bajo Apache 2.0, una de las licencias más generosas del mundo del software. Podías descargarlos, modificarlos, integrarlos en un producto y vender lo que generaban sin pedir permiso a nadie.

Qwen-Image-2.1 se publica, en cambio, bajo la Qwen Research License.

Esa licencia te permite experimentar, investigar y crear arte para ti. Pero en el momento en que montes una aplicación de pago sobre él, vendas imágenes generadas a clientes o lo uses dentro de un producto comercial, necesitas un acuerdo aparte con Alibaba.

Esto va más allá de la letra pequeña legal. Las herramientas de imagen de código abierto prosperan porque la gente comparte complementos libremente: estilos, personajes y versiones ajustadas. Una licencia solo para investigación implica que menos empresas invertirán en ese ecosistema, así que probablemente crecerá más despacio de lo que habría crecido con Apache.

A quién le conviene

  • Aficionados, estudiantes, investigadores y artistas que crean obra personal: es uno de los modelos de imagen más capaces que puedes ejecutar en casa. Es compacto, crea imágenes realmente transparentes y puede manejar diez referencias a la vez. Pruébalo.
  • Quien esté montando un negocio: lee antes la licencia. Para tener libertad comercial sin pedir permiso, FLUX.2 Klein y otros modelos con licencias permisivas siguen siendo el terreno más seguro.

Qwen-Image-2.1 demuestra lo buenos que se han vuelto los modelos de imagen pequeños y locales. También demuestra que «abierto» y «de uso comercial libre» no siempre son lo mismo.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Lo bastante pequeño para un ordenador doméstico: El generador de imágenes tiene 7.000 millones de parámetros, muchos menos que los modelos de 20.000 millones de las versiones anteriores de Qwen-Image, y Alibaba añade trucos como la reutilización de cálculos de atención para que sea barato de ejecutar. Menos memoria significa que más gente puede ejecutarlo en su propia tarjeta gráfica.
  • Transparencia de verdad: La mayoría de los modelos locales pintan un objeto sobre un fondo y te dejan a ti el recorte, lo que suele dejar un halo borroso alrededor del pelo o del cristal. Qwen-Image-2.1 puede generar directamente imágenes transparentes (RGBA), editar capas transparentes y extraer un sujeto de una foto.
  • Hasta diez referencias: Dale la foto de una persona, una chaqueta de una tienda online y una habitación, y puede combinarlas en una sola escena manteniendo reconocibles caras y productos. Entre los ejemplos de la propia Alibaba hay una foto de grupo creada a partir de seis retratos distintos.
  • Señala lo que quieres cambiar: Las ediciones locales se pueden marcar con un círculo, un garabato pintado o una máscara aparte, así que no tienes que describir con palabras dónde está.
  • Nitidez en 2K: Salida nativa de 2048×2048, además de formatos panorámicos y verticales, con mejor renderizado de texto, iluminación de retrato y detalle fino.

Limitaciones honestas

  • No apto para uso comercial: Qwen-Image-2.1 usa la Qwen Research License. Los modelos de imagen Qwen anteriores tenían licencia Apache 2.0, que permitía a cualquiera el uso comercial. Ahora, si cobras por las imágenes o creas un producto de pago con estos pesos, necesitas una licencia aparte de Alibaba.
  • Una comunidad más pequeña, por ahora: Una arquitectura nueva y una licencia restrictiva implican menos estilos, personajes y complementos entrenados por la comunidad que en FLUX.2 Klein o en modelos más antiguos con licencia Apache.
  • Muy reciente: Se lanzó el 20 de septiembre de 2026. Las comparaciones independientes de calidad, velocidad y uso de memoria en hardware doméstico todavía son escasas, así que pruébalo con tus propias instrucciones.
  • Convenciones de prompt para la transparencia: La salida transparente funciona mejor con la redacción que recomienda Alibaba (por ejemplo, indicar de forma explícita que la imagen tiene canal alfa).
03

Resumen de Benchmarks

Generador visual — 7.000 millones de parámetros

32 capas DiT de flujo único con atención de granularidad mixta y reutilización de la caché KV del prefijo, según Alibaba. Los modelos Qwen-Image anteriores se basaban en un generador de 20.000 millones.

Transparencia nativa (RGBA)

Genera imágenes transparentes a partir de texto, edita capas transparentes y extrae sujetos de fotografías, todo en un solo modelo.

Hasta 10 imágenes de referencia

Combina varias referencias conservando la identidad de personas y productos; ediciones locales mediante círculos, anotaciones pintadas o máscaras.

Salida — 2048×2048 nativa

Además de 16:9 (2752×1536), 9:16, 4:3, 3:2 y otras proporciones, según la ficha del modelo de Alibaba.

Licencia — Qwen Research License

Se permite la investigación y el uso personal; el uso comercial requiere un acuerdo aparte. Los modelos de imagen Qwen anteriores tenían licencia Apache 2.0.

04

El Veredicto

Qwen-Image-2.1 es un modelo de imagen local técnicamente impresionante con una pega en la licencia. Para aficionados, estudiantes, investigadores y artistas que crean obra personal en ComfyUI, es de lo más capaz que se puede ejecutar en casa: compacto, con transparencia real y capaz de manejar diez referencias a la vez. Para quien quiera montar un negocio con las imágenes, la historia es otra. La licencia impide el uso comercial sin permiso de Alibaba, así que FLUX.2 Klein y otros modelos con licencias permisivas siguen siendo la base más segura.

05

Preguntas frecuentes