Classé #1 Génération d'Images Locale — Des Pixels sur Votre Propre Machine
Alibaba (Qwen Team)

Qwen-Image-2.1

Qwen-Image-2.1 est un petit modèle d'image astucieux que vous pouvez télécharger et faire tourner vous-même. Avec un générateur d'images de 7 milliards de paramètres, il crée des images classiques et transparentes en 2K, retouche des photos et fusionne jusqu'à dix images de référence en une seule scène. Le hic est juridique, pas technique : contrairement aux précédents modèles d'image Qwen, il n'est pas sous licence pour un usage commercial.

Mis à jour 27 septembre 2026 7B DiTLocal ImageNative RGBA
8.8sur 10
Site officiel
Idéal pour

Qwen-Image-2.1 est un petit modèle d'image astucieux que vous pouvez télécharger et faire tourner vous-même. Avec un générateur d'images de 7 milliards de paramètres, il crée des images classiques et transparentes en 2K, retouche des photos et fusionne jusqu'à dix images de référence en une seule scène. Le hic est juridique, pas technique : contrairement aux précédents modèles d'image Qwen, il n'est pas sous licence pour un usage commercial.

Pourquoi ça Gagne

Générateur visuel compact de 7 milliards de paramètres (32 couches DiT à flux unique), bien plus petit que les modèles de 20 milliards de la précédente famille Qwen-Image. Génère nativement des images transparentes (RGBA), retouche des calques transparents et détoure des sujets dans des photos. Accepte jusqu'à 10 images de référence et des retouches locales signalées par un cercle, un gribouillis ou un masque. Sortie native en 2048×2048, plus des formats panoramiques et portrait. Pris en charge dès le premier jour dans ComfyUI et Diffusers.

À surveiller

Il est publié sous la Qwen Research License, et non sous Apache 2.0 comme les précédents modèles d'image Qwen. L'usage personnel et la recherche sont autorisés ; pour vendre des images ou bâtir un produit payant dessus, il faut un accord séparé avec Alibaba. Les extensions de la communauté (LoRA, versions affinées) se développeront donc plus lentement.

01

Ce que c'est réellement

Pour ceux qui font tourner l’IA sur leur propre ordinateur, les modèles d’image avaient une manie agaçante : chaque nouveau modèle était meilleur, et chaque nouveau modèle était plus gros. Un meilleur texte et des détails plus nets voulaient généralement dire qu’il fallait une carte graphique plus chère.

Qwen-Image-2.1, publié par Alibaba le 20 septembre 2026, rompt avec cette tendance. Il est plus petit que les modèles d’image Qwen qui l’ont précédé, et il en fait davantage.

Petit, et étonnamment capable

La partie du modèle qui dessine réellement l’image compte 7 milliards de paramètres. C’est nettement moins que le générateur de 20 milliards de paramètres des précédents modèles Qwen-Image. Selon Alibaba, ce résultat vient d’une architecture épurée – 32 couches « à flux unique » qui traitent le texte et l’image ensemble – et d’astuces qui évitent de refaire deux fois le même travail.

Pour vous, cela signifie un modèle plus léger et moins coûteux à faire tourner. Et il en contient davantage :

  • Des images transparentes. Demandez un autocollant, un sprite de jeu vidéo ou un détourage de produit, et il peut en générer un avec un fond réellement transparent. La plupart des modèles peignent un fond et vous laissent l’effacer, en général avec un halo flou autour des cheveux ou du verre. Qwen-Image-2.1 peut aussi retoucher des calques transparents et extraire un sujet d’une photo existante.
  • Jusqu’à dix références. Donnez-lui la photo d’une personne, une veste trouvée sur une boutique en ligne et l’image d’une pièce, et il peut placer cette personne, vêtue de cette veste, dans cette pièce. Parmi les exemples d’Alibaba figure une photo de groupe assemblée à partir de six portraits distincts.
  • Montrer plutôt que décrire. Pour modifier une partie d’une image, vous pouvez l’entourer, gribouiller dessus ou fournir un masque, au lieu d’essayer d’expliquer avec des mots où se trouve « le truc à gauche ».
  • Sortie en 2K. Il génère nativement en 2048×2048, ainsi qu’en formats panoramique, portrait et autres.

Dès le premier jour, il fonctionnait dans ComfyUI et Hugging Face Diffusers, les deux façons les plus répandues de faire tourner des modèles d’image en local.

Le hic : la licence a changé

C’est là que la bonne nouvelle se complique.

Les précédents modèles d’image Qwen étaient publiés sous Apache 2.0, l’une des licences les plus généreuses du monde du logiciel. On pouvait les télécharger, les modifier, les intégrer à un produit et vendre ce qu’ils produisaient sans rien demander à personne.

Qwen-Image-2.1 est, lui, publié sous la Qwen Research License.

Cette licence vous autorise à expérimenter, à faire de la recherche et à créer de l’art pour vous-même. Mais dès que vous bâtissez une application payante dessus, que vous vendez des images générées à des clients ou que vous l’utilisez dans un produit commercial, il vous faut un accord séparé avec Alibaba.

Ce n’est pas qu’un détail juridique. Les outils d’image open source prospèrent parce que les gens partagent librement leurs extensions : styles, personnages et versions affinées. Une licence réservée à la recherche signifie que moins d’entreprises investiront dans cet écosystème, qui devrait donc croître plus lentement qu’il ne l’aurait fait sous Apache.

Pour qui ?

  • Les amateurs, étudiants, chercheurs et artistes qui créent des œuvres personnelles : c’est l’un des modèles d’image les plus capables que l’on puisse faire tourner chez soi. Il est compact, crée de vraies images transparentes et sait jongler avec dix références à la fois. Essayez-le.
  • Ceux qui montent une activité : lisez d’abord la licence. Pour une liberté commerciale sans avoir à demander d’autorisation, FLUX.2 Klein et les autres modèles sous licence permissive restent le terrain le plus sûr.

Qwen-Image-2.1 montre à quel point les petits modèles d’image locaux sont devenus bons. Il montre aussi qu’« ouvert » et « librement utilisable à des fins commerciales » ne sont pas toujours synonymes.

02

Forces et limites honnêtes

Points Forts

  • Assez petit pour un ordinateur personnel : le générateur d’images compte 7 milliards de paramètres, bien moins que les modèles de 20 milliards des précédentes versions de Qwen-Image, et Alibaba ajoute des astuces comme la réutilisation des calculs d’attention pour qu’il reste économique à faire tourner. Moins de mémoire nécessaire, c’est plus de gens capables de l’exécuter sur leur propre carte graphique.
  • Une vraie transparence : la plupart des modèles locaux peignent un objet sur un fond et vous laissent le détourage, ce qui laisse généralement un halo flou autour des cheveux ou du verre. Qwen-Image-2.1 peut générer directement des images transparentes (RGBA), retoucher des calques transparents et extraire un sujet d’une photo.
  • Jusqu’à dix références : donnez-lui la photo d’une personne, une veste repérée sur une boutique en ligne et une pièce, et il peut les réunir en une seule scène en gardant visages et produits reconnaissables. Parmi les exemples d’Alibaba figure une photo de groupe composée à partir de six portraits distincts.
  • Montrez ce qu’il faut changer : les retouches locales se signalent par un cercle, un gribouillis peint ou un masque séparé : inutile de décrire l’endroit avec des mots.
  • Net en 2K : sortie native en 2048×2048, plus des formats panoramiques et portrait, avec un meilleur rendu du texte, de l’éclairage des portraits et des détails fins.

Limites Honnêtes

  • Pas d’usage commercial : Qwen-Image-2.1 utilise la Qwen Research License. Les précédents modèles d’image Qwen étaient sous Apache 2.0, qui autorisait tout le monde à en faire un usage commercial. Désormais, si vous vendez des images ou bâtissez un produit payant sur ces poids, il vous faut une licence séparée d’Alibaba.
  • Une communauté plus réduite, pour l’instant : nouvelle architecture et licence restrictive signifient moins de styles, de personnages et d’extensions entraînés par la communauté que pour FLUX.2 Klein ou les anciens modèles sous licence Apache.
  • Très récent : il est sorti le 20 septembre 2026. Les comparaisons indépendantes de qualité, de vitesse et de consommation mémoire sur du matériel grand public restent rares : testez-le avec vos propres prompts.
  • Des conventions de prompt pour la transparence : la sortie transparente fonctionne mieux avec la formulation recommandée par Alibaba (par exemple en précisant explicitement que l’image comporte un canal alpha).
03

Aperçu des Benchmarks

Générateur visuel — 7 milliards de paramètres

32 couches DiT à flux unique, avec une attention à granularité mixte et la réutilisation du cache KV du préfixe, selon Alibaba. Les précédents modèles Qwen-Image reposaient sur un générateur de 20 milliards.

Transparence native (RGBA)

Génère des images transparentes à partir de texte, retouche des calques transparents et détoure des sujets dans des photos, le tout dans un seul modèle.

Jusqu'à 10 images de référence

Combine plusieurs références en préservant l'identité des personnes et des produits ; retouches locales par cercle, annotation peinte ou masque.

Sortie — 2048×2048 en natif

Plus le 16:9 (2752×1536), le 9:16, le 4:3, le 3:2 et d'autres formats, selon la fiche du modèle d'Alibaba.

Licence — Qwen Research License

Recherche et usage personnel autorisés ; l'usage commercial exige un accord séparé. Les précédents modèles d'image Qwen étaient sous Apache 2.0.

04

Le Verdict

Qwen-Image-2.1 est un modèle d’image local techniquement impressionnant, assorti d’un piège côté licence. Pour les amateurs, les étudiants, les chercheurs et les artistes qui créent des œuvres personnelles dans ComfyUI, c’est l’un des outils les plus capables qu’on puisse faire tourner chez soi : compact, avec une vraie transparence et dix références à la fois. Pour quiconque veut bâtir une activité sur ces images, c’est une autre histoire. La licence exclut l’usage commercial sans l’autorisation d’Alibaba : FLUX.2 Klein et les autres modèles sous licence permissive restent la base la plus sûre.

05

Foire aux questions