Qwen-Image-2.1 : 7B et jusqu'à 10 références
Qwen-Image-2.1генерация изображениймодели с открытыми весами
Ce qu'Alibaba a réellement publié
Ce qui retient l'attention ici n'est pas tant la comparaison spectaculaire avec GPT Image 1.5 que l'association de 7B et de véritables fonctions d'édition. Dans le dépôt GitHub officiel de Qwen, Alibaba présente Qwen-Image-2.1 comme un modèle unifié pour générer et modifier des images ; les 7 milliards de paramètres concernent précisément le composant génératif visuel.
Le modèle accepte jusqu'à 10 images de référence et peut les réunir dans une même composition. Ce mode ne sert pas seulement au transfert de style : les cas d'usage annoncés incluent la préservation de l'identité, l'assemblage d'un vêtement ou d'un produit depuis plusieurs sources, ainsi que le contrôle d'éléments isolés d'une scène.
L'édition ne semble pas non plus être une fonction décorative. Des modifications locales précises, la suppression d'arrière-plan et une sortie RGBA native avec transparence sont annoncées. La documentation évoque également une résolution 2K : Qwen-Image-2.1 vise donc non seulement les belles démonstrations, mais aussi les maquettes, fiches, schémas et autres supports à retravailler.
Un effort particulier porte sur le texte, les infographies et les pages denses avec mise en page. C'est historiquement un point faible des modèles de diffusion : ils peuvent gérer un grand titre, mais les petits libellés et une composition cohérente finissent souvent en soupe visuelle.
Alibaba revendique de meilleurs résultats que GPT Image 1.5 dans ses propres benchmarks. Le GenAI Showdown indépendant donne une image plus nuancée : Qwen-Image-2.1 obtient 7 sur 15, contre 4 sur 15 pour Qwen-Image 1.0, mais reste derrière Ideogram 4 avec 8 sur 15. Les retours sur le texte divergent aussi : certains saluent les petites inscriptions, tandis que d'autres obtiennent un rendu illisible.
Au 22 septembre 2026, les poids sont disponibles sur Hugging Face et le code est publié sur GitHub. Toutefois, le terme open source demande une nuance : la page de licence cite le Qwen Research License Agreement et les descriptions disponibles mentionnent des restrictions non commerciales. Il est plus juste de parler d'un modèle à poids ouverts que d'une licence permissive approuvée par l'OSI.
Pourquoi la compacité compte plus qu'une victoire au classement
La valeur pratique de Qwen-Image-2.1 réside dans l'intégration d'une génération et d'une édition solides dans un composant visuel relativement compact. Cela rend les expérimentations locales plus réalistes, même si les informations publiées ne donnent pas de réponse universelle sur la mémoire nécessaire ou la vitesse selon le matériel.
Avant de regarder un score global, je testerais trois points : la stabilité des petits textes, la préservation des objets avec plusieurs références et la précision des retouches locales. C'est précisément là que des exemples séduisants s'écartent souvent d'un processus de production reproductible.
Ce n'est donc pas un remplaçant automatique des générateurs fermés. Mais les poids ouverts, l'édition et jusqu'à 10 références dans un seul modèle changent réellement la donne pour la recherche et les prototypes locaux. La vraie question n'est plus de savoir si la démo impressionne, mais si le modèle conserve ses qualités annoncées de façon constante hors de celle-ci.