Alibaba Cloud a lancé Qwen-Image-2.1, un modèle d'intelligence artificielle (IA) à poids ouverts de 7 milliards de paramètres, qui combine des capacités de génération et d'édition d'images. Cette version repose sur une architecture légère, prend en charge la transparence de manière native et permet l’édition simultanée de jusqu'à dix images de référence. Certains observateurs ont toutefois relevé que la licence Apache 2.0, qui accompagnait le précédent modèle Qwen Image, a été remplacée par une licence « Qwen Research » qui restreint l'utilisation commerciale, et ce, malgré la mention « poids ouverts ». Alibaba Cloud, également connu sous le nom d'Aliyun, est une entreprise spécialisée dans le cloud computing, filiale du groupe Alibaba. Alibaba Cloud fournit des services de cloud computing aux entreprises en ligne ainsi qu'à l'écosystème de commerce électronique d'Alibaba. Alibaba Cloud développe également la série Qwen de grands modèles de langage à poids ouverts. Il s'agit de la plus grande entreprise de cloud computing en Chine et dans la région Asie-Pacifique, selon Gartner.
Alibaba Cloud a officiellement lancé Qwen-Image-2.1, un modèle ouvert unifié combinant des capacités de génération d’images à partir de texte et d’édition d’images au sein d’un seul point de contrôle.
« Nous sommes ravis de mettre en open source Qwen-Image-2.1, un modèle d'image de la famille Qwen qui offre un équilibre entre qualité de génération, efficacité d'inférence et coût. Qwen-Image-2.1 réunit la génération d'images à partir de texte et la retouche d'images au sein d'un seul et même modèle », a déclaré Alibaba dans un communiqué.
Annoncé le 20 septembre dernier, ce modèle ne compte que 7 milliards de paramètres dans son composant de génération visuelle, soit une fraction de ceux de nombreux systèmes concurrents, mais affirme surpasser la plupart des modèles commerciaux fermés sur le benchmark propriétaire Qwen-Image-Bench avec un score de 60,28.
Compact et efficace
Ce lancement marque un tournant notable en faveur de l’efficacité. Qwen-Image-2.1 repose en effet sur une architecture allégée. Son composant de génération visuelle comprend 32 couches DiT à flux unique et 7 milliards de paramètres, ce qui permet au modèle d'offrir une qualité de génération d'images optimale malgré sa taille réduite.
L'efficacité de l'inférence constitue un autre axe prioritaire, notamment lors de l'édition à partir de plusieurs images d'entrée. Cette optimisation repose sur une architecture d'attention à granularité mixte. Le texte, y compris le préfixe du système et les instructions d'édition, utilise un masque causal au niveau des tokens, tandis que la génération d'images utilise un masque au niveau des blocs. La réutilisation du cache KV permet aux images d'entrée et aux instructions d'édition de servir de contexte statique, ce qui permet d'améliorer l'efficacité de l'inférence et de réduire l'utilisation de la mémoire.
Grâce à cette architecture légère, le modèle offre une qualité d’image compétitive tout en restant exécutable sur des GPU grand public, notamment les NVIDIA RTX 3090 et 5090.
Transparence native, création et édition unifiées
L'innovation phare de Qwen-Image-2.1 réside dans sa sortie native en transparence RGBA, qui permet aux utilisateurs de générer des images dotées de véritables canaux alpha directement à partir de prompts, sans avoir besoin d'une étape distincte de suppression de l'arrière-plan.
« La transparence native constitue une nouveauté majeure de cette version. En décembre 2025, nous avons lancé Qwen-Image-Layered, un modèle dédié à la génération d’images transparentes. Qwen-Image-2.1 intègre désormais cette fonctionnalité dans un modèle unifié, qui utilise le prompt pour déterminer s’il doit générer une image classique ou une image comportant un canal de transparence. », a déclaré Alibaba.
Qwen-Image-2.1 est capable de générer des images transparentes plus complexes, composées de plusieurs éléments. En combinant génération et retouche, le modèle permet également de retoucher directement des images transparentes. Il est par exemple possible de modifier l'expression d'un sujet tout en conservant l'arrière-plan transparent.
Cette fonctionnalité s’étend par ailleurs aux photographies réelles. À partir d’une image RVB, le modèle peut extraire le sujet souhaité sous forme de calque RGBA avec transparence, ce qui facilite la réutilisation des éléments dans les travaux de conception et de composition ultérieurs.
Édition polyvalente
Qwen-Image-2.1 prend en charge l'édition simultanée de jusqu'à dix images de référence, ce qui ouvre la voie à des cas d'utilisation tels que les portraits de groupe, les essayages virtuels et l'aménagement intérieur.
Dans l'exemple de portrait de groupe ci-dessous, six portraits individuels situés à gauche sont réunis en une seule photographie.
Pour l'édition locale, Qwen-Image-2.1 prend en charge les cercles, les annotations dessinées et les masques distincts pour préciser l'emplacement où une modification doit être effectuée.
L'exemple ci-dessous utilise des cercles de différentes couleurs pour identifier trois zones à la fois. L'instruction générative « Retire la montre en métal dans le cercle bleu, change la couleur des cheveux dans le cercle rouge en noir et remplace la zone dans le cercle vert par un pyjama en lin à manches courtes gris » donne le résultat suivant :
La résolution de sortie est fixée par défaut à 2 048 × 2 048 pixels pour les sept formats d’image pris en charge, avec un rendu typographique amélioré et un éclairage des portraits mis en avant par l’équipe de développement.
Des observateurs du secteur ont cependant relevé un changement de licence : alors que le précédent modèle Qwen Image, doté de 20 milliards de paramètres, était publié sous licence Apache 2.0, Qwen-Image-2.1 est assorti d’une licence « Qwen Research », qui impose des restrictions sur le déploiement commercial malgré la mention « poids ouverts » figurant sur la page de lancement.
Source : Annonce de Qwen-Image-2.1
Et vous ?
Quel est votre avis sur le sujet ?
Que pensez-vous des nouveautés proposées par cette version de Qwen-Image ? Les trouvez-vous utiles et intéressantes ?Voir aussi :
Alibaba Cloud lance Qwen-Image-2.0, un modèle fondamental de génération d'images de nouvelle génération, combinant infographie professionnelle et photoréalisme dans un seul modèle d'IA
Alibaba présente Qwen Image Edit, un outil permettant d'effectuer des retouches d'images grâce à l'IA en quelques secondes. Cela va-t-il révolutionner à jamais le domaine de la retouche assistée par l'IA ?
Alibaba lance Qwen3.8-Omni-Flash, un modèle d'IA omnimodal capable de produire des vidéos, des clips musicaux, des films, des résumés audiovisuels et des conversations en temps réel
Vous avez lu gratuitement 20 157 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.