Si vous avez déjà utilisé des générateurs d’images par IA, vous connaissez les points faibles habituels : des mots qui se transforment en bruit visuel, des images de référence ignorées à moitié et des prompts qui donnent des résultats légèrement décalés, sans qu’on arrive vraiment à identifier pourquoi. Qwen Image 2 Pro prétend corriger ces problèmes précis. Voici ce qui s’est réellement passé lorsque nous l’avons testé sur des flux de travail commerciaux réels.
Ce que fait réellement Qwen Image 2 Pro
La plupart des modèles de texte vers image reposent sur la même architecture de base : vous écrivez un prompt, vous obtenez une image. La qualité de génération varie, mais l’interface est presque identique d’un outil à l’autre. Qwen Image 2 Pro fonctionne différemment sur un point important : il accepte à la fois un prompt textuel et une image de référence facultative. Vous pouvez donc partir de rien ou remodeler une photo existante grâce à une description.
Cette entrée par image de référence change la manière d’aborder un projet. Au lieu de tout décrire depuis zéro à chaque fois, vous importez une vraie photo et décrivez ce que vous voulez modifier. Le modèle gère la transition. C’est un changement important pour quiconque travaille sur la photographie produit, la création éditoriale ou les présentations client, lorsque le point de départ est un vrai visuel plutôt qu’une toile vierge.
Le modèle repose sur la combinaison d’un encodeur vision-langage et d’un décodeur de diffusion. L’encodeur lit simultanément le texte et l’image, ce qui explique pourquoi l’intégration de l’image de référence paraît plus cohérente que lorsqu’on envoie simplement une photo dans un pipeline img2img classique. Les signaux textuels et visuels sont traités ensemble dès le départ, et non l’un après l’autre.
Un rendu du texte qui tient la route
La fonctionnalité la plus commentée est le rendu précis du texte dans l’image. Les générateurs d’IA ont jusqu’ici échoué sur ce point, car la génération de texte exige un raisonnement spatial que les modèles de diffusion standard gèrent mal. Les lettres sont interverties, l’espacement s’effondre, et les polices deviennent décoratives alors que vous aviez demandé un sans-serif épuré.
Qwen Image 2 Pro comble ces lacunes en traitant la typographie comme un élément structurel plutôt que comme un élément ajouté après coup. En pratique, des prompts comme « une affiche produit avec un titre en sans-serif gras en haut du cadre » donnent des titres lisibles. Les lettres sont placées là où vous l’avez décrit, l’épaisseur de police correspond à ce que vous avez demandé, et le texte s’intègre à la composition au lieu de flotter maladroitement par-dessus.
Cela compte surtout pour les travaux commerciaux : visuels pour les réseaux sociaux, affiches d’événements, étiquettes de produits, fonds de diapositives de présentation. Si votre flux de travail exige du texte dans l’image plutôt qu’ajouté en post-production, c’est l’un des rares modèles qui rend cela possible sans ingénierie de prompt poussée ni itérations pénibles.
Entrée par image de référence
Le paramètre facultatif image accepte l’URL d’une photo existante. Lorsque vous en fournissez une, le modèle s’en sert comme ancre visuelle. Vous décrivez les changements dans le prompt, et le résultat reflète ces changements tout en conservant les éléments structurels de l’original.
L’ampleur de la transformation dépend de la précision de votre prompt et du degré d’écart que vous demandez. Un remplacement d’arrière-plan discret, avec le sujet inchangé, donne un résultat très propre. Une refonte tonale complète à partir d’une photo de référence peut s’éloigner de la composition d’origine. Le modèle interprète la référence au lieu de la reprendre entièrement.
Les prompts négatifs fonctionnent en combinaison avec l’image de référence. Si la photo source contient des éléments que vous voulez exclure du résultat, les nommer dans le prompt négatif réduit leur présence dans l’image finale.

Tester l’édition précise : la photographie produit
Nous avons mené trois tests ciblés : remplacement d’arrière-plan pour une photo de produit, typographie dans une image pour les réseaux sociaux, et transfert de style à partir d’un portrait de référence. Chaque test utilisait un style de prompt et un format différents, afin de solliciter des aspects distincts des capacités du modèle.
Résultats du remplacement d’arrière-plan
Le test : un flacon de produit sur un bureau encombré, image de référence importée, et prompt demandant un fond de studio en marbre propre, avec une lumière douce et diffuse venant de la gauche.
Le résultat : la texture du marbre est réaliste, avec des veines et des reflets de surface adaptés. La direction de la lumière correspond au prompt. L’ombre du produit a été conservée depuis l’original et s’étend naturellement sur la nouvelle surface. La séparation des contours entre le produit et le nouvel arrière-plan est propre à une résolution d’affichage normale, même si un zoom à 200 % montre une légère perte de netteté sur le rebord du bouchon.
Le temps de traitement était d’environ 8 secondes pour une sortie en 16:9 à résolution standard. C’est compétitif par rapport à la plupart des modèles hébergés sur Replicate, à ce niveau de qualité, surtout pour les tâches qui impliquent le traitement d’une image de référence.
💡 Astuce : lorsque vous remplacez un arrière-plan à partir d’une image de référence, utilisez match_input_image: true pour conserver le format d’origine et éviter les recadrages qui coupent les bords du produit de façon inattendue.
Ce que contrôle le prompt négatif
Le prompt négatif ne sert pas seulement au filtrage stylistique ; il fonctionne comme un outil d’exclusion spatiale. Dans le test sur le produit, ajouter « bureau encombré, surface en bois, câbles, papiers » au prompt négatif a rendu le remplacement d’arrière-plan plus propre dès le premier passage. Sans cela, de légères textures de bureau transparaissaient à travers le marbre, dans les zones floues autour de la base du produit.
L’efficacité du prompt négatif dépend de la précision des termes. Des mots vagues comme « désordre » ont eu moins d’effet que la désignation des éléments réellement présents dans l’image de référence. Si des éléments de votre image de référence persistent dans le résultat, décrivez-les explicitement dans le prompt négatif au lieu d’utiliser des descripteurs généraux.

Tester la typographie dans les images
C’est là que Qwen Image 2 Pro se distingue de la plupart des modèles, de façon mesurable. La typographie dans les images générées est un point de défaillance connu dans toute la catégorie depuis des années, et la plupart des solutions exigent encore une superposition en post-production plutôt qu’une génération directe.
Des mises en page d’affiches qui tiennent
Le test : générer une affiche d’événement pour les réseaux sociaux, avec un titre sur deux lignes, un sous-titre et une date en bas. Pas d’image de référence ; uniquement du texte vers image, à partir d’une seule description détaillée.
Le titre s’affiche à la bonne position. Les deux lignes sont présentes et lisibles. La police fait apparaître une nette différence de graisse entre le titre et le sous-titre. La date en bas était lisible quatre fois sur cinq. Lors d’un passage, une paire de lettres du sous-titre était légèrement fusionnée au troisième mot.
Pour une comparaison directe, le même prompt donné à Flux Dev a produit des caractères déformés ou totalement absents à chaque tentative. La qualité visuelle des éléments hors texte de Flux Dev était bonne, mais la typographie était inutilisable dans tous les cas.
💡 Astuce : pour les affiches, décrivez l’épaisseur de la police, comme gras, normal ou fin, plutôt qu’un nom de caractère précis. Le modèle répond plus fidèlement aux descripteurs d’épaisseur qu’aux noms de familles de polices.
Là où la précision du texte faiblit
Les chaînes longues sont plus difficiles. Au-delà d’environ huit mots dans un seul titre, la précision se dégrade : l’espacement des lettres devient irrégulier, et certains glyphes fusionnent ou se scindent au moment du rendu. Utiliser le modèle pour des éléments textuels courts et percutants, et garder les textes plus longs pour la retouche en post-production, donne des résultats systématiquement meilleurs.
La ponctuation dans les images est aussi irrégulière. Les apostrophes et les guillemets apparaissent correctement moins souvent que les caractères alphanumériques simples. Si votre texte exige une ponctuation exacte, prévoyez de la finaliser dans votre logiciel de design après la génération plutôt que de compter sur le modèle pour la placer correctement.

Utiliser Qwen Image 2 Pro sur PicassoIA
Qwen Image 2 Pro est disponible directement sur PicassoIA, sans autre configuration que la connexion à votre compte. Pas d’installation locale, pas de configuration de jeton API pour un usage de base.
Étape 1 : ouvrir la page du modèle
Rendez-vous sur Qwen Image 2 Pro sur PicassoIA. L’interface affiche le champ de prompt principal en haut, une section facultative d’import d’image en dessous, puis les paramètres. La mise en page est simple et toute la configuration se fait dans un seul panneau.
Étape 2 : rédiger votre prompt
Soyez précis sur quatre éléments : le sujet, l’environnement, la direction de la lumière et le texte éventuel à intégrer dans l’image. Un prompt comme « une bouteille d’eau en verre sur une surface de carreaux de céramique blancs, lumière douce d’une fenêtre à droite, ombres minimales, photographie produit épurée » donne au modèle assez d’informations spatiales pour travailler avec précision, sans contraindre trop la composition.
Si vous voulez inclure du texte dans l’image, indiquez-le explicitement entre guillemets dans votre prompt : titre : « Summer 2025 ». Le modèle reprend plus fidèlement les chaînes entre guillemets que le texte intégré à une description de scène. C’est la méthode la plus fiable pour obtenir un texte lisible dès le premier passage.
Activez l’Expansion automatique du prompt pour les prompts courts lorsque vous voulez que le modèle complète automatiquement les détails de la scène. Désactivez-la lorsque vous avez besoin d’un contrôle strict et ne voulez pas que le modèle ajoute des éléments que vous n’avez pas spécifiés.
Étape 3 : configurer le format et les paramètres
Formats disponibles : 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 2:1, 1:2. Pour les publications sur les réseaux sociaux, 9:16 ou 1:1 conviennent le mieux selon le format de la plateforme. Pour les bannières horizontales et les en-têtes de site web, 16:9. Pour les mises en page d’impression, 4:3 ou 3:2.
Si vous avez importé une image de référence et voulez que le résultat reprenne ses dimensions exactes, activez Faire correspondre à l’image importée. Cela remplace le réglage du format et utilise les proportions natives de l’image de référence.
Étape 4 : itérer avec le contrôle du seed
Définissez une valeur de seed dès que vous obtenez un résultat proche de ce dont vous avez besoin. Garder le même seed et n’apporter que de petites modifications ciblées au prompt vous permet de parcourir des variantes de façon contrôlée, au lieu de recevoir des résultats aléatoires à chaque génération.
C’est particulièrement utile pour les itérations typographiques : fixez le seed, modifiez le texte dans la description de votre prompt, puis relancez la génération. La composition générale et la lumière restent cohérentes, tandis que l’élément textuel modifié change. La plupart des utilisateurs obtiennent un résultat exploitable en trois à cinq itérations avec cette méthode.

Qwen Image 2 Pro ou Flux Dev : comparaison côte à côte
Les deux modèles sont disponibles sur PicassoIA et prennent tous deux en charge les workflows de texte vers image et d’image vers image, mais ils sont optimisés pour des usages différents.
| Caractéristique | Qwen Image 2 Pro | Flux Dev |
|---|
| Rendu du texte | Précis pour les chaînes courtes | Déformé dans la plupart des cas |
| Entrée par image de référence | Oui, image vers image complète | Oui, mode img2img |
| Formats d’image | 9 options | 11 options |
| Temps de génération moyen | ~8 secondes | ~3 à 5 secondes |
| Prompt négatif | Oui | Pas de prompt négatif natif |
| Contrôle du seed | Oui | Oui |
| Expansion automatique du prompt | Oui | Non |
| Idéal pour | Texte dans l’image, retouches à partir d’une référence | Vitesse, volume, photoréalisme |
Flux Dev est plus rapide et offre d’excellents résultats photoréalistes lorsque le texte n’est pas une exigence du brief. Son architecture de 12 milliards de paramètres produit des scènes nettes et très fidèles à partir de prompts descriptifs, et le mode img2img gère bien les transformations visuelles.
Qwen Image 2 Pro convient mieux lorsque le résultat doit comporter une typographie lisible, ou lorsque vous travaillez à partir d’une image de référence et avez besoin de transitions d’arrière-plan propres, avec un minimum d’artefacts sur les contours.
Ils répondent à des workflows différents plutôt que de se disputer le même créneau. Lancer les deux sur un même projet pour comparer les premiers résultats est une approche pratique lorsque vous ne savez pas lequel convient le mieux à un brief précis.

Quoi lui associer
Qwen Image 2 Pro produit à la résolution de génération standard, environ 1 mégapixel selon le format choisi. Pour une livraison commerciale, vous voudrez souvent une passe d’upscaling avant l’export final.
Pour l’upscaling
Clarity Pro Upscaler est la meilleure option pour les résultats photoréalistes de Qwen Image 2 Pro. Il ajoute des micro-détails en accord avec le style photoréaliste de l’original : texture de la peau, tissage des tissus, grain des surfaces. Les résultats s’intègrent naturellement à ce que génère Qwen Image 2 Pro, sans ajouter une netteté artificielle par-dessus.
Pour les résultats de photographie produit aux surfaces lisses et aux contours nets, Google Upscaler gère ces matériaux sans ajouter de bruit de texture artificiel qui détonnerait sur le verre ou le métal poli.
Pour une passe rapide en 4x sans réglages poussés, Real ESRGAN traite vite et gère fiablement la plupart des types de sortie courants.
Pour le nettoyage de l’arrière-plan
Lorsque le remplacement d’arrière-plan laisse des artefacts sur les contours ou des résidus de la scène d’origine, Remove Background peut isoler le sujet proprement. Utilisez-le après la génération avec Qwen Image 2 Pro pour obtenir un détourage propre, puis composez le sujet sur un arrière-plan final dans votre logiciel de retouche.
💡 Astuce : pour les photos de produits, le workflow le plus efficace est le suivant : générer avec Qwen Image 2 Pro pour la composition et la lumière, passer par Remove Background pour obtenir un détourage propre, puis upscaler avec P Image Upscale pour la livraison. Trois outils, environ 30 secondes au total, des résultats adaptés aux présentations client.

Les limites réelles à connaître
Résolution au moment de la génération
Le modèle génère à résolution standard. Pour un usage web, c’est suffisant. Pour l’impression grand format ou les situations qui exigent un détail en pleine page au format A2 ou plus, une passe d’upscaling est nécessaire avant la livraison. Intégrez-la dans votre planning.
Les longues chaînes de texte se dégradent
La précision du texte baisse avec la longueur de la chaîne. Le modèle fonctionne mieux avec des éléments textuels courts et contenus. Pour tout texte plus long à intégrer dans l’image, générez la composition visuelle sans texte, puis ajoutez le contenu dans votre outil de design. Vous gardez ainsi un meilleur contrôle typographique qu’en luttant contre les limites de rendu du modèle sur les longues chaînes.
La fidélité à l’image de référence n’est pas de 100 %
Le modèle interprète une image de référence, il ne la copie pas. Lorsque vous importez une référence, attendez-vous à ce que le résultat partage les éléments structurels et les caractéristiques d’éclairage de l’original, sans être une retouche directe au niveau du pixel. Si vous avez besoin d’une retouche régionale précise avec des masques explicites, c’est une autre catégorie d’outils.
L’expansion du prompt peut surprendre
L’expansion automatique du prompt est activée par défaut. Elle ajoute des détails de scène que le modèle déduit de votre description courte. Cela peut produire des résultats plus riches et plus complets, ou introduire des éléments que vous n’aviez pas demandés. Pour un travail commercial précis, désactivez-la et rédigez votre prompt complet manuellement, afin de savoir exactement ce que vous demandez.
3 workflows qui donnent des résultats

Maquettes d’emballages produits : importez l’image de référence de l’emballage, décrivez l’arrière-plan et les conditions de lumière visés, générez en 4:3 ou 3:2, puis upscalez avec Clarity Pro Upscaler. Ce workflow est plus rapide que la mise en place d’une prise de vue en studio pour chaque variante d’emballage, et il produit des résultats qui tiennent en présentation client et sur les fiches e-commerce.
Visuels pour les réseaux sociaux avec texte intégré : utilisez la fonctionnalité de rendu du texte pour les visuels d’événements, les en-têtes promotionnels ou les visuels d’annonce, où le titre fait partie de la composition plutôt que d’être ajouté en post-production. Gardez les titres sous six mots pour un rendu de caractères propre, et utilisez le contrôle du seed pour itérer sur la formulation sans reconstruire la mise en page visuelle depuis zéro.
Transferts de style à partir d’une référence : importez une photo dont vous voulez reproduire la lumière et la qualité tonale, décrivez le nouveau sujet et l’environnement, puis générez. Le modèle reprend les caractéristiques tonales et la direction de la lumière de la référence tout en remplaçant le contenu par ce que vous avez décrit. C’est plus rapide que de reproduire la lumière manuellement en post-production, et le résultat offre une intégration naturelle entre le sujet et l’environnement.
Pour les cas où vous devez rédiger et affiner des prompts complexes avant de lancer la génération, Qwen3.7-Plus sur PicassoIA peut vous aider à construire des descriptions de scène détaillées, à analyser des images de référence pour identifier les éléments à préciser dans votre prompt, et à identifier pourquoi un prompt ne donne pas le résultat attendu.

Essayez-le sur PicassoIA
Qwen Image 2 Pro est un outil ciblé. Il gère mieux que la plupart des alternatives de sa catégorie le texte dans l’image et l’édition à partir d’une image de référence, et il produit des résultats photoréalistes d’une qualité suffisante pour les workflows commerciaux, sans traitement externe à chaque passage.
Les limites sont réelles, surtout en ce qui concerne la longueur des chaînes de texte et la résolution de génération, mais elles sont prévisibles. Une fois que vous les connaissez, vous pouvez travailler autour : gardez les titres courts, prévoyez une étape d’upscaling, désactivez l’expansion automatique du prompt pour les travaux précis. Le contrôle du seed et le prompt négatif offrent une profondeur d’itération suffisante pour obtenir des résultats prêts à l’emploi sans lancer des dizaines de générations.
Si vous produisez des contenus où la typographie doit figurer dans l’image, ou si vous partez d’une photo de référence et avez besoin de changements précis d’arrière-plan ou de style, ce modèle a sa place dans votre workflow.
Essayez Qwen Image 2 Pro sur PicassoIA dès maintenant. Commencez par une courte description de produit et une image de référence de votre bibliothèque, puis observez la tenue du premier passage. Les paramètres sont réduits à l’essentiel et l’interface est immédiate : vous pouvez lancer votre premier test en moins de deux minutes.
Vous pouvez aussi parcourir tous les modèles disponibles sur PicassoIA pour trouver la combinaison d’outils de génération, d’édition et d’upscaling qui convient à votre workflow créatif.