Qwen Image 3.0 : poids open source, API et installation locale

Qwen Image 3.0 n’a aucun poids téléchargeable : il ne fonctionne que via l’API hébergée d’Alibaba Cloud, à environ 0,03 $ par image. Cet article sépare les faits des rumeurs, liste les versions Qwen Image antérieures qui sont ouvertes, présente une installation locale avec Diffusers et explique comment essayer Qwen Image 3 dans le navigateur.

Qwen Image 3.0 : poids open source, API et installation locale
Cristian Da Conceicao
Fondateur de Picasso IA

Si vous avez cherché les poids open source de Qwen Image 3.0, voici la réponse directe : ils n’existent pas. L’équipe Qwen d’Alibaba a annoncé Qwen Image 3.0 le 21 juillet 2026 comme un service hébergé, et aucun dépôt Hugging Face, aucune fiche de modèle, aucun fichier de licence ni aucun rapport technique n’a été publié pour ce modèle. Vous disposez aujourd’hui de trois solutions : appeler le modèle via l’API d’Alibaba Cloud, exécuter une version Qwen Image ouverte antérieure sur votre propre GPU, ou essayer Qwen Image 3 dans le navigateur sur PicassoIA, sans rien installer.

Cette page vous aide à choisir la solution qui vous convient, ce que chacune coûte et comment la mettre en place sans chercher des téléchargements qui n’existent pas. Tous les chiffres ci-dessous proviennent de pages publiques publiées entre août et septembre 2026, et lorsque les sources se contredisent, je le signale.

La réponse courte sur les poids

Le 13 août 2026, une vérification indépendante de Hugging Face et de ModelScope n’a trouvé aucun dépôt Qwen Image 3.0 sous les organisations Qwen ou Tongyi-MAI. La documentation consultée à la fin du mois d’août décrivait toujours le modèle comme accessible uniquement via un accès hébergé Qwen et Alibaba Cloud. En clair, vous ne pouvez pas télécharger Qwen Image 3.0, ni le faire tourner sur votre propre machine.

Ce qu’Alibaba a réellement publié

Qwen Image 3.0 existe en deux niveaux : un modèle standard (qwen-image-3.0) et un modèle Pro (qwen-image-3.0-pro). Un même modèle assure la génération texte vers image et l’édition d’images. Les caractéristiques annoncées sont les suivantes :

  • Longueur du prompt : jusqu’à environ 4,5K tokens par requête
  • Résolution : jusqu’à 2048×2048 pixels
  • Rendu du texte : caractères aussi petits que 10 pixels environ, dans 12 langues
  • Styles : plus de 100 styles intégrés
  • Sortie : plusieurs images par requête

L’accent est mis sur les visuels riches en informations, comme les infographies, les pages de journaux, les fiches d’exercices, les maquettes d’interface et les storyboards, et non seulement sur les belles images.

Ce que « open source » signifie ici

On confond souvent trois choses différentes lorsqu’on écrit « open source » à côté du nom d’un modèle :

  1. Poids ouverts : vous pouvez télécharger les fichiers du modèle et le faire tourner vous-même.
  2. Licence ouverte : les fichiers sont accompagnés d’une autorisation d’usage commercial.
  3. Accès ouvert : n’importe qui peut payer et appeler le modèle via une API.

Qwen Image 3.0 n’offre que le troisième point. Cela a des conséquences concrètes : vous ne pouvez pas faire de fine-tuning, vous ne pouvez pas figer une version sur votre propre serveur, et si Alibaba modifie le prix ou retire un niveau, votre chaîne de traitement change avec lui.

💡 Méfiez-vous des faux téléchargements. Tout site, tout torrent ou tout canal de discussion proposant des « poids de Qwen Image 3.0 » ne vient pas d’Alibaba, car Alibaba n’en a publié aucun. Ce type de fichier sert souvent à diffuser des logiciels malveillants. Restez sur les organisations Qwen officielles sur Hugging Face et ModelScope.

Un mur de pierre usé avec un grand portail en bois ouvert d’un côté et un portail en fer fermé par un cadenas de l’autre

Quelles versions de Qwen Image sont ouvertes

La famille Qwen Image n’est pas fermée dans son ensemble. Plusieurs versions antérieures sont ouvertes, et c’est de là que part toute installation locale.

VersionPoidsLicenceRemarques
Qwen Image (août 2025)OuiApache 2.0MMDiT de 20 milliards de paramètres, axé sur le texte
Qwen Image Edit 2511 (décembre 2025)OuiApache 2.0Variante d’édition
Qwen Image 2512 (décembre 2025)OuiApache 2.0Texte plus net, visages plus réalistes
Qwen Image 2.0 (février 2026)Non à l’annoncen/aLes poids n’étaient pas encore publiés au moment de l’annonce du dépôt
Qwen Image 3.0 et 3.0 Pro (juillet 2026)NonConditions d’utilisation de l’hébergementAPI uniquement
Qwen Image 2.1 (septembre 2026)OuiLicence de rechercheGénérateur de 7B plus encodeur de 8B

Les versions sous Apache 2.0

Les poids originaux de Qwen Image ont été rendus publics le 4 août 2025, sur Hugging Face et ModelScope, sous licence Apache 2.0. Cette licence autorise l’usage commercial, la modification et la redistribution avec peu de contraintes. Les versions de décembre 2025, Qwen Image Edit 2511 et Qwen Image 2512, ont suivi le même schéma, et le dépôt GitHub fournit des extraits Diffusers prêts à l’emploi pour chacune d’elles.

Si votre objectif est un modèle que vous pouvez affiner, héberger sur votre propre serveur ou intégrer dans un produit sans facturation par image, ce sont ces fichiers qu’il faut examiner.

Qwen Image 2.1 et sa licence

Les comparatifs publiés décrivent Qwen Image 2.1 comme une version à poids ouverts, avec un générateur visuel de 7B, un encodeur vision-langage de 8B et une sortie transparente native. Un comparatif la date du 20 septembre 2026. Le hic tient à la licence. Selon les informations disponibles, les éléments publiés utilisent une licence de recherche, et l’usage commercial nécessite un accord distinct avec Qwen.

💡 Lisez la licence sur la page du modèle avant de générer quoi que ce soit pour un client. « Les poids sont téléchargeables » et « le résultat peut être vendu » sont deux questions distinctes.

Comment fonctionne l’API hébergée

Si vous voulez Qwen Image 3.0 lui-même, l’API est la seule porte d’entrée. Elle passe par Alibaba Cloud Model Studio, aussi appelé DashScope dans la documentation de l’API.

Vue en contre-plongée d’un couloir bordé de baies de serveurs noires dans un centre de données silencieux

Accès et noms des modèles

Deux régions comptent. La région Singapour dessert la plupart des utilisateurs hors de Chine continentale, et une région Pékin dessert le marché chinois. Les tokens d’API sont propres à chaque région : un token créé pour l’une ne fonctionnera pas avec l’autre. Des agrégateurs tiers proposent aussi le modèle : OpenRouter propose Qwen Image 3.0 depuis début août 2026 pour environ 0,03 $ par image de 1K.

La procédure de configuration se présente ainsi :

  1. Créez un compte Alibaba Cloud et ouvrez Model Studio dans la région de Singapour.
  2. Activez les modèles de génération d’images que vous comptez utiliser.
  3. Créez un jeton d’API dans la console et stockez-le dans une variable d’environnement.
  4. Appelez qwen-image-3.0 ou qwen-image-3.0-pro avec un prompt et une taille.

Le bureau d’un développeur vu d’en haut avec un ordinateur portable, une carte d’accès manuscrite et une tasse de café

Le coût par image

Tarifs relevés pour la région de Singapour au 31 août 2026 :

ÉlémentPrix
Qwen Image 3.0 standard, par image produite0,03 $
Qwen Image 3.0 Pro, par image produite0,04 $ à 0,075 $
Image source pour l’édition, par image0,003 $
Quota gratuit10 images, valable 90 jours

À ces tarifs, 1 000 images standard coûtent environ 30 $, et 10 000 environ 300 $. Le Pro se situe entre 400 $ et 750 $ pour 10 000 images, selon la taille de sortie. L’édition ajoute quelques dixièmes de centime par image de référence. Les tarifs natifs d’Alibaba Cloud n’étaient pas entièrement documentés dans tous les articles, alors vérifiez la page de facturation avant de bâtir un budget sur ces chiffres.

Une mise à plat avec une calculatrice en laiton, des tickets de caisse et un carnet de colonnes dessinées à la main

Un exemple de requête

Voici la forme générale d’un appel de texte vers image. Considérez-le comme un point de départ et non comme une recette à copier-coller.

curl -X POST "$DASHSCOPE_ENDPOINT" \
  -H "Authorization: Bearer $DASHSCOPE_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-image-3.0",
    "input": {
      "messages": [
        {
          "role": "user",
          "content": [
            { "text": "A chalkboard sign reading OPEN outside a corner cafe, morning light" }
          ]
        }
      ]
    },
    "parameters": { "size": "2048*1152", "n": 1 }
  }'

💡 Vérifiez les détails dans votre propre console. Les noms des champs suivent le modèle DashScope utilisé par les versions précédentes de Qwen Image, mais les articles tiers ne s’accordent pas sur l’adresse exacte du point de terminaison. Copiez l’URL et le schéma de requête affichés dans Model Studio avant de mettre quoi que ce soit en production.

Vue par-dessus l’épaule d’une femme qui tape sur un ordinateur portable dans un espace de coworking lumineux

Les limites de débit ne sont pas officiellement documentées. Des intégrateurs signalent des réponses 429 sous forte charge, alors prévoyez dès le départ un backoff exponentiel plutôt que de relancer immédiatement la requête.

Installation locale avec les poids Qwen ouverts

Comme Qwen Image 3.0 ne peut pas tourner en local, une installation locale implique l’une des versions ouvertes citées plus haut. Qwen Image 2512 est le choix naturel pour un usage général, car il améliore la netteté du texte et le réalisme des visages par rapport à l’original.

Retour à la réalité sur le matériel

Le modèle d’origine compte 20 milliards de paramètres. En bfloat16, cela représente environ 40 Go pour le seul modèle d’image, sans compter l’encodeur de texte. Voici un tableau de planification indicatif :

ConfigurationÀ prévoir
48 Go de mémoire GPU ou plusFonctionne en bfloat16 sans difficulté
Carte grand public de 24 GoNécessite un déchargement sur le CPU ou une version quantifiée, plus lent par image
Carte de 12 à 16 GoPossible uniquement avec une forte quantification, attendez-vous à de longs délais
Pas de GPU dédiéPeu praticable, utilisez plutôt une option hébergée

Les conversions FP8 et GGUF communautaires sont largement utilisées dans ComfyUI pour faire tenir le modèle sur des cartes plus petites. La qualité varie selon la conversion, testez donc vos propres prompts avant de vous engager. Prévoyez aussi un stockage rapide : les fichiers du modèle pèsent plusieurs dizaines de gigaoctets, et le déchargement sur le CPU s’appuie sur la mémoire système, donc 32 Go de RAM constituent un minimum confortable.

Gros plan de mains installant une grande carte graphique dans un emplacement de carte mère

Installer et exécuter avec Diffusers

Le dépôt recommande d’installer Diffusers depuis les sources :

pip install git+https://github.com/huggingface/diffusers
pip install torch accelerate

Si Python signale un paquet manquant pour l’encodeur de texte au chargement du pipeline, installez-le avec pip et relancez le script. Voici ensuite un script minimal, utilisant les poids 2512 :

import torch
from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained(
    "Qwen/Qwen-Image-2512",
    torch_dtype=torch.bfloat16,
)
pipe.enable_model_cpu_offload()

image = pipe(
    prompt="A rainy street market at dusk, a hand-painted sign reading OPEN",
    negative_prompt=" ",
    width=1664,
    height=928,
    num_inference_steps=50,
    true_cfg_scale=4.0,
    generator=torch.Generator(device="cuda").manual_seed(42),
).images[0]

image.save("qwen-test.png")

Remplacez-le par Qwen/Qwen-Image pour exécuter la version originale, ou par Qwen/Qwen-Image-Edit-2511 avec le pipeline d’édition si vous voulez modifier des photos existantes. Le premier lancement télécharge plusieurs dizaines de gigaoctets : démarrez-le avec une connexion stable et un disque disposant de suffisamment d’espace.

Quand le local l’emporte sur l’API

À 0,03 $ par image, la facture d’API reste faible pour la plupart des créateurs. L’auto-hébergement ne devient avantageux que si vous générez des dizaines de milliers d’images par mois avec un GPU qui reste occupé, ou si des règles de confidentialité interdisent d’envoyer les prompts à un tiers. Une carte inactive coûte plus cher que l’API ne le fera jamais.

Macro de trois ventilateurs de GPU noirs et d’un empilement serré d’ailettes en aluminium dans une pièce peu éclairée

Ce que Qwen Image 3.0 fait le mieux

La qualité est la raison pour laquelle les gens veulent la version 3.0 en premier lieu, il vaut donc la peine de voir où elle fait ses preuves.

Un texte lisible dans les images

Des lettres déformées sont la marque classique d’une image générée par IA. Les modèles Qwen ont été conçus pour l’éviter, et la version 3.0 étend ce progrès aux petits caractères : panneaux, étiquettes, menus et légendes restent lisibles. Un prompt du type « une ardoise de café indiquant OPEN » devrait renvoyer exactement ce mot, correctement orthographié.

Quelques habitudes rendent le texte plus propre sur n’importe quel modèle Qwen :

  • Citez les mots exacts. Placez le texte souhaité entre guillemets.
  • Restez court. D’un à trois mots par panneau ou étiquette sont bien plus sûrs qu’un paragraphe.
  • Nommez la surface. La craie sur ardoise, la peinture sur brique et l’encre sur papier ne donnent pas le même rendu.
  • Indiquez l’emplacement. « Au-dessus de la porte » ou « sur le tableau de menu à gauche » supprime les approximations.

Façade d’un café sur une rue pavée avec une ardoise indiquant OPEN

Mises en page denses et édition

Les pages de journaux, les fiches d’exercices, les storyboards et les tableaux de bord sont les cas où la longue fenêtre de prompt de 4,5K tokens prend tout son intérêt. Vous pouvez décrire chaque colonne, chaque légende et chaque encadré dans une seule requête. Le même modèle accepte des images de référence, ce qui permet de restyler ou de corriger une zone d’une photo sans redessiner toute la scène.

💡 Relisez tout. Des évaluateurs préviennent que les mises en page générées peuvent sembler fiables tout en étant fausses. Vérifiez les noms, les chiffres et les dates avant toute publication.

Utiliser Qwen Image 3 sur PicassoIA

Il existe une quatrième solution, qui évite les tokens, les pages de facturation et les cartes graphiques. Qwen Image 3 fonctionne directement sur PicassoIA, et la page du modèle indique qu’il est gratuit à utiliser en ligne.

Étape par étape

  1. Ouvrez la page du modèle Qwen Image 3.
  2. Rédigez votre prompt en phrases simples. Placez entre guillemets le texte que vous voulez voir dans l’image, et gardez-le court.
  3. Choisissez un format. Prenez 16:9 pour les bannières, 9:16 pour les stories, 1:1 pour les publications du fil.
  4. Laissez l’expansion du prompt activée pour les prompts courts, ou désactivez-la si vous voulez un contrôle total.
  5. Lancez la génération et examinez le résultat. Modifiez une chose à la fois, puis relancez.
  6. Figez le seed une fois qu’un résultat vous plaît, afin de pouvoir le reproduire plus tard.

Pour l’édition, importez une photo dans le champ image, décrivez la modification et activez l’option qui correspond à la résolution de l’entrée afin que le résultat conserve sa taille d’origine.

Les réglages qui comptent

RéglageRôle
PromptTexte obligatoire qui décrit l’image ou la modification
FormatNeuf préréglages : 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 2:1 et 1:2
Prompt négatifIndique ce qu’il faut exclure, comme les filigranes ou les doigts en trop
SeedTout entier de 0 à 2147483647 pour des résultats reproductibles
Expansion du promptActivée par défaut, elle réécrit les prompts courts en versions plus riches
Respecter l’image sourceConserve la taille et les proportions d’une photo importée

Besoin de scènes plus chargées ? Essayez Qwen Image 3 Pro, qui gère les compositions denses comportant plusieurs objets distincts. Si vous préférez la lignée à poids ouverts sans installation locale, Qwen Image 2512 et le Qwen Image original sont disponibles, et Qwen Image Edit 2511 gère les modifications de photos. Pour les styles personnalisés, il existe aussi le Qwen Image LoRA Trainer Legacy.

Quelle solution vous convient

Associez votre situation à la bonne option :

Votre situationMeilleure solution
Vous avez besoin des résultats de Qwen Image 3.0 dans votre propre applicationAPI Alibaba Cloud
Vous voulez des fichiers que vous pouvez affiner et hébergerPoids ouverts comme Qwen Image 2512
Vous n’avez pas de GPU et voulez des résultats en quelques minutesPicassoIA dans le navigateur
Vous avez besoin de droits commerciaux sans démarches supplémentairesVersions Apache 2.0 ou conditions de l’hébergement
Vous générez moins de quelques milliers d’images par moisAPI ou PicassoIA, pas de matériel local

Trois erreurs à éviter

  • Chercher un téléchargement. Il n’existe aucun poids officiel de Qwen Image 3.0, et tout ce qui est présenté ainsi est suspect.
  • Ignorer la licence. Qwen Image 2.1 utilise une licence de recherche, alors que les versions antérieures sont sous Apache 2.0.
  • Budgéter avec le prix standard. Les résultats du niveau Pro coûtent davantage, jusqu’à 0,075 $ par image.

Essayez les modèles Qwen sur Picasso IA dès aujourd’hui

Le bilan est court : Qwen Image 3.0 se trouve derrière une API, les poids ouverts appartiennent aux versions plus anciennes, et le moyen le plus rapide de voir ce que la famille sait faire consiste à saisir un prompt et à regarder le résultat. Ouvrez Qwen Image 3 sur Picasso IA, rédigez un prompt avec une courte enseigne ou étiquette, et comparez le résultat avec Qwen Image 2512. Lancez le même prompt sur les deux, modifiez un seul détail, et gardez la version qui vous plaît le plus.

Une créative souriante dans un studio ensoleillé tenant une photographie fraîchement imprimée devant un mur de tirages

Parcourez la liste complète des modèles sur picassoia.com/en/all-models pour trouver celui qui convient à vos affiches, photos de produits, maquettes et retouches, puis lancez votre première génération dès aujourd’hui.

Partager cet article

Choisissez votre langue