Qwen Image 3.0 के डाउनलोड करने योग्य वेट्स नहीं हैं: यह केवल Alibaba Cloud के होस्टेड API के ज़रिए चलता है, प्रति इमेज लगभग $0.03 में। यह लेख तथ्य और अफ़वाह को अलग करता है, बताता है कि Qwen Image के कौन-से पिछले रिलीज़ ओपन हैं, Diffusers वाला लोकल सेटअप दिखाता है और समझाता है कि ब्राउज़र में Qwen Image 3 कैसे आज़माएँ।
अगर आपने Qwen Image 3.0 open source weights खोजा है, तो सीधा जवाब यह है: ये मौजूद नहीं हैं। Alibaba की Qwen टीम ने 21 जुलाई 2026 को Qwen Image 3.0 को एक होस्टेड सेवा के रूप में घोषित किया था, और इसके लिए कोई Hugging Face रिपॉज़िटरी, मॉडल कार्ड, लाइसेंस फ़ाइल या तकनीकी रिपोर्ट सामने नहीं आई है। आज आपके पास तीन रास्ते हैं: Alibaba Cloud के API से मॉडल को कॉल करना, अपने GPU पर कोई पिछला ओपन Qwen Image रिलीज़ चलाना, या PicassoIA पर Qwen Image 3 को ब्राउज़र में आज़माना, जिसके लिए कुछ भी इंस्टॉल नहीं करना पड़ता।
यह पेज बताता है कि कौन-सा रास्ता किसके लिए सही है, हर एक की लागत क्या है और असली न होने वाले डाउनलोड के पीछे भागे बिना सेटअप कैसे करें। नीचे दिए हर आँकड़े अगस्त से सितंबर 2026 के बीच प्रकाशित सार्वजनिक पेजों से लिए गए हैं, और जहाँ स्रोत आपस में असहमत हैं, वहाँ मैं यह साफ़ बताता हूँ।
वेट्स के बारे में सीधा जवाब
13 अगस्त 2026 को Hugging Face और ModelScope की एक स्वतंत्र जाँच में Qwen या Tongyi-MAI संगठनों के तहत कोई Qwen Image 3.0 रिपॉज़िटरी नहीं मिली। अगस्त के अंत में देखे गए दस्तावेज़ों में भी मॉडल को केवल होस्टेड Qwen और Alibaba Cloud एक्सेस के ज़रिए उपलब्ध बताया गया था। सीधे शब्दों में, आप Qwen Image 3.0 डाउनलोड नहीं कर सकते, और इसे अपनी मशीन पर नहीं चला सकते।
Alibaba ने असल में क्या जारी किया है
Qwen Image 3.0 दो टियर में आता है: एक स्टैंडर्ड मॉडल (qwen-image-3.0) और एक Pro मॉडल (qwen-image-3.0-pro)। एक ही मॉडल टेक्स्ट-टू-इमेज जनरेशन और इमेज एडिटिंग दोनों संभालता है। रिपोर्ट किए गए स्पेक इस तरह दिखते हैं:
प्रॉम्प्ट की लंबाई: प्रति अनुरोध लगभग 4.5K टोकन तक
रिज़ॉल्यूशन: 2048×2048 पिक्सल तक
टेक्स्ट रेंडरिंग: लगभग 10 पिक्सल जितने छोटे अक्षर, 12 भाषाओं में
स्टाइल: 100 से ज़्यादा बिल्ट-इन लुक
आउटपुट: प्रति अनुरोध कई इमेज
इसका फ़ोकस सूचना-घनी विज़ुअल्स पर है, जैसे इन्फ़ोग्राफ़िक, अख़बार के पन्ने, वर्कशीट, UI मॉकअप और स्टोरीबोर्ड, न कि सिर्फ़ सुंदर तस्वीरें।
यहाँ "ओपन-सोर्स" का मतलब क्या है
जब लोग किसी मॉडल के नाम के आगे "open source" लिखते हैं, तो वे तीन अलग-अलग चीज़ें मिला देते हैं:
ओपन वेट्स: आप मॉडल फ़ाइलें डाउनलोड करके खुद चला सकते हैं।
ओपन लाइसेंस: फ़ाइलों के साथ कमर्शियल उपयोग की अनुमति आती है।
ओपन एक्सेस: कोई भी भुगतान करके API के ज़रिए मॉडल कॉल कर सकता है।
Qwen Image 3.0 केवल तीसरी चीज़ देता है। व्यवहार में इसका असर बड़ा है: आप इसे फ़ाइन-ट्यून नहीं कर सकते, अपने सर्वर पर कोई वर्ज़न पिन नहीं कर सकते, और अगर Alibaba कीमत बदले या कोई टियर बंद करे, तो आपकी पाइपलाइन भी उसी के साथ बदल जाएगी।
💡 नकली डाउनलोड से सावधान रहें। कोई भी वेबसाइट, टोरेंट या चैट चैनल जो "Qwen Image 3.0 weights" की पेशकश करता है, वह Alibaba का नहीं है, क्योंकि Alibaba ने कोई वेट्स प्रकाशित नहीं किए हैं। ऐसी फ़ाइलें मैलवेयर फैलाने का आम तरीका हैं। Hugging Face और ModelScope पर केवल आधिकारिक Qwen संगठनों से ही डाउनलोड करें।
कौन-से Qwen Image वर्ज़न ओपन हैं
Qwen Image परिवार पूरी तरह बंद नहीं है। कई पिछले रिलीज़ ओपन हैं, और हर लोकल सेटअप वहीं से शुरू होता है।
रिलीज़
वेट्स
लाइसेंस
नोट्स
Qwen Image (अगस्त 2025)
हाँ
Apache 2.0
20B पैरामीटर MMDiT, टेक्स्ट पर केंद्रित
Qwen Image Edit 2511 (दिसंबर 2025)
हाँ
Apache 2.0
एडिटिंग वेरिएंट
Qwen Image 2512 (दिसंबर 2025)
हाँ
Apache 2.0
बेहतर टेक्स्ट शार्पनेस, ज़्यादा यथार्थवादी चेहरे
Qwen Image 2.0 (फ़रवरी 2026)
घोषणा के समय नहीं
लागू नहीं
जब रिपॉज़िटरी की ख़बर पोस्ट हुई, तब वेट्स जारी नहीं हुए थे
Qwen Image 3.0 और 3.0 Pro (जुलाई 2026)
नहीं
होस्टेड सेवा की शर्तें
केवल API
Qwen Image 2.1 (सितंबर 2026)
हाँ
Research license
7B जनरेटर और 8B एन्कोडर
Apache 2.0 रिलीज़
मूल Qwen Image वेट्स 4 अगस्त 2025 को Hugging Face और ModelScope दोनों पर Apache 2.0 के तहत सार्वजनिक हुए थे। यह लाइसेंस कमर्शियल उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है, और उस पर बहुत कम शर्तें लागू होती हैं। दिसंबर 2025 के रिलीज़, Qwen Image Edit 2511 और Qwen Image 2512, भी उसी पैटर्न पर चले, और GitHub रिपॉज़िटरी हर एक के लिए तैयार Diffusers स्निपेट देती है।
अगर आपका लक्ष्य ऐसा मॉडल है जिसे आप फ़ाइन-ट्यून कर सकें, अपने सर्वर पर होस्ट कर सकें या प्रति इमेज बिल के बिना किसी प्रोडक्ट में शामिल कर सकें, तो ये फ़ाइलें देखें।
Qwen Image 2.1 और उसका लाइसेंस
प्रकाशित तुलनाएँ Qwen Image 2.1 को एक ओपन-वेट्स रिलीज़ बताती हैं, जिसमें 7B विज़ुअल जनरेटर, 8B विज़न-लैंग्वेज एन्कोडर और नेटिव ट्रांसपेरेंट आउटपुट है। एक तुलना इसकी तारीख 20 सितंबर 2026 बताती है। पेच लाइसेंस में है। रिपोर्ट्स के अनुसार जारी सामग्री पर research license लागू है, और कमर्शियल उपयोग के लिए Qwen के साथ अलग समझौता चाहिए।
💡 किसी क्लाइंट के लिए कुछ भी जनरेट करने से पहले मॉडल पेज पर लाइसेंस पढ़ें। "वेट्स डाउनलोड किए जा सकते हैं" और "आउटपुट बेचना मुफ़्त है" दो अलग सवाल हैं।
होस्टेड API कैसे काम करता है
अगर आपको Qwen Image 3.0 ही चाहिए, तो API ही एकमात्र दरवाज़ा है। यह Alibaba Cloud Model Studio के ज़रिए चलता है, जिसे API दस्तावेज़ में DashScope भी कहा गया है।
एक्सेस और मॉडल के नाम
दो रीजन मायने रखते हैं। Singapore रीजन मुख्य भूमि चीन के बाहर के ज़्यादातर उपयोगकर्ताओं को सेवा देता है, और Beijing रीजन चीनी बाज़ार के लिए है। API टोकन रीजन-विशिष्ट होते हैं, इसलिए एक रीजन के लिए बना टोकन दूसरे पर काम नहीं करेगा। थर्ड-पार्टी एग्रीगेटर भी इस मॉडल की सूची देते हैं: OpenRouter अगस्त 2026 की शुरुआत से Qwen Image 3.0 लगभग $0.03 प्रति 1K इमेज पर दे रहा है।
सेटअप का प्रवाह इस तरह है:
Alibaba Cloud अकाउंट बनाएँ और Singapore रीजन में Model Studio खोलें।
जिन इमेज जनरेशन मॉडलों का उपयोग करना है, उन्हें एक्टिवेट करें।
कंसोल में API टोकन बनाएँ और उसे एक एनवायरनमेंट वेरिएबल में सहेजें।
एक प्रॉम्प्ट और साइज़ के साथ qwen-image-3.0 या qwen-image-3.0-pro को कॉल करें।
प्रति इमेज लागत
31 अगस्त 2026 तक Singapore रीजन के लिए रिपोर्ट की गई कीमतें:
आइटम
कीमत
Qwen Image 3.0 स्टैंडर्ड, प्रति आउटपुट इमेज
$0.03
Qwen Image 3.0 Pro, प्रति आउटपुट इमेज
$0.04 से $0.075
एडिटिंग के लिए इनपुट इमेज, प्रति इमेज
$0.003
मुफ़्त कोटा
10 इमेज, 90 दिन तक वैध
इन दरों पर 1,000 स्टैंडर्ड इमेज की लागत लगभग $30 है, और 10,000 की लगभग $300। Pro के लिए 10,000 इमेज $400 से $750 के बीच आती हैं, आउटपुट साइज़ के हिसाब से। एडिटिंग में हर रेफ़रेंस इमेज पर कुछ दशमलव सेंट जुड़ते हैं। हर लेख में Alibaba Cloud की मूल दरें पूरी तरह दर्ज नहीं थीं, इसलिए इन आँकड़ों के आधार पर बजट बनाने से पहले बिलिंग पेज ज़रूर जाँच लें।
एक नमूना अनुरोध
टेक्स्ट-टू-इमेज कॉल का सामान्य ढाँचा यह है। इसे कॉपी-पेस्ट रेसिपी नहीं, शुरुआती बिंदु मानें।
💡 अपने कंसोल में विवरण की पुष्टि करें। फ़ील्ड नाम उसी DashScope पैटर्न का पालन करते हैं जो पिछले Qwen Image मॉडल इस्तेमाल करते थे, लेकिन थर्ड-पार्टी सेटअप लेख एंडपॉइंट होस्ट के बारे में अलग-अलग बातें कहते हैं। कुछ भी शिप करने से पहले Model Studio में दिखाए गए URL और रिक्वेस्ट स्कीमा को कॉपी करें।
रेट लिमिट्स आधिकारिक रूप से दस्तावेज़ित नहीं हैं। इंटीग्रेटर्स भारी लोड में 429 रिस्पॉन्स की रिपोर्ट करते हैं, इसलिए पहले दिन से एक्सपोनेंशियल बैकऑफ़ लगाएँ, तुरंत दोबारा कोशिश न करें।
ओपन Qwen वेट्स के साथ लोकल सेटअप
चूँकि Qwen Image 3.0 लोकली नहीं चल सकता, लोकल सेटअप का मतलब ऊपर दिए ओपन रिलीज़ में से कोई एक है। सामान्य काम के लिए Qwen Image 2512 स्वाभाविक चुनाव है, क्योंकि यह मूल की तुलना में टेक्स्ट शार्पनेस और चेहरे के यथार्थवाद में बेहतर है।
हार्डवेयर की असलियत
मूल मॉडल में 20B पैरामीटर हैं। bfloat16 में अकेले इमेज मॉडल के लिए लगभग 40 GB लगते हैं, टेक्स्ट एन्कोडर गिनने से पहले। यह एक मोटी योजना तालिका है:
सेटअप
क्या उम्मीद करें
48 GB या उससे ज़्यादा GPU मेमोरी
bfloat16 में आराम से चलता है
24 GB का कंज़्यूमर कार्ड
CPU ऑफ़लोड या क्वांटाइज़्ड बिल्ड चाहिए, प्रति इमेज धीमा
12 से 16 GB का कार्ड
केवल भारी क्वांटाइज़ेशन के साथ संभव, लंबे इंतज़ार की उम्मीद रखें
कोई समर्पित GPU नहीं
व्यावहारिक नहीं, होस्टेड विकल्प इस्तेमाल करें
मॉडल को छोटे कार्ड पर फिट करने के लिए ComfyUI में समुदाय के FP8 और GGUF कन्वर्ज़न व्यापक रूप से इस्तेमाल होते हैं। क्वालिटी हर कन्वर्ज़न के हिसाब से अलग होती है, इसलिए किसी एक पर टिकने से पहले अपने प्रॉम्प्ट आज़माएँ। तेज़ स्टोरेज भी ज़रूरी है: मॉडल फ़ाइलें दसियों गीगाबाइट की होती हैं, और CPU ऑफ़लोड सिस्टम मेमोरी पर निर्भर करता है, इसलिए 32 GB RAM एक आरामदायक न्यूनतम है।
Diffusers के साथ इंस्टॉल और चलाना
रिपॉज़िटरी सोर्स से Diffusers इंस्टॉल करने की सलाह देती है:
अगर पाइपलाइन लोड होते समय Python टेक्स्ट एन्कोडर के लिए कोई पैकेज गायब बताए, तो उसे pip से इंस्टॉल करें और स्क्रिप्ट फिर से चलाएँ। फिर 2512 वेट्स का उपयोग करते हुए एक न्यूनतम स्क्रिप्ट:
import torch
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained(
"Qwen/Qwen-Image-2512",
torch_dtype=torch.bfloat16,
)
pipe.enable_model_cpu_offload()
image = pipe(
prompt="A rainy street market at dusk, a hand-painted sign reading OPEN",
negative_prompt=" ",
width=1664,
height=928,
num_inference_steps=50,
true_cfg_scale=4.0,
generator=torch.Generator(device="cuda").manual_seed(42),
).images[0]
image.save("qwen-test.png")
मूल रिलीज़ चलाने के लिए Qwen/Qwen-Image लगाएँ, या अगर आप मौजूदा फ़ोटो बदलना चाहते हैं तो एडिटिंग पाइपलाइन के साथ Qwen/Qwen-Image-Edit-2511। पहली बार चलाने पर दसियों गीगाबाइट डाउनलोड होते हैं, इसलिए इसे स्थिर कनेक्शन और काफ़ी जगह वाली ड्राइव पर शुरू करें।
लोकल कब API से बेहतर है
$0.03 प्रति इमेज पर API का बिल ज़्यादातर क्रिएटर्स के लिए छोटा रहता है। सेल्फ़-होस्टिंग तभी फ़ायदेमंद होती है जब आप हर महीने दसियों हज़ार इमेज बनाते हों और GPU लगातार व्यस्त रहता हो, या जब प्राइवेसी नियम किसी तीसरे पक्ष को प्रॉम्प्ट भेजने पर रोक लगाते हों। खाली पड़ा कार्ड API से हमेशा ज़्यादा खर्च करवाता है।
Qwen Image 3.0 किसमें सबसे अच्छा है
लोग वर्ज़न 3.0 की ओर मुख्य रूप से क्वालिटी की वजह से जाते हैं, इसलिए देखना उचित है कि यह कहाँ अपनी जगह बनाता है।
इमेज में पढ़ने योग्य टेक्स्ट
बिगड़े हुए अक्षर AI इमेज की सबसे पुरानी पहचान हैं। Qwen मॉडल इसी से बचने के लिए बने थे, और वर्ज़न 3.0 इसे छोटे टाइप तक ले जाता है: साइनबोर्ड, लेबल, मेन्यू और कैप्शन जो पढ़ने योग्य रहते हैं। "a chalkboard sign reading OPEN" जैसा प्रॉम्प्ट ठीक वही शब्द, सही स्पेलिंग के साथ लौटाना चाहिए।
कुछ आदतें किसी भी Qwen मॉडल पर टेक्स्ट को साफ़ बनाती हैं:
सटीक शब्द उद्धरण चिह्नों में लिखें। जो टेक्स्ट आप चाहते हैं, उसे कोट्स के अंदर रखें।
छोटा रखें। हर साइन या लेबल पर एक से तीन शब्द, किसी पैराग्राफ़ से कहीं ज़्यादा सुरक्षित है।
सतह का नाम लें। स्लेट पर चॉक, ईंट पर पेंट और कागज़ पर स्याही, सब अलग तरह से रेंडर होते हैं।
बताएँ कि वह कहाँ है। "दरवाज़े के ऊपर" या "बाईं मेन्यू बोर्ड पर" लिखने से अंदाज़ा लगाने की ज़रूरत नहीं रहती।
घने लेआउट और एडिटिंग
अख़बार के पन्ने, वर्कशीट, स्टोरीबोर्ड और डैशबोर्ड वहाँ हैं जहाँ 4.5K टोकन वाली लंबी प्रॉम्प्ट विंडो फ़ायदेमंद होती है। आप एक ही अनुरोध में हर कॉलम, कैप्शन और पैनल का वर्णन कर सकते हैं। यही मॉडल रेफ़रेंस इमेज भी स्वीकार करता है, इसलिए आप पूरा दृश्य दोबारा बनाए बिना फ़ोटो के एक हिस्से को रीस्टाइल या ठीक कर सकते हैं।
💡 हर चीज़ की प्रूफ़रीडिंग करें। समीक्षकों की चेतावनी है कि जनरेट किए गए लेआउट आधिकारिक दिख सकते हैं, जबकि वे गलत भी हो सकते हैं। कुछ भी सार्वजनिक करने से पहले नाम, संख्याएँ और तारीखें जाँच लें।
PicassoIA पर Qwen Image 3 का उपयोग करें
एक चौथा रास्ता है जो टोकन, बिलिंग पेज और ग्राफ़िक्स कार्ड, तीनों को छोड़ता है। Qwen Image 3 सीधे PicassoIA पर चलता है, और मॉडल पेज इसे ऑनलाइन मुफ़्त में उपयोग के लिए सूचीबद्ध करता है।
अपना प्रॉम्प्ट सामान्य वाक्यों में लिखें। इमेज में जो भी टेक्स्ट चाहिए उसे कोट्स में रखें, और उसे छोटा रखें।
आस्पेक्ट रेशियो चुनें। बैनर के लिए 16:9, स्टोरी के लिए 9:16, फ़ीड पोस्ट के लिए 1:1 चुनें।
छोटे प्रॉम्प्ट के लिए प्रॉम्प्ट एक्सपैंशन चालू रखें, या पूरा नियंत्रण चाहिए तो बंद करें।
जनरेट दबाएँ और परिणाम देखें। एक बार में एक चीज़ बदलें, फिर दोबारा चलाएँ।
कोई परिणाम पसंद आ जाए तो सीड लॉक करें, ताकि बाद में उसे दोबारा बना सकें।
एडिटिंग के लिए, इमेज फ़ील्ड में फ़ोटो अपलोड करें, बदलाव बताएँ, और ऐसा विकल्प चालू करें जो इनपुट रिज़ॉल्यूशन से मेल खाए, ताकि आउटपुट अपना मूल साइज़ रखे।
ज़रूरी सेटिंग्स
सेटिंग
वह क्या करती है
प्रॉम्प्ट
ज़रूरी टेक्स्ट जो इमेज या एडिट का वर्णन करता है
आस्पेक्ट रेशियो
नौ प्रीसेट: 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 2:1 और 1:2
नेगेटिव प्रॉम्प्ट
बताता है क्या बाहर रखना है, जैसे वॉटरमार्क या extra fingers
सीड
दोहराए जा सकने वाले परिणामों के लिए 0 से 2147483647 तक कोई भी पूर्णांक
प्रॉम्प्ट एक्सपैंशन
डिफ़ॉल्ट रूप से चालू, छोटे प्रॉम्प्ट को ज़्यादा समृद्ध बनाता है
आपको ऐसी फ़ाइलें चाहिए जिन्हें आप फ़ाइन-ट्यून और होस्ट कर सकें
Qwen Image 2512 जैसे ओपन वेट्स
आपके पास GPU नहीं है और आपको मिनटों में परिणाम चाहिए
ब्राउज़र में PicassoIA
आपको बिना अतिरिक्त कागज़ी कार्रवाई के कमर्शियल अधिकार चाहिए
Apache 2.0 रिलीज़ या होस्टेड शर्तें
आप हर महीने कुछ हज़ार से कम इमेज बनाते हैं
API या PicassoIA, लोकल हार्डवेयर नहीं
तीन गलतियाँ जिनसे बचें
डाउनलोड खोजना। Qwen Image 3.0 के आधिकारिक वेट्स मौजूद नहीं हैं, और उस नाम से मिलने वाली किसी भी चीज़ पर शक करें।
लाइसेंस छोड़ना। Qwen Image 2.1 research license इस्तेमाल करता है, जबकि पुराने रिलीज़ Apache 2.0 पर हैं।
स्टैंडर्ड कीमत से बजट बनाना। Pro टियर का आउटपुट ज़्यादा महँगा है, प्रति इमेज $0.075 तक।
आज ही Picasso IA पर Qwen Images आज़माएँ
ईमानदार सार छोटा है: Qwen Image 3.0 एक API के पीछे है, ओपन वेट्स पिछले रिलीज़ के हैं, और इस परिवार की क्षमता देखने का सबसे तेज़ तरीका है एक प्रॉम्प्ट लिखकर परिणाम देखना। Picasso IA पर Qwen Image 3 खोलें, उसमें एक छोटा साइनबोर्ड या लेबल वाला प्रॉम्प्ट लिखें, और आउटपुट की तुलना Qwen Image 2512 से करें। दोनों पर एक ही प्रॉम्प्ट चलाएँ, एक विवरण बदलें, और जो संस्करण आपको बेहतर लगे उसे रखें।
पोस्टर, प्रोडक्ट शॉट, मॉकअप और फ़ोटो एडिट के लिए सही विकल्प खोजने हेतु picassoia.com/en/all-models पर पूरी मॉडल सूची देखें, फिर आज ही अपनी पहली जनरेशन शुरू करें।