गणित और जादू के बीच कहीं, एक डिफ़्यूज़न मॉडल पूरी तरह रैंडम नॉइज़ से भरी स्क्रीन लेता है और धीरे-धीरे उसे एक फ़ोटोरियलिस्टिक चेहरे, रेनेसां शैली की ऑयल पेंटिंग या गोल्डन आवर में एक शहर के दृश्य में तराशता है। अगर आपने कभी AI इमेज जनरेटर में एक वाक्य लिखा है और कुछ बनते देखा है, तो आपने डिफ़्यूज़न मॉडल को काम करते देखा है। लेकिन उस प्रक्रिया के अंदर असल में क्या होता है? जब आप उसके दो चरण देख लेते हैं, तो जवाब आश्चर्यजनक रूप से तर्कसंगत लगता है।
डिफ़्यूज़न मॉडल के पीछे का विचार
डिफ़्यूज़न मॉडल नॉइज़ हटाने के लिए प्रशिक्षित होता है। पूरी मूल अवधारणा बस यही है। प्रशिक्षण के दौरान मॉडल को लाखों इमेज दिखाई जाती हैं, जिनमें बढ़ती मात्रा में रैंडम नॉइज़ जोड़ा गया होता है। वह कदम-दर-कदम यह क्षमता विकसित करता है कि नॉइज़ जुड़ने से पहले मूल इमेज कैसी दिखती थी। प्रशिक्षण के बाद प्रक्रिया उलटी चलती है: आप पूरी तरह नॉइज़ से शुरू करते हैं, और मॉडल अपने आंतरिक किए गए चरणों में पीछे की ओर चलता है, हर चरण पर नॉइज़ हटाते हुए, जब तक एक सुसंगत इमेज सामने न आ जाए।
एक अजीब किस्म की रचनात्मकता
यह सुनने में अजीब लगता है कि इसे "रचनात्मकता" कहा जाए। मॉडल किसी इंसानी कलाकार की तरह शून्य से कुछ नहीं पेंट कर रहा होता। इसके बजाय वह उस आंतरिक नक्शे में से एक रास्ता चुनता है जिसमें यह दर्ज है कि अलग-अलग स्तर की विकृति पर असली इमेज कैसी दिखती हैं, और अराजकता से स्पष्टता की ओर बढ़ता है। उस रास्ते पर मंज़िल, जिसे आपका टेक्स्ट प्रॉम्प्ट आकार देता है, तय करती है कि अंत में आपको क्या दिखेगा।
इसीलिए नतीजे इतने विविध और स्वाभाविक लगते हैं। मॉडल स्टोर की गई इमेज नहीं निकालता और न ही टुकड़ों को जोड़ता है। वह डीनॉइज़िंग प्रक्रिया के हर चरण पर यह मानकर चलते हुए कुछ नया बनाता है कि असली इमेज को वहाँ कैसा दिखना चाहिए।
नॉइज़ ही शुरुआती बिंदु क्यों है
नॉइज़ से शुरू करने का फ़ैसला सोच-समझकर लिया गया है। नॉइज़ गणितीय रूप से अच्छी तरह परिभाषित होता है, खासकर गॉसियन नॉइज़, जिसमें पिक्सल मान एक बेल-कर्व वितरण का पालन करते हैं। यही गणितीय सटीकता मॉडल को कड़ाई से प्रशिक्षित होने देती है। उसने लाखों इमेज के हर स्तर की विकृति वाले नॉइज़ संस्करण देखे हैं, इसलिए वह किसी भी चरण पर बताने में सक्षम है कि क्या हटाया जाना चाहिए।
Note: गॉसियन नॉइज़ बिल्कुल TV स्टैटिक जैसा दिखता है। हर पिक्सल सामान्य वितरण से खींचा गया एक रैंडम मान होता है। अधिकतम नॉइज़ स्तर पर, मूल इमेज आपके सामने दिखने वाली चीज़ में कोई जानकारी नहीं जोड़ती।

फ़ॉरवर्ड डिफ़्यूज़न: इमेज से नॉइज़ तक
प्रशिक्षण चरण इमेज को व्यवस्थित रूप से नष्ट करने से शुरू होता है। इसे फ़ॉरवर्ड डिफ़्यूज़न कहते हैं, और यह हर टाइमस्टेप पर इमेज में गॉसियन नॉइज़ की एक छोटी, गणितीय रूप से सटीक मात्रा जोड़कर काम करता है। सैकड़ों टाइमस्टेप के बाद मूल इमेज पूरी तरह अपरिचित हो जाती है। बचता है सिर्फ़ शुद्ध स्टैटिक, जो बिना किसी इमेज के रैंडमली बनाए गए नॉइज़ से अलग नहीं पहचाना जा सकता।
नॉइज़ जोड़ना, कदम-दर-कदम
इसे ऐसे समझें जैसे किसी फ़ोटो पर धीरे-धीरे और अधिक अपारदर्शी ट्रेसिंग पेपर की परतें रखना। एक परत के बाद फ़ोटो अब भी ज़्यादातर दिखती है। दस परतों के बाद वह धुंधली और फीकी हो जाती है। एक हज़ार परतों के बाद आपको फ़ोटो बिल्कुल नहीं दिखती। फ़ॉरवर्ड डिफ़्यूज़न ठीक यही करता है, बस पिक्सल-स्तर के नॉइज़ के साथ, गणितीय रूप से नियंत्रित और पूर्वानुमेय वृद्धि में।

केंद्रीय अंतर्दृष्टि यह है कि हर नॉइज़ वाला संस्करण अपने टाइमस्टेप लेबल से जोड़ा जाता है। मॉडल को दिखाया जाता है, "यह इमेज 1000 में से चरण 200 पर ऐसी दिखती है," और "यह 1000 में से चरण 800 पर ऐसी दिखती है।" प्रशिक्षण सेट की हर इमेज के लिए हर एक चरण एक लेबल वाला प्रशिक्षण उदाहरण बन जाता है। इस तरह पहले से मौजूद इमेज से एक विशाल, समृद्ध संरचना वाला डेटासेट बन जाता है।
नॉइज़ शेड्यूल कैसा दिखता है
| टाइमस्टेप | नॉइज़ स्तर | इमेज की दृश्यता |
|---|
| 0 | कोई नहीं | मूल इमेज बिल्कुल साफ़ |
| 100 | कम | हल्की दानेदार |
| 400 | मध्यम | धुंधली, किनारे दिखते हुए |
| 700 | अधिक | सिर्फ़ धुंधले आकार |
| 1000 | अधिकतम | शुद्ध गॉसियन नॉइज़ |
नॉइज़ किस दर से जोड़ा जाता है, यह नॉइज़ शेड्यूल कहलाने वाली चीज़ तय करती है। अलग-अलग शेड्यूल, जैसे लीनियर, कोसाइन या सिग्मॉइड, इस बात को प्रभावित करते हैं कि मॉडल आखिर में कितनी अच्छी इमेज बना सकता है। ज़्यादातर आधुनिक मॉडल कोसाइन शेड्यूलिंग इस्तेमाल करते हैं, जो सिरों पर नॉइज़ धीरे जोड़ती है और बीच में तेज़, जिससे अंतिम आउटपुट बेहतर दिखते हैं।
रिवर्स डिफ़्यूज़न: नॉइज़ से इमेज तक
एक बार मॉडल ने लाखों इमेज के हर नॉइज़ स्तर को आत्मसात कर लिया, तो आप प्रक्रिया उलट देते हैं। आप उसे शुद्ध नॉइज़ देते हैं और पूछते हैं कि असली इमेज के करीब पहुँचने के लिए कौन-सा नॉइज़ हटाना चाहिए। वह थोड़ा हटाता है। आप फिर पूछते हैं। वह थोड़ा और हटाता है। चुने गए सैम्पलर के आधार पर 20 से 1000 ऐसे डीनॉइज़िंग चरणों के बाद, एक असली-सी दिखने वाली इमेज सामने आ जाती है।
डीनॉइज़िंग न्यूरल नेटवर्क
डिफ़्यूज़न मॉडल के अंदर का न्यूरल नेटवर्क इमेज को सीधे नहीं बनाता। वह नॉइज़ को ही प्रेडिक्ट करता है, यानी हर चरण पर कौन-सा नॉइज़ घटाया जाना चाहिए। असली काम करने वाला हिस्सा आम तौर पर U-Net आर्किटेक्चर होता है: एक न्यूरल नेटवर्क जिसका आकार अक्षर U जैसा होता है, जिसमें एक एन्कोडर पथ होता है जो नॉइज़ वाली इमेज को अमूर्त प्रतिनिधित्व में संपीड़ित करता है, और एक डिकोडर पथ होता है जो साफ़ प्रेडिक्शन को दोबारा बनाता है। प्रेडिक्ट किया गया नॉइज़ घटाने के बाद जो बचता है, उसी से इमेज उभरती है।

कितने चरण लगते हैं?
मूल DDPM (Denoising Diffusion Probabilistic Model) पेपर को 1000 डीनॉइज़िंग चरण चाहिए थे, जिससे जनरेशन बेहद धीमी हो जाती थी। आधुनिक सैम्पलर जैसे DDIM (Denoising Diffusion Implicit Models), DPM++ और Euler डीनॉइज़िंग प्रक्रिया में बड़े, ज़्यादा समझदार कदम उठाकर सिर्फ़ 20 से 50 चरणों में उच्च-गुणवत्ता वाली इमेज बना सकते हैं। यही वजह है कि शुरुआती इम्प्लीमेंटेशन की तुलना में आज के AI इमेज टूल लगभग तुरंत काम करते लगते हैं।
Note: सैम्पलर एक अलग एल्गोरिदम है जो प्रशिक्षित मॉडल के ऊपर बैठता है। सैम्पलर बदलने से मॉडल ने जो आत्मसात किया है वह नहीं बदलता। यह सिर्फ़ इस बात को बदलता है कि मॉडल के प्रेडिक्शन नॉइज़ से इमेज तक जाने के लिए कैसे इस्तेमाल होते हैं। अलग-अलग सैम्पलर अलग ज़रूरतों के लिए ठीक हैं: DDIM तेज़ और स्थिर है, DPM++ ज़्यादा चरणों के साथ बेहतर गुणवत्ता देता है, Euler गति और सटीकता का अच्छा संतुलन रखता है।
लेटेंट स्पेस के अंदर
हाई रिज़ॉल्यूशन पर कच्चे पिक्सल मानों पर सीधे डिफ़्यूज़न चलाना बेहद धीमा और कम्प्यूटेशनल रूप से महँगा होगा। 512x512 इमेज में हर डीनॉइज़िंग चरण पर प्रोसेस करने के लिए 786,000 से ज़्यादा अलग-अलग पिक्सल मान होते हैं। आधुनिक डिफ़्यूज़न मॉडल इसे एक अहम दक्षता ट्रिक से हल करते हैं: वे डीनॉइज़िंग को पिक्सल स्पेस के बजाय संपीड़ित प्रतिनिधित्व में करते हैं, जिसे लेटेंट स्पेस कहते हैं।
एन्कोडर और डिकोडर
डिफ़्यूज़न शुरू होने से पहले, एन्कोडर नाम का एक अलग न्यूरल नेटवर्क इमेज को मानों की बहुत छोटी ग्रिड में संपीड़ित कर देता है। 512x512 पिक्सल की इमेज आम तौर पर 64x64 लेटेंट प्रतिनिधित्व बन जाती है, यानी संपीड़न अनुपात 64। सारी डीनॉइज़िंग इस छोटे आकार पर होती है, जो काफ़ी तेज़ है। जब डीनॉइज़िंग पूरी हो जाती है, तो डिकोडर नाम का दूसरा नेटवर्क लेटेंट प्रतिनिधित्व को वापस पूरे रिज़ॉल्यूशन की इमेज में फैलाता है।

एन्कोडर और डिकोडर मिलकर एक Variational Autoencoder (VAE) बनाते हैं। वह लेटेंट स्पेस जो यह बनाता है, वह मनमाना संपीड़न नहीं है; वह एक संरचित, जानकारी से भरपूर प्रतिनिधित्व है, जो इमेज की सबसे अहम विज़ुअल विशेषताओं को बचाए रखता है और जो अनावश्यक है उसे हटा देता है। इसे फ़िल्म नेगेटिव की तरह समझें: एक पूरे रिज़ॉल्यूशन की फ़ोटो की सारी जानकारी एक पतली, छोटी सामग्री की पट्टी पर संपीड़ित।
लेटेंट स्पेस ने सब कुछ क्यों बदल दिया
इसी आर्किटेक्चर की वजह से इस मॉडल परिवार को आधिकारिक तौर पर Latent Diffusion Models (LDMs) कहा जाता है, हालाँकि ज़्यादातर लोग बस "डिफ़्यूज़न मॉडल" कहते हैं। Stable Diffusion XL और Stable Diffusion 3 दोनों लेटेंट डिफ़्यूज़न मॉडल हैं। Flux Pro भी ऐसा ही है। पिक्सल स्पेस के बजाय लेटेंट स्पेस में काम करने से हाई-रिज़ॉल्यूशन AI इमेज जनरेशन सर्वर फ़ार्म की ज़रूरत के बजाय आम उपभोक्ता हार्डवेयर पर व्यावहारिक हो गई।
टेक्स्ट आउटपुट को कैसे नियंत्रित करता है
बिना टेक्स्ट कंडीशनिंग के डिफ़्यूज़न मॉडल हर बार रैंडम, सांख्यिकीय रूप से सही दिखने वाली इमेज बनाता। टेक्स्ट प्रॉम्प्ट डीनॉइज़िंग प्रक्रिया को कंडीशन करके काम करते हैं, मॉडल को इमेज स्पेस के उन खास हिस्सों की ओर मोड़ते हुए जहाँ सामग्री आपके विवरण से मेल खाती है।
टेक्स्ट एन्कोडर और एम्बेडिंग
आप जो टेक्स्ट टाइप करते हैं, वह पहले एक टेक्स्ट एन्कोडर द्वारा एक सघन संख्यात्मक प्रतिनिधित्व में बदला जाता है। CLIP या T5 जैसे मॉडल आपका प्रॉम्प्ट पढ़ते हैं और हाई-डायमेंशनल वेक्टरों का एक क्रम बनाते हैं, जिन्हें एम्बेडिंग कहते हैं। हर एम्बेडिंग पूरे वाक्य के संदर्भ में शब्दों और वाक्यांशों का अर्थ पकड़ती है। ये एम्बेडिंग वेक्टर हर डीनॉइज़िंग चरण पर U-Net में पास किए जाते हैं, इसलिए नॉइज़ प्रेडिक्शन लगातार इस बात से प्रभावित रहता है कि आपने क्या माँगा था।

क्लासिफ़ायर-फ़्री गाइडेंस
टेक्स्ट के प्रभाव की ताकत गाइडेंस स्केल (जिसे CFG स्केल भी कहते हैं, यानी Classifier-Free Guidance का संक्षिप्त रूप) नाम की सेटिंग से नियंत्रित होती है। लगभग 2 से 4 के कम मानों पर मॉडल टेक्स्ट का ढीला पालन करता है और ज़्यादा विविध, कभी-कभी अप्रत्याशित नतीजे देता है। लगभग 12 से 20 के उच्च मानों पर मॉडल टेक्स्ट का बहुत सख्ती से पालन करता है, लेकिन ज़रूरत से ज़्यादा संतृप्त या विकृत इमेज बना सकता है। ज़्यादातर AI जनरेटर का डिफ़ॉल्ट गाइडेंस स्केल 7 से 12 के बीच होता है, जो प्रॉम्प्ट की निष्ठा और विज़ुअल गुणवत्ता के बीच संतुलन रखता है।
Note: क्लासिफ़ायर-फ़्री गाइडेंस हर चरण पर डीनॉइजिंग दो बार चलाकर काम करता है: एक बार आपकी टेक्स्ट कंडीशन के साथ और एक बार उसके बिना। फिर मॉडल दोनों प्रेडिक्शन के अंतर को बढ़ाता है। ज़्यादा गाइडेंस स्केल का मतलब है बड़ा एम्प्लिफ़िकेशन फ़ैक्टर, जो नतीजे को आपके प्रॉम्प्ट की ओर ज़्यादा ज़ोर से खींचता है।
प्रशिक्षण प्रक्रिया
शून्य से डिफ़्यूज़न मॉडल को प्रशिक्षित करने के लिए विशाल डेटासेट और भारी कम्प्यूट चाहिए। Stable Diffusion XL जैसे मॉडल इंटरनेट से खंगाले गए सैकड़ों मिलियन इमेज-कैप्शन जोड़ों पर प्रशिक्षित किए गए थे, जिसके लिए सैकड़ों GPU के क्लस्टर हफ़्तों या महीनों तक चलाने पड़े। उस प्रक्रिया से मॉडल जो बनाता है, वह इमेज का डेटाबेस नहीं होता, बल्कि विज़ुअल संरचना का एक समृद्ध आंतरिक प्रतिनिधित्व होता है।
मॉडल असल में क्या आत्मसात करता है
प्रशिक्षण के दौरान, डेटासेट की हर इमेज के लिए प्रक्रिया इस तरह चलती है:
- 1 से 1000 के बीच एक रैंडम टाइमस्टेप चुनें
- इमेज में उसी टाइमस्टेप के अनुरूप गॉसियन नॉइज़ की मात्रा जोड़ें
- नॉइज़ वाली इमेज को टाइमस्टेप नंबर और टेक्स्ट कैप्शन के साथ U-Net को दें
- U-Net से अनुमान लगाने को कहें कि कौन-सा नॉइज़ जोड़ा गया था
- गणना करें कि प्रेडिक्शन कितना गलत था (लॉस फ़ंक्शन)
- भविष्य के प्रेडिक्शन और सटीक बनाने के लिए मॉडल के वेट समायोजित करें

यह चक्र अरबों इमेज-टाइमस्टेप जोड़ों के लिए दोहराया जाता है। नतीजा एक ऐसा मॉडल है जिसने मानव विज़ुअल संस्कृति के एक विशाल हिस्से की विज़ुअल संरचना को आत्मसात कर लिया है, और जो उस वितरण के भीतर आने वाली किसी भी इमेज की ओर नॉइज़ से आगे बढ़ सकता है।
रैंडम सीड की भूमिका
रिवर्स डीनॉइज़िंग प्रक्रिया डिटरमिनिस्टिक नहीं है। एक ही प्रॉम्प्ट होने पर भी, अलग-अलग रैंडम सीड के साथ मॉडल को दो बार चलाने पर पूरी तरह अलग इमेज मिलती हैं। ऐसा इसलिए है क्योंकि शुरुआती नॉइज़ रैंडम है, और उस प्रारंभिक नॉइज़ में छोटे अंतर भी डीनॉइज़िंग प्रक्रिया के बहुत अलग रास्तों तक ले जाते हैं। यह एक खूबी है, खामी नहीं: इसी से एक ही प्रॉम्प्ट की कई जनरेशन में विज़ुअल विविधता मिलती है।

डिफ़्यूज़न बनाम अन्य जेनरेटिव मॉडल
डिफ़्यूज़न मॉडल किसी खाली जगह में पैदा नहीं हुए। इनसे पहले AI इमेज जनरेशन पर दो पुराने तरीके हावी थे, और तीनों की तुलना से समझ आता है कि डिफ़्यूज़न मानक क्यों बना।
GANs के मुकाबले
Generative Adversarial Networks (GANs) दो प्रतिस्पर्धी नेटवर्क इस्तेमाल करते हैं: एक जनरेटर जो इमेज बनाता है और एक डिस्क्रिमिनेटर जो नकली इमेज पहचानने की कोशिश करता है। ये तेज़ी से तीखी, उच्च-निष्ठा वाली इमेज बना सकते हैं, लेकिन इन्हें प्रशिक्षित करना बेहद मुश्किल होता है और ये "मोड कोलैप्स" के शिकार होते हैं, जहाँ जनरेटर विविध आउटपुट देना बंद कर देता है और इमेज की एक संकरी रेंज पर अटक जाता है, जो डिस्क्रिमिनेटर को भरोसेमंद ढंग से धोखा देती हैं।
डिफ़्यूज़न मॉडल इनफ़रेंस में धीमे होते हैं, लेकिन ज़्यादा विविध, नियंत्रणीय आउटपुट देते हैं और प्रशिक्षण में कहीं ज़्यादा स्थिर होते हैं। उच्च निष्ठा के साथ किसी भी टेक्स्ट पर कंडीशन करने की क्षमता डिफ़्यूज़न में GANs की तुलना में कहीं ज़्यादा स्वाभाविक है, क्योंकि GANs को प्रॉम्प्ट पर अर्थपूर्ण नियंत्रण पाने के लिए आर्किटेक्चर की चालें और जुगाड़ चाहिए होते हैं।
VAEs के मुकाबले
Variational Autoencoders भी लेटेंट प्रतिनिधित्वों के साथ काम करते हैं और लेटेंट स्पेस से सैंपल लेकर इमेज बना सकते हैं। फिर भी, ये धुंधले नतीजे देते हैं, क्योंकि ये औसत पिक्सल समानता के लिए अनुकूलन करते हैं, और कई संभावित इमेज का "औसत" अक्सर उन सबका फीका मिश्रण होता है। डिफ़्यूज़न मॉडल नॉइज़ प्रेडिक्शन के लिए अनुकूलन करके इस समस्या को पूरी तरह टाल देते हैं, जो स्वाभाविक रूप से ज़्यादा तीखे और विस्तृत आउटपुट देता है।
| मॉडल प्रकार | गति | गुणवत्ता | टेक्स्ट नियंत्रण | प्रशिक्षण स्थिरता |
|---|
| GAN | तेज़ | तीखी लेकिन संकरी | सीमित | कठिन |
| VAE | तेज़ | अक्सर धुंधली | सीमित | स्थिर |
| डिफ़्यूज़न | मध्यम | उच्च निष्ठा, विविध | उत्कृष्ट | बहुत स्थिर |

असली मॉडल, असली नतीजे
AI इमेज प्लेटफ़ॉर्म पर आप जिन मॉडलों का इस्तेमाल करते हैं, वे सभी इन्हीं डिफ़्यूज़न सिद्धांतों पर बने हैं। नीचे देखें कि प्रमुख मॉडल ऊपर पढ़े गए सिद्धांतों से कैसे मेल खाते हैं।
Stable Diffusion और उसके वर्ज़न
Stable Diffusion XL आर्किटेक्चर ने एक दो-चरणीय पाइपलाइन पेश की: एक बेस मॉडल व्यापक संरचना और कम्पोज़िशन संभालता है, और एक रिफ़ाइनर मॉडल दूसरे पास में बारीक विवरणों को तीखा करता है। Stable Diffusion 3 ने क्लासिक U-Net की जगह DiT (Diffusion Transformer) आर्किटेक्चर लिया, जिससे टेक्स्ट रेंडरिंग की सटीकता और कम्पोज़िशन पर नियंत्रण काफ़ी बेहतर हुआ।
ये मॉडल पोर्ट्रेट, आर्किटेक्चरल विज़ुअलाइज़ेशन, प्रोडक्ट फ़ोटोग्राफ़ी और इलस्ट्रेशन में विशेषज्ञता वाले सैकड़ों फ़ाइन-ट्यून किए गए वर्ज़न की नींव हैं। फ़ाइन-ट्यूनिंग मूल डिफ़्यूज़न प्रक्रिया को नहीं बदलती; यह मॉडल के आंतरिक वितरण को किसी खास विज़ुअल स्टाइल या विषय-क्षेत्र की ओर खिसकाती है।
Flux और नई पीढ़ी
Flux Pro और Flux Schnell डिफ़्यूज़न ट्रांसफ़ॉर्मर में अत्याधुनिक स्तर का प्रतिनिधित्व करते हैं। ये असाधारण फ़ोटोरियलिज़्म, जनरेट की गई इमेज के भीतर सटीक टेक्स्ट रेंडरिंग और प्रॉम्प्ट के विवरणों का मज़बूत पालन देते हैं। Flux Redux Dev मौजूदा रेफ़रेंस इमेज के ऊपर वेरिएशन जनरेशन की सुविधा देकर इसे आगे बढ़ाता है, ताकि आप पूरी तरह नॉइज़ से नहीं, बल्कि एक शुरुआती बिंदु से दोहरा सकें।
ये सभी मॉडल अब भी बिल्कुल वही मूल प्रक्रिया अपनाते हैं: प्रशिक्षण में फ़ॉरवर्ड नॉइज़, जनरेशन के समय रिवर्स डीनॉइज़िंग, गति के लिए लेटेंट स्पेस कंप्रेशन, और आउटपुट को आकार देने के लिए टेक्स्ट कंडीशनिंग। आर्किटेक्चरल सुधार बदलते हैं कि मॉडल उस प्रक्रिया पर कितनी अच्छी तरह चलता है, यह नहीं बदलते कि प्रक्रिया क्या है।
अभी आप क्या बना सकते हैं
इसे व्यवहार में लाने के लिए आपको मॉडल प्रशिक्षित करने या कोड की एक भी पंक्ति लिखने की ज़रूरत नहीं है। ऊपर बताया गया हर मॉडल Picasso IA पर सीधे ब्राउज़र में उपलब्ध है, बिना किसी सेटअप के।

Flux Pro में एक विस्तृत और विशिष्ट प्रॉम्प्ट टाइप करके शुरू करें और देखें कि डीनॉइज़िंग प्रक्रिया आपके शब्दों को फ़ोटोरियलिस्टिक दृश्य में कैसे बदलती है। यह देखने के लिए कि टेक्स्ट नतीजे को कितनी ताकत से आकार देता है, गाइडेंस स्केल को ऊपर-नीचे करें। फिर वही प्रॉम्प्ट लेकर Stable Diffusion XL पर जाएँ और दो ऐसे मॉडलों के सौंदर्य में फ़र्क देखें जो एक ही मूल आर्किटेक्चर साझा करते हैं, पर उस पर चलने का तरीका अलग है।
एक ही प्रॉम्प्ट को अलग-अलग सीड के साथ दो बार जनरेट करें। ध्यान दें कि आउटपुट कितने अलग हैं, जबकि अंतर्निहित प्रक्रिया बिल्कुल एक जैसी है। यह विविधता कोई खामी नहीं है। यह डिफ़्यूज़न की प्रायिकतात्मक प्रकृति है, जो ठीक वही कर रही है जिसके लिए उसे बनाया गया है: अराजकता से स्पष्टता की ओर बढ़ना, आपके माँगे हुए के मार्गदर्शन में, ऐसे रास्ते से जिसे कोई भी दो जनरेशन कभी साझा नहीं करेंगी।
आपकी बनाई हर इमेज नॉइज़ के भीतर एक यात्रा है। अब आप जानते हैं कि उस रास्ते में असल में क्या होता है।