डिफ़्यूज़न मॉडल क्या है, सरल शब्दों में समझें

डिफ़्यूज़न मॉडल आज इस्तेमाल होने वाले हर बड़े AI इमेज जनरेटर के पीछे हैं, Stable Diffusion से लेकर Flux तक। यह लेख बताता है कि ये असल में कैसे काम करते हैं: गॉसियन नॉइज़ जोड़ने से लेकर रिवर्स डीनॉइज़िंग, लेटेंट स्पेस कंप्रेशन और टेक्स्ट कंडीशनिंग तक, बिना गणित के भारी शब्दों और फ़ालतू बातों के।

डिफ़्यूज़न मॉडल क्या है, सरल शब्दों में समझें
Cristian Da Conceicao
Picasso IA के संस्थापक

गणित और जादू के बीच कहीं, एक डिफ़्यूज़न मॉडल पूरी तरह रैंडम नॉइज़ से भरी स्क्रीन लेता है और धीरे-धीरे उसे एक फ़ोटोरियलिस्टिक चेहरे, रेनेसां शैली की ऑयल पेंटिंग या गोल्डन आवर में एक शहर के दृश्य में तराशता है। अगर आपने कभी AI इमेज जनरेटर में एक वाक्य लिखा है और कुछ बनते देखा है, तो आपने डिफ़्यूज़न मॉडल को काम करते देखा है। लेकिन उस प्रक्रिया के अंदर असल में क्या होता है? जब आप उसके दो चरण देख लेते हैं, तो जवाब आश्चर्यजनक रूप से तर्कसंगत लगता है।

डिफ़्यूज़न मॉडल के पीछे का विचार

डिफ़्यूज़न मॉडल नॉइज़ हटाने के लिए प्रशिक्षित होता है। पूरी मूल अवधारणा बस यही है। प्रशिक्षण के दौरान मॉडल को लाखों इमेज दिखाई जाती हैं, जिनमें बढ़ती मात्रा में रैंडम नॉइज़ जोड़ा गया होता है। वह कदम-दर-कदम यह क्षमता विकसित करता है कि नॉइज़ जुड़ने से पहले मूल इमेज कैसी दिखती थी। प्रशिक्षण के बाद प्रक्रिया उलटी चलती है: आप पूरी तरह नॉइज़ से शुरू करते हैं, और मॉडल अपने आंतरिक किए गए चरणों में पीछे की ओर चलता है, हर चरण पर नॉइज़ हटाते हुए, जब तक एक सुसंगत इमेज सामने न आ जाए।

एक अजीब किस्म की रचनात्मकता

यह सुनने में अजीब लगता है कि इसे "रचनात्मकता" कहा जाए। मॉडल किसी इंसानी कलाकार की तरह शून्य से कुछ नहीं पेंट कर रहा होता। इसके बजाय वह उस आंतरिक नक्शे में से एक रास्ता चुनता है जिसमें यह दर्ज है कि अलग-अलग स्तर की विकृति पर असली इमेज कैसी दिखती हैं, और अराजकता से स्पष्टता की ओर बढ़ता है। उस रास्ते पर मंज़िल, जिसे आपका टेक्स्ट प्रॉम्प्ट आकार देता है, तय करती है कि अंत में आपको क्या दिखेगा।

इसीलिए नतीजे इतने विविध और स्वाभाविक लगते हैं। मॉडल स्टोर की गई इमेज नहीं निकालता और न ही टुकड़ों को जोड़ता है। वह डीनॉइज़िंग प्रक्रिया के हर चरण पर यह मानकर चलते हुए कुछ नया बनाता है कि असली इमेज को वहाँ कैसा दिखना चाहिए।

नॉइज़ ही शुरुआती बिंदु क्यों है

नॉइज़ से शुरू करने का फ़ैसला सोच-समझकर लिया गया है। नॉइज़ गणितीय रूप से अच्छी तरह परिभाषित होता है, खासकर गॉसियन नॉइज़, जिसमें पिक्सल मान एक बेल-कर्व वितरण का पालन करते हैं। यही गणितीय सटीकता मॉडल को कड़ाई से प्रशिक्षित होने देती है। उसने लाखों इमेज के हर स्तर की विकृति वाले नॉइज़ संस्करण देखे हैं, इसलिए वह किसी भी चरण पर बताने में सक्षम है कि क्या हटाया जाना चाहिए।

Note: गॉसियन नॉइज़ बिल्कुल TV स्टैटिक जैसा दिखता है। हर पिक्सल सामान्य वितरण से खींचा गया एक रैंडम मान होता है। अधिकतम नॉइज़ स्तर पर, मूल इमेज आपके सामने दिखने वाली चीज़ में कोई जानकारी नहीं जोड़ती।

विंटेज एनालॉग टेलीविज़न पर स्टैटिक नॉइज़ दिखता हुआ, मद्धम कमरे में फ़ॉस्फ़ोरेसेंट CRT स्क्रीन की चमक नीली-सफ़ेद रोशनी फैलाती हुई, गर्म इनकैंडेसेंट परिवेश प्रकाश स्क्रीन की ठंडी रोशनी से टकराता हुआ

फ़ॉरवर्ड डिफ़्यूज़न: इमेज से नॉइज़ तक

प्रशिक्षण चरण इमेज को व्यवस्थित रूप से नष्ट करने से शुरू होता है। इसे फ़ॉरवर्ड डिफ़्यूज़न कहते हैं, और यह हर टाइमस्टेप पर इमेज में गॉसियन नॉइज़ की एक छोटी, गणितीय रूप से सटीक मात्रा जोड़कर काम करता है। सैकड़ों टाइमस्टेप के बाद मूल इमेज पूरी तरह अपरिचित हो जाती है। बचता है सिर्फ़ शुद्ध स्टैटिक, जो बिना किसी इमेज के रैंडमली बनाए गए नॉइज़ से अलग नहीं पहचाना जा सकता।

नॉइज़ जोड़ना, कदम-दर-कदम

इसे ऐसे समझें जैसे किसी फ़ोटो पर धीरे-धीरे और अधिक अपारदर्शी ट्रेसिंग पेपर की परतें रखना। एक परत के बाद फ़ोटो अब भी ज़्यादातर दिखती है। दस परतों के बाद वह धुंधली और फीकी हो जाती है। एक हज़ार परतों के बाद आपको फ़ोटो बिल्कुल नहीं दिखती। फ़ॉरवर्ड डिफ़्यूज़न ठीक यही करता है, बस पिक्सल-स्तर के नॉइज़ के साथ, गणितीय रूप से नियंत्रित और पूर्वानुमेय वृद्धि में।

लकड़ी की मेज़ पर रखी छपी हुई पोर्ट्रेट फ़ोटो, उस पर ऊपर से पारदर्शी ट्रेसिंग पेपर की परतें एक के ऊपर एक रखी हैं, हर परत थोड़ा और विज़ुअल नॉइज़ जोड़ती हुई, दोपहर की गर्म धूप कागज़ की बनावट पर तिरछी पड़ती हुई

केंद्रीय अंतर्दृष्टि यह है कि हर नॉइज़ वाला संस्करण अपने टाइमस्टेप लेबल से जोड़ा जाता है। मॉडल को दिखाया जाता है, "यह इमेज 1000 में से चरण 200 पर ऐसी दिखती है," और "यह 1000 में से चरण 800 पर ऐसी दिखती है।" प्रशिक्षण सेट की हर इमेज के लिए हर एक चरण एक लेबल वाला प्रशिक्षण उदाहरण बन जाता है। इस तरह पहले से मौजूद इमेज से एक विशाल, समृद्ध संरचना वाला डेटासेट बन जाता है।

नॉइज़ शेड्यूल कैसा दिखता है

टाइमस्टेपनॉइज़ स्तरइमेज की दृश्यता
0कोई नहींमूल इमेज बिल्कुल साफ़
100कमहल्की दानेदार
400मध्यमधुंधली, किनारे दिखते हुए
700अधिकसिर्फ़ धुंधले आकार
1000अधिकतमशुद्ध गॉसियन नॉइज़

नॉइज़ किस दर से जोड़ा जाता है, यह नॉइज़ शेड्यूल कहलाने वाली चीज़ तय करती है। अलग-अलग शेड्यूल, जैसे लीनियर, कोसाइन या सिग्मॉइड, इस बात को प्रभावित करते हैं कि मॉडल आखिर में कितनी अच्छी इमेज बना सकता है। ज़्यादातर आधुनिक मॉडल कोसाइन शेड्यूलिंग इस्तेमाल करते हैं, जो सिरों पर नॉइज़ धीरे जोड़ती है और बीच में तेज़, जिससे अंतिम आउटपुट बेहतर दिखते हैं।

रिवर्स डिफ़्यूज़न: नॉइज़ से इमेज तक

एक बार मॉडल ने लाखों इमेज के हर नॉइज़ स्तर को आत्मसात कर लिया, तो आप प्रक्रिया उलट देते हैं। आप उसे शुद्ध नॉइज़ देते हैं और पूछते हैं कि असली इमेज के करीब पहुँचने के लिए कौन-सा नॉइज़ हटाना चाहिए। वह थोड़ा हटाता है। आप फिर पूछते हैं। वह थोड़ा और हटाता है। चुने गए सैम्पलर के आधार पर 20 से 1000 ऐसे डीनॉइज़िंग चरणों के बाद, एक असली-सी दिखने वाली इमेज सामने आ जाती है।

डीनॉइज़िंग न्यूरल नेटवर्क

डिफ़्यूज़न मॉडल के अंदर का न्यूरल नेटवर्क इमेज को सीधे नहीं बनाता। वह नॉइज़ को ही प्रेडिक्ट करता है, यानी हर चरण पर कौन-सा नॉइज़ घटाया जाना चाहिए। असली काम करने वाला हिस्सा आम तौर पर U-Net आर्किटेक्चर होता है: एक न्यूरल नेटवर्क जिसका आकार अक्षर U जैसा होता है, जिसमें एक एन्कोडर पथ होता है जो नॉइज़ वाली इमेज को अमूर्त प्रतिनिधित्व में संपीड़ित करता है, और एक डिकोडर पथ होता है जो साफ़ प्रेडिक्शन को दोबारा बनाता है। प्रेडिक्ट किया गया नॉइज़ घटाने के बाद जो बचता है, उसी से इमेज उभरती है।

एक सॉफ़्टवेयर इंजीनियर की मेज़ का ऊपर से लिया गया एरियल फ़ोटो, हाथ मैकेनिकल कीबोर्ड पर टाइप करते हुए, वाइडस्क्रीन मॉनिटर पर Python कोड और मैट्रिक्स ऐरे विज़ुअलाइज़ेशन दिखते हुए, गर्म ट्यूंगस्टन डेस्क लैंप, नोटबुक में हाथ से लिखे समीकरण

कितने चरण लगते हैं?

मूल DDPM (Denoising Diffusion Probabilistic Model) पेपर को 1000 डीनॉइज़िंग चरण चाहिए थे, जिससे जनरेशन बेहद धीमी हो जाती थी। आधुनिक सैम्पलर जैसे DDIM (Denoising Diffusion Implicit Models), DPM++ और Euler डीनॉइज़िंग प्रक्रिया में बड़े, ज़्यादा समझदार कदम उठाकर सिर्फ़ 20 से 50 चरणों में उच्च-गुणवत्ता वाली इमेज बना सकते हैं। यही वजह है कि शुरुआती इम्प्लीमेंटेशन की तुलना में आज के AI इमेज टूल लगभग तुरंत काम करते लगते हैं।

Note: सैम्पलर एक अलग एल्गोरिदम है जो प्रशिक्षित मॉडल के ऊपर बैठता है। सैम्पलर बदलने से मॉडल ने जो आत्मसात किया है वह नहीं बदलता। यह सिर्फ़ इस बात को बदलता है कि मॉडल के प्रेडिक्शन नॉइज़ से इमेज तक जाने के लिए कैसे इस्तेमाल होते हैं। अलग-अलग सैम्पलर अलग ज़रूरतों के लिए ठीक हैं: DDIM तेज़ और स्थिर है, DPM++ ज़्यादा चरणों के साथ बेहतर गुणवत्ता देता है, Euler गति और सटीकता का अच्छा संतुलन रखता है।

लेटेंट स्पेस के अंदर

हाई रिज़ॉल्यूशन पर कच्चे पिक्सल मानों पर सीधे डिफ़्यूज़न चलाना बेहद धीमा और कम्प्यूटेशनल रूप से महँगा होगा। 512x512 इमेज में हर डीनॉइज़िंग चरण पर प्रोसेस करने के लिए 786,000 से ज़्यादा अलग-अलग पिक्सल मान होते हैं। आधुनिक डिफ़्यूज़न मॉडल इसे एक अहम दक्षता ट्रिक से हल करते हैं: वे डीनॉइज़िंग को पिक्सल स्पेस के बजाय संपीड़ित प्रतिनिधित्व में करते हैं, जिसे लेटेंट स्पेस कहते हैं।

एन्कोडर और डिकोडर

डिफ़्यूज़न शुरू होने से पहले, एन्कोडर नाम का एक अलग न्यूरल नेटवर्क इमेज को मानों की बहुत छोटी ग्रिड में संपीड़ित कर देता है। 512x512 पिक्सल की इमेज आम तौर पर 64x64 लेटेंट प्रतिनिधित्व बन जाती है, यानी संपीड़न अनुपात 64। सारी डीनॉइज़िंग इस छोटे आकार पर होती है, जो काफ़ी तेज़ है। जब डीनॉइज़िंग पूरी हो जाती है, तो डिकोडर नाम का दूसरा नेटवर्क लेटेंट प्रतिनिधित्व को वापस पूरे रिज़ॉल्यूशन की इमेज में फैलाता है।

पारंपरिक डार्करूम में एक फ़िल्म फ़ोटोग्राफ़र 35mm फ़िल्म नेगेटिव की पट्टी को एम्बर लाल सेफ़-लाइट की ओर उठाए हुए, पट्टी पर क्रम में छोटी-छोटी संपीड़ित इमेज दिखती हुईं, नीचे बेंच पर केमिकल डेवलपिंग ट्रे रखी हुईं

एन्कोडर और डिकोडर मिलकर एक Variational Autoencoder (VAE) बनाते हैं। वह लेटेंट स्पेस जो यह बनाता है, वह मनमाना संपीड़न नहीं है; वह एक संरचित, जानकारी से भरपूर प्रतिनिधित्व है, जो इमेज की सबसे अहम विज़ुअल विशेषताओं को बचाए रखता है और जो अनावश्यक है उसे हटा देता है। इसे फ़िल्म नेगेटिव की तरह समझें: एक पूरे रिज़ॉल्यूशन की फ़ोटो की सारी जानकारी एक पतली, छोटी सामग्री की पट्टी पर संपीड़ित।

लेटेंट स्पेस ने सब कुछ क्यों बदल दिया

इसी आर्किटेक्चर की वजह से इस मॉडल परिवार को आधिकारिक तौर पर Latent Diffusion Models (LDMs) कहा जाता है, हालाँकि ज़्यादातर लोग बस "डिफ़्यूज़न मॉडल" कहते हैं। Stable Diffusion XL और Stable Diffusion 3 दोनों लेटेंट डिफ़्यूज़न मॉडल हैं। Flux Pro भी ऐसा ही है। पिक्सल स्पेस के बजाय लेटेंट स्पेस में काम करने से हाई-रिज़ॉल्यूशन AI इमेज जनरेशन सर्वर फ़ार्म की ज़रूरत के बजाय आम उपभोक्ता हार्डवेयर पर व्यावहारिक हो गई।

टेक्स्ट आउटपुट को कैसे नियंत्रित करता है

बिना टेक्स्ट कंडीशनिंग के डिफ़्यूज़न मॉडल हर बार रैंडम, सांख्यिकीय रूप से सही दिखने वाली इमेज बनाता। टेक्स्ट प्रॉम्प्ट डीनॉइज़िंग प्रक्रिया को कंडीशन करके काम करते हैं, मॉडल को इमेज स्पेस के उन खास हिस्सों की ओर मोड़ते हुए जहाँ सामग्री आपके विवरण से मेल खाती है।

टेक्स्ट एन्कोडर और एम्बेडिंग

आप जो टेक्स्ट टाइप करते हैं, वह पहले एक टेक्स्ट एन्कोडर द्वारा एक सघन संख्यात्मक प्रतिनिधित्व में बदला जाता है। CLIP या T5 जैसे मॉडल आपका प्रॉम्प्ट पढ़ते हैं और हाई-डायमेंशनल वेक्टरों का एक क्रम बनाते हैं, जिन्हें एम्बेडिंग कहते हैं। हर एम्बेडिंग पूरे वाक्य के संदर्भ में शब्दों और वाक्यांशों का अर्थ पकड़ती है। ये एम्बेडिंग वेक्टर हर डीनॉइज़िंग चरण पर U-Net में पास किए जाते हैं, इसलिए नॉइज़ प्रेडिक्शन लगातार इस बात से प्रभावित रहता है कि आपने क्या माँगा था।

एक महिला के हाथ चमड़े की जिल्द वाली डायरी में विस्तृत वर्णनात्मक नोट्स लिखते हुए, डायरी के बगल में एक पहाड़ी लैंडस्केप की छपी हुई फ़ोटो गोल्डन आवर में, प्राकृतिक नरम खिड़की की रोशनी जो हल्की छायाएँ बनाती हुई

क्लासिफ़ायर-फ़्री गाइडेंस

टेक्स्ट के प्रभाव की ताकत गाइडेंस स्केल (जिसे CFG स्केल भी कहते हैं, यानी Classifier-Free Guidance का संक्षिप्त रूप) नाम की सेटिंग से नियंत्रित होती है। लगभग 2 से 4 के कम मानों पर मॉडल टेक्स्ट का ढीला पालन करता है और ज़्यादा विविध, कभी-कभी अप्रत्याशित नतीजे देता है। लगभग 12 से 20 के उच्च मानों पर मॉडल टेक्स्ट का बहुत सख्ती से पालन करता है, लेकिन ज़रूरत से ज़्यादा संतृप्त या विकृत इमेज बना सकता है। ज़्यादातर AI जनरेटर का डिफ़ॉल्ट गाइडेंस स्केल 7 से 12 के बीच होता है, जो प्रॉम्प्ट की निष्ठा और विज़ुअल गुणवत्ता के बीच संतुलन रखता है।

Note: क्लासिफ़ायर-फ़्री गाइडेंस हर चरण पर डीनॉइजिंग दो बार चलाकर काम करता है: एक बार आपकी टेक्स्ट कंडीशन के साथ और एक बार उसके बिना। फिर मॉडल दोनों प्रेडिक्शन के अंतर को बढ़ाता है। ज़्यादा गाइडेंस स्केल का मतलब है बड़ा एम्प्लिफ़िकेशन फ़ैक्टर, जो नतीजे को आपके प्रॉम्प्ट की ओर ज़्यादा ज़ोर से खींचता है।

प्रशिक्षण प्रक्रिया

शून्य से डिफ़्यूज़न मॉडल को प्रशिक्षित करने के लिए विशाल डेटासेट और भारी कम्प्यूट चाहिए। Stable Diffusion XL जैसे मॉडल इंटरनेट से खंगाले गए सैकड़ों मिलियन इमेज-कैप्शन जोड़ों पर प्रशिक्षित किए गए थे, जिसके लिए सैकड़ों GPU के क्लस्टर हफ़्तों या महीनों तक चलाने पड़े। उस प्रक्रिया से मॉडल जो बनाता है, वह इमेज का डेटाबेस नहीं होता, बल्कि विज़ुअल संरचना का एक समृद्ध आंतरिक प्रतिनिधित्व होता है।

मॉडल असल में क्या आत्मसात करता है

प्रशिक्षण के दौरान, डेटासेट की हर इमेज के लिए प्रक्रिया इस तरह चलती है:

  1. 1 से 1000 के बीच एक रैंडम टाइमस्टेप चुनें
  2. इमेज में उसी टाइमस्टेप के अनुरूप गॉसियन नॉइज़ की मात्रा जोड़ें
  3. नॉइज़ वाली इमेज को टाइमस्टेप नंबर और टेक्स्ट कैप्शन के साथ U-Net को दें
  4. U-Net से अनुमान लगाने को कहें कि कौन-सा नॉइज़ जोड़ा गया था
  5. गणना करें कि प्रेडिक्शन कितना गलत था (लॉस फ़ंक्शन)
  6. भविष्य के प्रेडिक्शन और सटीक बनाने के लिए मॉडल के वेट समायोजित करें

एक बड़े प्राकृतिक कॉर्क पिनबोर्ड पर सैकड़ों छपी हुई फ़ोटो सटीक ग्रिड में लगी हुईं, एक महिला शोधकर्ता एक ओर हाथ बाँधे संग्रह की जाँच करती हुई, गर्म ओवरहेड ट्रैक लाइटिंग

यह चक्र अरबों इमेज-टाइमस्टेप जोड़ों के लिए दोहराया जाता है। नतीजा एक ऐसा मॉडल है जिसने मानव विज़ुअल संस्कृति के एक विशाल हिस्से की विज़ुअल संरचना को आत्मसात कर लिया है, और जो उस वितरण के भीतर आने वाली किसी भी इमेज की ओर नॉइज़ से आगे बढ़ सकता है।

रैंडम सीड की भूमिका

रिवर्स डीनॉइज़िंग प्रक्रिया डिटरमिनिस्टिक नहीं है। एक ही प्रॉम्प्ट होने पर भी, अलग-अलग रैंडम सीड के साथ मॉडल को दो बार चलाने पर पूरी तरह अलग इमेज मिलती हैं। ऐसा इसलिए है क्योंकि शुरुआती नॉइज़ रैंडम है, और उस प्रारंभिक नॉइज़ में छोटे अंतर भी डीनॉइज़िंग प्रक्रिया के बहुत अलग रास्तों तक ले जाते हैं। यह एक खूबी है, खामी नहीं: इसी से एक ही प्रॉम्प्ट की कई जनरेशन में विज़ुअल विविधता मिलती है।

फ़ोटोग्राफ़र एक केमिकल डेवलपर बाथ में ब्लैक एंड व्हाइट फ़िल्म फ़ोटो विकसित करता हुआ, सफ़ेद फ़ोटोग्राफ़िक कागज़ से धीरे-धीरे एक पोर्ट्रेट इमेज उभरती हुई, एम्बर लाल सेफ़-लाइट ऊपर से नाटकीय गर्म रोशनी बिखेरती हुई

डिफ़्यूज़न बनाम अन्य जेनरेटिव मॉडल

डिफ़्यूज़न मॉडल किसी खाली जगह में पैदा नहीं हुए। इनसे पहले AI इमेज जनरेशन पर दो पुराने तरीके हावी थे, और तीनों की तुलना से समझ आता है कि डिफ़्यूज़न मानक क्यों बना।

GANs के मुकाबले

Generative Adversarial Networks (GANs) दो प्रतिस्पर्धी नेटवर्क इस्तेमाल करते हैं: एक जनरेटर जो इमेज बनाता है और एक डिस्क्रिमिनेटर जो नकली इमेज पहचानने की कोशिश करता है। ये तेज़ी से तीखी, उच्च-निष्ठा वाली इमेज बना सकते हैं, लेकिन इन्हें प्रशिक्षित करना बेहद मुश्किल होता है और ये "मोड कोलैप्स" के शिकार होते हैं, जहाँ जनरेटर विविध आउटपुट देना बंद कर देता है और इमेज की एक संकरी रेंज पर अटक जाता है, जो डिस्क्रिमिनेटर को भरोसेमंद ढंग से धोखा देती हैं।

डिफ़्यूज़न मॉडल इनफ़रेंस में धीमे होते हैं, लेकिन ज़्यादा विविध, नियंत्रणीय आउटपुट देते हैं और प्रशिक्षण में कहीं ज़्यादा स्थिर होते हैं। उच्च निष्ठा के साथ किसी भी टेक्स्ट पर कंडीशन करने की क्षमता डिफ़्यूज़न में GANs की तुलना में कहीं ज़्यादा स्वाभाविक है, क्योंकि GANs को प्रॉम्प्ट पर अर्थपूर्ण नियंत्रण पाने के लिए आर्किटेक्चर की चालें और जुगाड़ चाहिए होते हैं।

VAEs के मुकाबले

Variational Autoencoders भी लेटेंट प्रतिनिधित्वों के साथ काम करते हैं और लेटेंट स्पेस से सैंपल लेकर इमेज बना सकते हैं। फिर भी, ये धुंधले नतीजे देते हैं, क्योंकि ये औसत पिक्सल समानता के लिए अनुकूलन करते हैं, और कई संभावित इमेज का "औसत" अक्सर उन सबका फीका मिश्रण होता है। डिफ़्यूज़न मॉडल नॉइज़ प्रेडिक्शन के लिए अनुकूलन करके इस समस्या को पूरी तरह टाल देते हैं, जो स्वाभाविक रूप से ज़्यादा तीखे और विस्तृत आउटपुट देता है।

मॉडल प्रकारगतिगुणवत्ताटेक्स्ट नियंत्रणप्रशिक्षण स्थिरता
GANतेज़तीखी लेकिन संकरीसीमितकठिन
VAEतेज़अक्सर धुंधलीसीमितस्थिर
डिफ़्यूज़नमध्यमउच्च निष्ठा, विविधउत्कृष्टबहुत स्थिर

एक चमकदार आधुनिक विश्वविद्यालय की कंप्यूटर लैब में आमने-सामने बैठे दो शोधकर्ता, अपने बड़े मॉनिटरों पर अलग-अलग AI-जनरेटेड इमेज देखते हुए, स्क्रीन की ओर इशारा करते हुए बातचीत में मग्न, कैंडिड डॉक्यूमेंट्री फ़ोटोग्राफ़ी शैली

असली मॉडल, असली नतीजे

AI इमेज प्लेटफ़ॉर्म पर आप जिन मॉडलों का इस्तेमाल करते हैं, वे सभी इन्हीं डिफ़्यूज़न सिद्धांतों पर बने हैं। नीचे देखें कि प्रमुख मॉडल ऊपर पढ़े गए सिद्धांतों से कैसे मेल खाते हैं।

Stable Diffusion और उसके वर्ज़न

Stable Diffusion XL आर्किटेक्चर ने एक दो-चरणीय पाइपलाइन पेश की: एक बेस मॉडल व्यापक संरचना और कम्पोज़िशन संभालता है, और एक रिफ़ाइनर मॉडल दूसरे पास में बारीक विवरणों को तीखा करता है। Stable Diffusion 3 ने क्लासिक U-Net की जगह DiT (Diffusion Transformer) आर्किटेक्चर लिया, जिससे टेक्स्ट रेंडरिंग की सटीकता और कम्पोज़िशन पर नियंत्रण काफ़ी बेहतर हुआ।

ये मॉडल पोर्ट्रेट, आर्किटेक्चरल विज़ुअलाइज़ेशन, प्रोडक्ट फ़ोटोग्राफ़ी और इलस्ट्रेशन में विशेषज्ञता वाले सैकड़ों फ़ाइन-ट्यून किए गए वर्ज़न की नींव हैं। फ़ाइन-ट्यूनिंग मूल डिफ़्यूज़न प्रक्रिया को नहीं बदलती; यह मॉडल के आंतरिक वितरण को किसी खास विज़ुअल स्टाइल या विषय-क्षेत्र की ओर खिसकाती है।

Flux और नई पीढ़ी

Flux Pro और Flux Schnell डिफ़्यूज़न ट्रांसफ़ॉर्मर में अत्याधुनिक स्तर का प्रतिनिधित्व करते हैं। ये असाधारण फ़ोटोरियलिज़्म, जनरेट की गई इमेज के भीतर सटीक टेक्स्ट रेंडरिंग और प्रॉम्प्ट के विवरणों का मज़बूत पालन देते हैं। Flux Redux Dev मौजूदा रेफ़रेंस इमेज के ऊपर वेरिएशन जनरेशन की सुविधा देकर इसे आगे बढ़ाता है, ताकि आप पूरी तरह नॉइज़ से नहीं, बल्कि एक शुरुआती बिंदु से दोहरा सकें।

ये सभी मॉडल अब भी बिल्कुल वही मूल प्रक्रिया अपनाते हैं: प्रशिक्षण में फ़ॉरवर्ड नॉइज़, जनरेशन के समय रिवर्स डीनॉइज़िंग, गति के लिए लेटेंट स्पेस कंप्रेशन, और आउटपुट को आकार देने के लिए टेक्स्ट कंडीशनिंग। आर्किटेक्चरल सुधार बदलते हैं कि मॉडल उस प्रक्रिया पर कितनी अच्छी तरह चलता है, यह नहीं बदलते कि प्रक्रिया क्या है।

अभी आप क्या बना सकते हैं

इसे व्यवहार में लाने के लिए आपको मॉडल प्रशिक्षित करने या कोड की एक भी पंक्ति लिखने की ज़रूरत नहीं है। ऊपर बताया गया हर मॉडल Picasso IA पर सीधे ब्राउज़र में उपलब्ध है, बिना किसी सेटअप के।

एक रचनात्मक पेशेवर महिला अपने लैपटॉप पर AI इमेज जनरेटर में टेक्स्ट प्रॉम्प्ट टाइप करती हुई, उसके बाहरी मॉनिटर पर एक खूबसूरती से जनरेट की गई पोर्ट्रेट इमेज, चेहरे पर सच्ची खुशी, एक चमकदार क्रिएटिव स्टूडियो में प्राकृतिक दिन की रोशनी

Flux Pro में एक विस्तृत और विशिष्ट प्रॉम्प्ट टाइप करके शुरू करें और देखें कि डीनॉइज़िंग प्रक्रिया आपके शब्दों को फ़ोटोरियलिस्टिक दृश्य में कैसे बदलती है। यह देखने के लिए कि टेक्स्ट नतीजे को कितनी ताकत से आकार देता है, गाइडेंस स्केल को ऊपर-नीचे करें। फिर वही प्रॉम्प्ट लेकर Stable Diffusion XL पर जाएँ और दो ऐसे मॉडलों के सौंदर्य में फ़र्क देखें जो एक ही मूल आर्किटेक्चर साझा करते हैं, पर उस पर चलने का तरीका अलग है।

एक ही प्रॉम्प्ट को अलग-अलग सीड के साथ दो बार जनरेट करें। ध्यान दें कि आउटपुट कितने अलग हैं, जबकि अंतर्निहित प्रक्रिया बिल्कुल एक जैसी है। यह विविधता कोई खामी नहीं है। यह डिफ़्यूज़न की प्रायिकतात्मक प्रकृति है, जो ठीक वही कर रही है जिसके लिए उसे बनाया गया है: अराजकता से स्पष्टता की ओर बढ़ना, आपके माँगे हुए के मार्गदर्शन में, ऐसे रास्ते से जिसे कोई भी दो जनरेशन कभी साझा नहीं करेंगी।

आपकी बनाई हर इमेज नॉइज़ के भीतर एक यात्रा है। अब आप जानते हैं कि उस रास्ते में असल में क्या होता है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख