डिफ्यूज़न मॉडल सरल शब्दों में क्या हैं

डिफ्यूज़न मॉडल आज के सबसे यथार्थवादी AI इमेज जनरेटर के पीछे काम करते हैं। यह लेख नॉइज़ जोड़ने की अवधारणा से लेकर रिवर्स डीनॉइज़िंग प्रक्रिया तक, इनके काम करने का तरीका बताता है, और इसके लिए किसी तकनीकी पृष्ठभूमि की ज़रूरत नहीं है। इसमें असली उदाहरण, साफ़ उपमाएँ और सीधी तुलनाएँ शामिल हैं।

डिफ्यूज़न मॉडल सरल शब्दों में क्या हैं
Cristian Da Conceicao
Picasso IA के संस्थापक

अगर आपने कभी कोई वाक्य टाइप किया है और कंप्यूटर को शून्य से एक फ़ोटोरियलिस्टिक इमेज बनाते देखा है, तो आप पहले ही डिफ्यूज़न मॉडल को काम करते देख चुके हैं। आज के ज़्यादातर बड़े AI इमेज जनरेटर के पीछे यही मॉडल होते हैं, Stable Diffusion से लेकर Flux Dev तक, और इनका काम करने का तरीका ज़्यादातर लोगों की उम्मीद से कहीं ज़्यादा सरल है। यह लेख डिफ्यूज़न मॉडल को बिना समीकरणों, बिना जार्गन और बिना उन हिस्सों को छोड़े समझाता है जो सचमुच मायने रखते हैं।

पानी में फैलती स्याही की बूँद, जो आणविक स्तर पर डिफ्यूज़न की अवधारणा दिखाती है

वह नॉइज़ समस्या जिसकी कोई बात नहीं करता

डिफ्यूज़न मॉडल की ज़्यादातर व्याख्याएँ जटिल गणित से शुरू होती हैं। शुरुआत के लिए यह गलत जगह है। सही जगह एक सरल सवाल है: क्या हो अगर आप कंप्यूटर को रैंडमनेस को उलटना सिखा सकें?

सोचिए कि जब आप पानी के गिलास में स्याही की एक बूँद डालकर हिलाते हैं तो क्या होता है। स्याही फैलती है, घुलती है, और आख़िरकार आप यह नहीं बता पाते कि वह कहाँ से शुरू हुई थी। फैलने, एक समान हो जाने और संरचना खो देने की इस प्रक्रिया को डिफ्यूज़न कहते हैं। यह पानी में स्याही के साथ होता है, धातु की छड़ में गर्मी के साथ होता है, और कमरे में खुशबू के साथ होता है।

डिफ्यूज़न मॉडल इसी विचार को उधार लेते हैं और उसे उल्टा चलाते हैं।

शुरुआती बिंदु के रूप में नॉइज़ क्यों सही है

इमेज की दुनिया में "नॉइज़" का मतलब होता है रैंडम पिक्सल वैल्यू। कोई भी फ़ोटो लीजिए और हर पिक्सल में काफ़ी सारी रैंडम वैल्यू जोड़ दीजिए, तो आपको टूटे टेलीविज़न जैसी स्टैटिक दिखेगी। मूल इमेज पूरी तरह खो जाती है।

हर डिफ्यूज़न मॉडल की शुरुआत यहीं से होती है। इसलिए नहीं कि यह दिलचस्प है, बल्कि इसलिए कि यह उपयोगी है। शुद्ध नॉइज़ बनाना आसान है। रैंडम पिक्सल बनाने के लिए इमेज का डेटासेट नहीं चाहिए। आप इन्हें शून्य से तुरंत बना सकते हैं।

वह अंतर्दृष्टि जिसने डिफ्यूज़न मॉडल को व्यावहारिक बनाया, यह है: अगर आप एक न्यूरल नेटवर्क को सिखा सकें कि वह थोड़ी-सी नॉइज़ वाली इमेज लेकर उसका साफ़ रूप अनुमानित करे, तो आप इस प्रक्रिया को सैकड़ों बार जोड़ सकते हैं और शुद्ध नॉइज़ से एक सुसंगत इमेज तक पहुँच सकते हैं।

डिफ्यूज़न मॉडल असल में कैसे काम करता है

वर्कस्टेशन पर बैठा एक शोधकर्ता, जिसके कई मॉनिटरों पर न्यूरल नेटवर्क ट्रेनिंग के आरेख और लॉस कर्व दिख रहे हैं

अपने मूल में, डिफ्यूज़न मॉडल एक न्यूरल नेटवर्क है जिसका एक ही काम है: इमेज में नॉइज़ का अनुमान लगाना। यह सुनने में लगभग बहुत सरल लगता है, लेकिन यही एक क्षमता जब पर्याप्त डेटा और कंप्यूट के साथ बड़े पैमाने पर लागू होती है, तो वही फ़ोटोरियलिस्टिक नतीजे देती है जो आज आप देखते हैं।

पहला चरण है शुद्ध विनाश

ट्रेनिंग इमेज को जानबूझकर नष्ट करने से शुरू होती है। रिसर्चर लाखों असली फ़ोटो लेते हैं और नियंत्रित तरीके से उनमें कई अलग-अलग स्तरों पर रैंडम गॉसियन नॉइज़ जोड़ते हैं। नॉइज़ स्तर 1 पर इमेज लगभग सामान्य दिखती है, बस थोड़ी दानेदार। स्तर 500 पर वह बुरी तरह बिगड़ चुकी होती है। स्तर 1,000 पर वह शुद्ध स्टैटिक होती है।

हर नॉइज़ वाले संस्करण के लिए नेटवर्क को बताया जाता है: यह नॉइज़ वाली इमेज है, यह नॉइज़ का स्तर है, अब नेटवर्क बताए कि नॉइज़ कैसी दिख रही है। लाखों ट्रेनिंग उदाहरणों के दौरान नेटवर्क हर गंभीरता के स्तर पर नॉइज़ के पैटर्न पहचानने में बहुत माहिर हो जाता है।

दूसरा चरण है जादू का हिस्सा

एक बार ट्रेन हो जाने के बाद, आप मॉडल को उल्टा चलाते हैं। आप पूरी तरह रैंडम नॉइज़ इमेज से शुरू करते हैं, उसे नेटवर्क को देते हैं, उससे चरण 1,000 पर नॉइज़ का अनुमान लगवाते हैं, उसमें से कुछ नॉइज़ घटाते हैं, फिर चरण 999 पर नॉइज़ का अनुमान लगवाते हैं, फिर घटाते हैं, और यही दोहराते हैं।

इन 1,000 छोटे डीनॉइज़िंग चरणों के बाद स्टैटिक एक सुसंगत इमेज में बदल जाती है। नेटवर्क को कभी यह नहीं बताया गया कि कुछ खास बनाना है। उसे सिर्फ़ नॉइज़ हटाने को कहा गया था। लेकिन चूँकि उसने लाखों असली फ़ोटो से सीखा है, इसलिए जो इमेज उभरती है वह असली फ़ोटो जैसी दिखती है।

💡 मूल विचार: डिफ्यूज़न मॉडल शून्य से चित्र बनाकर इमेज नहीं बनाते। वे घटाव के ज़रिए बनाते हैं, नॉइज़ हटाते जाते हैं जब तक संरचना सामने न आ जाए।

नेटवर्क असल में क्या सीखता है

कॉर्क बोर्ड पर लगी पाँच प्रिंटेड फ़ोटो, जो साफ़ से पूरी तरह स्टैटिक तक बढ़ते नॉइज़ ओवरले दिखाती हैं

डिफ्यूज़न मॉडल के बारे में सबसे चौंकाने वाली बात यह है कि ट्रेनिंग के दौरान न्यूरल नेटवर्क असल में क्या सीखता है। वह आँखें, पेड़ या चेहरे बनाना नहीं सीखता। वह इमेज की सांख्यिकीय संरचना सीखता है, वे पैटर्न जो पिक्सल की व्यवस्था को असली चीज़ों जैसा दिखाते हैं, न कि रैंडम नॉइज़ जैसा।

ट्रेनिंग लूप की व्याख्या

सादे शब्दों में ट्रेनिंग लूप कुछ ऐसा दिखता है:

  1. डेटासेट से एक असली इमेज लें
  2. 1 से 1,000 के बीच एक रैंडम नॉइज़ स्तर चुनें
  3. इमेज में ठीक उतना ही नॉइज़ जोड़ें
  4. नॉइज़ वाली इमेज और नॉइज़ स्तर नेटवर्क को दिखाएँ
  5. नेटवर्क से कहें कि जोड़ा गया मूल नॉइज़ अनुमानित करे
  6. अनुमान की तुलना असली नॉइज़ से करें
  7. अगला अनुमान थोड़ा बेहतर बनाने के लिए नेटवर्क के वेट्स समायोजित करें
  8. यह अरबों बार दोहराएँ

पर्याप्त पुनरावृत्तियों के बाद नेटवर्क ने इतने उदाहरण देख लिए होते हैं कि उसने "प्राकृतिक इमेज" का मतलब गहरे सांख्यिकीय स्तर पर आत्मसात कर लिया होता है। उसे बिना स्पष्ट रूप से बताए पता होता है कि आसमान के पिक्सल आमतौर पर ज़मीन के पिक्सल के ऊपर दिखते हैं, चेहरों में एक खास सममिति होती है, और बनावट अनुमानित तरीकों से दोहराती है।

1,000 चरण सब कुछ क्यों बदल देते हैं

पिछले डिफ्यूज़न तरीकों ने नॉइज़ से इमेज तक एक ही झटके में पहुँचने की कोशिश की। नतीजे कमज़ोर थे। छलांग बहुत बड़ी थी, एक साथ बहुत ज़्यादा जानकारी का अनुमान लगाना पड़ता था।

प्रक्रिया को 1,000 छोटे चरणों में तोड़ने से हर चरण की कठिनाई नाटकीय रूप से बदल जाती है। हर चरण पर नेटवर्क को बस एक छोटा-सा सुधार करना होता है। छोटे सुधारों का सटीक अनुमान लगाना आसान होता है। 1,000 छोटे सटीक सुधारों का संचय एक बड़ा, सटीक नतीजा देता है।

इसी वजह से बाद के काम ने ज़रूरी चरणों की संख्या घटाने पर ज़ोर दिया, जैसे SDXL Lightning 4Step जो सिर्फ़ 4 चरणों में अच्छी गुणवत्ता देता है, या Flux Schnell जो सेकंडों में साफ़ और तीखी इमेज बनाता है।

साधारण शब्दों में फ़ॉरवर्ड बनाम रिवर्स

एक हाथ फ्रॉस्टेड ग्लास पैनल से टीवी स्टैटिक को धीरे से मिटाता हुआ, जिसके नीचे एक साफ़ पहाड़ी लैंडस्केप दिख रहा है

डिफ्यूज़न मॉडल के दो हिस्सों के औपचारिक नाम हैं: फ़ॉरवर्ड प्रक्रिया और रिवर्स प्रक्रिया। व्यवहार में इन्हें समझाना आसान है।

एक दिशा विनाश करती है, एक निर्माण करती है

प्रक्रियादिशाक्या होता हैकब चलती है
फ़ॉरवर्डइमेज से नॉइज़ तकधीरे-धीरे गॉसियन नॉइज़ जोड़ती है जब तक इमेज नष्ट न हो जाएकेवल ट्रेनिंग के दौरान
रिवर्सनॉइज़ से इमेज तकधीरे-धीरे नॉइज़ हटाती है जब तक इमेज फिर से न बन जाएइनफ़रेंस (इमेज जनरेशन) के दौरान

फ़ॉरवर्ड प्रक्रिया में कोई सीखने योग्य पैरामीटर नहीं होते। यह बस नॉइज़ जोड़ने वाला एक गणितीय सूत्र है। रिवर्स प्रक्रिया वह जगह है जहाँ न्यूरल नेटवर्क रहता है। सारी बुद्धिमानी इसी दूसरी दिशा को चलाना सीखने में है।

U-Net की भूमिका

ज़्यादातर डिफ्यूज़न मॉडल जिस न्यूरल नेटवर्क आर्किटेक्चर का उपयोग करते हैं, उसे U-Net कहते हैं। इसका नाम इसके आकार से आया है: यह इमेज को एक छोटे प्रतिनिधित्व में संपीड़ित करता है (U का निचला हिस्सा), फिर उसे पूरे आकार तक फैलाता है (U का दाहिना हिस्सा), और दोनों तरफ़ के मिलते-जुलते स्तरों के बीच कनेक्शन होते हैं।

यह आर्किटेक्चर इमेज प्रोसेस करने में खास तौर पर अच्छा है, क्योंकि:

  • संपीड़न वैश्विक संरचना पकड़ता है (क्या यह बाहरी दृश्य है या अंदरूनी?)
  • विस्तार बारीक विवरण दोबारा बनाता है (यहाँ घास की बनावट कैसी दिखती है?)
  • स्किप कनेक्शन बारीक विवरणों को संपीड़न से सीधे विस्तार तक पहुँचने देते हैं, बिना खोए

Flux Dev जैसे नए मॉडल U-Net की जगह ट्रांसफ़ॉर्मर-आधारित आर्किटेक्चर की ओर बढ़े हैं, जो बहुत ऊँचे रिज़ॉल्यूशन को ज़्यादा कुशलता से संभालते हैं और प्रॉम्प्ट का अधिक सूक्ष्म अनुसरण करने देते हैं।

टेक्स्ट प्रॉम्प्ट और वे नॉइज़ को कैसे दिशा देते हैं

साफ़ सफ़ेद डेस्क पर लैपटॉप कीबोर्ड पर टेक्स्ट प्रॉम्प्ट टाइप करते हाथों का ऊपर से लिया गया दृश्य

यह समझाना कि डिफ्यूज़न मॉडल नॉइज़ से इमेज कैसे बनाता है, कहानी का पहला हिस्सा है। दूसरा हिस्सा यह समझाना है कि टेक्स्ट प्रॉम्प्ट यह कैसे नियंत्रित करते हैं कि कौन-सी इमेज उभरेगी। यहीं टेक्स्ट-टू-इमेज मॉडल साधारण डिफ्यूज़न मॉडल से अलग होते हैं।

CLIP और शब्दों व इमेज के बीच का पुल

टेक्स्ट-गाइडेड डिफ्यूज़न मॉडल आपके लिखे प्रॉम्प्ट को संख्यात्मक प्रतिनिधित्व में बदलने के लिए CLIP (या इससे मिलते-जुलते टेक्स्ट एनकोडर) नाम का एक अलग मॉडल इस्तेमाल करते हैं। CLIP को इंटरनेट से सैकड़ों मिलियन इमेज-टेक्स्ट जोड़ियों पर ट्रेन किया गया था, ताकि वह सीख सके कि कौन-से शब्द और वाक्यांश किन विज़ुअल अवधारणाओं के साथ आम तौर पर दिखते हैं।

जब आप प्रॉम्प्ट टाइप करते हैं, तो CLIP उसे एक वेक्टर में बदल देता है, यानी संख्याओं की एक सूची जो आपके टेक्स्ट का अर्थ एक ऐसे स्पेस में दर्शाती है जहाँ संबंधित अवधारणाएँ पास-पास होती हैं। "लकड़ी की मेज़ पर एक लाल सेब" वाला प्रॉम्प्ट एक ऐसा वेक्टर बनाता है जो "फल", "किचन स्टिल लाइफ" और "प्राकृतिक रोशनी" जैसी संबंधित अवधारणाओं के वेक्टरों के गणितीय रूप से करीब होता है।

वह वेक्टर हर डीनॉइज़िंग चरण पर डिफ्यूज़न मॉडल में डाला जाता है, और एक स्थिर गाइड की तरह काम करता है जो उभरती इमेज को वर्णित अवधारणा की ओर खींचता है। इस मार्गदर्शन के बिना, मॉडल बस रैंडम फ़ोटोरियलिस्टिक इमेज बनाता, जिनका आपके शब्दों से कोई संबंध न होता।

क्लासिफ़ायर-फ़्री गाइडेंस

एक तकनीक है जिसे क्लासिफ़ायर-फ़्री गाइडेंस कहते हैं, जो टेक्स्ट-टू-इमेज नतीजों को काफ़ी ज़्यादा तीखा और प्रॉम्प्ट के ज़्यादा करीब बनाती है। इसका बुनियादी विचार यह है:

हर डीनॉइज़िंग चरण पर मॉडल दो बार चलता है:

  1. एक बार प्रॉम्प्ट के साथ, आपके विवरण पर आधारित नॉइज़ का अनुमान लगाते हुए
  2. एक बार बिना किसी प्रॉम्प्ट के, केवल इमेज से नॉइज़ का अनुमान लगाते हुए

अंतिम नॉइज़ अनुमान दोनों को मिलाता है: बिना प्रॉम्प्ट वाले अनुमान से शुरू करें और प्रॉम्प्ट वाले तथा बिना प्रॉम्प्ट वाले अनुमानों के अंतर का एक बढ़ाया हुआ रूप जोड़ें। यह बढ़ोतरी (जो कई इंटरफ़ेस में गाइडेंस स्केल सेटिंग के रूप में दिखती है) आउटपुट को आपके प्रॉम्प्ट की ओर ज़्यादा ज़ोर से धकेलती है, लेकिन इसकी कीमत इमेज की विविधता के कुछ हिस्से से चुकानी पड़ती है।

💡 व्यावहारिक टिप: गाइडेंस स्केल की ऊँची वैल्यू (7-10) ऐसी इमेज देती हैं जो आपके प्रॉम्प्ट से बहुत शाब्दिक रूप से मेल खाती हैं। निचली वैल्यू (3-5) ज़्यादा रचनात्मक, पर कभी-कभी अनपेक्षित नतीजे देती हैं।

अभी लोकप्रिय डिफ्यूज़न मॉडल

गहरे स्लेट पर साथ-साथ रखे दो प्रिंटेड फ़ोटोग्राफ़िक पोर्ट्रेट, बाईं ओर नॉइज़ वाला और धुंधला, दाईं ओर चटक डिटेल के साथ बेहद तीखा

डिफ्यूज़न मॉडल का परिदृश्य तेज़ी से बदला है। जो मॉडल दो साल पहले सबसे उन्नत था, उसे आज उपलब्ध मॉडल अक्सर काफ़ी पीछे छोड़ देते हैं। स्थिति यह है।

Stable Diffusion और उसके वर्ज़न

Stable Diffusion वह मॉडल था जिसने डिफ्यूज़न इमेज जनरेशन को आम लोगों तक पहुँचाया। 2022 में Stability AI द्वारा जारी किया गया, यह पहला बड़ा टेक्स्ट-टू-इमेज मॉडल था जिसके ओपन वेट्स थे, यानी कोई भी इसे अपने हार्डवेयर पर चला सकता था।

इसका मूल नवाचार लेटेंट डिफ्यूज़न था: पिक्सल वैल्यू पर सीधे डीनॉइज़िंग प्रक्रिया चलाने के बजाय (जो ऊँचे रिज़ॉल्यूशन पर कम्प्यूटेशनल रूप से महँगी है), यह प्रक्रिया एक संपीड़ित "लेटेंट स्पेस" में चलाता है और नतीजे को अंत में ही पिक्सल में डिकोड करता है। इसी से उपभोक्ता हार्डवेयर पर उच्च-गुणवत्ता जनरेशन व्यावहारिक बनी।

तब से इस परिवार का काफ़ी विस्तार हुआ है:

  • Stable Diffusion 3.5 Large बेहतर प्रॉम्प्ट अनुसरण और बारीक विवरण रेंडर करने के लिए ट्रांसफ़ॉर्मर-आधारित आर्किटेक्चर इस्तेमाल करता है
  • Stable Diffusion 3.5 Medium रोज़मर्रा के उपयोग के लिए गुणवत्ता और जनरेशन गति के बीच अच्छा संतुलन देता है
  • SDXL ने ऊँचा नेटिव रिज़ॉल्यूशन और जटिल मल्टी-सब्जेक्ट कंपोज़िशन को बेहतर तरीके से संभालना शुरू किया

Flux और नई पीढ़ी

गहरे बालों वाली एक युवा महिला सोफ़े पर बैठकर टैबलेट पर AI से बने पोर्ट्रेट इमेज की गैलरी देख रही है

Black Forest Labs का Flux परिवार ओपन-सोर्स डिफ्यूज़न मॉडल में इस समय सबसे उन्नत परिवार है। Stable Diffusion बनाने वाले कई उन्हीं रिसर्चरों द्वारा बनाया गया Flux पारंपरिक डिफ्यूज़न की जगह फ़्लो मैचिंग तरीका अपनाता है, जिससे यह तकनीकी रूप से शुद्ध डिफ्यूज़न मॉडल की बजाय उसका करीबी रिश्तेदार बन जाता है, लेकिन यह उन्हीं मूल सिद्धांतों पर काम करता है और उसी तरह ट्रेन होता है।

मॉडलसबसे अच्छा किसके लिएगति
Flux Schnellतेज़ प्रोटोटाइपिंग, ज़्यादा मात्राबहुत तेज़ (1-4 चरण)
Flux Devगुणवत्तापूर्ण रचनात्मक काममध्यम
Flux Proकमर्शियल-ग्रेड आउटपुटमध्यम
Flux 1.1 Proअधिकतम गुणवत्ता वाला प्रोडक्शनमध्यम
Flux 2 Proइमेज जनरेशन और एडिटिंगमध्यम

Flux को जो अलग बनाता है वह है इमेज के भीतर टेक्स्ट को असाधारण रूप से संभालना, बारीक शारीरिक विवरण और प्रॉम्प्ट की सटीकता। जहाँ पिछले मॉडल किसी दृश्य में सुसंगत हाथ या पढ़ने योग्य शब्द बनाने में संघर्ष करते थे, वहीं Flux दोनों को भरोसेमंद तरीके से संभालता है।

अन्य उल्लेखनीय मॉडल

डिफ्यूज़न मॉडल का इकोसिस्टम इन दो परिवारों से काफ़ी आगे तक फैला है। कुछ और जिन्हें जानना उपयोगी है:

  • Google का Imagen 4 विस्तृत रेंज के विषयों में समृद्ध फ़ोटोरियलिज़्म और बेहतरीन लाइटिंग फ़िडेलिटी देता है
  • AI Forever का Kandinsky 2 मल्टीलिंगुअल प्रॉम्प्ट के लिए मज़बूत समर्थन देता है, जिससे यह दुनिया भर में अधिक सुलभ बनता है
  • Material Diffusion 3D वर्क, गेम डेवलपमेंट और प्रोडक्ट डिज़ाइन के लिए सीमलेस टाइलेबल टेक्सचर जनरेट करने में विशेषज्ञ है
  • Realistic Vision v5.1 खास तौर पर फ़ोटोरियलिस्टिक पोर्ट्रेट और लाइफ़स्टाइल फ़ोटोग्राफ़ी के लिए फ़ाइन-ट्यून किया गया है

अभी इन मॉडलों को आज़माएँ

गोल्डन आवर की समृद्ध रोशनी और बेहद तीखे डिटेल वाली AI से बनी पोर्ट्रेट फ़ोटो प्रिंट को थामे हुए हाथ

इन मॉडलों को आज चलाने के लिए आपको GPU, Python एनवायरनमेंट या किसी तकनीकी पृष्ठभूमि की ज़रूरत नहीं है। PicassoIA आपको ब्राउज़र इंटरफ़ेस के ज़रिए 91 से ज़्यादा टेक्स्ट-टू-इमेज डिफ्यूज़न मॉडल तक सीधी पहुँच देता है, और इंस्टॉलेशन की ज़रूरत नहीं है।

अभी आप ये काम कर सकते हैं:

  • Flux Dev या Stable Diffusion 3.5 Large का उपयोग करके पोर्ट्रेट, लैंडस्केप और प्रोडक्ट शॉट बनाएँ
  • Flux Schnell की तुलना Flux 1.1 Pro Ultra से करके गति बनाम गुणवत्ता का प्रयोग करें
  • इनपेंटिंग और आउटपेंटिंग टूल्स से मौजूदा फ़ोटो एडिट करें, जो डिफ्यूज़न का उपयोग करके इमेज को स्वाभाविक रूप से भरते या बढ़ाते हैं
  • सुपर-रिज़ॉल्यूशन मॉडल से इमेज अपस्केल और रिस्टोर करें, जो बारीक विवरण वापस लाने के लिए मिलते-जुलते डीनॉइज़िंग सिद्धांत लागू करते हैं

घुंघराले बालों वाली एक महिला रोशन होम ऑफ़िस में अपने लैपटॉप को देखकर मुस्कुराती हुई, जिस पर AI से बनी इमेज के नतीजे दिख रहे हैं

डिफ्यूज़न मॉडल क्या कर रहा है, इसकी समझ बनाने का सबसे अच्छा तरीका है उसे इस्तेमाल करना। एक प्रॉम्प्ट टाइप करें, नतीजा देखें, एक शब्द बदलें, और देखें कि वह कैसे बदलता है। कुछ मिनट के हाथों-हाथ अनुभव से जो समझ बनती है, वह घंटों की व्याख्याएँ पढ़ने से ज़्यादा कीमती है।

डिफ्यूज़न मॉडल इसलिए काम करते हैं क्योंकि उन्होंने दुनिया से सीखा है। वे जो भी इमेज बनाते हैं, उसमें लाखों असली फ़ोटो का सांख्यिकीय निशान होता है। जब आप एक विवरण लिखते हैं और इमेज सामने आती है, तो आप ऐसा मॉडल देख रहे होते हैं जिसने एक ही सवाल का जवाब सीखने में अरबों ट्रेनिंग चरण बिताए: जब सारी रैंडमनेस हटा दी जाए, तो दुनिया कैसी दिखती है?

यह सवाल, बड़े पैमाने पर पूछा जाए, तो ऐसी चीज़ देता है जो वास्तविकता के बहुत करीब है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख