अनसेंसर्ड डिफ्यूज़न मॉडल कैसे काम करते हैं: बिना प्रतिबंध वाली AI आर्ट के असली मैकेनिज़्म

अनसेंसर्ड डिफ्यूज़न मॉडल के आर्किटेक्चर का विस्तृत विश्लेषण: लेटेंट स्पेस डीनॉइज़िंग से लेकर CLIP टेक्स्ट एन्कोडिंग, सेफ़्टी फ़िल्टर हटाने और NSFW फ़ाइन-ट्यूनिंग से यह कैसे बदलता है कि AI इमेज जनरेटर क्या बना सकते हैं।

अनसेंसर्ड डिफ्यूज़न मॉडल कैसे काम करते हैं: बिना प्रतिबंध वाली AI आर्ट के असली मैकेनिज़्म
Cristian Da Conceicao
Picasso IA के संस्थापक

जिस पल एक टेक्स्ट प्रॉम्प्ट फ़ोटोरियलिस्टिक इमेज बनता है, उसके पीछे अरबों गणितीय ऑपरेशन एक के बाद एक चलते हैं और शुद्ध रैंडम नॉइज़ को सुसंगत विज़ुअल जानकारी में बदलते हैं, जो ठीक वैसी ही होती है जैसा आपने बताया था। अनसेंसर्ड डिफ्यूज़न मॉडल भी यही करते हैं, लेकिन उन गार्डरेल के बिना जो ज़्यादातर कमर्शियल प्लेटफ़ॉर्म डिफ़ॉल्ट रूप से लगाते हैं। नतीजा ऐसी AI इमेज जनरेशन है जो इंसानी क्रिएटिव इरादे की पूरी रेंज का जवाब देती है, साधारण से लेकर उत्तेजक तक। यह समझना सिर्फ़ तकनीकी जिज्ञासा नहीं है; यह आधुनिक AI इमेज जनरेशन के मूल आर्किटेक्चर को उजागर करता है, और यह भी बताता है कि कुछ मॉडल ऐसे नतीजे क्यों देते हैं जो दूसरे नहीं दे सकते।

AI में "अनसेंसर्ड" का असली मतलब क्या है

ज़्यादातर लोग मानते हैं कि डिफ्यूज़न मॉडल से सेफ़्टी फ़िल्टर हटाना कॉन्फ़िगरेशन फ़ाइल में छिपा एक सीधा ऑन/ऑफ़ टॉगल है। असलियत इससे कहीं ज़्यादा जटिल है, और कहीं ज़्यादा दिलचस्प भी।

डिफ़ॉल्ट सेफ़्टी चेकर

स्टैंडर्ड Stable Diffusion रिलीज़ के साथ एक सेफ़्टी चेकर आता है, एक सेकेंडरी क्लासिफ़िकेशन मॉडल जो हर बनी हुई इमेज को आप तक पहुँचने से पहले जाँचता है। जब उसे कोई ऐसा कंटेंट मिलता है जिसे वह अनुचित मानता है, तो वह आउटपुट को काली इमेज से बदल देता है। सेफ़्टी चेकर डिफ्यूज़न मॉडल का हिस्सा नहीं है; यह एक पोस्ट-प्रोसेसिंग फ़िल्टर के रूप में काम करता है, जो जनरेशन पूरी होने के बाद लगाया जाता है।

इसे हटाना पाइपलाइन कॉन्फ़िगरेशन में safety_checker=None सेट करने जितना आसान है। लेकिन अकेले इससे कोई मॉडल "अनसेंसर्ड" नहीं बन जाता। केवल साफ़ डेटासेट पर ट्रेन किया गया मॉडल भी स्पष्ट या उत्तेजक कंटेंट को विश्वसनीय ढंग से बनाने में संघर्ष करेगा, क्योंकि ट्रेनिंग डेटा ही तय करता है कि मॉडल क्या रेंडर करना जानता है। फ़िल्टर प्रतिबंध का सबसे कम दिलचस्प हिस्सा है।

ट्रेनिंग डेटा ही असली फ़िल्टर है

प्रतिबंध की अधिक महत्वपूर्ण परत ट्रेनिंग डेटा में होती है। Stable Diffusion जैसे मूल मॉडल LAION-5B पर ट्रेन किए गए थे, जो एक विशाल वेब-स्क्रैप्ड डेटासेट है और जिसे ट्रेनिंग शुरू होने से पहले स्पष्ट NSFW कंटेंट हटाने के लिए फ़िल्टर किया गया था। मॉडल ने वह सामग्री कभी देखी ही नहीं, इसलिए उसके पास उसे लगातार या अच्छी गुणवत्ता में बनाने की सीमित क्षमता है।

असली अनसेंसर्ड मॉडल ऐसे डेटासेट पर फ़ाइन-ट्यून किए जाते हैं जिनमें वयस्क कंटेंट, आर्टिस्टिक न्यूडिटी और उत्तेजक इमेज उनके विवरणात्मक कैप्शन के साथ शामिल होते हैं। यह फ़ाइन-ट्यूनिंग प्रक्रिया U-Net आर्किटेक्चर के वेट्स को समायोजित करती है, ताकि मॉडल मानव शरीर, अंतरंग लाइटिंग स्थितियों और उत्तेजक कंपोज़िशन का एक समृद्ध आंतरिक प्रतिनिधित्व बना सके, जो फ़िल्टर किए गए मॉडलों में सिरे से नहीं होता। सेफ़्टी चेकर हटाए गए फ़िल्टर्ड बेस मॉडल और ठीक से फ़ाइन-ट्यून किए गए अनसेंसर्ड मॉडल के आउटपुट की गुणवत्ता में ज़मीन-आसमान का फ़र्क है।

AI-जनरेटेड मानव इमेजरी की गुणवत्ता दर्शाता एक फ़ोटोरियलिस्टिक पोर्ट्रेट

डिफ़्यूज़न प्रक्रिया: नॉइज़ से इमेज तक

यह समझने के लिए कि अनसेंसर्ड ट्रेनिंग डेटा इतना अहम क्यों है, आपको देखना होगा कि डिफ्यूज़न मॉडल इमेज कैसे बनाते हैं, एक-एक चरण में।

फ़ॉरवर्ड और रिवर्स डिफ़्यूज़न

डिफ्यूज़न मॉडल दो-चरणीय प्रक्रिया से ट्रेन होते हैं। फ़ॉरवर्ड प्रक्रिया में मॉडल को लाखों असली इमेज दिखाई जाती हैं और वह देखता है कि हर इमेज में छोटे-छोटे चरणों में Gaussian नॉइज़ जोड़ा जाता है, जब तक मूल इमेज पूरी तरह स्टैटिक से ढक न जाए। मॉडल विभिन्न नॉइज़ स्तरों और चरणों पर इस विनाश को देखता है, और यह आंतरिक मानचित्र बनाता है कि अलग-अलग मात्रा का नॉइज़ विभिन्न विज़ुअल अवधारणाओं के साथ क्या करता है।

रिवर्स प्रक्रिया में मॉडल को उस नॉइज़ का अनुमान लगाकर उसे एक-एक चरण में घटाना सिखाया जाता है, जब तक एक साफ़ इमेज फिर से उभर न आए। यह कोई मेमोराइज़ेशन का काम नहीं है; मॉडल यह सांख्यिकीय समझ बना रहा है कि किसी भी नॉइज़ वाली स्थिति के नीचे कौन-सी विज़ुअल जानकारी सबसे संभावित रूप से मौजूद होगी, जो दिए गए टेक्स्ट प्रॉम्प्ट पर निर्भर है।

इनफ़रेंस के दौरान, यानी जब आप वास्तव में इमेज बनाते हैं, मॉडल शुद्ध रैंडम नॉइज़ से शुरू करता है और रिवर्स प्रक्रिया को बार-बार लागू करता है। हर डीनॉइज़िंग चरण लेटेंट रिप्रेज़ेंटेशन को उस सुसंगत इमेज की ओर थोड़ा और करीब ले जाता है जो आपके टेक्स्ट प्रॉम्प्ट से मेल खाती है। यही डीनॉइज़िंग लूप है, और यह आपके कॉन्फ़िगर किए गए सैंपलिंग स्टेप्स जितनी बार चलता है, जो ज़्यादातर मॉडलों के लिए आम तौर पर 20 से 50 के बीच होते हैं।

लेटेंट स्पेस

आधुनिक डिफ्यूज़न मॉडल पिक्सल डेटा पर सीधे काम नहीं करते। वे लेटेंट स्पेस नाम की संपीड़ित रिप्रेज़ेंटेशन पर काम करते हैं, जिसे Variational Autoencoder (VAE) एन्कोड और डीकोड करता है। 512x512 की एक स्टैंडर्ड पिक्सल-स्पेस इमेज 64x64 के काफ़ी छोटे लेटेंट रिप्रेज़ेंटेशन में बदल जाती है। यह संपीड़न जेनरेशन को कहीं तेज़ बनाता है और डीनॉइज़िंग प्रक्रिया को पिक्सल-स्तर के नॉइज़ पैटर्न के बजाय उच्च-स्तरीय सिमेंटिक संरचना, कंपोज़िशन, लाइटिंग और सब्जेक्ट की पहचान पकड़ने देता है।

VAE डीकोडर अंतिम डीनॉइज़्ड लेटेंट को वापस पूरे रिज़ॉल्यूशन की इमेज में बदलता है। फ़ोटोरियलिस्टिक आउटपुट के लिए इस डीकोडर की गुणवत्ता बेहद अहम है, इसीलिए फ़ाइन-ट्यून किए गए मॉडल अक्सर U-Net के साथ कस्टम VAE वेट्स भी शामिल करते हैं। मानव शरीर रचना और त्वचा के रंगों की व्यापक रेंज पर ट्रेन किया गया VAE किसी सामान्य VAE से ज़्यादा सटीक और विस्तृत आउटपुट देगा। यही एक और कारण है कि अनसेंसर्ड फ़ाइन-ट्यूनिंग सिर्फ़ U-Net वेट्स तक सीमित नहीं रहती।

बड़े पैमाने पर AI इमेज जनरेशन को शक्ति देता GPU सर्वर इंफ़्रास्ट्रक्चर

CLIP शब्दों को इमेज में कैसे बदलता है

डिफ्यूज़न प्रक्रिया बताती है कि नॉइज़ इमेज कैसे बनता है। लेकिन आपका टेक्स्ट प्रॉम्प्ट वास्तव में यह कैसे तय करता है कि कौन-सी इमेज बनेगी?

CLIP टेक्स्ट एन्कोडर

Stable Diffusion और उसके डेरिवेटिव टेक्स्ट एन्कोडर के रूप में CLIP (Contrastive Language-Image Pretraining) का उपयोग करते हैं। CLIP को सैकड़ों मिलियन इमेज-टेक्स्ट जोड़ियों पर ट्रेन किया गया था, ताकि एक साझा एम्बेडिंग स्पेस बने जहाँ मिलती-जुलती अवधारणाएँ, चाहे शब्दों में व्यक्त हों या विज़ुअल कंटेंट में, संख्यात्मक रूप से एक साथ जुड़ जाएँ। मॉडल ने सीखा कि समुद्र तट पर एक महिला की फ़ोटो और टेक्स्ट वाक्यांश "woman on a beach" इस गणितीय स्पेस में पास-पास होने चाहिए।

जब आप प्रॉम्प्ट टाइप करते हैं, तो CLIP उसे संख्याओं के एक वेक्टर में बदलता है जिसे टेक्स्ट एम्बेडिंग कहते हैं, और यह आपके विवरण के सिमेंटिक अर्थ को एन्कोड करता है। यह एम्बेडिंग हर डीनॉइज़िंग चरण पर U-Net की cross-attention लेयर्स में डाली जाती है, और मॉडल को आपके शब्दों से मेल खाने वाली विज़ुअल अवधारणाओं की ओर ले जाती है। आपका टेक्स्ट जितना समृद्ध और विशिष्ट होगा, CLIP आपके इरादे को उतना ही सटीक एन्कोड कर पाएगा, और U-Net उसे उतनी ही सटीकता से बना पाएगा।

अनसेंसर्ड फ़ाइन-ट्यूनिंग में अक्सर सिर्फ़ U-Net ही नहीं, टेक्स्ट एन्कोडर के अपडेट भी शामिल होते हैं। जब किसी मॉडल को विशिष्ट विवरणात्मक शब्दावली के साथ स्पष्ट इमेजरी दिखाई जाती है, तो CLIP का आंतरिक एम्बेडिंग स्पेस उन अवधारणाओं को उन विज़ुअल रिप्रेज़ेंटेशन के सापेक्ष अधिक उपयोगी स्थानों पर खिसका देता है जो U-Net बनाता है। यही संरेखण अनसेंसर्ड मॉडलों को स्पष्ट प्रॉम्प्ट पर भरोसेमंद ढंग से प्रतिक्रिया देने देता है, न कि अस्पष्ट या शारीरिक रूप से असंगत नतीजे देने देता है।

क्लासिफ़ायर-फ़्री गाइडेंस

किसी भी डिफ्यूज़न मॉडल का एक सबसे महत्वपूर्ण पैरामीटर CFG स्केल है, जिसे क्लासिफ़ायर-फ़्री गाइडेंस स्केल भी कहते हैं। ऊँची CFG वैल्यू मॉडल को हर डीनॉइज़िंग चरण पर प्रॉम्प्ट से ज़्यादा सख्ती से चिपकने पर मजबूर करती है, पर इसकी कीमत इमेज की स्वाभाविकता और विविधता में कुछ कमी के रूप में चुकानी पड़ती है। कम वैल्यू टेक्स्ट से ज़्यादा रचनात्मक विचलन की अनुमति देती हैं, जिससे ज़्यादा स्वाभाविक नतीजे मिल सकते हैं, लेकिन वे वह विशेष विवरण छोड़ सकती हैं जो आपने माँगा था।

क्लासिफ़ायर-फ़्री गाइडेंस हर चरण पर डीनॉइज़िंग प्रक्रिया को दो बार चलाकर काम करता है: एक बार आपके टेक्स्ट एम्बेडिंग के साथ (कंडिशन्ड जेनरेशन) और एक बार बिना किसी टेक्स्ट के (अनकंडिशन्ड जेनरेशन)। फिर मॉडल इन दोनों आउटपुट के अंतर को CFG स्केल फ़ैक्टर से बढ़ाता है, जिससे नतीजा उसी दिशा में और आगे जाता है जिधर आपका टेक्स्ट इशारा कर रहा है।

अनसेंसर्ड जेनरेशन के लिए CFG स्केल इसलिए मायने रखता है क्योंकि मॉडल को वह विशिष्ट कंटेंट बनाने के लिए पर्याप्त मार्गदर्शन चाहिए जो आप वर्णन करते हैं, लेकिन इतना कठोर भी न हो कि वह उन "सुरक्षित" विज़ुअल पैटर्न पर लौट जाए जो उसके बेस वेट्स में सबसे ज़्यादा दर्ज हैं। मॉडल और सैंपलर के आधार पर, 5 से 9 के बीच का CFG स्केल NSFW कंटेंट के लिए आम तौर पर सबसे अच्छा संतुलन देता है।

प्रॉम्प्ट टिप: नेगेटिव प्रॉम्प्ट भी पॉज़िटिव प्रॉम्प्ट जितने ही ज़रूरी हैं। इनका उपयोग धुंधलापन, अतिरिक्त अंग और शारीरिक विकृतियाँ दबाने के लिए करें, जो उन कंटेंट में ज़्यादा आम हो जाती हैं जिन्हें मॉडल की ट्रेनिंग डिस्ट्रीब्यूशन की सीमा पर धकेला गया हो।

मॉडल पैरामीटर का विश्लेषण करते एक शोधकर्ता की वर्कस्टेशन पर तस्वीर

लोकप्रिय मॉडल और उनका आर्किटेक्चर

अलग-अलग मॉडल आर्किटेक्चर अनसेंसर्ड जेनरेशन को अलग-अलग तरीकों से संभालते हैं। यहाँ सबसे प्रमुख मॉडलों की तुलना है।

SDXL और उसके डेरिवेटिव

SDXL ने एक दो-चरणीय आर्किटेक्चर पेश किया: एक बेस मॉडल जो कम-रिज़ॉल्यूशन लेटेंट बनाता है, और उसके बाद एक रिफ़ाइनर मॉडल जो दूसरे पास में हाई-फ़्रीक्वेंसी डिटेल जोड़ता है। बड़ी पैरामीटर संख्या (Stable Diffusion 1.5 के 860 मिलियन के मुकाबले 3.5 बिलियन) SDXL को कहीं बेहतर शारीरिक संरचना, लाइटिंग की सुसंगति और कंपोज़िशन पर नियंत्रण देती है। यही बड़ी क्षमता SDXL फ़ाइन-ट्यूनिंग को अनसेंसर्ड कंटेंट के लिए इतना प्रभावी बनाती है; मॉडल में बारीक प्रतिनिधित्व के लिए सीधे-सीधे ज़्यादा जगह होती है।

SDXL Lightning एक डिस्टिल्ड वर्ज़न है, जो सिर्फ़ 4 सैंपलिंग स्टेप्स में तुलनीय गुणवत्ता हासिल करता है, जिससे कंपोज़िशन और पोज़ परखते समय तेज़ इटरेशन व्यावहारिक हो जाता है। इसकी कीमत बारीक प्रॉम्प्ट विवरणों के पालन में थोड़ी कमी है, लेकिन ज़्यादातर उपयोग मामलों में गति का लाभ इस सटीकता के नुकसान से अधिक होता है।

Dreamshaper XL Turbo जैसे कम्युनिटी फ़ाइन-ट्यून SDXL बेस के ऊपर अतिरिक्त ट्रेनिंग जोड़ते हैं, और ऐसे मॉडल बनाते हैं जो तेज़ भी हैं और कई स्टाइल में फ़ोटोरियलिस्टिक मानव आकृति बनाने में सक्षम भी।

मॉडलआर्किटेक्चरसैंपलिंग स्टेप्सकिसके लिए सबसे अच्छा
SDXLडुअल-स्टेज UNet20-30हाई डिटेल, जटिल दृश्य
SDXL Lightningडिस्टिल्ड SDXL4-8स्पीड, तेज़ प्रयोग
Dreamshaper XLफ़ाइन-ट्यून्ड SDXL10-20स्टाइलाइज़्ड रियलिज़्म
Realistic Vision v5.1SD 1.5 फ़ाइन-ट्यून20-30फ़ोटोरियलिस्टिक पोर्ट्रेट

Realistic Vision और Photon

Realistic Vision v5.1 फ़ोटोरियलिस्टिक मानव फ़ोटोग्राफ़ी के लिए सबसे लगातार सक्षम मॉडलों में से एक बना हुआ है। इसे उच्च-गुणवत्ता वाले फ़ोटोग्राफ़ी डेटासेट पर व्यापक रूप से फ़ाइन-ट्यून किया गया था, और यह त्वचा की बनावट, बालों की बारीक लटों और प्राकृतिक लाइटिंग व्यवहार ऐसे पैदा करता है जिनका मिलान कई नए और बड़े मॉडल अब भी नहीं कर पाते। इसका अपेक्षाकृत छोटा आकार (SD 1.5 आधारित) ज़्यादातर हार्डवेयर पर तेज़ जेनरेशन समय भी देता है।

Luma Photon एक अलग तरीका अपनाता है, जो स्टाइलिस्टिक स्थिरता के बजाय प्रॉम्प्ट के पालन और कंपोज़िशन की सटीकता को प्राथमिकता देता है। यह जटिल मल्टी-सब्जेक्ट दृश्यों और असामान्य कैमरा एंगल में उत्कृष्ट है, और दिखाता है कि CLIP में सुधार और U-Net फ़ाइन-ट्यूनिंग मिलकर जेनरेशन के दौरान मॉडल की प्राथमिकताओं को कितना बदल सकते हैं।

फ़ोटोरियलिस्टिक AI आउटपुट क्षमता दर्शाता एक प्राकृतिक बाहरी पोर्ट्रेट

Flux और DiT आर्किटेक्चर

Flux Schnell LoRA और Flux Pro Finetuned क्लासिक U-Net डिफ्यूज़न आर्किटेक्चर से एक बुनियादी बदलाव दर्शाते हैं। Flux एक Diffusion Transformer (DiT) का उपयोग करता है, जो U-Net की कनवोल्यूशनल लेयर्स की जगह पूरे मॉडल में self-attention और cross-attention मैकेनिज़्म लगाता है। नतीजा टेक्स्ट के पालन में काफ़ी बेहतर है, जटिल पोज़ में शारीरिक संरचना अधिक सुसंगत है, और कई सब्जेक्ट्स के बीच स्पेसियल रिश्तों को संभालना भी बेहतर हुआ है।

LoRA वर्ज़न अनसेंसर्ड उपयोगों के लिए खास तौर पर काम के हैं। LoRA (Low-Rank Adaptation) पूरे मॉडल को दोबारा ट्रेन किए बिना लक्षित वेट एडजस्टमेंट की अनुमति देता है, यानी बेस Flux आर्किटेक्चर बरकरार रहता है, जबकि अलग और हल्के LoRA वेट्स नई जेनरेशन क्षमताएँ जोड़ते हैं। कई LoRA को इनफ़रेंस के समय मिलाकर और वज़न देकर इस्तेमाल किया जा सकता है, जिससे अलग-अलग स्टाइल और कंटेंट प्रकारों को मिलाने वाले बेहद कस्टमाइज़्ड जेनरेशन प्रोफ़ाइल बनते हैं।

फ़ाइन-ट्यूनिंग अनसेंसर्ड मॉडल कैसे बनाती है

फ़ाइन-ट्यूनिंग वह प्रक्रिया है जो असल में सेंसर्ड बेस मॉडल को अनसेंसर्ड में बदलती है। यह सिर्फ़ मॉडल को स्पष्ट इमेज दिखाने से कहीं ज़्यादा सूक्ष्म है।

फ़ाइन-ट्यूनिंग के दौरान क्या होता है

जब कोई डेवलपर मौजूदा मॉडल को NSFW कंटेंट पर फ़ाइन-ट्यून करता है, तो वह क्यूरेटेड डेटासेट का उपयोग करके अतिरिक्त ट्रेनिंग पास चलाता है, जिसमें स्पष्ट या उत्तेजक इमेज होती हैं और हर एक के साथ विवरणात्मक टेक्स्ट कैप्शन जुड़े होते हैं। इस प्रक्रिया के दौरान ग्रेडिएंट अपडेट U-Net वेट्स को समायोजित करते हैं, खासकर cross-attention लेयर्स में, जहाँ टेक्स्ट एम्बेडिंग विज़ुअल फ़ीचर मैप्स से मिलती हैं। इससे विवरणात्मक शब्दावली और उन विज़ुअल रिप्रेज़ेंटेशन के बीच मज़बूत संबंध बनते हैं जो मॉडल को बनाने चाहिए।

फ़ाइन-ट्यूनिंग मॉडल की मौजूदा क्षमताओं को मिटाती नहीं है। यह मौजूदा संबंधों के ऊपर नए संबंध जोड़ती है, इसीलिए अच्छी तरह की गई अनसेंसर्ड फ़ाइन-ट्यूनिंग अपने बेस मॉडल की कंपोज़िशन समझ, लाइटिंग संवेदनशीलता और स्टाइल की रेंज बनाए रखती है। दूसरी ओर, खराब तरीके से की गई फ़ाइन-ट्यूनिंग आर्टिफ़ैक्ट ला सकती है, शारीरिक सटीकता घटा सकती है, या ऐसे प्रॉम्प्ट के हिस्सों को अनदेखा करवा सकती है जो उसके फ़ाइन-ट्यूनिंग डेटा के संकीर्ण डिस्ट्रीब्यूशन से टकराते हैं।

LoRA बनाम फ़ुल फ़ाइन-ट्यूनिंग

अनसेंसर्ड मॉडल बनाने के दो प्रमुख तरीके हैं, और हर एक के अपने अलग समझौते हैं:

  • फ़ुल फ़ाइन-ट्यूनिंग: हर ट्रेनिंग पास में सभी मॉडल वेट्स अपडेट होते हैं। यह सबसे गहराई से एकीकृत नतीजे और सबसे अच्छी शारीरिक सुसंगति देता है, लेकिन इसके लिए भारी GPU कंप्यूट, कई दिनों का ट्रेनिंग समय चाहिए, और सावधानी से न संभाला जाए तो बेस मॉडल की क्षमताओं के "कैटेस्ट्रॉफ़िक फ़ॉरगेटिंग" का जोखिम रहता है।
  • LoRA फ़ाइन-ट्यूनिंग: छोटे रैंक-डिकम्पोज़िशन मैट्रिक्स खास वेट लेयर्स में डाले जाते हैं और ट्रेनिंग के दौरान केवल वही मैट्रिक्स अपडेट होते हैं। ट्रेन करना कहीं सस्ता है, छोटी फ़ाइलों के रूप में साझा करना आसान है, इनफ़रेंस के समय मिलाने के लायक है, और बेस मॉडल की गुणवत्ता घटने का जोखिम न्यूनतम है।

ज़्यादातर सार्वजनिक रूप से उपलब्ध अनसेंसर्ड मॉडल या तो SD 1.5 या SDXL बेस के फ़ुल फ़ाइन-ट्यून हैं, या Flux Schnell LoRA या SDXL बेस मॉडलों के ऊपर लगाने के लिए बनाए गए LoRA वेट्स हैं।

AI मॉडल के विकास को दर्शाता एक अकादमिक शोध वातावरण

सैंपलिंग मेथड और वे क्यों मायने रखते हैं

हर डिफ्यूज़न मॉडल एक ही सैंपलिंग एल्गोरिदम का उपयोग नहीं करता, और इस चुनाव का आउटपुट गुणवत्ता पर मापने योग्य असर पड़ता है, खासकर बारीक शारीरिक विवरणों पर।

आम सैम्पलर की तुलना

सैम्पलर तय करता है कि मॉडल हर डीनॉइज़िंग चरण पर नॉइज़ वाले लेटेंट से साफ़ इमेज तक कैसे पहुँचता है। अलग-अलग सैम्पलर सबसे अच्छे नॉइज़-हटाने के पथ का अनुमान लगाने के लिए अलग-अलग गणितीय तरीके इस्तेमाल करते हैं।

सैम्पलरगतिगुणवत्तासबसे अच्छा उपयोग
Euler Ancestralतेज़अच्छीत्वरित ड्राफ़्ट, स्टाइलाइज़्ड आउटपुट
DPM++ 2M Karrasमध्यमउत्कृष्टपोर्ट्रेट गुणवत्ता, त्वचा की डिटेल
DDIMतेज़मध्यमसुसंगत, दोहराने योग्य आउटपुट
UniPCतेज़बहुत अच्छीसामान्य उपयोग, संतुलित नतीजे

DPM++ 2M Karras फ़ोटोरियलिस्टिक मानव विषयों के लिए लगातार सबसे तीखी त्वचा की बनावट और सबसे प्राकृतिक बाल रेंडर करता है। Stable Diffusion 3.5 Large जैसे मॉडलों पर NSFW जेनरेशन के लिए यही पसंदीदा सैम्पलर है, क्योंकि बड़ी मॉडल क्षमता एक अधिक सटीक सैंपलिंग पथ से लाभ उठाती है।

सैंपलिंग स्टेप्स और उनका असर

ज़्यादा स्टेप्स अधिक परिष्कृत नतीजे देते हैं, लेकिन एक सीमा के बाद घटते लाभ के साथ। ज़्यादातर अनसेंसर्ड मॉडलों के लिए व्यावहारिक विभाजन कुछ ऐसा दिखता है:

  • 10-15 स्टेप्स: तेज़ प्रीव्यू गुणवत्ता, पूरी जेनरेशन से पहले कंपोज़िशन और पोज़ परखने के लिए उपयुक्त
  • 20-30 स्टेप्स: अंतिम आउटपुट के लिए मानक गुणवत्ता, ज़्यादातर उपयोगों के लिए पर्याप्त
  • 40-50 स्टेप्स: अधिकतम डिटेल निकालना, हीरो इमेज या ऐसे कंटेंट के लिए जिसे अपस्केल किया जाएगा, इसके लिए अतिरिक्त समय लगाना सार्थक है

सबसे अच्छी स्टेप संख्या सैम्पलर पर काफ़ी निर्भर करती है। Lightning और Turbo वेरिएंट ट्रेनिंग के दौरान consistency distillation का उपयोग करते हैं, ताकि 4-8 स्टेप्स में उच्च-गुणवत्ता नतीजे मिलें, ऐसी स्टेप संख्या जो एक गैर-डिस्टिल्ड मॉडल पर स्टैंडर्ड सैम्पलर से धुंधले और असंगत नतीजे देगी।

हाई-फ़िडेलिटी AI विज़ुअल आउटपुट दर्शाती इन्फ़िनिटी पूल में एक सुंदर आकृति

अनसेंसर्ड मॉडलों से गुणवत्तापूर्ण नतीजे पाना

आर्किटेक्चर जानना एक बात है। उसका उपयोग करके लगातार उच्च-गुणवत्ता वाली इमेज बनाने के लिए प्रॉम्प्टिंग का एक व्यवस्थित तरीका चाहिए।

काम करने वाली प्रॉम्प्ट संरचना

अनसेंसर्ड मॉडलों के लिए सबसे प्रभावी प्रॉम्प्ट एक सुसंगत संरचना का पालन करते हैं, जो इस तरह होती है जैसे कोई फ़ोटोग्राफ़ी ब्रीफ़ शूट का वर्णन करता है:

  1. सब्जेक्ट का विवरण विशिष्ट शारीरिक गुणों के साथ (बालों का रंग, शरीर का गठन, त्वचा का रंग)
  2. पोज़ और एक्शन दिशात्मक स्पष्टता के साथ ("पालथी मारकर बैठा हुआ, बाईं ओर मुँह किए हुए")
  3. कपड़े या उनकी अनुपस्थिति विशिष्ट कपड़े और रंग के विवरण के साथ
  4. वातावरण और बैकग्राउंड लाइट स्रोत के विनिर्देशों के साथ
  5. कैमरा और लेंस विवरण फ़ोटोग्राफ़िक सौंदर्य को स्थिर करने के लिए (85mm f/1.4, आँखों के स्तर पर)
  6. क्वालिटी मॉडिफ़ायर अंत में (8K फ़ोटोरियलिस्टिक, Kodak Portra 400 फ़िल्म ग्रेन)

सटीकता ही सब कुछ है। "समुद्र तट पर एक खूबसूरत महिला" औसत दर्जे के नतीजे देगी, क्योंकि मॉडल के पास विवरणों को उस चीज़ से भरने की बहुत आज़ादी है जो उसके ट्रेनिंग डेटा में सांख्यिकीय रूप से औसत है। "गोल्डन आवर में सफ़ेद रेत पर पालथी मारकर बैठी, सफ़ेद बिकिनी में, भूरे-लाल बाल और हल्के झाईं वाली एक महिला, 85mm f/1.4 लेंस से शूट, दाईं ओर से गर्म साइड-लाइटिंग, अग्रभूमि में बारीक रेत की बनावट, Kodak Portra 400 फ़िल्म ग्रेन, 8K फ़ोटोरियलिस्टिक" कहीं ज़्यादा सुसंगत और विस्तृत आउटपुट देता है।

प्रॉम्प्ट को बाधाओं के एक सेट की तरह सोचें, जो मॉडल के सैंपल स्पेस को धीरे-धीरे सीमित करता है। आप जो हर विशिष्ट विवरण जोड़ते हैं, वह संभावित आउटपुट के एक वर्ग को हटाता है और जेनरेशन को ठीक उसी की ओर धकेलता है जो आप वर्णन कर रहे हैं।

AI इमेज वर्कफ़्लो को दर्शाता एक क्रिएटिव स्टूडियो वातावरण

असल में मदद करने वाले नेगेटिव प्रॉम्प्ट

फ़ोटोरियलिस्टिक NSFW कंटेंट के लिए नेगेटिव प्रॉम्प्ट वैकल्पिक नहीं हैं। ये सबसे आम जेनरेशन आर्टिफ़ैक्ट हटाने का मुख्य उपकरण हैं:

  • deformed, ugly, bad anatomy, disfigured — मानव आकृतियों में संरचनात्मक गलतियों को रोकता है
  • blurry, low resolution, jpeg artifacts, pixelated — इमेज की तीखापन बनाए रखता है
  • cartoon, illustration, painting, drawing, sketch — फ़ोटोरियलिस्टिक स्टाइल को स्थिर करता है
  • extra limbs, missing fingers, fused fingers, malformed hands — सबसे आम शारीरिक विफलता वाले मोड को निशाना बनाता है
  • watermark, logo, text, signature — अवांछित ओवरले हटाता है जो अक्सर दिखाई देते हैं

Realistic Vision v5.1 या Dreamshaper XL Turbo इस्तेमाल करते समय नेगेटिव प्रॉम्प्ट में oversaturated, plastic skin, waxy, airbrushed जोड़ने से त्वचा की रियलिज़्म और बेहतर होती है, क्योंकि यह मॉडल को उस ओवर-प्रोसेस्ड लुक से दूर धकेलता है जो तब दिखता है जब फ़ाइन-ट्यूनिंग डेटा भारी एडिट की गई फ़ोटोग्राफ़ी की ओर झुका हो।

सीड पर भी ध्यान देना उपयोगी है। जब कोई जेनरेशन पसंद आए, तो उसकी सीड वैल्यू नोट करें और हर बार शुरू से दोबारा बनाने के बजाय छोटे प्रॉम्प्ट बदलावों के साथ उसी को दोबारा इस्तेमाल करें, ताकि व्यवस्थित ढंग से इटरेट किया जा सके। अच्छे नतीजे से शानदार नतीजे तक पहुँचने का यह सबसे तेज़ तरीका है।

कोस्टल लाइफ़स्टाइल फ़ोटोग्राफ़ी जो AI आउटपुट गुणवत्ता के बेंचमार्क दर्शाती है

PicassoIA पर बनाना शुरू करें

डिफ्यूज़न मॉडल, सेंसर्ड हों या नहीं, उस प्लेटफ़ॉर्म जितने ही शक्तिशाली होते हैं जो उन्हें आपके हाथों तक पहुँचाता है। PicassoIA आपको टेक्स्ट-टू-इमेज मॉडलों की पूरी रेंज का सीधा एक्सेस देता है, Realistic Vision v5.1 के फ़ोटोरियलिस्टिक आउटपुट से लेकर Flux Pro Finetuned की आर्किटेक्चरल सटीकता और Dreamshaper XL Turbo की स्टाइलिस्टिक रेंज तक। आप सैंपलिंग स्टेप्स, CFG स्केल, सीड और नेगेटिव प्रॉम्प्ट सीधे नियंत्रित करते हैं, जिसका मतलब है कि आप सफल नतीजों को दोहरा सकते हैं और किस्मत वाली जेनरेशन का इंतज़ार करने के बजाय व्यवस्थित ढंग से इटरेट कर सकते हैं।

प्लेटफ़ॉर्म जटिल कंपोज़िशन के काम के लिए Luma Photon और उन वर्कफ़्लो के लिए SDXL Lightning भी देता है जहाँ आप कम समय में कई विचार परखना चाहते हैं। इस लेख में वर्णित हर मॉडल बिना सेटअप के, बिना लोकल हार्डवेयर की ज़रूरत के, और उन घंटों की कॉन्फ़िगरेशन के बिना उपलब्ध है जो सेल्फ़-होस्टेड पाइपलाइन माँगती हैं।

इस लेख में वर्णित हर बात, लेटेंट स्पेस कंप्रेशन से लेकर CLIP टेक्स्ट एम्बेडिंग और डीनॉइज़िंग लूप तक, हर बार घटती है जब आप जेनरेट पर क्लिक करते हैं। डिफ्यूज़न प्रक्रिया का भौतिकी सिद्धांत भर नहीं है; यह आपकी बनाई हर इमेज पर रियल टाइम में चल रहा है। ऐसा मॉडल चुनें जो आप जो बनाना चाहते हैं उससे मेल खाए, एक विशिष्ट और संरचित प्रॉम्प्ट लिखें, अपना CFG स्केल 6 से 8 के बीच रखें, नेगेटिव प्रॉम्प्ट जोड़ें, और देखें कि क्या निकलता है। पहला नतीजा शायद ही अंतिम होता है, लेकिन दूसरे और तीसरे इटरेशन, जो मॉडल आपको दिखाता है उसकी जानकारी से बनते हैं, तेज़ी से वहीं ले जाते हैं जो आपके मन में था।

AI-जनरेटेड इमेज प्रदर्शित करती एक आर्ट गैलरी, जो संभावित आउटपुट की रेंज दर्शाती है

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख