AI NSFW इमेज जनरेटर असल में कैसे काम करते हैं

AI NSFW इमेज जनरेटर के पीछे की असली तकनीक की गहरी पड़ताल: डिफ्यूज़न मॉडल आर्किटेक्चर से लेकर लेटेंट स्पेस एन्कोडिंग, CLIP टेक्स्ट कंडीशनिंग, सेफ़्टी फ़िल्टर की मैकेनिक्स, LoRA फ़ाइन-ट्यूनिंग और वह सटीक कंप्यूटेशनल प्रक्रिया, जो टेक्स्ट प्रॉम्प्ट को फ़ोटोरियलिस्टिक इमेज में बदलती है।

AI NSFW इमेज जनरेटर असल में कैसे काम करते हैं
Cristian Da Conceicao
Picasso IA के संस्थापक

तस्वीरें असली लगती हैं। "AI के हिसाब से अच्छी" वाली असली नहीं, बल्कि सच में फ़ोटोरियलिस्टिक, त्वचा के रोम-छिद्र तक दिखने वाली और प्राकृतिक रोशनी वाली असली। अगर आपने कभी सोचा है कि टेक्स्ट प्रॉम्प्ट से फ़ोटोरियलिस्टिक पोर्ट्रेट बनाने वाले AI NSFW इमेज जनरेटर के अंदर असल में क्या चलता है, तो यह लेख पूरी प्रक्रिया को बिना किसी अमूर्तता के, चरण-दर-चरण समझाता है।

GPU सर्वर रैक जो AI इमेज जनरेशन को शक्ति देते हैं

डिफ्यूज़न प्रक्रिया, सरल भाषा में

नॉइज़ का इमेज से क्या लेना-देना है

डिफ्यूज़न मॉडल एक विनाश प्रक्रिया को उलटना सीखकर काम करते हैं। ट्रेनिंग के दौरान मॉडल को असली इमेज दिखाई जाती हैं, और उन इमेज को सैकड़ों स्टेप्स में धीरे-धीरे बढ़ती मात्रा के Gaussian नॉइज़ से भ्रष्ट किया जाता है, जब तक वे शुद्ध स्टैटिक जैसी न दिखने लगें। मॉडल का काम हर नॉइज़ स्तर पर यह सीखना है कि "साफ़" वर्ज़न शायद कैसा दिखता होगा।

इनफ़रेंस के समय (जब आप प्रॉम्प्ट टाइप करते हैं), प्रक्रिया उलटी चलती है। मॉडल पूरी तरह रैंडम नॉइज़ टेन्सर से शुरू करता है और स्टेप-दर-स्टेप ऐसे तरीके से नॉइज़ हटाता है जो आपके टेक्स्ट प्रॉम्प्ट से निर्देशित होता है। 20 से 50 डिनॉइज़िंग स्टेप्स के बाद आपके पास एक सुसंगत इमेज होती है।

💡 यही वजह है कि "इनफ़रेंस स्टेप्स" मायने रखते हैं। ज़्यादा स्टेप्स का मतलब है ज़्यादा रिफ़ाइनमेंट पास। बहुत कम हों तो इमेज धुंधली लगती है। बहुत ज़्यादा हों तो फ़ायदा घटने लगता है। ज़्यादातर मॉडल 25 से 40 स्टेप्स के बीच सबसे अच्छा प्रदर्शन करते हैं।

बेतरतीब पिक्सेल से परफ़ेक्ट आउटपुट तक

डिनॉइज़िंग सीधे पिक्सेल स्पेस में नहीं होती। वह कंप्यूटेशनल रूप से बहुत भारी होगी। इसके बजाय यह लेटेंट स्पेस में होती है, यानी इमेज की एक संपीड़ित गणितीय प्रस्तुति में। एक Variational Autoencoder (VAE) इमेज को इस लेटेंट स्पेस में एन्कोड करता है, डिफ्यूज़न प्रक्रिया वहीं अपना काम करती है, और आखिर में VAE डिकोडर नतीजे को पूरे रिज़ोल्यूशन की इमेज में बदल देता है।

इसी वजह से Stable Diffusion जैसे लेटेंट स्पेस मॉडल आम कंज़्यूमर हार्डवेयर पर चल सकते हैं। आप सीधे लाखों पिक्सेल प्रोसेस नहीं कर रहे होते। आप एक कॉम्पैक्ट प्रस्तुति पर काम करते हैं, जो लगभग 64 गुना छोटी है, और यही वजह है कि यह तकनीक रिसर्च लैब्स से बाहर भी पहुँच सकी।

कॉपर ट्रेस डिटेल वाला GPU सर्किट बोर्ड, मैक्रो फ़ोटोग्राफ़ी

टेक्स्ट एन्कोडर: शब्द विज़ुअल कैसे बनते हैं

CLIP और यह आपका प्रॉम्प्ट कैसे पढ़ता है

जब आप AI इमेज जनरेटर में प्रॉम्प्ट टाइप करते हैं, तो आपका टेक्स्ट सीधे डिफ्यूज़न मॉडल तक नहीं जाता। उसे पहले एक टेक्स्ट एन्कोडर प्रोसेस करता है, जो आमतौर पर CLIP (Contrastive Language-Image Pretraining) होता है। यह आपके शब्दों को एक घने संख्यात्मक वेक्टर में बदलता है, जो उनका सिमेंटिक अर्थ पकड़ता है।

CLIP को इंटरनेट से मिले सैकड़ों मिलियन इमेज-कैप्शन जोड़ों पर ट्रेन किया गया था। उसने सीखा कि मिलते-जुलते कॉन्सेप्ट्स को अपने एम्बेडिंग स्पेस में पास-पास रखना है। "Beautiful woman at sunset" और "golden hour portrait photography" उस स्पेस में एक-दूसरे के पास आते हैं, और इसी वजह से मिलते-जुलते प्रॉम्प्ट विज़ुअली मिलते-जुलते नतीजे देते हैं।

Flux 1.1 Pro और Flux 1.1 Pro Ultra जैसे नए आर्किटेक्चर CLIP और T5 टेक्स्ट एन्कोडर के संयोजन का इस्तेमाल करते हैं, जिससे पिछले Stable Diffusion मॉडल की तुलना में इनका प्रॉम्प्ट पालन कहीं बेहतर होता है। T5 एन्कोडर लंबे और जटिल प्रॉम्प्ट को भी बिना सिमेंटिक धागा खोए संभालता है।

प्रॉम्प्ट के शब्द इतने मायने क्यों रखते हैं

टेक्स्ट एम्बेडिंग पूरी डिनॉइज़िंग प्रक्रिया में एक कंडीशनिंग सिग्नल की तरह काम करता है। हर स्टेप पर U-Net (वह मुख्य न्यूरल नेटवर्क जो डिनॉइज़िंग करता है) जाँचता है: क्या यह आंशिक रूप से डिनॉइज़ हुई इमेज वैसी दिख रही है जैसा टेक्स्ट एम्बेडिंग कहता है? अगर नहीं, तो वह उसे समायोजित करता है।

इसी वजह से कुछ शब्दों का असर बहुत ज़्यादा होता है। टेक्सचर, लाइटिंग और स्टाइल बताने वाले विशेषण, जैसे "Kodak Portra", "f/1.4 bokeh", "golden hour", CLIP की सीखी हुई एसोसिएशन में इसलिए बैठे हैं क्योंकि वे ट्रेनिंग डेटा में लगातार खास विज़ुअल स्टाइल्स के साथ आए। फ़ोटोग्राफ़ी की भाषा में प्रॉम्प्ट लिखना कोई स्टाइल की पसंद भर नहीं है। यह मॉडल के विज़ुअल कॉन्सेप्ट्स की आंतरिक व्यवस्था से सीधा संपर्क है।

स्टूडियो में AI-जनरेटेड पोर्ट्रेट थंबनेल का विश्लेषण करती महिला

फ़ोटोरियलिस्टिक नतीजों के पीछे के मॉडल

Stable Diffusion और उसके वैरिएंट्स

Stability AI का Stable Diffusion वह मॉडल था जिसने आम लोगों के लिए फ़ोटोरियलिस्टिक AI इमेज जनरेशन खोला। इसके लेटेंट डिफ्यूज़न आर्किटेक्चर ने ओपन वेट्स के साथ मिलकर हर संभव निच के लिए ऑप्टिमाइज़ किए गए फ़ाइन-ट्यून्ड वैरिएंट्स का पूरा इकोसिस्टम बना दिया।

SDXL ने मूल मॉडल में काफ़ी सुधार किया। यह नेटिव 1024x1024 रिज़ोल्यूशन पर चलता है और इसमें डुअल टेक्स्ट एन्कोडर सेटअप है। इसमें एक रिफ़ाइनर मॉडल भी आया, जो दूसरे पास में हाई-फ़्रीक्वेंसी डिटेल जोड़ता है। इसी वजह से SDXL आउटपुट में साफ़ तौर पर ज़्यादा तीखापन और ज़्यादा फ़ोटोग्राफ़िक चरित्र दिखता है। SDXL Lightning 4-Step वैरिएंट इसे 4-स्टेप इनफ़रेंस प्रक्रिया में बदल देता है, बिना ज़्यादा दृश्य क्वालिटी खोए।

Stable Diffusion 3.5 Large ने Multimodal Diffusion Transformer (MMDiT) आर्किटेक्चर के साथ और आगे कदम बढ़ाया, और पारंपरिक U-Net को पूरी तरह बदल दिया। नतीजा है टेक्स्ट का कहीं बेहतर पालन और ज़्यादा सुसंगत कंपोज़िशन, खासकर हाई रिज़ोल्यूशन पर।

मॉडलआर्किटेक्चरसबसे उपयुक्तरियलिज़्म लेवल
Stable DiffusionU-Net + VAEसामान्य उपयोगअच्छा
SDXLDual U-Netपोर्ट्रेट, फ़ैशनबहुत अच्छा
SD 3.5 LargeMMDiTजटिल दृश्यउत्कृष्ट
Flux 1.1 Pro UltraFlow Matchingफ़ोटोरियलिज़्मअपनी श्रेणी में सर्वश्रेष्ठ

Flux: नया मानक

Black Forest Labs का Flux ओपन-वेट फ़ोटोरियलिस्टिक जनरेशन में अत्याधुनिक स्तर को दर्शाता है। यह मानक DDPM डिफ्यूज़न की जगह Rectified Flow आर्किटेक्चर इस्तेमाल करता है, यानी यह बहुत कम स्टेप्स में और काफ़ी बेहतर स्ट्रक्चरल सुसंगति के साथ हाई-क्वालिटी इमेज बना सकता है।

पूरी मॉडल फ़ैमिली Flux Schnell (4-स्टेप फ़ास्ट इनफ़रेंस) से लेकर Flux 2 Pro (सबसे ज़्यादा क्वालिटी, ज़्यादा कंप्यूट) तक फैली है। फ़ोटोरियलिस्टिक आउटपुट के लिए Flux को खास तौर पर प्रासंगिक बनाती है उसकी मानव शरीर-रचना, त्वचा के टेक्सचर और लाइटिंग की हैंडलिंग। ये ऐसे क्षेत्र हैं जिनमें पुराने मॉडल कुख्यात रूप से संघर्ष करते थे।

💡 शरीर-रचना मायने रखती है। पहले के डिफ्यूज़न मॉडल में हाथों को लेकर अच्छी तरह दर्ज समस्या थी: extra उँगलियाँ, जुड़ी हुई उँगलियाँ, गलत अनुपात। Flux का flow matching आर्किटेक्चर शरीर के अंगों की ज्यामिति को काफ़ी बेहतर संभालता है, क्योंकि यह नॉइज़ से इमेज तक के बीच ज़्यादा सिद्धांत-आधारित ट्रांसपोर्ट पथ इस्तेमाल करता है।

LoRA से फ़ाइन-ट्यूनिंग

LoRA (Low-Rank Adaptation) वह तरीका है जिससे मॉडल को शुरू से दोबारा ट्रेन किए बिना उसमें खास एस्थेटिक्स जोड़ी जाती हैं। LoRA वेट में बदलावों का एक छोटा सेट होता है, जो मॉडल के आउटपुट को किसी खास स्टाइल, सब्जेक्ट या एस्थेटिक की ओर मोड़ देता है। इसे इनफ़रेंस के समय किसी भी बेस मॉडल के ऊपर एक एडजस्टेबल स्ट्रेंथ वैल्यू के साथ लगाया जा सकता है।

NSFW-सक्षम मॉडल के लिए LoRA अक्सर खास बॉडी टाइप, लाइटिंग स्टाइल या आर्टिस्टिक एस्थेटिक्स पर ट्रेन किए जाते हैं। इनकी कंप्यूटेशनल लागत नगण्य होती है, लेकिन ये आउटपुट का चरित्र काफ़ी बदल देते हैं। Flux Dev और DreamShaper XL Turbo जैसे मॉडल LoRA लोडिंग को नेटिव रूप से सपोर्ट करते हैं, इसलिए ये फ़ाइन-ट्यून्ड फ़ोटोरियलिस्टिक वैरिएंट्स के डिफ़ॉल्ट बेस बन जाते हैं।

पेशेवर फ़ैशन फ़ोटोग्राफ़ी स्टूडियो, मॉडल और लाइटिंग सेटअप के साथ

NSFW क्षमताएँ कैसे जोड़ी जाती हैं

असल में ट्रेनिंग डेटा कैसा होता है

हर AI इमेज जनरेटर अपने ट्रेनिंग डेटा का एक सांख्यिकीय प्रतिबिंब होता है। Stable Diffusion जैसे बेस मॉडल LAION-5B पर ट्रेन किए गए थे, जो इंटरनेट से खंगाले गए 5 अरब इमेज-कैप्शन जोड़ों का डेटासेट है। इस डेटासेट में वयस्क कंटेंट, आर्टिस्टिक न्यूडिटी और मैच्योर फ़ोटोग्राफ़ी की काफ़ी मात्रा शामिल थी।

इसलिए बेस मॉडल में ऐसा कंटेंट बनाने की संभावित क्षमता होती है। सवाल यह है कि इनफ़रेंस के समय सेफ़्टी फ़िल्टरिंग उस क्षमता को दबाती है या उसे खुला छोड़ती है। यह साफ़ समझना ज़रूरी है: मॉडल खुद "जानता" नहीं कि वह वयस्क कंटेंट बना रहा है। वह ट्रेनिंग डेटा की सांख्यिकीय नियमितताओं से पैटर्न मिलाता है, और आपके दिए टेक्स्ट एम्बेडिंग से दिशा पाता है।

गार्डरेल्स हटाना

सामान्य कमर्शियल डिप्लॉयमेंट में सेफ़्टी फ़िल्टर कई स्तरों पर लगाए जाते हैं:

  1. इनपुट फ़िल्टरिंग: कुछ प्रॉम्प्ट शब्द मॉडल तक पहुँचने से पहले ब्लॉक कर दिए जाते हैं
  2. इनफ़रेंस-टाइम NSFW क्लासिफ़ायर: मॉडल के आउटपुट की जाँच एक ट्रेन किया गया बाइनरी क्लासिफ़ायर से होती है, जो इमेज को सुरक्षित या असुरक्षित के रूप में लेबल करता है
  3. पोस्ट-प्रोसेसिंग ब्लर/ब्लॉक: चिह्नित इमेज यूज़र तक पहुँचने से पहले ब्लर की जाती हैं या रिजेक्ट कर दी जाती हैं

NSFW-सक्षम वैरिएंट्स अंतर्निहित मॉडल वेट्स को बरकरार रखते हुए इन फ़िल्टरों को हटाकर या बायपास करके काम करते हैं। कुछ वैरिएंट्स इससे भी आगे जाते हैं और एक्सप्लिसिट डेटासेट पर फ़ाइन-ट्यूनिंग करते हैं, ताकि बिना खास प्रॉम्प्ट के भी मॉडल के डिफ़ॉल्ट आउटपुट ज़्यादा वयस्क दिशा में चले जाएँ।

कुछ मॉडल दूसरों से ज़्यादा रियल क्यों लगते हैं

NSFW कंटेंट में फ़ोटोरियलिज़्म तीन चीज़ों पर निर्भर करता है: बेस मॉडल की क्वालिटी, फ़ाइन-ट्यून डेटासेट की क्वालिटी और इनफ़रेंस सेटिंग्स। मूल Stable Diffusion जैसे पुराने मॉडल ऐसे आउटपुट देते हैं जो पहचाने जा सकते हैं कि AI से बने हैं: त्वचा प्लास्टिक जैसी लगती है, लाइटिंग सामान्य होती है, और शरीर-रचना कभी-कभी गलत होती है।

Realistic Vision v5.1 और RealVisXL v3.0 Turbo जैसे खास फ़ोटोरियलिस्टिक मॉडल ख़ास तौर पर हाई-क्वालिटी फ़ोटोग्राफ़ी डेटासेट पर फ़ाइन-ट्यून किए गए थे। इसी वजह से उनके आउटपुट में वह ग्रेन, डेप्थ ऑफ़ फ़ील्ड की विशेषताएँ और त्वचा का रेंडरिंग दिखता है, जो असली फ़ोटोग्राफ़ी को रेंडर की गई इमेज से अलग करता है।

गोल्डन आवर में भूमध्यसागरीय छत पर काले स्विमसूट में महिला

सेफ़्टी फ़िल्टर: वे क्या रोकते हैं और कैसे

डिफ़ॉल्ट फ़िल्टर कैसे काम करते हैं

सबसे आम सेफ़्टी मैकेनिज़्म एक CLIP-आधारित बाइनरी क्लासिफ़ायर है, जिसे सुरक्षित और असुरक्षित कंटेंट में फ़र्क करने के लिए ट्रेन किया गया है। यह जनरेट की गई इमेज को CLIP के फ़ीचर स्पेस में एम्बेड करता है और जाँचता है कि वह "असुरक्षित" माने गए ज्ञात एम्बेडिंग्स के कितने करीब है।

इस तरीके की समस्या यह है कि यह नियम-आधारित नहीं, बल्कि प्रोबेबिलिस्टिक है। क्लासिफ़ायर को "असुरक्षित" कैसा दिखता है, इसके खास उदाहरणों पर ट्रेन किया गया था। जो कंटेंट उन ट्रेनिंग उदाहरणों से अलग दिखता है, वह उतना ही एक्सप्लिसिट होने पर भी निकल सकता है। इसी वजह से भारी फ़िल्टरिंग वाले प्लेटफ़ॉर्म पर भी कभी-कभी मॉडरेशन के नतीजे असंगत निकलते हैं।

बायपास की समस्या

इंटरनेट पर एक पूरी उप-संस्कृति है जो ऐसे प्रॉम्प्ट ढूँढने में लगी है जो सेफ़्टी फ़िल्टर से निकल जाएँ। सबसे आम रणनीतियों में शामिल हैं:

  • सिमेंटिक डायल्यूशन: एक्सप्लिसिट कॉन्सेप्ट्स को बड़ी मात्रा के न्यूट्रल संदर्भ से घेरना, ताकि CLIP एम्बेडिंग "असुरक्षित" क्षेत्रों से दूर खिंच जाए
  • अप्रत्यक्ष विवरण: श्रेणी का सीधा नाम लिए बिना नतीजों का वर्णन करना
  • टोकन मैनिपुलेशन: कुछ फ़िल्टर सटीक टोकन की ब्लॉकलिस्ट पर चलते हैं, इसलिए पर्यायवाची या हल्के बदलाव उन्हें बायपास कर देते हैं

यह एक लगातार चलने वाली होड़ है। मॉडल प्रोवाइडर लगातार अपने फ़िल्टर अपडेट करते हैं; कम्युनिटी लगातार नए रास्ते खोजती रहती है। कोई भी पक्ष स्थायी जीत हासिल नहीं करता।

प्लेटफ़ॉर्म-स्तर मॉडरेशन

इनफ़रेंस-टाइम फ़िल्टरिंग के अलावा, प्लेटफ़ॉर्म अकाउंट और API स्तर पर कंटेंट पॉलिसी एन्फ़ोर्समेंट भी जोड़ते हैं। उपयोग की शर्तें तय करती हैं कि आउटपुट किस काम में लिए जा सकते हैं। बार-बार पॉलिसी उल्लंघन होने पर अकाउंट सस्पेंड हो जाता है। यह तकनीकी फ़िल्टरिंग से अलग है: यह एक कानूनी और व्यावसायिक स्तर का नियंत्रण है, जो मॉडल से स्वतंत्र रूप से काम करता है।

कुछ प्लेटफ़ॉर्म सत्यापित वयस्क यूज़रों के लिए एज-गेटेड NSFW टियर देते हैं, जहाँ इनफ़रेंस-टाइम फ़िल्टर की जगह एक कम सख्त क्लासिफ़ायर लगाया जाता है। यह आर्टिस्टिक न्यूडिटी की अनुमति देता है, पर एक्सप्लिसिटली पोर्नोग्राफ़िक कंटेंट को अब भी ब्लॉक करता है। यह वह तरीका है जो पहुँच और ज़िम्मेदार डिप्लॉयमेंट के बीच संतुलन बनाता है।

डेटा सेंटर फ़्लोर का हवाई दृश्य, जिसमें सर्वर ग्रिड का ढाँचा दिख रहा है

CFG स्केल और इनफ़रेंस स्टेप्स की भूमिका

CFG स्केल क्या नियंत्रित करता है

Classifier-Free Guidance (CFG) स्केल वह पैरामीटर है जो नियंत्रित करता है कि मॉडल आपके प्रॉम्प्ट का कितनी सख्ती से पालन करता है, बनाम वह कितनी रचनात्मक आज़ादी लेता है। CFG 1.0 पर मॉडल लगभग आपके प्रॉम्प्ट को नज़रअंदाज़ कर देता है और नॉइज़ के आधार पर जो स्वाभाविक लगे वही बना देता है। CFG 20+ पर वह प्रॉम्प्ट का इतनी कड़ाई से पालन करता है कि आउटपुट ओवर-सैचुरेटेड और शरीर-रचना में विकृत हो जाते हैं।

फ़ोटोरियलिस्टिक आउटपुट के लिए मीठा बिंदु आमतौर पर 5 से 9 के बीच होता है। इस रेंज में मॉडल प्रॉम्प्ट का करीबी पालन करता है, और फिर भी त्वचा, लाइटिंग और कंपोज़िशन को प्राकृतिक बनाने की पर्याप्त आज़ादी रखता है।

💡 पोर्ट्रेट और ग्लैमर फ़ोटोग्राफ़ी प्रॉम्प्ट के लिए: CFG 6-7 लगातार सबसे प्राकृतिक त्वचा टोन और लाइटिंग देता है। इससे ज़्यादा वैल्यू रंगों को ओवर-सैचुरेशन की ओर धकेलती हैं और किनारों व बारीक डिटेल्स के आसपास आर्टिफ़ैक्ट्स की संभावना बढ़ाती हैं।

असल में कितने स्टेप्स चाहिए

ज़्यादा इनफ़रेंस स्टेप्स का मतलब है ज़्यादा डिनॉइज़िंग पास, जो आम तौर पर एक सीमा तक बेहतर क्वालिटी देते हैं। यह संबंध इस तरह है:

  • 4-8 स्टेप्स (Schnell-क्लास मॉडल, SDXL Lightning 4-Step): तेज़, ठीक-ठाक क्वालिटी, इटरेशन और प्रीव्यू के लिए काम की
  • 20-30 स्टेप्स (सामान्य रेंज): मज़बूत डिटेल, अच्छी शरीर-रचना, फ़ाइनल आउटपुट के लिए उपयुक्त
  • 40-60 स्टेप्स (घटते फ़ायदे का क्षेत्र): बारीक डिटेल में थोड़ा बेहतर, प्रति इमेज काफ़ी ज़्यादा कंप्यूट

ज़्यादातर फ़ोटोरियलिस्टिक उपयोगों के लिए CFG 6.5 पर 28-35 स्टेप्स भरोसेमंद बेसलाइन है। इससे आगे आप ऐसे सुधारों के लिए कंप्यूट खर्च कर रहे होते हैं जो सामान्य व्यूइंग साइज़ पर मुश्किल से दिखते हैं। असली क्वालिटी लाभ बेहतर बेस मॉडल और बेहतर प्रॉम्प्ट से आते हैं, ज़्यादा स्टेप्स चलाने से नहीं।

देर रात वर्कस्टेशन पर AI ट्रेनिंग कोड लिखता डेवलपर

अपनी इमेज बनाना शुरू करें

यह तकनीक अभी उपलब्ध है, किसी लोकल हार्डवेयर सेटअप की ज़रूरत के बिना। PicassoIA इस लेख में बताए गए शीर्ष प्रदर्शन करने वाले मॉडल तक सीधी पहुँच देता है, और असली इनफ़रेंस इन्फ़्रास्ट्रक्चर सर्वर-साइड संभाला जाता है।

ग्लैमर और फ़ोटोरियलिस्टिक पोर्ट्रेट काम के लिए ये मॉडल सबसे लगातार असली-फ़ोटोग्राफ़ी वाला चरित्र देते हैं:

  • Flux 1.1 Pro Ultra: अपनी श्रेणी में सर्वश्रेष्ठ फ़ोटोरियलिज़्म, बेहतरीन त्वचा और लाइटिंग रेंडरिंग
  • Realistic Vision v5.1: खास तौर पर फ़ोटोग्राफ़ी पर फ़ाइन-ट्यून, पोर्ट्रेट काम के लिए उत्कृष्ट
  • RealVisXL v3.0 Turbo: SDXL-आधारित, तेज़, भरोसेमंद शरीर-रचना और त्वचा टेक्सचर
  • DreamShaper XL Turbo: बहुमुखी, फ़ोटोग्राफ़िक स्टाइल्स की विस्तृत रेंज संभालता है
  • Flux 2 Pro: नवीनतम पीढ़ी की क्वालिटी, जटिल लाइटिंग और कंपोज़िशन संभालता है

फ़ोटोरियलिस्टिक नतीजों के लिए सबसे अच्छा काम करने वाला प्रॉम्प्ट ढाँचा उसी पैटर्न को मानता है जो एक प्रोफ़ेशनल फ़ोटोग्राफ़ी ब्रीफ़ का होता है: सब्जेक्ट, लाइटिंग, कैमरा, फ़िल्म स्टॉक। "A woman in white linen on a sunlit terrace, volumetric afternoon light, 85mm f/1.8, Kodak Portra 400" उन "beautiful" या "realistic" जैसे अस्पष्ट शब्दों से लगातार बेहतर परिणाम देता है।

धूप वाले लकड़ी के पियर पर घुंघराले लाल बालों वाली महिला, प्राकृतिक रोशनी

अगर आप और आगे जाना चाहते हैं, तो Flux Dev और SDXL Multi ControlNet LoRA दोनों ControlNet कंडीशनिंग सपोर्ट करते हैं, जो आपको एक रेफ़रेंस इमेज से पोज़, कंपोज़िशन और स्ट्रक्चर नियंत्रित करने देता है। कई आउटपुट में लगातार नतीजे पाने का यही तरीका है, सिर्फ़ प्रॉम्प्टिंग पर निर्भर रहने के बजाय।

मॉडल ट्रेन हो चुके हैं। इन्फ़्रास्ट्रक्चर क्लाउड में चलता है। एकमात्र परिवर्तनशील चीज़ आपके प्रॉम्प्ट की क्वालिटी और बार-बार सुधारते रहने की आपकी इच्छा है।

टैबलेट पर AI डिफ्यूज़न प्रक्रिया, धुंधला नॉइज़ सुलझकर फ़ोटोरियलिस्टिक पोर्ट्रेट बनता हुआ

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख