NSFW AI जनरेटर डरा देने वाली हद तक असली बन रहे हैं (और नतीजे यही साबित करते हैं)

नवीनतम NSFW AI जनरेटर ने एक ऐसी सीमा पार कर ली है जिसकी ज़्यादातर लोगों को उम्मीद नहीं थी। जो आउटपुट कभी साफ़ तौर पर सिंथेटिक लगते थे, वे अब एडिटोरियल फ़ोटोग्राफ़ी को टक्कर देते हैं, जिनमें असली स्किन टेक्सचर, प्राकृतिक रोशनी और सटीक एनाटॉमी है। यह विश्लेषण उन मॉडलों को कवर करता है जो इस बदलाव को चला रहे हैं, यथार्थवाद क्यों काम करता है, और आप खुद शानदार नतीजे कैसे बना सकते हैं।

NSFW AI जनरेटर डरा देने वाली हद तक असली बन रहे हैं (और नतीजे यही साबित करते हैं)
Cristian Da Conceicao
Picasso IA के संस्थापक

आज के NSFW AI जनरेटर से निकलने वाली इमेज अब AI जैसी नहीं लगतीं। वे फ़ोटो जैसी लगती हैं। यह बढ़ा-चढ़ाकर कहने वाली बात नहीं है। पिछले 18 महीनों में चुपचाप एक ऐसा अहम मोड़ आया है जिसे ज़्यादातर लोगों ने नोटिस नहीं किया।

क्या बदला? आर्किटेक्चर बेहतर हुआ। ट्रेनिंग डेटा बड़े पैमाने पर बढ़ा। फ़ाइन-ट्यून किए गए मॉडल सिंथेटिक और असली के बीच का फ़ासला उन चीज़ों में कम करने लगे जो सबसे ज़्यादा मायने रखती हैं: स्किन टेक्सचर, बालों की फ़िज़िक्स, प्राकृतिक रोशनी और सटीक एनाटॉमी। अब नतीजों को बारीकी से जाँचे बिना उन्हें फ़ोटोग्राफ़ी से अलग पहचानना वास्तव में मुश्किल है। जब आप Flux 1.1 Pro Ultra से बनी इमेज को एडिटोरियल फ़ोटोग्राफ़ी के बगल में रखते हैं, तो फ़र्क अब साफ़ नहीं दिखता।

यह लेख बताता है कि असल में क्या हुआ, इसके पीछे कौन से मॉडल हैं, प्रॉम्प्ट कैसे काम करता है, और आज PicassoIA पर आप खुद ये नतीजे कैसे दोहरा सकते हैं।

स्टूडियो की ड्रामैटिक रोशनी और फ़ोटोरियलिस्टिक स्किन टेक्सचर वाला क्लोज़-अप एडिटोरियल पोर्ट्रेट

असली और सिंथेटिक के बीच का फ़ासला अब लगभग खत्म हो चुका है

धुंधली आर्टिफ़ैक्ट से फ़िल्म-क्वालिटी आउटपुट तक

दो साल पहले NSFW AI जनरेटर की एक पहचानने लायक "लुक" होती थी। चेहरे थोड़े ज़्यादा चिकने होते थे। हाथ गलत होते थे। रोशनी सपाट और बिना स्रोत की लगती थी। बैकग्राउंड में गहराई और माहौल की कमी होती थी। थोड़ी भी समझ रखने वाला व्यक्ति AI आउटपुट को तुरंत पहचान सकता था: मोम जैसी त्वचा, असंभव आँखों की समरूपता, और ऐसे बाल जो प्रोटीन की जगह प्लास्टिक जैसे बर्ताव करते थे।

वह दौर खत्म हो चुका है।

शुरुआती जनरेटिव मॉडल की पहचान बने आर्टिफ़ैक्ट आज के टॉप-टियर मॉडल में ज़्यादातर गायब हो चुके हैं। उनकी जगह अब वैसी चीज़ आ गई है जो मीडियम फ़ॉर्मैट कैमरे से निकली तस्वीर के करीब लगती है: ग्रेन, अपूर्णता, और ऐसा असली टेक्सचर जो असली लगता है, क्योंकि मॉडल ने इसे बहुत बड़े पैमाने पर असली फ़ोटोग्राफ़िक डेटा से सीखा है।

यह बदलाव धीरे-धीरे नहीं हुआ। यह आर्किटेक्चर का बदलाव था। डिफ़्यूज़न मॉडल ने नॉइज़ शेड्यूलिंग बेहतर की, ऐसे ट्रांसफ़ॉर्मर बैकबोन अपनाए जो दूर तक फैले स्पेसियल रिश्तों को संभालते हैं, और ट्रेनिंग डेटासेट उन डेटासेट से कई गुना बड़े हो गए जो उनके पिछले वर्ज़न इस्तेमाल करते थे। मॉडलों ने सिर्फ़ यह नहीं सीखा कि लोग कैसे दिखते हैं। उन्होंने यह सीखा कि लोगों की फ़ोटोग्राफ़ी कैसी दिखती है, और यह एक अलग और ज़्यादा काम की चीज़ है।

पिछले 18 महीनों में क्या बदला

यथार्थवाद में इस सफलता को तीन ताकतों ने एक साथ आगे बढ़ाया:

  1. ट्रांसफ़ॉर्मर-आधारित आर्किटेक्चर: Flux 1.1 Pro Ultra और Stable Diffusion 3.5 Large जैसे मॉडलों ने पुराने UNet डिज़ाइन की जगह ट्रांसफ़ॉर्मर बैकबोन लिए, जो कंपोज़िशन, रोशनी की एकरूपता और एनाटॉमी को कहीं ज़्यादा सटीकता से संभालते हैं।
  2. बड़े पैमाने पर फ़ाइन-ट्यूनिंग का चलन: ओपन-सोर्स कम्युनिटी ने हज़ारों विशेष LoRA मॉडल बनाए, जिन्हें खास तौर पर चुनी गई फ़ोटोग्राफ़िक पोर्ट्रेट तस्वीरों पर ट्रेन किया गया। मज़बूत बेस मॉडल पर लगाने पर इन्होंने मानव सब्जेक्ट के लिए यथार्थवाद को काफ़ी बेहतर किया।
  3. प्रॉम्प्ट इंजीनियरिंग की परिपक्वता: कम्युनिटी ने फ़ोटोरियलिज़्म के लिए खास तौर पर अनुकूलित नियम विकसित किए, जैसे असली कैमरा नाम, असली फ़िल्म स्टॉक और असली लाइटिंग सेटअप। ये उन मॉडलों में फ़ोटोग्राफ़िक रेंडरिंग व्यवहार सक्रिय करते हैं जिन्हें फ़ोटोग्राफ़िक डेटा पर ट्रेन किया गया था।

💡 आज के टॉप आउटपुट में जो यथार्थवाद दिखता है, वह संयोग नहीं है। यह सटीक प्रॉम्प्ट इंजीनियरिंग का नतीजा है, जो ऐसे मॉडलों पर लागू होती है जो अब फ़ोटोग्राफ़ी को सांख्यिकीय और संरचनात्मक स्तर पर समझते हैं।

सफ़ेद रेत वाले साफ़ समुद्र तट पर सुबह की रोशनी में बिकिनी पहनी महिला का ड्रोन से एरियल व्यू

ऐसे मॉडल जो सच में नतीजे देते हैं

Flux 1.1 Pro Ultra की फ़ोटोग्राफ़िक सटीकता

Black Forest Labs का Flux 1.1 Pro Ultra फ़ोटोरियलिस्टिक मानव पोर्ट्रेट के लिए अभी का बेंचमार्क है। इसका ट्रांसफ़ॉर्मर बैकबोन कंपोज़िशन और रोशनी के उन रिश्तों को संभालता है जिन्हें पुराने UNet मॉडल ठीक से नहीं दर्शा पाते थे, खास तौर पर स्किन और बालों जैसे बारीक सब्जेक्ट के लिए।

NSFW कंटेंट के लिए इसे क्या अलग बनाता है:

  • स्किन रेंडरिंग: यह सबसर्फ़ेस स्कैटरिंग (त्वचा के नीचे से रोशनी कैसे गुज़रती और बिखरती है) को किसी भी पिछले वर्ज़न से बेहतर संभालता है, और वह गर्म पारदर्शिता देता है जो त्वचा को पेंट की हुई नहीं, जीवंत दिखाती है
  • एनाटॉमी की सटीकता: असामान्य पोज़, अधूरे फ़्रेम या मुश्किल एंगल में भी अनुपात सही रहते हैं, जो पुराने मॉडलों को बिगाड़ देते थे
  • रोशनी की एकरूपता: रोशनी के स्रोत भौतिक रूप से बर्ताव करते हैं। परछाइयाँ वहीं पड़ती हैं जहाँ उन्हें पड़ना चाहिए, हाइलाइट फैलते नहीं, और बाउंस लाइट सब्जेक्ट के अँधेरे हिस्से को सही तरीके से भरती है
  • बैकग्राउंड का मेल: सब्जेक्ट और माहौल एक ही रोशनी साझा करते हैं, जो सिंथेटिक इमेज में सबसे आम पहचान है, और इसे Flux Ultra खास तौर पर अच्छी तरह संभालता है

बेस Flux 1.1 Pro भी जानने लायक है, जो एक तेज़ विकल्प है और ज़्यादातर उपयोग के लिए फिर भी शानदार यथार्थवाद देता है। Flux Dev कम्युनिटी फ़ाइन-ट्यूनिंग के लिए पसंदीदा बेस है, जबकि Flux Schnell तेज़ दोहराव वाले वर्कफ़्लो के लिए स्पीड को प्राथमिकता देता है।

मॉडलकिसके लिए सबसे अच्छास्पीडयथार्थवाद
Flux 1.1 Pro Ultraअधिकतम फ़ोटोरियलिज़्ममध्यम★★★★★
Flux 1.1 Proसंतुलित गुणवत्ता और स्पीडतेज़★★★★☆
Flux Devफ़ाइन-ट्यूनिंग का बेसमध्यम★★★★☆
Stable Diffusion 3.5 Largeजटिल कंपोज़िशनमध्यम★★★★☆
Realistic Vision v5.1शुद्ध पोर्ट्रेट यथार्थवादतेज़★★★★☆

बैकलिट औद्योगिक गोदाम की खिड़की के सामने एक महिला की फ़ाइन आर्ट फ़ोटोग्राफ़ी सिल्हूट

Stable Diffusion 3.5 Large और SDXL परिवार

Stable Diffusion 3.5 Large ने Stability AI की लाइन में एक बड़ा आर्किटेक्चरल अपग्रेड दिया। इसका मल्टीमॉडल डिफ़्यूज़न ट्रांसफ़ॉर्मर (MMDiT) टेक्स्ट और इमेज के बीच मेल को पिछले वर्ज़न से काफ़ी बेहतर संभालता है, जो बारीक प्रॉम्प्ट विवरणों के लिए सबसे ज़्यादा मायने रखता है: खास लाइटिंग सेटअप, सटीक बॉडी पोज़िशन, माहौल का डिटेल।

सुधार खास तौर पर उन जटिल दृश्यों में दिखता है जहाँ कई तत्वों को सही तरीके से एक-दूसरे के साथ काम करना होता है। उदाहरण के लिए, अँधेरे कमरे में खिड़की की रोशनी से आंशिक रूप से रोशन महिला, जहाँ पिछले मॉडल कंट्रास्ट को सपाट कर देते थे और माहौल की गुणवत्ता खो देते थे।

SDXL कम्युनिटी फ़ाइन-ट्यूनिंग के बेस के रूप में अब भी प्रासंगिक है। इसके ज़्यादा नेटिव रिज़ॉल्यूशन ने फ़ोटोरियलिस्टिक फ़ाइन-ट्यून का एक पूरा इकोसिस्टम खड़ा किया, जो कम्युनिटी में सबसे ज़्यादा इस्तेमाल होने वाले मॉडलों में शामिल है, खास तौर पर पोर्ट्रेट और ग्लैमर काम के लिए।

Realistic Vision और RealVisXL

शुद्ध पोर्ट्रेट और ग्लैमर फ़ोटोग्राफ़ी के यथार्थवाद के लिए Realistic Vision v5.1 और RealVisXL v3.0 Turbo पर खास ध्यान देना चाहिए। इन मॉडलों को खास तौर पर उच्च-गुणवत्ता वाले फ़ोटोग्राफ़िक पोर्ट्रेट डेटा पर फ़ाइन-ट्यून किया गया था, यानी ये बिना बहुत अधिक प्रॉम्प्ट इंजीनियरिंग के डिफ़ॉल्ट रूप से फ़ोटोरियलिस्टिक आउटपुट देते हैं।

RealVisXL उन बारीक चीज़ों को संभालता है जो इमेज को असली महसूस कराती हैं: गोरी त्वचा के नीचे कैपिलरी की हल्की लाली, पलकों की सूक्ष्म परछाइयाँ ऊपरी पलक पर पड़ना, थोड़े खुले होंठों पर स्पेक्युलर हाइलाइट, और चेहरे की विशेषताओं की प्राकृतिक असमानता जो प्रामाणिकता का संकेत देती है।

गहरे लाल होंठ, हॉलीवुड वेव वाले बाल और परफ़ेक्ट स्टूडियो लाइटिंग वाला ग्लैमर पोर्ट्रेट

अब आउटपुट इतने असली क्यों लगते हैं

ट्रेनिंग का पैमाना और डेटा की गुणवत्ता

शुरुआती सार्वजनिक डिफ़्यूज़न मॉडल दसियों लाख इमेज वाले डेटासेट पर ट्रेन हुए थे। आज के टॉप मॉडल अरबों पर ट्रेन होते हैं। इस पैमाने पर मॉडल सिर्फ़ विज़ुअल पैटर्न याद नहीं करता। वह यह आंतरिक रूप से समझ लेता है कि असली फ़ोटोग्राफ़ी में रोशनी, ज्यामिति और मटीरियल के गुण आपस में कैसे काम करते हैं।

नतीजा यह है कि जब आप "बाईं ओर से सुबह की वॉल्यूमेट्रिक रोशनी" का वर्णन करते हैं, तो मॉडल सिर्फ़ गर्म रंग की झलक नहीं जोड़ता। वह हिसाब लगाता है कि उस कोण पर चेहरे पर कड़ी परछाइयाँ कहाँ पड़नी चाहिए, रोशनी गालों की हड्डी और कंधों जैसी घुमावदार सतहों के चारों ओर कैसे लिपटती है, फ़र्श से आती बाउंस लाइट छाया वाले हिस्से को कहाँ भरेगी, और उस स्थिति में रंग का तापमान त्वचा के टोन पर क्या असर डालेगा।

यह सांख्यिकीय लर्निंग के ज़रिए फ़िज़िक्स-अवेयर रेंडरिंग है। यह बड़े पैमाने से उभरी है, स्पष्ट प्रोग्रामिंग से नहीं। मॉडलों को कभी नहीं बताया गया कि रोशनी कैसे काम करती है। उन्होंने इसे अरबों फ़ोटो से खुद निकाला।

स्किन, रोशनी और टेक्सचर के लिए फ़ाइन-ट्यूनिंग

बेस मॉडल सामान्यवादी होते हैं। पोर्ट्रेट यथार्थवाद में नाटकीय सुधार खास तौर पर चुने हुए डेटासेट पर फ़ाइन-ट्यूनिंग से आया।

उच्च-गुणवत्ता वाली पोर्ट्रेट फ़ोटोग्राफ़ी के सेट पर ट्रेन किए गए LoRA (Low-Rank Adaptation) मॉडल बेस मॉडल को सिखाते हैं कि मानव सब्जेक्ट के लिए फ़ोटोग्राफ़िक यथार्थवाद को ज़्यादा महत्व दे। जब इसे Flux 1.1 Pro Ultra जैसे मज़बूत बेस पर लगाया जाता है, तो यह संयोजन ऐसे नतीजे देता है जिन्हें सचमुच फ़ोटो समझा जा सकता है।

फ़ाइन-ट्यूनिंग की प्रक्रिया मॉडल से प्रभावी रूप से कहती है: "यह बेस स्किन को जिन भी तरीकों से दिखा सकता है, उनमें से उस तरीके को प्राथमिकता दो जिसमें वह प्राकृतिक रोशनी में दिखती है, सटीक सबसर्फ़ेस स्कैटरिंग के साथ, चेहरे भर में उचित टेक्सचर विविधता के साथ, और यथार्थवादी छिद्र वितरण के साथ।" मॉडल स्किन रेंडर करने के दूसरे संभावित तरीकों के मुकाबले इन फ़ोटोग्राफ़िक प्राथमिकताओं को ज़्यादा महत्व देना सीखता है।

💡 सबसे अच्छे NSFW AI नतीजे एक मज़बूत बेस मॉडल को एक अच्छी तरह ट्रेन किए गए पोर्ट्रेट LoRA के साथ जोड़ते हैं। बेस कंपोज़िशन और कोहेरेंस संभालता है; LoRA वे फ़ोटोग्राफ़िक बारीक विवरण संभालता है जो इमेज को असली महसूस कराते हैं।

गर्म रोशनी वाले मद्धम बुटीक होटल कमरे में हाथीदाँत रंग की फ़्रेंच लेस लिंजरी पहनी महिला, चियारोस्कुरो लाइटिंग

PicassoIA पर Flux 1.1 Pro Ultra कैसे इस्तेमाल करें

Flux 1.1 Pro Ultra PicassoIA पर पूरे Flux परिवार और फ़ोटोरियलिज़्म पर केंद्रित दर्जनों अन्य मॉडलों के साथ सीधे उपलब्ध है।

अपना पहला प्रॉम्प्ट सेट करना

मॉडल फ़ोटोग्राफ़ी-शैली के विवरणों पर सबसे अच्छी प्रतिक्रिया देता है, न कि आर्ट-डायरेक्शन वाले विवरणों पर। अपने प्रॉम्प्ट की संरचना चार मुख्य तत्वों पर बनाएँ:

  1. सब्जेक्ट: व्यक्ति, उसका पोज़, एक्सप्रेशन और पहनावा साफ़ विवरण के साथ बताएँ
  2. माहौल: जगह, सेटिंग, दिन का समय, वातावरण
  3. रोशनी: रोशनी का स्रोत, दिशा, गुणवत्ता (कड़ी बनाम नरम) और रंग का तापमान बताएँ
  4. कैमरा: एक असली कैमरा बॉडी, लेंस की फ़ोकल लंबाई और एपर्चर का नाम लें

कमज़ोर प्रॉम्प्ट: Beautiful woman, bedroom, night

मज़बूत प्रॉम्प्ट: Woman in ivory French lace lingerie sitting on the edge of a white cotton bed, left hand resting in lap, gaze directed slightly off-camera toward a window, warm amber bedside lamp casting directional chiaroscuro light from the right creating intimate shadow play, natural skin imperfections visible, shot on Leica M11 with 50mm Noctilux f/0.95, 8K RAW, Kodak Portra 800 film grain

दूसरा प्रॉम्प्ट सिर्फ़ यह नहीं बताता कि आप क्या देखना चाहते हैं। वह उन फ़ोटोग्राफ़िक परिस्थितियों का वर्णन करता है जो वही चीज़ पैदा करतीं जो आप देखना चाहते हैं। सोचने का यह बदलाव नतीजों को पूरी तरह बदल देता है।

सबसे ज़्यादा मायने रखने वाले पैरामीटर

PicassoIA पर Flux 1.1 Pro Ultra इस्तेमाल करते समय कुछ सेटिंग लगातार बड़ा फ़र्क लाती हैं:

  • आस्पेक्ट रेशियो: लैंडस्केप और एडिटोरियल शॉट के लिए 16:9, पोर्ट्रेट ओरिएंटेशन वाले काम के लिए 9:16
  • स्टेप्स: ज़्यादा स्टेप काउंट (30-40) स्किन और बालों के ज़्यादा परिष्कृत डिटेल देते हैं
  • गाइडेंस स्केल: यथार्थवाद के लिए 3.5-4.5 सबसे अच्छी सीमा है। कम मान ज़्यादा क्रिएटिव व्याख्या देते हैं, ज़्यादा मान शाब्दिक प्रॉम्प्ट के ज़्यादा करीब रहते हैं

यथार्थ नतीजों के लिए टिप्स

  • खास फ़िल्म स्टॉक के नाम लें: "Kodak Portra 400," "Fujifilm Provia 100F," "Ilford HP5" हर एक अलग सौंदर्य पहचान रखते हैं, जिसे मॉडल अपने फ़ोटोग्राफ़िक ट्रेनिंग डेटा से पहचानता है
  • अपूर्णताओं का साफ़ वर्णन करें: "प्राकृतिक स्किन टेक्सचर," "गालों पर हल्की कैपिलरी लाली," "कनपटी पर बारीक बाल" जैसे शब्द लिखें, क्योंकि अपूर्णता प्रामाणिकता का एहसास देती है
  • स्टाइल शब्दों को एक साथ जोड़ने से बचें: "Photorealistic AND cinematic AND editorial" परस्पर विरोधी संकेत भेजता है। एक मुख्य रजिस्टर चुनें और बाकी काम कैमरा स्पेसिफ़िकेशन पर छोड़ दें
  • बैकग्राउंड का विवरण दें: एक परफ़ेक्ट रेंडर हुआ सब्जेक्ट धुंधले बैकग्राउंड पर तुरंत इमर्शन तोड़ देता है। बैकग्राउंड को भी सब्जेक्ट जितना ध्यान दें

नीली घड़ी के समय यूरोपीय शहर की कोबलस्टोन सड़क पर बैकलेस ड्रेस में चलती आत्मविश्वासी महिला

अधिकतम यथार्थवाद के लिए प्रॉम्प्ट लिखना

एक मज़बूत प्रॉम्प्ट की बनावट

एक औसत AI आउटपुट और सचमुच फ़ोटोरियलिस्टिक आउटपुट के बीच का फ़र्क अक्सर एक कारक पर आ जाता है: आप रोशनी का वर्णन कितनी सटीकता से करते हैं।

ज़्यादातर शुरुआती लोग सब्जेक्ट का विस्तार से वर्णन करते हैं और रोशनी को धुंधला छोड़ देते हैं। मॉडल को अंदाज़ा लगाना पड़ता है। वह डिफ़ॉल्ट रूप से समान, बिना स्रोत वाली रोशनी चुनता है, जो तुरंत सिंथेटिक लगती है, क्योंकि कोई असली फ़ोटो ऐसी नहीं दिखती। हर असली फ़ोटो में एक खास स्थिति पर एक खास रोशनी का स्रोत होता है।

अपनी रोशनी का वर्णन करें:

लाइटिंग शब्दआउटपुट पर असर
Volumetric morning light from leftनरम दिशात्मक गर्माहट, वायुमंडलीय धुंध
Single Profoto B10 strobe at 45 degreesपरिभाषित परछाइयों वाली कड़ी एडिटोरियल रोशनी
Large octabox directly overheadसमान चमकदार फ़ैशन-क्वालिटी रोशनी
Available light only, no flashप्राकृतिक, कैंडिड, प्रामाणिक डॉक्यूमेंट्री एहसास
Chiaroscuro, directional side lightहाई कंट्रास्ट, फ़ाइन आर्ट, नाटकीय मूड
Blue hour ambient urban lightठंडे टोन, नरम, सिनेमैटिक स्ट्रीट एहसास
Backlight with rim haloसब्जेक्ट सिल्हूट में, गर्म बाहरी रेखा का अलगाव

काम करने वाले लाइटिंग डिस्क्रिप्टर

स्किन के लिए खास तौर पर, सबसे प्रभावी लाइटिंग डिस्क्रिप्टर एक स्रोत प्रकार को रंग तापमान और दिशा के साथ जोड़ते हैं:

  • "Soft morning window light from right, 5500K, wrapping around the cheekbone"
  • "Single amber bedside lamp at eye level from left, 2700K, strong shadow on far side of face"
  • "Overcast outdoor light, diffused and even, 6500K, no shadows"

मॉडल ऐसी फ़ोटोग्राफ़ी पर ट्रेन हुआ है जहाँ यह जानकारी हर इमेज में पहले से मौजूद है। जब आप इसे स्पष्ट रूप से देते हैं, तो आप वही भाषा बोलते हैं जो ट्रेनिंग डेटा ने इस्तेमाल की थी।

क्या यथार्थवाद को तोड़ता है

कुछ पैटर्न मज़बूत प्रॉम्प्ट को भी कमज़ोर कर सकते हैं, जो ऐसे आंतरिक विरोधाभास पैदा करते हैं जिन्हें मॉडल ठीक से हल नहीं कर पाता:

  • बैकग्राउंड और सब्जेक्ट की रोशनी में असंगति: अगर बैकग्राउंड भोर का संकेत देता है पर आपने स्टूडियो स्ट्रोब लाइटिंग बताई है, तो मॉडल को एक चुनना पड़ता है और आम तौर पर वह गलत होता है
  • परिवेश के पैमाने की कमी: एरियल शॉट, चौड़े इंटीरियर और बाहरी दृश्यों को "तैरते सब्जेक्ट" की समस्या से बचने के लिए पैमाने के संदर्भ चाहिए
  • सामान्य विशेषणों का विशिष्ट विवरणों के साथ मिश्रण: "Beautiful woman" के साथ "Leica M11 85mm f/1.4" रेंडरिंग रजिस्टर के बारे में मिले-जुले संकेत भेजता है
  • प्रॉम्प्ट को ज़रूरत से ज़्यादा भरना: एक बिंदु तक ज़्यादा विवरण बेहतर है। उस बिंदु के बाद शब्द एक-दूसरे से टकराने लगते हैं और आउटपुट उलझ जाता है

सुबह के डेक से घने जंगल की धुंधली घाटी को देखती, पीठ की ओर से दिखाई गई महिला, निहितार्थ रूप से फ़ाइन आर्ट न्यूडिटी

मॉडल अब ज़्यादातर अपेक्षाओं से आगे हैं

टॉप-टियर AI पोर्ट्रेट आउटपुट की पेशेवर फ़ोटोग्राफ़ी से तुलना करने वाले ब्लाइंड टेस्ट में, गैर-विशेषज्ञ दर्शक अब AI इमेज को "असली फ़ोटोग्राफ़ी" के रूप में 70% से ज़्यादा दर पर पहचानते हैं। यह संख्या 2023 की शुरुआत में तुलनीय मॉडलों के लिए 20% से नीचे थी।

पोर्ट्रेट काम के लिए खास तौर पर, मॉडल फ़ोटोग्राफ़िक प्रामाणिकता को परिभाषित करने वाली चीज़ें संभालते हैं:

  • स्किन: सबसर्फ़ेस स्कैटरिंग, चेहरे के अलग-अलग हिस्सों में प्राकृतिक टेक्सचर विविधता, गोरी त्वचा में कैपिलरी का विवरण, उचित तैलीयपन और मैट क्षेत्र
  • बाल: प्राकृतिक मोटाई विविधता के साथ व्यक्तिगत बालों की फ़िज़िक्स, हेयरलाइन पर प्रामाणिक उड़ते बाल, और जहाँ बाल खोपड़ी से मिलते हैं वहाँ सही बर्ताव
  • आँखें: रोशनी के स्रोत से सही स्पेक्युलर हाइलाइट, उचित गहराई के साथ यथार्थवादी आइरिस डिटेल, और कॉर्निया पर प्राकृतिक नमी
  • रोशनी: स्रोत के आकार और दूरी के आधार पर सटीक नरमी वाली भौतिक रूप से सुसंगत परछाइयाँ, सही बाउंस लाइट, और प्रामाणिक वायुमंडलीय बिखराव

बचे हुए संकेत मुख्य रूप से दो क्षेत्रों में केंद्रित हैं: क्लोज़-अप में हाथों की असामान्य स्थितियाँ, और चौड़े शॉट में जटिल बैकग्राउंड-सब्जेक्ट रोशनी की निरंतरता। दोनों को प्रॉम्प्ट निर्माण और बार-बार सुधार से हल किया जा सकता है।

बारिश में क्लोज़-अप पोर्ट्रेट, त्वचा पर प्राकृतिक बूँदें, स्ट्रीट लैंप के नीचे फ़ोटोरियलिस्टिक डिटेल

कंटेंट क्रिएटर्स के लिए इसका मतलब

दृश्य कंटेंट बनाने वाले किसी भी व्यक्ति के लिए इसका व्यावहारिक असर बड़ा है। एक फ़ोटोग्राफ़र जो एडिटोरियल-क्वालिटी पोर्ट्रेट काम शूट करना चाहता था, उसे एक मॉडल, एक लोकेशन, एक स्टाइलिस्ट, लाइटिंग उपकरण और शूटिंग व पोस्ट-प्रोसेसिंग के घंटों की ज़रूरत पड़ती थी। प्रति इमेज कुल लागत सैकड़ों या हज़ारों डॉलर तक जाती थी, और अकेले लॉजिस्टिक्स ने अच्छे संसाधनों वाले प्रोडक्शन तक पहुँच को सीमित कर दिया था।

Flux 1.1 Pro Ultra टेक्स्ट विवरण से सेकंडों में तुलनीय नतीजे देता है।

यह कोई मामूली दक्षता सुधार नहीं है। यह इस बात में संरचनात्मक बदलाव है कि कौन क्या बना सकता है। Realistic Vision v5.1, RealVisXL v3.0 Turbo, और Stable Diffusion 3.5 Large जैसे मॉडलों ने प्रोडक्शन-क्वालिटी पोर्ट्रेट को उस तरह लोकतांत्रिक बना दिया है जैसा तीन साल पहले मौजूद ही नहीं था।

💡 अब बाधा उपकरण, बजट या सब्जेक्ट तक पहुँच नहीं है। अब यह पूरी तरह प्रॉम्प्ट की गुणवत्ता और मॉडल के चुनाव पर निर्भर है। क्रिएटिव आउटपुट अब प्रोडक्शन संसाधनों से अलग हो चुका है।

SDXL इकोसिस्टम ने खास तौर पर फ़ोटोरियलिस्टिक मानव पोर्ट्रेट के लिए अनुकूलित फ़ाइन-ट्यून मॉडलों की एक पीढ़ी तैयार की, सैकड़ों की संख्या में। ऐसे प्लेटफ़ॉर्म के साथ मिलकर जो इन सबको एक ही इंटरफ़ेस में उपलब्ध कराते हैं, क्रिएटिव सीमा अब लॉजिस्टिक्स और बजट के बजाय कल्पना और प्रॉम्प्ट कौशल से तय होती है।

धूप वाली खिड़की की सीट पर बैठी, मिनिमलिस्ट अपार्टमेंट में बड़ी सफ़ेद लिनन शर्ट पहने महिला

अभी PicassoIA पर बनाना शुरू करें

अगर आपने इन मॉडलों को खुद नहीं आज़माया है, तो आपकी कल्पना और अब तक AI से देखी गई चीज़ों के बीच का फ़ासला आपको सचमुच चौंका सकता है।

PicassoIA आपको Flux 1.1 Pro Ultra, Flux 1.1 Pro, Flux Dev, Flux Schnell, Stable Diffusion 3.5 Large, SDXL, Realistic Vision v5.1, और RealVisXL v3.0 Turbo सीधे एक ही इंटरफ़ेस से उपलब्ध कराता है, किसी लोकल सेटअप या GPU की ज़रूरत नहीं।

Flux 1.1 Pro Ultra से शुरू करें। इस लेख की फ़ोटोग्राफ़ी-पहले संरचना वाला प्रॉम्प्ट लिखें। लाइटिंग की दिशा बताएँ, कैमरा का नाम लें, माहौल का वर्णन करें और अपूर्णताएँ शामिल करें। फिर उसे चलाएँ।

आज जो नतीजे बन रहे हैं, वे "AI के लिए ठीक-ठाक" नहीं हैं। वे किसी भी मानक पर उल्लेखनीय हैं। मॉडल आ चुके हैं। अब बस यह बचा है कि आप जो प्रॉम्प्ट लिख रहे हैं, वह उन सब चीज़ों की माँग करता है या नहीं जो वे सचमुच दे सकते हैं।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख