वयस्क AI आर्ट में चेहरों को एक जैसा कैसे रखें

जनरेशन के बीच अपने कैरेक्टर्स को खोना बंद करें। वयस्क AI आर्ट में चेहरे की एकरूपता कुछ ऐसे टूल्स और वर्कफ़्लो पर निर्भर है, जिन्हें ज़्यादातर क्रिएटर्स कभी आज़माते ही नहीं। यह लेख बताता है कि PicassoIA पर सीड लॉकिंग, इमेज रेफ़रेंस और सही मॉडल चुनकर इसे ठीक-ठीक कैसे करें।

वयस्क AI आर्ट में चेहरों को एक जैसा कैसे रखें
Cristian Da Conceicao
Picasso IA के संस्थापक

आपने एक ही कैरेक्टर की तीस इमेज जनरेट कीं और तीस अलग-अलग लोग मिले। अलग नाक की बनावट, अलग आँखों का आकार, अलग जॉलाइन। अगर आपने वयस्क AI आर्ट बनाने में थोड़ा भी समय लगाया है, तो यह समस्या आपके कई घंटे खा चुकी होगी। चेहरे की एकरूपता निस्संदेह AI इमेज जनरेशन की सबसे कठिन तकनीकी चुनौती है, और यही वह कौशल है जो आम उपयोगकर्ताओं को उन क्रिएटर्स से अलग करता है जो एक ही पहचाने जाने वाले कैरेक्टर के साथ पूरी सीरीज़ बना सकते हैं।

यह लेख हर उस तरीके को समझाता है जो वाकई काम करता है: सीड एंकरिंग, इमेज रेफ़रेंस वर्कफ़्लो, मॉडल चयन और प्रॉम्प्ट इंजीनियरिंग। इसमें एक-सत्र के त्वरित समाधान और सीरीज़ के काम के लिए लंबे समय तक चलने वाले उपाय, दोनों शामिल हैं।

स्पष्ट फ़ीचर्स वाली एक महिला का फ़ोटोरियलिस्टिक क्लोज़-अप पोर्ट्रेट, गर्म टंगस्टन स्टूडियो रोशनी, Kodak Portra 400 फ़िल्म ग्रेन

दर्जनों जनरेशन में चेहरे क्यों बदलते हैं

समस्या ठीक करने से पहले यह समझना ज़रूरी है कि यह होता क्यों है।

रैंडमनेस की समस्या

हर इमेज जनरेशन एक नॉइज़ सीड से शुरू होती है। यह सीड एक संख्या है, आमतौर पर बहुत बड़ी, जो डिफ़्यूज़न प्रोसेस की शुरुआती रैंडम स्थिति तय करती है। सीड में सिर्फ़ एक अंक भी बदल दें, तो मॉडल अपने लेटेंट स्पेस के बिल्कुल अलग कोने से चित्र बनाना शुरू कर देता है। जनरेशन 47 में मिला चेहरा दोबारा तभी आने की संभावना बहुत कम है, जब तक आप हालात को ठीक-ठीक लॉक न करें।

ज़्यादातर कंटेंट के लिए यह मायने नहीं रखता। सूर्यास्त, शहर का दृश्य, जंगल, ये जनरेशन के बीच अलग होने पर भी "सही" लगते हैं। लेकिन इंसानी चेहरे में हज़ारों सूक्ष्म विशेषताएँ होती हैं, जिन्हें दर्शक अनजाने में पढ़ लेते हैं। जब जॉलाइन चौकोर से अंडाकार हो जाती है, नाक का पुल पतला हो जाता है, या आँखें बादाम जैसी से गोल हो जाती हैं, तो दर्शक तुरंत पकड़ लेते हैं। हमारा दिमाग इन बदलावों को पहचानने के लिए ही विकसित हुआ है, क्योंकि अलग-अलग संदर्भों में एक ही व्यक्ति को पहचानना कभी जीवित रहने का कौशल था।

चेहरे को असल में क्या नियंत्रित करता है

तीन चीज़ें तय करती हैं कि AI मॉडल कौन-सा चेहरा बनाएगा:

  1. सीड (रैंडम शुरुआती बिंदु)
  2. टेक्स्ट प्रॉम्प्ट (आप चेहरे का वर्णन कितनी सटीकता से करते हैं)
  3. रेफ़रेंस इमेज (अगर आप IP-Adapter या ऐसे किसी टूल के ज़रिए एक देते हैं)

तीनों को एक साथ नियंत्रित करें, तो एकरूपता मिलती है। इनमें से कोई एक भी छूट जाए, तो चेहरा बदल जाता है। ज़्यादातर उपयोगकर्ता सिर्फ़ प्रॉम्प्ट को नियंत्रित करते हैं। इसीलिए ज़्यादातर उपयोगकर्ताओं के चेहरे असंगत रहते हैं।

गहरे लहरदार बालों वाली एक महिला वेलवेट चेज़ लाउंज पर लेटी हुई, रेम्ब्रांट लाइटिंग, फ़ोटोरियलिस्टिक RAW 8K

तरीका 1: सीड लॉकिंग

यह सबसे तेज़ तरीका है और सबसे कम इस्तेमाल होने वाला भी। जब आपको कोई जनरेशन ऐसा चेहरा दे जो आपको चाहिए, तो तुरंत सीड नंबर लिख लें।

सीड व्यवहार में कैसे काम करते हैं

ज़्यादातर प्लेटफ़ॉर्म जनरेशन आउटपुट में कहीं सीड दिखाते हैं। PicassoIA पर सीड इमेज के साथ लौटाया जाता है। उसे कॉपी करें और कैरेक्टर के नाम के साथ टेक्स्ट फ़ाइल में सेव करें। यह सीड और आपका हूबहू वही प्रॉम्प्ट आपका फ़ेस टेम्प्लेट बन जाता है।

कुछ बातें ज़्यादातर उपयोगकर्ता नज़रअंदाज़ कर देते हैं: अकेला सीड काफ़ी नहीं है। आपको सीड के साथ हूबहू वही बेस प्रॉम्प्ट चाहिए। अगर प्रॉम्प्ट में काफ़ी बदलाव करें, तो सीड उन बदलावों की अलग व्याख्या करेगा और अलग कंपोज़िशन बनाएगा, जिसका अक्सर मतलब होता है अलग चेहरा। सीड रैंडमनेस को नियंत्रित करता है, आउटपुट को सीधे नहीं।

सीड और प्रॉम्प्ट एंकरिंग

अपने प्रॉम्प्ट दो परतों में बनाएँ:

  • लेयर 1 (फ़ेस एंकर, कभी नहीं बदलता): [25-year-old woman, sharp green eyes, high cheekbones, full lips, straight nose bridge, auburn hair, light freckles]
  • लेयर 2 (दृश्य का वर्णन, हर जनरेशन में बदलता है): [standing in a sunlit studio, wearing a cream silk robe]

हर जनरेशन में लेयर 1 को शब्द-दर-शब्द एक जैसा रखें। सिर्फ़ लेयर 2 बदलें। लॉक किए गए सीड के साथ मिलाकर यह चेहरे के बहकने को काफ़ी कम कर देता है। हर बार परफ़ेक्ट मेल नहीं मिलेगा, लेकिन इतना करीबी मिलेगा कि पोस्ट-प्रोसेसिंग या अपस्केलिंग से अंतर पाटा जा सके।

टिप: अपनी फ़ेस एंकर परत को एक टेक्स्ट स्निपेट के रूप में सेव करें, जिसे किसी भी प्रॉम्प्ट में पेस्ट किया जा सके। चेहरे के विवरण का एक भी विशेषण बदलने से आउटपुट बदल जाता है।

सफ़ेद लिनन बेड पर लेटी एक महिला का एरियल टॉप-डाउन व्यू, सुबह की गोल्डन आवर रोशनी, बारीक कॉटन टेक्सचर डिटेल

तरीका 2: IP-Adapter और इमेज रेफ़रेंस

लगातार सीरीज़ के काम के लिए यह सबसे शक्तिशाली तरीका है। IP-Adapter आपको एक रेफ़रेंस इमेज अपलोड करने देता है और मॉडल को उसी रेफ़रेंस का चेहरा रखने का निर्देश देता है।

इमेज रेफ़रेंस कैसे काम करता है

चेहरा बताने के लिए सिर्फ़ टेक्स्ट पर निर्भर रहने के बजाय आप मॉडल को एक फ़ोटो देते हैं। मॉडल आपके रेफ़रेंस से चेहरे की संरचना का विश्लेषण करता है और उसे नई कंपोज़िशन में दोबारा बनाने की कोशिश करता है। मुख्य पैरामीटर ये हैं:

पैरामीटरयह क्या नियंत्रित करता है
फ़ेस स्ट्रेंथचेहरा रेफ़रेंस से कितना मेल खाता है (0.0 से 1.0)
कंपोज़िशन स्ट्रेंथरेफ़रेंस पोज़ और दृश्य को कितना नियंत्रित करता है
डिनॉइज़मॉडल को दृश्य की दोबारा व्याख्या करने की कितनी आज़ादी है

अलग-अलग दृश्यों में शुद्ध चेहरा एकरूपता के लिए फ़ेस स्ट्रेंथ ऊँची (0.7 से 0.9) और कंपोज़िशन स्ट्रेंथ कम (0.2 से 0.4) रखें। इससे मॉडल को संकेत मिलता है: यही चेहरा रखिए, बाकी सब कुछ बदलने की आज़ादी है।

सही रेफ़रेंस इमेज चुनना

आपकी रेफ़रेंस इमेज बहुत मायने रखती है। चेहरे की एकरूपता के लिए आदर्श रेफ़रेंस:

  • चेहरा सामने से या हल्के कोण पर दिखाए (अत्यधिक प्रोफ़ाइल से बचें)
  • साफ़, समान रोशनी हो, जिसमें तेज़ छायाएँ फ़ीचर्स को न ढकें
  • उच्च रिज़ोल्यूशन हो और चेहरे पर तेज़ फ़ोकस हो
  • चेहरा दिखाए, आसपास कोई दूसरा व्यक्ति न हो
  • तटस्थ से हल्के भाव हों (तेज़ भाव मॉडल को उसी भाव में लॉक कर सकते हैं)

वयस्क AI आर्ट के लिए खास तौर पर, एक सलीकेदार पोर्ट्रेट शॉट, जिसमें आपके चाहे हुए फ़ीचर पहले से हों, सबसे अच्छा काम करता है। मॉडल सिर्फ़ उस रेफ़रेंस से निकाली गई चेहरे की ज्यामितीय संरचना की परवाह करता है, और किसी चीज़ की नहीं।

शहर की ओर खुली हाई-राइज़ अपार्टमेंट खिड़की पर प्लैटिनम ब्लोंड बालों वाली एक महिला, सांझ के समय, ठंडी एम्बिएंट रोशनी

तरीका 3: कैरेक्टर LoRA ट्रेनिंग

जो क्रिएटर्स लंबे समय की सीरीज़ के लिए चेहरे की सबसे ऊँची एकरूपता चाहते हैं, उनके लिए LoRA (Low-Rank Adaptation) को किसी कैरेक्टर पर ट्रेन करना सबसे अच्छा मानक है।

ट्रेन करने के लिए क्या चाहिए

LoRA एक छोटा मॉडल ऐड-ऑन है, जिसे किसी खास चेहरे की रेफ़रेंस इमेज के सेट पर ट्रेन किया जाता है। ट्रेनिंग के बाद आप यह LoRA लोड करते हैं और यह सीड या दृश्य बदलने के बावजूद हर जनरेशन को उसी चेहरे की ओर ले जाता है।

ठोस नतीजों के लिए न्यूनतम डेटासेट:

  • एक ही चेहरे की 15 से 30 इमेज
  • कोणों की विविधता: सामने, तीन-चौथाई, साइड प्रोफ़ाइल
  • रोशनी की विविधता: दिन, रात, स्टूडियो, बाहर
  • भावों की विविधता: तटस्थ, मुस्कुराते हुए, गंभीर
  • पूरे सेट में इमेज क्वालिटी एक जैसी

ट्रेनिंग में आपके हार्डवेयर के अनुसार 20 मिनट से लेकर कई घंटे तक लग सकते हैं। ट्रेन हो जाने के बाद आपके पास एक ऐसा फ़ेस एंकर होगा जो किसी भी प्रॉम्प्ट और किसी भी दृश्य में काम करता है।

LoRA कब बाकी सब पर भारी पड़ता है

LoRA का इस्तेमाल तब करें जब:

  • आप एक ही कैरेक्टर की 50 या अधिक इमेज की सीरीज़ बना रहे हों
  • कैरेक्टर का चेहरा बहुत खास हो और टेक्स्ट में बताना मुश्किल हो
  • आपको अलग-अलग मॉडल और स्टाइल में एकरूपता चाहिए
  • आप चाहते हैं कि दूसरे लोग भी भरोसे के साथ वही चेहरा इस्तेमाल करें

सीड और प्रॉम्प्ट का इस्तेमाल तब करें जब:

  • आप एक बार का सेशन या छोटा बैच कर रहे हों
  • ट्रेनिंग के लिए आपके पास समय या हार्डवेयर न हो
  • आपको एक ही प्लेटफ़ॉर्म पर जल्दी नतीजे चाहिए

दोनों की अपनी जगह है। ज़्यादातर पेशेवर वयस्क AI कंटेंट क्रिएटर्स अपने मुख्य कैरेक्टर्स के लिए LoRA और त्वरित काम के लिए सीड-लॉकिंग इस्तेमाल करते हैं।

छत के इनफ़िनिटी पूल पर पन्ना रंग की बिकिनी में आग-लाल बालों वाली एक महिला, गोल्डन रिम लाइट, RAW 8K फ़ोटोग्राफ़ी

चेहरे की एकरूपता के लिए सर्वश्रेष्ठ मॉडल

सभी मॉडल चेहरे की एकरूपता को एक जैसा नहीं संभालते। हर मॉडल की आर्किटेक्चर और ट्रेनिंग डेटा तय करते हैं कि वह अलग-अलग प्रॉम्प्ट में चेहरे की विशेषताएँ कितनी अच्छी तरह बनाए रखता है।

Seedream 5 Pro

ByteDance का Seedream 5 Pro PicassoIA पर फ़ोटोरियलिस्टिक पोर्ट्रेट एकरूपता के सबसे मज़बूत मॉडलों में से एक है। इसका 2K आउटपुट रिज़ोल्यूशन बारीक चेहरे के विवरण बचाने के लिए पर्याप्त पिक्सल घनत्व देता है, और उच्च-गुणवत्ता वाले फ़ोटोग्राफ़िक डेटा पर इसकी ट्रेनिंग इसे यथार्थवादी चेहरे की बनावट की ओर ले जाती है, न कि उन स्टाइलाइज़्ड फ़ीचर्स की ओर जो बहक जाते हैं।

वयस्क कंटेंट के लिए, Seedream 5 Pro प्रॉम्प्ट में मज़बूत फ़ेस एंकर देने पर जनरेशन के बीच संरचनात्मक एकरूपता बनाए रखते हुए, सुझावात्मक परिदृश्यों को फ़ोटोरियलिस्टिक विवरण के साथ संभालता है।

सबसे अच्छा के लिए: हाई-रेज़ पोर्ट्रेट सीरीज़, ग्लैमर फ़ोटोग्राफ़ी स्टाइल, यथार्थवादी त्वचा और फ़ीचर्स का विवरण

Reve 2.1

Reve 2.1 की एक खास ताकत है: यह प्रॉम्प्ट में विस्तृत चेहरे के विवरणों पर अच्छी प्रतिक्रिया देता है, जिससे सीड और प्रॉम्प्ट तकनीक खास तौर पर असरदार हो जाती है। जब आप चेहरे की विशिष्ट ज्यामिति (आँखों का आकार, नाक का पुल, होंठों की भराई, गालों की हड्डी की ऊँचाई) लिखते हैं, तो Reve 2.1 इन्हें कई अन्य मॉडलों से ज़्यादा शाब्दिक रूप से समझता है।

सबसे अच्छा के लिए: प्रॉम्प्ट से चेहरा लॉक करना, मध्यम-जटिलता वाली सीरीज़ का काम

Krea 2 Large

Krea 2 Large फ़ोटोरियलिज़्म में सबसे दमदार मॉडल है। यह ऐसी शारीरिक सटीकता के साथ चेहरे बनाता है जिससे एकरूपता पाना और बनाए रखना आसान हो जाता है। इसकी बड़ी आर्किटेक्चर अलग-अलग कंपोज़िशन में चेहरे की ज्यामिति की ज़्यादा बारीकियाँ सँभालकर रखती है।

सबसे अच्छा के लिए: अति-यथार्थवादी चेहरे, पेशेवर ग्लैमर कंटेंट, उच्च-निष्ठा वाले विवरण

Riverflow v2.5 Pro

Riverflow v2.5 Pro गति और गुणवत्ता का ऐसा संतुलन लाता है जो बड़े बैच के लिए व्यावहारिक है। अगर आप अच्छे सीड खोजने के लिए एक सेशन में 20 से 30 इमेज जनरेट कर रहे हैं, तो इसकी जनरेशन गति आपको तेज़ी से दोहराने देती है।

सबसे अच्छा के लिए: तेज़ सीड-खोज सेशन, फ़ेस प्रॉम्प्ट का बैच टेस्टिंग

कसे फ़्रेम वाला चियारोस्कुरो क्लोज़-अप पोर्ट्रेट, गहरे लहरदार बाल, गहरे रूबी होंठ, नाटकीय रेम्ब्रांट रोशनी, RAW 8K

PicassoIA पर एक एकरूप कैरेक्टर के लिए इसका इस्तेमाल कैसे करें

picassoia.com/en/all-models पर PicassoIA आपको 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल के साथ विशेष एडिटिंग और अपस्केलिंग टूल्स देता है, सब कुछ एक ही प्लेटफ़ॉर्म पर, बिना किसी डाउनलोड या सेटअप के।

चरण-दर-चरण वर्कफ़्लो

चरण 1: अपना कैरेक्टर टेम्प्लेट बनाएँ

एक विस्तृत फ़ेस एंकर पैराग्राफ़ लिखें और हर स्थायी विशेषता शामिल करें:

[25-year-old woman], [almond-shaped hazel eyes], [light brow arch], [slightly upturned nose], [full lower lip], [sharp jaw], [high cheekbones], [smooth skin], [natural auburn hair]

चरण 2: 15 से 20 विविधताएँ जनरेट करें

अपने फ़ेस एंकर के साथ Seedream 5 Pro या Krea 2 Large इस्तेमाल करें। हर उस जनरेशन का सीड नंबर लिखें जो आपको पसंद आए।

चरण 3: अपना कैनोनिकल चेहरा चुनें

अपने बैच में से वह एक जनरेशन चुनें जो कैरेक्टर को सबसे अच्छी तरह दिखाती हो। यही अब आपका मास्टर रेफ़रेंस है। इसकी इमेज और सीड सेव करें।

चरण 4: मास्टर रेफ़रेंस को अपस्केल करें

इस मास्टर रेफ़रेंस को भविष्य में IP-Adapter इनपुट के रूप में इस्तेमाल करने से पहले, इसे Clarity Pro Upscaler या Crystal Upscaler से चलाएँ। अपस्केलिंग से ऐसी डिटेल और शार्पनेस आती है जो रेफ़रेंस मॉडल को ज़्यादा ज्यामितीय डेटा देती है। धुंधला रेफ़रेंस धुंधली पहचान लॉक देता है।

चरण 5: अपने रेफ़रेंस से दृश्य विविधताएँ जनरेट करें

अब नई जनरेशन के लिए अपने मास्टर रेफ़रेंस को IP-Adapter इनपुट के रूप में इस्तेमाल करें। आपका कैरेक्टर नए दृश्यों, पोज़ और परिस्थितियों में रखा जाएगा, और उसका चेहरा बरकरार रहेगा।

तेज़ डिटेल के लिए P Image Upscale

बिना क्वालिटी खोए तेज़ अपस्केलिंग के लिए, P Image Upscale लगभग एक सेकंड में शार्प नतीजे देता है। जब आप जनरेशन के बीच तेज़ी से दोहरा रहे हों और पूरे रिज़ोल्यूशन पर चेहरे की डिटेल जाँचनी हो, तो यह सबसे तेज़ रास्ता है।

पुराने या कम-रिज़ोल्यूशन रेफ़रेंस के लिए Real ESRGAN

अगर आप कम-रिज़ोल्यूशन वाली रेफ़रेंस इमेज पर काम कर रहे हैं, तो Real ESRGAN भरोसेमंद 4x अपस्केल देता है, जो बिना नए हैलुसिनेशन वाले फ़ीचर जोड़े डिटेल वापस लाता है। रेफ़रेंस को साफ़ रखना उसे शार्प रखने जितना ही ज़रूरी है।

पूरे शरीर का समुद्र तट शॉट, प्राकृतिक घुंघराले काले बाल, हवा में लहराती मूँगा रंग की सिल्क ड्रेस, कैरिबियन गोल्डन आवर

प्रॉम्प्ट इंजीनियरिंग से चेहरे की एकरूपता

IP-Adapter या LoRA के बिना भी, मज़बूत प्रॉम्प्ट इंजीनियरिंग अकेले ही चेहरे के बहकने को काफ़ी कम कर देती है।

टिकने वाले फ़िज़िकल एंकर

ये वर्णनकर्ता श्रेणियाँ जनरेशन के बीच सबसे स्थिर रहती हैं। इन्हें अपनी फ़ेस एंकर परत में ज़रूर शामिल करें:

आँखों के वर्णनकर्ता (सबसे अधिक असर):

  • आकार: बादाम जैसी, गोल, हुडेड, मोनोलिड, ऊपर उठी हुई, नीचे झुकी हुई
  • रंग: विशिष्ट शब्द (हेज़ल, एम्बर, स्टील ग्रे) "ब्राउन आइज़" जैसे सामान्य शब्दों से बेहतर काम करते हैं
  • चेहरे के सापेक्ष आकार: "बड़ी आँखें" बनाम "छोटी, तीखी आँखें"

नाक के वर्णनकर्ता (दूसरे सबसे अधिक असर):

  • पुल की चौड़ाई: पतली, चौड़ी, सीधी, हल्की घुमावदार
  • नोक का आकार: गोल, नुकीली, ऊपर उठी हुई, सपाट
  • कुल आकार: छोटी, उभरी हुई, संतुलित

जॉ और चेहरे का आकार:

  • जॉलाइन: तीखी और कोणीय, नरम और गोल, चौकोर
  • चेहरे का आकार: अंडाकार, दिल जैसा, चौकोर, हीरे जैसा
  • गाल की हड्डी का उभार: ऊँचा, सपाट, उभरा हुआ

होंठ:

  • भराई: भरे ऊपरी और निचले होंठ, पतले होंठ, ज़्यादा भरा निचला होंठ
  • आकार: क्यूपिड्स बो, प्राकृतिक, चौड़े फ़ासले वाले

वयस्क AI प्रॉम्प्ट में हमेशा क्या शामिल करें

वयस्क AI आर्ट में, जहाँ आप अंतरंग दृश्यों में एक ही चेहरा चाहते हैं, ये जोड़ मॉडल को सामान्य आकर्षक चेहरों की ओर बहकने से रोकते हैं:

  • खास जातीय संकेत जहाँ प्रासंगिक हों (वरना मॉडल उसी ओर औसत करेगा जिधर उसका ट्रेनिंग डेटा झुका था)
  • उम्र के संकेत ("25 वर्ष की" चेहरे के आकार को अनिर्दिष्ट उम्र से बेहतर रखती है)
  • अपूर्णता के निशान ("नाक के पुल पर हल्का उभार," "हल्की झाइयाँ") मॉडल को हर चीज़ को एक सामान्य चेहरे में चिकना करने के बजाय अनोखी विशेषताएँ बचाने पर मजबूर करते हैं
  • बाल एंकर के रूप में: असामान्य या खास बाल मॉडल को कैरेक्टर पहचानने में मदद करते हैं, भले ही चेहरे के विवरण थोड़े बहक जाएँ

टिप: अपूर्णता के निशान जितने ज़्यादा खास होंगे, मॉडल के लिए कोई सामान्य आकर्षक चेहरा थोपना उतना ही मुश्किल होगा। नाक पर हल्की झाइयाँ और ठोड़ी पर हल्के गड्ढे वाला कैरेक्टर, "परफ़ेक्ट ब्यूटी" प्रॉम्प्ट के मुकाबले एकरूप रखना कहीं आसान है।

क्रीम रंग के पेरिसियन सोफ़े पर लेटी तीन-चौथाई पोर्ट्रेट, हनी-ब्लोंड बालायज़, दोपहर की नरम प्राकृतिक रोशनी

5 गलतियाँ जो चेहरे की एकरूपता खत्म कर देती हैं

ज़्यादातर चेहरे की एकरूपता की समस्याएँ कुछ दोहराई जाने वाली गलतियों से आती हैं।

गलती 1: सीरीज़ के बीच में मॉडल बदलना

अलग मॉडलों के औसत चेहरे के अपने-अपने झुकाव होते हैं। अगर आप अपना कैरेक्टर Seedream 5 Pro में जनरेट करें और फिर बिना IP-Adapter रेफ़रेंस के Reve 2.1 पर चले जाएँ, तो दूसरा मॉडल एक अलग व्यक्ति बनाएगा। मज़बूत इमेज रेफ़रेंस टूल्स इस्तेमाल न करें तो एक सेशन में एक ही मॉडल पर टिके रहें।

गलती 2: सीरीज़ के बीच में रिज़ोल्यूशन बदलना

सीरीज़ के बीच 512x512 से 1024x1024 पर जाने से मॉडल चेहरे को सैंपल करने का तरीका बदल देता है। मॉडल ज़्यादा पिक्सल भरते ही फ़ेस एंकर की कंपोज़िशन खिसक जाती है। सीरीज़ शुरू करने से पहले रिज़ोल्यूशन तय करें और उसे स्थिर रखें।

गलती 3: रोशनी की एकरूपता को नज़रअंदाज़ करना

नाटकीय रोशनी से चेहरा अलग पढ़ा जाता है। नीचे से रोशन चेहरा ऊपर से रोशन उसी चेहरे से अलग व्यक्ति जैसा लगता है। अपने फ़ेस एंकर में रोशनी की दिशा भी शामिल करें: "कैमरे के बाईं ओर से नरम रोशनी" या "गर्म ऊपर से स्टूडियो लाइट"।

गलती 4: बहुत कम सीड विकल्प

ठीक वही चेहरा देने वाला सीड पहली पाँच कोशिशों में शायद ही मिलता है। सीड-खोज सेशन में 15 से 30 इमेज जनरेट करने की योजना बनाएँ। जितने ज़्यादा विकल्प देखेंगे, आपका मास्टर रेफ़रेंस उतना ही बेहतर होगा।

गलती 5: धुंधली रेफ़रेंस इमेज इस्तेमाल करना

कम-रिज़ोल्यूशन या सॉफ़्ट-फ़ोकस रेफ़रेंस इमेज IP-Adapter को खराब ज्यामितीय डेटा देती है। टूल धुंधलेपन से चेहरे की संरचना का अंदाज़ा लगाने की कोशिश करता है और गलत अंदाज़ा लगा लेता है। रेफ़रेंस के रूप में इस्तेमाल करने से पहले हमेशा Crystal Upscaler से अपस्केल और शार्प करें।

कैरेक्टर शीट का तरीका

पारंपरिक कैरेक्टर डिज़ाइन से ली गई एक तकनीक, जो AI आर्ट में बिल्कुल सटीक बैठती है: कैरेक्टर शीट।

कैरेक्टर शीट रेफ़रेंस इमेज का एक सेट है, जिसमें आपका कैरेक्टर कई कोणों और कई रोशनी में दिखता है, सब एक ही सेशन में, एक ही सीड और प्रॉम्प्ट से जनरेट किया गया। आमतौर पर पाँच से आठ इमेज:

  • सामने का चेहरा, तटस्थ भाव
  • तीन-चौथाई कोण, हल्की मुस्कान
  • साइड प्रोफ़ाइल
  • सामने का चेहरा, अलग रोशनी
  • पूरा शरीर (शरीर के प्रकार के रेफ़रेंस के लिए)

इन्हें अपनी रेफ़रेंस लाइब्रेरी बनाकर, इनमें से किसी भी एक को IP-Adapter वर्कफ़्लो में डालें और दृश्य चाहे जो हो, सटीक चेहरा पुनः बना सकते हैं। कोई एक रेफ़रेंस काम न करे, तो शीट से दूसरा आज़माएँ। अलग-अलग कोण अलग कंपोज़िशन में बेहतर काम करते हैं।

वैनिटी मिरर पर साइड प्रोफ़ाइल में पूर्वी एशियाई महिला, नेवी ब्लेज़र, लाल लिपस्टिक लगाते हुए, गर्म सूर्यास्त की बैकलाइट

विभिन्न प्लेटफ़ॉर्म पर चेहरे की एकरूपता

अगर आप कई प्लेटफ़ॉर्म पर काम करते हैं, तो हर प्लेटफ़ॉर्म पर अपना कैरेक्टर फिर से स्थापित करना होगा। कोई सार्वभौमिक फ़ेस इंपोर्ट नहीं है जो हर जगह काम करे। लेकिन एक उच्च-गुणवत्ता वाली IP-Adapter रेफ़रेंस इमेज ही पोर्टेबल चेहरे के सबसे करीब है।

वर्कफ़्लो: PicassoIA पर अपना कैनोनिकल चेहरा जनरेट करें, Clarity Pro Upscaler से उसे अधिकतम रिज़ोल्यूशन तक अपस्केल करें, फिर उस इमेज को किसी भी ऐसे प्लेटफ़ॉर्म पर रेफ़रेंस इनपुट के रूप में इस्तेमाल करें जो इमेज-टू-इमेज या IP-Adapter वर्कफ़्लो सपोर्ट करता हो।

एनिमेटेड कंटेंट या बोलने वाले वीडियो के लिए, Omni Human 1.5 आपको अपने कैरेक्टर की एक स्थिर इमेज लेकर उसे ऑडियो या मोशन के साथ एनिमेट करने देता है। चूँकि आप एक ही कैनोनिकल इमेज से शुरू करते हैं, इसलिए पूरे एनिमेशन में चेहरा स्थिर रहता है, और वीडियो फ़ॉर्मेट के लिए एकरूपता अपने-आप सुलझ जाती है।

आज ही अपना पहला एकरूप कैरेक्टर बनाएँ

यहाँ बताई गई हर चीज़ (सीड-लॉकिंग, IP-Adapter रेफ़रेंस, अपस्केलिंग) PicassoIA पर बिना कुछ डाउनलोड किए उपलब्ध है। प्लेटफ़ॉर्म पूरी तरह ब्राउज़र में चलता है, जिसमें 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल, सुपर-रिज़ोल्यूशन टूल्स और एडिटिंग क्षमताएँ एक ही इंटरफ़ेस से उपलब्ध हैं।

पोर्ट्रेट में मज़बूत मॉडलों में से एक से शुरू करें: Seedream 5 Pro, Krea 2 Large, या Reve 2.1। अपना फ़ेस एंकर प्रॉम्प्ट लिखें। 20 विविधताएँ जनरेट करें, जो सीड पसंद आएँ उन्हें नोट करें, एक मास्टर रेफ़रेंस चुनें, उसे Clarity Pro Upscaler से अपस्केल करें, और वहीं से अपनी सीरीज़ शुरू करें।

एकरूप कैरेक्टर वाले क्रिएटर और हर सेशन में तीस अलग लोग जनरेट करने वाले क्रिएटर के बीच का फ़र्क तीन आदतों पर आकर टिकता है: अपना सीड लॉक करें, अपना प्रॉम्प्ट एंकर करें, हमेशा एक रेफ़रेंस इमेज रखें। इन्हीं से शुरुआत करें, और चेहरे का बहकना निराशा नहीं, बल्कि सुलझी हुई समस्या बन जाएगा।

सभी उपलब्ध मॉडल picassoia.com/en/all-models पर देखें।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख