AI कैरेक्टर को हर सीन में एक जैसा कैसे रखें

अगर आपने कभी एक बेहतरीन AI कैरेक्टर बनाया और अगली इमेज में उसका चेहरा बदल गया, तो यह आर्टिकल बताता है कि प्रोफ़ेशनल लोग AI से बने सीनों में कैरेक्टर की पहचान एक जैसी कैसे रखते हैं। इसमें सीड नंबर, प्रॉम्प्ट इंजीनियरिंग, रेफ़रेंस वर्कफ़्लो और प्लेटफ़ॉर्म के खास टूल शामिल हैं, जो कंसिस्टेंसी को संयोग नहीं बल्कि भरोसेमंद नतीजा बनाते हैं।

AI कैरेक्टर को हर सीन में एक जैसा कैसे रखें
Cristian Da Conceicao
Picasso IA के संस्थापक

कई इमेज में AI कैरेक्टर को एक जैसा रखना AI आर्ट की सबसे निराश करने वाली समस्याओं में से एक है। मंगलवार को आप एक बेहतरीन चेहरा बनाते हैं, बुधवार को उसे दोबारा बनाने की कोशिश करते हैं, और कैरेक्टर बिल्कुल अलग इंसान जैसा दिखने लगता है। ऐसा इसलिए होता है क्योंकि ज़्यादातर डिफ्यूज़न मॉडल स्टेटलेस होते हैं, यानी उन्हें यह याद नहीं रहता कि पहले उन्होंने क्या बनाया था।

लेकिन कंसिस्टेंसी संभव है। AI कॉमिक्स, स्टोरीबोर्ड और प्रोडक्ट विज़ुअल पर काम करने वाले प्रोफ़ेशनल्स ने दर्जनों सीनों में एक ही कैरेक्टर को बनाए रखने के भरोसेमंद सिस्टम विकसित किए हैं। यहाँ बताया गया है कि वे यह कैसे करते हैं।

कैरेक्टर क्यों बदलते रहते हैं

डिफ्यूज़न मॉडल की मुख्य समस्या

हर बार जब आप AI इमेज जनरेटर चलाते हैं, वह शुरुआत से शुरू करता है। उसके पास आपके कैरेक्टर की आँखों का रंग, नाक का आकार या बालों की बनावट याद रखने की कोई अंतर्निहित मेमोरी नहीं होती। मॉडल हर बार आपके टेक्स्ट प्रॉम्प्ट को नए सिरे से समझता है, इसलिए "भूरे बालों और नीली आँखों वाली एक महिला" के दो जनरेशन बिल्कुल अलग-अलग लोग बना सकते हैं।

यह कोई बग नहीं है। यह प्रोबेबिलिस्टिक जनरेशन के काम करने का तरीका है। मॉडल संभावित इमेज के एक विशाल वितरण से सैंपल लेता है, और हर सैंपल थोड़ा अलग होता है।

"कंसिस्टेंट" का असली मतलब

असली कंसिस्टेंसी का मतलब है कि कैरेक्टर की मुख्य शारीरिक विशेषताएँ, हड्डियों की बनावट, आँखों का आकार, त्वचा का रंग और चेहरे की विशेषताओं के बीच का अनुपात अलग-अलग संदर्भों में भी एक जैसा रहे। पोशाक, रोशनी और पोज़ बदल सकते हैं। चेहरा नहीं बदलना चाहिए।

तीन कोणों में एक जैसी चेहरे की विशेषताएँ दिखाती कैरेक्टर ट्रिप्टिक

ज़्यादातर लोग "मिलता-जुलता" और "कंसिस्टेंट" को एक समझ लेते हैं। जो कैरेक्टर ज़्यादातर इमेज में लगभग एक जैसा दिखता है, वह कंसिस्टेंट नहीं है। कंसिस्टेंट वह है जिसकी वही जॉलाइन, होंठों का वही आकार और आँखों के बीच की वही दूरी हर एक जनरेशन में दिखें।

पहले अपनी कैरेक्टर शीट बनाएँ

5 शारीरिक एंकर

एक भी इमेज बनाने से पहले आपको एक लिखित कैरेक्टर शीट चाहिए, जो पाँच शारीरिक एंकर तय करे:

  1. चेहरे का आकार: अंडाकार, चौकोर, दिल जैसा, गोल, लंबोतरा
  2. आँखों का विवरण: रंग, आकार (बादाम जैसी, गोल, झुकी हुई पलकों वाली) और दूरी
  3. नाक की बनावट: पुल की चौड़ाई, सिरे का आकार, नथुनों का फैलाव
  4. त्वचा का रंग: "गुनगुना ऑलिव", "ठंडा आइवरी", "गहरा एबोनी" जैसे खास वर्णन
  5. बाल: रंग, बनावट, कट और लंबाई सटीक शब्दों में

"खूबसूरत भूरे बाल" न लिखें। लिखें "कंधों तक लंबे चेस्टनट भूरे बाल, हल्की हाइलाइट्स के साथ, हल्की लहर, बाईं ओर साइड पार्टिंग।" आप जितने ज़्यादा सटीक होंगे, मॉडल को उतना ही कम अनुमान लगाना पड़ेगा।

लाइट टेबल पर कैरेक्टर रेफ़रेंस शीट देखते क्रिएटिव डायरेक्टर

इसे कास्टिंग ब्रीफ़ की तरह लिखें

अपनी कैरेक्टर शीट को किसी फ़िल्म प्रोडक्शन की कास्टिंग ब्रीफ़ समझें। असली कास्टिंग डायरेक्टर अभिनेताओं का वर्णन बहुत बारीक शारीरिक ब्योरे के साथ करते हैं, क्योंकि सीन 4 में एक अलग अभिनेता पूरी फ़िल्म बिगाड़ देता है।

अपने कैरेक्टर का वर्णन बुलेट लिस्ट के बजाय एक घने, एक ही पैराग्राफ़ में लिखें। इस पैराग्राफ़ को प्रोफ़ेशनल "कैरेक्टर ब्लॉक" कहते हैं, और इसे हर प्रॉम्प्ट में शब्दशः कॉपी किया जाता है।

💡 टिप: अपना कैरेक्टर ब्लॉक 120 शब्दों से छोटा रखें। लंबे ब्लॉक सीन के वर्णन से टकराते हैं और कंसिस्टेंसी बेहतर बनाने के बजाय घटा सकते हैं।

सीड नंबर आपका सबसे बड़ा हथियार है

सीड कैसे काम करते हैं

हर AI इमेज एक रैंडम सीड से बनती है, यानी एक संख्या जो जनरेशन प्रक्रिया को शुरू करती है। जब आप एक ही प्रॉम्प्ट के साथ एक ही सीड इस्तेमाल करते हैं, तो आपको वही इमेज मिलती है। प्रॉम्प्ट को थोड़ा बदलें और सीड वही रखें, तो इमेज बदल जाती है, पर उसकी अंतर्निहित संरचना का कुछ हिस्सा बचा रहता है, जिसमें चेहरे की ज्यामिति भी शामिल है।

कंप्यूटर स्क्रीन पर सीड नंबर सेटिंग इंटरफ़ेस

AI आर्ट बनाने वाले किसी भी व्यक्ति के लिए यह सबसे कम इस्तेमाल होने वाला कंसिस्टेंसी टूल है। जैसे ही आप कोई कैरेक्टर बनाते हैं जो आपको पसंद आए, तुरंत उसका सीड नंबर नोट करें। उसे अपनी कैरेक्टर शीट में रखें।

कब लॉक करें और कब बदलें

अपना सीड लॉक करें जब:

  • एक ही कैरेक्टर के कई पोज़ बना रहे हों
  • पोशाक के अलग-अलग वेरिएशन आज़मा रहे हों
  • कॉमिक्स या स्टोरीबोर्ड के लिए सीन-से-सीन निरंतरता बना रहे हों

अपना सीड बदलें जब:

  • किसी दूसरे भाव या एक्सप्रेशन पर जा रहे हों, जहाँ सीड अड़चन डाल रहा हो
  • कैरेक्टर की उम्र बढ़ानी हो या उसे बहुत बदलना हो
  • पूरी तरह नया कैरेक्टर शुरू कर रहे हों

💡 टिप: कुछ प्लेटफ़ॉर्म सीड रेंज की सुविधा देते हैं, जहाँ आस-पास के सीड नंबर मिलते-जुलते, पर हूबहू एक जैसे नहीं आउटपुट देते। अपने मूल सीड से प्लस या माइनस 50 के साथ प्रयोग करें, ताकि ऐसे वैरिएंट मिलें जो कंसिस्टेंसी बनाए रखें और विविधता भी दें।

कंसिस्टेंसी के लिए प्रॉम्प्ट इंजीनियरिंग

कैरेक्टर ब्लॉक फ़ॉर्मूला

कंसिस्टेंट कैरेक्टर प्रॉम्प्ट के लिए प्रोफ़ेशनल्स यही सटीक फ़ॉर्मूला इस्तेमाल करते हैं:

[सीन सेटअप] + [कैरेक्टर ब्लॉक] + [एक्शन/पोज़] + [वातावरण] + [रोशनी] + [कैमरा/तकनीकी]

कैरेक्टर ब्लॉक कभी नहीं बदलता। बाकी प्रॉम्प्ट सीन के हिसाब से ढलता है।

कैरेक्टर ब्लॉक का उदाहरण: "young woman, 28 years old, oval face, almond-shaped dark brown eyes, defined high cheekbones, small straight nose, full lips, warm olive skin tone, shoulder-length dark wavy hair, lean athletic build"

यह ब्लॉक हर प्रॉम्प्ट में जाता है, चाहे कैरेक्टर समुद्र तट पर हो या ऑफ़िस में।

3 आम प्रॉम्प्ट गलतियाँ

गलतीक्या गड़बड़ होती हैसमाधान
अस्पष्ट वर्णन"beautiful woman" हर बार एक नया इंसान बनाता है8 या अधिक खास शारीरिक वर्णन इस्तेमाल करें
कैरेक्टर ब्लॉक को आख़िर में रखनामॉडल शुरुआती टोकन को ज़्यादा वज़न देता हैकैरेक्टर ब्लॉक को हमेशा सीन के वर्णन से पहले रखें
ब्लॉक का कोई भी शब्द बदलना"dark hair" और "dark wavy hair" में फ़र्क जनरेशन को काफ़ी बदल देता हैब्लॉक को कॉपी-पेस्ट करें, कभी दोबारा न टाइप करें

💡 टिप: अपना कैरेक्टर ब्लॉक किसी नोट्स टूल में टेक्स्ट स्निपेट के रूप में सेव करें। एक टैप में उसे किसी भी प्रॉम्प्ट फ़ील्ड में पेस्ट किया जा सकता है।

ऐसे टूल जो कंसिस्टेंसी आसान बनाते हैं

PicassoIA पर Portrait Series

PicassoIA पर Portrait Series मॉडल खास तौर पर एक ही व्यक्ति के कई पोर्ट्रेट बनाने के लिए बना है। इसे सीधे कंसिस्टेंसी की समस्या हल करने के लिए डिज़ाइन किया गया था, जिससे यह कैरेक्टर वर्क के लिए सबसे व्यावहारिक टूल्स में से एक बन जाता है।

आम-उद्देश्य वाले मॉडल के उलट, Portrait Series रेफ़रेंस कंडीशनिंग का इस्तेमाल करता है, जो हर जनरेशन में चेहरे की ज्यामिति को स्थिर रखती है। अपने कैरेक्टर की एक रेफ़रेंस इमेज अपलोड करें, और मॉडल उसे हर आगे की जनरेशन के लिए स्ट्रक्चरल गाइड की तरह इस्तेमाल करता है।

अलग-अलग सीन वातावरण में एक जैसा दिखता वही कैरेक्टर

सीन वेरिएशन के लिए Flux Redux

Flux Redux Schnell किसी मौजूदा इमेज को लेकर ऐसे वेरिएशन बनाता है जो मूल इमेज की विज़ुअल पहचान बनाए रखते हैं। कैरेक्टर कंसिस्टेंसी के लिए इसका मतलब है कि आप अपनी आदर्श कैरेक्टर जनरेशन से शुरू करते हैं और Redux की मदद से उसे नए सीन, पोज़ या रोशनी में रखते हैं।

वर्कफ़्लो यह है:

  1. अपनी "मास्टर" कैरेक्टर इमेज बनाएँ
  2. उसे Flux Redux Schnell में डालें
  3. नया सीन या पोज़ बताएँ
  4. मॉडल आपके कैरेक्टर की दिखावट बनाए रखते हुए नया संदर्भ लागू करता है

यह सिर्फ़ टेक्स्ट प्रॉम्प्ट से कैरेक्टर को दोबारा बनाने की कोशिश से कहीं ज़्यादा भरोसेमंद है।

स्ट्रक्चरल कंट्रोल के लिए Flux Canny Pro

Flux Canny Pro किसी मौजूदा इमेज का स्ट्रक्चरल एज मैप निकालता है और उसे नई जनरेशन के लिए एक सख़्त बाधा के रूप में इस्तेमाल करता है। कैरेक्टर के लिए इसका मतलब है हड्डियों की बनावट और अनुपात को लॉक करना, और साथ ही रोशनी, रंग या स्टाइल बदलने की छूट देना।

अगर आपके कैरेक्टर का कोई खास सिल्हूट या बहुत खास अनुपात है, तो Canny कंट्रोल सुनिश्चित करता है कि वे अनुपात हर जनरेशन में बचे रहें।

भरोसेमंद बेस मॉडल के रूप में SDXL

SDXL कैरेक्टर जनरेशन के लिए अब भी सबसे भरोसेमंद बेस मॉडल में से एक है, क्योंकि इसका आर्किटेक्चर विस्तृत शारीरिक वर्णनों पर बहुत अनुमानित ढंग से प्रतिक्रिया देता है। कई प्रोफ़ेशनल कैरेक्टर आर्टिस्ट किसी कैरेक्टर को स्थापित करने के लिए SDXL को मुख्य बेस बनाते हैं, और फिर सीन वेरिएशन के लिए Flux-आधारित टूल्स इस्तेमाल करते हैं।

कैरेक्टर प्रिंट से मिलाए गए रंग के नमूने देखते ग्राफ़िक डिज़ाइनर

रेफ़रेंस इमेज का सही इस्तेमाल

अच्छी रेफ़रेंस इमेज की पहचान

कैरेक्टर कंसिस्टेंसी के लिए रेफ़रेंस इमेज ऐसी होनी चाहिए:

  • तटस्थ भाव: मुस्कान या मुँह बनाना विशेषताओं को बढ़ा-चढ़ाकर दिखाता है और आगे की जनरेशन बिगाड़ देता है
  • सामने से या हल्के 3/4 कोण से: प्रोफ़ाइल में मॉडल के लिए पकड़ने लायक बहुत कम विशेषताएँ दिखती हैं
  • साफ़ रोशनी: बिना कड़ी परछाइयों वाली समान, फैली हुई रोशनी पूरी चेहरे की संरचना दिखाती है
  • न्यूनतम बैकग्राउंड: भीड़भाड़ वाला बैकग्राउंड कंडीशनिंग के दौरान चेहरे के डेटा से टकराता है
  • उच्च रिज़ॉल्यूशन: ज़्यादा डिटेल का मतलब है मॉडल के पास पकड़ने के लिए ज़्यादा जानकारी

सबसे आम गलती है बहुत स्टाइलाइज़्ड या नाटकीय रोशनी वाली इमेज को रेफ़रेंस बनाना। मॉडल स्टाइल और रोशनी को सिर्फ़ चेहरे के नहीं, बल्कि कैरेक्टर के हिस्से के रूप में सीख लेता है।

गोल्डन आवर में शहर की सड़क पर आत्मविश्वास से चलती एक जैसी विशेषताओं वाली महिला

फेस स्वैप बनाम स्टाइल ट्रांसफ़र

ये दो अलग कंसिस्टेंसी तरीके हैं, जिन्हें लगातार आपस में मिला दिया जाता है:

फेस स्वैप रेफ़रेंस इमेज से एक खास चेहरा लेकर उसे नई बनाई गई बॉडी पर लगा देता है। नतीजा फ़ोटोरियलिस्टिक और बहुत कंसिस्टेंट होता है, पर इसके लिए असली रेफ़रेंस फ़ोटो चाहिए, और आउटपुट उस खास चेहरे की रोशनी और बनावट से बँधा रहता है।

स्टाइल ट्रांसफ़र किसी कैरेक्टर की कलात्मक शैली (बालों का रंग, त्वचा का रंग, सामान्य अनुपात) को बनाए रखता है, बिना किसी खास फ़ोटोरियलिस्टिक चेहरे से बँधे। यह ज़्यादा लचीला है, पर कम सटीक।

काल्पनिक कैरेक्टर और AI से बनी रचनाओं के लिए, SDXL ControlNet LoRA के साथ स्टाइल ट्रांसफ़र लचीलापन और कंसिस्टेंसी का सबसे अच्छा संतुलन देता है।

अलग-अलग सीन में अपने कैरेक्टर की जाँच करें

5-सीन टेस्ट

किसी कैरेक्टर डिज़ाइन पर पक्का फ़ैसला लेने से पहले वह करें जिसे प्रोफ़ेशनल "5-सीन टेस्ट" कहते हैं। उसी कैरेक्टर को इन पाँच बिल्कुल अलग संदर्भों में बनाएँ:

  1. इनडोर न्यूट्रल: सपाट रोशनी वाला ऑफ़िस, लाइब्रेरी या किचन
  2. आउटडोर कड़ी धूप: सीधे ऊपर से आती दोपहर की धूप
  3. रात का सीन: कृत्रिम रोशनी, उच्च कंट्रास्ट
  4. क्लोज़-अप पोर्ट्रेट: फ़्रेम के 80% हिस्से में चेहरा
  5. फ़ुल बॉडी शॉट: कैरेक्टर सिर से पैर तक दिखे

अगर कैरेक्टर पाँचों में पहचानने लायक रहता है, तो आपका प्रॉम्प्ट और वर्कफ़्लो मज़बूत है। अगर वह किसी एक स्थिति में भटकता है, तो वह संदर्भ आपके कंसिस्टेंसी सिस्टम को तोड़ रहा है और उस पर काम करने की ज़रूरत है।

कंसिस्टेंट और इनकंसिस्टेंट AI कैरेक्टर जनरेशन दिखाती स्प्लिट स्क्रीन तुलना

कब दोबारा शुरू करें और कब सुधारें

दोबारा शुरू करें जब:

  • चेहरे की संरचना ही बदल गई हो (अलग हड्डियों की बनावट, सिर्फ़ भाव नहीं)
  • 5 में से 3 से ज़्यादा एंकर विशेषताएँ गलत हों
  • जो सीड पहले काम कर रहा था, वह किसी मॉडल अपडेट के बाद काम करना बंद कर दे

सुधारें जब:

  • त्वचा का रंग थोड़ा अलग हो पर चेहरा सही हो
  • बालों का रंग खिसक गया हो पर चेहरा बरकरार हो
  • पोज़ अजीब हो पर चेहरा सही हो

सुधार का मतलब है उस खास भटकते तत्व के लिए नेगेटिव प्रॉम्प्ट जोड़ना, या मॉडल वेट्स को थोड़ा समायोजित करना। दोबारा शुरू करने का मतलब है नया सीड और संशोधित कैरेक्टर ब्लॉक।

विस्तृत नोट्स रखें

चमड़े की नोटबुक में कैरेक्टर का विवरण लिखते हाथ

महीनों के काम में कंसिस्टेंसी बनाए रखने वाले प्रोफ़ेशनल्स की एक आदत समान होती है: जुनूनी दस्तावेज़ीकरण। हर सफल जनरेशन का सीड, प्रॉम्प्ट, मॉडल और सेटिंग्स दर्ज किए जाते हैं। हर असफल जनरेशन पर नोट लिखा जाता है कि क्या बिगड़ा।

यह उबाऊ लगता है, जब तक आपको तीन महीने बाद कैरेक्टर दोबारा बनाना न पड़े और यह याद न रहे कि आपने कौन-से सटीक शब्द इस्तेमाल किए थे। ये नोट्स ही कंसिस्टेंसी को सिर्फ़ एक बार हासिल करने के बजाय लंबे समय तक टिकाऊ बनाते हैं।

💡 टिप: कैरेक्टर वेरिएशन आज़माते समय तेज़ इटरेशन के लिए Flux Schnell LoRA इस्तेमाल करें। इसकी गति से 5-सीन टेस्ट घंटों के बजाय मिनटों में हो जाता है, जिससे दस्तावेज़ीकरण की प्रक्रिया कहीं कम थकाऊ लगती है।

बड़े पैमाने पर कंसिस्टेंसी: LoRA ट्रेनिंग

जब आपको किसी कैरेक्टर को सैकड़ों इमेज में एक जैसा रखना हो, तो प्रॉम्प्ट इंजीनियरिंग और सीड आख़िरकार अपनी सीमा तक पहुँच जाएँगे। इस स्तर पर प्रोफ़ेशनल्स अपने खास कैरेक्टर पर एक समर्पित LoRA (Low-Rank Adaptation) ट्रेन करते हैं।

कैरेक्टर LoRA एक छोटी फाइन-ट्यून की गई मॉडल लेयर है, जो आपके कैरेक्टर की 15 से 30 इमेज पर ट्रेन होती है। एक बार ट्रेन होने के बाद, किसी भी जनरेशन रन में इस LoRA को जोड़ने का मतलब है कि मॉडल अब आपके कैरेक्टर को "जानता" है और लंबे कैरेक्टर ब्लॉक के बिना भी उसे भरोसेमंद ढंग से दोहराएगा।

PicassoIA पर SDXL ControlNet LoRA फ़्रेमवर्क संरचित कैरेक्टर कंडीशनिंग को सपोर्ट करता है, जो स्ट्रक्चरल कंट्रोल को LoRA कंडीशनिंग के लचीलेपन के साथ जोड़ता है।

एक जैसी मेल खाती विशेषताओं वाले एक ही कैरेक्टर के पोलरॉइड प्रिंट

ज़्यादातर क्रिएटर्स के लिए, जब कैरेक्टर लगातार चल रहे काम का केंद्र बन जाता है, तब LoRA ट्रेनिंग ही अंतिम मंज़िल होती है। यह प्रॉम्प्टिंग कौशल पर निर्भरता खत्म करती है और कंसिस्टेंसी को लगभग अपने-आप बना देती है।

अपने खुद के कंसिस्टेंट कैरेक्टर बनाना शुरू करें

AI जनरेशन में कैरेक्टर कंसिस्टेंसी एक कौशल है, किस्मत नहीं। किसी जनरेशन टूल को खोलने से पहले इसके लिए सोच-समझकर सिस्टम बनाना ज़रूरी है।

क्रम साफ़ है: एक विस्तृत लिखित कैरेक्टर शीट से शुरू करें, जो भी जनरेशन पसंद आए उसका सीड लॉक करें, हर प्रॉम्प्ट में अपना कैरेक्टर ब्लॉक बिना चूके इस्तेमाल करें, और Portrait Series, Flux Redux Schnell और Flux Canny Pro जैसे टूल्स की मदद से अपने कैरेक्टर को नए सीनों में ले जाएँ, बिना उसकी पहचान खोए।

PicassoIA इन सभी टूल्स को एक ही जगह देता है, बेस टेक्स्ट-टू-इमेज मॉडल से लेकर खास पोर्ट्रेट कंडीशनर और स्ट्रक्चरल कंट्रोल तक। चाहे आप ग्राफ़िक नॉवेल, कंटेंट सीरीज़ या ब्रांड विज़ुअल के लिए कैरेक्टर बना रहे हों, प्लेटफ़ॉर्म पर वे खास टूल मौजूद हैं जो कंसिस्टेंसी को संयोग के बजाय भरोसेमंद बनाते हैं।

एक कैरेक्टर चुनें। उसकी शीट बनाएँ। 5-सीन टेस्ट चलाएँ। आप हैरान होंगे कि एक व्यवस्थित तरीका कितनी जल्दी एक थकाऊ प्रक्रिया को भरोसेमंद क्रिएटिव वर्कफ़्लो में बदल देता है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख