कंसिस्टेंट कैरेक्टर AI वीडियो जनरेटर: फ़्री टूल्स और प्रॉम्प्ट
AI वीडियो के हर शॉट में एक कैरेक्टर को पहचानने लायक बनाए रखें। यह लेख उन फ़्री टूल की तुलना करता है जो चेहरे को स्थिर रखते हैं, PicassoIA पर बना रेफ़रेंस इमेज वर्कफ़्लो दिखाता है, और कैरेक्टर शीट, मूवमेंट क्लिप और मल्टी-सीन कहानियों के लिए कॉपी करने लायक प्रॉम्प्ट देता है।
आप एक शानदार क्लिप बनाते हैं जिसमें एक महिला बारिश वाले बाज़ार में जैतून रंग का रेनकोट पहने चल रही है। फिर आप अगला शॉट बनाते हैं और वह अलग नाक, अलग बालों और ऐसे कोट के साथ दिखती है जिसका रंग चुपचाप बदल गया है। AI वीडियो से कहानी कहने वाले हर व्यक्ति की यही रोज़ की परेशानी है, और कंसिस्टेंट कैरेक्टर AI वीडियो जनरेटर वर्कफ़्लो इसी को ठीक करने के लिए बना है। अच्छी बात यह है कि आपको किसी पेड स्टूडियो टूल्स के सेट की ज़रूरत नहीं। कुछ फ़्री टूल, एक मज़बूत रेफ़रेंस इमेज और दोहराया जा सकने वाला प्रॉम्प्ट ढाँचा काफ़ी है, ताकि पहली क्लिप से दसवीं तक एक ही इंसान स्क्रीन पर बना रहे।
यह लेख बताता है कि कैरेक्टर क्यों भटकते हैं, कौन-से फ़्री टूल किसी पहचान को सबसे अच्छी तरह बनाए रखते हैं, चार-चरणों वाला रेफ़रेंस इमेज वर्कफ़्लो, PicassoIA पर दो व्यावहारिक ट्यूटोरियल, और ऐसे प्रॉम्प्ट जिन्हें आप सीधे जनरेटर में चिपका सकते हैं।
क्लिप्स के बीच कैरेक्टर क्यों भटकते हैं
हर AI वीडियो टूल मूल रूप से एक प्रोबेबिलिटी मशीन है। "रेनकोट में एक महिला" माँगिए, दो बार, और आपको दो अलग महिलाएँ मिलेंगी, क्योंकि अनुरोध में यह तय ही नहीं है कि वह कौन है। कंसिस्टेंसी कोई स्विच नहीं है जिसे आप ऑन कर दें। यह तब बनती है जब आप मॉडल को एक वाक्य से ज़्यादा ऐसी चीज़ देते हैं जिसे वह पकड़कर रखे।
पहचान का भटकाव कैसा दिखता है
भटकाव शायद ही कभी एक बड़ी विफलता के रूप में दिखता है। यह छोटे बदलावों के रूप में घुसता है, जो शॉट्स की एक श्रृंखला में जुड़कर बड़ा हो जाता है:
चेहरे का भटकाव: जबड़ा नरम पड़ जाता है, आँखें पास आ जाती हैं, या क्लिपों के बीच नाक का आकार बदल जाता है।
पहनावे का भटकाव: कॉलर में अचानक बटन आ जाता है, स्कार्फ़ सरसों के रंग से नारंगी हो जाता है, कहीं से लोगो प्रकट हो जाता है।
स्टाइल का भटकाव: पहला शॉट दानेदार 35mm फ़िल्म जैसा दिखता है, दूसरा किसी चमकदार विज्ञापन जैसा।
मोशन का भटकाव: एक ही क्लिप के भीतर, तेज़ सिर घुमाने या कैमरे की ओर लंबी चाल के दौरान चेहरा हल्का-सा बदल जाता है।
दर्शक ये चारों एक सेकंड से कम में पकड़ लेते हैं, भले ही वे बता न पाएँ कि गड़बड़ क्या है। जो कैरेक्टर एक जैसा न दिखे, वह बस कैरेक्टर लगना बंद कर देता है।
ऐसा क्यों होता है
हर जनरेशन रैंडम नॉइज़ से शुरू होता है। "युवा महिला, ऑबर्न बाल, झाइयाँ" जैसा टेक्स्ट विवरण हज़ारों अलग-अलग चेहरों पर फ़िट बैठता है, इसलिए मॉडल हर बार नया चेहरा चुन लेता है। शब्द किसी इंसान का अधूरा विवरण होते हैं। तस्वीर नहीं।
इसीलिए इस लेख का हर भरोसेमंद तरीका मॉडल को लंबे पैराग्राफ़ के बजाय एक इमेज से टिकाता है।
💡 सरल नियम: इमेज से तय करें कि कैरेक्टर कौन है, और टेक्स्ट से बताएँ कि कैरेक्टर क्या करता है। किसी प्रॉम्प्ट से वह काम कभी न करवाएँ जो रेफ़रेंस फ़ोटो का है।
कैरेक्टर को थामे रखने वाले फ़्री टूल
फ़्री वीडियो टूल तीन परिवारों में आते हैं, और हर एक पहचान को अलग तरीके से सँभालता है:
इमेज से वीडियो। आप पहला फ़्रेम देते हैं, इसलिए पहले फ़्रेम का चेहरा ठीक वही होता है जो आपका रेफ़रेंस है।
रेफ़रेंस से वीडियो। आप एक या अधिक रेफ़रेंस इमेज या क्लिप देते हैं, और मॉडल सीन गढ़ते हुए भी विषय को पहचानने लायक रखता है।
मोशन ट्रांसफ़र। आप एक कैरेक्टर इमेज के साथ वह मूवमेंट वाला वीडियो देते हैं जो आप चाहते हैं, और मॉडल वह मूवमेंट आपके कैरेक्टर पर मैप कर देता है।
वीडियो मॉडल उतना ही कंसिस्टेंट होता है जितनी स्टिल इमेज आप उसे देते हैं, इसलिए असली काम ज़्यादातर पहली क्लिप रेंडर होने से पहले ही हो जाता है।
रेफ़रेंस इमेज वर्कफ़्लो
पूरी प्रक्रिया चार कदमों की है। इन्हें क्रम से करें और कोई कदम न छोड़ें।
पहले कैरेक्टर शीट बनाएँ
किसी वीडियो टूल को छूने से पहले अपने कैरेक्टर की स्टिल इमेज का एक सेट बनाएँ: सामने का दृश्य, प्रोफ़ाइल, तीन-चौथाई दृश्य, और एक-दो एक्सप्रेशन। Nano Banana Pro इस चरण के लिए अच्छा बैठता है, क्योंकि यह आपके प्रॉम्प्ट के साथ 14 रेफ़रेंस इमेज तक स्वीकार करता है। एक पोर्ट्रेट पसंद आ जाए, तो उसे वापस डालें और बाकी कोण माँगें।
फिर एक आइडेंटिटी ब्लॉक लिखें: कैरेक्टर का वर्णन करने वाले तय शब्दों का एक पैराग्राफ़। इसे प्रोजेक्ट के बाकी हिस्से में हर प्रॉम्प्ट की शुरुआत में बिना बदले चिपकाएँ।
a woman in her late twenties with a short auburn bob, light freckles across her nose and cheeks, hazel eyes, a small silver stud earring, an olive-green waxed cotton raincoat and a mustard-yellow wool scarf
ठोस बातें काव्यात्मक बातों से बेहतर हैं। बालों की लंबाई, चेहरे की एक खासियत और एक पोशाक, विशेषणों के पूरे पन्ने से ज़्यादा काम करते हैं।
कपड़े और चेहरा लॉक करें
पहनावा चेहरों से ज़्यादा भटकाव पैदा करता है। एक सरल सिल्हूट और दो सपाट रंगों वाली एक पोशाक चुनें। लोगो, लेटरिंग, फ़्रिंज, परतों वाले गहने और भड़कीले पैटर्न भटकाव को खींचते हैं, क्योंकि मॉडल को हर फ़्रेम में उन्हें दोबारा गढ़ना पड़ता है।
जब कोई स्टिल लगभग सही हो, तो उसे दोबारा जनरेट करने के बजाय ठीक करें। PicassoIA Image Editor Pro तीन रेफ़रेंस इमेज तक लेता है और प्रॉम्प्ट के भीतर उन्हें "image 1", "image 2" आदि कहकर संबोधित करने देता है। ऐसा कुछ आज़माएँ: "image 1 से चेहरा और बाल रखें। सिर्फ़ स्कार्फ़ को सरसों के पीले रंग में बदलें।" चूँकि मॉडल अनलिमिटेड है, आप शीट साफ़ होने तक छोटे-छोटे दर्जनों सुधार चला सकते हैं।
पहले फ़्रेम से एनिमेट करें
सबसे अच्छी स्टिल चुनें और उसे इमेज-टू-वीडियो जनरेशन का पहला फ़्रेम बनाएँ। Seedance 2.5 Lite और PicassoIA Video दोनों इनपुट इमेज को शुरुआती फ़्रेम मानते हैं और उसका आस्पेक्ट रेशियो अपनाते हैं। यानी पहले फ़्रेम का चेहरा ही आपका रेफ़रेंस है, और मॉडल को उसे बस पाँच से दस सेकंड तक स्थिर रखना है।
प्रॉम्प्ट सिर्फ़ मूवमेंट के बारे में लिखें। चेहरा दोबारा न बताएँ, क्योंकि इमेज यह पहले ही कर चुकी है। अच्छी मूवमेंट पंक्तियाँ: "कैमरे की ओर सिर घुमाती है", "हल्की बारिश में आगे चलती है", "धीमा डॉली-इन"। हर क्लिप में एक ही क्रिया रखें।
आख़िरी फ़्रेम से दृश्य जोड़ें
कहानी आगे बढ़ाने के लिए, किसी भी वीडियो प्लेयर से क्लिप एक का आख़िरी फ़्रेम एक्सपोर्ट करें और उसे क्लिप दो का पहला फ़्रेम बनाएँ। Seedance 2.5 Lite में Last frame image विकल्प भी है: पहला फ़्रेम सेट होने पर क्लिप उस फ़्रेम से उस फ़्रेम की ओर एनिमेट होती है जो आप देते हैं, जो योजनाबद्ध ट्रांज़िशन के लिए काम आता है।
जो भी काम कर गया हो उसे दोहरा सकें, इसके लिए एक सरल प्रोडक्शन लॉग रखें:
सीन
स्रोत इमेज
सीड
मूवमेंट पंक्ति
1. मार्केट
सामने का दृश्य, रेनकोट
4821
कैमरे की ओर मुड़ती है, मुस्कुराती है
2. प्लेटफ़ॉर्म
तीन-चौथाई दृश्य
4821
अपनी घड़ी देखती है
3. कैफ़े
प्रोफ़ाइल दृश्य
7390
हाथों से कप को लपेटती है
💡 टिप: हर उस क्लिप का सीड सेव करें जो आपको पसंद हो। एक ही सीड के साथ वही प्रॉम्प्ट दोबारा चलाने से परिणाम दोहराया जाता है, इसलिए आप एक शब्द बदलकर देख सकते हैं कि वह शब्द ठीक-ठीक क्या बदलता है।
Seedance 2.5 Lite चरण-दर-चरण
Seedance 2.5 Lite Seedance 2.5 का हल्का संस्करण है। यह 480p और 720p पर रेंडर करता है, सिंक्रोनाइज़्ड ऑडियो के साथ 10 सेकंड तक की क्लिप बनाता है, और Wonder members इसे प्रति क्लिप लागत के बिना चला सकते हैं। यह आख़िरी बात कंसिस्टेंसी के काम में मायने रखती है, क्योंकि आप बहुत बार रीजेनरेट करेंगे।
मॉडल पेज खोलें और अपनी कैरेक्टर स्टिल Input image पर अपलोड करें। Aspect ratio को match_input_image पर छोड़ें ताकि क्लिप आपके रेफ़रेंस का फ़्रेमिंग बनाए रखे।
सिर्फ़ मूवमेंट वाला प्रॉम्प्ट लिखें। सिनेमैटिक, क्रमबद्ध विवरण सबसे अच्छा काम करते हैं: क्या चलता है, कैमरा कैसे चलता है, शॉट के दौरान क्या बदलता है।
रिज़ॉल्यूशन चुनें। तेज़ ड्राफ़्ट के लिए 480p, और उन वर्ज़नों के लिए 720p (डिफ़ॉल्ट) रखें जिन्हें आप रखना चाहते हैं।
अवधि तय करें। किसी छोटे बीट के लिए 5 सेकंड चुनें, या जब एक्शन को जगह चाहिए तो 10 सेकंड।
सीड डालें। कोई भी पूर्ण संख्या चलेगी। इसे अपने लॉग में लिखें।
आख़िरी फ़्रेम इमेज जोड़ें (वैकल्पिक)। जब आप चाहते हों कि क्लिप किसी खास पोज़ या सेटिंग पर खत्म हो, तो समापन वाला फ़्रेम अपलोड करें।
ऑडियो तय करें।Save audio डिफ़ॉल्ट रूप से चालू है। अगर आप अपना साउंडट्रैक जोड़ने वाले हैं तो इसे बंद कर दें।
जनरेट करें और तुलना करें। तीन-चार वैरिएशन चलाएँ, सबसे अच्छा रखें, और नोट करें कि किस शब्द-चयन से भटकाव आया।
एक तय फ़ॉर्मेट पसंद है? PicassoIA Video इनपुट इमेज के साथ उसी तरह काम करता है, लेकिन हर क्लिप 24 फ़्रेम प्रति सेकंड पर, 480p या 720p में, तय 5 सेकंड की होती है। इससे पूरे सीक्वेंस को एक ही लंबाई में काटना आसान हो जाता है।
💡 टिप: मूवमेंट सही लगने तक 480p पर ड्राफ़्ट बनाएँ, फिर जीतने वाला प्रॉम्प्ट और सीड 720p पर दोबारा चलाएँ।
रेफ़रेंस क्लिप के लिए Wan 2.7 R2V
Wan 2.7 R2V एक रेफ़रेंस-से-वीडियो मॉडल है। यह आपकी रेफ़रेंस सामग्री पढ़ता है और उसका इस्तेमाल पूरे वीडियो में सब्जेक्ट की पहचान टिकाने के लिए करता है, इसलिए आप बिना पहला फ़्रेम दिए किसी जाने-पहचाने कैरेक्टर को बिल्कुल नए सीन में रख सकते हैं। यह 720p या 1080p आउटपुट देता है और 16:9, 9:16, 1:1, 4:3 और 3:4 को सपोर्ट करता है।
जो सेटिंग्स मायने रखती हैं:
रेफ़रेंस इमेज: JPG, PNG, BMP या WebP में आपके कैरेक्टर के एक या अधिक पोर्ट्रेट।
रेफ़रेंस वीडियो: उसी कैरेक्टर की छोटी MP4 या MOV क्लिप, जब आप चाहते हों कि लुक और मूवमेंट बिना बिगड़े आगे पहुँचें।
प्रॉम्प्ट: सीन और एक्शन का वर्णन करें। उसे दोबारा वर्णन करने के बजाय "रेफ़रेंस वाली महिला" लिखें।
शॉट टाइप: एक सब्जेक्ट के लिए single, कई सब्जेक्ट वाले सीन के लिए multi।
नेगेटिव प्रॉम्प्ट: वह सूची बनाएँ जो नहीं दिखनी चाहिए, जैसे बदला हुआ हेयरस्टाइल या अतिरिक्त लोग।
रिज़ॉल्यूशन: टेस्ट के लिए 720p, और फ़ाइनल रेंडर के लिए 1080p (डिफ़ॉल्ट)।
सीड: दोहराने योग्य आउटपुट के लिए 0 से 2147483647 तक कोई भी मान।
जब मूवमेंट सबसे ज़्यादा मायने रखता है
कुछ शॉट्स को सिर्फ़ स्थिर चेहरा नहीं, बल्कि एक खास मूवमेंट चाहिए। Kling v3 Motion Control एक कैरेक्टर इमेज और एक छोटी रेफ़रेंस वीडियो लेता है और मूवमेंट को आपके कैरेक्टर पर मैप कर देता है। स्टैंडर्ड मोड त्वरित प्रीव्यू के लिए 720p रेंडर करता है, और प्रोफ़ेशनल मोड फ़ाइनल क्लिप के लिए 1080p।
कैरेक्टर ओरिएंटेशन सेटिंग लंबाई की सीमा बदलती है। image पर सेट करने पर कैरेक्टर उसी दिशा में रहता है जिधर आपकी स्टिल है, और क्लिप 10 सेकंड तक जा सकती है। video पर सेट करने पर कैरेक्टर रेफ़रेंस क्लिप के व्यक्ति का अनुसरण करता है, और क्लिप 30 सेकंड तक पहुँच सकती है। चूँकि कैरेक्टर आपकी स्टिल से आता है, पहचान वहीं बनी रहती है, जबकि मूवमेंट क्लिप से आता है। एक छोटा टेक्स्ट प्रॉम्प्ट ऊपर से सीन के ब्योरे जोड़ सकता है।
कॉपी करने लायक प्रॉम्प्ट
कोष्ठक वाले हिस्से बदलें और बाकी सब हूबहू वैसा ही छोड़ें।
कैरेक्टर शीट प्रॉम्प्ट
Photorealistic portrait of [IDENTITY BLOCK]. Neutral grey backdrop, soft window light from the left, 85mm lens, shallow depth of field, natural skin texture, relaxed expression, [front view / three-quarter view / profile view].
इसे तीन बार चलाएँ और सिर्फ़ कोष्ठक वाला दृश्य बदलें। बाकी हर शब्द एक जैसा रहे।
पहले फ़्रेम के लिए मोशन प्रॉम्प्ट
She turns her head slowly toward the camera and smiles, raindrops slide off the edge of her hood, shoppers drift past in soft focus behind her. Slow dolly-in, gentle handheld movement, late afternoon light.
ध्यान दें कि इसमें क्या नहीं है: बाल, झाइयाँ, कोट। यह सब पहला फ़्रेम उठाता है।
रेफ़रेंस क्लिप प्रॉम्प्ट
The woman from the reference images walks through a rainy outdoor market, stops at a fruit stall and lifts an orange to smell it. Medium tracking shot at eye level, warm string lights, light rain, shallow depth of field.
इसके साथ नेगेटिव प्रॉम्प्ट जोड़ें:
different face, changed hairstyle, different coat, extra people, text, watermark, blurry, distorted hands
चार-सीन की कहानी योजना
सीन
सेटिंग
मूवमेंट पंक्ति
कैमरा
1
बारिश वाला बाज़ार
फल की दुकानों के पास से चलती है
धीमा ट्रैकिंग
2
सांझ के समय ट्रेन प्लेटफ़ॉर्म
अपनी घड़ी देखती है, पटरी की ओर देखती है
लॉक्ड ऑफ़
3
कैफ़े की खिड़की वाली सीट
दोनों हाथों से कप लपेटती है, बाहर झाँकती है
धीमा पुश-इन
4
भोर में छत
स्कार्फ़ कसकर खींचती है, सूर्योदय की ओर मुड़ती है
राइट की ओर पैन
हर सेटिंग के लिए एक स्टिल पाने के लिए PicassoIA Image Editor Pro से पूछें: "image 1 की महिला को सांझ के समय ट्रेन प्लेटफ़ॉर्म पर रखें। उसका चेहरा, बाल और पोशाक जस के तस रखें।" फिर तालिका की मूवमेंट पंक्ति से हर स्टिल को एनिमेट करें।
वे गलतियाँ जो कंसिस्टेंसी तोड़ती हैं
पहचान वाला ब्लॉक दोबारा लिखना
"ऑबर्न बॉब" को "छोटे लालिमा वाले बाल" से बदलने पर मॉडल को नया ब्रीफ़ मिल जाता है, और वह अपनी मनमर्ज़ी चलाने लगेगा। ब्लॉक कॉपी करके चिपकाएँ। उसे याददाश्त से कभी दोबारा न टाइप करें।
एक क्लिप से बहुत ज़्यादा माँगना
तेज़ स्पिन, चेहरे के सामने से गुज़रती भीड़ और लंबे एक्शन सीक्वेंस मॉडल को शॉट के बीच में कैरेक्टर दोबारा बनाने पर मजबूर करते हैं। हर क्लिप को एक एक्शन दें और उनके बीच कट करें।
बाकी ज़्यादातर समस्याएँ कुछ ही कारणों पर लौटती हैं:
समस्या
संभावित कारण
समाधान
चेहरा क्लिप के बीच में बदल जाता है
तेज़ सिर घुमाना या लंबी क्लिप
5 सेकंड तक छोटा करें और मूवमेंट पंक्ति धीमी करें
सीन बदलने पर कोट का रंग बदल जाता है
रंग अलग शब्दों में बताया गया
पहचान वाला ब्लॉक शब्दशः दोबारा इस्तेमाल करें
क्लिप अलग-अलग फ़िल्मों जैसी दिखती हैं
लेंस और रोशनी वाले शब्द बदल गए
हर प्रॉम्प्ट में वही लेंस और लाइट वाली पंक्ति दोहराएँ
पूरी प्रक्रिया एक दोपहर में निपट सकती है। एक कैरेक्टर चुनें, आइडेंटिटी ब्लॉक लिखें, Nano Banana Pro से पाँच इमेज की शीट बनाएँ, PicassoIA Image Editor Pro से उसे निखारें, फिर Seedance 2.5 Lite से दो या तीन सीन एनिमेट करें। इस दौरान हर सीड लॉग करें।
आपकी पहली कोशिश परफ़ेक्ट नहीं होगी, और यह ठीक है। हर दौर बताता है कि कौन-से शब्द कैरेक्टर को स्थिर रखते हैं और कौन-से उसे फिसलने देते हैं। PicassoIA खोलें, अपनी कैरेक्टर इमेज बनाएँ, अपनी सबसे अच्छी इमेज को पहले फ़्रेम के रूप में अपलोड करें और आज ही अपनी पहली कंसिस्टेंट क्लिप रेंडर करें। जब आप और वीडियो मॉडल साथ-साथ तुलना करना चाहें, तो पूरा कैटलॉग picassoia.com/en/all-models पर देखें।