AI वीडियो मॉडल के लिए प्रॉम्प्ट पैटर्न जो सच में काम करते हैं
AI वीडियो में लगातार अच्छे नतीजे देने वाले प्रॉम्प्ट पैटर्न का संरचित विश्लेषण। मूल सब्जेक्ट-एक्शन-एनवायरनमेंट फ़ॉर्मूला से लेकर Wan 2.7, Kling v3, Veo 3.1, Sora 2 और Seedance 2.0 के मॉडल-विशेष बदलाव तक, साथ में चीट शीट, नेगेटिव प्रॉम्प्ट टेम्पलेट और सबसे आम गड़बड़ियों के समाधान।
जो वीडियो प्रॉम्प्ट काम करता है और जो फ़ेल होता है, उनके बीच का फ़र्क शायद ही कभी शब्दावली का होता है। यह संरचना का होता है। AI वीडियो मॉडल प्रॉम्प्ट को उस तरह नहीं पढ़ते जैसे इंसान पढ़ते हैं। वे आपके दिए शब्दों के क्रम से स्थानिक संबंध, समय के संकेत और मोशन वेक्टर पहचानते हैं। अगर इन्हें गलत लिखा, तो सब्जेक्ट झिलमिलाने लगते हैं, कैमरा बहकता है और बीच में दृश्य शोर में बदल जाते हैं। सही लिखा, तो फ़ुटेज ऐसा लगता है जैसे किसी असली कैमरे से शूट हुआ हो।
यह लेख उन खास प्रॉम्प्ट पैटर्न का विश्लेषण करता है जो आज उपलब्ध प्रमुख AI वीडियो मॉडल पर लगातार, उच्च गुणवत्ता वाले आउटपुट देते हैं: Wan 2.7 T2V से लेकर Kling v3 Video, Veo 3.1 से लेकर Seedance 2.0 तक।
ज़्यादातर प्रॉम्प्ट शुरू में ही क्यों बिखर जाते हैं
3 पैटर्न जो हर बार फ़ेल होते हैं
1. नाउन डंप। "पहाड़, सूर्यास्त, औरत, चलती हुई, सिनेमाई।" यह मॉडल को पाँच चीज़ें बताता है, पर उनके बीच कोई संबंध नहीं देता। क्या औरत पहाड़ की तरफ़ चल रही है? या उससे दूर? मॉडल अंदाज़ा लगाता है, और हर फ़्रेम पर अलग अंदाज़ा लगाता है।
2. एडजेक्टिव स्टैक। "खूबसूरत, शानदार, मनमोहक, दिल छू लेने वाला, जादुई सूर्यास्त।" एक जैसे शब्द जोड़ने से असर बढ़ता नहीं, बल्कि कमज़ोर पड़ जाता है। मॉडल इन विशेषणों का औसत निकालता है और एक बीच का नतीजा देता है, जो इनमें से किसी पर भी पूरी तरह नहीं टिकता।
3. निष्क्रिय दृश्य। "एक जंगल। वहाँ एक नदी है। पक्षी मौजूद हैं।" कोई मोशन दिशा नहीं, सब्जेक्ट की कोई गतिविधि नहीं, कोई समय-क्रम नहीं। वीडियो मॉडल को यह जानना होता है कि समय के साथ क्या हो रहा है, केवल यह नहीं कि फ़्रेम में क्या मौजूद है।
मॉडल असल में क्या पार्स करता है
आधुनिक वीडियो जनरेशन मॉडल प्रॉम्प्ट को परतों में प्रोसेस करते हैं। पहले वे मुख्य सब्जेक्ट निकालते हैं और उसे मोशन की प्राथमिकता देते हैं। फिर वे एनवायरनमेंट का संदर्भ पढ़ते हैं ताकि बैकग्राउंड की परत बने। आख़िर में वे समय के संशोधक जैसे "धीरे-धीरे", "अचानक" या "कैमरा पीछे खिंचता है" समझते हैं, ताकि क्लिप की अवधि भर में हरकत को कोरियोग्राफ़ किया जा सके।
अगर आपका सब्जेक्ट लंबी विशेषणों की सूची के बीच दबा है, या आपके मोशन संकेत एनवायरनमेंट स्थापित होने से पहले आ जाते हैं, तो मॉडल की कोहेरेंस टूट जाती है। पहले तीन से पाँच शब्दों का सबसे ज़्यादा वज़न होता है।
💡 मोटा नियम: पहले सब्जेक्ट, फिर एक्शन, फिर एनवायरनमेंट, और संशोधक सबसे आख़िर में। इससे हटने का जोखिम आपका अपना है।
कोर प्रॉम्प्ट फ़ॉर्मूला
वह फ़ॉर्मूला जो सभी वीडियो मॉडल पर लगातार बाकी सभी से बेहतर प्रदर्शन करता है, यह है:
यहाँ हर शब्द का वज़न है। इन दो प्रॉम्प्ट की तुलना करें:
कमज़ोर: "प्रकृति में सफ़ेद पोशाक वाली एक औरत"
मज़बूत: "धूप से भरे जंगली फूलों के मैदान में एक औरत बहती सफ़ेद लिनन की पोशाक में नंगे पैर चलती है"
दूसरे संस्करण में मॉडल को एक सब्जेक्ट, एक भौतिक गुण, एक खास एक्शन क्रिया और एक परिभाषित एनवायरनमेंट मिलता है। अब मॉडल सब्जेक्ट को फ़्रेम-दर-फ़्रेम लगातार टिका सकता है।
जब आपका सब्जेक्ट इंसान हो, तो शामिल करें: कपड़े की बनावट, अंदाज़न कद-काठी, और एक खास एक्शन क्रिया। "वहाँ खड़ी है" नहीं, बल्कि "धीरे से मुड़कर कैमरे की ओर देखती है" लिखें। "बैठी है" नहीं, बल्कि "लकड़ी की मेज़ के पार आगे झुकती है" लिखें।
लैंडस्केप, प्रोडक्ट या वस्तुओं जैसे गैर-मानव सब्जेक्ट के लिए उन्हें फ़्रेम में एक खास जगह दें: "अग्रभूमि में एक काली एस्प्रेसो मशीन" या "बारिश से चमकती शहर की सड़क पर तिरछी खड़ी एक विंटेज कार।"
मोशन और कैमरा की दिशा
यहीं ज़्यादातर प्रॉम्प्ट अपना परफ़ॉर्मेंस गँवा देते हैं। कैमरा मोशन और सब्जेक्ट मोशन दो अलग चीज़ें हैं, और दोनों को एक जैसा मानने से दोनों बिगड़ते हैं।
सब्जेक्ट मोशन बताता है कि आपका मुख्य तत्व क्या करता है: "धीरे-धीरे चलता है," "अपना सिर घुमाती है," "लहरें टकराकर लौटती हैं।"
कैमरा मोशन बताता है कि वर्चुअल कैमरा क्या करता है: "धीमा डॉली पुश," "लो-एंगल ट्रैकिंग शॉट," "एरियल क्रेन पुल-बैक," "हैंडहेल्ड हल्का झटका।"
इन्हें अलग-अलग बताएँ, और कैमरा मोशन सबसे आख़िर में रखें, ताकि मॉडल उसे कोरियोग्राफ़ी के आवरण की तरह इस्तेमाल कर सके:
"धूप वाले आँगन में एक लाल पोशाक में औरत धीरे से कैमरे की ओर मुड़ती है। कमर की ऊँचाई से धीमा डॉली पुश आगे। 35mm लेंस।"
वातावरण और रोशनी की परत
रोशनी ही वह सबसे बड़ा वैरिएबल है जो एक सपाट दिखने वाले आउटपुट और सिनेमाई लगने वाले आउटपुट के बीच फ़र्क करता है। बताएँ:
दिशा: "बाईं ओर से सुबह की रोशनी," "डूबते सूरज से बैकलिट," "ऊपर से छनती छायादार धूप"
गुणवत्ता: "नरम फैली हुई रोशनी," "दोपहर की तीखी कंट्रास्ट," "गोल्डन आवर की गर्म चमक"
रंग का तापमान: "गर्म अंबर रंग," "ठंडा नीला-भूरा बादलदार प्रकाश"
बस "सिनेमाई रोशनी" न लिखें। यह वाक्यांश इतना ज़्यादा इस्तेमाल हो चुका है कि ज़्यादातर मॉडल के लिए लगभग अर्थहीन है। रोशनी का वर्णन ऐसे करें जैसे एक सिनेमैटोग्राफ़र करता है: वह कहाँ से आती है, और सब्जेक्ट के चेहरे या सतह पर क्या असर डालती है।
💡 प्रो टिप: "Kodak Portra 400 color profile" या "16mm पर शूट" जैसा कोई खास फ़िल्म स्टॉक संदर्भ जोड़ने से मॉडल को संकेत मिलता है कि आपको ऑर्गेनिक टेक्सचर, प्राकृतिक ग्रेन और कम संतृप्त हाइलाइट चाहिए। आउटपुट की गुणवत्ता में यह अपनी हैसियत से कहीं ज़्यादा असर डालता है।
दृश्य के प्रकार के अनुसार प्रॉम्प्ट पैटर्न
अलग-अलग दृश्य श्रेणियों को अलग संरचनात्मक ज़ोर चाहिए। यहाँ बताया गया है कि अपने प्रॉम्प्ट में वज़न कैसे दें।
कथात्मक और सिनेमाई दृश्य
कहानी-आधारित क्लिप के लिए समय-क्रम का तर्क सबसे अहम है। मॉडल को पता होना चाहिए कि पहले क्या होता है, फिर क्या होता है, और कैमरा उसका जवाब कैसे देता है।
जुड़ाव वाले मोशन शब्द इस्तेमाल करें: "फिर," "जब," "जबकि।" ये फ़्रेम-दर-फ़्रेम कारण-और-प्रभाव का संबंध बनाते हैं।
"सूर्योदय के समय एक अकेला पर्वतारोही घाटी को देखने के लिए रुककर एक चोटी पर पहुँचता है। कैमरा धीरे-धीरे वाइड क्रेन शॉट में पीछे खिंचता है, और उसके चारों ओर के पहाड़ों का विस्तार दिखाता है। दाईं ओर से गर्म सुनहरी रोशनी।"
नाटकीय असर के लिए Kling v3 Video और Veo 3.1 समय-क्रम के तर्क को सबसे अच्छी तरह संभालते हैं। दोनों जुड़ाव वाले मोशन शब्दों को भरोसेमंद ढंग से समझते हैं और कैमरा मूवमेंट के दौरान सब्जेक्ट की कंसिस्टेंसी बनाए रखते हैं।
प्रोडक्ट और लाइफ़स्टाइल फ़ुटेज
प्रोडक्ट शॉट्स को स्थानिक सटीकता चाहिए। मॉडल को साफ़-साफ़ बताएँ कि प्रोडक्ट फ़्रेम में कहाँ है, उसके आसपास क्या है, और रोशनी उसकी सतह से कैसे मिलती है।
"सफ़ेद संगमरमर के काउंटरटॉप पर अग्रभूमि में तेज़ फ़ोकस में एक चिकनी काली एस्प्रेसो मशीन, उसकी टोंटी से उठती भाप। सुबह की खिड़की की रोशनी के साथ धुंधली गर्म रसोई की पृष्ठभूमि। मशीन से उठती भाप की ओर धीमा रैक फ़ोकस पुल। 100mm मैक्रो लेंस।"
प्रोडक्ट वर्क के लिए LTX 2 Pro और LTX 2.3 Pro 4K आउटपुट में वस्तु के बारीक डिटेल और साफ़ बैकग्राउंड अलगाव को बनाए रखने में उत्कृष्ट हैं।
पोर्ट्रेट और कैरेक्टर मोशन
पोर्ट्रेट इस पर टिके होते हैं कि मॉडल फ़्रेम-दर-फ़्रेम चेहरे की कंसिस्टेंसी कितनी अच्छी तरह संभालता है। यहाँ सबसे आम विफलता सब्जेक्ट का मॉर्फ़ होना है। इसका मुकाबला इस तरह करें:
तटस्थ भाव का आधार जोड़ें: "तटस्थ भाव, हल्की स्वाभाविक मुस्कान"
सिर और आँखों की दिशा बताएँ: "सीधे कैमरे में देखते हुए, हल्का नीचे का झुकाव"
मोशन को न्यूनतम और धीमा रखें: "हवा में बालों की हल्की हरकत, सिर का धीमा मोड़"
"छोटे काले बालों वाली एक आत्मविश्वासी युवा औरत हल्की स्वाभाविक मुस्कान के साथ सीधे कैमरे में देखती है, गोधूलि में एक शहरी छत पर खड़ी। उसके पीछे डूबते सूरज की रिम लाइट एक गर्म प्रभामंडल बनाती है। 85mm f/1.4 पोर्ट्रेट लेंस। धीमा ज़ूम इन, क्लिप के अंत तक सब्जेक्ट फ़्रेम भर देता है।"
PicassoIA पर Wan 2.7 T2V का उपयोग कैसे करें
Wan 2.7 T2V उपलब्ध सबसे सक्षम टेक्स्ट-टू-वीडियो मॉडलों में से एक है, जो मज़बूत टेम्पोरल कोहेरेंस के साथ 1080p क्लिप बनाता है। PicassoIA पर सबसे अच्छे नतीजे पाने का तरीका यहाँ है।
चरण 2: प्रॉम्प्ट फ़ील्ड में ऊपर दिए फ़ॉर्मूले के अनुसार अपना इनपुट संरचित करें। Wan 2.7 कैमरा मोशन संकेतों पर विशेष रूप से अच्छा प्रतिक्रिया देता है, जब उन्हें प्रॉम्प्ट के अंत में रखा जाए, सब्जेक्ट और एनवायरनमेंट पूरी तरह स्थापित होने के बाद।
चरण 3: अपना रिज़ॉल्यूशन 1080p पर सेट करें। Wan 2.7 ज़्यादा आउटपुट रिज़ॉल्यूशन पर काफ़ी बेहतर तीक्ष्णता बनाए रखता है, और 720p से फ़र्क साफ़ दिखता है।
चरण 4: उन क्लिप के लिए जिन्हें मोशन की निरंतरता चाहिए (जैसे किसी व्यक्ति का दृश्य से होकर चलना), नेगेटिव प्रॉम्प्ट फ़ील्ड का उपयोग करके यह बाहर रखें: blurry, flickering, morphing, distorted, low quality, static, duplicate subject।
चरण 5: अपनी पहली जनरेशन चलाएँ। अगर सब्जेक्ट पहले 2 सेकंड में बहकता है, तो आपका एनवायरनमेंट वर्णन बहुत कम है। दोबारा बनाने से पहले बैकग्राउंड में और स्पेशियल एंकर जोड़ें।
चरण 6: उसी दृश्य पर इमेज-टू-वीडियो वर्कफ़्लो के लिए Wan 2.7 I2V पर जाएँ, जो आपको जनरेट की गई स्टिल इमेज को एक कंटिन्यूएशन प्रॉम्प्ट से एनिमेट करने देता है, और पहले फ़्रेम से ही सब्जेक्ट की दिखावट को लॉक करता है।
Wan 2.7 के लिए पैरामीटर सुझाव
पैरामीटर
अनुशंसित मान
नोट्स
Steps
30-40
ज़्यादा steps = ज़्यादा डिटेल, धीमी जनरेशन
CFG Scale
7-9
ओवर-शार्पनिंग से बचने के लिए 10 से नीचे रखें
Motion Strength
0.6-0.8
0.9 से ऊपर सब्जेक्ट में अस्थिरता पैदा करता है
Clip Length
5-8 सेकंड
कोहेरेंस के लिए सबसे अच्छी अवधि
Negative Prompt
नीचे का अनुभाग देखें
हमेशा शामिल करें
💡 Wan 2.7 T2V भीड़ वाले दृश्यों और जटिल एनवायरनमेंटल बैकग्राउंड को ज़्यादातर मॉडलों से बेहतर संभालता है। अगर आपके दृश्य में कई तत्व हैं, तो Motion 2.0 जैसे सिंगल-सब्जेक्ट-केंद्रित मॉडलों की तुलना में यह बेहतर पहली पसंद है।
मॉडल-विशेष प्रॉम्प्ट बदलाव
हर मॉडल में उसके ट्रेनिंग डेटा से आए कुछ झुकाव होते हैं। उन्हें जानने से आपके प्रॉम्प्ट निशाने पर लगते हैं, अंदाज़े पर नहीं।
Kling v3 और Kling v2.6
Kling v3 Video और Kling v2.6 सिनेमाई ताकत वाले मॉडल हैं, जो फ़िल्म और सिनेमैटोग्राफ़ी की शब्दावली पर ज़ोरदार प्रतिक्रिया देते हैं।
क्या काम करता है: लेंस विनिर्देश (35mm prime, anamorphic), फ़िल्म संदर्भ (shot on 35mm film), और साफ़ कैमरा मूवमेंट (Steadicam tracking shot, dolly zoom)।
क्या काम नहीं करता: स्पेशियल आधार के बिना अमूर्त मूड वाले शब्द। "रहस्यमय वातावरण" असंगत नतीजे देता है। "भोर में जंगल की ज़मीन पर फैलती हल्की धुंध" नहीं देता।
Kling v2.6 मोशन कंट्रोल इनपुट को भी सपोर्ट करता है, जिससे आप कैमरा के रास्ते सीधे खींच सकते हैं। इसे एक मज़बूत टेक्स्ट प्रॉम्प्ट के साथ मिलाकर आप डॉली या पैन मूवमेंट को सटीकता से दोहरा सकते हैं। Kling परिवार से सबसे उच्च आउटपुट गुणवत्ता के लिए, Kling v2.1 Master विस्तृत सिनेमाई प्रॉम्प्ट मिलने पर शानदार 1080p नतीजे देता है।
Veo 3.1 और Sora 2
Veo 3.1 और Sora 2 ऐसे फ़ाउंडेशनल मॉडलों पर बने हैं जो विशाल वीडियो डेटासेट पर ट्रेन हुए हैं। ये वास्तविक-दुनिया की भौतिकी को ज़्यादातर मॉडलों से बेहतर संभालते हैं।
इन मॉडलों के लिए भौतिक यथार्थवाद के वर्णन पर ज़ोर दें: "पानी की सतह का तनाव," "गुरुत्वाकर्षण में स्वाभाविक रूप से लटकता कपड़ा," "सब्जेक्ट के खिड़की से गुज़रते समय दीवार पर खिसकती छाया।"
Sora 2 उन प्रॉम्प्ट पर विशेष रूप से अच्छा प्रतिक्रिया देता है जो फ़िल्म ट्रीटमेंट की तरह लिखे गए हों: पूरे वाक्य, स्वाभाविक भाषा, कारण-और-प्रभाव की संरचना। यह दूसरे मॉडलों की तुलना में टोकन के क्रम के प्रति कम संवेदनशील है। Sora 2 Pro इसे लंबी क्लिप अवधि और ज़्यादा डिटेल बनाए रखने के साथ आगे ले जाता है।
Veo 3.1 Fast उसका तेज़ वर्ज़न है: पूरी गुणवत्ता वाली जनरेशन पर लगने से पहले प्रॉम्प्ट संरचनाओं को परखने के लिए बिल्कुल सही।
Seedance 2.0 और Pixverse v6
Seedance 2.0 और Pixverse v6 दोनों नेटिव ऑडियो के साथ जनरेट करते हैं, जिससे बदल जाता है कि प्रॉम्प्ट कैसे लिखने चाहिए। भले ही आपका ध्यान विज़ुअल पर हो, फिर भी एम्बिएंट साउंड के वर्णन शामिल करें: वे मॉडल की ऑडियो परत को दिशा देते हैं और आउटपुट को ज़्यादा सुसंगत बनाते हैं।
"सूर्यास्त के समय बेसाल्ट की चट्टानों से लहरें टकराती हैं, हवा में धुंध। मथते पानी और हवा की आवाज़। धीमी गति, 70mm लेंस।"
Pixverse v6 तेज़ मोशन को असाधारण रूप से अच्छी तरह संभालता है (एक्शन दृश्य, खेल, प्राकृतिक घटनाएँ)। Seedance 2.0 धीमे, भावनात्मक फ़ुटेज और कैरेक्टर की मौजूदगी वाले दृश्यों में बेहतर है। उसी इंजन पर तेज़ नतीजों के लिए, Seedance 2.0 Fast जनरेशन के समय के एक हिस्से में ज़्यादातर गुणवत्ता बनाए रखता है।
LTX 2 Pro और LTX 2.3 Pro
LTX 2 Pro और LTX 2.3 Pro 4K-नेटिव जनरेटर हैं। इस रिज़ॉल्यूशन पर प्रॉम्प्ट में टेक्सचर का विवरण काफ़ी फ़ायदेमंद साबित होता है। सतही सामग्री को साफ़-साफ़ बताएँ: "मौसम से घिसी ओक की बनावट," "हाथ से सिला चमड़ा," "ब्रश किया हुआ एल्युमिनियम।"
ये मॉडल लाइटिंग ट्रांज़िशन प्रॉम्प्ट पर भी अच्छा प्रतिक्रिया देते हैं: "सुबह की रोशनी दोपहर में बदलती हुई, परछाइयाँ लंबी होती हुई।" ये सूक्ष्म समय-आधारित रोशनी बदलावों को दिखा सकते हैं, जिन्हें ज़्यादातर मॉडल एक स्थिर एक्सपोज़र में समतल कर देते हैं।
नेगेटिव प्रॉम्प्ट जो 80% समस्याएँ ठीक करते हैं
नेगेटिव प्रॉम्प्ट बाद में सोची गई चीज़ नहीं हैं। वीडियो जनरेशन में वे संरचनात्मक होते हैं।
डिफ़ॉल्ट बहिष्करण
यह बेसलाइन नेगेटिव प्रॉम्प्ट ज़्यादातर मॉडलों पर काम करता है:
blurry, out of focus, flickering, morphing, distorted face, duplicate subject,
deformed limbs, low quality, pixelated, watermark, text overlay, jumpcut,
static background, color banding, overexposed, underexposed
कुछ और बदलने से पहले हर जनरेशन पर इसे लागू करें।
स्टाइल-विशेष नेगेटिव
सिनेमाई फ़ुटेज के लिए:
cartoon, illustration, anime, CGI, unrealistic, neon, oversaturated, digital art
पोर्ट्रेट और कैरेक्टर क्लिप के लिए:
two faces, extra limbs, asymmetrical features, unnatural skin texture, plastic look,
over-retouched skin
💡 मॉडल-विशेष नोट: Runway का Gen 4.5 नेगेटिव प्रॉम्प्ट पर विशेष रूप से अच्छा प्रतिक्रिया देता है। इसका नेगेटिव प्रॉम्प्ट फ़ील्ड ज़्यादातर प्रतिस्पर्धियों की तुलना में आउटपुट की शैली पर ज़्यादा असर डालता है, इसलिए अपने पॉज़िटिव प्रॉम्प्ट को बदलने से पहले यहाँ समय लगाना फ़ायदेमंद है।
प्रॉम्प्ट चीट शीट टेबल
कैमरा मूवमेंट की शब्दावली
आप जो प्रभाव चाहते हैं
काम करने वाले शब्द
सब्जेक्ट की ओर धीमा पुश
"slow dolly push forward," "gradual zoom in"
स्केल दिखाने के लिए पीछे खिंचना
"crane pull-back," "reverse dolly," "zoom out to wide"
इसका आम कारण होता है कि आपका एनवायरनमेंट कम वर्णित है। मॉडल के पास बैकग्राउंड में बहुत सारी स्वतंत्रता होती है, और वह हर फ़्रेम में उसे अलग ढंग से भरता है। इसे ठीक करने के लिए 2-3 खास बैकग्राउंड तत्व स्थिति के साथ जोड़ें: "बाईं ओर मौसम से घिसी पत्थर की दीवार," "दाईं ओर मध्य-दूरी पर सरू के पेड़ों की एक कतार।"
अपनी मोशन स्ट्रेंथ सेटिंग भी जाँचें। अगर यह 0.85 से ऊपर है, तो इसे कम करें। ऊँचे मोशन स्ट्रेंथ मान हर मॉडल पर बैकग्राउंड की असंगति को हर फ़्रेम में बढ़ाते हैं।
क्लिप के बीच में सब्जेक्ट का मॉर्फ़ होना
यह तब होता है जब सब्जेक्ट का वर्णन अस्पष्ट हो, मोशन संकेत बहुत आक्रामक हो, या दोनों। तीन समाधान:
पोज़ एंकर जोड़ें: "बाएँ पैर पर वज़न, दाएँ हाथ की हथेली कूल्हे पर" मॉडल को एक भौतिक शुरुआती अवस्था देता है, जिस पर वह फ़्रेम के बीच लौट सके।
क्लिप की लंबाई घटाएँ: जटिल सब्जेक्ट के लिए 3 सेकंड की क्लिप की कंसिस्टेंसी 9 सेकंड की क्लिप से काफ़ी बेहतर होती है।
इमेज-टू-वीडियो इस्तेमाल करें: पहले अपने सब्जेक्ट की एक स्टैटिक इमेज जनरेट करें, फिर Wan 2.7 I2V या Kling v2.6 से उसे एनिमेट करें। इससे सब्जेक्ट की दिखावट फ़्रेम ज़ीरो पर लॉक हो जाती है और कंसिस्टेंसी की समस्या पूरी तरह हट जाती है।
अप्राकृतिक मोशन
अप्राकृतिक मोशन आम तौर पर अस्पष्ट मोशन क्रियाओं से आता है। "हिलना" या "जाना" जैसे शब्द मॉडल को कुछ भी ठोस नहीं देते। उन्हें खास भौतिक एक्शन से बदलें जिनमें गति का संदर्भ हो:
"कैमरे की ओर बढ़ता है" की जगह लिखें "धीमी, सोच-समझकर चाल से कैमरे की ओर चलता है, ज़मीन पर कदमों के निशान दिखते हुए"
"नदी बहती है" की जगह लिखें "नदी की धारा दाएँ से बाएँ स्थिर गति से बहती है, सतह पर दोपहर की रोशनी चमकती हुई"
इन पैटर्न को काम में लाएँ
इस लेख के पैटर्न हर जनरेशन को परफ़ेक्ट नहीं बनाएँगे, लेकिन वे असफल आउटपुट को काफ़ी हद तक कम ज़रूर करेंगे। असली कौशल इटरेशन में है: एक प्रॉम्प्ट चलाएँ, पहचानें कि कौन-सा तत्व (सब्जेक्ट, मोशन, एनवायरनमेंट, कैमरा) फ़ेल हो रहा है, उसी एक वैरिएबल को ठीक करें, फिर दोबारा चलाएँ।
इस लेख से एक प्रॉम्प्ट पैटर्न चुनें, उसे उस दृश्य पर लागू करें जिसमें आप अटके हैं, और फिर दो-तीन मॉडलों पर चलाकर देखें कि हर एक एक ही इनपुट को कैसे समझता है। यही तुलना आपको वीडियो प्रॉम्प्ट इंजीनियरिंग के बारे में किसी भी संदर्भ शीट से ज़्यादा सिखाएगी।