AI वीडियो मॉडल के लिए प्रॉम्प्ट पैटर्न जो सच में काम करते हैं

AI वीडियो में लगातार अच्छे नतीजे देने वाले प्रॉम्प्ट पैटर्न का संरचित विश्लेषण। मूल सब्जेक्ट-एक्शन-एनवायरनमेंट फ़ॉर्मूला से लेकर Wan 2.7, Kling v3, Veo 3.1, Sora 2 और Seedance 2.0 के मॉडल-विशेष बदलाव तक, साथ में चीट शीट, नेगेटिव प्रॉम्प्ट टेम्पलेट और सबसे आम गड़बड़ियों के समाधान।

AI वीडियो मॉडल के लिए प्रॉम्प्ट पैटर्न जो सच में काम करते हैं
Cristian Da Conceicao
Picasso IA के संस्थापक

जो वीडियो प्रॉम्प्ट काम करता है और जो फ़ेल होता है, उनके बीच का फ़र्क शायद ही कभी शब्दावली का होता है। यह संरचना का होता है। AI वीडियो मॉडल प्रॉम्प्ट को उस तरह नहीं पढ़ते जैसे इंसान पढ़ते हैं। वे आपके दिए शब्दों के क्रम से स्थानिक संबंध, समय के संकेत और मोशन वेक्टर पहचानते हैं। अगर इन्हें गलत लिखा, तो सब्जेक्ट झिलमिलाने लगते हैं, कैमरा बहकता है और बीच में दृश्य शोर में बदल जाते हैं। सही लिखा, तो फ़ुटेज ऐसा लगता है जैसे किसी असली कैमरे से शूट हुआ हो।

यह लेख उन खास प्रॉम्प्ट पैटर्न का विश्लेषण करता है जो आज उपलब्ध प्रमुख AI वीडियो मॉडल पर लगातार, उच्च गुणवत्ता वाले आउटपुट देते हैं: Wan 2.7 T2V से लेकर Kling v3 Video, Veo 3.1 से लेकर Seedance 2.0 तक।

ज़्यादातर प्रॉम्प्ट शुरू में ही क्यों बिखर जाते हैं

3 पैटर्न जो हर बार फ़ेल होते हैं

1. नाउन डंप। "पहाड़, सूर्यास्त, औरत, चलती हुई, सिनेमाई।" यह मॉडल को पाँच चीज़ें बताता है, पर उनके बीच कोई संबंध नहीं देता। क्या औरत पहाड़ की तरफ़ चल रही है? या उससे दूर? मॉडल अंदाज़ा लगाता है, और हर फ़्रेम पर अलग अंदाज़ा लगाता है।

2. एडजेक्टिव स्टैक। "खूबसूरत, शानदार, मनमोहक, दिल छू लेने वाला, जादुई सूर्यास्त।" एक जैसे शब्द जोड़ने से असर बढ़ता नहीं, बल्कि कमज़ोर पड़ जाता है। मॉडल इन विशेषणों का औसत निकालता है और एक बीच का नतीजा देता है, जो इनमें से किसी पर भी पूरी तरह नहीं टिकता।

3. निष्क्रिय दृश्य। "एक जंगल। वहाँ एक नदी है। पक्षी मौजूद हैं।" कोई मोशन दिशा नहीं, सब्जेक्ट की कोई गतिविधि नहीं, कोई समय-क्रम नहीं। वीडियो मॉडल को यह जानना होता है कि समय के साथ क्या हो रहा है, केवल यह नहीं कि फ़्रेम में क्या मौजूद है।

मॉडल असल में क्या पार्स करता है

आधुनिक वीडियो जनरेशन मॉडल प्रॉम्प्ट को परतों में प्रोसेस करते हैं। पहले वे मुख्य सब्जेक्ट निकालते हैं और उसे मोशन की प्राथमिकता देते हैं। फिर वे एनवायरनमेंट का संदर्भ पढ़ते हैं ताकि बैकग्राउंड की परत बने। आख़िर में वे समय के संशोधक जैसे "धीरे-धीरे", "अचानक" या "कैमरा पीछे खिंचता है" समझते हैं, ताकि क्लिप की अवधि भर में हरकत को कोरियोग्राफ़ किया जा सके।

अगर आपका सब्जेक्ट लंबी विशेषणों की सूची के बीच दबा है, या आपके मोशन संकेत एनवायरनमेंट स्थापित होने से पहले आ जाते हैं, तो मॉडल की कोहेरेंस टूट जाती है। पहले तीन से पाँच शब्दों का सबसे ज़्यादा वज़न होता है।

💡 मोटा नियम: पहले सब्जेक्ट, फिर एक्शन, फिर एनवायरनमेंट, और संशोधक सबसे आख़िर में। इससे हटने का जोखिम आपका अपना है।

मैकेनिकल कीबोर्ड पर लकड़ी की मेज़ पर संदर्भ नोट्स के साथ प्रॉम्प्ट टाइप करते हाथ

कोर प्रॉम्प्ट फ़ॉर्मूला

वह फ़ॉर्मूला जो सभी वीडियो मॉडल पर लगातार बाकी सभी से बेहतर प्रदर्शन करता है, यह है:

[सब्जेक्ट + एक्शन] + [एनवायरनमेंट/बैकग्राउंड] + [कैमरा निर्देश] + [रोशनी/वातावरण] + [स्टाइल संशोधक]

सब्जेक्ट, एक्शन, एनवायरनमेंट

यहाँ हर शब्द का वज़न है। इन दो प्रॉम्प्ट की तुलना करें:

  • कमज़ोर: "प्रकृति में सफ़ेद पोशाक वाली एक औरत"
  • मज़बूत: "धूप से भरे जंगली फूलों के मैदान में एक औरत बहती सफ़ेद लिनन की पोशाक में नंगे पैर चलती है"

दूसरे संस्करण में मॉडल को एक सब्जेक्ट, एक भौतिक गुण, एक खास एक्शन क्रिया और एक परिभाषित एनवायरनमेंट मिलता है। अब मॉडल सब्जेक्ट को फ़्रेम-दर-फ़्रेम लगातार टिका सकता है।

जब आपका सब्जेक्ट इंसान हो, तो शामिल करें: कपड़े की बनावट, अंदाज़न कद-काठी, और एक खास एक्शन क्रिया। "वहाँ खड़ी है" नहीं, बल्कि "धीरे से मुड़कर कैमरे की ओर देखती है" लिखें। "बैठी है" नहीं, बल्कि "लकड़ी की मेज़ के पार आगे झुकती है" लिखें।

लैंडस्केप, प्रोडक्ट या वस्तुओं जैसे गैर-मानव सब्जेक्ट के लिए उन्हें फ़्रेम में एक खास जगह दें: "अग्रभूमि में एक काली एस्प्रेसो मशीन" या "बारिश से चमकती शहर की सड़क पर तिरछी खड़ी एक विंटेज कार।"

मोशन और कैमरा की दिशा

यहीं ज़्यादातर प्रॉम्प्ट अपना परफ़ॉर्मेंस गँवा देते हैं। कैमरा मोशन और सब्जेक्ट मोशन दो अलग चीज़ें हैं, और दोनों को एक जैसा मानने से दोनों बिगड़ते हैं।

सब्जेक्ट मोशन बताता है कि आपका मुख्य तत्व क्या करता है: "धीरे-धीरे चलता है," "अपना सिर घुमाती है," "लहरें टकराकर लौटती हैं।"

कैमरा मोशन बताता है कि वर्चुअल कैमरा क्या करता है: "धीमा डॉली पुश," "लो-एंगल ट्रैकिंग शॉट," "एरियल क्रेन पुल-बैक," "हैंडहेल्ड हल्का झटका।"

इन्हें अलग-अलग बताएँ, और कैमरा मोशन सबसे आख़िर में रखें, ताकि मॉडल उसे कोरियोग्राफ़ी के आवरण की तरह इस्तेमाल कर सके:

"धूप वाले आँगन में एक लाल पोशाक में औरत धीरे से कैमरे की ओर मुड़ती है। कमर की ऊँचाई से धीमा डॉली पुश आगे। 35mm लेंस।"

वातावरण और रोशनी की परत

रोशनी ही वह सबसे बड़ा वैरिएबल है जो एक सपाट दिखने वाले आउटपुट और सिनेमाई लगने वाले आउटपुट के बीच फ़र्क करता है। बताएँ:

  • दिशा: "बाईं ओर से सुबह की रोशनी," "डूबते सूरज से बैकलिट," "ऊपर से छनती छायादार धूप"
  • गुणवत्ता: "नरम फैली हुई रोशनी," "दोपहर की तीखी कंट्रास्ट," "गोल्डन आवर की गर्म चमक"
  • रंग का तापमान: "गर्म अंबर रंग," "ठंडा नीला-भूरा बादलदार प्रकाश"

बस "सिनेमाई रोशनी" न लिखें। यह वाक्यांश इतना ज़्यादा इस्तेमाल हो चुका है कि ज़्यादातर मॉडल के लिए लगभग अर्थहीन है। रोशनी का वर्णन ऐसे करें जैसे एक सिनेमैटोग्राफ़र करता है: वह कहाँ से आती है, और सब्जेक्ट के चेहरे या सतह पर क्या असर डालती है।

💡 प्रो टिप: "Kodak Portra 400 color profile" या "16mm पर शूट" जैसा कोई खास फ़िल्म स्टॉक संदर्भ जोड़ने से मॉडल को संकेत मिलता है कि आपको ऑर्गेनिक टेक्सचर, प्राकृतिक ग्रेन और कम संतृप्त हाइलाइट चाहिए। आउटपुट की गुणवत्ता में यह अपनी हैसियत से कहीं ज़्यादा असर डालता है।

एक महिला सफ़ेद लिनन की ड्रेस में भूमध्यसागरीय कोबलस्टोन वाली गली में आत्मविश्वास से चलते हुए, गोल्डन आवर में

दृश्य के प्रकार के अनुसार प्रॉम्प्ट पैटर्न

अलग-अलग दृश्य श्रेणियों को अलग संरचनात्मक ज़ोर चाहिए। यहाँ बताया गया है कि अपने प्रॉम्प्ट में वज़न कैसे दें।

कथात्मक और सिनेमाई दृश्य

कहानी-आधारित क्लिप के लिए समय-क्रम का तर्क सबसे अहम है। मॉडल को पता होना चाहिए कि पहले क्या होता है, फिर क्या होता है, और कैमरा उसका जवाब कैसे देता है।

जुड़ाव वाले मोशन शब्द इस्तेमाल करें: "फिर," "जब," "जबकि।" ये फ़्रेम-दर-फ़्रेम कारण-और-प्रभाव का संबंध बनाते हैं।

"सूर्योदय के समय एक अकेला पर्वतारोही घाटी को देखने के लिए रुककर एक चोटी पर पहुँचता है। कैमरा धीरे-धीरे वाइड क्रेन शॉट में पीछे खिंचता है, और उसके चारों ओर के पहाड़ों का विस्तार दिखाता है। दाईं ओर से गर्म सुनहरी रोशनी।"

भोर में घने देवदार के जंगल का वाइड एस्टैब्लिशिंग शॉट, सुनहरी प्रकाश की किरणों और अकेले पर्वतारोही की आकृति के साथ

नाटकीय असर के लिए Kling v3 Video और Veo 3.1 समय-क्रम के तर्क को सबसे अच्छी तरह संभालते हैं। दोनों जुड़ाव वाले मोशन शब्दों को भरोसेमंद ढंग से समझते हैं और कैमरा मूवमेंट के दौरान सब्जेक्ट की कंसिस्टेंसी बनाए रखते हैं।

प्रोडक्ट और लाइफ़स्टाइल फ़ुटेज

प्रोडक्ट शॉट्स को स्थानिक सटीकता चाहिए। मॉडल को साफ़-साफ़ बताएँ कि प्रोडक्ट फ़्रेम में कहाँ है, उसके आसपास क्या है, और रोशनी उसकी सतह से कैसे मिलती है।

"सफ़ेद संगमरमर के काउंटरटॉप पर अग्रभूमि में तेज़ फ़ोकस में एक चिकनी काली एस्प्रेसो मशीन, उसकी टोंटी से उठती भाप। सुबह की खिड़की की रोशनी के साथ धुंधली गर्म रसोई की पृष्ठभूमि। मशीन से उठती भाप की ओर धीमा रैक फ़ोकस पुल। 100mm मैक्रो लेंस।"

संगमरमर के काउंटरटॉप पर उठती भाप और गर्म रसोई के बोकेह के साथ चिकनी काली एस्प्रेसो मशीन

प्रोडक्ट वर्क के लिए LTX 2 Pro और LTX 2.3 Pro 4K आउटपुट में वस्तु के बारीक डिटेल और साफ़ बैकग्राउंड अलगाव को बनाए रखने में उत्कृष्ट हैं।

पोर्ट्रेट और कैरेक्टर मोशन

पोर्ट्रेट इस पर टिके होते हैं कि मॉडल फ़्रेम-दर-फ़्रेम चेहरे की कंसिस्टेंसी कितनी अच्छी तरह संभालता है। यहाँ सबसे आम विफलता सब्जेक्ट का मॉर्फ़ होना है। इसका मुकाबला इस तरह करें:

  1. तटस्थ भाव का आधार जोड़ें: "तटस्थ भाव, हल्की स्वाभाविक मुस्कान"
  2. सिर और आँखों की दिशा बताएँ: "सीधे कैमरे में देखते हुए, हल्का नीचे का झुकाव"
  3. मोशन को न्यूनतम और धीमा रखें: "हवा में बालों की हल्की हरकत, सिर का धीमा मोड़"

"छोटे काले बालों वाली एक आत्मविश्वासी युवा औरत हल्की स्वाभाविक मुस्कान के साथ सीधे कैमरे में देखती है, गोधूलि में एक शहरी छत पर खड़ी। उसके पीछे डूबते सूरज की रिम लाइट एक गर्म प्रभामंडल बनाती है। 85mm f/1.4 पोर्ट्रेट लेंस। धीमा ज़ूम इन, क्लिप के अंत तक सब्जेक्ट फ़्रेम भर देता है।"

गोधूलि में शहरी छत पर सुनहरी रिम लाइट और शहर के बोकेह के साथ एक आत्मविश्वासी युवा औरत का पोर्ट्रेट

PicassoIA पर Wan 2.7 T2V का उपयोग कैसे करें

Wan 2.7 T2V उपलब्ध सबसे सक्षम टेक्स्ट-टू-वीडियो मॉडलों में से एक है, जो मज़बूत टेम्पोरल कोहेरेंस के साथ 1080p क्लिप बनाता है। PicassoIA पर सबसे अच्छे नतीजे पाने का तरीका यहाँ है।

Wan 2.7 T2V के साथ चरण-दर-चरण

चरण 1: PicassoIA पर Wan 2.7 T2V मॉडल पेज खोलें।

चरण 2: प्रॉम्प्ट फ़ील्ड में ऊपर दिए फ़ॉर्मूले के अनुसार अपना इनपुट संरचित करें। Wan 2.7 कैमरा मोशन संकेतों पर विशेष रूप से अच्छा प्रतिक्रिया देता है, जब उन्हें प्रॉम्प्ट के अंत में रखा जाए, सब्जेक्ट और एनवायरनमेंट पूरी तरह स्थापित होने के बाद।

चरण 3: अपना रिज़ॉल्यूशन 1080p पर सेट करें। Wan 2.7 ज़्यादा आउटपुट रिज़ॉल्यूशन पर काफ़ी बेहतर तीक्ष्णता बनाए रखता है, और 720p से फ़र्क साफ़ दिखता है।

चरण 4: उन क्लिप के लिए जिन्हें मोशन की निरंतरता चाहिए (जैसे किसी व्यक्ति का दृश्य से होकर चलना), नेगेटिव प्रॉम्प्ट फ़ील्ड का उपयोग करके यह बाहर रखें: blurry, flickering, morphing, distorted, low quality, static, duplicate subject।

चरण 5: अपनी पहली जनरेशन चलाएँ। अगर सब्जेक्ट पहले 2 सेकंड में बहकता है, तो आपका एनवायरनमेंट वर्णन बहुत कम है। दोबारा बनाने से पहले बैकग्राउंड में और स्पेशियल एंकर जोड़ें।

चरण 6: उसी दृश्य पर इमेज-टू-वीडियो वर्कफ़्लो के लिए Wan 2.7 I2V पर जाएँ, जो आपको जनरेट की गई स्टिल इमेज को एक कंटिन्यूएशन प्रॉम्प्ट से एनिमेट करने देता है, और पहले फ़्रेम से ही सब्जेक्ट की दिखावट को लॉक करता है।

Wan 2.7 के लिए पैरामीटर सुझाव

पैरामीटरअनुशंसित माननोट्स
Steps30-40ज़्यादा steps = ज़्यादा डिटेल, धीमी जनरेशन
CFG Scale7-9ओवर-शार्पनिंग से बचने के लिए 10 से नीचे रखें
Motion Strength0.6-0.80.9 से ऊपर सब्जेक्ट में अस्थिरता पैदा करता है
Clip Length5-8 सेकंडकोहेरेंस के लिए सबसे अच्छी अवधि
Negative Promptनीचे का अनुभाग देखेंहमेशा शामिल करें

💡 Wan 2.7 T2V भीड़ वाले दृश्यों और जटिल एनवायरनमेंटल बैकग्राउंड को ज़्यादातर मॉडलों से बेहतर संभालता है। अगर आपके दृश्य में कई तत्व हैं, तो Motion 2.0 जैसे सिंगल-सब्जेक्ट-केंद्रित मॉडलों की तुलना में यह बेहतर पहली पसंद है।

चमड़े की नोटबुक थामे फ़िल्मकार के हाथ, जिसमें हाथ से लिखे प्रॉम्प्ट नोट्स हैं, पास में एक विंटेज फ़िल्म कैमरा

मॉडल-विशेष प्रॉम्प्ट बदलाव

हर मॉडल में उसके ट्रेनिंग डेटा से आए कुछ झुकाव होते हैं। उन्हें जानने से आपके प्रॉम्प्ट निशाने पर लगते हैं, अंदाज़े पर नहीं।

Kling v3 और Kling v2.6

Kling v3 Video और Kling v2.6 सिनेमाई ताकत वाले मॉडल हैं, जो फ़िल्म और सिनेमैटोग्राफ़ी की शब्दावली पर ज़ोरदार प्रतिक्रिया देते हैं।

क्या काम करता है: लेंस विनिर्देश (35mm prime, anamorphic), फ़िल्म संदर्भ (shot on 35mm film), और साफ़ कैमरा मूवमेंट (Steadicam tracking shot, dolly zoom)।

क्या काम नहीं करता: स्पेशियल आधार के बिना अमूर्त मूड वाले शब्द। "रहस्यमय वातावरण" असंगत नतीजे देता है। "भोर में जंगल की ज़मीन पर फैलती हल्की धुंध" नहीं देता।

Kling v2.6 मोशन कंट्रोल इनपुट को भी सपोर्ट करता है, जिससे आप कैमरा के रास्ते सीधे खींच सकते हैं। इसे एक मज़बूत टेक्स्ट प्रॉम्प्ट के साथ मिलाकर आप डॉली या पैन मूवमेंट को सटीकता से दोहरा सकते हैं। Kling परिवार से सबसे उच्च आउटपुट गुणवत्ता के लिए, Kling v2.1 Master विस्तृत सिनेमाई प्रॉम्प्ट मिलने पर शानदार 1080p नतीजे देता है।

Veo 3.1 और Sora 2

Veo 3.1 और Sora 2 ऐसे फ़ाउंडेशनल मॉडलों पर बने हैं जो विशाल वीडियो डेटासेट पर ट्रेन हुए हैं। ये वास्तविक-दुनिया की भौतिकी को ज़्यादातर मॉडलों से बेहतर संभालते हैं।

इन मॉडलों के लिए भौतिक यथार्थवाद के वर्णन पर ज़ोर दें: "पानी की सतह का तनाव," "गुरुत्वाकर्षण में स्वाभाविक रूप से लटकता कपड़ा," "सब्जेक्ट के खिड़की से गुज़रते समय दीवार पर खिसकती छाया।"

Sora 2 उन प्रॉम्प्ट पर विशेष रूप से अच्छा प्रतिक्रिया देता है जो फ़िल्म ट्रीटमेंट की तरह लिखे गए हों: पूरे वाक्य, स्वाभाविक भाषा, कारण-और-प्रभाव की संरचना। यह दूसरे मॉडलों की तुलना में टोकन के क्रम के प्रति कम संवेदनशील है। Sora 2 Pro इसे लंबी क्लिप अवधि और ज़्यादा डिटेल बनाए रखने के साथ आगे ले जाता है।

Veo 3.1 Fast उसका तेज़ वर्ज़न है: पूरी गुणवत्ता वाली जनरेशन पर लगने से पहले प्रॉम्प्ट संरचनाओं को परखने के लिए बिल्कुल सही।

Seedance 2.0 और Pixverse v6

Seedance 2.0 और Pixverse v6 दोनों नेटिव ऑडियो के साथ जनरेट करते हैं, जिससे बदल जाता है कि प्रॉम्प्ट कैसे लिखने चाहिए। भले ही आपका ध्यान विज़ुअल पर हो, फिर भी एम्बिएंट साउंड के वर्णन शामिल करें: वे मॉडल की ऑडियो परत को दिशा देते हैं और आउटपुट को ज़्यादा सुसंगत बनाते हैं।

"सूर्यास्त के समय बेसाल्ट की चट्टानों से लहरें टकराती हैं, हवा में धुंध। मथते पानी और हवा की आवाज़। धीमी गति, 70mm लेंस।"

सूर्यास्त के समय नुकीली बेसाल्ट चट्टानों से टकराती समुद्री लहरें, पानी के छींटे हवा में जमे हुए

Pixverse v6 तेज़ मोशन को असाधारण रूप से अच्छी तरह संभालता है (एक्शन दृश्य, खेल, प्राकृतिक घटनाएँ)। Seedance 2.0 धीमे, भावनात्मक फ़ुटेज और कैरेक्टर की मौजूदगी वाले दृश्यों में बेहतर है। उसी इंजन पर तेज़ नतीजों के लिए, Seedance 2.0 Fast जनरेशन के समय के एक हिस्से में ज़्यादातर गुणवत्ता बनाए रखता है।

LTX 2 Pro और LTX 2.3 Pro

LTX 2 Pro और LTX 2.3 Pro 4K-नेटिव जनरेटर हैं। इस रिज़ॉल्यूशन पर प्रॉम्प्ट में टेक्सचर का विवरण काफ़ी फ़ायदेमंद साबित होता है। सतही सामग्री को साफ़-साफ़ बताएँ: "मौसम से घिसी ओक की बनावट," "हाथ से सिला चमड़ा," "ब्रश किया हुआ एल्युमिनियम।"

ये मॉडल लाइटिंग ट्रांज़िशन प्रॉम्प्ट पर भी अच्छा प्रतिक्रिया देते हैं: "सुबह की रोशनी दोपहर में बदलती हुई, परछाइयाँ लंबी होती हुई।" ये सूक्ष्म समय-आधारित रोशनी बदलावों को दिखा सकते हैं, जिन्हें ज़्यादातर मॉडल एक स्थिर एक्सपोज़र में समतल कर देते हैं।

नेगेटिव प्रॉम्प्ट जो 80% समस्याएँ ठीक करते हैं

नेगेटिव प्रॉम्प्ट बाद में सोची गई चीज़ नहीं हैं। वीडियो जनरेशन में वे संरचनात्मक होते हैं।

डिफ़ॉल्ट बहिष्करण

यह बेसलाइन नेगेटिव प्रॉम्प्ट ज़्यादातर मॉडलों पर काम करता है:

blurry, out of focus, flickering, morphing, distorted face, duplicate subject, 
deformed limbs, low quality, pixelated, watermark, text overlay, jumpcut, 
static background, color banding, overexposed, underexposed

कुछ और बदलने से पहले हर जनरेशन पर इसे लागू करें।

स्टाइल-विशेष नेगेटिव

सिनेमाई फ़ुटेज के लिए:

cartoon, illustration, anime, CGI, unrealistic, neon, oversaturated, digital art

पोर्ट्रेट और कैरेक्टर क्लिप के लिए:

two faces, extra limbs, asymmetrical features, unnatural skin texture, plastic look, 
over-retouched skin

प्रोडक्ट शॉट्स के लिए:

floating object, misaligned shadow, reflective distortion, background bleeding

💡 मॉडल-विशेष नोट: Runway का Gen 4.5 नेगेटिव प्रॉम्प्ट पर विशेष रूप से अच्छा प्रतिक्रिया देता है। इसका नेगेटिव प्रॉम्प्ट फ़ील्ड ज़्यादातर प्रतिस्पर्धियों की तुलना में आउटपुट की शैली पर ज़्यादा असर डालता है, इसलिए अपने पॉज़िटिव प्रॉम्प्ट को बदलने से पहले यहाँ समय लगाना फ़ायदेमंद है।

प्रॉम्प्ट चीट शीट टेबल

कैमरा मूवमेंट की शब्दावली

आप जो प्रभाव चाहते हैंकाम करने वाले शब्द
सब्जेक्ट की ओर धीमा पुश"slow dolly push forward," "gradual zoom in"
स्केल दिखाने के लिए पीछे खिंचना"crane pull-back," "reverse dolly," "zoom out to wide"
चलते सब्जेक्ट का पीछा"tracking shot," "Steadicam follow," "panning left"
स्थिर, कोई कैमरा मूव नहीं"static shot," "tripod locked," "no camera movement"
हैंडहेल्ड ऊर्जा"subtle handheld shake," "slight camera sway"
एरियल परिप्रेक्ष्य"drone footage," "bird's-eye view," "overhead establishing shot"

मोशन तीव्रता पैमाना

तीव्रताउपयोग करने वाले शब्द
लगभग स्थिर"imperceptible motion," "hair barely shifting in stillness"
हल्की"gentle sway," "slow turn," "slight movement"
मध्यम"walks through," "moderate breeze," "turns steadily"
सक्रिय"brisk walk," "running," "waves crashing"
गतिशील"racing," "explosive," "rapid camera whip-pan"

लैवेंडर के खेत में चलती लाल पोशाक वाली औरत को सीधे नीचे से देखता एरियल ड्रोन शॉट

आउटपुट टूटने पर क्या करें

धुंधले या असंगत फ़्रेम

इसका आम कारण होता है कि आपका एनवायरनमेंट कम वर्णित है। मॉडल के पास बैकग्राउंड में बहुत सारी स्वतंत्रता होती है, और वह हर फ़्रेम में उसे अलग ढंग से भरता है। इसे ठीक करने के लिए 2-3 खास बैकग्राउंड तत्व स्थिति के साथ जोड़ें: "बाईं ओर मौसम से घिसी पत्थर की दीवार," "दाईं ओर मध्य-दूरी पर सरू के पेड़ों की एक कतार।"

अपनी मोशन स्ट्रेंथ सेटिंग भी जाँचें। अगर यह 0.85 से ऊपर है, तो इसे कम करें। ऊँचे मोशन स्ट्रेंथ मान हर मॉडल पर बैकग्राउंड की असंगति को हर फ़्रेम में बढ़ाते हैं।

क्लिप के बीच में सब्जेक्ट का मॉर्फ़ होना

यह तब होता है जब सब्जेक्ट का वर्णन अस्पष्ट हो, मोशन संकेत बहुत आक्रामक हो, या दोनों। तीन समाधान:

  1. पोज़ एंकर जोड़ें: "बाएँ पैर पर वज़न, दाएँ हाथ की हथेली कूल्हे पर" मॉडल को एक भौतिक शुरुआती अवस्था देता है, जिस पर वह फ़्रेम के बीच लौट सके।
  2. क्लिप की लंबाई घटाएँ: जटिल सब्जेक्ट के लिए 3 सेकंड की क्लिप की कंसिस्टेंसी 9 सेकंड की क्लिप से काफ़ी बेहतर होती है।
  3. इमेज-टू-वीडियो इस्तेमाल करें: पहले अपने सब्जेक्ट की एक स्टैटिक इमेज जनरेट करें, फिर Wan 2.7 I2V या Kling v2.6 से उसे एनिमेट करें। इससे सब्जेक्ट की दिखावट फ़्रेम ज़ीरो पर लॉक हो जाती है और कंसिस्टेंसी की समस्या पूरी तरह हट जाती है।

अप्राकृतिक मोशन

अप्राकृतिक मोशन आम तौर पर अस्पष्ट मोशन क्रियाओं से आता है। "हिलना" या "जाना" जैसे शब्द मॉडल को कुछ भी ठोस नहीं देते। उन्हें खास भौतिक एक्शन से बदलें जिनमें गति का संदर्भ हो:

  • "कैमरे की ओर बढ़ता है" की जगह लिखें "धीमी, सोच-समझकर चाल से कैमरे की ओर चलता है, ज़मीन पर कदमों के निशान दिखते हुए"
  • "नदी बहती है" की जगह लिखें "नदी की धारा दाएँ से बाएँ स्थिर गति से बहती है, सतह पर दोपहर की रोशनी चमकती हुई"

पेड़ों से छनती धूप में धूप वाले बाहरी कैफ़े में स्वाभाविक बातचीत करते दो लोग

इन पैटर्न को काम में लाएँ

इस लेख के पैटर्न हर जनरेशन को परफ़ेक्ट नहीं बनाएँगे, लेकिन वे असफल आउटपुट को काफ़ी हद तक कम ज़रूर करेंगे। असली कौशल इटरेशन में है: एक प्रॉम्प्ट चलाएँ, पहचानें कि कौन-सा तत्व (सब्जेक्ट, मोशन, एनवायरनमेंट, कैमरा) फ़ेल हो रहा है, उसी एक वैरिएबल को ठीक करें, फिर दोबारा चलाएँ।

PicassoIA आपको यहाँ चर्चा किए गए सभी प्रमुख वीडियो मॉडल एक ही जगह देता है। Wan 2.7 T2V, Kling v3 Video, Veo 3.1, Seedance 2.0, Sora 2 और LTX 2.3 Pro, ये सभी टैब बदले बिना और API keys संभाले बिना उपलब्ध हैं।

इस लेख से एक प्रॉम्प्ट पैटर्न चुनें, उसे उस दृश्य पर लागू करें जिसमें आप अटके हैं, और फिर दो-तीन मॉडलों पर चलाकर देखें कि हर एक एक ही इनपुट को कैसे समझता है। यही तुलना आपको वीडियो प्रॉम्प्ट इंजीनियरिंग के बारे में किसी भी संदर्भ शीट से ज़्यादा सिखाएगी।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख