AI वीडियो के लिए प्रॉम्प्ट चेकलिस्ट जो सच में काम करे

AI वीडियो प्रॉम्प्ट लिखना, जिनसे सिनेमैटिक और लगातार एक-जैसे नतीजे मिलें, सिर्फ़ यह बताने से कहीं ज़्यादा है कि आपको क्या चाहिए। यह चेकलिस्ट हर तत्व को तोड़कर समझाती है, सीन की कंपोज़िशन और कैमरा मूवमेंट से लेकर लाइटिंग संकेत और पेसिंग तक, ताकि आपका अगला वीडियो जनरेशन पहली ही कोशिश में सही निकले।

AI वीडियो के लिए प्रॉम्प्ट चेकलिस्ट जो सच में काम करे
Cristian Da Conceicao
Picasso IA के संस्थापक

टेक्स्ट-टू-वीडियो मॉडल के सामने खाली प्रॉम्प्ट फ़ील्ड देखने में जितना सरल लगता है, उतना है नहीं। आप कुछ लिखते हैं, जनरेट दबाते हैं, और दो मिनट बाद आपके पास एक वीडियो होता है। पर वह वैसा बिल्कुल नहीं दिखता जैसा आपने कल्पना की थी।

"मैंने साफ़ बताया था" और "नतीजा सही निकला" के बीच का फ़ासला लगभग हमेशा प्रॉम्प्ट की समस्या होता है। ऐसा इसलिए नहीं कि आपने गलत शब्द लिखे, बल्कि इसलिए कि टेक्स्ट-टू-वीडियो मॉडल को एक खास तरह की जानकारी एक खास क्रम में चाहिए, और ज़्यादातर लोग उसका आधा हिस्सा बिना जाने छोड़ देते हैं। यह चेकलिस्ट हर उस तत्व को कवर करती है जो AI वीडियो प्रॉम्प्ट में होना चाहिए, और इसे इस तरह व्यवस्थित किया गया है कि हर जनरेशन से पहले आप इसे एक बार देख सकें।

index cards पर हाथ से लिखे प्रॉम्प्ट नोट्स को गर्म खिड़की की रोशनी में देखता व्यक्ति

ज़्यादातर AI वीडियो प्रॉम्प्ट कमज़ोर क्यों रह जाते हैं

इमेज प्रॉम्प्टिंग और वीडियो प्रॉम्प्टिंग में फ़र्क

इमेज प्रॉम्प्ट एक जमे हुए पल का वर्णन करते हैं। आप समय और मूवमेंट के बारे में ढीले रह सकते हैं, क्योंकि मॉडल को सिर्फ़ एक फ़्रेम बनाना होता है। वीडियो प्रॉम्प्ट एक सीक्वेंस का वर्णन करते हैं। मॉडल को पता होना चाहिए कि सीन की शुरुआत किससे होती है, 5 या 10 सेकंड में वह कैसे बदलता है, और पूरे समय कैमरा क्या कर रहा है। ये बातें छोड़ देने पर मॉडल खाली जगहें अपने हिसाब से भर देता है, आम तौर पर कैमरे का रैंडम बहाव, सब्जेक्ट की झटकेदार हरकत, और बीच का ऐसा फ़्रेम जो शुरुआती फ़्रेम जैसा बिल्कुल न लगे।

मॉडल को असल में क्या जानना होता है

ज़्यादातर AI वीडियो मॉडल लाखों क्लिप्स पर प्रशिक्षित होते हैं, जिनमें पेशेवर सिनेमैटोग्राफ़ी के नियम पहले से शामिल होते हैं। वे उस शिल्प की भाषा पर अच्छी प्रतिक्रिया देते हैं: खास कैमरा शब्द, लाइटिंग की शब्दावली, मोशन की क्रियाएँ। "कूल" या "अच्छा" जैसे धुंधले विशेषण मॉडल को कुछ ठोस नहीं देते।

Seedance 2.0, Kling v3 Video और Veo 3.1 जैसे मॉडल संरचित और खास प्रॉम्प्ट पर कहीं बेहतर प्रतिक्रिया देते हैं। चलिए इनमें से एक प्रॉम्प्ट का हर भाग समझते हैं।

सीन फ़ाउंडेशन चेकलिस्ट

कैमरा या मोशन के किसी भी ब्योरे से पहले, एक अच्छा AI वीडियो प्रॉम्प्ट कौन, क्या और कहाँ तय करता है। ये तीन आधार मॉडल को हर फ़्रेम के लिए एक स्थिर शुरुआत देते हैं।

गोल्डन आवर में फ़िल्म प्रोडक्शन सेट का चौड़ा एरियल शॉट, जिसमें क्रू मेंबर परछाईं जैसे दिख रहे हैं

सब्जेक्ट: फ़्रेम में कौन या क्या है

अपने सब्जेक्ट को इतनी बारीकी से परिभाषित करें कि कोई कास्टिंग डायरेक्टर उसे पहचान सके। "एक महिला" की जगह लिखें "30 के दशक में एक महिला, छोटे काले बाल, क्रीम रंग का रेनकोट पहने हुए।" "एक कार" की जगह लिखें "क्रोम ट्रिम और पीछे एग्ज़ॉस्ट पाइप वाली काली 1960 की मसल कार।"

इतना ब्योरा टेम्पोरल कंसिस्टेंसी में मदद करता है। जब मॉडल के पास सब्जेक्ट का सटीक वर्णन होता है, तो वह हर फ़्रेम में उसे स्थिर रखता है, बजाय इसके कि वह बदलता रहे।

कमज़ोरमज़बूत
"एक आदमी चल रहा है""दाढ़ी वाला एक आदमी, ग्रे सूट में, 40 के मध्य में, जेबों में हाथ डाले चलता हुआ"
"एक शहर""बारिश वाले यूरोपीय शहर की एक संकरी कोबलस्टोन गली, गीली दुकानें, शाम का समय"
"प्राकृतिक दृश्य""सुबह की पौ फटने के समय एक चीड़ के जंगल की खुली जगह, ज़मीन के स्तर पर धुंध, उगते सूरज की पीछे से रोशनी"

एनवायरनमेंट: एक्शन कहाँ होता है

एनवायरनमेंट को भी सब्जेक्ट जितनी ही बारीकी चाहिए। "एक कॉफ़ी शॉप में" बहुत पतला वर्णन है। "एक छोटी स्वतंत्र कॉफ़ी शॉप के अंदर, खुली ईंट की दीवारें, बेमेल लकड़ी की कुर्सियाँ, गर्म एडिसन बल्ब की रोशनी, और पीछे की स्ट्रीट-विंडो पर दिखती बारिश" मॉडल को एक असली जगह देता है जिसे वह भर सके। एनवायरनमेंट का वर्णन जितना समृद्ध होगा, फ़्रेम-दर-फ़्रेम बैकग्राउंड उतना ही स्थिर रहेगा।

दिन का समय और मौसम

ये दो पैरामीटर आपके प्रॉम्प्ट के लगभग किसी भी दूसरे तत्व से ज़्यादा काम करते हैं। ये रोशनी की दिशा, कलर टेम्परेचर, परछाईं की कठोरता और वायुमंडलीय फैलाव तय करते हैं। "सुबह की हल्की धुंध," "दोपहर की तेज़ धूप," "बादल वाली शाम," "ब्लू-आवर वाला सांझ का समय": इनमें से हर एक पूरी तरह अलग दृश्य-दुनिया खड़ी कर देता है। दिन का समय कभी अनिर्दिष्ट न छोड़ें।

कैमरा और कंपोज़िशन संकेत

पानी की बूँदों वाले लेंस के शीशे का क्लोज़-अप लो-एंगल शॉट

एंगल और दूरी

AI वीडियो मॉडल एंगल और दूरी के मानक सिनेमैटोग्राफ़ी शब्दों पर अच्छी प्रतिक्रिया देते हैं। इन्हें सीधे इस्तेमाल करें:

  • एंगल: आई लेवल, लो एंगल, हाई एंगल, बर्ड्स-आई, डच टिल्ट, ओवर-द-शोल्डर
  • दूरी: एक्सट्रीम क्लोज़-अप (ECU), क्लोज़-अप (CU), मीडियम शॉट (MS), फ़ुल शॉट (FS), वाइड शॉट, एक्सट्रीम वाइड शॉट (EWS)

इन्हें मिलाना ("लो-एंगल मीडियम शॉट") मॉडल को बिल्कुल बता देता है कि सब्जेक्ट के सापेक्ष कैमरा कहाँ रखना है।

काम करने वाले मूवमेंट निर्देश

कैमरा मूवमेंट वीडियो प्रॉम्प्टिंग के सबसे असरदार लीवर्स में से एक है, और सबसे ज़्यादा अनदेखा किया जाने वाला भी। कुछ भरोसेमंद मूवमेंट वर्णन जिन पर ज़्यादातर मॉडल अच्छी प्रतिक्रिया देते हैं:

  • "slow dolly-in": कैमरा सब्जेक्ट की ओर भौतिक रूप से आगे बढ़ता है
  • "gentle pan right": कैमरा क्षैतिज रूप से घूमता है
  • "tilt up": कैमरा ऊपर की ओर लंबवत घूमता है
  • "tracking shot": कैमरा चलते सब्जेक्ट का पीछा करता है
  • "static locked-off shot": कोई मूवमेंट नहीं, बहुत स्थिर
  • "slow aerial descent": बर्ड्स-आई व्यू नीचे की ओर उतरता हुआ

💡 Kling v2.6 और Kling v3 Omni Video जैसे मॉडल के लिए, प्रॉम्प्ट में कैमरा मूवमेंट सीधे बताने से वह नतीजे मिलते हैं जो ज़्यादा सोचे-समझे और निर्देशित लगते हैं, बनिस्बत उस स्थिति के जब इसे अनिर्दिष्ट छोड़ दिया जाए।

लेंस और डेप्थ ऑफ़ फ़ील्ड के नोट्स

अगर आप फ़ोकल लेंथ जानते हैं जो चाहते हैं, तो उसे शामिल करें। "शैलो डेप्थ ऑफ़ फ़ील्ड वाला 85mm पोर्ट्रेट लेंस" और "28mm वाइड एंगल, सब कुछ फ़ोकस में" अलग-अलग नतीजे देते हैं। ये मनमाने नंबर नहीं हैं: ये खास विज़ुअल सौंदर्य को समेटते हैं जो ट्रेनिंग डेटा में लगातार दिखते हैं। 28mm वाइड एंगल परिवेश का संदर्भ बनाता है। 85mm जगह को संकुचित करता है और सब्जेक्ट को अलग करता है। 200mm टेलीफ़ोटो परतों को समतल करता है और व्यस्त बैकग्राउंड से सब्जेक्ट को नाटकीय रूप से अलग करता है।

मोशन और एक्शन वर्णन

भोर में गीले ट्रैक पर दौड़ते समय कदम के बीच पकड़ा गया पुरुष स्प्रिंटर, रिम लाइट और अंगों पर मोशन ब्लर के साथ

मूवमेंट को सटीकता से बताना

मोशन वर्णन में सबसे आम गलती यह है कि आप बताते हैं कोई चीज़ क्या है, न कि वह क्या करती है।

"एक दौड़ता हुआ व्यक्ति" मॉडल को बताता है कि सब्जेक्ट गतिशील है। वह मॉडल को उस मूवमेंट की गुणवत्ता, गति, दिशा या भौतिक ब्योरा नहीं बताता। "एक महिला पूरी रफ़्तार से कैमरे की ओर दौड़ती हुई, बाँहें झूलती हुई, पैरों के पीछे बजरी बिखरती हुई, चेहरे पर एकाग्रता" मॉडल को ये पाँचों बातें बता देता है।

एक्टिव वर्ब और देखे जा सकने वाले भौतिक ब्योरे इस्तेमाल करें: बिखरना, डोलना, चमकना, झुकना, घूमना, लहराना, फड़फड़ाना। ये "चलना" या "एनिमेटेड" जैसे सामान्य शब्दों से कहीं ज़्यादा लगातार मोशन देते हैं।

पेसिंग की समस्या

पाँच सेकंड के वीडियो को एक साफ़ और एकल एक्शन आर्क चाहिए। दस सेकंड के वीडियो में दो बीट्स आ सकती हैं। Wan 2.7 T2V, LTX 2.3 Pro और Hailuo 02 जैसे जनरेटर तब बेहतर क्लिप बनाते हैं जब प्रॉम्प्ट कई अलग घटनाओं के बजाय एक लगातार एक्शन का वर्णन करे।

अगर आप लिखते हैं "वह दरवाज़ा खोलती है, अंदर जाती है, बैठती है और फ़ोन उठाती है," तो आप 30 सेकंड के सीन को 5 सेकंड की क्लिप में ठूँस रहे हैं। मॉडल फ़्रेम छोड़ देगा या बिखरे हुए झटके बनाएगा। इसके बजाय लिखें: "वह धीरे से भारी लकड़ी का दरवाज़ा खोलती है, दहलीज़ पर रुकती है, उसके पीछे से सुनहरी रोशनी अंदर आती हुई।"

टेम्पोरल कंसिस्टेंसी का असली मतलब

टेम्पोरल कंसिस्टेंसी का मतलब है फ़्रेमों में विज़ुअल तत्वों का स्थिर रहना: सब्जेक्ट का चेहरा, बैकग्राउंड, लाइटिंग, रंग पैलेट। जब यह टूटती है, तो टेक्सचर झिलमिलाते हैं, चेहरे बदलते दिखते हैं, या एनवायरनमेंट क्लिप के बीच में बदल जाता है।

इसे बेहतर बनाने के लिए मॉडल को स्थिर सहारे देने होते हैं। लंबे और खास सब्जेक्ट वर्णन मदद करते हैं। मज़बूत सीन लाइटिंग वर्णन मदद करते हैं। एक साथ बहुत सारे चलते तत्वों से बचना मदद करता है। Pixverse v6 और Gen 4.5 जैसे मॉडल में स्थिरता के अंतर्निहित सुधार हैं, पर बेसलाइन अब भी प्रॉम्प्ट ही तय करता है।

लाइटिंग और माहौल

खाली थिएटर स्टेज, घिसे लकड़ी के फ़र्श पर एक अकेली स्पॉटलाइट का शंकु

प्राकृतिक बनाम कृत्रिम रोशनी

प्राकृतिक रोशनी के वर्णन ट्रेनिंग डेटा में मज़बूत संबंध रखते हैं। "गोल्डन आवर बैकलाइट," "बादलों से फैली दिन की रोशनी," "ब्लू-आवर वाली सड़क की रोशनी," "सिर के ऊपर दोपहर का सूरज जो कड़ी परछाईं डालता है": इनमें से हर एक तुरंत मॉडल के लिए विज़ुअल संदर्भ तय कर देता है।

कृत्रिम रोशनी आपको ज़्यादा सटीकता देती है। "एक ही ऊपरी टंगस्टन बल्ब," "गीले फ़ुटपाथ पर परावर्तित नियॉन साइन," "नरम फ़िल वाला तीन-बिंदु स्टूडियो सेटअप," "गलियारे में टिमटिमाती फ़्लोरोसेंट": ये सभी खास सिनेमैटिक मूड उच्च स्थिरता के साथ दर्ज करते हैं।

कलर टेम्परेचर से मूड

कलर टेम्परेचर किसी भी दूसरी चीज़ जितना ही दृश्य के भावनात्मक असर को प्रभावित करता है। इन शब्दों को सीधे इस्तेमाल करें:

  • गर्म (नारंगी-एंबर): आत्मीय, नॉस्टैल्जिक, आरामदायक
  • ठंडा (नीला-टील): क्लिनिकल, तनावपूर्ण, अलग-थलग
  • न्यूट्रल: डॉक्यूमेंट्री, यथार्थवादी, ज़मीनी
  • मिश्रित: सिनेमैटिक और नाटकीय (जैसे, "ठंडे नीले बाहरी दृश्य में फैलती गर्म अंदरूनी रोशनी")

सफ़ेद सीमलेस बैकड्रॉप पर तीन पेशेवर सॉफ़्टबॉक्स लाइट्स वाला फ़ोटोग्राफ़ी स्टूडियो का अंदरूनी हिस्सा

फ़्लैट वीडियो की समस्या से बचना

सपाट, कम रोशनी वाले वीडियो अक्सर उन प्रॉम्प्ट से आते हैं जिनमें लाइटिंग का कोई वर्णन ही नहीं होता। मॉडल मध्यम-धूसर औसत पर चला जाता है। इससे बचने के लिए:

  1. हमेशा एक रोशनी का स्रोत बताएँ (खिड़की, सूरज, लैंप, स्ट्रीटलाइट, स्क्रीन)
  2. दिशा बताएँ (बाईं ओर से, ऊपर से, बैक-लिट, साइड-लिट)
  3. गुणवत्ता बताएँ (कठोर, नरम, फैली हुई, सीधी, बिखरी हुई)

लाइटिंग का सिर्फ़ एक वाक्य ("बाईं ओर से गर्म खिड़की की रोशनी, सब्जेक्ट के चेहरे पर नरम परछाइयाँ डालती हुई") भी किसी भी जनरेशन का विज़ुअल आउटपुट नाटकीय रूप से बदल देता है।

स्टाइल, नेगेटिव प्रॉम्प्ट और अंतिम जाँच

भोर में कोहरे से भरा घना जंगली रास्ता, चीड़ के पेड़ और धुंध जो नरम सुबह की रोशनी फैलाती है

स्टाइल मॉडिफ़ायर जो सच में काम करते हैं

AI वीडियो के सबसे अच्छे स्टाइल मॉडिफ़ायर असली सिनेमैटिक संदर्भों से लिए जाते हैं। वे उन खास विज़ुअल सिस्टमों को समेटते हैं जिन्हें मॉडल ने असली फ़िल्मों और फ़ोटोग्राफ़ी से सीखा है:

  • "photorealistic, 8K": फ़ोटोग्राफ़िक यथार्थवाद का आधार
  • "film grain, Kodak Portra 400": एनालॉग टेक्सचर, कम संतृप्त गर्माहट
  • "Kodachrome palette": संतृप्त विंटेज रंग
  • "Arri Alexa look": पेशेवर सिनेमा कलर साइंस
  • "anamorphic lens flares": वाइडस्क्रीन सिनेमा सौंदर्य
  • "handheld documentary": जानबूझकर प्राकृतिक हिलना

"hyper-realistic digital" या "cinematic 3D render" जैसे सिंथेटिक लगने वाले शब्दों से बचें। ये अक्सर मॉडल को CG सौंदर्य की ओर खींच देते हैं, भले ही आप लाइव-एक्शन फ़ोटोग्राफ़ी चाहते हों।

नेगेटिव प्रॉम्प्ट: क्या बाहर रखें

सभी वीडियो मॉडल में अलग नेगेटिव प्रॉम्प्ट फ़ील्ड नहीं होता। जब होता है, तो उसे ज़रूर इस्तेमाल करें। ज़्यादातर वीडियो को बेहतर बनाने वाले मानक अपवर्जन:

  • धुंधला, आउट-ऑफ़-फ़ोकस (जब तक जानबूझकर न हो)
  • वॉटरमार्क, टेक्स्ट ओवरले, लोगो
  • कार्टून, इलस्ट्रेशन, एनिमेटेड, एनीमे
  • कम क्वालिटी, पिक्सेलेटेड, कंप्रेशन आर्टिफ़ैक्ट
  • ज़्यादा कैमरा शेक (जब तक माँगा न गया हो)
  • कई लोग (अगर आपके सीन को एक ही सब्जेक्ट चाहिए)

अंतिम रीड-थ्रू टेस्ट

कोई भी प्रॉम्प्ट सबमिट करने से पहले, उसे दोबारा पढ़ें और इन छह सवालों के जवाब दें:

  1. क्या आप ठीक-ठीक कल्पना कर सकते हैं कि पहला फ़्रेम कैसा दिखता है?
  2. क्या आप जानते हैं कि पहले और आख़िरी फ़्रेम के बीच क्या बदलता है?
  3. क्या कोई नामित रोशनी का स्रोत है?
  4. क्या आपने कैमरा एंगल बताया है?
  5. क्या आपने कैमरा मूवमेंट बताया है, या साफ़ तौर पर कैमरा स्थिर छोड़ा है?
  6. क्या सब्जेक्ट का वर्णन इतना खास है कि वह फ़्रेमों में स्थिर रहे?

इनमें से किसी भी सवाल का जवाब "नहीं" हो, तो जनरेट करने से पहले वह कमी भर दें।

AI वीडियो मॉडल के हिसाब से प्रॉम्प्ट चेकलिस्ट

अलग-अलग मॉडल एक ही प्रॉम्प्ट पर अलग प्रतिक्रिया देते हैं। अपनी भाषा को मॉडल की खासियत के अनुसार ढालने से हर मॉडल के लिए एक जैसा तरीका अपनाने से बेहतर नतीजे मिलते हैं।

व्यस्त शहरी क्रॉसवॉक का ऊपर से बर्ड्स-आई व्यू, जिसमें पैदल यात्री दोपहर बाद की लंबी परछाइयाँ डाल रहे हैं

मोशन और ऑडियो के लिए Seedance 2.0

Seedance 2.0 वीडियो के साथ नेटिव ऑडियो बनाता है, जिससे यह उन सीन के लिए आदर्श है जहाँ परिवेश की आवाज़ मायने रखती है। इसकी मोशन क्वालिटी तेज़ चलते सब्जेक्ट को अच्छे से संभालती है। Seedance के लिए प्रॉम्प्ट में ऑडियो संदर्भ बताने से बनने वाला साउंडस्केप बेहतर होता है: "चट्टानी किनारे से टकराती लहरें," "रश आवर में शहर के ट्रैफ़िक की गूँज," "बजरी वाले रास्ते पर कदमों की आवाज़।"

सिनेमैटिक नियंत्रण के लिए Kling v3

Kling v3 Video खास कैमरा भाषा पर विशेष रूप से अच्छी प्रतिक्रिया देता है। मूवमेंट के प्रकार बताना ("slow push-in," "crane shot rising") सामान्य वर्णनों की तुलना में साफ़ तौर पर ज़्यादा नियंत्रित नतीजे देता है। Kling v3 का 1080p आउटपुट उन स्थितियों के लिए मज़बूत विकल्प बनाता है जहाँ आउटपुट क्वालिटी जनरेशन की गति से ज़्यादा मायने रखती है। Kling v2.6 तेज़ इटरेशन के लिए गति और नियंत्रण का अच्छा संतुलन देता है।

लंबे सीक्वेंस के लिए Wan 2.7

Wan 2.7 T2V 1080p जनरेशन संभालता है और अच्छी टेम्पोरल स्थिरता वाली लंबी क्लिप्स के लिए मज़बूत विकल्प है। इसका इमेज-टू-वीडियो वर्ज़न, Wan 2.7 I2V, एक संदर्भ इमेज को शुरुआती फ़्रेम के रूप में लेता है, जिससे कंसिस्टेंसी की समस्याएँ काफ़ी कम हो जाती हैं, क्योंकि मॉडल के पास एक ठोस, पिक्सेल-परफ़ेक्ट शुरुआती बिंदु होता है, सिर्फ़ टेक्स्ट से शुरुआत करने के बजाय।

ऑडियो-सिंक्ड कंटेंट के लिए Veo 3.1

Veo 3.1 सिंक्रोनाइज़्ड नेटिव ऑडियो के साथ वीडियो बनाता है। डायलॉग वाले सीन या संगीत-आधारित कंटेंट के लिए, प्रॉम्प्ट में ध्वनि का वर्णन ऑडियो जनरेशन को ज़्यादा काम की सामग्री देता है: "पृष्ठभूमि में धीरे बजता हल्का अकूस्टिक गिटार," "टाइल वाले बाथरूम में प्राकृतिक गूँज के साथ संवाद," "चीड़ के पेड़ों से होकर बहती हवा।"

तेज़ इटरेशन के लिए Pixverse v6 और Hailuo 02

जब इटरेशन की गति अधिकतम क्वालिटी से ज़्यादा मायने रखती है, तो Pixverse v6 और Hailuo 02 अच्छे रिज़ॉल्यूशन पर तेज़ नतीजे देते हैं। ये प्रॉम्प्ट वेरिएशन टेस्ट करने के लिए अच्छे हैं: एक ही सीन के तीन वर्ज़न अलग लाइटिंग या मोशन वर्णन के साथ लिखें, तीनों को जल्दी जनरेट करें, फिर सबसे मज़बूत वर्ज़न को अंतिम आउटपुट के लिए ज़्यादा क्वालिटी वाले मॉडल पर ले जाएँ।

PicassoIA पर AI वीडियो प्रॉम्प्टिंग कैसे करें

PicassoIA आपको एक ही इंटरफ़ेस से ऊपर के सभी मॉडल तक पहुँच देता है, और हर एक के लिए अलग API कीज़ या अकाउंट की ज़रूरत नहीं होती। यहाँ बताया गया है कि प्लेटफ़ॉर्म पर इस चेकलिस्ट का इस्तेमाल कैसे करें:

चरण 1: अपना मॉडल चुनें

टेक्स्ट-टू-वीडियो कलेक्शन में जाकर अपने सीन के हिसाब से मॉडल चुनें। तेज़ी से बार-बार आज़माने के लिए P Video या Ray Flash 2 720p से शुरुआत करें। फ़ाइनल क्वालिटी के आउटपुट के लिए Seedance 2.0, Kling v3 Video या Veo 3.1 पर जाएँ।

चरण 2: प्रॉम्प्ट को हिस्सों में बनाएँ

इन नौ फ़ील्ड्स को क्रम से भरें:

  1. सब्जेक्ट (कौन या क्या, सटीक वर्णन के साथ)
  2. एनवायरनमेंट (कहाँ, स्थापत्य या प्राकृतिक ब्योरे के साथ)
  3. दिन का समय और मौसम
  4. कैमरा एंगल और दूरी
  5. कैमरा मूवमेंट, या "static locked-off shot"
  6. एक्शन या मोशन (एकल आर्क, एक्टिव वर्ब)
  7. लाइटिंग (स्रोत, दिशा, गुणवत्ता)
  8. स्टाइल मॉडिफ़ायर (फ़ोटोरियलिस्टिक मानक, ज़रूरत हो तो फ़िल्म स्टॉक)
  9. अपवर्जन (अंत में, या उपलब्ध हो तो नेगेटिव फ़ील्ड में)

चरण 3: 5 सेकंड से शुरू करें, फिर बढ़ाएँ

पहले 5 सेकंड की क्लिप जनरेट करें। पहला फ़्रेम और क्लिप भर में कंसिस्टेंसी देखें। अगर पहला फ़्रेम गलत है, तो सीन का वर्णन ठीक करें। अगर बीच में कंसिस्टेंसी टूटती है, तो सब्जेक्ट की विशिष्टता बढ़ाएँ और एक साथ चलते तत्वों की संख्या घटाएँ। लंबी क्लिप तभी बनाएँ जब 5 सेकंड वाला वर्ज़न पूरी तरह एकसार लगे।

चरण 4: अधिकतम कंसिस्टेंसी के लिए इमेज-टू-वीडियो इस्तेमाल करें

अगर आपके मन में कोई खास पहला फ़्रेम है, तो उसे पहले टेक्स्ट-टू-इमेज मॉडल से जनरेट करें, फिर उस इमेज को एनिमेशन के लिए Wan 2.7 I2V, Wan 2.5 I2V, या Hailuo 2.3 में डालें। इससे टेम्पोरल कंसिस्टेंसी की ज़्यादातर समस्याएँ खत्म हो जाती हैं, क्योंकि मॉडल के पास एक असली, पिक्सेल-परफ़ेक्ट शुरुआती बिंदु होता है, सब कुछ सिर्फ़ टेक्स्ट से बनाने के बजाय।

लकड़ी की मेज़ पर सजे स्टोरीबोर्ड स्केच, जिन पर हाथ से लिखे कैमरा एंगल हैं और पास में कॉफ़ी का कप

अभी जनरेट करना शुरू करें

यह चेकलिस्ट याद करने के लिए नहीं है। इसे जनरेट दबाने से पहले तेज़ी से देख लेने के लिए बनाया गया है, जैसे कोई पायलट उड़ान से पहले प्री-फ़्लाइट जाँच करता है: इसलिए नहीं कि वह सिस्टम भूल गया है, बल्कि इसलिए कि व्यवस्थित जाँच वह तत्व पकड़ लेती है जिसे वह वरना छोड़ देता।

इस ढाँचे को एक नोट्स फ़ाइल में कॉपी करें और हर जनरेशन से पहले भरें:

Subject: [who or what, described precisely]
Environment: [where, with specific detail]
Time and weather: [lighting context]
Camera angle: [low / eye / high / aerial + distance]
Camera movement: [named movement or "locked-off"]
Action: [single motion arc, active verbs]
Lighting: [source + direction + quality]
Style: [photorealistic, film stock, etc.]
Exclude: [what the model should avoid]

हर फ़ील्ड भरा होने का मतलब है कम बेकार जनरेशन और तेज़ नतीजे। ऐसा प्रॉम्प्ट जो फीकी, झटकेदार क्लिप बनाता है और वह जो बचाने लायक कुछ बनाता है, इनके बीच का फ़र्क अक्सर तीन-चार खास शब्दों पर आ टिकता है जो आपने अभी तक जोड़े ही नहीं थे।

PicassoIA 100 से ज़्यादा टेक्स्ट-टू-वीडियो मॉडल को बिना किसी सेटअप झंझट के एक ही जगह पर रखता है। कोई मॉडल चुनें, इस चेकलिस्ट से गुज़रें, और जनरेट करें। आपका पहला संरचित प्रॉम्प्ट picassoia.com पर आपका इंतज़ार कर रहा है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख