AI वीडियो के लिए प्रॉम्प्ट चेकलिस्ट जो सच में काम करे
AI वीडियो प्रॉम्प्ट लिखना, जिनसे सिनेमैटिक और लगातार एक-जैसे नतीजे मिलें, सिर्फ़ यह बताने से कहीं ज़्यादा है कि आपको क्या चाहिए। यह चेकलिस्ट हर तत्व को तोड़कर समझाती है, सीन की कंपोज़िशन और कैमरा मूवमेंट से लेकर लाइटिंग संकेत और पेसिंग तक, ताकि आपका अगला वीडियो जनरेशन पहली ही कोशिश में सही निकले।
टेक्स्ट-टू-वीडियो मॉडल के सामने खाली प्रॉम्प्ट फ़ील्ड देखने में जितना सरल लगता है, उतना है नहीं। आप कुछ लिखते हैं, जनरेट दबाते हैं, और दो मिनट बाद आपके पास एक वीडियो होता है। पर वह वैसा बिल्कुल नहीं दिखता जैसा आपने कल्पना की थी।
"मैंने साफ़ बताया था" और "नतीजा सही निकला" के बीच का फ़ासला लगभग हमेशा प्रॉम्प्ट की समस्या होता है। ऐसा इसलिए नहीं कि आपने गलत शब्द लिखे, बल्कि इसलिए कि टेक्स्ट-टू-वीडियो मॉडल को एक खास तरह की जानकारी एक खास क्रम में चाहिए, और ज़्यादातर लोग उसका आधा हिस्सा बिना जाने छोड़ देते हैं। यह चेकलिस्ट हर उस तत्व को कवर करती है जो AI वीडियो प्रॉम्प्ट में होना चाहिए, और इसे इस तरह व्यवस्थित किया गया है कि हर जनरेशन से पहले आप इसे एक बार देख सकें।
ज़्यादातर AI वीडियो प्रॉम्प्ट कमज़ोर क्यों रह जाते हैं
इमेज प्रॉम्प्टिंग और वीडियो प्रॉम्प्टिंग में फ़र्क
इमेज प्रॉम्प्ट एक जमे हुए पल का वर्णन करते हैं। आप समय और मूवमेंट के बारे में ढीले रह सकते हैं, क्योंकि मॉडल को सिर्फ़ एक फ़्रेम बनाना होता है। वीडियो प्रॉम्प्ट एक सीक्वेंस का वर्णन करते हैं। मॉडल को पता होना चाहिए कि सीन की शुरुआत किससे होती है, 5 या 10 सेकंड में वह कैसे बदलता है, और पूरे समय कैमरा क्या कर रहा है। ये बातें छोड़ देने पर मॉडल खाली जगहें अपने हिसाब से भर देता है, आम तौर पर कैमरे का रैंडम बहाव, सब्जेक्ट की झटकेदार हरकत, और बीच का ऐसा फ़्रेम जो शुरुआती फ़्रेम जैसा बिल्कुल न लगे।
मॉडल को असल में क्या जानना होता है
ज़्यादातर AI वीडियो मॉडल लाखों क्लिप्स पर प्रशिक्षित होते हैं, जिनमें पेशेवर सिनेमैटोग्राफ़ी के नियम पहले से शामिल होते हैं। वे उस शिल्प की भाषा पर अच्छी प्रतिक्रिया देते हैं: खास कैमरा शब्द, लाइटिंग की शब्दावली, मोशन की क्रियाएँ। "कूल" या "अच्छा" जैसे धुंधले विशेषण मॉडल को कुछ ठोस नहीं देते।
Seedance 2.0, Kling v3 Video और Veo 3.1 जैसे मॉडल संरचित और खास प्रॉम्प्ट पर कहीं बेहतर प्रतिक्रिया देते हैं। चलिए इनमें से एक प्रॉम्प्ट का हर भाग समझते हैं।
सीन फ़ाउंडेशन चेकलिस्ट
कैमरा या मोशन के किसी भी ब्योरे से पहले, एक अच्छा AI वीडियो प्रॉम्प्ट कौन, क्या और कहाँ तय करता है। ये तीन आधार मॉडल को हर फ़्रेम के लिए एक स्थिर शुरुआत देते हैं।
सब्जेक्ट: फ़्रेम में कौन या क्या है
अपने सब्जेक्ट को इतनी बारीकी से परिभाषित करें कि कोई कास्टिंग डायरेक्टर उसे पहचान सके। "एक महिला" की जगह लिखें "30 के दशक में एक महिला, छोटे काले बाल, क्रीम रंग का रेनकोट पहने हुए।" "एक कार" की जगह लिखें "क्रोम ट्रिम और पीछे एग्ज़ॉस्ट पाइप वाली काली 1960 की मसल कार।"
इतना ब्योरा टेम्पोरल कंसिस्टेंसी में मदद करता है। जब मॉडल के पास सब्जेक्ट का सटीक वर्णन होता है, तो वह हर फ़्रेम में उसे स्थिर रखता है, बजाय इसके कि वह बदलता रहे।
कमज़ोर
मज़बूत
"एक आदमी चल रहा है"
"दाढ़ी वाला एक आदमी, ग्रे सूट में, 40 के मध्य में, जेबों में हाथ डाले चलता हुआ"
"एक शहर"
"बारिश वाले यूरोपीय शहर की एक संकरी कोबलस्टोन गली, गीली दुकानें, शाम का समय"
"प्राकृतिक दृश्य"
"सुबह की पौ फटने के समय एक चीड़ के जंगल की खुली जगह, ज़मीन के स्तर पर धुंध, उगते सूरज की पीछे से रोशनी"
एनवायरनमेंट: एक्शन कहाँ होता है
एनवायरनमेंट को भी सब्जेक्ट जितनी ही बारीकी चाहिए। "एक कॉफ़ी शॉप में" बहुत पतला वर्णन है। "एक छोटी स्वतंत्र कॉफ़ी शॉप के अंदर, खुली ईंट की दीवारें, बेमेल लकड़ी की कुर्सियाँ, गर्म एडिसन बल्ब की रोशनी, और पीछे की स्ट्रीट-विंडो पर दिखती बारिश" मॉडल को एक असली जगह देता है जिसे वह भर सके। एनवायरनमेंट का वर्णन जितना समृद्ध होगा, फ़्रेम-दर-फ़्रेम बैकग्राउंड उतना ही स्थिर रहेगा।
दिन का समय और मौसम
ये दो पैरामीटर आपके प्रॉम्प्ट के लगभग किसी भी दूसरे तत्व से ज़्यादा काम करते हैं। ये रोशनी की दिशा, कलर टेम्परेचर, परछाईं की कठोरता और वायुमंडलीय फैलाव तय करते हैं। "सुबह की हल्की धुंध," "दोपहर की तेज़ धूप," "बादल वाली शाम," "ब्लू-आवर वाला सांझ का समय": इनमें से हर एक पूरी तरह अलग दृश्य-दुनिया खड़ी कर देता है। दिन का समय कभी अनिर्दिष्ट न छोड़ें।
कैमरा और कंपोज़िशन संकेत
एंगल और दूरी
AI वीडियो मॉडल एंगल और दूरी के मानक सिनेमैटोग्राफ़ी शब्दों पर अच्छी प्रतिक्रिया देते हैं। इन्हें सीधे इस्तेमाल करें:
इन्हें मिलाना ("लो-एंगल मीडियम शॉट") मॉडल को बिल्कुल बता देता है कि सब्जेक्ट के सापेक्ष कैमरा कहाँ रखना है।
काम करने वाले मूवमेंट निर्देश
कैमरा मूवमेंट वीडियो प्रॉम्प्टिंग के सबसे असरदार लीवर्स में से एक है, और सबसे ज़्यादा अनदेखा किया जाने वाला भी। कुछ भरोसेमंद मूवमेंट वर्णन जिन पर ज़्यादातर मॉडल अच्छी प्रतिक्रिया देते हैं:
"slow dolly-in": कैमरा सब्जेक्ट की ओर भौतिक रूप से आगे बढ़ता है
"gentle pan right": कैमरा क्षैतिज रूप से घूमता है
"tilt up": कैमरा ऊपर की ओर लंबवत घूमता है
"tracking shot": कैमरा चलते सब्जेक्ट का पीछा करता है
"static locked-off shot": कोई मूवमेंट नहीं, बहुत स्थिर
"slow aerial descent": बर्ड्स-आई व्यू नीचे की ओर उतरता हुआ
💡 Kling v2.6 और Kling v3 Omni Video जैसे मॉडल के लिए, प्रॉम्प्ट में कैमरा मूवमेंट सीधे बताने से वह नतीजे मिलते हैं जो ज़्यादा सोचे-समझे और निर्देशित लगते हैं, बनिस्बत उस स्थिति के जब इसे अनिर्दिष्ट छोड़ दिया जाए।
लेंस और डेप्थ ऑफ़ फ़ील्ड के नोट्स
अगर आप फ़ोकल लेंथ जानते हैं जो चाहते हैं, तो उसे शामिल करें। "शैलो डेप्थ ऑफ़ फ़ील्ड वाला 85mm पोर्ट्रेट लेंस" और "28mm वाइड एंगल, सब कुछ फ़ोकस में" अलग-अलग नतीजे देते हैं। ये मनमाने नंबर नहीं हैं: ये खास विज़ुअल सौंदर्य को समेटते हैं जो ट्रेनिंग डेटा में लगातार दिखते हैं। 28mm वाइड एंगल परिवेश का संदर्भ बनाता है। 85mm जगह को संकुचित करता है और सब्जेक्ट को अलग करता है। 200mm टेलीफ़ोटो परतों को समतल करता है और व्यस्त बैकग्राउंड से सब्जेक्ट को नाटकीय रूप से अलग करता है।
मोशन और एक्शन वर्णन
मूवमेंट को सटीकता से बताना
मोशन वर्णन में सबसे आम गलती यह है कि आप बताते हैं कोई चीज़ क्या है, न कि वह क्या करती है।
"एक दौड़ता हुआ व्यक्ति" मॉडल को बताता है कि सब्जेक्ट गतिशील है। वह मॉडल को उस मूवमेंट की गुणवत्ता, गति, दिशा या भौतिक ब्योरा नहीं बताता। "एक महिला पूरी रफ़्तार से कैमरे की ओर दौड़ती हुई, बाँहें झूलती हुई, पैरों के पीछे बजरी बिखरती हुई, चेहरे पर एकाग्रता" मॉडल को ये पाँचों बातें बता देता है।
एक्टिव वर्ब और देखे जा सकने वाले भौतिक ब्योरे इस्तेमाल करें: बिखरना, डोलना, चमकना, झुकना, घूमना, लहराना, फड़फड़ाना। ये "चलना" या "एनिमेटेड" जैसे सामान्य शब्दों से कहीं ज़्यादा लगातार मोशन देते हैं।
पेसिंग की समस्या
पाँच सेकंड के वीडियो को एक साफ़ और एकल एक्शन आर्क चाहिए। दस सेकंड के वीडियो में दो बीट्स आ सकती हैं। Wan 2.7 T2V, LTX 2.3 Pro और Hailuo 02 जैसे जनरेटर तब बेहतर क्लिप बनाते हैं जब प्रॉम्प्ट कई अलग घटनाओं के बजाय एक लगातार एक्शन का वर्णन करे।
अगर आप लिखते हैं "वह दरवाज़ा खोलती है, अंदर जाती है, बैठती है और फ़ोन उठाती है," तो आप 30 सेकंड के सीन को 5 सेकंड की क्लिप में ठूँस रहे हैं। मॉडल फ़्रेम छोड़ देगा या बिखरे हुए झटके बनाएगा। इसके बजाय लिखें: "वह धीरे से भारी लकड़ी का दरवाज़ा खोलती है, दहलीज़ पर रुकती है, उसके पीछे से सुनहरी रोशनी अंदर आती हुई।"
टेम्पोरल कंसिस्टेंसी का असली मतलब
टेम्पोरल कंसिस्टेंसी का मतलब है फ़्रेमों में विज़ुअल तत्वों का स्थिर रहना: सब्जेक्ट का चेहरा, बैकग्राउंड, लाइटिंग, रंग पैलेट। जब यह टूटती है, तो टेक्सचर झिलमिलाते हैं, चेहरे बदलते दिखते हैं, या एनवायरनमेंट क्लिप के बीच में बदल जाता है।
इसे बेहतर बनाने के लिए मॉडल को स्थिर सहारे देने होते हैं। लंबे और खास सब्जेक्ट वर्णन मदद करते हैं। मज़बूत सीन लाइटिंग वर्णन मदद करते हैं। एक साथ बहुत सारे चलते तत्वों से बचना मदद करता है। Pixverse v6 और Gen 4.5 जैसे मॉडल में स्थिरता के अंतर्निहित सुधार हैं, पर बेसलाइन अब भी प्रॉम्प्ट ही तय करता है।
लाइटिंग और माहौल
प्राकृतिक बनाम कृत्रिम रोशनी
प्राकृतिक रोशनी के वर्णन ट्रेनिंग डेटा में मज़बूत संबंध रखते हैं। "गोल्डन आवर बैकलाइट," "बादलों से फैली दिन की रोशनी," "ब्लू-आवर वाली सड़क की रोशनी," "सिर के ऊपर दोपहर का सूरज जो कड़ी परछाईं डालता है": इनमें से हर एक तुरंत मॉडल के लिए विज़ुअल संदर्भ तय कर देता है।
कृत्रिम रोशनी आपको ज़्यादा सटीकता देती है। "एक ही ऊपरी टंगस्टन बल्ब," "गीले फ़ुटपाथ पर परावर्तित नियॉन साइन," "नरम फ़िल वाला तीन-बिंदु स्टूडियो सेटअप," "गलियारे में टिमटिमाती फ़्लोरोसेंट": ये सभी खास सिनेमैटिक मूड उच्च स्थिरता के साथ दर्ज करते हैं।
कलर टेम्परेचर से मूड
कलर टेम्परेचर किसी भी दूसरी चीज़ जितना ही दृश्य के भावनात्मक असर को प्रभावित करता है। इन शब्दों को सीधे इस्तेमाल करें:
गर्म (नारंगी-एंबर): आत्मीय, नॉस्टैल्जिक, आरामदायक
ठंडा (नीला-टील): क्लिनिकल, तनावपूर्ण, अलग-थलग
न्यूट्रल: डॉक्यूमेंट्री, यथार्थवादी, ज़मीनी
मिश्रित: सिनेमैटिक और नाटकीय (जैसे, "ठंडे नीले बाहरी दृश्य में फैलती गर्म अंदरूनी रोशनी")
फ़्लैट वीडियो की समस्या से बचना
सपाट, कम रोशनी वाले वीडियो अक्सर उन प्रॉम्प्ट से आते हैं जिनमें लाइटिंग का कोई वर्णन ही नहीं होता। मॉडल मध्यम-धूसर औसत पर चला जाता है। इससे बचने के लिए:
हमेशा एक रोशनी का स्रोत बताएँ (खिड़की, सूरज, लैंप, स्ट्रीटलाइट, स्क्रीन)
दिशा बताएँ (बाईं ओर से, ऊपर से, बैक-लिट, साइड-लिट)
लाइटिंग का सिर्फ़ एक वाक्य ("बाईं ओर से गर्म खिड़की की रोशनी, सब्जेक्ट के चेहरे पर नरम परछाइयाँ डालती हुई") भी किसी भी जनरेशन का विज़ुअल आउटपुट नाटकीय रूप से बदल देता है।
स्टाइल, नेगेटिव प्रॉम्प्ट और अंतिम जाँच
स्टाइल मॉडिफ़ायर जो सच में काम करते हैं
AI वीडियो के सबसे अच्छे स्टाइल मॉडिफ़ायर असली सिनेमैटिक संदर्भों से लिए जाते हैं। वे उन खास विज़ुअल सिस्टमों को समेटते हैं जिन्हें मॉडल ने असली फ़िल्मों और फ़ोटोग्राफ़ी से सीखा है:
"photorealistic, 8K": फ़ोटोग्राफ़िक यथार्थवाद का आधार
"film grain, Kodak Portra 400": एनालॉग टेक्सचर, कम संतृप्त गर्माहट
"hyper-realistic digital" या "cinematic 3D render" जैसे सिंथेटिक लगने वाले शब्दों से बचें। ये अक्सर मॉडल को CG सौंदर्य की ओर खींच देते हैं, भले ही आप लाइव-एक्शन फ़ोटोग्राफ़ी चाहते हों।
नेगेटिव प्रॉम्प्ट: क्या बाहर रखें
सभी वीडियो मॉडल में अलग नेगेटिव प्रॉम्प्ट फ़ील्ड नहीं होता। जब होता है, तो उसे ज़रूर इस्तेमाल करें। ज़्यादातर वीडियो को बेहतर बनाने वाले मानक अपवर्जन:
धुंधला, आउट-ऑफ़-फ़ोकस (जब तक जानबूझकर न हो)
वॉटरमार्क, टेक्स्ट ओवरले, लोगो
कार्टून, इलस्ट्रेशन, एनिमेटेड, एनीमे
कम क्वालिटी, पिक्सेलेटेड, कंप्रेशन आर्टिफ़ैक्ट
ज़्यादा कैमरा शेक (जब तक माँगा न गया हो)
कई लोग (अगर आपके सीन को एक ही सब्जेक्ट चाहिए)
अंतिम रीड-थ्रू टेस्ट
कोई भी प्रॉम्प्ट सबमिट करने से पहले, उसे दोबारा पढ़ें और इन छह सवालों के जवाब दें:
क्या आप ठीक-ठीक कल्पना कर सकते हैं कि पहला फ़्रेम कैसा दिखता है?
क्या आप जानते हैं कि पहले और आख़िरी फ़्रेम के बीच क्या बदलता है?
क्या कोई नामित रोशनी का स्रोत है?
क्या आपने कैमरा एंगल बताया है?
क्या आपने कैमरा मूवमेंट बताया है, या साफ़ तौर पर कैमरा स्थिर छोड़ा है?
क्या सब्जेक्ट का वर्णन इतना खास है कि वह फ़्रेमों में स्थिर रहे?
इनमें से किसी भी सवाल का जवाब "नहीं" हो, तो जनरेट करने से पहले वह कमी भर दें।
AI वीडियो मॉडल के हिसाब से प्रॉम्प्ट चेकलिस्ट
अलग-अलग मॉडल एक ही प्रॉम्प्ट पर अलग प्रतिक्रिया देते हैं। अपनी भाषा को मॉडल की खासियत के अनुसार ढालने से हर मॉडल के लिए एक जैसा तरीका अपनाने से बेहतर नतीजे मिलते हैं।
मोशन और ऑडियो के लिए Seedance 2.0
Seedance 2.0 वीडियो के साथ नेटिव ऑडियो बनाता है, जिससे यह उन सीन के लिए आदर्श है जहाँ परिवेश की आवाज़ मायने रखती है। इसकी मोशन क्वालिटी तेज़ चलते सब्जेक्ट को अच्छे से संभालती है। Seedance के लिए प्रॉम्प्ट में ऑडियो संदर्भ बताने से बनने वाला साउंडस्केप बेहतर होता है: "चट्टानी किनारे से टकराती लहरें," "रश आवर में शहर के ट्रैफ़िक की गूँज," "बजरी वाले रास्ते पर कदमों की आवाज़।"
सिनेमैटिक नियंत्रण के लिए Kling v3
Kling v3 Video खास कैमरा भाषा पर विशेष रूप से अच्छी प्रतिक्रिया देता है। मूवमेंट के प्रकार बताना ("slow push-in," "crane shot rising") सामान्य वर्णनों की तुलना में साफ़ तौर पर ज़्यादा नियंत्रित नतीजे देता है। Kling v3 का 1080p आउटपुट उन स्थितियों के लिए मज़बूत विकल्प बनाता है जहाँ आउटपुट क्वालिटी जनरेशन की गति से ज़्यादा मायने रखती है। Kling v2.6 तेज़ इटरेशन के लिए गति और नियंत्रण का अच्छा संतुलन देता है।
लंबे सीक्वेंस के लिए Wan 2.7
Wan 2.7 T2V 1080p जनरेशन संभालता है और अच्छी टेम्पोरल स्थिरता वाली लंबी क्लिप्स के लिए मज़बूत विकल्प है। इसका इमेज-टू-वीडियो वर्ज़न, Wan 2.7 I2V, एक संदर्भ इमेज को शुरुआती फ़्रेम के रूप में लेता है, जिससे कंसिस्टेंसी की समस्याएँ काफ़ी कम हो जाती हैं, क्योंकि मॉडल के पास एक ठोस, पिक्सेल-परफ़ेक्ट शुरुआती बिंदु होता है, सिर्फ़ टेक्स्ट से शुरुआत करने के बजाय।
ऑडियो-सिंक्ड कंटेंट के लिए Veo 3.1
Veo 3.1 सिंक्रोनाइज़्ड नेटिव ऑडियो के साथ वीडियो बनाता है। डायलॉग वाले सीन या संगीत-आधारित कंटेंट के लिए, प्रॉम्प्ट में ध्वनि का वर्णन ऑडियो जनरेशन को ज़्यादा काम की सामग्री देता है: "पृष्ठभूमि में धीरे बजता हल्का अकूस्टिक गिटार," "टाइल वाले बाथरूम में प्राकृतिक गूँज के साथ संवाद," "चीड़ के पेड़ों से होकर बहती हवा।"
तेज़ इटरेशन के लिए Pixverse v6 और Hailuo 02
जब इटरेशन की गति अधिकतम क्वालिटी से ज़्यादा मायने रखती है, तो Pixverse v6 और Hailuo 02 अच्छे रिज़ॉल्यूशन पर तेज़ नतीजे देते हैं। ये प्रॉम्प्ट वेरिएशन टेस्ट करने के लिए अच्छे हैं: एक ही सीन के तीन वर्ज़न अलग लाइटिंग या मोशन वर्णन के साथ लिखें, तीनों को जल्दी जनरेट करें, फिर सबसे मज़बूत वर्ज़न को अंतिम आउटपुट के लिए ज़्यादा क्वालिटी वाले मॉडल पर ले जाएँ।
PicassoIA पर AI वीडियो प्रॉम्प्टिंग कैसे करें
PicassoIA आपको एक ही इंटरफ़ेस से ऊपर के सभी मॉडल तक पहुँच देता है, और हर एक के लिए अलग API कीज़ या अकाउंट की ज़रूरत नहीं होती। यहाँ बताया गया है कि प्लेटफ़ॉर्म पर इस चेकलिस्ट का इस्तेमाल कैसे करें:
एनवायरनमेंट (कहाँ, स्थापत्य या प्राकृतिक ब्योरे के साथ)
दिन का समय और मौसम
कैमरा एंगल और दूरी
कैमरा मूवमेंट, या "static locked-off shot"
एक्शन या मोशन (एकल आर्क, एक्टिव वर्ब)
लाइटिंग (स्रोत, दिशा, गुणवत्ता)
स्टाइल मॉडिफ़ायर (फ़ोटोरियलिस्टिक मानक, ज़रूरत हो तो फ़िल्म स्टॉक)
अपवर्जन (अंत में, या उपलब्ध हो तो नेगेटिव फ़ील्ड में)
चरण 3: 5 सेकंड से शुरू करें, फिर बढ़ाएँ
पहले 5 सेकंड की क्लिप जनरेट करें। पहला फ़्रेम और क्लिप भर में कंसिस्टेंसी देखें। अगर पहला फ़्रेम गलत है, तो सीन का वर्णन ठीक करें। अगर बीच में कंसिस्टेंसी टूटती है, तो सब्जेक्ट की विशिष्टता बढ़ाएँ और एक साथ चलते तत्वों की संख्या घटाएँ। लंबी क्लिप तभी बनाएँ जब 5 सेकंड वाला वर्ज़न पूरी तरह एकसार लगे।
चरण 4: अधिकतम कंसिस्टेंसी के लिए इमेज-टू-वीडियो इस्तेमाल करें
अगर आपके मन में कोई खास पहला फ़्रेम है, तो उसे पहले टेक्स्ट-टू-इमेज मॉडल से जनरेट करें, फिर उस इमेज को एनिमेशन के लिए Wan 2.7 I2V, Wan 2.5 I2V, या Hailuo 2.3 में डालें। इससे टेम्पोरल कंसिस्टेंसी की ज़्यादातर समस्याएँ खत्म हो जाती हैं, क्योंकि मॉडल के पास एक असली, पिक्सेल-परफ़ेक्ट शुरुआती बिंदु होता है, सब कुछ सिर्फ़ टेक्स्ट से बनाने के बजाय।
अभी जनरेट करना शुरू करें
यह चेकलिस्ट याद करने के लिए नहीं है। इसे जनरेट दबाने से पहले तेज़ी से देख लेने के लिए बनाया गया है, जैसे कोई पायलट उड़ान से पहले प्री-फ़्लाइट जाँच करता है: इसलिए नहीं कि वह सिस्टम भूल गया है, बल्कि इसलिए कि व्यवस्थित जाँच वह तत्व पकड़ लेती है जिसे वह वरना छोड़ देता।
इस ढाँचे को एक नोट्स फ़ाइल में कॉपी करें और हर जनरेशन से पहले भरें:
Subject: [who or what, described precisely]
Environment: [where, with specific detail]
Time and weather: [lighting context]
Camera angle: [low / eye / high / aerial + distance]
Camera movement: [named movement or "locked-off"]
Action: [single motion arc, active verbs]
Lighting: [source + direction + quality]
Style: [photorealistic, film stock, etc.]
Exclude: [what the model should avoid]
हर फ़ील्ड भरा होने का मतलब है कम बेकार जनरेशन और तेज़ नतीजे। ऐसा प्रॉम्प्ट जो फीकी, झटकेदार क्लिप बनाता है और वह जो बचाने लायक कुछ बनाता है, इनके बीच का फ़र्क अक्सर तीन-चार खास शब्दों पर आ टिकता है जो आपने अभी तक जोड़े ही नहीं थे।
PicassoIA 100 से ज़्यादा टेक्स्ट-टू-वीडियो मॉडल को बिना किसी सेटअप झंझट के एक ही जगह पर रखता है। कोई मॉडल चुनें, इस चेकलिस्ट से गुज़रें, और जनरेट करें। आपका पहला संरचित प्रॉम्प्ट picassoia.com पर आपका इंतज़ार कर रहा है।