एक भूलने लायक AI वीडियो और ऐसा वीडियो, जो ध्यान खींच ले, इनमें अक्सर फ़र्क बस कुछ दर्जन शब्दों का होता है। हज़ारों नहीं। सैकड़ों भी नहीं। आपके प्रॉम्प्ट के शब्द मोशन, कैमरे के व्यवहार, माहौल के टोन और टेम्पोरल फ़्लो को तय करते हैं, और ज़्यादातर लोग बस किसी दृश्य का वर्णन टाइप कर देते हैं, इन सब बातों के बारे में सोचे बिना।
यह कोई आलोचना नहीं है। ज़्यादातर लोग इसी तरह शुरू करते हैं। आप अपने दिमाग में जो दिख रहा है वह टाइप करते हैं, जनरेट दबाते हैं, और जो मिलता है वह ऐसी फ़ोटो जैसा होता है जिसने हिलने का फ़ैसला कर लिया हो। सब्जेक्ट सही होता है, लेकिन वीडियो स्थिर, बेतरतीब या गलत लगता है। गड़बड़ी मॉडल में नहीं है। गड़बड़ी निर्देश में है।
नीचे हम बताते हैं कि सिनेमैटिक AI वीडियो बनाने वाले प्रॉम्प्ट और पिक्सल के उलझे लूप बनाने वाले प्रॉम्प्ट में ठीक-ठीक फ़र्क क्या है।
छोटे प्रॉम्प्ट वीडियो में क्यों विफल होते हैं
इमेज जनरेशन और वीडियो जनरेशन मूल रूप से अलग काम हैं, फिर भी कई यूज़र अपने वीडियो प्रॉम्प्ट वैसे ही लिखते हैं जैसे इमेज प्रॉम्प्ट लिखते हैं। एक स्थिर इमेज प्रॉम्प्ट किसी अवस्था का वर्णन करता है। वीडियो प्रॉम्प्ट को समय के साथ होने वाला बदलाव बताना पड़ता है।
जब आप टाइप करते हैं "a woman walking through a forest," तो वीडियो मॉडल को यह अनुमान लगाना पड़ता है:
- वह किस रफ़्तार से चल रही है?
- कैमरा उसका पीछा करता है, स्थिर रहता है, या पैन करता है?
- जैसे-जैसे वह चलती है, पृष्ठभूमि में क्या बदलता है?
- क्या रोशनी बदलती है?
- यह 5 सेकंड में कैसे आगे बढ़ता है?
Seedance 2.0 या Veo 3 जैसे मॉडल इन सब पर अपना सबसे अच्छा अनुमान लगाएँगे, लेकिन "सबसे अच्छा अनुमान" आपके इरादे के बराबर नहीं होता। छोटे प्रॉम्प्ट नियंत्रण मॉडल को सौंप देते हैं। विस्तृत प्रॉम्प्ट नियंत्रण आपके पास रखते हैं।
💡 मूल सिद्धांत: वीडियो प्रॉम्प्ट में जो भी तत्व आप अपरिभाषित छोड़ते हैं, वह एक फ़ैसला है जिसे आप AI को सौंप रहे हैं। जानबूझकर तय करें कि क्या परिभाषित करना है।

हर वीडियो प्रॉम्प्ट को चाहिए 5 मुख्य तत्व
ये पाँच घटक कोई वैकल्पिक अतिरिक्त चीज़ें नहीं हैं। ये उस वीडियो की बुनियाद हैं जो वास्तव में वैसा बर्ताव करता है जैसा आप चाहते हैं।

1. सब्जेक्ट और शुरुआती अवस्था
सब्जेक्ट का सटीक वर्णन करें। सिर्फ़ यह नहीं कि वह कौन या क्या है, बल्कि पहले फ़्रेम पर उसकी ठीक स्थिति, मुद्रा और परिवेश से उसका रिश्ता भी।
कमज़ोर: "A man in a city"
मज़बूत: "A middle-aged man in a grey overcoat stands at the edge of a rain-slicked city intersection, head slightly bowed, hands in pockets"
मज़बूत वर्ज़न मॉडल को एक तय शुरुआती फ़्रेम देता है। बाकी सब उसी पर बनता है।
2. मोशन निर्देश
इमेज के मुकाबले वीडियो में यही जुड़ता है, और यही सबसे ज़्यादा छूटने वाला तत्व है। आपको बताना होगा कि क्या चलता है, कैसे चलता है और किस रफ़्तार से।
मोशन निर्देशों में शामिल हैं:
- सब्जेक्ट की गति ("she turns slowly," "the crowd surges forward," "leaves drift down")
- कैमरे की गति ("slow dolly-in," "gentle upward tilt," "static lockoff")
- पर्यावरण की गति ("steam rises from a grate," "traffic blurs past in background")
Kling v2.6 और Wan 2.7 T2V जैसे मॉडल साफ़ मोशन-भाषा पर अच्छी प्रतिक्रिया देते हैं। अस्पष्ट मोशन असंगत नतीजे देता है।
3. टेम्पोरल सीक्वेंस
AI वीडियो मॉडल एक तय अवधि का कंटेंट जनरेट करते हैं, जो मॉडल के हिसाब से आम तौर पर 4-10 सेकंड होती है। आपके प्रॉम्प्ट को उन सेकंडों के आर्क का वर्णन करना चाहिए, सिर्फ़ एक स्थिर पल का नहीं।
इसे एक छोटी स्क्रिप्ट की तरह सोचें: उन सेकंडों की शुरुआत, बीच और अंत में क्या होता है?
उदाहरण: "कैमरा एक कॉफ़ी कप के क्लोज़-अप से खुलता है। अगले कुछ सेकंड में वह धीरे-धीरे पीछे हटता है और एक भीड़ भरा कैफ़े दिखाता है। आख़िरी फ़्रेम तक सब्जेक्ट, कोने की एक मेज़ पर बैठी एक महिला, फ़ोकस में आ जाती है।"
इससे मॉडल को जनरेशन के हर पल पर क्या प्राथमिकता देनी है, यह पता चलता है।
4. रोशनी और माहौल
रोशनी सिर्फ़ दृश्य नहीं है। वीडियो प्रॉम्प्ट में यह मूड, दिन के समय और मोशन की क्वालिटी का संकेत भी देती है। तेज़ दोपहर की रोशनी में परछाइयाँ अलग तरह से चलती हैं, जबकि नरम बादल वाली रोशनी में अलग तरह से। बताएँ:
- दिन का समय ("golden hour," "blue hour," "midday overhead sun")
- रोशनी की दिशा ("light entering from upper left," "backlit subject")
- रोशनी की क्वालिटी ("soft diffused," "harsh directional," "volumetric shafts through window")
- वायुमंडलीय तत्व ("morning mist," "dust in the air," "rain on glass")
5. कैमरा विनिर्देश
मॉडल को बताएँ कि इस दृश्य को सैद्धांतिक रूप से किस तरह का कैमरा कैप्चर करता। इससे पूरी सौंदर्य-शैली तय होती है।
काम के शब्द: लेंस की फ़ोकल लेंथ ("35mm wide," "85mm portrait"), डेप्थ ऑफ़ फ़ील्ड ("f/1.8 shallow," "f/11 deep focus"), मूवमेंट का प्रकार ("handheld slight sway," "smooth gimbal," "locked off tripod"), और फ़िल्म रेंडरिंग ("Kodak Portra 400," "35mm grain")।
ऐसे कैमरा मूव जो सच में काम करते हैं
सभी कैमरा मूवमेंट के वर्णन बराबर नहीं होते। कुछ को मॉडल लगातार एक जैसा समझते हैं। कुछ इतने अस्पष्ट होते हैं कि बेतरतीब व्यवहार पैदा करते हैं।

ये कैमरा शब्द ज़्यादातर टेक्स्ट-टू-वीडियो प्लेटफ़ॉर्म पर भरोसेमंद नतीजे देते हैं:
| शब्द | यह क्या करता है | सबसे अच्छा कब काम करता है |
|---|
| Slow dolly-in | कैमरा सब्जेक्ट की ओर भौतिक रूप से आगे बढ़ता है | जब सब्जेक्ट स्थिर हो |
| Slow dolly-out | कैमरा पीछे हटता है और माहौल दिखाता है | संदर्भ या पैमाना बताने के लिए |
| Pan left/right | कैमरा एक स्थिर धुरी पर क्षैतिज घूमता है | एक चौड़ी जगह दिखाने के लिए |
| Tilt up/down | कैमरा एक स्थिर धुरी पर लंबवत घूमता है | ऊँचाई या गहराई दिखाने के लिए |
| Tracking shot | कैमरा एक चलते सब्जेक्ट का पीछा करता है | जब सब्जेक्ट गति में हो |
| Orbit shot | कैमरा सब्जेक्ट के चारों ओर घूमता है | प्रोडक्ट या किरदार पर फ़ोकस के लिए |
| Static lockoff | कैमरा नहीं हिलता | सब्जेक्ट के मोशन पर ज़ोर देने के लिए |
💡 प्रो टिप: एक साथ अधिकतम एक सब्जेक्ट मोशन और एक कैमरा मोशन जोड़ें। दो से ज़्यादा एक साथ होने वाली गतियाँ अक्सर मॉडल को किसी एक को चुनकर बाकी को नज़रअंदाज़ करने पर मजबूर करती हैं, या अस्थिर आउटपुट देती हैं।
LTX 2 Pro और Hailuo 02 जैसे मॉडल कैमरा मोशन निर्देशों को खास स्थिरता के साथ संभालते हैं। दोनों PicassoIA पर उपलब्ध हैं।
समय के साथ मोशन का वर्णन कैसे करें
यही वह हिस्सा है जिसमें ज़्यादातर प्रॉम्प्ट गलत होते हैं, और इसे ठीक करने से AI वीडियो के आउटपुट में सबसे बड़ा सुधार आता है।
AI वीडियो जनरेशन स्थिर इमेज रेंडरिंग नहीं है। मॉडल हर फ़्रेम को इस संभावना के आधार पर जनरेट करता है कि आगे क्या आएगा। आपका प्रॉम्प्ट अपनी संरचना को कालक्रम के अनुसार रखकर उस टेम्पोरल फ़्लो को प्रभावित कर सकता है।

निर्देशक की तरह सोचें, चित्रकार की तरह नहीं
चित्रकार बताता है कि क्या है। निर्देशक बताता है कि क्या होता है। ये दोनों मानसिकताएँ पूरी तरह अलग प्रॉम्प्ट बनाती हैं।
चित्रकार की मानसिकता: "बर्फ़ और सुबह की धुंध के साथ एक पहाड़ी लैंडस्केप।"
निर्देशक की मानसिकता: "सुबह की धुंध एक पहाड़ी घाटी से चिपकी हुई है। कई सेकंड के दौरान, गर्म धूप की एक किरण रिज को चीरती है और धुंध के पतला होने के साथ धीरे-धीरे बाएँ से दाएँ घाटी के तल पर फैलती है।"
दूसरा वर्ज़न मॉडल को सिर्फ़ रूप नहीं, बल्कि कार्य-कारण और टेम्पोरल सीक्वेंस भी बताता है।
ट्रांज़िशन वाली भाषा इस्तेमाल करें
समय के साथ बदलाव का संकेत देने वाले शब्दों में ये शामिल हैं:
- "जैसे-जैसे शॉट आगे बढ़ता है..."
- "अगले कुछ सेकंड में..."
- "धीरे-धीरे, वह..."
- "आख़िरी फ़्रेम तक..."
- "कैमरा धीरे-धीरे दिखाता है..."
ये वाक्यांश मॉडल को सिखाते हैं कि यह एक टेम्पोरल घटना है, स्थिर वर्णन नहीं।
विरोधी मोशन से बचें
एक आम गलती है एक साथ दो असंगत अवस्थाओं का वर्णन करना। "A figure running fast while the camera gently drifts" अक्सर अस्थिर आउटपुट देता है, क्योंकि तेज़ सब्जेक्ट मोशन और धीमी कैमरा गति को मिलाना कठिन है। या तो सब्जेक्ट की गति धीमी करें, या कैमरे की ऊर्जा को सब्जेक्ट की रफ़्तार से मिलाएँ।
रोशनी और माहौल को सही तरीके से लिखें
रोशनी ही वह जगह है जहाँ ज़्यादातर प्रॉम्प्ट बहुत सामान्य रह जाते हैं। "Natural light" या "dramatic lighting" मॉडल को लगभग कुछ नहीं बताते।

दिन के समय की ऐसी भाषा जो काम करे
| वाक्यांश | दृश्य प्रभाव |
|---|
| Golden hour | गर्म एम्बर टोन, लंबी क्षैतिज परछाइयाँ, नरम रैप-अराउंड रोशनी |
| Blue hour | ठंडा, कम संतृप्त पैलेट, आसमान की परिवेशी चमक, भोर से पहले की गहराई |
| Overcast diffused | कठोर परछाइयाँ नहीं, समान एक्सपोज़र, फीके रंग |
| Harsh midday sun | उच्च कंट्रास्ट, छोटी परछाइयाँ, संतृप्त रंग |
| Backlit silhouette | चमकीली पृष्ठभूमि के सामने गहरा सब्जेक्ट, हैलो रिम लाइट |
| Volumetric morning light | वातावरण में दिखती रोशनी की किरणें, धुंधली क्वालिटी |
ये वाक्यांश सभी प्रमुख टेक्स्ट-टू-वीडियो मॉडल समझते हैं, जिनमें Pixverse v5, Wan 2.7 I2V और Sora 2 शामिल हैं।
वायुमंडलीय परतें
मुख्य रोशनी के वर्णन के बाद वायुमंडलीय तत्व जोड़ें:
- "with dust particles visible in the light shafts"
- "morning fog softening the background"
- "heat shimmer rising from the pavement"
- "rain visible as streaks against the dark background"
इनमें से हर तत्व मुख्य सब्जेक्ट मोशन के अलावा वीडियो में गति जोड़ता है, और बिना किसी जटिल एक्शन सीक्वेंस के फ़्रेम को जीवंत बनाता है।
इमेज और वीडियो प्रॉम्प्ट में फ़र्क
यहाँ एक सीधी तुलना है, ताकि आप व्यवहार में बदलाव देख सकें।

इमेज प्रॉम्प्ट: "A woman in a red dress standing in a field of sunflowers at golden hour, 85mm lens, shallow depth of field, Kodak Portra 400."
उसी दृश्य के लिए वीडियो प्रॉम्प्ट: "गोल्डन आवर में एक चौड़े सूरजमुखी के खेत में लाल ड्रेस पहनी एक महिला कैमरे की ओर पीठ करके खड़ी है। शॉट के दौरान, वह धीरे-धीरे अपनी बाँहें बाहर की ओर उठाती है, हथेलियाँ ऊपर की ओर, जब उसके चारों ओर के सूरजमुखी के फूलों में हल्की हवा बहने लगती है। कैमरा उसके पीछे से उसकी दाईं ओर की तरफ़ धीमा ऑर्बिट करता है, और आख़िरी फ़्रेम तक उसकी प्रोफ़ाइल दिखाता है। नीचे दाईं ओर से कम ऊँचाई पर स्थित सूरज की गर्म साइड लाइटिंग उसकी ड्रेस और पास के सूरजमुखी के फूलों के किनारों पर मज़बूत रिम लाइट बनाती है। 85mm f/1.8 पर शूट किया गया, शैलो डेप्थ ऑफ़ फ़ील्ड, Kodak Portra 400 फ़िल्म ग्रेन।"
इमेज प्रॉम्प्ट एक अवस्था का वर्णन करता है। वीडियो प्रॉम्प्ट एक घटना का वर्णन करता है। हर अतिरिक्त वाक्य सिर्फ़ रूप नहीं, टेम्पोरल व्यवहार को नियंत्रित करता है।
आम प्रॉम्प्ट गलतियाँ (और उनके सुधार)
ये वे पैटर्न हैं जो लगातार कमज़ोर वीडियो आउटपुट देते हैं, साथ में सुधरे हुए विकल्प।

गलती 1: कोई मोशन निर्देश नहीं
- गलत: "जंगल में एक टहनी पर एक चिड़िया।"
- सुधार: "एक टहनी पर बैठी एक छोटी चिड़िया अचानक पंख फैलाती है और उड़ान भरती है, कैमरा स्थिर रहता है जब वह धुंधले हरे कैनोपी के सामने फ़्रेम से बाहर उठती है।"
गलती 2: विरोधी स्टाइल संकेत
- खराब: "Photorealistic cinematic drone footage with an anime aesthetic."
- सुधार: एक स्टाइल चुनें। असंगत विज़ुअल भाषाएँ मिलाने से मॉडल का आउटपुट बँट जाता है और कोई भी स्टाइल ठीक से नहीं बनती।
गलती 3: बहुत ज़्यादा सब्जेक्ट
- गलत: "तीन लोग बात कर रहे हैं, एक कुत्ता दौड़ता हुआ निकलता है, एक कार हॉर्न बजाती है, और एक हवाई जहाज़ ऊपर से उड़ता है।"
- सुधार: एक मुख्य सब्जेक्ट, अधिकतम एक सहायक तत्व। "एक पार्क की बेंच पर बैठा एक आदमी अख़बार पढ़ रहा है, जबकि पृष्ठभूमि में एक कुत्ता टहलते हुए गुज़रता है।"
गलती 4: कोई एंड-स्टेट परिभाषित नहीं
- गलत: "फ़ायरप्लेस में जलती आग।" (मॉडल बस लूप करता रहता है।)
- सुधार: "पत्थर के फ़ायरप्लेस में लपटें धीमी होकर जल रही हैं। शॉट के दौरान एक बड़ा लट्ठा धीरे-धीरे पकड़ लेता है और आग तेज़ होती है, पत्थर के मेंटल पर और ज़्यादा तेज़ नारंगी रोशनी डालते हुए।"
गलती 5: सामान्य माहौल
- खराब: "Beautiful lighting."
- सुधार: "Soft directional light entering from a large window at upper left, casting one strong shadow across the floor, warm amber afternoon quality."
PicassoIA पर मॉडल-विशेष सुझाव
अलग-अलग मॉडल अलग प्रॉम्प्ट शैलियों पर प्रतिक्रिया देते हैं। जनरेट करने से पहले यह जान लें।

ByteDance का फ़्लैगशिप मॉडल सिनेमैटिक, कालक्रम वाली प्रॉम्प्ट संरचनाओं पर बहुत अच्छी प्रतिक्रिया देता है। इसकी अंतर्निहित ऑडियो समझ का मतलब है कि बारिश, भीड़ के शोर या परिवेशी ध्वनि का वर्णन करने वाले वातावरणीय प्रॉम्प्ट अक्सर सिंक्रोनाइज़्ड ऑडियो देते हैं। परिवेश को विस्तार से शामिल करें।
Google का Veo 3.1 ज़्यादातर मॉडलों से बेहतर तरीके से जटिल, बहु-तत्व वाले दृश्य संभालता है। यह स्पष्ट कैमरा मोशन भाषा से लाभ उठाता है और "establishing shot," "tracking shot," और "reaction shot" जैसे फ़िल्म-भाषा के शब्दों पर प्रतिक्रिया देता है। नैरेटिव सीक्वेंस के लिए मज़बूत।
Kling का v3 1080p सिनेमैटिक आउटपुट के लिए अनुकूलित है। बहुत विशिष्ट रोशनी वर्णन और सटीक सब्जेक्ट मोशन इस्तेमाल करें। यह धीमी, सोची-समझी गति को खास तौर पर अच्छी तरह संभालता है, और अराजक एक साथ होने वाली गतियों का वर्णन करने वाले प्रॉम्प्ट में इसे दिक्कत होती है।
Wan का 2.7 मॉडल मज़बूत स्थिरता के साथ 1080p टेक्स्ट-टू-वीडियो संभालता है। इसे विस्तृत पर्यावरण वर्णन से फ़ायदा होता है, और यह वास्तुकला व प्राकृतिक दृश्यों के विवरणों पर प्रतिक्रिया देता है। एस्टैब्लिशिंग शॉट और पर्यावरणीय कहानी कहने के लिए बेहतरीन।
Lightricks का यह मॉडल स्पीड और 4K आउटपुट को प्राथमिकता देता है। संक्षिप्त, बहुत विशिष्ट प्रॉम्प्ट इस्तेमाल करें। लंबे पैराग्राफ़ सिग्नल को कमज़ोर कर देते हैं। एक सब्जेक्ट, एक मोशन, एक वातावरण और एक रोशनी की स्थिति पर ध्यान दें।
Luma का Ray 2 फ़्लूइड, ऑर्गेनिक मोशन में खास तौर पर मज़बूत है। पानी, आग, हवा और जैविक विकास जैसी प्राकृतिक घटनाओं का वर्णन करने वाले प्रॉम्प्ट यहाँ असाधारण रूप से विश्वसनीय नतीजे देते हैं।
एक ढाँचा जो लगातार काम करता है
कई मॉडलों पर परखने के बाद, यह प्रॉम्प्ट संरचना भरोसेमंद नतीजे देती है:
[सब्जेक्ट + शुरुआती स्थिति/अवस्था] + [शॉट के दौरान सब्जेक्ट क्या करता है] + [कैमरा मूवमेंट] + [वातावरण/पृष्ठभूमि के विवरण] + [रोशनी का विनिर्देश] + [कैमरा/लेंस के विवरण] + [माहौल]
पूरे प्रॉम्प्ट के रूप में लिखा गया:
"गहरे बालों वाली एक युवा महिला लकड़ी की मेज़ पर बैठी है, ठोड़ी एक हाथ पर टिकी है, बारिश की लकीरों वाली खिड़की को एकटक देख रही है। शॉट के दौरान, वह धीरे-धीरे साँस छोड़ती है और उसके कंधे ढीले पड़ते हैं, फिर वह आगे बढ़कर अपने लैपटॉप की स्क्रीन बंद करती है। कैमरा उसके बाईं ओर से एक स्थिर मीडियम शॉट लेता है। उसके पीछे, एक बड़ी खिड़की के शीशे पर बारिश की बूँदें धुंधले धूसर शहर के दृश्य के सामने लकीरें बनाती हुई नीचे उतरती हैं। खिड़की से आती फैली हुई बादलों वाली रोशनी फ़्रेम को समान रूप से भरती है, मेज़ की सतह पर नरम परछाइयाँ डालती है। 50mm f/2.4 पर शूट किया गया, Kodak Portra 400 फ़िल्म ग्रेन, हल्की रूम टोन वाली गर्माहट।"
इतनी विशिष्टता किसी भी दृश्य के लिए लगभग दो से तीन मिनट में संभव है। यह जटिल नहीं है। बस स्थिर रूप से नहीं, टेम्पोरल रूप से सोचने की ज़रूरत है।
PicassoIA पर अभी आज़माएँ
PicassoIA एक ही जगह पर 87 से ज़्यादा टेक्स्ट-टू-वीडियो मॉडल होस्ट करता है, मुफ़्त और असीमित PicassoIA Video जनरेटर से लेकर Sora 2 Pro, Gen 4.5, Seedance 2.0 और Kling v2.6 तक।
ऊपर दिया ढाँचा इस्तेमाल करके शुरू करें। एक दृश्य चुनें। उसे पाँचों तत्वों के साथ पूरा लिखें। पहले ढाँचे की जाँच के लिए मुफ़्त मॉडल पर जनरेट करें, और जब मोशन और टाइमिंग सही लगने लगे, तब अपने पसंदीदा प्रीमियम मॉडल पर जाएँ।
पहला नतीजा परफ़ेक्ट नहीं होगा। लक्ष्य वह भी नहीं है। लक्ष्य यह समझना है कि अगला कौन सा तत्व बदलना है। AI वीडियो के लिए प्रॉम्प्ट लिखना एक ऐसा कौशल है जो तेज़ी से बढ़ता है, और PicassoIA पर फ़ीडबैक लूप इतना तेज़ है कि एक ही सत्र में कई बार सुधार किए जा सकते हैं।
आपका सबसे अच्छा वीडियो प्रॉम्प्ट किसी मामूली प्रॉम्प्ट से बस एक संशोधन दूर है। मॉडल इंतज़ार कर रहे हैं।