वीडियो जनरेशन MCP सर्वर: एक ही चैट में Veo, Kling और Seedance
वीडियो जनरेशन MCP सर्वर की मदद से आप टैब बदले बिना एक ही चैट में Veo, Kling और Seedance से क्लिप बनवा सकते हैं। यह लेख बताता है कि टूल, एसिंक जॉब और पोलिंग कैसे काम करते हैं, कौन-सा मॉडल किस शॉट के लिए सही है, किन सीमाओं की उम्मीद रखें, और ऐसे प्रॉम्प्ट कैसे लिखें जो पहले रेंडर में ही काम कर जाएँ।
आपके पास एक Veo टैब खुला है, दूसरी विंडो में Kling टैब है, और एक Seedance टैब है जिसे आप बंद करना भूल गए, और जो शॉट आप ढूँढ रहे हैं वह इन तीनों में से किसी में भी हो सकता है। हर जनरेटर का अपना प्रॉम्प्ट फ़ॉर्मैट, अपना सेटिंग्स पैनल और अपना डाउनलोड बटन होता है। एक वीडियो जनरेशन MCP सर्वर इस दिनचर्या को एक चैट में टाइप किए गए एक वाक्य से बदल देता है: आप क्लिप का वर्णन करते हैं, असिस्टेंट मॉडल चुनता है, जॉब सबमिट करता है, उसकी स्थिति देखता है और आपको एक लिंक सौंप देता है। यह लेख बताता है कि यह सेटअप कैसे काम करता है, Veo 3.1, Kling v3 Video और Seedance 2.5 Lite में से हर एक किसमें सबसे अच्छा है, और ऐसे प्रॉम्प्ट कैसे लिखें जो पहले रेंडर में ही काम कर जाएँ।
पाँच टैब से बेहतर एक चैट क्यों है
टैब बदलने का बोझ
टूल बदलना तब तक हानिरहित लगता है जब तक आप कदम गिनना शुरू न करें। आप एक साइट पर प्रॉम्प्ट कॉपी करते हैं, इंतज़ार करते हैं, फ़ाइल डाउनलोड करते हैं, उसका नाम बदलते हैं, अगली साइट खोलते हैं, पेस्ट करते हैं, फिर पता चलता है कि दूसरे मॉडल को ऑडियो अलग तरीके से समझाना होगा, और दोबारा लिखते हैं। तीसरी कोशिश तक आपको याद नहीं रहता कि कौन-सा सीड किस क्लिप से आया था, और आपके डेस्कटॉप का फ़ोल्डर "final_v2_really" जैसे नामों वाली फ़ाइलों का ढेर बन जाता है।
चैट इस स्थिति को पलट देती है। बातचीत खुद प्रोजेक्ट फ़ाइल बन जाती है: हर प्रॉम्प्ट, हर सेटिंग और हर परिणाम का लिंक एक ही स्क्रॉल में रहता है, जिसे बाद में खोजा जा सकता है। असिस्टेंट एक ही क्रिएटिव ब्रीफ़ को तीन मॉडल-विशिष्ट प्रॉम्प्ट में भी बदल सकता है, और यही वह उबाऊ हिस्सा है जिसे कोई हाथ से करना पसंद नहीं करता।
MCP असल में क्या करता है
Model Context Protocol एक ओपन स्टैंडर्ड है, जिसे Anthropic ने 2024 के अंत में पेश किया था। यह चैट ऐप को बाहरी टूल्स से एक तय तरीके से बात करने देता है। सर्वर टूल्स की एक सूची बताता है। हर टूल का एक नाम होता है, सादी भाषा में एक विवरण होता है, और एक JSON स्कीमा होता है जो बताता है कि उसे कौन-से इनपुट चाहिए। चैट ऐप यह सूची मॉडल को दिखाता है, मॉडल तय करता है कि कौन-सा टूल फ़िट बैठता है, और ऐप कॉल को सर्वर तक पहुँचाता है और परिणाम वापस बातचीत में डाल देता है।
सर्वर स्थानीय रूप से stdio पर या दूर से HTTP पर चल सकते हैं, इसलिए वीडियो सर्वर आपके लैपटॉप पर एक छोटी प्रक्रिया हो सकता है या एक होस्टेड एंडपॉइंट जिसे आप एक बार जोड़ लेते हैं। चैट के नज़रिए से, "रात के बाज़ार में एक कुक की पाँच सेकंड की क्लिप बनाओ" एक अस्पष्ट इच्छा नहीं रहती, बल्कि एक संरचित कॉल बन जाती है, जिसमें प्रॉम्प्ट, अवधि और रिज़ॉल्यूशन शामिल होते हैं।
💡 टिप: टूल के विवरण लोगों की उम्मीद से कहीं ज़्यादा मायने रखते हैं। मॉडल इन्हें पढ़कर तय करता है कि कौन-सा टूल कॉल करना है, इसलिए "टेक्स्ट प्रॉम्प्ट से वीडियो बनाएँ" लिखने वाला सर्वर "run job" लिखने वाले सर्वर से कहीं ज़्यादा भरोसेमंद तरीके से इस्तेमाल होता है।
सर्वर वीडियो जॉब को कैसे संभालता है
टूल, स्कीमा और पोलिंग
PicassoIA कनेक्टर एक अच्छा ठोस उदाहरण है, क्योंकि इसकी टूल सूची छोटी और पढ़ने में आसान है। इस लेख के लिखे जाने के समय इसमें ये टूल हैं:
वे मॉडल सूचीबद्ध करता है जो आपका अकाउंट इस्तेमाल कर सकता है
get_account
आपका प्लान और पैरलल सीमाएँ लौटाता है
cancel_generation
जॉब रद्द करता है, जब तक GPU पहले से वीडियो रेंडर न कर रहा हो
हर जनरेट टूल जैसे ही कोई GPU जॉब स्वीकार करता है, एक predict_id लौटाता है, साथ में अनुमानित समय भी। इसके बाद आप सुझाए गए इंतज़ार के बाद get_generation कॉल करते हैं, और हर इंतज़ार के बाद फिर से, जब तक स्थिति succeeded या failed न दिखाने लगे। failure अंतिम होता है, इसलिए असिस्टेंट उसी जॉब को दोबारा कोशिश करने के बजाय नया जनरेशन सबमिट करता है।
वीडियो को एसिंक जॉब की ज़रूरत क्यों है
टेक्स्ट-टू-इमेज कॉल कुछ सेकंड में लौट आती है। वीडियो ऐसा नहीं करता। मॉडल पेज के उदाहरण रेंडर इसका अंदाज़ा देते हैं: Veo 3.1 के उदाहरण लगभग एक से दो मिनट में बने, Seedance 2.5 Lite के उदाहरण लगभग दो से तीन मिनट में, और Kling v3 Video के उदाहरण लंबाई और सेटिंग्स के हिसाब से लगभग पाँच से अठारह मिनट तक चले। कोई चैट टूल कॉल इतनी देर तक नहीं रुक सकती।
इसलिए सर्वर एक टिकट लौटा देता है और असिस्टेंट को उसकी जाँच करने देता है। इसी वजह से क्लिप रेंडर होते समय भी आपकी चैट चलती रहती है: पहली क्लिप पकने के दौरान अगले शॉट का प्रॉम्प्ट माँग सकते हैं।
एक सेशन कैसा दिखता है
सर्वर कनेक्ट होने के बाद एक यथार्थवादी बातचीत कुछ ऐसी होती है:
आप टाइप करते हैं: "शाम के बाज़ार में एक कुक नूडल्स उछालते हुए, गर्म बल्ब, चटचटाने की आवाज़ के साथ 5 सेकंड की 16:9 क्लिप बनाएँ।"
असिस्टेंट वीडियो टूल चुनता है, प्रॉम्प्ट, अवधि और रिज़ॉल्यूशन भरता है, और सबमिट करता है।
सर्वर एक predict_id और अनुमानित समय लौटाता है।
असिस्टेंट सुझाया गया अंतराल इंतज़ार करता है, get_generation कॉल करता है, देखता है कि जॉब अभी भी प्रोसेस हो रहा है, और फिर इंतज़ार करता है।
स्थिति succeeded में बदल जाती है, और असिस्टेंट चैट में MP4 लिंक पोस्ट करता है।
आप कहते हैं "वही शॉट, पर कुक कैमरे की ओर देखता है", और असिस्टेंट वही सीड और बदली हुई मोशन लाइन के साथ दोबारा सबमिट करता है।
पूरा लूप एक ही विंडो में रहता है, और इसमें आपको कोई API रेफ़रेंस पढ़ने की ज़रूरत नहीं पड़ती।
एक समय में पाँच जॉब
PicassoIA का API डॉक्यूमेंटेशन हर अकाउंट के लिए 5 एक साथ चलने वाले प्रेडिक्शन बताता है, जो आपके API एक्सेस और MCP कनेक्शन में साझा होते हैं। आठ शॉट के स्टोरीबोर्ड का मतलब है कि असिस्टेंट पाँच सबमिट करे, उनकी पोलिंग करे, और स्लॉट खाली होते ही बाकी को कतार में रखे। आप इसे साफ़ शब्दों में कह सकते हैं: "शॉट्स को पाँच-पाँच के बैच में चलाएँ और हर लिंक तैयार होते ही पोस्ट करें।"
तीन मॉडल, तीन ताकतें
कोई एक मॉडल हर शॉट नहीं जीतता, और यही असली तर्क है कि एक चैट के पीछे कई मॉडल क्यों रखे जाएँ। मॉडल पेज बताते हैं कि हर एक किसके लिए बना है।
जब रियलिज़्म और ध्वनि मायने रखें
Veo 3.1 टेक्स्ट प्रॉम्प्ट को संदर्भ-सचेत ऑडियो के साथ 1080p फ़ुटेज में बदलता है, ताकि खटखट, हवा या आवाज़ें तस्वीर से मेल खाते हुए आएँ। क्लिप 16:9 या 9:16 में 4, 6 या 8 सेकंड की चलती हैं। आप दो पलों के बीच इंटरपोलेट करने के लिए पहला फ़्रेम और आखिरी फ़्रेम सेट कर सकते हैं, या शॉट्स के बीच किसी सब्जेक्ट को एक जैसा रखने के लिए तीन रेफ़रेंस इमेज तक दे सकते हैं। एक नेगेटिव प्रॉम्प्ट फ़ील्ड आपको वे चीज़ें बाहर रखने देता है जो नहीं चाहिए। एक तेज़ वर्ज़न, Veo 3.1 Fast, जल्दी ड्राफ़्ट के लिए मौजूद है।
इसे तब चुनें जब शॉट कोई विश्वसनीय वास्तविक दुनिया का पल हो: तटीय सड़क पर एक कार, कैफ़े में बातचीत, या प्राकृतिक परिवेश ध्वनि के साथ मेज़ पर रखा कोई प्रोडक्ट।
जब मल्टी-शॉट कंट्रोल चाहिए
Kling v3 Video लंबे फ़ॉर्मैट का विकल्प है। यह 15 सेकंड तक की क्लिप बनाता है और मल्टी-शॉट स्क्रिप्टिंग सपोर्ट करता है: आप एक ही जनरेशन में 6 दृश्य तक परिभाषित कर सकते हैं, हर एक का अपना प्रॉम्प्ट और अवधि के साथ। स्टैंडर्ड मोड 720p रेंडर करता है और प्रो मोड 1080p। आप इमेज से पहला और आखिरी फ़्रेम पिन कर सकते हैं, 16:9, 9:16 या 1:1 चुन सकते हैं, और नेगेटिव प्रॉम्प्ट जोड़ सकते हैं। ऑडियो जनरेशन एक स्विच है जो डिफ़ॉल्ट रूप से बंद रहता है, इसलिए जब आपको साउंड चाहिए तो चैट से उसे चालू करने को कहें।
जब किसी क्लिप में छोटा सा आर्क चाहिए, जैसे वाइड शॉट, क्लोज़-अप और रिएक्शन, और आप तीन अलग फ़ाइलों को जोड़ना नहीं चाहते, तो यही मॉडल इस्तेमाल करें। इस समूह में सबसे लंबा इंतज़ार इसी का होगा।
जब तेज़ इटरेशन चाहिए
Seedance 2.5 Lite मात्रा के लिए बना है। यह 480p या 720p पर 5 या 10 सेकंड की क्लिप बनाता है, डिफ़ॉल्ट रूप से सिंक्रनाइज़्ड ऑडियो के साथ, टेक्स्ट से या शुरुआती इमेज से, और इसमें एक सीड दिया जा सकता है, जिसे किसी परिणाम को दोहराने के लिए लॉक किया जा सके। इसका मॉडल पेज इसे Wonder सदस्यों के लिए असीमित बताता है, इसलिए दोपहर के खाने से पहले दस प्रॉम्प्ट वैरिएशन आज़माने के लिए यह स्वाभाविक मॉडल है। जब और चाहिए तो बड़े वर्ज़न भी मौजूद हैं: Seedance 2.5 30 सेकंड तक की क्लिप के साथ सूचीबद्ध है, और Seedance 2.0 बिल्ट-इन ऑडियो के साथ टेक्स्ट-टू-वीडियो देता है।
हर शॉट के लिए सही मॉडल चुनना
स्पेक्स को साथ-साथ रखें तो रूटिंग के फ़ैसले आसान हो जाते हैं। रेंडर समय हर मॉडल पेज के उदाहरण जनरेशन से लिए गए हैं, इसलिए इन्हें अनुमान मानें, वादा नहीं।
💡 टिप: तेज़ मॉडल में ड्राफ़्ट बनाएँ, धीमे में फ़िनिश करें। तेज़ इटरेशन से विचार, फ़्रेमिंग और मोशन तय करें, फिर लंबे रेंडर उन शॉट्स पर खर्च करें जिन्हें आप पहले ही मंज़ूर कर चुके हैं।
कच्चा क्लिप शायद ही कभी आखिरी कदम होता है। PicassoIA वीडियो एडिटिंग, वीडियो अपस्केलिंग और विज़ुअल इफ़ेक्ट्स की एक बड़ी सूची भी देता है, जहाँ जनरेटर अपना काम करने के बाद आप स्टाइलाइज़्ड लुक या क्लीन-अप पास जोड़ते हैं। पूरी सूची picassoia.com/en/all-models पर है।
ऐसे प्रॉम्प्ट लिखें जिन्हें चैट दोबारा इस्तेमाल कर सके
शॉट लिस्ट विशेषणों से बेहतर है
Seedance 2.5 Lite का मॉडल पेज कहता है कि सिनेमैटिक, कालक्रम के हिसाब से लिखे वर्णन सबसे अच्छा काम करते हैं, और यही आदत हर वीडियो मॉडल में मदद करती है। जो होता है उसे क्रम में लिखें, ठीक वैसे जैसे कोई डायरेक्टर शॉट लिस्ट पढ़ता है, और "महाकाव्य" व "शानदार" जैसे विशेषण जमा न करें। मॉडल विशेषण को फ़िल्म नहीं कर सकता, लेकिन वह एक ऐसे कुक को फ़िल्म कर सकता है जो एक बार नूडल्स उछालता है जबकि लपटें भड़कती हैं।
एक काम करने वाला प्रॉम्प्ट टेम्पलेट
चार पंक्तियों का ढाँचा प्रॉम्प्ट को एक जैसा रखता है, जब असिस्टेंट उन्हें अलग-अलग मॉडल के लिए दोबारा लिखता है:
Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.
भरा हुआ रूप कुछ ऐसा दिखता है:
एक स्ट्रीट-फ़ूड कुक, कैनवस एप्रन में, गैस की लौ पर वोक थामे हुए है। वह नूडल्स को एक बार उछालता है, लपटें भड़कती हैं, भाप कैमरे की ओर लुढ़कती है। छाती की ऊँचाई से धीमा पुश-इन। ऊपर गर्म बल्ब, चटचटाता तेल और बाज़ार का शोर।
फिर चैट से इसे हर मॉडल के हिसाब से ढालने को कहें। Veo 3.1 के लिए आवाज़ साफ़ लिखें, क्योंकि ऑडियो प्रॉम्प्ट का पालन करता है। Kling v3 Video के लिए बीट्स को दृश्यों में बाँटें और शॉट की अवधियों का योग कुल अवधि के बराबर रखें, हर शॉट कम से कम एक सेकंड का हो। Seedance 2.5 Lite के लिए इसे एक बहते हुए पैराग्राफ़ में रखें और परिणाम पसंद आने पर सीड लॉक कर दें।
अगर आपका चैट मॉडल शॉट के वर्णन में कमज़ोर है, तो प्रॉम्प्ट Claude Sonnet 5 या Gemini 3.5 Flash जैसे बेहतर लेखक से ड्राफ़्ट करवाएँ और नतीजा बातचीत में पेस्ट कर दें।
कमज़ोर पहला रेंडर ठीक करना
एक बार में एक ही चर बदलें। पहले सीड लॉक करें, फिर सिर्फ़ मोशन लाइन बदलें। कुछ आदतें घंटों बचाती हैं:
सब्जेक्ट खिसकता है: एक पहला-फ़्रेम इमेज दें, ताकि मॉडल एक तय लुक से शुरू करे।
अनचाही चीज़ें दिखती हैं: वह नेगेटिव प्रॉम्प्ट फ़ील्ड इस्तेमाल करें जो Veo 3.1 और Kling v3 Video दोनों देते हैं।
क्लिप भरी-भरी लगती है: उसे छोटा करें। एक क्रिया वाली पाँच सेकंड की क्लिप तीन क्रियाओं वाली दस सेकंड की क्लिप से बेहतर है।
💡 टिप: टूल्स को जोड़ें। इमेज टूल से एक स्टिल बनाएँ, फ़्रेमिंग मंज़ूर करें, फिर उस इमेज को पहले फ़्रेम के रूप में दें, ताकि वीडियो वहीं से शुरू हो जहाँ से आप चाहते हैं।
Seedance 2.5 Lite व्यावहारिक पहला पड़ाव है, क्योंकि यह तेज़ है, डिफ़ॉल्ट रूप से ऑडियो संभालता है और कनेक्टर के दो वीडियो टूल्स में से एक है। PicassoIA पर प्रवाह यह है:
Seedance 2.5 Lite पेज खोलें, या चैट से generate_video_seedance कॉल करने को कहें।
ऊपर दिए चार-पंक्ति टेम्पलेट का इस्तेमाल करते हुए कालक्रम के हिसाब से प्रॉम्प्ट लिखें।
5 या 10 सेकंड की अवधि चुनें। परीक्षण के दौरान 5 रखें।
रिज़ॉल्यूशन चुनें। 480p सबसे तेज़ रेंडर होता है और ड्राफ़्ट के लिए ठीक है, 720p ज़्यादा शार्प है और उस संस्करण के लिए है जिसे आप रखेंगे।
आस्पेक्ट रेशियो चुनें, या शुरुआती फ़्रेम के रूप में इमेज अपलोड करें। इमेज के साथ क्लिप इमेज से मेल खाती है और रेशियो सेटिंग को नज़रअंदाज़ करती है।
save audio चालू रखें, जब तक आपको साइलेंट क्लिप न चाहिए।
बाद में परिणाम दोहराना हो तो seed सेट करें।
सबमिट करें, जॉब succeed होने तक पोल करें, और लौटाया गया लिंक खोलें।
सेटिंग
विकल्प
कब बदलें
अवधि
5 या 10 सेकंड
एक्शन को जगह चाहिए तो 10 पर जाएँ
रिज़ॉल्यूशन
480p या 720p
ड्राफ़्ट के लिए 480p, रखने लायक शॉट्स के लिए 720p
आस्पेक्ट रेशियो
16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3
उस प्लेटफ़ॉर्म से मिलाएँ जहाँ आप पोस्ट करते हैं
इनपुट इमेज
वैकल्पिक
पहले फ़्रेम का लुक तय करें
आखिरी फ़्रेम इमेज
वैकल्पिक, इनपुट इमेज चाहिए
शॉट कैसे खत्म होता है, यह नियंत्रित करें
Seed
कोई भी इंटीजर
परिणाम दोहराएँ या टेक की तुलना करें
Save audio
चालू या बंद
साइलेंट B-roll के लिए बंद
Veo और Kling के लिए वही प्रवाह
कुछ बदलावों के साथ कदम वही रहते हैं। Veo 3.1 पर 4, 6 या 8 सेकंड और 720p या 1080p चुनें। रेफ़रेंस इमेज केवल 16:9 और 8 सेकंड के साथ काम करती हैं, और रेफ़रेंस मौजूद होने पर आखिरी फ़्रेम नज़रअंदाज़ हो जाता है। Kling v3 Video पर स्टैंडर्ड (720p) या प्रो (1080p) मोड चुनें, ऑडियो चालू करें, प्रॉम्प्ट को 2,500 अक्षरों के भीतर रखें, और जब कई दृश्य चाहिए तो मल्टी-शॉट सूची जोड़ें।
सीमाएँ जिनके लिए योजना बनानी होगी
कतार, रीट्राई और failure
पैरलल सीमा: हर अकाउंट के लिए 5 एक साथ चलने वाले प्रेडिक्शन, कनेक्शनों में साझा। अपने बैच पाँच-पाँच के हिसाब से बनाएँ।
अंतिम failure: failed जॉब की पोलिंग करने से वह वापस नहीं आएगा। असिस्टेंट को नया जॉब सबमिट करना चाहिए, आदर्श रूप से सरल प्रॉम्प्ट के साथ।
प्रॉम्प्ट का आकार: PicassoIA API 4,000 अक्षर तक के प्रॉम्प्ट लेता है, और Kling v3 Video अपने प्रॉम्प्ट को 2,500 पर सीमित करता है, इसलिए पहले छोटा संस्करण लिखें।
रद्द करना: जॉब तब तक रद्द किया जा सकता है जब तक GPU वीडियो रेंडर करना शुरू न करे। उसके बाद वह अंत तक चलता है।
कनेक्टर क्या नहीं करता
दायरे पर एक ईमानदार वाक्य ज़रूरी है। इस लेख के लिखे जाने के समय, PicassoIA कनेक्टर चार मॉडल सूचीबद्ध करता है: एक इमेज जनरेटर, एक इमेज एडिटर, PicassoIA Video और Seedance 2.5 Lite। Veo 3.1 और Kling v3 Video PicassoIA साइट से चलते हैं, और उन्हें उसी चैट में लाने के लिए आपको अपना MCP सर्वर बनाना होगा जो उनके प्रोवाइडर API को रैप करे।
अपने अकाउंट में list_models चलाकर देखें कि आज क्या उपलब्ध है, और किसी वर्कफ़्लो को उन पर बनाने से पहले picassoia.com/en/pricing देखें कि कौन-से प्लान MCP कनेक्शन शामिल करते हैं।
आज ही अपनी पहली क्लिप बनाएँ
एक ऐसा शॉट चुनें जिसे आप आमतौर पर फ़िल्माते या स्टॉक फ़ुटेज के रूप में खरीदते, उसे चार-पंक्ति वाले प्रॉम्प्ट में लिखें, और तीनों मॉडल से चलाएँ। तेज़ ड्राफ़्ट के लिए पहले Seedance 2.5 Lite रखें, मंज़ूर किया गया संस्करण यथार्थवादी साउंड के लिए Veo 3.1 को भेजें या मल्टी-शॉट कट के लिए Kling v3 Video को, और नतीजों की साथ-साथ तुलना करें। एक दोपहर में आप जान जाएँगे कि आपकी शैली किस मॉडल की ओर झुकती है।
यह सब आप Picasso IA पर आज़मा सकते हैं। किसी इमेज मॉडल से एक स्टिल बनाएँ, उसे पहले फ़्रेम के रूप में इस्तेमाल करें, और उसे चलते हुए देखें। पूरी कैटलॉग picassoia.com/en/all-models पर ब्राउज़ करें और आज रात ही अपना पहला प्रॉम्प्ट चलाएँ।