Veo 3.1 MCP सर्वर: Claude और Gemini में Veo वीडियो जनरेट करें

एक Veo 3.1 MCP सर्वर Claude और Gemini को Google वीडियो रेंडर शुरू करने, जॉब की स्थिति जाँचने और MP4 आपके लिए सेव करने देता है। असली टूल नाम, Claude Desktop, Claude Code और Gemini CLI के कॉन्फ़िग ब्लॉक, प्रति सेकंड कीमतें और बेहतर क्लिप देने वाले प्रॉम्प्ट पैटर्न देखें।

Veo 3.1 MCP सर्वर: Claude और Gemini में Veo वीडियो जनरेट करें
Cristian Da Conceicao
Picasso IA के संस्थापक

Claude में एक वाक्य टाइप करके साउंड के साथ तैयार वीडियो वापस पाना अब कोई लैब का चमत्कार नहीं है। Veo 3.1 MCP सर्वर के साथ यह एक सामान्य टूल कॉल है: आपका क्लाइंट प्रॉम्प्ट को Google के वीडियो मॉडल तक भेजता है, क्लिप रेंडर होने तक इंतज़ार करता है और MP4 को उस फ़ोल्डर में सेव करता है जो आपने चुना है। पेंच यह है कि कुछ भी अपने-आप, बिना सेटअप के नहीं चलता। आप एक सर्वर चुनते हैं, उसे Claude या Gemini से जोड़ते हैं, और पहली रेंडर से पहले बिलिंग जाँचते हैं ताकि आपका बजट एक झटके में खत्म न हो जाए।

यह लेख असली टूल नामों, असली कॉन्फ़िग ब्लॉक और असली प्रति सेकंड कीमतों के साथ उस सेटअप को समझाता है, और फिर PicassoIA पर बिना कॉन्फ़िग वाला विकल्प दिखाता है। थर्ड-पार्टी सर्वरों की सारी जानकारी उनके सार्वजनिक READMEs और लिस्टिंग से ली गई है, इसलिए इसे टेस्ट रिपोर्ट नहीं, पढ़ने की सूची समझें।

लैपटॉप पर टाइप करते हाथ, स्क्रीन पर रुका हुआ समुद्र का वीडियो फ़्रेम

Veo MCP सर्वर क्या करता है

MCP, यानी Model Context Protocol, वह ओपन स्टैंडर्ड है जो AI क्लाइंट को बाहरी टूल कॉल करने देता है। Veo MCP सर्वर एक छोटा प्रोग्राम है जो वीडियो जनरेशन को कुछ टूल के रूप में उपलब्ध कराता है। आपका क्लाइंट इसे एक लोकल प्रोसेस के रूप में चलाता है, टूल की सूची पढ़ता है और जब आप क्लिप माँगते हैं तब उन टूल को कॉल करता है।

Gemini API को सीधे क्यों न कॉल करें? कर सकते हैं, और एक छोटी Python स्क्रिप्ट यह काम कर देती है। MCP सर्वर तब काम का होता है जब आप चाहते हैं कि बातचीत ही काम चलाए। Claude शॉट लिस्ट बनाता है, सेटिंग चुनता है, रेंडर शुरू करता है, उसकी स्थिति देखता है और बताता है कि फ़ाइल कहाँ सेव हुई, यह सब एक ही थ्रेड में।

ओक की शेल्फ़ पर एक छोटा फ़ैनलेस मिनी कंप्यूटर और एक इथरनेट केबल

तीन मुख्य हिस्से

आप कोई भी सर्वर चुनें, हर सेटअप में ये तीन परतें एक जैसी होती हैं।

हिस्साउदाहरणकाम
क्लाइंटClaude Desktop, Claude Code, Gemini CLIआपका अनुरोध लेता है और तय करता है कि कौन सा टूल कॉल करना है
सर्वरuvx से चलने वाला एक Python पैकेजटूल कॉल को Gemini API रिक्वेस्ट में बदलता है
मॉडलVeo 3.1वीडियो और उसका ऑडियो रेंडर करता है

सर्वर आपका Google क्रेडेंशियल रखता है, इसलिए यही हिस्सा सबसे ज़्यादा जाँच का हकदार है।

वीडियो को async टूल की ज़रूरत क्यों है

टेक्स्ट का जवाब कुछ सेकंड में आ जाता है। वीडियो नहीं आता। एक सर्वर के README में प्रॉम्प्ट के हिसाब से रेंडर समय 11 सेकंड से 6 मिनट तक बताया गया है, और एक दूसरा सर्वर जॉब को बैकग्राउंड में शुरू करता है, एक job ID लौटाता है और क्लाइंट को हर 15 से 20 सेकंड में पोल करने को कहता है। यह पैटर्न मायने रखता है, क्योंकि चैट क्लाइंट लंबे समय तक लटके टूल कॉल से हार मान लेते हैं।

💡 अगर कोई सर्वर वीडियो खत्म होने तक रुका रहता है, तो लंबी रेंडर पर टाइमआउट की उम्मीद रखें। ऐसे सर्वर चुनें जिनमें एक टूल जॉब शुरू करे और दूसरा उसकी स्थिति जाँचे।

कम्युनिटी सर्वर और उनके टूल

Google, Gemini API के ज़रिए Veo उपलब्ध कराता है, और कम्युनिटी ने इसे कई MCP सर्वर में लपेट दिया है। इनमें से कोई भी Google या PicassoIA ने नहीं बनाया है। नीचे दी गई जानकारी GitHub पर मौजूद alohc सर्वर, Gemini Media MCP की लिस्टिंग, visualgen mcp और AceDataCloud के mcp-veo से ली गई है।

शहर के अपार्टमेंट में शाम को चौड़े मॉनिटर पर कोड पढ़ता दाढ़ी वाला डेवलपर

आपको दिखने वाले टूल

सर्वरटूलसीमाएँ
alohc veo-mcp-servergenerate_video, animate_image, extend_video_clip, generate_video_with_style, list_veo_models4, 6 या 8 सेकंड, 720p या 1080p, 16:9 या 9:16
Gemini Media MCPveo_generate_video, veo_image_to_video, veo_interpolate_video, veo_extend_video, veo_check_job, veo_list_jobs और तीन यूटिलिटी टूल720p, 1080p या 4K, 1 से 4 वीडियो के बैच
visualgen mcpएक इमेज जनरेटर और लाइट, फ़ास्ट व स्टैंडर्ड टियर में Veo 3.1720p से 4K तक, वैकल्पिक इमेज-टू-वीडियो
mcp-veo (AceDataCloud)टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, 1080p अपस्केलिंग, टास्क ट्रैकिंगAceDataCloud API के ज़रिए चलता है, सीधे Google से नहीं

तीन तरह के टूल हर जगह दोहराए जाते हैं: टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और एक्सटेंशन। एक्सटेंशन किसी मौजूदा क्लिप में लगभग 7 सेकंड जोड़ता है, लेकिन एक README इसे 720p और कुल 148 सेकंड तक सीमित करता है, और Veo 3.1 Lite एक्सटेंशन को बिल्कुल सपोर्ट नहीं करता।

alohc सर्वर का डिफ़ॉल्ट मॉडल veo-3.1-generate-preview है, और Gemini Media MCP सर्वर स्टैंडर्ड और फ़ास्ट वर्ज़न देता है। जब कोई सर्वर आपको नाम से मॉडल चुनने देता है, तो वह चुनाव अपने प्रॉम्प्ट में लिख दें ताकि क्लाइंट अंदाज़ा न लगाए।

ऐसा सर्वर चुनें जिसे आप जाँच सकें

ये प्रोग्राम आपकी मशीन पर आपके Google क्रेडेंशियल के साथ चलते हैं। किसी को इंस्टॉल करने से पहले:

  • सोर्स कोड पढ़ें, क्योंकि इनमें से हर एक इतना छोटा है कि जल्दी देखा जा सके।
  • नवीनतम रिलीज़ को ट्रैक करने के बजाय एक वर्ज़न पिन करें।
  • इसके लिए एक अलग Google क्रेडेंशियल बनाएँ, ताकि बिना कुछ तोड़े उसे रद्द कर सकें।
  • बिलिंग अकाउंट पर बजट अलर्ट सेट करें, क्योंकि लूप में फँसा प्रोग्राम वीडियो के हर सेकंड के हिसाब से बिल होता है।

Veo को Claude से जोड़ें

Claude दो तरीकों से MCP सर्वरों तक पहुँचता है: Claude Desktop एक JSON कॉन्फ़िग फ़ाइल से, और Claude Code एक कमांड से। दोनों एक ही सर्वर पैकेज चलाते हैं।

संगमरमर की कैफ़े टेबल पर स्ट्रीट की खिड़की के पास लैपटॉप पर काम करती महिला

Claude Desktop सेटअप

  1. uv इंस्टॉल करें, वह Python रनर जो uvx देता है।
  2. Claude Desktop में Settings खोलें, फिर Developer, फिर Edit Config।
  3. इस जैसा एक सर्वर ब्लॉक जोड़ें:
{
  "mcpServers": {
    "veo": {
      "command": "uvx",
      "args": ["veo-mcp-server"],
      "env": {
        "VIDEO_OUTPUT_DIR": "./videos"
      }
    }
  }
}
  1. अपना Gemini क्रेडेंशियल उसी env ब्लॉक में जोड़ें, उस वेरिएबल नाम के साथ जो आपके चुने हुए README में लिखा है।
  2. Claude Desktop को पूरी तरह बंद करके फिर से खोलें। Veo टूल टूल मेन्यू में दिखने चाहिए।

💡 आउटपुट फ़ोल्डर वेरिएबल हर सर्वर में अलग होते हैं। एक README VIDEO_OUTPUT_DIR इस्तेमाल करता है, दूसरा VEO_OUTPUT_DIR। वही नाम कॉपी करें जो आपने इंस्टॉल किए प्रोजेक्ट में दिया है।

अगर टूल न दिखें, तो पहले JSON को वैलिडेट करें, क्योंकि एक अतिरिक्त ट्रेलिंग कॉमा पूरी फ़ाइल तोड़ देता है। फिर जाँचें कि uvx आपके PATH पर है और आपने विंडो बंद करने की बजाय ऐप को सचमुच बंद किया है।

Claude Code सेटअप

एक कमांड उस सर्वर को हर उस प्रोजेक्ट के लिए रजिस्टर कर देता है जो आप खोलते हैं:

claude mcp add veo -s user -- uvx veo-mcp-server

अपना क्रेडेंशियल -e फ़्लैग से दें, फिर /mcp चलाकर पक्का करें कि सर्वर connected दिख रहा है। इसके बाद "ट्रेन की खिड़की पर बारिश की 6 सेकंड की वर्टिकल क्लिप बनाएँ, बिना म्यूज़िक के, फिर बताएँ फ़ाइल कहाँ सेव हुई" जैसा प्रॉम्प्ट एक स्टार्ट कॉल, कई स्टेटस चेक और आख़िर में फ़ाइल पाथ देता है। पहली बार 720p पर 4 सेकंड की क्लिप माँगें, ताकि गलत कॉन्फ़िग या अस्पष्ट प्रॉम्प्ट की कीमत डॉलर नहीं, सेंट्स में चुकानी पड़े।

Veo को Gemini से जोड़ें

आपके पास दो रास्ते हैं। Gemini CLI वही MCP सर्वर लोड कर सकता है, और Gemini ऐप खुद Veo क्लिप बना सकता है।

डेस्क का ऊपर से दृश्य, लैपटॉप के बगल में फ़ोन पर तटरेखा का वीडियो चल रहा है

Gemini CLI कॉन्फ़िग

Gemini CLI ~/.gemini/settings.json पढ़ता है और सर्वर mcpServers ऑब्जेक्ट के अंदर उम्मीद करता है, वही शेप जो Claude इस्तेमाल करता है:

{
  "mcpServers": {
    "veo": {
      "command": "uvx",
      "args": ["veo-mcp-server"],
      "env": {
        "VIDEO_OUTPUT_DIR": "./videos"
      }
    }
  }
}

क्रेडेंशियल वेरिएबल यहाँ भी जोड़ें, CLI को रीस्टार्ट करें और /mcp चलाकर देखें कि उसने कौन से टूल लोड किए हैं। Gemini CLI SSE और HTTP streaming सर्वर भी स्वीकार करता है, इसलिए होस्टेड सर्वर भी चलेगा, बशर्ते वह भरोसेमंद हो।

अगर रेंडर पर पैसे खर्च करने से पहले आप चैट मॉडल से शॉट लिस्ट बनवाना चाहते हैं, तो Gemini 3.5 Flash कच्चे ड्राफ़्ट के लिए तेज़ है और Gemini 3.1 Pro लंबी स्क्रिप्ट के लिए ठीक है।

MCP के बिना Gemini ऐप

Gemini ऐप समर्थित प्लान पर सीधे Veo वीडियो भी बना सकता है। यह रास्ता एक-बार की क्लिप के लिए ठीक है। इसमें न स्क्रिप्टिंग है, न बैच रन और न ऐसा फ़ाइल पाथ जिस पर आपका नियंत्रण हो। जैसे ही आपको दोहराने लायक आउटपुट चाहिए, MCP ही बेहतर विकल्प है।

बेहतर क्लिप देने वाले प्रॉम्प्ट

Veo 3.1 16:9 या 9:16 में 4, 6 या 8 सेकंड की क्लिप बनाता है, और ऑडियो तस्वीर के साथ-साथ जेनरेट होता है। यह नेगेटिव प्रॉम्प्ट, सीड, 3 तक रेफ़रेंस इमेज और पहला व आख़िरी फ़्रेम स्वीकार करता है। PicassoIA पर मॉडल के अपने उदाहरण संवाद और कमरे की आवाज़ सीधे प्रॉम्प्ट में लिखते हैं, इसलिए प्रॉम्प्ट को टैग की सूची नहीं, स्क्रिप्ट समझें।

फ़िल्ममेकर के हाथ पेंसिल से स्टोरीबोर्ड बनाते हुए, पास में विंटेज लाइट मीटर

शॉट, सब्जेक्ट, मोशन, साउंड

हर प्रॉम्प्ट चार हिस्सों में बनाएँ:

  1. शॉट: लेंस, एंगल और दूरी, जैसे "लो एंगल, 35mm, धीरे-धीरे पास आता कैमरा"।
  2. सब्जेक्ट: स्क्रीन पर कौन या क्या है, दो-तीन ठोस विवरण के साथ।
  3. मोशन: क्लिप के दौरान क्या बदलता है, क्रम से।
  4. साउंड: परिवेश का शोर, संगीत, या उद्धृत संवाद।

साउंड वह हिस्सा है जिसे ज़्यादातर लोग छोड़ देते हैं। मॉडल डिफ़ॉल्ट रूप से ऑडियो बनाता है, इसलिए कमरे की आवाज़ और कोई भी बोली गई पंक्ति लिखें, और सिर्फ़ प्राकृतिक ध्वनि चाहिए तो "no music" लिखें। जहाँ आपका टूल ऑडियो स्विच देता है, वहाँ उसे बंद करने पर आपको बिना आवाज़ का फ़ुटेज मिलता है, और आप उस पर बाद में खुद संगीत डाल सकते हैं।

एक काम का उदाहरण: लो एंगल, 35mm, बारिश वाली खिड़की की चौखट पर चाय के सिरेमिक मग पर धीरे-धीरे पास आता कैमरा। भाप ऊपर की ओर बल खाती है, उसके पीछे काँच पर एक बूँद फिसलती है। हल्की बारिश, दूर से ट्राम की घंटी, कोई संगीत नहीं।

कमज़ोर प्रॉम्प्टमज़बूत प्रॉम्प्ट
एक स्टाइलिश शहर वाला वीडियोशाम के समय बारिश से चमकते सड़क बाज़ार के ऊपर से एरियल पुल बैक, विक्रेता अपने छज्जे नीचे कर रहे हैं, गीले डामर पर गर्म स्ट्रिंग बल्ब की रोशनी झलक रही है, दूर से गड़गड़ाहट और धीमी आवाज़ें
एक इंसान बात करता हुआट्रेन प्लेटफ़ॉर्म पर ऊनी कोट पहने एक महिला का मीडियम क्लोज़-अप, वह कहती है "आख़िरी इंसान घर पहुँचे तो लाइट बंद कर दे", उसके पीछे स्टेशन की घोषणा गूँजती है

💡 जो नहीं चाहिए, जैसे टेक्स्ट ओवरले या हैंडहेल्ड कंपन, उसे मुख्य प्रॉम्प्ट की जगह नेगेटिव प्रॉम्प्ट में डालें।

स्टार्ट फ़्रेम और एंड फ़्रेम

इमेज-टू-वीडियो सबसे ज़्यादा नियंत्रण देता है। image को पहले फ़्रेम के रूप में और last_frame को आख़िरी फ़्रेम के रूप में सेट करें, और मॉडल दोनों के बीच का ट्रांज़िशन बना देता है। आदर्श इनपुट आउटपुट रेशियो से मेल खाते हैं, यानी 16:9 के लिए लगभग 1280x720 या 9:16 के लिए 720x1280। ये स्टिल PicassoIA Image से बना सकते हैं, जो दोनों रेशियो देता है।

दो सीमाएँ याद रखें: रेफ़रेंस इमेज केवल 16:9 और 8 सेकंड पर काम करती हैं, और जब भी रेफ़रेंस इमेज मौजूद हों, आख़िरी फ़्रेम नज़रअंदाज़ हो जाता है।

प्रति क्लिप असली लागत

MCP सर्वर खुद मुफ़्त है। Google Gemini API के लिए वीडियो के हर सेकंड पर बिल करता है, ऑडियो समेत, और आप जो टियर चुनते हैं उसके हिसाब से एक ही क्लिप 8 गुना कम या ज़्यादा लागत की हो सकती है।

काले अखरोट की मेज़ पर कैलकुलेटर, स्टॉपवॉच और नोटबुक

प्रति सेकंड दरें

लिखे जाने के समय प्रकाशित Gemini API दरें:

टियर720p1080p4K1080p पर 8 सेकंड
Veo 3.1$0.40$0.40$0.60$3.20
Veo 3.1 Fast$0.10$0.12$0.30$0.96
Veo 3.1 Lite$0.05$0.08उपलब्ध नहीं$0.64

बजट बनाने से पहले Google का प्राइसिंग पेज देखें, क्योंकि दरें बदलती रहती हैं। 1080p और 4K पर क्लिप 8 सेकंड की चलती हैं।

सही टियर चुनें

  • Lite या Fast पर 720p में ड्राफ़्ट बनाएँ। 8 सेकंड का Fast ड्राफ़्ट $0.80 का पड़ता है, और Lite ड्राफ़्ट $0.40 का।
  • जब क्वालिटी सबसे ज़्यादा मायने रखे, तब विजेता वर्ज़न स्टैंडर्ड Veo 3.1 टियर पर रेंडर करें। Lite में 4K नहीं है और एक्सटेंशन भी नहीं।
  • सीमा तय करके बैच चलाएँ। 20 सोशल क्लिप, हर एक 8 सेकंड की, कुल 160 सेकंड का वीडियो होता है: Lite पर 720p में $8.00, Fast पर 1080p में $19.20, स्टैंडर्ड पर 1080p में $64.00।

💡 720p पर 8 सेकंड के दस ड्राफ़्ट Fast पर $8 और स्टैंडर्ड पर $32 के पड़ते हैं। सस्ते में बार-बार प्रयोग करें, फिर फ़ाइनल के लिए एक बार भुगतान करें।

एक और लागत जो इनवॉइस में नहीं दिखती: alohc README चेतावनी देता है कि बने वीडियो लगभग 2 दिन तक Google के सर्वरों पर रहते हैं। पक्का करें कि आपका सर्वर हर फ़ाइल उसी दिन डिस्क पर डाउनलोड कर ले।

PicassoIA पर Veo 3.1 कैसे इस्तेमाल करें

क्रेडेंशियल, कॉन्फ़िग फ़ाइलें और बिलिंग अकाउंट छोड़ दें। PicassoIA का मॉडल पेज वही कंट्रोल ब्राउज़र में देता है, और क्लिप आपकी गैलरी में डाउनलोड के लिए तैयार मिल जाती है।

बड़े मॉनिटर पर रेगिस्तानी हाईवे का प्रीव्यू देखता एक युवक, स्टूडियो में

ज़रूरी सेटिंग्स

  1. PicassoIA पर Veo 3.1 खोलें।
  2. ऊपर बताए चार हिस्सों का इस्तेमाल करके प्रॉम्प्ट लिखें।
  3. नीचे की टेबल से विकल्प चुनें।
  4. चाहें तो पहला फ़्रेम, आख़िरी फ़्रेम, 3 तक रेफ़रेंस इमेज, नेगेटिव प्रॉम्प्ट या सीड जोड़ें।
  5. जनरेट करें, प्रीव्यू देखें और MP4 डाउनलोड करें।
सेटिंगविकल्पडिफ़ॉल्ट
अवधि4, 6 या 8 सेकंड8
रेज़ोल्यूशन720p या 1080p1080p
आस्पेक्ट रेशियो16:9 या 9:1616:9
ऑडियोचालू या बंदचालू

Veo 3.1 Fast वही सेटिंग्स इस्तेमाल करता है, सिवाय रेफ़रेंस इमेज के, जो यह नहीं देता। तेज़ ड्राफ़्ट के लिए इसे चुनें: इसके पेज के Fast उदाहरण 45 से 59 सेकंड में रेंडर हुए, जबकि स्टैंडर्ड मॉडल के उदाहरणों में लगभग 73 से 114 सेकंड लगे।

MCP के ज़रिए PicassoIA

PicassoIA के पास https://api.picassoia.com/v1 पर Replicate-style prediction endpoints और Bearer authentication वाला डेवलपर API है, साथ ही एक MCP कनेक्टर भी। दोनों चार मॉडल देते हैं: एक इमेज मॉडल, एक इमेज एडिटर, एक वीडियो मॉडल और ऑडियो के साथ Seedance 2.5 Lite। Veo 3.1 इस सूची में नहीं है, इसलिए Veo के लिए मॉडल पेज इस्तेमाल करें, और Claude के अंदर स्क्रिप्ट से वीडियो के लिए PicassoIA Video या Seedance 2.5 Lite को कॉल किया जा सकता है। हर अकाउंट पर एक साथ अधिकतम 5 predictions चलते हैं, जो सभी कनेक्शनों में साझा होते हैं।

अपनी पहली क्लिप बनाएँ

एक ऐसा वाक्य चुनें जिसे एक ही शॉट में फ़िल्माया जा सके। हाथ से चाय डालना, पुल पार करती ट्राम, दरवाज़े पर इंतज़ार करता कुत्ता। छोटे और ठोस दृश्य Veo को सबसे साफ़ लक्ष्य देते हैं, और उन्हें दोबारा बनाने में सबसे कम खर्च आता है।

गोल्डन आवर में छत पर फ़िल्ममेकर, हाथ में तैयार क्लिप वाला टैबलेट

तीन गलतियाँ जिनसे बचें

  1. एक्सपायरी भूल जाना। Google की तरफ़ छोड़े गए वीडियो लगभग 2 दिन बाद गायब हो जाते हैं, इसलिए उन्हें डाउनलोड कर लें।
  2. 4K पर ड्राफ़्ट बनाना। सस्ते में ड्राफ़्ट बनाएँ, फ़ाइनल एक बार बनाएँ।
  3. स्टेटस टूल छोड़ देना। जो क्लाइंट एक लंबी कॉल का इंतज़ार करते हैं, उनका टाइमआउट हो जाता है। job IDs इस्तेमाल करें और पोल करें।

खुद आज़माने के लिए तैयार हैं? PicassoIA खोलें, PicassoIA Image से पहला फ़्रेम बनाएँ, फिर Veo 3.1 से उसे एनिमेट करें। हर रन में एक ही डिटेल बदलें, नतीजों की तुलना Seedance 2.5 Lite से करें, और जो वर्ज़न पसंद आएँ उन्हें रखें। अपनी इमेज और वीडियो PicassoIA पर बस एक प्रॉम्प्ट दूर हैं, और पूरी मॉडल सूची picassoia.com/en/all-models पर उपलब्ध है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख