Gemini API में Veo 3.1 के तीनों मॉडल ID एक साथ: standard, Fast और Lite। देखें कि हर एक में कौन-से रिज़ॉल्यूशन और कितनी लंबाई की क्लिप मिलती हैं, एक क्लिप की प्रति सेकंड लागत क्या है, Python में इन्हें कैसे कॉल करें और ब्राउज़र से कैसे चलाएँ।
आप अपनी स्क्रिप्ट में मॉडल का नाम डालते हैं, उसे चलाते हैं और वीडियो की जगह एरर मिलता है। Veo 3.1 के साथ यह जितना होना चाहिए उससे ज़्यादा बार होता है, क्योंकि लॉन्च पोस्ट में लिखा नाम, Gemini API का नाम और किसी तीसरे प्लेटफ़ॉर्म का नाम, तीनों अलग-अलग स्ट्रिंग हैं। यह पेज Veo 3.1, Veo 3.1 Fast और Veo 3.1 Lite के सटीक ID सूचीबद्ध करता है, बताता है कि हर एक क्या कर सकता है, प्रति सेकंड कितनी लागत आती है और इन्हें बिना अंदाज़े के कैसे कॉल करें।
संक्षेप में: Gemini API में तीनों नाम veo-3.1-generate-preview, veo-3.1-fast-generate-preview और veo-3.1-lite-generate-preview हैं। नीचे दिया गया हर हिस्सा समझाता है कि ये ऐसे क्यों दिखते हैं, आपके काम के लिए कौन-सा सही है, और जब आप कोड लिखने के बजाय क्लिक करना चाहें, तो PicassoIA पर वही मॉडल कैसे चलाएँ। अगर कोई रिक्वेस्ट तुरंत फेल हो जाए, तो कुछ भी और बदलने से पहले अपनी स्ट्रिंग को नीचे की टेबल से मिलाएँ, क्योंकि लंबी स्क्रिप्ट में एक अक्षर की गलती आसानी से हो जाती है और उसे पकड़ना मुश्किल होता है।
तीन मॉडल ID
Google के Gemini API डॉक्यूमेंटेशन में Veo 3.1 परिवार के ये कोड दिए गए हैं। इन्हें ठीक वैसे ही कॉपी करें, जिसमें -preview वाला अंत भी शामिल है।
💡 टिप: ID हूबहू स्ट्रिंग होते हैं। veo-3.1, veo3.1 और veo-3-1-fast ऊपर के तीनों कोड में से कोई नहीं हैं, इसलिए इनका इस्तेमाल करने वाली रिक्वेस्ट ऐसा मॉडल माँग रही है जो Google की सूची में है ही नहीं।
Veo 3.1 standard
veo-3.1-generate-preview इस परिवार का सबसे ऊपर का मॉडल है। Google की प्रॉपर्टी टेबल के अनुसार यह इनपुट के रूप में टेक्स्ट या इमेज लेता है, नेटिव रूप से जेनरेट किए गए ऑडियो के साथ वीडियो देता है, और 720p, 1080p और 4k आउटपुट देता है। क्लिप 4, 6 या 8 सेकंड लंबी होती हैं, और 1080p व 4k केवल 8 सेकंड तक सीमित हैं। इसे तब चुनें जब क्लिप ही अंतिम प्रोडक्ट हो और बजट इजाज़त दे।
Veo 3.1 Fast
veo-3.1-fast-generate-preview Google की टेबल में standard मॉडल वाली ही इनपुट, आउटपुट, रिज़ोल्यूशन और अवधि की पंक्तियाँ साझा करता है। बदलाव एक समझौते का है: प्रति सेकंड कम कीमत और कम इंतज़ार। PicassoIA पेज पर प्रकाशित उदाहरण जनरेशन में Fast की क्लिप लगभग 45 से 59 सेकंड में तैयार हुईं, जबकि standard Veo 3.1 पेज के उदाहरणों में 72 से 114 सेकंड लगे।
Veo 3.1 Lite
veo-3.1-lite-generate-preview सबसे सस्ता टियर है। यह 720p और 1080p (केवल 8 सेकंड) सपोर्ट करता है, इसमें 4k आउटपुट नहीं है, और Google के डॉक्यूमेंटेशन के अनुसार इसके लिए वीडियो एक्सटेंशन उपलब्ध नहीं है। Veo 3.1 Lite पेज के उदाहरण लगभग 37 से 42 सेकंड में पूरे हुए। इसे वॉल्यूम टियर समझें: बहुत सारे ड्राफ़्ट, सोशल क्लिप और बैकग्राउंड लूप।
नाम कहाँ से आते हैं
पैटर्न को समझना
हर ID एक ही ढाँचे का पालन करता है: वर्ज़न, वैकल्पिक टियर, शब्द generate, और फिर रिलीज़ स्टेज। तो veo-3.1-fast-generate-preview का मतलब है Veo 3.1, Fast टियर, generate, preview स्टेज।
पुराने Veo 3 मॉडल अलग स्टेज सफ़िक्स इस्तेमाल करते हैं। veo-3.0-generate-001 और veo-3.0-fast-generate-001 को stable सूचीबद्ध किया गया है, जिनमें 720p या 1080p पर 8 सेकंड की क्लिप बनती हैं। अगर आप ये PicassoIA पर चाहते हैं, तो वे Veo 3 और Veo 3 Fast हैं।
Preview का मतलब है कि Google अब भी व्यवहार, सीमाएँ या कीमत बदल सकता है। स्ट्रिंग को एक config कॉन्स्टेंट में रखें, ताकि जिस दिन नाम बदले, एक ही बदलाव से पूरा प्रोजेक्ट अपडेट हो जाए।
Stable या preview? अगर आपका प्रोडक्ट किसी मॉडल का नाम बदलने या उसकी कीमत बदलने को नहीं झेल सकता, तो stable Veo 3 जोड़ी ज़्यादा सुरक्षित आधार है, बशर्ते 720p या 1080p पर 8 सेकंड की क्लिप काफ़ी हों। अगर आपको 4, 6 या 8 सेकंड की लंबाई, सस्ता Lite टियर या 4k आउटपुट चाहिए, तो आप preview क्षेत्र में हैं और बदलाव के लिए तैयार रहना चाहिए। हर जनरेट की गई फ़ाइल के साथ मॉडल स्ट्रिंग लॉग करें, ताकि महीनों बाद भी नतीजे को दोबारा बनाया या जाँचा जा सके।
दूसरे प्लेटफ़ॉर्म पर नाम
Gemini API की स्ट्रिंग कभी किसी दूसरे प्लेटफ़ॉर्म पर न चिपकाएँ। PicassoIA इन मॉडलों को google ओनर के तहत सूचीबद्ध करता है, जिनके नामों से generate और preview शब्द हटे होते हैं, और पेज स्लग से डॉट हटे होते हैं।
कहाँ
Veo 3.1
Fast
Lite
Gemini API
veo-3.1-generate-preview
veo-3.1-fast-generate-preview
veo-3.1-lite-generate-preview
PicassoIA मॉडल नाम
google/veo-3.1
google/veo-3.1-fast
google/veo-3.1-lite
PicassoIA पेज स्लग
google-veo-31
google-veo-31-fast
google-veo-31-lite
व्यावहारिक नियम यह है: जो टूल Gemini API से बात करता है, उसे veo-3.1-generate-preview चाहिए, जबकि जो टूल या कैटलॉग ओनर और नाम की जोड़ी के साथ काम करता है, उसे google/veo-3.1 चाहिए। दोनों को मिलाना आसान गलती है, जिसका नतीजा ऐसा मॉडल माँगना होता है जो मौजूद ही नहीं है।
Google Cloud के Vertex AI की अपनी मॉडल सूची है। ID को उसी कंसोल से पढ़ें, यह मानकर न चलें कि वह Gemini API वाली स्ट्रिंग से मेल खाती है।
स्पेक्स एक नज़र में
नीचे के सभी आँकड़े Veo के लिए Google के Gemini API डॉक्यूमेंटेशन से लिए गए हैं।
प्रॉपर्टी
Veo 3.1
Veo 3.1 Fast
Veo 3.1 Lite
Veo 3 और Fast
इनपुट
टेक्स्ट, इमेज
टेक्स्ट, इमेज
टेक्स्ट, इमेज
टेक्स्ट, इमेज
आउटपुट
ऑडियो के साथ वीडियो
ऑडियो के साथ वीडियो
ऑडियो के साथ वीडियो
ऑडियो के साथ वीडियो
रिज़ोल्यूशन
720p, 1080p, 4k
720p, 1080p, 4k
720p, 1080p
720p, 1080p
अवधि
4, 6 या 8 s
4, 6 या 8 s
4, 6 या 8 s
8 s
स्टेटस
Preview
Preview
Preview
Stable
1080p नियम
Google 1080p (और जिन मॉडलों में है उनमें 4k) को 8 सेकंड की क्लिप से जोड़ता है, और PicassoIA का Lite फ़ॉर्म भी वही नियम दोहराता है: 1080p चुनने पर अवधि 8 होनी चाहिए। रिज़ोल्यूशन और अवधि को एक जोड़ी की तरह देखें। 4 या 6 सेकंड की क्लिप का मतलब 720p है।
Lite में क्या नहीं है
4k और वीडियो एक्सटेंशन के अलावा, PicassoIA पर Lite फ़ॉर्म में नेगेटिव प्रॉम्प्ट फ़ील्ड, ऑडियो टॉगल और रेफ़रेंस इमेज नहीं हैं। standard मॉडल के फ़ॉर्म में तीनों हैं, और Fast में नेगेटिव प्रॉम्प्ट और ऑडियो टॉगल बने रहते हैं। अगर आपकी पाइपलाइन किसी कैरेक्टर को स्थिर रखने के लिए रेफ़रेंस इमेज पर निर्भर है, तो Lite गलत टियर है।
हर कॉल की लागत
Google Veo का बिल जेनरेट हुए वीडियो के प्रति सेकंड के हिसाब से बनाता है। ये उसके प्राइसिंग पेज पर, इसे लिखते समय, ऑडियो वाली कीमतें हैं, साथ में एक 8 सेकंड की क्लिप की लागत।
मॉडल
720p प्रति सेकंड
1080p प्रति सेकंड
4k प्रति सेकंड
1080p पर 8 s क्लिप
Veo 3.1
$0.40
$0.40
$0.60
$3.20
Veo 3.1 Fast
$0.10
$0.12
$0.30
$0.96
Veo 3.1 Lite
$0.05
$0.08
समर्थित नहीं
$0.64
💡 बजट बनाने से पहले जाँचें: ये preview मॉडल हैं, और preview कीमतें बदल सकती हैं। Google यह भी बताता है कि केवल तभी शुल्क लिया जाता है जब वीडियो सफलतापूर्वक जनरेट हो।
सस्ते ड्राफ़्ट, महँगा फ़ाइनल
किसी असली बैच पर हिसाब लगाएँ। Lite पर 720p में दस 8 सेकंड के ड्राफ़्ट की लागत 10 x $0.40 = $4.00 है। Fast पर 1080p में तीन रिफ़ाइनमेंट की लागत 3 x $0.96 = $2.88 है। standard पर 1080p में एक फ़ाइनल की लागत $3.20 है। कुल: $10.08। वही चौदह क्लिप standard 1080p पर बनाने की लागत 14 x $3.20 = $44.80 होती, जबकि जनरेशन की संख्या वही रहती।
छोटे ड्राफ़्ट और भी बचत कराते हैं। 4 सेकंड की क्लिप 720p पर अनुमति में है, इसलिए Lite ड्राफ़्ट की लागत 4 x $0.05 = $0.20 है, Fast ड्राफ़्ट $0.40 और standard ड्राफ़्ट $1.60 है। कैमरा मूव और साउंड 4 सेकंड के ड्राफ़्ट पर तय करें, फिर प्रॉम्प्ट काम करने लगे तो 8 सेकंड खर्च करें।
PicassoIA पर आप ब्राउज़र से जनरेट करते हैं, इसलिए आपके अपने कोड में प्रति सेकंड का कोई मीटर नहीं है जिसे ट्रैक करना पड़े। सीमाएँ आपके प्लान पर निर्भर करती हैं, इसलिए बड़ा रन करने से पहले जाँच लें।
एक काम करने वाली Python कॉल
Google के डॉक्यूमेंटेशन में standard मॉडल के लिए नीचे दिया पैटर्न दिखाया गया है। यह google-genai SDK इस्तेमाल करता है, एक लंबे समय चलने वाला ऑपरेशन शुरू करता है और वीडियो तैयार होने तक उसकी स्थिति जाँचता रहता है। क्लाइंट आपका Gemini क्रेडेंशियल एनवायरनमेंट से पढ़ता है, इसलिए चलाने से पहले उसे उसी तरीके से सेट करें जैसा Google AI Studio बताता है।
import time
from google import genai
from google.genai import types
client = genai.Client()
prompt = "A slow dolly shot along a rainy street at dusk, a street musician plays saxophone, rain and distant traffic in the audio"
operation = client.models.generate_videos(
model="veo-3.1-generate-preview",
prompt=prompt,
)
while not operation.done:
print("Waiting for video generation to finish...")
time.sleep(10)
operation = client.operations.get(operation)
generated_video = operation.response.generated_videos[0]
client.files.download(file=generated_video.video, destination="output.mp4")
टियर बदलने पर केवल एक आर्गुमेंट बदलता है। तीनों नाम एक डिक्शनरी में रखें और जिसकी ज़रूरत हो उसे पास करें:
कॉल एक वीडियो नहीं, एक ऑपरेशन लौटाती है। आपका लूप हर 10 सेकंड में operation.done जाँचता है और फिर फ़ाइल डाउनलोड करता है। standard मॉडल पर एक-दो मिनट के इंतज़ार का बजट रखें, और Fast व Lite पर उससे कम, ऊपर के उदाहरण समय के आधार पर। जब तक ऑपरेशन चल रहा हो, दोबारा सबमिट न करें, वरना आप दूसरी क्लिप जनरेट करेंगे (और उसका पैसा देंगे)।
पैसे बर्बाद करने वाली गलतियाँ
सफ़िक्स छूट गया।veo-3.1-generate बिना -preview के सूचीबद्ध कोड नहीं है।
Lite पर 4k। यह टियर इसे नहीं देता।
6 सेकंड की क्लिप पर 1080p। 8 सेकंड सेट करें, या 720p पर जाएँ।
Lite क्लिप को एक्सटेंड करना। Google कहता है कि Lite के लिए एक्सटेंशन उपलब्ध नहीं है।
स्ट्रिंग इधर-उधर बिखेरना। दस फ़ाइलों में ID हार्ड-कोड करेंगे तो नाम बदलने में एक दोपहर लग जाएगी।
बैच कतार में डालने से पहले इस छोटी चेकलिस्ट से गुज़रें:
मॉडल स्ट्रिंग पहली टेबल के तीन कोड में से एक से हूबहू मेल खाती है।
रिज़ोल्यूशन और अवधि एक मान्य जोड़ी हैं: 1080p का मतलब 8 सेकंड है।
आपने जो टियर चुना है वह आपकी ज़रूरत सपोर्ट करता है: 4k, एक्सटेंशन और रेफ़रेंस इमेज Lite पर नहीं हैं।
आपने हर आउटपुट फ़ाइल के साथ मॉडल स्ट्रिंग और प्रॉम्प्ट लॉग किया है।
रन दबाने से पहले आपने प्रति सेकंड की कीमत को क्लिप की संख्या से गुणा कर लिया है।
आपके काम के लिए कौन-सा मॉडल सही है
काम
सबसे अच्छा टियर
क्यों
प्रॉम्प्ट टेस्टिंग और स्टोरीबोर्ड
Fast
कम कीमत, जल्दी नतीजा
फ़ाइनल हीरो क्लिप या 4k डिलीवरी
Veo 3.1 standard
सबसे ऊँची रिज़ोल्यूशन सीमा
रोज़ के वर्टिकल सोशल क्लिप
Lite
प्रति सेकंड सबसे सस्ता
शॉट्स में एक सब्जेक्ट को स्थिर रखना
Veo 3.1 standard
PicassoIA पर रेफ़रेंस इमेज
इटरेशन के लिए Fast
ज़्यादातर प्रॉम्प्ट को तीन-चार बार दोबारा लिखना पड़ता है, जब तक कैमरा मूव और साउंड वैसे न आ जाएँ जैसा आप चाहते हैं। वे रीराइट Veo 3.1 Fast पर करें, फिर जीता हुआ प्रॉम्प्ट standard मॉडल पर ले जाएँ।
चूँकि हर टियर नेटिव ऑडियो देता है, इसलिए साउंड को प्रॉम्प्ट में लिखें। PicassoIA के अपने उदाहरण प्रॉम्प्ट यही करते हैं: ट्रेन की सीटी और स्टेशन का माहौल, बारिश की बूँदों वाली खिड़की के साथ सॉफ़्ट जैज़, कोट्स में बोला गया एक संवाद। जो प्रॉम्प्ट साउंड का नाम लेता है, वह मॉडल को ऑडियो ट्रैक बनाने के लिए कुछ देता है, और आप ड्राफ़्ट के बीच का फ़र्क जल्दी सुन लेंगे।
फ़ाइनल के लिए Standard
जब कोई क्लिप लैंडिंग पेज पर, क्लाइंट डेक में या बड़ी स्क्रीन पर जाएगी, तो Veo 3.1 की अतिरिक्त लागत को जायज़ ठहराना आसान है। यही इस परिवार का एकमात्र टियर है जिस पर PicassoIA पर रेफ़रेंस इमेज हैं, और Google की टेबल में यह 4k की पंक्ति Fast के साथ साझा करता है।
वॉल्यूम के लिए Lite
Veo 3.1 Lite हर उस वर्कफ़्लो में फ़िट बैठता है जहाँ दर्जनों छोटी क्लिप चाहिए: प्रोडक्ट लूप, वर्टिकल पोस्ट, पॉडकास्ट के लिए बैकग्राउंड फ़ुटेज। सबसे सस्ते नतीजे के लिए आस्पेक्ट रेशियो 9:16 पर बदलें और 720p सेट करें।
PicassoIA पर Veo 3.1 कैसे इस्तेमाल करें
कोई कोड नहीं, कोई क्रेडेंशियल नहीं, वही मॉडल परिवार। Veo 3.1 पेज पर प्रक्रिया यह है:
प्रॉम्प्ट लिखें। यही एकमात्र ज़रूरी फ़ील्ड है। सब्जेक्ट, कैमरा मूव, रोशनी और वह साउंड बताएँ जो आप सुनना चाहते हैं।
अवधि सेट करें। 4, 6 या 8 सेकंड चुनें। डिफ़ॉल्ट 8 है।
रिज़ोल्यूशन और रेशियो सेट करें। 720p या 1080p चुनें (डिफ़ॉल्ट 1080p है), और 16:9 या 9:16।
ऑडियो चालू रखें। ऑडियो विकल्प डिफ़ॉल्ट रूप से सक्षम है। जो चीज़ बाहर रखनी हो उसके लिए नेगेटिव प्रॉम्प्ट जोड़ें।
जनरेट करें और डाउनलोड करें। क्लिप तैयार होने का इंतज़ार करें, फिर फ़ाइल सेव करें।
फ़्रेम और रेफ़रेंस इमेज
अपने पहले फ़्रेम से शुरू करने के लिए इनपुट इमेज जोड़ें। आखिरी फ़्रेम भी जोड़ें तो मॉडल दोनों के बीच ट्रांज़िशन बनाता है। आदर्श इमेज 16:9 या 9:16 में 1280x720 या 720x1280 की हों, जो आपके चुने रेशियो से मेल खाएँ।
किसी सब्जेक्ट को एक जैसा रखने के लिए, उसकी जगह एक से तीन रेफ़रेंस इमेज अपलोड करें। यह केवल standard मॉडल पर काम करता है, और केवल 16:9 व 8 सेकंड के साथ। अगर आप रेफ़रेंस इमेज देते हैं, तो आखिरी फ़्रेम अनदेखा किया जाता है, इसलिए हर क्लिप के लिए एक ही तरीका चुनें।
PicassoIA पर Fast और Lite
Veo 3.1 Fast डिफ़ॉल्ट रूप से 1080p पर चलता है और नेगेटिव प्रॉम्प्ट व ऑडियो टॉगल रखता है। Veo 3.1 Lite डिफ़ॉल्ट रूप से 720p पर चलता है, और जब भी आप 1080p चुनते हैं तो 8 सेकंड ज़रूरी होते हैं।
💡 PicassoIA के API के लिए कोड लिख रहे हैं? इसे लिखते समय PicassoIA के डेवलपर API में उसके अपने चार मॉडल सूचीबद्ध थे, जिनमें PicassoIA Video और Seedance 2.5 Lite शामिल हैं, न कि Google के Veo मॉडल। इस लेख में दिए Veo ID Gemini API के हैं, और ऊपर के Veo पेज ब्राउज़र के लिए हैं।
आज ही अपनी पहली क्लिप बनाएँ
एक प्रॉम्प्ट चुनें और उसे तीन बार चलाएँ: एक बार Veo 3.1 पर, एक बार Fast पर और एक बार Lite पर। जहाँ फ़ॉर्म सीड देता है, वहाँ सीड एक जैसा रखें, फिर तीनों क्लिप साथ रखकर देखें। लगभग पाँच मिनट में आपको कीमत और स्पीड का फ़र्क दिख जाएगा, और पता चल जाएगा कि कौन-सा टियर आपके वर्कफ़्लो में जगह पाने लायक है।
एक अच्छा टेस्ट प्रॉम्प्ट: एक बरिस्ता संगमरमर के काउंटर पर लाते का कप सरकाता है, भाप उठ रही है, सॉफ़्ट जैज़ और एस्प्रेसो मशीन की सिसकारी, कप पर धीमा पुश-इन। इसमें एक साफ़ सब्जेक्ट, एक कैमरा मूव और एक तय साउंडस्केप है, इसलिए टियर का फ़र्क अंदाज़े के बजाय मोशन की क्वालिटी और ऑडियो में दिखेगा।
Picasso IA तीनों को एक ही साइट पर रखता है, ताकि आप इंटीग्रेशन का एक भी कोड लिखने से पहले टेस्ट कर सकें। Veo 3.1, Veo 3.1 Fast या Veo 3.1 Lite खोलें, जो सीन आप सोच रहे हैं वह टाइप करें, और देखें कि वह साउंड वाली क्लिप में बदल जाता है।