हर उस बातचीत में जो Veo 3.1 की होती है, रेज़ोल्यूशन पर ध्यान रहता है: तीखे किनारे, फ़ोटोरियलिस्टिक टेक्सचर, 1080p आउटपुट जो छोटी क्लिप्स को किसी फ़िल्म सेट से निकली चीज़ जैसा बना देता है। लगभग कोई भी ऑडियो की बात नहीं करता। ऐसा इसलिए नहीं कि वह कम ज़रूरी है। ऐसा इसलिए है कि ज़्यादातर लोग जानते ही नहीं कि वह असल में क्या करता है।
Veo 3.1 में नेटिव ऑडियो जनरेशन मॉडल के अंदर ही बना हुआ है। इसका मतलब है कि वीडियो रेंडर होने के बाद ऊपर से साउंड नहीं चिपकाया जाता। हर फ़्रेम के साथ सिंक में आवाज़ बनती है, उसी प्रॉम्प्ट से जो विज़ुअल आउटपुट चलाता है। पार्क में भौंकता कुत्ता, सुनसान गलियारे में चरमराते फ़र्श, लाइव परफ़ॉर्मेंस पर प्रतिक्रिया देती भीड़: मॉडल इन दृश्यों को उसी तरह "सुनता" है जैसे उन्हें "देखता" है, और उनके मेल की आवाज़ बनाता है।
इससे प्रॉम्प्ट लिखने का तरीका बदलता है। इससे यह भी बदलता है कि आप अपने आउटपुट से क्या उम्मीद कर सकते हैं। और इससे यह बदलता है कि AI से बना वीडियो असली प्रोडक्शन वर्कफ़्लो में कैसे फ़िट होता है। आपको असल में क्या जानना चाहिए, यहाँ है।

वह ऑडियो लेयर जिसका कोई ज़िक्र नहीं करता
यह सिर्फ़ बैकग्राउंड शोर नहीं है
जब लोग पहली बार देखते हैं कि Veo 3.1 ऑडियो बनाता है, तो मान लेते हैं कि यह एक सरल एम्बिएंट पास है: वीडियो में दिखाए गए माहौल से मेल खाती कोई आम बैकग्राउंड गुनगुनाहट। यह धारणा गलत है, और इससे मॉडल के काम को बहुत कम आँका जाता है।
Veo 3.1 का ऑडियो सिस्टम एक साथ कम से कम तीन अलग-अलग लेयर पर काम करता है: एम्बिएंट माहौल की आवाज़, ऑब्जेक्ट-विशेष साउंड इफ़ेक्ट (जिन्हें साउंड डिज़ाइनर Foley कहते हैं), और जब प्रॉम्प्ट में इंसानी मौजूदगी का संकेत हो तब बोलने या गाने वाला कंटेंट। इनमें से हर एक की अपनी जनरेशन लॉजिक है। हर एक आपके प्रॉम्प्ट के लिखे जाने के तरीके पर अलग ढंग से प्रतिक्रिया देता है।
एम्बिएंट साउंड नींव है। किसी बाहरी जंगल के दृश्य के लिए इसका मतलब है पत्तियों से गुज़रती हवा, दूर से आती पक्षियों की आवाज़ें, और खुली जगह की हल्की, कम-फ़्रीक्वेंसी वाली गुनगुनाहट। शहरी दृश्य के लिए इसका मतलब है ट्रैफ़िक की बनावट, सड़क के शोर की लहर, और एक चौड़े बाहरी माहौल के ध्वनिक गुण। इनडोर दृश्य के लिए इसका मतलब है रूम टोन: वह खास सन्नाटा जो पूरी तरह खामोश नहीं होता, और जिसे दीवारों की सामग्री और कमरे के आकार से आकार मिलता है।
💡 टिप: अगर आप ज़्यादा समृद्ध एम्बिएंट साउंड चाहते हैं, तो अपने प्रॉम्प्ट में ध्वनिक माहौल साफ़-साफ़ बताएँ। "पत्थर की दीवारों वाला एक गिरजाघर का अंदरूनी हिस्सा" और "एक आधुनिक खुला ऑफ़िस" से साफ़ तौर पर अलग रूम टोन बनेगा।
मॉडल असल में तीन चीज़ें जनरेट करता है
ज़्यादातर सफल आउटपुट में मॉडल तीन ऑडियो श्रेणियाँ बनाता है:
- एम्बिएंट माहौल: किसी जगह की लगातार चलती बैकग्राउंड बनावट, जो उसकी भौतिक विशेषताओं से तय होती है
- Foley-स्टाइल साउंड इफ़ेक्ट: स्क्रीन पर दिख रही खास चीज़ों और क्रियाओं से जुड़ी आवाज़ें
- आवाज़ वाला कंटेंट: डायलॉग, बोलचाल या गायन, जब लोग दिख रहे हों और उन्हें बोलने के लिए कहा गया हो
तीसरी श्रेणी को ज़्यादातर क्रिएटर कम आँकते हैं। जब आपके प्रॉम्प्ट में कोई इंसान बोल रहा हो, तो मॉडल सिर्फ़ होंठों की हरकत नहीं बनाता। वह उसके साथ जाने वाली आवाज़ भी बनाता है। ज़्यादातर मामलों में बोली गई आवाज़ समझ आने वाली इंसानी भाषा नहीं होगी, लेकिन उसमें किसी असल में बात करते व्यक्ति की लय, रफ़्तार और भावनात्मक लहज़ा होता है। यह B-roll, प्रज़ेंटेशन मॉकअप और ऐसे किसी भी दृश्य के लिए काम का है जहाँ निहित बोलचाल खास शब्दों से ज़्यादा मायने रखती है।

Veo 3.1 आवाज़ कैसे बनाता है
टेक्स्ट-टू-ऑडियो पाइपलाइन
Veo 3.1 एक जॉइंट वीडियो-ऑडियो जनरेशन आर्किटेक्चर इस्तेमाल करता है। यही वह हिस्सा है जिसे कोई साफ़ तरीके से नहीं समझाता। मॉडल पहले वीडियो बनाकर फिर दूसरे पास में उसमें ऑडियो नहीं जोड़ता। इसके बजाय वीडियो और ऑडियो दोनों एक ही दृश्य के एक साझा लेटेंट रिप्रेज़ेंटेशन से साथ-साथ बनते हैं।
व्यवहार में इसका मतलब है कि ऑडियो वीडियो कंटेंट के प्रति कारण-स्तर पर जागरूक होता है। स्क्रीन पर कुछ हिलता है, तो मॉडल जानता है कि हरकत हुई है, और उससे सिंक में एक ऑडियो घटना बना सकता है। दरवाज़ा बंद होता है: आपको क्लिक सुनाई देता है। हाथ मेज़ पर थपथपाता है: टक्कर ठीक सही फ़्रेम पर आती है। ये सिंक पूरी तरह सटीक नहीं होते, लेकिन ये किसी ऐसे अलग पोस्ट-प्रोसेस सिस्टम से कहीं ज़्यादा सटीक होते हैं जो ऑडियो को वीडियो से मिलाने का काम अलग से करता है।
मॉडल को बड़े पैमाने पर जोड़ीदार ऑडियो-वीडियो डेटा पर ट्रेन किया गया था। उसके ट्रेनिंग सेट के हर वीडियो में उसका मूल ऑडियो था, जिससे मॉडल ने सीखा कि असली दुनिया के दृश्य अंदर से कैसे सुनाई देते हैं। यह टेक्स्ट-टू-स्पीच पाइपलाइन या साउंड इफ़ेक्ट डेटाबेस से अलग है। मॉडल के पास दुनिया की एक आंतरिक ध्वनिक समझ है, जिसे वह हर दृश्य जनरेट करते समय लागू करता है।
"नेटिव ऑडियो" का असल मतलब क्या है
नेटिव ऑडियो का मतलब है कि आवाज़ उसी मॉडल से बनती है जिसने वीडियो बनाया। कोई बाहरी ऑडियो सर्विस नहीं बुलाई जाती। कोई ऑडियो लाइब्रेरी नहीं खंगाली जाती। एक ही इनफ़ेरेंस पास दोनों मोडैलिटी एक साथ बनाता है।
इसके कई कारण हैं। पहला, यह फ़्रेम स्तर पर सिंक्रोनाइज़ेशन की गारंटी देता है। दूसरा, इसका मतलब है कि ऑडियो को वही प्रॉम्प्ट कंडीशनिंग मिलती है जो वीडियो को मिलती है। तीसरा, इसका मतलब है कि सिंक खोए बिना आप ऑडियो को आसानी से बदलकर दोबारा नहीं जोड़ सकते।
इसका दूसरा पहलू यह है कि आप ऑडियो को अलग से नियंत्रित नहीं कर सकते। अगर आपको कोई खास संगीत, किसी खास भाषा में वॉइस-ओवर या कोई सटीक साउंड इफ़ेक्ट चाहिए, तो नेटिव ऑडियो वह नहीं देगा। यह एक सुसंगत, विश्वसनीय ऑडियो माहौल देता है जो विज़ुअल दृश्य से मेल खाता है, और जो आपके टेक्स्ट प्रॉम्प्ट से अपने आप बनता है।

ऑडियो क्वालिटी का पूरा हिसाब
एम्बिएंट साउंड का प्रदर्शन
एम्बिएंट साउंड में Veo 3.1 सबसे लगातार अच्छा प्रदर्शन करता है। बाहरी प्राकृतिक वातावरण, शहरी सड़कें और इनडोर जगहें, सभी को भरोसेमंद एम्बिएंट ट्रीटमेंट मिलता है। मॉडल रीवर्ब और कमरे की ध्वनिकी को खास तौर पर अच्छी तरह संभालता है: बड़ी पत्थर की इमारत में सेट क्लिप कालीन वाले बेडरूम में सेट क्लिप से साफ़ तौर पर लंबी रीवर्ब टेल पैदा करेगी।
फ़्रीक्वेंसी बैलेंस आम तौर पर वास्तविकता की ओर झुका होता है। वाहनों वाले दृश्यों में भारी बास की गड़गड़ाहट, बाहरी दिन के दृश्यों में साफ़ हाई-फ़्रीक्वेंसी मौजूदगी, और बंद इनडोर जगहों में ज़्यादा सपाट, दबी हुई बनावट। ये गुण स्पष्ट ध्वनिक मॉडलिंग नियमों से नहीं, बल्कि ट्रेनिंग डेटा से उभरते हैं।
वीडियो क्रिएटर्स के लिए इसका मतलब है कि Veo 3.1 का एम्बिएंट साउंड अक्सर पोस्ट-प्रोडक्शन ऑडियो वर्कफ़्लो में एक शुरुआती बिंदु के रूप में काम का होता है। यह प्रोफ़ेशनल लोकेशन साउंड या समर्पित Foley सेशन की जगह नहीं लेगा, लेकिन यह एक रेफ़रेंस लेयर देता है जिस पर आगे काम किया जा सकता है, जिसके ऊपर परतें जोड़ी जा सकती हैं, या जिससे खामोशी से शुरू किए बिना छोटे कटअवे भरे जा सकते हैं।
डायलॉग और आवाज़ का सिंक
आवाज़ का सिंक्रोनाइज़ेशन मॉडल की सबसे चौंकाने वाली खूबियों में से एक है। जब वीडियो में दिख रहा कोई व्यक्ति बोलता हुआ लगता है, तो ऑडियो में ऐसी आवाज़ें होती हैं जो उसकी होंठों की हरकत से लगभग मेल खाती हैं। लय अच्छी तरह मेल खाती है। भावनात्मक लहज़ा, आत्मविश्वास भरा, झिझकता हुआ, रौबदार, प्रॉम्प्ट के विवरण से मेल खाता है।
जो यह नहीं करता, वह है पहचाने जाने वाले शब्द या वाक्यांश बनाना। बोली गई आवाज़ वही रहती है जिसे साउंड डिज़ाइनर "walla" कहते हैं: भीड़ या किसी एक व्यक्ति की प्लेसहोल्डर वोकल आवाज़, जो बोलने का आभास देती है पर उसमें कोई अर्थ नहीं होता। ज़्यादातर B-roll और प्रीव्यू उपयोगों के लिए यह पूरी तरह उपयुक्त है।
जिन उपयोगों में समझ आने वाली बोली चाहिए, उनके लिए एक समर्पित वॉइस सिंथेसिस मॉडल ज़रूरी है। PicassoIA पर Seedance 2.0 और Seedance 2.5 मॉडल भी अलग ऑडियो गुणों के साथ नेटिव ऑडियो जनरेशन देते हैं। असली बोली के साथ असली लिप सिंक के लिए, वीडियो मॉडल के आउटपुट को एक अलग वॉइस और लिप सिंक टूल के साथ जोड़ना मानक प्रोडक्शन वर्कफ़्लो है।
💡 Tip: अपने प्रॉम्प्ट में बोलने वाले व्यक्ति की भावनात्मक स्थिति और रफ़्तार बताएँ: "एक महिला दर्शकों से शांत और सोच-समझकर बोलती हुई।" इससे जनरेट होने वाली वोकल आवाज़ की लय प्रभावित होती है, सिर्फ़ विज़ुअल परफ़ॉर्मेंस नहीं।

साउंड इफ़ेक्ट और Foley
ऑब्जेक्ट-विशेष साउंड इफ़ेक्ट वहाँ हैं जहाँ नतीजे कम अनुमानित होते हैं। Foley-स्टाइल आवाज़ें, कदमों की आहट, टक्कर, सरसराता कपड़ा, दरवाज़े की आवाज़ें, इस पर निर्भर करती हैं कि मॉडल वीडियो में किसी खास क्रिया को सही पहचाने और उसे सही ऑडियो घटना से जोड़े।
जब विज़ुअल घटना साफ़ हो और फ़्रेम के बीच में हो, तो मॉडल आम तौर पर यह सही करता है। कीबोर्ड पर टाइप करता हाथ क्लिकिंग की आवाज़ बनाता है। उछलती गेंद टक्कर की आवाज़ बनाती है। कार का दरवाज़ा बंद होने पर शीट मेटल और रबर सील के मिलने की पहचानी जाने वाली धमक आती है।
जब क्रिया गौण हो, तेज़ी से चल रही हो, या विज़ुअली अस्पष्ट हो, तो मेल टूटने लगता है। ऑडियो घटना थोड़ी गलत समय पर आ सकती है, गलत ऑब्जेक्ट से जुड़ सकती है, या बिल्कुल गायब हो सकती है। यह ऐसा क्षेत्र है जहाँ Veo 3.1 Veo 3 से साफ़ सुधार दिखाता है, लेकिन फिर भी इस पर ध्यान देना ज़रूरी है कि आप फ़्रेम में कौन सी चीज़ों और क्रियाओं को केंद्र में रखते हैं।

जब ऑडियो बिखरने लगता है
जटिल ध्वनिक माहौल
जब एक साथ कई प्रतिस्पर्धी ऑडियो स्रोत मौजूद हों, तो मॉडल संघर्ष करता है। संगीत, भीड़ के शोर और अलग-अलग बातचीत वाला एक व्यस्त बाज़ार ऐसा ऑडियो देता है जिसमें ये तत्व असंगत ढंग से घुल जाते हैं। मिश्रण में वह परतदार संरचना नहीं होती जो कोई इंसानी ऑडियो डिज़ाइनर बनाता। अलग-अलग तत्व बिना साफ़ तर्क के अग्रभूमि में आते-जाते रहते हैं।
व्यावहारिक हल यह है कि अपने प्रॉम्प्ट में ध्वनिक दृश्य सरल रखें। एक प्राथमिक ऑडियो स्रोत प्लस एम्बिएंट भरोसेमंद पैटर्न है। "शांत सुबह के फ़ुटपाथ पर गिटार बजाता एक स्ट्रीट म्यूज़िशियन" वाला प्रॉम्प्ट "कई बैंड, सामान बेचते विक्रेता और खेलते बच्चों वाला एक स्ट्रीट फ़ेस्टिवल" से बेहतर ऑडियो देगा। मॉडल दूसरे वाले को विज़ुअली तो संभाल लेता है, लेकिन उसका ऑडियो एक घुली-मिली लहर बन जाता है।
प्रॉम्प्ट संवेदनशीलता की समस्या
Veo 3.1 का ऑडियो आपके प्रॉम्प्ट की भाषा पर मज़बूती से निर्भर करता है। ऐसे शब्द जो आवाज़ का संकेत देते हैं, जैसे "एक तूफ़ान", "एक भरा हुआ रेस्तराँ", "चालू इंजन", ज़्यादा ऑडियो विवरण देते हैं। ऐसे शब्द जो बिना आवाज़ के संकेत के सिर्फ़ विज़ुअल कंटेंट बताते हैं, जैसे "पहाड़ों की एक पेंटिंग", "एक स्टाइलाइज़्ड पोर्ट्रेट", वे शांत, सरल ऑडियो या लगभग खामोशी देते हैं।
यह कोई बग नहीं है। मॉडल को इसी तरह व्यवहार करने के लिए ट्रेन किया गया है। अगर आपको अपने आउटपुट में समृद्ध ऑडियो चाहिए, तो आपको ऐसे प्रॉम्प्ट लिखने होंगे जो सोनिक घटनाओं का वर्णन करें, सिर्फ़ विज़ुअल संरचना नहीं। सोचें कि दृश्य में मौजूद व्यक्ति क्या सुनेगा, और उसे अपने वर्णन में शामिल करें।
💡 Tip: अपने प्रॉम्प्ट में एक अलग ऑडियो विवरण वाली लाइन जोड़ें। विज़ुअल विवरण के बाद लिखें: "Audio: sound of..." यह साफ़ ढाँचा लंबे या जटिल प्रॉम्प्ट में ऑडियो की गुणवत्ता को काफ़ी बेहतर बनाता है।

Veo 3.1 बनाम ऑडियो वाले दूसरे मॉडल
हर टेक्स्ट-टू-वीडियो मॉडल नेटिव ऑडियो नहीं बनाता। कई लोकप्रिय मॉडल अब भी सिर्फ़ वीडियो वाली क्लिप देते हैं। PicassoIA पर मौजूदा ऑडियो-सक्षम मॉडलों की तुलना यह रही:
| मॉडल | ऑडियो प्रकार | सिंक क्वालिटी | सबसे अच्छा किसके लिए |
|---|
| Veo 3.1 | नेटिव जॉइंट ऑडियो-वीडियो | उत्कृष्ट | प्राकृतिक दृश्य, डायलॉग |
| Veo 3.1 Fast | नेटिव जॉइंट ऑडियो-वीडियो | अच्छा | ऑडियो के साथ तेज़ इटरेशन |
| Veo 3.1 Lite | नेटिव जॉइंट ऑडियो-वीडियो | अच्छा | हल्का ऑडियो-वीडियो आउटपुट |
| Seedance 2.0 | बिल्ट-इन ऑडियो | अच्छा | डायनामिक एक्शन दृश्य |
| Seedance 2.5 | बिल्ट-इन ऑडियो | अच्छा | लंबी अवधि का ऑडियो-वीडियो कंटेंट |
| Pixverse v6 | सिनेमैटिक AI ऑडियो | अच्छा | सिनेमैटिक आउटपुट |
| Kling v2.1 | कोई नेटिव ऑडियो नहीं | लागू नहीं | विज़ुअल क्वालिटी पर फ़ोकस |
| Wan 2.7 T2V | कोई नेटिव ऑडियो नहीं | लागू नहीं | HD रेज़ोल्यूशन पर फ़ोकस |
Veo 3.1 की मुख्य खासियत उसका जॉइंट जनरेशन आर्किटेक्चर है। जो मॉडल ऑडियो को पोस्ट-प्रोसेस के रूप में जोड़ते हैं, भले ही वे उच्च क्वालिटी के हों, उनमें टाइमिंग में बहाव दिखता है जिसे प्रशिक्षित कान तुरंत पकड़ लेते हैं। Veo 3.1 का नेटिव तरीका इस समस्या से ढाँचागत रूप से बचता है, बेहतर मिक्सिंग से नहीं, बल्कि इसलिए कि वहाँ कोई सिंक्रोनाइज़ेशन चरण नहीं होता जिसे गलत किया जा सके।

PicassoIA पर Veo 3.1 कैसे इस्तेमाल करें
PicassoIA पर पूरा Veo 3.1 मॉडल मौजूद है, साथ ही इसका तेज़ वर्ज़न Veo 3.1 Fast और हल्का Veo 3.1 Lite भी। सबसे अच्छा ऑडियो आउटपुट पाना प्रॉम्प्ट के ढाँचे पर निर्भर करता है।
चरण 1: सही Veo 3.1 वर्ज़न चुनें
जहाँ ऑडियो मायने रखता है, वहाँ अंतिम क्वालिटी के आउटपुट के लिए पूरा Veo 3.1 इस्तेमाल करें। इटरेशन और प्रॉम्प्ट टेस्टिंग के लिए Veo 3.1 Fast इस्तेमाल करें। सरल दृश्यों पर तेज़ थ्रूपुट चाहिए हो तो Veo 3.1 Lite इस्तेमाल करें।
चरण 2: ऑडियो-सजग प्रॉम्प्ट लिखें
अपने प्रॉम्प्ट को दो हिस्सों में बनाएँ। पहले, विज़ुअल दृश्य का विस्तार से वर्णन करें। दूसरे, अंत में एक खास ऑडियो नोट जोड़ें:
- विज़ुअल: "एक व्यस्त कॉफ़ी शॉप में बरिस्ता एस्प्रेसो शॉट तैयार करता हुआ, क्लोज़-अप में पोर्टाफ़िल्टर का ग्रुप हेड में लॉक होना।"
- ऑडियो नोट: "Audio: एस्प्रेसो मशीन की हिस्स की आवाज़, पीसने की आवाज़, पृष्ठभूमि में कैफ़े की हल्की बातचीत, टाइल वाले काउंटर पर सिरेमिक कप रखने की आवाज़।"
चरण 3: प्लेबैक पर ऑडियो-विज़ुअल तालमेल जाँचें
जनरेट होने के बाद, यह तय करने से पहले कि क्लिप रखनी है या नहीं, उसे आवाज़ के साथ एक बार चलाएँ। खास तौर पर इन बातों पर ध्यान दें:
- क्या एम्बिएंट माहौल विज़ुअल सेटिंग से मेल खाता है?
- क्या स्क्रीन पर किसी टक्कर या हरकत के साथ संबंधित ऑडियो घटना है?
- क्या कुल लाउडनेस ठीक है, न कट रही है, न लगभग खामोश?
चरण 4: ऑडियो की खामियों पर प्रॉम्प्ट बदलकर इटरेट करें
अगर ऑडियो कमज़ोर या बेमेल है, तो बस दोबारा जनरेट न करें। प्रॉम्प्ट बदलें। और सोनिक विवरण जोड़ें। मुख्य ऑडियो घटनाओं को अपने वर्णन में आगे लाएँ। एक बेहतर, ऑडियो-केंद्रित प्रॉम्प्ट के साथ दूसरी बार जनरेट किया गया आउटपुट लगभग हमेशा उसी प्रॉम्प्ट के दोबारा चलाए गए आउटपुट से बेहतर होता है।
चरण 5: ज़रूरत हो तो समर्पित ऑडियो टूल्स के साथ जोड़ें
समझ आने वाली बोली के लिए, जनरेशन के बाद टेक्स्ट-टू-स्पीच मॉडल से एक वॉइस लेयर जोड़ें। कस्टम म्यूज़िक स्कोरिंग के लिए PicassoIA के AI म्यूज़िक जनरेशन टूल्स अलग से इस्तेमाल करें और पोस्ट में मिक्स करें। Veo 3.1 का नेटिव ऑडियो एक मज़बूत नींव है, अंतिम मिक्स में जो संभव है उसकी सीमा नहीं।

Veo 3.1 का ऑडियो असल में क्या बदलता है
ऑडियो ज़्यादातर क्रिएटर्स के अंदाज़े से ज़्यादा मायने रखता है, और इसकी वजह यह है कि यह पूरी क्लिप की महसूस होने वाली क्वालिटी बदल देता है। जो वीडियो अच्छा दिखता है पर गलत सुनाई देता है, वह तुरंत नकली लगता है। कान ऑडियो-विज़ुअल बेमेल को पकड़ने में बिल्कुल नहीं चूकता। जब एम्बिएंट साउंड सही हो, जब Foley ठीक समय पर लगे, जब रूम टोन जगह से मेल खाए, तब अधूरा वीडियो भी ज़्यादा असली लगता है।
Veo 3.1 ऑडियो को इतनी बार सही करता है कि डिफ़ॉल्ट तरीका, यानी एक अच्छे लिखे प्रॉम्प्ट से जनरेट करके नेटिव आउटपुट इस्तेमाल करना, ज़्यादातर उन पोस्ट-प्रोडक्शन ऑडियो पाइपलाइनों से बेहतर है जो सिर्फ़ वीडियो वाले मॉडलों पर लगाई जाती हैं। बारह महीने पहले AI वीडियो जहाँ था, उससे यह एक बड़ा बदलाव है।
जो मॉडल ऑडियो में पिछड़ते हैं, भले ही तकनीकी रूप से प्रभावशाली हों, जैसे Kling v2.1, उनमें आपको ऑडियो खुद ढूँढना, काटना और सिंक करना पड़ता है। यह कोई मामूली वर्कफ़्लो नहीं है। इसमें समय लगता है, ऑडियो एडिटिंग का कौशल चाहिए, और लगभग हमेशा एक ऐसी सीवन रह जाती है जिसे ध्यान से सुनने वाले पकड़ लेते हैं।
Veo 3.1 उस प्रक्रिया से ढूँढने और सिंक करने का चरण पूरी तरह हटा देता है। ऑडियो वीडियो के साथ ही आता है, फ़्रेम स्तर पर मेल खाता हुआ, उसी प्रॉम्प्ट से बना हुआ। यह कोई छोटी सुविधा नहीं है। सोलो क्रिएटर्स और छोटी टीमों के लिए यह एक उपयोगी क्लिप और उस क्लिप के बीच का फ़र्क है जिसे प्रकाशित होने से पहले दो घंटे और काम चाहिए।

साउंड के साथ बनाना शुरू करें
Veo 3.1 के ऑडियो को समझने का सबसे अच्छा तरीका है जानबूझकर ऑडियो प्रॉम्प्टिंग के साथ कुछ क्लिप बनाना और जो वापस आता है उसे ध्यान से सुनना। मॉडल ऐसे सटीक, सोनिक-सजग प्रॉम्प्ट लेखन को इनाम देता है, और उसका असर पहले ही प्लेबैक पर साफ़ सुनाई देता है।
PicassoIA आपको सीधे Veo 3.1, Veo 3.1 Fast, Veo 3.1 Lite और व्यापक ऑडियो-सक्षम टेक्स्ट-टू-वीडियो लाइब्रेरी तक पहुँच देता है, बिना लोकल GPU सेटअप या API क्रेडेंशियल के। आप प्रॉम्प्ट लिखते हैं, प्लेटफ़ॉर्म जनरेशन संभालता है, और हर क्लिप में ऑडियो वीडियो के साथ आता है।
एक ऐसा दृश्य लिखने की कोशिश करें जिसमें एक साफ़, केंद्रीय सोनिक घटना हो: एहरन पर काम करता लोहार, खिड़की पर बरसती बारिश, या सबवे स्टेशन पर बजाता संगीतकार। ऑडियो को अपने प्रॉम्प्ट में साफ़-साफ़ लिखें। फिर सुनें कि मॉडल क्या बनाता है।
Veo 3.1 जो बनाता है और जिसके लिए आपको पोस्ट-प्रोडक्शन ऑडियो टीम चाहिए होती, उसके बीच का फ़ासला ज़्यादातर लोगों की उम्मीद से कहीं ज़्यादा तेज़ी से घट रहा है। ऑडियो पहले से मौजूद है। ज़्यादातर क्रिएटर्स ने बस सुनना शुरू नहीं किया है।