Veo 3.1 का नेटिव ऑडियो: असली टेस्टिंग के बाद पहली राय

Google के Veo 3.1 ने वह कर दिखाया जो कुछ ही AI वीडियो मॉडल भरोसेमंद ढंग से कर पाए हैं: वीडियो के साथ ही उसी समय बना सिंक्रनाइज़्ड, नेटिव ऑडियो। यह लेख असली टेस्टिंग से मिली ईमानदार पहली राय साझा करता है, जिसमें ऑडियो क्वालिटी, स्पीच की सटीकता, एम्बिएंट साउंड, म्यूज़िक इंटीग्रेशन और यह कि यह मॉडल आज प्लेटफ़ॉर्म पर उपलब्ध दूसरे टूल्स की तुलना में कैसा है, इन सब पर ध्यान दिया गया है।

Veo 3.1 का नेटिव ऑडियो: असली टेस्टिंग के बाद पहली राय
Cristian Da Conceicao
Picasso IA के संस्थापक

Google का Veo 3.1 एक ऐसे दावे के साथ आया है जिस पर ज़्यादातर AI वीडियो टूल्स खरे उतरने में संघर्ष करते रहे हैं: ऐसा ऑडियो जो सचमुच उस वीडियो का हिस्सा लगे जिसके साथ वह चलता है। पोस्ट-प्रोसेस नहीं किया गया। किसी अलग मॉडल से ऊपर से चिपकाया नहीं गया। ऑडियो नेटिव रूप से बना है, सिंक में है, और उसी एकीकृत आउटपुट का हिस्सा है। यह एक असली फ़र्क है, और बाहरी माहौल, डायलॉग, म्यूज़िक और जटिल साउंडस्केप वाले दर्जनों टेस्ट प्रॉम्प्ट पर Veo 3.1 को परखने के बाद यह बताते हैं कि वह असल में कैसा सुनाई देता है।

"नेटिव ऑडियो" का असल मतलब क्या है

प्रोफ़ेशनल ऑडियो मिक्सिंग कंसोल जिसमें फ़ेडर, VU मीटर और ब्रॉडकास्ट स्टूडियो में चमकदार एल्युमिनियम है

ज़्यादातर AI वीडियो जनरेटर दो अलग चरणों में काम करते हैं। पहले एक वीडियो डिफ़्यूज़न मॉडल विज़ुअल फ़्रेम बनाता है। फिर एक अलग ऑडियो मॉडल या कोई इंसानी एडिटर उसके ऊपर साउंड जोड़ता है। इसी पाइपलाइन से वह गड़बड़ी पैदा होती है जो आपने शायद बहुत से AI वीडियो में देखी होगी: कदमों की आवाज़ बीट से देर से पड़ना, पेड़ों की टहनियों के झुकने की विज़ुअल तीव्रता से मेल न खाने वाली हवा की आवाज़, या खुले मैदान वाले दृश्य में भी डायलॉग का बाथरूम में रिकॉर्ड हुआ लगना।

Veo 3.1 एक अलग आर्किटेक्चरल रास्ता अपनाता है। ऑडियो और वीडियो एक साथ बनते हैं, यानी मॉडल को यह संयुक्त समझ होती है कि विज़ुअली क्या हो रहा है और उस दृश्य को कैसा सुनाई देना चाहिए। नतीजा हमेशा परफ़ेक्ट नहीं होता, लेकिन यह ऐसे ढंग से अलग है जिसे आप सुनकर पहचान सकते हैं।

पुराना तरीका बनाम नया तरीका

तरीकाऑडियो स्रोतसिंक्रनाइज़ेशनक्वालिटी की सीमा
पोस्ट-प्रोसेस ओवरलेअलग ऑडियो मॉडलमैन्युअल या ऑटोमैटिक मिलानमॉडलों के बीच के अंतर से सीमित
नेटिव संयुक्त जनरेशनवही मॉडल, एक ही पासअंतर्निहितवीडियो संदर्भ से जुड़ी

ऊपर की तालिका सरल है, लेकिन यह मुख्य समझौते को पकड़ती है। नेटिव जनरेशन बेहतर ऑडियो की गारंटी नहीं देता, पर अधिक सुसंगत ऑडियो की गारंटी ज़रूर देता है।

सिंक्रनाइज़ेशन सबसे कठिन हिस्सा क्यों था

सिंक्रनाइज़ेशन सिर्फ़ टाइमिंग की समस्या नहीं है। यह अर्थ की समस्या है। जब वीडियो में दरवाज़ा ज़ोर से बंद होता है, तो ऑडियो मॉडल को सिर्फ़ यह जानना काफ़ी नहीं कि धमाका कब होगा, बल्कि यह भी कि दरवाज़ा किस तरह का है, उसकी आवाज़ कितनी भारी है, कमरे की ध्वनिक बनावट कैसी है, और बैकग्राउंड के मुकाबले धमाका कितना तेज़ होना चाहिए। यह सब सही करने के लिए ऑडियो मॉडल को वीडियो के कंटेंट को सचमुच समझना होता है, सिर्फ़ टाइमस्टैम्प पर वेवफ़ॉर्म नहीं मिलाने होते।

💡 ध्यान दें: अपने Veo 3.1 प्रॉम्प्ट में ध्वनिक वातावरण को साफ़ लिखें। "गूँजते संगमरमर के गलियारे" या "दबी-दबी आवाज़ वाला बाहरी कैफ़े बैकग्राउंड" लिखने से नेटिव ऑडियो अधिक खास और सटीक नतीजे की ओर जाएगा।

पहली सुनवाई: एम्बिएंट साउंड की क्वालिटी

कंडेंसर स्टूडियो माइक्रोफ़ोन का क्लोज़-अप, गर्म टंगस्टन रिम लाइट और असली जाली की बनावट के साथ

एम्बिएंट साउंड वह जगह है जहाँ Veo 3.1 सबसे लगातार प्रभावशाली है। बाहरी माहौल में नेटिव जनरेशन का तरीका खास तौर पर काम आता है, क्योंकि बाहरी ऑडियो को असली बनाने वाली चीज़ अक्सर कई एक साथ चलती आवाज़ों की परतें होती हैं: अलग-अलग सतहों से गुजरती हवा, दूर का ट्रैफ़िक, अलग-अलग दूरी पर चिड़ियों की चहचहाहट, और हवा के दबाव के बदलने की धीमी गूँज।

बाहरी माहौल

जंगल के दृश्य वाले प्रॉम्प्ट के टेस्ट में ऐसा ऑडियो आया जिसमें सही तौर पर पक्षियों की चहचहाहट, हल्की हवा फ़्रेम से गुज़रते समय पत्तों की सरसराहट और दूर के पानी के स्रोत की आवाज़ थी। इनमें से कोई भी आवाज़ साफ़ तौर पर प्रॉम्प्ट में नहीं माँगी गई थी। वे विज़ुअल कंटेंट से अपने-आप निकाली गई थीं। यही मुख्य नतीजा है: Veo 3.1 दृश्य को पढ़ता है और बिना कहे ध्वनिक वास्तविकता भर देता है।

बारिश वाले दृश्यों के नतीजे खास तौर पर मज़बूत रहे। अलग-अलग सतहों पर बारिश की आवाज़ (कंक्रीट, घास और कपड़े के शामियाने पर), हर दृश्य में सही तौर पर अलग थी, भले ही प्रॉम्प्ट एक जैसा था। सामग्री के हिसाब से ऐसा ऑडियो बनाना वह चीज़ है जिसे दोहराने के लिए अलग ऑडियो मॉडल को साफ़ निर्देशों की ज़रूरत पड़ती।

इनडोर दृश्य और रूम टोन

इनडोर ऑडियो ज़्यादा मुश्किल है। रूम टोन, यानी किसी बंद जगह का बुनियादी नॉइज़ फ़्लोर, वह चीज़ है जिस पर प्रोफ़ेशनल साउंड डिज़ाइनर बहुत समय लगाते हैं, क्योंकि यह तब तक सुनाई नहीं देती जब तक गड़बड़ न हो। टेस्टिंग में Veo 3.1 बड़ी गूँज वाली जगहों को अच्छी तरह संभालता दिखा। एक कैथेड्रल वाले दृश्य में प्राकृतिक शुरुआती रिफ़्लेक्शन के साथ विश्वसनीय लो-फ़्रीक्वेंसी रूम रेज़ोनेंस आया।

छोटे, ध्वनिक रूप से ट्रीट किए गए कमरे कम सफल रहे। कुछ आउटपुट में हल्का "बाथटब" इफ़ेक्ट आया, यानी एक सूक्ष्म लेकिन साफ़ सुनाई देने वाली ओवर-रीवर्ब, जिससे अंतरंग दृश्य थोड़े ज़्यादा बड़े लगने लगे। इससे आउटपुट बिगड़ता नहीं है, लेकिन जिसने असली रूम रिकॉर्डिंग के साथ काम किया है, उसे यह सुनाई दे जाएगा।

स्पीच और डायलॉग

रोशनी कम वाले रिकॉर्डिंग बूथ में स्टूडियो मॉनिटर हेडफ़ोन पहने एक महिला की साइड प्रोफ़ाइल, एकॉस्टिक फ़ोम पैनल के साथ

डायलॉग वह हिस्सा है जहाँ पहली राय उलझ जाती है। Veo 3.1 वर्णनात्मक प्रॉम्प्ट से समझ में आने वाली स्पीच बना सकता है, जो अपने आप में एक बड़ी उपलब्धि है। लेकिन स्पीच ही वह जगह है जहाँ AI ऑडियो और प्रोफ़ेशनल वॉइस रिकॉर्डिंग के बीच का क्वालिटी का फ़र्क सबसे ज़्यादा सुनाई देता है।

डायलॉग कितना साफ़ है?

साफ़ और सरल डायलॉग प्रॉम्प्ट वाले टेस्ट में (कैमरे की ओर सीधे बोलता एक न्यूज़ एंकर, बाहर निर्देश देता एक टूर गाइड), समझ में आने की दर ऊँची रही। शब्द साफ़ थे, गति स्वाभाविक थी और ऊर्जा वर्णित दृश्य से मेल खा रही थी।

कठिनाई ज़्यादा जटिल स्पीच स्थितियों में आती है: दो किरदारों के बीच तेज़ आगे-पीछे का डायलॉग, भावनाओं की बड़ी रेंज वाली स्पीच, या ऊँचे बैकग्राउंड शोर के ऊपर चलता डायलॉग। ऐसे मामलों में स्पष्टता गिरी, और कुछ मौकों पर खास शब्द समझने मुश्किल हो गए।

निचोड़: नरेशन, मोनोलॉग और साफ़ तौर पर स्टेज किए गए डायलॉग के लिए, Veo 3.1 की स्पीच जनरेशन सचमुच काम की है। कई किरदारों वाली जटिल बातचीत के दृश्यों के लिए यह अभी भी विकसित हो रहा क्षेत्र है।

एक्सेंट और उच्चारण की सटीकता

एक्सेंट का व्यवहार असंगत रहा। किसी खास क्षेत्रीय एक्सेंट वाले किरदार के लिए प्रॉम्प्ट देने पर कभी-कभी विश्वसनीय अनुमान आया, और कभी-कभी सामान्य आवाज़ मिली जिसमें बस कुछ लहजे के उतार-चढ़ाव थे। यह सिर्फ़ Veo 3.1 की समस्या नहीं है, ज़्यादातर ऑडियो जनरेशन मॉडल इससे प्रभावित होते हैं, लेकिन जब प्रोडक्शन असली क्षेत्रीय आवाज़ों पर निर्भर हो, तो इसे जानना ज़रूरी है।

💡 प्रैक्टिकल टिप: अगर एक्सेंट की सटीकता आपके प्रोडक्शन के लिए मायने रखती है, तो एक ही प्रॉम्प्ट के कुछ वेरिएशन बनाएँ और सबसे अच्छा आउटपुट चुनें। PicassoIA पर Veo 3.1 आपको पूरा सेटअप शुरू से बनाए बिना तेज़ी से बार-बार प्रयोग करने देता है।

म्यूज़िक और स्कोर

ऑडियो वेवफ़ॉर्म और स्पेक्ट्रम एनालाइज़र दिखाता बड़ा 4K ब्रॉडकास्ट मॉनिटर, हाथों पर एम्बर स्क्रीन की चमक

AI वीडियो में बैकग्राउंड म्यूज़िक ऐतिहासिक रूप से सबसे कमज़ोर कड़ी रहा है। ज़्यादातर मॉडल ऐसा म्यूज़िक बनाते हैं जो या तो विज़ुअल मूड से सुर में मेल नहीं खाता, या समय के हिसाब से अटपटा होता है, जिसमें कॉर्ड बदलाव और बीट स्क्रीन पर चल रही क्रिया से नहीं मिलते।

मूड मिलान

Veo 3.1 मूड को पिछले मॉडलों से काफ़ी बेहतर संभालता है। हवा में लहराती लंबी घास वाला एक स्लो-मोशन बाहरी दृश्य एक नपा-तुला, मिनिमलिस्ट इंस्ट्रुमेंटल लेकर आया, जिसमें सही हार्मोनिक स्पेसिंग थी। रात की एक शहरी सड़क वाला दृश्य बेस-प्रधान, लयबद्ध रूप से घना बैकग्राउंड लेकर आया, जो विज़ुअल पेसिंग की ऊर्जा से मेल खाता था।

लगता है मॉडल विज़ुअल पेसिंग, कलर पैलेट और दृश्य के घनत्व को पढ़कर सही म्यूज़िक-रजिस्टर का अनुमान लगाता है। यह आउटपुट पर आधारित अनुमान है, लेकिन अलग-अलग प्रॉम्प्ट में यह एकरूपता बताती है कि यह संयोग नहीं है।

टेम्पो और बीट अलाइनमेंट

विज़ुअल घटनाओं के साथ बीट अलाइनमेंट ज़्यादा कठिन समस्या है, और Veo 3.1 अभी वहाँ पूरी तरह नहीं पहुँचा है। एक्शन सीक्वेंस में म्यूज़िक का टेम्पो दृश्य की आम ऊर्जा को तो पकड़ता था, लेकिन खास बीट्स शायद ही कभी विज़ुअल कट या मोशन के चरम बिंदुओं से मेल खाती थीं। ज़्यादातर उपयोगों के लिए यह चल सकता है। लेकिन म्यूज़िक वीडियो जैसे कंटेंट के लिए, जहाँ सटीक अलाइनमेंट मायने रखता है, मौजूदा आउटपुट को मैन्युअल पोस्ट-प्रोडक्शन समायोजन की ज़रूरत पड़ेगी।

मॉडल जॉनर और रजिस्टर सही पकड़ता है। लय को अभी सटीक रूप से पकड़ना बाकी है।

दूसरे मॉडलों से तुलना

देर रात की एडिटिंग सुइट में डुअल मॉनिटर की ओर झुका चालीस के आसपास का एक आदमी, ऊपर लटकते लैंप से गर्म रोशनी का शंकु

Veo 3.1 को संदर्भ में रखने के लिए यह देखना ज़रूरी है कि दूसरे नेटिव-ऑडियो वीडियो मॉडल अभी क्या बना रहे हैं, क्योंकि यह क्षेत्र तेज़ी से आगे बढ़ा है।

Veo 3.1 बनाम Veo 3

Veo 3 नेटिव ऑडियो जनरेशन लाने वाला पहला Google मॉडल था, और उसकी शुरुआत अहम थी। Veo 3.1 उस नींव को दोबारा लिखने के बजाय उसे परिष्कृत करता है। एम्बिएंट ऑडियो की क्वालिटी साफ़ तौर पर ज़्यादा सुसंगत है। मध्यम जटिलता वाले प्रॉम्प्ट में डायलॉग की स्पष्टता सुधरी है। इनडोर रूम टोन की समस्या दोनों में मौजूद है, हालाँकि 3.1 में यह थोड़ी कम है।

अगर आप अभी तेज़ जनरेशन के लिए Veo 3 Fast इस्तेमाल कर रहे हैं, तो Veo 3.1 Fast और Veo 3.1 Lite वही स्पीड टियर देते हैं, लेकिन नए ऑडियो आर्किटेक्चर के साथ।

Veo 3.1 बनाम Seedance 2.0

Seedance 2.0 और उसका छोटा साथी Seedance 2.0 Mini दोनों ByteDance के नेटिव-ऑडियो सक्षम मॉडल हैं। बराबर प्रॉम्प्ट पर साथ-साथ टेस्टिंग में Seedance 2.0 का ऑडियो ट्रेबल स्पष्टता में थोड़ा बेहतर था, जबकि Veo 3.1 ने ज़्यादा विश्वसनीय लो-फ़्रीक्वेंसी एम्बिएंट कंटेंट दिया। दोनों में से कोई निश्चित रूप से बेहतर नहीं है; वे अलग-अलग उपयोग के मामलों के लिए बने हैं।

स्पीच-प्रधान कंटेंट के लिए नतीजे इतने करीब थे कि गैर-विशेषज्ञ को फ़र्क सुनाई नहीं देगा। शुद्ध सिनेमाई एम्बिएंट काम के लिए Veo 3.1 को लो-एंड की विश्वसनीयता में थोड़ी बढ़त है।

मॉडलएम्बिएंट ताकतडायलॉग स्पष्टताम्यूज़िक सुसंगति
Veo 3.1मज़बूतअच्छीमध्यम
Veo 3अच्छीमध्यममध्यम
Seedance 2.0अच्छीअच्छीमध्यम
Sora 2मध्यमअच्छीमज़बूत

Veo 3.1 बनाम Sora 2

OpenAI का Sora 2 भी सिंक्रनाइज़्ड ऑडियो जनरेशन देता है। लंबे सीक्वेंस में इसकी विज़ुअल क्वालिटी मज़बूत बनी हुई है, लेकिन Sora 2 के टेस्ट में ऑडियो क्वालिटी ने म्यूज़िक जनरेशन में ज़्यादा सुसंगति दिखाई, इसकी कीमत पर एम्बिएंट लेयर के काम में कम प्रभावशाली रहा। दोनों मॉडल अलग-अलग प्रोडक्शन प्रोफ़ाइल की सेवा करते हैं।

इसी विषय पर परखने लायक दूसरे मॉडलों में Pixverse v6 शामिल है, जो AI ऑडियो के साथ सिनेमाई वीडियो देता है, और Flux 3 जो हाई रेज़ोल्यूशन पर सिंक्रनाइज़्ड-ऑडियो जनरेशन के लिए है। जिन टीमों को सबसे तेज़ संभव इटरेशन चाहिए, उनके लिए Seedance 2.5 पर भी नज़र डालने लायक है।

PicassoIA पर Veo 3.1 कैसे इस्तेमाल करें

फ़िल्ममेकर की डेस्क का ओवरहेड फ़्लैट-ले, स्टोरीबोर्ड, नोट्स वाले कागज़, वीडियो टाइमलाइन दिखाता लैपटॉप और कॉफ़ी मग

PicassoIA आपको अकाउंट के अलावा किसी API कॉन्फ़िगरेशन या क्रेडिट कार्ड मैनेजमेंट के बिना सीधे Veo 3.1 तक पहुँच देता है। पहली कोशिश में साफ़ ऑडियो आउटपुट कैसे पाएँ, यह यहाँ है।

चरण-दर-चरण

  1. PicassoIA पर Veo 3.1 खोलें
  2. अपना टेक्स्ट प्रॉम्प्ट लिखें, जिसमें विज़ुअल वर्णन और साफ़ ध्वनिक वर्णन दोनों शामिल हों
  3. अपना पसंदीदा रेज़ोल्यूशन सेट करें (1080p उपलब्ध है)
  4. जनरेशन सबमिट करें और आउटपुट का इंतज़ार करें, जो वीडियो और ऑडियो को एक एकीकृत फ़ाइल के रूप में देता है
  5. डाउनलोड से पहले बिल्ट-इन प्लेयर में ऑडियो का प्रीव्यू करें
  6. अगर ऑडियो की स्पष्टता कम है, तो अपने प्रॉम्प्ट में ध्वनिक विवरण बदलें और दोबारा जनरेट करें

वेरिएशन और तुलना के लिए, तेज़ इटरेशन के वास्ते Veo 3.1 Lite आज़माएँ, जिसका रेज़ोल्यूशन थोड़ा कम है, या जब स्पीड अधिकतम क्वालिटी से ज़्यादा मायने रखे, तब Veo 3.1 Fast।

बेहतर ऑडियो के लिए प्रॉम्प्ट टिप्स

बैकलिट मैकेनिकल कीबोर्ड पर टाइप करते एक प्रोफ़ेशनल आदमी के हाथों का क्लोज़-अप, मॉनिटर की नीली-सफ़ेद रोशनी

Veo 3.1 के नेटिव ऑडियो की क्वालिटी इस बात पर सीधे निर्भर करती है कि आप अपने प्रॉम्प्ट में ध्वनिक वातावरण को कितने साफ़-साफ़ ढंग से बताते हैं। टेस्टिंग से मिले सबसे असरदार पैटर्न ये हैं:

  • ध्वनिक स्थान का नाम लें: "छोटा टाइल वाला बाथरूम" बनाम "बड़ा संगमरमर का एट्रियम" बिल्कुल अलग रूम टोन देते हैं
  • ध्वनि स्रोतों की परतें बनाएँ: प्राथमिक, द्वितीयक और बैकग्राउंड ऑडियो तत्वों को एक ही प्रॉम्प्ट में अलग-अलग बताएँ
  • आयतन और दूरी वाली भाषा का इस्तेमाल करें: "दूर का ट्रैफ़िक", "पास की भीड़ की गुनगुनाहट", "क्लोज़-अप में पेन की क्लिक" जैसी बातें मॉडल को स्थानिक संकेत देती हैं
  • मूड को ध्वनिक रूप से बताएँ: "दृश्य दबा-दबा और करीब लगता है, जैसे हवा भारी हो" जैसे वाक्य ज़्यादा शांत और अंतरंग ऑडियो की ओर ले जाते हैं
  • स्पीच की विशेषताएँ बताएँ: "आत्मविश्वासी और धीमी गति वाली नैरेटर आवाज़" बनाम "उत्साहित, तेज़-तेज़ डिलीवरी" लहजे और पेसिंग को आकार देंगे

💡 त्वरित टेस्ट: कोई भी ऐसा प्रॉम्प्ट लें जो आपने पहले बिना ऑडियो वर्णन के इस्तेमाल किया हो, उसमें दृश्य की आवाज़ के बारे में सिर्फ़ तीन वाक्य जोड़ें, और आउटपुट की तुलना करें। ऑडियो की सुसंगति में फ़र्क आम तौर पर काफ़ी बड़ा होता है।

अभी किस बात पर काम बाकी है

बड़े स्टूडियो में डायरेक्शनल शॉटगन माइक्रोफ़ोन के साथ फ़्लुइड हेड ट्राइपॉड पर प्रोफ़ेशनल सिनेमा कैमरे का मीडियम शॉट

सीमाओं के बारे में ईमानदारी आशावाद से ज़्यादा काम की होती है, इसलिए यहाँ वे खास क्षेत्र हैं जहाँ Veo 3.1 का नेटिव ऑडियो अभी प्रोफ़ेशनल प्रोडक्शन मानकों तक नहीं पहुँचता।

ऑडियो आर्टिफ़ैक्ट

टेस्टिंग में सबसे लगातार दिखी समस्या एक हल्का लेकिन सुनाई देने वाला कंप्रेशन आर्टिफ़ैक्ट था, जो हाई-फ़्रीक्वेंसी कंटेंट में आता है। यह धातु की पर्क्यूशन वाले दृश्यों, स्पीच के तीखे व्यंजनों, या रात में कीड़ों जैसी ऊँची पिच वाली एम्बिएंट आवाज़ों में सबसे साफ़ नज़र आता है। यह ऑडियो का मुख्य चरित्र नहीं है, पर मौजूद है। प्रोफ़ेशनल संदर्भ में आउटपुट इस्तेमाल करने वालों को डिलीवरी से पहले हल्का ब्रॉडबैंड नॉइज़ रिडक्शन पास चलाना चाहिए।

एक दूसरा आर्टिफ़ैक्ट लंबी क्लिप्स में ऑडियो सेगमेंट की सीमाओं पर दिखता है। लंबी क्लिप्स पर Veo 3.1 के नेटिव ऑडियो की निरंतरता अच्छी है, लेकिन पूरी तरह निर्बाध नहीं। जब मॉडल अपने आंतरिक सेगमेंट बदलता है, तो कभी-कभी एक छोटी टेक्सचर की असंगति आती है, जो एक हल्की क्रॉसफ़ेड सीम जैसी लगती है।

जटिल साउंडस्केप

ऐसे प्रॉम्प्ट जिनमें सचमुच जटिल ध्वनिक वातावरण का वर्णन था (बारिश वाले शहर का व्यस्त बाहरी बाज़ार, या एक साथ भीड़ के शोर, लाइव म्यूज़िक और पब्लिक एड्रेस घोषणाओं वाला स्टेडियम), उनसे ऐसे आउटपुट आए जिनमें अलग-अलग तत्व पहचाने जा सकते थे, लेकिन लेयरिंग थोड़ी सपाट लगी। आवाज़ें मौजूद थीं, पर स्थानिक पोज़िशनिंग और सापेक्ष आयतन के रिश्ते पूरी तरह विश्वसनीय नहीं थे।

यह आंशिक रूप से फ़्रंटियर की सीमा है और आंशिक रूप से प्रॉम्प्टिंग की चुनौती। टेक्स्ट में जटिल साउंडस्केप का वर्णन करना सचमुच कठिन है, और मॉडल स्वाभाविक रूप से अस्पष्ट इनपुट के साथ अपना सर्वश्रेष्ठ कर रहा है।

क्या मदद करता है: जटिल साउंडस्केप को प्रॉम्प्ट में प्राथमिकता वाली परतों में तोड़ें। पहले प्रमुख ध्वनि लिखें, फिर सहायक ध्वनियाँ, फिर बैकग्राउंड। मॉडल को काम करने के लिए साफ़ पदानुक्रम देने से, हर चीज़ को एक ही स्तर के विवरण में बताने की तुलना में ज़्यादा विश्वसनीय आउटपुट मिलता है।

तीन खास ध्वनिक परतें, जो प्रमुखता के हिसाब से साफ़ तौर पर क्रम में हों, सब कुछ एक ही घने पैराग्राफ़ में बताने की तुलना में लगातार बेहतर परिणाम देती हैं।

खुद आज़माएँ

वर्कस्टेशन, तीन मॉनिटर और वॉल्यूमेट्रिक खिड़की की रोशनी वाले घुमावदार डेस्क के साथ प्रोफ़ेशनल वीडियो प्रोडक्शन स्टूडियो का लो-एंगल वाइड शॉट

टेस्टिंग से मिली पहली राय एक सीमा तक ही काम आती है। ऑडियो की क्वालिटी इतनी व्यक्तिगत होती है कि आपके अपने कंटेंट प्रकारों पर आपके अपने कान ही भरोसेमंद टेस्ट हैं।

PicassoIA पर Veo 3.1 अभी आपको बिना कॉन्फ़िगरेशन के झंझट के नेटिव ऑडियो जनरेशन की सुविधा देता है। अगर आप ऐसा कंटेंट बना रहे हैं जो एम्बिएंट माहौल, वॉइसओवर नरेशन या प्राकृतिक साउंडस्केप पर निर्भर है, तो इसे अपने असली उपयोग के मामलों पर गंभीरता से परखना उचित है।

तुलना के लिए, वही प्रॉम्प्ट Veo 2 पर चलाएँ (जिसमें नेटिव ऑडियो नहीं है) और सुनें कि स्ट्रक्चरल स्तर पर नेटिव जनरेशन क्या फ़र्क डालता है। फिर Veo 3.1 के आउटपुट की तुलना Hailuo 02 या Grok Imagine Video 1.5 से करें, ताकि देखा जा सके कि मौजूदा क्षेत्र विभिन्न प्रदाताओं में कैसा है।

PicassoIA पर उपलब्ध मॉडल AI वीडियो जनरेशन में अभी जो कुछ संभव है, उसकी पूरी रेंज को कवर करते हैं। ऑडियो-नेटिव मॉडल अभी नया विकास हैं, लेकिन आज के सर्वश्रेष्ठ आउटपुट और प्रोफ़ेशनल पोस्ट-प्रोडक्शन की शुरुआत के बीच की दूरी उम्मीद से कहीं ज़्यादा तेज़ी से घट रही है।

ऐसे प्रॉम्प्ट से शुरू करें जिसका दृश्य रूप आप पहले से जानते हैं, उसमें एक खास ध्वनिक वर्णन जोड़ें, और देखें कि क्या आता है। आउटपुट का ऑडियो आपको किसी भी पहली राय वाले लेख से ज़्यादा बता देगा।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख