बिना माइक्रोफ़ोन के PowerPoint, Premiere Pro और DaVinci Resolve के लिए AI वॉइसओवर

स्क्रिप्ट एक बार लिखें, AI वॉइस से साफ़ नैरेशन बनाएँ और उसे PowerPoint, Premiere Pro या DaVinci Resolve में डालें। यह लेख वॉइस मॉडल की तुलना करता है, सटीक सेटिंग्स, मेन्यू पाथ और लाउडनेस टारगेट दिखाता है, और फिर कैप्शन, डबिंग और स्लाइड विज़ुअल्स जोड़कर प्रोजेक्ट पूरा करता है।

बिना माइक्रोफ़ोन के PowerPoint, Premiere Pro और DaVinci Resolve के लिए AI वॉइसओवर
Cristian Da Conceicao
Picasso IA के संस्थापक

दस स्लाइड का डेक बनाने में एक दोपहर लगनी चाहिए। नैरेशन में हफ़्ते का बचा हुआ पूरा समय लग जाता है। आप स्लाइड 3 रिकॉर्ड करते हैं, कुत्ता भौंकता है, फिर से रिकॉर्ड करते हैं, और फिर स्लाइड 7 पर किसी प्रोडक्ट के नाम का गलत उच्चारण दिख जाता है, और स्लाइड 1 से 6 का लहजा अब मेल नहीं खाता। PowerPoint, Premiere Pro और DaVinci Resolve के लिए AI वॉइसओवर इस चक्र को खत्म कर देता है: आप स्क्रिप्ट एक बार लिखते हैं, हर स्लाइड या सीन के लिए साफ़ ऑडियो बनाते हैं, और फ़ाइलें उसी एडिटर में डालते हैं जिसे आप पहले से इस्तेमाल करते हैं।

यह लेख पूरा रास्ता दिखाता है। आप एक वॉइस मॉडल चुनेंगे, ऐसी स्क्रिप्ट लिखेंगे जो पढ़ी हुई नहीं, बल्कि बोली हुई लगे, उसे PicassoIA पर चलाएँगे, और फिर PowerPoint, Premiere Pro और DaVinci Resolve में खास मेन्यू पाथ और सेटिंग्स के साथ ऑडियो जोड़ेंगे। नतीजा ट्रेनिंग डेक, YouTube वीडियो, प्रोडक्ट डेमो और क्लाइंट प्रेज़ेंटेशन के लिए दोहराया जा सकने वाला वर्कफ़्लो है, और इसमें माइक्रोफ़ोन की ज़रूरत नहीं पड़ती।

सही वॉइस मॉडल चुनें

हर टेक्स्ट-टू-स्पीच मॉडल हर काम के लिए ठीक नहीं होता। जो वॉइस एक शांत प्रोडक्ट वॉकथ्रू पर परफ़ेक्ट लगती है, वह 30 सेकंड के दमदार प्रोमो पर फीकी लग सकती है। PicassoIA पर 24 टेक्स्ट-टू-स्पीच मॉडल सूचीबद्ध हैं, इसलिए असली सवाल यह है कि आपको इनमें से कौन-से दो-तीन चाहिए।

खाली होम रिकॉर्डिंग बूथ, जिसमें धूल भरा कंडेंसर माइक्रोफ़ोन और एकॉस्टिक फ़ोम पैनल हैं

मॉडल एक-दूसरे के सामने

स्लाइड और वीडियो नैरेशन के लिए सबसे काम के विकल्पों की तुलना यह है:

मॉडलसबसे अच्छा किसके लिएखास बात
Speech 2.8 HDस्लाइड नैरेशन, ट्यूटोरियल, लंबी स्क्रिप्टदस इमोशन स्टाइल, WAV और FLAC एक्सपोर्ट, इनलाइन पॉज़ मार्कर, 40+ भाषाएँ
Speech 2.8 Turboतेज़ ड्राफ़्ट और जल्दी रीराइटगति सबसे पहले, 2.8 HD के परिवार का ही मॉडल
ElevenLabs V3एक्सप्रेसिव नैरेशन और कैरेक्टर रीड25+ वॉइस पर्सोना, स्टाइल और स्टेबिलिटी स्लाइडर
ElevenLabs v2 Multilingualकई भाषाओं में एक ही स्क्रिप्ट30+ भाषाएँ
Gemini 3.1 Flash TTSग्लोबल रोलआउट30 वॉइस, 70+ भाषाएँ
Qwen3 TTSकस्टम या क्लोन की गई वॉइसवॉइस क्लोन करें या नई डिज़ाइन करें

हर प्रोजेक्ट के लिए एक मॉडल चुनें और उसी पर टिके रहें। एक ही डेक में तीन अलग-अलग वॉइस मिलाने से दर्शक संदेश की जगह ऑडियो पर ध्यान देने लगते हैं।

💡 टिप: एक ही 20 सेकंड का पैराग्राफ़ तीन मॉडल से जनरेट करें, हेडफ़ोन पर बारी-बारी से चलाएँ, और असली स्क्रिप्ट छूने से पहले चुनें। यहाँ पाँच मिनट लगाने से बाद में पूरा री-रेंडर बचता है।

अपनी वॉइस क्लोन करना

अगर डेक आपकी आवाज़ में होना चाहिए, या आपकी कंपनी के प्रवक्ता की आवाज़ में, तो Voice Cloning एक कस्टम वॉइस बनाता है जिसे आप दोबारा इस्तेमाल कर सकते हैं। यह जो वॉइस ID लौटाता है, वह सीधे Speech 2.8 HD में लग जाती है, इसलिए हर बाद की स्लाइड एक ही आवाज़ में रहती है। अगर आप विवरण से वॉइस डिज़ाइन करना पसंद करते हैं, तो Qwen3 TTS भी इसी तरह का रास्ता देता है। सिर्फ़ वही वॉइस क्लोन करें जो आपकी अपनी हैं या जिनके इस्तेमाल की आपके पास लिखित अनुमति है।

अखरोट की मेज़ पर रखे स्टूडियो हेडफ़ोन, बगल में हाथ से लिखी नोटबुक

ऐसी स्क्रिप्ट लिखें जो बोली हुई लगे

टेक्स्ट-टू-स्पीच वही पढ़ता है जो आप उसे देते हैं। आँखों के लिए लिखी गई स्क्रिप्ट से अकड़ा हुआ नैरेशन बनता है, इसलिए कुछ भी जनरेट करने से पहले उसे कान के लिए एडिट करें।

प्रिंटेड स्क्रिप्ट, लैपटॉप, कॉफ़ी और स्टॉपवॉच रखी हुई ओक की मेज़ का ऊपर से लिया दृश्य

संख्याएँ, एक्रोनिम और पॉज़

कुछ आदतें ज़्यादातर रोबोटिक पलों को ठीक कर देती हैं:

  • वाक्य छोटे रखें। 15 से 20 शब्दों का लक्ष्य रखें। अगर ज़ोर से पढ़ते समय साँस फूलने लगे, तो मॉडल भी जल्दबाज़ी में लगेगा।
  • मुश्किल शब्दों को वैसे लिखें जैसे वे बोले जाते हैं। अगर अक्षर चाहिए तो "S Q L" लिखें, और शब्द चाहिए तो "sequel" लिखें।
  • जब स्क्रिप्ट में तारीखें, कीमतें या बड़ी संख्याएँ हों, तो Speech 2.8 HD में English Normalization चालू करें।
  • पॉज़ मार्कर जोड़ें। <#0.5#> टाइप करने से आधा सेकंड की खामोशी जुड़ती है, जो स्लाइड बदलने के ठीक बाद परफ़ेक्ट रहती है।
  • खुद एक बार ज़ोर से पढ़ें। जो भी बात आपको अटकाती है, वही मॉडल को भी अटकाएगी।

नैरेशन लगभग 150 शब्द प्रति मिनट, यानी करीब 2.5 शब्द प्रति सेकंड की रफ़्तार से चलता है। हर स्लाइड लिखने से पहले उसका आकार तय करने के लिए यह टेबल इस्तेमाल करें:

स्लाइड या सीन की लंबाईलक्ष्य शब्द संख्या
10 सेकंडलगभग 25 शब्द
20 सेकंडलगभग 50 शब्द
30 सेकंडलगभग 75 शब्द
60 सेकंडलगभग 150 शब्द

हर स्लाइड या सीन के लिए एक फ़ाइल

हर स्लाइड को अलग ऑडियो फ़ाइल के रूप में जनरेट करें और उन्हें क्रम से नाम दें: slide-01.wav, slide-02.wav, और इसी तरह। जब कोई क्लाइंट स्लाइड 6 के शब्द बदलता है, तो आप सिर्फ़ एक फ़ाइल दोबारा बनाते हैं, पूरा नैरेशन नहीं, और बाकी हर स्लाइड अपने सटीक टाइमिंग के साथ वैसी ही रहती है। यही नियम वीडियो पर भी लागू होता है: हर सीन के लिए एक फ़ाइल, जो आपकी टाइमलाइन के क्रम से मेल खाए।

PicassoIA पर Speech 2.8 HD इस्तेमाल करें

इस वर्कफ़्लो के लिए Speech 2.8 HD मुख्य मॉडल है, क्योंकि यह लॉसलेस ऑडियो एक्सपोर्ट करता है, इनलाइन पॉज़ स्वीकार करता है और इमोशन व स्पीड पर सीधा नियंत्रण देता है।

ऑन-स्क्रीन ऑडियो वेवफ़ॉर्म एडिटर के सामने लैपटॉप ट्रैकपैड पर रखा हाथ

चरण 1: अपनी स्क्रिप्ट पेस्ट करें

मॉडल पेज खोलें और एक स्लाइड का नैरेशन Text फ़ील्ड में पेस्ट करें। एक रन में 10,000 अक्षर तक स्वीकार होते हैं, जो किसी भी एक स्लाइड की ज़रूरत से कहीं ज़्यादा है। अपने पॉज़ मार्कर अभी जोड़ लें।

चरण 2: वॉइस, इमोशन और स्पीड सेट करें

एडिटर-तैयार ऑडियो के लिए ये सेटिंग्स मायने रखती हैं:

सेटिंगसुझाया गया मानक्यों
Voice IDWise_Woman (डिफ़ॉल्ट) या English_Explanatory_Man जैसी एक्सप्लेनर वॉइससाफ़ और स्थिर डिलीवरी
Emotionट्रेनिंग के लिए calm या neutral, मार्केटिंग के लिए autoलहजा एक जैसा रखता है
Speed0.95 से 1.05अनुमत सीमा 0.5 से 2.0 है, लेकिन छोटे बदलाव प्राकृतिक लगते हैं
Pitch0सीमा माइनस 12 से प्लस 12 सेमीटोन है
Language boostEnglish या Automaticनामों और विदेशी शब्दों में मदद करता है
English normalizationसंख्याओं और तारीखों के लिए चालूथोड़ी देरी (लेटेंसी) जोड़ता है
Audio formatWAVलॉसलेस, हर एडिटर में स्वीकार्य
Sample rate44100दिया गया सबसे ऊँचा विकल्प
Channelmonoएक वॉइस को एक ही चैनल चाहिए
Subtitle enableकैप्शन चाहिए तो चालूवाक्य-स्तर के टाइमस्टैम्प लौटाता है

चरण 3: जनरेट करें, सुनें, डाउनलोड करें

मॉडल चलाएँ, फिर हेडफ़ोन पर सुनें। एक बार में एक ही सेटिंग बदलें: अगर लाइन बहुत उत्साही लगे, तो स्पीड छूने से पहले इमोशन बदलें। सही लगने पर फ़ाइल डाउनलोड करें और उसका नाम उसकी स्लाइड के हिसाब से रखें।

तीन गलतियाँ बार-बार दिखती हैं। पूरे डेक को एक लंबी फ़ाइल के रूप में जनरेट करने से बाद के बदलाव तकलीफ़देह हो जाते हैं। तंग स्लाइड में फिट करने के लिए Speed 1.3 करने से वॉइस हड़बड़ी वाली लगती है, इसलिए इसके बजाय शब्द काटें। और हेडफ़ोन पर बिना सुने आगे बढ़ने से छोटी-छोटी उच्चारण की चूकें फ़ाइनल एक्सपोर्ट तक पहुँच जाती हैं। हर स्लाइड पर एक मिनट अतिरिक्त दें, तो एडिटर वाला चरण सहज रहेगा।

💡 ElevenLabs V3 के लिए टिप: ElevenLabs V3 में Previous Text और Next Text फ़ील्ड हैं। उसके पहले की स्लाइड और उसके बाद की स्लाइड पेस्ट करें, और मॉडल सीमाओं पर इंटोनेशन को समायोजित करता है, जिससे वॉइस एक स्लाइड से दूसरी तक बहती हुई लगती है।

PowerPoint के लिए AI वॉइसओवर

PowerPoint पर नतीजा सबसे जल्दी दिखता है। नैरेशन वाले डेक को वीडियो के रूप में साझा किया जा सकता है, किओस्क पर चलाया जा सकता है, या उन लोगों को भेजा जा सकता है जो कभी लाइव कॉल में नहीं आएँगे।

एक चमकदार मीटिंग रूम में प्रोजेक्टर स्क्रीन के बगल में खड़ा प्रेज़ेंटर

हर स्लाइड में ऑडियो जोड़ें

  1. थंबनेल पैन में पहली स्लाइड चुनें।
  2. Insert, फिर Audio, फिर Audio on My PC चुनें और slide-01.wav चुनें।
  3. Playback टैब पर Start को Automatically पर सेट करें और Hide During Show पर टिक करें, ताकि स्पीकर आइकन न दिखे।
  4. क्लिप की सटीक अवधि पढ़ने के लिए Trim Audio पर क्लिक करें।
  5. Transitions टैब पर Advance Slide के अंतर्गत After पर टिक करें और वह अवधि लिखें, साथ में आधा सेकंड साँस लेने की जगह।
  6. हर स्लाइड के लिए दोहराएँ।

अब ऑडियो अपने आप शुरू होता है, और वाक्य खत्म होने पर स्लाइड आगे बढ़ जाती है। प्लेबैक के दौरान कोई क्लिक नहीं चाहिए। अगर किसी स्लाइड में एनिमेशन हैं, तो उन्हें Start: After Previous पर सेट करें, ताकि बिल्ड सीक्वेंस क्लिक का इंतज़ार करने के बजाय वॉइस के साथ चले।

💡 टिप: जो डेक ईमेल से जाते हैं, उनके लिए Speech 2.8 HD से नैरेशन को WAV के बजाय 128 kbps पर MP3 के रूप में एक्सपोर्ट करें। फ़ाइल छोटी रहती है, और लैपटॉप स्पीकर पर कोई फ़र्क नहीं सुनता।

नैरेटेड वीडियो एक्सपोर्ट करें

File, फिर Export, फिर Create a Video पर जाएँ। Full HD (1080p) चुनें, Use Recorded Timings and Narrations चुना रहने दें और Create Video पर क्लिक करें। PowerPoint आपके लिखे advance टाइमिंग का सम्मान करता है, इसलिए वीडियो सेकंड-दर-सेकंड ऑडियो से मेल खाता है।

Premiere Pro में AI वॉइसओवर

वीडियो एडिट में वॉइस आपका एंकर होती है। AI ऑडियो टेकों के बीच गति में कभी नहीं बदलता, इसलिए आप पहले नैरेशन लॉक कर सकते हैं और फिर तस्वीरों को उसी के हिसाब से काट सकते हैं।

मल्टी-ट्रैक टाइमलाइन वाले ड्यूल मॉनिटर सेटअप पर काम करता वीडियो एडिटर, पीछे से दिखता हुआ

इम्पोर्ट करें और टाइमलाइन से सिंक करें

  1. Ctrl+I दबाएँ (Mac पर Cmd+I) और हर वॉइस फ़ाइल को VO नाम के bin में इम्पोर्ट करें।
  2. scene-01.wav को सीक्वेंस की शुरुआत में A1 पर ड्रैग करें, फिर अगली फ़ाइलें एक के बाद एक लगाएँ।
  3. Razor टूल (C) और ripple delete का इस्तेमाल करें, जिस भी गैप को आप ज़रूरत से लंबा पाएँ उसे कसने के लिए।
  4. जिन सटीक शब्दों पर विज़ुअल बदलना चाहिए, वहाँ M दबाएँ, फिर अपने फ़ुटेज को उन मार्करों पर काटें।

Premiere 44.1 kHz फ़ाइलों को 48 kHz सीक्वेंस में अपने आप बदल देता है, इसलिए आपको हाथ से रीसैंपल करने की ज़रूरत नहीं है।

Essential Sound से साफ़ करें

Window, फिर Essential Sound खोलें, वॉइस क्लिप चुनें और Dialogue पर क्लिक करें। Loudness के अंतर्गत Auto-Match दबाएँ। म्यूज़िक को अलग ट्रैक पर रखें, उसे Music टैग करें, और डायलॉग क्लिप्स पर Ducking चालू करें, ताकि वॉइस बोलने पर साउंडट्रैक नीचे आ जाए। अगर कोई S ध्वनि तीखी लगे, तो वॉइस ट्रैक पर DeEsser इफ़ेक्ट जोड़ें।

ट्रैकसामग्रीलक्ष्य
A1AI वॉइसओवरDialogue टैग, Auto-Match
A2म्यूज़िकMusic टैग, A1 के नीचे दबा हुआ
A3साउंड इफ़ेक्टमिक्स में धीमे, कभी वॉइस से तेज़ नहीं
Final mixपूरा सीक्वेंसवेब वीडियो के लिए लगभग minus 14 LUFS

💡 टिप: अगर कोई एक लाइन गलत लगे, तो उसे प्लगइन से ठीक न करें। टेक्स्ट बदलें, उस एक फ़ाइल को समान सेटिंग्स के साथ दोबारा जनरेट करें और टाइमलाइन पर बदल दें। कान से ठीक करने से यह कम समय लेता है।

DaVinci Resolve में AI वॉइसओवर

Resolve भी इसी तरीके का फ़ायदा देता है। वॉइस लॉक करें, फिर बाकी सब उसी के आसपास बनाएँ। नीचे दिए हर चरण के लिए Resolve का मुफ़्त वर्ज़न काफ़ी है।

कॉम्पैक्ट ऑडियो मिक्सिंग कंट्रोल सरफ़ेस पर फ़ेडर एडजस्ट करते हाथ

Edit पेज पर एडिट बनाएँ

  1. Ctrl+I दबाएँ, या अपनी वॉइस फ़ाइलें Media Pool में ड्रैग करें।
  2. Edit पेज पर हर फ़ाइल को सीन के क्रम में Audio 1 पर डालें।
  3. हर क्लिप की शुरुआत और अंत की खामोशी काटने के लिए B दबाकर Blade टूल चुनें, फिर ripple delete से गैप बंद करें।
  4. जिन शब्दों पर तस्वीर बदलनी चाहिए, वहाँ टाइमलाइन मार्कर डालने के लिए M दबाएँ।

Resolve 44.1 kHz फ़ाइलों को 48 kHz टाइमलाइन में अपने आप रीसैंपल कर देता है।

Fairlight में लेवल संतुलित करें

Fairlight पेज पर जाएँ। वॉइस क्लिप्स पर राइट क्लिक करें और Normalize Audio Levels चुनें, ताकि हर सीन एक ही लाउडनेस पर आए। लाउडनेस मीटर पर नतीजा जाँचें और Main 1 बस को तब तक एडजस्ट करें जब तक फ़ाइनल टाइमलाइन वेब डिलीवरी के लिए लगभग minus 14 LUFS पर न आ जाए। म्यूज़िक के लिए, या तो ऑटोमेशन से हाथ से वॉल्यूम ऊपर-नीचे करें, या म्यूज़िक ट्रैक पर वॉइस को साइड-चेन बनाकर कंप्रेसर लगाएँ।

तीनों टूल एक ही कामों पर कैसे मेल खाते हैं, यह यहाँ है:

कार्यPowerPointPremiere ProDaVinci Resolve
ऑडियो इम्पोर्टInsert, Audio, Audio on My PCFile, ImportFile, Import, Media
सबसे अच्छा फ़ाइल फ़ॉर्मेट128 kbps पर MP3WAVWAV
टाइमिंग का तरीकाAdvance Slide, AfterRazor टूल और ripple deleteBlade टूल और ripple delete
लेवल मिलानाप्लेबैक वॉल्यूमEssential Sound, Auto-MatchFairlight में Normalize Audio Levels
एक्सपोर्टCreate a VideoExport (Ctrl+M)Deliver पेज

कैप्शन, डबिंग और विज़ुअल्स

वॉइसओवर तैयार वीडियो का सिर्फ़ एक हिस्सा है। वही स्क्रिप्ट कैप्शन, अनुवाद और स्क्रीन पर दिखने वाली तस्वीरों को भी आधार देती है।

चमकदार कोवर्किंग स्पेस में हेडफ़ोन लगाकर सुनती महिला, अग्रभूमि में ट्राइपॉड

एक ही स्क्रिप्ट से कैप्शन और डबिंग

कैप्शन के लिए, वाक्य-स्तर के टाइमस्टैम्प पाने हेतु Speech 2.8 HD में subtitle metadata चालू करें, या ट्रांसक्रिप्ट पाने के लिए तैयार ऑडियो को GPT-4o Transcribe से चलाएँ, फिर Autocaption से एक्सपोर्ट की गई क्लिप में कैप्शन बर्न करें।

दूसरी भाषाओं के लिए आपके पास दो साफ़ रास्ते हैं:

  • ऑडियो फिर से जनरेट करें। स्क्रिप्ट का अनुवाद करें, वही सेटिंग्स रखें और Gemini 3.1 Flash TTS या ElevenLabs v2 Multilingual से दोबारा चलाएँ।
  • तैयार वीडियो की डबिंग करें। ElevenLabs Dubbing एक ही पास में वीडियो को 90+ भाषाओं में अनुवाद करता है।

किसी मौजूदा MP4 में एडिटर खोले बिना नई वॉइस ट्रैक जोड़ने के लिए, Video Audio Merge साउंडट्रैक को बदलता या मिलाता है।

स्लाइड विज़ुअल्स और B-Roll स्टिल्स

बढ़िया नैरेशन कमज़ोर तस्वीरों पर भी दर्शक को खो देता है। अपनी स्लाइड और कटअवे के लिए टेक्स्ट-टू-इमेज मॉडल से फ़ोटोग्राफ़िक स्टिल्स बनाएँ: ड्राफ़्ट के लिए P Image तेज़ है, जबकि मुख्य तस्वीरों के लिए Seedream 4.5 और FLUX.2 Pro ठीक रहते हैं। लेंस, रोशनी और सतह की बनावट का वर्णन करें, और रेशियो 16:9 रखें, ताकि इमेज बिना काटे स्लाइड या टाइमलाइन फ़्रेम में पूरी फिट हो।

सफ़ेद दीवार पर विज़ुअल मूड बोर्ड के रूप में प्रिंटेड तस्वीरें पिन करता डिज़ाइनर

अगले प्रोजेक्ट पर आज़माएँ

वह एक डेक या वीडियो चुनें जिसे आप रिकॉर्ड करना टालते आ रहे हैं। उसकी पहली स्लाइड Speech 2.8 HD में PicassoIA पर पेस्ट करें, run दबाएँ, और फ़ाइल को PowerPoint, Premiere Pro या DaVinci Resolve में डाल दें। फिर अगली स्लाइड एक अलग वॉइस से जनरेट करके तुलना करें। तीसरी फ़ाइल तक आप जान जाएँगे कि कौन-सी वॉइस आपके कंटेंट पर फिट बैठती है और किन सेटिंग्स को दोबारा छूने की ज़रूरत नहीं।

इस वर्कफ़्लो की हर चीज़ एक ही जगह है: वॉइस, ट्रांसक्रिप्शन, कैप्शन, डबिंग और इमेज जनरेशन। पूरा कैटलॉग picassoia.com/en/all-models पर देखें, अपनी स्क्रिप्ट पर दो-तीन वॉइस आज़माएँ, और अपने अगले डेक को खुद अपना नैरेशन करने दें।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख