दस स्लाइड का डेक बनाने में एक दोपहर लगनी चाहिए। नैरेशन में हफ़्ते का बचा हुआ पूरा समय लग जाता है। आप स्लाइड 3 रिकॉर्ड करते हैं, कुत्ता भौंकता है, फिर से रिकॉर्ड करते हैं, और फिर स्लाइड 7 पर किसी प्रोडक्ट के नाम का गलत उच्चारण दिख जाता है, और स्लाइड 1 से 6 का लहजा अब मेल नहीं खाता। PowerPoint, Premiere Pro और DaVinci Resolve के लिए AI वॉइसओवर इस चक्र को खत्म कर देता है: आप स्क्रिप्ट एक बार लिखते हैं, हर स्लाइड या सीन के लिए साफ़ ऑडियो बनाते हैं, और फ़ाइलें उसी एडिटर में डालते हैं जिसे आप पहले से इस्तेमाल करते हैं।
यह लेख पूरा रास्ता दिखाता है। आप एक वॉइस मॉडल चुनेंगे, ऐसी स्क्रिप्ट लिखेंगे जो पढ़ी हुई नहीं, बल्कि बोली हुई लगे, उसे PicassoIA पर चलाएँगे, और फिर PowerPoint, Premiere Pro और DaVinci Resolve में खास मेन्यू पाथ और सेटिंग्स के साथ ऑडियो जोड़ेंगे। नतीजा ट्रेनिंग डेक, YouTube वीडियो, प्रोडक्ट डेमो और क्लाइंट प्रेज़ेंटेशन के लिए दोहराया जा सकने वाला वर्कफ़्लो है, और इसमें माइक्रोफ़ोन की ज़रूरत नहीं पड़ती।
सही वॉइस मॉडल चुनें
हर टेक्स्ट-टू-स्पीच मॉडल हर काम के लिए ठीक नहीं होता। जो वॉइस एक शांत प्रोडक्ट वॉकथ्रू पर परफ़ेक्ट लगती है, वह 30 सेकंड के दमदार प्रोमो पर फीकी लग सकती है। PicassoIA पर 24 टेक्स्ट-टू-स्पीच मॉडल सूचीबद्ध हैं, इसलिए असली सवाल यह है कि आपको इनमें से कौन-से दो-तीन चाहिए।

मॉडल एक-दूसरे के सामने
स्लाइड और वीडियो नैरेशन के लिए सबसे काम के विकल्पों की तुलना यह है:
| मॉडल | सबसे अच्छा किसके लिए | खास बात |
|---|
| Speech 2.8 HD | स्लाइड नैरेशन, ट्यूटोरियल, लंबी स्क्रिप्ट | दस इमोशन स्टाइल, WAV और FLAC एक्सपोर्ट, इनलाइन पॉज़ मार्कर, 40+ भाषाएँ |
| Speech 2.8 Turbo | तेज़ ड्राफ़्ट और जल्दी रीराइट | गति सबसे पहले, 2.8 HD के परिवार का ही मॉडल |
| ElevenLabs V3 | एक्सप्रेसिव नैरेशन और कैरेक्टर रीड | 25+ वॉइस पर्सोना, स्टाइल और स्टेबिलिटी स्लाइडर |
| ElevenLabs v2 Multilingual | कई भाषाओं में एक ही स्क्रिप्ट | 30+ भाषाएँ |
| Gemini 3.1 Flash TTS | ग्लोबल रोलआउट | 30 वॉइस, 70+ भाषाएँ |
| Qwen3 TTS | कस्टम या क्लोन की गई वॉइस | वॉइस क्लोन करें या नई डिज़ाइन करें |
हर प्रोजेक्ट के लिए एक मॉडल चुनें और उसी पर टिके रहें। एक ही डेक में तीन अलग-अलग वॉइस मिलाने से दर्शक संदेश की जगह ऑडियो पर ध्यान देने लगते हैं।
💡 टिप: एक ही 20 सेकंड का पैराग्राफ़ तीन मॉडल से जनरेट करें, हेडफ़ोन पर बारी-बारी से चलाएँ, और असली स्क्रिप्ट छूने से पहले चुनें। यहाँ पाँच मिनट लगाने से बाद में पूरा री-रेंडर बचता है।
अपनी वॉइस क्लोन करना
अगर डेक आपकी आवाज़ में होना चाहिए, या आपकी कंपनी के प्रवक्ता की आवाज़ में, तो Voice Cloning एक कस्टम वॉइस बनाता है जिसे आप दोबारा इस्तेमाल कर सकते हैं। यह जो वॉइस ID लौटाता है, वह सीधे Speech 2.8 HD में लग जाती है, इसलिए हर बाद की स्लाइड एक ही आवाज़ में रहती है। अगर आप विवरण से वॉइस डिज़ाइन करना पसंद करते हैं, तो Qwen3 TTS भी इसी तरह का रास्ता देता है। सिर्फ़ वही वॉइस क्लोन करें जो आपकी अपनी हैं या जिनके इस्तेमाल की आपके पास लिखित अनुमति है।

ऐसी स्क्रिप्ट लिखें जो बोली हुई लगे
टेक्स्ट-टू-स्पीच वही पढ़ता है जो आप उसे देते हैं। आँखों के लिए लिखी गई स्क्रिप्ट से अकड़ा हुआ नैरेशन बनता है, इसलिए कुछ भी जनरेट करने से पहले उसे कान के लिए एडिट करें।

संख्याएँ, एक्रोनिम और पॉज़
कुछ आदतें ज़्यादातर रोबोटिक पलों को ठीक कर देती हैं:
- वाक्य छोटे रखें। 15 से 20 शब्दों का लक्ष्य रखें। अगर ज़ोर से पढ़ते समय साँस फूलने लगे, तो मॉडल भी जल्दबाज़ी में लगेगा।
- मुश्किल शब्दों को वैसे लिखें जैसे वे बोले जाते हैं। अगर अक्षर चाहिए तो "S Q L" लिखें, और शब्द चाहिए तो "sequel" लिखें।
- जब स्क्रिप्ट में तारीखें, कीमतें या बड़ी संख्याएँ हों, तो Speech 2.8 HD में English Normalization चालू करें।
- पॉज़ मार्कर जोड़ें।
<#0.5#> टाइप करने से आधा सेकंड की खामोशी जुड़ती है, जो स्लाइड बदलने के ठीक बाद परफ़ेक्ट रहती है।
- खुद एक बार ज़ोर से पढ़ें। जो भी बात आपको अटकाती है, वही मॉडल को भी अटकाएगी।
नैरेशन लगभग 150 शब्द प्रति मिनट, यानी करीब 2.5 शब्द प्रति सेकंड की रफ़्तार से चलता है। हर स्लाइड लिखने से पहले उसका आकार तय करने के लिए यह टेबल इस्तेमाल करें:
| स्लाइड या सीन की लंबाई | लक्ष्य शब्द संख्या |
|---|
| 10 सेकंड | लगभग 25 शब्द |
| 20 सेकंड | लगभग 50 शब्द |
| 30 सेकंड | लगभग 75 शब्द |
| 60 सेकंड | लगभग 150 शब्द |
हर स्लाइड या सीन के लिए एक फ़ाइल
हर स्लाइड को अलग ऑडियो फ़ाइल के रूप में जनरेट करें और उन्हें क्रम से नाम दें: slide-01.wav, slide-02.wav, और इसी तरह। जब कोई क्लाइंट स्लाइड 6 के शब्द बदलता है, तो आप सिर्फ़ एक फ़ाइल दोबारा बनाते हैं, पूरा नैरेशन नहीं, और बाकी हर स्लाइड अपने सटीक टाइमिंग के साथ वैसी ही रहती है। यही नियम वीडियो पर भी लागू होता है: हर सीन के लिए एक फ़ाइल, जो आपकी टाइमलाइन के क्रम से मेल खाए।
PicassoIA पर Speech 2.8 HD इस्तेमाल करें
इस वर्कफ़्लो के लिए Speech 2.8 HD मुख्य मॉडल है, क्योंकि यह लॉसलेस ऑडियो एक्सपोर्ट करता है, इनलाइन पॉज़ स्वीकार करता है और इमोशन व स्पीड पर सीधा नियंत्रण देता है।

चरण 1: अपनी स्क्रिप्ट पेस्ट करें
मॉडल पेज खोलें और एक स्लाइड का नैरेशन Text फ़ील्ड में पेस्ट करें। एक रन में 10,000 अक्षर तक स्वीकार होते हैं, जो किसी भी एक स्लाइड की ज़रूरत से कहीं ज़्यादा है। अपने पॉज़ मार्कर अभी जोड़ लें।
चरण 2: वॉइस, इमोशन और स्पीड सेट करें
एडिटर-तैयार ऑडियो के लिए ये सेटिंग्स मायने रखती हैं:
| सेटिंग | सुझाया गया मान | क्यों |
|---|
| Voice ID | Wise_Woman (डिफ़ॉल्ट) या English_Explanatory_Man जैसी एक्सप्लेनर वॉइस | साफ़ और स्थिर डिलीवरी |
| Emotion | ट्रेनिंग के लिए calm या neutral, मार्केटिंग के लिए auto | लहजा एक जैसा रखता है |
| Speed | 0.95 से 1.05 | अनुमत सीमा 0.5 से 2.0 है, लेकिन छोटे बदलाव प्राकृतिक लगते हैं |
| Pitch | 0 | सीमा माइनस 12 से प्लस 12 सेमीटोन है |
| Language boost | English या Automatic | नामों और विदेशी शब्दों में मदद करता है |
| English normalization | संख्याओं और तारीखों के लिए चालू | थोड़ी देरी (लेटेंसी) जोड़ता है |
| Audio format | WAV | लॉसलेस, हर एडिटर में स्वीकार्य |
| Sample rate | 44100 | दिया गया सबसे ऊँचा विकल्प |
| Channel | mono | एक वॉइस को एक ही चैनल चाहिए |
| Subtitle enable | कैप्शन चाहिए तो चालू | वाक्य-स्तर के टाइमस्टैम्प लौटाता है |
चरण 3: जनरेट करें, सुनें, डाउनलोड करें
मॉडल चलाएँ, फिर हेडफ़ोन पर सुनें। एक बार में एक ही सेटिंग बदलें: अगर लाइन बहुत उत्साही लगे, तो स्पीड छूने से पहले इमोशन बदलें। सही लगने पर फ़ाइल डाउनलोड करें और उसका नाम उसकी स्लाइड के हिसाब से रखें।
तीन गलतियाँ बार-बार दिखती हैं। पूरे डेक को एक लंबी फ़ाइल के रूप में जनरेट करने से बाद के बदलाव तकलीफ़देह हो जाते हैं। तंग स्लाइड में फिट करने के लिए Speed 1.3 करने से वॉइस हड़बड़ी वाली लगती है, इसलिए इसके बजाय शब्द काटें। और हेडफ़ोन पर बिना सुने आगे बढ़ने से छोटी-छोटी उच्चारण की चूकें फ़ाइनल एक्सपोर्ट तक पहुँच जाती हैं। हर स्लाइड पर एक मिनट अतिरिक्त दें, तो एडिटर वाला चरण सहज रहेगा।
💡 ElevenLabs V3 के लिए टिप: ElevenLabs V3 में Previous Text और Next Text फ़ील्ड हैं। उसके पहले की स्लाइड और उसके बाद की स्लाइड पेस्ट करें, और मॉडल सीमाओं पर इंटोनेशन को समायोजित करता है, जिससे वॉइस एक स्लाइड से दूसरी तक बहती हुई लगती है।
PowerPoint के लिए AI वॉइसओवर
PowerPoint पर नतीजा सबसे जल्दी दिखता है। नैरेशन वाले डेक को वीडियो के रूप में साझा किया जा सकता है, किओस्क पर चलाया जा सकता है, या उन लोगों को भेजा जा सकता है जो कभी लाइव कॉल में नहीं आएँगे।

हर स्लाइड में ऑडियो जोड़ें
- थंबनेल पैन में पहली स्लाइड चुनें।
- Insert, फिर Audio, फिर Audio on My PC चुनें और
slide-01.wav चुनें।
- Playback टैब पर Start को Automatically पर सेट करें और Hide During Show पर टिक करें, ताकि स्पीकर आइकन न दिखे।
- क्लिप की सटीक अवधि पढ़ने के लिए Trim Audio पर क्लिक करें।
- Transitions टैब पर Advance Slide के अंतर्गत After पर टिक करें और वह अवधि लिखें, साथ में आधा सेकंड साँस लेने की जगह।
- हर स्लाइड के लिए दोहराएँ।
अब ऑडियो अपने आप शुरू होता है, और वाक्य खत्म होने पर स्लाइड आगे बढ़ जाती है। प्लेबैक के दौरान कोई क्लिक नहीं चाहिए। अगर किसी स्लाइड में एनिमेशन हैं, तो उन्हें Start: After Previous पर सेट करें, ताकि बिल्ड सीक्वेंस क्लिक का इंतज़ार करने के बजाय वॉइस के साथ चले।
💡 टिप: जो डेक ईमेल से जाते हैं, उनके लिए Speech 2.8 HD से नैरेशन को WAV के बजाय 128 kbps पर MP3 के रूप में एक्सपोर्ट करें। फ़ाइल छोटी रहती है, और लैपटॉप स्पीकर पर कोई फ़र्क नहीं सुनता।
नैरेटेड वीडियो एक्सपोर्ट करें
File, फिर Export, फिर Create a Video पर जाएँ। Full HD (1080p) चुनें, Use Recorded Timings and Narrations चुना रहने दें और Create Video पर क्लिक करें। PowerPoint आपके लिखे advance टाइमिंग का सम्मान करता है, इसलिए वीडियो सेकंड-दर-सेकंड ऑडियो से मेल खाता है।
Premiere Pro में AI वॉइसओवर
वीडियो एडिट में वॉइस आपका एंकर होती है। AI ऑडियो टेकों के बीच गति में कभी नहीं बदलता, इसलिए आप पहले नैरेशन लॉक कर सकते हैं और फिर तस्वीरों को उसी के हिसाब से काट सकते हैं।

इम्पोर्ट करें और टाइमलाइन से सिंक करें
- Ctrl+I दबाएँ (Mac पर Cmd+I) और हर वॉइस फ़ाइल को VO नाम के bin में इम्पोर्ट करें।
scene-01.wav को सीक्वेंस की शुरुआत में A1 पर ड्रैग करें, फिर अगली फ़ाइलें एक के बाद एक लगाएँ।
- Razor टूल (C) और ripple delete का इस्तेमाल करें, जिस भी गैप को आप ज़रूरत से लंबा पाएँ उसे कसने के लिए।
- जिन सटीक शब्दों पर विज़ुअल बदलना चाहिए, वहाँ M दबाएँ, फिर अपने फ़ुटेज को उन मार्करों पर काटें।
Premiere 44.1 kHz फ़ाइलों को 48 kHz सीक्वेंस में अपने आप बदल देता है, इसलिए आपको हाथ से रीसैंपल करने की ज़रूरत नहीं है।
Essential Sound से साफ़ करें
Window, फिर Essential Sound खोलें, वॉइस क्लिप चुनें और Dialogue पर क्लिक करें। Loudness के अंतर्गत Auto-Match दबाएँ। म्यूज़िक को अलग ट्रैक पर रखें, उसे Music टैग करें, और डायलॉग क्लिप्स पर Ducking चालू करें, ताकि वॉइस बोलने पर साउंडट्रैक नीचे आ जाए। अगर कोई S ध्वनि तीखी लगे, तो वॉइस ट्रैक पर DeEsser इफ़ेक्ट जोड़ें।
| ट्रैक | सामग्री | लक्ष्य |
|---|
| A1 | AI वॉइसओवर | Dialogue टैग, Auto-Match |
| A2 | म्यूज़िक | Music टैग, A1 के नीचे दबा हुआ |
| A3 | साउंड इफ़ेक्ट | मिक्स में धीमे, कभी वॉइस से तेज़ नहीं |
| Final mix | पूरा सीक्वेंस | वेब वीडियो के लिए लगभग minus 14 LUFS |
💡 टिप: अगर कोई एक लाइन गलत लगे, तो उसे प्लगइन से ठीक न करें। टेक्स्ट बदलें, उस एक फ़ाइल को समान सेटिंग्स के साथ दोबारा जनरेट करें और टाइमलाइन पर बदल दें। कान से ठीक करने से यह कम समय लेता है।
DaVinci Resolve में AI वॉइसओवर
Resolve भी इसी तरीके का फ़ायदा देता है। वॉइस लॉक करें, फिर बाकी सब उसी के आसपास बनाएँ। नीचे दिए हर चरण के लिए Resolve का मुफ़्त वर्ज़न काफ़ी है।

Edit पेज पर एडिट बनाएँ
- Ctrl+I दबाएँ, या अपनी वॉइस फ़ाइलें Media Pool में ड्रैग करें।
- Edit पेज पर हर फ़ाइल को सीन के क्रम में Audio 1 पर डालें।
- हर क्लिप की शुरुआत और अंत की खामोशी काटने के लिए B दबाकर Blade टूल चुनें, फिर ripple delete से गैप बंद करें।
- जिन शब्दों पर तस्वीर बदलनी चाहिए, वहाँ टाइमलाइन मार्कर डालने के लिए M दबाएँ।
Resolve 44.1 kHz फ़ाइलों को 48 kHz टाइमलाइन में अपने आप रीसैंपल कर देता है।
Fairlight में लेवल संतुलित करें
Fairlight पेज पर जाएँ। वॉइस क्लिप्स पर राइट क्लिक करें और Normalize Audio Levels चुनें, ताकि हर सीन एक ही लाउडनेस पर आए। लाउडनेस मीटर पर नतीजा जाँचें और Main 1 बस को तब तक एडजस्ट करें जब तक फ़ाइनल टाइमलाइन वेब डिलीवरी के लिए लगभग minus 14 LUFS पर न आ जाए। म्यूज़िक के लिए, या तो ऑटोमेशन से हाथ से वॉल्यूम ऊपर-नीचे करें, या म्यूज़िक ट्रैक पर वॉइस को साइड-चेन बनाकर कंप्रेसर लगाएँ।
तीनों टूल एक ही कामों पर कैसे मेल खाते हैं, यह यहाँ है:
| कार्य | PowerPoint | Premiere Pro | DaVinci Resolve |
|---|
| ऑडियो इम्पोर्ट | Insert, Audio, Audio on My PC | File, Import | File, Import, Media |
| सबसे अच्छा फ़ाइल फ़ॉर्मेट | 128 kbps पर MP3 | WAV | WAV |
| टाइमिंग का तरीका | Advance Slide, After | Razor टूल और ripple delete | Blade टूल और ripple delete |
| लेवल मिलाना | प्लेबैक वॉल्यूम | Essential Sound, Auto-Match | Fairlight में Normalize Audio Levels |
| एक्सपोर्ट | Create a Video | Export (Ctrl+M) | Deliver पेज |
कैप्शन, डबिंग और विज़ुअल्स
वॉइसओवर तैयार वीडियो का सिर्फ़ एक हिस्सा है। वही स्क्रिप्ट कैप्शन, अनुवाद और स्क्रीन पर दिखने वाली तस्वीरों को भी आधार देती है।

एक ही स्क्रिप्ट से कैप्शन और डबिंग
कैप्शन के लिए, वाक्य-स्तर के टाइमस्टैम्प पाने हेतु Speech 2.8 HD में subtitle metadata चालू करें, या ट्रांसक्रिप्ट पाने के लिए तैयार ऑडियो को GPT-4o Transcribe से चलाएँ, फिर Autocaption से एक्सपोर्ट की गई क्लिप में कैप्शन बर्न करें।
दूसरी भाषाओं के लिए आपके पास दो साफ़ रास्ते हैं:
किसी मौजूदा MP4 में एडिटर खोले बिना नई वॉइस ट्रैक जोड़ने के लिए, Video Audio Merge साउंडट्रैक को बदलता या मिलाता है।
स्लाइड विज़ुअल्स और B-Roll स्टिल्स
बढ़िया नैरेशन कमज़ोर तस्वीरों पर भी दर्शक को खो देता है। अपनी स्लाइड और कटअवे के लिए टेक्स्ट-टू-इमेज मॉडल से फ़ोटोग्राफ़िक स्टिल्स बनाएँ: ड्राफ़्ट के लिए P Image तेज़ है, जबकि मुख्य तस्वीरों के लिए Seedream 4.5 और FLUX.2 Pro ठीक रहते हैं। लेंस, रोशनी और सतह की बनावट का वर्णन करें, और रेशियो 16:9 रखें, ताकि इमेज बिना काटे स्लाइड या टाइमलाइन फ़्रेम में पूरी फिट हो।

अगले प्रोजेक्ट पर आज़माएँ
वह एक डेक या वीडियो चुनें जिसे आप रिकॉर्ड करना टालते आ रहे हैं। उसकी पहली स्लाइड Speech 2.8 HD में PicassoIA पर पेस्ट करें, run दबाएँ, और फ़ाइल को PowerPoint, Premiere Pro या DaVinci Resolve में डाल दें। फिर अगली स्लाइड एक अलग वॉइस से जनरेट करके तुलना करें। तीसरी फ़ाइल तक आप जान जाएँगे कि कौन-सी वॉइस आपके कंटेंट पर फिट बैठती है और किन सेटिंग्स को दोबारा छूने की ज़रूरत नहीं।
इस वर्कफ़्लो की हर चीज़ एक ही जगह है: वॉइस, ट्रांसक्रिप्शन, कैप्शन, डबिंग और इमेज जनरेशन। पूरा कैटलॉग picassoia.com/en/all-models पर देखें, अपनी स्क्रिप्ट पर दो-तीन वॉइस आज़माएँ, और अपने अगले डेक को खुद अपना नैरेशन करने दें।