आज सुबह आपकी ट्रेन में कोई न कोई इस वक़्त एक उपन्यास सुन रहा होगा, और उसे पढ़ने वाली आवाज़ शायद कभी साँस भी न लेती हो। मुफ़्त AI ऑडियोबुक नैरेशन खोजने पर पहले रोबोटिक आवाज़ें मिलती थीं, जो किसी वाक्य को वैसे पढ़ती थीं जैसे GPS रास्ता बताता है। अब यह बदल चुका है। आप किसी चैप्टर को टेक्स्ट बॉक्स में डाल सकते हैं, एक आवाज़ चुन सकते हैं, और ऐसा ऑडियो पा सकते हैं जो किसी दुखद पंक्ति पर धीमा हो जाता है, किसी खुलासे से पहले रुकता है, और ज़्यादातर नामों का उच्चारण पहली ही बार में सही करता है।
यह लेख बताता है कि कौन से जनरेटर आपका समय लेने लायक हैं, मुफ़्त होने से असल में क्या मिलता है, और एक तैयार मैनुस्क्रिप्ट को बिना स्टूडियो बुक किए सुनने लायक ऑडियो में कैसे बदला जाए। यहाँ बताया गया हर वॉइस मॉडल Picasso IA पर उपलब्ध है, इसलिए आप एक ही पैराग्राफ़ पर उन्हें साथ-साथ आज़मा सकते हैं और मार्केटिंग पेजों की बजाय अपने कानों पर भरोसा कर सकते हैं।

मुफ़्त नैरेशन का असल मतलब
इस इंटरनेट कोने में "मुफ़्त" शब्द को खूब खींचा जाता है। कुछ टूल्स आपको दस मिनट और एक वॉटरमार्क देते हैं। कुछ पूरी ऑडियो फ़ाइल देते हैं, पर हर अनुरोध को कुछ हज़ार कैरेक्टर तक सीमित रखते हैं। इन दोनों का फ़र्क जानने से आपका एक दोपहर का बेकार काम बच सकता है, इसलिए शुरुआत यहीं से करते हैं।
शून्य डॉलर में क्या मिलता है
एक अच्छा मुफ़्त टेक्स्ट-टू-स्पीच सेटअप आपको चार चीज़ें देता है:
- आवाज़ों की असली चॉइस। एक ही डिफ़ॉल्ट narrator नहीं, बल्कि अलग-अलग उम्र, लहज़ों और एक्सेंट की रेंज, जिन्हें आप एक ही पैराग्राफ़ पर परख सकें।
- डिलीवरी पर नियंत्रण। स्पीड, पिच, वॉल्यूम और भावना ऐसी सेटिंग्स हैं जिन्हें आप बदल सकते हैं, कोई रहस्य नहीं जिसे आपको मानना ही पड़े।
- काम की फ़ाइलें। अपलोड के लिए MP3, और बाद में ऑडियो एडिट करने की योजना हो तो WAV या FLAC।
- कई भाषाएँ। एक ही स्क्रिप्ट को एक विकल्प बदलकर अंग्रेज़ी, स्पेनिश और जापानी ऑडियो में बदला जा सकता है।
Picasso IA Speech 2.8 HD और Gemini 3.1 Flash TTS दोनों को ऑनलाइन मुफ़्त में उपयोग के लिए बताता है, और इसके टेक्स्ट-टू-स्पीच कलेक्शन में कुल 24 मॉडल हैं। यह इतना बड़ा पूल है कि लगभग हर किताब के लिए फ़िट बैठने वाली आवाज़ मिल सकती है।
जहाँ मुफ़्त टियर खत्म होते हैं
पेच साइज़ का है। Speech 2.8 HD हर अनुरोध में अधिकतम 10,000 कैरेक्टर स्वीकार करता है, और Gemini 3.1 Flash TTS अधिकतम 4,000 बाइट्स। 4,000 शब्दों का चैप्टर लगभग 24,000 कैरेक्टर का होता है, इसलिए आपको उसे टुकड़ों में भेजना होगा। 80,000 शब्दों के उपन्यास के लिए बड़ी सीमा पर भी लगभग 50 अनुरोध लगते हैं।
शुरू करने से पहले दो और सीमाएँ जाँचने लायक हैं। पहली है आउटपुट फ़ॉर्मेट: अगर आपको एडिट करना है तो ऐसा मॉडल चुनें जो WAV या FLAC एक्सपोर्ट करता हो, क्योंकि ज़्यादा कंप्रेस्ड MP3 हर बार सेव करने पर थोड़ी डिटेल खोता है। दूसरी है भाषा: अंग्रेज़ी में गर्म लगने वाली आवाज़ जर्मन में फीकी लग सकती है, इसलिए उसी भाषा में टेस्ट करें जिसमें आपके श्रोता सुनेंगे।
💡 समय की योजना बनाएँ, पैसे की नहीं। मुफ़्त ऑडियोबुक की असली कीमत वह घंटा है जो आप चैप्टर बाँटने, जनरेट करने और सुनकर जाँचने में लगाते हैं। पहली बार हर चैप्टर के लिए एक शाम रखें, फिर सेटिंग्स सेट होते ही यह समय घटता देखें।

AI narrators कौन सुनता है
सिंथेटिक नैरेशन सिर्फ़ टेक्नोलॉजी के शौकीनों के लिए कोई दिखावटी ट्रिक नहीं है। यह तीन बहुत आम समस्याएँ हल करता है, और हर समस्या के पीछे अलग तरह का इंसान है।
सेल्फ़-पब्लिशिंग लेखक
किसी इंसान narrator और रिकॉर्डिंग बूथ को किराए पर लेना बहुत से पहली बार लिखने वाले लेखकों की पहुँच से बाहर है, और इसी वजह से उनकी किताबें सिर्फ़ टेक्स्ट में रह जाती हैं। AI नैरेशन यह कमी भरता है। एक लेखक कुछ ही दिनों में किसी तैयार मैनुस्क्रिप्ट का साफ़ और एक-सा ऑडियो एडिशन बना सकता है, यह जान सकता है कि पाठक सचमुच इसे चाहते हैं या नहीं, और अगर किताब सफल होती है तो बाद में किसी इंसान के परफ़ॉर्मेंस के लिए पैसे दे सकता है।

यात्री और धावक
ऑडियो उन जगहों पर फ़िट होता है जहाँ पढ़ना संभव नहीं। चालीस मिनट की ट्रेन यात्रा, लंबी दौड़, शहर के पार ड्राइव, सिंक में पड़े बर्तन। जो लोग पहले से पॉडकास्ट के दीवाने हैं, वे लेख, न्यूज़लेटर और स्टडी नोट्स भी ऑडियो में खुशी से सुनेंगे, और यहीं AI वॉइस चमकती हैं: आपके पास मौजूद कोई भी टेक्स्ट कुछ ऐसा बन सकता है जिसे आप सुन सकें। वह लंबी रिपोर्ट जिसे आप टालते रहते हैं, आपका अपना अधूरा ड्राफ़्ट, जिसे आपको सुनाया जाए, ताकि आप उसके अटपटे वाक्य सुन सकें, किसी दोस्त की छोटी कहानी, या परीक्षा से एक रात पहले लेक्चर नोट्स। अगर आप उसे पेस्ट कर सकते हैं, तो आप उसे सुन भी सकते हैं।


ऑडियो की ज़रूरत वाले श्रोता
कम दृष्टि, डिस्लेक्सिया या थकी आँखों वाले पाठकों के लिए नैरेशन सुविधा नहीं, बल्कि पहुँच का साधन है। एक शांत, स्थिर आवाज़ जो लंबा लेख उस गति से पढ़े जो आप चुनें, एक असली बाधा हटाती है। बुज़ुर्ग पाठक जो कहानियों से अब भी प्यार करते हैं पर छोटे अक्षर पढ़ने में दिक्कत महसूस करते हैं, उन्हें भी यही फ़ायदा मिलता है, और वे किसी से मदद माँगे बिना कोई हिस्सा जितनी बार चाहें दोबारा सुन सकते हैं।

आज़माने लायक जनरेटर
Picasso IA 24 टेक्स्ट-टू-स्पीच मॉडल एक ही कलेक्शन में रखता है, ताकि आपको हर साइट पर अलग खाता खोले बिना एक ही पैराग्राफ़ कई इंजनों से चलाने को मिले। यह रही छोटी सूची, जिससे मैं शुरू करता।
लंबे नैरेशन के लिए स्टूडियो जैसी क्वालिटी
सीधे नैरेशन के लिए Speech 2.8 HD मेरी डिफ़ॉल्ट पसंद है। यह साफ़, हाई-फ़िडेलिटी ऑडियो देता है, 256 kbps MP3 या लॉसलेस WAV और FLAC तक, और दस डिलीवरी स्टाइल देता है, जिनमें शांत, दुखी, हैरान और न्यूट्रल शामिल हैं। स्पीड आधे से दोगुनी तक जाती है, पिच किसी भी दिशा में 12 सेमीटोन तक बदलती है, और एक सरल मार्कर टाइम्ड पॉज़ डालता है। यह सेंटेंस-लेवल टाइमस्टैम्प भी लौटा सकता है, जो तब काम आता है जब आप अपनी किताब के वीडियो संस्करण के लिए कैप्शन चाहें।
यह सबसे अच्छी तरह कहाँ फ़िट होता है:
- नॉनफ़िक्शन और निबंध जिन्हें स्थिर, भरोसेमंद लहज़े की ज़रूरत है।
- लिटरेरी फ़िक्शन जिसमें एक ही narrator और कुछ ही किरदार हों।
- लंबे प्रोजेक्ट जहाँ एक जैसी सेटिंग्स चमक-दमक से ज़्यादा मायने रखती हैं।
किरदारों के लिए एक्सप्रेसिव डिलीवरी
Gemini 3.1 Flash TTS परफ़ॉर्मेंस की ओर झुकता है। आप 30 वॉइस में से एक चुनते हैं, फिर सादी भाषा में स्टाइल प्रॉम्प्ट लिखते हैं, जैसे "इसे धीरे पढ़ें, जैसे किसी थके हुए बच्चे को सोने से पहले कहानी सुनाई जा रही हो।" [whispering], [laughing] और [sigh] जैसे इनलाइन टैग अलग-अलग पंक्तियों को आकार देते हैं, ताकि कोई किरदार ठीक वहीं आवाज़ धीमी कर सके जहाँ स्क्रिप्ट कहती है। 70 से ज़्यादा भाषा कोड के साथ एक ही स्क्रिप्ट एक ड्रॉपडाउन बदलकर स्पैनिश या हिंदी संस्करण बन सकती है।
परखने लायक दूसरी आवाज़ें
आवाज़ें अलग-अलग टेक्स्ट पर अलग बर्ताव करती हैं, इसलिए पूरी किताब के लिए तय करने से पहले एक से ज़्यादा को आज़माएँ।
- क्लोनिंग के विकल्प। Qwen3 TTS, Chatterbox और MiniMax Voice Cloning अपनी कस्टम narrator आवाज़ बना सकते हैं। सिर्फ़ अपनी आवाज़ क्लोन करें, या वह आवाज़ जिसके इस्तेमाल की आपके पास लिखित अनुमति हो।
- दूसरी भाषाएँ। ElevenLabs v2 Multilingual 30+ भाषाएँ संभालता है, और ElevenLabs Dubbing वीडियो को 90+ भाषाओं में अनुवाद करता है, अगर बाद में आप अपनी किताब का वीडियो ट्रेलर चाहें।
- संवाद। Play Dialog नेचुरल बातचीत वाले ऑडियो के लिए बना है, जो दो बोलने वालों वाले दृश्यों के लिए ठीक है।
- स्पीड। Inworld TTS 1.5 Max असली चीज़ को पॉलिश करने से पहले रफ़ ड्राफ़्ट सुनने का तेज़ तरीका है।
उपलब्ध हर मॉडल picassoia.com/en/all-models पर देख सकते हैं।
निष्पक्ष ऑडिशन चलाएँ
किसी आवाज़ को उसके डेमो क्लिप से न आँकें। लगभग 150 शब्दों का अपना टेस्ट पैसेज बनाएँ जिसमें कठिन हिस्से हों: संवाद की एक पंक्ति, एक संख्या या तारीख, एक असामान्य नाम, और एक शांत भावनात्मक वाक्य। फिर उसी पैसेज को मिलती-जुलती स्पीड और पिच पर तीन मॉडलों से चलाएँ, और हर टेक को तीन बातों पर 1 से 5 के बीच अंक दें:
- रिदम। क्या वह वहाँ साँस लेता है जहाँ इंसान लेता, या कॉमा पर भी जल्दी से आगे बढ़ जाता है?
- उच्चारण। क्या नाम, संख्या और तारीख सही निकले?
- गर्मजोशी। क्या आप दो घंटे बाद भी सुनते रहेंगे, या पॉज़ बटन की ओर हाथ जाएगा?
नोट्स संभालकर रखें। तीन हफ़्ते बाद जब कोई चैप्टर गड़बड़ लगे, तो यह स्कोरकार्ड बता देगा कि किस सेटिंग को दोष देना है।
आवाज़ कब नेचुरल लगती है
यहाँ सबसे चौंकाने वाली बात है: आप जो आवाज़ चुनते हैं, वह उतनी मायने नहीं रखती जितना आप सोचते हैं। श्रोता कुछ ही मिनटों में थोड़े सिंथेटिक टिम्बर को माफ़ कर देते हैं। जो वे कभी माफ़ नहीं करते वह है खराब रिदम, ऐसा narrator जो किसी अंतिम संस्कार वाले दृश्य को जल्दी-जल्दी निपटा दे, या किसी नाम के बीच में रुक जाए।

पेसिंग आवाज़ चुनने से ज़्यादा मायने रखती है
जल्दी बोलने वाला narrator घबराया हुआ लगता है। जो खींच-खींचकर बोलता है, वह नींद में लगता है। फ़िक्शन के लिए सामान्य स्पीड (1.0) से शुरू करें, और घने नॉनफ़िक्शन के लिए 0.9 तक लाएँ, जहाँ श्रोताओं को हर बिंदु समझने के लिए एक ठहराव चाहिए। छोटा रनटाइम पाने के लिए स्पीड बढ़ाने की इच्छा को रोकें। श्रोता अपने ऐप में प्लेबैक तेज़ कर सकते हैं, पर जो आवाज़ बहुत तेज़ बना दी गई हो, उसे कोई धीमा नहीं कर सकता।

भावना और विराम
असली काम विराम करते हैं। Speech 2.8 HD में <#0.8#> जैसा मार्कर 0.8 सेकंड का विराम डालता है, जो खुलासे से पहले या चैप्टर टाइटल के बाद अच्छा काम करता है। Gemini 3.1 Flash TTS स्टाइल प्रॉम्प्ट से मिलता-जुलता असर पाता है। ये शुरुआती बिंदु ज़्यादातर किताबों के लिए काम करते हैं:
| दृश्य | भावना | स्पीड |
|---|
| शांत वर्णन | शांत | 0.95 |
| तनावपूर्ण पीछा | ऑटो | 1.1 |
| दुख या हानि | दुखी | 0.9 |
| किसी विचार को समझाना | प्रवाहपूर्ण | 1.0 |
| हल्का, मज़ेदार हिस्सा | खुश | 1.05 |
इन संख्याओं को पहला ड्राफ़्ट मानें, फिर अपने कानों पर भरोसा करें। तीन छोटे जाल लगभग हर किसी को फँसाते हैं:
- संख्याएँ और तारीखें। Speech 2.8 HD में अंग्रेज़ी नॉर्मलाइज़ेशन चालू करें, ताकि आंकड़े वैसे पढ़े जाएँ जैसे कोई इंसान बोलता।
- गढ़े हुए नाम। उन्हें वैसे लिखें जैसे स्क्रिप्ट में वे बोले जाते हैं, जैसे फ़ैंटेसी नाम के लिए "Sil-vane", फिर टेक जाँचें।
- एक्रोनिम। तय करें कि "NASA" को शब्द की तरह बोला जाए या "FBI" के अक्षर अलग-अलग बोले जाएँ, और उसी तरह लिखें।
पाँच चरणों में एक चैप्टर का नैरेशन
यह वॉकथ्रू Speech 2.8 HD का इस्तेमाल करता है, क्योंकि इसके कंट्रोल ऑडियोबुक के काम से साफ़ मेल खाते हैं। यही प्रवाह कलेक्शन के बाकी मॉडलों पर भी लागू होता है।
- Picasso IA पर Speech 2.8 HD पेज खोलें।
- अपने चैप्टर का एक हिस्सा टेक्स्ट फ़ील्ड में पेस्ट करें, अधिकतम 10,000 कैरेक्टर।
- एक आवाज़, एक भावना और एक स्पीड चुनें।
- जनरेट करें, फिर हेडफ़ोन लगाकर पूरा टेक सुनें।
- फ़ाइल डाउनलोड करें और उसे चैप्टर और हिस्से के हिसाब से नाम दें, जैसे
ch03-part2.wav।
स्क्रिप्ट तैयार करें

नैरेशन पन्ने पर लिखी हर चीज़ उजागर कर देता है। पेस्ट करने से पहले टेक्स्ट साफ़ करें: पेज नंबर, फ़ुटनोट मार्कर और बेकार फ़ॉर्मेटिंग हटाएँ। जिन शब्दों को आप लिखते कुछ और हैं और बोलते कुछ और, उन्हें पूरा लिखें, जैसे "Dr." या "St."। बहुत लंबे वाक्य तोड़ें, क्योंकि जिस आवाज़ की साँस फूल जाए वह उस छोटे वाक्य से बुरी लगती है जो थोड़ा छोटा हो। पहला पेज खुद ज़ोर से पढ़ें। जहाँ आप अटकते हैं, वहाँ मॉडल भी अटकेगा।
वॉइस कंट्रोल सेट करें
| सेटिंग | शुरुआती मान | यह क्यों मायने रखती है |
|---|
| वॉइस | Wise_Woman (डिफ़ॉल्ट) | एक ही पैराग्राफ़ पर कई आवाज़ें आज़माएँ |
| भावना | ऑटो, या फ़िक्शन के लिए शांत | ऑटो मॉडल को स्टाइल चुनने देता है, शांत स्थिर नैरेशन देता है |
| स्पीड | 1.0 | 0.05 के छोटे कदमों में बदलें |
| पिच | 0 | अधिकतम एक या दो सेमीटोन बदलें |
| ऑडियो फ़ॉर्मेट | एडिट के लिए WAV या FLAC, अपलोड के लिए MP3 | लॉसलेस फ़ाइलों में एडिट की गुंजाइश रहती है |
| अंग्रेज़ी नॉर्मलाइज़ेशन | चालू | संख्याओं और तारीखों का बेहतर पठन, थोड़ी देरी के साथ |
| लैंग्वेज बूस्ट | English या Automatic | दूसरी भाषाओं के नामों में मदद करता है |
💡 एक बार में एक सेटिंग बदलें। अगर आप वॉइस, स्पीड और भावना एक साथ बदलेंगे, तो आपको कभी पता नहीं चलेगा कि कौन सा बदलाव टेक को ठीक कर गया।
पूरी लंबाई की किताब संभालना
एक चैप्टर आसान है। पूरी किताब एक लॉजिस्टिक्स की समस्या है, और उसका हल ऊब भरा लेकिन भरोसेमंद है: छोटे टुकड़े और सख्त नोट्स।
चैप्टर को चंक्स में बाँटें
पैराग्राफ़ ब्रेक पर काटें, कभी वाक्य के बीच में नहीं। Speech 2.8 HD के साथ प्रति चंक 6,000 से 8,000 कैरेक्टर का लक्ष्य रखें, और Gemini 3.1 Flash TTS के साथ 4,000 बाइट्स के नीचे रहें, अगर आपके टेक्स्ट में एक्सेंट वाले अक्षर बहुत हैं तो थोड़ा और कम। फ़ाइलों को पढ़ने के क्रम में सॉर्ट होने लायक नंबर दें, और एक सरल स्प्रेडशीट रखें जिसमें लिखा हो कि कौन से चंक पूरे हुए और किन्हें दोबारा करना है।
पूरी किताब में एक ही आवाज़ रखें
पहला अच्छा टेक मिलने के बाद हर सेटिंग लिख लें: वॉइस, भावना, स्पीड, पिच, फ़ॉर्मेट। हर चंक के लिए उन्हीं का इस्तेमाल करें। फिर हर चंक के जोड़ को सुनें। अगर ऊर्जा अचानक बदलती लगे, तो दूसरे हिस्से को पहले हिस्से के आख़िरी वाक्य के साथ रन-इन जोड़कर दोबारा बनाएँ और बाद में उसे काट दें। कोई भी मुफ़्त ऑडियो एडिटर चंक्स के बीच आधा सेकंड की ख़ामोशी डाल सकता है और पूरी किताब में वॉल्यूम बराबर कर सकता है।
AI नैरेशन की असली सीमाएँ
AI नैरेशन अच्छा है, जादू नहीं। किसी को तैयार ऑडियोबुक का वादा करने से पहले जानें कि यह अब भी कहाँ संघर्ष करता है।
- डायलॉग-प्रधान फ़िक्शन मुश्किल है। एक ही आवाज़ जब छह किरदार निभाती है, तो वे आपस में घुल-मिल सकते हैं। Gemini 3.1 Flash TTS में स्टाइल प्रॉम्प्ट मदद करते हैं, और दो वक्ताओं पर बने दृश्यों के लिए Play Dialog सही रहता है।
- अपने श्रोताओं को बताएँ। अपनी किताब के विवरण में लिखें कि ऑडियो की नैरेशन AI ने की है, और कुछ भी अपलोड करने से पहले सिंथेटिक नैरेशन पर हर रिटेलर के नियम देख लें।
- वॉइस क्लोन सिर्फ़ सहमति से करें। आपकी अपनी आवाज़ ठीक है। किसी और की आवाज़ के लिए लिखित अनुमति ज़रूरी है।
- सब कुछ सुनें। मॉडल अब भी दुर्लभ नामों पर और "lead" या "read" जैसे शब्दों पर चूक जाते हैं, जहाँ सही उच्चारण संदर्भ पर निर्भर करता है।
इनमें से कोई भी सीमा रुकावट नहीं है। ये एक चेकलिस्ट हैं। जो लेखक AI नैरेशन को ऑडियो एडिशन का पहला ड्राफ़्ट मानते हैं, और कमज़ोर हिस्सों को ठीक करने में एक घंटा लगाते हैं, वे ऐसी चीज़ पाते हैं जिसे श्रोता पूरा सुनते हैं। जो लेखक पूरी मैनुस्क्रिप्ट पेस्ट करके बिना सुने आउटपुट अपलोड कर देते हैं, उन्हें गलत उच्चारण वाले नायक पर एक-स्टार रिव्यू मिलते हैं।
आज ही अपना नैरेशन आज़माएँ
अपनी किताब का वह एक पन्ना चुनें जिसे आपने सबसे ज़्यादा दोबारा पढ़ा है। Picasso IA खोलें, उसे Speech 2.8 HD या Gemini 3.1 Flash TTS में पेस्ट करें, और जनरेट दबाएँ। दस मिनट बाद आप जान जाएँगे कि यह आपकी कहानी के लिए काम करता है या नहीं, और आपके पास किसी दोस्त को सुनाने के लिए पहली ऑडियो फ़ाइल होगी।
ऑडियो रेंडर होते समय आर्टवर्क भी बनाएँ। Seedream 4.5, FLUX 2 Pro या P-Image जैसा इमेज मॉडल आपकी ऑडियोबुक लिस्टिंग के लिए फ़ोटोरियलिस्टिक दृश्य उतने ही समय में बना सकता है जितने में चाय बनती है। पूरा कैटलॉग picassoia.com/en/all-models पर देखें, एक ही पैराग्राफ़ पर अलग-अलग आवाज़ों के साथ प्रयोग करें, और वे आवाज़ें रखें जो आपको भुला दें कि कोई मशीन बोल रही है।
आपकी कहानी एक आवाज़ का इंतज़ार कर रही है। जाइए, उसे आवाज़ दीजिए।