फ़्री टेक्स्ट-टू-स्पीच API: मूल्य, Python और अनलिमिटेड विकल्प
हर फ़्री टेक्स्ट-टू-स्पीच API के नियम अलग होते हैं: मासिक सीमाएँ जो रीसेट होती हैं, बारह महीने के ट्रायल जो खत्म हो जाते हैं, और ओपन-सोर्स मॉडल जिनमें कोई मीटर नहीं होता। असली कीमतें, काम करने वाला Python कोड और वॉइस को पहले ब्राउज़र में आज़माने का तरीका देखें।
सर्च बार में "free text to speech API" टाइप करें और आपको तीन बहुत अलग जवाब मिलेंगे। एक क्लाउड दिग्गज की मासिक सीमा। एक Python पैकेज जो चुपचाप किसी और के सर्वर इस्तेमाल करता है। एक ओपन-सोर्स मॉडल जिसे आप अपनी मशीन पर चलाते हैं। तीनों फ़्री हैं, लेकिन सिर्फ़ एक सच में अनलिमिटेड है, और वह वह नहीं है जिसकी ज़्यादातर लोग उम्मीद करते हैं।
यह आर्टिकल विकल्पों को उनकी असली लागत के हिसाब से छाँटता है, हर एक के लिए काम करने वाला Python दिखाता है, और अंत में एक तरीका बताता है जिससे आप कोई इंटीग्रेशन कोड लिखने से पहले ब्राउज़र में वॉइस आज़मा सकें। आँकड़े अक्टूबर 2026 तक के प्रोवाइडर प्राइसिंग पेज और प्रकाशित सारांशों से लिए गए हैं। कीमतें बदलती रहती हैं, इसलिए बजट बनाने से पहले संख्याओं की पुष्टि कर लें।
फ़्री का असली मतलब
प्रोवाइडर "फ़्री" शब्द का इस्तेमाल तीन अलग-अलग व्यवस्थाओं के लिए करते हैं, और इन्हें आपस में गड़बड़ करना ही वह वजह है जिससे प्रोटोटाइप एक सरप्राइज़ इनवॉइस में बदल जाता है।
आवर्ती मासिक भत्ते
Google Cloud और Microsoft Azure हर महीने मुफ़्त भत्ता रीसेट करते हैं, जिसकी कोई समाप्ति तिथि नहीं होती। Google स्टैंडर्ड वॉइस के 4 मिलियन कैरेक्टर देता है, और Azure के F0 टियर में न्यूरल वॉइस के 0.5 मिलियन कैरेक्टर मिलते हैं। सीमा के भीतर रहें तो बिल हमेशा के लिए शून्य रहता है। Google पर सीमा पार करेंगे तो सामान्य प्रति-कैरेक्टर दर चुकानी होगी। Azure का F0 टियर सीमित है, इसलिए आपको बिल नहीं, बल्कि एक ऊपरी सीमा का सामना करना पड़ता है।
बारह महीने के ट्रायल
Amazon Polly की सीमा नए अकाउंट पर उनके पहले 12 महीनों के लिए लागू होती है। AWS हर महीने 1 मिलियन न्यूरल कैरेक्टर, 500 हज़ार (500 thousand) लॉन्ग फ़ॉर्म कैरेक्टर और 100 हज़ार (100 thousand) जनरेटिव कैरेक्टर सूचीबद्ध करता है, और प्रकाशित सारांशों में स्टैंडर्ड वॉइस के लिए यह सीमा 5 मिलियन बताई गई है। बारहवें महीने के बाद उतने ही ट्रैफ़िक की कीमत स्टैंडर्ड वॉइस पर $4 प्रति मिलियन कैरेक्टर और न्यूरल पर $16 हो जाती है। जनवरी में फ़्री रहने वाले प्रोटोटाइप पर अगली जनवरी तक असली खर्च जुड़ सकता है।
ElevenLabs बीच में आता है। इसका फ़्री प्लान हर महीने लगभग 10,000 कैरेक्टर देता है, जो सिर्फ़ दस से पंद्रह मिनट के ऑडियो के बराबर है, और यह एट्रिब्यूशन माँगता है तथा कमर्शियल उपयोग की अनुमति नहीं देता। एक वॉइस को आज़माने के लिए यह काफ़ी है और किसी प्रोडक्ट के लिए बहुत छोटा। उसी वॉइस फ़ैमिली को PicassoIA पर ElevenLabs v3 के रूप में भी उपलब्ध किया गया है।
ओपन-सोर्स और अनलिमिटेड
सिर्फ़ एक विकल्प सचमुच अनलिमिटेड है: वह सॉफ़्टवेयर जिसे आप खुद चलाते हैं। Piper एक साधारण CPU पर चलता है और 30+ भाषाओं में 100 से ज़्यादा वॉइस देता है। Kokoro 82 मिलियन पैरामीटर वाला एक मॉडल है, जो प्राकृतिक स्पीच बनाता है और बताया जाता है कि GPU पर यह रियल टाइम से लगभग 100 गुना तेज़ चलता है। कोई आपके इस्तेमाल का हिसाब नहीं रखता, क्योंकि कोई आपको होस्ट नहीं कर रहा। इसकी कीमत है आपका अपना हार्डवेयर, सेटअप में लगने वाला समय, और हर वॉइस का लाइसेंस जाँचने का काम, इससे पहले कि आप उससे बनी किसी चीज़ को बेचें।
फ़्री टियर की साथ-साथ तुलना
प्राइसिंग टेबल
प्रोवाइडर और टियर
मुफ़्त सीमा
क्या इसकी समय-सीमा है?
इसके बाद भुगतान वाली दर
Google Cloud Standard
हर महीने 4M कैरेक्टर
नहीं
$4 प्रति 1M
Google Cloud Neural2
हर महीने लगभग 1M कैरेक्टर
नहीं
$16 प्रति 1M
Azure Neural (F0)
हर महीने 0.5M कैरेक्टर
नहीं
इस्तेमाल के हिसाब से भुगतान
Amazon Polly Standard
हर महीने 5M कैरेक्टर
12 महीने बाद
$4 प्रति 1M
Amazon Polly Neural
हर महीने 1M कैरेक्टर
12 महीने बाद
$16 प्रति 1M
ElevenLabs Free
हर महीने लगभग 10K कैरेक्टर
नहीं
भुगतान वाले प्लान
Piper या Kokoro
कोई सीमा नहीं
नहीं
आपका अपना हार्डवेयर
💡 सीमाएँ प्रति अकाउंट, प्रति माह और प्रति वॉइस टियर गिनी जाती हैं। स्टैंडर्ड और प्रीमियम वॉइस अलग-अलग पूल से खर्च होते हैं, इसलिए जो सटीक वॉइस आप शिप करने की योजना बना रहे हैं, उसे ही टेस्ट करें।
एक मिलियन कैरेक्टर में क्या मिलता है
AWS के अपने प्राइसिंग उदाहरणों के हिसाब से प्रति मिलियन कैरेक्टर लगभग 23 घंटे 8 मिनट की स्पीच बनती है। इसे एक मोटे नियम के रूप में इस्तेमाल करें। Google के 4 million स्टैंडर्ड कैरेक्टर लगभग 90 घंटे के ऑडियो प्रति माह के बराबर हैं, और Azure के 0.5 million लगभग 11 घंटे के बराबर।
1,500 शब्दों की एक ब्लॉग पोस्ट लगभग 9,000 कैरेक्टर की होती है। इतने आकार पर Azure का फ़्री टियर लगभग 55 पोस्ट प्रति माह नैरेट करता है और Google का 400 से ज़्यादा। मिड-साइज़ ब्लॉग पर "read aloud" बटन फ़्री टियर के भीतर आ जाता है, बशर्ते आप हर बार पेज व्यू पर दोबारा जनरेट करने के बजाय हर ऑडियो फ़ाइल को स्टोर करें।
गिनती सावधानी से करें। ज़्यादातर प्रोवाइडर आपके भेजे हर कैरेक्टर को मीटर करते हैं, जिसमें स्पेस, विराम चिह्न और मार्कअप टैग भी शामिल हैं, इसलिए सिंथेसिस से पहले HTML हटाएँ और सादा टेक्स्ट भेजें। किसी अनुमान पर भरोसा करने से पहले एक हफ़्ते के असली ट्रैफ़िक को मापें।
बिना खर्च वाले Python विकल्प
तीन पैकेज ज़्यादातर छोटी स्क्रिप्ट्स को संभाल लेते हैं। ये pip से इंस्टॉल होते हैं, इन्हें बिलिंग अकाउंट की ज़रूरत नहीं होती और कुछ लाइनों में काम करते हैं, लेकिन ये एक जैसे नहीं हैं।
चार लाइनों में gTTS
from gtts import gTTS
tts = gTTS("Your order has shipped.", lang="en")
tts.save("order.mp3")
gTTS Google Translate के पीछे लगे स्पीच एंडपॉइंट का एक अनौपचारिक रैपर है। इसमें कोई क्रेडेंशियल नहीं है और कोई प्रकाशित कोटा नहीं है, और यही असली समस्या है: Google बिना सूचना के इस एंडपॉइंट को थ्रॉटल कर सकता है या बदल सकता है। यह क्लासरूम की स्क्रिप्ट के लिए ठीक है। ग्राहकों के सामने वाले फ़ीचर के लिए यह जोखिम भरा है।
pyttsx3 ऑफ़लाइन चलता है
import pyttsx3
engine = pyttsx3.init()
engine.setProperty("rate", 170)
engine.save_to_file("Your order has shipped.", "order.wav")
engine.runAndWait()
pyttsx3 आपके ऑपरेटिंग सिस्टम में पहले से इंस्टॉल वॉइस को चलाता है: Windows पर SAPI5, macOS पर NSSpeechSynthesizer और Linux पर eSpeak। इसमें कोई नेटवर्क कॉल नहीं होती और कोई सीमा नहीं होती। एक दिक्कत यह है कि इसकी वॉइस 2005 के GPS डिवाइस जैसी लगती है, इसलिए कुछ भी तय करने से पहले अपने कानों से परख लें।
बेहतर वॉइस के लिए edge-tts
import asyncio
import edge_tts
async def main():
speech = edge_tts.Communicate("Your order has shipped.", "en-US-AriaNeural")
await speech.save("order.mp3")
asyncio.run(main())
edge-tts उसी read aloud सर्विस से बात करता है जो Edge ब्राउज़र इस्तेमाल करता है। इसकी वॉइस न्यूरल क्वालिटी की है और पैकेज फ़्री है, लेकिन यह एक अनौपचारिक क्लाइंट है जिसके पीछे कोई सर्विस एग्रीमेंट नहीं है। इसे gTTS की तरह समझें: निजी प्रोजेक्ट्स के लिए अच्छा, लेकिन जब पेड यूज़र्स इस पर निर्भर हों तो यह एक जोखिम है।
लोकल न्यूरल मॉडल
Piper और Kokoro दो ऐसे विकल्प हैं जिन्हें पहले आज़माएँ। Piper एक डाउनलोड की गई वॉइस फ़ाइल लेता है और कमांड लाइन से सीधे ऑडियो लिखता है:
echo "Your order has shipped." | piper --model en_US-lessac-medium.onnx --output_file order.wav
यह Raspberry Pi 4 के लिए पर्याप्त हल्का है, इसलिए ऑफ़लाइन किओस्क, होम ऑटोमेशन और ऐसी किसी भी चीज़ के लिए यह आम पसंद है जिसे इंटरनेट के बिना भी चलते रहना हो। Kokoro को ज़्यादा मेमोरी चाहिए, लेकिन उसकी आवाज़ काफ़ी ज़्यादा प्राकृतिक लगती है, और GPU पर वह बहुत तेज़ चलता है।
Python से क्लाउड API कॉल करना
जब आपको SLA, SSML मार्कअप या दर्जनों भाषाएँ चाहिए, तब क्लाउड प्रोवाइडर ईमानदार रास्ता है। पैटर्न हर जगह एक जैसा है: प्रमाणीकरण करें, टेक्स्ट भेजें, ऑडियो बाइट्स प्राप्त करें।
Google Cloud का उदाहरण
from google.cloud import texttospeech
client = texttospeech.TextToSpeechClient()
response = client.synthesize_speech(
input=texttospeech.SynthesisInput(text="Your order has shipped."),
voice=texttospeech.VoiceSelectionParams(
language_code="en-US", name="en-US-Standard-C"
),
audio_config=texttospeech.AudioConfig(
audio_encoding=texttospeech.AudioEncoding.MP3
),
)
with open("order.mp3", "wb") as f:
f.write(response.audio_content)
प्रमाणीकरण GOOGLE_APPLICATION_CREDENTIALS एनवायरनमेंट वेरिएबल से आता है, जो एक सर्विस अकाउंट फ़ाइल की ओर इशारा करता है, इसलिए स्क्रिप्ट के अंदर कोई सीक्रेट नहीं रहता। en-US-Standard-C की जगह Neural2 वॉइस रखें तो कॉल वैसी ही रहती है। बदलते हैं सिर्फ़ वह पूल जिससे आप खर्च करते हैं, और कीमत।
भुगतान से पहले कैश करें
import hashlib
import pathlib
def cached_speech(text, synthesize):
name = hashlib.sha256(text.encode()).hexdigest() + ".mp3"
path = pathlib.Path("audio_cache") / name
if not path.exists():
path.parent.mkdir(exist_ok=True)
path.write_bytes(synthesize(text))
return path
टेक्स्ट का हैश बनाने का मतलब है कि कोई दोहराया गया वाक्य दूसरी बार मुफ़्त पड़ता है। read aloud फ़ीचर के लिए अकेली यही आदत आम तौर पर ट्रैफ़िक को फ़्री टियर के भीतर रखती है। दो और आदतें मदद करती हैं: लंबे टेक्स्ट को वाक्य की सीमाओं पर बाँटें, क्योंकि ज़्यादातर प्रोवाइडर एक रिक्वेस्ट को कुछ हज़ार कैरेक्टर तक सीमित करते हैं, और रेट लिमिट रिस्पॉन्स के लिए हर कॉल को exponential backoff वाले retry में लपेटें।
अनलिमिटेड विकल्प और उनकी शर्तें
"Unlimited" खोजें तो वही तीन वादे सामने आते हैं। हर एक की एक कीमत है।
सेल्फ़ होस्टिंग में समय लगता है। आपको मॉडल इंस्टॉल करने होते हैं, डिपेंडेंसी संभालनी होती हैं, GPU मेमोरी पर नज़र रखनी होती है और जब कोई रिलीज़ कुछ तोड़ दे तब सब कुछ अपडेट करना होता है। हर महीने कुछ हज़ार रिक्वेस्ट के लिए फ़्री क्लाउड टियर आपके घंटों से सस्ता है। लाखों रिक्वेस्ट पर, अपने सर्वर पर Piper या Kokoro चलाना फ़ायदे का सौदा बनने लगता है।
अनौपचारिक एंडपॉइंट टूटते हैं। gTTS और edge-tts उन सर्विसेज़ पर निर्भर हैं जिनके मालिकों ने डेवलपर्स से कभी कोई वादा नहीं किया। ये धीमे हो सकते हैं, फ़ॉर्मेट बदल सकते हैं या गायब हो सकते हैं। अगर कोई फ़ीचर आपके ग्राहकों के लिए मायने रखता है, तो उसे किसी समर्थित प्रोवाइडर की फ़ॉलबैक वॉइस दें।
"Unlimited" प्लान कुछ और मीटर करते हैं। कुछ सब्सक्रिप्शन सर्विसेज़ असीमित स्पीच का विज्ञापन करती हैं और फिर concurrency, कमर्शियल अधिकारों या वॉइस क्वालिटी पर सीमा लगा देती हैं। किसी प्रोडक्ट को किसी प्लान पर डालने से पहले fair use वाला पैराग्राफ़ पढ़ लें।
क्वालिटी कीमत के टैग से कहीं ज़्यादा अलग होती है। एक ही प्रोवाइडर की स्टैंडर्ड वॉइस और न्यूरल वॉइस ज़मीन-आसमान जितनी अलग सुन सकती हैं, इसलिए सस्ते टियर पर उदार सीमा का मतलब यह नहीं कि आपको वही वॉइस मिल रही है जो आप सच में चाहते थे।
मात्रा ही वजह है कि यह बात मायने रखती है। एक read aloud फ़ीचर जो विज़िटर्स के लिए हर आर्टिकल नैरेट करता है, जिनमें वे लोग भी शामिल हैं जो वेब पढ़ने के लिए ऑडियो पर निर्भर हैं, एक व्यस्त हफ़्ते में ही पूरी मासिक सीमा खर्च कर सकता है।
सही फ़्री रास्ता चुनना
आपकी स्थिति
सबसे अच्छा फ़्री रास्ता
किस बात का ध्यान रखें
वीकेंड स्क्रिप्ट या डेमो
gTTS या edge-tts
अनौपचारिक, टूट सकता है
ऑफ़लाइन ऐप या डिवाइस
pyttsx3 या Piper
pyttsx3 की सपाट वॉइस
छोटा प्रोडक्शन फ़ीचर
Google Standard या Azure F0
सीमा हर महीने रीसेट होती है
हाई वॉल्यूम, फ़िक्स्ड लागत
सेल्फ़ होस्टेड Kokoro या Piper
GPU समय और वॉइस लाइसेंस
ऑडियोबुक या वीडियो वॉइसओवर
बिना कोड वाला ब्राउज़र टूल
कोई API एक्सेस नहीं
ज़्यादातर असली प्रोजेक्ट दो पंक्तियों को मिलाते हैं: डेवलपमेंट के लिए लोकल या फ़्री क्लाउड वॉइस, और ग्राहकों तक पहुँचने वाले संस्करण के लिए समर्थित प्रोवाइडर।
शिप करने से पहले, जो भी वॉइस चुनें उस पर तीन वाक्यों का टेस्ट चलाएँ: एक में $1,200.50 जैसी कीमत हो, एक में Dr. या SQL जैसा संक्षेप हो, और एक में ऐसा नाम हो जिसका उच्चारण मुश्किल हो। ये तीन लाइनें ज़्यादातर normalization की समस्याएँ उजागर कर देती हैं, और इनमें आपकी सीमा के सौ कैरेक्टर से भी कम खर्च होते हैं।
PicassoIA पर Speech 2.8 HD इस्तेमाल करें
कभी-कभी आपको कोई इंटीग्रेशन चाहिए ही नहीं, बस एक अच्छी वॉइसओवर फ़ाइल चाहिए। PicassoIA पर Speech 2.8 HD ब्राउज़र में चलता है, इसलिए आप तय करने से पहले वॉइस और सेटिंग्स आज़मा सकते हैं कि क्या बनाना है। लिखे जाने के समय, PicassoIA का developer API स्पीच के बजाय इमेज और वीडियो मॉडल सूचीबद्ध करता है, इसलिए यह एक ब्राउज़र वर्कफ़्लो है, ऊपर दिए प्रोवाइडर्स का ड्रॉप-इन विकल्प नहीं।
अपनी स्क्रिप्ट पेस्ट करें
मॉडल पेज खोलें और टेक्स्ट फ़ील्ड में 10,000 कैरेक्टर तक पेस्ट करें। <#0.5#> जैसे मार्कर से पॉज़ डालें, जो आधे सेकंड की साइलेंस जोड़ता है। लंबी स्क्रिप्ट को सीन्स में बाँटें और हर सीन अलग से जनरेट करें, ताकि एक खराब लाइन पूरे काम को दोबारा करने पर मजबूर न करे।
वॉइस और इमोशन सेट करें
एक वॉइस चुनें (डिफ़ॉल्ट Wise_Woman है) और एक इमोशन: auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent या neutral। लैंग्वेज हिंट 40 से ज़्यादा भाषाओं को सपोर्ट करता है, इसलिए एक स्क्रिप्ट एक ड्रॉपडाउन बदलने से स्पेनिश या जापानी संस्करण बन सकती है। फिर डिलीवरी को ट्यून करें:
स्पीड: 0.5 से 2.0, डिफ़ॉल्ट 1.0
पिच: माइनस 12 से प्लस 12 semitones
वॉल्यूम: 0 से 10, डिफ़ॉल्ट 1.0
💡 एक्सप्लेनर वीडियो के लिए स्पीड 1.1 आज़माएँ और पिच को शून्य से दो semitones के भीतर रखें। इससे बड़े बदलाव से आवाज़ कृत्रिम लगने लगती है।
सही फ़ॉर्मेट में एक्सपोर्ट करें
MP3 डिफ़ॉल्ट है और 256 kbps तक जाता है, जो पॉडकास्ट और वीडियो के लिए ठीक है। WAV और FLAC एडिटिंग के लिए lossless हैं, और PCM पाइपलाइन्स के लिए रॉ ऑडियो देता है। जब आपको कैप्शन के लिए सेंटेंस टाइमस्टैम्प चाहिए, तब सबटाइटल मेटाडेटा चालू करें।
स्क्रिप्ट, वॉइस और साउंडट्रैक तीन अलग काम हैं, और हर एक का एक मॉडल है। स्क्रिप्ट Claude Sonnet 5 या Gemini 3.5 Flash से ड्राफ़्ट करें, Speech 2.8 HD से नैरेशन जनरेट करें, फिर कम वॉल्यूम पर नीचे एक म्यूज़िक बेड लगाएँ, जिसे Lyria 3, Music 2.6 या Stable Audio 2.5 से बनाया गया हो।
एक सरल योजना आपको एक ही बैठक में शून्य से एक काम करने वाली वॉइस तक ले जाती है:
150 शब्दों की एक स्क्रिप्ट लिखें और उसे तीन अलग-अलग वॉइस से जनरेट करें।
सबसे अच्छी वॉइस चुनें और उसकी स्पीड, पिच और इमोशन सेटिंग्स लिख लें।
टेबल से वह फ़्री रास्ता चुनें जो आपकी मासिक मात्रा में फ़िट बैठता हो।
हर जनरेट की गई फ़ाइल स्टोर करें, ताकि हर वाक्य के लिए एक ही बार भुगतान हो।
PicassoIA खोलें, अपने किसी प्रोजेक्ट का एक पैराग्राफ़ पेस्ट करें और तीन अलग इमोशन के साथ तीन वॉइस आज़माएँ। दस मिनट की आज़माइश आपको किसी भी प्राइसिंग पेज से ज़्यादा बताती है, और इंटीग्रेशन कोड की एक लाइन लिखने से पहले वॉइस तय कर देती है। वहीं रहते हुए ऑडियो के साथ जोड़ने के लिए एक थंबनेल इमेज या छोटा वीडियो भी बनाएँ, फिर अपनी पसंदीदा वॉइस के आधार पर आगे बढ़ें।