फ़्री टेक्स्ट-टू-स्पीच API: मूल्य, Python और अनलिमिटेड विकल्प

हर फ़्री टेक्स्ट-टू-स्पीच API के नियम अलग होते हैं: मासिक सीमाएँ जो रीसेट होती हैं, बारह महीने के ट्रायल जो खत्म हो जाते हैं, और ओपन-सोर्स मॉडल जिनमें कोई मीटर नहीं होता। असली कीमतें, काम करने वाला Python कोड और वॉइस को पहले ब्राउज़र में आज़माने का तरीका देखें।

फ़्री टेक्स्ट-टू-स्पीच API: मूल्य, Python और अनलिमिटेड विकल्प
Cristian Da Conceicao
Picasso IA के संस्थापक

सर्च बार में "free text to speech API" टाइप करें और आपको तीन बहुत अलग जवाब मिलेंगे। एक क्लाउड दिग्गज की मासिक सीमा। एक Python पैकेज जो चुपचाप किसी और के सर्वर इस्तेमाल करता है। एक ओपन-सोर्स मॉडल जिसे आप अपनी मशीन पर चलाते हैं। तीनों फ़्री हैं, लेकिन सिर्फ़ एक सच में अनलिमिटेड है, और वह वह नहीं है जिसकी ज़्यादातर लोग उम्मीद करते हैं।

यह आर्टिकल विकल्पों को उनकी असली लागत के हिसाब से छाँटता है, हर एक के लिए काम करने वाला Python दिखाता है, और अंत में एक तरीका बताता है जिससे आप कोई इंटीग्रेशन कोड लिखने से पहले ब्राउज़र में वॉइस आज़मा सकें। आँकड़े अक्टूबर 2026 तक के प्रोवाइडर प्राइसिंग पेज और प्रकाशित सारांशों से लिए गए हैं। कीमतें बदलती रहती हैं, इसलिए बजट बनाने से पहले संख्याओं की पुष्टि कर लें।

फ़्री का असली मतलब

प्रोवाइडर "फ़्री" शब्द का इस्तेमाल तीन अलग-अलग व्यवस्थाओं के लिए करते हैं, और इन्हें आपस में गड़बड़ करना ही वह वजह है जिससे प्रोटोटाइप एक सरप्राइज़ इनवॉइस में बदल जाता है।

आवर्ती मासिक भत्ते

Google Cloud और Microsoft Azure हर महीने मुफ़्त भत्ता रीसेट करते हैं, जिसकी कोई समाप्ति तिथि नहीं होती। Google स्टैंडर्ड वॉइस के 4 मिलियन कैरेक्टर देता है, और Azure के F0 टियर में न्यूरल वॉइस के 0.5 मिलियन कैरेक्टर मिलते हैं। सीमा के भीतर रहें तो बिल हमेशा के लिए शून्य रहता है। Google पर सीमा पार करेंगे तो सामान्य प्रति-कैरेक्टर दर चुकानी होगी। Azure का F0 टियर सीमित है, इसलिए आपको बिल नहीं, बल्कि एक ऊपरी सीमा का सामना करना पड़ता है।

बारह महीने के ट्रायल

Amazon Polly की सीमा नए अकाउंट पर उनके पहले 12 महीनों के लिए लागू होती है। AWS हर महीने 1 मिलियन न्यूरल कैरेक्टर, 500 हज़ार (500 thousand) लॉन्ग फ़ॉर्म कैरेक्टर और 100 हज़ार (100 thousand) जनरेटिव कैरेक्टर सूचीबद्ध करता है, और प्रकाशित सारांशों में स्टैंडर्ड वॉइस के लिए यह सीमा 5 मिलियन बताई गई है। बारहवें महीने के बाद उतने ही ट्रैफ़िक की कीमत स्टैंडर्ड वॉइस पर $4 प्रति मिलियन कैरेक्टर और न्यूरल पर $16 हो जाती है। जनवरी में फ़्री रहने वाले प्रोटोटाइप पर अगली जनवरी तक असली खर्च जुड़ सकता है।

ElevenLabs बीच में आता है। इसका फ़्री प्लान हर महीने लगभग 10,000 कैरेक्टर देता है, जो सिर्फ़ दस से पंद्रह मिनट के ऑडियो के बराबर है, और यह एट्रिब्यूशन माँगता है तथा कमर्शियल उपयोग की अनुमति नहीं देता। एक वॉइस को आज़माने के लिए यह काफ़ी है और किसी प्रोडक्ट के लिए बहुत छोटा। उसी वॉइस फ़ैमिली को PicassoIA पर ElevenLabs v3 के रूप में भी उपलब्ध किया गया है।

ओपन-सोर्स और अनलिमिटेड

सिर्फ़ एक विकल्प सचमुच अनलिमिटेड है: वह सॉफ़्टवेयर जिसे आप खुद चलाते हैं। Piper एक साधारण CPU पर चलता है और 30+ भाषाओं में 100 से ज़्यादा वॉइस देता है। Kokoro 82 मिलियन पैरामीटर वाला एक मॉडल है, जो प्राकृतिक स्पीच बनाता है और बताया जाता है कि GPU पर यह रियल टाइम से लगभग 100 गुना तेज़ चलता है। कोई आपके इस्तेमाल का हिसाब नहीं रखता, क्योंकि कोई आपको होस्ट नहीं कर रहा। इसकी कीमत है आपका अपना हार्डवेयर, सेटअप में लगने वाला समय, और हर वॉइस का लाइसेंस जाँचने का काम, इससे पहले कि आप उससे बनी किसी चीज़ को बेचें।

व्हाइटबोर्ड पर फ़्री टियर विकल्पों को छाँटती स्टार्टअप टीम

फ़्री टियर की साथ-साथ तुलना

प्राइसिंग टेबल

प्रोवाइडर और टियरमुफ़्त सीमाक्या इसकी समय-सीमा है?इसके बाद भुगतान वाली दर
Google Cloud Standardहर महीने 4M कैरेक्टरनहीं$4 प्रति 1M
Google Cloud Neural2हर महीने लगभग 1M कैरेक्टरनहीं$16 प्रति 1M
Azure Neural (F0)हर महीने 0.5M कैरेक्टरनहींइस्तेमाल के हिसाब से भुगतान
Amazon Polly Standardहर महीने 5M कैरेक्टर12 महीने बाद$4 प्रति 1M
Amazon Polly Neuralहर महीने 1M कैरेक्टर12 महीने बाद$16 प्रति 1M
ElevenLabs Freeहर महीने लगभग 10K कैरेक्टरनहींभुगतान वाले प्लान
Piper या Kokoroकोई सीमा नहींनहींआपका अपना हार्डवेयर

💡 सीमाएँ प्रति अकाउंट, प्रति माह और प्रति वॉइस टियर गिनी जाती हैं। स्टैंडर्ड और प्रीमियम वॉइस अलग-अलग पूल से खर्च होते हैं, इसलिए जो सटीक वॉइस आप शिप करने की योजना बना रहे हैं, उसे ही टेस्ट करें।

एक मिलियन कैरेक्टर में क्या मिलता है

AWS के अपने प्राइसिंग उदाहरणों के हिसाब से प्रति मिलियन कैरेक्टर लगभग 23 घंटे 8 मिनट की स्पीच बनती है। इसे एक मोटे नियम के रूप में इस्तेमाल करें। Google के 4 million स्टैंडर्ड कैरेक्टर लगभग 90 घंटे के ऑडियो प्रति माह के बराबर हैं, और Azure के 0.5 million लगभग 11 घंटे के बराबर।

1,500 शब्दों की एक ब्लॉग पोस्ट लगभग 9,000 कैरेक्टर की होती है। इतने आकार पर Azure का फ़्री टियर लगभग 55 पोस्ट प्रति माह नैरेट करता है और Google का 400 से ज़्यादा। मिड-साइज़ ब्लॉग पर "read aloud" बटन फ़्री टियर के भीतर आ जाता है, बशर्ते आप हर बार पेज व्यू पर दोबारा जनरेट करने के बजाय हर ऑडियो फ़ाइल को स्टोर करें।

गिनती सावधानी से करें। ज़्यादातर प्रोवाइडर आपके भेजे हर कैरेक्टर को मीटर करते हैं, जिसमें स्पेस, विराम चिह्न और मार्कअप टैग भी शामिल हैं, इसलिए सिंथेसिस से पहले HTML हटाएँ और सादा टेक्स्ट भेजें। किसी अनुमान पर भरोसा करने से पहले एक हफ़्ते के असली ट्रैफ़िक को मापें।

प्रिंटेड इनवॉइस, कैलकुलेटर और लकड़ी की मेज़ पर एस्प्रेसो

बिना खर्च वाले Python विकल्प

तीन पैकेज ज़्यादातर छोटी स्क्रिप्ट्स को संभाल लेते हैं। ये pip से इंस्टॉल होते हैं, इन्हें बिलिंग अकाउंट की ज़रूरत नहीं होती और कुछ लाइनों में काम करते हैं, लेकिन ये एक जैसे नहीं हैं।

चार लाइनों में gTTS

from gtts import gTTS

tts = gTTS("Your order has shipped.", lang="en")
tts.save("order.mp3")

gTTS Google Translate के पीछे लगे स्पीच एंडपॉइंट का एक अनौपचारिक रैपर है। इसमें कोई क्रेडेंशियल नहीं है और कोई प्रकाशित कोटा नहीं है, और यही असली समस्या है: Google बिना सूचना के इस एंडपॉइंट को थ्रॉटल कर सकता है या बदल सकता है। यह क्लासरूम की स्क्रिप्ट के लिए ठीक है। ग्राहकों के सामने वाले फ़ीचर के लिए यह जोखिम भरा है।

कोवर्किंग स्पेस में Python कोड टाइप करता डेवलपर

pyttsx3 ऑफ़लाइन चलता है

import pyttsx3

engine = pyttsx3.init()
engine.setProperty("rate", 170)
engine.save_to_file("Your order has shipped.", "order.wav")
engine.runAndWait()

pyttsx3 आपके ऑपरेटिंग सिस्टम में पहले से इंस्टॉल वॉइस को चलाता है: Windows पर SAPI5, macOS पर NSSpeechSynthesizer और Linux पर eSpeak। इसमें कोई नेटवर्क कॉल नहीं होती और कोई सीमा नहीं होती। एक दिक्कत यह है कि इसकी वॉइस 2005 के GPS डिवाइस जैसी लगती है, इसलिए कुछ भी तय करने से पहले अपने कानों से परख लें।

बेहतर वॉइस के लिए edge-tts

import asyncio
import edge_tts

async def main():
    speech = edge_tts.Communicate("Your order has shipped.", "en-US-AriaNeural")
    await speech.save("order.mp3")

asyncio.run(main())

edge-tts उसी read aloud सर्विस से बात करता है जो Edge ब्राउज़र इस्तेमाल करता है। इसकी वॉइस न्यूरल क्वालिटी की है और पैकेज फ़्री है, लेकिन यह एक अनौपचारिक क्लाइंट है जिसके पीछे कोई सर्विस एग्रीमेंट नहीं है। इसे gTTS की तरह समझें: निजी प्रोजेक्ट्स के लिए अच्छा, लेकिन जब पेड यूज़र्स इस पर निर्भर हों तो यह एक जोखिम है।

लोकल न्यूरल मॉडल

Piper और Kokoro दो ऐसे विकल्प हैं जिन्हें पहले आज़माएँ। Piper एक डाउनलोड की गई वॉइस फ़ाइल लेता है और कमांड लाइन से सीधे ऑडियो लिखता है:

echo "Your order has shipped." | piper --model en_US-lessac-medium.onnx --output_file order.wav

यह Raspberry Pi 4 के लिए पर्याप्त हल्का है, इसलिए ऑफ़लाइन किओस्क, होम ऑटोमेशन और ऐसी किसी भी चीज़ के लिए यह आम पसंद है जिसे इंटरनेट के बिना भी चलते रहना हो। Kokoro को ज़्यादा मेमोरी चाहिए, लेकिन उसकी आवाज़ काफ़ी ज़्यादा प्राकृतिक लगती है, और GPU पर वह बहुत तेज़ चलता है।

वर्कबेंच पर एक छोटे स्पीकर से जुड़ा Raspberry Pi

Python से क्लाउड API कॉल करना

जब आपको SLA, SSML मार्कअप या दर्जनों भाषाएँ चाहिए, तब क्लाउड प्रोवाइडर ईमानदार रास्ता है। पैटर्न हर जगह एक जैसा है: प्रमाणीकरण करें, टेक्स्ट भेजें, ऑडियो बाइट्स प्राप्त करें।

Google Cloud का उदाहरण

from google.cloud import texttospeech

client = texttospeech.TextToSpeechClient()

response = client.synthesize_speech(
    input=texttospeech.SynthesisInput(text="Your order has shipped."),
    voice=texttospeech.VoiceSelectionParams(
        language_code="en-US", name="en-US-Standard-C"
    ),
    audio_config=texttospeech.AudioConfig(
        audio_encoding=texttospeech.AudioEncoding.MP3
    ),
)

with open("order.mp3", "wb") as f:
    f.write(response.audio_content)

प्रमाणीकरण GOOGLE_APPLICATION_CREDENTIALS एनवायरनमेंट वेरिएबल से आता है, जो एक सर्विस अकाउंट फ़ाइल की ओर इशारा करता है, इसलिए स्क्रिप्ट के अंदर कोई सीक्रेट नहीं रहता। en-US-Standard-C की जगह Neural2 वॉइस रखें तो कॉल वैसी ही रहती है। बदलते हैं सिर्फ़ वह पूल जिससे आप खर्च करते हैं, और कीमत।

डेटा सेंटर के गलियारे में चलता एक तकनीशियन

भुगतान से पहले कैश करें

import hashlib
import pathlib

def cached_speech(text, synthesize):
    name = hashlib.sha256(text.encode()).hexdigest() + ".mp3"
    path = pathlib.Path("audio_cache") / name
    if not path.exists():
        path.parent.mkdir(exist_ok=True)
        path.write_bytes(synthesize(text))
    return path

टेक्स्ट का हैश बनाने का मतलब है कि कोई दोहराया गया वाक्य दूसरी बार मुफ़्त पड़ता है। read aloud फ़ीचर के लिए अकेली यही आदत आम तौर पर ट्रैफ़िक को फ़्री टियर के भीतर रखती है। दो और आदतें मदद करती हैं: लंबे टेक्स्ट को वाक्य की सीमाओं पर बाँटें, क्योंकि ज़्यादातर प्रोवाइडर एक रिक्वेस्ट को कुछ हज़ार कैरेक्टर तक सीमित करते हैं, और रेट लिमिट रिस्पॉन्स के लिए हर कॉल को exponential backoff वाले retry में लपेटें।

अनलिमिटेड विकल्प और उनकी शर्तें

"Unlimited" खोजें तो वही तीन वादे सामने आते हैं। हर एक की एक कीमत है।

सेल्फ़ होस्टिंग में समय लगता है। आपको मॉडल इंस्टॉल करने होते हैं, डिपेंडेंसी संभालनी होती हैं, GPU मेमोरी पर नज़र रखनी होती है और जब कोई रिलीज़ कुछ तोड़ दे तब सब कुछ अपडेट करना होता है। हर महीने कुछ हज़ार रिक्वेस्ट के लिए फ़्री क्लाउड टियर आपके घंटों से सस्ता है। लाखों रिक्वेस्ट पर, अपने सर्वर पर Piper या Kokoro चलाना फ़ायदे का सौदा बनने लगता है।

अनौपचारिक एंडपॉइंट टूटते हैं। gTTS और edge-tts उन सर्विसेज़ पर निर्भर हैं जिनके मालिकों ने डेवलपर्स से कभी कोई वादा नहीं किया। ये धीमे हो सकते हैं, फ़ॉर्मेट बदल सकते हैं या गायब हो सकते हैं। अगर कोई फ़ीचर आपके ग्राहकों के लिए मायने रखता है, तो उसे किसी समर्थित प्रोवाइडर की फ़ॉलबैक वॉइस दें।

"Unlimited" प्लान कुछ और मीटर करते हैं। कुछ सब्सक्रिप्शन सर्विसेज़ असीमित स्पीच का विज्ञापन करती हैं और फिर concurrency, कमर्शियल अधिकारों या वॉइस क्वालिटी पर सीमा लगा देती हैं। किसी प्रोडक्ट को किसी प्लान पर डालने से पहले fair use वाला पैराग्राफ़ पढ़ लें।

क्वालिटी कीमत के टैग से कहीं ज़्यादा अलग होती है। एक ही प्रोवाइडर की स्टैंडर्ड वॉइस और न्यूरल वॉइस ज़मीन-आसमान जितनी अलग सुन सकती हैं, इसलिए सस्ते टियर पर उदार सीमा का मतलब यह नहीं कि आपको वही वॉइस मिल रही है जो आप सच में चाहते थे।

मात्रा ही वजह है कि यह बात मायने रखती है। एक read aloud फ़ीचर जो विज़िटर्स के लिए हर आर्टिकल नैरेट करता है, जिनमें वे लोग भी शामिल हैं जो वेब पढ़ने के लिए ऑडियो पर निर्भर हैं, एक व्यस्त हफ़्ते में ही पूरी मासिक सीमा खर्च कर सकता है।

कैफ़े की टेरेस पर स्मार्टफ़ोन पर ऑडियो सुनता आदमी

सही फ़्री रास्ता चुनना

आपकी स्थितिसबसे अच्छा फ़्री रास्ताकिस बात का ध्यान रखें
वीकेंड स्क्रिप्ट या डेमोgTTS या edge-ttsअनौपचारिक, टूट सकता है
ऑफ़लाइन ऐप या डिवाइसpyttsx3 या Piperpyttsx3 की सपाट वॉइस
छोटा प्रोडक्शन फ़ीचरGoogle Standard या Azure F0सीमा हर महीने रीसेट होती है
हाई वॉल्यूम, फ़िक्स्ड लागतसेल्फ़ होस्टेड Kokoro या PiperGPU समय और वॉइस लाइसेंस
ऑडियोबुक या वीडियो वॉइसओवरबिना कोड वाला ब्राउज़र टूलकोई API एक्सेस नहीं

ज़्यादातर असली प्रोजेक्ट दो पंक्तियों को मिलाते हैं: डेवलपमेंट के लिए लोकल या फ़्री क्लाउड वॉइस, और ग्राहकों तक पहुँचने वाले संस्करण के लिए समर्थित प्रोवाइडर।

शिप करने से पहले, जो भी वॉइस चुनें उस पर तीन वाक्यों का टेस्ट चलाएँ: एक में $1,200.50 जैसी कीमत हो, एक में Dr. या SQL जैसा संक्षेप हो, और एक में ऐसा नाम हो जिसका उच्चारण मुश्किल हो। ये तीन लाइनें ज़्यादातर normalization की समस्याएँ उजागर कर देती हैं, और इनमें आपकी सीमा के सौ कैरेक्टर से भी कम खर्च होते हैं।

कंडेंसर माइक्रोफ़ोन से वॉइसओवर रिकॉर्ड करती महिला

PicassoIA पर Speech 2.8 HD इस्तेमाल करें

कभी-कभी आपको कोई इंटीग्रेशन चाहिए ही नहीं, बस एक अच्छी वॉइसओवर फ़ाइल चाहिए। PicassoIA पर Speech 2.8 HD ब्राउज़र में चलता है, इसलिए आप तय करने से पहले वॉइस और सेटिंग्स आज़मा सकते हैं कि क्या बनाना है। लिखे जाने के समय, PicassoIA का developer API स्पीच के बजाय इमेज और वीडियो मॉडल सूचीबद्ध करता है, इसलिए यह एक ब्राउज़र वर्कफ़्लो है, ऊपर दिए प्रोवाइडर्स का ड्रॉप-इन विकल्प नहीं।

अपनी स्क्रिप्ट पेस्ट करें

मॉडल पेज खोलें और टेक्स्ट फ़ील्ड में 10,000 कैरेक्टर तक पेस्ट करें। <#0.5#> जैसे मार्कर से पॉज़ डालें, जो आधे सेकंड की साइलेंस जोड़ता है। लंबी स्क्रिप्ट को सीन्स में बाँटें और हर सीन अलग से जनरेट करें, ताकि एक खराब लाइन पूरे काम को दोबारा करने पर मजबूर न करे।

वॉइस और इमोशन सेट करें

एक वॉइस चुनें (डिफ़ॉल्ट Wise_Woman है) और एक इमोशन: auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent या neutral। लैंग्वेज हिंट 40 से ज़्यादा भाषाओं को सपोर्ट करता है, इसलिए एक स्क्रिप्ट एक ड्रॉपडाउन बदलने से स्पेनिश या जापानी संस्करण बन सकती है। फिर डिलीवरी को ट्यून करें:

  • स्पीड: 0.5 से 2.0, डिफ़ॉल्ट 1.0
  • पिच: माइनस 12 से प्लस 12 semitones
  • वॉल्यूम: 0 से 10, डिफ़ॉल्ट 1.0

💡 एक्सप्लेनर वीडियो के लिए स्पीड 1.1 आज़माएँ और पिच को शून्य से दो semitones के भीतर रखें। इससे बड़े बदलाव से आवाज़ कृत्रिम लगने लगती है।

सही फ़ॉर्मेट में एक्सपोर्ट करें

MP3 डिफ़ॉल्ट है और 256 kbps तक जाता है, जो पॉडकास्ट और वीडियो के लिए ठीक है। WAV और FLAC एडिटिंग के लिए lossless हैं, और PCM पाइपलाइन्स के लिए रॉ ऑडियो देता है। जब आपको कैप्शन के लिए सेंटेंस टाइमस्टैम्प चाहिए, तब सबटाइटल मेटाडेटा चालू करें।

चमकदार स्टूडियो में मॉनिटर पर ऑडियो सेटिंग्स बदलती महिला

उसी स्क्रिप्ट पर आज़माने लायक दूसरे मॉडल:

  • तेज़ टर्नअराउंड के लिए Speech 2.8 Turbo
  • प्राकृतिक, कम लेटेंसी वाले वॉइसओवर के लिए Inworld Realtime TTS 2
  • 70+ भाषाओं में 30 वॉइस के लिए Gemini 3.1 Flash TTS
  • एक्सप्रेसिव नैरेशन के लिए ElevenLabs v3
  • तेज़, हल्के आउटपुट के लिए Chatterbox Turbo
  • वॉइस क्लोन करने या नई डिज़ाइन करने के लिए Qwen3 TTS
  • कस्टम वॉइस के लिए MiniMax से Voice Cloning

अपना पहला वॉइसओवर बनाएँ

स्क्रिप्ट, वॉइस और साउंडट्रैक तीन अलग काम हैं, और हर एक का एक मॉडल है। स्क्रिप्ट Claude Sonnet 5 या Gemini 3.5 Flash से ड्राफ़्ट करें, Speech 2.8 HD से नैरेशन जनरेट करें, फिर कम वॉल्यूम पर नीचे एक म्यूज़िक बेड लगाएँ, जिसे Lyria 3, Music 2.6 या Stable Audio 2.5 से बनाया गया हो।

एनालॉग मिक्सिंग कंसोल पर एक संगीतकार के हाथ

एक सरल योजना आपको एक ही बैठक में शून्य से एक काम करने वाली वॉइस तक ले जाती है:

  1. 150 शब्दों की एक स्क्रिप्ट लिखें और उसे तीन अलग-अलग वॉइस से जनरेट करें।
  2. सबसे अच्छी वॉइस चुनें और उसकी स्पीड, पिच और इमोशन सेटिंग्स लिख लें।
  3. टेबल से वह फ़्री रास्ता चुनें जो आपकी मासिक मात्रा में फ़िट बैठता हो।
  4. हर जनरेट की गई फ़ाइल स्टोर करें, ताकि हर वाक्य के लिए एक ही बार भुगतान हो।

PicassoIA खोलें, अपने किसी प्रोजेक्ट का एक पैराग्राफ़ पेस्ट करें और तीन अलग इमोशन के साथ तीन वॉइस आज़माएँ। दस मिनट की आज़माइश आपको किसी भी प्राइसिंग पेज से ज़्यादा बताती है, और इंटीग्रेशन कोड की एक लाइन लिखने से पहले वॉइस तय कर देती है। वहीं रहते हुए ऑडियो के साथ जोड़ने के लिए एक थंबनेल इमेज या छोटा वीडियो भी बनाएँ, फिर अपनी पसंदीदा वॉइस के आधार पर आगे बढ़ें।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख