तेरह OpenAI TTS voices, तीन मॉडल और कोई ऑडियो प्रीव्यू नहीं। यह लेख हर voice की तुलना करता है, बताता है कि उसे कौन-सा मॉडल सपोर्ट करता है, खुद परखने के लिए एक टेस्ट स्क्रिप्ट देता है, असली लागत का हिसाब समझाता है, और नैरेशन, सपोर्ट बॉट और छोटे वीडियो के लिए शुरुआती पसंद सुझाता है।
तेरह voice नाम, तीन मॉडल, और उस पेज पर कोई ऑडियो प्रीव्यू नहीं जहाँ से आपको एक चुनना है। OpenAI के speech endpoint पर ज़्यादातर डेवलपर्स सबसे पहले इसी दीवार से टकराते हैं। Alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin और cedar, ये सब ड्रॉपडाउन में बराबर ठीक लगते हैं, फिर भी ये हर मॉडल पर एक जैसा बर्ताव नहीं करते, और आपकी स्क्रिप्ट पर इनकी आवाज़ भी एक जैसी नहीं होगी। यह लेख बताता है कि हर OpenAI TTS voice क्या है, उसे कौन-सा मॉडल सपोर्ट करता है, सभी तेरह को दस मिनट से कम में कैसे आज़माएँ, बिल कैसा दिखता है, और नैरेशन, सपोर्ट बॉट और छोटे वीडियो के लिए किससे शुरुआत करें। यह PicassoIA पर उन speech टूल्स की ओर भी इशारा करता है जो OpenAI की पेशकश के साथ मौजूद हैं, जिनमें एक ट्यूटोरियल वाला टूल भी है जिसे आप आज ही चला सकते हैं।
OpenAI TTS असल में क्या देता है
OpenAI की text to speech API एक ही endpoint के ज़रिए लिखे टेक्स्ट को बोले गए ऑडियो में बदलती है। आप एक मॉडल का नाम, एक voice का नाम और अपना टेक्स्ट भेजते हैं, और बदले में एक ऑडियो फ़ाइल मिलती है। जो बात लोगों को उलझा देती है वह यह है कि आप कौन-सा मॉडल चुनते हैं, यह तय करता है कि आप कितनी voices इस्तेमाल कर सकते हैं और बोलने के ढंग पर आपका कितना नियंत्रण होगा।
तीन मॉडल, तीन प्राइस टैग
मॉडल
Voices
कीमत
सबसे अच्छा किसके लिए
tts-1
9
प्रति 1M characters $15
तेज़, कम लागत वाले ड्राफ़्ट और लाइव प्लेबैक
tts-1-hd
9
प्रति 1M characters $30
पहले से रेंडर किया गया ज़्यादा फ़िडेलिटी वाला ऑडियो
gpt-4o-mini-tts
13
प्रति 1M text tokens इनपुट $0.60, प्रति 1M audio tokens आउटपुट $12
इंस्ट्रक्शन के ज़रिए लहज़ा, गति और एक्सेंट बदलने की सुविधा
दोनों पुराने मॉडल कैरेक्टर गिनती के हिसाब से कीमत लेते हैं। gpt-4o-mini-tts की कीमत टोकन में तय होती है, यानी आपकी लागत स्क्रिप्ट की लंबाई पर नहीं, बल्कि ऑडियो की लंबाई पर चलती है।
आउटपुट फ़ॉर्मेट और स्ट्रीमिंग
ऑडियो डिफ़ॉल्ट रूप से MP3 में वापस आता है, और विकल्प के तौर पर Opus, AAC, FLAC, WAV और PCM मिलते हैं। हर फ़ॉर्मेट का अपना काम है:
MP3 वेबसाइट और पॉडकास्ट के लिए सुरक्षित डिफ़ॉल्ट है।
Opus इंटरनेट पर स्ट्रीमिंग के लिए ठीक है, क्योंकि यह छोटा रहता है।
AAC फ़ोन और वीडियो एडिटर्स में अच्छा चलता है।
FLAC सब कुछ सुरक्षित रखता है, जो तब मायने रखता है जब आप फ़ाइल को आगे एडिट करने की सोच रहे हों।
WAV और PCM बिना कंप्रेशन वाले हैं, इसलिए जब लेटेंसी फ़ाइल के आकार से ज़्यादा मायने रखती है, तब ये चुने जाते हैं।
यह endpoint ऑडियो को बनते समय ही स्ट्रीम कर सकता है, इसलिए पूरा क्लिप तैयार होने से पहले ही प्लेबैक शुरू हो सकता है। वॉयस असिस्टेंट्स के लिए यह बड़ा फ़र्क डालता है, क्योंकि वहाँ दो सेकंड की चुप्पी भी कॉल कटने जैसी लगती है।
सभी 13 Voices एक नज़र में
नौ voices हर मॉडल पर चलती हैं। चार और सिर्फ़ gpt-4o-mini-tts पर चलती हैं। यह रही पूरी सूची, साथ में एक नोट कि सुनने वाले हर एक को आम तौर पर कैसे बताते हैं।
💡 पहले यह पढ़ें: OpenAI अपनी voices के लिए व्यक्तित्व के लेबल प्रकाशित नहीं करता, इसलिए "आम तौर पर इस तरह बताई जाती है" वाला कॉलम उस बात को दिखाता है जो डेवलपर्स और सुनने वाले अक्सर कहते हैं, कोई आधिकारिक स्पेसिफ़िकेशन नहीं। इसे शॉर्टलिस्ट की तरह लें और अंतिम फ़ैसला अपने कानों पर छोड़ें।
मूल नौ
Voice
आम तौर पर इस तरह बताई जाती है
कहाँ चलती है
alloy
न्यूट्रल, संतुलित, हर काम के लिए
तीनों मॉडल
ash
नरम, थोड़ी खुरदरी, बातचीत जैसी
तीनों मॉडल
coral
गर्मजोश, दोस्ताना, सहज
तीनों मॉडल
echo
साफ़, स्थिर, तथ्य-आधारित
तीनों मॉडल
fable
कहानीकार जैसा अंदाज़, अभिव्यंजक, अक्सर ब्रिटिश सुनाई देती है
तीनों मॉडल
nova
चमकदार, ऊर्जावान, उत्साही
तीनों मॉडल
onyx
गहरी, आधिकारिक, शांत
तीनों मॉडल
sage
नपी-तुली, सोच-समझकर, समान गति
तीनों मॉडल
shimmer
हल्की, साफ़, कोमल
तीनों मॉडल
ये नौ सबसे लंबे समय से हैं, इसलिए इनका इस्तेमाल सबसे ज़्यादा होता है और इन पर राय ढूँढना भी सबसे आसान है। अगर आपका प्रोडक्ट पहले से alloy या nova के साथ चल रहा है, तो स्विच करने की वजह तभी होती है जब नई voices कोई खास समस्या हल करें।
चार नई Voices
Voice
आम तौर पर इस तरह बताई जाती है
कहाँ चलती है
ballad
चिकनी, मधुर, कोमल
केवल gpt-4o-mini-tts
verse
अभिव्यंजक, गतिशील, जीवंत
केवल gpt-4o-mini-tts
marin
स्वाभाविक, परिष्कृत, फ़्लैगशिप क्वालिटी
केवल gpt-4o-mini-tts
cedar
स्वाभाविक, ज़मीन से जुड़ी, गर्म
केवल gpt-4o-mini-tts
OpenAI का अपना डॉक्यूमेंटेशन सबसे अच्छी क्वालिटी के लिए marin या cedar की सलाह देता है, जिससे ये किसी नए प्रोजेक्ट के लिए स्वाभाविक पहला टेस्ट बन जाती हैं। चूँकि ये केवल gpt-4o-mini-tts पर चलती हैं, इन्हें चुनने का मतलब यह भी है कि आपको इंस्ट्रक्शन फ़ील्ड मिलेगा, और असली लचीलापन वहीं है।
Voices आज़माएँ और डिलीवरी को दिशा दें
ऑडियो किसी टेक्स्ट पेज के अंदर नहीं रह सकता, इसलिए असली सैंपल पाने का सबसे तेज़ रास्ता उन्हें खुद बनाना है। एक ही स्क्रिप्ट के तेरह क्लिप बनाने में कुछ मिनट लगते हैं और कुछ पैसे।
एक स्क्रिप्ट जो कमज़ोर voices को पकड़ ले
अच्छी टेस्ट स्क्रिप्ट कोई सुंदर अनुच्छेद नहीं होती। वह एक स्ट्रेस टेस्ट होती है। ऐसी कोई चीज़ इस्तेमाल करें:
4,817 नंबर का ऑर्डर 3 मार्च को Dr. Okonkwo के पास 22 Birchwood Lane पर भेजा जाएगा। रुकिए, क्या आपने गुरुवार कहा? सच कहूँ तो मुझे उम्मीद नहीं थी कि डिलीवरी जल्दी आ जाएगी, पर देखिए, ऐसा हो ही गया। तीन बातें याद रखें: रसीद साथ लाएँ, सील जाँचें, और कुछ भी ठीक न लगे तो हमें कॉल करें।
इसमें एक लंबा नंबर, एक तारीख, एक कठिन सरनेम, एक सवाल, थोड़ा भावनात्मक मोड़ और एक सूची है। जो voices एक वाक्य पर बहुत अच्छी लगती हैं, वे अक्सर इनमें से किसी एक पर लड़खड़ा जाती हैं। फिर यह लूप चलाएँ:
from openai import OpenAI
from pathlib import Path
client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
"onyx", "sage", "shimmer", "verse", "marin", "cedar"]
for voice in voices:
out = Path(f"sample_{voice}.mp3")
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice=voice,
input=script,
instructions="Speak clearly in a warm, even tone.",
) as response:
response.stream_to_file(out)
अच्छे हेडफ़ोन लगाकर सुनें और हर क्लिप को चार बातों पर अंक दें:
नंबर और नाम: क्या "4,817" एक स्वाभाविक वाक्यांश की तरह निकलता है?
सवाल: क्या "क्या आपने गुरुवार कहा?" पर पिच ऊपर उठती है?
गति: क्या कॉमा साँस जैसे लगते हैं या रुकावट जैसे?
थकान: क्या आप इस voice को लगातार दस मिनट सुन पाएँगे?
इंस्ट्रक्शन जो पढ़ने का ढंग बदल दें
gpt-4o-mini-tts पर एक इंस्ट्रक्शन फ़ील्ड आपको सादी भाषा में बताने देता है कि voice कैसी सुनाई दे। OpenAI बताता है कि मॉडल को एक्सेंट, भावनात्मक रेंज, इंटोनेशन, इम्प्रेशन, गति, लहज़े और फुसफुसाने के लिए प्रॉम्प्ट किया जा सकता है। पुराने tts-1 और tts-1-hd मॉडल इसे सपोर्ट नहीं करते।
इंस्ट्रक्शन
क्या उम्मीद करें
"Speak in a cheerful and positive tone."
उठी हुई, दोस्ताना पढ़ंत, ऑनबोर्डिंग के लिए अच्छी
"Calm, slow, like a bedtime story."
लंबे विरामों के साथ नरम डिलीवरी
"Professional and concise, like a news anchor."
कसी हुई गति, सपाट भावना
"Whisper the final sentence."
नाटकीय असर के लिए धीमी आवाज़ में आख़िरी वाक्य
"Sound apologetic but confident."
देरी के बारे में सपोर्ट स्क्रिप्ट के लिए उपयोगी
💡 टिप: इंस्ट्रक्शन छोटे और ठोस रखें। एक साफ़ वाक्य अक्सर विशेषणों के पूरे अनुच्छेद से बेहतर काम करता है, और एक समय में एक ही इंस्ट्रक्शन बदलने से साफ़ पता चलता है कि नतीजे में क्या बदला।
कौन-सी Voice किस काम के लिए ठीक है
नीचे की तालिका आज़माने के लिए शुरुआती बिंदुओं का सेट है, नियम नहीं। Voices व्यक्तिगत पसंद पर निर्भर करती हैं, और आपकी स्क्रिप्ट किसी भी लेबल से ज़्यादा मायने रखती है।
काम
पहली पसंद
विकल्प
ऑडियोबुक और लंबे रीड
cedar
sage
सपोर्ट और फ़ोन बॉट
marin
coral
प्रोडक्ट डेमो
alloy
echo
विज्ञापन और छोटे क्लिप
nova
verse
मेडिटेशन और शांत कंटेंट
ballad
shimmer
नैरेशन और लंबे रीड
लंबी सुनाई मज़बूत व्यक्तित्व वाली voices को सज़ा देती है। जो तेज़ voice पंद्रह सेकंड में आपको मोह लेती है, वही दस मिनट तक आपको थका सकती है। नैरेशन के लिए ऐसी voice चुनें जो समान और धीमी हो, फिर इंस्ट्रक्शन से गर्माहट जोड़ें। पांडुलिपि को अनुच्छेदों की सीमाओं पर बाँटें, क्योंकि हर रिक्वेस्ट की इनपुट लंबाई की एक सीमा होती है और छोटे हिस्से voice को नई शुरुआत देते हैं। सटीक सीमा के लिए मौजूदा API रेफ़रेंस देखें।
असिस्टेंट्स और सपोर्ट बॉट
बॉट के लिए सबसे ज़रूरी गुण हैं स्पष्टता और हल्के दबाव में भी भरोसेमंद लहज़ा। अपनी voice को उन सबसे खराब संदेशों पर परखें जो आप भेजते हैं: रिफ़ंड, देरी, आउटेज। जो voice बुरी खबर सुनाते समय भी खुशमिज़ाज लगती है, वह असंवेदनशील लगती है, इसलिए हर रिक्वेस्ट में "calm and sincere" जैसे इंस्ट्रक्शन लिखें। इसके साथ स्ट्रीमिंग जोड़ें ताकि जवाब तुरंत शुरू हों।
विज्ञापन और छोटे क्लिप
छोटे क्लिप ऊर्जा को इनाम देते हैं। nova या verse पर भरोसा करें, "upbeat, quick, conversational" जैसा इंस्ट्रक्शन जोड़ें, और वाक्य छोटे रखें ताकि बोलने की गति कभी जल्दबाज़ी में न आए। दो-तीन वर्ज़न रेंडर करें और कान से चुनें, क्योंकि अच्छे और बेहतरीन टेक के बीच का फ़र्क अक्सर एक बदले हुए विशेषण भर का होता है।
असली आँकड़ों में लागत और सीमाएँ
प्रति कैरेक्टर बनाम प्रति टोकन
10,000 शब्दों की पांडुलिपि में लगभग 60,000 कैरेक्टर होते हैं, और स्वाभाविक गति पर लगभग 67 मिनट का भाषण बनता है। gpt-4o-mini-tts के लिए OpenAI का लॉन्च अनुमान ऑडियो के प्रति मिनट लगभग 1.5 सेंट था, और नीचे की आख़िरी पंक्ति इसी से निकाली गई है।
मॉडल
10,000 शब्दों के लिए मोटी लागत
tts-1
लगभग $0.90
tts-1-hd
लगभग $1.80
gpt-4o-mini-tts
लगभग $1.00
ये आँकड़े इतने छोटे हैं कि मॉडल का फ़ैसला कीमत नहीं, voice की क्वालिटी करे। असली लागत आपका वह समय है जो उन टेक को दोबारा रेंडर करने में जाता है जिनमें लहज़ा चूक गया, और यही इंस्ट्रक्शन फ़ील्ड के पक्ष में एक और तर्क है।
भाषा समर्थन
OpenAI 50 से ज़्यादा भाषाओं का समर्थन सूचीबद्ध करता है, Afrikaans और Arabic से लेकर Czech, Danish और Dutch तक, साथ में यह नोट कि voices फ़िलहाल अंग्रेज़ी के लिए ऑप्टिमाइज़ हैं। व्यवहार में इसका मतलब है कि गैर-अंग्रेज़ी स्क्रिप्ट चलती है, पर एक्सेंट अंग्रेज़ी उच्चारण की ओर खिसक सकता है। हर वह भाषा टेस्ट करें जो आप भेजते हैं, और लॉन्च से पहले किसी मूल वक्ता से सुनवाएँ।
प्रकटीकरण और कस्टम Voices
OpenAI की usage policies के अनुसार end users को साफ़ तौर पर बताना ज़रूरी है कि वे जो आवाज़ सुन रहे हैं, वह AI से बनी है और किसी इंसान की नहीं है। इस बात को अपने प्रोडक्ट में साफ़ दिखाएँ, छोटे अक्षरों वाली शर्तों में न छिपाएँ। कस्टम voices उपलब्ध हैं, लेकिन वे एक अलग प्रक्रिया के पीछे हैं, जिसमें speaker की सहमति की रिकॉर्डिंग और ऑडियो सैंपल देना ज़रूरी है। इसलिए अगर आप ब्रांड voice चाहते हैं, तो उसके लिए पहले से समय रखकर चलें।
PicassoIA पर विकल्प
PicassoIA OpenAI के speech मॉडल सूचीबद्ध नहीं करता। वह Generate speech कैटेगरी में कई दूसरे इंजन देता है, और साथ में उन दो कामों के टूल्स भी जो voice के आसपास होते हैं: नतीजे की जाँच और उसके नीचे साउंड जोड़ना।
गलत उच्चारण वाले नाम पकड़ने का एक तेज़ तरीका है कि बने ऑडियो को वापस speech to text से चलाएँ और उसकी तुलना अपनी स्क्रिप्ट से करें। GPT-4o Transcribe और GPT-4o Mini Transcribe दोनों यह काम करते हैं, और Gemini 3 Pro तीसरी राय के रूप में ठीक है। अगर ट्रांसक्रिप्ट कोई शब्द गिरा दे या बदल दे, तो सुनने वाले ने शायद वही सुना होगा।
Voice के नीचे म्यूज़िक जोड़ें
बिना किसी बेड के वॉइसओवर खाली-सा लग सकता है। Generate music कैटेगरी में एक ट्रैक बनाएँ और उसे नैरेशन के पीछे धीमा मिक्स करें। ElevenLabs Music, MiniMax Music 2.6, Lyria 3 Pro और Stable Audio 2.5 सभी टेक्स्ट प्रॉम्प्ट को ट्रैक में बदलते हैं। "soft instrumental, no vocals, steady tempo" माँगें ताकि कुछ भी शब्दों से होड़ न करे।
PicassoIA पर Gemini 3.1 Flash TTS इस्तेमाल करें
चूँकि OpenAI की voices वहाँ होस्ट नहीं होतीं, सबसे नज़दीकी विकल्प Gemini 3.1 Flash TTS है, जो बड़ी voice सूची के साथ मिलता-जुलता वर्कफ़्लो देता है। इसे चलाने का तरीका यह है:
मॉडल पेज खोलें और इनपुट फ़ॉर्म ढूँढें।
अपनी स्क्रिप्ट पेस्ट करें Text फ़ील्ड में। सीमा 4,000 बाइट्स है, इसलिए लंबी स्क्रिप्ट बाँटें।
30 विकल्पों में से एक voice चुनें। डिफ़ॉल्ट Kore है, और Puck, Charon, Fenrir, Aoede और Zephyr जैसे नाम अच्छी शुरुआत हैं।
Prompt फ़ील्ड में style prompt लिखें। डिफ़ॉल्ट "Say the following." है। उसकी जगह "Speak slowly with confidence" या "Use a calm, friendly tone." जैसा कुछ रखें।
Language code सेट करें। डिफ़ॉल्ट en-US है, और 70 से ज़्यादा कोड उपलब्ध हैं।
जनरेट करें, सुनें और समायोजित करें। हर रन में एक ही चीज़ बदलें ताकि पता रहे कि फ़र्क किससे पड़ा।
सेटिंग
टिप
Text tags
[whispering], [laughing], [shouting], [sigh] या [extremely fast] ठीक उस वाक्यांश से पहले जोड़ें जिस पर उनका असर पड़ना चाहिए
Prompt
एक वाक्य में गति, लहज़ा और एक्सेंट बताएँ
Voice
फ़ैसला करने से पहले एक ही अनुच्छेद पर तीन voices टेस्ट करें
Language code
इसे स्क्रिप्ट की भाषा से मिलाएँ, अपनी भाषा से नहीं
💡 टिप: तैयार क्लिप को GPT-4o Transcribe से चलाएँ और पुष्टि करें कि हर नाम और नंबर वैसे ही आया है जैसा लिखा था।
खुद आज़माएँ Picasso IA पर
OpenAI TTS voices के बीच चुनना सुनने का काम है, और इसमें बेहतर होने का सबसे तेज़ रास्ता है क्लिप बनाना और उनकी तुलना करना। ऊपर का टेस्ट स्क्रिप्ट लें, उसे तेरह voices पर चलाएँ, फिर वही स्क्रिप्ट Picasso IA पर Gemini 3.1 Flash TTS और MiniMax Speech 2.8 HD पर चलाएँ। एक हल्का म्यूज़िक बेड जोड़ें, ट्रांसक्रिप्ट जाँचें, और उस voice को रखें जो दसवीं बार सुनने पर भी सही लगे। Picasso IA खोलें, अपनी स्क्रिप्ट पेस्ट करें, और एक voice और एक इंस्ट्रक्शन से शुरुआत करें। आपका पहला काम का वॉइसओवर डॉपडाउन से दिखने वाले से कहीं ज़्यादा करीब है।