OpenAI TTS Voices: नमूने, विकल्प और कौन-सी चुनें

तेरह OpenAI TTS voices, तीन मॉडल और कोई ऑडियो प्रीव्यू नहीं। यह लेख हर voice की तुलना करता है, बताता है कि उसे कौन-सा मॉडल सपोर्ट करता है, खुद परखने के लिए एक टेस्ट स्क्रिप्ट देता है, असली लागत का हिसाब समझाता है, और नैरेशन, सपोर्ट बॉट और छोटे वीडियो के लिए शुरुआती पसंद सुझाता है।

OpenAI TTS Voices: नमूने, विकल्प और कौन-सी चुनें
Cristian Da Conceicao
Picasso IA के संस्थापक

तेरह voice नाम, तीन मॉडल, और उस पेज पर कोई ऑडियो प्रीव्यू नहीं जहाँ से आपको एक चुनना है। OpenAI के speech endpoint पर ज़्यादातर डेवलपर्स सबसे पहले इसी दीवार से टकराते हैं। Alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin और cedar, ये सब ड्रॉपडाउन में बराबर ठीक लगते हैं, फिर भी ये हर मॉडल पर एक जैसा बर्ताव नहीं करते, और आपकी स्क्रिप्ट पर इनकी आवाज़ भी एक जैसी नहीं होगी। यह लेख बताता है कि हर OpenAI TTS voice क्या है, उसे कौन-सा मॉडल सपोर्ट करता है, सभी तेरह को दस मिनट से कम में कैसे आज़माएँ, बिल कैसा दिखता है, और नैरेशन, सपोर्ट बॉट और छोटे वीडियो के लिए किससे शुरुआत करें। यह PicassoIA पर उन speech टूल्स की ओर भी इशारा करता है जो OpenAI की पेशकश के साथ मौजूद हैं, जिनमें एक ट्यूटोरियल वाला टूल भी है जिसे आप आज ही चला सकते हैं।

OpenAI TTS असल में क्या देता है

OpenAI की text to speech API एक ही endpoint के ज़रिए लिखे टेक्स्ट को बोले गए ऑडियो में बदलती है। आप एक मॉडल का नाम, एक voice का नाम और अपना टेक्स्ट भेजते हैं, और बदले में एक ऑडियो फ़ाइल मिलती है। जो बात लोगों को उलझा देती है वह यह है कि आप कौन-सा मॉडल चुनते हैं, यह तय करता है कि आप कितनी voices इस्तेमाल कर सकते हैं और बोलने के ढंग पर आपका कितना नियंत्रण होगा।

तीन मॉडल, तीन प्राइस टैग

मॉडलVoicesकीमतसबसे अच्छा किसके लिए
tts-19प्रति 1M characters $15तेज़, कम लागत वाले ड्राफ़्ट और लाइव प्लेबैक
tts-1-hd9प्रति 1M characters $30पहले से रेंडर किया गया ज़्यादा फ़िडेलिटी वाला ऑडियो
gpt-4o-mini-tts13प्रति 1M text tokens इनपुट $0.60, प्रति 1M audio tokens आउटपुट $12इंस्ट्रक्शन के ज़रिए लहज़ा, गति और एक्सेंट बदलने की सुविधा

दोनों पुराने मॉडल कैरेक्टर गिनती के हिसाब से कीमत लेते हैं। gpt-4o-mini-tts की कीमत टोकन में तय होती है, यानी आपकी लागत स्क्रिप्ट की लंबाई पर नहीं, बल्कि ऑडियो की लंबाई पर चलती है।

एक लकड़ी की मेज़ पर रखे चांदी के स्टूडियो माइक्रोफ़ोन की ग्रिल का क्लोज़-अप

आउटपुट फ़ॉर्मेट और स्ट्रीमिंग

ऑडियो डिफ़ॉल्ट रूप से MP3 में वापस आता है, और विकल्प के तौर पर Opus, AAC, FLAC, WAV और PCM मिलते हैं। हर फ़ॉर्मेट का अपना काम है:

  • MP3 वेबसाइट और पॉडकास्ट के लिए सुरक्षित डिफ़ॉल्ट है।
  • Opus इंटरनेट पर स्ट्रीमिंग के लिए ठीक है, क्योंकि यह छोटा रहता है।
  • AAC फ़ोन और वीडियो एडिटर्स में अच्छा चलता है।
  • FLAC सब कुछ सुरक्षित रखता है, जो तब मायने रखता है जब आप फ़ाइल को आगे एडिट करने की सोच रहे हों।
  • WAV और PCM बिना कंप्रेशन वाले हैं, इसलिए जब लेटेंसी फ़ाइल के आकार से ज़्यादा मायने रखती है, तब ये चुने जाते हैं।

यह endpoint ऑडियो को बनते समय ही स्ट्रीम कर सकता है, इसलिए पूरा क्लिप तैयार होने से पहले ही प्लेबैक शुरू हो सकता है। वॉयस असिस्टेंट्स के लिए यह बड़ा फ़र्क डालता है, क्योंकि वहाँ दो सेकंड की चुप्पी भी कॉल कटने जैसी लगती है।

सभी 13 Voices एक नज़र में

एक मेज़ का ऊपर से लिया दृश्य, जिस पर तेरह छोटे मग, हेडफ़ोन और एक नोटबुक रखे हैं

नौ voices हर मॉडल पर चलती हैं। चार और सिर्फ़ gpt-4o-mini-tts पर चलती हैं। यह रही पूरी सूची, साथ में एक नोट कि सुनने वाले हर एक को आम तौर पर कैसे बताते हैं।

💡 पहले यह पढ़ें: OpenAI अपनी voices के लिए व्यक्तित्व के लेबल प्रकाशित नहीं करता, इसलिए "आम तौर पर इस तरह बताई जाती है" वाला कॉलम उस बात को दिखाता है जो डेवलपर्स और सुनने वाले अक्सर कहते हैं, कोई आधिकारिक स्पेसिफ़िकेशन नहीं। इसे शॉर्टलिस्ट की तरह लें और अंतिम फ़ैसला अपने कानों पर छोड़ें।

मूल नौ

Voiceआम तौर पर इस तरह बताई जाती हैकहाँ चलती है
alloyन्यूट्रल, संतुलित, हर काम के लिएतीनों मॉडल
ashनरम, थोड़ी खुरदरी, बातचीत जैसीतीनों मॉडल
coralगर्मजोश, दोस्ताना, सहजतीनों मॉडल
echoसाफ़, स्थिर, तथ्य-आधारिततीनों मॉडल
fableकहानीकार जैसा अंदाज़, अभिव्यंजक, अक्सर ब्रिटिश सुनाई देती हैतीनों मॉडल
novaचमकदार, ऊर्जावान, उत्साहीतीनों मॉडल
onyxगहरी, आधिकारिक, शांततीनों मॉडल
sageनपी-तुली, सोच-समझकर, समान गतितीनों मॉडल
shimmerहल्की, साफ़, कोमलतीनों मॉडल

ये नौ सबसे लंबे समय से हैं, इसलिए इनका इस्तेमाल सबसे ज़्यादा होता है और इन पर राय ढूँढना भी सबसे आसान है। अगर आपका प्रोडक्ट पहले से alloy या nova के साथ चल रहा है, तो स्विच करने की वजह तभी होती है जब नई voices कोई खास समस्या हल करें।

चार नई Voices

Voiceआम तौर पर इस तरह बताई जाती हैकहाँ चलती है
balladचिकनी, मधुर, कोमलकेवल gpt-4o-mini-tts
verseअभिव्यंजक, गतिशील, जीवंतकेवल gpt-4o-mini-tts
marinस्वाभाविक, परिष्कृत, फ़्लैगशिप क्वालिटीकेवल gpt-4o-mini-tts
cedarस्वाभाविक, ज़मीन से जुड़ी, गर्मकेवल gpt-4o-mini-tts

OpenAI का अपना डॉक्यूमेंटेशन सबसे अच्छी क्वालिटी के लिए marin या cedar की सलाह देता है, जिससे ये किसी नए प्रोजेक्ट के लिए स्वाभाविक पहला टेस्ट बन जाती हैं। चूँकि ये केवल gpt-4o-mini-tts पर चलती हैं, इन्हें चुनने का मतलब यह भी है कि आपको इंस्ट्रक्शन फ़ील्ड मिलेगा, और असली लचीलापन वहीं है।

Voices आज़माएँ और डिलीवरी को दिशा दें

लैपटॉप पर ऑडियो फ़ाइलों की तुलना करती एक महिला, जिसके बगल में प्रिंटेड स्क्रिप्ट रखी है

ऑडियो किसी टेक्स्ट पेज के अंदर नहीं रह सकता, इसलिए असली सैंपल पाने का सबसे तेज़ रास्ता उन्हें खुद बनाना है। एक ही स्क्रिप्ट के तेरह क्लिप बनाने में कुछ मिनट लगते हैं और कुछ पैसे।

एक स्क्रिप्ट जो कमज़ोर voices को पकड़ ले

अच्छी टेस्ट स्क्रिप्ट कोई सुंदर अनुच्छेद नहीं होती। वह एक स्ट्रेस टेस्ट होती है। ऐसी कोई चीज़ इस्तेमाल करें:

4,817 नंबर का ऑर्डर 3 मार्च को Dr. Okonkwo के पास 22 Birchwood Lane पर भेजा जाएगा। रुकिए, क्या आपने गुरुवार कहा? सच कहूँ तो मुझे उम्मीद नहीं थी कि डिलीवरी जल्दी आ जाएगी, पर देखिए, ऐसा हो ही गया। तीन बातें याद रखें: रसीद साथ लाएँ, सील जाँचें, और कुछ भी ठीक न लगे तो हमें कॉल करें।

इसमें एक लंबा नंबर, एक तारीख, एक कठिन सरनेम, एक सवाल, थोड़ा भावनात्मक मोड़ और एक सूची है। जो voices एक वाक्य पर बहुत अच्छी लगती हैं, वे अक्सर इनमें से किसी एक पर लड़खड़ा जाती हैं। फिर यह लूप चलाएँ:

from openai import OpenAI
from pathlib import Path

client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
          "onyx", "sage", "shimmer", "verse", "marin", "cedar"]

for voice in voices:
    out = Path(f"sample_{voice}.mp3")
    with client.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice=voice,
        input=script,
        instructions="Speak clearly in a warm, even tone.",
    ) as response:
        response.stream_to_file(out)

अच्छे हेडफ़ोन लगाकर सुनें और हर क्लिप को चार बातों पर अंक दें:

  1. नंबर और नाम: क्या "4,817" एक स्वाभाविक वाक्यांश की तरह निकलता है?
  2. सवाल: क्या "क्या आपने गुरुवार कहा?" पर पिच ऊपर उठती है?
  3. गति: क्या कॉमा साँस जैसे लगते हैं या रुकावट जैसे?
  4. थकान: क्या आप इस voice को लगातार दस मिनट सुन पाएँगे?

इंस्ट्रक्शन जो पढ़ने का ढंग बदल दें

gpt-4o-mini-tts पर एक इंस्ट्रक्शन फ़ील्ड आपको सादी भाषा में बताने देता है कि voice कैसी सुनाई दे। OpenAI बताता है कि मॉडल को एक्सेंट, भावनात्मक रेंज, इंटोनेशन, इम्प्रेशन, गति, लहज़े और फुसफुसाने के लिए प्रॉम्प्ट किया जा सकता है। पुराने tts-1 और tts-1-hd मॉडल इसे सपोर्ट नहीं करते।

इंस्ट्रक्शनक्या उम्मीद करें
"Speak in a cheerful and positive tone."उठी हुई, दोस्ताना पढ़ंत, ऑनबोर्डिंग के लिए अच्छी
"Calm, slow, like a bedtime story."लंबे विरामों के साथ नरम डिलीवरी
"Professional and concise, like a news anchor."कसी हुई गति, सपाट भावना
"Whisper the final sentence."नाटकीय असर के लिए धीमी आवाज़ में आख़िरी वाक्य
"Sound apologetic but confident."देरी के बारे में सपोर्ट स्क्रिप्ट के लिए उपयोगी

💡 टिप: इंस्ट्रक्शन छोटे और ठोस रखें। एक साफ़ वाक्य अक्सर विशेषणों के पूरे अनुच्छेद से बेहतर काम करता है, और एक समय में एक ही इंस्ट्रक्शन बदलने से साफ़ पता चलता है कि नतीजे में क्या बदला।

कौन-सी Voice किस काम के लिए ठीक है

नीचे की तालिका आज़माने के लिए शुरुआती बिंदुओं का सेट है, नियम नहीं। Voices व्यक्तिगत पसंद पर निर्भर करती हैं, और आपकी स्क्रिप्ट किसी भी लेबल से ज़्यादा मायने रखती है।

कामपहली पसंदविकल्प
ऑडियोबुक और लंबे रीडcedarsage
सपोर्ट और फ़ोन बॉटmarincoral
प्रोडक्ट डेमोalloyecho
विज्ञापन और छोटे क्लिपnovaverse
मेडिटेशन और शांत कंटेंटballadshimmer

नैरेशन और लंबे रीड

लैंप के बगल में आर्मचेयर पर बैठकर ऑडियोबुक सुनता एक बुज़ुर्ग आदमी

लंबी सुनाई मज़बूत व्यक्तित्व वाली voices को सज़ा देती है। जो तेज़ voice पंद्रह सेकंड में आपको मोह लेती है, वही दस मिनट तक आपको थका सकती है। नैरेशन के लिए ऐसी voice चुनें जो समान और धीमी हो, फिर इंस्ट्रक्शन से गर्माहट जोड़ें। पांडुलिपि को अनुच्छेदों की सीमाओं पर बाँटें, क्योंकि हर रिक्वेस्ट की इनपुट लंबाई की एक सीमा होती है और छोटे हिस्से voice को नई शुरुआत देते हैं। सटीक सीमा के लिए मौजूदा API रेफ़रेंस देखें।

असिस्टेंट्स और सपोर्ट बॉट

चमकदार ऑफ़िस में डुअल मॉनिटर सेटअप की ओर हेडसेट लगाकर बोलता एक सपोर्ट एजेंट

बॉट के लिए सबसे ज़रूरी गुण हैं स्पष्टता और हल्के दबाव में भी भरोसेमंद लहज़ा। अपनी voice को उन सबसे खराब संदेशों पर परखें जो आप भेजते हैं: रिफ़ंड, देरी, आउटेज। जो voice बुरी खबर सुनाते समय भी खुशमिज़ाज लगती है, वह असंवेदनशील लगती है, इसलिए हर रिक्वेस्ट में "calm and sincere" जैसे इंस्ट्रक्शन लिखें। इसके साथ स्ट्रीमिंग जोड़ें ताकि जवाब तुरंत शुरू हों।

विज्ञापन और छोटे क्लिप

एक रसोई में ट्राइपॉड पर फ़ोन रखकर वर्टिकल वीडियो रिकॉर्ड करता एक युवक

छोटे क्लिप ऊर्जा को इनाम देते हैं। nova या verse पर भरोसा करें, "upbeat, quick, conversational" जैसा इंस्ट्रक्शन जोड़ें, और वाक्य छोटे रखें ताकि बोलने की गति कभी जल्दबाज़ी में न आए। दो-तीन वर्ज़न रेंडर करें और कान से चुनें, क्योंकि अच्छे और बेहतरीन टेक के बीच का फ़र्क अक्सर एक बदले हुए विशेषण भर का होता है।

असली आँकड़ों में लागत और सीमाएँ

एक लकड़ी की मेज़ पर लेजर, कैलकुलेटर और इनवॉइस का ऊपर से लिया दृश्य

प्रति कैरेक्टर बनाम प्रति टोकन

10,000 शब्दों की पांडुलिपि में लगभग 60,000 कैरेक्टर होते हैं, और स्वाभाविक गति पर लगभग 67 मिनट का भाषण बनता है। gpt-4o-mini-tts के लिए OpenAI का लॉन्च अनुमान ऑडियो के प्रति मिनट लगभग 1.5 सेंट था, और नीचे की आख़िरी पंक्ति इसी से निकाली गई है।

मॉडल10,000 शब्दों के लिए मोटी लागत
tts-1लगभग $0.90
tts-1-hdलगभग $1.80
gpt-4o-mini-ttsलगभग $1.00

ये आँकड़े इतने छोटे हैं कि मॉडल का फ़ैसला कीमत नहीं, voice की क्वालिटी करे। असली लागत आपका वह समय है जो उन टेक को दोबारा रेंडर करने में जाता है जिनमें लहज़ा चूक गया, और यही इंस्ट्रक्शन फ़ील्ड के पक्ष में एक और तर्क है।

भाषा समर्थन

OpenAI 50 से ज़्यादा भाषाओं का समर्थन सूचीबद्ध करता है, Afrikaans और Arabic से लेकर Czech, Danish और Dutch तक, साथ में यह नोट कि voices फ़िलहाल अंग्रेज़ी के लिए ऑप्टिमाइज़ हैं। व्यवहार में इसका मतलब है कि गैर-अंग्रेज़ी स्क्रिप्ट चलती है, पर एक्सेंट अंग्रेज़ी उच्चारण की ओर खिसक सकता है। हर वह भाषा टेस्ट करें जो आप भेजते हैं, और लॉन्च से पहले किसी मूल वक्ता से सुनवाएँ।

प्रकटीकरण और कस्टम Voices

OpenAI की usage policies के अनुसार end users को साफ़ तौर पर बताना ज़रूरी है कि वे जो आवाज़ सुन रहे हैं, वह AI से बनी है और किसी इंसान की नहीं है। इस बात को अपने प्रोडक्ट में साफ़ दिखाएँ, छोटे अक्षरों वाली शर्तों में न छिपाएँ। कस्टम voices उपलब्ध हैं, लेकिन वे एक अलग प्रक्रिया के पीछे हैं, जिसमें speaker की सहमति की रिकॉर्डिंग और ऑडियो सैंपल देना ज़रूरी है। इसलिए अगर आप ब्रांड voice चाहते हैं, तो उसके लिए पहले से समय रखकर चलें।

PicassoIA पर विकल्प

PicassoIA OpenAI के speech मॉडल सूचीबद्ध नहीं करता। वह Generate speech कैटेगरी में कई दूसरे इंजन देता है, और साथ में उन दो कामों के टूल्स भी जो voice के आसपास होते हैं: नतीजे की जाँच और उसके नीचे साउंड जोड़ना।

अन्य Speech इंजन

मॉडलख़ास बात
Gemini 3.1 Flash TTS30 voices, 70+ language codes, style prompts और expressive tags
MiniMax Speech 2.8 HDस्टूडियो क्वालिटी वॉइसओवर
ElevenLabs V3स्वाभाविक, अभिव्यंजक AI वॉइसओवर
Inworld TTS 1.5 Max15 भाषाओं में तेज़ वॉइसओवर
Chatterboxभावना नियंत्रण के साथ वॉइस क्लोनिंग
Qwen3 TTSकिसी voice को क्लोन करें या अपनी बनाएँ

ट्रांसक्रिप्शन से आउटपुट जाँचें

गलत उच्चारण वाले नाम पकड़ने का एक तेज़ तरीका है कि बने ऑडियो को वापस speech to text से चलाएँ और उसकी तुलना अपनी स्क्रिप्ट से करें। GPT-4o Transcribe और GPT-4o Mini Transcribe दोनों यह काम करते हैं, और Gemini 3 Pro तीसरी राय के रूप में ठीक है। अगर ट्रांसक्रिप्ट कोई शब्द गिरा दे या बदल दे, तो सुनने वाले ने शायद वही सुना होगा।

Voice के नीचे म्यूज़िक जोड़ें

एक मंद होम स्टूडियो में बड़े मिक्सिंग कंसोल पर फ़ेडर समायोजित करता एक म्यूज़िक प्रोड्यूसर

बिना किसी बेड के वॉइसओवर खाली-सा लग सकता है। Generate music कैटेगरी में एक ट्रैक बनाएँ और उसे नैरेशन के पीछे धीमा मिक्स करें। ElevenLabs Music, MiniMax Music 2.6, Lyria 3 Pro और Stable Audio 2.5 सभी टेक्स्ट प्रॉम्प्ट को ट्रैक में बदलते हैं। "soft instrumental, no vocals, steady tempo" माँगें ताकि कुछ भी शब्दों से होड़ न करे।

PicassoIA पर Gemini 3.1 Flash TTS इस्तेमाल करें

चमकदार मेज़ पर लैपटॉप, छोटा कंडेंसर माइक्रोफ़ोन और हाथ से लिखी voice सूची वाली नोटबुक

चूँकि OpenAI की voices वहाँ होस्ट नहीं होतीं, सबसे नज़दीकी विकल्प Gemini 3.1 Flash TTS है, जो बड़ी voice सूची के साथ मिलता-जुलता वर्कफ़्लो देता है। इसे चलाने का तरीका यह है:

  1. मॉडल पेज खोलें और इनपुट फ़ॉर्म ढूँढें।
  2. अपनी स्क्रिप्ट पेस्ट करें Text फ़ील्ड में। सीमा 4,000 बाइट्स है, इसलिए लंबी स्क्रिप्ट बाँटें।
  3. 30 विकल्पों में से एक voice चुनें। डिफ़ॉल्ट Kore है, और Puck, Charon, Fenrir, Aoede और Zephyr जैसे नाम अच्छी शुरुआत हैं।
  4. Prompt फ़ील्ड में style prompt लिखें। डिफ़ॉल्ट "Say the following." है। उसकी जगह "Speak slowly with confidence" या "Use a calm, friendly tone." जैसा कुछ रखें।
  5. Language code सेट करें। डिफ़ॉल्ट en-US है, और 70 से ज़्यादा कोड उपलब्ध हैं।
  6. जनरेट करें, सुनें और समायोजित करें। हर रन में एक ही चीज़ बदलें ताकि पता रहे कि फ़र्क किससे पड़ा।
सेटिंगटिप
Text tags[whispering], [laughing], [shouting], [sigh] या [extremely fast] ठीक उस वाक्यांश से पहले जोड़ें जिस पर उनका असर पड़ना चाहिए
Promptएक वाक्य में गति, लहज़ा और एक्सेंट बताएँ
Voiceफ़ैसला करने से पहले एक ही अनुच्छेद पर तीन voices टेस्ट करें
Language codeइसे स्क्रिप्ट की भाषा से मिलाएँ, अपनी भाषा से नहीं

💡 टिप: तैयार क्लिप को GPT-4o Transcribe से चलाएँ और पुष्टि करें कि हर नाम और नंबर वैसे ही आया है जैसा लिखा था।

खुद आज़माएँ Picasso IA पर

OpenAI TTS voices के बीच चुनना सुनने का काम है, और इसमें बेहतर होने का सबसे तेज़ रास्ता है क्लिप बनाना और उनकी तुलना करना। ऊपर का टेस्ट स्क्रिप्ट लें, उसे तेरह voices पर चलाएँ, फिर वही स्क्रिप्ट Picasso IA पर Gemini 3.1 Flash TTS और MiniMax Speech 2.8 HD पर चलाएँ। एक हल्का म्यूज़िक बेड जोड़ें, ट्रांसक्रिप्ट जाँचें, और उस voice को रखें जो दसवीं बार सुनने पर भी सही लगे। Picasso IA खोलें, अपनी स्क्रिप्ट पेस्ट करें, और एक voice और एक इंस्ट्रक्शन से शुरुआत करें। आपका पहला काम का वॉइसओवर डॉपडाउन से दिखने वाले से कहीं ज़्यादा करीब है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख