OpenAI TTS API की कीमत: वॉइस, tts-1-hd और ElevenLabs से तुलना
OpenAI tts-1 के लिए प्रति मिलियन कैरेक्टर $15, tts-1-hd के लिए $30 और gpt-4o-mini-tts के लिए लगभग $0.015 प्रति मिनट लेता है। यह ब्रेकडाउन हर वॉइस की सूची देता है, एक आर्टिकल और एक ऑडियोबुक की असली लागत निकालता है और इन आंकड़ों को ElevenLabs से मिलाकर देखता है।
OpenAI का टेक्स्ट-टू-स्पीच API किसी ऐप, कोर्स या पॉडकास्ट में आवाज़ जोड़ने के सबसे सस्ते तरीकों में से एक है, और कीमतों की सूची एक वाक्य में आ जाती है: tts-1 के लिए प्रति मिलियन कैरेक्टर $15, tts-1-hd के लिए $30, और नए gpt-4o-mini-tts के लिए लगभग प्रति मिनट ऑडियो $0.015। ElevenLabs अपने टॉप मॉडल पर प्रति 1,000 कैरेक्टर $0.10 लेता है, जो tts-1-hd की दर से तीन गुना से भी ज़्यादा है। यह अंतर चुकाने लायक है या नहीं, यह इस पर निर्भर करता है कि वॉइस कैसी हो, भाषाएँ कौन-सी हों और डिलीवरी कितनी इंसानी लगनी चाहिए। यह पेज OpenAI की हर दर बताता है, मॉडल-दर-मॉडल वॉइस की सूची देता है, असली लागत के उदाहरण निकालता है और इन आंकड़ों को ElevenLabs के साथ रखता है, ताकि आप कोड की एक लाइन लिखने से पहले चुन सकें।
💡 त्वरित गणित: एक मिनट की नैरेशन लगभग 900 कैरेक्टर की होती है। यह tts-1 पर लगभग $0.014, tts-1-hd पर $0.027 और ElevenLabs v3 या Multilingual v2 पर $0.09 पड़ती है।
OpenAI प्रति कैरेक्टर क्या चार्ज करता है
OpenAI अपने दो क्लासिक स्पीच मॉडल की बिलिंग इनपुट कैरेक्टर के आधार पर करता है, ऑडियो के सेकंड के आधार पर नहीं। आप जो टेक्स्ट भेजते हैं उसी के पैसे लगते हैं, इसलिए धीमी, नाटकीय रीडिंग की कीमत भी तेज़ रीडिंग जितनी ही होती है। tts-1-hd मॉडल के पेज पर स्पीच एंडपॉइंट (v1/audio/speech) को एकमात्र समर्थित रूट बताया गया है, और यही एंडपॉइंट tts-1 और gpt-4o-mini-tts दोनों को सर्व करता है।
tts-1 और tts-1-hd की दरें
सार्वजनिक प्राइस लिस्ट छोटी है। कोई सीट फ़ीस नहीं है और कोई न्यूनतम खर्च नहीं है: आप अपने अकाउंट में क्रेडिट डालते हैं और हर रिक्वेस्ट उसमें से कटती है।
मॉडल
कीमत
प्रति 1,000 कैरेक्टर
सबसे अच्छा किसके लिए
tts-1
$15 प्रति 1M कैरेक्टर
$0.015
कम लेटेंसी वाले ऐप और असिस्टेंट
tts-1-hd
$30 प्रति 1M कैरेक्टर
$0.030
तैयार, बार-बार सुने जाने वाले ऑडियो
gpt-4o-mini-tts
$0.60 प्रति 1M टेक्स्ट टोकन और $12 प्रति 1M ऑडियो टोकन
टोकन आधारित, लगभग $0.015 प्रति मिनट
दिशा दी जा सकने वाली, भावपूर्ण प्रस्तुति
HD मॉडल की कीमत ठीक दोगुनी है। एक सामान्य स्क्रिप्ट के लिए यह अब भी छोटी रकम है, इसीलिए असली फ़ैसला शायद ही कभी पैसों का होता है। tts-1-hd मॉडल के पेज के अनुसार आपके उपयोग टियर के आधार पर रिक्वेस्ट की सीमा प्रति मिनट 2,500 से 10,000 के बीच है, जो ज़्यादातर ऐप्स के भेजने से कहीं ऊपर है।
gpt-4o-mini-tts टोकन के हिसाब से बिल करता है
सबसे नया मॉडल प्रति-कैरेक्टर वाले पैटर्न को तोड़ता है। यह इनपुट के लिए प्रति मिलियन टेक्स्ट टोकन $0.60 और आउटपुट के लिए प्रति मिलियन ऑडियो टोकन $12 लेता है, जो जनरेट हुए ऑडियो के लिए लगभग प्रति मिनट $0.015 बैठता है। यह tts-1 के लगभग बराबर है, लेकिन इसमें एक instructions फ़ील्ड भी है, जिसमें आप सादी भाषा में डिलीवरी बताते हैं, जैसे "धीरे बोलिए, किसी धैर्यवान शिक्षक की तरह।" tts-1 मॉडल में ऐसा कोई नियंत्रण नहीं है।
आधिकारिक Python SDK के साथ एक न्यूनतम कॉल कुछ ऐसी दिखती है:
from openai import OpenAI
client = OpenAI()
with client.audio.speech.with_streaming_response.create(
model="tts-1-hd",
voice="coral",
input="Your order shipped this morning and should arrive on Friday.",
response_format="mp3",
) as response:
response.stream_to_file("order-update.mp3")
मॉडल का नाम gpt-4o-mini-tts करें और डिलीवरी को नियंत्रित करने के लिए एक instructions स्ट्रिंग जोड़ें। हर रिक्वेस्ट में अधिकतम 4,096 कैरेक्टर का इनपुट लिया जा सकता है, इसलिए लंबी स्क्रिप्ट को हिस्सों में बाँटकर बाद में जोड़ना होगा।
असल में मिलने वाली वॉइस
वॉइस की गिनती में तीनों OpenAI मॉडल सबसे ज़्यादा अलग हैं, और यह उससे कहीं ज़्यादा मायने रखता है जितना ज़्यादातर प्राइसिंग पेज मानते हैं। एक सस्ता मॉडल जिसकी एक वॉइस आपको पसंद न हो, वह सस्ता नहीं है।
tts-1 और tts-1-hd पर नौ वॉइस
दोनों क्लासिक मॉडल एक ही नौ वॉइस साझा करते हैं: alloy, ash, coral, echo, fable, onyx, nova, sage और shimmer। एक नैरेटर, एक दोस्ताना असिस्टेंट और एक गहरी आवाज़ वाले एनाउंसर के लिए यह काफ़ी है, पर अलग-अलग किरदारों की पूरी कास्ट के लिए नहीं।
नए मॉडल पर चार अतिरिक्त वॉइस
gpt-4o-mini-tts में 13 वॉइस हैं। यह मूल नौ को रखता है और ballad, verse, marin और cedar जोड़ता है। OpenAI सबसे अच्छी क्वालिटी के लिए marin या cedar की सलाह देता है।
आउटपुट फ़ॉर्मैट: डिफ़ॉल्ट रूप से MP3, साथ में Opus, AAC, FLAC, WAV और PCM। WAV और PCM सबसे तेज़ लौटते हैं।
स्ट्रीमिंग: API चंक्स में स्ट्रीमिंग सपोर्ट करता है, इसलिए पूरी फ़ाइल बनने से पहले ही प्लेबैक शुरू हो सकता है।
भाषाएँ: लगभग 99, जो Whisper के भाषा-समर्थन पर आधारित हैं। OpenAI बताता है कि वॉइस अंग्रेज़ी के लिए ऑप्टिमाइज़ की गई हैं, इसलिए प्रतिबद्ध होने से पहले अपनी लक्ष्य भाषा की जाँच करें।
खुलासा: उपयोग नीतियों के अनुसार अंतिम उपयोगकर्ताओं को साफ़ सूचना देना ज़रूरी है कि वॉइस AI से बनी है, इंसान की नहीं।
tts-1 या tts-1-hd?
दोनों मॉडल एक ही नौ वॉइस और एक ही इनपुट लेते हैं, इसलिए बदलना आपके कोड में एक शब्द का बदलाव है। इसी से चुनाव आज़माना आसान हो जाता है: दोनों पर एक ही पैराग्राफ़ रेंडर करें और उस डिवाइस पर सुनें जिसे आपके दर्शक असल में इस्तेमाल करते हैं।
अतिरिक्त $15 क्या दिलाते हैं
OpenAI tts-1 को कम लेटेंसी वाला विकल्प और tts-1-hd को बेहतर क्वालिटी वाला विकल्प बताता है। लंबे अंशों पर HD मॉडल से ज़्यादा चिकनी और स्थिर डिलीवरी की उम्मीद करें, और यह अंतर हेडफ़ोन पर सबसे आसानी से सुनाई देगा। शोरगुल वाले ऐप में फ़ोन के स्पीकर पर कई श्रोता इसे नहीं पकड़ पाएँगे।
दोनों के बीच चुनाव कैसे करें
tts-1 चुनें चैट के जवाबों, वॉइस असिस्टेंट, नोटिफ़िकेशन और ऐसी किसी भी चीज़ के लिए जहाँ पहली आवाज़ जल्दी आनी चाहिए।
tts-1-hd चुनें ऑडियोबुक, कोर्स के पाठ, पॉडकास्ट और विज्ञापनों के लिए, ऐसा ऑडियो जिसे लोग बार-बार सुनते हैं और ध्यान से परखते हैं।
gpt-4o-mini-tts चुनें जब वॉइस में मूड चाहिए: शांत सपोर्ट एजेंट, उत्साही प्रोडक्ट एनाउंसर, या फुसफुसाहट।
💡 मोटा नियम: तैयार कंटेंट के लिए गणित सीधा है। 80,000 शब्दों की ऑडियोबुक को स्टैंडर्ड की जगह HD पर रेंडर करने से बिल में लगभग $7.20 जुड़ते हैं, इसलिए जब भी श्रोता ऑडियो एक से ज़्यादा बार सुनेंगे, डिफ़ॉल्ट रूप से HD चुनें।
असली लागत के उदाहरण
नीचे के हर आंकड़े में 150 शब्द प्रति मिनट की नैरेशन गति और स्पेस सहित लगभग 6 कैरेक्टर प्रति शब्द मानी गई है, जिससे 900 कैरेक्टर प्रति मिनट बैठते हैं। आपकी अपनी स्क्रिप्ट अलग होगी, इसलिए इन्हें इनवॉइस नहीं, बजट का अनुमान समझें।
काम
tts-1
tts-1-hd
gpt-4o-mini-tts
ElevenLabs Flash
ElevenLabs v3 या Multilingual v2
1,000 शब्दों का लेख (6,000 कैरेक्टर)
$0.09
$0.18
लगभग $0.10
$0.30
$0.60
80,000 शब्दों की ऑडियोबुक (480,000 कैरेक्टर)
$7.20
$14.40
लगभग $8.00
$24.00
$48.00
हर महीने 1 मिलियन कैरेक्टर
$15
$30
लगभग $16.70
$50
$100
1,000 शब्दों का एक आर्टिकल
किसी ब्लॉग पोस्ट को सुनने लायक बनाने में tts-1 पर 10 सेंट से कम और HD पर 25 सेंट से कम लगते हैं। ElevenLabs के टॉप रेट पर भी यह 60 सेंट है, इसलिए कभी-कभार की नैरेशन के लिए कीमत का फ़र्क लगभग मायने नहीं रखता। लागत नहीं, आवाज़ की गुणवत्ता देखकर चुनें।
80,000 शब्दों की एक ऑडियोबुक
पूरी लंबाई की किताब में फ़र्क साफ़ दिखता है: लगभग नौ घंटे के ऑडियो के लिए tts-1-hd पर $14.40 बनाम ElevenLabs के टॉप मॉडल पर $48। इंसानी नैरेटर एक तैयार घंटे पर इस तालिका के किसी भी कॉलम से कहीं ज़्यादा खर्च करता है, इसलिए यहाँ का हर विकल्प स्टूडियो बुकिंग का एक हिस्सा भर है।
एक महीने के 1 मिलियन कैरेक्टर
ऐप के पैमाने पर स्तर अलग-अलग हो जाते हैं। जो प्रोडक्ट हर महीने 10 लाख कैरेक्टर की वॉइस बनाता है, वह प्रोवाइडर और मॉडल के हिसाब से $15 से $100 तक देता है। रिट्राई पर ध्यान दें: अगर हर तीसरा क्लिप दोबारा जनरेट करते हैं, तो हर आंकड़े में एक-तिहाई जोड़ लें। बार-बार आने वाले वाक्यों, जैसे अभिवादन और एरर मैसेज, का ऑडियो कैश करें, क्योंकि एक ही टेक्स्ट का दोबारा पैसा देने की ज़रूरत नहीं पड़ती।
OpenAI TTS बनाम ElevenLabs
लागत की तालिका बताती है कि कौन सस्ता है। यह नहीं बताती कि आपके इस्तेमाल के लिए कौन बेहतर लगता है, या तब क्या होता है जब आपकी स्क्रिप्ट एक रिक्वेस्ट की सीमा से लंबी हो।
कारक
OpenAI tts-1-hd
ElevenLabs Flash v2.5
ElevenLabs Multilingual v2 और v3
API कीमत प्रति 1,000 कैरेक्टर
$0.030
$0.05
$0.10
भाषाएँ
लगभग 99
32
29 (v2), 70+ (v3)
प्रति रिक्वेस्ट अधिकतम कैरेक्टर
4,096
40,000
10,000 (v2), 5,000 (v3)
बिल्ट-इन वॉइस
9
बड़ी लाइब्रेरी और वॉइस क्लोनिंग
बड़ी लाइब्रेरी और वॉइस क्लोनिंग
स्पीड पर फ़ोकस
tts-1 पर कम लेटेंसी
कंपनी के अनुसार लगभग 75 ms
ज़्यादा क्वालिटी, पर धीमा
ElevenLabs के आंकड़े 2026 के मध्य की प्राइसिंग ब्रेकडाउन से लिए गए हैं। कंपनी अपने प्लान अक्सर अपडेट करती है, इसलिए बजट तय करने से पहले उसके प्राइसिंग पेज पर मौजूदा आंकड़े ज़रूर जाँच लें।
प्रति 1,000 कैरेक्टर कीमत
API पर tts-1 की दर $0.015, tts-1-hd की $0.030, ElevenLabs Flash और Turbo की $0.05, और Multilingual v2 व v3 की $0.10 है। इसका मतलब है कि ElevenLabs Flash की लागत tts-1-hd से लगभग 1.7 गुना है, और उसके टॉप मॉडल लगभग 3.3 गुना। सब्सक्रिप्शन में क्रेडिट बंडल मिलते हैं: free plan में हर महीने 10,000 क्रेडिट मिलते हैं, जिसमें स्टैंडर्ड मॉडल पर हर कैरेक्टर का एक क्रेडिट लगता है और Flash व Turbo पर आधा क्रेडिट।
वॉइस की क्वालिटी और एक्सप्रेशन
कीमत कहानी का केवल आधा हिस्सा है। ElevenLabs ने अपनी पहचान एक्सप्रेसिव और प्राकृतिक डिलीवरी से बनाई है, और Eleven v3 70+ भाषाओं में भावनात्मक रेंज और मल्टी-स्पीकर डायलॉग जोड़ता है। OpenAI का जवाब स्टीयरेबिलिटी है: gpt-4o-mini-tts एक्सेंट, टोन, गति और भावना के बारे में सादी भाषा के निर्देश लेता है, यह वह काम है जिसे दोनों tts-1 मॉडल में से कोई नहीं कर सकता।
अगर आपको ऐसे किरदारों की कास्ट चाहिए जो हर सीन में अलग लगें, तो ElevenLabs की वॉइस लाइब्रेरी और क्लोनिंग आपको ज़्यादा गुंजाइश देते हैं। अगर आपको एक भरोसेमंद, सस्ती वॉइस चाहिए, तो लागत के मामले में OpenAI आगे है। एकमात्र ईमानदार परीक्षा यह है कि दोनों पर एक ही पैराग्राफ़ चलाएँ और सुनें।
सीमाएँ, भाषाएँ और लाइसेंस
रिक्वेस्ट की सीमाएँ आपके कोड को आकार देती हैं। OpenAI इनपुट को 4,096 कैरेक्टर तक सीमित रखता है और Eleven v3 को 5,000 पर, इसलिए लंबी स्क्रिप्ट को चंक करना होगा और टुकड़ों के बीच वॉइस को एक जैसा रखने का तरीका चाहिए। Flash v2.5 40,000 कैरेक्टर स्वीकार करता है, यानी लंबी रीडिंग के लिए कम जोड़ लगेंगे।
लाइसेंसिंग भी अलग है। ElevenLabs के free plan में कमर्शियल लाइसेंस नहीं है, और कमर्शियल अधिकार पहले पेड plan से शुरू होते हैं। OpenAI के अनुसार आपको अंतिम उपयोगकर्ताओं को बताना होगा कि वॉइस AI से बनी है। ग्राहकों तक ऑडियो भेजने से पहले दोनों की शर्तें ज़रूर पढ़ें।
PicassoIA पर ElevenLabs v3 कैसे इस्तेमाल करें
प्रति कैरेक्टर भुगतान करने से पहले, इस तुलना का ElevenLabs वाला हिस्सा आप ब्राउज़र में सुन सकते हैं। PicassoIA के text-to-speech कलेक्शन में 24 मॉडल सूचीबद्ध हैं, जिनमें ElevenLabs v3, Flash v2.5, Turbo v2.5 और Multilingual v2 शामिल हैं, साथ ही MiniMax, Google, Inworld और Resemble AI के विकल्प भी। स्क्रिप्ट चिपकाएँ, वॉइस चुनें और ऑडियो कुछ ही सेकंड में वापस आ जाता है।
ड्रॉपडाउन से एक voice चुनें। डिफ़ॉल्ट Rachel है, और सूची में 25 से ज़्यादा पर्सोना हैं।
language code सेट करें। डिफ़ॉल्ट en है; स्पेनिश या फ़्रेंच के लिए es या fr इस्तेमाल करें।
पहली बार के लिए stability को 0.5 पर, similarity boost को 0.75 पर, style को 0 पर और speed को 1 पर रहने दें।
मॉडल चलाएँ, सुनें, एक बार में एक सेटिंग बदलें और जो पसंद आए वह फ़ाइल डाउनलोड करें।
नतीजे बदलने वाली सेटिंग
Stability: ज़्यादा मान लंबी स्क्रिप्ट में वॉइस को स्थिर रखते हैं, कम मान ज़्यादा बदलाव देते हैं।
Style: 0 से 1 तक का स्लाइडर, जो डिलीवरी को सामान्य नैरेशन से ज़्यादा नाटकीय रीडिंग की ओर ले जाता है।
Speed: 0.25x से 4x तक कुछ भी, ट्यूटोरियल नैरेशन धीमा करने के लिए काम का।
Previous and next text: किसी चंक से पहले और बाद के वाक्य चिपकाएँ, ताकि जोड़ पर इंटोनेशन प्राकृतिक रहे। ऊपर बताई गई प्रति-रिक्वेस्ट कैरेक्टर सीमा का यही हल है।
त्वरित A/B टेस्ट के लिए, वही पैराग्राफ़ गति के लिए Flash v2.5, स्टूडियो जैसी क्वालिटी के लिए MiniMax Speech 2.8 HD, 30 वॉइस और 70+ भाषाओं के लिए Gemini 3.1 Flash TTS और तेज़ मल्टी-लैंग्वेज वॉइसओवर के लिए Inworld TTS 1.5 Max पर चलाएँ। फिर नतीजों की तुलना अपने अकाउंट के tts-1-hd सैंपल से करें।
म्यूज़िक और ट्रांसक्रिप्शन भी
वॉइस अक्सर ऑडियो का अकेला काम नहीं होती। किसी प्रोडक्ट वीडियो को म्यूज़िक बेड चाहिए, और पॉडकास्ट को कैप्शन और सर्च के लिए ट्रांसक्रिप्ट।
ऑडियो ट्रांसक्राइब करें। तैयार नैरेशन या इंटरव्यू को टेक्स्ट में बदलने के लिए GPT-4o Transcribe, GPT-4o Mini Transcribe या Gemini 3 Pro इस्तेमाल करें। ट्रांसक्रिप्ट कैप्शन, शो नोट्स और प्रूफ़रीडिंग तीनों का काम करता है: अगर ट्रांसक्रिप्ट में कोई शब्द गलत पढ़ा गया, तो श्रोता भी शायद उसे गलत ही सुनेगा।
एक सरल पाइपलाइन इन्हें जोड़ती है: स्क्रिप्ट लिखें, वॉइस रेंडर करें, म्यूज़िक बेड जोड़ें, फिर अंतिम मिक्स का ट्रांसक्रिप्शन करके शब्दों की जाँच करें।
आज ही खुद आज़माएँ
प्राइसिंग टेबल की भी एक सीमा होती है। OpenAI बनाम ElevenLabs का फ़ैसला करने का सबसे तेज़ तरीका है कि अपनी स्क्रिप्ट कई वॉइस में सुनें और देखें कि आपकी मात्रा पर हर विकल्प कितना खर्च करता है। PicassoIA खोलें, किसी text-to-speech मॉडल में एक पैराग्राफ़ चिपकाएँ और उसकी तुलना tts-1-hd क्लिप से करें। फिर एक म्यूज़िक ट्रैक जोड़ें, नतीजे का ट्रांसक्रिप्शन करें और अपने एपिसोड या वीडियो के कवर के लिए कुछ फ़ोटोरियलिस्टिक इमेज जनरेट करें। पूरे ऑडियो और विज़ुअल वर्कफ़्लो को आज़माने की हर सुविधा एक ही जगह है, इसलिए खुलकर प्रयोग करें और जो संयोजन सबसे अच्छा लगे उसे रखें।