अब तीन वेंडर लाइव सॉकेट पर स्पीच-टू-स्पीच मॉडल बेच रहे हैं, और तीनों अलग-अलग तरीके से बिलिंग करते हैं। OpenAI ऑडियो टोकन गिनता है। Google भी ऑडियो टोकन गिनता है, लेकिन उसके साथ प्रति मिनट के बराबर की कीमत भी छापता है। xAI टोकन नहीं गिनता और हर उस मिनट का एक तय रेट लेता है जिसमें कनेक्शन खुला रहता है। यही फ़र्क अकेले सूची-मूल्य की सीधी तुलना को भ्रामक बना देता है। स्प्रेडशीट में जो वॉइस असिस्टेंट प्रति मिनट एक सेंट का लगता है, असली बातचीत, बढ़ते कॉन्टेक्स्ट और टूल कॉल शामिल होते ही उसका खर्च उससे दस गुना तक जा सकता है।
यह ब्रेकडाउन तीनों रियलटाइम वॉइस API को एक ही आधार पर रखता है। आपको 8 अक्टूबर 2026 को जाँची गई प्रकाशित दरें मिलेंगी, एक मिनट का कैलकुलेशन उदाहरण, 10,000 और 100,000 मिनट का मासिक बजट, और वे छिपी लागतें जो लॉन्च के बाद बिल बदल देती हैं। आख़िर में PicassoIA पर वॉइस, म्यूज़िक और ट्रांसक्रिप्ट का सस्ता प्रोटोटाइप बनाने का एक तरीका भी है, उससे पहले कि आप इनमें से किसी एक को चुनें।

OpenAI रियलटाइम प्राइसिंग
OpenAI की मौजूदा लाइनअप, जो 6 जुलाई 2026 को जारी हुई, gpt-realtime-2.1 और gpt-realtime-2.1-mini है। दोनों स्पीच-टू-स्पीच के ऊपर कॉन्फ़िगर करने योग्य रीज़निंग इफ़ॉर्ट जोड़ते हैं, साथ ही अल्फ़ान्यूमेरिक स्ट्रिंग, साइलेंस, बैकग्राउंड नॉइज़ और इंटरप्शन को बेहतर तरीके से संभालते हैं। OpenAI ने यह भी बताया कि बेहतर कैशिंग की वजह से उसके सभी रियलटाइम मॉडल में p95 लेटेंसी में कम से कम 25% की कमी आई है।
gpt-realtime-2.1 की दरें
सभी कीमतें प्रति 1 मिलियन टोकन हैं।
| टोकन का प्रकार | इनपुट | कैश्ड इनपुट | आउटपुट |
|---|
| टेक्स्ट | $4.00 | $0.40 | $24.00 |
| ऑडियो | $32.00 | $0.40 | $64.00 |
इमेज इनपुट की बिलिंग $5.00 प्रति मिलियन टोकन है। पिछला gpt-realtime-2 भी यही कीमतें रखता है, जबकि gpt-realtime-1.5 और मूल gpt-realtime ऑडियो की वही दरें रखते हैं, पर टेक्स्ट आउटपुट के लिए $16.00 प्रति मिलियन टोकन लेते हैं। $24.00 की छलांग रीज़निंग-सक्षम 2.x लाइन के साथ आई।
मिनी विकल्प
gpt-realtime-2.1-mini ऑडियो पर फ़्लैगशिप का लगभग एक-तिहाई लगता है।
| टोकन का प्रकार | इनपुट | कैश्ड इनपुट | आउटपुट |
|---|
| टेक्स्ट | $0.60 | $0.06 | $2.40 |
| ऑडियो | $10.00 | $0.30 | $20.00 |
इमेज इनपुट घटकर $0.80 प्रति मिलियन टोकन हो जाता है। मिनी मॉडल पर लगभग 4,000 असली सेशन का एक प्रकाशित मापन बताता है कि एक सामान्य असिस्टेंट $0.05 से $0.08 प्रति मिनट पर आता है, जबकि भारी सवाल-जवाब वाली कॉल $0.12 से $0.15 तक पहुँचीं।
कैश्ड ऑडियो की छूट
OpenAI की प्राइस शीट की सबसे सस्ती लाइन कैश्ड ऑडियो इनपुट है: फ़्लैगशिप पर $32.00 की जगह $0.40, यानी लगभग 99% की कटौती। कैशिंग स्थिर प्रीफ़िक्स को इनाम देती है, यानी आपका सिस्टम प्रॉम्प्ट और बातचीत के पिछले टर्न। जो भी कॉन्टेक्स्ट की शुरुआत बदलता है, वह छूट तोड़ देता है। उसी मापन में पाया गया कि कॉल के बीच ताज़ा रिट्रीवल रिज़ल्ट डालने से कैश रीसेट हो जाता है और हर इवेंट पर लगभग $0.007 से $0.009 का खर्च आता है।

Gemini Live प्राइसिंग
Google अपने रियलटाइम वॉइस मॉडल Live API के ज़रिए बेचता है, और उसकी प्राइस शीट सबसे आसानी से समझ में आती है क्योंकि उसमें टोकन दर और प्रति मिनट दोनों आंकड़े छपे होते हैं।
Gemini 3.8 Live की दरें
gemini-3.8-live और gemini-3.8-live-extended-thinking पेड टियर पर एक ही प्राइस लिस्ट साझा करते हैं।
| प्रकार | प्रति 1M टोकन | प्रति मिनट |
|---|
| टेक्स्ट इनपुट | $0.75 | लागू नहीं |
| ऑडियो इनपुट | $3.00 | $0.005 |
| इमेज या वीडियो इनपुट | $1.00 | $0.002 |
| टेक्स्ट आउटपुट | $4.50 | लागू नहीं |
| ऑडियो आउटपुट | $12.00 | $0.018 |
दोनों कॉलम 25 ऑडियो टोकन प्रति सेकंड पर आपस में मेल खाते हैं, इसलिए आप समय के हिसाब से या टोकन के हिसाब से बजट बना सकते हैं और दोनों से एक ही संख्या निकलती है। असिस्टेंट के बोलने का एक मिनट $0.018 का पड़ता है, और कॉलर के बोलने का एक मिनट आधा सेंट।
💡 टिप: तीनों में से सिर्फ़ Google ऐसा है जो टोकन बिलिंग के लिए प्रति मिनट के बराबर की कीमत प्रकाशित करता है। अगर आपकी फ़ाइनेंस टीम कॉल के प्रति मिनट का रेट चाहती है, तो Gemini बिना किसी कन्वर्ज़न के वह दे देता है।

फ़्री टियर और ट्रांसलेट मॉडल
Live मॉडल के लिए एक फ़्री टियर मौजूद है, जो Gemini को पेड टियर पर जाने से पहले शून्य लागत पर प्रोटोटाइप बनाने की स्वाभाविक जगह बनाता है। उसी पेज के दो संबंधित मॉडल भी जानने लायक हैं:
- Gemini 3.5 Live Translate (प्रीव्यू): 70+ भाषाओं में स्पीच-टू-स्पीच अनुवाद, $3.50 प्रति मिलियन इनपुट टोकन ($0.0053 प्रति मिनट) और $21.00 प्रति मिलियन आउटपुट टोकन ($0.0315 प्रति मिनट) पर।
- Gemini 3.5 Transcribe Live: स्ट्रीमिंग स्पीच-टू-टेक्स्ट, $3.50 प्रति मिलियन इनपुट टोकन ($0.005 प्रति मिनट) और $21.00 प्रति मिलियन टेक्स्ट आउटपुट टोकन ($0.004 प्रति मिनट) पर।
पुराना Gemini 2.5 Flash Native Audio प्रीव्यू अब भी सूची में है, जिसकी कीमत $3.00 प्रति मिलियन ऑडियो इनपुट टोकन और $12.00 प्रति मिलियन ऑडियो आउटपुट टोकन है।
Grok Voice प्राइसिंग
xAI ने उलटा रास्ता चुना है। वहाँ गिनने के लिए कोई ऑडियो टोकन नहीं हैं, सिर्फ़ मिनट हैं।
प्रति मिनट एक तय रेट
Voice Agent API grok-voice-think-fast-2.0 चलाता है, जिसे grok-voice-latest उपनाम से भी इस्तेमाल किया जा सकता है। xAI के प्राइसिंग पेज पर इसकी कीमत $0.08 प्रति मिनट, या $4.80 प्रति घंटा लिखी है। लॉन्च के शुरुआती रिपोर्ट में $0.05 प्रति मिनट बताया गया था, इसलिए किसी भी संख्या पर पूर्वानुमान बनाने से पहले लाइव पेज ज़रूर जाँच लें।
बिलिंग कनेक्शन के समय के हिसाब से होती है। एक मिनट की चुप्पी का खर्च उतना ही है जितना एक मिनट की बातचीत का, और हर टर्न पर कॉन्टेक्स्ट दोबारा बिल नहीं होता। जिस टीम को अचानक आए बिलों का डर रहता है, उसके लिए यही अनुमान लगाने योग्य होना ही इसकी असली खूबी है। उसी पेज की संबंधित लाइन आइटम:
- स्पीच टू टेक्स्ट: REST पर $0.10 प्रति घंटा, स्ट्रीमिंग के लिए $0.20 प्रति घंटा।
- टेक्स्ट टू स्पीच: $15.00 प्रति मिलियन कैरेक्टर।
आवाज़ें, भाषाएँ, फ़ोन रूटिंग
API 20+ भाषाओं को सपोर्ट करता है जिनमें नेटिव-क्वालिटी एक्सेंट हैं, और स्पीच-टू-स्पीच व टेक्स्ट-टू-स्पीच प्रोडक्ट एक ही वॉइस रोस्टर साझा करते हैं। आप रेफ़रेंस ऑडियो क्लिप से कस्टम वॉइस भी बना सकते हैं। टूल सपोर्ट में फ़ंक्शन कॉलिंग, फ़ाइल सर्च, वेब सर्च, X सर्च और रिमोट MCP सर्वर शामिल हैं।
टेलीफ़ोनी के लिए xAI नेटिव G.711 के साथ SIP इंटीग्रेशन का दस्तावेज़ीकरण करता है, जो PSTN, कॉन्टैक्ट-सेंटर और PBX ट्रैफ़िक के लिए बना है। थर्ड-पार्टी लेखों में कुछ ऐसी संख्याएँ जुड़ी हैं जिनकी पुष्टि मेरी जाँच के समय प्राइसिंग पेज ने नहीं की: सेशन 30 मिनट तक सीमित, प्रति टीम 100 समवर्ती सेशन, वेब और X सर्च कॉल पर $5 प्रति 1,000 का शुल्क, और प्रोविज़न्ड फ़ोन नंबर पर अतिरिक्त $0.01 प्रति मिनट। इन्हें रिपोर्ट की गई जानकारी मानें, गारंटी नहीं।

साइड-बाय-साइड लागत तालिका
अलग-अलग बिलिंग यूनिट के लिए एक साझा परिदृश्य चाहिए। नीचे वाला जान-बूझकर सरल रखा गया है।
बात का एक मिनट
मान्यताएँ: 60 सेकंड की विंडो में कॉलर 25 सेकंड बोलता है और असिस्टेंट 25 सेकंड बोलता है। OpenAI ऑडियो को लगभग 100 टोकन प्रति सेकंड के हिसाब से गिना गया है, जो पहले बताए गए असली-सेशन मापन में दिखी दर है। Gemini ऑडियो को उसकी प्रकाशित 25 टोकन प्रति सेकंड की दर से गिना गया है। Grok की बिलिंग कनेक्शन के समय पर होती है। टेक्स्ट, टूल और बढ़ते कॉन्टेक्स्ट को जान-बूझकर बाहर रखा गया है।
| API और मॉडल | बिलिंग यूनिट | प्रति मिनट लागत |
|---|
| OpenAI gpt-realtime-2.1 | ऑडियो टोकन | लगभग $0.240 |
| OpenAI gpt-realtime-2.1-mini | ऑडियो टोकन | लगभग $0.075 |
| Gemini 3.8 Live | ऑडियो टोकन | लगभग $0.010 |
| Grok grok-voice-think-fast-2.0 | कनेक्शन का समय | $0.080 |
फ़्लैगशिप का गणित यह है: 2,500 इनपुट टोकन, $32.00 प्रति मिलियन पर ($0.080), और साथ में 2,500 आउटपुट टोकन, $64.00 प्रति मिलियन पर ($0.160)। मिनी मॉडल का योग वही है, बस दरें $10.00 और $20.00 हैं। Gemini का हिसाब यह है: कॉलर के ऑडियो का 0.4167 मिनट $0.005 पर, और असिस्टेंट के ऑडियो का 0.4167 मिनट $0.018 पर।
सिर्फ़ ऑडियो को देखें तो Gemini लगभग gpt-realtime-2.1 से 25 गुना सस्ता है, और मिनी मॉडल व Grok दोनों से लगभग 8 गुना सस्ता।
💡 इस तालिका को न्यूनतम आधार मानें। इसमें सिर्फ़ ऑडियो की कीमत है। असली सेशन में टेक्स्ट टोकन, रीज़निंग, टूल कॉल और बातचीत का इतिहास भी जुड़ता है, जिसे अगला हिस्सा समझाता है।
हर महीने 10,000 मिनट
इस आधार को असली वर्कलोड तक बढ़ाने पर दिखता है कि बजट की बातचीत कहाँ बदल जाती है।
| API और मॉडल | 10,000 मिनट | 100,000 मिनट |
|---|
| OpenAI gpt-realtime-2.1 | $2,400 | $24,000 |
| OpenAI gpt-realtime-2.1-mini | $750 | $7,500 |
| Gemini 3.8 Live | लगभग $96 | लगभग $960 |
| Grok grok-voice-think-fast-2.0 | $800 | $8,000 |
10,000 मिनट पर सबसे सस्ते और सबसे महंगे विकल्प के बीच का फ़र्क हर महीने $2,300 से ज़्यादा है। 100,000 मिनट पर यह $23,000 से आगे निकल जाता है। कम मात्रा पर ज़्यादातर टीमें कीमत के बजाय क्वालिटी और फ़ीचर देखकर चुनेंगी।

छिपी लागतें जो बिल बढ़ाती हैं
ऊपर की तालिका में जो आधार है, अच्छी खबर वहीं खत्म हो जाती है। चार चीज़ें असली इनवॉइस को उससे ऊपर ले जाती हैं।
कॉन्टेक्स्ट जमा होता जाता है
टोकन बिलिंग में हर टर्न पर अब तक की पूरी बातचीत दोबारा भेजी जा सकती है। टर्न 20 पर, अगर कैशिंग या इतिहास की छंटाई उन्हें न संभाले, तो आप पिछले 19 आदान-प्रदान का खर्च फिर से दे रहे होते हैं। 4,000 सेशन वाले मापन में एक बिना छंटी कॉल 480,000 टोकन तक पहुँच गई और एक ही सेशन में $2.05 लगे। मिनी मॉडल पर खर्च का लगभग 80% हिस्सा अकेले ऑडियो आउटपुट से आता है।
तीन आदतें इसे काबू में रखती हैं:
- जवाब की लंबाई सीमित करें। छोटे जवाब खर्च 20% से 40% तक घटाते हैं।
- इतिहास छाँटें। पुराने टर्न को दोबारा चलाने के बजाय उनका सार बनाएँ।
- प्रीफ़िक्स को स्थिर रखें। OpenAI पर यही $32.00 और $0.40 प्रति मिलियन ऑडियो इनपुट टोकन का फ़र्क है।
Grok का फ़्लैट रेट पहले दो को पूरी तरह टाल देता है, और लंबी कॉल के लिए यही इसका सबसे मज़बूत तर्क है।
टूल और रीज़निंग टोकन
OpenAI के 2.1 मॉडल आपको रीज़निंग इफ़ort सेट करने देते हैं। ज़्यादा इफ़ort कठिन टूल-उपयोग वाले टर्न को बेहतर बनाता है, लेकिन आउटपुट टोकन और लेटेंसी दोनों बढ़ाता है, और टेक्स्ट आउटपुट अब $24.00 प्रति मिलियन पड़ता है। FAQ जैसी कॉल के लिए कम इफ़ort रखें और रीज़निंग पर खर्च तभी करें जहाँ गलत जवाब की कीमत कुछ सेंट से ज़्यादा हो।
टूल कॉल अपनी अलग लाइन जोड़ते हैं। कॉल के बीच डाला गया रिट्रीवल कैश रीसेट कर सकता है, Grok पर सर्च कॉल अलग से बिल होती हैं, और टेलीफ़ोनी सेटअप में फ़ोन नंबर प्रति मिनट शुल्क जोड़ता है। अगर आप किसी ग्राहक को वॉइस एजेंट का दाम बताते हैं, तो ऊपर के मापन से लगता है कि सबसे खराब सेशन झेलने के लिए मिनी मॉडल पर प्रति मिनट $0.15 से $0.20 रखना सुरक्षित है।

आपके प्रोडक्ट के लिए कौन-सा API सही है
कीमत एक इनपुट है। सही चुनाव इस पर निर्भर करता है कि कॉल कितनी लंबी चलती हैं, कितनी हैं, और गलती की कीमत क्या है।
फ़ोन एजेंट
कॉन्टैक्ट-सेंटर ट्रैफ़िक का मतलब है लंबी कॉल, SIP रूटिंग और ऐसी फ़ाइनेंस टीम जिसे वेरिएंस से नफ़रत है। Grok की कनेक्शन-समय वाली बिलिंग और दस्तावेज़ित SIP सपोर्ट इनवॉइस का पूर्वानुमान आसान बनाते हैं। अगर कॉल में भारी रीज़निंग और टूल उपयोग चाहिए, जैसे दोबारा बुकिंग, ऑर्डर में बदलाव या अकाउंट जाँच, तो gpt-realtime-2.1 वह मॉडल है जो कॉन्फ़िगर करने योग्य रीज़निंग के लिए बना है, और $0.24 का एक मिनट फ़ेल हुई कॉल से अब भी बेहतर साबित हो सकता है।
इन-ऐप असिस्टेंट
बड़ी मात्रा और छोटे टर्न वाले कंज़्यूमर ऐप्स के लिए Gemini 3.8 Live लागत में काफ़ी आगे है, और इसका फ़्री टियर प्रोटोटाइप चरण की रुकावट हटा देता है। gpt-realtime-2.1-mini बीच में बैठता है: फ़्लैगशिप से तीन गुना सस्ता, और API का आकार वही है।
| स्थिति | सबसे अच्छा विकल्प | कारण |
|---|
| लाखों छोटे वॉइस टर्न | Gemini 3.8 Live | सबसे कम ऑडियो दरें, प्रति मिनट के आंकड़े प्रकाशित |
| SIP पर लंबी सपोर्ट कॉल | Grok Voice Agent | $0.08 प्रति मिनट का फ़्लैट रेट, कॉन्टेक्स्ट का दोबारा बिल नहीं |
| जटिल, टूल-भारी कॉल | gpt-realtime-2.1 | कॉन्फ़िगर करने योग्य रीज़निंग इफ़ort |
| संतुलित लागत और क्वालिटी | gpt-realtime-2.1-mini | फ़्लैगशिप ऑडियो दर का एक-तिहाई |
| शून्य बजट पर प्रोटोटाइप | Gemini फ़्री टियर | टेस्ट करते समय कोई शुल्क नहीं |

पैसे देने से पहले वॉइस का प्रोटोटाइप बनाएँ
रियलटाइम API ऑडियो के पहले सेकंड से ही बिल करना शुरू कर देता है, इसलिए आवाज़, स्क्रिप्ट और लहजे को पहले किसी सस्ती जगह पर तय कर लें। PicassoIA पर 24 टेक्स्ट-टू-स्पीच मॉडल सूचीबद्ध हैं, जिनमें वही वेंडर्स की आवाज़ें शामिल हैं जिनकी आप तुलना कर रहे हैं: Gemini 3.1 Flash TTS और Grok Text To Speech। लेटेंसी पर ध्यान देने वाले टेस्ट के लिए Inworld Realtime TTS 2, 120ms सिंथेसिस वाला Realtime TTS 1.5 Mini और 200ms से कम आउटपुट वाला Realtime TTS 1.5 Max भी हैं।
Gemini 3.1 Flash TTS का इस्तेमाल कैसे करें
Gemini 3.1 Flash TTS 70+ भाषाओं में 30 आवाज़ें देता है, जो ब्रांड की आवाज़ को कुछ मिनटों में परखने के लिए काफ़ी विविधता है।
- मॉडल पेज खोलें और PicassoIA में साइन इन करें।
- अपनी स्क्रिप्ट पेस्ट करें। वैसे लिखें जैसे लोग बोलते हैं: छोटे वाक्य, संक्षिप्त रूप और हर पंक्ति में एक विचार।
- 30 की सूची में से एक आवाज़ चुनें और अपनी स्क्रिप्ट की भाषा सेट करें।
- जनरेट करें और सुनें। नंबर, नाम और ईमेल पते जाँचें, वही स्ट्रिंग जो लाइव एजेंट्स को गड़बड़ाती हैं।
- वही स्क्रिप्ट Grok Text To Speech में दोहराएँ और टोन की साथ-साथ तुलना करें।
- जो ऑडियो पसंद आए उसे डाउनलोड करें और कोई कोड लिखे जाने से पहले अपनी टीम के साथ साझा करें।
💡 टिप: 5 से 6 लाइनों की एक तय टेस्ट स्क्रिप्ट रखें, जिसमें एक फ़ोन नंबर, एक कीमत और किसी व्यक्ति का नाम हो। हर बार एक ही लाइनें इस्तेमाल करने से वॉइस की तुलना निष्पक्ष रहती है।

म्यूज़िक और ट्रांसक्रिप्ट बात को पूरा करते हैं
वॉइस प्रोडक्ट को शायद ही कभी सिर्फ़ स्पीच चाहिए होता है। होल्ड म्यूज़िक, इंट्रो जिंगल या ब्रांडेड साउंड बेड के लिए Lyria 3 और Music 2.6 टेक्स्ट प्रॉम्प्ट से मूल ट्रैक बनाते हैं। दूसरी दिशा के लिए GPT 4o Transcribe, GPT 4o Mini Transcribe और Gemini 3 Pro टेस्ट कॉल की रिकॉर्डिंग को टेक्स्ट में बदलते हैं, ताकि एजेंट ने असल में क्या कहा, वह दोबारा सुनने के बजाय पढ़ा जा सके।

अपना वॉइस डेमो बनाएँ
ऊपर के आंकड़े बदलते रहेंगे, इसलिए किसी वेंडर को मंज़ूरी देने से पहले अपनी कॉल की लंबाई और अपने बोलने के अनुपात के साथ एक मिनट वाला हिसाब दोबारा चलाएँ। काम आज ही क्रिएटिव हिस्से से शुरू करें: स्क्रिप्ट लिखें, आवाज़ बनाएँ, म्यूज़िक बेड जोड़ें, फिर नतीजे का ट्रांसक्रिप्ट बनाकर उसे पढ़ें। यह सब बिना एक भी लाइन इंटीग्रेशन कोड लिखे PicassoIA पर चलता है।
एक वॉइस मॉडल चुनें, स्क्रिप्ट पेस्ट करें और पहला इनवॉइस आने से पहले सुनें कि हर विकल्प कैसा लगता है। जब आप आगे बढ़ने के लिए तैयार हों, तो PicassoIA पर हर मॉडल देखें, और वॉइस, म्यूज़िक, ट्रांसक्रिप्ट और इमेज के साथ तब तक प्रयोग करते रहें जब तक डेमो वैसा लगे जैसा आप अपना प्रोडक्ट सुनना चाहते हैं।