Gemini TTS: आवाज़ें, प्राइसिंग, API और भाषाएँ विस्तार से
Gemini TTS 30 प्रीबिल्ट आवाज़ों, 70+ भाषाओं और "whispering" तथा "laughing" जैसे एक्सप्रेसिव टैग के साथ स्क्रिप्ट को स्पीच में बदलता है। यह लेख हर आवाज़ को उसके टोन के हिसाब से समझाता है, कीमत के पीछे का असली टोकन गणित दिखाता है, एक काम करने वाला Python API कॉल देता है और एक ब्राउज़र रूट बताता है जिसे किसी सेटअप की ज़रूरत नहीं।
Gemini TTS से एक मिनट के वॉइसओवर की लागत स्टैंडर्ड रेट पर लगभग तीन सेंट आती है। यही एक आँकड़ा समझाता है कि डेवलपर, पॉडकास्टर और कोर्स बनाने वाले लोग इसके बारे में बार-बार क्यों पूछते हैं। Google के स्पीच मॉडल 30 नामित आवाज़ों, दर्जनों भाषाओं और परफ़ॉर्मेंस को निर्देश देने के सरल अंग्रेज़ी तरीके के साथ स्क्रिप्ट को ऑडियो में बदलते हैं। डेमो क्लिप यह नहीं दिखातीं कि आपके प्रोजेक्ट में क्या फ़ैसला करता है: कौन-सी आवाज़ किस काम के लिए सही है, टोकन का बिल कैसे जुड़ता है, API कॉल कैसी दिखती है और सीमाएँ कहाँ हैं। नीचे इन सबको असली आँकड़ों, एक काम करने वाले Python उदाहरण और एक नो-कोड रूट के साथ समझाया गया है, जिसे आप एक मिनट से कम में ब्राउज़र में आज़मा सकते हैं।
Gemini TTS असल में क्या करता है
Gemini TTS, Google के Gemini मॉडल का स्पीच आउटपुट वाला हिस्सा है। आप टेक्स्ट के साथ एक वैकल्पिक निर्देश भेजते हैं, और मॉडल टेक्स्ट की जगह ऑडियो लौटाता है। पारंपरिक टेक्स्ट-टू-स्पीच इंजन हर वाक्य पर एक ही तय अंदाज़ लागू करते हैं। Gemini TTS मॉडल निर्देश और स्क्रिप्ट दोनों को एक साथ पढ़ता है, इसलिए "इसे एक थकी हुई नाइट शिफ़्ट नर्स की तरह बोलो" जैसा निर्देश सिर्फ़ पिच नहीं, बल्कि रफ़्तार, साँस और टोन भी बदल देता है।
टेक्स्ट से बोली जाने वाली ऑडियो तक
हर रिक्वेस्ट में तीन चीज़ें होती हैं: एक स्क्रिप्ट, एक वॉइस और एक स्टाइल निर्देश। Picasso IA पर Gemini 3.1 Flash TTS पेज इन्हें चार फ़ील्ड में दिखाता है: text, voice, prompt और language_code। डिफ़ॉल्ट वॉइस Kore है, भाषा en-US है और प्रॉम्प्ट "Say the following." है। जनरेट दबाएँ और कुछ ही सेकंड में तैयार ऑडियो फ़ाइल आ जाती है। मॉडल पेज पर प्रकाशित दो सैंपल रन में लगभग 6.5 और 4.0 सेकंड लगे। इतना छोटा लूप आपके काम करने का तरीका बदल देता है: किसी लाइन को फिर से लिखें, दोबारा जनरेट करें और हर टेक की तुलना करें, जैसे आप किसी इंसानी नैरेटर के साथ करते, बिना बुकिंग फ़ीस और स्टूडियो के घंटों के।
इस्तेमाल होने वाले मॉडल वर्ज़न
Google एक से ज़्यादा TTS मॉडल देता है, और चुनाव से आपका बिल बदलता है:
Gemini 3.1 Flash TTS (प्रीव्यू): $1.00 प्रति मिलियन टेक्स्ट इनपुट टोकन और $20.00 प्रति मिलियन ऑडियो आउटपुट टोकन की कीमत।
Gemini 2.5 Flash Preview TTS: दोनों तरफ़ 3.1 Flash की कीमत का ठीक आधा।
Gemini 2.5 Pro Preview TTS: 3.1 Flash जैसी ही दरें, लेकिन इसमें कोई फ़्री टियर नहीं है।
आप कौन-सा चुनें? जब आपको सबसे नया डिलीवरी कंट्रोल चाहिए, तो 3.1 Flash चुनें। जब आप हज़ारों छोटी स्ट्रिंग्स को वॉइस देते हैं, जैसे ऐप नोटिफ़िकेशन, तब 2.5 Flash चुनें, क्योंकि आधी कीमत का फ़ायदा जल्दी बड़ा हो जाता है। 2.5 Pro तभी चुनें जब उसका आउटपुट आपको ज़्यादा पसंद हो, क्योंकि उसकी कीमत 3.1 Flash जितनी है और उसमें कोई फ़्री टियर नहीं है।
Google के स्पीच डॉक्युमेंटेशन में नए Flash और Flash Lite TTS मॉडल भी सूचीबद्ध हैं। इस लेख के लिखे जाने के समय उनकी दरें प्राइसिंग टेबल में नहीं थीं, इसलिए बजट बनाने से पहले टेबल ज़रूर देख लें।
30 आवाज़ें, टोन के हिसाब से
Gemini TTS में 30 प्रीबिल्ट आवाज़ें हैं, जिनके नाम खगोल विज्ञान और मिथकों से लिए गए हैं। Google हर एक के साथ "Bright" या "Firm" जैसा एक शब्द का लेबल जोड़ता है, और चुनने का सबसे तेज़ तरीका यही लेबल है। इन्हें शुरुआती बिंदु मानें, क्योंकि स्टाइल प्रॉम्प्ट किसी भी आवाज़ को ज़्यादा गर्म, तेज़ या सपाट बना सकता है।
उत्साही और चमकदार
सात आवाज़ें ऊर्जावान झुकाव रखती हैं: Zephyr (चमकीली), Puck (उत्साही), Autonoe (चमकीली), Laomedeia (उत्साही), Sadachbia (Lively), Fenrir (Excitable) और Leda (Youthful)। इन्हें विज्ञापनों, सोशल क्लिप, ऑनबोर्डिंग टूर और बच्चों के कंटेंट में इस्तेमाल करें, जहाँ सुनने वाले को पहले ही सेकंड में रफ़्तार महसूस होनी चाहिए।
गर्म और कोमल
छह आवाज़ें नरम पक्ष पर हैं: Sulafat (Warm), Achird (Friendly), Vindemiatrix (Gentle), Achernar (Soft), Enceladus (Breathy) और Aoede (Breezy)। ये मेडिटेशन स्क्रिप्ट, बेडटाइम स्टोरी, वेलनेस ऐप और कस्टमर सपोर्ट संदेशों के लिए ठीक हैं।
दृढ़ और स्पष्ट
दस आवाज़ें अधिकार का एहसास देती हैं: Kore (दृढ़), Orus (दृढ़), Alnilam (दृढ़), Iapetus (स्पष्ट), Erinome (स्पष्ट), Charon (जानकारीपूर्ण), Rasalgethi (जानकारीपूर्ण), Sadaltager (जानकार), Schedar (संतुलित) और Pulcherrima (मुखर)। Kore की डिफ़ॉल्ट होने की एक वजह है: यह बिना रूखे लगे ट्यूटोरियल, एक्सप्लेनर और प्रोडक्ट डेमो के लिए काम करती है।
बाकी सात आवाज़ें कमी पूरी करती हैं। Algieba, Despina, Callirrhoe, Umbriel और Zubenelgenubi चिकनी, सहज या आरामदेह हैं, जो बातचीत के लिए ठीक बैठती हैं। Algenib (Gravelly) और Gacrux (Mature) किरदारों और कहानी कहने के लिए बनावट जोड़ती हैं।
काम
पहले आज़माने वाली आवाज़ें
प्रोडक्ट डेमो
Kore, Charon, Sadaltager
पॉडकास्ट इंट्रो
Puck, Fenrir, Algenib
मेडिटेशन
Vindemiatrix, Achernar, Enceladus
सोशल ऐड
Zephyr, Sadachbia, Leda
ऑडियोबुक नैरेशन
Gacrux, Schedar, Sulafat
💡 कोई फ़ैसला करने से पहले ऑडिशन करें। 30 शब्दों का एक पैराग्राफ़ पेस्ट करें, तीन आवाज़ों से रेंडर करें और उन्हीं स्पीकर पर सुनें जिन पर आपके दर्शक सुनेंगे। ये लेबल Google का विवरण हैं। आख़िरी फ़ैसला आपके कान करेंगे।
70+ भाषाएँ और उच्चारण
भाषा फ़ील्ड में 70 से ज़्यादा भाषाएँ आती हैं, और कई के क्षेत्रीय रूप भी हैं। यह उतना छोटा मुद्दा नहीं है जितना लगता है: मेक्सिकन और कास्टिलियन स्पेनिश शब्दावली और लय में अलग हैं, और सुनने वाले एक वाक्य के भीतर ही इसे पकड़ लेते हैं।
भाषा
उपलब्ध कोड
English
en-US, en-GB, en-AU, en-IN
Spanish
es-ES, es-MX, es-419
French
fr-FR, fr-CA
Portuguese
pt-BR, pt-PT
Chinese
cmn-CN, cmn-tw
Arabic
ar-001, ar-EG
तरीका सरल है। लक्ष्य भाषा में स्क्रिप्ट लिखें, मेल खाता कोड सेट करें और वही वॉइस रखें। ज़्यादातर मामलों में एक ही आवाज़ सूची की हर भाषा पढ़ सकती है, इसलिए आप सभी बाज़ारों में एक ही ब्रांड साउंड रख सकते हैं। अन्य लोकप्रिय कोड हैं de-DE, it-IT, ja-JP, ko-KR, hi-IN, tr-TR, pl-PL, nl-NL, sv-SE और vi-VN।
सूची की दुर्लभ भाषाएँ
बड़े बाज़ारों से आगे, सूची में Cebuano (ceb-PH), Haitian Creole (ht-HT), Javanese (jv-JV), Malagasy (mg-MG), Maithili (mai-IN), Konkani (kok-IN), Sindhi (sd-IN), Basque (eu-ES), Galician (gl-ES) और यहाँ तक कि Latin (la-VA) भी शामिल हैं। सभी की गुणवत्ता एक जैसी नहीं होगी, इसलिए ग्राहकों के सामने जाने वाली किसी भी चीज़ की समीक्षा किसी मूल भाषी से करवाएँ। पूरा कोर्स स्थानीय बनाने से पहले, लक्ष्य भाषा में 20 सेकंड का सैंपल दो आवाज़ों से रेंडर करें और मूल भाषी को तीन सवालों के साथ भेजें: क्या नाम सही सुनाई देते हैं, क्या लय स्वाभाविक लगती है, और क्या उच्चारण आपके लक्ष्य क्षेत्र से मेल खाता है? अगर एक्रोनिम मॉडल को उलझाते हैं, तो स्क्रिप्ट में उन्हें उच्चारण के हिसाब से लिखें। अगर आपका स्रोत स्क्रिप्ट नहीं, बल्कि तैयार वीडियो है, तो ElevenLabs Dubbing उसे उसी प्लेटफ़ॉर्म पर 90+ भाषाओं में अनुवाद कर देता है।
टैग और स्टाइल प्रॉम्प्ट
डिलीवरी को दो तरीकों से आकार मिलता है। टैग अलग-अलग वाक्यांशों पर काम करते हैं, और स्टाइल प्रॉम्प्ट पूरे टेक का मूड तय करता है।
एकल लाइनों के लिए इनलाइन टैग
टैग स्क्रिप्ट के भीतर वर्गाकार ब्रैकेट में लिखे जाते हैं। मॉडल पेज [sigh], [laughing], [whispering], [shouting] और [extremely fast] सूचीबद्ध करता है, और प्रकाशित सैंपल दिखाते हैं कि वर्णनात्मक टैग भी काम करते हैं। एक सैंपल Algenib आवाज़ पर [like dracula] से शुरू होता है। दूसरा Callirrhoe पर [laughs] I did NOT expect that. [sigh] Can you believe it! चलाता है।
टैग
क्या उम्मीद करें
[whispering]
दबी हुई, माइक्रोफ़ोन के बेहद करीब
[laughing]
लाइन से पहले या उसके भीतर सुनाई देने वाली हँसी
[shouting]
ऊँची आवाज़ और तात्कालिकता
[sigh]
थकी या राहत भरी लंबी साँस
[extremely fast]
तेज़, सिकुड़ी हुई रफ़्तार
पूरे टेक के लिए स्टाइल प्रॉम्प्ट
prompt फ़ील्ड 4,000 बाइट तक सादी भाषा लेता है। "Say this in a calm, professional tone" या "Speak with excitement and energy" जैसे छोटे निर्देश भी नतीजा बदल देते हैं। लंबे निर्देश एक दृश्य बनाते हैं: "You are having a casual conversation with a friend. Say the following in a friendly and amused way." प्रकाशित Callirrhoe सैंपल यही दूसरा रूप इस्तेमाल करता है।
दोनों तरीके एक प्रोडक्ट घोषणा पर कैसे मिलते हैं, यह देखें, जिसे Puck से बोला गया है। प्रॉम्प्ट है "Speak like a friendly presenter on a morning show, upbeat but not rushed." स्क्रिप्ट है Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! प्रॉम्प्ट ऊर्जा की ऊपरी सीमा तय करता है, फुसफुसाहट एक पल की अंतरंगता बनाती है, और चिल्लाहट ज़्यादा ज़ोर से लगती है क्योंकि वह एक शांत लाइन के बाद आती है। कंट्रास्ट ही टैग को सुनाई देने लायक बनाता है।
💡 हर वाक्य में एक भावना। एक लाइन में तीन टैग लगाने से गड़बड़ी बनती है। एक टैग लगाएँ, सुनें, फिर तय करें कि लाइन को दूसरा टैग चाहिए या नहीं।
Gemini TTS की असली लागत
ऑडियो टोकन में बिल होता है, और Google का प्राइसिंग पेज इसका रूपांतरण साफ़ बताता है: 25 ऑडियो टोकन प्रति सेकंड। बाकी सब इसी एक आँकड़े से निकलता है।
एक मिनट के भाषण का मतलब है 60 सेकंड गुणा 25 टोकन, यानी 1,500 आउटपुट टोकन। $20.00 प्रति मिलियन के हिसाब से यह 1,500 गुणा 20 भाग 1,000,000, यानी $0.03 प्रति मिनट है। आप जो टेक्स्ट भेजते हैं, वह नगण्य है: 150 बोले गए शब्द लगभग 200 इनपुट टोकन के बराबर हैं, यानी लगभग $0.0002।
ऑडियो की अवधि
3.1 Flash स्टैंडर्ड
3.1 Flash बैच
2.5 Flash स्टैंडर्ड
1 मिनट
$0.03
$0.015
$0.015
10 मिनट
$0.30
$0.15
$0.15
1 घंटा
$1.80
$0.90
$0.90
10 घंटे
$18.00
$9.00
$9.00
फ़्री टियर और बैच छूट
Google दोनों Flash मॉडल के लिए फ़्री टियर सूचीबद्ध करता है, जबकि Pro केवल पेड है। फ़्री टियर की रेट लिमिट बदलती रहती हैं, इसलिए लॉन्च प्लान बनाने से पहले प्राइसिंग पेज पर उनकी पुष्टि कर लें। बैच मोड, यानी बाद में पूरे होने वाले एसिंक्रोनस जॉब, दोनों दरों को आधा कर देता है। इसलिए ऑडियोबुक, कोर्स लाइब्रेरी या रात भर में रेंडर हो सकने वाले किसी भी पुराने कंटेंट के लिए यही स्पष्ट विकल्प है।
एक उदाहरण से यह ठोस हो जाता है। मान लीजिए आप 20 पाठों वाला कोर्स बनवाते हैं, जिसका हर पाठ 8 मिनट का है। यह 160 मिनट का ऑडियो है, जिसकी लागत 160 गुणा $0.03, यानी $4.80 है, 3.1 Flash की स्टैंडर्ड दर पर, और बैच में $2.40। इसे 100 पाठों तक बढ़ाएँ, तो स्टैंडर्ड पर $24.00 या बैच पर $12.00 बनते हैं। स्क्रिप्ट बदलने के बाद एक पाठ दोबारा रिकॉर्ड करने में लगभग 24 सेंट लगते हैं, और यही असली फ़ायदा है: ऑडियो एडिट करना शेड्यूलिंग की समस्या नहीं रहता।
💡 बजट का मोटा नियम। अपने तैयार ऑडियो मिनटों को $0.03 से गुणा करें, यह 3.1 Flash की स्टैंडर्ड दर है। बैच के लिए उसका आधा। ये दरें प्रीव्यू मॉडल की हैं, इसलिए स्केल करते समय इन्हें दोबारा जाँच लें।
Gemini TTS API को कॉल करना
Python SDK के साथ TTS रिक्वेस्ट एक सामान्य generate_content कॉल है, जिसमें दो बदलाव होते हैं: ऑडियो रिस्पॉन्स मोडैलिटी और एक स्पीच कॉन्फ़िग जो वॉइस का नाम लेता है।
एक न्यूनतम Python उदाहरण
from google import genai
from google.genai import types
import wave
client = genai.Client() # reads your credentials from the environment
response = client.models.generate_content(
model="gemini-3.1-flash-tts-preview",
contents="Say warmly: Welcome back. Today we compare three voices.",
config=types.GenerateContentConfig(
response_modalities=["AUDIO"],
speech_config=types.SpeechConfig(
voice_config=types.VoiceConfig(
prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
)
),
),
)
pcm = response.candidates[0].content.parts[0].inline_data.data
with wave.open("welcome.wav", "wb") as f:
f.setnchannels(1)
f.setsampwidth(2)
f.setframerate(24000)
f.writeframes(pcm)
कुछ विवरण डीबगिंग का समय बचाते हैं:
क्रेडेंशियल फ़ाइल से बाहर रहते हैं। क्लाइंट उन्हें एनवायरनमेंट वेरिएबल से उठाता है, इसलिए आपकी रिपॉज़िटरी में कोई गोपनीय चीज़ नहीं रहती।
स्टाइल निर्देश प्रॉम्प्ट टेक्स्ट का हिस्सा है। स्क्रिप्ट से पहले "Say warmly:" वही काम करता है जो Picasso IA के prompt फ़ील्ड में होता है।
आउटपुट रॉ PCM है। यह 24 kHz, मोनो, 16-बिट ऑडियो के रूप में आता है। wave मॉड्यूल इसे चलाने योग्य WAV फ़ाइल में लपेटता है, और अगर आपको छोटी फ़ाइलें चाहिए तो ffmpeg इसे MP3 में बदल देता है।
प्रीव्यू मॉडल पर फ़ील्ड नाम बदलते रहते हैं। SDK अपडेट के बाद कॉल फ़ेल हो, तो Google का मौजूदा रेफ़रेंस देखें।
एक कॉल में दो स्पीकर
API एक ही रिक्वेस्ट में दो स्पीकर तक स्वीकार करता है। अपनी स्क्रिप्ट की लाइनों पर लेबल लगाएँ, जैसे "Host:" और "Guest:", फिर स्पीच कॉन्फ़िग में हर लेबल को एक वॉइस से जोड़ें। यह पॉडकास्ट स्टाइल डायलॉग या दो आवाज़ों वाले FAQ का तेज़ रास्ता है। दृढ़ आवाज़ को किसी जीवंत आवाज़ के साथ जोड़ें, ताकि सुनने वाले बिना विज़ुअल्स के भी बारी-बारी बोलने वालों को पहचान सकें। तीन या उससे ज़्यादा वॉइस के लिए, हर स्पीकर की लाइनें अलग से रेंडर करें और उन्हें ऑडियो एडिटर में जोड़ें।
लंबी स्क्रिप्ट के लिए, पैराग्राफ़ के हिसाब से बाँटें, टुकड़े एक-एक करके भेजें और हर नतीजा कैश करें। तब एक फ़ेल रिक्वेस्ट की कीमत पूरा चैप्टर नहीं, सिर्फ़ एक पैराग्राफ़ होती है। प्रीव्यू मॉडल पर आम तौर पर स्टेबल मॉडल से सख़्त रेट लिमिट होती है, इसलिए कॉल को exponential backoff वाले retry में लपेटें। हर फ़ाइल के साथ वॉइस, भाषा कोड और स्क्रिप्ट का हैश लॉग करें, तो आप बाद में किसी भी क्लिप को उन्हीं सेटिंग्स से फिर से बना सकते हैं।
अपने ब्राउज़र में Gemini TTS आज़माएँ
अगर आपको सिर्फ़ कुछ क्लिप चाहिए, तो कोड छोड़ दें। Picasso IA मॉडल पेज Gemini 3.1 Flash TTS को बिना सेटअप के ऑनलाइन मुफ़्त आज़माने लायक बताता है, और हर फ़ील्ड ऊपर बताए API विकल्पों से मेल खाता है।
अपनी स्क्रिप्ट Text में पेस्ट करें। सीमा 4,000 बाइट है, जो एक छोटे एक्सप्लेनर के लिए काफ़ी है। यह बाइट गिनता है, कैरेक्टर नहीं, इसलिए जापानी या अरबी स्क्रिप्ट में अंग्रेज़ी की तुलना में कम कैरेक्टर आते हैं।
एक Voice चुनें। Kore से शुरू करें, फिर दो और आज़माएँ।
अपनी स्क्रिप्ट से मेल खाता Language code सेट करें, जैसे मेक्सिकन स्पेनिश के लिए es-MX।
टोन और रफ़्तार बताने वाला Prompt लिखें, या तटस्थ पाठ के लिए डिफ़ॉल्ट "Say the following." रहने दें।
जहाँ भावना चाहिए वहाँ [whispering] जैसे टैग जोड़ें, जनरेट दबाएँ और ऑडियो डाउनलोड करें।
लंबे टुकड़ों के लिए स्क्रिप्ट को सेक्शन के हिसाब से बाँटें और बाद में फ़ाइलें जोड़ लें।
बदलने लायक सेटिंग्स
फ़ील्ड
डिफ़ॉल्ट
सुझाव
Text
कोई नहीं
4,000 बाइट तक। टैग कम इस्तेमाल करें
Voice
Kore
30 विकल्प। चुनने से पहले तीन आज़माएँ
Prompt
Say the following.
4,000 बाइट तक। टोन, रफ़्तार और उच्चारण तय करें
Language code
en-US
उसी भाषा से मेल खाएँ जिसमें स्क्रिप्ट लिखी है
💡 सपाट टेक का आम तौर पर मतलब होता है छोटा प्रॉम्प्ट। प्रॉम्प्ट को लंबा करें, स्क्रिप्ट को नहीं। बताएँ कि कौन बोल रहा है, किससे और क्यों, तो पेसिंग और ज़ोर अक्सर अपने-आप सही बैठते हैं।
इसे संगीत और ट्रांसक्रिप्ट के साथ जोड़ें
स्पीच अक्सर पूरा प्रोजेक्ट नहीं होती। बैकग्राउंड बेड के लिए Lyria 3 या Music 2.6 आज़माएँ और उसे नैरेशन के नीचे धीमे से मिक्स करें। कैप्शन के लिए ऑडियो को Gemini 3 Pro या GPT 4o Transcribe से प्रोसेस करें।
ट्रांसक्रिप्शन गुणवत्ता जाँच का काम भी करता है। जनरेट किए गए नैरेशन को ट्रांसक्राइब करें और उसे स्क्रिप्ट से मिलाएँ। गलत उच्चारण वाले प्रोडक्ट नाम और छूटे हुए शब्द टेक्स्ट के अंतर में दिख जाते हैं, उससे बहुत पहले कि कोई श्रोता शिकायत करे।
अपना पहला वॉइसओवर बनाएँ
Gemini TTS कुछ ही कामों में अपनी जगह बनाता है: प्रोडक्ट डेमो नैरेशन, पॉडकास्ट इंट्रो और ऐड रीड, आर्टिकल और न्यूज़लेटर के ऑडियो वर्ज़न, एक जैसे लहजे वाले ट्रेनिंग वीडियो, और एक स्क्रिप्ट से बने बहुभाषी ट्रैक। अगर आपके प्रोजेक्ट को कोई अलग आवाज़ चाहिए, तो इसी श्रेणी के तीन और मॉडल परखने लायक हैं: स्टूडियो क्वालिटी वॉइसओवर के लिए MiniMax Speech 2.8 HD, स्वाभाविक नैरेशन के लिए ElevenLabs V3 और जब रिस्पॉन्स की गति सबसे ज़रूरी हो, तब Inworld Realtime TTS 2। एक और सीमा जानने लायक है: API और Picasso IA पेज, दोनों 30 प्रीबिल्ट आवाज़ों के साथ काम करते हैं। अगर आपको ऐसी आवाज़ चाहिए जो आप या आपके ब्रांड जैसी लगे, तो इसके बजाय MiniMax Voice Cloning या Qwen3 TTS आज़माएँ।
आवाज़ के सवाल को सुलझाने का सबसे तेज़ तरीका उसे सुनना है। अपने प्रोजेक्ट से एक पैराग्राफ़ लें, Picasso IA पर Gemini 3.1 Flash TTS खोलें और तीन आवाज़ों से रेंडर करें। एक [whispering] टैग जोड़ें, भाषा कोड बदलकर देखें कि आपकी स्क्रिप्ट दूसरे बाज़ार में कैसी सुनाई देती है, और दोनों क्लिप साथ-साथ तुलना करें। दस मिनट के भीतर आपको पता चल जाएगा कि कौन-सी आवाज़ आपकी है, और जब भी प्रोजेक्ट बड़ा हो, उसी वर्कफ़्लो को Picasso IA पर म्यूज़िक और ट्रांसक्रिप्शन मॉडल के साथ आज़मा सकते हैं।