Gemini TTS: आवाज़ें, प्राइसिंग, API और भाषाएँ विस्तार से

Gemini TTS 30 प्रीबिल्ट आवाज़ों, 70+ भाषाओं और "whispering" तथा "laughing" जैसे एक्सप्रेसिव टैग के साथ स्क्रिप्ट को स्पीच में बदलता है। यह लेख हर आवाज़ को उसके टोन के हिसाब से समझाता है, कीमत के पीछे का असली टोकन गणित दिखाता है, एक काम करने वाला Python API कॉल देता है और एक ब्राउज़र रूट बताता है जिसे किसी सेटअप की ज़रूरत नहीं।

Gemini TTS: आवाज़ें, प्राइसिंग, API और भाषाएँ विस्तार से
Cristian Da Conceicao
Picasso IA के संस्थापक

Gemini TTS से एक मिनट के वॉइसओवर की लागत स्टैंडर्ड रेट पर लगभग तीन सेंट आती है। यही एक आँकड़ा समझाता है कि डेवलपर, पॉडकास्टर और कोर्स बनाने वाले लोग इसके बारे में बार-बार क्यों पूछते हैं। Google के स्पीच मॉडल 30 नामित आवाज़ों, दर्जनों भाषाओं और परफ़ॉर्मेंस को निर्देश देने के सरल अंग्रेज़ी तरीके के साथ स्क्रिप्ट को ऑडियो में बदलते हैं। डेमो क्लिप यह नहीं दिखातीं कि आपके प्रोजेक्ट में क्या फ़ैसला करता है: कौन-सी आवाज़ किस काम के लिए सही है, टोकन का बिल कैसे जुड़ता है, API कॉल कैसी दिखती है और सीमाएँ कहाँ हैं। नीचे इन सबको असली आँकड़ों, एक काम करने वाले Python उदाहरण और एक नो-कोड रूट के साथ समझाया गया है, जिसे आप एक मिनट से कम में ब्राउज़र में आज़मा सकते हैं।

Gemini TTS असल में क्या करता है

Gemini TTS, Google के Gemini मॉडल का स्पीच आउटपुट वाला हिस्सा है। आप टेक्स्ट के साथ एक वैकल्पिक निर्देश भेजते हैं, और मॉडल टेक्स्ट की जगह ऑडियो लौटाता है। पारंपरिक टेक्स्ट-टू-स्पीच इंजन हर वाक्य पर एक ही तय अंदाज़ लागू करते हैं। Gemini TTS मॉडल निर्देश और स्क्रिप्ट दोनों को एक साथ पढ़ता है, इसलिए "इसे एक थकी हुई नाइट शिफ़्ट नर्स की तरह बोलो" जैसा निर्देश सिर्फ़ पिच नहीं, बल्कि रफ़्तार, साँस और टोन भी बदल देता है।

गर्म घरेलू स्टूडियो में बूम आर्म माइक्रोफ़ोन के सामने बोलता, भूरे हुडी में एक पॉडकास्ट होस्ट

टेक्स्ट से बोली जाने वाली ऑडियो तक

हर रिक्वेस्ट में तीन चीज़ें होती हैं: एक स्क्रिप्ट, एक वॉइस और एक स्टाइल निर्देश। Picasso IA पर Gemini 3.1 Flash TTS पेज इन्हें चार फ़ील्ड में दिखाता है: text, voice, prompt और language_code। डिफ़ॉल्ट वॉइस Kore है, भाषा en-US है और प्रॉम्प्ट "Say the following." है। जनरेट दबाएँ और कुछ ही सेकंड में तैयार ऑडियो फ़ाइल आ जाती है। मॉडल पेज पर प्रकाशित दो सैंपल रन में लगभग 6.5 और 4.0 सेकंड लगे। इतना छोटा लूप आपके काम करने का तरीका बदल देता है: किसी लाइन को फिर से लिखें, दोबारा जनरेट करें और हर टेक की तुलना करें, जैसे आप किसी इंसानी नैरेटर के साथ करते, बिना बुकिंग फ़ीस और स्टूडियो के घंटों के।

इस्तेमाल होने वाले मॉडल वर्ज़न

Google एक से ज़्यादा TTS मॉडल देता है, और चुनाव से आपका बिल बदलता है:

  • Gemini 3.1 Flash TTS (प्रीव्यू): $1.00 प्रति मिलियन टेक्स्ट इनपुट टोकन और $20.00 प्रति मिलियन ऑडियो आउटपुट टोकन की कीमत।
  • Gemini 2.5 Flash Preview TTS: दोनों तरफ़ 3.1 Flash की कीमत का ठीक आधा।
  • Gemini 2.5 Pro Preview TTS: 3.1 Flash जैसी ही दरें, लेकिन इसमें कोई फ़्री टियर नहीं है।

आप कौन-सा चुनें? जब आपको सबसे नया डिलीवरी कंट्रोल चाहिए, तो 3.1 Flash चुनें। जब आप हज़ारों छोटी स्ट्रिंग्स को वॉइस देते हैं, जैसे ऐप नोटिफ़िकेशन, तब 2.5 Flash चुनें, क्योंकि आधी कीमत का फ़ायदा जल्दी बड़ा हो जाता है। 2.5 Pro तभी चुनें जब उसका आउटपुट आपको ज़्यादा पसंद हो, क्योंकि उसकी कीमत 3.1 Flash जितनी है और उसमें कोई फ़्री टियर नहीं है।

Google के स्पीच डॉक्युमेंटेशन में नए Flash और Flash Lite TTS मॉडल भी सूचीबद्ध हैं। इस लेख के लिखे जाने के समय उनकी दरें प्राइसिंग टेबल में नहीं थीं, इसलिए बजट बनाने से पहले टेबल ज़रूर देख लें।

30 आवाज़ें, टोन के हिसाब से

Gemini TTS में 30 प्रीबिल्ट आवाज़ें हैं, जिनके नाम खगोल विज्ञान और मिथकों से लिए गए हैं। Google हर एक के साथ "Bright" या "Firm" जैसा एक शब्द का लेबल जोड़ता है, और चुनने का सबसे तेज़ तरीका यही लेबल है। इन्हें शुरुआती बिंदु मानें, क्योंकि स्टाइल प्रॉम्प्ट किसी भी आवाज़ को ज़्यादा गर्म, तेज़ या सपाट बना सकता है।

साउंड इंजीनियर के हाथों का ऊपर से लिया क्लोज़-अप, ब्रश्ड एल्युमिनियम फ़ेडर वाले मिक्सिंग कंसोल पर

उत्साही और चमकदार

सात आवाज़ें ऊर्जावान झुकाव रखती हैं: Zephyr (चमकीली), Puck (उत्साही), Autonoe (चमकीली), Laomedeia (उत्साही), Sadachbia (Lively), Fenrir (Excitable) और Leda (Youthful)। इन्हें विज्ञापनों, सोशल क्लिप, ऑनबोर्डिंग टूर और बच्चों के कंटेंट में इस्तेमाल करें, जहाँ सुनने वाले को पहले ही सेकंड में रफ़्तार महसूस होनी चाहिए।

गर्म और कोमल

छह आवाज़ें नरम पक्ष पर हैं: Sulafat (Warm), Achird (Friendly), Vindemiatrix (Gentle), Achernar (Soft), Enceladus (Breathy) और Aoede (Breezy)। ये मेडिटेशन स्क्रिप्ट, बेडटाइम स्टोरी, वेलनेस ऐप और कस्टमर सपोर्ट संदेशों के लिए ठीक हैं।

दृढ़ और स्पष्ट

दस आवाज़ें अधिकार का एहसास देती हैं: Kore (दृढ़), Orus (दृढ़), Alnilam (दृढ़), Iapetus (स्पष्ट), Erinome (स्पष्ट), Charon (जानकारीपूर्ण), Rasalgethi (जानकारीपूर्ण), Sadaltager (जानकार), Schedar (संतुलित) और Pulcherrima (मुखर)। Kore की डिफ़ॉल्ट होने की एक वजह है: यह बिना रूखे लगे ट्यूटोरियल, एक्सप्लेनर और प्रोडक्ट डेमो के लिए काम करती है।

बाकी सात आवाज़ें कमी पूरी करती हैं। Algieba, Despina, Callirrhoe, Umbriel और Zubenelgenubi चिकनी, सहज या आरामदेह हैं, जो बातचीत के लिए ठीक बैठती हैं। Algenib (Gravelly) और Gacrux (Mature) किरदारों और कहानी कहने के लिए बनावट जोड़ती हैं।

कामपहले आज़माने वाली आवाज़ें
प्रोडक्ट डेमोKore, Charon, Sadaltager
पॉडकास्ट इंट्रोPuck, Fenrir, Algenib
मेडिटेशनVindemiatrix, Achernar, Enceladus
सोशल ऐडZephyr, Sadachbia, Leda
ऑडियोबुक नैरेशनGacrux, Schedar, Sulafat

💡 कोई फ़ैसला करने से पहले ऑडिशन करें। 30 शब्दों का एक पैराग्राफ़ पेस्ट करें, तीन आवाज़ों से रेंडर करें और उन्हीं स्पीकर पर सुनें जिन पर आपके दर्शक सुनेंगे। ये लेबल Google का विवरण हैं। आख़िरी फ़ैसला आपके कान करेंगे।

70+ भाषाएँ और उच्चारण

भाषा फ़ील्ड में 70 से ज़्यादा भाषाएँ आती हैं, और कई के क्षेत्रीय रूप भी हैं। यह उतना छोटा मुद्दा नहीं है जितना लगता है: मेक्सिकन और कास्टिलियन स्पेनिश शब्दावली और लय में अलग हैं, और सुनने वाले एक वाक्य के भीतर ही इसे पकड़ लेते हैं।

एक चमकदार अनुवाद कार्यालय में ओक की मेज़ के चारों ओर बैठे पाँच सहकर्मी, अलग-अलग भाषाओं की स्क्रिप्ट मिलाते हुए

भाषाउपलब्ध कोड
Englishen-US, en-GB, en-AU, en-IN
Spanishes-ES, es-MX, es-419
Frenchfr-FR, fr-CA
Portuguesept-BR, pt-PT
Chinesecmn-CN, cmn-tw
Arabicar-001, ar-EG

तरीका सरल है। लक्ष्य भाषा में स्क्रिप्ट लिखें, मेल खाता कोड सेट करें और वही वॉइस रखें। ज़्यादातर मामलों में एक ही आवाज़ सूची की हर भाषा पढ़ सकती है, इसलिए आप सभी बाज़ारों में एक ही ब्रांड साउंड रख सकते हैं। अन्य लोकप्रिय कोड हैं de-DE, it-IT, ja-JP, ko-KR, hi-IN, tr-TR, pl-PL, nl-NL, sv-SE और vi-VN।

सूची की दुर्लभ भाषाएँ

बड़े बाज़ारों से आगे, सूची में Cebuano (ceb-PH), Haitian Creole (ht-HT), Javanese (jv-JV), Malagasy (mg-MG), Maithili (mai-IN), Konkani (kok-IN), Sindhi (sd-IN), Basque (eu-ES), Galician (gl-ES) और यहाँ तक कि Latin (la-VA) भी शामिल हैं। सभी की गुणवत्ता एक जैसी नहीं होगी, इसलिए ग्राहकों के सामने जाने वाली किसी भी चीज़ की समीक्षा किसी मूल भाषी से करवाएँ। पूरा कोर्स स्थानीय बनाने से पहले, लक्ष्य भाषा में 20 सेकंड का सैंपल दो आवाज़ों से रेंडर करें और मूल भाषी को तीन सवालों के साथ भेजें: क्या नाम सही सुनाई देते हैं, क्या लय स्वाभाविक लगती है, और क्या उच्चारण आपके लक्ष्य क्षेत्र से मेल खाता है? अगर एक्रोनिम मॉडल को उलझाते हैं, तो स्क्रिप्ट में उन्हें उच्चारण के हिसाब से लिखें। अगर आपका स्रोत स्क्रिप्ट नहीं, बल्कि तैयार वीडियो है, तो ElevenLabs Dubbing उसे उसी प्लेटफ़ॉर्म पर 90+ भाषाओं में अनुवाद कर देता है।

टैग और स्टाइल प्रॉम्प्ट

डिलीवरी को दो तरीकों से आकार मिलता है। टैग अलग-अलग वाक्यांशों पर काम करते हैं, और स्टाइल प्रॉम्प्ट पूरे टेक का मूड तय करता है।

वॉइस बूथ में पॉप फ़िल्टर के सामने फुसफुसाता एक अभिनेता, मार्क-अप की हुई स्क्रिप्ट के साथ

एकल लाइनों के लिए इनलाइन टैग

टैग स्क्रिप्ट के भीतर वर्गाकार ब्रैकेट में लिखे जाते हैं। मॉडल पेज [sigh], [laughing], [whispering], [shouting] और [extremely fast] सूचीबद्ध करता है, और प्रकाशित सैंपल दिखाते हैं कि वर्णनात्मक टैग भी काम करते हैं। एक सैंपल Algenib आवाज़ पर [like dracula] से शुरू होता है। दूसरा Callirrhoe पर [laughs] I did NOT expect that. [sigh] Can you believe it! चलाता है।

टैगक्या उम्मीद करें
[whispering]दबी हुई, माइक्रोफ़ोन के बेहद करीब
[laughing]लाइन से पहले या उसके भीतर सुनाई देने वाली हँसी
[shouting]ऊँची आवाज़ और तात्कालिकता
[sigh]थकी या राहत भरी लंबी साँस
[extremely fast]तेज़, सिकुड़ी हुई रफ़्तार

पूरे टेक के लिए स्टाइल प्रॉम्प्ट

prompt फ़ील्ड 4,000 बाइट तक सादी भाषा लेता है। "Say this in a calm, professional tone" या "Speak with excitement and energy" जैसे छोटे निर्देश भी नतीजा बदल देते हैं। लंबे निर्देश एक दृश्य बनाते हैं: "You are having a casual conversation with a friend. Say the following in a friendly and amused way." प्रकाशित Callirrhoe सैंपल यही दूसरा रूप इस्तेमाल करता है।

दोनों तरीके एक प्रोडक्ट घोषणा पर कैसे मिलते हैं, यह देखें, जिसे Puck से बोला गया है। प्रॉम्प्ट है "Speak like a friendly presenter on a morning show, upbeat but not rushed." स्क्रिप्ट है Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! प्रॉम्प्ट ऊर्जा की ऊपरी सीमा तय करता है, फुसफुसाहट एक पल की अंतरंगता बनाती है, और चिल्लाहट ज़्यादा ज़ोर से लगती है क्योंकि वह एक शांत लाइन के बाद आती है। कंट्रास्ट ही टैग को सुनाई देने लायक बनाता है।

💡 हर वाक्य में एक भावना। एक लाइन में तीन टैग लगाने से गड़बड़ी बनती है। एक टैग लगाएँ, सुनें, फिर तय करें कि लाइन को दूसरा टैग चाहिए या नहीं।

Gemini TTS की असली लागत

ऑडियो टोकन में बिल होता है, और Google का प्राइसिंग पेज इसका रूपांतरण साफ़ बताता है: 25 ऑडियो टोकन प्रति सेकंड। बाकी सब इसी एक आँकड़े से निकलता है।

लैपटॉप और सोलर कैलकुलेटर के बगल में नोटबुक में बजट बनाता एक फ़्रीलांस क्रिएटर

मॉडलप्रति 1M टेक्स्ट इनपुट टोकनप्रति 1M ऑडियो आउटपुट टोकनफ़्री टियर
Gemini 3.1 Flash TTS Preview$1.00$20.00हाँ
Gemini 2.5 Flash Preview TTS$0.50$10.00हाँ
Gemini 2.5 Pro Preview TTS$1.00$20.00नहीं

सादे आँकड़ों में टोकन गणित

एक मिनट के भाषण का मतलब है 60 सेकंड गुणा 25 टोकन, यानी 1,500 आउटपुट टोकन। $20.00 प्रति मिलियन के हिसाब से यह 1,500 गुणा 20 भाग 1,000,000, यानी $0.03 प्रति मिनट है। आप जो टेक्स्ट भेजते हैं, वह नगण्य है: 150 बोले गए शब्द लगभग 200 इनपुट टोकन के बराबर हैं, यानी लगभग $0.0002।

ऑडियो की अवधि3.1 Flash स्टैंडर्ड3.1 Flash बैच2.5 Flash स्टैंडर्ड
1 मिनट$0.03$0.015$0.015
10 मिनट$0.30$0.15$0.15
1 घंटा$1.80$0.90$0.90
10 घंटे$18.00$9.00$9.00

फ़्री टियर और बैच छूट

Google दोनों Flash मॉडल के लिए फ़्री टियर सूचीबद्ध करता है, जबकि Pro केवल पेड है। फ़्री टियर की रेट लिमिट बदलती रहती हैं, इसलिए लॉन्च प्लान बनाने से पहले प्राइसिंग पेज पर उनकी पुष्टि कर लें। बैच मोड, यानी बाद में पूरे होने वाले एसिंक्रोनस जॉब, दोनों दरों को आधा कर देता है। इसलिए ऑडियोबुक, कोर्स लाइब्रेरी या रात भर में रेंडर हो सकने वाले किसी भी पुराने कंटेंट के लिए यही स्पष्ट विकल्प है।

एक उदाहरण से यह ठोस हो जाता है। मान लीजिए आप 20 पाठों वाला कोर्स बनवाते हैं, जिसका हर पाठ 8 मिनट का है। यह 160 मिनट का ऑडियो है, जिसकी लागत 160 गुणा $0.03, यानी $4.80 है, 3.1 Flash की स्टैंडर्ड दर पर, और बैच में $2.40। इसे 100 पाठों तक बढ़ाएँ, तो स्टैंडर्ड पर $24.00 या बैच पर $12.00 बनते हैं। स्क्रिप्ट बदलने के बाद एक पाठ दोबारा रिकॉर्ड करने में लगभग 24 सेंट लगते हैं, और यही असली फ़ायदा है: ऑडियो एडिट करना शेड्यूलिंग की समस्या नहीं रहता।

💡 बजट का मोटा नियम। अपने तैयार ऑडियो मिनटों को $0.03 से गुणा करें, यह 3.1 Flash की स्टैंडर्ड दर है। बैच के लिए उसका आधा। ये दरें प्रीव्यू मॉडल की हैं, इसलिए स्केल करते समय इन्हें दोबारा जाँच लें।

Gemini TTS API को कॉल करना

Python SDK के साथ TTS रिक्वेस्ट एक सामान्य generate_content कॉल है, जिसमें दो बदलाव होते हैं: ऑडियो रिस्पॉन्स मोडैलिटी और एक स्पीच कॉन्फ़िग जो वॉइस का नाम लेता है।

कंधे के ऊपर से देखा गया दृश्य: एक डेवलपर गहरे रंग के कोड एडिटर वाले मॉनिटर के बगल में टाइप करता हुआ

एक न्यूनतम Python उदाहरण

from google import genai
from google.genai import types
import wave

client = genai.Client()  # reads your credentials from the environment

response = client.models.generate_content(
    model="gemini-3.1-flash-tts-preview",
    contents="Say warmly: Welcome back. Today we compare three voices.",
    config=types.GenerateContentConfig(
        response_modalities=["AUDIO"],
        speech_config=types.SpeechConfig(
            voice_config=types.VoiceConfig(
                prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
            )
        ),
    ),
)

pcm = response.candidates[0].content.parts[0].inline_data.data

with wave.open("welcome.wav", "wb") as f:
    f.setnchannels(1)
    f.setsampwidth(2)
    f.setframerate(24000)
    f.writeframes(pcm)

कुछ विवरण डीबगिंग का समय बचाते हैं:

  • क्रेडेंशियल फ़ाइल से बाहर रहते हैं। क्लाइंट उन्हें एनवायरनमेंट वेरिएबल से उठाता है, इसलिए आपकी रिपॉज़िटरी में कोई गोपनीय चीज़ नहीं रहती।
  • स्टाइल निर्देश प्रॉम्प्ट टेक्स्ट का हिस्सा है। स्क्रिप्ट से पहले "Say warmly:" वही काम करता है जो Picasso IA के prompt फ़ील्ड में होता है।
  • आउटपुट रॉ PCM है। यह 24 kHz, मोनो, 16-बिट ऑडियो के रूप में आता है। wave मॉड्यूल इसे चलाने योग्य WAV फ़ाइल में लपेटता है, और अगर आपको छोटी फ़ाइलें चाहिए तो ffmpeg इसे MP3 में बदल देता है।
  • प्रीव्यू मॉडल पर फ़ील्ड नाम बदलते रहते हैं। SDK अपडेट के बाद कॉल फ़ेल हो, तो Google का मौजूदा रेफ़रेंस देखें।

एक कॉल में दो स्पीकर

API एक ही रिक्वेस्ट में दो स्पीकर तक स्वीकार करता है। अपनी स्क्रिप्ट की लाइनों पर लेबल लगाएँ, जैसे "Host:" और "Guest:", फिर स्पीच कॉन्फ़िग में हर लेबल को एक वॉइस से जोड़ें। यह पॉडकास्ट स्टाइल डायलॉग या दो आवाज़ों वाले FAQ का तेज़ रास्ता है। दृढ़ आवाज़ को किसी जीवंत आवाज़ के साथ जोड़ें, ताकि सुनने वाले बिना विज़ुअल्स के भी बारी-बारी बोलने वालों को पहचान सकें। तीन या उससे ज़्यादा वॉइस के लिए, हर स्पीकर की लाइनें अलग से रेंडर करें और उन्हें ऑडियो एडिटर में जोड़ें।

लंबी स्क्रिप्ट के लिए, पैराग्राफ़ के हिसाब से बाँटें, टुकड़े एक-एक करके भेजें और हर नतीजा कैश करें। तब एक फ़ेल रिक्वेस्ट की कीमत पूरा चैप्टर नहीं, सिर्फ़ एक पैराग्राफ़ होती है। प्रीव्यू मॉडल पर आम तौर पर स्टेबल मॉडल से सख़्त रेट लिमिट होती है, इसलिए कॉल को exponential backoff वाले retry में लपेटें। हर फ़ाइल के साथ वॉइस, भाषा कोड और स्क्रिप्ट का हैश लॉग करें, तो आप बाद में किसी भी क्लिप को उन्हीं सेटिंग्स से फिर से बना सकते हैं।

अपने ब्राउज़र में Gemini TTS आज़माएँ

अगर आपको सिर्फ़ कुछ क्लिप चाहिए, तो कोड छोड़ दें। Picasso IA मॉडल पेज Gemini 3.1 Flash TTS को बिना सेटअप के ऑनलाइन मुफ़्त आज़माने लायक बताता है, और हर फ़ील्ड ऊपर बताए API विकल्पों से मेल खाता है।

चमकदार वर्कस्पेस में गले में हेडफ़ोन लटकाए लैपटॉप पर स्क्रिप्ट टाइप करता एक कंटेंट क्रिएटर

ब्राउज़र में चरण-दर-चरण

  1. Picasso IA पर Gemini 3.1 Flash TTS पेज खोलें।
  2. अपनी स्क्रिप्ट Text में पेस्ट करें। सीमा 4,000 बाइट है, जो एक छोटे एक्सप्लेनर के लिए काफ़ी है। यह बाइट गिनता है, कैरेक्टर नहीं, इसलिए जापानी या अरबी स्क्रिप्ट में अंग्रेज़ी की तुलना में कम कैरेक्टर आते हैं।
  3. एक Voice चुनें। Kore से शुरू करें, फिर दो और आज़माएँ।
  4. अपनी स्क्रिप्ट से मेल खाता Language code सेट करें, जैसे मेक्सिकन स्पेनिश के लिए es-MX।
  5. टोन और रफ़्तार बताने वाला Prompt लिखें, या तटस्थ पाठ के लिए डिफ़ॉल्ट "Say the following." रहने दें।
  6. जहाँ भावना चाहिए वहाँ [whispering] जैसे टैग जोड़ें, जनरेट दबाएँ और ऑडियो डाउनलोड करें।
  7. लंबे टुकड़ों के लिए स्क्रिप्ट को सेक्शन के हिसाब से बाँटें और बाद में फ़ाइलें जोड़ लें।

बदलने लायक सेटिंग्स

फ़ील्डडिफ़ॉल्टसुझाव
Textकोई नहीं4,000 बाइट तक। टैग कम इस्तेमाल करें
VoiceKore30 विकल्प। चुनने से पहले तीन आज़माएँ
PromptSay the following.4,000 बाइट तक। टोन, रफ़्तार और उच्चारण तय करें
Language codeen-USउसी भाषा से मेल खाएँ जिसमें स्क्रिप्ट लिखी है

💡 सपाट टेक का आम तौर पर मतलब होता है छोटा प्रॉम्प्ट। प्रॉम्प्ट को लंबा करें, स्क्रिप्ट को नहीं। बताएँ कि कौन बोल रहा है, किससे और क्यों, तो पेसिंग और ज़ोर अक्सर अपने-आप सही बैठते हैं।

इसे संगीत और ट्रांसक्रिप्ट के साथ जोड़ें

स्पीच अक्सर पूरा प्रोजेक्ट नहीं होती। बैकग्राउंड बेड के लिए Lyria 3 या Music 2.6 आज़माएँ और उसे नैरेशन के नीचे धीमे से मिक्स करें। कैप्शन के लिए ऑडियो को Gemini 3 Pro या GPT 4o Transcribe से प्रोसेस करें।

कैफ़े की मेज़ पर लैपटॉप और रिकॉर्डर के साथ इंटरव्यू ट्रांसक्राइब करती गोल चश्मे वाली एक पत्रकार

ट्रांसक्रिप्शन गुणवत्ता जाँच का काम भी करता है। जनरेट किए गए नैरेशन को ट्रांसक्राइब करें और उसे स्क्रिप्ट से मिलाएँ। गलत उच्चारण वाले प्रोडक्ट नाम और छूटे हुए शब्द टेक्स्ट के अंतर में दिख जाते हैं, उससे बहुत पहले कि कोई श्रोता शिकायत करे।

अपना पहला वॉइसओवर बनाएँ

Gemini TTS कुछ ही कामों में अपनी जगह बनाता है: प्रोडक्ट डेमो नैरेशन, पॉडकास्ट इंट्रो और ऐड रीड, आर्टिकल और न्यूज़लेटर के ऑडियो वर्ज़न, एक जैसे लहजे वाले ट्रेनिंग वीडियो, और एक स्क्रिप्ट से बने बहुभाषी ट्रैक। अगर आपके प्रोजेक्ट को कोई अलग आवाज़ चाहिए, तो इसी श्रेणी के तीन और मॉडल परखने लायक हैं: स्टूडियो क्वालिटी वॉइसओवर के लिए MiniMax Speech 2.8 HD, स्वाभाविक नैरेशन के लिए ElevenLabs V3 और जब रिस्पॉन्स की गति सबसे ज़रूरी हो, तब Inworld Realtime TTS 2। एक और सीमा जानने लायक है: API और Picasso IA पेज, दोनों 30 प्रीबिल्ट आवाज़ों के साथ काम करते हैं। अगर आपको ऐसी आवाज़ चाहिए जो आप या आपके ब्रांड जैसी लगे, तो इसके बजाय MiniMax Voice Cloning या Qwen3 TTS आज़माएँ।

खिड़की के पास बारिश वाले रीडिंग कोने में सरसों के रंग का कार्डिगन पहने ऑडियोबुक सुनती एक महिला

आवाज़ के सवाल को सुलझाने का सबसे तेज़ तरीका उसे सुनना है। अपने प्रोजेक्ट से एक पैराग्राफ़ लें, Picasso IA पर Gemini 3.1 Flash TTS खोलें और तीन आवाज़ों से रेंडर करें। एक [whispering] टैग जोड़ें, भाषा कोड बदलकर देखें कि आपकी स्क्रिप्ट दूसरे बाज़ार में कैसी सुनाई देती है, और दोनों क्लिप साथ-साथ तुलना करें। दस मिनट के भीतर आपको पता चल जाएगा कि कौन-सी आवाज़ आपकी है, और जब भी प्रोजेक्ट बड़ा हो, उसी वर्कफ़्लो को Picasso IA पर म्यूज़िक और ट्रांसक्रिप्शन मॉडल के साथ आज़मा सकते हैं।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख