ElevenLabs ने 28 सितंबर, 2026 को Eleven v4 और v4 Turbo लॉन्च किए। यह लेख 90+ भाषाएँ, स्टैक किए जा सकने वाले ऑडियो टैग, 10 सेकंड से वॉइस क्लोनिंग, नए मॉडल ID, लेटेंसी और प्राइसिंग का विवरण देता है, और फिर दिखाता है कि PicassoIA पर आज ElevenLabs v3 से स्क्रिप्ट कैसे ड्राफ़्ट करें।
28 सितंबर, 2026 को ElevenLabs ने एक साथ दो स्पीच मॉडल जारी किए: Eleven v4 और Eleven v4 Turbo। अगर आप वॉइस फ़ीचर बनाते हैं, वीडियो नैरेट करते हैं, या पॉडकास्ट चलाते हैं, तो छोटी बात यह है: ज़्यादा भाषाएँ, स्टैक किए जा सकने वाले ऑडियो टैग, लंबी अनुरोध सीमा, और लाइव वॉइस एजेंट्स के लिए बना एक तेज़ मॉडल। विस्तृत जानकारी नीचे है, जिसमें आँकड़े, API बदलाव और आज अपनी स्क्रिप्ट का अभ्यास करने का व्यावहारिक तरीका शामिल है।
💡 सूचना: ElevenLabs API पर दो हफ़्ते का लॉन्च डिस्काउंट चला रहा है, जो 12 अक्टूबर, 2026 को समाप्त होगा। अगर आप v4 को बड़े पैमाने पर टेस्ट करने की योजना बना रहे हैं, तो यह तारीख इस पेज के किसी भी फ़ीचर से ज़्यादा मायने रखती है।
Eleven v4 असल में क्या है
ElevenLabs ने दोनों मॉडल एक ही दिन घोषित किए, और ये दोनों उसके एजेंट प्लेटफ़ॉर्म, क्रिएटिव स्टूडियो और पब्लिक API में उपलब्ध हैं। संदेश सीधा है: ऐसी वॉइस जो किसी इंसान के अभिनय जैसी लगे, न कि किसी इंसान के पढ़ने जैसी।
Eleven v4 एक्सप्रेसिव मॉडल है। जब परफ़ॉर्मेंस मायने रखती है, तब इसे चुनें: ऑडियोबुक, ट्रेलर, कैरेक्टर डायलॉग, विज्ञापन। Eleven v4 Turbo स्पीड के बदले थोड़ी रेंज छोड़ता है। यह वॉइस एजेंट्स के लिए बना है, ऐसे प्रोडक्ट के लिए जहाँ आधा सेकंड का विराम कॉल करने वाले को सोचने पर मजबूर कर दे कि कहीं लाइन तो नहीं कट गई।
दोनों Eleven v3 के बाद आते हैं, जो पहले से इनलाइन ऑडियो टैग सपोर्ट करता था। v4 यही विचार आगे ले जाता है और कमज़ोर बिंदुओं पर काम करता है: लंबी रीडिंग में वॉइस का बदलना, लगभग 70 पर रुकी भाषाओं की सूची, और Professional Voice Clones का सपोर्ट न होना।
ये आँकड़े ElevenLabs की लॉन्च पोस्ट, उसके मॉडल डॉक्यूमेंटेशन और पहले हफ़्ते की प्रेस रिपोर्ट से लिए गए हैं। जहाँ कोई आँकड़ा नहीं है, वहाँ कंपनी ने उसे प्रकाशित नहीं किया है, और मैंने अनुमान लगाने के बजाय उसे प्रकाशित नहीं के रूप में चिह्नित किया है।
ऐसी वॉइस जो एक-सी लगे
स्टैक किए जा सकने वाले ऑडियो टैग
सबसे बड़ा फ़ीचर दिशा-निर्देश देना है। आप वर्ग कोष्ठकों में इनलाइन टैग लिखते हैं, और मॉडल उन पर अमल करता है। ElevenLabs [laughs], [said angrily in French accent], [light rain] और [phone buzzing] जैसे उदाहरण देता है। ध्यान दें कि इस सूची में भावना, उच्चारण और साउंड इफ़ेक्ट, तीनों एक ही सिंटैक्स में मिले हुए हैं।
नई बात स्टैकिंग है। TechCrunch के अनुसार, अब आप कई टैग एक के बाद एक लिख सकते हैं, और मॉडल क्रम का पालन करता है और बाकी टैग गिराता नहीं। एक लाइन कुछ ऐसी दिख सकती है:
[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.
यह स्टाइल का एक उदाहरण है, डॉक्स से कॉपी किया गया वाक्य नहीं, इसलिए अपने शब्दों को खुद टेस्ट करें। छोटे, ठोस टैग आम तौर पर काव्यात्मक टैग से ज़्यादा भरोसेमंद रहते हैं।
लंबी स्क्रिप्ट में एकरूपता
अगर आपने कभी कोई चैप्टर टुकड़ों में जेनरेट किया है, तो यह समस्या आप जानते होंगे। लाइन 40 लाइन 3 से अलग नैरेटर जैसी लगती है। ElevenLabs कहता है कि v4 पूरी स्क्रिप्ट के टोन, गति और संदर्भ को पढ़ता है और वॉइस को स्थिर रखता है, भले ही आप बाद में किसी एक लाइन को दोबारा रेंडर करें।
इससे जुड़ा एक आँकड़ा भी है। The Decoder के अनुसार v4 का प्रोनन्सिएशन स्कोर 91.7 प्रतिशत है, जबकि v3 का 85.6 प्रतिशत है। यह विक्रेता का अपना आँकड़ा है, इसलिए इसे दिशा का संकेत मानें, आपकी स्क्रिप्ट के लिए वादा नहीं।
💡 टिप: लंबे प्रोडक्शन में रीटेक की योजना ज़रूरी है। पैराग्राफ़ के हिसाब से जेनरेट करें, हर पैराग्राफ़ को कैरेक्टर सीमा के अंदर रखें, और सिर्फ़ वही लाइनें दोबारा रेंडर करें जो पसंद न हों। v4 की एकरूपता इसी वर्कफ़्लो को सुरक्षित बनाने के लिए है।
90+ भाषाएँ और उच्चारण
भाषाओं की सूची लगभग 70 से बढ़कर 90 से ज़्यादा हो जाती है। TechCrunch जापानी, ब्राज़ीलियाई पुर्तगाली, मैंडरिन और कैंटोनीज़ में गुणवत्ता में साफ़ सुधार बताता है, और प्रेस रिपोर्ट में Mongolian और Odia जैसी नई समर्थित भाषाओं का ज़िक्र है।
एक बारीकी आसानी से छूट जाती है। किसी दूसरी भाषा में बोलने वाली क्लोन की गई वॉइस उस भाषा का मूल उच्चारण बनाए रखती है और टेक्स्ट आगे बढ़ने पर मूल वक्ता के उच्चारण की ओर नहीं खिसकती। ब्रांड वॉइस का स्थानीयकरण करने वालों के लिए यही फ़र्क है कि स्पेनिश रीडिंग विश्वसनीय लगे या ऐसी लगे जिसमें अमेरिकी व्यक्ति स्पेनिश शब्द बोल रहा हो।
बाहरी रैंकिंग पर, ElevenLabs कहता है कि v4 एक स्वतंत्र स्पीच लीडरबोर्ड पर नंबर एक है, जिसका Elo स्कोर लॉन्च लेखों में 1319 बताया गया है। ब्लाइंड टेस्ट में कंपनी का दावा है कि लगभग 75 प्रतिशत श्रोताओं ने v4 को प्रतिस्पर्धी मॉडलों से बेहतर पसंद किया, जबकि The Decoder प्रतिस्पर्धी के हिसाब से यह रेंज 65 से 81 प्रतिशत बताता है।
💡 ज़मीनी सच्चाई: लीडरबोर्ड छोटे टेस्ट वाक्यों का इस्तेमाल करते हैं। किसी भी मॉडल पर प्रोजेक्ट तय करने से पहले अपनी भाषा में अपनी स्क्रिप्ट चलाएँ।
वॉइस क्लोनिंग बेहतर हुई
10 सेकंड से तुरंत क्लोन
Instant Voice Clones के लिए सिर्फ़ 10 सेकंड का ऑडियो चाहिए। ElevenLabs कहता है कि नई आर्किटेक्चर से क्लोनिंग तेज़ होती है और लंबे टेक्स्ट में वॉइस की पहचान बेहतर बनी रहती है। वॉइस लाइब्रेरी भी बड़ी है: लॉन्च रिपोर्ट में 17,500 से ज़्यादा वॉइस चुनने के लिए बताई गई हैं।
उस 10 सेकंड के सैंपल की गुणवत्ता ही ज़्यादातर नतीजा तय करती है। शांत कमरे में रिकॉर्ड करें, जहाँ कोई संगीत या पंखे का शोर न हो, पूरे समय माइक्रोफ़ोन से एक ही दूरी रखें, और परफ़ॉर्म करने के बजाय अपनी सामान्य गति से बोलें। एक साफ़, सीधा-सादा सैंपल हर बार ऊर्जावान लेकिन शोर वाले सैंपल से बेहतर होता है।
Professional Clones की वापसी
v3 Professional Voice Clones का सपोर्ट नहीं करता था। v4 करता है, और यह सबसे उच्च-गुणवत्ता वाले कामों के लिए है: ऐसा नैरेटर जिसकी क्लोन की गई वॉइस सैकड़ों घंटे का ऑडियो पढ़ेगी।
हर क्लोन के लिए वॉइस के मालिक की सत्यापित सहमति ज़रूरी है। यह कोई मामूली फ़ुटनोट नहीं है। अगर आप किसी क्लाइंट के लिए कोई वॉइस क्लोन करते हैं, तो ऑडियो का एक भी सेकंड अपलोड करने से पहले लिखित अनुमति ले लें।
API डेवलपर्स के लिए क्या बदलता है
मॉडल ID और सीमाएँ
मॉडल बदलना एक फ़ील्ड का बदलाव है। ElevenLabs के डॉक्स के अनुसार रिक्वेस्ट बॉडी का ढाँचा वही रहता है और सिर्फ़ model_id बदलता है:
{
"text": "[laughs] That is not what the invoice said.",
"model_id": "eleven_v4"
}
कम लेटेंसी वाले वर्ज़न के लिए eleven_v4_turbo इस्तेमाल करें। प्रति अनुरोध सीमा 10,000 कैरेक्टर है, जिसे ElevenLabs लगभग दस मिनट के ऑडियो के बराबर बताता है, और यह eleven_v3 के लिए अनुमत 5,000 कैरेक्टर से दोगुनी है। आउटपुट MP3, WAV/PCM या µ-law में आता है, और WebSocket पर बाइडायरेक्शनल स्ट्रीमिंग सपोर्ट है, जो तब मायने रखता है जब आपका टेक्स्ट किसी लार्ज लैंग्वेज मॉडल से टोकन-दर-टोकन आ रहा हो।
पुराने मॉडल अब भी मौजूद हैं। डॉक्स के अनुसार eleven_flash_v2_5 प्रति अनुरोध 40,000 कैरेक्टर संभालता है, 32 भाषाओं में, लगभग 75 ms पर, और eleven_multilingual_v2 29 भाषाओं का सपोर्ट करता है। आप अब भी PicassoIA पर Flash v2.5 और v2 Multilingual के ज़रिए दोनों तक पहुँच सकते हैं।
लेटेंसी और स्ट्रीमिंग
यहाँ Turbo सबसे बड़ी खबर है। ElevenLabs पहली आवाज़ तक का मीडियन समय लगभग 150 ms और मीडियन इनफ़रेंस लेटेंसी लगभग 100 ms बताता है। The Decoder इसकी तुलना Cartesia Sonic 3.6 के 262 ms से करता है।
वॉइस एजेंट्स के लिए ज़्यादा दिलचस्प दावा टाइमिंग से जुड़ा है। मॉडल उसी समय ऑडियो बनाना शुरू कर सकता है जब उसके पीछे का लार्ज लैंग्वेज मॉडल अपना जवाब लिखना शुरू करे, इसलिए कॉल करने वाला बाकी जवाब लिखे जाने के दौरान ही उसे सुन लेता है।
दो सावधानियाँ। ElevenLabs ने स्टैंडर्ड v4 के लिए लेटेंसी का आँकड़ा प्रकाशित नहीं किया है, और अभी तक कोई स्वतंत्र लेटेंसी टेस्ट सामने नहीं आया है। अपने क्षेत्र से, अपने नेटवर्क ओवरहेड के साथ मापें, क्योंकि हर विक्रेता का आँकड़ा इसे बाहर रखता है।
प्राइसिंग और 12 अक्टूबर की समय-सीमा
प्रति मिलियन कैरेक्टर लिस्ट प्राइस v4 के लिए $80 और v4 Turbo के लिए $40 है। 12 अक्टूबर, 2026 तक लॉन्च ऑफ़र इन्हें घटाकर $22 और $11 कर देता है। 100,000 कैरेक्टर, यानी लगभग 100 मिनट का स्पीच, हर मामले में कितना पड़ता है, यह यहाँ है:
मॉडल
लिस्ट प्राइस
लॉन्च प्राइस
लिस्ट प्राइस पर 100,000 कैरेक्टर
लॉन्च प्राइस पर 100,000 कैरेक्टर
Eleven v4
$80 प्रति मिलियन
$22 प्रति मिलियन
$8.00
$2.20
Eleven v4 Turbo
$40 प्रति मिलियन
$11 प्रति मिलियन
$4.00
$1.10
अगर आप मूल्यांकन कर रहे हैं, तो डिस्काउंट से आप एक असली बेक-ऑफ़ सस्ते में चला सकते हैं। अगर आप किसी प्रोडक्ट का बजट बना रहे हैं, तो लिस्ट प्राइस के हिसाब से योजना बनाएँ, क्योंकि ऑफ़र खत्म होने के बाद यही कीमत चुकानी होगी।
कौन-सा काम, कौन-सा मॉडल
सही चुनाव इस पर निर्भर करता है कि ऑडियो किस काम के लिए है, इस पर नहीं कि कौन-सा मॉडल सबसे नया है।
छोटी टीमों के लिए एक व्यावहारिक बँटवारा: जब तक स्क्रिप्ट बदल रही हो, तब तक तेज़ और सस्ते मॉडल पर ड्राफ़्ट बनाएँ, और अंतिम ऑडियो एक्सप्रेसिव मॉडल पर रेंडर करें। वॉइस का काम महँगा तब होता है जब हर एडिट के बाद पूरा चैप्टर दोबारा बनाना पड़े, इसलिए पहले शब्द तय करें और प्रीमियम कैरेक्टर सबसे आख़िर में खर्च करें। अगर आपके प्रोडक्ट में दोनों ज़रूरतें मिली हों, जैसे लाइव Q&A असिस्टेंट वाला नैरेटेड कोर्स, तो लेसन के लिए v4 और असिस्टेंट के लिए Turbo इस्तेमाल कर सकते हैं, क्योंकि दोनों का रिक्वेस्ट फ़ॉर्मेट एक ही है।
3 आम गलतियाँ
एक वाक्य देखकर फ़ैसला करना। एक डेमो लाइन 40 पैराग्राफ़ के चैप्टर के बारे में कुछ साबित नहीं करती। अपनी सबसे लंबी, सबसे पेचीदा स्क्रिप्ट टेस्ट करें।
लाइव एजेंट के लिए एक्सप्रेसिव मॉडल इस्तेमाल करना। अगर कॉल करने वाला इंतज़ार कर रहा है, तो भले ही v4 थोड़ा समृद्ध लगे, Turbo ही सही टूल है।
लॉन्च प्राइस पर बजट बनाना। डिस्काउंट 12 अक्टूबर, 2026 को खत्म होता है। अपने प्रोजेक्ट की कीमत $80 और $40 प्रति मिलियन कैरेक्टर के हिसाब से तय करें।
PicassoIA पर ElevenLabs v3 कैसे इस्तेमाल करें
इस लेख के लिखे जाने के समय v4 PicassoIA कैटलॉग में नहीं है। ElevenLabs v3 है, और यह उसका सबसे करीबी रिश्तेदार है: वही परिवार, वही इनलाइन दिशा-निर्देश पढ़ने की आदत। इसलिए जब तक v4 ज़्यादा प्लेटफ़ॉर्मों तक पहुँचता है, स्क्रिप्ट ड्राफ़्ट करने और वॉइस टेस्ट करने के लिए यह अच्छी जगह है।
26 विकल्पों की सूची से एक voice चुनें। डिफ़ॉल्ट Rachel है; इसके अलावा Aria, Roger, Sarah और James भी हैं।
language code सेट करें, जैसे en, es या fr।
पहली बार स्लाइडर उनकी डिफ़ॉल्ट स्थिति पर रहने दें, फिर जेनरेट दबाएँ और सुनें।
एक बार में एक सेटिंग बदलें और फिर से जेनरेट करें। एक साथ तीन चीज़ें बदलने से कुछ पता नहीं चलता।
ज़रूरी सेटिंग्स
सेटिंग
रेंज
डिफ़ॉल्ट
क्या करती है
Speed
0.25 से 4.0
1
पूरी रीडिंग की गति
Style
0.0 से 1.0
0
डिलीवरी को न्यूट्रल से थिएट्रिकल की ओर धकेलता है
Stability
0.0 से 1.0
0.5
ऊँचा रखने पर लंबी स्क्रिप्ट में वॉइस ज़्यादा स्थिर रहती है
Similarity boost
0.0 से 1.0
0.75
आउटपुट चुनी हुई वॉइस का कितना करीब से पालन करता है
Previous text / Next text
टेक्स्ट
खाली
मॉडल को संदर्भ देता है ताकि वाक्यों के किनारों पर इंटोनेशन मेल खाए
दो आदतें समय बचाएँगी। पहली, अपने मौजूदा पैराग्राफ़ से पहले और बाद वाला पैराग्राफ़ संदर्भ फ़ील्ड में चिपकाएँ, ताकि हर जेनरेट हुआ हिस्सा अपने पड़ोसियों से साफ़ जुड़े। दूसरी, प्रॉम्प्ट में [whispers] जैसे कोष्ठक वाले टैग आज़माएँ और सुनें कि मॉडल उन्हें कैसे संभालता है। यही दिशा-निर्देश शैली v4 की बुनियाद है, इसलिए यह अभ्यास आगे भी काम आएगा।
वॉइस मॉडल शायद ही कभी अकेले काम करता है। जिन प्रोजेक्ट्स में नैरेशन चाहिए, उन्हें अक्सर म्यूज़िक बेड, ट्रांसक्रिप्ट या अनुवादित संस्करण भी चाहिए। ये तीनों PicassoIA पर उपलब्ध हैं।
ElevenLabs Music से कंपोज़ करें
ElevenLabs Music टेक्स्ट प्रॉम्प्ट को गाने में बदलता है। नैरेशन के काम के लिए इंस्ट्रुमेंटल, स्थिर और मिक्स में हल्का संगीत माँगें। मूड, टेम्पो और इंस्ट्रुमेंट सादे शब्दों में लिखें, जैसे "slow acoustic guitar, warm room, no vocals, 70 BPM." अगर तुलना करनी हो, तो Lyria 3 Pro और Music 2.6 भी उसी तरह के प्रॉम्प्ट लेते हैं।
GPT-4o या Gemini से ट्रांसक्राइब करें
नैरेशन बन जाने के बाद कैप्शन और टेक्स्ट रिकॉर्ड की ज़रूरत होती है। GPT-4o Transcribe ऑडियो को टेक्स्ट में बदलता है, और GPT-4o Mini Transcribe तेज़ ड्राफ़्ट के लिए हल्का विकल्प है। Gemini 3 Pro तीसरा रास्ता है, जो तब काम आता है जब आप देखना चाहें कि हर मॉडल नामों और संख्याओं को कैसे संभालता है।
एक उपयोगी तरकीब: जेनरेट किए गए नैरेशन को ट्रांसक्राइब करें और उसकी तुलना मूल स्क्रिप्ट से करें। कोई भी अंतर उस शब्द की ओर इशारा करता है जिस पर वॉइस अटकी, और आप स्पेलिंग में छोटे बदलाव या उच्चारण के संकेत से उसे ठीक कर सकते हैं।
वीडियो को 90+ भाषाओं में डब करें
ElevenLabs Dubbing एक तैयार वीडियो लेकर दूसरी भाषाओं में उसके संस्करण बनाता है। यह v4 की बढ़ी हुई भाषा सूची के साथ स्वाभाविक रूप से जुड़ता है, क्योंकि स्थानीयकरण ही वह जगह है जहाँ वॉइस की एकरूपता सबसे ज़्यादा काम आती है।
अब आपकी बारी, प्रयोग करें
किसी वॉइस मॉडल को परखने का सबसे अच्छा तरीका है उसे अपनी स्क्रिप्ट दें और सुनें। शुरू करने के लिए आपको स्टूडियो, बजट लाइन या एक हफ़्ते के सेटअप की ज़रूरत नहीं है।
एक दोपहर के लिए यह योजना है:
150 शब्दों की एक स्क्रिप्ट लिखें, जिसके बीच में एक भावनात्मक मोड़ हो।
उसे ElevenLabs v3 पर तीन अलग-अलग वॉइस के साथ रेंडर करें और स्टाइल स्लाइडर में एक बदलाव करें।
नतीजे को GPT-4o Transcribe से ट्रांसक्राइब करें और शब्दों को अपनी स्क्रिप्ट से मिलाएँ।
जब v4 आपके पसंदीदा प्लेटफ़ॉर्म तक पहुँचेगा, तब तक आप जान चुके होंगे कि आपकी सामग्री के लिए कौन-से टैग, वॉइस और सेटिंग्स ठीक हैं, और आप लिस्ट प्राइस के आधार पर भरोसे के साथ बजट बना सकेंगे।
Picasso IA खोलें और आज ही अपनी पहली स्क्रिप्ट आज़माएँ। एक वॉइस चुनें, एक स्टैक किया हुआ टैग जोड़ें, और सुनें कि दिशा-निर्देश से कितना फ़र्क पड़ता है।