पिछले दो सालों में कुछ बदला है, और ज़्यादातर लोगों ने उसे होते हुए नहीं देखा। AI से बनी आवाज़ों ने खुद को उजागर करना बंद कर दिया। वे उन रोबोट जैसी नहीं रहीं जो ट्रांसक्रिप्ट पढ़ते हैं, बल्कि उन इंसानों जैसी लगने लगीं जो बातचीत कर रहे होते हैं। ये परफ़ेक्ट लोग नहीं हैं, न ही ज़रूरत से ज़्यादा स्पष्ट बोलने वाले न्यूज़ एंकर, बल्कि असली लोग हैं, जिनकी बातों में लय, झिझक, गर्मजोशी और वज़न होता है। यह आर्टिकल बताता है कि ऐसा ठीक-ठीक क्यों हुआ, इसके भीतर की टेक्नोलॉजी कैसी दिखती है, और वे कौन से मॉडल हैं जो वॉइस सिंथेसिस के इतिहास में अब तक की सबसे बड़ी छलांग के लिए ज़िम्मेदार हैं।
पुरानी AI आवाज़ें गलत क्यों लगती थीं
2000 और 2010 के दशक के ज़्यादातर समय में, टेक्स्ट-टू-स्पीच सिस्टम एक सीधी धारणा पर चलते थे: बोली को फ़ोनीम में तोड़ो, उन्हें आपस में जोड़ो और फिर चला दो। समस्या जोड़ने के तरीके में थी। इंसानी बोली ध्वनि की अलग-अलग इकाइयों की एक के बाद एक लगाई गई लड़ी नहीं है। वह बहती है। अक्षर एक-दूसरे में घुल जाते हैं। एक शब्द की आखिरी ध्वनि अगले शब्द की शुरुआत को आकार देती है।
वे जोड़ जिन्होंने पोल खोल दी
शुरुआती कंकैटेनेटिव सिंथेसिस सिस्टम रिकॉर्ड की गई बोली के डेटाबेस से छोटे-छोटे ऑडियो क्लिप उठाकर उन्हें जोड़ देते थे। सुनने वाले जोड़ों को साफ़ पहचान लेते थे। शब्दों के बीच एक यांत्रिक सपाटपन होता था, और पिच में एक रोबोटिक एकरसता, जो तब कभी नहीं बदलती थी जब कोई असली इंसान उत्साहित, थका हुआ या सच में हँसता हुआ बोलता है।
पैरामीट्रिक सिंथेसिस थोड़ा ज़्यादा सुघड़ था, लेकिन उसकी अपनी समस्याएँ थीं। ये सिस्टम इंसानी वोकल ट्रैक्ट के गणितीय मॉडल से बोली बनाते थे, पर वे मॉडल बहुत सरल थे। आउटपुट चिकना तो था, लेकिन खोखला था, ऑडियो की दुनिया में वैक्स फ़िगर की तरह: रूप में इंसान जैसा पहचाना जा सकता था, पर हर बारीक बात में गलत।
श्रोताओं ने असल में क्या पकड़ा
साइकोएकॉस्टिक्स पर हुए शोध से पता चलता है कि इंसानी श्रोता प्रोसोडी के प्रति असाधारण रूप से संवेदनशील होते हैं: पिच का उठना-गिरना, विरामों का समय, और तनावग्रस्त अक्षरों का सूक्ष्म लंबा होना। शुरुआती AI आवाज़ें शब्द तो सही बोलती थीं, पर बोली के संगीत को बिगाड़ देती थीं। उनमें को-आर्टिक्युलेशन की भी कमी थी, यानी वह तरीका जिसमें मौजूदा ध्वनि पूरी होने से पहले ही आपकी जीभ और होंठ अगली ध्वनि की तैयारी शुरू कर देते हैं।

वह आर्किटेक्चर जिसने सब कुछ बदल दिया
रोबोटिक से इंसानी लगने वाली AI आवाज़ों तक का सफ़र कोई एक खोज नहीं थी। यह आर्किटेक्चर में बदलावों का एक क्रम था, और हर बदलाव ने कृत्रिमता की एक और परत हटाई।
WaveNet और न्यूरल वोकोडर का दौर
2016 में DeepMind ने WaveNet प्रकाशित किया, एक डीप न्यूरल नेटवर्क जो असली इंसानी बोली के सांख्यिकीय पैटर्न सीखकर ऑडियो को एक-एक सैंपल करके बनाता था। क्लिप जोड़ने या वोकल ट्रैक्ट के पैरामीटर परिकलित करने के बजाय, WaveNet ने सिग्नल के स्तर पर सीखा कि बोली असल में कैसी सुनाई देती है। गुणवत्ता में आई छलांग तुरंत सुनाई दी। लेकिन मूल आर्किटेक्चर रियल-टाइम उपयोगों के लिए बहुत धीमा था।
इसके बाद आए तेज़ वर्ज़न: Parallel WaveNet, WaveRNN, HiFi-GAN। हर एक ने कुछ फ़िडेलिटी के बदले रफ़्तार पाई, पर मूल सूझ को नहीं खोया: असली बोली के बड़े कॉर्पस पर प्रशिक्षित न्यूरल वोकोडर पुराने तरीकों से बनी किसी भी चीज़ से बुनियादी तौर पर ज़्यादा प्राकृतिक लगते हैं।
ट्रांसफ़ॉर्मर और अटेंशन की सफलता
दूसरा बड़ा बदलाव TTS के एकॉस्टिक मॉडलिंग हिस्से में ट्रांसफ़ॉर्मर आर्किटेक्चर को अपनाने से आया। ट्रांसफ़ॉर्मर सेल्फ़-अटेंशन मैकेनिज़्म इस्तेमाल करते हैं, जिससे मॉडल एक-एक टोकन करके प्रोसेस करने के बजाय पूरे इनपुट सीक्वेंस को एक साथ ध्यान में रख सकता है।
स्पीच सिंथेसिस के लिए इसका मतलब था कि मॉडल यह तर्क कर सकता था कि पोज़िशन 47 पर मौजूद शब्द कैसा सुनाई देना चाहिए, यह केवल आस-पास की ध्वनियों पर नहीं, बल्कि उस वाक्य की भावनात्मक दिशा पर निर्भर करता है जिसका वह हिस्सा है। नतीजा यह हुआ कि लंबी दूरी की प्रोसोडिक एकरूपता में ज़बरदस्त सुधार आया। वाक्य आपस में जुड़े हुए सुनाई देने लगे।

किसी आवाज़ को इंसानी क्या बनाता है
टेक्नोलॉजी को समझना एक बात है। लेकिन मॉडल असल में किसे दोहराने की कोशिश कर रहा है? कौन सी खास विशेषताएँ किसी आवाज़ को नकली के बजाय असली सुनाई देने देती हैं?
प्रोसोडी: बोली के भीतर का संगीत
प्रोसोडी तनाव, लय और इंटोनेशन के उन पैटर्न को कहते हैं जो शब्दों से परे अर्थ ढोते हैं। जब कोई "अरे, सच में?" को सपाट इंटोनेशन में कहता है, तो वह शिष्ट स्वीकृति का संकेत देता है। जब वही बात ऊपर उठती पिच और पहले एक विराम के साथ कहता है, तो वह सच्चे आश्चर्य का संकेत देता है। "सच में" शब्द नहीं बदला, पर उसका अर्थ पूरी तरह बदल गया।
आधुनिक TTS मॉडल भावनात्मक रूप से विविध बोली के विशाल कॉर्पस पर प्रशिक्षित होते हैं, अक्सर ऐसी एनोटेशन लेयर्स के साथ जो प्रोसोडिक विशेषताओं को साफ़-साफ़ लेबल करती हैं। इससे वे अर्थ, संदर्भ और डिलीवरी के बीच के रिश्ते को मॉडल कर पाते हैं।
साँस, विराम और अप्रत्याशित
असली बोलने वाले साँस लेते हैं। वे कभी-कभी किसी शब्द पर लड़खड़ाते हैं। किसी चौंकाने वाली बात से पहले रुकते हैं। तेज़ बोलते समय स्वर छोटे कर देते हैं और ज़ोर देते समय खींचते हैं। ElevenLabs V3 जैसे आधुनिक मॉडल खास तौर पर इन सूक्ष्म बदलावों को दोहराने के लिए प्रशिक्षित हैं, क्योंकि इनकी अनुपस्थिति ही पुरानी AI आवाज़ों को गलत महसूस कराती थी।
💡 बोली की अनकैनी वैली गलतियों के बारे में नहीं है। यह उन सूक्ष्म अपूर्णताओं की अनुपस्थिति के बारे में है जो प्रामाणिकता का संकेत देती हैं।
भावना और इरादा
वॉइस मॉडल की सबसे नई पीढ़ी इससे भी आगे जाती है: वे वक्ता के इरादे को मॉडल करने की कोशिश करते हैं। सिर्फ़ यह नहीं कि वक्ता क्या कह रहा है, बल्कि क्यों, और किस आंतरिक स्थिति में। Minimax Speech 2.8 HD जैसे मॉडल लंबे पैसेज में ऐसी नैरेशन दे सकते हैं जिसका भावनात्मक वज़न बदलता रहता है: कोमल पलों में नरम और नाटकीय पलों में कसा हुआ, बिना इसके लिए खास निर्देश दिए।

अभी नया मानक तय करने वाले मॉडल
यह क्षेत्र काफ़ी प्रतिस्पर्धी हो गया है। पिछले 12 महीनों में जारी हुए कई मॉडलों ने न्यूरल वॉइस सिंथेसिस में संभव की सीमा को आगे बढ़ाया है।
ElevenLabs V3 और V2 Multilingual
ElevenLabs V3 इस समय उपलब्ध सबसे अभिव्यंजक सामान्य-उद्देश्य TTS मॉडलों में से एक है। यह भावनात्मक बोली को उल्लेखनीय सटीकता से संभालता है और ऐसा ऑडियो बनाता है जो ज़्यादातर सामान्य श्रवण परीक्षणों में इंसानी लगता है। इसकी ताकत बारीक डिलीवरी में है: मॉडल सिर्फ़ टेक्स्ट नहीं पढ़ता, बल्कि उसकी व्याख्या भी करता है।
ElevenLabs V2 Multilingual उस क्षमता को 30+ भाषाओं तक ले जाता है, और गैर-अंग्रेज़ी टेक्स्ट के लिए भी उच्चारण की प्रामाणिकता और प्रोसोडिक स्वाभाविकता बनाए रखता है। ग्लोबल कंटेंट प्रोडक्शन के लिए यह एक महत्वपूर्ण क्षमता है।
ElevenLabs Flash v2.5 कुछ अभिव्यंजकता के बदले रफ़्तार देता है, जिससे यह उन रियल-टाइम उपयोगों के लिए व्यावहारिक विकल्प बन जाता है जहाँ लेटेंसी बारीकी से ज़्यादा मायने रखती है।
Minimax Speech 2.8 HD और Turbo
Minimax Speech 2.8 HD प्रोफ़ेशनल ऑडियो प्रोडक्शन को निशाना बनाता है। इसके आउटपुट में ऐसी गहराई और गर्मजोशी है जिसे ऑडियो इंजीनियर मिक्स में अच्छी तरह बैठने वाली बताते हैं। यह लंबी नैरेशन को उन थकान वाले आर्टिफ़ैक्ट के बिना संभालता है जो कुछ मॉडलों को परेशान करते हैं। Speech 2.8 Turbo कम गुणवत्ता हानि के साथ तेज़ चलता है, और हाई-वॉल्यूम कंटेंट पाइपलाइन के लिए उपयुक्त है।
Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS 30 अलग-अलग आवाज़ें और 70 से ज़्यादा भाषाओं का समर्थन लाता है। Google के लैंग्वेज मॉडलिंग इंफ़्रास्ट्रक्चर के साथ इसके एकीकरण से इसमें असामान्य रूप से मज़बूत कॉन्टेक्स्ट जागरूकता है। यह जटिल वाक्य संरचनाओं को पार्स कर सकता है और ऐसी डिलीवरी दे सकता है जो कही जा रही बात के अर्थगत वज़न को दर्शाती है।
Qwen3 TTS और वॉइस डिज़ाइन
Qwen3 TTS एक अलग क्षमता लाता है: किसी भी आवाज़ की क्लोनिंग करने या शुरू से कस्टम आवाज़ डिज़ाइन करने की योग्यता। इससे ऐसे उपयोग खुलते हैं जो नैरेशन से आगे बढ़कर पहचान और पर्सनलाइज़ेशन तक जाते हैं।
वॉइस क्लोनिंग असल में कैसे काम करती है
वॉइस क्लोनिंग वह जगह है जहाँ टेक्नोलॉजी सच में अजीब लगने लगती है। किसी असली इंसान के बोलने का एक छोटा ऑडियो नमूना लेकर उसके टिम्बर, लहजे और लय से मेल खाता सिंथेटिक संस्करण बनाने की क्षमता दरवाज़े खोलने जितनी तेज़ी से सवाल भी खड़े करती है।

रेफ़रेंस ऑडियो और स्पीकर कंडीशनिंग
आधुनिक वॉइस क्लोनिंग स्पीकर कंडीशनिंग के ज़रिए काम करती है: मॉडल एक रेफ़रेंस ऑडियो क्लिप लेता है, एक स्पीकर एम्बेडिंग (वोकल पहचान का एक गणितीय प्रतिनिधित्व) निकालता है, और उस एम्बेडिंग से सिंथेसिस प्रक्रिया को बाँधता है। मॉडल जो कुछ भी बनाता है, वह रेफ़रेंस वक्ता की विशेषताओं से रंगा होता है।
Minimax Voice Cloning इस प्रक्रिया को अपेक्षाकृत छोटे रेफ़रेंस नमूने से संभालता है, आम तौर पर 10 से 30 सेकंड का, और ऐसा आउटपुट देता है जो लक्ष्य आवाज़ की मूल फ़्रीक्वेंसी, फ़ॉर्मेंट संरचना और बोलने की लय को पकड़ता है।
Resemble AI Chatterbox इमोशन कंट्रोल जोड़ता है, जिससे आप सिर्फ़ आवाज़ की पहचान ही नहीं, बल्कि क्लोन के आउटपुट का भावनात्मक स्वर भी बदल सकते हैं, शांत और नपे-तुले से लेकर उत्साहित और तत्काल जैसे स्वर तक।
क्या दोहराया जा सकता है और क्या नहीं
मौजूदा मॉडल टिम्बर, पिच रेंज, लहजा और लय को उच्च फ़िडेलिटी के साथ दोहरा सकते हैं। जिस चीज़ से वे अभी भी जूझते हैं, वह है पैराभाषिक संकेतों का पूरा सेट जो सामाजिक अर्थ रखते हैं: घबराई हुई हँसी की सटीक गुणवत्ता, किसी क्षेत्रीय लहजे में व्यंग्य का खास लय-पैटर्न, और वे सूक्ष्म समय-बदलाव जो वक्ता की उम्र और सेहत का संकेत देते हैं।
Chatterbox Pro और PlayHT Play Dialog उन बची हुई सीमाओं को सबसे ज़ोर से चुनौती देने वाले मॉडलों में हैं, खासकर बातचीत और डायलॉग वाले उपयोगों के लिए।
AI आवाज़ें पहले से कहाँ काम संभाल रही हैं
न्यूरल TTS की तैनाती ज़्यादातर लोगों की सोच से कहीं ज़्यादा व्यापक है। AI आवाज़ों के साथ कई बातचीत किसी का ध्यान नहीं खींचतीं, क्योंकि टेक्नोलॉजी अब इतनी अच्छी हो गई है कि खुद को उजागर नहीं करती।

पॉडकास्ट, ऑडियोबुक और बड़े पैमाने पर कंटेंट
स्वतंत्र पॉडकास्टर और ऑडियोबुक प्रोड्यूसर TTS का उपयोग ऐसी रफ़्तार और लागत पर कंटेंट बनाने के लिए कर रहे हैं जो पहले उपलब्ध नहीं थी। जो नैरेटर पहले 4 घंटे की ऑडियोबुक रिकॉर्ड करने में 8 घंटे लगाता था, वह अब कुछ मिनटों में पूरा ड्राफ़्ट बना सकता है और बचे हुए समय को एडिटिंग और प्रोडक्शन में लगा सकता है।
ElevenLabs V2 Multilingual जैसे मॉडल उसी ऑडियोबुक को एक साथ 10 भाषाओं में लोकलाइज़ करना व्यावहारिक बनाते हैं, और सभी संस्करणों में मूल नैरेटर की वॉइस विशेषताएँ बनाए रखते हैं।
कस्टमर सपोर्ट और एंटरप्राइज़ ऑटोमेशन
कॉन्टैक्ट सेंटर न्यूरल TTS के शुरुआती अपनाने वालों में रहे हैं। पुराने, अटपटे IVR सिस्टम से ऐसे वॉइस एजेंट तक का बदलाव जो धैर्यवान और मददगार इंसानों जैसे लगते हैं, कॉलर की झुंझलाहट को उल्लेखनीय रूप से कम कर चुका है। Turbo v2.5 और TTS 1.5 Max इनमें से कई सिस्टम को शक्ति देते हैं, और रियल-टाइम इंटरैक्शन के लिए रफ़्तार और स्वाभाविकता में संतुलन बनाते हैं।
एक्सेसिबिलिटी
दृष्टिबाधित लोगों या पढ़ने में कठिनाई वाले लोगों के लिए, उच्च-गुणवत्ता वाला TTS कोई सुविधा मात्र नहीं है। यह जानकारी तक पहुँच है। आवाज़ की गुणवत्ता में आया सुधार गरिमा पर सीधा असर डालता है: किसी ऐसी आवाज़ से पढ़कर सुनाया जाना जो मौजूद और इंसानी लगती है, किसी मशीन से पढ़कर सुनाए जाने से बिल्कुल अलग अनुभव है।
PicassoIA पर अपनी AI आवाज़ कैसे बनाएँ
PicassoIA आपको API की जटिलता और सेटअप की झंझट के बिना उपलब्ध सबसे सक्षम टेक्स्ट-टू-स्पीच मॉडलों तक सीधी पहुँच देता है। यहाँ बताया गया है कि कम समय में प्रोफ़ेशनल परिणाम कैसे पाएँ।

ElevenLabs V3 के साथ चरण-दर-चरण
- PicassoIA पर ElevenLabs V3 पर जाएँ।
- अपना टेक्स्ट इनपुट फ़ील्ड में पेस्ट करें। विराम चिह्नों के साथ स्वाभाविक वाक्य लिखें, क्योंकि कॉमा और पूर्ण विराम सीधे गति को प्रभावित करते हैं।
- उपलब्ध प्रीसेट में से कोई आवाज़ चुनें, या वॉइस क्लोनिंग के लिए रेफ़रेंस ऑडियो क्लिप अपलोड करें।
- ज़्यादा अभिव्यंजक, विविध आउटपुट के लिए स्टेबिलिटी पैरामीटर कम रखें। लगातार, नियंत्रित डिलीवरी के लिए इसे ज़्यादा रखें।
- अगर आप चाहते हैं कि आउटपुट क्लोन की गई आवाज़ से करीब से मेल खाए, तो सिमिलैरिटी बूस्ट ऊँचा रखें।
- जनरेट करें और सुनें। आउटपुट को WAV या MP3 के रूप में डाउनलोड करें।
सबसे अच्छे परिणामों के लिए टिप्स
- विराम चिह्न डिलीवरी को आकार देते हैं। एलिप्सिस कॉमा से लंबा विराम बनाता है। प्रश्नवाचक चिह्न वाक्य की अंतिम पिच बदल देता है। इन्हें सोच-समझकर इस्तेमाल करें।
- छोटे खंड ज़्यादा स्वाभाविक लगते हैं। मॉडल को देने से पहले लंबे पैराग्राफ़ को छोटे वाक्यों में तोड़ने से आम तौर पर बेहतर प्रोसोडिक प्रवाह मिलता है।
- टेक्स्ट में भावनात्मक संदर्भ मायने रखता है। ElevenLabs V3 जैसे मॉडल लिखे गए टेक्स्ट के अर्थगत कंटेंट पर प्रतिक्रिया देते हैं। भावना वाले संवाद लिखने से बिना अतिरिक्त कॉन्फ़िगरेशन के अधिक उपयुक्त भावनात्मक डिलीवरी मिलेगी।
- मल्टीलिंगुअल आउटपुट के लिए, Gemini 3.1 Flash TTS तब बेहतर काम करता है जब टेक्स्ट प्रॉम्प्ट के बीच में अनुवाद किए जाने के बजाय सीधे लक्ष्य भाषा में हो।
💡 सबसे अच्छा TTS आउटपुट टाइपिस्ट की तरह नहीं, वॉइस डायरेक्टर की तरह सोचने से आता है। जिस तरह आप टेक्स्ट लिखते हैं, वह उसे पढ़ने वाले मॉडल को चुनने जितना ही अहम है।
अभी भी क्या परफ़ेक्ट नहीं है
यह कहना बेईमानी होगी कि न्यूरल TTS ने सब कुछ हल कर लिया है। अभी भी ऐसे कोने हैं जहाँ टेक्नोलॉजी अपनी असलियत उजागर कर देती है।

वे एज केस जो अब भी मॉडलों को उलझा देते हैं
असामान्य विशेष संज्ञाओं या संक्षेपों वाले लंबे, अत्यधिक तकनीकी पैसेज अब भी मॉडलों में अलग-अलग उच्चारण पैदा करते हैं। हास्य को विश्वसनीय ढंग से देना जगज़ाहिर तौर पर कठिन है, क्योंकि कॉमेडी की टाइमिंग के लिए ऐसा बेहद सटीक सूक्ष्म-समय चाहिए जिस पर ज़्यादातर मॉडल अभी पूरी तरह नियंत्रण नहीं रखते। व्यंग्य, जो इंसानी बोली में प्रोसोडिक विशेषताओं के एक बहुत खास मेल से संकेतित होता है, अब भी एक वास्तविक चुनौती बना हुआ है।
PlayHT Play Dialog बातचीत वाले कंटेंट के लिए खास तौर पर डिज़ाइन किया गया है और नैरेशन के लिए अनुकूलित मॉडलों से बेहतर मल्टी-टर्न डायलॉग संभालता है, पर लंबे संवादों के अंत में वह भी कभी-कभी भावनात्मक उतार-चढ़ाव को सपाट कर देता है।
एक और लगातार समस्या है लंबे दस्तावेज़ों में एकरूपता। 30 मिनट की ऑडियो फ़ाइल बनाने वाला मॉडल शुरुआत और अंत के बीच आवाज़ के व्यवहार में थोड़ा भटक सकता है। Minimax Speech 2.8 HD इसे ज़्यादातर मॉडलों से बेहतर संभालता है, पर यह आर्किटेक्चर की एक ज्ञात सीमा बनी हुई है।
यह अब भी क्यों मायने रखता है
इन सीमाओं के बावजूद, "साफ़ तौर पर सिंथेटिक" और "शायद इंसानी" के बीच का फ़ासला इतना नाटकीय रूप से सिकुड़ गया है कि अब अपवाद ही सबसे उन्नत स्तर को परिभाषित करते हैं, न कि आधार रेखा। एक साल पहले स्वाभाविकता ही उपलब्धि थी। आज बात भावनात्मक सटीकता और शैलीगत नियंत्रण की हो रही है।
खुद आज़माएँ
न्यूरल TTS के बारे में पढ़ने और उसे वास्तव में सुनने के बीच का फ़ासला बहुत बड़ा है। प्रोसोडिक मॉडलिंग या अटेंशन मैकेनिज़्म का कोई वर्णन इस बात को नहीं बता सकता कि जब कोई मॉडल दुखद पैसेज पढ़ता है और आवाज़ सच में थोड़ी उदास लगती है, तो वह कैसा सुनाई देता है।

PicassoIA आपको इस आर्टिकल में चर्चा किए गए मॉडलों की पूरी रेंज तक तुरंत पहुँच देता है। आप एक ही पैराग्राफ़ पर ElevenLabs V3 और Minimax Speech 2.8 HD को चलाकर फ़र्क सीधे सुन सकते हैं। आप Qwen3 TTS से किसी आवाज़ को क्लोन कर सकते हैं, कई भाषाओं में Gemini 3.1 Flash TTS को परख सकते हैं, या Chatterbox Pro के साथ पूरा नैरेट किया गया ऑडियो पीस बना सकते हैं।
टेक्नोलॉजी ने एक अहम सीमा पार कर ली है। आगे क्या होगा, यह इस पर निर्भर करेगा कि लोग इसके साथ असल में क्या करते हैं।

ऐसे टेक्स्ट से शुरू करें जो आपके लिए मायने रखता हो। टोन के अनुकूल आवाज़ चुनें। नतीजा सुनें। सिर्फ़ इसी तरीके से पता चलेगा कि टेक्नोलॉजी असल में अभी कहाँ है।