मल्टीमॉडल AI कोई रिसर्च कॉन्सेप्ट नहीं है जो पेवॉल के पीछे बैठा हो या अगले प्रोडक्ट रिलीज़ का इंतज़ार कर रहा हो। यह पहले से आपकी जेब में है। जब आप रेस्टोरेंट के मेन्यू की फ़ोटो लेते हैं और आपका फ़ोन उसे ज़ोर से पढ़कर सुनाता है, जब आप धुंधली तस्वीर से पूछते हैं कि यह कौन-सा पौधा है, या जब कोई चैटबॉट आपका सवाल सुनकर जवाब में आपके लिए चित्र बना देता है, तब मल्टीमॉडल AI ठीक वही कर रहा होता है जिसके लिए उसे बनाया गया था। यह शब्द तकनीकी लगता है, क्योंकि यह कुछ सचमुच नए की बात करता है: ऐसा AI सिस्टम जो एक साथ एक से ज़्यादा तरह के इनपुट प्रोसेस करता है, ठीक वैसे जैसे इंसान स्वाभाविक रूप से करता है।
"मल्टीमॉडल" का असल मतलब
यह शब्द अपने हिस्सों में साफ़-साफ़ बँट जाता है। "मोडल" का मतलब इनपुट या आउटपुट का एक प्रकार है। टेक्स्ट एक मोड है। इमेज दूसरा है। ऑडियो तीसरा है। वीडियो चौथा है। मल्टीमॉडल AI सिस्टम इनमें से कई को एक साथ प्राप्त और उत्पन्न कर सकता है, किसी एक ही चैनल तक सीमित रहने के बजाय।
एक AI, कई इंद्रियाँ
इस फ़र्क को ऐसे सोचें। पुराना, सिर्फ़ टेक्स्ट वाला AI मॉडल शब्दों की एक स्ट्रिंग लेता है और शब्दों में ही जवाब देता है। मल्टीमॉडल मॉडल एक साथ फ़ोटो, वॉइस रिकॉर्डिंग और टाइप किया हुआ सवाल ले सकता है, फिर टेक्स्ट, जनरेट की गई इमेज या सिंथेसाइज़्ड स्पीच में जवाब दे सकता है। यह तीन अलग-अलग टूल्स का एक के बाद एक चलना नहीं है। यह एक ही मॉडल है जो तीनों इनपुट को एक साथ मिलाकर सोचता है।
यह फ़र्क जितना लगता है उससे ज़्यादा मायने रखता है। जब आप किसी AI हेल्थ असिस्टेंट को रैश की फ़ोटो दिखाते हैं और टाइप करते हैं "क्या यह कुछ चिंता करने वाली बात है?", तो मॉडल अलग इमेज क्लासिफ़ायर चलाकर उसका नतीजा टेक्स्ट मॉडल को नहीं सौंपता। वह उस चीज़ के करीब कुछ करता है जो डॉक्टर करता है: विज़ुअल सबूत देखना और उसी पल सवाल पढ़ना, दोनों को एक साथ तौलना।
यहाँ तक पहुँचने में इतना समय क्यों लगा
टेक्स्ट, इमेज और ऑडियो को संभालने वाला एक ही मॉडल बनाने के लिए मूल रूप से नए तरह के आर्किटेक्चर की ज़रूरत पड़ी। शुरुआती AI मॉडल एक ही तरह के डेटा पर ट्रेन होते थे, क्योंकि अलग-अलग डेटा फ़ॉर्मेट की ट्रेनिंग पाइपलाइन जोड़ना कम्प्यूटेशनल रूप से बहुत भारी था और तकनीकी रूप से हल नहीं हुआ था। सफलता ट्रांसफ़ॉर्मर-आधारित आर्किटेक्चर से आई, जिन्हें इमेज पैच और ऑडियो स्पेक्ट्रोग्राम को वैसे ही संभालने के लिए बढ़ाया जा सका जैसे वे टेक्स्ट टोकन संभालते हैं। जब यह तरीका काम कर गया, तो ट्रेनिंग डेटासेट में कई मोडैलिटी के जोड़ीदार उदाहरण शामिल होने लगे, और मॉडल उन सबके बीच तर्क करने लायक बन गए।
वह बदलाव जो आपने पहले ही नोटिस किया
अगर आपने पिछले दो सालों में कोई भी मुख्यधारा AI असिस्टेंट इस्तेमाल किया है, तो आप मल्टीमॉडल फ़ीचर्स से टकराए होंगे, भले ही आपने उन्हें पहचाना न हो।
आपका फ़ोन यह पहले से करता है
अपने फ़ोन की तीन चीज़ों पर ग़ौर करें जो तब सामान्य लगीं जब वे आईं, लेकिन एक दशक पहले सचमुच असंभव थीं:
- विज़ुअल सर्च: किसी पौधे, फ़र्नीचर या प्रोडक्ट पर कैमरा रखें और तुरंत पहचान पाएँ।
- लाइव ट्रांसलेशन: किसी विदेशी भाषा के साइनबोर्ड पर फ़ोन रखें और शब्दों को असल समय में बदलते देखें।
- संदर्भ वाले वॉइस कमांड: रसीद देखते हुए कहें "इसके बारे में मुझे याद दिलाएँ", और आपका फ़ोन "इसके" को उस रसीद के रूप में समझ लेता है।
इनमें से हर एक मल्टीमॉडल AI है: एक ऐसा सिस्टम जो विज़ुअल और मौखिक इनपुट को एक साथ पढ़कर काम का आउटपुट देता है।
जब चैटबॉट देखने लगे
ज़्यादा बड़ा बदलाव तब आया जब लार्ज लैंग्वेज मॉडल बातचीत में सीधे इमेज स्वीकार करने लगे। अचानक आप स्क्रीनशॉट चिपकाकर पूछ सकते थे "इस कोड में क्या गड़बड़ है?", या हाथ से लिखी रेसिपी की फ़ोटो लेकर उसकी कैलोरी पूछ सकते थे। चैटबॉट को आपको यह टाइप करके बताने की ज़रूरत नहीं थी कि इमेज में क्या है। वह खुद देख सकता था।
5 असली स्थितियाँ जिन्हें यह बदलता है
यहाँ सिद्धांत ठोस रूप लेता है। मल्टीमॉडल AI रोज़मर्रा के कुछ खास कामों को ऐसे बदलता है जो व्यावहारिक भी हैं और मापे जा सकने वाले भी।

बिल या लेबल पढ़ना

किसी यूटिलिटी बिल, प्रोडक्ट लेबल या इंश्योरेंस दस्तावेज़ की फ़ोटो लें। पूछें "इसका असल मतलब क्या है?" या "एक्सपायरी डेट कौन-सी है?"। मॉडल इमेज पढ़ता है, ज़रूरी सामग्री निकालता है और सीधे आपके सवाल का जवाब देता है। कुछ टाइप करने की ज़रूरत नहीं। महीन अक्षरों पर आँखें गड़ाने की ज़रूरत नहीं। कम दृष्टि वाले लोगों के लिए, या ऐसी भाषा के दस्तावेज़ों के लिए जिन्हें आप अच्छी तरह नहीं पढ़ सकते, यह एक्सेसिबिलिटी में बड़ा व्यावहारिक बदलाव है।
ऐसी चीज़ का वर्णन करना जिसका नाम आप नहीं जानते
आपने कोई टूल, पौधा, पक्षी, कपड़े का पैटर्न या पुराना हार्डवेयर देखा है। आप उसका इतना अच्छा वर्णन नहीं कर सकते कि टेक्स्ट सर्च काम कर सके। मल्टीमॉडल AI के साथ आप उसकी फ़ोटो लेते हैं और पूछते हैं "यह क्या है?"। मॉडल उसे पहचानता है, सही नाम बताता है और अक्सर यह भी समझाता है कि उसका इस्तेमाल किस काम के लिए होता है। यह उस कमी को भरता है जो टेक्स्ट-आधारित सर्च इंजनों में दशकों से रही है।
होमवर्क और समीकरण

छात्र गणित का सवाल, केमिस्ट्री का डायग्राम या हाथ से लिखा निबंध फ़ोटो में लेकर सीधे मदद माँग सकते हैं। मॉडल सवाल को ठीक वैसा देखता है जैसा वह है, न कि उसके टाइप किए हुए अनुमान को। डायग्राम वाला ज्योमेट्री प्रूफ़, हाथ से बना फ़्री-बॉडी चित्र वाला फ़िज़िक्स प्रश्न, बायोलॉजी का चार्ट: ये सब जैसे पन्ने पर हैं वैसे ही जमा किए जा सकते हैं, और मॉडल उन्हें ढीले टेक्स्ट विवरण के बजाय विज़ुअल-गणितीय वस्तुओं की तरह समझता है।
वॉइस के साथ संदर्भ
वॉइस AI सालों से मौजूद है, लेकिन उसकी एक लगातार सीमा थी: वह सिर्फ़ शब्द सुनता था, स्थिति नहीं। मल्टीमॉडल वॉइस AI वह सीमा हटाता है। आप कुछ दिखाते हुए बोल सकते हैं। फ़ोन को पैकेज की ओर करके पूछें "इसे किस तापमान पर पकाना चाहिए?"। थाली उठाकर पूछें "इसमें कितनी सर्विंग हैं?"। मॉडल आपकी बात भी सुनता है और आप जिस चीज़ की ओर इशारा कर रहे हैं वह भी एक साथ देखता है, बजाय इसके कि आपको पहले शब्दों में उसका वर्णन करना पड़े।
क्रिएटिव काम तेज़ होता है

फ़ोटोग्राफ़र, डिज़ाइनर और कलाकार मल्टीमॉडल AI का इस्तेमाल करके किसी वांछित इमेज का वर्णन करते हैं: किसी रेफ़रेंस की ओर इशारा करके कहते हैं "कुछ ऐसा, पर थोड़ा गर्म।" वे कच्चे स्केच अपलोड करके सुधार माँगते हैं। वे प्रोडक्ट की फ़ोटो दिखाकर उसके मूड से मेल खाता कैप्शन माँगते हैं। अब क्रिएटिव प्रक्रिया हर चरण पर विज़ुअल इनपुट स्वीकार करती है, न कि सिर्फ़ शाब्दिक विवरणों पर निर्भर रहती है। ये विवरण उस तस्वीर को कभी पूरी तरह नहीं पकड़ पाते जो आप मन में सोच रहे होते हैं।
इसके पीछे के मॉडल
आज उपलब्ध कई AI मॉडल पूरी तरह मल्टीमॉडल हैं, और वे इस बात में काफ़ी अलग हैं कि वे क्या स्वीकार करते हैं और इनपुट के बीच कितनी अच्छी तरह तर्क करते हैं।

| मॉडल | टेक्स्ट | इमेज | ऑडियो | इमेज आउटपुट |
|---|
| GPT-4o | हाँ | हाँ | हाँ | हाँ |
| Gemini 3 Pro | हाँ | हाँ | हाँ | नहीं |
| Claude Opus 4.7 | हाँ | हाँ | नहीं | नहीं |
| Kimi K2.5 | हाँ | हाँ | नहीं | नहीं |
| Granite Vision 3.3 2B | हाँ | हाँ | नहीं | नहीं |
GPT-4o और इमेज का मोड़
GPT-4o उन पहले व्यापक रूप से उपलब्ध मॉडलों में से था जो एक ही बातचीत में टेक्स्ट, इमेज और ऑडियो को मूल रूप से संभालता था। यह अलग-अलग विशेष मॉडलों के बीच नहीं बदलता: यह तीनों को एक ही आर्किटेक्चर से प्रोसेस करता है। इसका व्यावहारिक नतीजा यह है कि आप बोलने, टाइप करने और इमेज दिखाने के बीच बदल सकते हैं, और मॉडल तीनों में पिछली बात का सिलसिला बनाए रखता है, बिना यह भूले कि पहले क्या हुआ था।
Gemini का ऑल-इन दांव
Google का Gemini 3 Pro शुरू से ही मल्टीमॉडल मॉडल के रूप में डिज़ाइन किया गया था। उन सिस्टमों के उलट जिनमें विज़न बाद में जोड़ा गया, Gemini को टेक्स्ट, इमेज, ऑडियो और वीडियो पर एक साथ ट्रेन किया गया था। नतीजा मज़बूत क्रॉस-मोडल रीज़निंग है: यह एक छोटी वीडियो क्लिप में जो होता है उसका वर्णन कर सकता है और उस वर्णन को उसी सेशन में अपलोड किए गए दस्तावेज़ से जोड़ सकता है।
वही मॉडल ऑडियो ट्रांसक्रिप्शन के काम भी संभालता है। Gemini 3 Pro for speech-to-text कई लहजों और भाषाओं में ऑडियो को सटीक रूप से बदलता है, जो मीटिंग ट्रांसक्रिप्शन, इंटरव्यू नोट्स और एक्सेसिबिलिटी वर्कफ़्लो के लिए उपयोगी है।
Claude की विज़ुअल रीज़निंग
Anthropic के Claude Opus 4.7 और Claude 4 Sonnet टेक्स्ट के साथ इमेज स्वीकार करते हैं और विस्तृत विज़ुअल जाँच में खास तौर पर मज़बूत हैं। Claude को चार्ट दिखाकर ट्रेंड का सार माँगें। घने दस्तावेज़ का पन्ना दिखाकर मुख्य बातें पूछें। उसकी ताकत सिर्फ़ यह पहचानने में नहीं है कि इमेज में क्या है, बल्कि इस पर तर्क करने में है कि उस सामग्री का मतलब क्या निकलता है।
💡 Claude मॉडल टेबल, स्प्रेडशीट और डायग्राम जैसे संरचित विज़ुअल कंटेंट पर कई विकल्पों की तुलना में खास तौर पर अच्छा प्रदर्शन करते हैं।
Kimi और ओपन विकल्प
Moonshot AI का Kimi K2.5 टेक्स्ट और इमेज को एक साथ स्वीकार करता है और मिले-जुले इनपुट वाली बातचीत को आसानी से संभालता है। IBM का Granite Vision 3.3 2B चार्ट, टेबल और संरचित दस्तावेज़ों को विज़ुअली पढ़ने में माहिर है, जिससे यह डेटा-भारी कामों के लिए अच्छा विकल्प बनता है। दोनों PicassoIA पर उपलब्ध हैं और मुफ़्त में आज़माए जा सकते हैं।
ऑडियो: वह मोडैलिटी जो अक्सर छूट जाती है

मल्टीमॉडल AI का ऑडियो पहलू लगातार कम आँका जाता है। ज़्यादातर लोग वॉइस AI को बुनियादी स्पीच रिकग्निशन समझते हैं: वह जो आपकी बात टाइप कर देता है। यह ट्रांसक्रिप्शन है, और यह उपयोगी है। लेकिन मल्टीमॉडल ऑडियो AI इससे कहीं ज़्यादा करता है।
GPT-4o Transcribe और GPT-4o Mini Transcribe बोले गए ऑडियो को साफ़, विराम-चिह्न वाले टेक्स्ट में बदलते हैं, जिसमें स्पीकर की पहचान और अपने-आप भाषा की पहचान भी शामिल है। Granite Speech 4.1 2B छह भाषाएँ संभालता है और मामूली हार्डवेयर पर भी कुशलता से चलने के लिए डिज़ाइन किया गया है।
इन्हें पुराने स्पीच-टू-टेक्स्ट टूल्स से जो चीज़ अलग करती है, वह है संदर्भ को बनाए रखना। मॉडल समझता है कि "put it in the box" में "it" पहले बताई गई किसी चीज़ की ओर इशारा करता है। वह डोमेन-विशेष शब्दावली को पहचानता है। वह रिकॉर्ड की गई मीटिंग में एक-दूसरे पर बोलने वाले स्पीकरों को बिना बातचीत का सिलसिला टूटे संभालता है।
वॉइस को पहली श्रेणी का इनपुट मानना
कई लोगों के लिए वॉइस संवाद का सबसे स्वाभाविक तरीका है। आप खाना बना रहे होते हैं और आपके हाथ व्यस्त होते हैं। आप गाड़ी चला रहे होते हैं और जल्दी जानकारी चाहिए। आप टाइप करने के बजाय बोलना पसंद करते हैं। मल्टीमॉडल AI जो वॉइस को मुख्य इनपुट के रूप में स्वीकार करता है, न कि सीमित विकल्प के रूप में, उन स्थितियों तक इंटरफ़ेस को खोलता है जहाँ टाइप करना अव्यावहारिक है या बोलने से धीमा है।
इससे आप क्या जनरेट कर सकते हैं

मौजूदा कंटेंट को प्रोसेस करना एक क्षमता है। नया कंटेंट जनरेट करना एक अलग और उतना ही शक्तिशाली स्तर है।
विवरण से इमेज तक
किसी दृश्य, प्रोडक्ट के विचार, मूड या व्यक्ति का शब्दों में वर्णन करें, और टेक्स्ट-टू-इमेज मॉडल शून्य से एक विज़ुअल बना देता है। इन आउटपुट की गुणवत्ता और दायरे में अब फ़ोटोरियलिस्टिक पोर्ट्रेट, आर्किटेक्चरल रेंडर, इलस्ट्रेटेड दृश्य और प्रोडक्ट मॉकअप शामिल हैं, और यह सब उस लिखित विवरण से जो आप टाइप करते हैं या बोलते हैं।
विज़ुअल इनपुट के साथ एडिटिंग
एक फ़ोटो अपलोड करें और बताएँ कि क्या बदलना है। कोई चीज़ हटाएँ। बैकग्राउंड बदलें। रोशनी और टोन समायोजित करें। मॉडल कोई सामान्य फ़िल्टर नहीं लगाता: वह आपकी इमेज की सामग्री पर तर्क करता है और ऐसे बदलाव करता है जो मौजूदा कंपोज़ीशन, परिप्रेक्ष्य और रोशनी की स्थितियों का सम्मान करें।
रेफ़रेंस इमेज को शुरुआती बिंदु बनाना
सबसे व्यावहारिक रोज़मर्रा के वर्कफ़्लो में से एक है मौजूदा इमेज को क्रिएटिव संदर्भ की तरह इस्तेमाल करना। किसी कमरे की फ़ोटो लें और बताएँ कि उसे कैसे नए सिरे से सजाना है। लोगो दिखाकर उसका एक वेरिएशन बताएँ। कोई पोर्ट्रेट अपलोड करके उसे किसी दूसरी सेटिंग में रखने को कहें। मॉडल आपके इनपुट को ट्रांसक्राइब करने वाला टेक्स्ट नहीं मानता, बल्कि विज़ुअल संदर्भ मानता है जिस पर निर्माण और सुधार किया जा सकता है।
PicassoIA का मल्टीमॉडल टूल सेट

PicassoIA मल्टीमॉडल AI की पूरी रेंज को एक प्लेटफ़ॉर्म पर लाता है, इमेज जनरेशन के लिए 90 से ज़्यादा मॉडल, भाषा और विज़ुअल रीज़निंग के लिए दर्जनों विकल्प, और ऑडियो इनपुट व आउटपुट के लिए समर्पित टूल।
इमेज के साथ बातचीत और रीज़निंग के लिए Claude Opus 4.7, GPT-5 और Gemini 3 Pro जैसे मॉडल सीधे प्लेटफ़ॉर्म पर उपलब्ध हैं। ऑडियो ट्रांसक्रिप्शन के लिए GPT-4o Transcribe और Granite Speech 3.3 8B बोले गए ऑडियो को प्रोडक्शन-स्तर की गुणवत्ता में संभालते हैं।

इन सबको एक जगह रखने का मूल्य सिर्फ़ सुविधा नहीं है। असली बात मोडैलिटी को जोड़ पाने की क्षमता है: टेक्स्ट प्रॉम्प्ट से इमेज जनरेट करें, फिर उसका वर्णन करने के लिए विज़न मॉडल चलाएँ, और फिर उस वर्णन को स्पीच मॉडल में डालकर उसे ज़ोर से सुनाएँ। जिन वर्कफ़्लो के लिए पहले कई अकाउंट और हाथ से कॉपी-पेस्ट चाहिए था, वे अब एक जुड़े हुए क्रम में चलते हैं।
💡 व्यावहारिक वर्कफ़्लो: किसी पसंदीदा डिज़ाइन का स्क्रीनशॉट अपलोड करें, विज़न मॉडल से उसका लिखित वर्णन बनवाएँ, फिर उस वर्णन को टेक्स्ट-टू-इमेज मॉडल में डालकर एक वेरिएशन जनरेट करें। तीन मोडैलिटी, एक क्रिएटिव लूप, पाँच मिनट से कम में।
जहाँ मल्टीमॉडल AI कम पड़ता है

मल्टीमॉडल AI सचमुच सक्षम है, लेकिन इसकी असली सीमाएँ हैं जिन पर सीधे बात करना ज़रूरी है।
यह अब भी आत्मविश्वास से गलतियाँ करता है
सबसे लगातार समस्या आत्मविश्वास वाली गलती है। मॉडल किसी इमेज का पूरे भरोसे के साथ वर्णन कर सकता है और किसी खास संख्या, नाम या ब्यौरे पर गलत हो सकता है। वह किसी फ़ोटो में आंकड़ा गलत पढ़ सकता है, किसी व्यक्ति को गलत पहचान सकता है, या ऐसी चीज़ का ज़िक्र कर सकता है जो असल में फ़्रेम में है ही नहीं। जिन कामों में सटीकता बहुत ज़रूरी है, जिनमें मेडिकल दस्तावेज़, कानूनी अनुबंध और वित्तीय आंकड़े शामिल हैं, वहाँ मॉडल के आउटपुट को हमेशा मूल स्रोत से मिलाकर जाँचें।
इमेज की गुणवत्ता जितनी अपेक्षित है उससे ज़्यादा मायने रखती है
मल्टीमॉडल मॉडल साफ़, अच्छी रोशनी वाली, हाई-रिज़ॉल्यूशन इमेज के साथ सबसे अच्छा काम करते हैं। खराब रोशनी में, तिरछे कोण से ली गई धुंधली फ़ोटो साफ़ स्कैन या अच्छी तरह कंपोज़ की गई तस्वीर की तुलना में कम भरोसेमंद नतीजे देती है। अगर विज़न मॉडल से कमज़ोर नतीजे आ रहे हैं, तो कुछ भी बदलने से पहले मूल इमेज सुधारना लगभग हमेशा सबसे प्रभावी कदम होता है।
प्राइवेसी पर विचार करना ज़रूरी है
जब आप AI मॉडल पर कोई इमेज अपलोड करते हैं, तो आप वह इमेज किसी थर्ड-पार्टी सर्वर पर भेज रहे होते हैं। ज़्यादातर रोज़मर्रा की फ़ोटो के लिए यह ठीक है। मेडिकल रिकॉर्ड, पहचान दस्तावेज़, अनुबंध, या संवेदनशील निजी डेटा वाली किसी भी चीज़ के लिए अपलोड करने से पहले प्लेटफ़ॉर्म की डेटा हैंडलिंग नीति जाँचें। कुछ मॉडल ठीक इसी वजह से प्राइवेसी-प्रथम प्रोसेसिंग मोड देते हैं।
कुछ बनाना शुरू करें
मल्टीमॉडल AI का अच्छा इस्तेमाल करने के लिए आपको तकनीकी पृष्ठभूमि की ज़रूरत नहीं है। इसका इंटरफ़ेस डिज़ाइन से ही स्वाभाविक है: उसे कुछ दिखाएँ, बताएँ कि आपको क्या चाहिए, और देखें कि वह क्या बनाता है।
PicassoIA आपको picassoia.com/en/all-models पर मल्टीमॉडल टूल सेट की पूरी रेंज तक पहुँच देता है। 90 से ज़्यादा मॉडल के साथ टेक्स्ट से इमेज। OpenAI, Anthropic, Google, Meta और दूसरों के मॉडल के साथ विज़ुअल रीज़निंग। ऐसा ऑडियो ट्रांसक्रिप्शन जो लहजों, कई स्पीकरों और छह भाषाओं को संभालता है। टेक्स्ट-टू-स्पीच। वीडियो जनरेशन। सभी मोडैलिटी यहाँ मौजूद हैं, और हर मॉडल पर लिखा है कि वह क्या स्वीकार करता है और क्या आउटपुट देता है।
एक सरल शुरुआत करें: हाल की कोई फ़ोटो अपलोड करें और विज़न मॉडल से उसका वर्णन करवाएँ। फिर वह वर्णन टेक्स्ट-टू-इमेज मॉडल में डालें और देखें कि AI आपकी इमेज को अपनी विज़ुअल भाषा में कैसे समझता है। इमेज से टेक्स्ट और फिर इमेज तक का यह लूप PicassoIA पर दो मिनट से कम में पूरा होता है, शुरू करने में कोई खर्च नहीं होता, और यह मल्टीमॉडल AI असल में क्या है, इसके बारे में किसी भी स्पष्टीकरण से ज़्यादा बताता है।
यह तकनीक सही पल का इंतज़ार नहीं कर रही। यह पहले से काम कर रही है। सवाल बस इतना है कि आप इसे पहले किस चीज़ की ओर करते हैं।