AI-जनरेटेड इमेज में टेक्स्ट सालों से गड़बड़ रहा है। आप एक सुंदर प्रॉम्प्ट लिखते हैं, जनरेट दबाते हैं, और आपका साइनबोर्ड "CAFFE LATTTE" पढ़ता है या आपकी पोस्टर हेडलाइन अक्षरों की उलझी हुई, उल्टी-सीधी खिचड़ी बन जाती है जिसका कोई मतलब नहीं निकलता। अगर आप AI आर्ट टूल्स का इस्तेमाल अमूर्त बैकग्राउंड से आगे किसी काम के लिए कर रहे हैं, तो इस समस्या ने आपका समय, दोबारा बनाने की मेहनत और सिरदर्द बढ़ाए हैं।
यहीं Ideogram और ChatGPT के बीच बहस गंभीर हो जाती है। दोनों टूल दावा करते हैं कि वे इमेज में टेक्स्ट को बाकियों से बेहतर संभालते हैं, लेकिन वे वहाँ पहुँचने के लिए बिल्कुल अलग रास्ते लेते हैं। एक स्टैंडअलोन इमेज जनरेटर है जो खास तौर पर टाइपोग्राफी पर केंद्रित है। दूसरा दुनिया का सबसे लोकप्रिय AI असिस्टेंट है, जिसमें एक इमेज इंजन जोड़ा गया है। यह तुलना बताती है कि जब पढ़ने लायक टेक्स्ट आपकी प्राथमिकता हो, तो हर एक असल में क्या देता है।
AI इमेज में टेक्स्ट इतनी बड़ी समस्या क्यों है
डिफ्यूजन मॉडल अक्षरों को कैसे देखते हैं
Stable Diffusion, Midjourney और ज़्यादातर ओपन-सोर्स टेक्स्ट-टू-इमेज सिस्टम सहित स्टैंडर्ड डिफ्यूजन मॉडल कभी टाइपोग्राफी रेंडर करने के लिए डिज़ाइन ही नहीं किए गए थे। इन्हें अरबों ऐसी इमेज पर ट्रेन किया गया जिनमें टेक्स्ट संयोग से दिखता था। नतीजतन, उन्होंने टेक्स्ट कैसा दिखता है, यह दृश्य रूप से अनुमानित करना सीख लिया, बिना अक्षरों के असली आकार और उनके नियमों को एन्कोड किए।
जब आप इनमें से किसी मॉडल से "OPEN" लिखा साइन बनाने को कहते हैं, तो वह ट्रेनिंग डेटा के सांख्यिकीय पैटर्न के आधार पर ऐसे पिक्सल बनाता है जो धुंधले तौर पर अक्षरों जैसे लगते हैं। कभी-कभी यह काम कर जाता है। ज़्यादातर बार आपको कुछ ऐसा मिलता है जो दूर से अक्षरों जैसा दिखता है, पर हर अक्षर को करीब से देखते ही बिखर जाता है।

शब्दों के साथ हैलुसिनेशन की समस्या
वही हैलुसिनेशन प्रवृत्ति जिसकी वजह से लार्ज लैंग्वेज मॉडल फ़र्ज़ी उद्धरण गढ़ देते हैं, विज़ुअल मॉडल और टेक्स्ट पर भी लागू होती है। जिस मॉडल में वर्णमाला की कोई पक्की समझ नहीं होती, वह अक्षरों को सजावटी आकार मान लेता है। वह उन्हें आसपास की इमेज की शैली में फिट करने के लिए मिलाता, उल्टा करता और बदलता है। नतीजा पहली नज़र में विश्वसनीय लगता है, लेकिन करीब से देखने पर वह व्यावहारिक रूप से अपठनीय होता है।
यह कोई सीधा समाधान नहीं है। इसे हल करने के लिए ऐसे डेटासेट पर ट्रेनिंग चाहिए जहाँ टेक्स्ट साफ़ तौर पर लेबल किया गया हो, और जहाँ मॉडल यह सीखे कि शैली चाहे जो हो, अक्षरों के आकार तय रहते हैं।
Ideogram असल में क्या करता है
Ideogram 2023 में एक खास दावे के साथ लॉन्च हुआ: यह जनरेट की गई इमेज के अंदर पढ़ने लायक टेक्स्ट डाल सकता है। इस एक फ़ीचर ने इसे डिज़ाइनरों, मार्केटर्स और सोशल मीडिया क्रिएटर्स के बीच तुरंत लोकप्रिय बना दिया, जिन्हें Photoshop पर स्विच किए बिना पोस्टर टेक्स्ट, लोगो मॉकअप या ब्रांडेड विज़ुअल चाहिए थे।
टाइपोग्राफी एक प्रमुख फ़ीचर के रूप में
Ideogram में मुख्य अंतर आर्किटेक्चर का है। मॉडल को इमेज-टेक्स्ट जोड़ों पर ट्रेन किया गया जहाँ टाइपोग्राफिक कंटेंट को सुरक्षित रखा गया और एक अलग तत्व के रूप में लेबल किया गया। अक्षरों को मनमाने आकार मानने के बजाय, मॉडल ने यह सीखा है कि खास अक्षर-क्रम सटीकता से रेंडर होने चाहिए।
व्यवहार में, आप अपने प्रॉम्प्ट में उद्धरण चिह्नों के भीतर टेक्स्ट डाल सकते हैं और Ideogram उन्हीं शब्दों को इमेज में रखने की कोशिश करेगा। छोटे वाक्यांशों (दो से पाँच शब्द) पर सफलता दर उल्लेखनीय रूप से ऊँची है। लंबी स्ट्रिंग कम भरोसेमंद हो जाती हैं, लेकिन तब भी गलतियाँ आम तौर पर पूरी तरह उलझने के बजाय बारीक स्पेलिंग की गलतियाँ होती हैं।

Ideogram के टेक्स्ट कंट्रोल विकल्प
Ideogram टेक्स्ट कैसे दिखता है, यह नियंत्रित करने के लिए उपयोगकर्ताओं को कई विकल्प देता है:
- फ़ॉन्ट स्टाइल का विवरण: आप "बोल्ड sans-serif", "एलिगेंट स्क्रिप्ट" या "हाथ से पेंट किए अक्षर" बता सकते हैं और मॉडल उन स्टाइल गुणों को रेंडर किए गए टेक्स्ट पर लागू करता है।
- रंग और कंट्रास्ट: सफ़ेद टेक्स्ट को गहरे बैकग्राउंड पर या रंगीन अक्षर भराव के लिए प्रॉम्प्ट करने से लगातार नतीजे मिलते हैं।
- टेक्स्ट प्लेसमेंट: यह पिक्सल-सटीक नहीं है, फिर भी आप टेक्स्ट को ऊपरी तिहाई, बीच में या कंपोज़िशन के नीचे रखने को कह सकते हैं और Ideogram आम तौर पर उस इरादे का सम्मान करता है।
- मैजिक प्रॉम्प्ट: एक वैकल्पिक प्रॉम्प्ट-एन्हांसमेंट लेयर जो आपके छोटे विवरण को अपने-आप एक विस्तृत, टेक्स्ट-अवेयर प्रॉम्प्ट में बदल देती है।
कमज़ोरी यह है कि टाइपोग्राफी के अलावा Ideogram की समग्र इमेज क्वालिटी फ़ोटोरियलिस्टिक जेनरेटरों के मौजूदा शीर्ष स्तर से थोड़ी नीचे है। ऐसे डिज़ाइन के लिए जहाँ गैर-टेक्स्ट तत्वों का लुक शब्दों जितना ही मायने रखता है, यह समझौता असली चिंता का विषय बन जाता है।
ChatGPT और इमेज में टेक्स्ट
ChatGPT की इमेज जनरेशन DALL-E 3 पर चलती है, जिसे बाद में GPT-4o की नेटिव इमेज जनरेशन और GPT Image 2 मॉडल के साथ अपडेट किया गया। OpenAI ने DALL-E 2 के बाद से टेक्स्ट सटीकता में काफ़ी निवेश किया है, जो शब्द रेंडर करने में बदनाम रूप से खराब था।
GPT-4o इमेज जनरेशन और टेक्स्ट
ChatGPT के नए इमेज इंजन की जनरेशन पाइपलाइन एक पूरी तरह अलग तरीके से काम करती है, जो शुद्ध डिफ्यूजन मॉडल से अलग है। GPT-4o आपके टेक्स्ट प्रॉम्प्ट को पूरी भाषा समझ के साथ प्रोसेस करता है और फिर उसे इमेज सिंथेसिस लेयर को भेजता है। इसका मतलब है कि जब आप शामिल करने वाला सटीक टेक्स्ट बताते हैं, तो भाषा मॉडल वाला हिस्सा सटीक अक्षर-क्रम को एन्कोड कर सकता है, जिससे इमेज सिंथेसिस चरण को एक साफ़ लक्ष्य मिलता है।
यह Midjourney या बेस Stable Diffusion से साफ़ तौर पर बेहतर नतीजा देता है, खास तौर पर इनके लिए:
- छोटे टेक्स्ट लेबल (साइनबोर्ड, बटन, नेम बैज)
- पोस्टर या विज्ञापनों पर हेडलाइन-स्टाइल टेक्स्ट
- प्रोडक्ट मॉकअप में शामिल टेक्स्ट
ChatGPT इंटरफ़ेस बार-बार सुधार की सुविधा भी देता है। आप एक इमेज जनरेट कर सकते हैं, फिर कह सकते हैं "साइन का शब्द नीला और बोल्ड होना चाहिए", और मॉडल सिर्फ़ वह तत्व बदलेगा और दृश्य को वैसा ही रखेगा।

ChatGPT फ़ॉन्ट प्रॉम्प्ट कैसे संभालता है
जहाँ ChatGPT फ़िलहाल Ideogram से पीछे है, वह है बारीक टाइपोग्राफिक नियंत्रण। जब आप "Art Deco letterforms" या "distressed stamp typeface" माँगते हैं, तो ChatGPT एक उचित अनुमान बनाता है, लेकिन स्टाइलिंग कम सटीक होती है। Ideogram की टाइपोग्राफी-विशिष्ट ट्रेनिंग उसे फ़ॉन्ट के चरित्र के लिए ज़्यादा समृद्ध शब्दावली देती है।
ChatGPT कभी-कभी हैलुसिनेटेड टेक्स्ट भी डाल देता है, खास तौर पर जब दृश्य में कोई बैकग्राउंड तत्व हो जहाँ आमतौर पर टेक्स्ट होता (जैसे बैकग्राउंड में किताब का कवर या स्ट्रीट साइन)। भले ही आपने उन तत्वों पर टेक्स्ट नहीं माँगा हो, मॉडल उन्हें कुछ विश्वसनीय लगने वाले टेक्स्ट से भरने की कोशिश कर सकता है, और वह अक्सर गड़बड़ होता है।
💡 त्वरित टिप: ChatGPT में साफ़-साफ़ "कोई बैकग्राउंड टेक्स्ट नहीं" या "बैकग्राउंड में खाली साइनबोर्ड" लिखने से अनचाहे टेक्स्ट हैलुसिनेशन काफ़ी घट जाते हैं।
सीधी तुलना: 6 असली उपयोग के मामले
| उपयोग का मामला | Ideogram | ChatGPT (GPT-4o) | विजेता |
|---|
| पोस्टर हेडलाइन (5 शब्द) | उच्च सटीकता | अच्छी सटीकता | Ideogram |
| एक-शब्द लोगो टेक्स्ट | उत्कृष्ट | उत्कृष्ट | टाई |
| पैराग्राफ़ का मुख्य टेक्स्ट | 2-3 लाइनों के बाद विफल | 2-3 लाइनों के बाद विफल | टाई |
| फ़ॉन्ट स्टाइल मिलान | मज़बूत, विशिष्ट | मध्यम, सामान्य | Ideogram |
| बार-बार टेक्स्ट एडिटिंग | सीमित | बातचीत वाले संशोधन | ChatGPT |
| फ़ोटोरियलिस्टिक दृश्य की क्वालिटी | अच्छी | उत्कृष्ट | ChatGPT |
| प्रति जनरेशन की गति | तेज़ | मध्यम | Ideogram |
| फ़्री टियर उपलब्धता | हाँ (सीमित) | हाँ (सीमित) | टाई |
कोई भी टूल मल्टी-वर्ड टेक्स्ट पर 100% सटीकता नहीं देता, लेकिन दोनों बाकी प्रतिस्पर्धियों से काफ़ी आगे हैं।। ऊपर की तालिका उन पैटर्न को दिखाती है जो उन डिज़ाइनरों और कंटेंट क्रिएटर्स ने लगातार बताए हैं जो असली प्रोडक्शन वर्कफ़्लो में दोनों टूल इस्तेमाल करते हैं।

हर टूल कहाँ कम पड़ता है
Ideogram की सीमाएँ
Ideogram की टेक्स्ट सटीकता के साथ कुछ समझौते आते हैं, जो आपके वर्कफ़्लो पर निर्भर करते हैं:
- स्टैंडअलोन टूल: यह किसी बड़े असिस्टेंट से जुड़ा नहीं है। ChatGPT की तरह आप इमेज के बारे में बातचीत नहीं कर सकते या प्राकृतिक भाषा में फ़ॉलो-अप एडिट नहीं बता सकते।
- फ़ोटोरियलिज़्म की सीमा: मॉडल की समग्र यथार्थवादिता, खास तौर पर मानव सब्जेक्ट वाले जटिल दृश्यों में, FLUX Dev या सबसे अच्छे SDXL वर्ज़न जैसे मॉडलों से थोड़ी नीचे है।
- लंबे टेक्स्ट में दिक्कत: छोटी हेडलाइन से लंबी कोई भी चीज़ अविश्वसनीय हो जाती है। बॉडी टेक्स्ट, पैराग्राफ़ या मल्टी-लाइन कंटेंट में अब भी गलतियाँ आती हैं।
- कोई नेटिव एडिटिंग लेयर नहीं: एक बार इमेज जनरेट होने के बाद, संशोधन के लिए लक्षित एडिट के बजाय समायोजित प्रॉम्प्ट के साथ पूरी तरह से दोबारा जनरेशन चाहिए।
ChatGPT की टेक्स्ट सीमाएँ
ChatGPT की इमेज में टेक्स्ट से जुड़ी मुख्य परेशानियाँ एक अलग तरह की समस्याओं से आती हैं:
- असंगत टाइपोग्राफी स्टाइल: जब तक आप बहुत खास तरीके से प्रॉम्प्ट न करें, फ़ॉन्ट रेंडरिंग कुछ हद तक बेतरतीब रहती है। एक ही प्रॉम्प्ट लगातार दो जनरेशन में अलग-अलग टाइपफ़ेस दे सकता है।
- बैकग्राउंड टेक्स्ट का प्रदूषण: बैकग्राउंड दृश्य तत्वों पर अक्सर अनचाहा टेक्स्ट आ जाता है, जो कंपोज़िशन को धुंधला कर देता है।
- फ़्री टियर पर रेट लिमिट: ChatGPT फ़्री अकाउंट पर इमेज जनरेशन को काफ़ी सीमित करता है, जिससे आप कितने प्रयोग कर सकते हैं यह सीमित हो जाता है।
- ढीला टेक्स्ट प्लेसमेंट: आप शब्दों में स्थिति बताते हैं, और मॉडल उसे ढीले ढंग से समझता है। ज़ोन-स्तर या पिक्सल-स्तर की पोज़िशनिंग उपलब्ध नहीं है।

अपनी AI इमेज में बेहतर टेक्स्ट कैसे पाएँ
प्रॉम्प्ट ट्रिक्स जो सच में काम करते हैं
आप चाहे जो टूल इस्तेमाल करें, ये तकनीकें लगातार टेक्स्ट सटीकता बेहतर करती हैं:
- अपने टेक्स्ट को साफ़ तौर पर उद्धरण चिह्नों में रखें: प्रॉम्प्ट के भीतर हमेशा इरादे वाले टेक्स्ट को उद्धरण चिह्नों में लपेटें।
a cafe sign reading "Daily Roast" लिखें, a cafe sign that says Daily Roast नहीं।
- फ़ॉन्ट श्रेणी बताएँ: "sans-serif", "serif", "handwritten" या "stencil" जोड़ने से मॉडल किसी एक स्टाइल पर टिकता है और शब्द के भीतर अक्षरों की भिन्नता कम होती है।
- टेक्स्ट की मात्रा घटाएँ: हर तत्व के लिए पाँच या उससे कम शब्दों तक सीमित रहें। ज़्यादा टेक्स्ट का मतलब है ज़्यादा विफलता के बिंदु।
- हाई-कंट्रास्ट बैकग्राउंड इस्तेमाल करें: सादे, गहरे या एक-रंग के बैकग्राउंड पर टेक्स्ट माँगने से पठनीयता काफ़ी सुधरती है।
- कई वेरिएंट जनरेट करें: एक ही आउटपुट पर बार-बार सुधार करने के बजाय चार से छह जनरेशन चलाएँ और सबसे अच्छा चुनें।
💡 प्रो टिप: अगर आपको इमेज के अंदर सच में सटीक बॉडी कॉपी चाहिए, तो बिना टेक्स्ट वाली इमेज जनरेट करें और बाद में Canva, Figma या Photoshop में टेक्स्ट को एक लेयर के रूप में जोड़ें। घने टेक्स्ट के लिए कोई भी AI टूल पेशेवर लेआउट सॉफ़्टवेयर की जगह भरोसेमंद तरीके से नहीं ले सकता।
PicassoIA पर GPT Image 2 का इस्तेमाल
अगर आप ChatGPT सब्सक्रिप्शन के बिना OpenAI के GPT Image 2 की क्वालिटी चाहते हैं, तो PicassoIA आपको उस मॉडल के साथ-साथ टेक्स्ट-टू-इमेज टूल्स के पूरे सेट का सीधा एक्सेस देता है।
टेक्स्ट-इन-इमेज प्रोजेक्ट के लिए इसे प्रभावी ढंग से इस्तेमाल करने का तरीका यह है:
चरण 1: GPT Image 2 मॉडल पेज पर जाएँ
PicassoIA पर GPT Image 2 मॉडल पर जाएँ। आपको प्रॉम्प्ट इनपुट, आस्पेक्ट रेशियो सिलेक्टर और जनरेशन कंट्रोल दिखेंगे।
चरण 2: टेक्स्ट-फ़ोकस्ड प्रॉम्प्ट लिखें
उद्धरण वाली तकनीक इस्तेमाल करें। उदाहरण के लिए: A rustic wooden storefront sign reading "The Linen House", late afternoon sunlight, photorealistic, warm shadows
चरण 3: आस्पेक्ट रेशियो सेट करें
सोशल मीडिया पोस्ट के लिए 1:1 या 4:5 अच्छा काम करता है। बैनर और वाइड-फ़ॉर्मेट डिज़ाइन के लिए 16:9 या 3:1 ज़्यादातर ज़रूरतें पूरी करता है।
चरण 4: जनरेट करें और तुलना करें
थोड़े अलग प्रॉम्प्ट के साथ तीन से चार जनरेशन चलाएँ। हर एक में टेक्स्ट कैसे रेंडर होता है, इसकी तुलना करें। सबसे अच्छे नतीजे में आमतौर पर बहुत कम टच-अप चाहिए।
चरण 5: इनपेंटिंग से रिफ़ाइन करें
अगर दृश्य बढ़िया है लेकिन एक शब्द थोड़ा गलत है, तो इनपेंटिंग टूल से सिर्फ़ टेक्स्ट वाले हिस्से पर मास्क लगाएँ और सुधरे प्रॉम्प्ट के साथ सिर्फ़ उसी हिस्से को दोबारा जनरेट करें।

आउटपुट क्वालिटी में असली अंतर
इमेज में टेक्स्ट के लिए Ideogram और ChatGPT के बीच बहस इस बारे में नहीं है कि कौन ज़्यादा होशियार है। यह इस बारे में है कि किसे उस खास समस्या को हल करने के लिए ट्रेन किया गया था जो आपके सामने है।
Ideogram को खास तौर पर टाइपोग्राफी के लिए बनाया गया था। अगर आपके वर्कफ़्लो में पोस्टर, सोशल कार्ड, कवर आर्ट या ब्रांडेड इमेज बनाना शामिल है जहाँ शब्द केंद्र में हैं, तो Ideogram की विशेष ट्रेनिंग उसे टेक्स्ट की विश्वसनीयता में एक असली बढ़त देती है।
GPT-4o इमेज वाला ChatGPT बाकी हर चीज़ में जीतता है: ज़्यादा समृद्ध दृश्य कंपोज़िशन, बेहतर फ़ोटोरियलिज़्म, बातचीत वाला सुधार और एक बड़े AI वर्कफ़्लो के साथ गहरा इंटीग्रेशन। जब एक जटिल दृश्य में टेक्स्ट कई तत्वों में से एक हो, तो वह व्यापक क्षमता अक्सर ज़्यादा मायने रखती है।
उन डिज़ाइनरों के लिए जिन्हें दोनों चाहिए: व्यावहारिक जवाब है कि दोनों टूल उनके सबसे अच्छे काम के लिए इस्तेमाल करें, या PicassoIA जैसा प्लेटफ़ॉर्म लें जहाँ एक ही इंटरफ़ेस में कई टेक्स्ट-टू-इमेज मॉडल उपलब्ध हैं, जिनमें GPT Image 2 और FLUX Dev शामिल हैं।
💡 जानने लायक बात: PicassoIA सुपर रेज़ोल्यूशन टूल्स भी देता है जो जनरेट की गई इमेज को अपस्केल और शार्प कर सकते हैं, जिससे जब शुरुआती आउटपुट में अक्षरों के किनारे थोड़े धुंधले हों, तब टेक्स्ट तत्व ज़्यादा साफ़ दिखते हैं।

आपको कौन सा चुनना चाहिए
चुनाव आपके मुख्य आउटपुट प्रकार पर निर्भर करता है:
-
Ideogram चुनें अगर: आप ऐसा कंटेंट बनाते हैं जहाँ टेक्स्ट हीरो है, जैसे पोस्टर, कोट्स, इवेंट फ़्लायर, सोशल कार्ड और ब्रांडेड ग्राफ़िक्स। छोटे वाक्यांशों पर इसकी टेक्स्ट सटीकता इस कीमत पर मुश्किल से हराई जा सकती है।
-
ChatGPT चुनें अगर: आपको समृद्ध, जटिल दृश्य चाहिए जहाँ टेक्स्ट एक सहायक तत्व हो। एडिटोरियल, विज्ञापन और स्टोरीटेलिंग कंटेंट के लिए इमेज क्वालिटी और बातचीत वाला सुधार वर्कफ़्लो ज़्यादा उपयुक्त हैं।
-
दोनों (या PicassoIA) चुनें अगर: आपके प्रोजेक्ट अलग-अलग हैं। कई मॉडल उपलब्ध होने का मतलब है कि आप हर काम के लिए सही टूल चुन सकते हैं, न कि हर प्रोजेक्ट को एक ही पाइपलाइन से गुज़ारें।
AI इमेज का क्षेत्र तेज़ी से सुधर रहा है। Ideogram और OpenAI के इमेज मॉडल, दोनों ने पिछले 18 महीनों में टेक्स्ट सटीकता में काफ़ी सुधार किया है, और कोई भी रुका हुआ नहीं है। फ़िलहाल, छोटे वाक्यांशों की टाइपोग्राफी में बढ़त Ideogram की ओर है, जबकि समग्र इमेज क्वालिटी और वर्कफ़्लो का लचीलापन ChatGPT की ओर झुके हैं।

PicassoIA पर खुद आज़माएँ
इस बहस पर अपनी राय बनाने का सबसे तेज़ तरीका है अपने टेस्ट खुद चलाना। PicassoIA पर जाएँ और एक ही प्रॉम्प्ट कई मॉडलों पर जनरेट करें। टेक्स्ट-भारी पोस्टर प्रॉम्प्ट के लिए GPT Image 2 आज़माएँ, फिर वही दृश्य FLUX Dev पर चलाएँ और नतीजों की साथ-साथ तुलना करें।
आप तुरंत देख पाएँगे कि कौन सा मॉडल आपकी खास प्रॉम्प्ट शैली को बेहतर संभालता है। यह खुद आज़माया गया टेस्ट किसी भी लिखित तुलना से ज़्यादा काम का है, क्योंकि यह आपके असली उपयोग, आपकी प्रॉम्प्ट शैली और आपके काम के लिए ज़रूरी विज़ुअल मानकों को दर्शाता है।
PicassoIA एक ही जगह पर 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल, इमेज एडिटिंग टूल्स, सुपर रेज़ोल्यूशन और वीडियो जनरेशन की सुविधा देता है। कई सब्सक्रिप्शन संभालने की ज़रूरत नहीं, टूल्स के बीच टैब बदलने की ज़रूरत नहीं। पूरा क्रिएटिव टूलकिट एक ही जगह पर है, और हर मॉडल अपडेट के साथ इमेज में टेक्स्ट की क्षमताएँ लगातार बेहतर होती जा रही हैं।