ज़्यादातर लोग AI मॉडल को उसके पैरामीटर की संख्या या किसी रीज़निंग बेंचमार्क पर उसके स्कोर से आंकते हैं। ये संख्याएँ मायने रखती हैं, लेकिन इनसे यह पता नहीं चलता कि मॉडल सचमुच आपका 80 पेज का कॉन्ट्रैक्ट पढ़ सकता है, बारह मैसेज पहले कही गई बात याद रख सकता है, या एक साथ पूरा सॉफ़्टवेयर प्रोजेक्ट अपने दिमाग में रख सकता है। इन सबको तय करने वाली संख्या कॉन्टेक्स्ट लेंथ है, जिसे कॉन्टेक्स्ट विंडो भी कहते हैं, और असल में यह मॉडल के स्पेक शीट में सबसे व्यावहारिक स्पेसिफ़िकेशन है।
वह एक स्पेक जो सब कुछ बदल देता है
कॉन्टेक्स्ट लेंथ टोकन में मापी जाती है, शब्दों या अक्षरों में नहीं। एक टोकन लगभग अंग्रेज़ी के 0.75 शब्द के बराबर होता है, इसलिए 1,000 टोकन लगभग 750 शब्द हैं। लेकिन टोकन में हर विराम चिह्न, हर स्पेस, कोड का हर हिस्सा और आपके सिस्टम प्रॉम्प्ट का हर तत्व भी गिना जाता है। जैसे ही मॉडल की कॉन्टेक्स्ट विंडो भर जाती है, वह पुरानी चीज़ें बिल्कुल नहीं देख पाता। वह धीमा नहीं होता और चेतावनी भी नहीं देता। वह भूल जाता है।
टोकन असल में क्या है

"टोकनाइज़ेशन" शब्द तकनीकी लगता है, लेकिन इसकी धारणा सरल है। लार्ज लैंग्वेज मॉडल अलग-अलग अक्षर नहीं पढ़ते। वे टेक्स्ट के टुकड़े पढ़ते हैं, जिन्हें टोकन कहते हैं और जो उस शब्दावली से तय होते हैं जिस पर मॉडल को प्रशिक्षित किया गया था। "the" या "is" जैसे आम शब्द आमतौर पर एक टोकन होते हैं। दुर्लभ शब्द, व्यक्तिवाचक संज्ञाएँ या कोड के चिह्न अक्सर दो, तीन या उससे ज़्यादा टोकन में बँट जाते हैं।
व्यवहार में यह क्यों मायने रखता है, वह यहाँ है:
- 10,000 शब्दों का एक निबंध लगभग 13,500 टोकन होता है।
- 200 लाइनों की एक Python स्क्रिप्ट 1,200 से 1,800 टोकन ले सकती है।
- निर्देशों वाला एक सामान्य सिस्टम प्रॉम्प्ट 300 से 600 टोकन का होता है।
- मल्टीमोडल मॉडल द्वारा प्रोसेस की गई एक अकेली इमेज अपने दम पर सैकड़ों टोकन ले सकती है।
ये सारी लागतें एक ही बजट से निकलती हैं। अगर किसी मॉडल की विंडो 4,096 टोकन की है और आपका सिस्टम प्रॉम्प्ट 400 टोकन लेता है, तो बाकी सब कुछ के लिए 3,696 टोकन बचते हैं: आपका मैसेज, बातचीत का इतिहास और मॉडल का जवाब।
विंडो जल्दी भर जाती है

यहीं ज़्यादातर उपयोगकर्ताओं को दिक्कत आती है। आप किसी चैटबॉट से बातचीत शुरू करते हैं, सब कुछ तेज़ और सटीक लगता है, और फिर बीस मैसेज बाद वह भूलता हुआ लगता है कि आपने शुरू में क्या कहा था। यह कोई बग नहीं है। कॉन्टेक्स्ट विंडो भर चुकी होती है और सबसे पुरानी सामग्री बाहर धकेल दी गई होती है, इसलिए मॉडल उन शुरुआती मैसेजों को अब सचमुच नहीं देख सकता।
अलग-अलग सिस्टम इसे अलग तरीकों से संभालते हैं। कुछ ट्रंकेट करते हैं (सबसे पुराने मैसेज चुपचाप काट देते हैं)। कुछ पुराने टर्न को सारांशित करके उनका संक्षिप्त रूप डालते हैं। कुछ आपसे नया सेशन शुरू करने को कहते हैं। इनमें से कोई भी बड़ी कॉन्टेक्स्ट विंडो का पूरा विकल्प नहीं है।
💡 व्यावहारिक टिप: उपयोगकर्ता इनपुट के लिए आपके पास वास्तव में कितना कॉन्टेक्स्ट बचता है, यह अनुमान लगाते समय हमेशा अपने सिस्टम प्रॉम्प्ट, कुछ उदाहरणों (few-shot examples) और जवाब की अपेक्षित लंबाई को गिनें।
छोटी बनाम लंबी कॉन्टेक्स्ट विंडो
आज के मॉडलों में कॉन्टेक्स्ट लेंथ बहुत अलग-अलग है। कुछ साल पहले 4,096 टोकन को उदार माना जाता था। आज 10 लाख टोकन या उससे ज़्यादा वाले मॉडल मौजूद हैं, हालाँकि दोनों छोरों पर असली ट्रेड-ऑफ़ हैं।
जब 4K टोकन काम निकाल देते हैं

छोटी कॉन्टेक्स्ट विंडो हमेशा कमज़ोरी नहीं होती। स्वाभाविक रूप से छोटे कामों के लिए 4K या 8K विंडो पूरी तरह पर्याप्त है:
- एक तथ्यात्मक सवाल का जवाब देना
- एक पैराग्राफ़ का अनुवाद करना
- एक छोटा ईमेल या सोशल मीडिया कैप्शन लिखना
- एक संक्षिप्त स्पेक दिए जाने पर फ़ंक्शन लिखना
- तेज़ गणित या रीज़निंग के चरण
इन परिस्थितियों में, छोटे कॉन्टेक्स्ट आकार के लिए गति और लागत पर अनुकूलित मॉडल व्यावहारिक मायनों में बड़े मॉडल से बेहतर प्रदर्शन कर सकता है। आपको तेज़ जवाब मिलते हैं और API लागत कम होती है, और गुणवत्ता में कोई उल्लेखनीय कमी नहीं आती।
जब आपको 128K या उससे ज़्यादा चाहिए
इन उपयोग मामलों के लिए समीकरण पूरी तरह बदल जाता है:
| कार्य | अनुमानित टोकन संख्या |
|---|
| पूरा उपन्यास (80,000 शब्द) | लगभग 110,000 टोकन |
| एंटरप्राइज़ कोडबेस (100+ फ़ाइलें) | 200,000 से 500,000 टोकन |
| कानूनी कॉन्ट्रैक्ट समीक्षा (50 पेज) | लगभग 35,000 टोकन |
| एक घंटे का ट्रांसक्रिप्ट | लगभग 30,000 टोकन |
| 3 घंटे का रिसर्च इंटरव्यू | लगभग 80,000 टोकन |
| पूरा प्रोडक्ट मैनुअल | लगभग 60,000 टोकन |
इतने बड़े पैमाने की सामग्री के साथ काम करते समय, 4K विंडो सिर्फ़ खिंचती नहीं, टूट जाती है। मॉडल वह कॉन्टेक्स्ट नहीं देख पाता जिसकी उसे सटीक जवाब देने के लिए ज़रूरत है, और आपके प्रॉम्प्ट को दोबारा लिखने से भी यह नहीं सुधरता।
मॉडल के अंदर क्या होता है
समझना ज़रूरी है कि कॉन्टेक्स्ट लेंथ को बढ़ाना महँगा क्यों है, इसके लिए यह देखना होगा कि जब मॉडल आपका प्रॉम्प्ट पढ़ता है तो वह असल में क्या करता है।
अटेंशन आपका प्रॉम्प्ट कैसे पढ़ता है

आधुनिक लैंग्वेज मॉडल सेल्फ़-अटेंशन नाम की व्यवस्था इस्तेमाल करते हैं। कॉन्टेक्स्ट का हर टोकन मतलब और संबंधों की तस्वीर बनाने के लिए बाकी हर टोकन को देखता है। इसी वजह से LLM टेक्स्ट की बारीकियों और लंबी दूरी की निर्भरताओं को पकड़ने में इतने अच्छे हैं।
इस गणना की लागत टोकन की संख्या में द्विघात (quadratic) होती है। कॉन्टेक्स्ट लेंथ दोगुनी करने पर गणना दोगुनी नहीं होती, वह चार गुनी हो जाती है। इसीलिए बहुत लंबी कॉन्टेक्स्ट विंडो वाले मॉडलों को प्रशिक्षित और चलाने में काफ़ी ज़्यादा हार्डवेयर लगता है, और इसी वजह से कई कुशल मॉडल इस लागत को घटाने के लिए स्लाइडिंग विंडो अटेंशन, स्पार्स अटेंशन या लीनियर अटेंशन जैसी तरकीबें इस्तेमाल करते हैं।
💡 आपके लिए यह क्यों मायने रखता है: 10 लाख टोकन की कॉन्टेक्स्ट विंडो वाला मॉडल उस मॉडल जैसा नहीं है जो 10 लाख टोकन पर अच्छा काम करता हो। "नीडल इन ए हेस्टैक" जैसे बेंचमार्क देखें, जो मापता है कि मॉडल लंबे दस्तावेज़ के गहराई में दबे किसी खास तथ्य को ढूँढ पाता है या नहीं।
"बीच में खो जाने" की समस्या

2023 में प्रकाशित शोध ने कई मॉडल परिवारों में एक लगातार विफलता पैटर्न की पहचान की: जब प्रासंगिक जानकारी लंबे कॉन्टेक्स्ट के बीच में होती है, तो प्रदर्शन गिर जाता है। मॉडल कॉन्टेक्स्ट की सबसे शुरुआत या सबसे अंत में रखी जानकारी को बीच में दबी जानकारी की तुलना में कहीं ज़्यादा भरोसेमंद तरीके से याद रखते हैं।
इसके व्यावहारिक नतीजे हैं:
- अपने सबसे ज़रूरी निर्देश प्रॉम्प्ट के शुरू में रखें, बीच में नहीं।
- अगर आप कोई लंबा दस्तावेज़ सारांशित कर रहे हैं, तो यह न मानें कि मॉडल ने हर पैराग्राफ़ को बराबर ध्यान से प्रोसेस किया।
- रिट्रीवल टास्क के लिए, मॉडल को केवल शुरुआत पर नहीं, बल्कि उन कॉन्टेक्स्ट पोज़िशन पर खास तौर पर परखें जिनकी आपको परवाह है।
नई मॉडल पीढ़ियों के साथ यह समस्या सुधरी है, लेकिन यह पूरी तरह ख़त्म नहीं हुई है। इसलिए किसी भी दावे पर शक करना सही है कि कोई मॉडल "200K टोकन को पूरी तरह संभालता है", जब तक उसके पीछे असली रिट्रीवल बेंचमार्क न हों।
आज के शीर्ष मॉडलों में कॉन्टेक्स्ट लेंथ
कॉन्टेक्स्ट लेंथ की होड़ तेज़ी से बढ़ी है। यहाँ कुछ प्रमुख मॉडल अभी कहाँ खड़े हैं, यह देखें।

लंबे कॉन्टेक्स्ट के लिए बने मॉडल
PicassoIA पर उपलब्ध कई मॉडल खास तौर पर लंबे कॉन्टेक्स्ट वाले काम के लिए उपयुक्त हैं।
Moonshotai का Kimi K2.6 लंबे कॉन्टेक्स्ट प्रोसेसिंग को मुख्य डिज़ाइन लक्ष्य मानकर बनाया गया था। यह मल्टी-डॉक्यूमेंट रीज़निंग को मज़बूत रिकॉल सटीकता के साथ संभालता है, और जब आपको एक ही सेशन में कई फ़ाइलें या बहुत लंबा बातचीत थ्रेड डालना हो, तो यह बेहतर विकल्पों में से एक है।
Google के Gemini 3.1 Pro और Gemini 2.5 Flash दोनों बेहद बड़ी विंडो सपोर्ट करते हैं और ज़्यादा टोकन संख्या पर भी रीज़निंग की गुणवत्ता बनाए रखने के लिए अनुकूलित हैं, जिससे वे दस्तावेज़-भारी वर्कफ़्लो के लिए अच्छे हैं।
Anthropic के Claude Opus 4.7 और Claude 4 Sonnet को लंबे-दस्तावेज़ कार्यों पर व्यापक रूप से परखा गया है, और "नीडल इन ए हेस्टैक" शैली के मूल्यांकन में उच्च रिकॉल सटीकता के लिए जाने जाते हैं।
IBM Granite 8B Code Instruct 128K कोड के लिए विशेष रूप से अनुकूलित 128,000 टोकन का कॉन्टेक्स्ट देता है, जो बड़े सॉफ़्टवेयर प्रोजेक्ट के लिए मज़बूत विकल्प है, जहाँ आपको मॉडल को एक साथ कई फ़ाइलें देखने की ज़रूरत हो।
IBM Granite 4.0 H Small दक्षता के लिए बना एक कॉम्पैक्ट लंबा-कॉन्टेक्स्ट मॉडल है, जो सीमित कंप्यूट पर भी अच्छा चलता है और फिर भी विस्तारित टोकन बजट पर ठोस रिकॉल देता है।
Meta के Meta Llama 4 Scout Instruct और Llama 4 Maverick Instruct दोनों बहुत लंबे कॉन्टेक्स्ट की सीमा तक जाते हैं और ओपन वेट्स वाले विकल्प हैं, जो डेवलपर्स में पारदर्शिता और लचीलेपन के लिए लोकप्रिय हैं।
जहाँ गति अब भी जीतती है
हर काम को बड़ी कॉन्टेक्स्ट विंडो की ज़रूरत नहीं होती। छोटे, बार-बार होने वाले कामों के लिए ये मॉडल कुछ कॉन्टेक्स्ट क्षमता के बदले कहीं तेज़ थ्रूपुट देते हैं:
- GPT 5 Mini और GPT 4.1 Nano कम-लेटेंसी जवाबों के लिए अनुकूलित हैं, जहाँ प्रॉम्प्ट मानक विंडो में आराम से आ जाता है।
- DeepSeek v3.1 मिश्रित छोटे और मध्यम-लंबाई वाले कामों के लिए लागत और प्रदर्शन में अच्छा संतुलन रखता है।
- DeepSeek R1 मध्यम-कॉन्टेक्स्ट परिस्थितियों में चरण-दर-चरण रीज़निंग जोड़ता है, जहाँ आपके लिए दस्तावेज़ की कच्ची लंबाई से ज़्यादा रीज़निंग की गुणवत्ता मायने रखती है।
वे काम जो सीमाओं को परखते हैं
लंबे दस्तावेज़ पढ़ना

कानूनी समीक्षा, वित्तीय ड्यू डिलिजेंस, शैक्षणिक शोध, अनुपालन ऑडिट: इन सबमें ऐसे दस्तावेज़ पढ़ने होते हैं जो दस हज़ार से लेकर लाखों शब्दों तक के होते हैं। 8K विंडो वाला मॉडल एक लंबा कॉन्ट्रैक्ट भी पूरा नहीं रख सकता। या तो आपको उसे टुकड़ों में बाँटना होगा, जिसमें दस्तावेज़ों के बीच का कॉन्टेक्स्ट छूटने का जोखिम है, या फिर सचमुच बड़ी विंडो वाला मॉडल इस्तेमाल करना होगा।
इस काम के लिए Grok 4, GPT 5 Pro और Claude Opus 4.7 लगातार शीर्ष प्रदर्शन करने वालों में हैं। वे केवल लंबे इनपुट स्वीकार नहीं करते। वे पहले टोकन से आखिरी टोकन तक उन इनपुट के बारे में सुसंगत रीज़निंग बनाए रखते हैं।
मल्टी-टर्न बातचीत
लंबी बातचीत तेज़ी से कॉन्टेक्स्ट जमा करती है। 45 मिनट के ट्रबलशूटिंग सेशन से गुज़रने वाला सपोर्ट चैटबॉट हज़ारों टोकन का इतिहास बना देता है। एक क्रिएटिव राइटिंग सेशन जिसमें आप कई दौर में कहानी को निखारते हैं, वह भी जल्दी कॉन्टेक्स्ट सीमा तक पहुँच जाता है।
💡 तरकीब: प्रोडक्ट इम्प्लीमेंटेशन के लिए, बातचीत की स्थिति का लगातार अपडेट होता संरचित सारांश सहेजें और हर नए सेशन की शुरुआत में डालें, कच्चा चैट इतिहास भेजने के बजाय। इससे टोकन बजट नई सामग्री के लिए बचा रहता है, पुराने टर्न दोहराने में नहीं जाता।
GPT 5.4, GPT 5 और Kimi K2.6 विस्तारित मल्टी-टर्न सेशन अच्छी तरह संभालते हैं। वे सुसंगत बने रहते हैं और बातचीत की शुरुआत में आई उन बारीकियों को ट्रैक करते हैं जिन्हें ज़्यादातर छोटी विंडो वाले मॉडल पहले ही गिरा चुके होते।
फ़ाइलों में फैले कोड प्रोजेक्ट

डेवलपर्स के लिए कॉन्टेक्स्ट लेंथ सबसे ज़्यादा यहीं मायने रखती है। जब आप AI मॉडल से कोई फ़ंक्शन रीफ़ैक्टर करने को कहते हैं, तो उसे देखना होगा कि वह फ़ंक्शन कोड में और कहाँ इस्तेमाल हो रहा है। जब आप नया मॉड्यूल लिखवाते हैं, तो उसे वे इंटरफ़ेस देखने होंगे जिनसे उसे जुड़ना है। 4K कॉन्टेक्स्ट वाला मॉडल एक समय में एक फ़ाइल पढ़ता है। 128K वाला मॉडल एक छोटा पूरा कोडबेस अपने पास रख सकता है और उसके पार समग्र रूप से रीज़निंग कर सकता है।
IBM Granite 8B Code Instruct 128K ठीक इसी उपयोग के लिए बनाया गया था। 128K टोकन पर यह एक साथ लगभग 500 से 800 सामान्य सोर्स फ़ाइलें कॉन्टेक्स्ट में रख सकता है, जो ज़्यादातर छोटे और मध्यम आकार के एप्लिकेशन को पूरी तरह कवर कर लेता है।
Meta Llama 3.1 405B Instruct एक लंबी कॉन्टेक्स्ट विंडो में भारी पैरामीटर गहराई जोड़ता है, जिससे यह तब सबसे मज़बूत विकल्पों में से एक है जब आपको कोड समझने की व्यापकता और निर्देश-पालन की सटीकता, दोनों चाहिए।
किसी भी सीमा के भीतर कैसे काम करें
सबसे अच्छे लंबे-कॉन्टेक्स्ट मॉडल के साथ भी कुछ काम ऐसे होंगे जो किसी एक कॉन्टेक्स्ट विंडो में समा नहीं सकते। यहाँ दो सबसे भरोसेमंद रणनीतियाँ हैं।
विभाजित करें और सारांश बनाएँ
सबसे सरल तरीका है बड़े दस्तावेज़ों को ऐसे टुकड़ों में बाँटना जो कॉन्टेक्स्ट विंडो में समा जाएँ, हर टुकड़े को अलग से प्रोसेस करना, और फिर नतीजों को जोड़ना। जोखिम उन संबंधों को खो देने का है जो टुकड़ों के बीच फैले हों। इस जोखिम को कम करने के लिए:
- आसन्न टुकड़ों के बीच थोड़ा ओवरलैप रखें, ताकि सीमा पर कुछ भी छूटे नहीं।
- हर टुकड़े के अंत में मॉडल से मुख्य तथ्यों और खुले सवालों को समेटने वाला संरचित सारांश माँगें।
- उन सारांशों को एक अंतिम पास में साथ डालें और संयुक्त आउटपुट तैयार करवाएँ।
यह तरीका उन दस्तावेज़ों पर अच्छा काम करता है जिनका हर खंड अपेक्षाकृत स्व-निहित हो, जैसे अलग-अलग अध्यायों वाली लंबी रिपोर्ट।
स्टफ़िंग की जगह RAG का इस्तेमाल करें
Retrieval-Augmented Generation (RAG) बहुत बड़े नॉलेज बेस के लिए आर्किटेक्चर का चुनाव है। सब कुछ एक साथ कॉन्टेक्स्ट में डालने के बजाय, आप:
- अपने दस्तावेज़ों को वेक्टर डेटाबेस में इंडेक्स करते हैं।
- क्वेरी के समय केवल सबसे प्रासंगिक टुकड़े निकालते हैं, आमतौर पर 3 से 10।
- उन टुकड़ों को उपयोगकर्ता के सवाल के साथ कॉन्टेक्स्ट में डालते हैं।
इससे सक्रिय कॉन्टेक्स्ट छोटा और केंद्रित रहता है। ट्रेड-ऑफ़ यह है कि आपके पास ऐसा रिट्रीवल सिस्टम होना चाहिए जो सही टुकड़े सचमुच सामने लाए। RAG तब ख़राब काम करता है जब उत्तर के लिए किसी बड़े दस्तावेज़ के कई दूर के हिस्सों में फैली जानकारी को जोड़ना पड़े, और ठीक यही वह स्थिति है जहाँ असली लंबे-कॉन्टेक्स्ट मॉडल जीतता है।
इन दोनों तरीकों को अक्सर साथ मिलाया जाता है: RAG से सबसे प्रासंगिक खंड पहचानें, फिर उन खंडों का लंबा अंश अंतिम संश्लेषण के लिए लंबे-कॉन्टेक्स्ट मॉडल को दें।
PicassoIA पर देखें कि लंबा-कॉन्टेक्स्ट AI क्या कर सकता है

किसी मॉडल में कॉन्टेक्स्ट लेंथ ही अकेली चीज़ नहीं है जो मायने रखती है, लेकिन अक्सर यही वह स्पेसिफ़िकेशन होता है जो तय करता है कि मॉडल वह काम कर सकता है या नहीं जो आपको सचमुच चाहिए। बिना उसकी कॉन्टेक्स्ट विंडो जाँचे मॉडल चुनना ऐसा है जैसे किसी कंसल्टेंट को रखें और मीटिंग के बाद पता चले कि वह बातचीत के आख़िरी पाँच मिनट ही याद रख सकता है।
PicassoIA पर आप इस लेख में बताए गए हर मॉडल को सीधे अपने ब्राउज़र में परख सकते हैं, बिना किसी सेटअप या API कॉन्फ़िगरेशन के। एक लंबा दस्तावेज़ डालें। कई फ़ाइलों वाला कोडबेस चिपकाएँ। एक गहरी बातचीत चलाएँ। आपको साफ़ दिखेगा कि हर मॉडल दबाव में कैसा व्यवहार करता है।
LLM से आगे, PicassoIA आपको 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल देता है, जिनमें PicassoIA Image Editor Pro और PicassoIA Image शामिल हैं, साथ ही वीडियो जनरेशन, वॉइस सिंथेसिस, बैकग्राउंड हटाने और सुपर-रिज़ॉल्यूशन टूल्स, सब एक ही जगह पर।
आज ही GPT 5, Claude Opus 4.7 या Kimi K2.6 आज़माएँ। कुछ लंबा डालकर देखें कि क्या होता है।