2027 में लोकल LLM के लिए सबसे अच्छे MCP सर्वर: Ollama, LM Studio और Open WebUI के सेटअप
लोकल मॉडल प्राइवेट होते हैं, लेकिन टूल जोड़ने तक वे सिर्फ़ चैट कर सकते हैं। यह आर्टिकल Ollama, LM Studio और Open WebUI के लिए सात MCP सर्वर की रैंकिंग करता है, हर क्लाइंट का कॉन्फ़िग दिखाता है, ऐसे मॉडल सुझाता है जो टूल भरोसेमंद तरीके से कॉल करते हैं, और वे सेफ़्टी नियम बताता है जो लोकल एजेंट को क़ाबू में रखते हैं।
लोकल मॉडल प्राइवेट होते हैं और चलाने में सस्ते भी, लेकिन बिना किसी सेटअप के वे सिर्फ़ बात कर सकते हैं। वे आपका प्रोजेक्ट फ़ोल्डर नहीं पढ़ सकते, git diff नहीं देख सकते या कोई वेब पेज नहीं खोल सकते। MCP, यानी Model Context Protocol, यह कमी दूर करता है। यह किसी भी संगत ऐप को मॉडल तक असली टूल पहुँचाने का एक मानक तरीका देता है। पेच यह है कि लोकल सेटअप में दो समस्याएँ होती हैं जो क्लाउड चैटबॉट में नहीं होतीं: छोटी कॉन्टेक्स्ट विंडो, और छोटा मॉडल जो टूल कॉल में ज़्यादा बार गड़बड़ करता है। इसलिए लोकल LLM के लिए सबसे अच्छे MCP सर्वर सबसे बड़ी कैटलॉग वाले नहीं होते। वे वे कुछ सर्वर होते हैं जो हल्के, अनुमानित और अपनी मशीन पर लगातार चलाने के लिए सुरक्षित हों।
नीचे आपको ऐसे सात सर्वर मिलेंगे जो यह कसौटी पूरी करते हैं, इन्हें Ollama, LM Studio और Open WebUI से जोड़ने के तीन तरीके, और वे गलतियाँ जो लोकल एजेंट को धीमा या जोखिम भरा बना देती हैं।
लोकल मॉडल को MCP की ज़रूरत क्यों है
MCP व्यवहार में क्या करता है
MCP सर्वर एक छोटा प्रोग्राम है जो टूल्स की सूची बताता है: फ़ाइल पढ़ना, git कमांड चलाना, पेज लाना। MCP क्लाइंट, जैसे LM Studio या Open WebUI, वह सूची आपके मॉडल को दिखाता है। जब मॉडल कोई टूल चाहता है, तो वह एक स्ट्रक्चर्ड कॉल भेजता है, क्लाइंट उसे सर्वर पर चलाता है, और नतीजा बातचीत में वापस चला जाता है।
लोकल इस्तेमाल में यह बँटवारा ठीक बैठता है। मॉडल आपके हार्डवेयर पर रहता है, सर्वर उसके पास चलता है, और कुछ भी आपके नेटवर्क से बाहर नहीं जाता, जब तक कोई टूल खुद वेब तक नहीं पहुँचता। दो ट्रांसपोर्ट हर जगह दिखते हैं:
stdio: क्लाइंट सर्वर को आपकी मशीन पर चाइल्ड प्रोसेस के रूप में शुरू करता है। ज़्यादातर रेफ़रेंस सर्वर इसी तरह काम करते हैं।
Streamable HTTP: सर्वर एक वेब सर्विस के रूप में चलता है, जिसकी उम्मीद Open WebUI जैसे ब्राउज़र-आधारित ऐप्स करते हैं।
छोटे मॉडल कहाँ अटकते हैं
7 से 20 बिलियन पैरामीटर वाला मॉडल टूल कॉल कर सकता है, लेकिन वह फ़्रंटियर मॉडल जितना माफ़ करने वाला नहीं होता। वह गलत टूल चुन सकता है, कोई आर्गुमेंट गढ़ सकता है या एक ही कॉल बार-बार दोहरा सकता है। हर टूल जो सर्वर दिखाता है, वह प्रॉम्प्ट में लिखा जाता है, इसलिए दस सर्वर आप एक शब्द टाइप करने से पहले ही मामूली कॉन्टेक्स्ट विंडो का बड़ा हिस्सा खा सकते हैं।
💡 मोटा नियम: हर चैट में बारह नहीं, तीन-चार सर्वर चालू करें। LM Studio के अपने डॉक्स चेतावनी देते हैं कि Claude या ChatGPT के लिए बनाए गए सर्वर टोकन तेज़ी से खर्च कर सकते हैं और लोकल मॉडल को धीमा कर सकते हैं।
पहले क्लाइंट चुनें
क्लाइंट तय करता है कि आप कौन-से सर्वर इस्तेमाल कर सकते हैं और सेटअप कितना मुश्किल होगा। तीन विकल्प ज़्यादातर लोकल टूल्स के सेट को कवर करते हैं, और हर एक MCP को अलग तरीके से संभालता है।
LM Studio: सबसे तेज़ रास्ता
LM Studio ने वर्ज़न 0.3.17 में MCP सपोर्ट जोड़ा और वह लोकल और रिमोट दोनों सर्वर संभालता है। दाईं साइडबार में Program टैब खोलें, Install चुनें, फिर Edit mcp.json। यह फ़ाइल Cursor की नोटेशन का पालन करती है, इसलिए दूसरे टूल्स से कॉपी किए गए कॉन्फ़िग आमतौर पर सीधे पेस्ट हो जाते हैं।
रिमोट सर्वर कमांड की जगह url और वैकल्पिक headers इस्तेमाल करते हैं। ऑनलाइन मिला कॉन्फ़िग पेस्ट करते समय सिर्फ़ "mcpServers": { ... } के अंदर का हिस्सा कॉपी करें, नहीं तो नेस्टेड ब्रेसेस फ़ाइल को तोड़ देंगे।
💡 npx से शुरू होने वाले सर्वर को Node.js चाहिए, और uvx से शुरू होने वाले सर्वर को uv चाहिए। नया जोड़ा गया सर्वर बिना टूल दिखाए तो अक्सर यह ज़रूरी रनटाइम छूट जाने की वजह से होता है, और इसे नज़रअंदाज़ करना आसान है।
Ollama और एक ब्रिज
Ollama मॉडल चलाता है और टूल कॉलिंग सपोर्ट करता है, लेकिन वह खुद MCP नहीं बोलता। आपको बीच में एक क्लाइंट चाहिए जो टूल्स की सूची बनाए और उन्हें Ollama के टूल फ़ॉर्मेट में बदले। आपके विकल्प:
ollmcp (MCP Client for Ollama): एक टर्मिनल ऐप जो Ollama मॉडल को stdio, SSE और Streamable HTTP पर MCP सर्वर से जोड़ता है, इसमें एजेंट मोड है और टूल चलने से पहले एक ह्यूमन-इन-द-लूप कन्फ़र्मेशन स्टेप भी। इसे uv tool install --upgrade ollmcp से इंस्टॉल करें।
MCPHost: पहले का पसंदीदा टूल, जिसका अब सक्रिय रखरखाव नहीं होता, और इसका उत्तराधिकारी Kit बताया गया है।
ollama-mcp-bridge: एक कम्युनिटी ब्रिज प्रोजेक्ट, उनके लिए जो हल्का रैपर पसंद करते हैं।
अगर आपका ज़्यादातर काम टर्मिनल में होता है तो ollmcp चुनें। टेस्ट करते समय इसके कन्फ़र्मेशन प्रॉम्प्ट चालू रखें। हर Ollama मॉडल टूल्स को सपोर्ट नहीं करता, और Ollama लाइब्रेरी उन मॉडल पर टैग लगाती है जो करते हैं, इसलिए कोई मॉडल डाउनलोड करने से पहले उस टैग से फ़िल्टर करें।
Open WebUI और Streamable HTTP
Open WebUI वर्ज़न 0.6.31 से MCP को नेटिव तौर पर सपोर्ट करता है, लेकिन सिर्फ़ Streamable HTTP पर, क्योंकि यह कई यूज़र के लिए बना वेब ऐप है, डेस्कटॉप प्रोसेस नहीं। एडमिन Settings > Admin > Integrations में सर्वर जोड़ता है, + Add Connection चुनता है और टाइप को MCP (Streamable HTTP) पर सेट करता है। सामान्य यूज़र अपने सर्वर रजिस्टर नहीं कर सकते, यह एक जानबूझकर लिया गया सेफ़्टी फ़ैसला है।
stdio सर्वर के लिए उन्हें mcpo के पीछे चलाएँ, जो एक प्रॉक्सी है और stdio या SSE सर्वर को OpenAPI एंडपॉइंट में बदलता है:
फिर मिले URL को OpenAPI टूल सर्वर के रूप में जोड़ें। अगर आप Open WebUI को Docker में चलाते हैं, तो WEBUI_SECRET_KEY एनवायरनमेंट वेरिएबल सेट करें। इसके बिना, OAuth से जुड़े टूल हर बार कंटेनर रीस्टार्ट होने पर टूट जाते हैं।
सबसे अच्छे MCP सर्वर, रैंक के अनुसार
ये सात इस हिसाब से क्रमबद्ध हैं कि हर कॉन्टेक्स्ट टोकन के बदले एक ठेठ लोकल सेटअप में ये कितना जोड़ते हैं। छह आधिकारिक रेफ़रेंस कलेक्शन से हैं, जो अभी Everything, Fetch, Filesystem, Git, Memory, Sequential Thinking और Time को मेंटेन करता है। सातवाँ, Playwright, Microsoft का है।
Filesystem
लगभग हर कोई इसे सबसे पहले इंस्टॉल करता है। यह मॉडल को फ़ाइलें पढ़ने, लिखने, सूचीबद्ध करने और खोजने के टूल देता है, और सिर्फ़ उन्हीं फ़ोल्डर तक सीमित रहता है जो आप आर्गुमेंट के रूप में देते हैं। इसे नोट्स वॉल्ट, docs फ़ोल्डर या एक ही रेपो की ओर इंगित करें, अपनी पूरी होम डायरेक्टरी की ओर कभी नहीं। यह मीटिंग नोट्स का सारांश बनाने, फ़ाइलों के बैच का नाम बदलने या सोर्स कोड से README का ड्राफ़्ट बनाने जैसे काम संभालता है।
Git
uvx mcp-server-git से चलाने पर यह मॉडल को status, diffs और history पढ़ने और commits बनाने देता है। यह छोटा और व्यवहार में सधा हुआ है, इसलिए 8B-क्लास मॉडल के लिए अच्छा मेल है। स्टेज्ड diff के आधार पर commit message माँगें, और मॉडल को एक ही कॉल में सब कुछ मिल जाता है।
Fetch
Fetch एक URL लेता है और पेज को markdown में बदलता है ताकि वह कॉन्टेक्स्ट विंडो में आ जाए। कई लोकल सेटअप के लिए यह लाइव वेब तक पहुँचने का अकेला रास्ता है जिसमें कोई अकाउंट या टोकन नहीं चाहिए। हर लाए गए पेज को अविश्वसनीय टेक्स्ट मानें। पेज में आपके मॉडल के लिए निर्देश हो सकते हैं। इस समस्या को prompt injection कहते हैं।
Memory
यह एक नॉलेज-ग्राफ़ मेमोरी है जो entities, relations और observations को एक लोकल फ़ाइल में रखती है, ताकि मॉडल चैट के बीच तथ्य याद रख सके। छोटे मॉडल को स्थिर महसूस कराने का यह सबसे सस्ता तरीका है। वह फ़ाइल बैक अप करें और बीच-बीच में उसे देखते रहें, क्योंकि मॉडल तय करता है कि क्या सेव होगा। एक छोटा सिस्टम प्रॉम्प्ट, जो बताए कि तथ्य कब सेव करना है और कब याद करना है, मदद करता है, क्योंकि छोटे मॉडल अक्सर सब कुछ सेव कर देते हैं या कुछ भी नहीं।
Playwright
Microsoft का @playwright/mcp असली ब्राउज़र को accessibility snapshots के ज़रिए चलाता है, screenshots के ज़रिए नहीं, इसलिए सिर्फ़ टेक्स्ट वाला लोकल मॉडल बिना विज़न मॉडल के क्लिक और टाइप कर सकता है। यह सूची का सबसे भारी सर्वर है और सबसे जोखिम भरा भी, क्योंकि ब्राउज़र आपके नेटवर्क की किसी भी चीज़ तक पहुँच सकता है। एक अलग ब्राउज़र प्रोफ़ाइल इस्तेमाल करें और कन्फ़र्मेशन चालू रखें।
Sequential Thinking
यह मॉडल को समस्या को क्रमांकित विचारों में तोड़ने, उन्हें संशोधित करने और शाखाएँ बनाने का संरचित तरीका देता है। इससे छोटे मॉडल को बहु-चरणीय कामों के लिए एक ढाँचा मिल सकता है। जो मॉडल पहले से नेटिव रूप से रीज़न करते हैं उन्हें इसकी ज़रूरत नहीं पड़ सकती, इसलिए इसे चालू और बंद दोनों तरह से टेस्ट करें।
सातवाँ विकल्प, Time, मौजूदा समय और टाइमज़ोन कन्वर्ज़न के लिए एक छोटा सर्वर है। यह सुनने में जितना मामूली लगता है उससे ज़्यादा मायने रखता है, क्योंकि लोकल मॉडल के पास कोई घड़ी नहीं होती।
पहले कौन-से तीन चालू करें? कोडिंग के लिए Filesystem, Git और Sequential Thinking आज़माएँ। रिसर्च और नोट्स के लिए Fetch को Memory और Time के साथ जोड़ें। ब्राउज़र ऑटोमेशन के लिए Playwright को अकेले चलाएँ, ताकि उसकी टूल सूची को पूरी कॉन्टेक्स्ट विंडो अकेले मिले।
💡 SQLite, PostgreSQL, GitHub, Brave Search और Puppeteer के सर्वर पहले रेफ़रेंस कलेक्शन में थे, लेकिन अब वे एक आर्काइव में हैं। किसी पर निर्भर होने से पहले कोई मेंटेन किया जाने वाला विकल्प ढूँढ लें।
टूल अच्छी तरह कॉल करने वाले मॉडल
जो मॉडल टूल कॉल का फ़ॉर्मेट ठीक से नहीं बना सकता, उसके साथ एक बेहतरीन सर्वर भी बेकार है। लोकल टूल कॉलिंग के लिए लोग आमतौर पर Qwen, Llama 3.1 और उसके नए वर्ज़न, और Codestral की सलाह देते हैं। दो और आज़माने लायक हैं। GPT OSS 20B ओपन वेट्स वाला एक मॉडल है जिसे OpenAI ने एजेंटिक काम, जैसे function calling, को ध्यान में रखकर बनाया है, और OpenAI के अनुसार यह 16 GB मेमोरी में चलता है। Granite 4.1 8B IBM का कॉम्पैक्ट विकल्प है, जो मिड-रेंज GPU के लिए है।
ये दोनों PicassoIA पर होस्टेड मॉडल के रूप में उपलब्ध हैं, यानी आप कोई वेट डाउनलोड करने से पहले वहाँ प्रॉम्प्ट का अभ्यास कर सकते हैं। ये होस्टेड रन आपकी मशीन पर नहीं, PicassoIA के सर्वर पर होते हैं।
क्या देखें
नेटिव टूल कॉलिंग: मॉडल कार्ड में चैट टेम्प्लेट में टूल सपोर्ट देखें। उसके बिना क्लाइंट भरोसेमंद न होने वाली प्रॉम्प्ट चालों पर निर्भर हो जाता है।
कॉन्टेक्स्ट लेंथ: 16K से 32K टोकन का लक्ष्य रखें, ताकि टूल स्कीमा, नतीजे और पूरी बातचीत आ सके।
क्वांटाइज़ेशन: कम-बिट वर्ज़न मेमोरी बचाते हैं, लेकिन आर्गुमेंट फ़ॉर्मेटिंग को कम भरोसेमंद बना सकते हैं। अगर कॉल फ़ेल होने लगें, तो ज़्यादा-बिट वाली फ़ाइल आज़माएँ।
कम टेम्परेचर: 0.1 से 0.3 JSON आर्गुमेंट को स्थिर रखता है।
PicassoIA पर GPT OSS 20B इस्तेमाल करें
कुछ भी डाउनलोड करने से पहले, आप जाँच सकते हैं कि एक मॉडल टूल कॉल कैसे फ़ॉर्मेट करता है। इसमें लगभग दो मिनट लगते हैं।
मॉडल पेज खोलें।PicassoIA पर GPT OSS 20B पर जाएँ। कोई पैरामीटर ज़रूरी नहीं है, इसलिए आपको सिर्फ़ एक प्रॉम्प्ट चाहिए।
टूल-स्टाइल प्रॉम्प्ट लिखें। कुछ टूल उनके आर्गुमेंट के साथ सूचीबद्ध करें, फिर एक काम दें:
You can call these tools. Reply with JSON only.
read_file(path), list_directory(path), git_diff(repo)
Task: show me what changed in the notes folder today.
पैरामीटर सेट करें।Temperature को स्थिर आउटपुट के लिए डिफ़ॉल्ट 0.1 पर रखें, Top P 1 पर, दोनों पेनल्टी 0 पर, और Max Tokens 2048 पर, जब तक आपको लंबे जवाब की उम्मीद न हो।
जेनरेट करें और जाँचें। क्या JSON वैध है? क्या उसने सही टूल और समझदार आर्गुमेंट चुना?
सुधारें, फिर आगे बढ़ाएँ। आउटपुट स्थिर होने तक शब्द बदलें, फिर वही निर्देश LM Studio या Ollama में सिस्टम प्रॉम्प्ट के रूप में दोबारा इस्तेमाल करें।
💡 यह सिर्फ़ यह टेस्ट करता है कि मॉडल कॉल कैसे फ़ॉर्मेट करता है। यह आपके MCP सर्वर से कनेक्ट नहीं होता, इसलिए इसे अभ्यास समझें, लोकल रन का विकल्प नहीं।
अपने सेटअप को सुरक्षित रखें
MCP सर्वर कोड चला सकता है, फ़ाइलें पढ़ सकता है और आपका नेटवर्क इस्तेमाल कर सकता है। यही उसे उपयोगी बनाता है, और यही वजह है कि LM Studio के डॉक्स कहते हैं कि अविश्वसनीय स्रोतों से कभी MCP इंस्टॉल न करें।
हर फ़ोल्डर का दायरा तय करें
Filesystem सर्वर को हर प्रोजेक्ट के लिए एक फ़ोल्डर दें, कभी ड्राइव की जड़ नहीं।
जब भी मॉडल commit कर सकता है, तब git ब्रांच पर काम करें।
अगर हो सके तो सर्वर को अलग OS यूज़र या कंटेनर में चलाएँ।
जो भी टूल लिखे, मिटाए या डेटा भेजे, उसके लिए कन्फ़र्मेशन चालू रखें।
एक ही चैट में Fetch या Playwright जैसे वेब टूल को लिखने की अनुमति के साथ न जोड़ें, क्योंकि कोई शत्रुतापूर्ण पेज मॉडल को भटका सकता है।
कॉन्टेक्स्ट बजट पर नज़र रखें
मॉडल को दोष देने से पहले जाँचें कि आपके टूल विवरण कितने टोकन लेते हैं। सर्वर जोड़ने के बाद अगर वह निर्देशों को अनदेखा करने लगे, तो पहले सर्वर हटाएँ। तीन सोच-समझकर चुने गए सर्वर उस बातचीत को दबाने वाले दर्जन भर सर्वर से बेहतर हैं।
अपने एजेंट में इमेज जनरेशन जोड़ें
लोकल मॉडल चित्र नहीं बना सकते, लेकिन MCP क्लाइंट आपके लोकल सर्वरों के साथ एक होस्टेड इमेज सर्वर भी जोड़ सकता है। लोकल मॉडल प्रॉम्प्ट लिखता है और होस्टेड मॉडल उसे रेंडर करता है। PicassoIA इसके लिए एक API और एक MCP कनेक्शन देता है। API api.picassoia.com/v1 पर है और Bearer tokens इस्तेमाल करता है, और MCP कनेक्शन चार मॉडल दिखाता है: टेक्स्ट-टू-इमेज के लिए PicassoIA Image, एडिट के लिए PicassoIA Image Editor Pro, और दो वीडियो मॉडल।
यह कनेक्शन आप अपने अकाउंट के MCP पेज से सेट करते हैं। LM Studio में रिमोट सर्वर को mcp.json में url और headers के रूप में डाला जाता है, वही पैटर्न जो डॉक्स दूसरे रिमोट सर्वर के लिए दिखाते हैं।
दो सावधानियाँ लागू होती हैं:
प्राइवेसी: प्रॉम्प्ट आपकी मशीन से बाहर जाता है, इसलिए इमेज रिक्वेस्ट में निजी सामग्री न डालें।
सीमाएँ: अकाउंट में एक साथ 5 concurrent predictions की अनुमति है, जो आपके API tokens और MCP कनेक्शन में साझा होती है। किसी वर्कफ़्लो को इस पर बनाने से पहले प्राइसिंग पेज देखें कि कौन-सा plan API और MCP एक्सेस देता है।
PicassoIA पर अपनी इमेज बनाएँ
इस सेटअप का फ़ायदा लेने के लिए आपको पूरे एजेंट की ज़रूरत नहीं है। अपने लोकल मॉडल से एक ही दृश्य के तीन इमेज प्रॉम्प्ट माँगें, जो अलग-अलग कोणों से हों: एक लो शॉट, एक ओवरहेड शॉट और एक क्लोज़-अप। उन्हें PicassoIA Image में डालें और नतीजों की साथ-साथ तुलना करें।
फिर अपनी पसंदीदा इमेज को PicassoIA Image Editor Pro में खोलें, ताकि आप रोशनी ठीक करें, कोई चीज़ बदलें या कोई बारीकी साफ़ करें। साफ़ सब्जेक्ट, रोशनी की दिशा और लेंस की पसंद वाले छोटे प्रॉम्प्ट आम तौर पर सबसे तीखे फ़ोटोग्राफ़िक नतीजे देते हैं।
इसे अपने अगले ब्लॉग हेडर, प्रोडक्ट मॉकअप या डेस्कटॉप वॉलपेपर पर आज़माएँ। आपका लोकल मॉडल जितने प्रॉम्प्ट ड्राफ़्ट करेगा और आप जितने प्रयोग करेंगे, उतनी जल्दी आपको काम करने वाला शब्द-संयोजन मिल जाएगा, और PicassoIA हर दौर को दोहराना सस्ता बनाता है।