LM Studio MCP इमेज जनरेशन: स्टेप-बाय-स्टेप लोकल सेटअप
अपने कंप्यूटर पर LM Studio MCP इमेज जनरेशन चलाने का व्यावहारिक ट्यूटोरियल। LM Studio इंस्टॉल करें, टूल कॉल कर सकने वाला मॉडल चुनें, mcp.json एडिट करें, इमेज टूल जोड़ें, पहली कॉल को अप्रूव करें और वे एरर ठीक करें जो ज़्यादातर सेटअप रोक देते हैं। काम करने वाला कोड भी शामिल है।
आप अपने कंप्यूटर की चैट विंडो में एक वाक्य लिखते हैं, और कुछ सेकंड बाद बातचीत में एक तैयार फ़ोटो दिख जाती है। कोई ब्राउज़र टैब नहीं, ऐप्स के बीच कॉपी-पेस्ट नहीं, और कोई क्लाउड चैटबॉट आपके ड्राफ़्ट नहीं पढ़ता। जब सारे हिस्से जुड़ जाते हैं, तो LM Studio MCP इमेज जनरेशन ऐसा ही महसूस होता है, और यह जुड़ाव लगभग पंद्रह मिनट लेता है। यह ट्यूटोरियल सेटअप को क्रम से समझाता है: LM Studio इंस्टॉल करना, टूल कॉल कर सकने वाला मॉडल चुनना, mcp.json एडिट करना, इमेज टूल जोड़ना, पहली कॉल अप्रूव करना, और उन समस्याओं को ठीक करना जो ज़्यादातर पहली कोशिशों में अटकाती हैं।
नीचे दी हर फ़ाइल और कमांड कॉपी करने के लिए बनी है। जहाँ कोई डिटेल आपकी मशीन पर निर्भर करती है, वहाँ एक कॉलआउट बताता है कि आगे बढ़ने से पहले क्या जाँचना है।
यहाँ लोकली क्यों चलाएँ?
MCP यहाँ क्या करता है
MCP, यानी Model Context Protocol, एक मानक तरीका है जिससे कोई ऐप भाषा मॉडल को टूल देता है। LM Studio होस्ट है। वह आपकी मशीन पर एक मॉडल लोड करता है, एक या अधिक MCP सर्वर से जुड़ता है, और मॉडल को दिखाता है कि हर सर्वर क्या कर सकता है। जब मॉडल को लगता है कि कोई टूल उपयोगी है, तो LM Studio उसे चलाता है और नतीजा वापस चैट में भेज देता है।
इमेज के लिए टूल सरल है। मॉडल एक प्रॉम्प्ट लिखता है, generate_image जैसा कुछ कॉल करता है, और एक इमेज URL पाता है। भाषा मॉडल एक भी पिक्सेल नहीं बनाता। वह डायरेक्टर की तरह काम करता है: आपका ढीला-ढाला विचार लेता है, उसे विस्तृत ब्रीफ़ में बदलता है, और वह ब्रीफ़ इमेज इंजन को सौंप देता है।
लोकल चैट, रिमोट इमेज इंजन
यह बँटवारा मायने रखता है, क्योंकि यही तय करता है कि आपका हार्डवेयर बजट कितना होगा।
हिस्सा
कहाँ चलता है
इसकी कीमत
LM Studio में चैट मॉडल
आपका कंप्यूटर
मेमोरी और GPU का समय
MCP सर्वर प्रोसेस
आपका कंप्यूटर
कुछ मेगाबाइट
टूल के पीछे इमेज मॉडल
आपका GPU या होस्टेड API
आपके चुने विकल्प पर निर्भर
एक ही कंज़्यूमर ग्राफ़िक्स कार्ड पर चैट मॉडल के साथ इमेज मॉडल चलाना संभव है, पर तंग रहता है, क्योंकि दोनों को वीडियो मेमोरी चाहिए। टूल को होस्टेड API की ओर भेजने से GPU भाषा मॉडल के लिए खाली रहता है। आपकी बातचीत, आपकी फ़ाइलें और आपके टूल अप्रूवल आपकी मशीन पर रहते हैं, और सिर्फ़ अंतिम इमेज प्रॉम्प्ट बाहर जाता है। यह ट्यूटोरियल होस्टेड रास्ता अपनाता है और उदाहरण के लिए PicassoIA API इस्तेमाल करता है, लेकिन यही पैटर्न किसी भी इमेज सर्विस पर फ़िट होता है।
💡 क्या आप सब कुछ ऑफ़लाइन चाहते हैं? टूल का बैकएंड किसी लोकल इमेज सर्वर से बदल दें। सेटअप का LM Studio वाला हिस्सा बिल्कुल वैसा ही रहता है।
शुरू करने से पहले क्या चाहिए
काम करने वाला हार्डवेयर
चैट मॉडल का आकार न्यूनतम ज़रूरत तय करता है। ये संख्याएँ 4-बिट बिल्ड के लिए मोटा अनुमान हैं, बेंचमार्क नहीं, इसलिए कॉन्टेक्स्ट विंडो के लिए जगह छोड़ें।
मॉडल क्लास
ज़रूरी मेमोरी (लगभग)
आरामदेह मशीन
7B से 8B
लगभग 5 GB
16 GB RAM वाला लैपटॉप
20B
लगभग 16 GB
32 GB RAM वाला डेस्कटॉप या 16 GB GPU
30B और ऊपर
24 GB और ऊपर
वर्कस्टेशन GPU या 48 GB यूनिफ़ाइड मेमोरी वाला Mac
Apple Silicon Mac में CPU और GPU एक ही मेमोरी पूल साझा करते हैं, इसलिए वे मध्यम आकार के मॉडलों में हैरान करने वाली अच्छी परफ़ॉर्मेंस देते हैं। Windows और Linux पर 12 GB या उससे ज़्यादा VRAM वाला NVIDIA कार्ड सबसे सहज अनुभव देता है, और अगर धीमे जवाब मंज़ूर हों तो सिर्फ़ CPU पर भी चल जाता है।
सॉफ़्टवेयर चेकलिस्ट
LM Studio 0.3.17 या उसके बाद का वर्ज़न। उस रिलीज़ में MCP सपोर्ट जुड़ा था। पुराने बिल्ड में Program टैब नहीं होता।
Node.js (करंट LTS)। नीचे दिखाए गए लोकल कमांड सर्वर के लिए चाहिए।
एक इमेज सर्विस टोकन। PicassoIA के लिए API पेज पर एक सीक्रेट बनाएँ। वह pia_sk_ से शुरू होता है।
एक सादा टेक्स्ट एडिटर। ऐप में बना एडिटर चलता है, पर JSON मिलाते समय दूसरी विंडो मददगार रहती है।
LM Studio और एक मॉडल इंस्टॉल करें
डाउनलोड और इंस्टॉल
lmstudio.ai से Windows, macOS या Linux का इंस्टॉलर डाउनलोड करें और उसे किसी भी डेस्कटॉप ऐप की तरह चलाएँ। ऐप खोलें, फिर सेटिंग्स में वर्ज़न नंबर देखें। अगर वह 0.3.17 से कम दिखे, तो आगे बढ़ने से पहले अपडेट करें, क्योंकि अगले सेक्शन की कोई भी चीज़ पुराने बिल्ड में नहीं होती।
पहली लॉन्च पर मॉडल कैटलॉग दिखता है। अभी सबसे बड़े नामों को छोड़ दें। जो छोटा मॉडल दो सेकंड में जवाब देता है, वह आपके सेटअप के बारे में उस बड़े मॉडल से ज़्यादा बताता है जो हर जवाब में एक मिनट लगाता है।
टूल-रेडी मॉडल चुनें
टूल कॉलिंग एक प्रशिक्षित व्यवहार है। जिस मॉडल ने कभी टूल-उपयोग के उदाहरण नहीं देखे, वह आपके इमेज सर्वर को नज़रअंदाज़ करेगा या एक टूटी हुई कॉल गढ़ देगा। डाउनलोड करने से पहले हर मॉडल कार्ड में "tool use" या "function calling" देखें।
दो समझदार शुरुआती विकल्प हैं, जिन्हें आप पहले ब्राउज़र में आज़मा सकते हैं, ताकि बैंडविड्थ खर्च करने से पहले उनका लिखने का तरीका परख सकें:
मॉडल लोड करते समय कॉन्टेक्स्ट लेंथ सेटिंग पर ध्यान दें। टूल के विवरण, आपका सिस्टम प्रॉम्प्ट और पूरी बातचीत, सब उसी विंडो को साझा करते हैं। छोटी विंडो जल्दी भर जाती है, और जो मॉडल टूल का विवरण खो देता है, वह टूल कॉल करना बंद कर देता है। कम से कम 8,000 टोकन से शुरू करें, और अगर मॉडल पिछले चरण भूलने लगे तो बढ़ाएँ।
💡 पहले 4-बिट क्वांटाइज़्ड बिल्ड डाउनलोड करें। प्रॉम्प्ट लिखने की गुणवत्ता पर लगभग कोई असर नहीं पड़ता, और फ़ाइल फ़ुल-प्रेसिज़न आकार की लगभग एक-चौथाई होती है।
MCP सर्वर जोड़ें
ऐप में mcp.json खोलें
LM Studio में कोई भी चैट खोलें।
दाएँ साइडबार में Program टैब पर जाएँ।
Install पर क्लिक करें, फिर Edit mcp.json पर।
फ़ाइल को बिल्ट-इन एडिटर में एडिट करें और सेव करें।
LM Studio, Cursor के mcp.json नोटेशन का पालन करता है, इसलिए Cursor के लिए लिखा कॉन्फ़िग यहाँ भी उसी तरह पढ़ा जाता है। सेव करने पर सर्वर शुरू होना चाहिए और अपने टूल की सूची दिखानी चाहिए। इस समय लाल एरर लगभग हमेशा टूटे JSON का संकेत है।
रिमोट सर्वर जोड़ें
रिमोट सर्वर को एक URL चाहिए और आमतौर पर आपकी क्रेडेंशियल्स वाला एक हेडर:
URL की जगह वह पता डालें जो आपका इमेज प्रोवाइडर प्रकाशित करता है। PicassoIA अपने MCP कनेक्शन आपके अकाउंट के अंदर सूचीबद्ध करता है, इसलिए कनेक्शन की डिटेल्स वहाँ देखें। अगर किसी प्रोवाइडर का साइन-इन फ़्लो स्टैटिक हेडर की जगह ब्राउज़र लॉगिन माँगता है, तो नीचे दिया लोकल कमांड रास्ता अपनाएँ, जो सादे टोकन के साथ काम करता है।
लोकल कमांड सर्वर जोड़ें
लोकल सर्वर एक छोटा प्रोग्राम है जिसे LM Studio आपके लिए शुरू करता है:
💡 अपना प्लान जाँचें। API एक्सेस आपके PicassoIA प्लान पर निर्भर करता है, इसलिए इस पर रोज़ की दिनचर्या बनाने से पहले प्राइसिंग पेज पर मौजूदा शर्तें पढ़ लें।
चैट विंडो में पहला रन
नई चैट खोलें, अपना टूल-रेडी मॉडल लोड करें, और पुष्टि करें कि Program टैब में सर्वर enabled दिख रहा है। फिर कुछ ठोस माँगें:
शांत बंदरगाह की एक 16:9 फ़ोटो बनाएँ, सूर्योदय के समय, मछली पकड़ने वाली नावें आराम से खड़ी हों, हल्का कोहरा हो, 35mm फ़िल्म पर खींची गई।
सब कुछ जुड़ जाने के बाद एक राउंड ट्रिप ऐसा दिखता है:
आप ऊपर वाला वाक्य भेजते हैं।
मॉडल लगभग 50 शब्दों का विस्तृत ब्रीफ़ बनाता है और generate_image कॉल करने का फ़ैसला करता है।
LM Studio रुककर आपकी मंज़ूरी माँगता है।
सर्वर प्रेडिक्शन बनाता है, उसकी स्थिति जाँचता है और एक URL वापस लाता है।
मॉडल लिंक और उसने जो माँगा उसका एक-पंक्ति का विवरण लौटाकर जवाब देता है।
एक मिड-रेंज लैपटॉप पर पूरा लूप आम तौर पर एक मिनट से काफ़ी कम में हो जाता है, और उसका ज़्यादातर समय भाषा मॉडल के सोचने में जाता है, इमेज इंजन में नहीं।
टूल कॉल को अप्रूव करें
जब मॉडल आपका टूल कॉल करता है, तो LM Studio पहले एक कन्फ़र्मेशन डायलॉग दिखाता है। आप आर्गुमेंट्स देख सकते हैं, उन्हें एडिट कर सकते हैं, और फिर अप्रूव कर सकते हैं। टेस्ट करते समय allow once चुनें, या किसी भरोसेमंद टूल के लिए always allow। स्थायी अनुमतियाँ बाद में ऐप सेटिंग्स में प्रबंधित की जा सकती हैं।
शुरू में हर बार आर्गुमेंट्स पढ़ें। यहीं दिखता है कि मॉडल ने असल में क्या लिखा: प्रॉम्प्ट, रेशियो, और जो भी अजीब चीज़ उसने जोड़ी। एक ऐसा मॉडल जो एक पैराग्राफ़ वाले टूल को 3,000 अक्षरों का निबंध भेजता है, उसे ज़्यादा सख़्त सिस्टम प्रॉम्प्ट चाहिए।
अप्रूव करने के बाद टूल चलता है, एक इमेज URL लौटाता है, और मॉडल चैट में रिपोर्ट करता है। नतीजा देखने के लिए लिंक खोलें।
ऐसे प्रॉम्प्ट लिखें जो काम करें
मॉडल तब बेहतर इमेज प्रॉम्प्ट लिखते हैं जब सिस्टम प्रॉम्प्ट उन्हें बताए कि कैसे लिखना है। यह सिस्टम प्रॉम्प्ट फ़ील्ड में चिपकाएँ:
आप एक फ़ोटो डायरेक्टर हैं। जब इमेज माँगी जाए, तो generate_image को एक प्रॉम्प्ट के साथ कॉल करें, जो 40 से 70 शब्दों का हो: विषय और क्रिया, सेटिंग, रोशनी की दिशा, लेंस और दूरी, और सतह की बनावट। कभी भी neon, cartoon या 3D स्टाइल का अनुरोध न करें।
यह क्यों काम करता है: इमेज मॉडल उन्हीं संकेतों पर प्रतिक्रिया देते हैं जिनमें एक फ़ोटोग्राफ़र सोचता है।
सब्जेक्ट और क्रिया सादे शब्दों में सबसे पहले आते हैं।
रोशनी की एक दिशा होती है: "बाईं ओर से खिड़की की रोशनी" या "बादल भरा दोपहर"।
लेंस और दूरी फ़्रेमिंग तय करते हैं: "85mm क्लोज़-अप" या "24mm वाइड शॉट"।
बनावट यथार्थता जोड़ती है: "ऊन की बुनावट", "गीला पत्थर", "बारीक फ़िल्म ग्रेन"।
ड्राफ़्ट के लिए छोटे प्रॉम्प्ट चल जाते हैं। अंतिम इमेज के लिए विवरण जोड़ें, और अगर आपका टूल फ़िक्स्ड सीड देता है तो उसी के साथ दोबारा रन करें, ताकि एक समय में सिर्फ़ एक चीज़ बदले।
समस्याएँ ठीक करें और सुरक्षित रहें
सर्वर शुरू नहीं होता
इस सूची को क्रम से जाँचें:
JSON वैलिडेट करें। एक ट्रेलिंग कॉमा भी सब कुछ रोकने के लिए काफ़ी है।
कमांड हाथ से चलाएँ।command और args को टर्मिनल में चिपकाएँ। अगर वहाँ फ़ेल होता है, तो LM Studio में भी फ़ेल होगा।
पाथ जाँचें। Windows पर फ़ॉरवर्ड स्लैश, और कोई फ़ालतू स्पेस नहीं।
एनवायरनमेंट वेरिएबल जाँचें। खाली टोकन क्रैश के बजाय API से ऑथराइज़ेशन एरर देता है, इसलिए टूल का एरर टेक्स्ट पढ़ें।
मॉडल टूल को नज़रअंदाज़ करता है
तीन कारण ज़्यादातर मामलों को समझा देते हैं:
मॉडल को टूल के लिए प्रशिक्षित नहीं किया गया। ऐसा मॉडल चुनें जिसके कार्ड पर tool use लिखा हो।
बहुत सारे टूल। LM Studio का अपना दस्तावेज़ चेतावनी देता है कि क्लाउड असिस्टेंट के लिए बने सर्वर बहुत सारे टोकन इस्तेमाल कर सकते हैं और लोकल मॉडल पर भारी पड़ सकते हैं। एक या दो सर्वर सक्रिय रखें, दस नहीं।
कॉन्टेक्स्ट विंडो बहुत छोटी है। कॉन्टेक्स्ट लेंथ बढ़ाएँ, ताकि टूल के विवरण और चैट इतिहास दोनों समा सकें।
💡 जॉब प्रोसेसिंग में अटकी है? याद रखें कि एक साथ 5 प्रेडिक्शन की सीमा है। API POST /v1/predictions/{id}/cancel भी देता है, जो अटके हुए जॉब्स को साफ़ करने के लिए है।
अपना API टोकन सुरक्षित रखें
LM Studio का दस्तावेज़ साफ़ कहता है: कभी भी अविश्वसनीय स्रोतों से MCP सर्वर इंस्टॉल न करें। कोई सर्वर मनमाना कोड चला सकता है, लोकल फ़ाइलें पढ़ सकता है और आपके नेटवर्क कनेक्शन का इस्तेमाल कर सकता है। mcp.json में हर एंट्री को उस ऐप की तरह मानें जिसे आप इंस्टॉल कर रहे हैं।
अपने टोकन के लिए:
सीक्रेट को env ब्लॉक में रखें, कभी किसी चैट मैसेज या प्रॉम्प्ट में नहीं।
याद रखें कि mcp.json उसे सादे टेक्स्ट में सेव करता है, इसलिए वह फ़ाइल कभी किसी पब्लिक रिपॉज़िटरी में कमिट न करें।
PicassoIA हर अकाउंट पर दो टोकन की अनुमति देता है, इसलिए एक-एक करके रोटेट करें: नया बनाएँ, mcp.json अपडेट करें, फिर पुराना हटाएँ।
जिस सर्वर को आपने खुद नहीं लिखा, उसके लिए अनुमतियाँ allow once पर रखें।
PicassoIA पर P Image कैसे इस्तेमाल करें
प्रॉम्प्ट को टूल में जोड़ने से पहले उसे ब्राउज़र में टेस्ट करें। PicassoIA पर P Image एक सेकंड से कम में तैयार इमेज देता है और जेनरेशन असीमित हैं, इसलिए यह उन प्रॉम्प्ट्स के लिए तेज़ सैंडबॉक्स है जिन्हें आपका भाषा मॉडल बाद में लिखेगा।
प्रॉम्प्ट चिपकाएँ। प्रॉम्प्ट ही एकमात्र ज़रूरी फ़ील्ड है। वह इस्तेमाल करें जो आपके लोकल मॉडल ने लिखा।
आस्पेक्ट रेशियो सेट करें। डिफ़ॉल्ट 1:1 है। वाइड इमेज के लिए 16:9 चुनें, या custom के साथ वह चौड़ाई और ऊँचाई डालें जो 16 के गुणज हों।
वैकल्पिक सेटिंग्स बदलें। छोटे प्रॉम्प्ट के लिए prompt upsampling चालू करें। किसी नतीजे को दोबारा पाना हो तो सीड डालें।
जेनरेट करें। जेनरेट बटन पर क्लिक करें और लगभग एक सेकंड इंतज़ार करें।
डाउनलोड करें। इमेज सेव करें और उसकी तुलना LM Studio में आपके टूल के नतीजे से करें।
पैरामीटर
टाइप
यह क्या करता है
prompt
string
ज़रूरी। टेक्स्ट विवरण
aspect_ratio
choice
डिफ़ॉल्ट 1:1, साथ में 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, custom
width, height
integer
सिर्फ़ custom के साथ इस्तेमाल, 16 के गुणज
prompt_upsampling
boolean
LLM को छोटे प्रॉम्प्ट में विज़ुअल विवरण जोड़ने देता है
seed
integer
वही सीड और प्रॉम्प्ट वही इमेज दोहराते हैं
अगर ड्राफ़्ट सही लगे लेकिन आपको कोई अलग लुक चाहिए, तो वही प्रॉम्प्ट Z-Image Turbo, Flux 2 Klein 4B या Seedream 4.5 पर चलाएँ और जो आपके प्रोजेक्ट पर फ़िट बैठे उसे रखें।
आज ही अपनी इमेज बनाएँ
अब आपके पास एक चैट विंडो है जो ब्रीफ़ लिखती है, और एक इंजन है जो उन्हें फ़ोटो में बदलता है। आज रात एक राउंड आज़माएँ। अपने लोकल मॉडल से किसी ऐसे दृश्य के लिए तीन प्रॉम्प्ट माँगें जो आपके लिए मायने रखता हो, हर एक को P Image पर PicassoIA में चिपकाएँ, और देखें कि कौन-सा शब्दांकन सबसे तीखा नतीजा देता है। फिर जीती हुई स्टाइल अपने LM Studio टूल को भेजें और वही इमेज चैट छोड़े बिना सामने आते देखें।
PicassoIA इमेज एडिटिंग, अपस्केलिंग और छोटे वीडियो क्लिप्स भी देता है, ताकि एक अच्छी स्टिल इमेज आगे चलकर थंबनेल, पोस्टर या चलते दृश्य में बदल सके। पूरा कैटलॉग picassoia.com/en/all-models पर देखें, कोई मॉडल चुनें, और आज ही अपनी पहली इमेज बनाएँ।