इमेज जनरेशन के लिए सबसे अच्छा AI एजेंट (फ़्री और लोकल): आपके अपने PC पर असल में क्या चलता है

एक फ़्री, लोकल इमेज एजेंट आपके अपने ग्राफ़िक्स कार्ड पर एक छोटे लैंग्वेज मॉडल को डिफ्यूज़न बैकएंड के साथ जोड़ता है। यह आर्टिकल ComfyUI, InvokeAI, Forge, Fooocus और Open WebUI सेटअप की तुलना करता है, असली VRAM ज़रूरतें बताता है, और दिखाता है कि आपका हार्डवेयर कम पड़ने पर होस्टेड विकल्प कहाँ काम आता है।

इमेज जनरेशन के लिए सबसे अच्छा AI एजेंट (फ़्री और लोकल): आपके अपने PC पर असल में क्या चलता है
Cristian Da Conceicao
Picasso IA के संस्थापक

फ़्री AI इमेज एजेंट खोजने वाले ज़्यादातर लोगों को एक ही चीज़ चाहिए: अपनी बात टाइप करें, तैयार तस्वीर पाएँ, और कभी बिल न देखना पड़े। पेच यह है कि "एजेंट" शब्द के पीछे दो अलग काम छिपे हैं। एक हिस्सा सोचता है: वह आपका अनुरोध पढ़ता है, बेहतर प्रॉम्प्ट लिखता है, नतीजे की जाँच करता है और फिर कोशिश करता है। दूसरा हिस्सा चित्र बनाता है: एक डिफ्यूज़न मॉडल, जो उस प्रॉम्प्ट को पिक्सल में बदलता है। दोनों को अपने घर के PC पर हर महीने शून्य डॉलर में चलाया जा सकता है, लेकिन तभी जब दोनों हिस्से आपके ग्राफ़िक्स कार्ड के हिसाब से मेल खाएँ।

यह आर्टिकल उन सेटअप की तुलना करता है जो लोग घर पर असल में चलाते हैं, बताता है कि हर एक को किस तरह का हार्डवेयर चाहिए, और ज़्यादातर पाठकों के लिए एक साफ़ विजेता बताता है। यह भी बताता है कि लोकल सेटअप कहाँ जाकर रुक जाता है, क्योंकि यह दिखावा करना कि वह कभी रुकता ही नहीं, आपका वीकेंड बर्बाद करेगा।

असल में इमेज एजेंट क्या है

सुबह की रोशनी में किचन टेबल पर लैपटॉप पर टाइप करता एक युवा आदमी

दिमाग़ और ब्रश

एक साधारण इमेज जनरेटर एक प्रॉम्प्ट लेता है और एक तस्वीर लौटाता है। एजेंट उसके चारों ओर एक लूप लपेटता है। एक लैंग्वेज मॉडल आपका लक्ष्य पढ़ता है ("लिनन के कपड़े पर एक सिरेमिक मग की प्रोडक्ट फ़ोटो, सुबह की रोशनी"), उसे एक विस्तृत प्रॉम्प्ट में फैलाता है, इमेज टूल को कॉल करता है, आउटपुट देखता है, और फ़ैसला करता है कि उसे रखे या फिर से कोशिश करे।

लोकल बिल्ड में, दिमाग़ आम तौर पर एक छोटा ओपन-वेट लैंग्वेज मॉडल होता है, जिसे Ollama या LM Studio चलाते हैं। लोकल आकार के अच्छे विकल्पों में IBM Granite 4.1 8B और GPT OSS 20B शामिल हैं। ब्रश एक डिफ्यूज़न मॉडल है, जो ComfyUI, InvokeAI, Forge या ऐसे ही किसी फ़्रंट एंड के अंदर चलता है।

फ़्री और लोकल क्यों मायने रखता है

लोकल चलाने से तीन बार-बार होने वाली परेशानियाँ दूर हो जाती हैं:

  • प्रति इमेज कोई फ़ीस नहीं। आपका खर्च बिजली और वह कार्ड है जो आपके पास पहले से है।
  • कोई कतार नहीं। दूसरों का ट्रैफ़िक आपके बैच को धीमा नहीं करता।
  • पूरी प्राइवेसी। रेफ़रेंस फ़ोटो, क्लाइंट फ़ाइलें और अनरिलीज़्ड प्रोडक्ट कभी आपकी मशीन से बाहर नहीं जाते।

💡 त्वरित जाँच: अगर आप महीने में कुछ दर्जन से कम इमेज बनाते हैं, तो लोकल स्टैक की सेटअप में लगने वाला समय उसकी बचत से ज़्यादा पड़ सकता है। अगर आप सैकड़ों इमेज बनाते हैं, तो यह जल्दी फ़ायदेमंद हो जाता है।

पहले आपको किस हार्डवेयर की ज़रूरत है

बड़े तीन-पंखों वाले ग्राफ़िक्स कार्ड को डेस्कटॉप कंप्यूटर केस में लगाते हाथ

VRAM लगभग सब कुछ तय करती है

आपके ग्राफ़िक्स कार्ड की वीडियो मेमोरी पहला फ़िल्टर है। प्रोसेसर की स्पीड और सिस्टम RAM का असर इससे कहीं कम होता है। नीचे की टेबल मोटे, व्यावहारिक स्तर देती है। सटीक संख्याएँ मॉडल के वर्ज़न, क्वांटाइज़ेशन लेवल और आप जिस रिज़ॉल्यूशन की माँग करते हैं, उसके साथ बदलती हैं।

वीडियो मेमोरीअच्छे से चलने वाले इमेज मॉडलसाथ में फ़िट होने वाला लैंग्वेज मॉडलक्या उम्मीद करें
4 GBपुराने, छोटे मॉडल4-bit पर 3Bधीमा, कम रिज़ॉल्यूशन
6 से 8 GBमेमोरी ऑफ़लोडिंग के साथ SDXL, कॉम्पैक्ट टर्बो मॉडल4-bit पर 7B से 8Bएक मिनट से कम में उपयोगी 1024 px इमेज
12 GBआराम से SDXL, क्वांटाइज़्ड FLUX वेरिएंट4-bit पर 8Bरोज़ का सहज काम
16 से 24 GBकम प्रिसिज़न में FLUX 2 Dev और Qwen Image 251220B क्लासउपलब्ध सबसे अच्छी लोकल क्वालिटी

इमेज मॉडल और लैंग्वेज मॉडल एक ही मेमोरी के लिए लड़ते हैं। व्यावहारिक हल सीधा है: ComfyUI को स्टेप के बीच मॉडल अनलोड करने दें, और Ollama की keep_alive वैल्यू कम रखें, ताकि प्रॉम्प्ट लिखने के बाद लैंग्वेज मॉडल मेमोरी से निकल जाए। Ollama डिफ़ॉल्ट रूप से किसी मॉडल को पाँच मिनट तक लोड रखता है, जो 8 GB कार्ड पर बहुत ज़्यादा है।

सिर्फ़ CPU और Apple Silicon

कोई समर्पित ग्राफ़िक्स कार्ड नहीं है? तब भी विकल्प हैं, बस धीमे। Apple Silicon Mac प्रोसेसर और GPU के बीच मेमोरी साझा करते हैं, इसलिए 32 GB वाली मशीन हैरानी की हद तक बड़े मॉडल रख सकती है। Draw Things जैसे फ़्री ऐप्स इसी डिज़ाइन के आधार पर बने हैं। सिर्फ़ CPU वाला PC छोटे मॉडल चला सकता है, लेकिन हर तस्वीर में सेकंड की जगह मिनट लगने की उम्मीद रखें।

शाम के समय एक छोटे अपार्टमेंट होम ऑफ़िस में लकड़ी की मेज़ के पास रखा डेस्कटॉप टावर

सबसे अच्छे लोकल टूल्स का सेट, रैंकिंग के साथ

यह रहा ईमानदार रैंकिंग, सबसे सक्षम से लेकर सबसे आसानी से सीखे जाने वाले तक। नीचे का हर टूल डाउनलोड के लिए फ़्री है।

स्टैककिसके लिए सबसे अच्छाएजेंट के लिए तैयारसेटअप की मेहनत
ComfyUI plus Ollama या LM Studioपावर यूज़र, दोहराने योग्य पाइपलाइनहाँ, बिल्ट-इन API सर्वरज़्यादा
Open WebUI plus Ollamaचैट-स्टाइल एजेंट फ़्रंट एंडहाँ, ComfyUI से जुड़ता हैमध्यम
InvokeAIकैनवस एडिटिंग, पॉलिश्ड इंटरफ़ेसआंशिक रूप से, इसमें API हैकम से मध्यम
Forgeपरिचित WebUI लेआउट, कम मेमोरी उपयोगहाँ, API फ़्लैग के साथमध्यम
Fooocusपहली बार इस्तेमाल करने वालेसीमितकम

ComfyUI plus एक लोकल लैंग्वेज मॉडल

कुल मिलाकर यह सबसे अच्छा चुनाव है। ComfyUI एक नोड-आधारित टूल है, जिसमें जनरेशन का हर स्टेप एक दिखने वाला ब्लॉक होता है। सुनने में यह डराने वाला लग सकता है, लेकिन यही इसे एजेंट के लिए अनुकूल बनाता है। किसी भी वर्कफ़्लो को API फ़ॉर्मेट में एक्सपोर्ट किया जा सकता है और लोकल पोर्ट (डिफ़ॉल्ट रूप से 8188) पर HTTP कॉल से चलाया जा सकता है। आपका लैंग्वेज मॉडल प्रॉम्प्ट लिखता है, उसे वर्कफ़्लो JSON में भरता है, उसे भेजता है और तैयार फ़ाइल उठा लेता है।

यह क्यों जीतता है:

  • यह सबसे विस्तृत रेंज के इमेज मॉडल सपोर्ट करता है, जिनमें SDXL, FLUX और Qwen Image फ़ैमिली शामिल हैं।
  • वर्कफ़्लो फ़ाइलों के रूप में सेव होते हैं, इसलिए अच्छा नतीजा दोबारा मिल सकता है।
  • ComfyUI के लिए समुदाय के बनाए MCP सर्वर मौजूद हैं, जो टूल-कॉलिंग वाले मॉडल को सीधे इसे चलाने देते हैं। किसी पर भरोसा करने से पहले हर प्रोजेक्ट की हाल की गतिविधि देख लें।

💡 टिप: पहले एक वर्कफ़्लो हाथ से बनाकर टेस्ट करें। एजेंट सिर्फ़ उसी पाइपलाइन को दोहरा सकता है जो पहले से काम कर रही हो।

कंधे के ऊपर से देखती एक डेवलपर, जो तैयार फ़ोटोग्राफ़ों से भरे मॉनिटर को देख रही है

Ollama के साथ Open WebUI

अगर आप JSON जोड़ने की बजाय अपने एजेंट से बात करना चाहते हैं, तो Open WebUI सबसे दोस्ताना रास्ता है। यह लोकल मॉडल के लिए चैट इंटरफ़ेस देता है और इमेज अनुरोध ComfyUI या AUTOMATIC1111 से मिलते-जुलते बैकएंड को भेज सकता है। आप टाइप करते हैं "बारिश वाली शाम की सड़क के तीन वेरिएशन बनाएँ" और चैट विंडो बाकी सब संभाल लेती है। यह कच्ची ComfyUI स्क्रिप्टिंग जितना लचीला नहीं है, लेकिन आप एक दोपहर में ही काम करने लगते हैं।

हाथ से एडिटिंग के लिए InvokeAI

InvokeAI ओपन सोर्स है और एक कैनवस के इर्द-गिर्द बना है। आप पेंट करते हैं, मास्क लगाते हैं और क्षेत्रों को उसी जगह दोबारा जनरेट करते हैं। यह उन इलस्ट्रेटर और फ़ोटोग्राफ़रों के लिए ठीक है जो प्रॉम्प्ट से ज़्यादा एडिट करते हैं। यह पूरी तरह एजेंट टूल कम है, लेकिन इसका API और साफ़ इंटरफ़ेस ComfyUI के साथ एक मज़बूत दूसरा इंस्टॉल बनाता है।

तेज़ शुरुआत के लिए Forge और Fooocus

Forge क्लासिक AUTOMATIC1111 इंटरफ़ेस का हल्का फ़ोर्क है। यह मेमोरी का ज़्यादा सावधानी से इस्तेमाल करता है, इसलिए पुराने कार्ड इससे ज़्यादा फ़ायदा उठाते हैं। Fooocus लगभग हर सेटिंग को एक ही प्रॉम्प्ट बॉक्स के पीछे छिपा देता है, जिससे यह सबसे आसान शुरुआती विकल्प बन जाता है। यह सीमित मेंटेनेंस मोड में है, इसलिए इसे लंबे समय के ठिकाने की बजाय शुरुआती टूल की तरह देखें।

किन इमेज मॉडल को चलाएँ

लैपटॉप के बगल में रखी एक जैसी इमेज दिखाते लैपटॉप के साथ, प्रिंट की गई लैंडस्केप फ़ोटो पकड़े एक फ़ोटोग्राफ़र के हाथ

एजेंट उतना ही अच्छा है जितना उसका ब्रश। यहाँ आम मॉडल एक-दूसरे के मुकाबले कैसे हैं, यह दिया गया है, और इनमें से हर एक का PicassoIA पर पेज है, जहाँ आप वेट डाउनलोड करने में एक घंटा लगाने से पहले उसे आज़मा सकते हैं।

मॉडलताकतआम मेमोरी ज़रूरत
SDXLबड़ा समुदाय, कई फ़ाइन-ट्यून8 GB
Stable Diffusion 3.5 Mediumअच्छा प्रॉम्प्ट फ़ॉलोइंग, मध्यम रेंज के कार्ड10 से 12 GB
FLUX 2 Klein 4Bछोटा और तेज़8 से 12 GB
Z-Image Turboकम स्टेप वाली जनरेशनमध्यम
FLUX 2 Devटॉप-टियर रियलिज़्म16 GB या उससे ज़्यादा
Qwen Image 2512मज़बूत टेक्स्ट रेंडरिंग16 GB या उससे ज़्यादा

छोटे और तेज़ विकल्प

अगर आपके कार्ड में 8 GB या उससे कम मेमोरी है, तो SDXL या Z-Image Turbo से शुरू करें। टर्बो स्टाइल के मॉडल को सिर्फ़ कुछ स्टेप चाहिए, और यह बहुत मायने रखता है जब एजेंट हर अनुरोध पर चार-पाँच कोशिशें माँग सकता है। जो मॉडल हर कोशिश में तीन सेकंड लेता है, वह उस सुंदर मॉडल से बेहतर है जो नब्बे सेकंड लेता है।

बड़े कार्ड के लिए क्वालिटी विकल्प

16 GB या उससे ज़्यादा के साथ, FLUX 2 Dev और Qwen Image 2512 घर पर चलाए जा सकने वाले सबसे यथार्थ लगने वाली स्किन, फ़ैब्रिक और लाइटिंग देते हैं। क्वांटाइज़्ड वर्ज़न थोड़ी डिटेल की कीमत पर मेमोरी का उपयोग काफ़ी कम कर देते हैं, और यह समझौता अक्सर करने लायक होता है।

पहले लाइसेंस कार्ड पढ़ें। "डाउनलोड के लिए फ़्री" और "किसी भी उपयोग के लिए फ़्री" अलग चीज़ें हैं। SDXL एक उदार ओपन लाइसेंस के तहत आता है। Stable Diffusion 3.5 छोटे व्यवसायों के लिए Stability की कम्युनिटी शर्तों के तहत फ़्री है। बड़े FLUX मॉडल के ओपन वेट्स पर अक्सर गैर-व्यावसायिक शर्तें लागू होती हैं। इनसे बनी कोई चीज़ बेचने से पहले मॉडल कार्ड जाँच लें।

अपने कार्ड के हिसाब से मॉडल चुनें

स्थिति के हिसाब से छोटा सार यह है:

  • 8 GB कार्ड, पहली बार: SDXL के साथ Fooocus या Forge, फिर सहज होने पर Open WebUI जोड़ें।
  • 12 GB कार्ड, ऑटोमेशन चाहिए: IBM Granite 4.1 8B जैसे छोटे टूल-कॉलिंग मॉडल के साथ ComfyUI।
  • 16 से 24 GB कार्ड, सबसे अच्छी क्वालिटी चाहिए: FLUX 2 Dev या Qwen Image 2512 के साथ ComfyUI, और 20B क्लास का लैंग्वेज मॉडल।
  • Mac यूज़र: जल्दी काम के लिए Draw Things, और एजेंट पाइपलाइन चाहिए तो ComfyUI।
  • सक्षम हार्डवेयर नहीं है: इंस्टॉल छोड़ें और वही मॉडल PicassoIA पर चलाएँ।

एजेंट लूप कैसे काम करता है

प्रिंट की गई लैंडस्केप फ़ोटो, माउस, कॉफ़ी कप और स्केचबुक के साथ एक करीने से रखी मेज़

प्रॉम्प्ट, जनरेट, जज, रीट्राई

हर काम करने वाला इमेज एजेंट चार चालें दोहराता है:

  1. प्रॉम्प्ट। लैंग्वेज मॉडल आपके छोटे अनुरोध को एक विस्तृत प्रॉम्प्ट में फिर से लिखता है: सब्जेक्ट, सेटिंग, रोशनी, लेंस, मूड।
  2. जनरेट। वह उस प्रॉम्प्ट और एक तय साइज़ के साथ इमेज टूल को कॉल करता है।
  3. जज। विज़न-सक्षम मॉडल, या एक सरल नियम सेट, नतीजे में साफ़ गड़बड़ियाँ जाँचता है, जैसे टेढ़े हाथ या गलत रंग।
  4. रीट्राई। अगर जाँच फ़ेल होती है, तो वह प्रॉम्प्ट या सीड बदलता है और आपकी तय सीमा तक फिर से चलता है।

यह सीमा तय करें। तीन-चार कोशिशों की सीमा के बिना, एक ज़िद्दी अनुरोध पूरी रात आपका GPU व्यस्त रख सकता है।

MCP के ज़रिए टूल जोड़ना

Model Context Protocol लैंग्वेज मॉडल को बाहरी टूल कॉल करने का एक मानक तरीका देता है। LM Studio MCP होस्ट की तरह काम कर सकता है, और Ollama में टूल-कॉलिंग वाले मॉडल छोटी ब्रिज स्क्रिप्ट के ज़रिए मिलते-जुलते सेटअप चला सकते हैं। व्यवहार में आप एक टूल ("generate_image") रजिस्टर करते हैं, जो प्रॉम्प्ट को ComfyUI को भेजता है और फ़ाइल का पाथ लौटाता है। टूल का दायरा सीमित रखें। जो टूल सिर्फ़ प्रॉम्प्ट, आस्पेक्ट रेशियो और सीड स्वीकार करता है, वह छोटे मॉडल के लिए बीस विकल्पों वाले टूल से सही तरीके से कॉल करना आसान होता है।

💡 भरोसेमंद होने का नियम: छोटे लैंग्वेज मॉडल लंबे टूल स्कीमा पर फ़ेल होते हैं। कम पैरामीटर का मतलब है कम टूटी हुई कॉल।

जहाँ लोकल कम पड़ता है

बारिश वाली कैफ़े की खिड़की के पास लैपटॉप पर काम करती एक महिला

फ़्री की असली कीमत

लोकल नकद में फ़्री है, लेकिन ध्यान के मामले में महँगा। इंस्टॉल में एक शाम, कुछ ड्राइवर की गड़बड़ियाँ, और टूल अपडेट होने पर लगातार रखरखाव की उम्मीद रखें। बिजली की लागत लोगों के डर से छोटी है। 15 सेंट प्रति किलोवाट-घंटे पर एक घंटे तक चलने वाला 300 W कार्ड लगभग 4.5 सेंट का पड़ता है। गर्मी और पंखे का शोर रोज़ की बड़ी परेशानी है, खासकर छोटे कमरे में।

लैपटॉप अपनी अलग सीमाएँ जोड़ते हैं। मामूली ग्राफ़िक्स चिप वाला लैपटॉप SDXL चला सकता है, लेकिन गर्म होने पर उसकी स्पीड गिर जाती है और बैटरी जल्दी खत्म होती है। अगर आप कैफ़े या ट्रेन से काम करते हैं, तो आपके घर के डेस्कटॉप पर चलने वाले लोकल टूल्स के सेट तक पहुँचना मुश्किल है, और लैपटॉप के हल्के मॉडल डेस्कटॉप कार्ड जैसा नतीजा नहीं दे पाएँगे।

होस्टेड बैकअप

जब काम आपके कार्ड से बड़ा हो, या आप अपनी डेस्क से दूर हों, तब होस्टेड रास्ता कमी पूरी करता है। PicassoIA के पास बड़ा टेक्स्ट-टू-इमेज कैटलॉग है, इसलिए आप बिना कुछ डाउनलोड किए FLUX 2 Dev, Qwen Image 2512, P-Image और Seedream 4.5 टेस्ट कर सकते हैं। इसमें कोई भी ComfyUI वर्कफ़्लो मॉडल भी होस्ट है, जो तब उपयोगी है जब आपने पहले से कोई पाइपलाइन बना रखी हो और उसे ज़्यादा ताकतवर हार्डवेयर पर चलाना चाहते हों। कई पाठक एक हाइब्रिड तरीका अपनाते हैं: ड्राफ़्ट और निजी काम लोकल पर, और आखिरी भारी रेंडर होस्टेड पर।

PicassoIA पर Flux 2 Dev कैसे इस्तेमाल करें

स्टूडियो की मेज़ पर प्रिंट की गई प्रोडक्ट फ़ोटो देखते दो डिज़ाइनर

यह वही लूप है जो एक लोकल एजेंट करता है, बस हाथ से। किसी मॉडल में डिस्क स्पेस लगाने से पहले यह देखने का तेज़ तरीका है कि वह क्या कर सकता है।

  1. मॉडल पेज खोलें। टेक्स्ट-टू-इमेज कलेक्शन में FLUX 2 Dev पर जाएँ।
  2. प्रॉम्प्ट को परतों में लिखें। पहले विषय बताएँ, फिर सेटिंग, रोशनी और लेंस। उदाहरण: "लिनन के कपड़े पर एक सिरेमिक मग, बाईं ओर से नरम खिड़की की रोशनी, 50mm लेंस, उथली डेप्थ ऑफ़ फ़ील्ड, फ़िल्म ग्रेन"।
  3. गंतव्य के हिसाब से आस्पेक्ट रेशियो चुनें। ब्लॉग बैनर के लिए 16:9, प्रोडक्ट शॉट के लिए 1:1, और स्टोरी के लिए 9:16 इस्तेमाल करें।
  4. सीड को स्थिर रखें। जब कंपोज़िशन सही हो लेकिन एक डिटेल गड़बड़ हो, तो सीड वही रखें और प्रॉम्प्ट में सिर्फ़ एक वाक्यांश बदलें। एक साथ पाँच चीज़ें बदलने से यह देखना असंभव हो जाता है कि क्या काम किया।
  5. दो या तीन वेरिएशन बनाएँ और तुलना करें। बेहतरीन रखें, फिर Qwen Image Edit 2511 जैसे एडिटिंग मॉडल से छोटी खामियाँ ठीक करें।
  6. अगला प्रॉम्प्ट लैंग्वेज मॉडल से लिखवाएँ। अपने नतीजे का विवरण Kimi K2.6 में चिपकाएँ और तीन बेहतर प्रॉम्प्ट वेरिएशन माँगें। यही एजेंट का "दिमाग़" वाला हिस्सा है, जो आपके लिए काम कर रहा है।

💡 टिप: जो प्रॉम्प्ट काम कर गए, उनकी एक टेक्स्ट फ़ाइल रखें। बाद में यही आपके लोकल एजेंट की शुरुआती लाइब्रेरी बन जाएगी।

खुद आज़माएँ Picasso IA पर

शुरू करने से पहले आपको लोकल बनाम होस्टेड का सवाल हल करने की ज़रूरत नहीं है। Picasso IA खोलें, एक टेक्स्ट-टू-इमेज मॉडल चुनें, और वही प्रॉम्प्ट दो या तीन मॉडल पर चलाएँ। दस मिनट में आपको पता चल जाएगा कि कौन-सा स्टाइल आपके काम में फ़िट बैठता है, कौन-सा मॉडल डाउनलोड के लायक है, और आपके प्रॉम्प्ट को कितनी डिटेल चाहिए। फिर उस मॉडल के आसपास अपना लोकल एजेंट बनाएँ जिसे आप पहले से पसंद करते हैं, और जिन दिनों आपके अपने कार्ड को आराम चाहिए, तब Picasso IA खुला रखें।

एक प्रॉम्प्ट लिखें, जनरेट दबाएँ, और देखें कि आपका विचार तस्वीर में कैसा दिखता है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख