अनसेंसर्ड AI इमेज जनरेशन को लोकल मशीन पर कैसे सेट करें
अनसेंसर्ड AI इमेज जनरेशन को लोकली चलाने से सब कुछ आपके नियंत्रण में रहता है। कोई कंटेंट फ़िल्टर नहीं, कोई सब्सक्रिप्शन लिमिट नहीं, डेटा प्राइवेसी की कोई चिंता नहीं। यह आर्टिकल हार्डवेयर की ज़रूरतें, सॉफ़्टवेयर इंस्टॉलेशन, मॉडल चुनने और सेफ़्टी फ़िल्टर हटाने की पूरी प्रक्रिया बताता है, ताकि आप अपनी मशीन पर वह सब जनरेट कर सकें जो आप सोच सकते हैं।
अपने हार्डवेयर पर AI इमेज जनरेशन चलाना आज रचनात्मक आज़ादी में सबसे बड़े बदलावों में से एक है। कोई क्लाउड सर्विस आपके प्रॉम्प्ट फ़िल्टर नहीं करती। कोई मासिक टोकन लिमिट नहीं है। कोई कंटेंट पॉलिसी का ईमेल नहीं आता कि आपकी इमेज ब्लॉक हो गई है। जब आप टूल्स का सेट लोकली चलाते हैं, तो एकमात्र सीमा आपका GPU, आपकी कल्पना और आपका चुना हुआ मॉडल होता है।
यह आर्टिकल आपको बताता है कि अनसेंसर्ड लोकल AI इमेज जनरेशन चालू करने के लिए असल में क्या चाहिए, हार्डवेयर से लेकर सबसे लोकप्रिय UI में सेफ़्टी फ़िल्टर बंद करने तक।
"लोकल" का असली मतलब
जब आप AI इमेज जनरेटर लोकली चलाते हैं, तो पूरी इनफ़रेंस प्रक्रिया आपकी मशीन पर होती है। मॉडल के वेट्स आपके GPU की VRAM में लोड होते हैं, आपका CPU प्रीप्रोसेसिंग और सैंपलिंग का समन्वय करता है, और आउटपुट इमेज आपके नेटवर्क से बाहर नहीं जाती। कोई API कॉल किसी सर्वर तक नहीं जाती। कोई इमेज स्कैन, लॉग या रिव्यू नहीं होती।
यह क्लाउड-आधारित जनरेशन से मूल रूप से अलग है। Midjourney या DALL-E जैसे प्लेटफ़ॉर्म पर हर प्रॉम्प्ट उनके सर्वर पर प्रोसेस होता है और उनकी कंटेंट मॉडरेशन पॉलिसी के अधीन होता है। लोकल सेटअप वह परत पूरी तरह हटा देते हैं।
दो प्रमुख फ़्रेमवर्क
इस क्षेत्र में दो लोकल इनफ़रेंस फ़्रेमवर्क हावी हैं:
AUTOMATIC1111 (A1111): सबसे ज़्यादा इस्तेमाल होने वाला। ब्राउज़र-आधारित UI, बड़ा एक्सटेंशन इकोसिस्टम, शुरुआती लोगों के लिए आसान सेटअप।
ComfyUI: नोड-आधारित ग्राफ़ वर्कफ़्लो। यह ज़्यादा जटिल है, लेकिन कस्टम पाइपलाइन बनाने के लिए कहीं ज़्यादा शक्तिशाली है।
दोनों एक ही मॉडल फ़ॉर्मेट सपोर्ट करते हैं। आपका चुनाव इस पर निर्भर करता है कि जनरेशन पाइपलाइन पर आप कितना नियंत्रण चाहते हैं।
हार्डवेयर की ज़रूरतें
कुछ भी इंस्टॉल करने से पहले अपना हार्डवेयर जाँच लें। कमज़ोर हार्डवेयर पर लोकल मॉडल चलाना नए यूज़र्स की परेशानी का सबसे आम कारण है।
GPU VRAM ही सब कुछ है
VRAM एक कठोर सीमा है। इनफ़रेंस के दौरान मॉडल पूरी तरह GPU मेमोरी में फ़िट होने चाहिए। अगर नहीं होते, तो जनरेशन CPU पर चली जाती है (बेहद धीमी) या पूरी तरह क्रैश हो जाती है।
मॉडल प्रकार
न्यूनतम VRAM
अनुशंसित VRAM
SD 1.5 चेकपॉइंट
4 GB
6 GB
SDXL चेकपॉइंट
8 GB
12 GB
Flux Dev / Schnell
12 GB
16 GB+
SD 3.5 Large
16 GB
24 GB
💡 नोट: ये अनुमानित मान हैं। असली उपयोग रिज़ॉल्यूशन, बैच साइज़ और इस पर निर्भर करता है कि आप बेस मॉडल के साथ ControlNet या LoRAs चला रहे हैं या नहीं।
ज़्यादातर NSFW जनरेशन के मामलों के लिए RTX 3080 (10 GB) या RTX 4070 (12 GB) लोकप्रिय चेकपॉइंट मॉडल के अधिकांश हिस्से को कवर करते हैं। RTX 4090 (24 GB) Flux और SD 3.5 Large सहित सब कुछ बिना समझौते के चला लेता है।
AMD GPU काम करते हैं, लेकिन Linux पर ROCm का उपयोग करके अतिरिक्त कॉन्फ़िगरेशन की ज़रूरत होती है। Windows पर DirectML के ज़रिए AMD सपोर्ट काम करता है, लेकिन यह धीमा और कम स्थिर है।
CPU और RAM
GPU-एक्सेलरेटेड इनफ़रेंस में CPU बाधा नहीं है, लेकिन मॉडल लोड करने और OS के ओवरहेड के लिए RAM मायने रखती है।
न्यूनतम: 16 GB सिस्टम RAM
अनुशंसित: 32 GB सिस्टम RAM
CPU: कोई भी आधुनिक क्वाड-कोर (Intel i5/Ryzen 5 या बेहतर)
अगर आपकी GPU VRAM कम है, तो सिस्टम कंप्यूटेशन को CPU RAM और सिस्टम मेमोरी पर शिफ़्ट कर देगा (जिसे अक्सर "CPU offload" मोड कहा जाता है)। यह काम करता है, लेकिन यह प्रति सेकंड 1-5 इटरेशन पर जनरेट करता है, जबकि अच्छे GPU पर यह 20-60+ होता है।
स्टोरेज
मॉडल फ़ाइलें बड़ी होती हैं। उसी हिसाब से स्टोरेज का बजट बनाएँ:
SD 1.5 चेकपॉइंट: हर एक 2-7 GB
SDXL चेकपॉइंट: हर एक 6-13 GB
Flux Dev मॉडल: ~23 GB
SD 3.5 Large: ~16 GB
अगर आप कई मॉडल इकट्ठा करने की योजना बना रहे हैं, तो 500 GB से 1 TB का एक समर्पित SSD एक व्यावहारिक शुरुआत है। HDD पर स्टोरेज काम करता है, लेकिन मॉडल लोड होने का समय उल्लेखनीय रूप से धीमा होगा।
AUTOMATIC1111 WebUI इंस्टॉल करना
AUTOMATIC1111 को Python 3.10.x और Git चाहिए। 3.11 या 3.12 का उपयोग कुछ एक्सटेंशन के साथ डिपेंडेंसी कॉन्फ़्लिक्ट पैदा कर सकता है। 3.10 पर ही टिके रहें।
Windows सेटअप
आधिकारिक Python साइट से Python 3.10 इंस्टॉल करें। इंस्टॉलेशन के दौरान "Add Python to PATH" पर टिक करें।
git-scm.com से Git इंस्टॉल करें।
उस फ़ोल्डर में एक टर्मिनल (PowerShell या CMD) खोलें जहाँ आप WebUI इंस्टॉल करना चाहते हैं।
पहली बार चलाने पर सभी डिपेंडेंसी अपने-आप डाउनलोड होती हैं। आपकी इंटरनेट स्पीड के हिसाब से इसमें 10-20 मिनट लगते हैं। पूरा होने के बाद WebUI आपके ब्राउज़र में http://127.0.0.1:7860 पर खुलता है।
स्क्रिप्ट वर्चुअल एनवायरनमेंट बनाने और डिपेंडेंसी इंस्टॉल करने का काम संभालती है। ब्राउज़र इंटरफ़ेस के लिए URL वही रहता है।
सेफ़्टी चेकर बंद करना
डिफ़ॉल्ट रूप से A1111 में एक सेफ़्टी चेकर आता है, जो कुछ कंटेंट वाली इमेज को ब्लैक आउट कर देता है। इसे बंद करने के लिए एक ही फ़्लैग चाहिए।
Windows पर webui-user.bat या Linux पर webui.sh को टेक्स्ट एडिटर में खोलें। वह लाइन खोजें जो COMMANDLINE_ARGS= से शुरू होती है और नीचे दिए फ़्लैग जोड़ें:
NSFW सेफ़्टी चेकर पूरी तरह बंद करने के लिए जोड़ें:
--disable-nan-check
💡 ज़रूरी: कुछ चेकपॉइंट पर सेफ़्टी चेकर UI में नहीं, बल्कि मॉडल के भीतर ही बेक होता है। किसी अनरिस्ट्रिक्टेड चेकपॉइंट पर स्विच करने से (नीचे देखें) WebUI कॉन्फ़िगरेशन छुए बिना इसे पूरी तरह बायपास कर देता है।
ComfyUI एक विकल्प के रूप में
ComfyUI एक अलग तरीका अपनाता है। पारंपरिक सेटिंग्स पैनल की जगह यह एक नोड ग्राफ़ इस्तेमाल करता है, जिसमें हर प्रोसेसिंग स्टेप एक विज़ुअल ब्लॉक होता है, जो अगले से जुड़ा होता है। यह सुनने में डराने वाला लगता है, लेकिन इसे समझ लेने के बाद यही इसकी ताकत बन जाता है।
कुछ लोग ComfyUI क्यों पसंद करते हैं
कोई छिपा हुआ प्रोसेसिंग स्टेप नहीं: पाइपलाइन का हर ऑपरेशन एक नोड के रूप में दिखता है। पर्दे के पीछे कुछ नहीं होता।
ज़्यादा कुशल: एक ही हार्डवेयर और मॉडल पर ComfyUI A1111 से तेज़ है, खासकर बैच जनरेशन के लिए।
ControlNet सेट करना आसान है: पोज़ कंट्रोल, डेप्थ मैपिंग या रेफ़रेंस इमेज कंडीशनिंग जोड़ना सेटिंग्स के भीतर छिपा होने की बजाय ड्रैग-एंड-ड्रॉप से होता है।
डिफ़ॉल्ट रूप से कोई सेफ़्टी चेकर नहीं: ComfyUI बिना किसी कंटेंट फ़िल्टर परत के आता है। आप जो प्रॉम्प्ट करते हैं, वही मिलता है।
Windows पर पोर्टेबल स्टैंडअलोन वर्ज़न (जो ComfyUI GitHub releases पेज पर उपलब्ध है) को Python इंस्टॉलेशन की ज़रूरत बिल्कुल नहीं पड़ती। डाउनलोड करें, एक्सट्रैक्ट करें, चलाएँ।
अपनी मॉडल चेकपॉइंट फ़ाइलें ComfyUI/models/checkpoints/ फ़ोल्डर में रखें। LoRA फ़ाइलें ComfyUI/models/loras/ में जाती हैं। ComfyUI अगली बार चलने पर इन्हें अपने-आप पहचान लेता है।
सही मॉडल चुनना
चेकपॉइंट मॉडल जो आप इस्तेमाल करते हैं, वह किसी भी सेटिंग या पैरामीटर से ज़्यादा मायने रखता है। बेस मॉडल स्टाइल, एनाटॉमी की सटीकता तय करता है, और यह भी कि सेफ़्टी चेकर मौजूद है या नहीं।
रियलिस्टिक आउटपुट के लिए सबसे अच्छे चेकपॉइंट
कम्युनिटी द्वारा ट्रेन किए गए अनरिस्ट्रिक्टेड चेकपॉइंट खास तौर पर फ़ोटोरियलिस्टिक और NSFW-सक्षम आउटपुट के लिए ऑप्टिमाइज़ किए गए हैं। 2025 में सबसे लोकप्रिय परिवार ये हैं:
Flux Dev और Flux Schnell ओपन-वेट टेक्स्ट-टू-इमेज जनरेशन में सबसे उन्नत तकनीक हैं। इन्हें ज़्यादा VRAM (12-16 GB) चाहिए, लेकिन ये SD 1.5 या SDXL मॉडल से कहीं ज़्यादा शार्प और एनाटॉमी की दृष्टि से अधिक सटीक इमेज बनाते हैं।
Stable Diffusion 3.5 Large हाई-रेज़ोल्यूशन काम के लिए एक और मज़बूत विकल्प है, जिसकी प्रॉम्प्ट फ़ॉलोइंग शानदार है।
इन्हें कहाँ से लें
Civitai फ़ाइन-ट्यून्ड चेकपॉइंट, LoRAs और embeddings के लिए मुख्य कम्युनिटी हब है। ज़्यादातर अनरिस्ट्रिक्टेड मॉडल वहाँ मिल जाते हैं, साथ में इस बारे में विस्तृत यूज़र नोट्स होते हैं कि वे सबसे अच्छा क्या बनाते हैं।
HuggingFace Flux, Stable Diffusion और अन्य बेस आर्किटेक्चर के आधिकारिक मॉडल वेट्स होस्ट करता है। कुछ गेटेड रिपॉज़िटरी तक पहुँचने के लिए अकाउंट बनाना और मॉडल के लाइसेंस की शर्तों को स्वीकार करना ज़रूरी है।
LoRA फ़ाइलें (छोटे फ़ाइन-ट्यून ऐड-ऑन) यहाँ जाती हैं:
A1111: stable-diffusion-webui/models/Lora/
ComfyUI: ComfyUI/models/loras/
ऐसे प्रॉम्प्ट लिखना जो सच में काम करें
प्रॉम्प्ट की क्वालिटी ही एक सामान्य आउटपुट और सच में प्रभावशाली चीज़ के बीच का फ़र्क बनाती है। मॉडल सिर्फ़ वही जनरेट करता है जो आप पर्याप्त विस्तार से बताते हैं।
पॉज़िटिव प्रॉम्प्ट की संरचना
अच्छे प्रॉम्प्ट एक ढीले क्रम का पालन करते हैं: सब्जेक्ट और एक्शन, वातावरण, लाइटिंग, कैमरा, क्वालिटी मॉडिफ़ायर।
फ़ोटोरियलिस्टिक नतीजों के लिए:
[subject description], [clothing/pose details], [environment/setting],
[lighting type and direction], [camera and lens], [film stock],
photorealistic, 8k, high detail, sharp focus, RAW photo
उदाहरण:
beautiful woman with dark hair, wearing a strappy black dress,
standing on a rooftop at dusk, golden hour backlight creating
rim light on shoulders, shot on Sony A7 85mm f/1.8,
Kodak Portra 400, photorealistic, 8k
आम समस्याओं से बचने के लिए नेगेटिव प्रॉम्प्ट
नेगेटिव प्रॉम्प्ट मॉडल को बताते हैं कि किससे बचना है। क्वालिटी सुधार के लिए ये लगभग सार्वभौमिक हैं:
cartoon, anime, illustration, painting, drawing, 3d render, cgi,
deformed, bad anatomy, extra limbs, missing fingers, blurry,
low resolution, watermark, text, logo, ugly, distorted
💡 टिप: SD 1.5 मॉडल के लिए, अपने नेगेटिव प्रॉम्प्ट में EasyNegative या bad_prompt_version2 को textual inversion टोकन के रूप में embed करने से बिना किसी मैनुअल प्रॉम्प्ट इंजीनियरिंग के एनाटॉमी की गलतियाँ काफ़ी कम हो जाती हैं।
CFG स्केल और सैंपलिंग सेटिंग्स
दो सेटिंग्स जिन्हें ज़्यादातर शुरुआती लोग डिफ़ॉल्ट पर छोड़ देते हैं, पर उन्हें छोड़ना नहीं चाहिए:
CFG स्केल: नियंत्रित करता है कि मॉडल आपके प्रॉम्प्ट का कितनी सख्ती से पालन करता है। 5-7 के मान ज़्यादा प्राकृतिक और विविध नतीजे देते हैं। 10 से ऊपर के मान अक्सर ओवरसैचुरेशन और विकृति पैदा करते हैं।
सैंपलिंग स्टेप्स: एक सीमा तक ज़्यादा स्टेप्स का मतलब ज़्यादा परिष्कृत आउटपुट है। ज़्यादातर मॉडल के लिए 20-30 स्टेप्स व्यावहारिक सीमा है। Flux Schnell और SDXL Lightning 4step डिस्टिल्ड मॉडल हैं, जो बिना क्वालिटी खोए 4-8 स्टेप्स में चलने के लिए डिज़ाइन किए गए हैं।
लोकल AI असल में क्या बनाता है
सही चेकपॉइंट, सेटिंग्स और प्रॉम्प्ट संरचना के साथ लोकल AI जनरेशन ऐसी फ़ोटोरियलिस्टिक इमेज बनाता है, जिन्हें प्रोफ़ेशनल फ़ोटोग्राफ़ी से अलग पहचानना मुश्किल है। ऊपर की इमेज दिखाती है कि उचित सेटअप से क्या संभव है: सब्जेक्ट का विस्तृत विवरण, लाइटिंग की साफ़ दिशा, और प्रॉम्प्ट में एक फ़िल्म स्टॉक का संदर्भ।
WebUI से इटरेशन तेज़ हो जाता है। एक बैच जनरेट करें, प्रॉम्प्ट सुधारें, सीड बदलें और फिर से जनरेट करें। ज़्यादातर अनुभवी यूज़र अंतिम आउटपुट तय करने से पहले 5-15 बार इटरेट करते हैं।
आम एरर और उनके समाधान
साफ़ इंस्टॉलेशन के बाद भी कुछ एरर बार-बार आते हैं।
"CUDA out of memory": आपकी VRAM खत्म हो गई। प्राथमिकता के क्रम में समाधान: रिज़ॉल्यूशन कम करें, A1111 के लॉन्च आर्ग्युमेंट में --medvram या --lowvram फ़्लैग चालू करें, या छोटा मॉडल चुनें।
काली या ग्रे इमेज: सेफ़्टी चेकर ने अपना काम कर दिया। यह तब होता है जब बेस SD मॉडल के साथ चेकर अभी भी सक्रिय हो। किसी अनरिस्ट्रिक्टेड चेकपॉइंट पर स्विच करें या ऊपर बताए अनुसार इसे बंद करें।
"model.safetensors is not a valid file": डाउनलोड करप्ट हो गया था। चेकपॉइंट को हटाकर फिर से डाउनलोड करें। जाँचें कि फ़ाइल का साइज़ स्रोत में दिए गए साइज़ से मेल खाता है।
बेहद धीमी जनरेशन (1-2 it/s): आप CPU पर चल रहे हैं। जाँचें कि PyTorch CUDA सपोर्ट के साथ इंस्टॉल हुआ था। A1111 के कंसोल आउटपुट में स्टार्टअप पर Using device: cuda दिखे, यह पक्का करें।
LoRA के ट्रिगर वर्ड गायब: कई LoRAs को सक्रिय होने के लिए प्रॉम्प्ट में एक खास ट्रिगर वर्ड चाहिए। ट्रिगर वर्ड की सूची के लिए Civitai पर मॉडल का पेज देखें।
जब लोकल सेटअप व्यावहारिक न हो
लोकल जनरेशन तब आदर्श है जब आपके पास हार्डवेयर हो। लेकिन हर किसी के पास हाई-VRAM GPU नहीं होता, और कुछ वर्कफ़्लो (मोबाइल, यात्रा, कम-पावर वाली मशीनें) लोकल सेटअप को अव्यावहारिक बना देते हैं।
ऐसे मामलों के लिए PicassoIA लोकल सेटअप में इस्तेमाल होने वाले कई समान मॉडलों की क्लाउड पहुँच देता है, जिनमें Flux और Stable Diffusion वेरिएंट शामिल हैं, और इसके लिए इंस्टॉलेशन या लोकल GPU की ज़रूरत नहीं होती।
अभी उपलब्ध मॉडल
PicassoIA के टेक्स्ट-टू-इमेज कलेक्शन में वे मॉडल शामिल हैं जिन पर गंभीर यूज़र सबसे ज़्यादा भरोसा करते हैं:
PicassoIA को लोकल सेटअप के साथ इस्तेमाल करने का फ़ायदा स्पीड और मॉडल की विविधता है। 20+ GB मॉडल फ़ाइलें डाउनलोड करने और लोकल जनरेशन का इंतज़ार करने की बजाय, आप ब्राउज़र में जल्दी-जल्दी अलग-अलग मॉडल आज़मा सकते हैं और तय कर सकते हैं कि कौन से लोकली डाउनलोड करने लायक हैं।
अभी बनाना शुरू करें
चाहे आप RTX 4090 के साथ पूरा लोकल टूल्स का सेट चला रहे हों या लोकल सेशन के बीच प्रॉम्प्ट टेस्ट कर रहे हों, सच में अनरिस्ट्रिक्टेड इमेज जनरेशन शुरू करने की प्रक्रिया 2027 में पहले से कहीं ज़्यादा सुलभ है। मॉडल ओपन-वेट हैं, टूल मुफ़्त हैं, और कम्युनिटी बहुत बड़ी है।
अगर आपने अब तक अपनी पहली लोकल जनरेशन नहीं की है, तो सबसे तेज़ रास्ता यह है: अपने बजट में फ़िट होने वाला GPU चुनें, पोर्टेबल वर्ज़न के साथ ComfyUI इंस्टॉल करें, Civitai से Realistic Vision v5.1 या RealVisXL लें और उसे checkpoints फ़ोल्डर में डालें। सेटअप के 20 मिनट के भीतर आपकी पहली जनरेशन चल जाएगी।
पूरी इंस्टॉलेशन छोड़कर अभी सीधे शुरू करना चाहते हैं? PicassoIA पर बिना किसी इंस्टॉलेशन के Flux Dev, Flux Schnell या Stable Diffusion 3.5 Large आज़माएँ। इस आर्टिकल में बताई गई वही प्रॉम्प्ट संरचना क्लाउड प्लेटफ़ॉर्म पर भी उसी तरह काम करती है, इसलिए पूरा लोकल डाउनलोड करने से पहले आप टेस्ट और इटरेट कर सकते हैं।