AI इमेज बिगाड़ने वाली प्रॉम्प्ट की गलतियाँ (और उन्हें कैसे ठीक करें)
हर बार जब आपकी AI-जनरेटेड इमेज गलत निकलती है, तो लगभग हमेशा उसके पीछे कोई खराब प्रॉम्प्ट होता है। यह आर्टिकल टेक्स्ट-टू-इमेज जनरेटर के साथ लोगों की सबसे नुकसानदेह प्रॉम्प्ट गलतियों को विस्तार से समझाता है, अस्पष्ट विवरण से लेकर लाइटिंग की जानकारी न होने तक, और हर एक के लिए आज़माए हुए समाधान देता है।
आप जिस भी जनरेटर का इस्तेमाल करें, चाहे वह Flux Dev हो, Flux Schnell हो या Stable Diffusion, वह जो आप टाइप करते हैं उसे लेता है और शब्द-दर-शब्द, टोकन-दर-टोकन उससे इमेज बनाता है। आउटपुट उतना ही अच्छा होता है जितना अच्छा आप इनपुट देते हैं। यह बात स्पष्ट लगती है। फिर भी ज़्यादातर लोग प्रॉम्प्ट किराने की सूची की तरह लिखते हैं और फिर हैरान होते हैं कि नतीजे बुखार में देखे गए सपनों जैसे क्यों लगते हैं।
AI इमेज बिगाड़ने वाली प्रॉम्प्ट की गलतियाँ शायद ही कभी नाटकीय होती हैं। वे चुपचाप, छोटी-छोटी और पूरी तरह ठीक हो सकने वाली होती हैं। यह आर्टिकल ऐसी सात सबसे नुकसानदेह गलतियों को विस्तार से समझाता है और दिखाता है कि ठीक-ठीक क्या बदलना है।
आपके प्रॉम्प्ट बार-बार विफल क्यों होते हैं
कल्पना और आउटपुट के बीच का अंतर
आपके मन में एक साफ़ तस्वीर है। गोल्डन आवर की रोशनी में खड़ी एक महिला, सफ़ेद लिनन की शर्ट पहने हुए, हवा में लहराते बाल, गर्म और फ़ोटोग्राफ़िक। आप टाइप करते हैं "woman in sunset light" और कुछ धुंधला, अकड़ा हुआ और साफ़ तौर पर AI-बना हुआ मिलता है। कमी मॉडल की क्षमता में नहीं है। कमी अनुवाद में है।
टेक्स्ट-टू-इमेज मॉडल भाषा को सांख्यिकीय रूप से प्रोसेस करते हैं। आपके प्रॉम्प्ट का हर शब्द एक वज़न रखता है, और मॉडल उन वज़नों को संतुलित करके आउटपुट बनाता है। जब आपका प्रॉम्प्ट पतला होता है, तो मॉडल खाली जगहें अपने सबसे आम ट्रेनिंग एसोसिएशन से भरता है। सामान्य नतीजे वहीं से आते हैं।
AI असल में क्या पढ़ता है
अपने प्रॉम्प्ट को शोर वाले सिग्नल की तरह सोचें। हर अस्पष्ट शब्द शोर जोड़ता है। हर विशिष्ट शब्द सिग्नल को साफ़ करता है। "Beautiful woman" लगभग पूरा शोर है। "A 28-year-old woman with green eyes and natural auburn hair, standing on a beach at golden hour, wearing a loose white linen shirt, hair moving slightly in the wind, 85mm portrait lens, f/1.6, Kodak Portra 400" लगभग पूरा सिग्नल है।
इन दो प्रॉम्प्ट के आउटपुट की गुणवत्ता में फ़र्क सूक्ष्म नहीं है। वह नाटकीय है।
गलती 1: बहुत अस्पष्ट होना
अस्पष्ट प्रॉम्प्ट कैसा दिखता है
अस्पष्ट प्रॉम्प्ट ही AI इमेज से निराश होने का सबसे आम कारण हैं। वे कुछ ऐसे दिखते हैं:
"a person in a city"
"beautiful landscape"
"cool portrait"
"futuristic building"
इनमें से कोई भी मॉडल को काम करने के लिए पर्याप्त नहीं देता। "A person" हज़ारों चेहरों के औसत में बदल जाता है। "Beautiful landscape" मॉडल को पूरी छूट दे देता है, जो सुनने में अच्छा लगता है, पर आमतौर पर कुछ उबाऊ और अनुमान लगाने लायक बनाता है।
💡 अस्पष्टता की जाँच: अगर आप एक ही प्रॉम्प्ट से दस बिल्कुल अलग इमेज का वर्णन कर सकते हैं, तो प्रॉम्प्ट बहुत अस्पष्ट है।
समाधान: विशिष्टता की परतें जोड़ें
अपने सब्जेक्ट को चार परतों में तोड़ें:
परत
अस्पष्ट
विशिष्ट
सब्जेक्ट
"a woman"
"a 30-year-old woman with freckles and short dark hair"
सेटिंग
"outdoors"
"standing on a cobblestone street in Lisbon at noon"
मूड
"nice light"
"harsh overhead midday sun casting short sharp shadows"
चारों परतें भर दें और पहली ही जनरेशन में आपके नतीजे बेहतर होंगे।
गलती 2: प्रॉम्प्ट में लाइटिंग को नज़रअंदाज़ करना
लाइटिंग सब कुछ क्यों बदल देती है
किसी भी फ़ोटो में लाइटिंग अकेला सबसे शक्तिशाली वेरिएबल है। यह मूड, गहराई, कलर टेम्परेचर तय करती है और यह भी कि त्वचा जीवंत दिखेगी या प्लास्टिक जैसी। फ़ोटोग्राफ़ी डेटा पर ट्रेन किए गए AI मॉडल लाइटिंग के संदर्भों को गहराई से समझते हैं, क्योंकि फ़ोटोग्राफ़रों ने 150 साल लगाकर दर्ज किया है कि लाइटिंग का ठीक-ठीक वर्णन कैसे करें।
जब आप अपने प्रॉम्प्ट में लाइटिंग छोड़ देते हैं, तो मॉडल डिफ़ॉल्ट रूप से एक सपाट, परिवेशीय रोशनी वाला आउटपुट दे देता है। यह गलत नहीं है, बस बेजान है। जैसे ही आप कोई विशिष्ट लाइटिंग विवरण जोड़ते हैं, इमेज में गहराई आ जाती है।
फ़ोटोग्राफ़र की तरह रोशनी का वर्णन कैसे करें
अपने प्रॉम्प्ट में ये पैटर्न इस्तेमाल करें:
दिशा: "morning light from the left", "backlit by setting sun", "overhead noon sun"
कलर टेम्परेचर: "warm golden hour", "cool blue twilight", "neutral studio daylight"
स्रोत: "single window to the right", "candlelight only", "open shade on a cloudy day"
💡 अधिकतम नियंत्रण के लिए दिशा + गुणवत्ता + टेम्परेचर को मिलाएँ। "Soft golden backlight from the left, warm 3200K, hazy atmosphere" मॉडल को एक की जगह तीन उपयोगी बाधाएँ देता है।
गलती 3: कैमरा और लेंस की जानकारी भूल जाना
"85mm f/1.8" की ताकत
फ़ोटोग्राफ़र जानते हैं कि जो लेंस आप इस्तेमाल करते हैं, वह इमेज के पूरे दृश्य चरित्र को बदल देता है। 24mm वाइड-एंगल शॉट विस्तृत और थोड़ा विकृत लगता है। 85mm पोर्ट्रेट शॉट आत्मीय लगता है, जिसमें पृष्ठभूमि चिकने बोके में सिमट जाती है। 100mm मैक्रो शॉट उन बनावटों को दिखाता है जो नंगी आँख से नहीं दिखतीं।
फ़ोटोग्राफ़ी डेटा पर ट्रेन किए गए AI इमेज मॉडल ने इन एसोसिएशन को आत्मसात कर लिया है। जब आप अपने प्रॉम्प्ट में लेंस की जानकारी शामिल करते हैं, तो आप सिर्फ़ शब्द नहीं जोड़ रहे होते। आप दृश्य विशेषताओं का एक सीखा हुआ सेट सक्रिय कर रहे होते हैं।
अगले प्रॉम्प्ट में ये आज़माएँ:
24mm wide angle, f/8, deep focus पर्यावरण या स्थापत्य शॉट के लिए
85mm, f/1.4, shallow depth of field, soft bokeh पोर्ट्रेट के लिए
100mm macro, f/2.8 टेक्सचर डिटेल वाले अत्यधिक क्लोज़-अप के लिए
कोण और दूरी भी मायने रखते हैं
कैमरा कोण भी उतना ही शक्तिशाली है:
कोण
दृश्य प्रभाव
लो एंगल (ऊपर देखते हुए)
सब्जेक्ट शक्तिशाली और प्रभुत्वशाली दिखता है
आई लेवल
प्राकृतिक, डॉक्यूमेंट्री जैसा एहसास
हाई एंगल (नीचे देखते हुए)
सब्जेक्ट छोटा और संदर्भ-प्रधान दिखता है
एरियल / ओवरहेड
ग्राफ़िक, अमूर्त, पैटर्न-केंद्रित
डच टिल्ट
तनाव, बेचैनी
दूरी भी जोड़ें: "close-up", "medium shot", "wide establishing shot"। ये तीन शब्द कंपोज़िशन को पूरी तरह बदल देते हैं।
गलती 4: परस्पर विरोधी स्टाइल टैग जोड़ना
जब ज़्यादा होना कम हो जाता है
एक लोकप्रिय धारणा है कि ज़्यादा स्टाइल टैग वाले लंबे प्रॉम्प्ट बेहतर इमेज देते हैं। "Photorealistic, oil painting, watercolor, anime, cinematic, HDR, 8K, masterpiece" टाइप किया जाता है और यूज़र सोचता है कि आउटपुट इतना उलझा और धुंधला क्यों दिखता है। इसका कारण यह है कि ये स्टाइल टैग आपस में टकराते हैं।
"Photorealistic" और "anime" मॉडल को विपरीत दिशाओं में खींचते हैं। "Oil painting" और "cinematic photography" तकनीकी रूप से असंगत हैं। मॉडल इन सबको संतुष्ट करने की कोशिश करता है और अंत में किसी को भी संतुष्ट नहीं कर पाता।
💡 स्टाइल स्टैक का नियम: एक प्राथमिक स्टाइल और एक सहायक मॉडिफ़ायर चुनें। दो टकराते प्राथमिक स्टाइल कीचड़ पैदा करते हैं।
साफ़ स्टाइल स्टैक कैसे बनाएँ
पहले अपना स्टाइल एंकर चुनें, फिर उसे सहारा दें:
फ़ोटोरियलिस्टिक फ़ोटोग्राफ़ी: RAW photo, 8K, photorealistic, Kodak Portra 400, film grain
सिनेमैटिक स्टिल: cinematic color grading, anamorphic lens flare, 2.39:1 aspect ratio, film print
डॉक्यूमेंट्री: photojournalism, natural light, handheld feel, 35mm street photography
इन्हें मिलाएँ नहीं। एक लेन चुनें और उसी में रहें। आपका स्टाइल स्टैक जितना साफ़ होगा, आउटपुट उतना ही सुसंगत होगा।
गलती 5: नेगेटिव प्रॉम्प्ट छोड़ देना
नेगेटिव प्रॉम्प्ट क्या करते हैं
नेगेटिव प्रॉम्प्ट मॉडल को बताते हैं कि क्या बाहर रखना है। ये Stable Diffusion और अन्य मॉडल में उपलब्ध हैं जो क्लासिफ़ायर-फ़्री गाइडेंस को सपोर्ट करते हैं। जब आप इन्हें इस्तेमाल नहीं करते, तो आप मॉडल से कह रहे होते हैं: "इस इमेज में क्या नहीं दिखना चाहिए, इस पर मेरी कोई पसंद नहीं है।"
नतीजा यह होता है कि AI के आम आर्टिफ़ैक्ट, अतिरिक्त उँगलियाँ, आपस में मिले चेहरे, धुंधली पृष्ठभूमि और अनपेक्षित टेक्स्ट पैटर्न, इन्हें छानने वाली कोई बाधा न होने से सब सामने आ जाते हैं।
एक शुरुआती नेगेटिव प्रॉम्प्ट टेम्पलेट
इसे कॉपी करें और अपने उपयोग के अनुसार ढालें:
blurry, out of focus, low quality, watermark, text, logo, extra limbs, extra fingers, deformed hands, distorted face, cartoon, illustration, CGI, 3D render, anime, oversaturated, noise, grain, duplicate, ugly, bad anatomy
ऊपर से स्टाइल-विशिष्ट बहिष्कार जोड़ें:
पोर्ट्रेट के लिए: bald, double chin, asymmetrical eyes जोड़ें
लैंडस्केप के लिए: buildings, people, artificial light जोड़ें
प्रोडक्ट शॉट के लिए: shadows on product, cluttered background, reflections जोड़ें
💡 Flux Dev पर, ऊँचे गाइडेंस मान मॉडल को पॉज़िटिव और नेगेटिव दोनों प्रॉम्प्ट का ज़्यादा सख़्ती से पालन करवाते हैं। गाइडेंस 3.5 या उससे ऊपर होने पर आपका नेगेटिव प्रॉम्प्ट सचमुच एक फ़िल्टर बन जाता है।
गलती 6: एस्पेक्ट रेशियो और कंपोज़िशन को नज़रअंदाज़ करना
कंपोज़िशन बनाम क्रॉपिंग
कई लोग 1:1 स्क्वेयर फ़ॉर्मेट में इमेज बनाते हैं और फिर उन्हें अपने इच्छित उपयोग के लिए क्रॉप करते हैं। इससे कंपोज़िशन बिगड़ जाता है। पोर्ट्रेट को 2:3 या 9:16 में बनाना चाहिए। लैंडस्केप बैकग्राउंड को 16:9 या 21:9 में बनाना चाहिए। सोशल मीडिया पोस्ट को 4:5 की ज़रूरत पड़ सकती है।
जब आप गलत एस्पेक्ट रेशियो में बनाकर क्रॉप करते हैं, तो आप वह जानकारी खो देते हैं जो मॉडल ने जानबूझकर वहाँ रखी थी। मॉडल आपको दिए गए कैनवास के लिए अपनी कंपोज़िशन बनाता है। क्रॉपिंग उस फ़ैसले का एक हिस्सा फेंक देती है।
आपके सब्जेक्ट के लिए सही अनुपात
उपयोग
सबसे अच्छा अनुपात
पोर्ट्रेट, सोशल पोस्ट
2:3 या 9:16
वेबसाइट हीरो इमेज
16:9 या 21:9
प्रोडक्ट शॉट
1:1 या 4:3
Instagram स्क्वेयर
1:1
प्रिंट पोस्टर
3:4 या 2:3
Flux Schnell 11 एस्पेक्ट रेशियो सपोर्ट करता है और Flux Dev भी यही रेंज कवर करता है। PicassoIA पर आप जनरेशन से पहले अपना रेशियो सेट करते हैं, ताकि मॉडल शुरू से सही कंपोज़िशन बनाए, बाद में नहीं।
अगर आपका आउटपुट फिर भी ज़रूरत के अनुसार फ़्रेम नहीं भरता, तो Real ESRGAN सुपर-रेज़ोल्यूशन मॉडल आपके नतीजे को 4 गुना अपस्केल करता है और डिटेल बनाए रखता है, ताकि अंतिम क्रॉप से पहले आपके पास गुंजाइश रहे।
गलती 7: स्थिरता के लिए सीड का इस्तेमाल न करना
आपके नतीजे इधर-उधर क्यों कूदते हैं
जब भी आप बिना फ़िक्स्ड सीड के प्रॉम्प्ट चलाते हैं, मॉडल एक अलग रैंडम नॉइज़ पैटर्न से शुरू करता है। इसका मतलब है कि एक जैसे प्रॉम्प्ट लगातार चलाने पर बिल्कुल अलग इमेज दे सकते हैं। अगर आपको कोई नतीजा पसंद आ जाए, तो सीड के बिना आप उसे दोबारा नहीं बना सकते। और अगर आप एक सुसंगत विज़ुअल सीरीज़ बनाना चाहते हैं, तो आपके पास कोई एंकर पॉइंट नहीं होता।
ज़्यादातर लोग हर जनरेशन को नई लॉटरी टिकट की तरह लेते हैं। शुरुआती प्रयोग के लिए यह तरीका ठीक है, पर प्रोडक्शन के काम के लिए यह पूरी तरह विफल हो जाता है।
सीड से दिशा को लॉक करना
जब आपको कोई नतीजा मिले जो सही दिशा में जाता हो, तो तुरंत सीड लिख लें। फिर सीड को फ़िक्स्ड रखते हुए प्रॉम्प्ट में छोटे-छोटे बदलाव करके आगे बढ़ें। इससे आपको एक नियंत्रित, दोहराए जा सकने वाला रास्ता मिलता है।
Flux Dev पर आप सीड को सीधे जनरेशन पैरामीटर में सेट करते हैं। फ़िक्स्ड सीड पर थोड़ी अलग लाइटिंग वर्णन के साथ जनरेट करें, गाइडेंस मान बदलें, या एक समय में एक स्टाइल मॉडिफ़ायर बदलें। हर बदलाव साफ़ समझ आता है, क्योंकि एक ही वेरिएबल बदला गया होता है।
💡 सीड कंट्रोल को अपनी जनरेशन के लिए वर्ज़न कंट्रोल की तरह सोचें। यह प्रयोग करने वाले और उत्पादन करने वाले के बीच फ़र्क करता है।
PicassoIA पर Flux Dev कैसे इस्तेमाल करें
Flux Dev PicassoIA पर उपलब्ध सबसे सक्षम टेक्स्ट-टू-इमेज मॉडलों में से एक है, जो 12 बिलियन पैरामीटर पर चलता है और 1-मेगापिक्सल इमेज देता है जो करीबी जाँच में भी टिकती है। यहाँ एक चरण-दर-चरण वर्कफ़्लो है जो इस आर्टिकल में बताई हर बात को लागू करता है।
चरण 1: पहले अपना एस्पेक्ट रेशियो सेट करें
प्रॉम्प्ट का एक भी शब्द लिखने से पहले, एस्पेक्ट रेशियो सेलेक्टर खोलें और उसे अपने इच्छित आउटपुट से मिलाकर सेट करें। वाइडस्क्रीन के लिए 16:9, पोर्ट्रेट के लिए 2:3, सोशल के लिए 1:1। मॉडल उसे दिए गए कैनवास के लिए अपनी कंपोज़िशन बनाता है।
चरण 2: चार परतों में प्रॉम्प्ट लिखें
सब्जेक्ट: मुख्य फ़ोकस कौन या क्या है, ठोस शारीरिक विवरण के साथ
सेटिंग: दृश्य कहाँ घटित होता है, वास्तविक दुनिया की स्थान-विशिष्टता के साथ
लाइटिंग: दिशा, गुणवत्ता और कलर टेम्परेचर
तकनीकी: लेंस की फ़ोकल लंबाई, एपर्चर, फ़िल्म स्टॉक, स्टाइल मॉडिफ़ायर
इन्हें एक ही नेचुरल-लैंग्वेज प्रॉम्प्ट में जोड़ें। चारों परतों में अलग-अलग अवधारणाओं को अल्पविराम से अलग न करें, वरना मॉडल उन सबको बराबर वज़न दे देता है।
चरण 3: गाइडेंस सेट करें
गाइडेंस पैरामीटर नियंत्रित करता है कि मॉडल आपके प्रॉम्प्ट का कितनी सख़्ती से पालन करे। कम मान (लगभग 2-3) मॉडल को रचनात्मक छूट देते हैं। ऊँचे मान (4 से ऊपर) आउटपुट को आपके शब्दों से कसकर बाँध देते हैं। बहुत विस्तृत प्रॉम्प्ट के लिए 3.5 से शुरू करें। ढीले, रचनात्मक प्रॉम्प्ट के लिए 2.5 आज़माएँ।
चरण 4: सीड फ़िक्स करें, फिर दोहराएँ
जनरेशन एक बार चलाएँ। अगर दिशा सही है पर पूरी तरह नहीं, तो सीड नोट करें और एक छोटे बदलाव के साथ फिर चलाएँ। एक समय में एक चीज़ बदलें: लाइटिंग वर्णन, लेंस की फ़ोकल लंबाई, या कोई एक विशेषण। हर बदलाव आपको सिखाता है कि वह वेरिएबल संदर्भ में असल में क्या करता है।
चरण 5: ज़रूरत पड़ने पर अपस्केल करें
अगर आपके आउटपुट को प्रिंट या हाई-रेज़ोल्यूशन डिस्प्ले के लिए बड़ा करना है, तो PicassoIA पर उसे Real ESRGAN से चलाएँ। 4x अपस्केलर बारीक डिटेल को तीखा करता है और कंप्रेशन आर्टिफ़ैक्ट कम करता है, जिससे गुणवत्ता में कोई साफ़ दिखने वाली कमी आए बिना बड़ी फ़ाइल मिलती है।
वह प्रॉम्प्ट जो सचमुच काम करता है
ऊपर की सब बातों के बाद, व्यवहार में एक अच्छी तरह बना प्रॉम्प्ट कैसा दिखता है, यह देखें। इन दोनों की तुलना करें:
कमज़ोर प्रॉम्प्ट:
"a beautiful woman at sunset"
मज़बूत प्रॉम्प्ट:
"A 28-year-old woman with natural auburn hair standing on a rocky coastline at golden hour, warm backlight from the right side creating rim lighting on her hair, wearing a loose off-white linen shirt, looking slightly off-camera with a calm expression, 85mm f/1.4 portrait lens, shallow depth of field with ocean background bokeh, Kodak Portra 400 film grain, photorealistic RAW 8K photography"
दूसरा प्रॉम्प्ट लंबा है, यह सच है। पर वह इसलिए लंबा नहीं है कि उसमें ज़्यादा विशेषण हैं। वह इसलिए लंबा है क्योंकि वह चारों परतें कवर करता है: सब्जेक्ट, सेटिंग, लाइटिंग और तकनीकी। हर शब्द अपनी जगह का हक़दार है।
AI इमेज बिगाड़ने वाली प्रॉम्प्ट की गलतियाँ रचनात्मकता या प्रतिभा की बात नहीं हैं। वे जानकारी की बात हैं। मॉडल केवल वही संभाल सकता है जो आप उसे देते हैं। उसे ज़्यादा दें, तो वह बदले में ज़्यादा लौटाएगा।
अभी बेहतर इमेज बनाएँ
इस आर्टिकल में बताया गया हर कौशल आज PicassoIA पर परखने के लिए उपलब्ध है। Flux Dev खोलें और अपना अगला प्रॉम्प्ट ऐसे लाइटिंग वर्णन के साथ चलाएँ जिसे आपने पहले कभी इस्तेमाल नहीं किया। एक ही सेशन में दर्जनों वैरिएशन के तेज़ दोहराव के लिए Flux Schnell आज़माएँ। और जब आपकी इमेज को प्रिंट के लिए ज़्यादा रेज़ोल्यूशन चाहिए, तो उन्हें Real ESRGAN से चलाएँ और कुछ ही सेकंड में 4x अपस्केल पाएँ।
PicassoIA आपको 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल देता है, बिना क्रेडिट सीमा और बिना जनरेशन कोटा के। यानी आप इस आर्टिकल का हर सुधार लागू कर सकते हैं, हर वैरिएशन परख सकते हैं और वह प्रॉम्प्ट अनुशासन बना सकते हैं जो लगातार ऐसी इमेज देता है जिन्हें सहेजने लायक हो। picassoia.com/en/all-models से शुरू करें और अपने अगले प्रोजेक्ट के लिए सही मॉडल चुनें।