आपने एक ऐसा प्रॉम्प्ट बनाने में काफ़ी समय लगाया जो ठोस लगता है। आपने जनरेट बटन दबाया। जो नतीजा आया वह गलत है: लाइटिंग फ़्लैट है, कंपोज़िशन आम है, और माहौल वैसा नहीं है जैसा आपने सोचा था। अगर यह बार-बार होता है, तो समस्या लगभग निश्चित रूप से मॉडल में नहीं, बल्कि शब्दों में है।
AI इमेज जनरेटर टेक्स्ट को उस तरह नहीं पढ़ते जैसे इंसान पढ़ते हैं। वे टोकन को वेट देते हैं, ट्रेनिंग डेटा से पैटर्न निकालते हैं, और अस्पष्टता को सांख्यिकीय औसत की ओर सुलझाते हैं। कुछ शब्द इस औसत निकालने वाले व्यवहार को बहुत तेज़ी से ट्रिगर करते हैं। दूसरे शब्द इतनी कम विज़ुअल जानकारी रखते हैं कि मॉडल खाली जगहें वही भरता है जो उसने सबसे ज़्यादा देखा है, और वह शायद ही कभी वैसा होता है जैसा आपके मन में था। यह उन शब्दों और उनकी जगह क्या लिखें, इसका सीधा विवरण है।
प्रॉम्प्ट बार-बार गलत नतीजे क्यों देते हैं
मॉडल इरादा नहीं, टोकन पार्स करता है
जब आप लिखते हैं "make it look nice", तो मॉडल आपकी बात को नज़रअंदाज़ नहीं कर रहा होता। वह "nice" को पिक्सल निर्देश में बदल ही नहीं सकता। इस शब्द का ट्रेनिंग डेटा में कोई एक-सा विज़ुअल समकक्ष नहीं है। इसका मतलब नरम पेस्टल मिनिमलिज़्म भी हो सकता है और ड्रामैटिक स्टूडियो लाइटिंग भी। मॉडल यह तय नहीं कर सकता।
प्लेटफ़ॉर्म पर सबसे अच्छा प्रदर्शन करने वाले मॉडल, जिनमें Flux Dev और GPT Image 1 शामिल हैं, ठोस विज़ुअल शब्दावली पर प्रतिक्रिया देते हैं। राय वाले विशेषण नहीं। तुलनात्मक शब्द नहीं। दृश्य में मौजूद चीज़ों का भौतिक वर्णन: रोशनी का स्रोत, सतह की बनावट, लेंस की फ़ोकल लंबाई, कलर टेम्परेचर।

स्पेसिफ़िसिटी ही असली करेंसी है
"a car at sunset" और "a 1967 Ford Mustang fastback in Wimbledon White, parked on wet asphalt, three-quarter rear angle, 24mm wide, f/4, golden hour, 10 minutes post-sunset, soft flare on the rear taillight chrome" के फ़र्क पर विचार करें। दूसरा प्रॉम्प्ट लिखने में कोई अतिरिक्त खर्च नहीं होता। नतीजे बेमिसाल रूप से ज़्यादा सोच-समझकर बनाए गए होते हैं।
एक औसत जनरेशन और एक बेहतरीन जनरेशन के बीच का फ़र्क लगभग हमेशा स्पेसिफ़िसिटी का होता है। बेहतर मॉडल नहीं। किस्मत नहीं। वे शब्द जो आप चुनते हैं।
अस्पष्ट क्वालिटी वाले शब्द जो आउटपुट बिगाड़ देते हैं
"Beautiful," "Amazing," "Stunning," "Gorgeous"
ये शायद कमज़ोर प्रॉम्प्ट में सबसे आम शब्द हैं। इंसान के लिए "beautiful portrait" में सचमुच भावनात्मक वज़न होता है। लेकिन Flux Pro या Imagen 4 Ultra के लिए ये शब्द ट्रेनिंग सेट की हर "beautiful" टैग वाली इमेज के सांख्यिकीय औसत में बदल जाते हैं, जो ज़्यादा प्रोसेस्ड और आम नतीजा होता है।
बताएँ कि कैमरा लेंस के लिए वह चीज़ क्यों खूबसूरत होगी:
| इसके बजाय... | लिखें... |
|---|
| खूबसूरत सूर्यास्त | सूर्यास्त के 15 मिनट बाद, 6° पर एम्बर और गुलाबी रोशनी, सिरस बादलों की परतों से होकर आती वॉल्यूमेट्रिक किरणें |
| शानदार पोर्ट्रेट | 85mm f/1.4, दोनों पुतलियों में कैचलाइट, ऊपर से हेयरलाइट का रिम, प्राकृतिक त्वचा की बनावट |
| कमाल की बनावट | 60mm मैक्रो, f/5.6, खुरदरी कंक्रीट सतह, ऑक्सीकृत खनिज जमाव, दिखती दरारों का जाल |

💡 मोटा नियम: अगर कोई शब्द बताता है कि कोई चीज़ आपको कैसा महसूस कराती है, न कि वह कैसी दिखती है, तो उसे प्रॉम्प्ट से हटा दें और उसकी जगह एक विज़ुअल ऑब्ज़र्वेशन लिखें।
"Perfect," "Flawless," "Ideal"
राय वाले सर्वोत्तमता-सूचक शब्दों में शून्य विज़ुअल डेटा होता है। "a perfect composition" को पार्स नहीं किया जा सकता। मॉडल के पास सौंदर्य का कोई निर्णय नहीं होता। वह बस यह जानता है कि समान संदर्भों में उसने क्या सबसे ज़्यादा देखा है, और "perfect" वही लौटाएगा: मीडियन।
सभी सर्वोत्तम-सूचक शब्द हटा दें। वे कोई जानकारी नहीं जोड़ते और मॉडल को औसत निकालने की ओर धकेलते हैं। उनकी जगह ठोस सकारात्मक वर्णन लिखें: "sharp focus across the subject, natural depth of field falloff, foreground element slightly soft."
संबंध बताने वाले शब्द जिन्हें मॉडल प्रोसेस नहीं कर सकता
"More," "Less," "Better," "Worse"
ये शब्द सिर्फ़ संदर्भ में काम करते हैं। "More dramatic lighting" किसकी तुलना में? हर जनरेशन शून्य से शुरू होती है। आपका मौजूदा प्रॉम्प्ट पार्स करते समय मॉडल के पास किसी पिछले आउटपुट तक पहुँच नहीं होती। इस संदर्भ में तुलनात्मक भाषा संरचनात्मक रूप से बेमानी है।
निरपेक्ष विकल्प:
- "More dramatic" बन जाता है "single hard spotlight at 45° from the left, shadow covering 65% of the subject"
- "Less busy background" बन जाता है "plain seamless white backdrop, no objects, no texture"
- "Better skin" बन जाता है "smooth natural skin, visible pore texture, subsurface scattering in highlights, no blemishes"
"Make It More Realistic"
यह निर्देश सक्षम मॉडलों को भी उलझा देता है। Stable Diffusion 3 और Stable Diffusion 3.5 Large "realistic" को अर्थों की एक बड़ी रेंज में समझते हैं। फ़ोटोग्राफ़िक रियलिज़्म, शारीरिक सटीकता, भौतिक रूप से संभव लाइटिंग और मटीरियल की विश्वसनीयता, ये सभी अलग-अलग आयाम हैं।
बताएँ कि कौन-सा आयाम मायने रखता है:
- फ़ोटोग्राफ़िक: "35mm f/2.8, Kodak Portra 400, available light, film grain visible in shadows"
- शारीरिक: "correct hand proportions, natural finger joints, natural knuckle crease shadows"
- मटीरियल: "cotton fabric with visible thread structure, subtle sheen on highlights, natural drape wrinkles"
साइज़, स्केल और मात्रा की गलतियाँ
"Big," "Small," "Tall," "Short"
ये बिना किसी संदर्भ वस्तु के सापेक्ष हैं। "A big crowd" 20 लोगों के रूप में भी रेंडर हो सकती है और 2,000 के रूप में भी। दृश्य में कोई भौतिक एंकर न हो, तो मॉडल उस वाक्यांश के लिए ट्रेनिंग औसत जो भी हो, उसी को चुन लेता है। स्केल असंगत हो जाता है।

एक संदर्भ जोड़ें:
- "A big crowd" बन जाता है "hundreds of people filling a city plaza, shot from 30 meters elevation, individual faces visible at the margins"
- "A small room" बन जाता है "interior of a 3x4 meter space, low ceiling, furniture filling most of the floor area, walls close to camera"
- "A tall building" बन जाता है "40-story glass tower, shot from street level looking up, 16mm wide angle, converging vertical lines"
"A Few," "Some," "Many," "Several"
मात्रा वाली भाषा अलग-अलग जनरेशन में बहुत असंगत नतीजे देती है। "A few flowers" तीन के रूप में भी दिख सकते हैं और चालीस के रूप में भी, यह इस पर निर्भर करता है कि मॉडल उस वाक्यांश के लिए ट्रेनिंग डेटा से क्या निकालता है। अगर संख्या आपकी कंपोज़िशन पर असर डालती है, तो साफ़-साफ़ बताएँ। "Three sunflowers" हमेशा "some sunflowers" से बेहतर प्रदर्शन करेगा।
💡 जब सटीक गिनती मायने नहीं रखती, तो घनत्व वाली भाषा इस्तेमाल करें: "flowers packed tightly across the foreground" या "sparse, isolated blooms with visible space between each stem"। घनत्व एक विज़ुअल गुण है। गिनती नहीं।
स्टाइल लेबल जो बहुत कम अर्थ रखते हैं
"Cinematic"
"Cinematic" AI प्रॉम्प्टिंग में सबसे ज़्यादा इस्तेमाल होने वाला शब्द है और ट्रेनिंग में इसका अर्थ लगभग खत्म हो चुका है। मॉडल अब इसे डिफ़ॉल्ट रूप से "dark, slightly desaturated, atmospheric haze, vague lens flare" बना देते हैं। यह असली सिनेमा के लगभग 5% को ही कवर करता है।
इसकी जगह वह लिखें जो आपका असल मतलब है:
- एनामॉर्फ़िक: "anamorphic lens oval bokeh, horizontal lens flare streaks, 2.39:1 letterbox, teal and orange grade"
- डॉक्यूमेंट्री: "handheld, slight camera shake, available light only, 24mm, deep depth of field, natural color"
- स्टूडियो ड्रामा: "three-point lighting setup, controlled shadows, mid-gray seamless, 50mm f/5.6"
"Aesthetic," "Vibrant," "Vivid"
सोशल मीडिया पर सालों के पतले, बेमतलब इस्तेमाल के बाद "Aesthetic" लगभग बेकार लेबल बन चुका है। हर इमेज की एक एस्थेटिक होती है। उसका नाम लेने से कुछ नहीं जुड़ता। उसकी जगह वे विज़ुअल गुण बताएँ जो आपके चाहे हुए लुक को परिभाषित करते हैं।
"Vibrant" और "vivid" आम तौर पर मॉडल को ओवरसैचुरेशन की ओर धकेलते हैं। इमेज ऐसी लगती हैं जैसे उन पर अधिकतम स्तर का Instagram फ़िल्टर लगा हो।
| इनसे बचें | इसके बजाय इस्तेमाल करें |
|---|
| जीवंत रंग | सैचुरेटेड प्राथमिक टोन, Fuji Velvia सिमुलेशन, समृद्ध शैडो डिटेल |
| चमकीला आसमान | गहरा कोबाल्ट नीला आसमान, पोलराइज़िंग फ़िल्टर इफ़ेक्ट, साफ़ बादलों की किनारें |
| एस्थेटिक | ठोस गुण बताएँ: मद्धम हरे रंग, कॉटन जैसी बनावट, दोपहर बाद की धुंध |

समय के संदर्भ जो भ्रम पैदा करते हैं
"Modern," "Classic," "Retro," "Vintage"
ये कालिक लेबल दशकों के पूरी तरह अलग विज़ुअल स्टाइल को समेटते हैं। "A modern kitchen" 1970 के दशक का हार्वेस्ट गोल्ड भी हो सकता है और 2024 के इंटीग्रेटेड-हार्डवेयर मिनिमलिज़्म वाला भी। मॉडल इन लेबलों को उस दौर के सभी ट्रेनिंग डेटा के औसत कंपोजिट में बदल देते हैं, जिससे कोई खास काल नहीं दिखता।
दशक या डिज़ाइन आंदोलन का नाम लिखें:
- "Modern" बन जाता है "2020s Scandinavian minimalist: matte white lacquer cabinets, integrated pulls, quartz countertops, oak floor"
- "Vintage" बन जाता है "1970s American kitchen: harvest gold appliances, dark walnut veneer, avocado tile backsplash"
- "Retro" बन जाता है "1950s American diner: chrome bar stools, red vinyl seat covers, checkerboard black-and-white tile"
"Professional"
"Professional headshot" AI जनरेटर को सबसे ज़्यादा बार भेजे जाने वाले खराब प्रॉम्प्ट में से एक है। मॉडल फ्लैट स्टूडियो लाइटिंग और कठोर एक्सप्रेशन वाला औसत स्टॉक-फ़ोटो जैसा नतीजा लौटाते हैं। इसे इसके असली घटकों में तोड़ें।
दृश्य के रूप में "professional" का मतलब:
- रोशनी: 45° पर कैमरा-लेफ़्ट में सॉफ़्टबॉक्स, कैमरा-राइट में सिल्वर रिफ़्लेक्टर फ़िल, सीधे ऊपर से हेयर लाइट
- बैकग्राउंड: कोनों पर हल्के विग्नेट के साथ सीमलेस मध्यम-तटस्थ ग्रे
- एक्सप्रेशन: तटस्थ सीधी नज़र, जबड़े में हल्का तनाव, होंठों की प्राकृतिक आराम वाली स्थिति
- तकनीकी: 85mm f/5.6, पूरे चेहरे पर शार्प, कान थोड़े सॉफ़्ट, कोई मोशन ब्लर नहीं
नेगेटिव निर्देश और स्ट्रक्चर के जाल
मुख्य प्रॉम्प्ट फ़ील्ड में नेगेटिव
"no background," "no people," और "not too dark" जैसे निर्देश पॉज़िटिव प्रॉम्प्ट में प्रभावी नहीं होते। AI इमेज मॉडल लॉजिक इंजन नहीं हैं। जब आप "no background" लिखते हैं, तो आप टोकन स्ट्रीम में "background" की अवधारणा डालते हैं, जो उल्टा आउटपुट में बैकग्राउंड तत्वों को मज़बूत कर सकती है।

Ideogram v3 Turbo और SDXL Lightning 4Step जैसे मॉडलों में इसी कारण से समर्पित नेगेटिव प्रॉम्प्ट फ़ील्ड होते हैं। इनका इस्तेमाल करें।
पॉज़िटिव में बदलाव:
- पॉज़िटिव में "No background" बन जाता है "isolated on seamless white", और "background, environment, setting" नेगेटिव प्रॉम्प्ट में जाता है
- "Not dark" बन जाता है "high-key lighting, bright, airy, overexposed shadows"
- "No text" नेगेटिव प्रॉम्प्ट की एंट्री के रूप में सबसे अच्छा रहता है: "text, watermark, label, words"
वाक्य संरचना बनाम विज़ुअल वर्णन
पूरे वाक्यों में व्याकरणिक संरचना होती है, जिसका ज़्यादातर हिस्सा AI मॉडल संज्ञा और विशेषण टोकन के पक्ष में छोड़ देते हैं। "A woman who is standing by a window in the morning light" की तुलना में "woman standing, tall window, morning light, soft backlit silhouette" ज़्यादा असरदार है।
"who," "which," "that," और "while" जैसे जोड़ने वाले शब्द बिना विज़ुअल सिग्नल जोड़े प्रोसेसिंग में शोर जोड़ते हैं।
फ़ॉर्मैट तुलना:
| वाक्य शैली | विज़ुअल टोकन शैली |
|---|
| खिड़की के पास खुश दिखती एक महिला | महिला, गर्म मुस्कान, ऊँची खिड़की, नरम दोपहर बाद की रोशनी |
| पुरानी दिखती, अच्छी रोशनी वाली सड़क | कोबलस्टोन सड़क, 19वीं सदी का यूरोपीय, गोल्डन आवर, लंबी छायाएँ |
| तेज़ और ताक़तवर दिखती कार | लो-एंगल लाल Ferrari F40, पिछले पहियों पर मोशन ब्लर, f/4 डेप्थ ऑफ़ फ़ील्ड |
मज़बूत प्रॉम्प्ट असल में कैसे दिखते हैं
भरोसेमंद प्रॉम्प्ट के चार स्तंभ
हर असरदार प्रॉम्प्ट चार श्रेणियाँ कवर करता है। अगर इनमें से कोई एक भी गायब है, तो मॉडल उस खाली जगह को अपने औसत से भर देता है। जनरेट करने से पहले हर प्रॉम्प्ट को इस सूची से जाँचें:
- सब्जेक्ट: मुख्य फ़ोकस का भौतिक, विशिष्ट वर्णन, जिसमें स्थिति, एक्सप्रेशन, कपड़े, उम्र और पहचान के विशेष विवरण शामिल हों
- एनवायरनमेंट: वह जगह जहाँ सब्जेक्ट है, जिसका वर्णन विशिष्ट मटीरियल, दूरी और स्केल संदर्भों के साथ हो
- लाइटिंग: दिशा, गुणवत्ता (हार्ड या सॉफ़्ट), कलर टेम्परेचर और भौतिक रोशनी का स्रोत
- टेक्निकल स्पेक्स: लेंस की फ़ोकल लंबाई, अपर्चर, फ़िल्म टाइप, आस्पेक्ट रेशियो, और कोई भी युग या फ़ोटोग्राफ़र का संदर्भ

💡 जनरेट करने से पहले हर प्रॉम्प्ट को इस चेकलिस्ट से गुज़ारें। इससे आप अपनी 80% अस्पष्ट भाषा को जनरेशन क्रेडिट खर्च होने से पहले पकड़ लेंगे।
फ़ोटोग्राफ़ी शब्दावली की अदला-बदली
सबसे तेज़ सुधार यह है कि अमूर्त विशेषणों की जगह फ़ोटोग्राफ़ी शब्दावली रखें। विशाल इमेज डेटासेट पर ट्रेन किए गए मॉडल तकनीकी कैमरा और लाइटिंग भाषा पर बहुत अच्छी प्रतिक्रिया देते हैं। इन शब्दों के ट्रेनिंग डेटा में ठोस और लगातार विज़ुअल संदर्भ होते हैं।
त्वरित अदला-बदली तालिका:
| अमूर्त शब्द | फ़ोटोग्राफ़ी शब्दावली |
|---|
| सपनीला | सॉफ़्ट फ़ोकस, f/1.4, हल्का ओवरएक्सपोज़र, हाइलाइट्स पर लेंस फ़्लेयर |
| नाटकीय | एक ही तेज़ रोशनी का स्रोत, हाई कंट्रास्ट, गहरे शैडो फ़िल रेशियो |
| साफ़-सुथरा | सफ़ेद सीमलेस बैकड्रॉप, सीधे ऊपर से बड़ा सॉफ़्टबॉक्स, कोई बनावट नहीं |
| मूडी | सिर्फ़ उपलब्ध रोशनी, टंगस्टन कलर कास्ट, मिडटोन में 35mm ग्रेन |
| शार्प | 85mm f/8, फ़ोकस स्टैक्ड, दोपहर की तेज़ रोशनी, कैमरे में बिल्कुल कोई मोशन नहीं |
| गर्म | Kodak Portra 400 पैलेट, 5500K टंगस्टन शिफ़्ट, छायाओं में एम्बर |
अभी इन सिद्धांतों को लागू करें
अपने पिछले तीन असफल प्रॉम्प्ट लें और ऊपर के हर सिद्धांत का इस्तेमाल करके उन्हें दोबारा लिखें। हर राय वाला शब्द हटाएँ। हर तुलनात्मक संबंध की जगह निरपेक्ष मान रखें। कैमरा लेंस का स्पेसिफ़िकेशन जोड़ें। लाइटिंग सेटअप का नाम लें। सभी कालिक लेबल की जगह दशक-विशिष्ट वर्णन रखें। एक फ़िल्म स्टॉक का संदर्भ जोड़ें।
फिर PicassoIA पर Flux Dev या Stable Diffusion 3.5 Large पर वही दृश्य साथ-साथ जनरेट करें। आउटपुट क्वालिटी का फ़र्क आपके प्रॉम्प्ट के साथ व्यवहार करने का तरीका हमेशा के लिए बदल देगा।

PicassoIA पर 91 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल एक अच्छे लिखे प्रॉम्प्ट का इंतज़ार कर रहे हैं। Ideogram v3 Turbo उन प्रॉम्प्ट के साथ अच्छा काम करता है जिनमें टेक्स्ट तत्व शामिल हों। GPT Image 1 जटिल मल्टी-एलिमेंट दृश्यों को खास तौर पर अच्छी तरह संभालता है। SDXL Lightning 4Step प्रॉम्प्ट में बदलाव टेस्ट करते समय तेज़ इटरेशन के लिए आदर्श है। Flux Schnell LoRA तेज़ और साफ़ नतीजों के साथ स्पष्ट स्टाइलिस्टिक दिशाओं को पुरस्कृत करता है।
एक चुनें। यहाँ पढ़ी हर बात का इस्तेमाल करके एक सटीक प्रॉम्प्ट लिखें। देखें कि साफ़ और सोच-समझकर चुनी गई भाषा असल में क्या देती है। बस यही अभ्यास है।
