आप एक वाक्य टाइप करते हैं, जेनरेट दबाते हैं और एक इमेज सामने आ जाती है। सतह पर यही होता है। लेकिन जैसे ही आप कोई खास इमेज चाहते हैं, जो आपके मन में बनी सीन से मेल खाए, तो आपको समझ आता है कि आपके शब्दों को कहीं ज़्यादा मेहनत करनी होगी। यहीं प्रॉम्प्ट काम आते हैं, और यही वजह है कि इन्हें अच्छा लिखना सीखना आज सबसे व्यावहारिक कौशलों में से एक है।

तो असल में प्रॉम्प्ट क्या है?
यह बस टेक्स्ट है
एक AI प्रॉम्प्ट वह निर्देश है जो आप किसी AI मॉडल को देते हैं। बस इतना ही। यह टेक्स्ट का एक टुकड़ा है, जो आमतौर पर एक बॉक्स में टाइप किया जाता है और मॉडल को बताता है कि आपको क्या चाहिए। इमेज जनरेशन के संदर्भ में, यह टेक्स्ट वह ब्लूप्रिंट बन जाता है जिसे AI विज़ुअल आउटपुट बनाने के लिए इस्तेमाल करता है।
"प्रॉम्प्ट" शब्द थिएटर से आया है, जहाँ एक प्रॉम्प्टर भूले हुए डायलॉग एक्टर के कान में फुसफुसाता है। यहाँ कॉन्सेप्ट मिलता-जुलता है: आप मॉडल को उसका क्यू दे रहे हैं। आप उसे बता रहे हैं कि उसे क्या करना है, क्या कल्पना करनी है और सीन को कैसे फ़्रेम करना है।
याद रखने के लिए कोई गुप्त कोड नहीं हैं। आपको कोई प्रोग्रामिंग भाषा सीखने की ज़रूरत नहीं है। एक प्रॉम्प्ट उतना सरल हो सकता है जितना यह:
सूर्यास्त के समय एक छत पर बैठी बिल्ली
या उतना विस्तृत जितना यह:
a tabby cat with orange and white fur sitting on a terracotta tile rooftop in southern Spain, golden hour light casting long warm shadows, a blurred city skyline in the background, shot with a 135mm telephoto lens at f/2.8, Kodak Portra 400 film grain, photorealistic, 8K
दोनों प्रॉम्प्ट हैं। एक से आपको ठीक-ठाक नतीजा मिलेगा। दूसरे से वही मिलेगा जो आपने कल्पना की थी।
AI पढ़ता है, फिर बनाता है
जब आप प्रॉम्प्ट सबमिट करते हैं, तो मॉडल आपके शब्दों को टोकन में बदलता है, यानी शब्दों और शब्द-अंशों के संख्यात्मक रूप, जिनसे वह ट्रेनिंग के दौरान जुड़ाव सीख चुका होता है। ये टोकन उन पैटर्न्स को ट्रिगर करते हैं जिन्हें मॉडल ने लाखों बार देखा है: कम्पोज़िशन, रंग, लाइटिंग की स्थितियाँ, टेक्सचर, आर्टिस्टिक स्टाइल।
AI इंसानों वाले अर्थ में "कल्पना" नहीं करता। यह एक परिष्कृत पैटर्न-कम्प्लीशन सिस्टम है। आपका प्रॉम्प्ट इनपुट है; इमेज उसी कम्प्लीशन प्रक्रिया का आउटपुट है। आपके इनपुट की क्वालिटी सीधे आउटपुट की क्वालिटी को आकार देती है।
आपके शब्द आपकी सोच से कहीं ज़्यादा मायने रखते हैं
अस्पष्ट प्रॉम्प्ट, अस्पष्ट नतीजे
यह निराश करने वाली सच्चाई है जिससे ज़्यादातर शुरुआती लोग जल्दी टकराते हैं: AI को नहीं पता कि आपका मतलब क्या था। वह सिर्फ़ वही जानता है जो आपने लिखा है।
अगर आप "a woman on the beach" टाइप करते हैं, तो आपको समुद्र तट पर एक महिला मिलेगी। लेकिन कौन-सा समुद्र तट? दिन का कौन-सा समय? उसने क्या पहना है, वह क्या कर रही है, कैसा महसूस कर रही है? कैमरा एंगल क्या है? मूड कैसा है? मॉडल हर खाली जगह को उससे भर देता है जो उसके ट्रेनिंग डेटा के हिसाब से सबसे संभावित लगता है, और आमतौर पर इसका मतलब होता है सामान्य, औसत, अनोखा कुछ नहीं।
आउटपुट तकनीकी रूप से सही होता है। लेकिन वह आपका नहीं होता। वह उस इमेज से मेल नहीं खाता जो आपके मन में थी।

स्पेसिफ़िसिटी ही सुपरपावर है
प्रॉम्प्ट में जोड़ा गया हर डिटेल एक कंस्ट्रेंट है जो मॉडल के आउटपुट स्पेस को आपके इरादे की ओर संकुचित करता है। इसे अनिश्चितता कम करने के रूप में सोचें। आप सिर्फ़ एक सीन का वर्णन नहीं कर रहे: आप उन सभी सीनों को हटा रहे हैं जो आपको नहीं चाहिए।
"golden hour lighting" जोड़ने से हर सपाट दोपहर वाला सीन हट जाता है। "85mm f/1.8 portrait lens" जोड़ने से हर वाइड-एंगल कम्पोज़िशन हट जाती है। "1970s film photography aesthetic" जोड़ने से हर डिजिटल-लगने वाला रेंडर हट जाता है।
हर शब्द एक फ़िल्टर है। जितने ज़्यादा फ़िल्टर, उतना सटीक नतीजा। यह कोई बोझ नहीं है: यही रचनात्मक काम का असली रूप है।
एक मज़बूत प्रॉम्प्ट के बिल्डिंग ब्लॉक्स
सब्जेक्ट, स्टाइल, मूड, लाइटिंग
लगभग हर असरदार इमेज प्रॉम्प्ट में चार मुख्य घटक होते हैं:
| कंपोनेंट | यह क्या करता है | उदाहरण |
|---|
| सब्जेक्ट | इमेज किस बारे में है | "a woman with red hair" |
| स्टाइल | इमेज की विज़ुअल भाषा | "photorealistic, film photography" |
| मूड | भावनात्मक रंग | "melancholy, quiet, overcast" |
| लाइटिंग | सीन में रोशनी कैसे बर्ताव करती है | "volumetric morning light from the left" |
आपको हमेशा चारों की ज़रूरत नहीं होती। लेकिन जब आपको वह नहीं मिल रहा जो आप चाहते हैं, तो इन चार में से कोई एक घटक लगभग हमेशा गायब या अस्पष्ट होता है।
💡 एक तेज़ ट्रिक: कोई भी प्रॉम्प्ट लिखने से पहले खुद से पूछें "सब्जेक्ट क्या है, स्टाइल क्या है, मूड क्या है, और रोशनी कहाँ से आ रही है?" इन चार सवालों के जवाब दे दें, तो आपका प्रॉम्प्ट अपने-आप लिखा जाने लगेगा।
नेगेटिव प्रॉम्प्ट क्या करते हैं
कुछ AI मॉडल, खासकर जो Stable Diffusion आर्किटेक्चर पर आधारित हैं, एक दूसरा टेक्स्ट फ़ील्ड स्वीकार करते हैं जिसे नेगेटिव प्रॉम्प्ट कहते हैं। यहीं आप उन चीज़ों की सूची देते हैं जो आप इमेज में नहीं चाहते।
नेगेटिव प्रॉम्प्ट में अक्सर जोड़ी जाने वाली चीज़ें:
blurry, low quality, artifacts
text, watermark, signature
extra fingers, distorted face
cartoon, illustration, CGI
नेगेटिव प्रॉम्प्ट इमेज से कंटेंट मिटाते नहीं हैं। वे मॉडल की सैंपलिंग प्रक्रिया को उन टोकन से दूर ले जाते हैं। नतीजा ज़्यादा साफ़ और नियंत्रित आउटपुट होता है, ख़ासकर शारीरिक सटीकता और फोटोरियलिज़्म के लिए।
Flux.1 Dev और Stable Diffusion 3 जैसे मॉडल अच्छे तरीके से लिखे नेगेटिव प्रॉम्प्ट से काफ़ी फ़ायदा उठाते हैं। GPT Image 2 जैसे दूसरे मॉडल बातचीत वाली नेचुरल लैंग्वेज के आधार पर काम करते हैं और ये कंस्ट्रेंट्स पॉज़िटिव प्रॉम्प्ट के भीतर ही संभाल लेते हैं।
पैरामीटर और मॉडिफ़ायर
टेक्स्ट के अलावा, कई प्लेटफ़ॉर्म अतिरिक्त पैरामीटर दिखाते हैं जो आपके प्रॉम्प्ट सिस्टम का हिस्सा बन जाते हैं:
- आस्पेक्ट रेशियो: मॉडल को टारगेट कैनवास का आकार बताता है (16:9, 1:1, 9:16)
- स्टेप्स: ज़्यादा सैंपलिंग स्टेप्स आमतौर पर ज़्यादा डिटेल देते हैं, पर जेनरेशन का समय बढ़ जाता है
- CFG स्केल / गाइडेंस स्केल: मॉडल आपके प्रॉम्प्ट को कितनी सख़्ती से फ़ॉलो करता है बनाम कितना क्रिएटिव होता है
- सीड: एक फ़िक्स्ड रैंडम नंबर, जो प्रॉम्प्ट न बदलने पर बिल्कुल वही आउटपुट दोहराता है
इन्हें सिर्फ़ तकनीकी सेटिंग्स न समझें, बल्कि अपने प्रॉम्प्ट के विस्तार के रूप में देखें। --ar 16:9 सेट करना उतना ही रचनात्मक फ़ैसला है जितना कैमरा एंगल चुनना।

प्रॉम्प्ट के वे स्टाइल जो सच में काम करते हैं
डिस्क्रिप्टिव बनाम डायरेक्टिव
प्रॉम्प्ट लिखने के दो मोटे तरीके हैं, और कब किसे इस्तेमाल करना है, यह जानना सच में उपयोगी है।
डिस्क्रिप्टिव प्रॉम्प्ट सीन की तस्वीर बनाते हैं। वे कैप्शन या सीन के वर्णन जैसे पढ़े जाते हैं। इमेज जनरेशन के लिए ये सबसे अच्छा काम करते हैं:
a narrow cobblestone alley in Lisbon at dusk, laundry hanging between balconies, golden light filtering through, a lone figure in the distance, 35mm film grain
डायरेक्टिव प्रॉम्प्ट निर्देश देते हैं। वे मॉडल को बताते हैं कि क्या करना है। एडिटिंग, इन-कॉन्टेक्स्ट टास्क और लैंग्वेज मॉडल के लिए ये सबसे अच्छा काम करते हैं:
change the background to a beach, keep the person identical, make the lighting warm and golden
टेक्स्ट-टू-इमेज मॉडल के लिए, डिस्क्रिप्टिव प्रॉम्प्ट लगभग हमेशा डायरेक्टिव से बेहतर प्रदर्शन करते हैं। मॉडल कोई आदेश नहीं मान रहा; वह एक विवरण से पैटर्न-कम्प्लीशन कर रहा है।
रेफ़रेंस-आधारित प्रॉम्प्ट
जब आपको कई इमेज में एक जैसा कैरेक्टर, ऑब्जेक्ट या सीन चाहिए, तो रेफ़रेंस-आधारित प्रॉम्प्टिंग एक शक्तिशाली तरीका है। इसमें आपके टेक्स्ट प्रॉम्प्ट के साथ एक सोर्स इमेज इस्तेमाल होती है, जो विज़ुअल आउटपुट को एंकर करती है।
Flux Kontext Pro जैसे टूल्स खास तौर पर इसी वर्कफ़्लो के लिए बने हैं: उन्हें एक मौजूदा इमेज और एक टेक्स्ट निर्देश दीजिए, और वे उस इमेज को उसकी मूल विज़ुअल पहचान बरकरार रखते हुए एडिट या विस्तारित करते हैं।
यह प्रोडक्ट फ़ोटो, एक जैसे कैरेक्टर आर्ट और बड़े पैमाने पर ब्रांडेड कंटेंट बनाने के लिए बेहद मायने रखता है।
स्टाइल ट्रांसफ़र प्रॉम्प्ट
स्टाइल ट्रांसफ़र प्रॉम्प्ट किसी ज्ञात फ़ोटोग्राफ़र, पेंटर या आर्टिस्टिक मूवमेंट की विज़ुअल भाषा का हवाला देते हैं, बजाय इसके कि सीन को शुरू से वर्णित करें:
in the style of Saul Leiter, overlapping reflections, muted winter palette, candid street photography
shot on a Contax G2, Fujifilm Superia 400, slightly underexposed
ये शॉर्टहैंड संदर्भ मॉडल के ट्रेनिंग डेटा में विज़ुअल जुड़ावों के खास समूहों को सक्रिय करते हैं। जो बात शुरू से वर्णन करने में पचास शब्द लगते, वह पाँच शब्दों में हो सकती है।
इन्हें सावधानी से इस्तेमाल करें: कुछ स्टाइल संदर्भ इतने हावी होते हैं कि प्रॉम्प्ट की बाकी हर चीज़ को दबा देते हैं। अगर स्टाइल सब्जेक्ट पर भारी पड़ रहा है, तो स्टाइल वाले शब्दों का वज़न कम करें या उन्हें प्रॉम्प्ट में बाद में रखें।

AI मॉडल आपका प्रॉम्प्ट कैसे पढ़ते हैं
टोकन और वेट
मॉडल आपका वाक्य उस तरह नहीं पढ़ता जैसे आप पढ़ते हैं। वह उसे टोकन में तोड़ता है, और हर टोकन को उसकी स्थिति, आवृत्ति और ट्रेनिंग के दौरान सीखे पैटर्न के आधार पर एक अटेंशन स्तर देता है।
व्यवहार में इसका मतलब है:
- प्रॉम्प्ट की शुरुआत के पास के शब्द कई आर्किटेक्चर में ज़्यादा वज़न रखते हैं
- दोहराए गए शब्द या कॉन्सेप्ट पर ज़ोर दिया जा सकता है, हालाँकि ज़रूरत से ज़्यादा दोहराव आर्टिफ़ैक्ट पैदा कर सकता है
- दुर्लभ या असामान्य शब्द कोई साफ़ पैटर्न सक्रिय न करें, अगर ट्रेनिंग डेटा में उनका बहुत कम संपर्क रहा हो
कुछ प्लेटफ़ॉर्म आपको (golden light:1.5) जैसे सिंटैक्स से टर्म्स को मैन्युअली वेट देने देते हैं, ताकि मॉडल उस वाक्यांश पर ज़्यादा ध्यान दे। यह सिंटैक्स हर प्लेटफ़ॉर्म पर अलग होता है, इसलिए जिस भी मॉडल का इस्तेमाल कर रहे हैं उसका डॉक्युमेंटेशन देख लें।
शब्द क्रम क्यों मायने रखता है
ज़्यादातर टेक्स्ट-टू-इमेज मॉडल में, प्रॉम्प्ट की शुरुआत मुख्य सब्जेक्ट एंकर होती है। सबसे ज़रूरी तत्व पहले रखें।
कम असरदार: photorealistic, 8K, golden hour, a woman sitting on a beach wearing a red dress
ज़्यादा असरदार: a woman in a red dress sitting on a beach, golden hour warm light, photorealistic, 8K
पहले वाले वर्ज़न में मॉडल सब्जेक्ट से पहले क्वालिटी मॉडिफ़ायर देखता है, और सीन स्थापित करने से पहले स्टाइल पर एंकर हो सकता है। दूसरे में पहले सब्जेक्ट स्थापित होता है, फिर क्वालिटी वाले शब्द उसे निखारते हैं। आउटपुट में फ़र्क अक्सर काफ़ी बड़ा होता है।
असली मॉडल के लिए प्रॉम्प्टिंग (हर प्लेटफ़ॉर्म पर क्या बदलता है)

Flux 1.1 Pro के लिए प्रॉम्प्टिंग
Black Forest Labs का Flux 1.1 Pro इस समय उपलब्ध सबसे लोकप्रिय टेक्स्ट-टू-इमेज मॉडलों में से एक है, और इसकी वजह भी ठोस है: यह लंबे, विस्तृत प्रॉम्प्ट को बेहद अच्छी तरह संभालता है।
Flux के साथ आप पैराग्राफ़ जितने लंबे वर्णन लिख सकते हैं और मॉडल ज़्यादातर डिटेल पकड़ लेगा। यह इन पर अच्छी प्रतिक्रिया देता है:
- लाइटिंग के विशिष्ट वर्णन: "volumetric side lighting from the left, casting a single hard shadow"
- कैमरा और लेंस के संदर्भ: "shot with a Hasselblad 500C/M, 80mm Planar, medium format depth of field"
- मटीरियल और टेक्सचर के संकेत: "rough weathered oak, visible grain, slight weathering on the lower edge"
Flux 1.1 Pro Ultra इसे और आगे ले जाता है, 4MP आउटपुट रेज़ोल्यूशन के साथ, जिससे बारीक टेक्सचर और डिटेल और भी साफ़ उभरते हैं। थोड़ी कम फ़िडेलिटी पर तेज़ गति के लिए, Flux Schnell सेकंडों में प्रॉम्प्ट प्रोसेस करता है, जो तेज़ी से इटरेशन और पूरा रेंडर करने से पहले प्रॉम्प्ट वेरिएशन टेस्ट करने के लिए आदर्श है।
Stable Diffusion 3 के लिए प्रॉम्प्टिंग
Stable Diffusion 3 और उसका तेज़ वर्ज़न Stable Diffusion 3.5 Large Turbo सालों के कम्युनिटी इस्तेमाल से बनी एक अलग प्रॉम्प्टिंग संस्कृति रखते हैं।
इसे बाकी मॉडलों से जो अलग करता है:
- यहाँ नेगेटिव प्रॉम्प्ट मायने रखते हैं: SD3 को यह बताने से काफ़ी फ़ायदा होता है कि किससे बचना है
- स्टाइल टोकन का वज़न भारी होता है: "hyperrealistic," "cinematic," और "bokeh" जैसे शब्द मज़बूत सौंदर्य पैटर्न सक्रिय करते हैं
- आर्टिस्ट और फ़ोटोग्राफ़र के संदर्भ अच्छा काम करते हैं: "Gregory Crewdson lighting" या "Annie Leibovitz portrait" आउटपुट को नाटकीय रूप से बदल सकते हैं
- LoRA फ़ाइन-ट्यून्स समीकरण बदल देते हैं: स्टाइल LoRA इस्तेमाल करने पर बेस प्रॉम्प्ट उतना अहम नहीं रहता, क्योंकि LoRA स्टाइल का ज़्यादातर काम खुद संभाल लेता है
GPT Image 2 और नेचुरल लैंग्वेज
GPT Image 2 सादी, बातचीत वाली नेचुरल लैंग्वेज का जवाब देने के लिए ट्रेन किया गया है। आपको किसी खास सिंटैक्स या फ़ोटोग्राफ़ी के शब्दजाल की ज़रूरत नहीं है।
आप लिख सकते हैं: "I want a photo of a woman at a farmers market picking up tomatoes, it should feel warm and natural, like a candid shot, not posed", और GPT Image 2 उस इरादे को भरोसेमंद तरीके से समझ लेगा।
यह सादी भाषा में कंस्ट्रेंट्स भी संभालता है: "no filters, no artificial colors, realistic skin tones" को बिना किसी अलग नेगेटिव प्रॉम्प्ट फ़ील्ड के समझा और लागू किया जाता है। इससे यह उन लोगों के लिए खास तौर पर आसान हो जाता है जिन्होंने अभी फ़ोटोग्राफ़ी के तकनीकी शब्दों का अपना संग्रह नहीं बनाया है।

3 गलतियाँ जो आपके नतीजे बिगाड़ देती हैं
बहुत छोटे या बहुत सामान्य
सबसे आम शुरुआती गलती है 3 से 7 शब्दों का प्रॉम्प्ट लिखना और फिर हैरान होना कि आउटपुट औसत क्यों है। छोटे प्रॉम्प्ट मॉडल को भारी रचनात्मक छूट देते हैं, जिसका मतलब है भारी विविधता। कुछ आउटपुट दिलचस्प होंगे; ज़्यादातर सामान्य।
समाधान सीधा है: ज़्यादा वर्णन करें। ज़्यादा संदर्भ, ज़्यादा स्पेसिफ़िसिटी, ज़्यादा कंस्ट्रेंट्स। आप रचनात्मकता को ज़्यादा बाँध नहीं रहे, आप उसे दिशा दे रहे हैं।
विरोधाभासी निर्देश
AI मॉडल आपके प्रॉम्प्ट के सभी कंस्ट्रेंट्स को एक साथ पूरा करने की कोशिश करते हैं। जब वे कंस्ट्रेंट्स एक-दूसरे के उलट होते हैं, तो आउटपुट उलझा हुआ होता है।
विरोधाभासी प्रॉम्प्ट के उदाहरण:
- "dark moody noir" और "bright cheerful sunny day" (लाइटिंग का विरोधाभास)
- "close-up portrait" और "full body shot" (फ़्रेमिंग का विरोधाभास)
- "photorealistic RAW photograph" और "watercolor painting style" (स्टाइल का विरोधाभास)
मॉडल विरोधाभासों का एक अजीब-सा औसत निकालने की कोशिश करेगा, और नतीजा आमतौर पर दोनों में से कोई नहीं होगा। एक दिशा चुनें और उस पर टिके रहें।
मॉडल-विशिष्ट सिंटैक्स को नज़रअंदाज़ करना
हर मॉडल की अपनी प्रॉम्प्टिंग परंपराएँ होती हैं, और गलत परंपरा अपनाना खराब नतीजों का आम कारण है।
उदाहरण के लिए, किसी ऐसे मॉडल के साथ SD3-स्टाइल नेगेटिव प्रॉम्प्ट सिंटैक्स इस्तेमाल करना जो नेगेटिव प्रॉम्प्ट सपोर्ट नहीं करता, या तो नज़रअंदाज़ हो जाएगा या अनपेक्षित व्यवहार पैदा करेगा। ऐसे मॉडल के साथ एक-वाक्य के, बातचीत जैसे प्रॉम्प्ट लिखना, जो लंबे तकनीकी वर्णनों को पसंद करता है, क्वालिटी का बड़ा हिस्सा छोड़ देना है।
💡 जब आप किसी नए मॉडल के साथ शुरुआत करें, तो कोई असली काम करने से पहले पाँच टेस्ट प्रॉम्प्ट चलाएँ। लंबाई, संरचना और स्टाइल बदलकर देखें। देखें कि आउटपुट में क्या बदलता है। यह छोटा प्रयोग बाद में घंटों की झुंझलाहट बचा देता है।

इसे आज़माएँ और देखें क्या होता है
प्रॉम्प्ट में अच्छा बनने का सबसे अच्छा तरीका है ढेर सारे प्रॉम्प्ट लिखना और ध्यान से देखना कि खास शब्द बदलने पर क्या बदलता है। उस सीधे लूप का कोई शॉर्टकट नहीं है: प्रॉम्प्ट लिखें, आउटपुट देखें, सुधारें, दोहराएँ।

Picasso IA आपको एक ही जगह पर 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल का एक्सेस देता है, ताकि आप एक ही प्रॉम्प्ट को Flux 1.1 Pro, Imagen 4, Seedream 4.5 और Realistic Vision v5.1 पर टेस्ट कर सकें और तुरंत देख सकें कि हर मॉडल आपके शब्दों को अलग तरह से कैसे समझता है। यह क्रॉस-मॉडल तुलना उन प्रॉम्प्टिंग फ़ैसलों को समझने के सबसे तेज़ तरीकों में से एक है जो सच में मायने रखते हैं।

अभी अपने मन में कोई सीन सोचें। कुछ खास: एक व्यक्ति, एक जगह, एक मूड। जितना विस्तृत वर्णन लिख सकते हैं लिखें। फिर उसे चलाएँ। फिर सुधारें। पूरी प्रक्रिया बस इतनी है।
जो प्रॉम्प्ट असाधारण इमेज बनाते हैं, वे संयोग नहीं होते। वे इस बात का नतीजा होते हैं कि आप जानते हैं आपको क्या चाहिए और उसे कहने के लिए आपके पास शब्द हैं।