हर दिन हज़ारों लोग AI इमेज जनरेटर में प्रॉम्प्ट लिखते हैं और निराश होकर हट जाते हैं। वे अपना दृश्य सावधानी से बताते हैं, रंगों के ब्योरे जोड़ते हैं, और अपने सब्जेक्ट का नाम सटीकता से लिखते हैं। मॉडल कुछ ऐसा बनाता है जो ठीक-ठाक दिखता है। काम चलाऊ। भूलने लायक। फिर किसी मौज में वे उसी प्रॉम्प्ट की शुरुआत में बस एक शब्द जोड़ देते हैं और अचानक इमेज ऐसी लगती है जैसे वह फ़िल्म सेट पर किसी प्रोफ़ेशनल कैमरे से ली गई हो। वह एक शब्द "photorealistic" है, और इस तरह का बदलाव लाने वाला यह अकेला शब्द नहीं है। कौन से शब्दों में सबसे ज़्यादा वज़न है, उन्हें कहाँ रखना है, और अलग-अलग मॉडल उनपर कैसे प्रतिक्रिया देते हैं, यही जानकारी उन क्रिएटर्स को अलग करती है जो हर सेशन में शानदार नतीजे पाते हैं, उन लोगों से जो बार-बार रीरोल करते हैं और उम्मीद लगाए रहते हैं।

ज़्यादातर प्रॉम्प्ट क्यों फ़्लैट रह जाते हैं
लगभग हर टेक्स्ट-टू-इमेज मॉडल का डिफ़ॉल्ट विज़ुअल आउटपुट किसी चित्रित, पेंटरली या डिजिटली रेंडर की गई चीज़ की ओर झुकता है। यह कोई खामी नहीं है। ऐसा इसलिए होता है क्योंकि ट्रेनिंग डेटासेट में फ़ोटोग्राफ़ों के साथ भारी मात्रा में डिजिटल आर्ट, इलस्ट्रेशन और स्टाइलाइज़्ड कंटेंट भी शामिल होता है। आपकी ओर से साफ़ स्टाइल संकेत न हो, तो मॉडल वह सब कुछ औसत कर देता है जो उसने कभी देखा है।
वह गायब सामग्री
जब आप लिखते हैं "a woman walking in a park at sunset," तो मॉडल को तय करना पड़ता है कि यह असल में कैसा दिखे। क्या यह वॉटरकलर है? 3D रेंडर? ऑयल पेंटिंग? या फ़ोटोग्राफ़? बिना किसी स्टाइल एंकर के, मॉडल वही चुनता है जिसे आपके बाकी शब्दों को देखते हुए वह सबसे संभावित मानता है।
स्टाइल एंकर शब्द वही गायब सामग्री हैं। वे सब्जेक्ट का वर्णन नहीं होते। वे पूरी इमेज के विज़ुअल रजिस्टर के बारे में निर्देश होते हैं। "photorealistic" जोड़ने से मॉडल को कहा जाता है कि सब कुछ फ़ोटोग्राफ़िक आउटपुट की ओर भारित करे: असली दुनिया की रोशनी का भौतिकी, प्राकृतिक त्वचा की बनावट, प्रामाणिक मटीरियल और असली डेप्थ ऑफ़ फ़ील्ड।
मॉडल असल में क्या पढ़ता है
AI इमेज मॉडल किसी दृश्य को उस तरह "देखकर" रेंडर नहीं करते जैसे कोई डायरेक्टर करता है। वे शब्दों और विज़ुअल आउटपुट के बीच के सांख्यिकीय संबंधों की व्याख्या करके काम करते हैं, जो ट्रेनिंग के दौरान सीखे गए होते हैं। कुछ शब्द विज़ुअल पैटर्न के कुछ समूहों को इतनी मज़बूती से सक्रिय करते हैं कि वे मॉडल के डिफ़ॉल्ट को पलट देते हैं।
शब्द "photorealistic" Flux 1.1 Pro और Realistic Vision v5.1 जैसे मॉडलों की ट्रेनिंग शब्दावली में सबसे ज़्यादा वज़न वाले शब्दों में से एक है। यह केवल यथार्थवाद का सुझाव नहीं देता। यह संबंधित विज़ुअल गुणों के पूरे समूह का संकेत देता है: प्राकृतिक रोशनी, फ़िल्म ग्रेन, सटीक परछाइयाँ, मानव-आकार के अनुपात, असली टेक्स्चर और फ़ोटोग्राफ़िक कलर ग्रेडिंग।

वह शब्द जो नियम बदल देता है
"Photorealistic" इस तरह का वज़न रखने वाला अकेला शब्द नहीं है, लेकिन सबसे ज़्यादा मॉडलों और विषयों में यही सबसे भरोसेमंद स्टाइल शब्द है। यह समझाता है कि यह ऐसे स्तर पर क्यों काम करता है जिस तक दूसरे एकल शब्द शायद ही पहुँच पाते हैं।
शब्द से पहले और बाद में
एक बेसलाइन प्रॉम्प्ट लीजिए: "a woman sitting in a cafe reading a book."
बिना किसी स्टाइल शब्द के, ज़्यादातर मॉडलों पर आउटपुट डिजिटल इलस्ट्रेशन और थोड़ी स्टाइलाइज़्ड फ़ोटो के बीच कहीं आता है। रोशनी सामान्य होती है। टेक्स्चर कृत्रिम ढंग से चिकना होता है। रंगों में हल्का सैचुरेशन बढ़ा होता है, जो कोई असली कैमरा नहीं देता।
अब आगे एक शब्द जोड़िए: "photorealistic, a woman sitting in a cafe reading a book."
फ़र्क़ तुरंत दिखता है। रोशनी दिशात्मक और भौतिक रूप से तार्किक हो जाती है। टेबल की सतह पर लकड़ी के रेशों का टेक्स्चर दिखता है। उसकी त्वचा पर दिखने वाले छिद्र और सूक्ष्म खामियाँ होती हैं। किताब के पन्नों में कागज़ की बनावट होती है। पृष्ठभूमि में बैठे लोग डेप्थ ऑफ़ फ़ील्ड की सटीक सिमुलेशन से उचित रूप से धुंधले हो जाते हैं।
एक शब्द। पूरी तरह अलग इमेज।
यह ऐसे क्यों काम करता है
शब्द "photorealistic" वह चीज़ लेकर चलता है जिसे प्रॉम्प्ट इंजीनियर सिमेंटिक ग्रैविटी कहते हैं। यह विज़ुअल गुणों के एक खास समूह से इतना घना जुड़ा है कि पूरी जनरेशन प्रक्रिया को एक ही दिशा में खींच लेता है। यह सब्जेक्ट का वर्णन नहीं करता। यह तय करता है कि मॉडल दृश्य में हर चीज़ को कैसे रेंडर करे।
💡 इसे कैमरा मोड स्विच की तरह समझें। हर तत्व को "realistic-looking" बताने के बजाय, आप मॉडल को RAW मोड में शूट करने को कहते हैं। उस निर्देश के बाद की हर चीज़ उसके नियम अपने आप ले लेती है।

पावर शब्द, क्रम से
"Photorealistic" राजा है, लेकिन हाई-इम्पैक्ट स्टाइल शब्दों का पूरा दरबार जानने लायक है। ये बेतरतीब विशेषण नहीं हैं। हर एक एक अलग विज़ुअल समूह को सक्रिय करता है और कई जनरेशन में लगातार नतीजे देता है।
श्रेणी 1: अधिकतम प्रभाव वाले शब्द
| शब्द | यह क्या सक्रिय करता है | सबसे अच्छा किसके लिए |
|---|
| photorealistic | फ़िल्म फ़ोटोग्राफ़ी की भौतिकी, प्राकृतिक टेक्स्चर, असली रोशनी | पोर्ट्रेट, लाइफ़स्टाइल, फ़ैशन |
| cinematic | वाइडस्क्रीन अनुपात, नाटकीय रोशनी, कलर ग्रेडिंग | मूड और कहानी वाले दृश्य |
| RAW photography | बिना प्रोसेस की डिटेल, प्राकृतिक ग्रेन, सच्चे रंग | स्ट्रीट फ़ोटोग्राफ़ी, डॉक्युमेंट्री |
| hyperrealistic | अत्यधिक डिटेल, लगभग मैक्रो स्तर की टेक्स्चर गुणवत्ता | चेहरे, प्रोडक्ट, क्लोज़-अप |
| shot on 35mm | फ़िल्म ग्रेन, प्राकृतिक रंग, ऑर्गेनिक एहसास | कोई भी लाइफ़स्टाइल या पोर्ट्रेट दृश्य |
श्रेणी 2: टेक्स्चर और वातावरण वाले शब्द
| शब्द | यह क्या सक्रिय करता है | सबसे अच्छा किसके लिए |
|---|
| Kodak Portra 400 | गर्म त्वचा के टोन, प्राकृतिक ग्रेन, फ़िल्म लुक | पोर्ट्रेट, आउटडोर दृश्य |
| bokeh | शैलो डेप्थ ऑफ़ फ़ील्ड, क्रीमी पृष्ठभूमि ब्लर | पोर्ट्रेट में सब्जेक्ट को अलग दिखाना |
| volumetric lighting | गॉड रेज़, वायुमंडलीय गहराई, नाटकीय परछाइयाँ | लैंडस्केप, इंटीरियर दृश्य |
| film grain | ऑर्गेनिक टेक्स्चर, कम डिजिटल आर्टिफ़ैक्ट्स | किसी भी इमेज में प्रामाणिकता जोड़ता है |
| Rembrandt lighting | एकल नाटकीय साइडलाइट, गहरी परछाइयाँ | कैरेक्टर पोर्ट्रेट, नाटकीय मूड |
वे शब्द जिन्हें इस्तेमाल करना बंद करें
कुछ शब्द जो उपयोगी लगते हैं, असल में मॉडल को इलस्ट्रेटेड या कृत्रिम आउटपुट की ओर खींचते हैं। इन्हें अपने photorealistic प्रॉम्प्ट से हटा दें:
- "beautiful" अक्सर आदर्शीकृत, इलस्ट्रेटेड सौंदर्य की ओर धकेलता है, फ़ोटोग्राफ़िक सौंदर्य की ओर नहीं
- "amazing" इतना अस्पष्ट है कि कोई खास विज़ुअल समूह सक्रिय नहीं करता
- "detailed" "visible pores" या "fabric weave" जैसे खास टेक्स्चर वर्णकों की तुलना में कम प्रभाव वाला है
- "high quality" बिना स्टाइल एंकर के लगभग कुछ नहीं बताता कि गुणवत्ता कैसी दिखनी चाहिए

शब्द कहाँ रखते हैं, इससे फ़र्क़ पड़ता है
प्रॉम्प्ट में स्थिति बेतरतीब नहीं होती। प्राकृतिक भाषा पर ट्रेन किए गए मॉडल कई आर्किटेक्चर में पहले के टोकन को ज़्यादा वज़न देते हैं। स्थिति ही तय कर सकती है कि कोई शब्द पूरी इमेज का मार्गदर्शन करता है या मुश्किल से दर्ज होता है।
स्टाइल के लिए आगे रखना
अपना पावर शब्द प्रॉम्प्ट की सबसे शुरुआत में रखें, सब्जेक्ट के वर्णन से पहले:
"Photorealistic, cinematic, a woman in a red dress standing at a rainy window, warm interior light against cold blue exterior, 85mm f/1.4"
इससे "photorealistic" और "cinematic" प्रमुख निर्देश बन जाते हैं। उसके बाद का हर हिस्सा इन्हीं फ़िल्टरों से होकर समझा जाता है।
दोहराव के लिए अंत में रखना
प्रॉम्प्ट का अंत किसी गुणवत्ता एंकर से करना अलग तरह से काम करता है। यह स्टाइल को ऊपर से तय करने के बजाय उसे मज़बूत करता है:
"A woman in a red dress standing at a rainy window, warm interior light, 85mm f/1.4, shot on Kodak Portra 400, photorealistic RAW photography"
दोनों स्थितियाँ काम करती हैं। आगे रखना पहले टोकन से ही विज़ुअल रजिस्टर तय करता है। अंत में रखना सब्जेक्ट और दृश्य स्थापित होने के बाद उसे मज़बूत करता है। सबसे प्रभावी प्रॉम्प्ट दोनों तरीके अपनाते हैं।
स्टैकिंग फ़ॉर्मूला
फ़ोटोरियलिस्टिक नतीजों के लिए सबसे अच्छा प्रदर्शन करने वाली प्रॉम्प्ट संरचना एक भरोसेमंद पैटर्न पर चलती है:
[स्टाइल शब्द] + [सब्जेक्ट और क्रिया] + [वातावरण] + [रोशनी] + [कैमरा स्पेक्स] + [फ़िल्म स्टॉक]
उदाहरण: "Photorealistic, young woman laughing in a sunlit garden, golden hour backlight creating warm halo effect, shot with 85mm f/1.8, Kodak Portra 400 film grain, natural skin texture visible"
💡 स्टैक का हर तत्व इमेज की एक अलग परत संभालता है। स्टाइल रजिस्टर तय करता है। सब्जेक्ट फ़ोकस देता है। वातावरण संदर्भ देता है। रोशनी मूड बनाती है। कैमरा स्पेक्स डेप्थ नियंत्रित करते हैं। फ़िल्म स्टॉक अंतिम ऑर्गेनिक टेक्स्चर जोड़ता है।

अलग-अलग मॉडल कैसे प्रतिक्रिया देते हैं
हर मॉडल एक ही शब्द को एक जैसा नहीं लेता। किसी खास शब्द का वज़न इस बात पर निर्भर करता है कि मॉडल किस पर ट्रेन हुआ और उसे कैसे फ़ाइन-ट्यून किया गया। अपने मॉडल को जानने से यह बदलता है कि आप प्रॉम्प्ट कैसे लिखते हैं।
Flux मॉडल: भाषा-अनुकूल
Flux परिवार, जिसमें Flux 2 Pro, Flux 1.1 Pro और Flux Schnell शामिल हैं, अधिक भाषा-संरेखित तरीके से ट्रेन किया गया है। ये मॉडल प्राकृतिक भाषा के स्टाइल निर्देशों पर अच्छी प्रतिक्रिया देते हैं। Flux के साथ आप लिख सकते हैं "make this photorealistic with natural film grain" और मॉडल उस निर्देश को असंबद्ध कीवर्ड की तरह नहीं, बल्कि संदर्भ के साथ समझता है।
Flux Kontext Pro वेरिएंट इसे और आगे ले जाता है, इमेज-आधारित संदर्भ इनपुट की अनुमति देकर कई जनरेशन में फ़ोटोरियलिस्टिक स्टाइल की स्थिरता को काफ़ी ज़्यादा भरोसेमंद बनाता है।
Flux के लिए सबसे अच्छा तरीका: वर्णनात्मक, प्राकृतिक भाषा इस्तेमाल करें। स्टाइल शब्द आगे रखें, लेकिन उसके बाद कीवर्ड सूची के बजाय पूरे वाक्य लिखें। Flux घनत्व के बजाय स्पष्टता को पुरस्कृत करता है।
SDXL वेरिएंट: कीवर्ड-संवेदी
Stable Diffusion XL और उसके वेरिएंट कीवर्ड-शैली के प्रॉम्प्ट पर मज़बूत प्रतिक्रिया देते हैं। मॉडल कॉमा से अलग किए गए शब्दों को अलग-अलग ध्यान संकेतों की तरह लेता है। शुरू में रखे स्टाइल शब्दों का ध्यान-वज़न अधिक होता है, और कीवर्ड का क्रम सीधे तय करता है कि आउटपुट में कौन से तत्व हावी होंगे।
SDXL के लिए, स्टैक्ड कीवर्ड तरीका प्राकृतिक भाषा से लगातार बेहतर प्रदर्शन करता है:
"photorealistic, professional photography, young woman, golden hour, 85mm portrait, Kodak Portra 400, film grain, sharp focus, directional natural light"
SDXL के लिए सबसे अच्छा तरीका: कॉमा से अलग किए गए कीवर्ड। हर एक अलग संकेत भेजता है। क्रम मायने रखता है, इसलिए सबसे महत्वपूर्ण स्टाइल और गुणवत्ता शब्द पहले रखकर प्राथमिकता तय करें।
Realistic Vision: रोशनी ही लीवर है
Realistic Vision v5.1 एक फ़ाइन-ट्यून्ड मॉडल है जो अपने डिफ़ॉल्ट के रूप में पहले से ही फ़ोटोरियलिस्टिक आउटपुट की ओर भारी झुकाव रखता है। यहाँ "photorealistic" जोड़ने से बेस मॉडलों की तुलना में कम अतिरिक्त लाभ मिलता है। मॉडल पहले से यथार्थवाद के लिए अनुकूलित है, इसलिए रुकावट रोशनी की गुणवत्ता पर खिसक जाती है।
Realistic Vision प्रॉम्प्ट में "volumetric lighting" या "Rembrandt lighting" जोड़ने से अक्सर "photorealistic" जोड़ने की तुलना में ज़्यादा नाटकीय फ़र्क़ आता है, क्योंकि यथार्थवाद पहले से ही मॉडल में बैठा है। इस मॉडल पर जो एक शब्द सब कुछ बदल देता है वह एक खास रोशनी का वर्णक है।

अध्ययन के लायक 10 प्रॉम्प्ट: पहले और बाद में
ये उदाहरण दिखाते हैं कि एक स्टाइल शब्द जोड़ने से क्या असर होता है। हर जोड़ी में सब्जेक्ट का वर्णन एक जैसा है। केवल एंकर शब्द बदलता है।
पोर्ट्रेट और फ़ैशन
| एंकर के बिना | एंकर के साथ |
|---|
| "woman in a white dress on a beach" | "photorealistic, woman in a white dress on a beach" |
| "man in a suit on a city street" | "cinematic, man in a suit on a city street" |
| "model with long hair, outdoor, daytime" | "shot on 35mm film, model with long hair, outdoor, daytime" |
| "girl with freckles in natural light" | "Kodak Portra 400, girl with freckles in natural light" |
प्रकृति और लैंडस्केप
| एंकर के बिना | एंकर के साथ |
|---|
| "forest path in autumn" | "RAW photography, forest path in autumn" |
| "sunrise over mountain lake" | "volumetric lighting, sunrise over mountain lake" |
| "waves crashing on rocky shore" | "hyperrealistic, waves crashing on rocky shore" |
लाइफ़स्टाइल और भावना
| एंकर के बिना | एंकर के साथ |
|---|
| "woman laughing with friends at a restaurant" | "candid photography, woman laughing with friends at a restaurant" |
| "man reading a book by a window" | "Kodak Portra 400, man reading a book by a window" |
| "couple walking on a beach at sunset" | "cinematic photography, couple walking on a beach at sunset" |
💡 एक ही मॉडल पर, एक ही सीड के साथ, दोनों संस्करण बैक-टू-बैक चलाएँ ताकि पता चले कि एक शब्द आउटपुट पर असल में क्या कर रहा है। फ़र्क़ आमतौर पर तुरंत और साफ़ दिखता है।

अपना खुद का पावर शब्द भंडार बनाना
कुछ हाई-इम्पैक्ट शब्द जानना एक शुरुआत है। अपने खास उपयोग के मामलों के लिए भरोसेमंद रूप से काम करने वाले परखे हुए शब्दों की निजी शब्दावली बनाना ही उन क्रिएटर्स को अलग करता है जो लगातार अच्छा काम करते हैं, उनसे जो कभी-कभार किस्मत से अच्छी इमेज पाते हैं।
5-शब्द प्रॉम्प्ट ढाँचा
हर मज़बूत फ़ोटोरियलिस्टिक प्रॉम्प्ट पाँच मुख्य शब्द प्रकारों पर बनाया जा सकता है। इसे एक ढाँचा मानें जिसे आप हर खास इमेज के लिए विस्तार देते हैं:
- स्टाइल एंकर जैसे photorealistic, cinematic, या RAW फ़ोटोग्राफ़ी
- सब्जेक्ट डिस्क्रिप्टर जो बताता है कि दृश्य में कौन या क्या है
- लाइटिंग का प्रकार जैसे गोल्डन आवर, Rembrandt, या volumetric
- कैमरा स्पेसिफ़िकेशन जैसे 85mm f/1.8, वाइड एंगल, या टाइट क्लोज़-अप
- फ़िल्म या टेक्स्चर सिग्नेचर जैसे Kodak Portra 400 या प्राकृतिक फ़िल्म ग्रेन
यह ढाँचा अकेले, थोड़े अतिरिक्त ब्योरे के साथ भी, उन विस्तृत गद्य वर्णनों से लगातार बेहतर प्रदर्शन करता है जिनमें ये पाँच स्तंभ नहीं होते। यह ढाँचा मॉडल को गुणवत्ता संबंधी फ़ैसले लेने के लिए ज़रूरी सारी जानकारी बिना किसी अस्पष्टता के देता है।
वे शब्द जिनकी ताकत खत्म हो चुकी है
AI इमेज जनरेशन के शुरुआती दौर में कुछ शब्द बेहद असरदार थे, लेकिन इतने ज़्यादा इस्तेमाल हुए कि मॉडल ने उनका असर लगभग औसत कर दिया है:
- "masterpiece" Stable Diffusion का सबसे मज़बूत क्वालिटी टैग था और अब बहुत कमज़ोर हो चुका है
- "best quality" का सिग्नल वज़न इतना कम है कि आउटपुट में कोई खास बदलाव नहीं लाता
- "ultra detailed" की जगह अब "visible pore texture" या "fabric weave visible" जैसे खास टेक्स्चर वर्णक आ गए हैं
- "trending on ArtStation" 2022 में शक्तिशाली था और अब लगभग बेअसर हो चुका है
इन्हें ठोस, खास वर्णकों से बदलने से मॉडल को ज़्यादा उपयोगी जानकारी मिलती है और नतीजे लगातार बेहतर आते हैं।
परखें और ट्रैक करें कि क्या काम करता है
AI इमेज जनरेशन में सबसे कम आँकी जाने वाली आदत प्रॉम्प्ट और उनके आउटपुट का लॉग रखना है। जब कोई शब्द नाटकीय रूप से बेहतर नतीजा दे, तो उसे लिख लें। जब कोई शब्द लगातार इमेज बिगाड़े, तो उसे ब्लैकलिस्ट कर दें। समय के साथ यह निजी संदर्भ पुस्तकालय किसी भी सामान्य प्रॉम्प्ट फ़ॉर्मूले से ज़्यादा कीमती बन जाता है।
💡 अलग-अलग मॉडल एक ही शब्द पर अलग प्रतिक्रिया देते हैं। जो शब्द Flux आउटपुट को नाटकीय रूप से बदलता है, वह SDXL पर लगभग बेअसर हो सकता है, और इसका उल्टा भी। हर पावर शब्द को उसी मॉडल पर परखें जिसे आप सबसे ज़्यादा इस्तेमाल करने की योजना बना रहे हैं।

कई एंकर का चक्रवृद्धि प्रभाव
एक शब्द इमेज बदलता है। दो हाई-इम्पैक्ट शब्द उसे और ज़्यादा बदलते हैं। सही जगह रखे तीन शब्द ऐसे नतीजे दे सकते हैं जो प्रोफ़ेशनल फ़ोटोग्राफ़ी को टक्कर दें। यह असर जोड़ने वाला नहीं है। यह गुणा होता है। हर एंकर शब्द बाकी को मज़बूत करता है और जनरेशन को मॉडल के डिफ़ॉल्ट से दूर, आपके इच्छित आउटपुट की ओर धकेलता है।
शब्द जोड़ना कब रोकें
ज़्यादा हमेशा बेहतर नहीं होता। पाँच से सात उच्च-सिग्नल शब्दों के बाद, अतिरिक्त योग्यताएँ टकराव पैदा करने लगती हैं। मॉडल हर निर्देश को एक साथ मानने की कोशिश करता है और नतीजा ओवर-प्रोसेस्ड या विज़ुअली असंगत हो सकता है।
ज़्यादातर फोटोरियलिस्टिक प्रॉम्प्ट के लिए सबसे अच्छी रेंज कुल मिलाकर 30 से 60 शब्दों के बीच है। इतना लंबा कि साफ़-साफ़ बताया जा सके। इतना छोटा कि विरोधाभास से बचा जा सके।
एक-शब्द परीक्षण
जब आप यह जाँचना चाहते हैं कि कोई खास शब्द आपके प्रॉम्प्ट में सच में कुछ उपयोगी कर रहा है या नहीं, तो दो एक जैसी जनरेशन चलाएँ: एक शब्द के साथ और एक उसके बिना। अगर आप भरोसे से नहीं बता पाते कि कौन सा आउटपुट बेहतर है, तो वह शब्द उस टोकन जगह के लायक नहीं है जो वह घेरता है।
अनुभवी प्रॉम्प्ट इंजीनियर इसी तरह पहचानते हैं कि कौन से शब्द असल में वज़न रखते हैं और कौन से सिर्फ़ भराव हैं जो उपयोगी लगते हैं पर आउटपुट में कुछ नहीं बदलते। निर्मम परीक्षण एक भरोसेमंद निजी फ़ॉर्मूले तक पहुँचने का सबसे छोटा रास्ता है।

PicassoIA पर सटीकता के साथ जनरेट करना शुरू करें
इस लेख में जो बताया गया है उसे समझने का सबसे तेज़ तरीका खुद प्रयोग करना है। कोई भी पुराना प्रॉम्प्ट लें जिसके नतीजे से आप पूरी तरह संतुष्ट नहीं थे। उसकी शुरुआत में "photorealistic" जोड़ें। चलाएँ। फिर "cinematic" आज़माएँ। फिर "shot on Kodak Portra 400" आज़माएँ। तीनों आउटपुट को साथ-साथ रखकर तुलना करें।
PicassoIA पर आपके पास Flux 1.1 Pro, Flux 2 Pro, Realistic Vision v5.1, Dreamshaper XL Turbo और Playground v2.5 जैसे मॉडल उपलब्ध हैं, जिनके डिफ़ॉल्ट सौंदर्य अलग हैं और स्टाइल एंकर शब्दों के प्रति संवेदनशीलता भी अलग है।
एक ही प्रयोग तीन अलग मॉडलों पर चलाने से आपको यह पूरी तस्वीर मिलती है कि यह शब्द अलग-अलग आर्किटेक्चर में असल में कैसे काम करता है। संभव है कि आपको दिखे कि Flux पर सबसे ज़्यादा काम करने वाला शब्द वह नहीं है जो SDXL पर हावी है। यह कोई समस्या नहीं है। यही वह जानकारी है जो आपके अगले सौ प्रॉम्प्ट को पिछले सौ से बेहतर बनाती है।
"photorealistic" से शुरुआत करें। एक और शब्द जोड़ें। देखें क्या बदलता है। हर अनुभवी प्रॉम्प्ट इंजीनियर इसी तरह यहाँ तक पहुँचा है: एक बार में एक शब्द, एक बार में एक प्रयोग। केवल बुरा प्रॉम्प्ट वह है जिसे आपने कभी परखा ही नहीं।