AI इमेज जनरेशन में प्रॉम्प्ट इंजीनियरिंग आपके नतीजों को कैसे बदलती है

आपके प्रॉम्प्ट का हर शब्द आपको मिलने वाली AI इमेज को आकार देता है। यह लेख बताता है कि प्रॉम्प्ट की संरचना, लाइटिंग की भाषा, स्टाइल डिस्क्रिप्टर और नेगेटिव प्रॉम्प्ट मिलकर एक ही AI मॉडल से बिल्कुल अलग नतीजे कैसे देते हैं।

AI इमेज जनरेशन में प्रॉम्प्ट इंजीनियरिंग आपके नतीजों को कैसे बदलती है
Cristian Da Conceicao
Picasso IA के संस्थापक

एक औसत AI इमेज और एक शानदार इमेज के बीच का फ़र्क लगभग कभी मॉडल का नहीं होता। वह प्रॉम्प्ट होता है। दो लोग एक ही टेक्स्ट-टू-इमेज AI का इस्तेमाल कर सकते हैं, थोड़े अलग निर्देश टाइप कर सकते हैं, और ऐसे नतीजे पा सकते हैं जो लगें कि दो अलग प्रोग्रामों से बने हैं। क्वालिटी का वह बड़ा फ़ासला इस पर निर्भर करता है कि आप लिखते कैसे हैं।

प्रॉम्प्ट इंजीनियरिंग वह तरीका है जिसमें सटीक, संरचित और वर्णनात्मक टेक्स्ट लिखा जाता है, जो AI मॉडल को साफ़-साफ़ बताता है कि क्या बनाना है। इसमें कोई जादुई शब्द या गुप्त कोड नहीं होते। यह संवाद की बात है। आप जितना साफ़ बताएँगे कि क्या चाहिए, नतीजा आपकी सोच के उतना ही करीब होगा। और आप जितनी ज़्यादा विशिष्टता जोड़ेंगे, फ़र्क उतना ही ज़्यादा नज़र आएगा।

प्रॉम्प्ट असल में क्या करता है

स्टूडियो मॉनिटर पर दिखती अस्पष्ट और विशिष्ट AI प्रॉम्प्ट के नतीजों की तुलना

यह आपके शब्दों को विज़ुअल प्रोबेबिलिटी की तरह पढ़ता है

जब आप Flux Pro या Stable Diffusion 3.5 Large जैसे मॉडल में प्रॉम्प्ट टाइप करते हैं, तो मॉडल आपके वाक्य को इंसान की तरह नहीं पढ़ता। वह आपके शब्दों को विज़ुअल टोकन के एक सेट की तरह प्रोसेस करता है, जिनमें से हर एक ट्रेनिंग के दौरान लाखों ट्रेनिंग इमेज से सीखे गए खास पिक्सल पैटर्न के साथ सांख्यिकीय संबंध रखता है।

"Woman" कुछ पैटर्न क्लस्टर सक्रिय करता है। "Woman in a park" उन क्लस्टर को सीमित करता है। "Woman in a park at golden hour, backlit by setting sun, 85mm lens, shallow depth of field" मॉडल के सीखे हुए विज़ुअल स्पेस के एक बेहद खास हिस्से को सक्रिय करता है। नतीजा सिर्फ़ ज़्यादा विस्तृत नहीं होता। वह ज़्यादा नियंत्रित होता है।

हर शब्द प्रोबेबिलिटी डिस्ट्रीब्यूशन को खिसकाता है

हर शब्द को एक डायल समझें। एक डायल घुमाने से पूरी इमेज बदल जाती है। "Overcast sky" जोड़ें और लाइटिंग नरम हो जाती है। "Kodak Portra 400" जोड़ें और कलर पैलेट गर्म, थोड़े डीसैचुरेटेड फ़िल्म टोन की ओर खिसक जाता है। "Low angle" जोड़ें और पर्सपेक्टिव झुक जाता है। मॉडल एक सुसंगत आउटपुट बनाने के लिए इन सारे डायल को एक साथ लगातार संतुलित करता रहता है।

इसी वजह से दो प्रॉम्प्ट जो अर्थ में मिलते-जुलते लगते हैं, विज़ुअली पूरी तरह अलग इमेज दे सकते हैं। यह रैंडमनेस नहीं है। यह सटीकता है, या उसकी कमी।

अस्पष्ट बनाम विशिष्ट: असली फ़ासला

नोटपैड पर हाथ से लिखे नोट्स और स्टिकी नोट्स के साथ प्रॉम्प्ट की योजना बनाता फ़ोटोग्राफ़र

"Woman in a park" से क्या मिलता है

किसी भी मॉडल में "woman in a park" टाइप करें और आपको कुछ तकनीकी रूप से सही मिलेगा। बाहर एक व्यक्ति, उसके आसपास कुछ हरी चीज़ें। लेकिन AI को हर विज़ुअल फ़ैसला खुद लेना पड़ता है: दिन का समय, उसके कपड़े, उसका भाव, रोशनी की दिशा, कैमरा का कोण, डेप्थ ऑफ़ फ़ील्ड, रंग का मूड। वह इन सबके लिए औसत चुनाव करता है, क्योंकि जब कोई बंधन न हो तो सांख्यिकीय प्रोबेबिलिटी यही देती है।

नतीजा 2014 की किसी स्टॉक फ़ोटो जैसा दिखता है। तकनीकी रूप से सही। विज़ुअली भुलाने लायक।

30 और शब्द क्या देते हैं

अब यह कोशिश करें: "a young woman in a linen shirt crouching in a wheat field at golden hour, backlit by setting sun creating a halo through her hair, low-angle ground-level shot, 24mm wide lens, soft golden bokeh in foreground grass, Kodak Portra 400 film grain."

अब हर विज़ुअल फ़ैसला आपके हाथ में है। लाइटिंग तय है। लेंस तय है। डेप्थ ऑफ़ फ़ील्ड का तरीका तय है। कलर पैलेट तय है। कंपोज़िशन तय है। AI को अंदाज़ा नहीं लगाना पड़ता। वह ट्रेनिंग डेटा का औसत निकालने के बजाय आपकी सोच को अमल में लाता है।

प्रॉम्प्ट इंजीनियरिंग यही बुनियादी बदलाव लाती है। बेहतर AI नहीं, बेहतर निर्देश।

एक मज़बूत प्रॉम्प्ट के 5 बिल्डिंग ब्लॉक

गेहूँ के खेत में गोल्डन आवर पर फ़िल्म कैमरे के साथ बैठी महिला फ़ोटोग्राफ़र

एक अच्छी तरह बना प्रॉम्प्ट पाँच घटकों से बनता है। हर बार पाँचों की ज़रूरत नहीं होती, लेकिन जितने ज़्यादा आप शामिल करेंगे, नतीजे पर आपका नियंत्रण उतना ही ज़्यादा होगा।

1. सब्जेक्ट

मुख्य फ़ोकस कौन या क्या है? शारीरिक लक्षणों, कपड़ों, पोज़ और भावनात्मक स्थिति के बारे में साफ़-साफ़ बताएँ। "एक महिला" को "टेलर्ड ब्लेज़र पहने, घुंघराले काले बालों वाली 30 साल की एक महिला, जो शांत भाव से सीधे कैमरे में देख रही हो" बनाया जा सकता है। हर जोड़ा गया विवरण एक ऐसा वेरिएबल हटा देता है जिसे मॉडल अन्यथा अपने आप तय करता।

2. सेटिंग

यह कहाँ हो रहा है? दिन का समय, जगह, पृष्ठभूमि के तत्व और पर्यावरण की स्थितियाँ, ये सब इमेज को नाटकीय रूप से आकार देते हैं। "एक शहर में" को "रात 11 बजे, बारिश से चमकती कंकड़-पत्थर वाली गली पर, गीली ज़मीन पर स्ट्रीटलैंप की एम्बर रोशनी के गोल धब्बे, और दूर की हेडलाइट्स जो मोशन से धुंधली हों" बनाया जा सकता है। अब पृष्ठभूमि में बनावट, गहराई और माहौल होता है।

3. लाइटिंग

किसी भी फ़ोटोग्राफ़िक प्रॉम्प्ट में यह अकेला सबसे शक्तिशाली तत्व है। लाइटिंग किसी भी और कारक से ज़्यादा इमेज के भावनात्मक रंग को बदलती है।

लाइटिंग टर्मयह क्या पैदा करता है
गोल्डन आवर बैकलाइटगर्म हेलो, सिल्हूट के किनारे, अम्बर टोन
ओवरकास्ट डिफ़्यूज़्डनरम, समान छाया, ठंडे टोन, कम कंट्रास्ट
रेम्ब्रांट लाइटिंग45 डिग्री की दिशात्मक रोशनी, नाटकीय चेहरे की छाया
वॉल्यूमेट्रिक लाइटवातावरण में दिखने वाली रोशनी की किरणें
प्रैक्टिकल लाइटिंगफ़्रेम में दिखने वाले रोशनी के स्रोत, लैंप और स्क्रीन

4. कैमरा और लेंस

Flux 1.1 Pro Ultra और Imagen 4 Ultra जैसे मॉडल फ़ोटोग्राफ़ी मेटाडेटा की भारी मात्रा पर ट्रेन किए गए हैं। लेंस की फ़ोकल लेंथ और एपर्चर बताने से डेप्थ-ऑफ़-फ़ील्ड इफ़ेक्ट कहीं ज़्यादा वास्तविक बनते हैं।

  • 85mm f/1.4: कसकर पोर्ट्रेट कंप्रेशन, मुलायम बैकग्राउंड ब्लर
  • 24mm f/1.8: चौड़ा परिवेश संदर्भ, हल्की किनारे की विकृति
  • 135mm f/2.0: मज़बूत बैकग्राउंड कंप्रेशन, टेलीफ़ोटो की नज़दीकी
  • 100mm macro: अत्यधिक क्लोज़-अप डिटेल, बहुत पतला फ़ोकल प्लेन

5. मूड और माहौल

इमेज के भावनात्मक एहसास का वर्णन करने वाले शब्द टेक्सचर, कंट्रास्ट, कलर ग्रेडिंग और निहित कहानी को प्रभावित करते हैं। "Melancholic," "tense," "nostalgic" और "serene" में से हर एक आउटपुट को मापने योग्य रूप से अलग दिशा में ले जाता है। ये काम करते हैं क्योंकि मॉडल ने ट्रेनिंग के दौरान लाखों इमेज से जुड़ी भावनात्मक भाषा को आत्मसात किया है।

नेगेटिव प्रॉम्प्ट: आप क्या हटा रहे हैं

चमकदार स्कैंडिनेवियाई ऑफ़िस में लैपटॉप के कीबोर्ड पर सटीकता से टाइप करते हाथों का क्लोज़-अप

अपवर्जन सब कुछ क्यों बदल देता है

नेगेटिव प्रॉम्प्ट AI को बताते हैं कि किससे सक्रिय रूप से बचना है। ये केवल पॉज़िटिव प्रॉम्प्ट के उल्टे नहीं होते। ये एक अलग सप्रेशन मैकेनिज़्म पर काम करते हैं, जो जनरेशन को खास पैटर्न क्लस्टर से दूर मोड़ता है।

नेगेटिव प्रॉम्प्ट के बिना, पोर्ट्रेट जनरेशन में हल्की धुंधली आँखें, अतिरिक्त उँगलियाँ, सपाट लाइटिंग या इमेज में वॉटरमार्क जैसी बनावट आ सकती है। अपने नेगेटिव फ़ील्ड में साफ़ अपवर्जन जोड़ने से वे सांख्यिकीय आकर्षण इमेज बनने से पहले ही आउटपुट से हट जाते हैं।

डिफ़ॉल्ट रूप से क्या बाहर रखें

💡 फ़ोटोरियलिस्टिक आउटपुट के लिए, अपने नेगेटिव प्रॉम्प्ट में ये जोड़ने पर हमेशा विचार करें: cartoon, illustration, painting, CGI, 3D render, anime, digital art, overexposed, underexposed, blurry, watermark, text overlay, distorted hands, extra fingers

Flux Dev और SDXL जैसे मॉडल नेगेटिव प्रॉम्प्ट पर ज़ोरदार प्रतिक्रिया देते हैं। Stable Diffusion 3.5 Large पर अच्छी तरह बने नेगेटिव प्रॉम्प्ट पॉज़िटिव प्रॉम्प्ट का एक भी शब्द बदले बिना, एक ही जनरेशन में इमेज को ठीक-ठाक से पोर्टफ़ोलियो-योग्य बना सकते हैं।

स्टाइल डिस्क्रिप्टर जो सचमुच काम करते हैं

गोधूलि के समय हाई-राइज़ छत पर बहते सफ़ेद सिल्क ड्रेस में खड़ी एक सुंदर महिला

फ़ोटोग्राफ़ी स्टाइल बनाम आर्ट स्टाइल

फ़ोटोग्राफ़ी-स्टाइल प्रॉम्प्ट और आर्ट-स्टाइल प्रॉम्प्ट के बीच एक ज़रूरी फ़र्क है। फ़ोटोग्राफ़ी प्रॉम्प्ट वास्तविक आउटपुट देते हैं। आर्ट-स्टाइल प्रॉम्प्ट इलस्ट्रेशन, पेंटिंग या CGI रेंडर देते हैं। अगर आपको फ़ोटोरियलिज़्म चाहिए, तो आपकी स्टाइल की भाषा विज़ुअल आर्ट से नहीं, फ़ोटोग्राफ़ी से आनी चाहिए।

फ़ोटोरियलिज़्म के लिए इसका इस्तेमाल करें:

  • RAW 8K photography
  • Sony A7 IV पर खींची गई
  • Kodak Portra 400
  • Film grain
  • Photorealistic

रियलिस्टिक आउटपुट के लिए इनसे बचें:

  • डिजिटल आर्ट
  • सिनेमैटिक रेंडर
  • 3D इलस्ट्रेशन
  • ArtStation पर ट्रेंडिंग
  • हाइपररियलिस्टिक पेंटिंग

अकेला शब्द "painting", भले ही सकारात्मक संदर्भ में हो, पूरे आउटपुट को इलस्ट्रेटेड सौंदर्य की ओर धकेल सकता है। फ़ोटोग्राफ़िक माध्यम के बारे में विशिष्टता मॉडल को वहीं टिकाती है जहाँ आप उसे चाहते हैं।

वज़न रखने वाले शब्द

कुछ शब्दों का असर उनके शब्दकोश अर्थ से कहीं ज़्यादा मज़बूत होता है। ऐसा इसलिए है क्योंकि ये ट्रेनिंग डेटा में उच्च-गुणवत्ता वाले फ़ोटोग्राफ़ी कैप्शन में अक्सर आते हैं, इसलिए मॉडल ने इन्हें तकनीकी रूप से उत्कृष्ट इमेज से जोड़ना सीखा है।

  • "photorealistic": पेंटरली और इलस्ट्रेटेड स्टाइल से दूर ले जाता है
  • "film grain": ऑर्गेनिक टेक्सचर जोड़ता है और डिजिटल रूखापन घटाता है
  • "volumetric light": लाइटिंग में दिखने वाला माहौल और गहराई बनाता है
  • "depth of field": वास्तविक ऑप्टिकल ब्लर इफ़ेक्ट सक्रिय करता है
  • "natural lighting": स्टूडियो-लैंप वाले कृत्रिम सौंदर्य से बचाता है
  • "RAW": बिना प्रोसेस हुए, उच्च-निष्ठा फ़ोटोग्राफ़िक आउटपुट का संकेत देता है

अलग-अलग मॉडल प्रॉम्प्ट पर कैसे प्रतिक्रिया देते हैं

स्टूडियो फ़र्श पर फ़ोम बोर्ड पर लगी प्रिंटेड AI इमेज देखता क्रिएटिव डायरेक्टर

वही प्रॉम्प्ट इस पर निर्भर करके अलग नतीजे दे सकता है कि उसे कौन सा मॉडल प्रोसेस करता है। यह जानना कि हर मॉडल आपके शब्दों की व्याख्या कैसे करता है, आपको उस टूल के लिए खास प्रॉम्प्ट लिखने में मदद करता है, न कि ऐसे सामान्य निर्देश जो हर बार अलग असर डालें।

Flux मॉडल और प्रॉम्प्ट एडहेरेंस

Flux परिवार, जिसमें Flux Pro, Flux 1.1 Pro और Flux Schnell शामिल हैं, असाधारण रूप से ऊँची प्रॉम्प्ट एडहेरेंस दर रखता है। ये मॉडल निर्देशों का करीब से पालन करने के लिए बने हैं। लंबे, विस्तृत प्रॉम्प्ट इन्हें भारी नहीं पड़ते। छोटे, अस्पष्ट इनपुट की तुलना में ज़्यादा विशिष्टता के साथ ये वास्तव में बेहतर प्रदर्शन करते हैं।

Flux मॉडल के लिए अपनी सबसे ज़रूरी विज़ुअल जानकारी सबसे आगे रखें। पहले सब्जेक्ट आना चाहिए, फिर परिवेश, फिर लाइटिंग, फिर लेंस का विवरण।

Stable Diffusion और स्टाइल कंट्रोल

SDXL और Stable Diffusion 3.5 Large आर्टिस्टिक स्टाइल डिस्क्रिप्टर पर ज़ोरदार प्रतिक्रिया देते हैं। ये मॉडल स्टाइल में लचीले हैं, फ़ोटोरियलिस्टिक से लेकर पेंटरली तक। अगर आपको फ़ोटोरियलिस्टिक क्षेत्र में रहना है, तो प्रॉम्प्ट में इसके बारे में साफ़-साफ़ लिखना चाहिए, वरना मॉडल डिफ़ॉल्ट रूप से स्टाइलाइज़्ड आउटपुट की ओर बह सकता है।

💡 SD मॉडल के लिए टिप: अपने प्रॉम्प्ट की शुरुआत में "photorealistic photography, RAW" लिखें और नेगेटिव प्रॉम्प्ट में "digital art, illustration, painting" एक साथ जोड़ें। दोनों संकेत एक साथ मिलकर फ़ोटोग्राफ़िक स्टाइल में ज़्यादा मज़बूत आधार देते हैं।

Imagen और फ़ोटोरियलिज़्म

Google के Imagen 4 और Imagen 4 Ultra खास तौर पर फ़ोटोरियलिज़्म के लिए ऑप्टिमाइज़ किए गए हैं। ये बिना बहुत सारे तकनीकी फ़ोटोग्राफ़ी मॉडिफ़ायर की ज़रूरत के, असाधारण स्किन टेक्सचर और लाइटिंग देते हैं। फिर भी, ये विस्तृत कंपोज़िशनल विवरणों पर अच्छी प्रतिक्रिया देते हैं। लाइटिंग का कोण, बैकग्राउंड की गहराई और फ़्रेम में सब्जेक्ट की जगह, ये सब अंतिम इमेज में मापने योग्य अंतर पैदा करते हैं।

प्रॉम्प्ट का वज़न और प्राथमिकता

धूप से भरे पेरिस कैफ़े में दोपहर की रोशनी में घुंघराले बालों वाली एक स्टाइलिश युवा महिला

सब्जेक्ट को सबसे आगे रखना

ज़्यादातर आधुनिक टेक्स्ट-टू-इमेज मॉडल प्रॉम्प्ट की शुरुआत को अंत से ज़्यादा वज़न देते हैं। पहले 20 से 30 शब्द मुख्य विज़ुअल सब्जेक्ट पर सबसे ज़्यादा असर डालते हैं। अगर लंबे प्रॉम्प्ट में आपका सब्जेक्ट अंत की ओर खिसकता है, तो उसे पहले बताए गए परिवेश के विवरणों के मुकाबले कम प्राथमिकता मिल सकती है।

अपने प्रॉम्प्ट को इस पदानुक्रम में संरचित करें:

  1. मुख्य सब्जेक्ट (कौन, क्या, क्या कर रहा है)
  2. परिवेश और बैकग्राउंड
  3. लाइटिंग की स्थितियाँ
  4. कैमरा और लेंस
  5. स्टाइल और माहौल के मॉडिफ़ायर

दोहराव और ज़ोर

अगर आपकी इमेज का कोई तत्व बेहद ज़रूरी है, तो उसे थोड़े अलग शब्दों में दो बार दोहराएँ या उसका ज़िक्र करें। "A woman in a red dress, her crimson gown catching the light" मॉडल को संकेत देता है कि लाल पोशाक एक प्राथमिकता वाला तत्व है, जिसे आउटपुट में साफ़ दिखना चाहिए। यह खास तौर पर उन इमेज के लिए ज़रूरी है जहाँ रंग अहम है और मॉडल वरना फीका या बदला हुआ रंग दे सकता है।

💡 व्यावहारिक जाँच: एक ही सीन को दो बार जनरेट करें, एक बार सब्जेक्ट पहले लिखकर और एक बार आखिर में। दोनों आउटपुट की तुलना करें। सब्जेक्ट की स्पष्टता में फ़र्क आम तौर पर बड़ा और तुरंत दिखता है।

3 आम प्रॉम्प्ट गलतियाँ

चारकोल ब्लेज़र में आत्मविश्वासी महिला का रेम्ब्रांट-शैली की लाइटिंग वाला नाटकीय लो-एंगल पोर्ट्रेट

गलती 1: सिर्फ़ "photorealistic" पर निर्भर रहना

"Photorealistic" एक स्टाइल संकेत है, क्वालिटी संकेत नहीं। यह मॉडल को बताता है कि किस श्रेणी का आउटपुट बनाना है, लेकिन लेंस स्पेक, लाइटिंग की दिशा और टेक्सचर के विवरण जैसे सहायक तकनीकी विवरणों के बिना नतीजा फिर भी सपाट और सामान्य लग सकता है।

कमज़ोर: "a portrait of a woman, photorealistic"

मज़बूत: "a portrait of a woman in natural morning light from the left, 85mm f/1.4 lens, skin pores visible, slight film grain, Kodak Portra 400, photorealistic 8K RAW"

आउटपुट की क्वालिटी के लिए सहायक विवरण अकेले "photorealistic" शब्द से कहीं ज़्यादा काम करते हैं।

गलती 2: परस्पर विरोधी स्टाइल संकेत

फ़ोटोग्राफ़िक और कलात्मक स्टाइल डिस्क्रिप्टर को मिलाना मॉडल को उलझा देता है। "Photorealistic painting in the style of an oil portrait" मॉडल को एक साथ दो विरोधी काम करने को कहता है। नतीजा एक अजीब मिश्रण बन जाता है जो किसी भी इरादे को पूरा नहीं करता। एक रास्ता चुनें और उसी पर टिके रहें।

गलती 3: बैकग्राउंड भूल जाना

सब्जेक्ट का वर्णन बिना बैकग्राउंड के वर्णन के होने का मतलब है कि AI बैकग्राउंड खुद गढ़ेगा। कभी-कभी यह ठीक चलता है। अक्सर यह एक धुंधला, औसत परिवेश बनाता है जो आपके सब्जेक्ट से टकराता है। बैकग्राउंड हमेशा बताएँ, भले ही संक्षेप में। "Plain white studio backdrop" कुछ न होने से बेहतर है। "Rain-slicked street at dusk" उससे भी बेहतर है।

Picasso IA पर प्रॉम्प्ट इंजीनियरिंग कैसे काम करती है

शरद ऋतु के पार्क के दृश्य पर छपी फ़ोटो को असली दृश्य से मिलाते हाथ

Picasso IA आपको 91 टेक्स्ट-टू-इमेज मॉडल तक सीधी पहुँच देता है, और ये सभी एक ही इनपुट पर प्रतिक्रिया देते हैं: आपका प्रॉम्प्ट। उपलब्ध विविधता का मतलब है कि आप एक ही प्रॉम्प्ट को Flux 1.1 Pro Ultra, Imagen 4 Ultra, SDXL और Flux Dev पर साथ-साथ आज़मा सकते हैं, और देख सकते हैं कि वही शब्द हर मॉडल के विज़ुअल स्पेस में कैसे अलग असर डालते हैं।

प्रॉम्प्ट इंजीनियरिंग की समझ बनाने का यह सबसे तेज़ तरीका है। एक मज़बूत प्रॉम्प्ट लिखें। उसे तीन अलग मॉडल पर चलाएँ। देखें कि हर मॉडल ने अपनी सीमाओं के भीतर कहाँ अपने विज़ुअल फ़ैसले लिए, और कहाँ उसने आपके निर्देशों का सटीक पालन किया। बदलाव करें। दोहराएँ। कुछ सत्रों में आपको साफ़ अंदाज़ा हो जाएगा कि कौन सा मॉडल किस तरह के विवरणों से सबसे अच्छे नतीजे देता है।

प्लेटफ़ॉर्म आपको जनरेशन के बाद आउटपुट को अपस्केल करने के लिए सुपर-रेज़ोल्यूशन टूल और पूरी इमेज दोबारा जनरेट किए बिना खास हिस्सों को ठीक करने के लिए इनपेंटिंग टूल भी देता है। ये दोनों वर्कफ़्लो मज़बूत बेस प्रॉम्प्ट पर निर्भर करते हैं। अच्छी तरह से प्रॉम्प्ट की गई इमेज का स्ट्रक्चर अपस्केलर के साथ काम करने के लिए ज़्यादा साफ़ होता है, और इनपेंटिंग मॉडल को भरने या ठीक करने के समय संदर्भ के लिए ज़्यादा सुसंगत क्षेत्र मिलते हैं।

अपनी इमेज बनाना शुरू करें

यह देखने का सबसे प्रभावी तरीका कि प्रॉम्प्ट इंजीनियरिंग आपके नतीजे कैसे बदलती है, इसके बारे में पढ़ना नहीं है। इसे नियंत्रित तरीके से आज़माना है।

एक कॉन्सेप्ट लें, कुछ सरल, जैसे पोर्ट्रेट या लैंडस्केप, और उसी प्रॉम्प्ट के तीन वर्ज़न लिखें।

वर्ज़न 1: दो शब्द। "Mountain lake."

वर्ज़न 2: लाइटिंग और दिन के समय के साथ एक वाक्य। "A mountain lake at dawn, mist rising from the water surface, soft pink morning light."

वर्ज़न 3: सब्जेक्ट, परिवेश, लाइटिंग, लेंस और स्टाइल के साथ पूरा संरचित प्रॉम्प्ट। "A calm alpine lake at dawn surrounded by pine trees, mist rising from the still water surface, soft volumetric pink and gold morning light from the east, shot from low to the waterline with a 24mm f/2.8 lens, foreground rocks sharp with middle-distance mist creating depth, Kodak Portra 400 film grain, photorealistic 8K RAW photography."

तीनों को Flux Pro या Imagen 4 पर चलाएँ। उन्हें साथ-साथ तुलना करें। वर्ज़न 1 और वर्ज़न 3 के बीच का फ़ासला सूक्ष्म नहीं है। वह चौंकाने वाला है। मॉडल नहीं बदला। उसकी क्षमताएँ नहीं बदलीं। आपका आउटपुट इसलिए बदला क्योंकि आपके निर्देश बदले।

प्रॉम्प्ट इंजीनियरिंग ठीक इसी तरह आपके नतीजे बदलती है। तकनीकी सेटिंग्स या छिपे हुए पैरामीटर से नहीं। भाषा से। विशिष्टता से। ऐसे शब्दों के सोच-समझकर चुनाव से जिनमें विज़ुअल वज़न होता है, और जिन पर मॉडल प्रतिक्रिया देने के लिए बना है।

कोई ऐसा दृश्य चुनें जिसे आप हमेशा से बेहद सटीक फ़ोटोग्राफ़िक डिटेल में देखना चाहते थे। उसका वर्णन करने वाला प्रॉम्प्ट लिखें, जिसमें सब्जेक्ट, लाइटिंग, लेंस, बैकग्राउंड और मूड सब कुछ हो। फिर Picasso IA खोलें, एक मॉडल चुनें, और देखें कि जब मॉडल को आखिरकार आपसे वह सब मिल जाए जो उसे चाहिए, तो सटीकता कैसी दिखती है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख