जब आप एक छोटा प्रॉम्प्ट टाइप करके जेनरेट दबाते हैं, तो नतीजे में एक खास कलर पैलेट, एक तय लाइट सोर्स और मूड की ऐसी भावना आती है जो जानबूझकर रखी गई लगती है। यह कोई इत्तेफ़ाक नहीं है। एक भी पिक्सल बनाने से पहले मॉडल ने रंग और लाइटिंग से जुड़े दर्जनों फ़ैसले ले लिए होते हैं। यह लेख बताता है कि कच्चे पिक्सल डेटा से लेकर आपकी स्क्रीन पर दिखने वाली आख़िरी इमेज तक, हर चरण पर ठीक-ठीक क्या होता है।

मॉडल असल में क्या देखता है
आधुनिक इमेज जनरेशन मॉडल रंग को उस तरह नहीं समझते जैसे इंसानी आँखें समझती हैं। वे न्यूमेरिक टेंसर के साथ काम करते हैं, यानी फ़्लोटिंग-पॉइंट वैल्यू के ऐसे ऐरे, जो इमेज की हर पोज़िशन पर स्पेशियल और स्पेक्ट्रल जानकारी दर्ज करते हैं। किसी भी क्रिएटिव फ़ैसले से पहले मॉडल को यह समझना होता है कि प्रॉम्प्ट जिस दृश्य का वर्णन कर रहा है, वह किस तरह का विज़ुअल माहौल है।
पिक्सल वैल्यू रंग नहीं होतीं
सबसे बुनियादी स्तर पर, एक इमेज संख्याओं का ग्रिड होती है। हर पिक्सल में तीन चैनल होते हैं: लाल, हरा और नीला (RGB), और मानक 8-बिट फ़ॉर्मैट में हर चैनल की वैल्यू 0 से 255 के बीच होती है। लेकिन आधुनिक डिफ़्यूज़न मॉडल अंदर से अक्सर फ़्लोटिंग-पॉइंट नॉर्मलाइज़्ड रूप में काम करते हैं, जहाँ 0.0 पूरा काला और 1.0 पूरी चमक होती है। किसी भी पॉइंट पर इंसान को जो "रंग" दिखता है, वह उस पॉइंट पर इन तीनों वैल्यू के आपसी संबंध की AI द्वारा की गई व्याख्या है, जो उसके पड़ोसी पिक्सलों के सापेक्ष होती है।
यह मायने रखता है, क्योंकि मॉडल यह नहीं सोचता कि "यह गर्म नारंगी होना चाहिए।" वह अरबों ट्रेनिंग उदाहरणों से सीखता है कि R, G और B वैल्यू के कुछ खास मेल कुछ खास संदर्भों में एक साथ दिखते हैं: सूर्यास्त, त्वचा के टोन, इनडोर टंगस्टन लाइट, जंगल की छाँव। ये स्टैटिस्टिकल पैटर्न ही वे नियम बन जाते हैं जो हर रंग के फ़ैसले को नियंत्रित करते हैं।
कलर स्पेस और इंटरनल रिप्रेज़ेंटेशन
ज़्यादातर जनरेशन मॉडल इंटरनल प्रोसेसिंग के दौरान RGB को एक पर्सेप्चुअल कलर स्पेस में बदलते हैं। आम विकल्पों में LAB (लाइटनेस और दो क्रोमैटिक एक्सिस), HSV (ह्यू, सैचुरेशन, वैल्यू) और YCbCr (ल्यूमिनेंस और कलर डिफ़रेंस कॉम्पोनेंट) शामिल हैं। ये स्पेस चमक को रंग से अलग करते हैं, जिससे मॉडल रंग पैलेट को बिगाड़े बिना लाइटिंग बदल सकता है, और इसका उल्टा भी।

💡 जब आप "soft morning light" का प्रॉम्प्ट देते हैं, तो मॉडल ख़ास तौर पर ल्यूमिनेंस चैनल को समायोजित करता है, शैडो वाले हिस्सों को गर्म मिड-टोन की ओर धकेलता है, बिना ज़रूरी तौर पर सीन की हर चीज़ का ह्यू बदले।
कलर के फ़ैसलों के पीछे न्यूरल नेटवर्क
असली कलर चुनने का लॉजिक एक बड़े न्यूरल नेटवर्क के वेट्स के अंदर रहता है, जिसे उच्च गुणवत्ता वाली फ़ोटोग्राफ़ों के क्यूरेटेड डेटासेट पर ट्रेन किया गया होता है। इन फ़ैसलों को दो अलग तंत्र चलाते हैं: सीखे गए एसोसिएशन और अटेंशन-आधारित संदर्भ।
ट्रेनिंग डेटा कलर आउटपुट को कैसे आकार देता है
ट्रेनिंग के दौरान मॉडल लाखों इमेज-टेक्स्ट जोड़ियों को प्रोसेस करता है। वह सीखता है कि शब्द "dusk" कुछ खास ह्यू-सैचुरेशन-ल्यूमिनेंस वितरणों से जुड़ा है, कि "clinical" माहौल ठंडे सफ़ेद और कम सैचुरेटेड नीलों की ओर झुकते हैं, और "romantic" दृश्य गर्म लाल और सॉफ़्ट बोके की ओर। ये एसोसिएशन मॉडल के वेट्स में स्पष्ट नियमों के बजाय स्टैटिस्टिकल प्रवृत्तियों के रूप में दर्ज होते हैं।
जितनी ज़्यादा बार कोई रंग-पैटर्न ट्रेनिंग डेटा में किसी कॉन्सेप्ट के साथ दिखता है, उतना ही वह एसोसिएशन मज़बूत होता है। इसी वजह से "golden hour portrait" माँगने पर लंबी दिशात्मक शैडो के साथ गर्म एम्बर टोन लगातार मिलते हैं। मॉडल ने वह पैटर्न हज़ारों बार देखा है।

लेटेंट स्पेस में क्रोमा, ह्यू और सैचुरेशन
Flux Pro और Stable Diffusion 3.5 Large जैसे डिफ़्यूज़न मॉडल लेटेंट स्पेस नाम के एक कंप्रेस्ड रिप्रेज़ेंटेशन में काम करते हैं। एन्कोडर पूरी इमेज को एक बहुत छोटे टेंसर में कंप्रेस करता है, जहाँ पास की वैल्यूज़ अर्थ से जुड़े विज़ुअल फ़ीचर दर्शाती हैं। इस स्पेस में ह्यू, क्रोमा और सैचुरेशन के अपने खास क्षेत्र होते हैं, और डीनॉइज़िंग प्रक्रिया के दौरान मॉडल उनसे होकर गुज़रता है।
जब मॉडल रैंडम नॉइज़ से शुरू करके इमेज को धीरे-धीरे निखारता है, तो हर डीनॉइज़िंग स्टेप लेटेंट स्पेस की वैल्यूज़ को प्रॉम्प्ट से मेल खाते क्षेत्रों की ओर ले जाता है। रंग के चुनाव इसी प्रक्रिया से चरण-दर-चरण उभरते हैं। शुरुआती डीनॉइज़िंग स्टेप सामान्य पैलेट तय करते हैं। बाद के स्टेप खास टोन निखारते हैं, हाइलाइट जोड़ते हैं और स्पेशियल असंगतियों को ठीक करते हैं।
| डीनॉइज़िंग चरण | क्या होता है |
|---|
| स्टेप 1-10 | ग्लोबल कलर टेम्परेचर तय होता है |
| स्टेप 11-30 | मुख्य ह्यू क्षेत्र वस्तुओं को सौंपे जाते हैं |
| स्टेप 31-50 | शैडो और हाइलाइट का डिटेल जुड़ता है |
| स्टेप 50+ | बारीक रंग सुधार और टेक्सचर निखार |
AI सेंसर के बिना लाइटिंग कैसे पढ़ता है
जनरेशन के दौरान कोई सेंसर असली रोशनी नहीं मापता। मॉडल लाइटिंग की स्थितियों का पूरा अनुकरण उन स्टैटिस्टिकल पैटर्न से करता है जो उसने ट्रेनिंग के दौरान सीखे। यह अनुकरण सटीक इसलिए होता है क्योंकि यह असली फ़ोटोग्राफ़ों में दर्ज रोशनी के भौतिकी पर आधारित है।
शैडो और दिशात्मक रोशनी
AI सतहों पर हाइलाइट और शैडो वाले हिस्सों के आपसी संबंध का विश्लेषण करके रोशनी की दिशा तय करता है। ट्रेनिंग डेटा में, ऊपर-बाईं ओर से रोशनी पड़ने वाला चेहरा हमेशा नाक, ठुड्डी और भौंह के नीचे-दाएँ हिस्से पर शैडो दिखाता है। मॉडल यह ज्यामितीय संगति सीखता है और नई इमेज बनाते समय उसे लागू करता है।
जब आप "window light from the left" लिखते हैं, तो मॉडल सीन के बाईं ओर बस एक चमकीला क्षेत्र नहीं जोड़ता। वह फ़्रेम की हर सतह पर सही शैडो पोज़िशन की गणना करता है: नाक, जबड़े की रेखा, कपड़े की सिलवटें, लकड़ी की मेज़ का दाना। इसी वजह से अच्छी तरह प्रॉम्प्ट की गई इमेज सपाट नहीं, बल्कि भौतिक रूप से विश्वसनीय लगती हैं।

टोनल मैपिंग और एक्सपोज़र
टोनल मैपिंग का मतलब है कि मॉडल इमेज में चमक की वैल्यूज़ को कैसे बाँटता है। एक अच्छी तरह एक्सपोज़ की गई फ़ोटो में न तो ब्लोन-आउट हाइलाइट होते हैं, न ही क्रश्ड शैडो। AI लाखों सही एक्सपोज़ की गई इमेज से सीखता है कि एक संतुलित हिस्टोग्राम कैसा दिखता है।
Imagen 4 Ultra और Flux 1.1 Pro Ultra जैसे मॉडल उच्च-गुणवत्ता वाले फ़ोटोग्राफ़ी डेटासेट पर ट्रेन किए गए हैं, जिनमें चौड़ी डायनामिक रेंज शामिल है। इससे उन्हें शैडो और हाइलाइट दोनों में एक साथ डिटेल बचाने की बेहतर समझ मिलती है, और यही उन प्रमुख कारणों में से एक है कि उनके आउटपुट पुराने मॉडलों की तुलना में ज़्यादा फ़ोटोग्राफ़िक लगते हैं।
💡 अगर आपकी जेनरेट की गई इमेज अंडर-एक्सपोज़्ड लगती है, तो अपने प्रॉम्प्ट में "bright natural light," "high key," या "correct exposure" जैसे शब्द जोड़ने से मॉडल की टोनल मैपिंग पूरे हिस्टोग्राम में हल्के वैल्यूज़ की ओर झुक जाती है।
कलर टेम्परेचर और व्हाइट बैलेंस
किसी भी इमेज का सबसे असरदार कलर फ़ैसला उसका कुल कलर टेम्परेचर होता है। असली फ़ोटोग्राफ़ी में इसे केल्विन में मापा जाता है, और यह तय करता है कि सीन की रोशनी गर्म (कैंडललाइट, लगभग 1800K), न्यूट्रल (दोपहर की धूप, 5500K) या ठंडी (बादल भरा आसमान, 7000K+) लगती है। AI यह काम आपकी ओर से किसी न्यूमेरिक इनपुट के बिना करता है।
गर्म बनाम ठंडा और मॉडल कैसे चुनता है
मॉडल प्रॉम्प्ट के संदर्भ-संकेतों से उचित कलर टेम्परेचर का अनुमान लगाता है। "evening," "candle," "fireside," और "sunset" जैसे शब्द आउटपुट को गर्म एम्बर टोन की ओर खींचते हैं। "winter," "morning fog," "overcast," और "hospital" जैसे शब्द उसे ठंडे, नीले झुकाव वाले पैलेट की ओर धकेलते हैं।
यह चुनाव बाइनरी नहीं है। मॉडल कलर टेम्परेचर को स्पेशियली बाँटता है: हाइलाइट वाले हिस्सों में गर्म टोन लगाता है, जबकि शैडो को ठंडे टोन से भरता है, ठीक वैसे ही जैसे मिले-जुले लाइटिंग वाली असली फ़ोटोग्राफ़ी में होता है।

हिस्टोग्राम और टोनल बैलेंस
ट्रेनिंग के दौरान AI को इमेज के साथ हिस्टोग्राम डेटा भी दिखाया जाता है। सही एक्सपोज़ की गई आउटडोर पोर्ट्रेट का हिस्टोग्राम मिड-टोन में चरम पर होता है और शैडो व हाइलाइट की ओर धीरे-धीरे ढलता है। मॉडल इसे फोटोरियलिस्टिक नतीजों के लिए एक लक्ष्य आकार के रूप में आत्मसात कर लेता है।
Seedream 4 और Qwen Image 2 Pro जैसे मॉडल आउटपुट इमेज में मज़बूत टोनल बैलेंस दिखाते हैं, क्योंकि उनके ट्रेनिंग डेटासेट को साफ़ हिस्टोग्राम वितरण वाली इमेज शामिल करने के लिए क्यूरेट किया गया था, ताकि ओवरएक्सपोज़्ड या सपाट इमेज से मॉडल बुरी आदतें न सीखे।
असली मॉडल और उनकी कलर की ताकतें
सभी जनरेशन मॉडल कलर और लाइटिंग को एक जैसे तरीके से नहीं संभालते। हर आर्किटेक्चर और ट्रेनिंग डेटासेट कलर साइंस के लागू होने के तरीके में अलग-अलग प्रवृत्तियाँ पैदा करता है।
Flux और फोटोरियलिस्टिक कलर
Black Forest Labs के Flux Dev और Flux 2 Pro पूरे सीन में कलर की संगति बनाए रखने में ख़ास तौर पर मज़बूत हैं। ये शायद ही कभी रैंडम कलर नॉइज़ वाले क्षेत्र बनाते हैं, और उनके लाइटिंग फ़ैसले स्पेशियली कोहेरेंट होते हैं। हाइलाइट और शैडो सही सतहों पर पड़ते हैं।
Flux Schnell रफ़्तार के लिए कुछ फ़िडेलिटी छोड़ता है, लेकिन सिर्फ़ 4 डीनॉइज़िंग स्टेप में भी सही कलर टेम्परेचर चुनाव और उचित शैडो प्लेसमेंट बनाए रखता है।

Ideogram और कलर हार्मनी
Ideogram v3 Quality कलर हार्मनी में ख़ास ताकत रखता है। यह अपने आप पूरक कलर संबंध चुनने की प्रवृत्ति रखता है, जैसे गर्म फ़ोरग्राउंड टोन को ठंडे बैकग्राउंड के सामने रखना, या सैचुरेटेड सब्जेक्ट को मद्धम पर्यावरण के सामने। इससे ऐसा विज़ुअल कंट्रास्ट बनता है जो आँख को खींचता है, और इमेज कृत्रिम रूप से रंगीन भी नहीं लगती।
AI कलर पैलेट कैसे चुनता है
कलर टेम्परेचर चुनने के अलावा, मॉडल हर सीन के लिए पूरा कलर पैलेट भी चुनता है। यह चयन विषय-वस्तु की सेमांटिक समझ और ट्रेनिंग से निकले सौंदर्य सिद्धांतों, दोनों पर आधारित होता है।
प्रमुख रंग और सीन का मूड
मॉडल इस आधार पर प्रमुख रंग तय करता है कि वह विषय के बारे में क्या जानता है। बीच का दृश्य सेरुलियन और रेत के टोन की ओर झुकेगा, क्योंकि यह मेल उसके ट्रेनिंग डेटा में सबसे ज़्यादा बार आया था। रात के बाज़ार में गहरे एम्बर, लाल लालटेन के टोन और ठंडे गहरे-नीले आसमान के बैकग्राउंड बनेंगे।
ये चयन पहले सीन स्तर पर होते हैं, फिर मॉडल वस्तु-वार उन्हें परिष्कृत करता है। मुख्य सब्जेक्ट को बैकग्राउंड से थोड़ा ज़्यादा सैचुरेटेड रंग मिलते हैं, और असली फ़ोटोग्राफ़ी आम तौर पर ऐसे ही दिखती है जब वह ठीक से एक्सपोज़ की गई हो।

पूरक रंग और विज़ुअल कंट्रास्ट
अच्छी तरह ट्रेन किए गए मॉडल कलर थ्योरी के सिद्धांत अपने आप लागू करते हैं। वे पूरक रंगों को आमने-सामने रखते हैं: नारंगी बनाम नीला, लाल बनाम हरा, पीला बनाम बैंगनी। यह स्पष्ट रूप से प्रोग्राम नहीं किया गया है। यह ट्रेनिंग डेटा से उभरता है, क्योंकि जो फ़ोटोग्राफ़ सौंदर्य मापदंडों पर ऊँचे अंक लेते हैं, वे आम तौर पर ये संबंध इस्तेमाल करते हैं।
💡 जब आप किसी सीन को "dramatic" या "cinematic" बताते हैं, तो आप मॉडल को अप्रत्यक्ष रूप से संकेत देते हैं कि ज़्यादा कंट्रास्ट और मज़बूत रंग-पूरकता उपयुक्त है। मॉडल इन्हें स्टाइल का इरादा मानता है और उसी के अनुसार अपना पैलेट चुनाव बदल देता है।
PicassoIA पर रंग के लिए प्रॉम्प्ट
AI रंग और लाइटिंग को कैसे संभालता है, यह जानने से प्रॉम्प्ट लिखते समय आपको असली बढ़त मिलती है। आप सिर्फ़ सीन का वर्णन नहीं कर रहे होते। आप मॉडल को ऐसे संकेत दे रहे होते हैं जो उसके आंतरिक रंग और लाइटिंग के फ़ैसलों को सीधे आकार देते हैं।
रंग को आकार देने वाले प्रॉम्प्ट शब्द
आप जो शब्द इस्तेमाल करते हैं उनमें खास रंग-संकेत होते हैं। यह एक व्यावहारिक संदर्भ है:
| प्रॉम्प्ट शब्द | कलर पर असर | लाइटिंग पर असर |
|---|
| "Golden hour" | गर्म एम्बर, नारंगी | लंबी शैडो, रिम लाइट |
| "Overcast" | कम सैचुरेटेड, ठंडा | सपाट डिफ़्यूज़ लाइट |
| "Studio light" | न्यूट्रल सफ़ेद | नियंत्रित सॉफ़्टबॉक्स |
| "Midday sun" | हाई कंट्रास्ट रंग | ऊपर से कड़ी शैडो |
| "Candlelight" | गहरे गर्म लाल, भूरे | लो-की, विग्नेट |
| "Window light" | प्राकृतिक दिन के टोन | दिशात्मक मुलायम शैडो |
| "Ocean setting" | सेरुलियन, टील, आइवरी | चमकीली ओवरहेड फ़िल |
लाइटिंग आउटपुट को बदलने वाले पैरामीटर
मुख्य प्रॉम्प्ट के अलावा, कुछ डिस्क्रिप्टर पैटर्न मॉडल को खास दिशाओं में धकेलते हैं। "Kodak Portra 400" जोड़ने से मॉडल को उस फ़िल्म स्टॉक के गर्म, थोड़े कम सैचुरेटेड टोनल प्रोफ़ाइल की नकल करने को कहा जाता है। "RAW photography" मॉडल को संकेत देता है कि वह HDR-जैसी ओवर-प्रोसेसिंग से बचे और असली कैमरा आउटपुट की रेंज में रहे।
Flux Kontext Pro के साथ काम करते समय आप टेक्स्ट प्रॉम्प्ट से मौजूदा इमेज को एडिट कर सकते हैं। इसका मतलब है कि आप नई रोशनी की स्थितियों का सीधे वर्णन करके पहले से जेनरेट की गई फ़ोटो का कलर टेम्परेचर या लाइटिंग की दिशा बदल सकते हैं। मॉडल इमेज को नए सिरे से बनाने के बजाय मौजूदा इमेज के ह्यू और शैडो मैप को समायोजित करता है।

💡 AI को हेक्स कोड या केल्विन वैल्यू की ज़रूरत नहीं है। वह प्राकृतिक भाषा के कलर संकेत पढ़ता है और उन्हें सटीक आंतरिक कलर फ़ैसलों में बदल देता है। आपका विज़ुअल वर्णन जितना ज़्यादा विशिष्ट होगा, मॉडल उतनी ही सटीकता से वह कलर माहौल दोहरा पाएगा जो आपके मन में है।
खुद प्रयोग करके देखें
AI के कलर और लाइटिंग फ़ैसलों को समझने का सबसे तेज़ तरीका सीधी तुलना करना है। एक ही सब्जेक्ट, जैसे पोर्ट्रेट, लेकर इन चार बदलावों के साथ चार बार जेनरेट करें: "morning light," "noon light," "golden hour light," और "candlelight"। मॉडल एक ही सब्जेक्ट से चार बिल्कुल अलग कलर माहौल बनाएगा, हर नतीजे में अलग शैडो पोज़िशन, कलर टेम्परेचर और पैलेट चुनाव के साथ।
PicassoIA आपको 90 से ज़्यादा टेक्स्ट-टू-इमेज मॉडल तक सीधी पहुँच देता है, जिनमें से हर एक का अपना कलर साइंस और लाइटिंग की प्रवृत्तियाँ हैं। Flux Pro, Imagen 4 और Ideogram v3 Quality पर इन तुलनाओं को साथ-साथ चलाने से आपको तुरंत दिख जाएगा कि हर मॉडल एक ही लाइटिंग प्रॉम्प्ट को कितने अलग तरीके से समझता है। ये फ़र्क असली हैं, लगातार दिखते हैं, और एक बार दिख जाएँ तो फिर उन्हें अनदेखा नहीं कर पाएँगे। तभी प्रॉम्प्ट लिखना असली कारीगरी जैसा लगने लगता है।