जब आप किसी AI इमेज जनरेटर में "पतझड़ के पत्तों में बैठी एक लाल लोमड़ी" टाइप करते हैं और 10 सेकंड बाद एक फ़ोटो-क्वालिटी इमेज सामने आती है, जो देखने में किसी Canon R5 से खींची गई लगती है, तो कुछ असामान्य घटता है। वहाँ कोई असली कैमरा नहीं था। किसी फ़ोटोग्राफ़र ने फ़्रेम नहीं सजाया। एक मशीन ने संख्याओं से वह इमेज बनाई।
यह प्रक्रिया जादू नहीं है। यह गणित, प्रायिकता और पैटर्न पहचान की एक हैरान कर देने वाली सुंदर श्रृंखला है, जिसे व्यावहारिक बनाने में दशकों का शोध लगा। यहाँ परत-दर-परत समझाया गया है कि यह ठीक-ठीक कैसे काम करता है।
जिस पल आप प्रॉम्प्ट टाइप करते हैं, तब क्या होता है
आपके शब्द बनते हैं नंबर
किसी भी इमेज के बनने से पहले, मॉडल को वह काम करना होता है जिसमें उसे बेहद माहिर बनाया गया है: आपके शब्दों का मतलब समझना। यह भाषा के रूप में नहीं, बल्कि एक गणितीय स्पेस में एक स्थिति के रूप में समझा जाता है।
जब आप "पतझड़ के पत्तों में एक लाल लोमड़ी" टाइप करते हैं, तो आपका टेक्स्ट टेक्स्ट एन्कोडर नाम के एक कंपोनेंट में जाता है। सबसे आम एन्कोडर CLIP (Contrastive Language-Image Pretraining) है, जिसे OpenAI ने विकसित किया। CLIP को इंटरनेट से सैकड़ों मिलियन इमेज-टेक्स्ट जोड़ियों पर ट्रेन किया गया, ताकि वह वाक्यों के अर्थ को फ़ोटो की विज़ुअल सामग्री से जोड़ना सीख सके।
आउटपुट एक टेक्स्ट एम्बेडिंग होता है: सैकड़ों या हज़ारों नंबरों की एक सूची, जो आपके प्रॉम्प्ट का सिमैंटिक अर्थ एन्कोड करती है। इसे GPS कोऑर्डिनेट्स की तरह सोचें, लेकिन अक्षांश और देशांतर की जगह आप एक कॉन्सेप्ट को 768-डायमेंशनल या 1024-डायमेंशनल स्पेस में खोज रहे होते हैं।
💡 इसीलिए प्रॉम्प्ट के शब्द मायने रखते हैं। "एक लोमड़ी" और "एम्बर आँखों वाली एक चालाक लोमड़ी" उस स्पेस में अलग-अलग जगहों पर पहुँचते हैं, और यह फ़र्क बदल देता है कि जनरेटर क्या बनाता है।

वे नंबर लेटेंट स्पेस में रास्ता खोजते हैं
मॉडल इमेज के साथ उस तरह काम नहीं करता जैसे आप उन्हें देखते हैं। वह लेटेंट स्पेस में काम करता है: इमेज का एक संपीड़ित गणितीय प्रतिनिधित्व, जहाँ मिलते-जुलते विज़ुअल एक साथ गुच्छों में जमा होते हैं।
लेटेंट स्पेस में, "सुबह के समय एक जंगल" और "शाम के समय एक जंगल" पास-पास पड़ोसी हैं। "एक समुद्र तट" और "एक पहाड़" एक-दूसरे से दूर हैं। आपका बनाया गया टेक्स्ट एम्बेडिंग एक टारगेट बन जाता है: इस स्पेस में एक ऐसी जगह, जिस तक मॉडल पहुँचने की कोशिश करेगा।
यही संपीड़न आधुनिक इमेज जनरेटरों को तेज़ बनाता है। पूरे पिक्सेल स्पेस में काम करने के लिए एक साथ लाखों वैल्यूज़ पर ऑपरेट करना पड़ता। लेटेंट स्पेस में हज़ारों संपीड़ित वैल्यूज़ पर काम होता है, और अंत में नतीजे को पूरे रिज़ॉल्यूशन में वापस डिकोड किया जाता है। यह डिकोडिंग स्टेप VAE (Variational Autoencoder) नाम का एक कंपोनेंट संभालता है।
डिफ्यूज़न मॉडल: असली इंजन
शुद्ध नॉइज़ से शुरुआत
यहाँ वह हिस्सा है जो सुनने में उल्टा लगता है। जनरेशन की प्रक्रिया आपके प्रॉम्प्ट से शुरू नहीं होती और शून्य से इमेज नहीं बनाती। यह रैंडम नॉइज़ से शुरू होती है, यानी पुराने TV की स्क्रीन पर दिखने वाली स्टैटिक का विज़ुअल रूप, और वहीं से उल्टी दिशा में काम करती है।
ट्रेनिंग के दौरान, मॉडल ने लाखों असली इमेज देखीं। हर एक इमेज के लिए उसने देखा कि रिसर्चर्स धीरे-धीरे, एक-एक स्टेप करके, उसमें नॉइज़ जोड़ते गए, जब तक इमेज पूरी तरह पहचान से परे स्टैटिक न बन गई। फिर मॉडल ने उल्टा करना सीखा: एक नॉइज़ वाली इमेज और मूल टेक्स्ट विवरण दिए जाने पर, क्या वह अनुमान लगा सकता है कि कम नॉइज़ वाला संस्करण कैसा दिखता था?
ऐसे अरबों उदाहरणों पर ट्रेनिंग के बाद, मॉडल इस उलटफेर में असाधारण रूप से माहिर हो जाता है। वह किसी ख़ास इमेज को याद नहीं रखता। वह इस बात के सांख्यिकीय पैटर्न सोख लेता है कि वस्तुएँ, टेक्सचर, रोशनी और सतहें एक-दूसरे से कैसे जुड़ते हैं।

स्टेप-दर-स्टेप डीनॉइज़िंग
जब आप "जनरेट" दबाते हैं, तो क्रम यह होता है:
- मॉडल एक पूरी तरह रैंडम नॉइज़ टेंसर से शुरू करता है (रैंडम नंबरों का एक ग्रिड)
- वह इस नॉइज़ को डीनॉइज़िंग नेटवर्क से गुज़ारता है, जो अनुमान लगाता है कि थोड़ा कम नॉइज़ वाला संस्करण कैसा दिखना चाहिए
- वह उस अनुमान को लागू करके थोड़ा साफ़ संस्करण पाता है
- यह प्रक्रिया 20 से 50 बार दोहराई जाती है (ये आपके सैंपलिंग स्टेप्स हैं)
- अंत में वह नतीजे को लेटेंट स्पेस से वापस पिक्सेल स्पेस में डिकोड करता है
हर पास के साथ इमेज और साफ़ और ज़्यादा सुसंगत होती जाती है। पहले स्ट्रक्चर उभरता है (मोटे आकार, कंपोज़िशन), फिर बाद के स्टेप्स में डिटेल (टेक्सचर, चेहरे, बारीक किनारे) आते हैं।
💡 ज़्यादा स्टेप्स आम तौर पर बेहतर क्वालिटी देते हैं, लेकिन फ़ायदा घटता जाता है। 20 से 40 स्टेप्स पर जाने से अक्सर साफ़ फ़र्क दिखता है। 40 से 80 पर शायद ही कभी दिखता है, जबकि समय दोगुना लगता है।
यह पुराने तरीकों से बेहतर क्यों है
2022 के आसपास डिफ्यूज़न मॉडल के प्रमुख बनने से पहले, सबसे लोकप्रिय तरीका GANs (Generative Adversarial Networks) था। GANs दो नेटवर्क्स को एक-दूसरे के सामने खड़ा करते हैं: एक जेनरेटर जो विश्वसनीय इमेज बनाने की कोशिश करता है, और एक डिस्क्रिमिनेटर जो नकली इमेज पहचानने की कोशिश करता है। इन दोनों के बीच का फ़ीडबैक लूप धीरे-धीरे आउटपुट की क्वालिटी सुधारता है।
GANs तेज़ और प्रभावशाली होते हैं, लेकिन ट्रेन करने में बेहद अस्थिर माने जाते हैं, "मोड कोलैप्स" के शिकार हो सकते हैं (जहाँ जेनरेटर बहुत मिलते-जुलते आउटपुट बनाने में अटक जाता है), और हाई रिज़ॉल्यूशन व विविध सब्जेक्ट्स तक स्केल करना मुश्किल होता है।
डिफ्यूज़न मॉडल प्रति इमेज धीमे होते हैं, लेकिन ट्रेन करने में ज़्यादा स्थिर होते हैं, कहीं ज़्यादा विविध आउटपुट देते हैं, और टेक्स्ट कंडीशनिंग पर कहीं बेहतर प्रतिक्रिया देते हैं। यह समझौता इसके लायक है: इसीलिए आज का हर बड़ा इमेज जनरेटर अपने मूल मैकेनिज़्म के रूप में डिफ्यूज़न का इस्तेमाल करता है।
मॉडल ने देखना कैसे सीखा

अरबों इमेज-टेक्स्ट जोड़ियाँ
कोई मॉडल क्या जनरेट कर सकता है, इसका सबसे अहम कारक उसका ट्रेनिंग डेटा है। PicassoIA Image और GPT Image 2 जैसे मॉडल ऐसे डेटासेट पर ट्रेन होते हैं जिनमें वेब से जुटाई गई, लाइसेंस्ड स्टॉक फ़ोटो लाइब्रेरी से ली गई और क्यूरेटेड कलेक्शन से ली गई सैकड़ों मिलियन से लेकर अरबों इमेज-टेक्स्ट जोड़ियाँ होती हैं।
हर इमेज के लिए ट्रेनिंग डेटा में एक कैप्शन होता है जो बताता है कि उसमें क्या है। "धूप वाले दिन एक पार्क में गोल्डन रिट्रीवर को घुमाती एक महिला।" "लैटे आर्ट वाले कॉफ़ी कप का क्लोज़-अप।" "रात में मैनहट्टन का एरियल व्यू।"
मॉडल इन इमेज को कभी याद नहीं करता। इसके बजाय वह सांख्यिकीय संबंध निकालता है: कौन-से विज़ुअल पैटर्न साथ-साथ आने की प्रवृत्ति रखते हैं, रोशनी अलग-अलग सतहों पर कैसे बर्ताव करती है, अलग-अलग कोणों से मानव चेहरे आम तौर पर कैसे दिखते हैं, और फ़र का टेक्सचर कपड़े के टेक्सचर से कैसे अलग होता है।
| ट्रेनिंग डेटासेट का पैमाना | अनुमानित इमेज संख्या | उदाहरण मॉडल |
|---|
| छोटा और क्यूरेटेड | 100K से 1M | शुरुआती Stable Diffusion LoRA |
| मध्यम, वेब से जुटाया गया | 100M से 500M | SDXL, पहले के Flux वेरिएंट |
| बड़ा, प्रोप्राइटरी | 1B+ | GPT Image 2, Seedream 4.5 |
CLIP: शब्दों और पिक्सेल के बीच का पुल
CLIP को अपनी अलग व्याख्या चाहिए, क्योंकि यही वह कंपोनेंट है जो भाषा को विज़ुअल पैटर्न से जोड़ता है। CLIP को एक खास लक्ष्य के साथ ट्रेन किया गया: इमेज और कैप्शन के एक बैच को देखकर हर इमेज को उसके सही कैप्शन से मिलाना। सैकड़ों मिलियन उदाहरणों पर ऐसा करने से एक ऐसा मॉडल बनता है जो विज़ुअल सामग्री और उसे बताने वाली भाषा के रिश्ते को गहराई से समझता है।
इसीलिए आप "सूर्यास्त के समय बंदरगाह की इम्प्रेशनिस्ट पेंटिंग" लिख सकते हैं और मॉडल सिर्फ़ "बंदरगाह" और "सूर्यास्त" को ही नहीं, बल्कि "इम्प्रेशनिस्ट" के शैलीगत और भावनात्मक संदर्भ को भी संभालता है। उसने इम्प्रेशनिज़्म का ज़िक्र करने वाले कैप्शन के साथ मोनेट की हज़ारों पेंटिंग देखी हैं।
💡 CLIP की वजह से ही नेगेटिव प्रॉम्प्ट काम करते हैं। मॉडल को "धुँधली पृष्ठभूमि नहीं" कहने से टारगेट एम्बेडिंग लेटेंट स्पेस के उन इलाकों से दूर खिसक जाती है जो ब्लर से जुड़े हैं।
न्यूरल नेटवर्क असल में क्या स्टोर करता है
मॉडल इमेज का कैटलॉग स्टोर नहीं करता। वह वेट्स स्टोर करता है: अरबों फ़्लोटिंग-पॉइंट नंबर, जो ट्रेनिंग से सीखे गए सांख्यिकीय पैटर्न एन्कोड करते हैं। ये वेट्स U-Net आर्किटेक्चर में रहते हैं, एक ऐसा न्यूरल नेटवर्क जिसका आकार अक्षर U जैसा होता है। इसमें एक एन्कोडर पाथ होता है जो जानकारी को संपीड़ित करता है, और एक डिकोडर पाथ होता है जो उसे फिर से फैलाता है, और दोनों ओर को जोड़ने वाले स्किप कनेक्शन होते हैं।
आधुनिक मॉडलों में पैरामीटर (वेट्स) की संख्या एक कहानी कहती है:
- Stable Diffusion 1.x: ~860 मिलियन पैरामीटर
- SDXL: ~6.6 बिलियन पैरामीटर
- Flux dev: ~12 बिलियन पैरामीटर
ज़्यादा पैरामीटर आम तौर पर जटिल विज़ुअल संबंधों को दर्शाने की ज़्यादा क्षमता, बेहतर सुसंगति और मज़बूत इंस्ट्रक्शन फ़ॉलोइंग देते हैं।
ब्लैक बॉक्स के अंदर का आर्किटेक्चर
U-Net और अटेंशन मैकेनिज़्म
डिफ्यूज़न मॉडल के केंद्र में मौजूद U-Net असल डीनॉइज़िंग करता है। वह एक नॉइज़ वाले लेटेंट को लेता है, उसकी जाँच करता है और जोड़े गए नॉइज़ का अनुमान लगाता है, ताकि सिस्टम उसे घटा सके।
U-Net के अंदर अटेंशन लेयर्स होती हैं: गणितीय ऑपरेशन जो इमेज के हर हिस्से को बाकी सभी हिस्सों को और टेक्स्ट एम्बेडिंग को एक साथ देखने देते हैं। इसी से मॉडल सुसंगति सुनिश्चित करता है, यानी लोमड़ी की पूँछ उसके शरीर से जुड़ी रहे, पूरी इमेज में रोशनी का स्रोत एक-सा रहे, और पतझड़ के पत्ते सच में लोमड़ी के चारों ओर हों, न कि बेतरतीब जगहों पर तैर रहे हों।
Diffusion Transformer (DiT) जैसे नए आर्किटेक्चर, जो Flux 2 Klein 9B और Seedream 4.5 जैसे मॉडलों में इस्तेमाल होते हैं, पारंपरिक U-Net की जगह पूरे ढाँचे में ट्रांसफ़ॉर्मर ब्लॉक लगाते हैं। इससे लंबी दूरी की सुसंगति और प्रॉम्प्ट के पालन में काफ़ी सुधार होता है।

कंडीशनिंग कैसे इमेज को प्रॉम्प्ट से मिलाती है
डीनॉइज़िंग नेटवर्क अकेले काम नहीं करता। हर स्टेप पर, यह दो चीज़ों पर कंडीशन्ड होता है:
- आपके प्रॉम्प्ट से टेक्स्ट एम्बेडिंग (CLIP या T5 का आउटपुट)
- मौजूदा नॉइज़ लेवल (प्रक्रिया के किस स्टेप पर आप हैं)
यह कंडीशनिंग क्रॉस-अटेंशन के ज़रिए लागू होती है, जहाँ नॉइज़ प्रेडिक्शन नेटवर्क की अटेंशन लेयर्स हर लेयर पर इमेज फ़ीचर्स के साथ टेक्स्ट एम्बेडिंग को भी देखती हैं। नतीजा यह होता है कि हर डीनॉइज़िंग स्टेप उसी से निर्देशित होता है जो आपने माँगा था।
नेगेटिव प्रॉम्प्ट भी इसी तरह काम करते हैं। ज़्यादातर इम्प्लीमेंटेशन नेटवर्क से दो समानांतर पास चलाते हैं: एक आपके पॉज़िटिव प्रॉम्प्ट पर कंडीशन्ड, और दूसरा नेगेटिव प्रॉम्प्ट पर। अंतिम प्रेडिक्शन पॉज़िटिव की ओर बढ़ता है और नेगेटिव से दूर हटता है।
CFG स्केल: क्रिएटिविटी का डायल
CFG (Classifier-Free Guidance) स्केल वह स्लाइडर है जो आपने शायद जनरेशन इंटरफ़ेस में देखा होगा। यह नियंत्रित करता है कि मॉडल आपके प्रॉम्प्ट का कितनी सख़्ती से पालन करता है, बनाम वह कितनी आज़ादी से जनरेट करता है।
- कम CFG (1 से 3): मॉडल आज़ादी से जनरेट करता है, अक्सर जीवंत और चौंकाने वाले नतीजे देता है, लेकिन आपके प्रॉम्प्ट के कुछ हिस्से छोड़ देता है
- मध्यम CFG (5 से 9): ज़्यादातर जनरेशन के लिए सबसे अच्छा संतुलन, प्रॉम्प्ट का पालन और स्वाभाविक विविधता के साथ
- ऊँचा CFG (12+): प्रॉम्प्ट का बहुत शाब्दिक पालन, जो अक्सर ओवरसैचुरेटेड और आर्टिफ़ैक्ट्स से भरे नतीजे देता है
गणित: हर स्टेप पर, मॉडल अंतिम प्रेडिक्शन को इस तरह निकालता है: अनकंडीशनल प्रेडिक्शन के ऊपर, CFG स्केल से गुणा किए गए कंडीशनल और अनकंडीशनल प्रेडिक्शन के अंतर को जोड़ा जाता है। CFG 1 का मतलब है कोई गाइडेंस एम्प्लिफ़िकेशन नहीं। CFG 7 का मतलब है कि बेसलाइन के मुकाबले प्रॉम्प्ट का असर सात गुना बढ़ा दिया गया है।
इमेज की क्वालिटी इतनी अलग क्यों होती है
सैंपलिंग स्टेप्स और स्पीड बनाम क्वालिटी

डीनॉइज़र एक लूप में चलता है, और हर पास को सैंपलिंग स्टेप कहा जाता है। अलग-अलग सैंपलर (जिन्हें शेड्यूलर भी कहते हैं) तय करते हैं कि हर स्टेप पर नॉइज़ कैसे हटाया जाएगा। आम सैंपलर ये हैं:
| सैंपलर | स्पीड | सबसे अच्छा किसके लिए |
|---|
| Euler | तेज़ | जल्दी ड्राफ़्ट, सुसंगत नतीजे |
| DPM++ 2M | तेज़ | हाई-क्वालिटी आउटपुट, कम स्टेप्स की ज़रूरत |
| DDIM | मध्यम | दोहराए जा सकने वाले नतीजे, एनिमेशन वर्कफ़्लो |
| Heun | धीमा | हर स्टेप पर ज़्यादा सटीकता |
DPM++ जैसे आधुनिक सैंपलर 20 स्टेप्स में भी शानदार नतीजे दे सकते हैं। Wan 2.7 Image Pro जैसे कुछ मॉडल 4 से 8 स्टेप्स में काम करने के लिए ट्रेन किए गए हैं, जिससे फ़ोटोरियलिज़्म से समझौता किए बिना बड़ी स्पीड बढ़त मिलती है।
सीड नंबर और रीप्रोड्यूसिबिलिटी
हर जनरेशन एक खास रैंडम नॉइज़ टेंसर से शुरू होती है। सीड वह नंबर है जिससे वह टेंसर बनाया जाता है। एक जैसे प्रॉम्प्ट, एक जैसी सेटिंग्स और एक जैसे सीड वाली दो जनरेशन एक जैसी इमेज देंगी।
इसी तरह आप कोई कंपोज़िशन लॉक करके उस पर काम कर सकते हैं। सीड वही रखकर प्रॉम्प्ट बदलने से अक्सर ऐसे वेरिएशन मिलते हैं जिनमें बुनियादी लेआउट और रोशनी वही रहती है, और सीन में अलग कंटेंट भरा होता है। यह प्रॉम्प्ट लिखने वालों के टूल्स के सेट में सबसे शक्तिशाली, और सबसे कम इस्तेमाल होने वाले टूल्स में से एक है।
रिज़ॉल्यूशन, आस्पेक्ट रेशियो और मेमोरी
ज़्यादातर डिफ्यूज़न मॉडल एक खास रिज़ॉल्यूशन पर ट्रेन किए गए थे (आम तौर पर 512x512 या 1024x1024)। अलग रिज़ॉल्यूशन या आस्पेक्ट रेशियो पर जनरेट करने के लिए या तो मल्टी-रिज़ॉल्यूशन डेटा पर फाइन-ट्यूनिंग करनी पड़ती है, या टाइलिंग और अपस्केलिंग का तरीका अपनाना पड़ता है।
Hunyuan Image 2.1 और Seedream 4.5 जैसे मॉडल 2K और 4K रिज़ॉल्यूशन को नेटिव रूप से सपोर्ट करते हैं, क्योंकि उन्हें शुरू से ही हाई-रिज़ॉल्यूशन डेटा पर ट्रेन किया गया था। 4K पर जनरेट करने के लिए काफ़ी ज़्यादा GPU मेमोरी (VRAM) चाहिए, क्योंकि लेटेंट रिप्रेज़ेंटेशन आउटपुट रिज़ॉल्यूशन के साथ बढ़ता है।
लोकप्रिय मॉडल और हर एक की खासियत

सभी इमेज जनरेटर एक जैसे वेट्स या आर्किटेक्चर इस्तेमाल नहीं करते। यहाँ बताया गया है कि प्रमुख मॉडल एक-दूसरे से कैसे अलग हैं और किसे कब चुनना चाहिए:
Flux: ओपन-सोर्स दिग्गज
Flux Redux Dev और Flux 2 Klein 9B Black Forest Labs के Flux आर्किटेक्चर पर बने हैं, जिसने पारंपरिक U-Net की जगह पूरा Diffusion Transformer लगाया। नतीजा यह है कि इमेज में टेक्स्ट रेंडरिंग कहीं बेहतर है, शरीर की बनावट अधिक सटीक है, और प्रॉम्प्ट का पालन पिछले डिफ्यूज़न मॉडलों से मज़बूत है। Flux फ़ोटोरियलिज़्म और जटिल मल्टी-सब्जेक्ट सीन में उत्कृष्ट है।
GPT Image 2: इंस्ट्रक्शन फ़ॉलो करने वाला
GPT Image 2 OpenAI के लैंग्वेज मॉडल को सीधे इमेज जनरेशन में जोड़ता है, जिससे इसे असाधारण रूप से मज़बूत इंस्ट्रक्शन-फ़ॉलोइंग क्षमता मिलती है। आप कई स्थानिक संबंधों वाली जटिल परिस्थितियाँ बता सकते हैं ("कॉफ़ी कप को लैपटॉप के बाईं ओर रखें और स्क्रीन पर स्प्रेडशीट दिखाएँ") और यह आम तौर पर उन्हें सही कर देता है। प्रॉम्प्ट की सटीकता में यह अभी सबसे आगे है।
Seedream और Hunyuan: नए दावेदार
ByteDance का Seedream 4.5 और Tencent का Hunyuan Image 2.1 हाई-रिज़ॉल्यूशन डिफ्यूज़न ट्रांसफ़ॉर्मर्स की नई पीढ़ी को दर्शाते हैं। दोनों नेटिव रूप से 2K से 4K आउटपुट देते हैं, जिसमें बेहतरीन स्किन टेक्सचर, बारीक डिटेल और फ़ोटोरियलिस्टिक रोशनी होती है। Seedream पोर्ट्रेट फ़ोटोग्राफ़ी और फ़ैशन इमेजरी में खास तौर पर मज़बूत प्रदर्शन करता है।
ControlNet: जब आपको सटीक नियंत्रण चाहिए
पोज़, डेप्थ और एज मैप
स्टैंडर्ड टेक्स्ट-टू-इमेज जनरेशन प्रॉबेबिलिस्टिक होता है: आप बताते हैं कि आपको क्या चाहिए, लेकिन कंपोज़िशन पर सटीक नियंत्रण नहीं होता। ControlNet टेक्स्ट प्रॉम्प्ट के ऊपर स्ट्रक्चरल कंडीशनिंग जोड़कर इसे बदलता है।
ControlNet एक रेफ़रेंस इमेज लेता है और उससे खास स्ट्रक्चरल जानकारी निकालता है:
- पोज़ मैप: मानव शरीर के स्केलेटन जॉइंट पोज़िशन, ताकि आप तय कर सकें कि कोई व्यक्ति ठीक किस तरह खड़ा या बैठा हो
- डेप्थ मैप: सीन के हर हिस्से की स्पेशियल दूरी, जो मूल इमेज के 3D स्ट्रक्चर को बनाए रखती है
- एज मैप (Canny): वस्तुओं की रूपरेखा और कॉन्टूर, ताकि आप अलग कंटेंट के साथ कोई कंपोज़िशन दोबारा इस्तेमाल कर सकें
- सेगमेंटेशन मैप: पिक्सेल-स्तर के क्षेत्र लेबल, जो दिखाते हैं कि इमेज के हर हिस्से में क्या है
स्टाइल बनाम स्ट्रक्चर
आप स्ट्रक्चरल मैप को अपने टेक्स्ट प्रॉम्प्ट के साथ फ़ीड करते हैं, और मॉडल दोनों का पालन करते हुए इमेज जनरेट करता है। इसी तरह प्रोफ़ेशनल क्रिएटर्स एक सीरीज़ में कैरेक्टर के पोज़ एक जैसे रखते हैं, या बिल्कुल अलग रोशनी और विषय-वस्तु के साथ कोई बैकग्राउंड कंपोज़िशन दोबारा इस्तेमाल करते हैं।
ControlNet को PicassoIA Image Editor Pro जैसे मॉडलों के साथ मिलाने पर आपको एक साथ स्ट्रक्चरल सटीकता और हाई-फ़िडेलिटी फ़ोटोरियलिस्टिक आउटपुट मिलता है, ऐसा संयोजन जिसके लिए पहले एक प्रोफ़ेशनल फ़ोटोग्राफ़र और बुक किया हुआ स्टूडियो चाहिए था।
अपनी इमेज बनाना शुरू करें

यह सारी तकनीक बिना कोड की एक लाइन लिखे उपलब्ध है। PicassoIA पर आप इस आर्टिकल में चर्चा किए गए हर मॉडल के साथ प्रयोग कर सकते हैं, जिसमें प्रिसाइज़ प्रॉम्प्टिंग के लिए GPT Image 2, फ़ोटोरियलिस्टिक आउटपुट के लिए Flux Redux Dev, और 4K पोर्ट्रेट फ़ोटोग्राफ़ी के लिए Seedream 4.5 शामिल हैं। सब कुछ ब्राउज़र टैब से, बिना किसी सेटअप के।
इन मॉडलों को भीतर से समझने का सबसे अच्छा तरीका है कि आप खुद उन्हें परखें। एक ही प्रॉम्प्ट Flux और GPT Image 2 पर आज़माएँ और देखें कि हर एक जटिल स्थानिक वर्णन को कैसे संभालता है। एक ही सीड पर CFG स्केल 3 बनाम 12 आज़माएँ। 10 सैंपलिंग स्टेप्स बनाम 40 आज़माएँ और देखें कि किस बिंदु पर आपको फ़र्क दिखना बंद हो जाता है।

आपको जो आउटपुट मिलता है, वह कोई रैंडम संयोग नहीं है। यह अरबों सीखे गए सांख्यिकीय पैटर्न का नतीजा है, जो आपके शब्दों से निर्देशित होकर दर्जनों डीनॉइज़िंग स्टेप्स में एक ऐसी चीज़ पर पहुँचते हैं जो देखने में कैमरे से खींची गई लगती है। अब जब आप मैकेनिज़्म जानते हैं, तो आप इसे सोच-समझकर इस्तेमाल करना शुरू कर सकते हैं।