AI इमेज जनरेटर असल में कैसे काम करते हैं (और नतीजे सबको हैरान क्यों करते हैं)

जब आप टेक्स्ट प्रॉम्प्ट लिखते हैं और कुछ ही सेकंड बाद एक शानदार इमेज सामने आ जाती है, तो पर्दे के पीछे क्या होता है? यह आर्टिकल डिफ्यूज़न मॉडल से लेकर ट्रेनिंग डेटा तक, और CLIP एम्बेडिंग से लेकर सैंपलिंग स्टेप्स तक, AI इमेज जनरेटर की असली तकनीक को समझाता है, वह भी साफ़ व्याख्या के साथ और बिना भारी-भरकम जार्गन के।

AI इमेज जनरेटर असल में कैसे काम करते हैं (और नतीजे सबको हैरान क्यों करते हैं)
Cristian Da Conceicao
Picasso IA के संस्थापक

जब आप किसी AI इमेज जनरेटर में "पतझड़ के पत्तों में बैठी एक लाल लोमड़ी" टाइप करते हैं और 10 सेकंड बाद एक फ़ोटो-क्वालिटी इमेज सामने आती है, जो देखने में किसी Canon R5 से खींची गई लगती है, तो कुछ असामान्य घटता है। वहाँ कोई असली कैमरा नहीं था। किसी फ़ोटोग्राफ़र ने फ़्रेम नहीं सजाया। एक मशीन ने संख्याओं से वह इमेज बनाई।

यह प्रक्रिया जादू नहीं है। यह गणित, प्रायिकता और पैटर्न पहचान की एक हैरान कर देने वाली सुंदर श्रृंखला है, जिसे व्यावहारिक बनाने में दशकों का शोध लगा। यहाँ परत-दर-परत समझाया गया है कि यह ठीक-ठीक कैसे काम करता है।

जिस पल आप प्रॉम्प्ट टाइप करते हैं, तब क्या होता है

आपके शब्द बनते हैं नंबर

किसी भी इमेज के बनने से पहले, मॉडल को वह काम करना होता है जिसमें उसे बेहद माहिर बनाया गया है: आपके शब्दों का मतलब समझना। यह भाषा के रूप में नहीं, बल्कि एक गणितीय स्पेस में एक स्थिति के रूप में समझा जाता है।

जब आप "पतझड़ के पत्तों में एक लाल लोमड़ी" टाइप करते हैं, तो आपका टेक्स्ट टेक्स्ट एन्कोडर नाम के एक कंपोनेंट में जाता है। सबसे आम एन्कोडर CLIP (Contrastive Language-Image Pretraining) है, जिसे OpenAI ने विकसित किया। CLIP को इंटरनेट से सैकड़ों मिलियन इमेज-टेक्स्ट जोड़ियों पर ट्रेन किया गया, ताकि वह वाक्यों के अर्थ को फ़ोटो की विज़ुअल सामग्री से जोड़ना सीख सके।

आउटपुट एक टेक्स्ट एम्बेडिंग होता है: सैकड़ों या हज़ारों नंबरों की एक सूची, जो आपके प्रॉम्प्ट का सिमैंटिक अर्थ एन्कोड करती है। इसे GPS कोऑर्डिनेट्स की तरह सोचें, लेकिन अक्षांश और देशांतर की जगह आप एक कॉन्सेप्ट को 768-डायमेंशनल या 1024-डायमेंशनल स्पेस में खोज रहे होते हैं।

💡 इसीलिए प्रॉम्प्ट के शब्द मायने रखते हैं। "एक लोमड़ी" और "एम्बर आँखों वाली एक चालाक लोमड़ी" उस स्पेस में अलग-अलग जगहों पर पहुँचते हैं, और यह फ़र्क बदल देता है कि जनरेटर क्या बनाता है।

AI इमेज जनरेशन सर्वर इंफ़्रास्ट्रक्चर

वे नंबर लेटेंट स्पेस में रास्ता खोजते हैं

मॉडल इमेज के साथ उस तरह काम नहीं करता जैसे आप उन्हें देखते हैं। वह लेटेंट स्पेस में काम करता है: इमेज का एक संपीड़ित गणितीय प्रतिनिधित्व, जहाँ मिलते-जुलते विज़ुअल एक साथ गुच्छों में जमा होते हैं।

लेटेंट स्पेस में, "सुबह के समय एक जंगल" और "शाम के समय एक जंगल" पास-पास पड़ोसी हैं। "एक समुद्र तट" और "एक पहाड़" एक-दूसरे से दूर हैं। आपका बनाया गया टेक्स्ट एम्बेडिंग एक टारगेट बन जाता है: इस स्पेस में एक ऐसी जगह, जिस तक मॉडल पहुँचने की कोशिश करेगा।

यही संपीड़न आधुनिक इमेज जनरेटरों को तेज़ बनाता है। पूरे पिक्सेल स्पेस में काम करने के लिए एक साथ लाखों वैल्यूज़ पर ऑपरेट करना पड़ता। लेटेंट स्पेस में हज़ारों संपीड़ित वैल्यूज़ पर काम होता है, और अंत में नतीजे को पूरे रिज़ॉल्यूशन में वापस डिकोड किया जाता है। यह डिकोडिंग स्टेप VAE (Variational Autoencoder) नाम का एक कंपोनेंट संभालता है।

डिफ्यूज़न मॉडल: असली इंजन

शुद्ध नॉइज़ से शुरुआत

यहाँ वह हिस्सा है जो सुनने में उल्टा लगता है। जनरेशन की प्रक्रिया आपके प्रॉम्प्ट से शुरू नहीं होती और शून्य से इमेज नहीं बनाती। यह रैंडम नॉइज़ से शुरू होती है, यानी पुराने TV की स्क्रीन पर दिखने वाली स्टैटिक का विज़ुअल रूप, और वहीं से उल्टी दिशा में काम करती है।

ट्रेनिंग के दौरान, मॉडल ने लाखों असली इमेज देखीं। हर एक इमेज के लिए उसने देखा कि रिसर्चर्स धीरे-धीरे, एक-एक स्टेप करके, उसमें नॉइज़ जोड़ते गए, जब तक इमेज पूरी तरह पहचान से परे स्टैटिक न बन गई। फिर मॉडल ने उल्टा करना सीखा: एक नॉइज़ वाली इमेज और मूल टेक्स्ट विवरण दिए जाने पर, क्या वह अनुमान लगा सकता है कि कम नॉइज़ वाला संस्करण कैसा दिखता था?

ऐसे अरबों उदाहरणों पर ट्रेनिंग के बाद, मॉडल इस उलटफेर में असाधारण रूप से माहिर हो जाता है। वह किसी ख़ास इमेज को याद नहीं रखता। वह इस बात के सांख्यिकीय पैटर्न सोख लेता है कि वस्तुएँ, टेक्सचर, रोशनी और सतहें एक-दूसरे से कैसे जुड़ते हैं।

फ़ोटोरियलिस्टिक आँख का क्लोज़-अप डिटेल

स्टेप-दर-स्टेप डीनॉइज़िंग

जब आप "जनरेट" दबाते हैं, तो क्रम यह होता है:

  1. मॉडल एक पूरी तरह रैंडम नॉइज़ टेंसर से शुरू करता है (रैंडम नंबरों का एक ग्रिड)
  2. वह इस नॉइज़ को डीनॉइज़िंग नेटवर्क से गुज़ारता है, जो अनुमान लगाता है कि थोड़ा कम नॉइज़ वाला संस्करण कैसा दिखना चाहिए
  3. वह उस अनुमान को लागू करके थोड़ा साफ़ संस्करण पाता है
  4. यह प्रक्रिया 20 से 50 बार दोहराई जाती है (ये आपके सैंपलिंग स्टेप्स हैं)
  5. अंत में वह नतीजे को लेटेंट स्पेस से वापस पिक्सेल स्पेस में डिकोड करता है

हर पास के साथ इमेज और साफ़ और ज़्यादा सुसंगत होती जाती है। पहले स्ट्रक्चर उभरता है (मोटे आकार, कंपोज़िशन), फिर बाद के स्टेप्स में डिटेल (टेक्सचर, चेहरे, बारीक किनारे) आते हैं।

💡 ज़्यादा स्टेप्स आम तौर पर बेहतर क्वालिटी देते हैं, लेकिन फ़ायदा घटता जाता है। 20 से 40 स्टेप्स पर जाने से अक्सर साफ़ फ़र्क दिखता है। 40 से 80 पर शायद ही कभी दिखता है, जबकि समय दोगुना लगता है।

यह पुराने तरीकों से बेहतर क्यों है

2022 के आसपास डिफ्यूज़न मॉडल के प्रमुख बनने से पहले, सबसे लोकप्रिय तरीका GANs (Generative Adversarial Networks) था। GANs दो नेटवर्क्स को एक-दूसरे के सामने खड़ा करते हैं: एक जेनरेटर जो विश्वसनीय इमेज बनाने की कोशिश करता है, और एक डिस्क्रिमिनेटर जो नकली इमेज पहचानने की कोशिश करता है। इन दोनों के बीच का फ़ीडबैक लूप धीरे-धीरे आउटपुट की क्वालिटी सुधारता है।

GANs तेज़ और प्रभावशाली होते हैं, लेकिन ट्रेन करने में बेहद अस्थिर माने जाते हैं, "मोड कोलैप्स" के शिकार हो सकते हैं (जहाँ जेनरेटर बहुत मिलते-जुलते आउटपुट बनाने में अटक जाता है), और हाई रिज़ॉल्यूशन व विविध सब्जेक्ट्स तक स्केल करना मुश्किल होता है।

डिफ्यूज़न मॉडल प्रति इमेज धीमे होते हैं, लेकिन ट्रेन करने में ज़्यादा स्थिर होते हैं, कहीं ज़्यादा विविध आउटपुट देते हैं, और टेक्स्ट कंडीशनिंग पर कहीं बेहतर प्रतिक्रिया देते हैं। यह समझौता इसके लायक है: इसीलिए आज का हर बड़ा इमेज जनरेटर अपने मूल मैकेनिज़्म के रूप में डिफ्यूज़न का इस्तेमाल करता है।

मॉडल ने देखना कैसे सीखा

कॉर्कबोर्ड पर छपी फ़ोटोग्राफ़ों को देखती एक महिला

अरबों इमेज-टेक्स्ट जोड़ियाँ

कोई मॉडल क्या जनरेट कर सकता है, इसका सबसे अहम कारक उसका ट्रेनिंग डेटा है। PicassoIA Image और GPT Image 2 जैसे मॉडल ऐसे डेटासेट पर ट्रेन होते हैं जिनमें वेब से जुटाई गई, लाइसेंस्ड स्टॉक फ़ोटो लाइब्रेरी से ली गई और क्यूरेटेड कलेक्शन से ली गई सैकड़ों मिलियन से लेकर अरबों इमेज-टेक्स्ट जोड़ियाँ होती हैं।

हर इमेज के लिए ट्रेनिंग डेटा में एक कैप्शन होता है जो बताता है कि उसमें क्या है। "धूप वाले दिन एक पार्क में गोल्डन रिट्रीवर को घुमाती एक महिला।" "लैटे आर्ट वाले कॉफ़ी कप का क्लोज़-अप।" "रात में मैनहट्टन का एरियल व्यू।"

मॉडल इन इमेज को कभी याद नहीं करता। इसके बजाय वह सांख्यिकीय संबंध निकालता है: कौन-से विज़ुअल पैटर्न साथ-साथ आने की प्रवृत्ति रखते हैं, रोशनी अलग-अलग सतहों पर कैसे बर्ताव करती है, अलग-अलग कोणों से मानव चेहरे आम तौर पर कैसे दिखते हैं, और फ़र का टेक्सचर कपड़े के टेक्सचर से कैसे अलग होता है।

ट्रेनिंग डेटासेट का पैमानाअनुमानित इमेज संख्याउदाहरण मॉडल
छोटा और क्यूरेटेड100K से 1Mशुरुआती Stable Diffusion LoRA
मध्यम, वेब से जुटाया गया100M से 500MSDXL, पहले के Flux वेरिएंट
बड़ा, प्रोप्राइटरी1B+GPT Image 2, Seedream 4.5

CLIP: शब्दों और पिक्सेल के बीच का पुल

CLIP को अपनी अलग व्याख्या चाहिए, क्योंकि यही वह कंपोनेंट है जो भाषा को विज़ुअल पैटर्न से जोड़ता है। CLIP को एक खास लक्ष्य के साथ ट्रेन किया गया: इमेज और कैप्शन के एक बैच को देखकर हर इमेज को उसके सही कैप्शन से मिलाना। सैकड़ों मिलियन उदाहरणों पर ऐसा करने से एक ऐसा मॉडल बनता है जो विज़ुअल सामग्री और उसे बताने वाली भाषा के रिश्ते को गहराई से समझता है।

इसीलिए आप "सूर्यास्त के समय बंदरगाह की इम्प्रेशनिस्ट पेंटिंग" लिख सकते हैं और मॉडल सिर्फ़ "बंदरगाह" और "सूर्यास्त" को ही नहीं, बल्कि "इम्प्रेशनिस्ट" के शैलीगत और भावनात्मक संदर्भ को भी संभालता है। उसने इम्प्रेशनिज़्म का ज़िक्र करने वाले कैप्शन के साथ मोनेट की हज़ारों पेंटिंग देखी हैं।

💡 CLIP की वजह से ही नेगेटिव प्रॉम्प्ट काम करते हैं। मॉडल को "धुँधली पृष्ठभूमि नहीं" कहने से टारगेट एम्बेडिंग लेटेंट स्पेस के उन इलाकों से दूर खिसक जाती है जो ब्लर से जुड़े हैं।

न्यूरल नेटवर्क असल में क्या स्टोर करता है

मॉडल इमेज का कैटलॉग स्टोर नहीं करता। वह वेट्स स्टोर करता है: अरबों फ़्लोटिंग-पॉइंट नंबर, जो ट्रेनिंग से सीखे गए सांख्यिकीय पैटर्न एन्कोड करते हैं। ये वेट्स U-Net आर्किटेक्चर में रहते हैं, एक ऐसा न्यूरल नेटवर्क जिसका आकार अक्षर U जैसा होता है। इसमें एक एन्कोडर पाथ होता है जो जानकारी को संपीड़ित करता है, और एक डिकोडर पाथ होता है जो उसे फिर से फैलाता है, और दोनों ओर को जोड़ने वाले स्किप कनेक्शन होते हैं।

आधुनिक मॉडलों में पैरामीटर (वेट्स) की संख्या एक कहानी कहती है:

  • Stable Diffusion 1.x: ~860 मिलियन पैरामीटर
  • SDXL: ~6.6 बिलियन पैरामीटर
  • Flux dev: ~12 बिलियन पैरामीटर

ज़्यादा पैरामीटर आम तौर पर जटिल विज़ुअल संबंधों को दर्शाने की ज़्यादा क्षमता, बेहतर सुसंगति और मज़बूत इंस्ट्रक्शन फ़ॉलोइंग देते हैं।

ब्लैक बॉक्स के अंदर का आर्किटेक्चर

U-Net और अटेंशन मैकेनिज़्म

डिफ्यूज़न मॉडल के केंद्र में मौजूद U-Net असल डीनॉइज़िंग करता है। वह एक नॉइज़ वाले लेटेंट को लेता है, उसकी जाँच करता है और जोड़े गए नॉइज़ का अनुमान लगाता है, ताकि सिस्टम उसे घटा सके।

U-Net के अंदर अटेंशन लेयर्स होती हैं: गणितीय ऑपरेशन जो इमेज के हर हिस्से को बाकी सभी हिस्सों को और टेक्स्ट एम्बेडिंग को एक साथ देखने देते हैं। इसी से मॉडल सुसंगति सुनिश्चित करता है, यानी लोमड़ी की पूँछ उसके शरीर से जुड़ी रहे, पूरी इमेज में रोशनी का स्रोत एक-सा रहे, और पतझड़ के पत्ते सच में लोमड़ी के चारों ओर हों, न कि बेतरतीब जगहों पर तैर रहे हों।

Diffusion Transformer (DiT) जैसे नए आर्किटेक्चर, जो Flux 2 Klein 9B और Seedream 4.5 जैसे मॉडलों में इस्तेमाल होते हैं, पारंपरिक U-Net की जगह पूरे ढाँचे में ट्रांसफ़ॉर्मर ब्लॉक लगाते हैं। इससे लंबी दूरी की सुसंगति और प्रॉम्प्ट के पालन में काफ़ी सुधार होता है।

फ़िल्म डार्करूम में डेवलपमेंट की प्रक्रिया

कंडीशनिंग कैसे इमेज को प्रॉम्प्ट से मिलाती है

डीनॉइज़िंग नेटवर्क अकेले काम नहीं करता। हर स्टेप पर, यह दो चीज़ों पर कंडीशन्ड होता है:

  • आपके प्रॉम्प्ट से टेक्स्ट एम्बेडिंग (CLIP या T5 का आउटपुट)
  • मौजूदा नॉइज़ लेवल (प्रक्रिया के किस स्टेप पर आप हैं)

यह कंडीशनिंग क्रॉस-अटेंशन के ज़रिए लागू होती है, जहाँ नॉइज़ प्रेडिक्शन नेटवर्क की अटेंशन लेयर्स हर लेयर पर इमेज फ़ीचर्स के साथ टेक्स्ट एम्बेडिंग को भी देखती हैं। नतीजा यह होता है कि हर डीनॉइज़िंग स्टेप उसी से निर्देशित होता है जो आपने माँगा था।

नेगेटिव प्रॉम्प्ट भी इसी तरह काम करते हैं। ज़्यादातर इम्प्लीमेंटेशन नेटवर्क से दो समानांतर पास चलाते हैं: एक आपके पॉज़िटिव प्रॉम्प्ट पर कंडीशन्ड, और दूसरा नेगेटिव प्रॉम्प्ट पर। अंतिम प्रेडिक्शन पॉज़िटिव की ओर बढ़ता है और नेगेटिव से दूर हटता है।

CFG स्केल: क्रिएटिविटी का डायल

CFG (Classifier-Free Guidance) स्केल वह स्लाइडर है जो आपने शायद जनरेशन इंटरफ़ेस में देखा होगा। यह नियंत्रित करता है कि मॉडल आपके प्रॉम्प्ट का कितनी सख़्ती से पालन करता है, बनाम वह कितनी आज़ादी से जनरेट करता है।

  • कम CFG (1 से 3): मॉडल आज़ादी से जनरेट करता है, अक्सर जीवंत और चौंकाने वाले नतीजे देता है, लेकिन आपके प्रॉम्प्ट के कुछ हिस्से छोड़ देता है
  • मध्यम CFG (5 से 9): ज़्यादातर जनरेशन के लिए सबसे अच्छा संतुलन, प्रॉम्प्ट का पालन और स्वाभाविक विविधता के साथ
  • ऊँचा CFG (12+): प्रॉम्प्ट का बहुत शाब्दिक पालन, जो अक्सर ओवरसैचुरेटेड और आर्टिफ़ैक्ट्स से भरे नतीजे देता है

गणित: हर स्टेप पर, मॉडल अंतिम प्रेडिक्शन को इस तरह निकालता है: अनकंडीशनल प्रेडिक्शन के ऊपर, CFG स्केल से गुणा किए गए कंडीशनल और अनकंडीशनल प्रेडिक्शन के अंतर को जोड़ा जाता है। CFG 1 का मतलब है कोई गाइडेंस एम्प्लिफ़िकेशन नहीं। CFG 7 का मतलब है कि बेसलाइन के मुकाबले प्रॉम्प्ट का असर सात गुना बढ़ा दिया गया है।

इमेज की क्वालिटी इतनी अलग क्यों होती है

सैंपलिंग स्टेप्स और स्पीड बनाम क्वालिटी

स्टूडियो मॉडल को निर्देश देता एक फ़ोटोग्राफ़र

डीनॉइज़र एक लूप में चलता है, और हर पास को सैंपलिंग स्टेप कहा जाता है। अलग-अलग सैंपलर (जिन्हें शेड्यूलर भी कहते हैं) तय करते हैं कि हर स्टेप पर नॉइज़ कैसे हटाया जाएगा। आम सैंपलर ये हैं:

सैंपलरस्पीडसबसे अच्छा किसके लिए
Eulerतेज़जल्दी ड्राफ़्ट, सुसंगत नतीजे
DPM++ 2Mतेज़हाई-क्वालिटी आउटपुट, कम स्टेप्स की ज़रूरत
DDIMमध्यमदोहराए जा सकने वाले नतीजे, एनिमेशन वर्कफ़्लो
Heunधीमाहर स्टेप पर ज़्यादा सटीकता

DPM++ जैसे आधुनिक सैंपलर 20 स्टेप्स में भी शानदार नतीजे दे सकते हैं। Wan 2.7 Image Pro जैसे कुछ मॉडल 4 से 8 स्टेप्स में काम करने के लिए ट्रेन किए गए हैं, जिससे फ़ोटोरियलिज़्म से समझौता किए बिना बड़ी स्पीड बढ़त मिलती है।

सीड नंबर और रीप्रोड्यूसिबिलिटी

हर जनरेशन एक खास रैंडम नॉइज़ टेंसर से शुरू होती है। सीड वह नंबर है जिससे वह टेंसर बनाया जाता है। एक जैसे प्रॉम्प्ट, एक जैसी सेटिंग्स और एक जैसे सीड वाली दो जनरेशन एक जैसी इमेज देंगी।

इसी तरह आप कोई कंपोज़िशन लॉक करके उस पर काम कर सकते हैं। सीड वही रखकर प्रॉम्प्ट बदलने से अक्सर ऐसे वेरिएशन मिलते हैं जिनमें बुनियादी लेआउट और रोशनी वही रहती है, और सीन में अलग कंटेंट भरा होता है। यह प्रॉम्प्ट लिखने वालों के टूल्स के सेट में सबसे शक्तिशाली, और सबसे कम इस्तेमाल होने वाले टूल्स में से एक है।

रिज़ॉल्यूशन, आस्पेक्ट रेशियो और मेमोरी

ज़्यादातर डिफ्यूज़न मॉडल एक खास रिज़ॉल्यूशन पर ट्रेन किए गए थे (आम तौर पर 512x512 या 1024x1024)। अलग रिज़ॉल्यूशन या आस्पेक्ट रेशियो पर जनरेट करने के लिए या तो मल्टी-रिज़ॉल्यूशन डेटा पर फाइन-ट्यूनिंग करनी पड़ती है, या टाइलिंग और अपस्केलिंग का तरीका अपनाना पड़ता है।

Hunyuan Image 2.1 और Seedream 4.5 जैसे मॉडल 2K और 4K रिज़ॉल्यूशन को नेटिव रूप से सपोर्ट करते हैं, क्योंकि उन्हें शुरू से ही हाई-रिज़ॉल्यूशन डेटा पर ट्रेन किया गया था। 4K पर जनरेट करने के लिए काफ़ी ज़्यादा GPU मेमोरी (VRAM) चाहिए, क्योंकि लेटेंट रिप्रेज़ेंटेशन आउटपुट रिज़ॉल्यूशन के साथ बढ़ता है।

लोकप्रिय मॉडल और हर एक की खासियत

तीन मॉनिटरों पर इमेज क्वालिटी की तुलना करता एक व्यक्ति

सभी इमेज जनरेटर एक जैसे वेट्स या आर्किटेक्चर इस्तेमाल नहीं करते। यहाँ बताया गया है कि प्रमुख मॉडल एक-दूसरे से कैसे अलग हैं और किसे कब चुनना चाहिए:

Flux: ओपन-सोर्स दिग्गज

Flux Redux Dev और Flux 2 Klein 9B Black Forest Labs के Flux आर्किटेक्चर पर बने हैं, जिसने पारंपरिक U-Net की जगह पूरा Diffusion Transformer लगाया। नतीजा यह है कि इमेज में टेक्स्ट रेंडरिंग कहीं बेहतर है, शरीर की बनावट अधिक सटीक है, और प्रॉम्प्ट का पालन पिछले डिफ्यूज़न मॉडलों से मज़बूत है। Flux फ़ोटोरियलिज़्म और जटिल मल्टी-सब्जेक्ट सीन में उत्कृष्ट है।

GPT Image 2: इंस्ट्रक्शन फ़ॉलो करने वाला

GPT Image 2 OpenAI के लैंग्वेज मॉडल को सीधे इमेज जनरेशन में जोड़ता है, जिससे इसे असाधारण रूप से मज़बूत इंस्ट्रक्शन-फ़ॉलोइंग क्षमता मिलती है। आप कई स्थानिक संबंधों वाली जटिल परिस्थितियाँ बता सकते हैं ("कॉफ़ी कप को लैपटॉप के बाईं ओर रखें और स्क्रीन पर स्प्रेडशीट दिखाएँ") और यह आम तौर पर उन्हें सही कर देता है। प्रॉम्प्ट की सटीकता में यह अभी सबसे आगे है।

Seedream और Hunyuan: नए दावेदार

ByteDance का Seedream 4.5 और Tencent का Hunyuan Image 2.1 हाई-रिज़ॉल्यूशन डिफ्यूज़न ट्रांसफ़ॉर्मर्स की नई पीढ़ी को दर्शाते हैं। दोनों नेटिव रूप से 2K से 4K आउटपुट देते हैं, जिसमें बेहतरीन स्किन टेक्सचर, बारीक डिटेल और फ़ोटोरियलिस्टिक रोशनी होती है। Seedream पोर्ट्रेट फ़ोटोग्राफ़ी और फ़ैशन इमेजरी में खास तौर पर मज़बूत प्रदर्शन करता है।

ControlNet: जब आपको सटीक नियंत्रण चाहिए

पोज़, डेप्थ और एज मैप

स्टैंडर्ड टेक्स्ट-टू-इमेज जनरेशन प्रॉबेबिलिस्टिक होता है: आप बताते हैं कि आपको क्या चाहिए, लेकिन कंपोज़िशन पर सटीक नियंत्रण नहीं होता। ControlNet टेक्स्ट प्रॉम्प्ट के ऊपर स्ट्रक्चरल कंडीशनिंग जोड़कर इसे बदलता है।

ControlNet एक रेफ़रेंस इमेज लेता है और उससे खास स्ट्रक्चरल जानकारी निकालता है:

  • पोज़ मैप: मानव शरीर के स्केलेटन जॉइंट पोज़िशन, ताकि आप तय कर सकें कि कोई व्यक्ति ठीक किस तरह खड़ा या बैठा हो
  • डेप्थ मैप: सीन के हर हिस्से की स्पेशियल दूरी, जो मूल इमेज के 3D स्ट्रक्चर को बनाए रखती है
  • एज मैप (Canny): वस्तुओं की रूपरेखा और कॉन्टूर, ताकि आप अलग कंटेंट के साथ कोई कंपोज़िशन दोबारा इस्तेमाल कर सकें
  • सेगमेंटेशन मैप: पिक्सेल-स्तर के क्षेत्र लेबल, जो दिखाते हैं कि इमेज के हर हिस्से में क्या है

स्टाइल बनाम स्ट्रक्चर

आप स्ट्रक्चरल मैप को अपने टेक्स्ट प्रॉम्प्ट के साथ फ़ीड करते हैं, और मॉडल दोनों का पालन करते हुए इमेज जनरेट करता है। इसी तरह प्रोफ़ेशनल क्रिएटर्स एक सीरीज़ में कैरेक्टर के पोज़ एक जैसे रखते हैं, या बिल्कुल अलग रोशनी और विषय-वस्तु के साथ कोई बैकग्राउंड कंपोज़िशन दोबारा इस्तेमाल करते हैं।

ControlNet को PicassoIA Image Editor Pro जैसे मॉडलों के साथ मिलाने पर आपको एक साथ स्ट्रक्चरल सटीकता और हाई-फ़िडेलिटी फ़ोटोरियलिस्टिक आउटपुट मिलता है, ऐसा संयोजन जिसके लिए पहले एक प्रोफ़ेशनल फ़ोटोग्राफ़र और बुक किया हुआ स्टूडियो चाहिए था।

अपनी इमेज बनाना शुरू करें

AI इमेज जनरेशन इंटरफ़ेस वाला क्रिएटिव डेस्क

यह सारी तकनीक बिना कोड की एक लाइन लिखे उपलब्ध है। PicassoIA पर आप इस आर्टिकल में चर्चा किए गए हर मॉडल के साथ प्रयोग कर सकते हैं, जिसमें प्रिसाइज़ प्रॉम्प्टिंग के लिए GPT Image 2, फ़ोटोरियलिस्टिक आउटपुट के लिए Flux Redux Dev, और 4K पोर्ट्रेट फ़ोटोग्राफ़ी के लिए Seedream 4.5 शामिल हैं। सब कुछ ब्राउज़र टैब से, बिना किसी सेटअप के।

इन मॉडलों को भीतर से समझने का सबसे अच्छा तरीका है कि आप खुद उन्हें परखें। एक ही प्रॉम्प्ट Flux और GPT Image 2 पर आज़माएँ और देखें कि हर एक जटिल स्थानिक वर्णन को कैसे संभालता है। एक ही सीड पर CFG स्केल 3 बनाम 12 आज़माएँ। 10 सैंपलिंग स्टेप्स बनाम 40 आज़माएँ और देखें कि किस बिंदु पर आपको फ़र्क दिखना बंद हो जाता है।

सुबह की नरम रोशनी में एक महिला का पोर्ट्रेट

आपको जो आउटपुट मिलता है, वह कोई रैंडम संयोग नहीं है। यह अरबों सीखे गए सांख्यिकीय पैटर्न का नतीजा है, जो आपके शब्दों से निर्देशित होकर दर्जनों डीनॉइज़िंग स्टेप्स में एक ऐसी चीज़ पर पहुँचते हैं जो देखने में कैमरे से खींची गई लगती है। अब जब आप मैकेनिज़्म जानते हैं, तो आप इसे सोच-समझकर इस्तेमाल करना शुरू कर सकते हैं।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख