AI आर्ट स्टाइल इतनी तेज़ी से कैसे कॉपी करता है: इसके पीछे का साइंस

AI आर्ट स्टाइल का अंदाज़ा यूँ ही नहीं लगाता। कन्वोल्यूशनल न्यूरल नेटवर्क, डिफ़्यूज़न मॉडल और अरबों ट्रेनिंग उदाहरणों की मदद से यह किसी भी पेंटिंग स्टाइल का सटीक विज़ुअल DNA सेकंडों में निकालकर दोबारा बना देता है, वैन गॉग के ब्रशस्ट्रोक से लेकर मोने के रंगों तक।

AI आर्ट स्टाइल इतनी तेज़ी से कैसे कॉपी करता है: इसके पीछे का साइंस
Cristian Da Conceicao
Picasso IA के संस्थापक

जब आप पहली बार कोई AI इमेज देखते हैं और उसे "वैन गॉग स्टाइल" या "मोने से प्रेरित" पहचान लेते हैं, तो एक पल के लिए थोड़ा अजीब सा लगता है। घुमावदार स्ट्रोक, मोटी इम्पास्टो पेंट, और क्षितिज पर रोशनी फैलने का खास तरीका, यह सब सेकंडों में बन जाता है। यह काम कैसे करता है? छोटा जवाब है कि इसमें गणित, विशाल डेटासेट और एक चालाक तरकीब न्यूरल स्टाइल ट्रांसफ़र शामिल है। लंबा जवाब इससे कहीं ज़्यादा दिलचस्प है।

कैनवास पर गीले इम्पास्टो ऑयल पेंट को छूते पेंटब्रश का क्लोज़-अप, दाईं ओर से गर्म स्टूडियो रोशनी, मैक्रो फ़ोटोग्राफ़ी

स्टाइल ट्रांसफ़र असल में है क्या

"स्टाइल ट्रांसफ़र" सुनने में कलात्मक लगता है, पर यह एक बहुत खास कम्प्यूटेशनल प्रक्रिया का वर्णन करता है। इसके मूल में स्टाइल ट्रांसफ़र उन दो चीज़ों को अलग करने की प्रक्रिया है जिन्हें इंसान सहज रूप से मिलाकर देखते हैं: इमेज में क्या दिखाया गया है (उसका कंटेंट) और उसे कैसे दिखाया गया है (उसकी स्टाइल)।

जब आप Starry Night को देखते हैं, तो आपको एक गाँव और आसमान दिखता है। वह कंटेंट है। लेकिन घुमावदार ब्रशवर्क, पीले और नीले रंगों का खास चुनाव, और तारों का धड़कता हुआ सा दिखना: वह स्टाइल है। इंसान इन्हें सहज रूप से अलग पहचान लेते हैं। किसी मशीन को यही सिखाना बिल्कुल अलग समस्या है।

जादू नहीं, बस गणित

न्यूरल स्टाइल ट्रांसफ़र को औपचारिक रूप से 2015 के एक पेपर में Gatys, Ecker और Bethge ने पेश किया था। इस तरीके में कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) का इस्तेमाल हुआ, खासतौर पर VGG-19, जो मूल रूप से इमेज क्लासिफ़िकेशन के लिए बना नेटवर्क था। शोधकर्ताओं ने पाया कि CNN की अलग-अलग लेयर अलग-अलग तरह की जानकारी सहेजती हैं।

शुरुआती लेयर लो-लेवल फ़ीचर पकड़ती हैं: किनारे, रंग, टेक्सचर। गहरी लेयर हाई-लेवल स्ट्रक्चर पकड़ती हैं: वस्तुएँ, दृश्य, कंपोज़िशन। पता चला कि स्टाइल को शुरुआती लेयर में फ़ीचर के आपसी संबंध का विश्लेषण करके निकाला जा सकता है। कंटेंट गहरी लेयर में रहता था।

एक नई इमेज को किसी रेफ़रेंस आर्टवर्क के स्टाइल स्टैटिस्टिक्स और किसी टार्गेट फ़ोटो के कंटेंट रिप्रेज़ेंटेशन से मिलाने के लिए ऑप्टिमाइज़ करके, नेटवर्क दोनों को मिला सकता था।

इसमें शामिल दो नेटवर्क

क्लासिक स्टाइल ट्रांसफ़र एक ही प्री-ट्रेन्ड CNN का इस्तेमाल "जज" की तरह करता है। हाल के तरीके दो अलग नेटवर्क इस्तेमाल करते हैं:

नेटवर्कभूमिका
जनरेटरस्टाइलाइज़्ड इमेज बनाता है
डिस्क्रिमिनेटरजाँचता है कि यह विश्वसनीय लगती है या नहीं

इस एडवर्सैरियल सेटअप को GAN (Generative Adversarial Network) कहा जाता है, और यह मूल ऑप्टिमाइज़ेशन तरीके से ज़्यादा तीखे और अधिक सुसंगत नतीजे देता है। जनरेटर लगातार बेहतर होता जाता है, क्योंकि डिस्क्रिमिनेटर लगातार उसकी खामियाँ पकड़ता रहता है।

न्यूरल नेटवर्क आर्ट को कैसे देखते हैं

एक महिला आधुनिक गैलरी में दो पेंटिंग देख रही है, ट्रैक लाइटिंग के नीचे मूल और AI-जनित संस्करणों की तुलना करते हुए

किसी आर्ट स्टाइल को कॉपी करने के लिए AI को पहले यह समझना होता है कि वह स्टाइल किन चीज़ों से बनी है। यह सिर्फ़ रंग मिलाने जितना सरल नहीं है। एक कुशल इम्प्रेशनिस्ट पेंटिंग में एक खास टेक्सचर फ़्रीक्वेंसी होती है, यानी अलग-अलग आकार के ब्रश के निशान किस तरह फैले हैं, इसका एक खास तरीका। उसका कलर पैलेट होता है, जिसमें सैचुरेशन और तापमान के खास संबंध होते हैं। उसमें कंपोज़िशन की आदतें भी होती हैं: कलाकार क्षितिज रेखा कहाँ रखता है, और कितना नेगेटिव स्पेस इस्तेमाल करता है।

CNN यह सब व्यवस्थित तरीके से निकालता है, इमेज को लाखों सीखे हुए फ़िल्टर से गुज़ारकर।

इमेज को लेयर-दर-लेयर तोड़ना

इसे एक डिसेक्शन की तरह समझें। नेटवर्क हर लेयर पर इमेज को फ़ीचर मैप में बाँट देता है:

  • लेयर 1: किनारे और रंग के बदलाव पहचानती है
  • लेयर 3: टेक्सचर और छोटे दोहराए जाने वाले पैटर्न पहचानती है
  • लेयर 7: वस्तु के हिस्से पहचानती है (एक चेहरा, एक पेड़ की छतरी)
  • लेयर 15+: पूरी वस्तुएँ और उनके आपसी संबंध पहचानती है

स्टाइल की जानकारी हर लेयर पर Gram matrix की गणना करके पकड़ी जाती है। यह मैट्रिक्स मापता है कि इमेज में अलग-अलग फ़ीचर एक साथ कितनी बार दिखते हैं। यह सह-घटना (co-occurrence) का पैटर्न ही गणितीय रूप से किसी स्टाइल को परिभाषित करता है। दो इमेज, जिनका कंटेंट पूरी तरह अलग है लेकिन जिनके Gram matrix स्टैटिस्टिक्स एक जैसे हैं, वे एक ही हाथ की बनी लगेंगी।

कंटेंट बनाम स्टाइल का अलगाव

यहाँ सबसे खूबसूरत बात यह है कि स्टाइल और कंटेंट नेटवर्क के अलग-अलग हिस्सों में एन्कोड होते हैं। आप दोनों को स्वतंत्र रूप से "डायल" कर सकते हैं।

एक छोटा सा उदाहरण: एक वाक्य के बारे में सोचें। शब्द कंटेंट हैं। लहजा, लय और वाक्य-संरचना स्टाइल हैं। आप वही बात हेमिंग्वे के अंदाज़ में भी कह सकते हैं और फ़ॉकनर के अंदाज़ में भी। न्यूरल स्टाइल ट्रांसफ़र पिक्सल के साथ यही करता है।

यही अलगाव पूरे सिस्टम को तेज़ी से चलने लायक बनाता है। एक बार जब आपके पास ऐसा ट्रेन्ड नेटवर्क हो जो स्टाइल और कंटेंट फ़ीचर भरोसेमंद ढंग से निकाल सके, तो नई स्टाइलाइज़्ड इमेज बनाना बस ऑप्टिमाइज़ेशन है: एक खाली कैनवास पर ग्रेडिएंट डिसेंट चलाना जब तक वह दोनों शर्तें पूरी न कर दे।

स्पीड फ़ैक्टर: अब यह इतना तेज़ क्यों है

प्राकृतिक रोशनी में खुले स्केचबुक, पेंट ट्यूब, ब्रश और पैलेट के साथ एक आर्टिस्ट की वर्कटेबल का ओवरहेड फ़्लैट-ले

2015 का मूल Gatys तरीका बेहद धीमा था। एक 512x512 स्टाइलाइज़्ड इमेज एक साधारण CPU पर बनाने में घंटों लगते थे। आज वही क्वालिटी का आउटपुट एक आम GPU पर एक सेकंड से भी कम में आ जाता है। क्या बदला?

GPU की ताकत ने सब बदल दिया

CPU से GPU कम्प्यूटिंग पर जाना पहली बड़ी रफ़्तार की वजह थी। GPU को बड़े पैमाने पर समानांतर गणना के लिए बनाया गया है, और न्यूरल नेटवर्क को ठीक इसी तरह की गणना चाहिए। एक आधुनिक NVIDIA A100 GPU प्रति सेकंड 312 teraFLOPS से ज़्यादा टेन्सर ऑपरेशन करता है।

लेकिन अकेला हार्डवेयर पूरी स्पीड की वजह नहीं बताता। आर्किटेक्चर भी बदला।

घंटों से सेकंडों तक

फ़ीड-फ़ॉरवर्ड स्टाइल ट्रांसफ़र नेटवर्क (2016 में Johnson et al. ने पेश किए) ने धीमे ऑप्टिमाइज़ेशन लूप की जगह एक ट्रेन्ड नेटवर्क रख दिया। खाली कैनवास पर हज़ारों स्टेप तक बार-बार सुधार करने के बजाय, आप नेटवर्क को लाखों इमेज पर एक बार ट्रेन करते हैं, ताकि वह एक ही फ़ॉरवर्ड पास में स्टाइल ट्रांसफ़ॉर्मेशन कर दे।

नतीजा: स्टाइल ट्रांसफ़र वीडियो पर रीयल-टाइम में चलने लगा। कम्प्यूटेशन का सवाल "इस इमेज को वैन गॉग जैसा दिखाने के लिए इसे कैसे बदलूँ?" से बदलकर "मैंने यह पहले ही सीख लिया है, यह रहा आउटपुट" हो गया।

तरीकास्पीडक्वालिटी
ऑप्टिमाइज़ेशन (2015)मिनट से घंटों तकउच्च
फ़ीड-फ़ॉरवर्ड नेटवर्क (2016)10-50msअच्छी
डिफ़्यूज़न मॉडल (2022+)1-5 सेकंडबहुत उच्च
आधुनिक तेज़ मॉडल (2024+)1 सेकंड से कमउत्कृष्ट

Flux Schnell जैसे आधुनिक मॉडल एक सेकंड से कम में इमेज बना देते हैं। यह रफ़्तार किसी शॉर्टकट से नहीं आती। यह बेहतर आर्किटेक्चर से आती है। ये आर्किटेक्चर सीख चुके हैं कि कम कम्प्यूटेशनल स्टेप में ज़्यादा ज्ञान कैसे समेटा जाए।

डिफ़्यूज़न मॉडल: एक अलग तरीका

एक चमकदार होम ऑफ़िस डेस्क पर एक महिला डुअल मॉनिटर पर लैंडस्केप फ़ोटो के मूल और प्रोसेस्ड संस्करणों की तुलना कर रही है

डिफ़्यूज़न मॉडल इमेज सिंथेसिस का मूल रूप से अलग तरीका है। जहाँ GAN दो नेटवर्क को एक-दूसरे के सामने खड़ा करते हैं, वहीं डिफ़्यूज़न मॉडल एक शांत, अधिक गणितीय प्रक्रिया सीखते हैं: नॉइज़ को उलटना कैसे है।

वे शुरुआत से स्टाइल कैसे सीखते हैं

ट्रेनिंग प्रक्रिया कुछ ऐसे काम करती है:

  1. एक असली इमेज लें
  2. कई स्टेप में धीरे-धीरे उसमें रैंडम नॉइज़ जोड़ें, जब तक इमेज पूरी तरह स्टेटिक न बन जाए
  3. हर स्टेप पर नॉइज़ का अनुमान लगाकर उसे हटाना नेटवर्क को सिखाएँ
  4. ट्रेनिंग के बाद, शुद्ध नॉइज़ से शुरू करें और प्रक्रिया को उलट दें

इससे एक ऐसा नेटवर्क बनता है जिसने अपने ट्रेनिंग डेटा के स्टैटिस्टिकल पैटर्न गहराई से सहेज लिए हैं। जब आप कहते हैं "इसे इम्प्रेशनिज़्म की स्टाइल में पेंट करो," तो मॉडल ने ट्रेनिंग के दौरान इतनी इम्प्रेशनिस्ट इमेज देखी हैं कि वह ठीक जानता है कि किस नॉइज़ पैटर्न को किस दिशा में उलटना है।

असल बात यह है: स्टाइल कोई ऊपर से लगाया गया फ़िल्टर नहीं है। वह जनरेशन प्रक्रिया में ही रचा-बसा होता है। मॉडल किसी फ़ोटो पर ब्रशस्ट्रोक नहीं जोड़ता। वह पूरी इमेज शुरू से बनाता है, जिसमें वे ब्रशस्ट्रोक उसकी बुनियादी विशेषता के रूप में मौजूद होते हैं।

अरबों इमेज पर ट्रेनिंग

Stable Diffusion को LAION-5B पर ट्रेन किया गया था, जो पाँच अरब इमेज-टेक्स्ट जोड़ियों का डेटासेट है। SDXL ने इसे हाई-रेज़ोल्यूशन ट्रेनिंग डेटा और बेहतर कैप्शन क्वालिटी के साथ आगे बढ़ाया।

जब कोई मॉडल पाँच अरब इमेज पर ट्रेन होता है जिन पर स्टाइल के वर्णनकर्ता लगे होते हैं, तो वह "इम्प्रेशनिस्ट पेंटिंग" सिर्फ़ कुछ बार नहीं देखता। वह उसे लाखों बार देखता है, अलग-अलग कलाकारों, सब्जेक्टों, रोशनी की स्थितियों और रंग पैलेट में। नतीजा एक ऐसा मॉडल है जिसने इम्प्रेशनिस्ट "स्टाइल स्पेस" को आत्मसात कर लिया है, जो किसी एक कलाकार के काम से कहीं ज़्यादा समृद्ध है।

व्यावहारिक रूप से इसका मतलब: जब आप टाइप करते हैं "इसे Monet की स्टाइल में पेंट करो," तो मॉडल ने Monet से जुड़ी इमेज की हर स्टैटिस्टिकल नियमितता सहेजी होती है: उनका पैलेट नीले और बैंगनी की ओर कैसे झुकता है, पानी की सतहों पर क्षैतिज स्ट्रोक की लय, और उनके आखिरी दौर में किनारों का नरम फैलाव। मॉडल यह सब एक साथ बनाता है, इसलिए नहीं कि उसे नियम सिखाए गए थे, बल्कि इसलिए कि उसने पैटर्न सीखे।

स्टाइल नियंत्रण में LoRA की भूमिका

एक लाइब्रेरी टेबल पर खुली आर्ट हिस्ट्री की किताब, जिसमें धूप की गर्म किरण में मोने, वैन गॉग और रेम्ब्रांट के रिप्रोडक्शन दिख रहे हैं

सटीक स्टाइल कॉपी करने का सबसे शक्तिशाली तरीका LoRA (Low-Rank Adaptation) है। इससे AI पूरे मॉडल को शुरू से दोबारा ट्रेन किए बिना कोई खास स्टाइल सीख सकता है।

पूरी रिट्रेनिंग के बिना स्टाइल

Stable Diffusion 3.5 Large जैसे मॉडल की पूरी फ़ाइन-ट्यूनिंग के लिए भारी कम्प्यूट और लाखों ट्रेनिंग इमेज चाहिए। LoRA इस गणित को पूरी तरह बदल देता है।

LoRA मूल मॉडल के वेट्स के साथ बैठने वाले ट्रेन करने योग्य वेट मैट्रिक्स का एक छोटा सेट जोड़कर काम करता है। ये मैट्रिक्स पूरे मॉडल की तुलना में बहुत छोटे होते हैं (आमतौर पर 200MB से कम)। लेकिन ये बेहद टार्गेटेड होते हैं। ये मॉडल के आउटपुट को एक खास स्टाइल डोमेन की ओर धकेलते हैं।

स्टाइल LoRA ट्रेन करने के लिए चाहिए:

  • लक्ष्य स्टाइल की सिर्फ़ 20-50 रेफ़रेंस इमेज जितनी कम
  • एक ही GPU पर कुछ घंटों की ट्रेनिंग
  • एक छोटी आउटपुट फ़ाइल, जिसे आसानी से बदला जा सकता है

Flux Dev LoRA मॉडल इसे और आगे ले जाता है, जिससे LoRA वेट्स सीधे एक हाई-क्वालिटी जनरेशन पाइपलाइन के भीतर लागू हो सकते हैं, ताकि स्टाइल को लचीले ढंग से अपनाया जा सके।

कलाकार LoRA क्यों इस्तेमाल करते हैं

काम करने वाले कलाकारों के लिए इसका आकर्षण साफ़ है। आप अपनी कलाकृतियों पर या किसी खास ऐतिहासिक कलाकार की स्टाइल पर LoRA ट्रेन कर सकते हैं, और ऐसा AI पा सकते हैं जो माँग पर उस स्टाइल से मेल खाती इमेज बनाए।

LoRA पैरामीटरयह क्या नियंत्रित करता है
ट्रेनिंग इमेजएन्कोड की गई विज़ुअल स्टाइल
लर्निंग रेटबेस मॉडल पर स्टाइल कितनी मज़बूती से हावी होती है
स्टेप्सस्टाइल को आत्मसात करने की गहराई
ट्रिगर वर्डवह टेक्स्ट वाक्यांश जो LoRA को सक्रिय करता है

प्रोडक्शन के बड़े पैमाने पर स्टाइल की सुसंगति इसीलिए मायने रखती है। इलस्ट्रेटेड कंटेंट बनाने वाली कंपनी अपने मौजूदा ब्रांड इलस्ट्रेशन पर एक ही LoRA ट्रेन कर सकती है और हर टुकड़े के लिए अतिरिक्त कलाकार रखे बिना सैकड़ों ब्रांड-अनुरूप इमेज बना सकती है।

AI क्या कॉपी कर सकता है और क्या नहीं

कॉर्क की दीवार पर लगा मूड बोर्ड, जिसमें प्रिंट की गई फ़ोटो, कलर स्वैच और पेंट की गई स्टाइल रेफ़रेंस प्रिंट नरम प्राकृतिक रोशनी में हैं

AI स्टाइल कॉपी करने में उल्लेखनीय रूप से अच्छा है। लेकिन यहाँ "स्टाइल" का मतलब साफ़-साफ़ बताना ज़रूरी है, और यह भी कि मौजूदा मॉडल कहाँ अब भी कमज़ोर पड़ते हैं।

ब्रशस्ट्रोक पैटर्न: हाँ

इम्प्रेशनिस्ट इमेज पर पर्याप्त ट्रेन किया गया डिफ़्यूज़न मॉडल विश्वसनीय ब्रशस्ट्रोक पैटर्न बनाएगा। वह सही घनत्व और दिशा में छोटे, दिशात्मक स्ट्रोक रखेगा। वह कठोर किनारों से बचेगा। वह रंगों को उसी खास तरीके से मिलाएगा जो उस स्टाइल की पहचान है।

जो AI अच्छी तरह कॉपी करता है:

  • कलर पैलेट और सैचुरेशन के स्तर
  • ब्रशस्ट्रोक का टेक्सचर और दिशा
  • कंपोज़िशन की आदतें (क्षितिज की जगह, सब्जेक्ट का फ़्रेमिंग)
  • किनारों की रेंडरिंग (नरम, कठोर, टूटे हुए)
  • कंट्रास्ट और टोनल रेंज

भावनात्मक इरादा: पूरी तरह नहीं

यहाँ बात ज़्यादा बारीक हो जाती है। वैन गॉग की स्टाइल सिर्फ़ तकनीकी चुनावों का सेट नहीं थी। वह खास भावनात्मक स्थितियों, निजी इतिहास और सोच-समझकर लिए गए कलात्मक फ़ैसलों से उभरी थी।

"वैन गॉग स्टाइल" जनरेट करने वाला AI कुछ ऐसा बनाता है जो वैन गॉग जैसा दिखता है, पर उसके पीछे का कोई इरादा नहीं होता। विज़ुअल स्टैटिस्टिक्स मेल खा जाते हैं। अर्थ गायब रहता है।

जो AI कॉपी नहीं करता:

  • कलाकार का इरादा या प्रेरणा
  • रचना के क्षण में लिए गए स्वतःस्फूर्त फ़ैसले
  • जीवन की घटनाओं के जवाब में समय के साथ स्टाइल के बदलने के खास तरीके
  • सामग्री का भौतिक एहसास (पेंट का वज़न, कैनवास का प्रतिरोध)

AI आर्ट का आलोचनात्मक मूल्यांकन करते समय यह अंतर मायने रखता है, लेकिन इससे टूल की उपयोगिता कम नहीं होती। स्टाइल विज़ुअल पैटर्न का एक सेट है। AI उन पैटर्न को बेहद अच्छी तरह कॉपी करता है। वे पैटर्न क्या अर्थ रखते हैं, वह एक अलग सवाल है।

PicassoIA पर खुद आज़माएँ

एक यूनिवर्सिटी हॉल में एक महिला आर्ट प्रोफ़ेसर दो अलग-अलग स्टाइल की पोर्ट्रेट पेंटिंग की प्रोजेक्ट की गई तुलना के सामने लेक्चर दे रही है

इस लेख में बताई गई तकनीक रिसर्च लैब्स के पीछे बंद नहीं है। यह अभी उपलब्ध है, और PicassoIA पर कई मॉडल खास तौर पर स्टाइल-आधारित जनरेशन के लिए बने हैं।

स्टाइल के लिए कौन से मॉडल सबसे अच्छे हैं

स्टाइल पुनरुत्पादन में अलग-अलग मॉडल की अलग ताकतें हैं:

फ़ोटोरियलिस्टिक स्टाइल ट्रांसफ़र के लिए: Flux Dev और Flux Pro पहली पसंद हैं। दोनों Black Forest Labs के आर्किटेक्चर पर आधारित हैं, जो टेक्स्ट प्रॉम्प्ट में स्टाइल वर्णनकर्ताओं को समझने में खास तौर पर मज़बूत है। आप "ऑयल पेंटिंग, मोटे ब्रशस्ट्रोक, गर्म पैलेट" लिख सकते हैं और आउटपुट उन शर्तों को भरोसेमंद ढंग से दिखाएगा।

अधिकतम क्वालिटी और डिटेल के लिए: Flux 1.1 Pro Ultra 4 मेगापिक्सल पर जनरेट करता है, जिसका मतलब है कि स्टाइल के टेक्सचर पूरे रेज़ोल्यूशन पर दिखते हैं। ब्रशस्ट्रोक के पैटर्न, कैनवास का दाना, पेंट की परतें: यह सब ऐसे डिटेल स्तर पर रेंडर होता है जो स्कैन की गई कलाकृति के करीब पहुँचता है।

मौजूदा फ़ोटो को नई स्टाइल में बदलने के लिए: Flux Kontext Pro एक इनपुट इमेज और टेक्स्ट निर्देश लेता है। आप कोई फ़ोटो लेकर उसे वॉटरकलर, ग्रेफ़ाइट स्केच या ऑयल पेंटिंग स्टाइल में रेंडर करने को कह सकते हैं, और मूल का कंटेंट बना रहता है।

रियलिस्टिक फ़ोटोग्राफ़िक स्टाइल के लिए: RealVisXL v3.0 Turbo और Realistic Vision v5.1 खास तौर पर हाइपर-रियलिस्टिक आउटपुट के लिए बने हैं। जब आपको जो "स्टाइल" चाहिए वह पेंटरली आर्ट के बजाय डॉक्यूमेंट्री फ़ोटोग्राफ़ी हो, तब ये मॉडल खरे उतरते हैं।

तेज़ी से प्रयोग के लिए: Imagen 4 Fast और Flux Schnell तेज़ी से जनरेट करते हैं, इसलिए जब आप अंतिम जनरेशन से पहले कई स्टाइल वर्णन जल्दी से आज़माना चाहें, तो ये आदर्श हैं।

स्टाइल के लिए प्रॉम्प्ट: असल में क्या काम करता है

प्रॉम्प्ट में आप स्टाइल का वर्णन कैसे करते हैं, इसका सीधा असर पड़ता है कि मॉडल उसे कितनी अच्छी तरह दोहराता है। अस्पष्ट स्टाइल शब्द अस्पष्ट नतीजे देते हैं। विशिष्ट तकनीकी वर्णन सटीक आउटपुट देते हैं।

कम प्रभावी:

"in the style of impressionism"

अधिक प्रभावी:

"loose oil paint brushstrokes, visible impasto texture, soft edges, warm sunlit palette with cobalt blue shadows, Monet-influenced treatment of water reflections, square brush marks in foreground grass"

दूसरा प्रॉम्प्ट मॉडल को ठोस विज़ुअल स्टैटिस्टिक्स देता है, जिन्हें वह निशाना बना सके। हर वर्णनकर्ता मॉडल की सीखी हुई किसी असली विशेषता से मेल खाता है।

एक उपयोगी टिप: अपने प्रॉम्प्ट में आर्ट मटीरियल जोड़ने से स्टाइल सीमित करने में मदद मिलती है। "Watercolor wash on cold-press paper", "charcoal on newsprint" और "gouache with matte finish" इतने खास हैं कि मॉडल उनके बारे में मज़बूत समझ रखता है।

आपकी कला, आपका प्रॉम्प्ट

एक विशाल ओपन-प्लान डिजिटल आर्ट स्टूडियो, जिसमें कई वर्कस्टेशन हैं, बड़े मॉनिटर पर अधूरी आर्टवर्क दिख रही है, स्काईलाइट से प्राकृतिक दिन की रोशनी आ रही है

एक महिला गर्म होम स्टूडियो में प्रिंट की गई फ़ोटो को गौर से देखने के लिए ऊपर उठाए हुए है, Zeiss 85mm पोर्ट्रेट लेंस, उथला डेप्थ ऑफ़ फ़ील्ड

AI स्टाइल कॉपी करने के पीछे की मशीनरी सचमुच प्रभावशाली है: कन्वोल्यूशनल न्यूरल नेटवर्क जो कंटेंट को स्टाइल स्टैटिस्टिक्स से अलग करते हैं, डिफ़्यूज़न मॉडल जो अरबों ट्रेनिंग उदाहरणों से नॉइज़ उलटना सीखते हैं, LoRA एडैप्टर जो कुछ सौ मेगाबाइट में खास विज़ुअल डोमेन एन्कोड करते हैं, और फ़ीड-फ़ॉरवर्ड नेटवर्क जो घंटों की गणना को मिलीसेकंड में समेट देते हैं।

लेकिन सबसे दिलचस्प बात यह है कि यह सब अब आपके हाथ में है। इसे इस्तेमाल करने के लिए आपको रिसर्च का बैकग्राउंड नहीं चाहिए। आपको एक प्रॉम्प्ट और एक मॉडल की ज़रूरत है।

ऐसी किसी स्टाइल से शुरू करें जो आपको दिलचस्प लगे, चाहे वह Klimt की संतृप्त ज्यामिति हो, Ansel Adams का मोनोक्रोम दाना, Egon Schiele की ढीली चारकोल रेखाएँ, या बस "linen curtains से छनकर आती दोपहर की धूप।" ऊपर की सूची से कोई मॉडल चुनें। उसे चलाएँ। फिर एक शब्द बदलें और दोबारा चलाएँ।

असली रचनात्मकता इसी दोहराव की प्रक्रिया में है। गणना का काम AI संभाल रहा है। सौंदर्य से जुड़े फ़ैसले अब भी पूरी तरह आपके हैं।

PicassoIA पर अभी आज़माएँ और देखें कि आपके पहले प्रॉम्प्ट से क्या निकलता है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख