Kolors: Kuaishou का AI इमेज मॉडल, विस्तार से

Kolors, Kuaishou Technology का ओपन-सोर्स टेक्स्ट-टू-इमेज डिफ़्यूज़न मॉडल है, जो चीनी और अंग्रेज़ी दोनों प्रॉम्प्ट के लिए ChatGLM टेक्स्ट एन्कोडर के साथ लेटेंट डिफ़्यूज़न आर्किटेक्चर पर बना है। यह लेख बताता है कि यह मॉडल अंदर से कैसे काम करता है, SDXL और अन्य फ़्रंटियर मॉडलों से यह कैसे अलग है, और पोर्ट्रेट, प्रोडक्ट इमेज और द्विभाषी उपयोग के मामलों में यह इतने तीखे, फोटोरियलिस्टिक नतीजे क्यों देता है।

Kolors: Kuaishou का AI इमेज मॉडल, विस्तार से
Cristian Da Conceicao
Picasso IA के संस्थापक

Kolors 2024 में आया और चीन के AI रिसर्च जगत की सबसे दिलचस्प तकनीकी रिलीज़ों में से एक बना। इसे Kuaishou Technology ने बनाया है, वही कंपनी जो शॉर्ट-वीडियो प्लेटफ़ॉर्म Kuaishou चलाती है। यह टेक्स्ट-टू-इमेज मॉडल लगभग तुरंत ओपन-सोर्स हो गया और उन रिसर्चरों और डेवलपरों का ध्यान खींचा जो पश्चिमी प्रभुत्व वाले मॉडल रिलीज़ के आदी हो चुके थे।

लोगों का ध्यान सिर्फ़ इमेज की क्वालिटी ने नहीं खींचा, जो वाकई प्रभावशाली है, बल्कि इसके नीचे के आर्किटेक्चरल फ़ैसलों ने भी। Kolors में ज़्यादातर पश्चिमी मॉडलों की तरह CLIP एन्कोडर नहीं, बल्कि ChatGLM से लिया गया ट्रांसफ़ॉर्मर-आधारित टेक्स्ट एन्कोडर इस्तेमाल होता है। यह एक चुनाव इस बात पर बड़ा असर डालता है कि प्रॉम्प्ट कैसे समझे जाते हैं और कमर्शियल और क्रिएटिव हर तरह के उपयोग में चीनी भाषा के इनपुट को मॉडल कितनी अच्छी तरह संभालता है।

इस लेख में हम देखेंगे कि Kolors तकनीकी रूप से कैसे काम करता है, यह क्या बनाता है, यह अन्य फ़्रंटियर मॉडलों की तुलना में कहाँ खड़ा है, और आज के तेज़ी से बदलते ओपन-सोर्स इमेज जनरेशन परिदृश्य में इसकी जगह कहाँ है।

Kolors असल में क्या है

Kolors एक बड़े पैमाने का टेक्स्ट-टू-इमेज डिफ़्यूज़न मॉडल है, जिसे Kuaishou की Kolors टीम ने विकसित किया और 2024 के मध्य में सार्वजनिक रूप से जारी किया गया। इसका पूरा मॉडल नाम Kolors-diffusers है, और यह Hugging Face पर उपलब्ध है, जहाँ कोई भी इसके वेट्स डाउनलोड करके चला सकता है। यह एक लेटेंट डिफ़्यूज़न फ़्रेमवर्क पर बना है, यानी इमेज पूरी पिक्सेल रिज़ॉल्यूशन पर न बनकर एक संपीड़ित लेटेंट स्पेस में बनती और प्रोसेस होती है, जो तेज़ भी है और मेमोरी के हिसाब से भी कुशल।

इसकी आर्किटेक्चर की जड़ें उसी विचारों के परिवार से जुड़ती हैं जिससे SDXL निकला। लेकिन Kolors एक अहम हिस्से में काफ़ी अलग है: टेक्स्ट एन्कोडर। यह अंतर कोई छोटा बदलाव नहीं है। इससे बदलता है कि मॉडल किस तरह के प्रॉम्प्ट संभाल सकता है और उसका प्रभावी उपयोग कौन कर सकता है।

लेटेंट डिफ़्यूज़न पर आधारित

लेटेंट डिफ़्यूज़न मॉडल में असली डीनॉइज़िंग प्रोसेस एक कम-आयामी लेटेंट स्पेस में होती है। एक Variational Autoencoder (VAE) ट्रेनिंग के लिए इमेज को इस स्पेस में संपीड़ित करता है, और इनफ़रेंस के समय मॉडल संपीड़ित स्पेस में जनरेट करता है, उसके बाद VAE डीकोडर अंतिम पिक्सेल इमेज दोबारा बनाता है।

इसका मतलब है कि कम्प्यूटेशनल रूप से महंगा हिस्सा, यानी बार-बार होने वाली डीनॉइज़िंग, कच्चे पिक्सेल की तुलना में कहीं छोटे टेंसर पर चलती है। Kolors 4-चैनल लेटेंट इस्तेमाल करता है, जिसका डाउनस्केलिंग फ़ैक्टर 8 है, इसलिए 1024x1024 इमेज को 128x128 लेटेंट के रूप में प्रोसेस किया जाता है। Kolors के अंदर का UNet डिफ़्यूज़न प्रक्रिया के हर स्टेप पर इस संपीड़ित स्पेस में नॉइज़ का अनुमान लगाने के लिए ट्रेन होता है, और फिर अंतिम रेंडरिंग के लिए VAE डीकोडर को सौंप देता है।

फ़ोटो स्टूडियो में प्रोफ़ेशनल मॉनिटर पर जेनरेट की गई पोर्ट्रेट इमेज देखता एक AI इंजीनियर

ChatGLM टेक्स्ट एन्कोडर

यहीं Kolors वाकई प्रतियोगिता से अलग होता है। CLIP, जो टेक्स्ट को 77-टोकन की फ़िक्स्ड-लेंथ सीक्वेंस में बदलता है और जिसकी सिमेंटिक गहराई सीमित है, उसकी जगह Kolors अपने टेक्स्ट एन्कोडर के रूप में ChatGLM3-6B इस्तेमाल करता है। ChatGLM Tsinghua University और Zhipu AI का द्विभाषी चीनी-अंग्रेज़ी लैंग्वेज मॉडल है, और यह लंबे, बारीक प्रॉम्प्ट को CLIP से कहीं बेहतर तरीके से संभालता है।

व्यावहारिक फ़र्क असली भी है और मापा भी जा सकता है। CLIP अंग्रेज़ी-प्रधान वेब-स्क्रैप्ड डेटा पर ट्रेन हुआ था और इनपुट की तीन श्रेणियों में संघर्ष करता है:

  • 77 टोकन से लंबे प्रॉम्प्ट
  • चीनी अक्षर और उनकी सिमेंटिक बारीकियाँ
  • एक से ज़्यादा सब्जेक्ट और उनके रिश्तों वाले जटिल कम्पोज़िशन निर्देश

ChatGLM इन तीनों को संभालता है। यह 256 टोकन तक का इनपुट सपोर्ट करता है, ट्रेनिंग के स्तर पर ही इसकी द्विभाषी क्षमता है, और इसमें 6-बिलियन पैरामीटर वाले उस लैंग्वेज मॉडल की ट्रांसफ़ॉर्मर गहराई है जिसे खास तौर पर चीनी-अंग्रेज़ी समझ के लिए ट्रेन किया गया है।

💡 मुख्य फ़र्क: Kolors पूरा चीनी प्रॉम्प्ट स्वीकार करके सटीक वर्णन वाले नतीजे दे सकता है, जबकि SDXL या तो गलत अनुवाद करेगा या प्रॉम्प्ट के सिमेंटिक अर्थ को पूरी तरह नज़रअंदाज़ कर देगा।

Kolors क्यों अलग दिखता है

2024 में दर्जनों ओपन-सोर्स टेक्स्ट-टू-इमेज मॉडल मौजूद हैं। क्या Kolors को SDXL के एक और फ़ाइन-ट्यून से अलग, अपने आप में ज़रूरी बनाता है?

इमेज में द्विभाषी टेक्स्ट

ज़्यादातर पश्चिमी मॉडल जब इमेज में टेक्स्ट लिखने को कहा जाए तो चीनी अक्षर बिगाड़ देते हैं या असंगत बनाते हैं। Kolors चीनी टाइपोग्राफ़ी को उल्लेखनीय रूप से ज़्यादा सटीकता से संभालता है, क्योंकि इसका टेक्स्ट एन्कोडर चीनी टोकन के सिमेंटिक वज़न को गहराई से समझता है। यह चीनी-भाषी बाज़ारों के कमर्शियल उपयोगों के लिए बहुत मायने रखता है: ई-कॉमर्स प्रोडक्ट बैनर, पोस्टर डिज़ाइन, सोशल मीडिया ग्राफ़िक्स और ऐप स्टोर स्क्रीनशॉट।

यही क्षमता अंग्रेज़ी टेक्स्ट रेंडरिंग तक भी जाती है। लैटिन स्क्रिप्ट के मामले में Kolors समर्पित टेक्स्ट-इन-इमेज मॉडलों के मुकाबले प्रतिस्पर्धी है, हालाँकि हर बार उनसे बेहतर नहीं। लेकिन यह अकेला बड़ा ओपन-सोर्स मॉडल है जो बिना किसी अनुवाद वाले प्रीप्रोसेसिंग चरण के, एक ही आर्किटेक्चर में दोनों स्क्रिप्ट भरोसेमंद तरीके से संभालता है।

आकर्षक लाल रेशमी ड्रेस में एक युवा महिला का फ़ोटोरियलिस्टिक पोर्ट्रेट, AI आउटपुट की क्वालिटी दिखाता हुआ

फ़ोटोरियलिस्टिक आउटपुट क्वालिटी

Kolors की इमेज फ़ोटोरियलिज़्म की ओर मज़बूत झुकाव रखती हैं। स्किन टेक्सचर, कपड़े की डिटेल, एम्बिएंट लाइटिंग और परिवेश की गहराई, सब एक स्वाभाविक क्वालिटी के साथ रेंडर होते हैं जो फ़ाइन-ट्यून्ड SDXL वेरिएंट और FLUX.1 Dev से मुकाबला करती है। मॉडल को Kuaishou द्वारा क्यूरेट किए गए एक बड़े प्रोप्राइटरी डेटासेट पर ट्रेन किया गया था, जिसमें हाई-रिज़ॉल्यूशन फ़ोटोग्राफ़ी और कमर्शियल इमेज शामिल थीं, जो प्लेटफ़ॉर्म के मीडिया इकोसिस्टम से जुटाई गई थीं।

रिलीज़ के कुछ ही बाद AI समुदाय द्वारा किए गए ब्लाइंड कंपैरिज़न में Kolors कई बेंचमार्क पर बेस SDXL से लगातार ज़्यादा स्कोर करता दिखा:

मेट्रिकSDXL BaseKolors
ह्यूमन प्रेफ़रेंस स्कोर75.2%85.6%
स्किन टेक्सचर रियलिज़्ममध्यमउच्च
चीनी प्रॉम्प्ट सटीकताकमज़ोरउच्च
लंबे प्रॉम्प्ट का पालनMediumHigh
टेक्स्ट रेंडरिंग (चीनी)विफलसफल
कम्पोज़िशन सटीकताMediumHigh

ये आँकड़े Kolors पेपर के इवैल्यूएशन सेक्शन से हैं और Kuaishou की अपनी आंतरिक बेंचमार्क पद्धति को दर्शाते हैं। स्वतंत्र समुदाय परीक्षणों ने भी इस रुझान की काफ़ी हद तक पुष्टि की है, खासकर पोर्ट्रेट सब्जेक्ट और सतह पर रखे प्रोडक्ट की इमेज में, जहाँ फ़ोटोरियलिज़्म ही मुख्य पैमाना है।

ओपन-सोर्स और चलाने में मुफ़्त

Kuaishou ने Kolors को एक ओपन लाइसेंस के तहत जारी किया है जो कमर्शियल उपयोग की अनुमति देता है। पूरे वेट्स, VAE और शेड्यूलर कॉन्फ़िगरेशन Hugging Face पर मुफ़्त उपलब्ध हैं। कोई भी उपयुक्त GPU वाला व्यक्ति इसे API खर्च के बिना लोकल चला सकता है। यह एक सोचा-समझा रणनीतिक फ़ैसला था: खुले तौर पर रिलीज़ करने से फ़ाइन-ट्यूनर, LoRA ट्रेनरों और डाउनस्ट्रीम एप्लिकेशनों का एक इकोसिस्टम बनता है, जो मॉडल की पहुँच को उससे कहीं आगे ले जाता है जितना Kuaishou अंदर से बना सकता था।

क्रिएटिव प्रोफ़ेशनल्स की एक विविध टीम लैपटॉप और टैबलेट के साथ कॉन्फ़्रेंस टेबल के चारों ओर मिलकर काम करती हुई

Kolors आर्किटेक्चर की गहरी पड़ताल

Kolors क्यों काम करता है, यह समझने के लिए मॉडल के अंदर चल रही प्रक्रिया पर एक संक्षिप्त नज़र डालना ज़रूरी है। अगर आप तकनीकी ब्योरों में रुचि नहीं रखते, तो आप इस हिस्से को छोड़ सकते हैं और लेख का सिलसिला नहीं टूटेगा।

UNet बैकबोन

Kolors अपने डीनॉइज़िंग बैकबोन के रूप में एक संशोधित UNet इस्तेमाल करता है, जिसकी संरचना SDXL के UNet जैसी है, लेकिन इसे Kuaishou की डेटा पाइपलाइन पर शुरू से ट्रेन किया गया है। वे संरचनात्मक फ़ैसले जो इसके व्यवहार को परिभाषित करते हैं:

  • रिज़ॉल्यूशन सपोर्ट: मल्टी-आस्पेक्ट रेशियो कंडीशनिंग सपोर्ट के साथ नेटिव 1024x1024 ट्रेनिंग
  • अटेंशन लेयर: क्रॉस-अटेंशन UNet की कई गहराइयों पर ChatGLM के टेक्स्ट एम्बेडिंग के आधार पर जनरेशन को कंडीशन करता है
  • स्किप कनेक्शन: स्टैंडर्ड UNet स्किप कनेक्शन अपसैंपलिंग पथ के दौरान स्थानिक संरचना को बनाए रखते हैं
  • टाइमस्टेप कंडीशनिंग: साइनसॉइडल टाइमस्टेप एम्बेडिंग इनफ़रेंस के दौरान पूरे समय नेटवर्क को डीनॉइज़िंग के चरण की जानकारी देती हैं

UNet शोर वाला लेटेंट टेंसर और प्रोजेक्टेड टेक्स्ट कंडीशनिंग दोनों एक साथ लेता है, हटाए जाने वाले नॉइज़ घटक का अनुमान लगाता है, और दोहराता है। DDIM, DPM++ 2M Karras और Euler सहित आम सैंपलर Kolors के साथ काम करते हैं। आम तौर पर 20 से 50 स्टेप अच्छी क्वालिटी देते हैं, और स्पीड और क्वालिटी के व्यावहारिक संतुलन के लिए 25 से 35 सबसे अच्छा माना जाता है।

हीट सिंक फ़िन और सर्किट बोर्ड की बारीकियों के साथ हाई-एंड GPU हार्डवेयर का क्लोज़-अप, फ़ोकस में तीखा

मॉडल में टोकन कैसे बहते हैं

Kolors में टेक्स्ट कंडीशनिंग पाइपलाइन SDXL के दो-एन्कोडर सेटअप से ज़्यादा जटिल है। कच्चे प्रॉम्प्ट से इमेज कंडीशनिंग तक की प्रोसेसिंग का क्रम यह है:

  1. इनपुट प्रॉम्प्ट चीनी या अंग्रेज़ी में आता है, 256 टोकन तक
  2. ChatGLM3-6B टोकनाइज़र टेक्स्ट को भाषा-सचेत सबवर्ड टोकनाइज़ेशन के साथ टोकन ID में बदलता है
  3. ChatGLM एन्कोडर [batch, seq_len, 4096] आकार वाले समृद्ध संदर्भात्मक एम्बेडिंग बनाता है
  4. प्रोजेक्शन लेयर 4096-आयामी एम्बेडिंग को UNet की आंतरिक एम्बेडिंग डाइमेंशन में मैप करती है
  5. क्रॉस-अटेंशन UNet की कई गहराइयों की लेयरों में हर जनरेशन स्टेप को इन प्रोजेक्शन के आधार पर कंडीशन करता है

ChatGLM एम्बेडिंग में CLIP एम्बेडिंग से कहीं ज़्यादा संदर्भात्मक जानकारी होती है, क्योंकि ChatGLM एक पूर्ण ऑटोरिग्रेसिव ट्रांसफ़ॉर्मर है, न कि पेयर्ड इमेज-टेक्स्ट डेटा पर ट्रेन किया गया कॉन्ट्रास्टिव मॉडल। इसी वजह से Kolors कम्पोज़िशन वाले प्रॉम्प्ट ज़्यादा भरोसेमंद ढंग से संभालता है: "बारिश वाली शाम को हरी इमारत के सामने खड़ी लाल कोट पहनी एक महिला" को एक कम्पोज़िशन वाले दृश्य के रूप में समझा जाता है, न कि इमेज-टेक्स्ट एसोसिएशन के सांख्यिकीय समूह के रूप में।

VAE और लेटेंट स्पेस

Kolors 4 लेटेंट चैनल वाला एक स्टैंडर्ड KL-रेगुलराइज़्ड VAE इस्तेमाल करता है। एन्कोडर ट्रेनिंग के लिए पिक्सेल इमेज को 8x स्पेशियल कम्प्रेशन पर लेटेंट में बदलता है, और डीकोडर इनफ़रेंस के समय पूरी इमेज दोबारा बनाता है। Kolors टीम ने शुरुआत के लिए SDXL के रिलीज़ किए गए VAE वेट्स का इस्तेमाल किया था, और यही एक कारण है कि लेटेंट स्पेस की विशेषताएँ कुछ SDXL-संबंधित टूलिंग और समुदायों के साथ काफ़ी हद तक मेल खाती हैं।

आधुनिक एंटरप्राइज़ डेटा सेंटर का सर्वर कॉरिडोर, जिसमें व्यवस्थित केबल मैनेजमेंट और इंडिकेटर लाइटें हैं

Kolors बनाम अन्य मॉडल

व्यापक मॉडल परिदृश्य में Kolors वास्तव में कहाँ खड़ा है?

एक नज़र में ताकत और कमज़ोरियाँ

मॉडलटेक्स्ट एन्कोडरचीनी सपोर्टओपन वेट्ससबसे अच्छा किसमें
KolorsChatGLM3-6Bउत्कृष्टहाँपोर्ट्रेट, फ़ोटोरियलिज़्म, द्विभाषी
SDXLCLIP + OpenCLIPकमज़ोरहाँस्पीड, LoRA इकोसिस्टम का आकार
FLUX.1 DevT5-XXL + CLIPसीमितहाँबारीक डिटेल, प्रॉम्प्ट की सटीकता
GPT Image 2GPT-4o visionअच्छानहींइंस्ट्रक्शन फ़ॉलोइंग, इमेज में टेक्स्ट
Midjourney v6Proprietaryठीक-ठाकनहींआर्टिस्टिक स्टाइल, सौंदर्य

Kolors एक खास जगह भरता है: नेटिव द्विभाषी सपोर्ट के साथ फ़ोटोरियलिस्टिक जनरेशन, ओपन-सोर्स पहुँच के स्तर पर। इस तुलना में कोई अन्य मॉडल यह संयोजन नहीं देता। FLUX.1 Dev फ़ोटोरियलिज़्म में करीब आता है, लेकिन उसमें चीनी भाषा की गहराई नहीं है। GPT Image 2 चीनी को बेहतर संभालता है, लेकिन वह क्लोज़्ड-सोर्स और केवल API पर उपलब्ध है।

जहाँ Kolors अपेक्षाकृत कमज़ोर है: इसका LoRA फ़ाइन-ट्यून इकोसिस्टम SDXL से छोटा है, इनफ़रेंस की स्पीड FLUX.1 Schnell से धीमी है, और डाउनलोड के लिए इसके पास समुदाय द्वारा बनाए गए स्टाइल चेकपॉइंट के वेरिएंट कम हैं।

Kolors कब चुनें

Kolors तब चुनें जब:

  • आपके दर्शक चीनी-भाषी हों और प्रॉम्प्ट मुख्य रूप से चीनी में लिखे जाएँगे
  • आपको पब्लिकेशन-क्वालिटी के फ़ोटोरियलिस्टिक पोर्ट्रेट या कमर्शियल प्रोडक्ट इमेज चाहिए
  • आपको प्रोडक्शन में उपयोग के लिए कमर्शियल-फ़्रेंडली लाइसेंस वाले ओपन वेट्स चाहिए
  • आप द्विभाषी प्रोडक्ट बना रहे हैं और दोनों भाषाई दर्शकों के लिए एक ही मॉडल चाहते हैं

कुछ और चुनें जब:

  • सबसे ज़्यादा इनफ़रेंस स्पीड प्राथमिकता हो (FLUX Schnell उल्लेखनीय रूप से तेज़ है)
  • आपको सबसे बड़ा फ़ाइन-ट्यून और LoRA इकोसिस्टम चाहिए (उसमें SDXL अब भी आगे है)
  • सटीक निर्देश पालन के साथ जटिल दृश्य कम्पोज़िशन चाहिए (FLUX.1 Dev बेहतर प्रदर्शन करता है)

वास्तविक दुनिया के उपयोग के मामले

पोर्ट्रेट और फ़ैशन फ़ोटोग्राफ़ी

Kolors ऐसी पोर्ट्रेट-क्वालिटी का आउटपुट देता है जो कई कमर्शियल संदर्भों में स्टॉक फ़ोटोग्राफ़ी की जगह ले सकता है। अलग-अलग नस्लों में स्किन टोन की रेंडरिंग स्वाभाविक है, लाइटिंग बिना नकली-सी चमक के सुसंगत रहती है, और मॉडल कपड़ों के फ़ैब्रिक के व्यवहार को हैरान करने वाली सटीकता से संभालता है। चीन में फ़ैशन फ़ोटोग्राफ़र और ई-कॉमर्स प्रोडक्शन टीमों ने इसे प्रोडक्ट इमेज और मॉडल रेफ़रेंस फ़्रेम बनाने के लिए तेज़ी से अपनाया, उस पैमाने पर जिसे पारंपरिक फ़ोटोग्राफ़ी आर्थिक रूप से पूरा नहीं कर सकती।

डुअल मॉनिटर सेटअप पर AI-जेनरेट की गई इमेज की गुणवत्ता जाँचने के लिए साथ-साथ तुलना आउटपुट

प्रोडक्ट विज़ुअलाइज़ेशन

चीनी ब्रांड महँगे स्टूडियो फ़ोटो शूट के बिना प्रोडक्ट-इन-कॉन्टेक्स्ट इमेज बनाने के लिए Kolors का सक्रिय उपयोग कर रहे हैं। एक स्किनकेयर ब्रांड सटीक कॉस्टिक लाइटिंग और शैडो के साथ संगमरमर की बाथरूम शेल्फ़ पर सीरम की बोतल की इमेज बना सकता है, वह भी पारंपरिक फ़ोटोग्राफ़ी की लागत के एक अंश में। नेटिव द्विभाषी प्रॉम्प्ट सपोर्ट का मतलब है कि मार्केटिंग टीम बिना किसी अनुवाद वाले प्रीप्रोसेसिंग या भाषा के अनुमान के सीधे चीनी में काम कर सकती है।

रिफ़्लेक्टिव सतहों, मटीरियल की पारदर्शिता और सतह-रोशनी के आपसी प्रभाव को मॉडल जिस तरह संभालता है, वह प्रोडक्ट विज़ुअलाइज़ेशन के काम के लिए खास तौर पर मज़बूत है, क्योंकि यह काम मटीरियल रेंडरिंग की सटीकता पर निर्भर करता है।

सोशल मीडिया और कंटेंट निर्माण

Kuaishou का अपना प्लेटफ़ॉर्म एक शॉर्ट-वीडियो प्रोडक्ट है, जो चीन में सीधे TikTok से प्रतिस्पर्धा करता है। Kolors सीधे Kuaishou के इन-प्लेटफ़ॉर्म क्रिएटर टूल्स में जाता है। कंटेंट क्रिएटर पूरी तरह चीनी में थंबनेल इमेज, बैनर आर्ट और प्रमोशनल ग्राफ़िक्स बना सकते हैं, और नतीजे बिना किसी अंग्रेज़ी बिचौलिए चरण के चीनी सोशल मीडिया की विज़ुअल अपेक्षाओं से मेल खाते हैं।

कैफ़े में हाथ में पकड़े स्मार्टफ़ोन की स्क्रीन पर एक सुंदर AI-जेनरेट की गई पोर्ट्रेट इमेज

व्यवहार में Kolors चलाना

API के ज़रिए

बिना लोकल हार्डवेयर के Kolors चलाने का सबसे सरल तरीका Replicate API के ज़रिए है। मॉडल kwai-kolors/kolors पर होस्ट है और प्रॉम्प्ट, नेगेटिव प्रॉम्प्ट, स्टेप, गाइडेंस स्केल और सीड जैसे स्टैंडर्ड डिफ़्यूज़न पैरामीटर स्वीकार करता है। एक सामान्य कॉल पर एक इमेज की लागत एक सेंट के एक अंश जितनी आती है, और लगभग 10 से 20 सेकंड के इनफ़रेंस समय में 1024x1024 आउटपुट मिलता है।

model: kwai-kolors/kolors
prompt: "一位穿着白色连衣裙的女子站在樱花树下"
num_inference_steps: 50
guidance_scale: 5.0
width: 1024
height: 1024

ऊपर दिए गए चीनी प्रॉम्प्ट का अनुवाद यह है: "सफ़ेद ड्रेस में एक महिला चेरी ब्लॉसम के पेड़ों के नीचे खड़ी है।" Kolors इसे बिना किसी अनुवाद चरण के नेटिव रूप से पार्स करता है।

लोकल सेटअप की ज़रूरतें

लोकल डिप्लॉयमेंट के लिए न्यूनतम कॉन्फ़िगरेशन यह है:

  • GPU: 1024x1024 पर आराम से इनफ़रेंस के लिए 24GB VRAM वाला RTX 3090
  • फ़्रेमवर्क: Hugging Face से Diffusers 0.30.0 या बाद का वर्ज़न
  • चेकपॉइंट: Kwai-Kolors/Kolors, जो सीधे Hugging Face Hub पर उपलब्ध है

मॉडल Diffusers की KolorsPipeline क्लास के साथ इंटीग्रेट होता है, जो ChatGLM टोकनाइज़ेशन को अपने-आप संभालती है। float16 प्रिसिजन के साथ लोड करने पर यह 18 से 20GB VRAM में फ़िट हो जाता है। RTX 4090 पर 1024x1024 पर 30-स्टेप इनफ़रेंस में लगभग 8 से 12 सेकंड लगते हैं।

💡 टिप: Ada और Ampere जनरेशन के GPU पर UNet में torch.compile() लागू करें, इससे इनफ़रेंस स्पीड में 20 से 30% सुधार मिलता है। अतिरिक्त मेमोरी दक्षता के लिए इसे बिना क्वालिटी खोए SDPA attention के साथ जोड़ें।

LoRA फ़ाइन-ट्यूनिंग

Kolors स्टैंडर्ड Diffusers ट्रेनिंग स्क्रिप्ट्स के ज़रिए LoRA फ़ाइन-ट्यूनिंग को सपोर्ट करता है, बस ChatGLM कंडीशनिंग पाथ के लिए कुछ छोटे बदलाव करने पड़ते हैं। Kolors पर स्टाइल LoRA ट्रेन करने के लिए लगभग 20 से 50 रेफ़रेंस इमेज और 24GB GPU पर 1,000 से 2,000 ट्रेनिंग स्टेप्स चाहिए, तब जाकर क्वालिटी ठीक-ठाक आती है। आइडेंटिटी कंसिस्टेंसी वाले कामों के लिए पूरी dreambooth-स्टाइल फ़ाइन-ट्यूनिंग भी सपोर्टेड है।

Kuaishou टीम ने सहायक मॉडल भी जारी किए, जिनमें आइडेंटिटी-कंसिस्टेंट पोर्ट्रेट जनरेशन के लिए Kolors-IP-Adapter और पोज़, डेप्थ और कैनी एज कंडीशनिंग के लिए Kolors-ControlNet शामिल हैं। ये जोड़ Kolors के आसपास के व्यावहारिक टूलसेट को कहीं ज़्यादा पूरा बना देते हैं, जितना अकेले बेस मॉडल के मूल्यांकन से लगता है।

धुंधली रोशनी वाले वर्कस्पेस में मैकेनिकल कीबोर्ड पर AI इमेज प्रॉम्प्ट टाइप करता एक क्रिएटिव प्रोफ़ेशनल

बड़ी तस्वीर

Kolors अपने अलग-अलग बेंचमार्क आँकड़ों से परे भी ध्यान देने लायक चीज़ है। यह चीनी रिसर्च टीमों के उच्च-क्वालिटी AI मॉडलों की एक बड़ी लहर का हिस्सा है, जिसे फ़्रंटियर मॉडल डेवलपमेंट की पश्चिमी चर्चाओं में अपेक्षाकृत कम दृश्यता मिली है।

Kuaishou, ByteDance और Alibaba की DAMO Academy की तरह, इंजीनियरिंग गहराई, कम्प्यूटेशनल संसाधन और प्रोप्राइटरी ट्रेनिंग डेटा रखता है, जिससे वह खास क्षेत्रों में पश्चिमी समकक्षों से मुकाबला कर सकने या उनसे आगे निकल सकने वाले मॉडल बना सकता है। Kolors रॉ एस्थेटिक स्टाइल में Midjourney v6 को नहीं हराता। लेकिन यह ज़्यादातर फ़ोटोरियलिस्टिक बेंचमार्क पर बेस SDXL से बेहतर प्रदर्शन करता है, और साथ ही ओपन-सोर्स रहते हुए, दो भाषाओं को नेटिव रूप से सपोर्ट करते हुए, कमर्शियल लाइसेंस के तहत आता है और सेल्फ़-होस्ट करने के लिए मुफ़्त है।

शाम के धुंधलके में ऊँची छत से ली गई घनी पूर्वी एशियाई महानगर की तस्वीर, नीचे वाहनों की रोशनी की लकीरों के साथ

इस रिलीज़ ने इमेज जनरेशन के लिए लार्ज लैंग्वेज मॉडल को टेक्स्ट एन्कोडर के रूप में इस्तेमाल करने के तरीके को भी सही साबित किया। T5-XXL, जिसे Stable Diffusion 3 और FLUX.1 Dev में इस्तेमाल किया गया, ने पश्चिमी पक्ष से यह अवधारणा साबित की। Kolors ने दिखाया कि ChatGLM का इस्तेमाल करके यह कम से कम उतना ही अच्छा काम करता है, और गैर-अंग्रेज़ी भाषाओं के लिए शायद बेहतर। डिफ़्यूज़न मॉडलों के लिए बेहतर टेक्स्ट-कंडीशनिंग आर्किटेक्चर की खोज जारी है, और Kolors उस चल रही कहानी में एक अहम डेटा पॉइंट है।

जो टीमें चीनी-भाषी उपयोगकर्ताओं के लिए प्रोडक्ट बना रही हैं, उनके लिए Kolors कोई जिज्ञासा या प्रयोगात्मक विकल्प भर नहीं है। यह एक ही कमर्शियल-लाइसेंस वाले मॉडल में फ़ोटोरियलिस्टिक इमेज क्वालिटी और नेटिव चीनी प्रॉम्प्ट सपोर्ट को जोड़ने वाला फ़िलहाल सबसे मज़बूत ओपन-सोर्स विकल्प है।

अपनी इमेज बनाना शुरू करें

आधुनिक AI इमेज जनरेशन क्या कर सकता है, यह अनुभव करने का सबसे तेज़ तरीका है एक ऐसे प्लेटफ़ॉर्म का इस्तेमाल करना जिसने इन्फ़्रास्ट्रक्चर पहले से संभाल रखा हो, ताकि आपको लोकल हार्डवेयर, मॉडल डाउनलोड या API क्रेडेंशियल की ज़रूरत न पड़े। PicassoIA दर्जनों अत्याधुनिक टेक्स्ट-टू-इमेज मॉडल होस्ट करता है, जिन्हें आप बिना किसी सेटअप के सीधे ब्राउज़र में चला सकते हैं।

अगर आपको Kolors द्वारा लोकप्रिय की गई शैली में फ़ोटोरियलिस्टिक जनरेशन चाहिए, तो FLUX.1 Dev PicassoIA पर बेहद विस्तृत और प्रॉम्प्ट के अनुरूप आउटपुट देता है। जिन निर्देश-भारी क्रिएटिव कामों में इमेज में टेक्स्ट मायने रखता है, उनके लिए GPT Image 2 बिना किसी कॉन्फ़िगरेशन के उपलब्ध है। दोनों PicassoIA के इन्फ़्रास्ट्रक्चर पर चलते हैं, इसलिए आप प्रॉम्प्ट लिखते हैं और कुछ ही सेकंड में नतीजे देखते हैं।

चाहे आप पोर्ट्रेट फ़ोटोग्राफ़ी, प्रोडक्ट इमेज, सोशल मीडिया एसेट बना रहे हों, या बस किसी विस्तृत विवरण से यह परखना चाहते हों कि ये मॉडल क्या बना सकते हैं, PicassoIA फ़्रंटियर-स्तर की इमेज जनरेशन को एक ही जगह पर रखता है। अपना प्रॉम्प्ट लिखें, अपना मॉडल चुनें, और देखें क्या निकलकर आता है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख