Kolors, Kuaishou Technology का ओपन-सोर्स टेक्स्ट-टू-इमेज डिफ़्यूज़न मॉडल है, जो चीनी और अंग्रेज़ी दोनों प्रॉम्प्ट के लिए ChatGLM टेक्स्ट एन्कोडर के साथ लेटेंट डिफ़्यूज़न आर्किटेक्चर पर बना है। यह लेख बताता है कि यह मॉडल अंदर से कैसे काम करता है, SDXL और अन्य फ़्रंटियर मॉडलों से यह कैसे अलग है, और पोर्ट्रेट, प्रोडक्ट इमेज और द्विभाषी उपयोग के मामलों में यह इतने तीखे, फोटोरियलिस्टिक नतीजे क्यों देता है।
Kolors 2024 में आया और चीन के AI रिसर्च जगत की सबसे दिलचस्प तकनीकी रिलीज़ों में से एक बना। इसे Kuaishou Technology ने बनाया है, वही कंपनी जो शॉर्ट-वीडियो प्लेटफ़ॉर्म Kuaishou चलाती है। यह टेक्स्ट-टू-इमेज मॉडल लगभग तुरंत ओपन-सोर्स हो गया और उन रिसर्चरों और डेवलपरों का ध्यान खींचा जो पश्चिमी प्रभुत्व वाले मॉडल रिलीज़ के आदी हो चुके थे।
लोगों का ध्यान सिर्फ़ इमेज की क्वालिटी ने नहीं खींचा, जो वाकई प्रभावशाली है, बल्कि इसके नीचे के आर्किटेक्चरल फ़ैसलों ने भी। Kolors में ज़्यादातर पश्चिमी मॉडलों की तरह CLIP एन्कोडर नहीं, बल्कि ChatGLM से लिया गया ट्रांसफ़ॉर्मर-आधारित टेक्स्ट एन्कोडर इस्तेमाल होता है। यह एक चुनाव इस बात पर बड़ा असर डालता है कि प्रॉम्प्ट कैसे समझे जाते हैं और कमर्शियल और क्रिएटिव हर तरह के उपयोग में चीनी भाषा के इनपुट को मॉडल कितनी अच्छी तरह संभालता है।
इस लेख में हम देखेंगे कि Kolors तकनीकी रूप से कैसे काम करता है, यह क्या बनाता है, यह अन्य फ़्रंटियर मॉडलों की तुलना में कहाँ खड़ा है, और आज के तेज़ी से बदलते ओपन-सोर्स इमेज जनरेशन परिदृश्य में इसकी जगह कहाँ है।
Kolors असल में क्या है
Kolors एक बड़े पैमाने का टेक्स्ट-टू-इमेज डिफ़्यूज़न मॉडल है, जिसे Kuaishou की Kolors टीम ने विकसित किया और 2024 के मध्य में सार्वजनिक रूप से जारी किया गया। इसका पूरा मॉडल नाम Kolors-diffusers है, और यह Hugging Face पर उपलब्ध है, जहाँ कोई भी इसके वेट्स डाउनलोड करके चला सकता है। यह एक लेटेंट डिफ़्यूज़न फ़्रेमवर्क पर बना है, यानी इमेज पूरी पिक्सेल रिज़ॉल्यूशन पर न बनकर एक संपीड़ित लेटेंट स्पेस में बनती और प्रोसेस होती है, जो तेज़ भी है और मेमोरी के हिसाब से भी कुशल।
इसकी आर्किटेक्चर की जड़ें उसी विचारों के परिवार से जुड़ती हैं जिससे SDXL निकला। लेकिन Kolors एक अहम हिस्से में काफ़ी अलग है: टेक्स्ट एन्कोडर। यह अंतर कोई छोटा बदलाव नहीं है। इससे बदलता है कि मॉडल किस तरह के प्रॉम्प्ट संभाल सकता है और उसका प्रभावी उपयोग कौन कर सकता है।
लेटेंट डिफ़्यूज़न पर आधारित
लेटेंट डिफ़्यूज़न मॉडल में असली डीनॉइज़िंग प्रोसेस एक कम-आयामी लेटेंट स्पेस में होती है। एक Variational Autoencoder (VAE) ट्रेनिंग के लिए इमेज को इस स्पेस में संपीड़ित करता है, और इनफ़रेंस के समय मॉडल संपीड़ित स्पेस में जनरेट करता है, उसके बाद VAE डीकोडर अंतिम पिक्सेल इमेज दोबारा बनाता है।
इसका मतलब है कि कम्प्यूटेशनल रूप से महंगा हिस्सा, यानी बार-बार होने वाली डीनॉइज़िंग, कच्चे पिक्सेल की तुलना में कहीं छोटे टेंसर पर चलती है। Kolors 4-चैनल लेटेंट इस्तेमाल करता है, जिसका डाउनस्केलिंग फ़ैक्टर 8 है, इसलिए 1024x1024 इमेज को 128x128 लेटेंट के रूप में प्रोसेस किया जाता है। Kolors के अंदर का UNet डिफ़्यूज़न प्रक्रिया के हर स्टेप पर इस संपीड़ित स्पेस में नॉइज़ का अनुमान लगाने के लिए ट्रेन होता है, और फिर अंतिम रेंडरिंग के लिए VAE डीकोडर को सौंप देता है।
ChatGLM टेक्स्ट एन्कोडर
यहीं Kolors वाकई प्रतियोगिता से अलग होता है। CLIP, जो टेक्स्ट को 77-टोकन की फ़िक्स्ड-लेंथ सीक्वेंस में बदलता है और जिसकी सिमेंटिक गहराई सीमित है, उसकी जगह Kolors अपने टेक्स्ट एन्कोडर के रूप में ChatGLM3-6B इस्तेमाल करता है। ChatGLM Tsinghua University और Zhipu AI का द्विभाषी चीनी-अंग्रेज़ी लैंग्वेज मॉडल है, और यह लंबे, बारीक प्रॉम्प्ट को CLIP से कहीं बेहतर तरीके से संभालता है।
व्यावहारिक फ़र्क असली भी है और मापा भी जा सकता है। CLIP अंग्रेज़ी-प्रधान वेब-स्क्रैप्ड डेटा पर ट्रेन हुआ था और इनपुट की तीन श्रेणियों में संघर्ष करता है:
77 टोकन से लंबे प्रॉम्प्ट
चीनी अक्षर और उनकी सिमेंटिक बारीकियाँ
एक से ज़्यादा सब्जेक्ट और उनके रिश्तों वाले जटिल कम्पोज़िशन निर्देश
ChatGLM इन तीनों को संभालता है। यह 256 टोकन तक का इनपुट सपोर्ट करता है, ट्रेनिंग के स्तर पर ही इसकी द्विभाषी क्षमता है, और इसमें 6-बिलियन पैरामीटर वाले उस लैंग्वेज मॉडल की ट्रांसफ़ॉर्मर गहराई है जिसे खास तौर पर चीनी-अंग्रेज़ी समझ के लिए ट्रेन किया गया है।
💡 मुख्य फ़र्क: Kolors पूरा चीनी प्रॉम्प्ट स्वीकार करके सटीक वर्णन वाले नतीजे दे सकता है, जबकि SDXL या तो गलत अनुवाद करेगा या प्रॉम्प्ट के सिमेंटिक अर्थ को पूरी तरह नज़रअंदाज़ कर देगा।
Kolors क्यों अलग दिखता है
2024 में दर्जनों ओपन-सोर्स टेक्स्ट-टू-इमेज मॉडल मौजूद हैं। क्या Kolors को SDXL के एक और फ़ाइन-ट्यून से अलग, अपने आप में ज़रूरी बनाता है?
इमेज में द्विभाषी टेक्स्ट
ज़्यादातर पश्चिमी मॉडल जब इमेज में टेक्स्ट लिखने को कहा जाए तो चीनी अक्षर बिगाड़ देते हैं या असंगत बनाते हैं। Kolors चीनी टाइपोग्राफ़ी को उल्लेखनीय रूप से ज़्यादा सटीकता से संभालता है, क्योंकि इसका टेक्स्ट एन्कोडर चीनी टोकन के सिमेंटिक वज़न को गहराई से समझता है। यह चीनी-भाषी बाज़ारों के कमर्शियल उपयोगों के लिए बहुत मायने रखता है: ई-कॉमर्स प्रोडक्ट बैनर, पोस्टर डिज़ाइन, सोशल मीडिया ग्राफ़िक्स और ऐप स्टोर स्क्रीनशॉट।
यही क्षमता अंग्रेज़ी टेक्स्ट रेंडरिंग तक भी जाती है। लैटिन स्क्रिप्ट के मामले में Kolors समर्पित टेक्स्ट-इन-इमेज मॉडलों के मुकाबले प्रतिस्पर्धी है, हालाँकि हर बार उनसे बेहतर नहीं। लेकिन यह अकेला बड़ा ओपन-सोर्स मॉडल है जो बिना किसी अनुवाद वाले प्रीप्रोसेसिंग चरण के, एक ही आर्किटेक्चर में दोनों स्क्रिप्ट भरोसेमंद तरीके से संभालता है।
फ़ोटोरियलिस्टिक आउटपुट क्वालिटी
Kolors की इमेज फ़ोटोरियलिज़्म की ओर मज़बूत झुकाव रखती हैं। स्किन टेक्सचर, कपड़े की डिटेल, एम्बिएंट लाइटिंग और परिवेश की गहराई, सब एक स्वाभाविक क्वालिटी के साथ रेंडर होते हैं जो फ़ाइन-ट्यून्ड SDXL वेरिएंट और FLUX.1 Dev से मुकाबला करती है। मॉडल को Kuaishou द्वारा क्यूरेट किए गए एक बड़े प्रोप्राइटरी डेटासेट पर ट्रेन किया गया था, जिसमें हाई-रिज़ॉल्यूशन फ़ोटोग्राफ़ी और कमर्शियल इमेज शामिल थीं, जो प्लेटफ़ॉर्म के मीडिया इकोसिस्टम से जुटाई गई थीं।
रिलीज़ के कुछ ही बाद AI समुदाय द्वारा किए गए ब्लाइंड कंपैरिज़न में Kolors कई बेंचमार्क पर बेस SDXL से लगातार ज़्यादा स्कोर करता दिखा:
मेट्रिक
SDXL Base
Kolors
ह्यूमन प्रेफ़रेंस स्कोर
75.2%
85.6%
स्किन टेक्सचर रियलिज़्म
मध्यम
उच्च
चीनी प्रॉम्प्ट सटीकता
कमज़ोर
उच्च
लंबे प्रॉम्प्ट का पालन
Medium
High
टेक्स्ट रेंडरिंग (चीनी)
विफल
सफल
कम्पोज़िशन सटीकता
Medium
High
ये आँकड़े Kolors पेपर के इवैल्यूएशन सेक्शन से हैं और Kuaishou की अपनी आंतरिक बेंचमार्क पद्धति को दर्शाते हैं। स्वतंत्र समुदाय परीक्षणों ने भी इस रुझान की काफ़ी हद तक पुष्टि की है, खासकर पोर्ट्रेट सब्जेक्ट और सतह पर रखे प्रोडक्ट की इमेज में, जहाँ फ़ोटोरियलिज़्म ही मुख्य पैमाना है।
ओपन-सोर्स और चलाने में मुफ़्त
Kuaishou ने Kolors को एक ओपन लाइसेंस के तहत जारी किया है जो कमर्शियल उपयोग की अनुमति देता है। पूरे वेट्स, VAE और शेड्यूलर कॉन्फ़िगरेशन Hugging Face पर मुफ़्त उपलब्ध हैं। कोई भी उपयुक्त GPU वाला व्यक्ति इसे API खर्च के बिना लोकल चला सकता है। यह एक सोचा-समझा रणनीतिक फ़ैसला था: खुले तौर पर रिलीज़ करने से फ़ाइन-ट्यूनर, LoRA ट्रेनरों और डाउनस्ट्रीम एप्लिकेशनों का एक इकोसिस्टम बनता है, जो मॉडल की पहुँच को उससे कहीं आगे ले जाता है जितना Kuaishou अंदर से बना सकता था।
Kolors आर्किटेक्चर की गहरी पड़ताल
Kolors क्यों काम करता है, यह समझने के लिए मॉडल के अंदर चल रही प्रक्रिया पर एक संक्षिप्त नज़र डालना ज़रूरी है। अगर आप तकनीकी ब्योरों में रुचि नहीं रखते, तो आप इस हिस्से को छोड़ सकते हैं और लेख का सिलसिला नहीं टूटेगा।
UNet बैकबोन
Kolors अपने डीनॉइज़िंग बैकबोन के रूप में एक संशोधित UNet इस्तेमाल करता है, जिसकी संरचना SDXL के UNet जैसी है, लेकिन इसे Kuaishou की डेटा पाइपलाइन पर शुरू से ट्रेन किया गया है। वे संरचनात्मक फ़ैसले जो इसके व्यवहार को परिभाषित करते हैं:
रिज़ॉल्यूशन सपोर्ट: मल्टी-आस्पेक्ट रेशियो कंडीशनिंग सपोर्ट के साथ नेटिव 1024x1024 ट्रेनिंग
अटेंशन लेयर: क्रॉस-अटेंशन UNet की कई गहराइयों पर ChatGLM के टेक्स्ट एम्बेडिंग के आधार पर जनरेशन को कंडीशन करता है
स्किप कनेक्शन: स्टैंडर्ड UNet स्किप कनेक्शन अपसैंपलिंग पथ के दौरान स्थानिक संरचना को बनाए रखते हैं
टाइमस्टेप कंडीशनिंग: साइनसॉइडल टाइमस्टेप एम्बेडिंग इनफ़रेंस के दौरान पूरे समय नेटवर्क को डीनॉइज़िंग के चरण की जानकारी देती हैं
UNet शोर वाला लेटेंट टेंसर और प्रोजेक्टेड टेक्स्ट कंडीशनिंग दोनों एक साथ लेता है, हटाए जाने वाले नॉइज़ घटक का अनुमान लगाता है, और दोहराता है। DDIM, DPM++ 2M Karras और Euler सहित आम सैंपलर Kolors के साथ काम करते हैं। आम तौर पर 20 से 50 स्टेप अच्छी क्वालिटी देते हैं, और स्पीड और क्वालिटी के व्यावहारिक संतुलन के लिए 25 से 35 सबसे अच्छा माना जाता है।
मॉडल में टोकन कैसे बहते हैं
Kolors में टेक्स्ट कंडीशनिंग पाइपलाइन SDXL के दो-एन्कोडर सेटअप से ज़्यादा जटिल है। कच्चे प्रॉम्प्ट से इमेज कंडीशनिंग तक की प्रोसेसिंग का क्रम यह है:
इनपुट प्रॉम्प्ट चीनी या अंग्रेज़ी में आता है, 256 टोकन तक
ChatGLM3-6B टोकनाइज़र टेक्स्ट को भाषा-सचेत सबवर्ड टोकनाइज़ेशन के साथ टोकन ID में बदलता है
ChatGLM एन्कोडर[batch, seq_len, 4096] आकार वाले समृद्ध संदर्भात्मक एम्बेडिंग बनाता है
प्रोजेक्शन लेयर 4096-आयामी एम्बेडिंग को UNet की आंतरिक एम्बेडिंग डाइमेंशन में मैप करती है
क्रॉस-अटेंशन UNet की कई गहराइयों की लेयरों में हर जनरेशन स्टेप को इन प्रोजेक्शन के आधार पर कंडीशन करता है
ChatGLM एम्बेडिंग में CLIP एम्बेडिंग से कहीं ज़्यादा संदर्भात्मक जानकारी होती है, क्योंकि ChatGLM एक पूर्ण ऑटोरिग्रेसिव ट्रांसफ़ॉर्मर है, न कि पेयर्ड इमेज-टेक्स्ट डेटा पर ट्रेन किया गया कॉन्ट्रास्टिव मॉडल। इसी वजह से Kolors कम्पोज़िशन वाले प्रॉम्प्ट ज़्यादा भरोसेमंद ढंग से संभालता है: "बारिश वाली शाम को हरी इमारत के सामने खड़ी लाल कोट पहनी एक महिला" को एक कम्पोज़िशन वाले दृश्य के रूप में समझा जाता है, न कि इमेज-टेक्स्ट एसोसिएशन के सांख्यिकीय समूह के रूप में।
VAE और लेटेंट स्पेस
Kolors 4 लेटेंट चैनल वाला एक स्टैंडर्ड KL-रेगुलराइज़्ड VAE इस्तेमाल करता है। एन्कोडर ट्रेनिंग के लिए पिक्सेल इमेज को 8x स्पेशियल कम्प्रेशन पर लेटेंट में बदलता है, और डीकोडर इनफ़रेंस के समय पूरी इमेज दोबारा बनाता है। Kolors टीम ने शुरुआत के लिए SDXL के रिलीज़ किए गए VAE वेट्स का इस्तेमाल किया था, और यही एक कारण है कि लेटेंट स्पेस की विशेषताएँ कुछ SDXL-संबंधित टूलिंग और समुदायों के साथ काफ़ी हद तक मेल खाती हैं।
Kolors बनाम अन्य मॉडल
व्यापक मॉडल परिदृश्य में Kolors वास्तव में कहाँ खड़ा है?
Kolors एक खास जगह भरता है: नेटिव द्विभाषी सपोर्ट के साथ फ़ोटोरियलिस्टिक जनरेशन, ओपन-सोर्स पहुँच के स्तर पर। इस तुलना में कोई अन्य मॉडल यह संयोजन नहीं देता। FLUX.1 Dev फ़ोटोरियलिज़्म में करीब आता है, लेकिन उसमें चीनी भाषा की गहराई नहीं है। GPT Image 2 चीनी को बेहतर संभालता है, लेकिन वह क्लोज़्ड-सोर्स और केवल API पर उपलब्ध है।
जहाँ Kolors अपेक्षाकृत कमज़ोर है: इसका LoRA फ़ाइन-ट्यून इकोसिस्टम SDXL से छोटा है, इनफ़रेंस की स्पीड FLUX.1 Schnell से धीमी है, और डाउनलोड के लिए इसके पास समुदाय द्वारा बनाए गए स्टाइल चेकपॉइंट के वेरिएंट कम हैं।
Kolors कब चुनें
Kolors तब चुनें जब:
आपके दर्शक चीनी-भाषी हों और प्रॉम्प्ट मुख्य रूप से चीनी में लिखे जाएँगे
आपको पब्लिकेशन-क्वालिटी के फ़ोटोरियलिस्टिक पोर्ट्रेट या कमर्शियल प्रोडक्ट इमेज चाहिए
आपको प्रोडक्शन में उपयोग के लिए कमर्शियल-फ़्रेंडली लाइसेंस वाले ओपन वेट्स चाहिए
आप द्विभाषी प्रोडक्ट बना रहे हैं और दोनों भाषाई दर्शकों के लिए एक ही मॉडल चाहते हैं
कुछ और चुनें जब:
सबसे ज़्यादा इनफ़रेंस स्पीड प्राथमिकता हो (FLUX Schnell उल्लेखनीय रूप से तेज़ है)
आपको सबसे बड़ा फ़ाइन-ट्यून और LoRA इकोसिस्टम चाहिए (उसमें SDXL अब भी आगे है)
सटीक निर्देश पालन के साथ जटिल दृश्य कम्पोज़िशन चाहिए (FLUX.1 Dev बेहतर प्रदर्शन करता है)
वास्तविक दुनिया के उपयोग के मामले
पोर्ट्रेट और फ़ैशन फ़ोटोग्राफ़ी
Kolors ऐसी पोर्ट्रेट-क्वालिटी का आउटपुट देता है जो कई कमर्शियल संदर्भों में स्टॉक फ़ोटोग्राफ़ी की जगह ले सकता है। अलग-अलग नस्लों में स्किन टोन की रेंडरिंग स्वाभाविक है, लाइटिंग बिना नकली-सी चमक के सुसंगत रहती है, और मॉडल कपड़ों के फ़ैब्रिक के व्यवहार को हैरान करने वाली सटीकता से संभालता है। चीन में फ़ैशन फ़ोटोग्राफ़र और ई-कॉमर्स प्रोडक्शन टीमों ने इसे प्रोडक्ट इमेज और मॉडल रेफ़रेंस फ़्रेम बनाने के लिए तेज़ी से अपनाया, उस पैमाने पर जिसे पारंपरिक फ़ोटोग्राफ़ी आर्थिक रूप से पूरा नहीं कर सकती।
प्रोडक्ट विज़ुअलाइज़ेशन
चीनी ब्रांड महँगे स्टूडियो फ़ोटो शूट के बिना प्रोडक्ट-इन-कॉन्टेक्स्ट इमेज बनाने के लिए Kolors का सक्रिय उपयोग कर रहे हैं। एक स्किनकेयर ब्रांड सटीक कॉस्टिक लाइटिंग और शैडो के साथ संगमरमर की बाथरूम शेल्फ़ पर सीरम की बोतल की इमेज बना सकता है, वह भी पारंपरिक फ़ोटोग्राफ़ी की लागत के एक अंश में। नेटिव द्विभाषी प्रॉम्प्ट सपोर्ट का मतलब है कि मार्केटिंग टीम बिना किसी अनुवाद वाले प्रीप्रोसेसिंग या भाषा के अनुमान के सीधे चीनी में काम कर सकती है।
रिफ़्लेक्टिव सतहों, मटीरियल की पारदर्शिता और सतह-रोशनी के आपसी प्रभाव को मॉडल जिस तरह संभालता है, वह प्रोडक्ट विज़ुअलाइज़ेशन के काम के लिए खास तौर पर मज़बूत है, क्योंकि यह काम मटीरियल रेंडरिंग की सटीकता पर निर्भर करता है।
सोशल मीडिया और कंटेंट निर्माण
Kuaishou का अपना प्लेटफ़ॉर्म एक शॉर्ट-वीडियो प्रोडक्ट है, जो चीन में सीधे TikTok से प्रतिस्पर्धा करता है। Kolors सीधे Kuaishou के इन-प्लेटफ़ॉर्म क्रिएटर टूल्स में जाता है। कंटेंट क्रिएटर पूरी तरह चीनी में थंबनेल इमेज, बैनर आर्ट और प्रमोशनल ग्राफ़िक्स बना सकते हैं, और नतीजे बिना किसी अंग्रेज़ी बिचौलिए चरण के चीनी सोशल मीडिया की विज़ुअल अपेक्षाओं से मेल खाते हैं।
व्यवहार में Kolors चलाना
API के ज़रिए
बिना लोकल हार्डवेयर के Kolors चलाने का सबसे सरल तरीका Replicate API के ज़रिए है। मॉडल kwai-kolors/kolors पर होस्ट है और प्रॉम्प्ट, नेगेटिव प्रॉम्प्ट, स्टेप, गाइडेंस स्केल और सीड जैसे स्टैंडर्ड डिफ़्यूज़न पैरामीटर स्वीकार करता है। एक सामान्य कॉल पर एक इमेज की लागत एक सेंट के एक अंश जितनी आती है, और लगभग 10 से 20 सेकंड के इनफ़रेंस समय में 1024x1024 आउटपुट मिलता है।
ऊपर दिए गए चीनी प्रॉम्प्ट का अनुवाद यह है: "सफ़ेद ड्रेस में एक महिला चेरी ब्लॉसम के पेड़ों के नीचे खड़ी है।" Kolors इसे बिना किसी अनुवाद चरण के नेटिव रूप से पार्स करता है।
लोकल सेटअप की ज़रूरतें
लोकल डिप्लॉयमेंट के लिए न्यूनतम कॉन्फ़िगरेशन यह है:
GPU: 1024x1024 पर आराम से इनफ़रेंस के लिए 24GB VRAM वाला RTX 3090
फ़्रेमवर्क: Hugging Face से Diffusers 0.30.0 या बाद का वर्ज़न
चेकपॉइंट: Kwai-Kolors/Kolors, जो सीधे Hugging Face Hub पर उपलब्ध है
मॉडल Diffusers की KolorsPipeline क्लास के साथ इंटीग्रेट होता है, जो ChatGLM टोकनाइज़ेशन को अपने-आप संभालती है। float16 प्रिसिजन के साथ लोड करने पर यह 18 से 20GB VRAM में फ़िट हो जाता है। RTX 4090 पर 1024x1024 पर 30-स्टेप इनफ़रेंस में लगभग 8 से 12 सेकंड लगते हैं।
💡 टिप: Ada और Ampere जनरेशन के GPU पर UNet में torch.compile() लागू करें, इससे इनफ़रेंस स्पीड में 20 से 30% सुधार मिलता है। अतिरिक्त मेमोरी दक्षता के लिए इसे बिना क्वालिटी खोए SDPA attention के साथ जोड़ें।
LoRA फ़ाइन-ट्यूनिंग
Kolors स्टैंडर्ड Diffusers ट्रेनिंग स्क्रिप्ट्स के ज़रिए LoRA फ़ाइन-ट्यूनिंग को सपोर्ट करता है, बस ChatGLM कंडीशनिंग पाथ के लिए कुछ छोटे बदलाव करने पड़ते हैं। Kolors पर स्टाइल LoRA ट्रेन करने के लिए लगभग 20 से 50 रेफ़रेंस इमेज और 24GB GPU पर 1,000 से 2,000 ट्रेनिंग स्टेप्स चाहिए, तब जाकर क्वालिटी ठीक-ठाक आती है। आइडेंटिटी कंसिस्टेंसी वाले कामों के लिए पूरी dreambooth-स्टाइल फ़ाइन-ट्यूनिंग भी सपोर्टेड है।
Kuaishou टीम ने सहायक मॉडल भी जारी किए, जिनमें आइडेंटिटी-कंसिस्टेंट पोर्ट्रेट जनरेशन के लिए Kolors-IP-Adapter और पोज़, डेप्थ और कैनी एज कंडीशनिंग के लिए Kolors-ControlNet शामिल हैं। ये जोड़ Kolors के आसपास के व्यावहारिक टूलसेट को कहीं ज़्यादा पूरा बना देते हैं, जितना अकेले बेस मॉडल के मूल्यांकन से लगता है।
बड़ी तस्वीर
Kolors अपने अलग-अलग बेंचमार्क आँकड़ों से परे भी ध्यान देने लायक चीज़ है। यह चीनी रिसर्च टीमों के उच्च-क्वालिटी AI मॉडलों की एक बड़ी लहर का हिस्सा है, जिसे फ़्रंटियर मॉडल डेवलपमेंट की पश्चिमी चर्चाओं में अपेक्षाकृत कम दृश्यता मिली है।
Kuaishou, ByteDance और Alibaba की DAMO Academy की तरह, इंजीनियरिंग गहराई, कम्प्यूटेशनल संसाधन और प्रोप्राइटरी ट्रेनिंग डेटा रखता है, जिससे वह खास क्षेत्रों में पश्चिमी समकक्षों से मुकाबला कर सकने या उनसे आगे निकल सकने वाले मॉडल बना सकता है। Kolors रॉ एस्थेटिक स्टाइल में Midjourney v6 को नहीं हराता। लेकिन यह ज़्यादातर फ़ोटोरियलिस्टिक बेंचमार्क पर बेस SDXL से बेहतर प्रदर्शन करता है, और साथ ही ओपन-सोर्स रहते हुए, दो भाषाओं को नेटिव रूप से सपोर्ट करते हुए, कमर्शियल लाइसेंस के तहत आता है और सेल्फ़-होस्ट करने के लिए मुफ़्त है।
इस रिलीज़ ने इमेज जनरेशन के लिए लार्ज लैंग्वेज मॉडल को टेक्स्ट एन्कोडर के रूप में इस्तेमाल करने के तरीके को भी सही साबित किया। T5-XXL, जिसे Stable Diffusion 3 और FLUX.1 Dev में इस्तेमाल किया गया, ने पश्चिमी पक्ष से यह अवधारणा साबित की। Kolors ने दिखाया कि ChatGLM का इस्तेमाल करके यह कम से कम उतना ही अच्छा काम करता है, और गैर-अंग्रेज़ी भाषाओं के लिए शायद बेहतर। डिफ़्यूज़न मॉडलों के लिए बेहतर टेक्स्ट-कंडीशनिंग आर्किटेक्चर की खोज जारी है, और Kolors उस चल रही कहानी में एक अहम डेटा पॉइंट है।
जो टीमें चीनी-भाषी उपयोगकर्ताओं के लिए प्रोडक्ट बना रही हैं, उनके लिए Kolors कोई जिज्ञासा या प्रयोगात्मक विकल्प भर नहीं है। यह एक ही कमर्शियल-लाइसेंस वाले मॉडल में फ़ोटोरियलिस्टिक इमेज क्वालिटी और नेटिव चीनी प्रॉम्प्ट सपोर्ट को जोड़ने वाला फ़िलहाल सबसे मज़बूत ओपन-सोर्स विकल्प है।
अपनी इमेज बनाना शुरू करें
आधुनिक AI इमेज जनरेशन क्या कर सकता है, यह अनुभव करने का सबसे तेज़ तरीका है एक ऐसे प्लेटफ़ॉर्म का इस्तेमाल करना जिसने इन्फ़्रास्ट्रक्चर पहले से संभाल रखा हो, ताकि आपको लोकल हार्डवेयर, मॉडल डाउनलोड या API क्रेडेंशियल की ज़रूरत न पड़े। PicassoIA दर्जनों अत्याधुनिक टेक्स्ट-टू-इमेज मॉडल होस्ट करता है, जिन्हें आप बिना किसी सेटअप के सीधे ब्राउज़र में चला सकते हैं।
अगर आपको Kolors द्वारा लोकप्रिय की गई शैली में फ़ोटोरियलिस्टिक जनरेशन चाहिए, तो FLUX.1 Dev PicassoIA पर बेहद विस्तृत और प्रॉम्प्ट के अनुरूप आउटपुट देता है। जिन निर्देश-भारी क्रिएटिव कामों में इमेज में टेक्स्ट मायने रखता है, उनके लिए GPT Image 2 बिना किसी कॉन्फ़िगरेशन के उपलब्ध है। दोनों PicassoIA के इन्फ़्रास्ट्रक्चर पर चलते हैं, इसलिए आप प्रॉम्प्ट लिखते हैं और कुछ ही सेकंड में नतीजे देखते हैं।
चाहे आप पोर्ट्रेट फ़ोटोग्राफ़ी, प्रोडक्ट इमेज, सोशल मीडिया एसेट बना रहे हों, या बस किसी विस्तृत विवरण से यह परखना चाहते हों कि ये मॉडल क्या बना सकते हैं, PicassoIA फ़्रंटियर-स्तर की इमेज जनरेशन को एक ही जगह पर रखता है। अपना प्रॉम्प्ट लिखें, अपना मॉडल चुनें, और देखें क्या निकलकर आता है।