Flux पिछले दो सालों का सबसे चर्चित इमेज जनरेशन मॉडल है, और इसकी वजह भी है। ऐसे मॉडल जिनकी इमेज में साफ़ तौर पर "AI वाला लुक" दिखता है, उनसे अलग, Flux की इमेज को फ़ोटोग्राफ़र, डिज़ाइनर और कंटेंट क्रिएटर अक्सर असली फ़ोटो समझ बैठते हैं। अगर आप अब तक AI इमेज जनरेशन को दूर से देख रहे थे और सोच रहे थे कि शुरू कहाँ से करें, तो यह वह मॉडल है जिस पर आपको ध्यान देना चाहिए।
Flux असल में है क्या
Flux एक ओपन वेट्स इमेज जनरेशन मॉडल है, जिसे Black Forest Labs ने बनाया है। यह टीम पूर्व Stability AI रिसर्चर्स ने मिलकर शुरू की थी। अगस्त 2024 में रिलीज़ होते ही इसने टेक्स्ट-टू-इमेज क्वालिटी का नया मानक तय कर दिया, ख़ासकर उन क्षेत्रों में जहाँ पिछले मॉडल संघर्ष करते थे: सटीक टेक्स्ट रेंडरिंग, असली-सा मानव शरीर और जटिल प्रॉम्प्ट का सटीक पालन।
इसका मूल आर्किटेक्चर डिफ़्यूज़न ट्रांसफ़ॉर्मर (DiT) तरीके पर आधारित है, जो Stable Diffusion जैसे पुराने मॉडलों में इस्तेमाल हुए U-Net बैकबोन से एक बड़ा विकास है। इसी डिज़ाइन की वजह से Flux पूरी इमेज में संरचनात्मक एकरूपता बनाए रख पाता है, जो पहले ControlNet जैसे अतिरिक्त टूल्स के बिना संभव नहीं था।
यह दूसरों से अलग क्यों है
Flux को अलग बनाने वाली बात सिर्फ़ कच्ची विज़ुअल क्वालिटी नहीं है। इसकी प्रतिष्ठा तीन चीज़ों पर टिकी है:
- प्रॉम्प्ट की वफ़ादारी: Flux जटिल, कई शर्तों वाले प्रॉम्प्ट को असाधारण सटीकता से फ़ॉलो करता है। लिखें "a red bicycle leaning against a blue wall with a cat sleeping on the seat in soft afternoon light" और Flux इन सारी डिटेल्स को सही-सही रेंडर करेगा।
- टेक्स्ट रेंडरिंग: पिछले मॉडल इमेज के अंदर के टेक्स्ट को लगातार बिगाड़ देते थे। Flux छोटे से मध्यम लंबाई के टेक्स्ट को भरोसेमंद ढंग से रेंडर करता है, और सोशल मीडिया ग्राफ़िक्स, मॉकअप और विज़ुअल स्टोरीटेलिंग के लिए यह बेहद मायने रखता है।
- मानव शरीर: हाथ, उंगलियाँ और चेहरे का अनुपात ऐतिहासिक रूप से AI इमेज मॉडल की कमज़ोर कड़ी रहे हैं। Flux शरीर-रचना के हिसाब से सही नतीजे उस दर से देता है जो अपने पिछले वर्ज़न से साफ़ तौर पर बेहतर है।
इसके पीछे की टीम
Black Forest Labs की स्थापना 2024 में Robin Rombach, Andreas Blattmann और उनके कुछ साथियों ने की, जिन्होंने मूल Stable Diffusion आर्किटेक्चर बनाया था। यही पृष्ठभूमि Flux की क्वालिटी के बारे में काफ़ी कुछ बता देती है। ये नए खिलाड़ी नहीं हैं: उन्होंने वह मूल पाइपलाइन डिज़ाइन की थी जिसे आज भी ज़्यादातर इमेज मॉडल इस्तेमाल करते हैं, और Flux में सालों की जमा हुई रिसर्च एक बिल्कुल नए आर्किटेक्चर पर लागू दिखती है।

Flux मॉडल परिवार
Black Forest Labs ने Flux को कई टियर में रिलीज़ किया है। सही टियर चुनना इस पर निर्भर करता है कि आप क्या बना रहे हैं और आपको कितने नियंत्रण की ज़रूरत है।
Schnell, Dev और Pro की तुलना
| मॉडल | स्पीड | क्वालिटी | सबसे अच्छा किसके लिए |
|---|
| Flux Schnell | बहुत तेज़ | अच्छी | रैपिड प्रोटोटाइपिंग, बल्क जनरेशन |
| Flux Dev | मध्यम | उत्कृष्ट | क्रिएटिव प्रोजेक्ट, विस्तृत दृश्य |
| Flux Pro | धीमा | सर्वश्रेष्ठ | फ़ाइनल आउटपुट, प्रोफ़ेशनल इस्तेमाल |
Flux Schnell स्पीड के लिए ऑप्टिमाइज़ किया गया वर्ज़न है। यह लगभग 1 से 4 स्टेप में इमेज बनाता है, इसलिए जब आपको कम समय में प्रॉम्प्ट के दर्जनों वेरिएशन आज़माने हों, तब यह सही है। क्वालिटी बाकी टियर से साफ़ तौर पर कम है, लेकिन ज़्यादातर प्रतियोगी फ़ास्ट मॉडल से फिर भी काफ़ी आगे है।
Flux Dev बीच का वर्ज़न है और शौकीनों और प्रोफ़ेशनल, दोनों के बीच शायद सबसे लोकप्रिय है। यह जनरेशन स्पीड और उत्कृष्ट आउटपुट क्वालिटी के बीच बढ़िया संतुलन रखता है, और इसके ओपन वेट्स की वजह से इसके आसपास LoRA फ़ाइन-ट्यून्स का एक विशाल इकोसिस्टम बन चुका है।
Flux Pro इस परिवार का फ़्लैगशिप है। इसके वेट्स बंद हैं, केवल API से एक्सेस होता है, और यह परिवार में सबसे उच्च क्वालिटी के आउटपुट देता है। जब आपको किसी कैंपेन, प्रोडक्ट पेज या एडिटोरियल काम के लिए फ़ाइनल इमेज चाहिए, तो यही वर्ज़न इस्तेमाल करें।
अधिकतम डिटेल के लिए Flux 1.1 Pro Ultra
Flux 1.1 Pro Ultra Flux Pro का अपग्रेडेड वर्ज़न है, जो 4-मेगापिक्सल आउटपुट को नेटिव सपोर्ट करता है। 4MP पर वे डिटेल्स भी तीखी रहती हैं जो बड़े साइज़ पर आम तौर पर धुंधली पड़ जाती हैं: कपड़े की बुनाई के पैटर्न, दूर की वास्तुकला के हिस्से, और मिड-डिस्टेंस शॉट्स में बालों की अलग-अलग लटें।
💡 Ultra कब इस्तेमाल करें: अगर आप प्रिंट, बड़े फ़ॉर्मेट के डिस्प्ले, या ऐसे किसी भी काम के लिए इमेज बना रहे हैं जिसे हाई रेज़ोल्यूशन पर देखा जाएगा, तो Ultra टियर का अतिरिक्त इनफ़रेंस खर्च उठाने लायक है।

Flux 2: अगली पीढ़ी
Flux 2 Pro और Flux 2 Dev इस वंश को आगे बढ़ाते हैं, जिनमें टेक्स्ट-टू-इमेज जनरेशन के साथ बेहतर इमेज-टू-इमेज क्षमताएँ भी हैं। आप एक रेफ़रेंस फ़ोटो और एक टेक्स्ट प्रॉम्प्ट दे सकते हैं, और Flux 2 दोनों इनपुट को मिलाकर एक एकीकृत आउटपुट बनाता है। इससे प्रोडक्ट फ़ोटोग्राफ़ी, कैरेक्टर कंसिस्टेंसी और सीन एडैप्टेशन के लिए नए वर्कफ़्लो खुलते हैं।
Flux 2 Max आउटपुट रेज़ोल्यूशन को और आगे ले जाता है, और Flux 2 आर्किटेक्चर की अतिरिक्त रचनात्मक स्वतंत्रता के साथ 4MP इमेज बनाता है। जिन व्यावसायिक कामों में इमेज-टू-इमेज इनपुट ब्रीफ़ का हिस्सा हो, उनके लिए यह इस समय सबसे ऊँचा विकल्प है।
Flux की इमेज इतनी अच्छी क्यों लगती हैं
Flux और पुराने मॉडलों के बीच क्वालिटी का फ़र्क असली है, लेकिन यह समझना कि यह फ़र्क क्यों है, आपको इसे बेहतर ढंग से इस्तेमाल करने में मदद करता है।
टेक्स्ट रेंडरिंग जो सचमुच काम करती है
सालों तक डिफ़्यूज़न मॉडल के लिए इमेज के अंदर पढ़ने लायक टेक्स्ट बनाना लगभग असंभव माना जाता था। Flux ने आर्किटेक्चर में बदलाव और ज़्यादा समृद्ध कैप्शनिंग वाले डेटासेट पर ट्रेनिंग के मेल से इसे बदला। साइन बोर्ड, दुकानों के सामने के बोर्ड या प्रोडक्ट पैकेजिंग पर रखे छोटे वाक्यांश, एकल शब्द और यहाँ तक कि सरल वाक्य भी Flux में सही आते हैं, और इतनी सटीकता से आते हैं कि मॉकअप के काम में यह सचमुच उपयोगी बन जाता है।
इसका व्यावहारिक मतलब यह है: आप a coffee shop window with "OPEN" painted in white letters जैसे प्रॉम्प्ट लिख सकते हैं और ठीक वही पा सकते हैं। अब आप इमेज के अंदर के टेक्स्ट को सजावटी शोर मानने तक सीमित नहीं हैं।
डिटेल के स्तर पर प्रॉम्प्ट का पालन
ज़्यादातर इमेज मॉडल लंबे प्रॉम्प्ट को प्रोबेबिलिटी डिस्ट्रीब्यूशन की तरह लेते हैं और सबसे सांख्यिकीय रूप से संभावित व्याख्या को तरजीह देते हैं। Flux एक साथ ज़्यादा शर्तें थामे रखता है। ऐसा प्रॉम्प्ट जो तीन अलग-अलग रोशनी के स्रोत, एक खास कपड़े की बनावट और किसी सब्जेक्ट का एक ख़ास भावपूर्ण एक्सप्रेशन तय करता है, वहाँ इमेज में तीनों सचमुच मौजूद होंगे, बीच में औसत होकर गायब नहीं होंगे।
इसका मतलब यह नहीं कि लंबा प्रॉम्प्ट हमेशा बेहतर होता है। Flux को अब भी सटीक, संरचित प्रॉम्प्ट से फ़ायदा मिलता है। फ़र्क बस इतना है कि जटिलता की सीमा कहीं ज़्यादा ऊँची है।

PicassoIA पर Flux कैसे इस्तेमाल करें
PicassoIA आपको एक सरल इंटरफ़ेस के ज़रिए हर Flux मॉडल तक पहुँच देता है, इसके लिए कोई API key या लोकल सेटअप नहीं चाहिए। यहाँ बताया गया है कि शून्य से अपनी पहली इमेज तक कैसे पहुँचें।
स्टेप 1: अपना मॉडल चुनें
अगर आप अभी शुरुआत कर रहे हैं तो Flux Dev पर जाएँ। यह क्वालिटी और स्पीड का सबसे अच्छा अनुपात देता है और प्रॉम्प्ट के प्रयोगों को आसानी से झेल लेता है। अगर इटरेशन के लिए स्पीड चाहिए, तो Flux Schnell पर स्विच करें। फ़ाइनल आउटपुट के लिए Flux Pro या Flux 1.1 Pro Ultra इस्तेमाल करें।
स्टेप 2: संरचित प्रॉम्प्ट लिखें
Flux के प्रॉम्प्ट तब सबसे अच्छा काम करते हैं जब वे एक साफ़ ढाँचे का पालन करें:
- सब्जेक्ट और एक्शन: इमेज में क्या है और वह क्या कर रहा है?
- वातावरण: जगह कौन-सी है? सेटिंग कैसी दिखती है?
- रोशनी: रोशनी की दिशा, गुणवत्ता और रंग।
- कैमरा और लेंस: फ़ोकल लेंथ, अपर्चर, शूटिंग का कोण।
- स्टाइल और मूड: इमेज से जो समग्र भाव व्यक्त होना चाहिए।
एक औसत प्रॉम्प्ट: a woman in a garden
एक मज़बूत प्रॉम्प्ट: a woman in her 30s sitting on a wooden bench in an overgrown English cottage garden, dappled morning light filtering through apple tree branches overhead, 85mm f/1.8 portrait lens, warm golden tones, natural expression, film grain
दूसरे प्रॉम्प्ट में Flux को वह सारी शर्तें मिलती हैं जिनकी उसे सही फ़ैसले लेने के लिए ज़रूरत है। पहला प्रॉम्प्ट सब कुछ संयोग पर छोड़ देता है।
स्टेप 3: पैरामीटर एडजस्ट करें
PicassoIA वे पैरामीटर दिखाता है जो सबसे ज़्यादा मायने रखते हैं:
- आस्पेक्ट रेशियो: लैंडस्केप के लिए 16:9, वर्टिकल सोशल कंटेंट के लिए 9:16, और स्क्वायर फ़ॉर्मेट के लिए 1:1।
- स्टेप्स (Flux Dev): ज़्यादा स्टेप्स (28 से 50) कोहेरेंस और डिटेल बेहतर करते हैं। कम स्टेप्स (10 से 20) तेज़ होते हैं पर नरम आउटपुट देते हैं।
- गाइडेंस स्केल: नियंत्रित करता है कि मॉडल आपके प्रॉम्प्ट को कितनी सख़्ती से फ़ॉलो करे। ज़्यादातर कामों के लिए 3.5 से 7 के बीच के मान अच्छे रहते हैं।
- सीड: नतीजे दोबारा पाने या किसी पसंदीदा कंपोज़िशन पर इटरेट करने के लिए एक फ़िक्स्ड सीड सेट करें।
💡 प्रो टिप: गाइडेंस स्केल लगभग 3.5 से शुरू करें और अगर मॉडल आपके प्रॉम्प्ट की ख़ास डिटेल्स नहीं पकड़ रहा हो, तो इसे धीरे-धीरे बढ़ाएँ। 7 से ऊपर जाने पर अक्सर ओवर-सैचुरेशन और कठोरता आने लगती है।

इमेज एडिटिंग के लिए Flux
Flux परिवार टेक्स्ट-टू-इमेज जनरेशन से कहीं आगे तक जाता है। कई मॉडल ख़ास तौर पर मौजूदा फ़ोटो एडिट करने के लिए बने हैं।
मूल इमेज खोए बिना एडिट करें
Flux Kontext Pro और Flux Kontext Max इंस्ट्रक्शन-बेस्ड एडिटिंग मॉडल हैं। आप एक मौजूदा इमेज और एक टेक्स्ट निर्देश देते हैं, और मॉडल सिर्फ़ वही बदलता है जो आपने बताया है, बाकी सब कुछ वैसा ही रखता है। शर्ट का रंग बदलना हो, किसी सीन में कोई चीज़ जोड़नी हो, या पोर्ट्रेट की रोशनी बदलनी हो? ये मॉडल उस सटीकता से यह करते हैं जिस तक पारंपरिक इनपेंटिंग वर्कफ़्लो नहीं पहुँच पाते।
Flux Kontext Fast वही इंस्ट्रक्शन-बेस्ड एडिटिंग काफ़ी तेज़ स्पीड पर देता है, जिससे कई बार लगातार एडिट करने वाले वर्कफ़्लो बिना लंबे इंतज़ार के व्यावहारिक बन जाते हैं।
इनपेंटिंग और आउटपेंटिंग
Flux Fill Pro और Flux Fill Dev इनपेंटिंग और आउटपेंटिंग के काम संभालते हैं। इनपेंटिंग में आप इमेज के एक हिस्से पर मास्क लगाकर उसे ऐसी जनरेटेड सामग्री से बदल सकते हैं जो आसपास के संदर्भ से मेल खाए। आउटपेंटिंग कैनवास को मूल फ़्रेम से बाहर तक बढ़ा देती है। दोनों ऑपरेशन रोशनी की एकरूपता, परिप्रेक्ष्य और टेक्सचर की क्वालिटी बनाए रखते हैं, जिससे एडिट विश्वसनीय लगते हैं।

डेप्थ और स्ट्रक्चर कंट्रोल
Flux Depth Pro और Flux Canny Pro Flux इकोसिस्टम में ControlNet-स्टाइल की कार्यक्षमता लाते हैं। Depth Pro जनरेशन के दौरान 3D संरचना को सीमित करने के लिए डेप्थ मैप इस्तेमाल करता है, ताकि आउटपुट में स्थानिक संबंध रेफ़रेंस से मेल खाएँ। Canny Pro एज डिटेक्शन से कंपोज़िशन की संरचना बचाए रखता है, जबकि स्टाइल या कंटेंट बदलता है। जब आपको संबंधित इमेज की एक सीरीज़ में एकसमान आउटपुट चाहिए, तब ये टूल्स ज़रूरी हो जाते हैं।
कस्टम स्टाइल के लिए Flux LoRA मॉडल
Flux Dev LoRA और Flux Schnell LoRA आपको बेस Flux मॉडलों के ऊपर फ़ाइन-ट्यून्ड स्टाइल वेट्स लगाने देते हैं। LoRA (Low-Rank Adaptation) फ़ाइलें छोटे न्यूरल नेटवर्क एडिशन हैं, जो पूरे मॉडल को दोबारा ट्रेन किए बिना उसे किसी ख़ास विज़ुअल स्टाइल, सब्जेक्ट या सौंदर्य की ओर धकेलते हैं।
LoRA आपकी आउटपुट पर क्या असर डालता है
फ़ैशन फ़ोटोग्राफ़ी पर ट्रेन किया गया LoRA Flux को उस रोशनी की शैली, बॉडी पोस्चर के फ़्रेमिंग और कलर पैलेट की ओर ले जाता है, और इसके लिए आपको हर प्रॉम्प्ट में उसका वर्णन नहीं करना पड़ता। कैरेक्टर LoRA कई जेनरेशन में एक जैसा चेहरा बनाए रखता है। नतीजा यह कि जब आपको अपनी रचनात्मक दिशा से मेल खाने वाला LoRA मिल जाता है, तो प्रॉम्प्ट की जटिलता में बड़ी कमी आ जाती है।
अपना LoRA खुद ट्रेन करना
PicassoIA पर P Image Trainer आपको सीधे ब्राउज़र में कस्टम LoRA वेट्स ट्रेन करने देता है। 10 से 20 रेफ़रेंस इमेज अपलोड करें, एक ट्रिगर वर्ड सेट करें, और ट्रेनर आपके ख़ास सब्जेक्ट या स्टाइल पर एक Flux LoRA फ़ाइन-ट्यून कर देता है। फिर बने वेट्स को Flux Dev LoRA के ज़रिए आगे की सभी जेनरेशन पर लगाया जा सकता है।

Flux प्रॉम्प्ट की 3 आम गलतियाँ
एक उच्च-क्वालिटी मॉडल के साथ भी प्रॉम्प्ट की गलतियाँ लगातार निराशाजनक नतीजे देंगी।
एब्स्ट्रैक्ट विशेषणों से भर देना
"beautiful", "stunning", "amazing" या "incredible" जैसे शब्द कोई ख़ास विज़ुअल जानकारी नहीं देते। Flux "beautiful" को तब तक रेंडर नहीं कर सकता जब तक उसे पता न हो कि आपके संदर्भ में वह कैसा दिखता है। हर एब्स्ट्रैक्ट विशेषण की जगह एक ठोस विज़ुअल वर्णन रखें।
इसकी जगह: "a beautiful portrait of a woman"
यह आज़माएँ: "a portrait of a woman, soft diffused window light from the left, 85mm lens, slight smile, loose linen shirt, muted sage green background"
काम के लिए गलत मॉडल
फ़ाइनल आउटपुट के लिए Flux Schnell इस्तेमाल करना, या बल्क इटरेशन के लिए Flux Pro इस्तेमाल करना, संसाधनों का बेमेल है। मॉडल टियर को अपने वर्कफ़्लो के चरण से मिलाएँ। Schnell से प्रोटोटाइप करें, Dev से परिष्कृत करें और Pro से फ़ाइनल करें।
कंपोज़िशन में खाली जगह को नज़रअंदाज़ करना
Flux कंपोज़िशन के निर्देशों का पालन करता है। अगर आप चाहते हैं कि सब्जेक्ट फ़्रेम के किसी ख़ास हिस्से में रहे, तो साफ़-साफ़ बताएँ। "Subject in the left third of the frame, large negative space to the right" लिखने से ऐसे नतीजे बार-बार मिलेंगे जो मॉडल के अपने-आप अच्छा क्रॉप चुनने की उम्मीद से कहीं बेहतर कंपोज़ होंगे।

इमेज वेरिएशन के लिए Flux
Flux Redux Dev और Flux Redux Schnell एक ख़ास वर्कफ़्लो समस्या हल करते हैं: किसी मौजूदा इमेज के वेरिएशन बनाना, और उसकी मूल विज़ुअल पहचान बनाए रखना। एक सोर्स इमेज दें, और Redux अलग कंपोज़िशन, कलर पैलेट या रोशनी वाले नए वर्ज़न बनाता है, और यह सब करते हुए सब्जेक्ट की पहचान और सीन का सामान्य चरित्र बचाए रखता है।
यह प्रोडक्ट फ़ोटोग्राफ़ी के लिए ख़ास तौर पर कीमती है, जहाँ आपको पूरा फ़ोटोशूट किए बिना एक ही चीज़ के कई एंगल या संदर्भ चाहिए। एक सीरीज़ के इलस्ट्रेशन या सोशल मीडिया पोस्ट में कैरेक्टर कंसिस्टेंसी के लिए भी यह उपयोगी है।
💡 Redux टिप: गाइडेंस स्केल डिफ़ॉल्ट के जितना करीब होगा, Redux को कंपोज़िशन की दोबारा व्याख्या करने की उतनी ही ज़्यादा आज़ादी होगी। कम मान तंग वेरिएशन देते हैं; ज़्यादा मान ढीले वेरिएशन देते हैं।

आज ही Flux से बनाना शुरू करें
Flux परिवार का हर मॉडल सीधे PicassoIA पर उपलब्ध है, इसके लिए कोई सॉफ़्टवेयर इंस्टॉलेशन, API कॉन्फ़िगरेशन या हार्डवेयर की ज़रूरत नहीं है। आप प्रॉम्प्ट लिखते हैं और आपको इमेज मिल जाती है। बस इतना ही सेटअप है।
पहले प्रयोग के लिए Flux Dev पर जाएँ और कुछ ऐसा लिखें जो आपके अपने जीवन या काम की किसी ख़ास चीज़ का वर्णन करे। कोई प्रोडक्ट जो आप बेचते हैं, कोई जगह जिसे आप जानते हैं, कोई व्यक्ति जिसे आप विज़ुअलाइज़ करना चाहते हैं। निजी प्रॉम्प्ट की ख़ास बातें शुरुआती प्रयोग को सामान्य टेस्ट प्रॉम्प्ट से कहीं ज़्यादा फ़ायदेमंद बना देती हैं।
जब आप एक इमेज से आगे बढ़ने के लिए तैयार हों, तो Flux Redux Dev एक रेफ़रेंस इमेज से वेरिएशन देता है। Flux Kontext Pro आपको एक सरल टेक्स्ट निर्देश से मौजूदा फ़ोटो एडिट करने देता है। Flux Fill Pro किसी भी इमेज को बिना दिखने वाली सीमों के बढ़ाता या ठीक करता है।
PicassoIA पर Flux का पूरा इकोसिस्टम इस समय उपलब्ध सबसे सक्षम सार्वजनिक रूप से सुलभ इमेज जनरेशन टूलसेट है। Flux क्या अच्छा करता है, इसकी असली समझ विकसित करने का एकमात्र तरीका उसे इस्तेमाल करना है। आज एक प्रॉम्प्ट से शुरुआत करें, और नतीजे आपको किसी भी लेख से ज़्यादा बता देंगे।
