Wan 2.6 का इस्तेमाल कैसे करें, चरण-दर-चरण: घर पर शानदार AI वीडियो बनाएँ
Wan 2.6 अब तक का सबसे सक्षम ओपन-सोर्स वीडियो जनरेशन मॉडल है, जो टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो, दोनों मोड में ज़्यादा साफ़ मोशन, मज़बूत प्रॉम्प्ट एडहेरेंस और सिनेमैटिक आउटपुट देता है। यह लेख आपका पहला प्रॉम्प्ट लिखने से लेकर रिज़ॉल्यूशन, फ्रेम रेट और मोशन इंटेंसिटी को ट्यून करने तक हर चरण समझाता है, ताकि आप पहले दिन से ही प्रोफ़ेशनल-क्वालिटी नतीजे पा सकें।
Wan 2.6 ओपन-सोर्स वीडियो जनरेशन में एक असली छलांग है। अगर आप इस क्षेत्र पर नज़र रख रहे हैं, तो आप जानते ही होंगे कि Wan सीरीज़ ने रिसर्च टीम की तरफ़ से लगातार प्रतिस्पर्धी नतीजे दिए हैं। वर्ज़न 2.6 इसे और आगे ले जाता है, जिसमें मोशन में ज़्यादा तालमेल, चेहरे की बेहतर डिटेल और प्रॉम्प्ट एडहेरेंस में काफ़ी सुधार है। चाहे आप सोशल मीडिया के लिए सिनेमैटिक क्लिप बना रहे हों, प्रोडक्ट फ़ोटोग्राफ़ी को एनिमेट कर रहे हों, या पूरा वीडियो वर्कफ़्लो तैयार कर रहे हों, अभी यही वह मॉडल है जिसे जानना ज़रूरी है।
Wan 2.6 असल में क्या करता है
Wan 2.6 एक ओपन-सोर्स डिफ्यूज़न-आधारित वीडियो जनरेशन मॉडल है। यह इनपुट के तौर पर टेक्स्ट विवरण या स्थिर इमेज लेता है और आम तौर पर 4 से 8 सेकंड की एक छोटी वीडियो क्लिप देता है, जिसका रिज़ॉल्यूशन 1080p तक हो सकता है। यह मॉडल वीडियो लेटेंट्स पर डिफ्यूज़न प्रक्रिया चलाता है, यानी यह शोर वाले फ्रेमों को बार-बार परिष्कृत करके उन्हें तालमेल वाले मोशन में बदलता है।
इसे पिछले ओपन-सोर्स मॉडलों से जो चीज़ अलग करती है, वह है ट्रेनिंग का बड़ा पैमाना और आर्किटेक्चर में बदलाव, जिनकी वजह से यह टेम्पोरल कंसिस्टेंसी संभाल पाता है। यानी फ्रेमों के बीच वही कैरेक्टर, लाइटिंग और माहौल बना रहता है, बिना झिलमिलाए या बहके।
दो मोड की व्याख्या
Wan 2.6 दो मुख्य वर्ज़न में आता है:
मोड
इनपुट
सबसे अच्छा किसके लिए
T2V (टेक्स्ट-टू-वीडियो)
सिर्फ़ टेक्स्ट प्रॉम्प्ट
शून्य से दृश्य बनाने के लिए
I2V (इमेज-टू-वीडियो)
स्थिर इमेज + टेक्स्ट प्रॉम्प्ट
फ़ोटो, प्रोडक्ट शॉट और पोर्ट्रेट को एनिमेट करने के लिए
ये दोनों वर्ज़न PicassoIA पर उपलब्ध हैं। टेक्स्ट-टू-वीडियो वर्ज़न Wan 2.6 T2V है और इमेज-टू-वीडियो वर्ज़न Wan 2.6 I2V। इसके अलावा Wan 2.6 I2V Flash भी है, जो जल्दी प्रीव्यू चाहिए होने पर स्पीड के लिए ऑप्टिमाइज़्ड है।
पिछले वर्ज़न से यह कैसे अलग है
Wan 2.5 T2V पहले से ही सक्षम था, लेकिन 2.6 उसकी मुख्य कमज़ोरियों को दूर करता है:
बेहतर चेहरे की कंसिस्टेंसी: फ्रेम-दर-फ्रेम चेहरे एक जैसे बने रहते हैं
मज़बूत प्रॉम्प्ट एडहेरेंस: जटिल दृश्य विवरणों का ज़्यादा शाब्दिक रूप से पालन होता है
बेहतर मोशन रियलिज़्म: कपड़े, बाल और पानी की फ़िज़िक्स-आधारित गति साफ़ तौर पर ज़्यादा विश्वसनीय लगती है
नोट: कुछ क्वालिटी की कीमत पर तेज़ जनरेशन के लिए, Wan 2.2 T2V Fast तेज़ ड्राफ़्ट के लिए अब भी एक बेहतरीन विकल्प है।
एक भी प्रॉम्प्ट लिखने से पहले
Wan 2.6 के ज़्यादातर खराब नतीजे खराब प्रॉम्प्ट से आते हैं। कोई भी सेटिंग छूने से पहले यह जानना ज़रूरी है कि मॉडल आपका इनपुट कैसे पढ़ता है।
एक अच्छे Wan 2.6 प्रॉम्प्ट की बनावट
एक मज़बूत Wan 2.6 प्रॉम्प्ट इस संरचना का पालन करता है:
"धूप से भरे गेहूँ के खेत में धीरे-धीरे चलती लाल ड्रेस वाली एक महिला, पीछे से गोल्डन आवर की रोशनी, कैमरा नीचे के कोण से धीरे-धीरे आगे बढ़ता हुआ, सिनेमैटिक, 8K, फोटोरियलिस्टिक"
हर तत्व काम करता है। सब्जेक्ट साफ़ है। मोशन परिभाषित है। परिवेश स्पष्ट है। लाइटिंग की दिशा है। कैमरे के लिए निर्देश हैं।
Wan 2.6 सबसे अच्छा किस पर प्रतिक्रिया देता है
मोशन क्रिया-शब्द: "धीरे-धीरे चलना", "मुड़ना", "नरमी से बहना", "स्थिरता से उठना"
टिप: सिर्फ़ सब्जेक्ट नहीं, बल्कि बताएँ कि कैमरा क्या कर रहा है। Wan 2.6 सिनेमैटिक कैमरा निर्देशों की भाषा पर अच्छी प्रतिक्रिया देता है।
चरण-दर-चरण Wan 2.6 टेक्स्ट-टू-वीडियो का इस्तेमाल
Wan 2.6 T2V से शून्य से क्लिप बनाने का यह मुख्य वर्कफ़्लो है।
चरण 1: अपना दृश्य विवरण लिखें
सब्जेक्ट, एक्शन और माहौल को कवर करने वाले एक वाक्य से शुरू करें। फिर हर तत्व को विस्तार दें:
एक सादा टेक्स्ट एडिटर खोलें
अपना मुख्य दृश्य एक पंक्ति में लिखें
दूसरी पंक्ति में लाइटिंग जोड़ें
तीसरी पंक्ति में कैमरा मूवमेंट जोड़ें
अंत में क्वालिटी और स्टाइल टैग जोड़ें
उदाहरण संरचना:
A man in a dark coat standing at a rain-soaked city intersection at night,
neon reflections on wet pavement, slow zoom out from close face to wide street,
cinematic, photorealistic, 8K, film grain
चरण 2: अपने पैरामीटर सेट करें
एक बार प्रॉम्प्ट तैयार हो जाए, तो जनरेट करने से पहले ये सेट करें:
पैरामीटर
सुझाया गया मान
क्यों
रिज़ॉल्यूशन
1280x720 या 1920x1080
क्वालिटी और स्पीड में संतुलन
फ्रेम
81 फ्रेम (लगभग 16fps पर 5 सेकंड)
मानक लंबाई, अच्छा मोशन आर्क
गाइडेंस स्केल
5.0 से 7.0
ज़्यादा = प्रॉम्प्ट का ज़्यादा शाब्दिक पालन
स्टेप्स
30 से 50
ज़्यादा स्टेप्स = ज़्यादा शार्प लेकिन धीमा
सीड
फिक्स्ड (जैसे 42)
जब अच्छा वेरिएशन मिल जाए, तो इसे लॉक करें
चरण 3: जनरेट करें और दोहराएँ
अपनी पहली जनरेशन ड्राफ़्ट के तौर पर चलाएँ। नतीजे को अलग-थलग करके न आँकें:
नोट करें क्या अच्छा रहा: कंपोज़िशन, लाइटिंग, मोशन की आम दिशा
एक बार में एक वेरिएबल बदलें: प्रॉम्प्ट और गाइडेंस एक साथ बदलने से यह पता लगाना नामुमकिन हो जाता है कि आपके आउटपुट में क्या सुधरा
चरण-दर-चरण Wan 2.6 इमेज-टू-वीडियो का इस्तेमाल
I2V वर्कफ़्लो एक स्थिर इमेज से शुरू होता है। मॉडल इमेज की कंपोज़िशन, गहराई और कंटेंट पढ़ता है, फिर आपके मोशन प्रॉम्प्ट के आधार पर उसे एनिमेट करता है।
सही सोर्स इमेज चुनना
सारी इमेज एक जैसी अच्छी तरह एनिमेट नहीं होतीं। Wan 2.6 I2V तब सबसे अच्छा काम करता है जब:
बैकग्राउंड से अलग साफ़ सब्जेक्ट हो: पोर्ट्रेट, एक सब्जेक्ट वाले प्रोडक्ट शॉट, अलग-थलग ऑब्जेक्ट
इमेज में प्राकृतिक लाइटिंग हो: फ्लैट स्टूडियो लाइटिंग या बहुत ज़्यादा ओवरएक्सपोज़्ड फ़ोटो से सपाट एनिमेशन आता है
कंपोज़िशन में गहराई हो: धुंधले बैकग्राउंड के सामने का सब्जेक्ट मॉडल को ज़्यादा स्पेशियल संकेत देता है
इनसे बचें: बहुत ज़्यादा प्रोसेस की गई फ़ोटो, दिखने वाले आर्टिफ़ैक्ट वाली AI-जनरेटेड इमेज, या कई जटिल, एक-दूसरे पर चढ़े सब्जेक्ट वाली इमेज।
प्रॉम्प्ट से एनिमेशन को दिशा देना
Wan 2.6 I2V के लिए आपका टेक्स्ट प्रॉम्प्ट एक मोशन निर्देश होता है, दृश्य का विवरण नहीं। आप मॉडल को बता रहे होते हैं कि इमेज में मौजूद चीज़ें कैसे चलें:
अच्छा: "कैमरा धीरे से दाईं ओर पैन करे, बालों में हल्की हवा, नरम बोके सांस लेता हुआ"
अच्छा: "सब्जेक्ट सिर को थोड़ा दाईं ओर घुमाए, आँखें स्वाभाविक रूप से झपकाए"
खराब: "जंगल में खड़ी एक महिला" (बहुत वर्णनात्मक, मोशन की दिशा पर्याप्त नहीं)
टिप: पूरी जनरेशन से पहले तेज़ प्रीव्यू के लिए, Wan 2.6 I2V Flash ड्राफ़्ट स्टेज पर मामूली क्वालिटी नुकसान के साथ जनरेशन का समय काफ़ी घटा देता है।
PicassoIA पर Wan 2.6 कैसे इस्तेमाल करें
PicassoIA के कलेक्शन में Wan 2.6 T2V और Wan 2.6 I2V, दोनों सीधे उपलब्ध हैं। यहाँ सटीक वर्कफ़्लो है।
चरण 1: मॉडल खोलें
PicassoIA पर Wan 2.6 T2V पेज पर जाएँ। आपको बाईं ओर इनपुट पैनल और दाईं ओर आउटपुट प्रीव्यू एरिया दिखेगा। अगर आप एक स्थिर इमेज से काम कर रहे हैं, तो इसके बजाय Wan 2.6 I2V खोलें।
चरण 2: सेटिंग भरें
टेक्स्ट-टू-वीडियो के लिए:
अपना प्रॉम्प्ट मुख्य इनपुट फ़ील्ड में पेस्ट करें
अपना नेगेटिव प्रॉम्प्ट जोड़ें (नीचे का सेक्शन देखें)
रिज़ॉल्यूशन सेट करें: तेज़ नतीजों के लिए 1280x720, फ़ाइनल क्वालिटी के लिए 1920x1080
फ्रेम काउंट सेट करें: स्वाभाविक क्लिप लंबाई के लिए 81 या 97 फ्रेम अच्छे काम करते हैं
गाइडेंस स्केल सेट करें: 6.0 से शुरू करें
इनफ़रेंस स्टेप्स सेट करें: 40 एक भरोसेमंद डिफ़ॉल्ट है
इमेज-टू-वीडियो के लिए:
अपनी सोर्स इमेज को इनपुट फ़ील्ड में अपलोड करें
अपना मोशन प्रॉम्प्ट लिखें जिसमें बताया गया हो कि दृश्य को कैसे चलना चाहिए
ऊपर वाले जैसे ही रिज़ॉल्यूशन और फ्रेम पैरामीटर सेट करें
चरण 3: जनरेट करें और डाउनलोड करें
जनरेट पर क्लिक करें। PicassoIA आपका जॉब क्यू में डालता है और प्रोसेसिंग शुरू करता है। जनरेशन का समय रिज़ॉल्यूशन और फ्रेम काउंट के हिसाब से बदलता है, आम तौर पर 720p क्लिप के लिए 2 से 5 मिनट।
पूरा होने पर वीडियो आउटपुट पैनल में दिखता है। उसे इनलाइन प्रीव्यू करें और इंटरफ़ेस से सीधे MP4 डाउनलोड करें।
टिप: अगर आपके पहले नतीजे में चेहरों या हाथों पर साफ़ आर्टिफ़ैक्ट दिखें, तो गाइडेंस स्केल 0.5 से 1.0 घटाएँ और उसी सीड से दोबारा जनरेट करें। कम गाइडेंस अक्सर ज़्यादा शार्प हुए आर्टिफ़ैक्ट को नरम कर देता है।
वे सेटिंग जो सच में मायने रखती हैं
ज़्यादातर शुरुआती लोग एस्थेटिक्स पर ध्यान देते हैं और उन पैरामीटर को नज़रअंदाज़ कर देते हैं जो आउटपुट की क्वालिटी तय करते हैं।
रिज़ॉल्यूशन और फ्रेम काउंट
अपने आउटपुट सेटिंग चुनने के लिए यह एक व्यावहारिक संदर्भ है:
रिज़ॉल्यूशन
फ्रेम काउंट
लगभग अवधि
उपयोग
832x480
49 फ्रेम
~3s
ड्राफ़्ट टेस्टिंग
1280x720
81 फ्रेम
~5s
मानक क्वालिटी
1920x1080
81 फ्रेम
~5s
फ़ाइनल आउटपुट
1920x1080
121 फ्रेम
~7.5s
लंबी क्लिप
ज़्यादातर सोशल मीडिया उपयोग के लिए, 81 फ्रेम वाला 1280x720 क्वालिटी और जनरेशन लागत के बीच सबसे अच्छा संतुलन देता है।
मोशन इंटेंसिटी और गाइडेंस स्केल
गाइडेंस स्केल (जिसे CFG स्केल भी कहते हैं) सबसे ज़्यादा असर डालने वाले पैरामीटर में से एक है:
4.0 से नीचे: ढीली व्याख्या, रचनात्मक आज़ादी, प्रॉम्प्ट को नज़रअंदाज़ कर सकता है
4.0 से 6.0: संतुलित, आम तौर पर जटिल दृश्यों के लिए आदर्श
6.0 से 8.0: सख़्त पालन, ओवर-शार्पनिंग या आर्टिफ़ैक्ट ला सकता है
8.0 से ऊपर: अक्सर जले हुए, अप्राकृतिक नतीजे देता है
कुछ इम्प्लीमेंटेशन मोशन इंटेंसिटी या मोशन बकेट स्लाइडर भी देते हैं। कम मान सूक्ष्म, यथार्थवादी मोशन देते हैं। ज़्यादा मान नाटकीय, बढ़ा-चढ़ाकर मूवमेंट बनाते हैं।
काम करने वाले नेगेटिव प्रॉम्प्ट
साफ़ आउटपुट के लिए इसे अपने बेसलाइन नेगेटिव प्रॉम्प्ट के रूप में इस्तेमाल करें:
blurry, low quality, artifacts, distorted faces, extra limbs,
flickering, watermark, text overlay, unrealistic motion, choppy frames
जिन चीज़ों पर आपकी जनरेशन विफल हो रही हो, उनके आधार पर खास शब्द जोड़ें। अगर चेहरे विकृत हो रहे हों, तो "deformed face, bad anatomy" जोड़ें। अगर वीडियो बहुत स्थिर है, तो "no motion, static, frozen" जोड़ें।
5 गलतियाँ जो Wan 2.6 के नतीजे बिगाड़ देती हैं
ये वे सबसे आम बातें हैं जो पहली बार Wan 2.6 इस्तेमाल करने वालों को उलझा देती हैं:
ऐसे प्रॉम्प्ट जो मोशन नहीं, स्थिर इमेज का वर्णन करते हैं: "खेत में खड़ी एक महिला" लगभग शून्य मूवमेंट देता है। मोशन क्रिया-शब्द और कैमरा निर्देश जोड़ें।
एक साथ बहुत सारे वेरिएबल बदलना: अगर आप प्रॉम्प्ट, गाइडेंस, रिज़ॉल्यूशन और सीड एक साथ बदल देते हैं, तो आप कभी यह अलग नहीं कर पाएँगे कि आपका आउटपुट किससे बेहतर हुआ।
जटिल मल्टी-सब्जेक्ट दृश्यों पर ज़्यादा गाइडेंस स्केल इस्तेमाल करना: कई सब्जेक्ट के साथ ज़्यादा CFG अक्सर आर्टिफ़ैक्ट लाता है। भीड़ या कई लोगों वाले शॉट के लिए 4.5 से 5.5 तक घटाएँ।
नेगेटिव प्रॉम्प्ट को पूरी तरह नज़रअंदाज़ करना: एक बेसिक नेगेटिव प्रॉम्प्ट भी आर्टिफ़ैक्ट की आवृत्ति को उल्लेखनीय रूप से कम करता है।
पहले ड्राफ़्ट में अधिकतम रिज़ॉल्यूशन पर जनरेट करना: 1080p की प्रोसेसिंग में काफ़ी ज़्यादा समय लगता है। अपना प्रॉम्प्ट 720p पर टेस्ट करें, फिर मंज़ूर किए गए अंतिम संस्करण को पूरे रिज़ॉल्यूशन पर चलाएँ।
अपने वीडियो के साथ आगे क्या करें
जनरेट की गई क्लिप एक शुरुआत है। इसे और आगे ले जाने का तरीका यह है:
अपस्केल करें: 720p आउटपुट को 4K-समान शार्पनेस तक ले जाने के लिए इसे AI वीडियो अपस्केलिंग मॉडल से चलाएँ।
एडिट करें और क्रम लगाएँ: लंबे सीक्वेंस बनाने के लिए एक वीडियो एडिटर में कई Wan 2.6 क्लिप जोड़ें।
लूप बनाएँ: 2 से 3 सेकंड की छोटी क्लिप को सोशल मीडिया कंटेंट के लिए सीमलेस लूप में बदला जा सकता है।
लिप सिंक जोड़ें: Wan 2.6 से एक चेहरा एनिमेट करें, फिर किसी भी वॉइस ट्रैक में यथार्थवादी मुँह की हरकत जोड़ने के लिए लिप सिंक मॉडल लगाएँ।
अभी बनाना शुरू करें
प्रोफ़ेशनल-क्वालिटी AI वीडियो बनाने की बाधा पहले कभी इतनी कम नहीं थी। PicassoIA के ज़रिए सीधे उपलब्ध Wan 2.6 के साथ आपको लोकल GPU हार्डवेयर या जटिल सेटअप की ज़रूरत नहीं है। एक प्रॉम्प्ट लिखें, कुछ पैरामीटर सेट करें, और मिनटों में एक सिनेमैटिक क्लिप पाएँ।
इस मॉडल की समझ बनाने का सबसे अच्छा तरीका है ज़्यादा से ज़्यादा अभ्यास। 10 जनरेशन चलाएँ। जो अच्छा रहा उसकी तुलना करें। अच्छे नतीजे देने वाले प्रॉम्प्ट का एक सरल लॉग रखें। आपकी सफलता दर जल्दी सुधरेगी।
PicassoIA पर Wan 2.6 T2V खोलें और अभी अपनी पहली जनरेशन चलाएँ। अगर आप एक स्थिर फ़ोटो से काम कर रहे हैं, तो सीधे Wan 2.6 I2V पर जाएँ। किसी भी तरह, आपके पास पाँच मिनट से कम में साझा करने लायक वीडियो क्लिप होगी।