Wan 2.6 का इस्तेमाल कैसे करें, चरण-दर-चरण: घर पर शानदार AI वीडियो बनाएँ

Wan 2.6 अब तक का सबसे सक्षम ओपन-सोर्स वीडियो जनरेशन मॉडल है, जो टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो, दोनों मोड में ज़्यादा साफ़ मोशन, मज़बूत प्रॉम्प्ट एडहेरेंस और सिनेमैटिक आउटपुट देता है। यह लेख आपका पहला प्रॉम्प्ट लिखने से लेकर रिज़ॉल्यूशन, फ्रेम रेट और मोशन इंटेंसिटी को ट्यून करने तक हर चरण समझाता है, ताकि आप पहले दिन से ही प्रोफ़ेशनल-क्वालिटी नतीजे पा सकें।

Wan 2.6 का इस्तेमाल कैसे करें, चरण-दर-चरण: घर पर शानदार AI वीडियो बनाएँ
Cristian Da Conceicao
Picasso IA के संस्थापक

Wan 2.6 ओपन-सोर्स वीडियो जनरेशन में एक असली छलांग है। अगर आप इस क्षेत्र पर नज़र रख रहे हैं, तो आप जानते ही होंगे कि Wan सीरीज़ ने रिसर्च टीम की तरफ़ से लगातार प्रतिस्पर्धी नतीजे दिए हैं। वर्ज़न 2.6 इसे और आगे ले जाता है, जिसमें मोशन में ज़्यादा तालमेल, चेहरे की बेहतर डिटेल और प्रॉम्प्ट एडहेरेंस में काफ़ी सुधार है। चाहे आप सोशल मीडिया के लिए सिनेमैटिक क्लिप बना रहे हों, प्रोडक्ट फ़ोटोग्राफ़ी को एनिमेट कर रहे हों, या पूरा वीडियो वर्कफ़्लो तैयार कर रहे हों, अभी यही वह मॉडल है जिसे जानना ज़रूरी है।

Wan 2.6 असल में क्या करता है

Wan 2.6 एक ओपन-सोर्स डिफ्यूज़न-आधारित वीडियो जनरेशन मॉडल है। यह इनपुट के तौर पर टेक्स्ट विवरण या स्थिर इमेज लेता है और आम तौर पर 4 से 8 सेकंड की एक छोटी वीडियो क्लिप देता है, जिसका रिज़ॉल्यूशन 1080p तक हो सकता है। यह मॉडल वीडियो लेटेंट्स पर डिफ्यूज़न प्रक्रिया चलाता है, यानी यह शोर वाले फ्रेमों को बार-बार परिष्कृत करके उन्हें तालमेल वाले मोशन में बदलता है।

इसे पिछले ओपन-सोर्स मॉडलों से जो चीज़ अलग करती है, वह है ट्रेनिंग का बड़ा पैमाना और आर्किटेक्चर में बदलाव, जिनकी वजह से यह टेम्पोरल कंसिस्टेंसी संभाल पाता है। यानी फ्रेमों के बीच वही कैरेक्टर, लाइटिंग और माहौल बना रहता है, बिना झिलमिलाए या बहके।

गोल्डन आवर में DSLR स्क्रीन पर AI से एनिमेट की गई इमेज देखता फ़ोटोग्राफ़र

दो मोड की व्याख्या

Wan 2.6 दो मुख्य वर्ज़न में आता है:

मोडइनपुटसबसे अच्छा किसके लिए
T2V (टेक्स्ट-टू-वीडियो)सिर्फ़ टेक्स्ट प्रॉम्प्टशून्य से दृश्य बनाने के लिए
I2V (इमेज-टू-वीडियो)स्थिर इमेज + टेक्स्ट प्रॉम्प्टफ़ोटो, प्रोडक्ट शॉट और पोर्ट्रेट को एनिमेट करने के लिए

ये दोनों वर्ज़न PicassoIA पर उपलब्ध हैं। टेक्स्ट-टू-वीडियो वर्ज़न Wan 2.6 T2V है और इमेज-टू-वीडियो वर्ज़न Wan 2.6 I2V। इसके अलावा Wan 2.6 I2V Flash भी है, जो जल्दी प्रीव्यू चाहिए होने पर स्पीड के लिए ऑप्टिमाइज़्ड है।

पिछले वर्ज़न से यह कैसे अलग है

Wan 2.5 T2V पहले से ही सक्षम था, लेकिन 2.6 उसकी मुख्य कमज़ोरियों को दूर करता है:

  • बेहतर चेहरे की कंसिस्टेंसी: फ्रेम-दर-फ्रेम चेहरे एक जैसे बने रहते हैं
  • मज़बूत प्रॉम्प्ट एडहेरेंस: जटिल दृश्य विवरणों का ज़्यादा शाब्दिक रूप से पालन होता है
  • बेहतर मोशन रियलिज़्म: कपड़े, बाल और पानी की फ़िज़िक्स-आधारित गति साफ़ तौर पर ज़्यादा विश्वसनीय लगती है

नोट: कुछ क्वालिटी की कीमत पर तेज़ जनरेशन के लिए, Wan 2.2 T2V Fast तेज़ ड्राफ़्ट के लिए अब भी एक बेहतरीन विकल्प है।

एक भी प्रॉम्प्ट लिखने से पहले

Wan 2.6 के ज़्यादातर खराब नतीजे खराब प्रॉम्प्ट से आते हैं। कोई भी सेटिंग छूने से पहले यह जानना ज़रूरी है कि मॉडल आपका इनपुट कैसे पढ़ता है।

लैपटॉप स्क्रीन पर स्क्रिप्ट के साथ मिनिमलिस्ट डेस्क पर टाइप करती युवा महिला

एक अच्छे Wan 2.6 प्रॉम्प्ट की बनावट

एक मज़बूत Wan 2.6 प्रॉम्प्ट इस संरचना का पालन करता है:

[सब्जेक्ट] + [एक्शन/मोशन] + [परिवेश] + [लाइटिंग] + [कैमरा व्यवहार] + [स्टाइल/मूड]

उदाहरण के लिए:

"धूप से भरे गेहूँ के खेत में धीरे-धीरे चलती लाल ड्रेस वाली एक महिला, पीछे से गोल्डन आवर की रोशनी, कैमरा नीचे के कोण से धीरे-धीरे आगे बढ़ता हुआ, सिनेमैटिक, 8K, फोटोरियलिस्टिक"

हर तत्व काम करता है। सब्जेक्ट साफ़ है। मोशन परिभाषित है। परिवेश स्पष्ट है। लाइटिंग की दिशा है। कैमरे के लिए निर्देश हैं।

Wan 2.6 सबसे अच्छा किस पर प्रतिक्रिया देता है

  • मोशन क्रिया-शब्द: "धीरे-धीरे चलना", "मुड़ना", "नरमी से बहना", "स्थिरता से उठना"
  • कैमरा भाषा: "डॉली इन", "पैन लेफ़्ट", "ऑर्बिटल शॉट", "हैंडहेल्ड हल्का स्वे"
  • लाइटिंग की ख़ास बातें: "गर्म साइड लाइट", "नरम बादलों वाली फैली रोशनी", "तेज़ सीधी दोपहर की धूप"
  • माहौल के शब्द: "कोहरे भरा", "धुंधला", "हवादार", "बारिश वाला", "धूल भरा"

टिप: सिर्फ़ सब्जेक्ट नहीं, बल्कि बताएँ कि कैमरा क्या कर रहा है। Wan 2.6 सिनेमैटिक कैमरा निर्देशों की भाषा पर अच्छी प्रतिक्रिया देता है।

चरण-दर-चरण Wan 2.6 टेक्स्ट-टू-वीडियो का इस्तेमाल

Wan 2.6 T2V से शून्य से क्लिप बनाने का यह मुख्य वर्कफ़्लो है।

मॉनिटरों पर वीडियो सेटिंग और पैरामीटर दिखाते डेवलपर डेस्क का एरियल शॉट

चरण 1: अपना दृश्य विवरण लिखें

सब्जेक्ट, एक्शन और माहौल को कवर करने वाले एक वाक्य से शुरू करें। फिर हर तत्व को विस्तार दें:

  1. एक सादा टेक्स्ट एडिटर खोलें
  2. अपना मुख्य दृश्य एक पंक्ति में लिखें
  3. दूसरी पंक्ति में लाइटिंग जोड़ें
  4. तीसरी पंक्ति में कैमरा मूवमेंट जोड़ें
  5. अंत में क्वालिटी और स्टाइल टैग जोड़ें

उदाहरण संरचना:

A man in a dark coat standing at a rain-soaked city intersection at night,
neon reflections on wet pavement, slow zoom out from close face to wide street,
cinematic, photorealistic, 8K, film grain

चरण 2: अपने पैरामीटर सेट करें

एक बार प्रॉम्प्ट तैयार हो जाए, तो जनरेट करने से पहले ये सेट करें:

पैरामीटरसुझाया गया मानक्यों
रिज़ॉल्यूशन1280x720 या 1920x1080क्वालिटी और स्पीड में संतुलन
फ्रेम81 फ्रेम (लगभग 16fps पर 5 सेकंड)मानक लंबाई, अच्छा मोशन आर्क
गाइडेंस स्केल5.0 से 7.0ज़्यादा = प्रॉम्प्ट का ज़्यादा शाब्दिक पालन
स्टेप्स30 से 50ज़्यादा स्टेप्स = ज़्यादा शार्प लेकिन धीमा
सीडफिक्स्ड (जैसे 42)जब अच्छा वेरिएशन मिल जाए, तो इसे लॉक करें

चरण 3: जनरेट करें और दोहराएँ

अपनी पहली जनरेशन ड्राफ़्ट के तौर पर चलाएँ। नतीजे को अलग-थलग करके न आँकें:

  • नोट करें क्या अच्छा रहा: कंपोज़िशन, लाइटिंग, मोशन की आम दिशा
  • नोट करें क्या बिगड़ा: चेहरे, मोशन आर्टिफ़ैक्ट, गलत चीज़ें
  • एक बार में एक वेरिएबल बदलें: प्रॉम्प्ट और गाइडेंस एक साथ बदलने से यह पता लगाना नामुमकिन हो जाता है कि आपके आउटपुट में क्या सुधरा

चरण-दर-चरण Wan 2.6 इमेज-टू-वीडियो का इस्तेमाल

I2V वर्कफ़्लो एक स्थिर इमेज से शुरू होता है। मॉडल इमेज की कंपोज़िशन, गहराई और कंटेंट पढ़ता है, फिर आपके मोशन प्रॉम्प्ट के आधार पर उसे एनिमेट करता है।

नरम प्राकृतिक खिड़की की रोशनी में AI वीडियो जनरेशन प्लेटफ़ॉर्म इंटरफ़ेस दिखाता MacBook

सही सोर्स इमेज चुनना

सारी इमेज एक जैसी अच्छी तरह एनिमेट नहीं होतीं। Wan 2.6 I2V तब सबसे अच्छा काम करता है जब:

  • बैकग्राउंड से अलग साफ़ सब्जेक्ट हो: पोर्ट्रेट, एक सब्जेक्ट वाले प्रोडक्ट शॉट, अलग-थलग ऑब्जेक्ट
  • इमेज में प्राकृतिक लाइटिंग हो: फ्लैट स्टूडियो लाइटिंग या बहुत ज़्यादा ओवरएक्सपोज़्ड फ़ोटो से सपाट एनिमेशन आता है
  • कंपोज़िशन में गहराई हो: धुंधले बैकग्राउंड के सामने का सब्जेक्ट मॉडल को ज़्यादा स्पेशियल संकेत देता है

इनसे बचें: बहुत ज़्यादा प्रोसेस की गई फ़ोटो, दिखने वाले आर्टिफ़ैक्ट वाली AI-जनरेटेड इमेज, या कई जटिल, एक-दूसरे पर चढ़े सब्जेक्ट वाली इमेज।

प्रॉम्प्ट से एनिमेशन को दिशा देना

Wan 2.6 I2V के लिए आपका टेक्स्ट प्रॉम्प्ट एक मोशन निर्देश होता है, दृश्य का विवरण नहीं। आप मॉडल को बता रहे होते हैं कि इमेज में मौजूद चीज़ें कैसे चलें:

  • अच्छा: "कैमरा धीरे से दाईं ओर पैन करे, बालों में हल्की हवा, नरम बोके सांस लेता हुआ"
  • अच्छा: "सब्जेक्ट सिर को थोड़ा दाईं ओर घुमाए, आँखें स्वाभाविक रूप से झपकाए"
  • खराब: "जंगल में खड़ी एक महिला" (बहुत वर्णनात्मक, मोशन की दिशा पर्याप्त नहीं)

टिप: पूरी जनरेशन से पहले तेज़ प्रीव्यू के लिए, Wan 2.6 I2V Flash ड्राफ़्ट स्टेज पर मामूली क्वालिटी नुकसान के साथ जनरेशन का समय काफ़ी घटा देता है।

PicassoIA पर Wan 2.6 कैसे इस्तेमाल करें

PicassoIA के कलेक्शन में Wan 2.6 T2V और Wan 2.6 I2V, दोनों सीधे उपलब्ध हैं। यहाँ सटीक वर्कफ़्लो है।

धुंधले से शार्प सिनेमैटिक क्वालिटी में बदलते फ़्रेम दिखाती फ़िल्म स्ट्रिप

चरण 1: मॉडल खोलें

PicassoIA पर Wan 2.6 T2V पेज पर जाएँ। आपको बाईं ओर इनपुट पैनल और दाईं ओर आउटपुट प्रीव्यू एरिया दिखेगा। अगर आप एक स्थिर इमेज से काम कर रहे हैं, तो इसके बजाय Wan 2.6 I2V खोलें।

चरण 2: सेटिंग भरें

टेक्स्ट-टू-वीडियो के लिए:

  1. अपना प्रॉम्प्ट मुख्य इनपुट फ़ील्ड में पेस्ट करें
  2. अपना नेगेटिव प्रॉम्प्ट जोड़ें (नीचे का सेक्शन देखें)
  3. रिज़ॉल्यूशन सेट करें: तेज़ नतीजों के लिए 1280x720, फ़ाइनल क्वालिटी के लिए 1920x1080
  4. फ्रेम काउंट सेट करें: स्वाभाविक क्लिप लंबाई के लिए 81 या 97 फ्रेम अच्छे काम करते हैं
  5. गाइडेंस स्केल सेट करें: 6.0 से शुरू करें
  6. इनफ़रेंस स्टेप्स सेट करें: 40 एक भरोसेमंद डिफ़ॉल्ट है

इमेज-टू-वीडियो के लिए:

  1. अपनी सोर्स इमेज को इनपुट फ़ील्ड में अपलोड करें
  2. अपना मोशन प्रॉम्प्ट लिखें जिसमें बताया गया हो कि दृश्य को कैसे चलना चाहिए
  3. ऊपर वाले जैसे ही रिज़ॉल्यूशन और फ्रेम पैरामीटर सेट करें

चरण 3: जनरेट करें और डाउनलोड करें

जनरेट पर क्लिक करें। PicassoIA आपका जॉब क्यू में डालता है और प्रोसेसिंग शुरू करता है। जनरेशन का समय रिज़ॉल्यूशन और फ्रेम काउंट के हिसाब से बदलता है, आम तौर पर 720p क्लिप के लिए 2 से 5 मिनट।

पूरा होने पर वीडियो आउटपुट पैनल में दिखता है। उसे इनलाइन प्रीव्यू करें और इंटरफ़ेस से सीधे MP4 डाउनलोड करें।

टिप: अगर आपके पहले नतीजे में चेहरों या हाथों पर साफ़ आर्टिफ़ैक्ट दिखें, तो गाइडेंस स्केल 0.5 से 1.0 घटाएँ और उसी सीड से दोबारा जनरेट करें। कम गाइडेंस अक्सर ज़्यादा शार्प हुए आर्टिफ़ैक्ट को नरम कर देता है।

वे सेटिंग जो सच में मायने रखती हैं

ज़्यादातर शुरुआती लोग एस्थेटिक्स पर ध्यान देते हैं और उन पैरामीटर को नज़रअंदाज़ कर देते हैं जो आउटपुट की क्वालिटी तय करते हैं।

दोपहर की गोल्डन रोशनी में वीडियो एडिटिंग मॉनिटर को ध्यान से देखता एक गंभीर प्रोफ़ेशनल

रिज़ॉल्यूशन और फ्रेम काउंट

अपने आउटपुट सेटिंग चुनने के लिए यह एक व्यावहारिक संदर्भ है:

रिज़ॉल्यूशनफ्रेम काउंटलगभग अवधिउपयोग
832x48049 फ्रेम~3sड्राफ़्ट टेस्टिंग
1280x72081 फ्रेम~5sमानक क्वालिटी
1920x108081 फ्रेम~5sफ़ाइनल आउटपुट
1920x1080121 फ्रेम~7.5sलंबी क्लिप

ज़्यादातर सोशल मीडिया उपयोग के लिए, 81 फ्रेम वाला 1280x720 क्वालिटी और जनरेशन लागत के बीच सबसे अच्छा संतुलन देता है।

मोशन इंटेंसिटी और गाइडेंस स्केल

गाइडेंस स्केल (जिसे CFG स्केल भी कहते हैं) सबसे ज़्यादा असर डालने वाले पैरामीटर में से एक है:

  • 4.0 से नीचे: ढीली व्याख्या, रचनात्मक आज़ादी, प्रॉम्प्ट को नज़रअंदाज़ कर सकता है
  • 4.0 से 6.0: संतुलित, आम तौर पर जटिल दृश्यों के लिए आदर्श
  • 6.0 से 8.0: सख़्त पालन, ओवर-शार्पनिंग या आर्टिफ़ैक्ट ला सकता है
  • 8.0 से ऊपर: अक्सर जले हुए, अप्राकृतिक नतीजे देता है

कुछ इम्प्लीमेंटेशन मोशन इंटेंसिटी या मोशन बकेट स्लाइडर भी देते हैं। कम मान सूक्ष्म, यथार्थवादी मोशन देते हैं। ज़्यादा मान नाटकीय, बढ़ा-चढ़ाकर मूवमेंट बनाते हैं।

काम करने वाले नेगेटिव प्रॉम्प्ट

साफ़ आउटपुट के लिए इसे अपने बेसलाइन नेगेटिव प्रॉम्प्ट के रूप में इस्तेमाल करें:

blurry, low quality, artifacts, distorted faces, extra limbs,
flickering, watermark, text overlay, unrealistic motion, choppy frames

जिन चीज़ों पर आपकी जनरेशन विफल हो रही हो, उनके आधार पर खास शब्द जोड़ें। अगर चेहरे विकृत हो रहे हों, तो "deformed face, bad anatomy" जोड़ें। अगर वीडियो बहुत स्थिर है, तो "no motion, static, frozen" जोड़ें।

5 गलतियाँ जो Wan 2.6 के नतीजे बिगाड़ देती हैं

सफ़ेद बैकग्राउंड के सामने हवा में अटकी पानी की बूँदें, एक्सट्रीम मैक्रो क्रिस्टलीय डिटेल में

ये वे सबसे आम बातें हैं जो पहली बार Wan 2.6 इस्तेमाल करने वालों को उलझा देती हैं:

  1. ऐसे प्रॉम्प्ट जो मोशन नहीं, स्थिर इमेज का वर्णन करते हैं: "खेत में खड़ी एक महिला" लगभग शून्य मूवमेंट देता है। मोशन क्रिया-शब्द और कैमरा निर्देश जोड़ें।

  2. एक साथ बहुत सारे वेरिएबल बदलना: अगर आप प्रॉम्प्ट, गाइडेंस, रिज़ॉल्यूशन और सीड एक साथ बदल देते हैं, तो आप कभी यह अलग नहीं कर पाएँगे कि आपका आउटपुट किससे बेहतर हुआ।

  3. जटिल मल्टी-सब्जेक्ट दृश्यों पर ज़्यादा गाइडेंस स्केल इस्तेमाल करना: कई सब्जेक्ट के साथ ज़्यादा CFG अक्सर आर्टिफ़ैक्ट लाता है। भीड़ या कई लोगों वाले शॉट के लिए 4.5 से 5.5 तक घटाएँ।

  4. नेगेटिव प्रॉम्प्ट को पूरी तरह नज़रअंदाज़ करना: एक बेसिक नेगेटिव प्रॉम्प्ट भी आर्टिफ़ैक्ट की आवृत्ति को उल्लेखनीय रूप से कम करता है।

  5. पहले ड्राफ़्ट में अधिकतम रिज़ॉल्यूशन पर जनरेट करना: 1080p की प्रोसेसिंग में काफ़ी ज़्यादा समय लगता है। अपना प्रॉम्प्ट 720p पर टेस्ट करें, फिर मंज़ूर किए गए अंतिम संस्करण को पूरे रिज़ॉल्यूशन पर चलाएँ।

अपने वीडियो के साथ आगे क्या करें

गर्म ट्यूंगस्टन रोशनी में प्रोफ़ेशनल वीडियो शूट सेट पर क्लैपबोर्ड थामे दो हाथ

जनरेट की गई क्लिप एक शुरुआत है। इसे और आगे ले जाने का तरीका यह है:

  • अपस्केल करें: 720p आउटपुट को 4K-समान शार्पनेस तक ले जाने के लिए इसे AI वीडियो अपस्केलिंग मॉडल से चलाएँ।
  • ऑडियो जोड़ें: अपनी क्लिप के साथ AI म्यूज़िक जनरेशन मॉडल से बना संगीत जोड़ें, या टेक्स्ट-टू-स्पीच से नरेशन डालें।
  • एडिट करें और क्रम लगाएँ: लंबे सीक्वेंस बनाने के लिए एक वीडियो एडिटर में कई Wan 2.6 क्लिप जोड़ें।
  • लूप बनाएँ: 2 से 3 सेकंड की छोटी क्लिप को सोशल मीडिया कंटेंट के लिए सीमलेस लूप में बदला जा सकता है।
  • लिप सिंक जोड़ें: Wan 2.6 से एक चेहरा एनिमेट करें, फिर किसी भी वॉइस ट्रैक में यथार्थवादी मुँह की हरकत जोड़ने के लिए लिप सिंक मॉडल लगाएँ।

अभी बनाना शुरू करें

आधुनिक को-वर्किंग स्पेस में टैबलेट पर वीडियो प्लेबैक देखती खुश महिला

प्रोफ़ेशनल-क्वालिटी AI वीडियो बनाने की बाधा पहले कभी इतनी कम नहीं थी। PicassoIA के ज़रिए सीधे उपलब्ध Wan 2.6 के साथ आपको लोकल GPU हार्डवेयर या जटिल सेटअप की ज़रूरत नहीं है। एक प्रॉम्प्ट लिखें, कुछ पैरामीटर सेट करें, और मिनटों में एक सिनेमैटिक क्लिप पाएँ।

इस मॉडल की समझ बनाने का सबसे अच्छा तरीका है ज़्यादा से ज़्यादा अभ्यास। 10 जनरेशन चलाएँ। जो अच्छा रहा उसकी तुलना करें। अच्छे नतीजे देने वाले प्रॉम्प्ट का एक सरल लॉग रखें। आपकी सफलता दर जल्दी सुधरेगी।

PicassoIA पर Wan 2.6 T2V खोलें और अभी अपनी पहली जनरेशन चलाएँ। अगर आप एक स्थिर फ़ोटो से काम कर रहे हैं, तो सीधे Wan 2.6 I2V पर जाएँ। किसी भी तरह, आपके पास पाँच मिनट से कम में साझा करने लायक वीडियो क्लिप होगी।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख