स्मूद मोशन और डिटेल के लिए Wan 2.6: इस वर्ज़न में क्या बदलता है

Wan 2.6 AI वीडियो जनरेशन में मोशन स्मूदनेस और विज़ुअल डिटेल को काफ़ी बेहतर बनाता है। यह लेख बताता है कि ये सुधार तकनीकी रूप से क्यों संभव हुए, T2V और I2V वर्ज़न में असली फ़र्क क्या है, और PicassoIA पर दोनों को चरण-दर-चरण कैसे इस्तेमाल करें। साथ में ऐसे पैरामीटर टिप्स भी हैं जो आपके नतीजे सच में बदल देते हैं।

स्मूद मोशन और डिटेल के लिए Wan 2.6: इस वर्ज़न में क्या बदलता है
Cristian Da Conceicao
Picasso IA के संस्थापक

वीडियो में "AI से बना" और "असली दिखता है" के बीच का फ़ासला पहले कभी इतना कम नहीं था, और Wan 2.6 इसकी सबसे साफ़ मिसालों में से एक है। wan-video की चल रही मॉडल सीरीज़ के हिस्से के रूप में जारी हुआ यह वर्ज़न 2.6 खास तौर पर AI वीडियो आउटपुट की दो सबसे बड़ी कमज़ोरियों को निशाना बनाता है: टेम्पोरल कोहेरेंस (फ़्रेम-दर-फ़्रेम चीज़ें कितनी स्मूद तरीके से हिलती हैं) और स्थानिक डिटेल को बनाए रखना (क्लिप भर में टेक्सचर, किनारे और बारीक संरचना कितनी अच्छी तरह टिकती है)। अगर आपने किसी पिछले Wan रिलीज़ या प्रतिस्पर्धी मॉडल के साथ काम किया है और देखा है कि बाल, कपड़ा या पानी क्लिप के बीच में जाकर धुंधला-सा गड़बड़ हो जाता है, तो Wan 2.6 उसी समस्या का सीधा जवाब है।

Wan 2.6 असल में क्या है

Wan 2.6, wan-video की जनरेशन सीढ़ी के बीच में है, यह 2.5 से ऊपर और नए 2.7 सीरीज़ से नीचे आता है। यह 14 बिलियन पैरामीटर पर ट्रेन किया गया डिफ्यूज़न ट्रांसफ़ॉर्मर आर्किटेक्चर इस्तेमाल करता है, जिससे इसकी क्षमता उसी फ़ैमिली के हल्के 1.3B वर्ज़न से काफ़ी ज़्यादा हो जाती है। पैरामीटर की यह अतिरिक्त संख्या किसी अमूर्त बेंचमार्क में नहीं, बल्कि एक बहुत ठोस तरीके से दिखती है: मॉडल की वह क्षमता कि वह फ़्रेम-दर-फ़्रेम ऑब्जेक्ट की पहचान और सतह की दिखावट को बिना बहुत ज़्यादा डीनॉइज़िंग स्टेप्स की ज़रूरत के एक जैसा रख पाता है।

इसके पीछे का आर्किटेक्चर

यह मॉडल वीडियो को लेटेंट फ़्रेम्स की एक सीक्वेंस के रूप में प्रोसेस करता है, और स्लाइडिंग विंडो अटेंशन की जगह फ़ुल-अटेंशन मैकेनिज़्म इस्तेमाल करता है। यही एक वजह है कि यह लंबे मोशन आर्क को विंडो-सीमित मॉडल से बेहतर संभालता है। फ़ुल टेम्पोरल अटेंशन का मतलब है कि जनरेशन सीक्वेंस का हर फ़्रेम बाकी हर फ़्रेम को सीधे प्रभावित कर सकता है, और इस तरह "ड्रिफ़्ट" की समस्या रुकती है, जिसमें चलती वस्तु क्लिप आगे बढ़ने के साथ धीरे-धीरे अपना आकार या रंग बदल लेती है।

शरद ऋतु के पाइन जंगल से बहती नदी का हवाई दृश्य, जिसमें सहज प्राकृतिक गति दिख रही है

पैरामीटर की संख्या क्यों मायने रखती है

14B मॉडल की जानकारी को संजोने की क्षमता 1.3B मॉडल से लगभग दस गुना होती है। व्यवहार में इसका मतलब है कि नेटवर्क ट्रेनिंग डेटा से ज़्यादा सटीक मोशन प्रायर्स स्टोर और इस्तेमाल कर सकता है। जब आप "a woman walking through a field" का प्रॉम्प्ट देते हैं, तो छोटे मॉडल को व्यापक रूप से सामान्यीकरण करना पड़ता है। बड़े मॉडल ने इतनी विविधता देखी है कि उसे पता है कि अलग-अलग चाल की रफ़्तार पर असली कपड़े की हरकत कैसी दिखती है, हवा में घास पैरों के नीचे कैसे व्यवहार करती है, और पूरी क्लिप की लंबाई में रोशनी की दिशा एक जैसी कैसे रखी जाए।

💡 14B मॉडल फ़ास्ट वर्ज़न से धीमा है, लेकिन इसकी टेक्सचर और किनारों की स्थिरता साफ़ तौर पर बेहतर होती है। फ़ाइनल क्वालिटी रेंडर के लिए इसे हमेशा स्पीड-ऑप्टिमाइज़्ड वर्ज़न के बजाय चुनें।

AI वीडियो में मोशन की समस्या

AI वीडियो जनरेशन में सालों से एक लगातार समस्या रही है: फ़्रेम अलग-अलग देखने में बढ़िया लगते हैं, लेकिन उनके बीच के ट्रांज़िशन से विज़ुअल आर्टिफ़ैक्ट, टिमटिमाते टेक्सचर या अंगों की विकृति पैदा होती है। यही टेम्पोरल कोहेरेंस की समस्या है, और यही असल में अच्छे वीडियो मॉडल को औसत मॉडलों से अलग करती है।

टेम्पोरल कोहेरेंस की व्याख्या

टेम्पोरल कोहेरेंस का मतलब है कि किसी वस्तु की विज़ुअल पहचान समय के साथ एक जैसी बनी रहती है। लाल जैकेट लाल ही रहती है। बाल उतने ही लंबे रहते हैं। बाईं ओर हिलता हाथ बिना किसी बेतरतीब झटके के बाईं ओर हिलता रहता है। डिफ्यूज़न मॉडल फ़्रेम्स को डीनॉइज़ करके वीडियो बनाते हैं, और मज़बूत टेम्पोरल कनेक्शन के बिना हर फ़्रेम लगभग उस रैंडम नॉइज़ का थोड़ा बदला हुआ रूप होता है, जिसे प्रॉम्प्ट बाँधे रखता है। फ़्रेम्स के बीच के कनेक्शन कमज़ोर हों तो छोटी-छोटी असंगतियाँ जुड़कर दिखने वाले आर्टिफ़ैक्ट बन जाती हैं।

गिरती हुई पानी की बूँदों की क्लोज़-अप मैक्रो फ़ोटो, जो क्रिस्टल जैसी सटीकता के साथ गति को थाम रही है

मोशन "AI" जैसा कब लगता है

दर्शकों को सबसे आसानी से पहचान में आने वाली तीन खास विफलता स्थितियाँ ये हैं:

  1. टेक्सचर स्विमिंग: लकड़ी की बनावट, कपड़े की बुनाई या त्वचा के टेक्सचर जैसे सतह के पैटर्न खिसकते और बहते हुए दिखते हैं, भले ही वस्तु खुद स्थिर हो
  2. लिंब मॉर्फ़िंग: हरकत के दौरान उँगलियाँ, बाँहें या पैर आकार बदलने लगते हैं, क्योंकि मॉडल शारीरिक संरचना की एकरूपता खो देता है
  3. बैकग्राउंड फ़्लिकर: फ़्रेम-स्तर के नॉइज़ में बदलाव की वजह से स्थिर बैकग्राउंड तत्व फ़्रेम्स के बीच धड़कते या टिमटिमाते हैं

Wan 2.6 इन तीनों से अपने अटेंशन आर्किटेक्चर और एक ट्रेनिंग व्यवस्था के ज़रिए निपटता है, जो खास तौर पर मोशन कोहेरेंस के नुकसान पर केंद्रित है, और ट्रेनिंग के दौरान मॉडल को ठीक इन्हीं तरह के आर्टिफ़ैक्ट के लिए दंडित करती है।

Wan 2.6 डिटेल को कैसे संभालता है

वीडियो में स्थानिक डिटेल इमेज से ज़्यादा मुश्किल है, क्योंकि मॉडल को वह डिटेल समय भर बनाए रखनी होती है। एक तीखा फ़्रेम बनाना एक चुनौती है। लेकिन 40 फ़्रेम बाद, जब कैमरा हिल चुका हो या सब्जेक्ट बदल चुका हो, उतनी ही तीखाई बनाए रखना मूल रूप से कहीं कठिन समस्या है।

बारीक टेक्सचर रेंडरिंग

Wan 2.6 एक VAE (variational autoencoder) इस्तेमाल करता है, जिसका स्थानिक कंप्रेशन रेशियो पिछले वर्ज़न से ज़्यादा है, और इससे लेटेंट एन्कोडिंग स्टेप में टेक्सचर की ज़्यादा जानकारी बची रहती है। आउटपुट के लिहाज़ से इसका मतलब है: कपड़े की बुनाई, चेहरे के रोमछिद्र, बालों की अलग-अलग लटें और खुरदुरी सतह वाली सामग्री, ये सब 2.5 या उससे पहले के मॉडल की तुलना में बेहतर तरीके से अपनी संरचना बनाए रखते हैं।

बादल छाए आसमान के सामने छलाँग लगाती बैले डांसर, ट्यूटू का कपड़ा बिल्कुल बारीक डिटेल में फैला हुआ

480p बनाम 720p का फ़र्क

Wan 2.6 अपने स्टैंडर्ड कॉन्फ़िगरेशन के लिए नेटिव 720p रिज़ॉल्यूशन पर जनरेट करता है, जो पुराने वर्ज़न के 480p से एक कदम आगे है। लेकिन अकेला रिज़ॉल्यूशन नंबर पूरी कहानी नहीं बताता। खराब टेक्सचर डिटेल वाला 720p वीडियो, एक शार्प 480p क्लिप से भी बुरा दिखता है। Wan 2.6 जो देता है, वह 720p पर हाई स्पेशियल फ़्रीक्वेंसी कंटेंट है, यानी यह छोटी और घनी डिटेल्स रेंडर करता है, न कि चिकने लो-फ़्रीक्वेंसी कलर ब्लॉब। बाल, फ़र, टेक्सटाइल और पत्तियों की बारीक डिटेल में यह असली आउटपुट में सबसे साफ़ दिखता है।

💡 क्लोज़-अप शॉट्स के लिए, जहाँ टेक्सचर डिटेल सबसे अहम है, जैसे प्रोडक्ट डेमो, पोर्ट्रेट एनिमेशन या कपड़े की हरकत, Wan 2.6 उन कई ज़्यादा रिज़ॉल्यूशन वाले मॉडलों से बेहतर विकल्प है जो स्पीड के लिए डिटेल कुर्बान कर देते हैं।

T2V बनाम I2V: कौन-सा इस्तेमाल करें

Wan 2.6 दो मुख्य वर्ज़न में आता है, जो अलग-अलग क्रिएटिव वर्कफ़्लो के लिए बने हैं। सही वर्ज़न चुनने से यह बदल जाता है कि आपको कौन-सा इनपुट तैयार करना होगा और किस तरह के आउटपुट की उम्मीद करनी चाहिए।

Wan 2.6 T2V के साथ टेक्स्ट-टू-वीडियो

Wan 2.6 T2V एक टेक्स्ट प्रॉम्प्ट लेता है और शुरू से एक वीडियो क्लिप जनरेट करता है। जब आप किसी सोर्स इमेज की बजाय किसी विचार से कंटेंट बना रहे हों, तब यह सही विकल्प है। यह इन चीज़ों के साथ सबसे अच्छा काम करता है:

  • एक्शन-आधारित प्रॉम्प्ट: गति के वर्णन स्थिर दृश्य के वर्णनों से बेहतर नतीजे देते हैं
  • माहौल वाले प्रॉम्प्ट: मौसम, रोशनी की स्थितियाँ और परिवेश की गति (हवा, बारिश, भीड़) वे क्षेत्र हैं जहाँ Wan 2.6 T2V उत्कृष्ट है
  • छोटी क्लिप लूप: 4 से 8 सेकंड की क्लिप, जिनमें मोशन की दिशा साफ़ हो

लैपटॉप पर काम करती एक युवा महिला, नरम दो-रंगी परिवेश रोशनी में

यह मॉडल प्रॉम्प्ट में दिए कैमरा मूवमेंट के निर्देशों पर अच्छी तरह प्रतिक्रिया देता है। "slow dolly forward", "tracking shot" या "static camera" जैसे वाक्यांश आउटपुट के व्यवहार पर साफ़ असर डालते हैं।

Wan 2.6 I2V के साथ इमेज-टू-वीडियो

Wan 2.6 I2V एक स्थिर इमेज लेता है और उसे एनिमेट करता है। यह ज़्यादा नियंत्रित विकल्प है, क्योंकि आप शुरुआती विज़ुअल स्थिति को सटीक तरीके से तय कर रहे होते हैं। इसके बाद मॉडल ऐसी मोशन जनरेट करता है जो आपकी इमेज के कंटेंट और मोशन बताने वाले टेक्स्ट प्रॉम्प्ट, दोनों से मेल खाती है।

पोर्ट्रेट, प्रोडक्ट फ़ोटोग्राफ़ी, आर्किटेक्चरल स्टिल्स या इलस्ट्रेशन को वीडियो में एनिमेट करने के लिए I2V बेहतर वर्कफ़्लो है। मॉडल इन कामों में खास तौर पर मज़बूत है:

  • प्राकृतिक परिवेश का एनिमेशन (पेड़, पानी, आसमान, कपड़ा)
  • बिना विकृति के चेहरे और शरीर की सूक्ष्म हरकत
  • लैंडस्केप और आर्किटेक्चरल फ़ोटोग्राफ़ी पर पैरलैक्स कैमरा मूव

Wan 2.6 I2V Flash उसी मॉडल का तेज़ वर्ज़न है, जो जनरेशन का समय काफ़ी घटाने के बदले कुछ डिटेल की निष्ठा कम कर देता है। इसे इटरेशन और ड्राफ़्ट के लिए इस्तेमाल करें, और फ़ाइनल आउटपुट के लिए फ़ुल I2V पर स्विच करें।

PicassoIA पर Wan 2.6 कैसे इस्तेमाल करें

दोनों Wan 2.6 वर्ज़न सीधे PicassoIA के प्लेटफ़ॉर्म पर उपलब्ध हैं। हर एक के लिए चरण-दर-चरण तरीका यहाँ है।

मैकेनिकल कीबोर्ड पर तेज़ी से टाइप करते एक आदमी के हाथ, उँगलियों की हरकत बारीक डिटेल में कैद

चरण-दर-चरण: टेक्स्ट-टू-वीडियो

  1. PicassoIA पर Wan 2.6 T2V खोलें
  2. टेक्स्ट फ़ील्ड में अपना प्रॉम्प्ट लिखें। मुख्य सब्जेक्ट और मूवमेंट से शुरुआत करें, फिर परिवेश और रोशनी जोड़ें
  3. सबसे अच्छी डिटेल बनाए रखने के लिए रिज़ॉल्यूशन 720p पर सेट करें
  4. सबसे सुसंगत नतीजों के लिए अवधि 4 से 6 सेकंड के बीच सेट करें
  5. गाइडेंस स्केल 6 और 8 के बीच सेट करें (ज़्यादा मान प्रॉम्प्ट को ज़्यादा शब्दशः मानते हैं; कम मान ज़्यादा क्रिएटिव विविधता देते हैं)
  6. Generate पर क्लिक करें और क्लिप के रेंडर होने का इंतज़ार करें

💡 प्रॉम्प्ट में मोशन की स्पीड के वर्णन ("slowly", "rapidly", "gently drifting") जोड़ने का आउटपुट की गति पर मापने योग्य असर होता है। Wan 2.6 T2V इन मॉडिफ़ायर को कई प्रतिस्पर्धी मॉडलों से ज़्यादा भरोसेमंद तरीके से पढ़ता है।

चरण-दर-चरण: इमेज-टू-वीडियो

  1. PicassoIA पर Wan 2.6 I2V खोलें
  2. अपनी सोर्स इमेज अपलोड करें। सबसे अच्छे नतीजों के लिए 1280x720 या उससे ज़्यादा रिज़ॉल्यूशन की 16:9 इमेज इस्तेमाल करें
  3. एक मोशन प्रॉम्प्ट लिखें, जिसमें बताएँ कि क्या हिलना चाहिए और कैसे। इमेज के कंटेंट का वर्णन न करें, सिर्फ़ मोशन का करें ("the hair flows gently in a warm breeze, leaves in the background rustle slowly")
  4. मोशन स्ट्रेंथ 50 और 70 के बीच सेट करें, ताकि ज़्यादा विकृति के बिना प्राकृतिक दिखने वाली हरकत मिले
  5. Generate करें

काम की पैरामीटर टिप्स

पैरामीटरअनुशंसित रेंजअसर
गाइडेंस स्केल6.5 से 7.5प्रॉम्प्ट का पालन बनाम विज़ुअल क्वालिटी
मोशन स्ट्रेंथ (I2V)45 से 75हरकत की मात्रा बनाम इमेज की निष्ठा
इनफ़रेंस स्टेप्स30 से 50क्वालिटी बनाम जनरेशन की गति
अवधि4 से 6 सेकंडसमय के साथ कोहेरेंस

रात में सिनेमाई रोशनी और गीले कंकड़-पत्थर वाला एक पेशेवर आउटडोर फ़िल्म सेट

I2V में कम मोशन स्ट्रेंथ सेटिंग पोर्ट्रेट और प्रोडक्ट एनिमेशन के लिए आदर्श है, जहाँ आपको नाटकीय हरकत की बजाय सूक्ष्म जीवंतता चाहिए। ज़्यादा सेटिंग परिवेश और एक्शन शॉट्स के लिए काम करती है, जहाँ बड़े पैमाने की हरकत ही मकसद होती है।

Wan 2.6 बनाम आस-पास के मॉडल

यह जानना कि Wan 2.6 आस-पास के मॉडलों के मुकाबले कहाँ बैठता है, हर प्रोजेक्ट के लिए सही टूल चुनने में मदद करता है।

Wan 2.5 और Wan 2.7 के मुकाबले

Wan 2.5 T2V एक सक्षम पिछला वर्ज़न है, लेकिन बारीक टेक्सचर रेंडरिंग में पुराने मॉडल की कमज़ोरियाँ दिखाता है। कपड़े, बाल या जटिल सतह वाली सामग्री की क्लिप्स पर 2.5 ज़्यादा टेक्सचर स्विमिंग पैदा करता है। Wan 2.6 इसे अपने बेहतर VAE और अटेंशन कपलिंग से सीधे संभालता है।

Wan 2.7 T2V और Wan 2.7 I2V अगला कदम हैं, जो रिज़ॉल्यूशन और मोशन डायनामिक्स में और सुधार जोड़ते हैं। Wan सीरीज़ में सबसे उच्च क्वालिटी के आउटपुट के लिए 2.7 अभी का सबसे ऊँचा स्तर है। लेकिन जब जनरेशन का समय मायने रखता है, तब Wan 2.6 एक मज़बूत विकल्प बना रहता है, क्योंकि तुलनीय सेटिंग्स पर यह 2.7 से लगातार तेज़ है।

हवा में मंडराता एक हमिंगबर्ड, जो उष्णकटिबंधीय फूल से रस पी रहा है, पंखों का ब्लर और पंखों की इंद्रधनुषी चमक साफ़ दिख रही है

दूसरे स्टूडियो के मुकाबले

उन मापदंडों पर केंद्रित तुलना, जिनमें Wan 2.6 अलग दिखता है:

मॉडलमोशन स्मूदनेसटेक्सचर डिटेलस्पीडरिज़ॉल्यूशन
Wan 2.6 T2Vबहुत उच्चउच्चमध्यम720p
Wan 2.6 I2Vबहुत उच्चबहुत उच्चमध्यम720p
Wan 2.5 T2Vमध्यममध्यमतेज़480p से 720p
Wan 2.7 T2Vउत्कृष्टबहुत उच्चधीमा1080p
Wan 2.6 I2V Flashउच्चमध्यमबहुत तेज़720p

Flash वर्ज़न स्पीड के लिए टेक्सचर डिटेल कुर्बान करता है, इसलिए यह फ़ाइनल आउटपुट की बजाय तेज़ इटरेशन के लिए सही टूल है।

कब Wan 2.6 सही चुनाव है

हर प्रोजेक्ट को Wan 2.6 की ज़रूरत नहीं होती। कब इसे चुनना है और कब किसी तेज़ या ज़्यादा रिज़ॉल्यूशन वाले विकल्प को, यह जानने से समय और क्रेडिट दोनों बचते हैं।

वे स्थितियाँ जहाँ यह सबसे अच्छा है

  • प्रोडक्ट एनिमेशन: प्रोडक्ट की फ़ोटो को सूक्ष्म मोशन, घूमती हाइलाइट्स या कपड़े की हरकत के साथ एनिमेट करना। I2V वर्ज़न इसे न्यूनतम विकृति के साथ संभालता है।
  • पोर्ट्रेट एनिमेशन: किसी स्थिर पोर्ट्रेट में प्राकृतिक साँस, आँखों की हरकत या बालों का हल्का-सा लहराना जोड़ना
  • प्रकृति और परिवेश की क्लिप्स: पानी, हवा, पत्तियाँ और वातावरण की गति, ये सभी वे क्षेत्र हैं जहाँ टेम्पोरल कोहेरेंस सबसे ज़्यादा मायने रखता है
  • शॉर्ट-फ़ॉर्म सोशल कंटेंट: 4 से 6 सेकंड के लूप, जिनमें स्मूद और परिष्कृत मोशन ही मुख्य क्वालिटी ज़रूरत है

रात के शहर की तुलना, जिसमें धुंधला AI आउटपुट और तीखा, हाई-डिटेल AI वीडियो आउटपुट साथ दिख रहे हैं

कब कुछ और चुनें

  • 10 सेकंड से लंबे क्लिप: लंबी अवधि पर टेम्पोरल कोहेरेंस कमज़ोर पड़ने लगती है। 8 सेकंड से आगे के क्लिप के लिए, Wan 2.7 I2V या लंबी रेंज में बेहतर कंसिस्टेंसी वाले दूसरे मॉडल, अतिरिक्त जनरेशन समय के लायक हैं।
  • 1080p एक सख्त ज़रूरत है: Wan 2.6 की सीमा 720p पर खत्म होती है। 1080p आउटपुट के लिए Wan 2.7 पर जाएँ।
  • बड़ी मात्रा में रैपिड प्रोटोटाइपिंग: अगर किसी स्टाइल पर फ़ैसला करने से पहले आपको 20 ड्राफ़्ट क्लिप चाहिए, तो Wan 2.6 I2V Flash या तेज़ वैरिएंट काफ़ी समय बचाएँगे।

💡 कॉन्सेप्ट इटरेशन के लिए Flash इस्तेमाल करें, और जब मोशन का तरीका और प्रॉम्प्ट के शब्द तय हो जाएँ, तब फ़ुल मॉडल पर स्विच करें। यह वर्कफ़्लो आम तौर पर उस तरीके से बेहतर फ़ाइनल नतीजे देता है, जिसमें इटरेशन के बिना सीधे फ़ुल मॉडल पर चला जाता है।

असली आउटपुट असल में क्या दिखाते हैं

अलग-अलग सब्जेक्ट प्रकारों में Wan 2.6 के आउटपुट देखने पर लगातार पैटर्न दिखते हैं। कपड़े और पोशाक का एनिमेशन वह क्षेत्र है जहाँ यह अपनी जनरेशन-स्पीड श्रेणी के ज़्यादातर विकल्पों से आगे निकल जाता है। "हवा में लहराती हल्की ड्रेस" जैसा सरल प्रॉम्प्ट वह क्लॉथ सिमुलेशन देता है, जिसके लिए कुछ ही साल पहले फ़िज़िक्स-आधारित रेंडरिंग चाहिए होती।

इंसानी मोशन धीमी से मध्यम रफ़्तार की हरकत के लिए भरोसेमंद है। चलना, सिर घुमाना और हाथों के इशारे अच्छी शारीरिक एकरूपता के साथ रेंडर होते हैं। तेज़ एथलेटिक हरकत वह एकमात्र क्षेत्र है जहाँ आर्टिफ़ैक्ट अब भी ज़्यादा बार दिखते हैं।

परिवेश का एनिमेशन इसकी लगातार मज़बूती है। पानी, बादल, आग और वनस्पति प्रॉम्प्ट पर ऐसे प्रतिक्रिया देते हैं जो भौतिक रूप से विश्वसनीय लगती है। लगता है मॉडल को प्रकृति के काफ़ी बड़े फ़ुटेज पर ट्रेन किया गया है, और इन सब्जेक्ट प्रकारों की आउटपुट क्वालिटी में यह साफ़ दिखता है।

दक्षिण-पूर्व एशिया का व्यस्त स्ट्रीट मार्केट, समृद्ध रंगों की डिटेल और परतदार भीड़ की गहराई के साथ

I2V रास्ते से आर्किटेक्चरल और प्रोडक्ट एनिमेशन न्यूनतम विकृति के साथ साफ़ नतीजे देता है। स्थिर फ़ोटोग्राफ़ी पर पैरलैक्स कैमरा मूव खास तौर पर मज़बूत हैं, जो सपाट सोर्स इमेज से गहराई का विश्वसनीय भ्रम पैदा करते हैं।

PicassoIA पर अपने वीडियो बनाना शुरू करें

Wan 2.6 आपके खास इस्तेमाल में असल में क्या करता है, यह देखने का सबसे अच्छा तरीका है अपने प्रॉम्प्ट आज़माना। PicassoIA आपको Wan 2.6 T2V और Wan 2.6 I2V के साथ पूरी Wan फ़ैमिली तक पहुँच देता है, जिसमें Wan 2.5 T2V Fast और Wan 2.7 T2V शामिल हैं, और एक ही इंटरफ़ेस में 100 से ज़्यादा दूसरे टेक्स्ट-टू-वीडियो मॉडल भी।

अगर आप पहली बार एनिमेशन शुरू कर रहे हैं, तो I2V वर्ज़न से शुरुआत करें। कोई पहले से मौजूद फ़ोटो अपलोड करें, एक सरल मोशन प्रॉम्प्ट लिखें (15 से 25 शब्द, जिनमें सिर्फ़ यह बताया गया हो कि क्या हिलता है और कैसे), और डिफ़ॉल्ट सेटिंग्स पर जनरेट करें। वह पहला आउटपुट आपको एक साफ़ बेसलाइन देगा कि आपके कंटेंट प्रकार के साथ मॉडल किन चीज़ों में अच्छा करता है।

वहाँ से, एक बार में एक ही वैरिएबल बदलना, चाहे प्रॉम्प्ट के शब्द हों, मोशन स्ट्रेंथ हो या गाइडेंस स्केल, आपको उस खास आउटपुट क्वालिटी तक सबसे तेज़ रास्ता देता है जिसकी आपको तलाश है। Wan 2.6 प्रयोग करने पर अच्छे नतीजे देता है, और तेज़ इटरेशन के लिए Flash वर्ज़न मौजूद होने से प्रयोग की लागत कम रहती है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख