Alibaba की Wan रिसर्च टीम ने अपने वीडियो जनरेशन सूट का वर्ज़न 2.7 जारी किया, तो AI वीडियो कम्युनिटी में हलचल मच गई। वजह कोई एक बड़ा आँकड़ा नहीं है, बल्कि यह रिलीज़ तीन चीज़ों का संगम है: टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, और एक बिल्कुल नया रेफ़रेंस-टू-वीडियो मोड, जो सब एक ओपन-वेट पैकेज में आते हैं। यह पैकेज उन मॉडलों को टक्कर देता है जो केवल पेड API के ज़रिए मिलते हैं। Wan 2.7 को लेकर जो शोर है, वह उसने कमाया है।
Wan 2.7 असल में क्या है
तीन मॉडल, एक नहीं
"2.7" कोई एक मॉडल नहीं है। यह एक ही वर्ज़न नाम के तहत एक साथ जारी की गई तीन अलग क्षमताएँ हैं:
- Wan 2.7 T2V: बिना किसी सोर्स इमेज के, सीधे टेक्स्ट प्रॉम्प्ट से 1080p वीडियो बनाता है।
- Wan 2.7 I2V: एक स्थिर इमेज लेकर उसे एक सुसंगत वीडियो क्लिप में एनिमेट करता है।
- Wan 2.7 R2V: रेफ़रेंस फ़ोटो से अलग किए गए किसी खास सब्जेक्ट को एनिमेट करता है, जिससे क्रिएटर को तय करने में सटीक नियंत्रण मिलता है कि क्या हिलेगा और कैसे।
हर मोड एक अलग वर्कफ़्लो के लिए बना है। T2V शुद्ध प्रॉम्प्ट-आधारित क्रिएशन के लिए है। I2V मौजूदा विज़ुअल्स को एनिमेट करने के लिए है। R2V सचमुच नई चीज़ है, और यही वह हिस्सा है जिस पर फ़िल्ममेकर और प्रोडक्ट टीमें सबसे ज़्यादा ध्यान दे रही हैं।
1080p बेसलाइन मायने रखती है
Wan 2.7 से पहले, किसी ओपन-वेट वीडियो मॉडल से 1080p आउटपुट पाने के लिए कच्चे जनरेशन के ऊपर काफ़ी पोस्ट-प्रोसेसिंग या अपस्केलिंग पाइपलाइन लगानी पड़ती थी। Wan 2.7 T2V सीधे 1080p पर आउटपुट देता है। यह मायने रखता है, क्योंकि नेटिव रेज़ोल्यूशन फ़्रेम्स के बीच टेम्पोरल कंसिस्टेंसी बनाए रखता है, जो जनरेशन के बाद अपस्केलिंग से नहीं हो पाती। सिंथेसिस के बाद फ़्रेम स्केल होने पर मोशन ब्लर, किनारों का तीखापन और बारीक टेक्सचर की डिटेल बिगड़ जाती हैं। जब मॉडल पहले फ़्रेम से ही पूरे रेज़ोल्यूशन पर जनरेट करता है, तो ये डिटेल पूरी क्लिप में सुसंगत रहती हैं।

2.6 से 2.7 तक क्या बदला
मोशन क्वालिटी में असली सुधार आया
Wan 2.6 T2V और Wan 2.6 I2V पहले ही मज़बूत प्रदर्शन दे चुके थे, खासकर स्मूद कैमरा मोशन और स्टैटिक सीन के रिवील में। Wan 2.7 सब्जेक्ट मोशन में वह कमी दूर करता है, जो 2.6 की कमज़ोर कड़ी थी। Wan 2.7 की क्लिप्स में किरदार और ऑब्जेक्ट फ़्रेम-दर-फ़्रेम अपना अनुपात ज़्यादा सुसंगत रखते हैं, और तेज़ी से चलने वाले तत्वों में पिछले वर्ज़न की तुलना में टेम्पोरल फ़्लिकरिंग साफ़ तौर पर कम दिखती है।
Wan 2.5 T2V में जटिल सब्जेक्ट मोशन के दौरान किनारों के पिघलने जैसी समस्या से बचने के लिए सावधानीपूर्वक प्रॉम्प्ट इंजीनियरिंग चाहिए थी। वर्ज़न 2.7 इसे यूज़र की ओर से काफ़ी कम मैनुअल दखल के साथ संभालता है।
R2V एक अलग कैटेगरी है
ज़्यादातर वीडियो AI मॉडल आपको दो रास्ते देते हैं: टेक्स्ट में कुछ बताएँ, या किसी इमेज से शुरू करें। Wan 2.7 R2V एक तीसरा रास्ता जोड़ता है: रेफ़रेंस फ़ोटो से कोई खास सब्जेक्ट निकालें और उसे नए सीन में एनिमेट करें। आप किसी व्यक्ति या प्रोडक्ट की इमेज देते हैं, मॉडल उस सब्जेक्ट को अलग करता है, और पूरी क्लिप में उसकी विज़ुअल पहचान बनाए रखते हुए मोशन जनरेट करता है।
जनरेट किए गए फ़्रेम्स में पहचान, टेक्सचर और अनुपात बनाए रखने के लिए मॉडल को रेफ़रेंस सब्जेक्ट की विस्तृत आंतरिक समझ चाहिए। Wan 2.7 स्थिर सब्जेक्ट और सरल मोशन वाले सब्जेक्ट के लिए यह भरोसेमंद ढंग से करता है।
💡 R2V प्रोडक्ट टीमों के लिए खास तौर पर उपयोगी है। एक प्रोडक्ट की एक फ़ोटो से बिना किसी फिज़िकल स्टूडियो शूट या टर्नटेबल रिग के घूमता हुआ शोकेस वीडियो बन जाता है।

1080p पर गति और दक्षता
ज़्यादा रेज़ोल्यूशन का मतलब हमेशा अनुपात में धीमी जनरेशन नहीं होता। Wan 2.7 आर्किटेक्चर में डिफ़्यूज़न ट्रांसफ़ॉर्मर बैकबोन में सुधार शामिल हैं, जो 720p बेस जनरेशन पर सीधे अपस्केलिंग पास चलाने की तुलना में 1080p पर हर स्टेप की कम्प्यूटेशनल लागत घटाते हैं। इससे जनरेशन का समय उन इटरेटिव वर्कफ़्लो के लिए व्यावहारिक रहता है, जहाँ क्रिएटर अंतिम क्लिप तय करने से पहले दर्जनों वैरिएशन चलाते हैं।
Wan 2.7 प्रतिस्पर्धियों के मुकाबले कैसा है
AI वीडियो बाज़ार में विकल्पों की इतनी भरमार पहले कभी नहीं थी। यहाँ एक ईमानदार आकलन है कि Wan 2.7 कहाँ जीतता है और कहाँ अभी उसे और सुधार करना है।
Wan 2.7 बनाम Veo 3
Google के Veo 3 और Veo 3.1 नेटिव सिंक्रोनाइज़्ड ऑडियो के साथ वीडियो देते हैं, जो Wan 2.7 नहीं देता। Veo 3 की सिनेमैटिक क्वालिटी सचमुच असाधारण है, खासकर जटिल प्राकृतिक रोशनी वाले बाहरी दृश्यों में। लेकिन Veo 3 एक क्लोज़्ड API है, जिसकी हर जनरेशन की लागत बड़ी मात्रा में तेज़ी से जुड़ती जाती है। Wan 2.7 ओपन वेट्स है, जिसे आप अपने सिस्टम पर चला सकते हैं या PicassoIA जैसे प्लेटफ़ॉर्म के ज़रिए प्रति क्लिप काफ़ी कम लागत पर इस्तेमाल कर सकते हैं। जो क्रिएटर हर प्रोजेक्ट में सैकड़ों इटरेशन चलाते हैं, उनके लिए यह लागत का अंतर अक्सर फ़ैसला कर देता है।
Wan 2.7 बनाम Sora 2
Sora 2 लंबी वीडियो अवधि और जटिल मल्टी-सीन नैरेटिव में उत्कृष्ट है। Wan 2.7 की ताकत छोटी, सटीक क्लिप्स और सब्जेक्ट पर खास नियंत्रण में है। अगर आपको कई सीन ट्रांज़िशन और सिंक्रोनाइज़्ड स्पीच वाला 30 सेकंड का वीडियो चाहिए, तो Sora 2 बेहतर टूल है। अगर आपको किसी खास प्रोडक्ट या किरदार की 5 से 10 सेकंड की क्लिप चाहिए, जिसका मोशन नियंत्रित हो, तो Wan 2.7 ज़्यादा व्यावहारिक है और काफ़ी सस्ता भी।
Wan 2.7 बनाम Kling v2.6
Kwai की Kling v2.6 उसी मोशन-क्वालिटी श्रेणी में शायद सबसे मज़बूत व्यावसायिक प्रतिस्पर्धी है। जटिल चेहरे के भावों वाले मानव सब्जेक्ट के लिए Kling का कैरेक्टर कंसिस्टेंसी Wan 2.7 से थोड़ा आगे है। जहाँ Wan 2.7 बढ़त बनाता है, वह है ओपन-सोर्स लचीलापन और R2V मोड, जो Kling समान रूप में नहीं देता। Kling v3 अपने मोशन कंट्रोल फ़ीचर के साथ असाधारण है, लेकिन यह अब भी केवल पेड प्रोडक्ट है।

Alibaba की AI टाइमलाइन में Wan 2.7
I2VGen से Wan तक
Alibaba वीडियो जनरेशन के क्षेत्र में ज़्यादातर लोगों की समझ से कहीं ज़्यादा समय से है। ali-vilab रिसर्च टीम के ज़रिए जारी I2VGen-XL इमेज-टू-वीडियो जनरेशन की उन शुरुआती गंभीर ओपन-सोर्स कोशिशों में से एक था, जिसमें स्ट्रक्चरल सुसंगति थी। Wan सीरीज़ वहीं से आगे बढ़ी जहाँ I2VGen ने छोड़ा था। इसने डिफ़्यूज़न ट्रांसफ़ॉर्मर आर्किटेक्चर अपनाया, जो आनुपातिक कम्प्यूट बढ़ोतरी के बिना रेज़ोल्यूशन बढ़ाता है।
Wan 2.1 1.3B ने मूल फ़्रेमवर्क पेश किया। Wan 2.2 I2V Fast ने स्पीड-ऑप्टिमाइज़्ड वर्ज़न जोड़े और Wan 2.2 S2V ने साउंड-ड्रिवन मोड जोड़ा। Wan 2.5 T2V ने टेम्पोरल कंसिस्टेंसी में साफ़ सुधार किया। Wan 2.6 T2V ने रेज़ोल्यूशन की सीमा बढ़ाई। वर्ज़न 2.7 अब R2V को बाकी सुधारों के साथ एक प्रमुख, प्रोडक्शन-रेडी क्षमता बनाता है।

Happyhorse बनाम Wan: अलग लक्ष्य
Alibaba Happyhorse 1.1 लाइन भी चलाता है, जो टेक्स्ट या इमेज इनपुट से 1080p तक वीडियो बनाती है। Happyhorse सिनेमैटिक मोशन की स्मूदनेस और लंबी क्लिप्स में स्टाइलिस्टिक कंसिस्टेंसी को प्राथमिकता देता है, जबकि Wan सब्जेक्ट की फ़िडेलिटी और सटीक कंट्रोल को प्राथमिकता देता है। वे Alibaba के इकोसिस्टम के भीतर एक-दूसरे से प्रतिस्पर्धा नहीं करते। Happyhorse स्मूद सिनेमैटिक नतीजों के लिए स्टूडियो-ग्रेड आउटपुट टूल है। Wan सब्जेक्ट-विशेष एनिमेशन के लिए प्रिसिशन कंट्रोल टूल है। Happyhorse 1.0 कम रेज़ोल्यूशन लक्ष्यों पर तेज़ जनरेशन के लिए अब भी उपलब्ध है।
PicassoIA पर Wan 2.7 कैसे इस्तेमाल करें
PicassoIA तीनों Wan 2.7 मॉडल सीधे होस्ट करता है। कोई लोकल GPU नहीं, कोई API key मैनेजमेंट नहीं, कोई सेटअप नहीं। व्यवहार में हर मोड कैसे काम करता है, यह यहाँ है।
Wan 2.7 T2V: टेक्स्ट से 1080p तक
- PicassoIA पर Wan 2.7 T2V खोलें।
- सीन, सब्जेक्ट, रोशनी और कैमरा मूवमेंट का विस्तृत प्रॉम्प्ट लिखें।
- अपनी इच्छित क्लिप की लंबाई चुनें। पाँच से दस सेकंड सबसे अच्छी टेम्पोरल कंसिस्टेंसी देते हैं।
- सबमिट करें और 1080p आउटपुट पाएँ।
💡 अपने प्रॉम्प्ट में कैमरा दिशा शामिल करें। "मीडियम शॉट से क्लोज़-अप तक धीमा डॉली इन" ऐसे प्रॉम्प्ट से कहीं बेहतर मोशन देता है, जो केवल स्टैटिक सीन का वर्णन करता है।
Wan 2.7 I2V: किसी भी फ़ोटो को एनिमेट करें
- PicassoIA पर Wan 2.7 I2V खोलें।
- अपनी सोर्स इमेज अपलोड करें।
- मोशन बताएँ: क्या हिलेगा, किस दिशा में, किस स्पीड से।
- मॉडल ऐसी क्लिप बनाता है जो आपकी इमेज से शुरू होती है और वहीं से सुसंगत मोशन बनाती है।
I2V के लिए सबसे अच्छे इनपुट: साफ़ बैकग्राउंड के सामने स्पष्ट सब्जेक्ट वाली हाई-कंट्रास्ट फ़ोटो। जिन इमेज के किनारे अस्पष्ट हों, उन्हें सब्जेक्ट की सीमाओं के पास टेम्पोरल आर्टिफ़ैक्ट से बचने के लिए ज़्यादा विस्तृत मोशन प्रॉम्प्ट चाहिए।

Wan 2.7 R2V: सब्जेक्ट-विशेष एनिमेशन
- PicassoIA पर Wan 2.7 R2V खोलें।
- जिस सब्जेक्ट को एनिमेट करना है, उसकी रेफ़रेंस इमेज अपलोड करें।
- वांछित मोशन और सीन का संदर्भ विस्तार से बताएँ।
- मॉडल सब्जेक्ट को अलग करता है, उसकी दिखावट बनाए रखता है और उसके आसपास मोशन सिंथेसाइज़ करता है।
R2V में क्या अच्छा काम करता है: प्रोडक्ट, अकेले किरदार, वाहन और अलग पहचान वाली सिल्हूट वाले जानवर। किसमें सावधानी से प्रॉम्प्ट लिखना ज़रूरी है: एक-दूसरे पर चढ़े हुए कई सब्जेक्ट, या बहुत टेक्सचर वाले बैकग्राउंड जो मॉडल के ध्यान में मुख्य सब्जेक्ट से होड़ करते हैं।
असल दुनिया के वे इस्तेमाल जो सचमुच काम करते हैं
स्थिर फ़ोटो से सोशल मीडिया क्लिप्स
Wan 2.7 I2V का सबसे तुरंत इस्तेमाल किसी ब्रांड की मौजूदा फ़ोटो लाइब्रेरी को छोटे वीडियो कंटेंट में बदलना है। खाने की फ़ोटो एक धीमे सिनेमैटिक रिवील में बदल जाती है। फ़ैशन शॉट में कपड़े की हल्की हरकत का एनिमेशन जुड़ जाता है। ट्रैवल फ़ोटो को हल्का पैरालैक्स ड्रिफ़्ट मिलता है, जो किसी भी सोशल फ़ीड पर नेटिव वीडियो जैसा दिखता है। जब स्टिल्स पहले से हाथ में हों, तो शॉर्ट-फ़ॉर्म वीडियो कंटेंट की बाधा काफ़ी घट जाती है।

फ़िल्म और कमर्शियल प्रोटोटाइपिंग
डायरेक्टर प्री-विज़ुअलाइज़ेशन के लिए Wan 2.7 T2V का इस्तेमाल करते हैं। जिस जटिल कैमरा मूव को लोकेशन पर सेट करने में आधा दिन लगे, उसे एक मिनट से कम में 5 सेकंड की क्लिप के रूप में टेस्ट किया जा सकता है। अगर फ़्रेमिंग काम करती है, तो फ़िज़िकल शूट ज़्यादा कुशल होगा। अगर नहीं करती, तो एक मिनट के कंप्यूट समय के सिवा कुछ बर्बाद नहीं हुआ। रफ़ ऑडियो-सिंक प्रीविज़ुअलाइज़ेशन के लिए Wan 2.2 S2V मॉडल साउंड-ड्रिवन एनिमेशन भी संभालता है।

स्टूडियो के बिना प्रोडक्ट विज़ुअलाइज़ेशन
Wan 2.7 R2V का ई-कॉमर्स टीमें पहले से सक्रिय उपयोग कर रही हैं, जो एक स्टूडियो फ़ोटो से घूमते हुए प्रोडक्ट व्यू बनाती हैं। एक घड़ी, एक स्नीकर, एक स्किनकेयर बोतल: रेफ़रेंस अपलोड करें, रोटेशन बताएँ, और मॉडल एक मोशन क्लिप बना देता है, जिसके लिए वरना एक समर्पित टर्नटेबल रिग और एक वीडियोग्राफ़र चाहिए होता। बड़े पैमाने पर लागत और समय की बचत मामूली नहीं है।

ओपन सोर्स वाला पहलू केंद्र में क्यों है
लागत और नियंत्रण का तर्क
क्लोज़्ड-सोर्स वीडियो API जनरेट किए गए कंटेंट के हर सेकंड पर बिल करते हैं। किसी भी सार्थक प्रोडक्शन मात्रा पर यह लागत तेज़ी से बढ़ती है। Wan 2.7 जैसा ओपन-वेट मॉडल किसी GPU क्लाउड इंस्टेंस पर एक निश्चित मासिक लागत में चल सकता है, या PicassoIA जैसे प्लेटफ़ॉर्म के ज़रिए, जो इंफ़्रास्ट्रक्चर का खर्च कई यूज़र्स में बाँट देते हैं। जो स्टूडियो हर हफ़्ते सैकड़ों क्लिप्स बनाते हैं, उनके लिए गणित सीधा है: ओपन-वेट एक्सेस अक्सर क्लोज़्ड-API विकल्पों की तुलना में प्रति क्लिप लगभग दस गुना सस्ता होता है।
लागत से आगे, ओपन वेट्स का मतलब है कि व्यापक समुदाय मॉडल को फ़ाइन-ट्यून, विस्तार और खास इस्तेमाल के लिए अनुकूलित कर सकता है। क्लोज़्ड मॉडल तभी सुधरते हैं जब उनके डेवलपर अपडेट साइकल में निवेश करना चुनें। ओपन मॉडल लगातार सुधरते हैं, क्योंकि रिसर्च ग्रुप, स्वतंत्र डेवलपर और व्यावसायिक टीमें सभी साझा आधार में योगदान देते हैं।

ब्रांड कंसिस्टेंसी के लिए फ़ाइन-ट्यूनिंग
चूँकि Wan 2.7 के वेट्स सार्वजनिक हैं, किसी भी ऐसी टीम के लिए जिसके पास मामूली GPU संसाधन हों, खास विज़ुअल स्टाइल पर फ़ाइन-ट्यूनिंग संभव है। कोई प्रोडक्शन कंपनी अपने हाउस स्टाइल पर LoRA अडैप्टर ट्रेन कर सकती है और अपनी पाइपलाइन की हर AI-जनरेटेड एसेट में विज़ुअली सुसंगत क्लिप्स पा सकती है। इतना ब्रांड कंट्रोल आज उपलब्ध किसी भी क्लोज़्ड-सोर्स वीडियो मॉडल में संभव नहीं है, चाहे बजट कितना भी हो।
💡 ओपन वेट्स ऑन-प्रिमाइसेस इनफ़रेंस भी सक्षम करते हैं। सख्त IP गोपनीयता ज़रूरतों वाले स्टूडियो Wan 2.7 को अपने सिस्टम पर चला सकते हैं, जिसमें कोई भी कंटेंट उनके नेटवर्क से बाहर नहीं जाता। लीगल, मेडिकल और फ़ाइनेंशियल कंटेंट कैटेगरी में यह एक कठोर ज़रूरत है, जहाँ क्लाउड API का इस्तेमाल प्रतिबंधित है।
Wan सीरीज़ एक नज़र में
सीरीज़ की प्रगति को समझने के लिए, PicassoIA पर उपलब्ध मुख्य Wan वर्ज़न यहाँ हैं:
Wan 2.7 अभी आज़माएँ
Wan 2.7 की चर्चा इसलिए हो रही है क्योंकि एक समर्पित रेफ़रेंस-टू-वीडियो मोड के साथ ओपन-वेट 1080p वीडियो जनरेशन आज एक असली, व्यावहारिक क्षमता है। कोई रिसर्च प्रीव्यू नहीं। कोई वेटलिस्ट नहीं। मॉडल लाइव हैं, नतीजे दोहराए जा सकते हैं, और आप बिना अपना ब्राउज़र छोड़े क्लिप्स बनाना शुरू कर सकते हैं।
PicassoIA आपको तीनों मोड का सीधा एक्सेस देता है:
- Wan 2.7 T2V: प्रॉम्प्ट लिखें, 1080p क्लिप पाएँ।
- Wan 2.7 I2V: फ़ोटो अपलोड करें, मोशन बताएँ, उसे जीवित होते देखें।
- Wan 2.7 R2V: एक रेफ़रेंस इमेज से किसी खास सब्जेक्ट को उसकी दिखावट और पहचान बनाए रखते हुए एनिमेट करें।
अगर आप वीडियो जनरेशन से आगे जाना चाहते हैं, तो PicassoIA टेक्स्ट-टू-इमेज मॉडल, सुपर-रेज़ोल्यूशन अपस्केलिंग, AI वीडियो एन्हांसमेंट, लिप सिंक और ऑडियो जनरेशन टूल्स का पूरा सूट भी होस्ट करता है। सब कुछ picassoia.com/en/all-models पर एक ही प्लेटफ़ॉर्म से उपलब्ध है। असली सवाल बस यह है कि आप कौन सा प्रोजेक्ट सबसे पहले जीवन में लाना चाहते हैं।