لماذا يحظى Wan 2.7 من Alibaba بكل هذا الاهتمام (وما الذي يقدّمه فعلًا)

أطلق Wan 2.7 من Alibaba ثلاثة أوضاع متميزة لتوليد الفيديو، وجودة مخرجات بدقة 1080p، وأوزانًا مفتوحة يمكن لأي مطوّر تشغيلها محليًا. يشرح هذا المقال ما يميّز Wan 2.7 عن إصداراته السابقة، وكيف يقارن بأبرز نماذج الفيديو الحالية، وكيف يمكنك البدء باستخدام الأوضاع الثلاثة كلها الآن على PicassoIA.

لماذا يحظى Wan 2.7 من Alibaba بكل هذا الاهتمام (وما الذي يقدّمه فعلًا)
Cristian Da Conceicao
مؤسس Picasso IA

حدث تحوّل ما في مجتمع فيديو الذكاء الاصطناعي حين أصدر فريق الأبحاث في Alibaba، فريق Wan، الإصدار 2.7 من مجموعة توليد الفيديو الخاصة به. ليس بسبب رقم واحد لافت في العناوين، بل لأن الإصدار يمثل ثلاثية متكاملة: تحويل النص إلى فيديو، وتحويل الصورة إلى فيديو، ووضع جديد كليًا لتحويل المرجع إلى فيديو، وكل ذلك في حزمة مفتوحة الأوزان تنافس نماذج لا تتوفر إلا عبر واجهات API مدفوعة. الضجة حول Wan 2.7 مستحقة.

ما هو Wan 2.7 فعلًا

ثلاثة نماذج، وليس نموذجًا واحدًا

الرقم "2.7" ليس نموذجًا واحدًا. إنه ثلاث قدرات مختلفة تُطلق معًا تحت راية الإصدار نفسه:

  • Wan 2.7 T2V: يولّد فيديو بدقة 1080p مباشرةً من أمر نصي، دون الحاجة إلى صورة مصدر.
  • Wan 2.7 I2V: يأخذ صورة ثابتة ويحوّلها إلى مقطع فيديو متماسك.
  • Wan 2.7 R2V: يحرّك عنصرًا محددًا معزولًا من صورة مرجعية، مانحًا صنّاع المحتوى تحكمًا دقيقًا فيما يتحرك وكيف يتحرك.

كل وضع يستهدف سير عمل مختلفًا. T2V مخصص للإنشاء القائم على الأوامر النصية وحدها. I2V مخصص لتحريك المواد المرئية الموجودة. أما R2V فهو الجديد حقًا، وهو الجزء الذي يلفت انتباه صنّاع الأفلام وفِرق المنتجات أكثر من غيره.

دقة 1080p الأساسية مهمة

قبل Wan 2.7، كان الحصول على مخرجات بدقة 1080p من نموذج فيديو مفتوح الأوزان يتطلب معالجة لاحقة كبيرة أو مسارات رفع دقة فوق التوليد الخام. يُخرج Wan 2.7 T2V بدقة 1080p أصلًا. وهذا مهم لأن الدقة الأصلية تحافظ على الاتساق الزمني عبر الإطارات بطريقة لا يمكن لرفع الدقة بعد التوليد أن يحاكيها. تتدهور ضبابية الحركة، وحدّة الحواف، وتفاصيل الملمس الدقيقة عند تغيير حجم الإطارات بعد التوليد. أما عندما يولّد النموذج بالدقة الكاملة منذ الإطار الأول، فتبقى هذه التفاصيل متماسكة عبر المقطع كله.

مطوّر محترف يعمل بأدوات توليد الفيديو بالذكاء الاصطناعي على محطة عمل بعدة شاشات

ما الذي تغيّر من 2.6 إلى 2.7

حققت جودة الحركة تقدمًا حقيقيًا

كان كلٌّ من Wan 2.6 T2V و Wan 2.6 I2V أداءين قويين بالفعل، خاصة في الحركة السلسة للكاميرا وفي الكشف عن المشاهد الثابتة. يسدّ Wan 2.7 الفجوة في حركة الأشخاص والعناصر، وهي النقطة الأضعف في 2.6. تحافظ الشخصيات والأجسام في مقاطع Wan 2.7 على نسبها عبر الإطارات بتماسك أكبر، وتُظهر العناصر سريعة الحركة ارتعاشًا زمنيًا أقل بوضوح مقارنةً بالإصدار السابق.

كان Wan 2.5 T2V يتطلب هندسة أوامر نصية دقيقة لتجنّب التشوّه المميز للحواف الذي يظهر خلال حركة الأشخاص المعقدة. يتعامل الإصدار 2.7 مع هذا الأمر، فيحتاج المستخدم إلى تدخّل يدوي أقل بكثير.

R2V فئة مختلفة

تمنحك معظم نماذج الذكاء الاصطناعي للفيديو مسارين: وصف شيء بالنص، أو البدء من صورة. يضيف Wan 2.7 R2V مسارًا ثالثًا: استخراج عنصر محدد من صورة مرجعية وتحريكه في مشهد جديد. تقدّم صورة لشخص أو منتج، فيعزل النموذج هذا العنصر ويولّد حركة مع الحفاظ على مظهره البصري طوال المقطع.

الحفاظ على الهوية والملمس والنسب عبر الإطارات المولّدة يتطلب من النموذج الاحتفاظ بتمثيل داخلي مفصّل للعنصر المرجعي. يفعل Wan 2.7 ذلك بموثوقية للعناصر الثابتة والعناصر ذات الحركة البسيطة.

💡 R2V مفيد بشكل خاص لفِرق المنتجات. تتحول صورة منتج واحدة إلى مقطع عرض دوّار دون استوديو تصوير فعلي أو جهاز دوران.

لقطة مقرّبة لشاشة سينمائية تعرض فيديو بدقة 1080p مولّدًا بالذكاء الاصطناعي بتفاصيل حادة للمناظر الطبيعية

السرعة والكفاءة بدقة 1080p

الدقة الأعلى لا تعني دائمًا توليدًا أبطأ بنسبة مماثلة. تتضمن بنية Wan 2.7 تحسينات على العمود الفقري لمحوّل الانتشار (diffusion transformer) تقلل التكلفة الحسابية لكل خطوة عند 1080p مقارنةً بتشغيل مرحلة رفع دقة ساذجة فوق توليد أساسي بدقة 720p. وهذا يُبقي أزمنة التوليد عملية لسير العمل التكراري، حيث يشغّل صنّاع المحتوى عشرات النسخ قبل اختيار المقطع النهائي.

كيف يقارن Wan 2.7 بالمنافسين

لم تكن لسوق الفيديو بالذكاء الاصطناعي خيارات أكثر من اليوم. إليك تقييم صريح لمواضع تفوّق Wan 2.7 ولمواضع ما زال فيها بحاجة إلى تحسين.

Wan 2.7 مقابل Veo 3

تُنتج Veo 3 و Veo 3.1 من Google صوتًا أصليًا متزامنًا مع الفيديو، وهو ما لا يفعله Wan 2.7. جودة Veo 3 السينمائية استثنائية حقًا، خاصةً في المشاهد الخارجية ذات الإضاءة الطبيعية المعقدة. لكن Veo 3 واجهة API مغلقة، وتكاليف كل توليد فيها تتراكم بسرعة عند الحجم الكبير. أما Wan 2.7 فهو مفتوح الأوزان، ويمكن استخدامه محليًا أو عبر منصات مثل PicassoIA بتكلفة أقل بكثير لكل مقطع. وبالنسبة إلى المبدعين الذين يشغّلون مئات التكرارات لكل مشروع، غالبًا ما يكون فرق التكلفة هذا حاسمًا.

Wan 2.7 مقابل Sora 2

Sora 2 يتفوّق في مدد الفيديو الممتدة والسرديات المعقدة متعددة المشاهد. تكمن قوة Wan 2.7 في المقاطع القصيرة والدقيقة مع تحكم محدد بالعناصر. إذا كنت تحتاج إلى فيديو مدته 30 ثانية يضم انتقالات متعددة بين المشاهد وكلامًا متزامنًا، فإن Sora 2 هو الأداة الأقوى. وإذا كنت تحتاج إلى مقطع مدته من 5 إلى 10 ثوانٍ لمنتج أو شخصية محددة بحركة قابلة للتحكم، فإن Wan 2.7 أكثر عملية وأقل تكلفة بشكل ملحوظ.

Wan 2.7 مقابل Kling v2.6

يُعد Kling v2.6 من Kwai ربما أقوى منافس تجاري في فئة جودة الحركة نفسها. ثبات شخصيات Kling متقدّم قليلًا على Wan 2.7 للأشخاص البشريين ذوي تعابير الوجه المعقدة. أما المكان الذي يكسب فيه Wan 2.7 أرضًا فهو المرونة مفتوحة المصدر ووضع R2V، الذي لا يقدّم Kling له مكافئًا بالشكل نفسه. يتميّز Kling v3 بميزات التحكم في الحركة، وهو استثنائي، لكنه يبقى منتجًا مدفوعًا فقط.

مقارنة جنبًا إلى جنب لمخرجات نماذج فيديو بالذكاء الاصطناعي معروضة على جدار شاشات في وكالة إعلامية محترفة

النموذجالدقةمفتوح المصدرالصوتوضع R2V
Wan 2.7 T2V1080pنعملانعم
Veo 3.11080pلانعملا
Sora 21080pلانعملا
Kling v2.61080pلالالا
Seedance 2.51080pلانعملا
LTX 2.3 Pro4Kلالالا
Ray 3.21080pلالالا

Wan 2.7 ضمن الجدول الزمني لشركة Alibaba

من I2VGen إلى Wan

لدى Alibaba تاريخ في مجال توليد الفيديو أطول مما يدركه معظم الناس. I2VGen-XL، الذي أُطلق عبر فريق الأبحاث ali-vilab، كان من المحاولات الجادة الأولى المفتوحة المصدر لتحويل الصورة إلى فيديو مع تماسك بنيوي. واصلت سلسلة Wan من حيث انتهى I2VGen، معتمدةً بنية محوّل الانتشار التي تُوسّع الدقة دون تضخم حسابي يوازي زيادة الدقة.

Wan 2.1 1.3B قدّم الإطار الأساسي. أضاف Wan 2.2 I2V Fast إصدارات محسّنة للسرعة، وأضاف وضع Wan 2.2 S2V المدفوع بالصوت. حسّن Wan 2.5 T2V الاتساق الزمني بشكل ملحوظ. ورفع Wan 2.6 T2V سقف الدقة. ويجعل الإصدار 2.7 الآن R2V قدرةً من الدرجة الأولى جاهزة للإنتاج، إلى جانب تحسينات الجودة على نطاق واسع.

منظر جوي من الأعلى لممر في مركز بيانات ضخم لمزرعة خوادم GPU يشغّل توليد الفيديو بالذكاء الاصطناعي

Happyhorse مقابل Wan: أهداف مختلفة

تحافظ Alibaba أيضًا على سلسلة Happyhorse 1.1، التي تولّد فيديو بدقة تصل إلى 1080p من مدخلات نصية أو صورية. يعطي Happyhorse الأولوية لسلاسة الحركة السينمائية والاتساق الأسلوبي عبر المقاطع الأطول، بينما يعطي Wan الأولوية لدقة العناصر وقابلية التحكم الدقيق. وهما لا يتنافسان داخل منظومة Alibaba. أما Happyhorse فهو أداة الإخراج بجودة الاستوديو للنتائج السينمائية السلسة، وأما Wan فهو أداة التحكم الدقيق في تحريك العناصر المحددة. ما زال Happyhorse 1.0 متاحًا لتوليد أسرع بأهداف دقة أقل.

كيف تستخدم Wan 2.7 على PicassoIA

تستضيف PicassoIA جميع نماذج Wan 2.7 الثلاثة مباشرةً. لا حاجة إلى وحدة GPU محلية، ولا إدارة لمفتاح API، ولا أي إعداد. إليك كيف يعمل كل وضع عمليًا.

Wan 2.7 T2V: من النص إلى 1080p

  1. افتح Wan 2.7 T2V على PicassoIA.
  2. اكتب أمرًا نصيًا مفصّلًا يصف المشهد والشخص والإضاءة وحركة الكاميرا.
  3. حدّد مدة المقطع المطلوبة. من 5 إلى 10 ثوانٍ يعطي أفضل تماسك زمني.
  4. أرسل الطلب واستلم المخرجات بدقة 1080p.

💡 ضمّن توجيه الكاميرا في أمرك النصي. «تقريب بطيء من لقطة متوسطة إلى لقطة مقرّبة» ينتج حركة أفضل بكثير من أمر يصف محتوى المشهد الثابت فقط.

Wan 2.7 I2V: حرّك أي صورة

  1. افتح Wan 2.7 I2V على PicassoIA.
  2. ارفع صورة المصدر.
  3. صِف الحركة: ما الذي يتحرك، وفي أي اتجاه، وبأي سرعة.
  4. يولّد النموذج مقطعًا يبدأ من صورتك ويُنشئ حركة متماسكة انطلاقًا منها.

أفضل المدخلات في وضع I2V: صور عالية التباين فيها شخص واضح أمام خلفية محددة. الصور ذات الحواف الغامضة تتطلب أوامر حركة أكثر تفصيلًا لتجنّب التشوّهات الزمنية قرب حدود الشخص.

محترف مبدع يقارن صورًا مرجعية مطبوعة بمخرجات فيديو متحركة بالذكاء الاصطناعي

Wan 2.7 R2V: تحريك عنصر محدد

  1. افتح Wan 2.7 R2V على PicassoIA.
  2. ارفع صورة مرجعية للعنصر الذي تريد تحريكه.
  3. صِف الحركة المطلوبة وسياق المشهد بالتفصيل.
  4. يعزل النموذج العنصر، ويحافظ على مظهره، ويولّد الحركة من حوله.

ما ينجح جيدًا في R2V: المنتجات والشخصيات المفردة والمركبات والحيوانات ذات الصور الظلية المميزة. ما يحتاج إلى أوامر دقيقة: مجموعات من العناصر المتداخلة، أو الخلفيات شديدة الملمس التي تنافس العنصر الرئيسي بصريًا على انتباه النموذج.

استخدامات واقعية تنجح فعلًا

مقاطع لوسائل التواصل من الصور الثابتة

أكثر استخدام فوري لنموذج Wan 2.7 I2V هو تحويل مكتبة الصور الحالية للعلامة التجارية إلى محتوى فيديو قصير. تتحول صورة طعام إلى كشف سينمائي بطيء. تكتسب لقطة الأزياء حركة قماش خفيفة. تحصل صورة السفر على انزياح بارالاكس (parallax) متدرّج لطيف يبدو كفيديو أصلي على أي تغذية وسائل تواصل. يتراجع الحاجز أمام محتوى الفيديو القصير بشكل ملحوظ عندما تكون الصور الثابتة في متناول اليد بالفعل.

صانع محتوى شاب يسجّل فيديو قصيرًا في استوديو منزلي بسيط على الطراز الإسكندنافي

نماذج أولية للأفلام والإعلانات

يستخدم المخرجون Wan 2.7 T2V للتصوّر المسبق. حركة كاميرا معقدة كانت ستستغرق نصف يوم لإعدادها في موقع التصوير يمكن اختبارها كمقطع مدته 5 ثوانٍ في أقل من دقيقة. إذا نجح التكوين، يصبح التصوير الفعلي أكثر كفاءة. وإن لم ينجح، لا يضيع شيء سوى دقيقة من وقت الحوسبة. كما يتعامل نموذج Wan 2.2 S2V مع التحريك المدفوع بالصوت لتصوّر أولي تقريبي للتزامن الصوتي.

مخرج أفلام يعاين تكوين لقطة مولّدة بالذكاء الاصطناعي على جهاز لوحي أثناء تصوير في موقع حضري خلال الساعة الذهبية

تصوير المنتجات دون استوديو

يستخدم فِرق التجارة الإلكترونية بالفعل Wan 2.7 R2V لتوليد عروض منتجات دوّارة من صورة استوديو واحدة. ساعة أو حذاء رياضي أو عبوة عناية بالبشرة: ارفع المرجع، وصِف الدوران، وسينتج النموذج مقطعًا متحركًا كان سيتطلب جهاز دوران مخصصًا ومصوّر فيديو. لا تُعد وفورات التكلفة والوقت عند الحجم الكبير هامشية.

مصمم منتجات يراجع فيديو منتج دوّارًا مولّدًا بالذكاء الاصطناعي على حاسوب محمول في استوديو بخلفية بيضاء نظيفة

لماذا تحتل زاوية المصدر المفتوح مكانة محورية

حجة التكلفة والتحكم

تحتسب واجهات API مغلقة المصدر الرسوم بالثانية من المحتوى المولّد. عند أي حجم إنتاج ملموس، تتراكم هذه التكلفة بسرعة. يمكن لنموذج مفتوح الأوزان مثل Wan 2.7 أن يعمل على مثيل GPU سحابي بتكلفة شهرية ثابتة، أو عبر منصات مثل PicassoIA التي توزّع نفقات البنية التحتية على عدد كبير من المستخدمين. بالنسبة إلى الاستوديوهات التي تولّد مئات المقاطع أسبوعيًا، الحساب بسيط: غالبًا ما يكون الوصول إلى الأوزان المفتوحة أرخص لكل مقطع بمقدار مرتبة من الحجم مقارنةً ببدائل API المغلقة.

بعيدًا عن التكلفة، تعني الأوزان المفتوحة أن المجتمع الأوسع يمكنه الضبط الدقيق للنموذج وتوسيعه وتكييفه لحالات استخدام محددة. تتحسن النماذج المغلقة فقط عندما يختار مطوّروها الاستثمار في دورة تحديث. أما النماذج المفتوحة فتتحسن باستمرار، لأن مجموعات البحث والمطورين المستقلين والفِرق التجارية تساهم جميعًا في القاعدة المشتركة.

مكتب تقني مفتوح المساحة يضم فريقًا متنوعًا مجتمعًا حول مكاتب واقفة يتعاون في تطوير الفيديو بالذكاء الاصطناعي

الضبط الدقيق لاتساق الهوية البصرية

لأن أوزان Wan 2.7 عامة، فإن الضبط الدقيق على أساليب بصرية محددة ممكن لأي فريق يملك موارد GPU متواضعة. يمكن لشركة إنتاج أن تدرّب محوّل LoRA على أسلوبها الخاص وتحصل على مقاطع متسقة بصريًا عبر كل أصل مولّد بالذكاء الاصطناعي في خط إنتاجها. هذا المستوى من التحكم في الهوية غير ممكن مع أي نموذج فيديو مغلق متاح حاليًا، بغض النظر عن الميزانية.

💡 الأوزان المفتوحة تتيح أيضًا تشغيل النموذج داخل المؤسسة. يمكن للاستوديوهات ذات متطلبات السرية الصارمة للملكية الفكرية تشغيل Wan 2.7 محليًا دون أن يغادر أي محتوى شبكتها. وهذا شرط صارم في فئات المحتوى القانوني والطبي والمالي، حيث يكون استخدام API السحابية مقيّدًا.

سلسلة Wan في لمحة

للسياق حول تطور السلسلة، إليك أهم إصدارات Wan المتاحة على PicassoIA:

الإصدارالوضعأقصى دقة
Wan 2.1 1.3BT2V720p
Wan 2.2 I2V FastI2V720p
Wan 2.2 S2Vمزامنة الصوت720p
Wan 2.5 T2VT2V1080p
Wan 2.5 I2VI2V1080p
Wan 2.6 T2VT2V1080p
Wan 2.6 I2VI2V1080p
Wan 2.7 T2VT2V1080p
Wan 2.7 I2VI2V1080p
Wan 2.7 R2VR2V1080p

جرّب Wan 2.7 الآن

الحديث حول Wan 2.7 يحدث لأن توليد الفيديو بدقة 1080p مفتوح الأوزان، مع وضع تحويل المرجع إلى فيديو المخصص، قدرة حقيقية وعملية اليوم. ليست معاينة بحثية. ولا قائمة انتظار. النماذج متاحة، والنتائج قابلة للتكرار، ويمكنك البدء بتوليد المقاطع دون مغادرة متصفحك.

تمنحك PicassoIA وصولًا مباشرًا إلى الأوضاع الثلاثة جميعها:

  • Wan 2.7 T2V: اكتب أمرًا نصيًا، واحصل على مقطع بدقة 1080p.
  • Wan 2.7 I2V: ارفع صورة، وصِف الحركة، وشاهدها تنبض بالحياة.
  • Wan 2.7 R2V: استخدم صورة مرجعية لتحريك عنصر محدد مع الحفاظ على مظهره وهويته.

إذا أردت التجاوز إلى ما هو أبعد من توليد الفيديو، تستضيف PicassoIA أيضًا مجموعة كاملة من نماذج تحويل النص إلى صورة، ورفع الدقة الفائق، وتحسين الفيديو بالذكاء الاصطناعي، ومزامنة الشفاه، وأدوات توليد الصوت. كل شيء متاح من منصة واحدة على picassoia.com/en/all-models. السؤال الوحيد هو أي مشروع تريد إحياءه أولًا.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة