Wan 2.6 لتوليد الفيديو بالذكاء الاصطناعي: شرح T2V وI2V وما الذي تحسّن فعلًا

Wan 2.6 من أكثر نماذج الفيديو بالذكاء الاصطناعي مفتوحة الأوزان قدرةً اليوم. يشرح هذا المقال إصداري T2V وI2V، ويوضح ما الذي تغيّر عن الإصدارات السابقة، ويبيّن كيف توظّفهما في مشاريع فيديو حقيقية مهما كانت ميزانيتك.

Wan 2.6 لتوليد الفيديو بالذكاء الاصطناعي: شرح T2V وI2V وما الذي تحسّن فعلًا
Cristian Da Conceicao
مؤسس Picasso IA

يشهد مجال الفيديو بالذكاء الاصطناعي تطورًا سريعًا، ويقع Wan 2.6 في نقطة التقاء بين سهولة الوصول والجودة. أصدره فريق الأبحاث في Alibaba ضمن سلسلة Wan مفتوحة الأوزان، ويمثّل الإصدار 2.6 خطوة كبيرة إلى الأمام في ما يمكن تحقيقه بتوليد الفيديو مفتوح المصدر. سواء كنت تحوّل أوامر نصية إلى لقطات سينمائية، أو تحرّك صورة ثابتة لتمنحها حركة سلسة، فإن عائلة النماذج هذه تقدّم ما كان حكرًا على المنتجات التجارية المغلقة قبل شهور قليلة فقط.

ما هو Wan 2.6 فعلًا

Wan (اختصار لـ Wan Video) هي سلسلة نماذج توليد الفيديو بالذكاء الاصطناعي مفتوحة الأوزان من Alibaba. على خلاف الأنظمة المغلقة التي تعمل خلف واجهات API برسوم استخدام، تُطلق نماذج Wan بأوزان متاحة للجميع، ما يعني أن الباحثين والمطورين وصنّاع المحتوى يستطيعون تشغيلها محليًا، أو الوصول إليها عبر منصات مثل PicassoIA دون قيود ملكية.

يبني الإصدار 2.6 على الأساس الذي وضعته الإصدارات 2.1 و2.2 و2.5، ويقدّم تحسينات مستهدفة في جودة الحركة، ومعالجة الدقة، والالتزام بالأوامر النصية. وهو ليس إعادة كتابة من الصفر، بل تحسين دقيق لمسار توليد الفيديو القائم على الانتشار (diffusion) الذي ظل فريق Wan يطوّره طوال عامي 2024 وأوائل 2025.

مقرب لجدول زمني لتحرير الفيديو الاحترافي على شاشة

البنية التقنية وراءه

يعتمد Wan 2.6 على بنية المحوّل الانتشاري للفيديو (video diffusion transformer). فبدلًا من توليد الإطارات واحدًا تلو الآخر بشكل مستقل، يمثّل النموذج التسلسل الزمني كاملًا معًا، ما ينتج حركة أكثر ترابطًا من الأساليب القديمة التي كانت تجمع الإطارات لاحقًا.

يجمع مسار التدريب بين:

  • تكييف النص لالتزام أفضل بالأوامر النصية في وضع T2V
  • تكييف الصورة لوضع I2V، حيث تثبّت الصورة المصدر الإطار الأول
  • طبقات الانتباه الزمني التي تفرض الاتساق بين الإطارات

والنتيجة نموذج يعامل الحركة كحدث متصل، لا كسلسلة من الصور المنفصلة. وهذا مهم جدًا عند توليد أشياء مثل الشعر المتطاير، وحركة الماء، وحركة جسم الإنسان، وهي أمور تميل إلى التحول إلى ضوضاء بصرية في النماذج الأضعف.

كيف يختلف عن الإصدارات السابقة

أدخلت كل نسخة في سلسلة Wan تحسينات مستهدفة:

الإصدارأبرز التغيير
Wan 2.1الإصدار الأساسي مفتوح المصدر، بمخرجات 480p/720p
Wan 2.2تشغيل أسرع للنموذج، ودعم S2V، وميزة الاستبدال المتحرك (animate-replace)
Wan 2.5التزام أفضل بالأوامر النصية، وإصدارات T2V أسرع
Wan 2.6مخرجات بدقة أعلى، وثبات زمني أقوى في I2V، وإصدار Flash

يكون القفز من 2.5 إلى 2.6 أوضح ما يكون في مهام تحويل الصورة إلى فيديو. كانت الإصدارات السابقة تنتج أحيانًا "انجرافًا" (drift)، حيث يبتعد الفيديو المولَّد بصريًا عن الصورة المصدر بعد عدة إطارات. ويشدّ Wan 2.6 هذا الارتكاز بشكل ملحوظ.

النماذج الثلاثة في عائلة 2.6

يأتي Wan 2.6 في ثلاثة إصدارات مختلفة، لكل منها حالة استخدام مختلفة.

منظر جوي لمحترف مبدع يعمل على لابتوب محاط بألواح القصص المصورة

Wan 2.6 T2V

Wan 2.6 T2V هو إصدار تحويل النص إلى فيديو. تزوّده بأمر نصي يصف مشهدًا، فيولّد النموذج مقطعًا قصيرًا من الصفر. يدعم نموذج 2.6 T2V مخرجات تصل إلى 1080p، ويُظهر تحسنًا ملموسًا في:

  • تكوين المشهد: تُوضع الأشياء والشخصيات بقصد أكبر وفق زاوية الكاميرا الموصوفة
  • قوة الحركة: تحمل الأفعال الموصوفة في الأوامر (الركض، تحطّم الأمواج، سقوط الأشياء) وزنًا فيزيائيًا أكثر واقعية
  • ثبات الإضاءة: يستمر اتجاه الضوء الذي يُحدَّد في الإطار الأول طوال المقطع

في توليد الفيديو من النص وحده، يتنافس Wan 2.6 T2V مباشرةً مع النماذج التجارية، مع بقائه متاحًا عبر الأوزان المفتوحة.

Wan 2.6 I2V

Wan 2.6 I2V هو إصدار تحويل الصورة إلى فيديو. تزوّده بصورة مصدر وأمر نصي يصف الحركة المطلوبة، فيحرّك النموذج المشهد. وهنا يُظهر Wan 2.6 أقوى تحسيناته مقارنةً بالإصدارات السابقة.

تحسّنت قدرة نموذج I2V على الحفاظ على هوية الموضوع عبر الإطارات بشكل ملحوظ. عندما تحرّك صورة شخصية، يحتفظ وجه الشخص ببنيته بدل أن يتشوّه أو يتلاشى في عيوب حركية مجردة. ويعود ذلك إلى تكييف أقوى للصورة يُطبَّق على طبقات متعددة من عملية الانتشار.

💡 نصيحة: لأفضل النتائج مع Wan 2.6 I2V، اجعل أمر الحركة محددًا. بدلًا من "اجعلها تتحرك"، جرّب "تدير رأسها ببطء نحو اليمين، ويتحرك شعرها برفق مع الحركة".

Wan 2.6 I2V Flash

Wan 2.6 I2V Flash يضحّي ببعض جودة المخرجات مقابل أوقات توليد أسرع بكثير. هذا الإصدار مفيد في:

  • التكرار السريع: اختبار مفاهيم حركية متعددة على الصورة المصدر نفسها قبل الالتزام بالتصيير الكامل
  • سير العمل كبير الحجم: عندما تحتاج إلى تحريك عشرات الصور لمشروع واحد وتكون سرعة التوليد عائقًا
  • المعاينات السريعة: التحقق من اتجاه الحركة وتوقيتها قبل التحول إلى نموذج I2V الكامل للمخرج النهائي

يُنتج إصدار Flash مقاطع أقصر بدقة أقل، لكنه يحافظ على جودة كافية تجعله مفيدًا فعلًا، لا مجرد مسودة خام.

ما الذي تغيّر في Wan 2.6

لقطة سينمائية مقرّبة لامرأة في إضاءة طبيعية ناعمة وحجمية

الدقة وجودة الحركة

أوضح ترقية في Wan 2.6 هي سقف الدقة. كانت النماذج 2.1 وبداية 2.2 تحصر المخرجات العملية في 720p مع نعومة ملحوظة. أما Wan 2.6 فينتج مخرجات 1080p حادة فعلًا، والحركة ضمن هذه الدقة أنظف.

الأمر لا يقتصر على عدد البكسلات الخام. فالدقة الأعلى بالجودة نفسها تتطلب من النموذج الحفاظ على الترابط عبر معلومات مكانية أكثر بكثير في كل إطار. ويحقق Wan 2.6 ذلك بتحسين طريقة مشاركة طبقات الانتباه الزمني للمعلومات عبر البعدين المكاني والزمني في آنٍ واحد.

النتيجة العملية: تبدو الحركة في Wan 2.6 معقولة فيزيائيًا. يتحرك الماء كالماء، والقماش كالقماش. ويتفاعل الشعر كنظام موحّد، لا كخصلات فردية تتصرف بشكل منفصل.

تحسينات الالتزام بالأمر النصي

كانت إصدارات Wan السابقة تنتج أحيانًا فيديوهات تنحرف عن الأمر النصي في منتصف المقطع، فتعود إلى أنماط حركة عامة. ويطبّق Wan 2.6 تكييف النص بقوة أكبر طوال عملية التوليد، لا في البداية فقط.

هذا يعني أن أوامر مثل "امرأة تجلس إلى طاولة في مقهى، وتضع حقيبتها على الكرسي، وتفتح قائمة الطعام" لديها فرصة أفضل بكثير لتنفيذ كل فعل موصوف، بدلًا من أن تنهار إلى مخرج حركة عامة بسيط. النموذج يبقى على المهمة.

منظر ساحلي سينمائي واسع عند الغروب الذهبي مع شخص وحيد على شرفة

ماذا عن الصوت؟

لا يولّد Wan 2.6 الصوت بشكل أصلي. ينتج النموذج فيديو صامتًا. إذا كان مشروعك يتطلب صوتًا متزامنًا، فستحتاج إلى إقرانه بأداة منفصلة لتوليد الصوت. وضمن PicassoIA، يتولى نموذج Wan 2.2 S2V الرسوم المتحركة المتزامنة مع الصوت، ويمكن لأدوات تحويل النص إلى كلام وتوليد الموسيقى بالذكاء الاصطناعي في المنصة أن تضيف الصوت كخطوة منفصلة.

النتائج في الواقع

مصوّر فيديو محترف بكاميرا سينمائية على سطح مبنى في المدينة عند الغسق

ما يتعامل معه بشكل جيد

يحقق Wan 2.6 أفضل أداء في هذه السيناريوهات:

  • البيئات الطبيعية: المناظر الطبيعية، وتأثيرات الطقس، والحركة العضوية مثل النباتات في الريح وأمواج المحيط
  • الموضوعات البشرية مع أفعال بسيطة: المشي والاستدارة والجلوس وتعابير الوجه الخفيفة
  • حركة الكاميرا: البانينغ البطيء (panning)، والاقتراب اللطيف (push-in)، والحركات المدارية حول موضوع
  • تحريك المنتجات: الأشياء الدوّارة، والعناصر العائمة، وحركات الكشف البسيطة

من الواضح أن النموذج تدرّب على تشكيلة واسعة من اللقطات الواقعية، ويظهر ذلك في طريقة تعامله الطبيعية مع الحركة القائمة على الفيزياء عندما تكون هي المحتوى الأساسي.

حيث ما زال يقصّر

يواجه Wan 2.6 صعوبات مع:

  • التفاعلات المعقدة بين عدة موضوعات: شخصان يتصافحان، أو مشاهد مزدحمة فيها حركة مستقلة لكل شخص
  • التفاصيل الدقيقة للأيدي والوجوه أثناء الحركة السريعة: نقطة ضعف مستمرة في جيل نماذج الانتشار للفيديو الحالي
  • التسلسلات الطويلة: ينتج النموذج مقاطع من بضع ثوانٍ، وتحويلها إلى سرديات أطول يتطلب دمجًا دقيقًا
  • الأوامر التجريدية للغاية: يميل النموذج إلى المخرجات الواقعية ويقاوم السيناريوهات غير الفيزيائية فعلًا

هذه قيود تخص فئة نماذج الانتشار للفيديو الأوسع في الوقت الحالي، وليست إخفاقات محددة في بنية Wan.

Wan 2.6 مقابل النماذج الأخرى

شاشتان احترافيتان جنبًا إلى جنب تُظهران تصحيح الألوان قبل وبعد

مجال الفيديو بالذكاء الاصطناعي مزدحم. إليك موقع Wan 2.6 مقارنةً بأبرز الخيارات الأخرى المتاحة على PicassoIA:

النموذجنقاط القوةمتى تختار Wan 2.6 بدلًا منه
Kling v2.6حركة سينمائية، وفيديو سردي ممتازالوصول عبر الأوزان المفتوحة، وتكلفة أقل على نطاق واسع
Veo 3صوت أصلي، وواقعية عالية جدًاجودة بصرية مقاربة بأسعار أكثر سهولة
Sora 2تماسك للمحتوى الطويل، ومشاهد معقدةلقطات أقصر تحتاج إلى هندسة أوامر أقل
Seedance 1 Proتوليد سريع، ومخرجات T2V قويةجودة Wan 2.6 I2V تتفوق على Seedance في مهام تحريك الصور
Wan 2.7 T2Vأحدث إصدار من Wan، وأعلى جودة إجماليةWan 2.6 أسرع، ولا يزال قادرًا جدًا في معظم المهام

إذا كنت تحتاج إلى أفضل جودة تجارية مطلقًا والميزانية ليست عائقًا، فإن Veo 3 أو Kling v2.6 خياران قويان. أما للتوسع والشفافية وكفاءة التكلفة، فإن Wan 2.6 يصعب التفوق عليه بسعره.

كيفية استخدام Wan 2.6 على PicassoIA

شابة تشاهد فيديو على شاشة في مكتب منزلي حديث بإضاءة دافئة

توفّر PicassoIA وصولًا مباشرًا إلى الإصدارات الثلاثة من Wan 2.6 دون أي إعداد محلي، أو متطلبات GPU، أو تهيئة تقنية. تفتح النموذج، وتكتب أمرك النصي، ثم تولّد.

استخدام Wan 2.6 T2V

  1. افتح Wan 2.6 T2V من مجموعة تحويل النص إلى فيديو
  2. اكتب الأمر النصي للمشهد، مع تحديد الموضوع والفعل والبيئة وزاوية الكاميرا
  3. اختر دقة المخرجات: 720p للسرعة، و1080p للجودة
  4. حدّد مدة المقطع، وعادةً ما بين 4 و6 ثوانٍ لأفضل ترابط زمني
  5. ولّد وراجع. إذا كان اتجاه الحركة خاطئًا، فعدّل الأمر النصي قبل إعادة التوليد

💡 نصيحة للأوامر النصية: أدرج لغة الكاميرا. "اقتراب بطيء من امرأة تقرأ في مقهى، عمق ميداني ضحل، ضوء بعد ظهر ذهبي" ينتج نتائج أفضل بكثير من "امرأة تقرأ".

استخدام Wan 2.6 I2V

  1. افتح Wan 2.6 I2V من المجموعة
  2. ارفع صورة المصدر. تعمل أفضل الصور النظيفة والمكتملة التكوين، ذات الموضوع الواضح
  3. اكتب أمر حركة يصف ما يجب أن يحدث، لا ما هو موجود في الصورة أصلًا
  4. ولّد بدقة 1080p للمخرج النهائي، أو استخدم Wan 2.6 I2V Flash لتمريرات التكرار السريعة
  5. إذا انحرف الموضوع عن الصورة المصدر، فأضف تفاصيل فيزيائية أكثر عن الموضوع في أمر الحركة

الجمع بين النماذج لأعمال أطول

للمشاريع التي تحتاج إلى أكثر من بضع ثوانٍ من اللقطات:

هذا النهج القائم على توليد عدة مقاطع هو ما تعتمد عليه معظم سيرات عمل الفيديو بالذكاء الاصطناعي الاحترافية فعليًا. ولا يزال التوليد الطويل لمحتوى بجودة عالية مشكلة بحثية مفتوحة لكل النماذج من هذه الفئة.

من ينبغي أن يستخدم Wan 2.6

عابرو مشاة في مدينة مزدحمة يعبرون عند الساعة الزرقاء مع آثار حركة ضبابية

يناسب Wan 2.6 بقوة:

  • صنّاع المحتوى الذين يحتاجون إلى مقاطع فيديو قصيرة لوسائل التواصل الاجتماعي، أو عروض المنتجات، أو المحتوى السردي
  • المصممون والمصورون الذين يريدون إحياء الصور الثابتة باستخدام نموذج I2V
  • المطورون والباحثون الذين يريدون نموذج فيديو قويًا مفتوح الأوزان ببنية شفافة
  • المسوّقون الذين ينتجون محتوى بكميات كبيرة ويحتاجون إلى توليد ثابت وفعّال من حيث التكلفة على نطاق واسع
  • صنّاع الأفلام الذين يستخدمون لقطات مولّدة بالذكاء الاصطناعي كلقطات مساندة (B-roll)، أو لتصوّر المفاهيم، أو لتحريك القصص المصورة

ليس الأداة المناسبة إذا كنت تحتاج إلى صوت أصلي، أو مقاطع طويلة جدًا، أو مشاهد معقدة جدًا بشخصيات متعددة. لهذه الحالات، سيخدمك Sora 2 أو Veo 3 أو Kling v2.1 Master بشكل أفضل.

جرّبه على لقطاتك الخاصة

لقطة مقرّبة جدًا لأيدي تكتب على لوحة مفاتيح ميكانيكية في استوديو مونتاج خافت الإضاءة

أفضل طريقة لترى بنفسك ما يقدّمه Wan 2.6 هي تشغيله على شيء تملكه بالفعل. التقط صورة من تصويرك، وافتح Wan 2.6 I2V على PicassoIA، واكتب أمر حركة يصف بالضبط ما تريد أن يفعله المشهد. شغّل إصدار Flash أولًا للتحقق من التوقيت والاتجاه، ثم انتقل إلى نموذج I2V الكامل للمخرج النهائي.

إذا كنت تبدأ من الصفر دون صورة مصدر، فإن Wan 2.6 T2V يتيح لك البناء من وصف نصي فقط. كلما كان أمرك أكثر تحديدًا، جاءت النتيجة أكثر قصدية. تؤثر زاوية الكاميرا، وظروف الإضاءة، وفعل الموضوع، وبيئة المشهد جميعها في المخرجات بطرق قابلة للقياس.

يضم كتالوج PicassoIA الكامل لـ**نماذج تحويل النص إلى فيديو** أيضًا إصدارات أحدث مثل Wan 2.7 T2V و**Wan 2.7 I2V**، إذا أردت مقارنة ما تقدمه أحدث نسخة فوق 2.6. تشغيل الاثنين متتاليًا على الأمر النصي نفسه هو أسرع طريقة لتحديد أيهما يناسب متطلباتك من الجودة والسرعة.

يوجد أكثر من 87 نموذجًا لتوليد الفيديو على المنصة، من خيارات مجانية وسريعة إلى أدوات سينمائية باحترافية عالية. إذا كان Wan 2.6 نقطة بدايتك، فالمجموعة تمنحك كل اتجاه للانطلاق منه.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة