Wan 2.6 بالتفصيل: نموذج توليد الفيديو السينمائي الجديد الذي يستحق التجربة

Wan 2.6 هو أكثر نماذج Wan Video سينمائية حتى الآن، إذ يقدّم حركة أحدّ وتفاصيل أغنى واتساقًا زمنيًا حقيقيًا. يشرح هذا المقال بنيته، وفروق أدائه الفعلية عن Wan 2.5، وكيف توظّفه في مشروعك القادم عبر ثلاثة إصدارات: T2V وI2V وI2V Flash.

Wan 2.6 بالتفصيل: نموذج توليد الفيديو السينمائي الجديد الذي يستحق التجربة
Cristian Da Conceicao
مؤسس Picasso IA

Wan 2.6 من الإصدارات التي تغيّر ما يتوقعه الناس من توليد الفيديو بالذكاء الاصطناعي. ليس لأنه يَعِد بشيء جديد، بل لأنه يقدّم ما كان الناس ينتظرونه: حركة سينمائية تصمد فعلًا. إذا كنت تتابع التطور السريع لسلسلة Wan Video من Alibaba، فأنت تعرف أن كل إصدار رفع السقف بشكل ملموس. والإصدار 2.6 لا يكسر هذا المسار.

يشرح هذا المقال البنية التي يقوم عليها Wan 2.6، وما الذي تغيّر تحديدًا عن سابقيه، وكيف تختلف الإصدارات الثلاثة المتاحة (T2V وI2V وI2V Flash)، وكيفية توظيف كل ذلك.

امرأة تراجع إطارات فيديو بالذكاء الاصطناعي على مكتب مضاء بأشعة الشمس

ما هو Wan 2.6 فعلًا

Wan 2.6 نموذج مفتوح المصدر لتوليد الفيديو طوّره فريق Wan Video التابع لشركة Alibaba. وهو ينتمي إلى عائلة نماذج الفيديو القائمة على الانتشار الكامن (latent diffusion)، أي أنه يعمل في فضاء كامن مضغوط بدلًا من توليد البكسلات مباشرة. يتيح هذا النهج مخرجات بدقة أعلى بكثير وحركة متماسكة على مدى أطول، دون الانفجار الحسابي الذي تسببه طرق فضاء البكسلات.

يشير الوسم "2.6" إلى تحديث جوهري في منتصف دورة الإصدارات ضمن الجيل Wan 2.x، ويقع بين سلسلة Wan 2.5 المعتمدة على نطاق واسع وإصدارات Wan 2.7الأحدث. ويستهدف توليد فيديو بدقة HD مع فهم زمني أفضل وتطابق أوضح بكثير بين أوامر النص والمخرجات المرئية.

من Wan 2.1 إلى 2.6

سارت سلسلة Wan على وتيرة إصدارات سريعة. قدّم Wan 2.1 البنية الأساسية للسلسلة مع دعم تحويل النص إلى فيديو بدقتي 480p و720p. وأضاف Wan 2.2 إصدارات متزامنة مع الصوت وتحسينًا في نمذجة الحركة عبر نهج S2V (تحويل الصوت إلى فيديو). ورفع Wan 2.5 مستوى تحريك الصور إلى درجة أعلى من الدقة، خاصة في مشاهد الحركة البطيئة والمتوسطة.

يأخذ Wan 2.6 ما أجاده 2.5 ويدفعه أبعد في ثلاثة اتجاهات: حدّة الدقة، واستمرارية الأشخاص عبر الإطارات، والمحاكاة الطبيعية للفيزياء لحركة الأقمشة والشعر والسوائل.

💡 معلومة تستحق المعرفة: إصدارات Wan Video مفتوحة الأوزان، أي أن أوزان النموذج متاحة للعموم. وهذا مهم لمن يشغّل النموذج محليًا أو يبني مسارات مخصصة.

البنية الأساسية

يعتمد Wan 2.6 في جوهره على مشفّر تبايني ثلاثي الأبعاد (3D VAE) لترميز المعلومات المكانية والزمنية معًا في الوقت نفسه. وهذا ما يميّزه عن نماذج الفيديو القديمة القائمة على الإطارات، التي كانت تعامل الزمن كأمر ثانوي. تعمل عملية الانتشار على رموز مكانية-زمنية (spatio-temporal tokens)، لذا يمتلك النموذج فهمًا متصلًا لكيفية حركة البكسلات عبر الزمن، لا لشكلها في إطار واحد فقط.

يستخدم تكييف النص مشفّرًا على نمط CLIP واسع النطاق، خضع للضبط الدقيق على أزواج من الفيديو والتعليقات. وهذا يمنح النموذج مفردات أغنى بكثير للغة الحركة: مفاهيم مثل "dolly أمامي بطيء" و"شعر تحمله الريح" أو "الشخص يدخل إلى الكادر" تُترجم إلى سلوك فيديو بشكل أكثر مباشرة مما كان في أنظمة تحويل النص إلى فيديو السابقة.

طاقم إنتاج سينمائي في شارع مرصوف بالحصى عند الغسق

ما الذي تغيّر من Wan 2.5 إلى 2.6

هذا هو القسم الذي يبحث عنه معظم الناس. لغة التسويق حول نماذج الذكاء الاصطناعي غالبًا ما تكون غامضة، لذا دعنا نكون محددين بشأن ما يفعله Wan 2.6 بشكل مختلف، وأين تظهر هذه الاختلافات فعلًا.

تماسك الحركة صار حقيقيًا

في Wan 2.5، كانت تسلسلات الحركة السريعة تميل إلى الانجراف. فالشخص الذي يركض عبر الكادر كان أحيانًا يُظهر تحولات طفيفة في الهوية: زاوية وجه مختلفة قليلًا، وتغيّر في تجاعيد الملابس، أو ذراع تتحرك في مسار غير معقول فيزيائيًا. يعالج Wan 2.6 هذا عبر آليات انتباه زمني محسّنة تفرض ثباتًا أقوى للهوية عبر الإطارات.

عمليًا، يعني هذا:

  • تحافظ الوجوه على بنيتها خلال حركات الكاميرا الأفقية والعمودية
  • تحتفظ الملابس بأنماط تجاعيدها من إطار إلى آخر أثناء الحركة
  • يبدو تأثير الاختلاف المنظوري للخلفية أكثر ارتكازًا على الفيزياء في لقطات dolly أو الدرون

الاتساق الزمني على نطاق واسع

من أصعب المشكلات في توليد الفيديو بالذكاء الاصطناعي الحفاظ على تماسك المشهد في المقاطع الأطول. معظم النماذج تُدرَّب على تسلسلات من 5 إلى 16 إطارًا ثم تُمدَّد لتوليد مخرجات أطول، وهذا يُدخل أخطاءً تتراكم. يوسّع Wan 2.6 نافذة التدريب الأصلية لديه، ويضيف مخطط انتباه زمني هرمي يسمح له بالحفاظ على حالة المشهد عبر إطارات أكثر قبل أن تتدهور الجودة.

النتيجة: يمكنك توليد مقاطع تبدو أقرب إلى مقتطفات من مشهد أطول، لا إلى لحظات قصيرة معزولة.

💡 نصيحة للأوامر النصية: صِف مشهدك بلغة كاميرا صريحة ("لقطة متوسطة ثابتة"، "تتبع بطيء نحو اليسار") للاستفادة القصوى من نمذجة الحركة المحسّنة في Wan 2.6.

تفصيل مقرب لبكرة فيلم قديمة

T2V مقابل I2V مقابل I2V Flash

يأتي Wan 2.6 في ثلاثة إصدارات، كل منها مُحسَّن لحالة استخدام مختلفة. واختيار الإصدار المناسب هو العامل الأكبر تأثيرًا على جودة المخرجات.

الإصدارالمدخلالأفضل لـالسرعة
Wan 2.6 T2Vأمر نصيإنشاء مشهد أصليعادية
Wan 2.6 I2Vصورة + أمر نصيتحريك الصور الفوتوغرافية ولقطات المنتجاتعادية
Wan 2.6 I2V Flashصورة + أمر نصيالتكرار السريع والمعايناتسريعة

أي صيغة تستخدم

استخدم T2V عندما تنشئ مشهدًا من الصفر، أو عندما لا توجد الصورة بعد، أو عندما تريد أقصى مرونة إبداعية من وصف مكتوب. يمنح T2V النموذج أوسع هامش للتصرف، وغالبًا ما ينتج أكثر النتائج إثارة سينمائيًا عند اقترانه بأوامر نصية مفصّلة.

استخدم I2V عندما تملك صورة مرجعية، أو صورة فوتوغرافية ثابتة، أو لقطة لمنتج، أو تصميمًا لشخصية تريد أن تحرّكها. يستخدم النموذج الصورة كإطار أول مثبّت، ويولّد الحركة انطلاقًا منه إلى الأمام. وهذا يزيد الاتساق بشكل كبير في الأعمال التجارية والمرتبطة بالعلامات التجارية.

استخدم I2V Flash عندما تحتاج إلى التكرار بسرعة. فهو مسار الفيديو من الصورة نفسه، لكن عبر مسار تشغيل مُقطَّر وأسرع. الجودة أقل قليلًا من I2V العادي، لكنه الخيار الصحيح لاختبار تنويعات الأوامر النصية قبل الالتزام بتوليد بجودة كاملة.

نصائح أوامر نصية تنجح

تتبع كتابة الأوامر في نموذج Wan 2.6 بنية محددة تختلف عن كتابة أوامر توليد الصور:

  1. حدّد الشخص بالتفاصيل الجسدية أولًا
  2. صِف الفعل بلغة واقعية مرتكزة على الفيزياء
  3. حدّد الكاميرا بمصطلحات التصوير السينمائي التقليدية
  4. عرّف البيئة بتفاصيل الإضاءة والجو

مثال: "امرأة في أواخر العشرينات، فستان أبيض فضفاض، تمشي ببطء وسط عشب طويل في مرج عند الساعة الذهبية. الكاميرا ثابتة، لقطة متوسطة، ريح خفيفة في العشب وشعرها، إضاءة خلفية دافئة بلون الكهرمان."

تجنّب الأوصاف المجردة مثل "جميل" أو "سينمائي" وحدها. بدلًا من ذلك، صِف الظروف الفيزيائية التي تُنتج الجمال: زاوية الضوء، وملمس الأسطح، وثقل الحركة.

امرأة بفستان برتقالي محروق تقف على رصيف خشبي باهت تحت الشمس

كيفية استخدام Wan 2.6 على PicassoIA

يتوفر لدى PicassoIA الإصدارات الثلاثة من Wan 2.6 ضمن مجموعة تحويل النص إلى فيديو. إليك كيفية توظيفها خطوة بخطوة.

الخطوة 1: اختر وضعك

افتح صفحة نموذج Wan 2.6 T2V للمحتوى الأصلي، أو صفحة Wan 2.6 I2V إذا كنت تبدأ من صورة. وإذا أردت اختبار تنويعات أوامر نصية متعددة قبل اختيار اتجاه معين، فابدأ بالإصدار Wan 2.6 I2V Flash للحصول على نتائج أسرع.

الخطوة 2: اكتب أمرًا نصيًا قويًا

باتباع البنية المكونة من أربعة أجزاء أعلاه (الشخص، والفعل، والكاميرا، والبيئة)، اكتب أمرك النصي بلغة وصفية بسيطة. فكّر في الأمر كأنك تصف مشهدًا لمدير التصوير على موقع التصوير، لا كأنك تكتب تعليمات لذكاء اصطناعي. التفاصيل الجسدية المحددة تتفوق على مُعدِّلات الجودة المجردة في كل مرة.

ما ينجح:

  • "تتحرك الكاميرا ببطء نحو اليمين بينما يلتفت الشخص لينظر إلى النافذة"
  • "وهج عدسة خفيف من ضوء الشمس المباشر، والشخص مضاء من الخلف"
  • "قماش الفستان يتموج مع الريح، والشعر يتحرك معه"

ما لا ينجح:

  • "تحفة سينمائية ملحمية بجودة 4K فائقة"
  • "إضاءة جميلة ورائعة ومبهرة"
  • "اجعله يبدو احترافيًا"

الخطوة 3: اضبط المعاملات

يمنحك Wan 2.6 التحكم في عدة معاملات أساسية:

  • المدة: ابدأ بمدة 5 ثوانٍ لاختبار الحركة، ثم مدّدها بعد تأكيد الاتجاه
  • الدقة: تُعد 720p النقطة المثالية بين السرعة والجودة، واستخدم 1080p للمخرجات النهائية
  • مقياس التوجيه (Guidance scale): القيم الأعلى تزيد الالتزام بالأمر النصي لكنها قد تقلل الحركة الطبيعية. وإعداد يقارب 7.5 يوازن بين الأمرين بشكل جيد عادةً
  • البذرة (Seed): ثبّت قيمة البذرة بعد أن تجد نتيجة تعجبك، ثم كرّر تعديل الأمر النصي مع إبقاء البذرة ثابتة

💡 نصيحة سير العمل: ولّد بدقة 480p أولًا للتحقق من الحركة والتكوين، ثم أعد التشغيل بدقة 1080p للمخرج النهائي. هذا يوفّر وقت حوسبة كبيرًا.

غرفة عرض سينمائية ليلًا ومشغّل الفيلم يضبط بكرة الفيلم

Wan 2.6 مقابل المنافسين

لا يوجد Wan 2.6 في فراغ. فمشهد توليد الفيديو بالذكاء الاصطناعي في 2027 مزدحم ببدائل قوية، ولكل منها نقاط قوة مختلفة.

النموذجنقطة القوةالقيد
Wan 2.6 T2Vمفتوح الأوزان، فيزياء حركة قويةأبطأ من النماذج التجارية
Kling v2.6تحكم سينمائي في الكاميرافيزياء أقل واقعية في الحركة السريعة
Veo 3صوت أصلي، مخرجات واقعية كالصور الفوتوغرافيةوصول مغلق ومحدود بمعدل الاستخدام
Sora 2اتساق المشهد على المدى الطويلمحصور في منظومة OpenAI
Wan 2.7 T2Vأحدث إصدار، دقة 1080p أصليةأحدث، وأمثلة أوامر مجتمعية أقل

الميزة المميّزة لنموذج Wan 2.6 هي بنيته المفتوحة مقترنةً بـجودة حركة بمستوى تجاري. فبينما تنتج Veo 3 وSora 2 نتائج مبهرة، فإنهما محصوران خلف بوابات وصول مملوكة. أما Wan 2.6 فيمنحك مخرجات مماثلة على بنية تحتية مفتوحة.

للسرعة الخالصة في تحريك الصور، ما زال Wan 2.6 I2V Flash أسرع من معظم البدائل عند مستويات جودة متقاربة. وهو النموذج الذي تلجأ إليه عندما تكون سرعة التكرار أهم من الدقة المطلقة.

يدان تمسكان هاتفًا ذكيًا وتصوران حقل قمح ذهبيًا عند الغروب

حالات استخدام واقعية

النظرية شيء، وهذا هو المكان الذي يثبت فيه Wan 2.6 قيمته فعلًا ضمن سير عمل إنتاجي.

المحتوى القصير لوسائل التواصل

في إنتاج محتوى وسائل التواصل، يتولى Wan 2.6 T2V المسار الكامل من الفكرة إلى المقطع النهائي. يمكن لعلامة سفر أن تصف مشهد وجهة، وتولّد مقطعًا من 5 إلى 7 ثوانٍ، وتحصل على أصل فيديو يوقف التمرير دون تصوير في موقع. والمفتاح هو إبقاء الحركة هادئة: حركات كاميرا بطيئة، وتحريك بيئي لطيف (ريح، ماء، تغيّرات في الضوء) بدلًا من تسلسلات أكشن معقدة.

يتعامل النموذج بشكل خاص جيدًا مع السيناريوهات الحياتية. امرأة تسير في سوق مزارعين، وزوجان على تراس مطعم عند الغسق، وشخص يقرأ بجوار نافذة في ضوء الصباح. هذه المشاهد الهادئة والفوتوغرافية هي المكان الذي يظهر فيه الاتساق الزمني المحسّن لـ Wan 2.6 بأوضح صورة.

ما قبل الإنتاج للأفلام

يُعد التصور المسبق (Pre-vis) من أعلى تطبيقات توليد الفيديو بالذكاء الاصطناعي قيمة في الإنتاج الاحترافي. يستخدم المخرجون القصص المصوّرة لإيصال النية إلى الطاقم، لكن الـ pre-vis المتحرك يوصل حركة الكاميرا والإيقاع والتوزيع الحركي بفعالية أكبر بكثير.

Wan 2.6 قوي بما يكفي لتوليد pre-vis أولي لمشاهد الحوار، واللقطات التأسيسية، والانتقالات. ويبرز هنا إصدار Wan 2.6 I2V بشكل خاص: أدخل صورة مرجعية لموقع التصوير، وصِف حركة الكاميرا، واحصل على نسخة متحركة لكيفية شعور اللقطة قبل أن تلتزم بوقت الطاقم.

امرأة ترتدي بلوزة كتان زرقاء فاتحة على شرفة من البلاط الإيطالي المشمس

فيديو المنتجات والعلامات التجارية

فيديو التجارة الإلكترونية والعلامات التجارية هو المجال الذي يكون فيه تحسين الاتساق في Wan 2.6 أكثر أهمية من الناحية التجارية. عند تحريك لقطة منتج، يجب أن تبقى هوية الموضوع ثابتة عبر الإطارات. كانت إصدارات Wan السابقة تنحرف أحيانًا في تفاصيل سطح المنتج، خاصة في المواد العاكسة والملصقات.

يتعامل Wan 2.6 مع تحريك المنتجات بشكل أفضل بكثير، خاصة في الحركة المُتحكَّم بها: دوران بطيء، ومنتج يخرج من الماء أو الضباب، وتكبير خفيف مع سياق بيئي. وبالنسبة للعلامات التي لم تصبح جاهزة بعد للاستثمار في إنتاج فيديو تجاري، فهذا بديل مقنع.

لفيديو المنتجات تحديدًا، ابدأ بـ Wan 2.6 I2V: قدّم صورة منتج نظيفة على خلفية محايدة، وصِف الحركة المطلوبة، ودع النموذج يتولى التحريك. وتكون النتائج أكثر قابلية للتنبؤ عندما تكون صورة الإطار الأول عالية الجودة.

مصوّر سينمائي يجهّز كاميرا سينمائية على مستنقع اسكتلندي ضبابي عند الفجر

مسار Wan 2.x وما يأتي بعده

يقع Wan 2.6 ضمن سلسلة تتطور بسرعة. نموذجا Wan 2.7 T2V وWan 2.7 I2V متاحان بالفعل، ويقدمان مخرجات أصلية بدقة 1080p وتحسينًا في قدرات مزامنة الصوت. ويتعامل النموذج المرافق Wan 2.2 S2V مع تحويل الصوت إلى فيديو إذا كان مشروعك يتطلب تحريكًا مدفوعًا بالصوت.

يتجه مسار سلسلة Wan نحو:

  • توليد مقاطع أطول مع الحفاظ على التماسك (النقطة المثالية الحالية هي 5 إلى 10 ثوانٍ)
  • دمج الصوت الأصلي مع توليد الفيديو
  • التزام أقوى بالأوامر النصية للمشاهد المعقدة متعددة الأشخاص
  • تشغيل أسرع للنموذج عبر التقطير، على غرار ما يُظهره I2V Flash

بالنسبة لأي شخص يبني توليد الفيديو بالذكاء الاصطناعي ضمن سير عمل منتظم، يمثل Wan 2.6 نقطة تحقق موثوقة وعالية الجودة في مسار هذا التطور. إنه الإصدار الذي انتقل فيه توليد الفيديو بالذكاء الاصطناعي من "عرض مبهر" إلى "أداة إنتاج حقيقية".

💡 مقارنة النماذج: إذا أردت الأحدث والأسرع من عائلة Wan، فإن Wan 2.7 T2V يستحق التجربة إلى جانب 2.6. وتظهر الفروقات بأوضح صورة في مخرجات 1080p وتسلسلات حركة الكاميرا المعقدة.

امرأة ترتدي بيكيني أبيض عند حوض سباحة لا متناهي في سانتوريني يطل على بحر إيجه

جرّبه على PicassoIA

أسرع طريقة لترى ما يفعله Wan 2.6 فعلًا هي أن تشغّله بنفسك. يتوفر لدى PicassoIA الإصدارات الثلاثة: Wan 2.6 T2V وWan 2.6 I2V وWan 2.6 I2V Flash، دون الحاجة إلى بنية تحتية محلية أو إعداد مفتاح API.

إذا كنت تبدأ من الصفر، فجرّب T2V بأمر نصي وصفي بسيط. صِف شخصًا، ومكانًا، ووقتًا من اليوم، وموضع الكاميرا. هذا يكفي للحصول على نتيجة أولى مقنعة. وبمجرد أن تعتاد على طريقة تفسير النموذج للغة الحركة، انتقل إلى I2V وابدأ من صورة فوتوغرافية لديك بالفعل.

إلى جانب Wan 2.6، يمنحك PicassoIA الوصول إلى المشهد الكامل لنماذج الفيديو المتقدمة: من Kling v2.6 للقطات المتحكَّم بها بالكاميرا، إلى Veo 3 لفيديو مدمج مع الصوت، وSora 2 لتوليد المشاهد الطويلة. ووجود كل هذه النماذج في مكان واحد يتيح لك اختبار الأمر النصي نفسه عبر نماذج متعددة ورؤية أيها يناسب أسلوب إنتاجك فورًا.

عصر توليد الفيديو بالذكاء الاصطناعي كأداة إبداعية جادة لا يقترب. إنه هنا. وWan 2.6 واحد من أوضح الأدلة على ذلك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة