Wan 2.6 لحركة أكثر سلاسة وتفاصيل أدق: ما الذي تغيّر في هذا الإصدار

يقدّم Wan 2.6 تحسينات ملحوظة في سلاسة الحركة والتفاصيل البصرية عند توليد الفيديو بالذكاء الاصطناعي. يشرح هذا المقال الأسباب التقنية وراء هذه التحسينات، ويوضح الفرق الحقيقي بين إصداري T2V و I2V، ويرشدك خطوة بخطوة إلى استخدام الإصدارين على PicassoIA، مع نصائح حول المعاملات تغيّر نتائجك فعلًا.

Wan 2.6 لحركة أكثر سلاسة وتفاصيل أدق: ما الذي تغيّر في هذا الإصدار
Cristian Da Conceicao
مؤسس Picasso IA

لم يكن الفرق بين الفيديو "المولّد بالذكاء الاصطناعي" والفيديو "الذي يبدو حقيقيًا" أضيق من اليوم، و Wan 2.6 واحد من أوضح الأمثلة على ذلك. صدر الإصدار 2.6 ضمن سلسلة النماذج المستمرة من wan-video، ويستهدف تحديدًا أكبر نقطتين ضعف في مخرجات فيديو الذكاء الاصطناعي: الاتساق الزمني (مدى سلاسة حركة الأشياء بين الإطارات) والحفاظ على التفاصيل المكانية (مدى ثبات الملمس والحواف والبنية الدقيقة عبر المقطع). إذا عملت مع أي إصدار سابق من Wan أو مع نموذج منافس، ولاحظت أن الشعر أو القماش أو الماء يتحوّل إلى كتلة مموّهة في منتصف المقطع، فإن Wan 2.6 هو الحل المباشر لهذه المشكلة.

ما هو Wan 2.6 فعلًا

يقع Wan 2.6 في منتصف سلسلة توليد wan-video، فوق 2.5 وأدنى من السلسلة الأحدث 2.7. يعتمد على بنية محوّل الانتشار (diffusion transformer) المدرَّب على 14 مليار معامل، وهذا يمنحه قدرة أكبر بكثير من الإصدارات الأخف 1.3B في العائلة نفسها. لا يظهر هذا العدد الأكبر من المعاملات في المقاييس المعيارية المجردة، بل بطريقة محددة جدًا: قدرة النموذج على الحفاظ على هوية الأجسام ومظهر السطوح بثبات عبر الإطارات، من دون الحاجة إلى خطوات إزالة ضوضاء قوية.

البنية التي تقف خلفه

يعالج النموذج الفيديو كتسلسل من الإطارات الكامنة (latent frames) عبر آلية انتباه كاملة بدلًا من انتباه النافذة المنزلقة، وهذا أحد الأسباب التي تجعله يتعامل مع مسارات الحركة الطويلة بشكل أفضل من النماذج المحدودة بالنوافذ. يعني الانتباه الزمني الكامل أن كل إطار في تسلسل التوليد يمكنه التأثير مباشرة في كل إطار آخر، مما يمنع مشكلة "الانجراف" حيث يتغيّر شكل الجسم المتحرك أو لونه تدريجيًا مع تقدّم المقطع.

منظر جوي لنهر يجري عبر غابة صنوبر في الخريف، يُظهر حركة طبيعية سلسة

لماذا يهم عدد المعاملات

يملك نموذج 14B قدرة تمثيلية تعادل تقريبًا عشرة أضعاف قدرة نموذج 1.3B. عمليًا، هذا يعني أن الشبكة يمكنها تخزين واستخدام تصوّرات أدق للحركة مستمدة من بيانات التدريب. عندما تطلب "امرأة تمشي عبر حقل"، يحتاج النموذج الأصغر إلى التعميم بشكل واسع. أما النموذج الأكبر فقد رأى تنوعًا كافيًا ليعرف كيف تتحرك الأقمشة الواقعية بسرعات مختلفة للمشي، وكيف تتصرف الأعشاب تحت الأقدام في الريح، وكيف يحافظ على اتجاه إضاءة ثابت طوال المقطع.

💡 نموذج 14B أبطأ من الإصدارات السريعة، لكنه ينتج ملمسًا أفضل وثباتًا أوضح للحواف بشكل ملحوظ. للتصيير بالجودة النهائية، فضّله دائمًا على الإصدارات المحسّنة للسرعة.

مشكلة الحركة في فيديو الذكاء الاصطناعي

عانى توليد فيديو الذكاء الاصطناعي لسنوات من مشكلة ثابتة: الإطارات تبدو رائعة كلٌّ على حدة، لكن الانتقال بينها يخلق عيوبًا بصرية أو وميضًا في الملمس أو تشوّهًا في الأطراف. هذه هي مشكلة الاتساق الزمني، وهي تحديدًا ما يميّز نماذج الفيديو الجيدة عن المتوسطة.

شرح الاتساق الزمني

يعني الاتساق الزمني أن الهوية البصرية للجسم تبقى ثابتة مع مرور الوقت. الجاكيت الأحمر يبقى أحمر، والشعر يحافظ على طوله، واليد التي تتحرك يسارًا تواصل حركتها يسارًا من دون ارتعاش عشوائي. تولّد نماذج الانتشار الفيديو عبر إزالة الضوضاء من الإطارات، وبدون اقتران زمني قوي، يكون كل إطار في الأساس نسخة معدّلة قليلًا من ضوضاء عشوائية مقيّدة بالأمر النصي. الروابط بين الإطارات ضعيفة، لذلك تتراكم الاختلافات الصغيرة لتصبح عيوبًا مرئية.

صورة ماكرو مقرّبة لقطرات ماء في منتصف السقوط، تجمّد الحركة بدقة بلورية

ما الذي يجعل الحركة تبدو "من صنع الذكاء الاصطناعي"

ثلاثة أنماط محددة للعطب هي الأكثر وضوحًا للمشاهدين:

  1. انزلاق الملمس: تبدو أنماط السطح مثل ألياف الخشب ونسيج القماش أو ملمس الجلد وكأنها تتحرك وتنجرف حتى عندما يكون الجسم نفسه ثابتًا
  2. تشوّه الأطراف: تتغيّر أشكال الأصابع أو الذراعين أو الساقين أثناء الحركة لأن النموذج يفقد تتبّع الاتساق التشريحي
  3. وميض الخلفية: تنبض العناصر الثابتة في الخلفية أو تتلألأ بين الإطارات بسبب تباين الضوضاء على مستوى الإطار

يعالج Wan 2.6 الأنماط الثلاثة جميعها من خلال بنية الانتباه لديه، وبنظام تدريب مصمم خصيصًا حول فقدان الاتساق في الحركة، إذ يعاقب النموذج أثناء التدريب على هذه الأنواع بالذات من العيوب.

كيف يتعامل Wan 2.6 مع التفاصيل

التفاصيل المكانية في الفيديو أصعب منها في الصور، لأن النموذج يجب أن يحافظ على هذه التفاصيل عبر الزمن. توليد إطار واحد حاد تحدٍّ بحد ذاته. أما الحفاظ على المستوى نفسه من الحدة بعد 40 إطارًا، بعد أن تتحرك الكاميرا أو يتغيّر موضع الشخص، فهو مشكلة أصعب بشكل جوهري.

عرض الملمس بتفاصيل دقيقة

يستخدم Wan 2.6 مشفّر VAE (المشفّر الذاتي المتغيّر) بنسبة ضغط مكاني أعلى من الإصدارات السابقة، وهذا يحافظ على معلومات أكثر عن الملمس خلال خطوة الترميز الكامن. ما يعنيه هذا في المخرجات: نسيج القماش ومسام الوجه وفصل خصلات الشعر والمواد ذات الأسطح الخشنة تحافظ كلها على بنيتها بشكل أفضل مما كانت عليه في 2.5 أو في النماذج الأقدم.

راقصة باليه في منتصف قفزة أمام سماء غائمة، وقماش التوتو منفوش بتفاصيل دقيقة

الفرق بين 480p و720p

يولّد Wan 2.6 بدقة 720p الأصلية في إعداده القياسي، وهي خطوة أعلى من 480p في الإصدارات الأقدم. لكن رقم الدقة وحده لا يروي القصة كاملة. فالفيديو بدقة 720p ذي تفاصيل الملمس الضعيفة يبدو أسوأ من مقطع 480p حاد. ما يقدّمه Wan 2.6 هو محتوى ترددي مكاني عالٍ بدقة 720p، أي أنه يصيّر تفاصيل صغيرة وكثيفة بدلًا من بقع ألوان ناعمة منخفضة التردد. تظهر التفاصيل الدقيقة في الشعر والفرو والمنسوجات والأوراق بوضوح أكبر في المخرجات الفعلية.

💡 للقطات القريبة التي يكون فيها تفصيل الملمس بالغ الأهمية، مثل عروض المنتجات، أو تحريك البورتريه، أو حركة الأقمشة، يُعد Wan 2.6 خيارًا أقوى من كثير من النماذج ذات الدقة الأعلى التي تضحّي بالتفاصيل من أجل السرعة.

T2V مقابل I2V: أيهما تستخدم

يأتي Wan 2.6 في إصدارين أساسيين يخدمان سير عمل إبداعي مختلفًا. اختيار الإصدار الصحيح يغيّر كلًّا من المدخلات التي تحتاج إلى تجهيزها ونوع المخرجات التي يمكنك توقعها.

تحويل النص إلى فيديو باستخدام Wan 2.6 T2V

يأخذ Wan 2.6 T2V أمرًا نصيًا ويولّد مقطع فيديو من الصفر. هذا هو الخيار الصحيح عندما تنشئ محتوى انطلاقًا من فكرة لا من صورة مصدر. يعمل بأفضل شكل مع:

  • الأوامر القائمة على الحركة: أوصاف الحركة تعطي نتائج أفضل من أوصاف المشاهد الثابتة
  • الأوامر الجوّية: الطقس وظروف الإضاءة والحركة البيئية (الريح والمطر والحشود) من المجالات التي يتفوّق فيها Wan 2.6 T2V
  • المقاطع القصيرة المتكررة: مقاطع من 4 إلى 8 ثوانٍ باتجاه حركة واضح

امرأة شابة تعمل على حاسوب محمول تحت إضاءة محيطة ناعمة ذات لونين

يستجيب النموذج جيدًا لتعليمات حركة الكاميرا داخل الأمر النصي. عبارات مثل "دولي بطيء للأمام" أو "لقطة تتبّع" أو "كاميرا ثابتة" تؤثر فعليًا في سلوك المخرجات.

تحويل الصورة إلى فيديو باستخدام Wan 2.6 I2V

يأخذ Wan 2.6 I2V صورة ثابتة ويحرّكها. هذا الخيار أكثر تحكمًا لأنك تحدد الحالة البصرية الابتدائية بدقة. ثم يولّد النموذج حركة تتسق مع محتوى صورتك ومع الأمر النصي الذي يصف الحركة.

لتحريك البورتريهات أو صور المنتجات أو اللقطات المعمارية الثابتة أو الرسوم التوضيحية إلى فيديو، يُعد I2V سير العمل الأفضل. ويتميز النموذج بشكل خاص في:

  • التحريك البيئي الطبيعي (الأشجار والماء والسماء والأقمشة)
  • الحركة الدقيقة للوجه والجسم من دون تشوّه
  • حركات الكاميرا بالمنظور المتوازي (parallax) على تصوير المناظر الطبيعية والعمارة

Wan 2.6 I2V Flash هو الإصدار الأسرع من النموذج نفسه، إذ يضحّي ببعض دقة التفاصيل مقابل تقليل كبير في زمن التوليد. استخدمه للتكرار والمسودات، ثم انتقل إلى I2V الكامل للمخرج النهائي.

كيفية استخدام Wan 2.6 على PicassoIA

كلا إصداري Wan 2.6 متاحان مباشرة على منصة PicassoIA. إليك الخطوات بالتفصيل لكل منهما.

يدا رجل تكتبان بسرعة على لوحة مفاتيح ميكانيكية، وحركة أطراف الأصابع ملتقطة بالتفصيل

خطوة بخطوة: تحويل النص إلى فيديو

  1. افتح Wan 2.6 T2V على PicassoIA
  2. اكتب أمرك النصي في حقل النص. ابدأ بالموضوع الرئيسي والحركة، ثم أضف البيئة والإضاءة
  3. اضبط الدقة على 720p للحفاظ على أفضل تفاصيل
  4. اضبط المدة بين 4 و6 ثوانٍ للحصول على أكثر النتائج تماسكًا
  5. اضبط مقياس التوجيه بين 6 و8 (القيم الأعلى تتبع الأمر النصي بحرفية أكبر، والقيم الأدنى تتيح تنوعًا إبداعيًا أكبر)
  6. اضغط على Generate وانتظر حتى يُصيَّر المقطع

💡 إضافة أوصاف لسرعة الحركة إلى أمرك النصي ("ببطء"، "بسرعة"، "ينجرف بلطف") تؤثر تأثيرًا قابلًا للقياس في سرعة المخرجات. يقرأ Wan 2.6 T2V هذه المعدّلات بموثوقية أكبر من كثير من النماذج المنافسة.

خطوة بخطوة: تحويل الصورة إلى فيديو

  1. افتح Wan 2.6 I2V على PicassoIA
  2. ارفع صورة المصدر. للحصول على أفضل النتائج استخدم صورة بنسبة 16:9 وبدقة 1280x720 أو أعلى
  3. اكتب أمرًا نصيًا للحركة يصف ما الذي يجب أن يتحرك وكيف. لا تصف محتوى الصورة نفسه، بل الحركة فقط ("يتطاير الشعر برفق في نسيم دافئ، وتحفحف الأوراق في الخلفية ببطء")
  4. اضبط قوة الحركة بين 50 و70 للحصول على حركة تبدو طبيعية من دون تشوّه مفرط
  5. اضغط على Generate

نصائح المعاملات التي تهم

المعاملالنطاق الموصى بهالتأثير
Guidance Scale6.5 إلى 7.5الالتزام بالأمر النصي مقابل الجودة البصرية
Motion Strength (I2V)45 إلى 75مقدار الحركة مقابل دقة الصورة
Inference Steps30 إلى 50الجودة مقابل سرعة التوليد
Duration4 إلى 6 ثوانٍالاتساق عبر الزمن

موقع تصوير سينمائي خارجي ليلًا بإضاءة سينمائية وأرصفة حجرية مبللة

إعدادات قوة الحركة المنخفضة في I2V مثالية لتحريك البورتريه والمنتجات، حيث تريد حياة خفيفة بدلًا من حركة درامية. أما الإعدادات الأعلى فتناسب اللقطات البيئية ولقطات الحركة التي تكون فيها الحركة واسعة النطاق هي الهدف.

Wan 2.6 مقابل النماذج القريبة

معرفة موقع Wan 2.6 بالنسبة إلى النماذج المجاورة تساعدك على اختيار الأداة المناسبة لكل مشروع.

مقارنة مع Wan 2.5 و Wan 2.7

Wan 2.5 T2V سلف قادر، لكنه يُظهر نقاط ضعف النموذج الأقدم في عرض التفاصيل الدقيقة للملمس. في المقاطع التي تحتوي على أقمشة أو شعر أو مواد سطحية معقدة، يميل 2.5 إلى إنتاج انزلاق ملمس أكبر. يعالج Wan 2.6 هذا مباشرة عبر مشفّر VAE المحسّن واقتران الانتباه.

يمثّل Wan 2.7 T2V وWan 2.7 I2V الخطوة التالية إلى الأمام، مع تحسينات إضافية في الدقة وديناميكيات الحركة. لأعلى جودة مخرجات في سلسلة Wan، يبقى 2.7 هو السقف الحالي. لكن يظل Wan 2.6 خيارًا قويًا عندما يكون زمن التوليد مهمًا، فهو أسرع من 2.7 باستمرار عند الإعدادات المتقاربة.

طائر الطنان محلّقًا في الهواء ويتغذى من زهرة استوائية، مع ظهور ضبابية الجناح ولمعان الريش

مقارنة بالاستوديوهات الأخرى

مقارنة مركّزة في المقاييس التي يتميز فيها Wan 2.6:

النموذجسلاسة الحركةتفاصيل الملمسالسرعةالدقة
Wan 2.6 T2Vعالية جدًاعاليةمتوسطة720p
Wan 2.6 I2Vعالية جدًاعالية جدًامتوسطة720p
Wan 2.5 T2Vمتوسطةمتوسطةسريعة480p إلى 720p
Wan 2.7 T2Vممتازةعالية جدًابطيئة1080p
Wan 2.6 I2V Flashعاليةمتوسطةسريعة جدًا720p

يضحّي إصدار Flash بتفاصيل الملمس مقابل السرعة، مما يجعله الأداة الصحيحة للتكرار السريع لا للمخرج النهائي.

متى يكون Wan 2.6 الخيار الصحيح

ليس كل مشروع يحتاج إلى Wan 2.6. معرفة متى تلجأ إليه مقابل بديل أسرع أو بدقة أعلى توفّر الوقت والنقاط.

السيناريوهات التي يتفوّق فيها

  • تحريك المنتجات: تحريك صورة منتج بحركة خفيفة، أو لمعان متحرك، أو حركة قماش. يتعامل معها إصدار I2V بأقل قدر من التشوّه
  • تحريك البورتريه: إضافة تنفّس طبيعي، أو حركة عين، أو انجراف خفيف للشعر إلى بورتريه ثابت
  • مقاطع الطبيعة والبيئة: الماء والريح والأوراق والحركة الجوّية من المجالات التي يكون فيها الاتساق الزمني الأهم
  • المحتوى القصير لوسائل التواصل: حلقات من 4 إلى 6 ثوانٍ تكون فيها الحركة السلسة والمصقولة هي متطلب الجودة الأساسي

مقارنة لمشهد مدينة ليلي تُظهر مخرجات ذكاء اصطناعي ضبابية مقابل فيديو ذكاء اصطناعي حاد عالي التفاصيل

متى تختار شيئًا آخر

  • المقاطع الطويلة التي تتجاوز 10 ثوانٍ: يتراجع الاتساق الزمني مع المدد الأطول. للمقاطع التي تتجاوز 8 ثوانٍ، يستحق Wan 2.7 I2V أو نماذج أخرى ذات اتساق أفضل على المدى الطويل وقت التوليد الإضافي
  • الدقة 1080p شرط إلزامي: يتوقف Wan 2.6 عند 720p. للحصول على مخرجات 1080p، انتقل إلى Wan 2.7
  • النماذج الأولية السريعة بكميات كبيرة: إذا كنت تحتاج إلى 20 مقطعًا تجريبيًا قبل حسم أسلوب ما، فإن Wan 2.6 I2V Flash أو الإصدارات الأسرع ستوفر وقتًا كبيرًا

💡 استخدم Flash لتجارب المفاهيم، ثم انتقل إلى النموذج الكامل بعد أن تحسم نهج الحركة وصياغة الأمر النصي. يُنتج سير العمل هذا عادةً نتائج نهائية أفضل من الذهاب مباشرة إلى النموذج الكامل من دون تكرار.

ما الذي تُظهره المخرجات الحقيقية فعلًا

النظر في مخرجات Wan 2.6 عبر أنواع مختلفة من الموضوعات يكشف أنماطًا ثابتة. تحريك الأقمشة والملابس هو المجال الذي يتفوّق فيه على معظم البدائل في فئة سرعة التوليد نفسها. يُنتج أمر بسيط مثل "فستان خفيف يتحرك مع الريح" محاكاة قماش كانت ستتطلب تصييرًا قائمًا على الفيزياء قبل بضع سنوات فقط.

حركة الإنسان موثوقة للحركة البطيئة إلى المتوسطة. المشي وتحريك الرأس وإيماءات اليد تُصيَّر باتساق تشريحي جيد. الحركة الرياضية السريعة هي المجال الوحيد الذي لا تزال تظهر فيه العيوب بتكرار أكبر.

تحريك البيئة نقطة قوة ثابتة. الماء والغيوم والنار والنباتات تستجيب للأوامر بطرق تبدو معقولة فيزيائيًا. يبدو أن النموذج تدرّب على كميات كبيرة من لقطات الطبيعة، وهذا واضح في جودة المخرجات لهذه الأنواع من الموضوعات.

سوق شارع مزدحم في جنوب شرق آسيا بتفاصيل لونية غنية وعمق متعدد الطبقات في الحشود

تحريك العمارة والمنتجات عبر مسار I2V ينتج نتائج نظيفة بأقل قدر من التشوّه. حركات الكاميرا بالمنظور المتوازي على التصوير الفوتوغرافي الثابت قوية بشكل خاص، إذ تخلق وهمًا مقنعًا بالعمق من صور مصدر مسطّحة.

ابدأ بإنشاء فيديوهاتك الخاصة على PicassoIA

أفضل طريقة لترى ما الذي يفعله Wan 2.6 فعلًا لحالتك الخاصة هي تشغيل أوامرك الخاصة. تتيح لك PicassoIA الوصول إلى Wan 2.6 T2V وWan 2.6 I2V إلى جانب عائلة Wan الكاملة، بما في ذلك Wan 2.5 T2V Fast وWan 2.7 T2V، إضافةً إلى أكثر من 100 نموذج آخر لتحويل النص إلى فيديو في واجهة واحدة.

إذا كنت تبدأ مع التحريك للمرة الأولى، فابدأ بإصدار I2V. ارفع صورة فوتوغرافية لديك بالفعل، واكتب أمرًا نصيًا بسيطًا للحركة (من 15 إلى 25 كلمة تصف فقط ما يتحرك وكيف)، ثم وَلِّد بالإعدادات الافتراضية. ستمنحك هذه المخرجات الأولى خط أساس واضحًا لما يجيده النموذج مع نوع محتواك.

من هناك، فإن تعديل متغيّر واحد في كل مرة، سواء كان صياغة الأمر النصي أو قوة الحركة أو مقياس التوجيه، يمنحك أسرع طريق إلى جودة المخرجات المحددة التي تسعى إليها. يكافئ Wan 2.6 التجريب، ومع توفر إصدار Flash للتكرار السريع، تكون كلفة التجريب منخفضة.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة