كيفية استخدام Wan 2.6 خطوة بخطوة: أنشئ فيديوهات مذهلة بالذكاء الاصطناعي من منزلك
Wan 2.6 هو أقوى نموذج مفتوح المصدر لتوليد الفيديو حتى الآن، إذ يقدّم حركة أوضح، والتزامًا أقوى بالأوامر النصية، ومخرجات سينمائية في وضعي تحويل النص إلى فيديو وتحويل الصورة إلى فيديو. يرشدك هذا المقال خلال كل خطوة، من كتابة أول أمر نصي إلى ضبط الدقة ومعدل الإطارات وشدة الحركة، لتحصل على نتائج بجودة احترافية من اليوم الأول.
Wan 2.6 خطوة حقيقية إلى الأمام في توليد الفيديو مفتوح المصدر. إذا كنت تتابع المجال، فأنت تعرف بالفعل أن سلسلة Wan من فريق البحث تقدّم نتائج تنافسية باستمرار. يدفع الإصدار 2.6 هذا التقدم أبعد، بتماسك أفضل للحركة، وتفاصيل وجه أدق، والتزام أفضل بشكل ملحوظ بالأوامر النصية. سواء كنت تصنع مقاطع سينمائية لوسائل التواصل الاجتماعي، أو تحرّك صور منتجات، أو تبني سير عمل فيديو متكاملًا، فهذا هو النموذج الذي ينبغي أن تعرفه الآن.
ماذا يفعل Wan 2.6 فعلًا
Wan 2.6 نموذج مفتوح المصدر لتوليد الفيديو قائم على الانتشار. يأخذ إما وصفًا نصيًا أو صورة ثابتة كمدخل، ويُخرج مقطع فيديو قصيرًا، عادةً بطول 4 إلى 8 ثوانٍ، وبدقة تصل إلى 1080p. يعمل النموذج كعملية انتشار على كامنات الفيديو، أي أنه يُحسّن الإطارات المشوّشة تدريجيًا لتصبح حركة متماسكة.
ما يميّزه عن النماذج المفتوحة المصدر السابقة هو حجم التدريب والتغييرات المعمارية التي تمكّنه من التعامل مع الاتساق الزمني عبر الإطارات، فيحافظ على الشخصية نفسها والإضاءة والبيئة متماسكةً دون وميض أو انجراف.
شرح الوضعين
يأتي Wan 2.6 في نسختين أساسيتين:
الوضع
المدخل
حالة الاستخدام
T2V (تحويل النص إلى فيديو)
أمر نصي فقط
إنشاء مشاهد من الصفر
I2V (تحويل الصورة إلى فيديو)
صورة ثابتة + أمر نصي
تحريك الصور، ولقطات المنتجات، والبورتريهات
الوضعان متاحان على PicassoIA. نسخة تحويل النص إلى فيديو هي Wan 2.6 T2V، ونسخة تحويل الصورة إلى فيديو هي Wan 2.6 I2V. وهناك أيضًا Wan 2.6 I2V Flash، المُحسَّن للسرعة عندما تحتاج إلى معاينات سريعة.
كيف يختلف عن الإصدارات السابقة
كان Wan 2.5 T2V قادرًا بالفعل، لكن 2.6 يعالج أبرز نقاط ضعفه:
تماسك وجوه أفضل: تبقى الوجوه متسقة من إطار إلى آخر
التزام أقوى بالأوامر النصية: تُتبع أوصاف المشاهد المعقدة بحرفية أكبر
واقعية حركة محسّنة: الحركة المبنية على الفيزياء للقماش والشعر والماء أكثر إقناعًا بشكل ملحوظ
ملاحظة: للحصول على توليد أسرع مع التضحية ببعض الجودة، يبقى Wan 2.2 T2V Fast خيارًا ممتازًا للمسودات السريعة.
قبل أن تكتب أي أمر نصي
معظم نتائج Wan 2.6 السيئة تأتي من أوامر نصية سيئة. قبل لمس أي إعدادات، تحتاج إلى معرفة كيف يقرأ النموذج مدخلاتك.
كلمات الأجواء: "ضبابي"، "مشبع بالضباب"، "عاصف"، "ممطر"، "مغبّر"
نصيحة: صِف ما تفعله الكاميرا، لا الشخص فقط. يستجيب Wan 2.6 جيدًا للغة توجيه الكاميرا السينمائية.
استخدام Wan 2.6 لتحويل النص إلى فيديو خطوة بخطوة
هذا هو سير العمل الأساسي لإنشاء مقطع من الصفر باستخدام Wan 2.6 T2V.
الخطوة 1: اكتب وصف مشهدك
ابدأ بجملة واحدة تغطي الشخص والفعل والبيئة. ثم وسّع كل عنصر:
افتح محرر نصوص بسيطًا
اكتب مشهدك الأساسي في سطر واحد
أضف الإضاءة في السطر الثاني
أضف حركة الكاميرا في السطر الثالث
أضف وسوم الجودة والأسلوب في النهاية
بنية المثال:
A man in a dark coat standing at a rain-soaked city intersection at night,
neon reflections on wet pavement, slow zoom out from close face to wide street,
cinematic, photorealistic, 8K, film grain
الخطوة 2: اضبط المعاملات
بعد أن يصبح أمرك النصي جاهزًا، اضبط هذه الإعدادات قبل التوليد:
المعامل
القيمة الموصى بها
السبب
الدقة
1280x720 أو 1920x1080
يوازن بين الجودة والسرعة
الإطارات
81 إطارًا (حوالي 5 ثوانٍ بمعدل 16fps)
طول قياسي، وقوس حركة جيد
مقياس التوجيه (Guidance Scale)
من 5.0 إلى 7.0
كلما ارتفع، زاد التزام النموذج الحرفي بالأمر النصي
الخطوات
من 30 إلى 50
خطوات أكثر تعني وضوحًا أعلى لكن بسرعة أقل
قيمة البذرة (Seed)
ثابتة (مثلًا 42)
ثبّتها عندما تجد تنويعة جيدة
الخطوة 3: ولّد وكرّر
شغّل أول توليد لك كمسودة. ولا تحكم على النتيجة بمعزل عن غيرها:
دوّن ما نجح: التكوين، والإضاءة، والاتجاه العام للحركة
دوّن ما انكسر: الوجوه، وعيوب الحركة، والأشياء غير الصحيحة
عدّل متغيرًا واحدًا في كل مرة: تغيير الأمر النصي والتوجيه معًا في الوقت نفسه يجعل من المستحيل معرفة ما الذي حسّن مخرجاتك
استخدام Wan 2.6 لتحويل الصورة إلى فيديو خطوة بخطوة
يبدأ سير عمل I2V بصورة ثابتة. يقرأ النموذج تكوين الصورة وعمقها ومحتواها، ثم يحركها بناءً على أمر الحركة الخاص بك.
اختيار الصورة المصدر المناسبة
ليست كل الصور تتحرك بالقدر نفسه من الجودة. يعمل Wan 2.6 I2V بأفضل شكل عندما:
يكون هناك شخص واضح ومنفصل عن الخلفية: البورتريهات، ولقطات المنتجات لشخص واحد، والأشياء المعزولة
تكون الصورة ذات إضاءة طبيعية: إضاءة الاستوديو المسطحة أو الصور شديدة التعريض للضوء تنتج حركة مسطحة
يتمتع التكوين بعمق: الشخص أمام خلفية غير واضحة يمنح النموذج إشارات مكانية أقوى
تجنّب: الصور المعالجة بكثافة، أو صور الذكاء الاصطناعي التي تظهر فيها عيوب مرئية، أو الصور التي تضم عدة أشخاص متداخلين ومعقدين.
توجيه الحركة بالأوامر النصية
مع Wan 2.6 I2V، يكون أمرك النصي توجيهًا للحركة لا وصفًا للمشهد. أنت تخبر النموذج كيف يتحرك ما هو موجود في الصورة بالفعل:
جيد: "حركة كاميرا بطيئة نحو اليمين، ريح خفيفة في الشعر، تنفّس ناعم لتأثير البوكيه"
جيد: "يدير الشخص رأسه قليلًا نحو اليمين، ويرمش بعينيه بشكل طبيعي"
سيئ: "امرأة تقف في غابة" (وصفي أكثر من اللازم، وتوجيه الحركة غير كافٍ)
نصيحة: لمعاينات أسرع قبل الالتزام بتوليد كامل، يقلّل Wan 2.6 I2V Flash زمن التوليد بشكل ملحوظ مع خسارة طفيفة في الجودة على مرحلة المسودة.
كيفية استخدام Wan 2.6 على PicassoIA
يتوفر على PicassoIA كل من Wan 2.6 T2V وWan 2.6 I2V مباشرة ضمن مجموعته. إليك سير العمل الدقيق.
الخطوة 1: افتح النموذج
انتقل إلى صفحة Wan 2.6 T2V على PicassoIA. سترى لوحة الإدخال على اليسار ومنطقة معاينة المخرجات على اليمين. إذا كنت تعمل من صورة ثابتة، فافتح Wan 2.6 I2V بدلًا من ذلك.
الخطوة 2: املأ الإعدادات
لتحويل النص إلى فيديو:
الصق أمرك النصي في حقل الإدخال الرئيسي
أضف أمرك النصي السلبي (انظر القسم أدناه)
اضبط الدقة: 1280x720 للحصول على نتائج أسرع، و1920x1080 للجودة النهائية
اضبط عدد الإطارات: 81 أو 97 إطارًا تعمل جيدًا لطول مقطع طبيعي
اضبط مقياس التوجيه: ابدأ من 6.0
اضبط خطوات تشغيل النموذج: 40 قيمة افتراضية موثوقة
لتحويل الصورة إلى فيديو:
ارفع صورتك المصدر في حقل إدخال الصورة
اكتب أمر الحركة الذي يصف كيف يجب أن يتحرك المشهد
اضبط الدقة وإعدادات الإطارات نفسها كما ورد أعلاه
الخطوة 3: ولّد وحمّل
انقر على «ولّد». يضع PicassoIA مهمتك في قائمة الانتظار ويبدأ المعالجة. يختلف وقت التوليد حسب الدقة وعدد الإطارات، ويستغرق عادةً من 2 إلى 5 دقائق لمقطع بدقة 720p.
عند الانتهاء، يظهر الفيديو في لوحة المخرجات. عاينه مباشرة وحمّل ملف MP4 من الواجهة مباشرة.
نصيحة: إذا أظهرت نتيجتك الأولى عيوبًا ملحوظة في الوجوه أو الأيدي، فجرّب خفض مقياس التوجيه بمقدار 0.5 إلى 1.0 وأعد التوليد بالبذرة نفسها. غالبًا ما يخفف التوجيه المنخفض العيوب الناتجة عن الحدّة الزائدة.
الإعدادات التي تهم فعلًا
يركّز معظم المبتدئين على الجماليات ويغفلون المعاملات التي تتحكم في جودة المخرجات.
الدقة وعدد الإطارات
إليك مرجعًا عمليًا لاختيار إعدادات المخرجات:
الدقة
عدد الإطارات
المدة التقريبية
حالة الاستخدام
832x480
49 إطارًا
حوالي 3 ثوانٍ
اختبار المسودات
1280x720
81 إطارًا
حوالي 5 ثوانٍ
جودة قياسية
1920x1080
81 إطارًا
حوالي 5 ثوانٍ
المخرج النهائي
1920x1080
121 إطارًا
حوالي 7.5 ثانية
مقاطع طويلة
بالنسبة لمعظم حالات الاستخدام على وسائل التواصل الاجتماعي، تحقق 1280x720 بعدد 81 إطارًا أفضل توازن بين الجودة وتكلفة التوليد.
شدة الحركة ومقياس التوجيه
مقياس التوجيه (ويُسمى أيضًا مقياس CFG) من أكثر المعاملات تأثيرًا:
أقل من 4.0: تفسير فضفاض، وحرية إبداعية، وقد يتجاهل أمرك النصي
من 4.0 إلى 6.0: متوازن، وغالبًا مثالي للمشاهد المعقدة
من 6.0 إلى 8.0: التزام صارم، وقد يُدخل حدّة زائدة أو عيوبًا
أعلى من 8.0: غالبًا ما يؤدي إلى نتائج مشبعة بشكل مفرط وغير طبيعية
تقدّم بعض التطبيقات أيضًا شريط شدة الحركة أو motion bucket. القيم المنخفضة تنتج حركة خفيفة وواقعية، والقيم المرتفعة تنتج حركة درامية ومبالغًا فيها.
أوامر سلبية تعمل بفعالية
استخدم هذا كأمر نصي سلبي أساسي للحصول على مخرجات أنظف:
blurry, low quality, artifacts, distorted faces, extra limbs,
flickering, watermark, text overlay, unrealistic motion, choppy frames
أضف مصطلحات محددة بناءً على ما تفشل فيه توليداتك. إذا كانت الوجوه تتشوه، فأضف "deformed face, bad anatomy". وإذا كان الفيديو ثابتًا أكثر من اللازم، فأضف "no motion, static, frozen".
5 أخطاء تُفسد نتائج Wan 2.6
هذه أكثر الأمور شيوعًا التي تُوقع مستخدمي Wan 2.6 لأول مرة:
أوامر نصية تصف صورة ثابتة لا حركة: "امرأة تقف في حقل" تنتج حركة شبه معدومة. أضف أفعال حركة وتعليمات كاميرا.
تغيير متغيرات كثيرة في وقت واحد: إذا غيّرت الأمر النصي والتوجيه والدقة والبذرة معًا، فلن تعرف أبدًا ما الذي حسّن مخرجاتك.
استخدام مقياس توجيه مرتفع في مشاهد معقدة بعدة أشخاص: تعدد الأشخاص مع CFG مرتفع غالبًا ما يؤدي إلى عيوب. اخفض القيمة إلى 4.5 إلى 5.5 للقطات الحشود أو المشاهد متعددة الأشخاص.
تجاهل الأوامر النصية السلبية تمامًا: حتى أمر سلبي أساسي يقلّل تكرار العيوب بشكل ملحوظ.
التوليد بأعلى دقة في المسودة الأولى: تستغرق دقة 1080p وقتًا أطول بكثير للمعالجة. اختبر أمرك النصي بدقة 720p، ثم شغّل النسخة النهائية المعتمدة بالدقة الكاملة.
ماذا تفعل بفيديوهاتك بعد ذلك
المقطع المُولَّد هو نقطة انطلاق. إليك كيف تأخذه أبعد:
ارفع دقته: شغّله عبر نموذج لرفع دقة الفيديو بالذكاء الاصطناعي لرفع مخرج 720p إلى وضوح يعادل 4K.
حرّر ورتّب: ادمج عدة مقاطع من Wan 2.6 معًا في محرر فيديو لبناء تسلسلات أطول.
حوّله إلى حلقة متكررة: يمكن تحويل المقاطع القصيرة، بطول 2 إلى 3 ثوانٍ، إلى حلقات متكررة سلسة لمحتوى وسائل التواصل الاجتماعي.
أضف مزامنة الشفاه: حرّك وجهًا باستخدام Wan 2.6، ثم طبّق نموذج مزامنة الشفاه لإضافة حركة فم واقعية إلى أي مسار صوتي.
ابدأ الإبداع الآن
لم يكن إنتاج فيديو بالذكاء الاصطناعي بجودة احترافية أسهل من ذلك قط. مع توفر Wan 2.6 مباشرة عبر PicassoIA، لا تحتاج إلى عتاد GPU محلي أو إعداد معقد. اكتب أمرًا نصيًا، واضبط بعض المعاملات، واحصل على مقطع سينمائي خلال دقائق.
أفضل طريقة لبناء الحدس مع هذا النموذج هي الكمية. شغّل 10 توليدات. قارن ما نجح. احتفظ بسجل بسيط للأوامر النصية التي أنتجت نتائج جيدة. ستتحسن نسبة نجاحك بسرعة.
افتح Wan 2.6 T2V على PicassoIA وشغّل أول توليد لك الآن. وإذا كنت تعمل من صورة فوتوغرافية ثابتة، فانتقل مباشرة إلى Wan 2.6 I2V. في الحالتين، ستحصل على مقطع فيديو قابل للمشاركة خلال أقل من خمس دقائق.