من المرجع إلى الفيديو في Wan 2.7: كيف يعمل فعليًا

Wan 2.7 هو أقوى نموذج مفتوح المصدر لتوليد الفيديو في عام 2027، ويقدّم ثلاثة أوضاع مختلفة: تحويل النص إلى فيديو، وتحويل الصورة إلى فيديو، وتحويل المرجع إلى فيديو. يشرح هذا المقال كيف يعمل كل وضع من الداخل، وما الذي يحافظ على الاتساق الزمني عبر الإطارات، وكيف تستخدم الأوضاع الثلاثة على PicassoIA لإنتاج فيديو سينمائي بدقة 1080p من أي نقطة بداية.

من المرجع إلى الفيديو في Wan 2.7: كيف يعمل فعليًا
Cristian Da Conceicao
مؤسس Picasso IA

Wan 2.7 ليس مجرد تحديث تدريجي لنموذج موجود. إنه يمثّل تحولًا معماريًا حقيقيًا في طريقة تعامل توليد الفيديو المفتوح المصدر مع الحركة، وإخلاص الشخص أو الكائن، والاتساق الزمني في الوقت نفسه. سواء بدأت من أمر نصي أو صورة ثابتة أو شخص مرجعي، فالنتائج في مستوى مختلف تمامًا عمّا أنتجته سلسلتا 2.1 و2.5. يفكك هذا المقال طريقة عمل كل وضع من أوضاع Wan 2.7 الثلاثة، حتى تعرف بالضبط ما الذي تقدّمه للنموذج ولماذا.

ما هو Wan 2.7 فعليًا

مهندس برمجيات يدرس مخططات الشبكات العصبية وتسلسلات إطارات الفيديو على شاشة شفافة في مختبر حديث

Wan 2.7 نموذج لتوليد الفيديو قائم على الانتشار، طوّرته Wan Video. وهو ينتمي إلى العائلة نفسها التي تضم Wan 2.1 و2.2 و2.5 و2.6، لكنه يقدّم نهجًا معدّلًا بشكل كبير في الانتباه عبر الإطارات ونمذجة الحركة. والنتيجة اتساق أفضل بكثير للشخص أو الكائن، وحركة كاميرا أكثر طبيعية، ودقة أعلى بوضوح عند 1080p مقارنةً بأي إصدار سابق.

ما يميّزه أن الأوضاع الثلاثة تشترك في العمود الفقري نفسه، وتتخصص في طبقة الشرط. هذا القرار المعماري الواحد هو سبب شعورك بأن T2V وI2V وR2V أدوات متناسقة وليست ثلاث أدوات منفصلة.

ثلاثة أوضاع، معمارية واحدة

تأتي عائلة Wan 2.7 بثلاثة إصدارات مختلفة:

  • Wan 2.7 T2V: يولّد الفيديو من أمر نصي فقط، ويستهدف مخرجات بدقة 1080p.
  • Wan 2.7 I2V: يأخذ صورة ثابتة كأول إطار ويحرّكها إلى الأمام في الزمن.
  • Wan 2.7 R2V: يقبل صورة مرجعية لموضوع محدد، ويحرّك ذلك الموضوع داخل مشهد جديد يصفه أمر نصي.

كل وضع يخدم سير عمل إبداعيًا مختلفًا. يناسب T2V بناء المفهوم من الصفر. ويُحيي I2V الصور الموجودة. أما R2V فيحل المشكلة الأصعب، وهي الحفاظ على شخصية أو كائن معين متسقًا أثناء وضعه في سياق جديد تمامًا.

ما الذي تغيّر عن الإصدارات السابقة

تُنتج سلسلة Wan 2.5 (T2V، I2V) فيديوهات مقنعة بدقة 720p. أما جيل 2.6 (T2V، I2V) فقد دفع الجودة نحو دقة عالية. يضيف Wan 2.7 ثلاثة أشياء لم تجتمع في أي من أسلافه: مسار شرط مخصص للتحويل من المرجع إلى الفيديو، ونوافذ انتباه زمني محسّنة تقلل الوميض عبر التسلسلات الطويلة، وتوقعًا للحركة بدرجة إخلاص أعلى مدرَّبًا على لقطات سينمائية وليس على فيديوهات الويب وحدها.

كيف يعمل وضع T2V

لقطة مقرّبة من أعلى لأيدٍ تكتب أمرًا نصيًا مفصلًا لتوليد الفيديو على لوحة مفاتيح ميكانيكية، وصور مرجعية على المكتب

تحويل النص إلى فيديو هو أسهل نقطة دخول. تكتب وصفًا لما تريد رؤيته، فينتج النموذج تسلسلًا من الإطارات يطابقه. لكن الآلية الكامنة تحت ذلك أكثر إثارة للاهتمام مما يوحي به هذا الملخص.

من النص إلى إطارات متحركة

يعمل Wan 2.7 T2V كنموذج انتشار كامن بعمود فقري لإزالة التشويش قائم على المحوّلات. عندما تُرسل أمرًا نصيًا، يمرّ أولًا عبر مُشفّر نصي مبني على نموذج لغوي كبير، يحوّل كلماتك إلى تمثيل متجهي كثيف. ويُشرط هذا التمثيل عملية إزالة التشويش بأكملها.

لا يولّد النموذج الإطارات واحدًا تلو الآخر. بل يولّد كل الإطارات في وقت واحد داخل فضاء كامن مضغوط، ثم يفكّ ترميز مكعب الكمون ذاك إلى بكسلات في النهاية. هذا النهج الكامل للتسلسل هو سبب تعامله مع الحركة بطبيعية أكبر بكثير من نماذج الفيديو التراجعية: إذ يستطيع الانتباه إلى المعلومات الموجودة في الإطار 12 وهو يقرر كيف يجب أن يبدو الإطار 3، بدلًا من أن يكون محكومًا بتسلسل صارم من اليسار إلى اليمين.

💡 نصيحة عملية: يستجيب Wan 2.7 T2V جيدًا لأوصاف حركة الكاميرا. عبارات مثل "دوران بطيء للأمام"، أو "حركة يد خفيفة نحو اليمين"، أو "لقطة عريضة ثابتة" تشكّل المخرجات بشكل ملحوظ، وليس أوصاف الموضوع وحدها.

من أين يأتي الاتساق الزمني

شريط فيلم على صندوق إضاءة يعرض ست لقطات متتالية لمشهد وادٍ جبلي بإضاءة ووضعية شخصية متسقتين

الاتساق الزمني هو أصعب ما يُنجَز بشكل صحيح في توليد الفيديو، وهنا يتفوق Wan 2.7 بوضوح على Wan 2.2 T2V Fast والإصدارات الأقدم مثل Wan 2.1.

يستخدم النموذج آلية انتباه ثلاثية الأبعاد تعمل عبر البعدين المكانيين والبعد الزمني في وقت واحد. كل "رقعة" فيديو تنتبه إلى الرقع المجاورة لها داخل الإطار، وإلى الموقع المكاني نفسه في الإطارات المتجاورة. هذا مكلف حسابيًا، لكنه يجبر النموذج على الحفاظ على ملمس ثابت وإضاءة ثابتة وهوية موضوع متسقة عبر المقطع كاملًا، بدلًا من تحسين كل إطار على حدة.

النتيجة العملية: الوجوه لا تومض، والشعر لا يغيّر لونه عشوائيًا بين الإطارات، وعناصر الخلفية تبقى مثبتة في مكانها. كانت النماذج الأقدم تحتاج أوامر نصية سلبية محددة لمحاربة هذه العيوب. مع Wan 2.7 أصبحت نادرة بدلًا من أن تكون هي الافتراضية.

كيف يعمل وضع I2V

أيدي مصوّر تمسك صورة مطبوعة لغروب شمس فوق بحيرة بجانب شاشة تعرض المشهد نفسه متحركًا مع تموجات مائية

يطرح تحويل الصورة إلى فيديو سؤالًا مختلفًا عن T2V: بالنظر إلى نقطة البداية البصرية الدقيقة هذه، ما الاستمرار المعقول لها؟ صُمم Wan 2.7 I2V خصيصًا لهذا، ويختلف هيكل الشرط فيه بشكل ملحوظ عن T2V.

صورتك كأول إطار

عندما تزوّد النموذج بصورة مصدر، يعالجها Wan 2.7 I2V عبر مُشفّر بصري منفصل، وليس مُشفّر النص، لاستخلاص تمثيلات ميزات عميقة، ثم يدمج هذه الميزات مع الكمون المشوّش في كل خطوة من خطوات إزالة التشويش. هذا ليس مجرد "ابدأ الفيديو من هذه الصورة" بالمعنى الساذج. النموذج يرجع باستمرار إلى خريطة ميزات صورتك طوال عملية التوليد، ولهذا يبقى مظهر الموضوع الأصلي سليمًا إلى حد كبير حتى في المشاهد ذات الحركة المعقدة.

يعمل الأمر النصي الذي تضيفه فوق الصورة كمتحكم في الحركة والاتجاه. يخبر النموذج بما ينبغي أن يحدث في المشهد، بينما تخبره الصورة بالشكل الذي يجب أن يبدو عليه المشهد.

كيف تُركَّب الحركة

دُرِّب النموذج على بيانات مقترنة: مقاطع فيديو حقيقية استُخدمت فيها إطارات محددة كمدخلات شرطية. يعلّمه نظام التدريب هذا الفيزياء الطبيعية للحركة. يجب أن تتموّج المياه إلى الخارج، ويجب أن يتطاير الشعر في اتجاه متسق، ويجب أن تنتقل تعابير الوجه بسلاسة. يعمل توقع الحركة المدمج في النموذج كمنظّم يحافظ على طبيعية الحركة المولّدة حتى عندما يكون أمرك مجردًا.

💡 نصيحة عملية: في I2V، تنجح أوصاف الحركة القصيرة أكثر من الطويلة. عبارة "شعر يتطاير برفق نحو اليسار، ابتسامة خفيفة، كاميرا ثابتة" تتفوق على أمر متعدد الجمل يصف أفعالًا متنافسة في وقت واحد. تمنح تعليمات الحركة البسيطة توقع الحركة المكتسب للنموذج مساحة أكبر ليعمل فيها.

وضع R2V هو القصة الحقيقية

صانع محتوى شاب يحمل صورة مرجعية لشخص، بينما تعرض الشاشة خلفه الشخص نفسه متحركًا في بيئة حديقة

إذا كان T2V مريحًا وكان I2V قويًا، فإن Wan 2.7 R2V هو الوضع الذي يحل مشكلة لم تستطع الأوضاع الأخرى حلها. يأخذ تحويل المرجع إلى فيديو صورة لشخص أو حيوان أو كائن محدد، ويحرّك هذا الموضوع داخل مشهد جديد تصفه بأمر نصي. تُحفظ الهوية البصرية للموضوع مع أن الخلفية والإضاءة والحركة مُولَّدة بالكامل.

لماذا يهم الحفاظ على الموضوع

قبل النماذج القادرة على R2V، كان الحفاظ على شخصية متسقة عبر فيديو مولّد بالذكاء الاصطناعي يتطلب إما سير عمل مُهندَسًا بدرجة كبيرة مثل ControlNet وضبط LoRA الدقيق ومجموعة أدوات تضم IP-Adapter، وإما قبول أن تنحرف الشخصية في مظهرها. ولم يكن أي من الخيارين قابلًا للاستخدام في الإنتاج.

يغيّر R2V ذلك بإضافة مسار شرط مخصص للموضوع. تُعالَج الصورة المرجعية عبر مُشفّر هوية يستخلص سمات المظهر المحددة، منفصلةً عن الشرط على مستوى المشهد القادم من النص. يتعلم النموذج احترام ميزات الهوية عبر كل الإطارات، ويعاملها كقيود صارمة لا كاقتراحات مرنة.

كيف يعمل شرط المرجع

تُشفَّر صورتك المرجعية مرتين. مرة عبر المُشفّر البصري الرئيسي لالتقاط ميزات المشهد، ومرة عبر مُشفّر الهوية المدرَّب خصيصًا لالتقاط خصائص مظهر الشخص أو الكائن. تُشرط المجموعتان من الميزات أداة إزالة التشويش على مقاييس مختلفة، إذ تُحقن ميزات الهوية في الطبقات ذات المستوى الأعلى حيث تُمثَّل المعلومات الدلالية.

يتحكم الأمر النصي بعد ذلك في سياق المشهد والحركة فقط، لأن سؤال "كيف يبدو الموضوع" قد أُجيب بالفعل بواسطة الصورة المرجعية. هذا الفصل في المسؤوليات هو ما يجعل مخرجات R2V تبدو أكثر تحكمًا من تطبيق شرط IP-Adapter فوق نموذج T2V قياسي.

كيفية استخدام Wan 2.7 على PicassoIA

امرأة عند مكتب واقف في استوديو إبداعي مشرق تنظر إلى واجهة إنشاء فيديو بالذكاء الاصطناعي على شاشة

أوضاع Wan 2.7 الثلاثة متاحة كلها على PicassoIA. إليك كيفية استخدام كل منها بفعالية.

البدء بـ T2V

افتح Wan 2.7 T2V على PicassoIA. يقبل حقل الأمر النصي نصًا حرًا، لكن الأوامر المنظمة تنتج نتائج أفضل باستمرار. استخدم هذا الترتيب:

  1. الموضوع: من أو ما الموجود في المشهد، مع تفاصيل المظهر.
  2. الحركة: ما الذي يحدث وكيف يتحرك.
  3. البيئة: مكان المشهد، بما في ذلك وقت اليوم.
  4. الكاميرا: ما الذي تفعله الكاميرا (ثابتة، أو تتحرك أفقيًا، أو تتتبع الموضوع، وغير ذلك).
  5. الأسلوب: واقعي كالصور الفوتوغرافية، أو سينمائي، أو إضاءة طبيعية، وغير ذلك.

يولّد النموذج بدقة 1080p افتراضيًا، وهي من أعلى الدقات الأصلية المتاحة بين أي نموذج فيديو مفتوح المصدر. وقت التوليد أطول من إصدار Wan 2.2 T2V Fast، لكن فرق الجودة كبير بما يكفي ليبرر ذلك لأي شيء يتجاوز النماذج الأولية السريعة.

تحريك الصور باستخدام I2V

ارفع صورة المصدر إلى Wan 2.7 I2V. يجب أن تكون الصورة نظيفة ومضاءة جيدًا، وتحتوي على الشخص أو الموضوع الذي تريد تحريكه. الصور الضبابية أو منخفضة التباين تقلل جودة المخرجات بشكل ملحوظ، لأن النموذج يملك معلومات بصرية أقل ليرتكز عليها.

اكتب أمرًا نصيًا يركّز على الحركة. ركّز على وصف الحركة والبيئة بدلًا من تكرار مظهر الموضوع (فالنموذج يملك ذلك بالفعل من الصورة). عبارة "أمواج تتكسر برفق على الشاطئ، ضوء الساعة الذهبية، لقطة عريضة ثابتة" أفضل من وصف مركّب طويل يحاول تحديد كل شيء دفعة واحدة.

R2V: تحريك موضوعات محددة

يتطلب Wan 2.7 R2V مدخلين: صورة مرجعية لموضوعك، وأمرًا نصيًا يصف المشهد الجديد. بالنسبة للصورة المرجعية، تعمل الصور بأسلوب البورتريه التي يظهر فيها موضوع واضح على خلفية بسيطة نسبيًا بشكل أفضل. يعمل مُشفّر الهوية بشكل أفضل عندما لا يكون الموضوع محجوبًا بشدة أو محاطًا بعناصر متشابهة بصريًا.

بالنسبة للأمر النصي، صِف المشهد الجديد كأن الموضوع المرجعي موجود فيه بالفعل. "يسير على مسار غابة مشمسة في الخريف، أوراق تتساقط، نسيم لطيف، لقطة تتبّع بطيئة." يتولى النموذج وضع موضوعك المرجعي في هذا السياق تلقائيًا.

كتابة الأوامر النصية التي تنجح فعلًا

لقطة مقرّبة لبطاقتين للأوامر النصية على مكتب خشبي: واحدة فوضوية ومختصرة على اليسار، وأخرى منظمة ومفصلة على اليمين، وقلم بينهما

تتأثر جودة مخرجات Wan 2.7 بجودة الأمر النصي بشكل كبير وغير متناسب. الأمر النصي المكتوب بشكل سيئ يهدر توليدًا كاملًا. أما الأمر المنظم جيدًا فينتج فيديو صالحًا للاستخدام في المحاولة الأولى باستمرار.

البنية التي تحقق النتائج

استخدم هذا القالب لأوامر T2V وI2V:

[Subject + appearance] [action] in [environment], [time of day / lighting], [camera motion], photorealistic, [quality modifiers]

أمر نصي ضعيف:

"امرأة تمشي في المدينة ليلًا"

أمر نصي قوي:

"امرأة في أواخر العشرينات ترتدي معطفًا صوفيًا داكنًا تسير على شارع مرصوف بالحصى مبلّل بالمطر، أضواء واجهات المحلات الدافئة تنعكس على الرصيف المبلل، لقطة تتبّع أمامية بطيئة على مستوى الشارع، واقعية كالصور الفوتوغرافية، بدقة 8K"

تمنح النسخة المنظمة النموذج هوية الموضوع، وتفاصيل الحركة، والبيئة، والإضاءة، وسلوك الكاميرا، وإرشادات الجودة. كل بُعد من هذه الأبعاد يشكّل جانبًا مختلفًا من المخرجات.

4 أخطاء تهدر التوليدات

  1. أفعال كثيرة في وقت واحد. يتعامل Wan 2.7 مع فعل رئيسي واحد في المقطع بشكل جيد. الأفعال المتنافسة المتعددة تنتج حركة غير متسقة.
  2. إغفال اتجاه الكاميرا. إذا لم تحدد حركة الكاميرا، فسيتخذ النموذج قرارًا قد لا يطابق قصدك. سمِّها دائمًا.
  3. موضوعات مجردة أكثر من اللازم. "شعور بالوحدة" لا يُولَّد جيدًا. أما "شخص جالس وحده على مقعد في حديقة، حمام يلتقط الطعام قريبًا، ضوء غائم" فيُولَّد جيدًا.
  4. تجاهل نسبة العرض إلى الارتفاع. يستخدم النموذج 16:9 افتراضيًا. إذا كانت صورة المصدر في I2V بوضعية طولية، فتتحسن النتائج عندما تقصّها أو تضيف حواف لتصبح 16:9 قبل رفعها.

Wan 2.7 مقابل المنافسين

استوديو منزلي حديث بجدار من شاشات المراقبة يعرض أربع لقطات فيديو مولّدة بالذكاء الاصطناعي جنبًا إلى جنب تُظهر مشاهد طبيعية وبورتريهات ومشاهد ساحلية وحضرية

Wan 2.7 لا يقف بمعزل عن غيره. إليك موقعه بالنسبة إلى نماذج تحويل النص إلى فيديو الرائدة الأخرى المتاحة على PicassoIA:

النموذجأقصى دقةالأوضاعالأفضل لـ
Wan 2.7 T2V1080pT2Vأعلى جودة مفتوحة المصدر
Wan 2.7 I2V1080pI2Vتحريك الصور الثابتة
Wan 2.7 R2V1080pR2Vفيديو بثبات الشخصية
Seedance 2.51080pT2V, I2Vمقاطع مدتها 30 ثانية مع صوت أصلي
Kling v2.61080pT2V, I2Vجودة الحركة السينمائية
Veo 3.11080pT2Vصوت أصلي، واقعية فوتوغرافية
LTX 2.3 Pro4KT2V, I2Vمخرجات بدقة عالية جدًا
Ray 3.2HDRT2V, I2VHDR وتدرج الألوان السينمائي

الميزة الرئيسية لـ Wan 2.7 هي وضع R2V، الذي لا يقدمه أي منافس مدرج بشكل أصلي. أما من حيث جودة T2V البحتة، فإن Veo 3.1 وSeedance 2.5 يتنافسان بقوة، ويتفوق Seedance في طول المقطع بمخرجات مدتها 30 ثانية. وللحصول على أعلى دقة، يبقى LTX 2.3 Pro بدقة 4K هو السقف الحالي. أما لمزيج إخلاص الموضوع وجودة الحركة وإتاحة المصدر المفتوح بدقة 1080p، فإن Wan 2.7 يحتل الصدارة في هذه المجموعة تحديدًا من الأدوات.

💡 متى تستخدم أي وضع: إذا كنت تبدأ من الصفر، فاستخدم T2V. إذا كانت لديك صورة تريد تحريكها، فاستخدم I2V. وإذا احتجت إلى وضع شخصية متسقة في مشاهد مختلفة، فإن R2V هو الوضع الوحيد المصمم خصيصًا لذلك.

ابدأ بإنشاء أول فيديو لك

منظر علوي لحاسوب محمول على طاولة رخامية بيضاء يعرض خط زمني لتحرير الفيديو، وبجانبه دفتر مفتوح وقلم رصاص وفنجان قهوة

Wan 2.7 متاح الآن بالأوضاع الثلاثة على PicassoIA، والحصول على أول مقطع لك أبسط مما قد توحي به العمق التقني للنموذج. ابدأ باستخدام Wan 2.7 T2V إذا كانت لديك فكرة إبداعية وتريد إنتاجها من وصف نصي. انتقل إلى Wan 2.7 I2V عندما تكون لديك صورة ثابتة تريد إحياءها. واستخدم Wan 2.7 R2V عندما تحتاج إلى ظهور شخص أو موضوع محدد باتساق في فيديو مولّد دون تدريب إضافي.

يمنحك مجموعة PicassoIA لتحويل النص إلى فيديو الأوسع أيضًا وصولًا إلى أكثر من 87 نموذجًا بمفاضلات مختلفة في السرعة والدقة والأسلوب. يوفّر Picassoia Video توليدًا مجانيًا غير محدود إذا أردت تجربة النماذج الأولية بسرعة قبل تخصيص توليد بجودة أعلى لنموذج Wan 2.7. ويستحق Ray 3.2 التجربة إذا كان لون HDR السينمائي أولوية لمخرجاتك.

ما يفصل الجيد عن الرائع في الفيديو بالذكاء الاصطناعي حاليًا ليس اختيار النموذج وحده. إنه دقة الأمر النصي ووضوح النية. اختر وضعك، واكتب أمرًا نصيًا يحدد الموضوع والحركة والبيئة والكاميرا والأسلوب، ثم دع Wan 2.7 يفعل ما صُمم من أجله. النتائج بدقة 1080p من نموذج مفتوح المصدر بهذا المستوى من الجودة لم تكن ممكنة قبل ثمانية عشر شهرًا. وهي متاحة اليوم لأي شخص على PicassoIA.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة