يتنافس اثنان من أكثر نماذج توليد الفيديو بالذكاء الاصطناعي حديثًا في المعيار الذي يهمّ المبدعين أكثر من غيره: الحركة السينمائية. Veo 3.1، نموذج تحويل النص إلى فيديو الرائد من Google DeepMind، وWan 2.6، النموذج القوي مفتوح الأوزان من فريق Wan-Video، كلاهما يَعِد بلقطات واقعية كالصور الفوتوغرافية، لكنهما يتبعان نهجين مختلفين جوهريًا في طريقة تشكّل الحركة على الشاشة. إذا كنت تختار بينهما لمشروعك القادم، فالفروق أوضح مما توحي به الدعاية، ومعرفة موضع تفوّق كل نموذج ستوفّر عليك ساعات من التصييرات الفاشلة والنقاط المهدورة.

ماذا يفعل كل نموذج فعليًا
قبل مقارنة المخرجات إطارًا إطارًا، تحتاج إلى فهم الغرض الذي بُني من أجله كل نموذج. يشتركان في أهداف سطحية، لكنهما يختلفان بشكل كبير في البنية وبيانات التدريب وفلسفة التصميم.
نظرة سريعة على Veo 3.1
Veo 3.1 هو أحدث إصدار من سلسلة Veo لدى Google DeepMind، مصمَّم لإنتاج فيديو بدقة 1080p من أوامر نصية مع دمج أصلي للصوت منذ لحظة التوليد. يبني النموذج على التماسك الحركي القوي الذي يتميز به Veo 3، ويضيف دقة زمنية أفضل، ومعالجة أفضل للمشاهد متعددة الأشخاص، وتحكمًا أكثر استجابة في توجيه الكاميرا. يعمل بعدة مستويات سرعة بحسب سير عملك: Veo 3.1 الكامل لأقصى جودة، وVeo 3.1 Fast الأسرع للتكرار السريع، وVeo 3.1 Lite الأخف لاختبار الأفكار بسرعة.
ما يجعله سينمائيًا بوضوح هو تدريبه على مجموعة ضخمة ومنتقاة من محتوى الأفلام والبث التلفزيوني. تُظهر استجابات الأوامر فهمًا حقيقيًا لمفاهيم مثل لقطات التتبع و_التركيز المتحرك (rack focus)_ و_الإضاءة المبررة_ و_تنفّس العدسة (lens breathing)_، وهي مصطلحات تعامل معها معظم نماذج تحويل النص إلى فيديو كأنها كلمات مفتاحية زخرفية لا كتعليمات إنتاج ذات معنى مادي. والفرق في جودة المخرجات عند استخدام المفردات السينمائية كبير وواضح فورًا.
نظرة سريعة على Wan 2.6
Wan 2.6 T2V هو أحدث إصدار من Wan-Video، وهو تطوّر لسلسلة Wan 2.x التي قدّمت باستمرار نتائج تنافسية بالنسبة لنموذج مفتوح الأوزان. يقدّم إصدار 2.6 تحسينات ملموسة في حدّة الحركة واتساقها عبر المدة الكاملة للفيديو، إضافة إلى نسخة مخصصة لتحويل الصورة إلى فيديو هي Wan 2.6 I2V، التي تحرّك الصور الثابتة بدقة فيزيائية لافتة وحفاظ جيد على التكوين.
تكمن قوة Wan 2.6 الأساسية في فيزياء الحركة الخام. يتعامل النموذج مع ديناميكيات السوائل ومحاكاة الأقمشة وحركة الشعر بطريقة نادرًا ما تبدو آلية أو مولّدة إجرائيًا. لا يملك تكامل الصوت الذي يتميز به Veo إطلاقًا، لكنه يعوّض ذلك بالمرونة: يمكنك ربط التوليد بصورة مرجعية والحصول على مقطع سينمائي متماسك مبني على تكوينك الدقيق وألوانك وتأطير الشخص.
جودة الحركة السينمائية جنبًا إلى جنب
هنا تظهر الفروق الحقيقية. جودة الحركة في الفيديو بالذكاء الاصطناعي لا تقتصر على انسيابية الإطارات المتوسطة، بل تتعلق بما إذا كانت الفيزياء تبدو مقنعة فعلًا، أي هل يتطابق الثقل والقصور الذاتي وتوقيت الحركة مع ما يتوقع جسم المشاهد أن يراه.
حركة الشخص والجسد
يتعامل Veo 3.1 مع الأشخاص بدقة ملحوظة عبر كامل أنواع الحركة. تتحرك خطوات المشي وتأرجح الذراعين وتعابير الوجه بالثقل والتوقيت الذي تتوقعه من لقطات الأفلام عالية الميزانية. تظهر حركات دقيقة لم تُطلب صراحة: الارتداد الخفيف للكتفين أثناء المشي، والتمايل الطبيعي لشخص واقف استجابةً لأمر يصف السكون، وحركة الرمش والتنفس اللاإرادية في لقطة مقرّبة لبورتريه.
يُعدّ Wan 2.6 تنافسيًا هنا، خصوصًا في الحركات الأكبر والأكثر دراماتيكية. تميل مشاهد الجري والقفز والحشود إلى إنتاج ديناميكيات أكثر إقناعًا بين الأشخاص في Wan 2.6. أما نقطة ضعفه فتظهر في الحركة الخفيفة جدًا: شخصية تقف وتتنفس ببساطة، أو وجه في حديث هادئ، قد تُنتج أحيانًا انزياحًا هندسيًا طفيفًا على مدى مقطع مدته 6 ثوانٍ، يكسر وهم التصوير الفوتوغرافي الحقيقي.

حركة الكاميرا والتحكم فيها
حركة الكاميرا من أوضح مزايا Veo 3.1 وأكثرها ثباتًا. عبارات مثل "دفعة دوللي بطيئة للأمام" أو "بانورama لليسار لكشف الخلفية" أو "لقطة متابعة محمولة على مستوى الكتف" تنتج حركة تتطابق مباشرة مع القصد السينمائي. يفهم النموذج ليس الاتجاه الميكانيكي لحركة الكاميرا فحسب، بل إحساس أنواع مختلفة من الحوامل والمشغّلين. تحتوي اللقطة المحمولة الموجَّهة على اهتزاز دقيق مناسب بالتردد والسعة الصحيحين. ولقطة الرافعة لها تباطؤ ناعم وموزون في نهاية المسار. والتكبير يحمل التشوّه التنفسي المميز لعدسة حقيقية.
يستطيع Wan 2.6 إنتاج حركة كاميرا، لكن استجابته للحركات المركّبة المعقدة أقل موثوقية. البانورامات الجانبية البسيطة ودفعات الاقتراب والابتعاد متّسقة. أما أي شيء يتطلب تنسيق تغييرات المنظور مع تتبع الشخص في الوقت نفسه، مثل التتبع مع التكبير المتزامن، أو لقطة متابعة تنتقل إلى لقطة واسعة ثابتة، فسيكون أكثر قابلية للتنبؤ ودقة في Veo 3.1.
الاتساق الزمني عبر المدة
يعني الاتساق الزمني ألّا تتغير الأشياء والأشخاص والبيئات في الشكل أو اللون أو النسب مع تقدّم الفيديو. حقق كلا النموذجين تحسنًا كبيرًا في هذا المجال مقارنةً بالإصدارات السابقة، لكن حالات الحدّ ما زالت تظهر، خصوصًا في المقاطع التي تقترب من 5 ثوانٍ أو تتجاوزها.
يحافظ Veo 3.1 على هوية الشخص بشكل أفضل عبر التسلسلات الأطول. يظل ملمس ملابس الشخصية وهندسة وجهها والسياق البيئي متماسكًا حتى عبر القطع التي يحاكيها النموذج داخل توليد واحد. وتحافظ عناصر الخلفية مثل الأشجار والعمارة والحشود على شكلها وموضعها الأساسي بموثوقية عالية.
يُظهر Wan 2.6 أحيانًا انجرافًا زمنيًا (temporal drift) في الشعر والأقمشة وتفاصيل الخلفية. في المشاهد المضبوطة بإحكام ذات التعقيد المنخفض وشخص واحد واضح، يُضاهي أداؤه أداء Veo 3.1. أما في التراكيب المزدحمة متعددة العناصر، فيتقدّم Veo 3.1 في الاتساق.
💡 لأقصى استقرار زمني في النموذجين: ركّز تعقيد المشهد على شخص أو شخصين رئيسيين في بيئة واضحة المعالم. أضف التنوع البصري من خلال حركة الكاميرا وتغيّر الإضاءة بدلًا من ازدحام المشهد بالعناصر. مكان واسع وفارغ يحتوي على شخص واحد يُنتج دائمًا تقريبًا اتساقًا أفضل من مشهد مكتظ.
أين يتفوّق Veo 3.1
ثلاثة مجالات محددة يتفوّق فيها Veo 3.1 بوضوح، وتتكرر عند اختبار النموذجين مقابل متطلبات الإنتاج الاحترافي.
مزامنة الصوت الأصلية
هذه أكثر قدرات Veo 3.1 تميّزًا في المشهد الحالي لفيديو الذكاء الاصطناعي. يولّد النموذج صوتًا متزامنًا مع الفيديو، يشمل الأصوات المحيطة وإيحاءات الحوار والمؤثرات الصوتية، كلها مستمدة من الأمر النصي نفسه في تمريرة توليد واحدة. موجة المحيط التي تولّدها ستبدو فعلًا كموجة محيط. والمطر يبدو كمطر. ومشهد الحشود يتضمن ضجيج الحشود. وحقل تهبّ عليه الرياح فيه حفيف العشب. هذا ليس معالجة لاحقة فوق مقطع صامت، بل ينبثق من تشغيل النموذج نفسه الذي ينتج المرئيات.
بالنسبة للمحتوى الاجتماعي وأفلام العلامات التجارية والفيديو القصير الذي يحتاج إلى حضور صوتي أساسي، يغيّر هذا سير الإنتاج بشكل كبير. لن تقضي وقتًا في محرر صوت لإضافة المؤثرات فوق لقطات صامتة. بل ستحصل على مخرجات صوتية ومرئية أولية من أمر نصي واحد جيد الصياغة، جاهزة للمراجعة والتحسين.

الدقة والحدّة بدقة 1080p
يُخرج Veo 3.1 بدقة 1080p افتراضيًا في جميع أنواع المشاهد. هذا مهم عمليًا لأي سياق تسليم لا يقتصر على المحتوى القصير لوسائل التواصل الاجتماعي: تقديم المواد لمنصات البث، ومواصفات إعلانات العرض، ومعايير تسليم البث، ومخرجات العملاء التجارية، كلها تعدّ 1080p حدًا أدنى. وعند 1080p تصمد دقة حركة Veo 3.1 أمام الفحص الدقيق. تبقى التفاصيل الدقيقة وملمس البشرة ونسيج الأقمشة واضحة بالحجم الكامل دون التشوهات الناتجة عن رفع الدقة عند تمديد مخرجات بدقة أقل.
الالتزام بمفردات السينما في الأوامر
يتمتع Veo 3.1 بالتزام أفضل بشكل ملحوظ بلغة التصوير السينمائي في الأوامر. وصف مشهد بمصطلحات سينمائية محددة ينتج مخرجات تعكس تلك التعليمات الدقيقة، بدلًا من تقريب عام لها. مصطلحات مثل البوكيه الأنامورفي (anamorphic bokeh) و_تركيز الديوبتر المنقسم (split diopter focus)_ و_الضوء الرئيسي المبرَّر من الكاميرا على اليسار_ و_هامش التعريض (exposure latitude)_ أو حبيبات الفيلم عند 400 ISO تنتج كلها فروقًا قابلة للقياس وواضحة في جودة المخرجات والدقة الأسلوبية مقارنةً بالوصف اللغوي العادي.
أين يتفوّق Wan 2.6
Wan 2.6 ليس نموذجًا أدنى. في حالات استخدام محددة، هو الخيار الأفضل، وأحيانًا بفارق كبير.
خط تحويل الصورة إلى فيديو
Wan 2.6 I2V من بين أفضل نماذج تحريك الصور المتاحة حاليًا في أي مكان. تقدّم صورة فوتوغرافية ثابتة مع وصف نصي للحركة المطلوبة، ويولّد النموذج مقطعًا يمتد بشكل طبيعي من التكوين الحالي للصورة وتدرّج ألوانها واتجاه إضاءتها وموضع الشخص فيها. ويضيف إصدار Wan 2.6 I2V Flash السرعة للتكرار السريع دون التنازل عن جودة الفيزياء الأساسية.
هذا الخط لا يُقدَّر بثمن للمصورين والفنانين البصريين والرسامين وأي شخص لديه أصول بصرية قوية ويريد إضافة حركة سينمائية إليها. لا يقدّم Veo 3.1 هذا النوع من التوليد المرتكز على الصورة بالدرجة نفسها من دقة التكوين وواقعية الحركة.

السرعة وحجم التكرار
يُنهي Wan 2.6 T2V التوليد باستمرار بسرعة أكبر من تشغيلات Veo 3.1 الكاملة عند إعدادات جودة مماثلة. في سير العمل التكراري حيث تحتاج إلى اختبار عدد كبير من تنويعات الأوامر لمشهد واحد قبل اعتماد التصيير النهائي، لهذه الميزة في السرعة أثر حقيقي على الزخم الإبداعي. يمكنك تجربة مزيد من التجارب في الفترة الزمنية نفسها، ما يعني فرصًا أكبر لاكتشاف الصياغة النصية التي تنتج سلوك الحركة الذي تريده بالضبط.
المرونة الإبداعية عبر الضبط الدقيق
بما أن Wan 2.6 مفتوح الأوزان، بنى مجتمع المبدعين العالمي بنية تحتية واسعة للضبط الدقيق حوله: محوّلات LoRA، وcheckpoints للأساليب، وضبطًا دقيقًا لأنماط حركة محددة، ونسخًا مدرّبة لثبات الشخصيات. يمكن تحقيق أساليب جمالية محددة وتواقيع حركة دقيقة للأنواع الفنية ومخرجات شخصيات متسقة للغاية عبر إصدارات Wan 2.6 المضبوطة بدقة، بطرق لا تدعمها النماذج المغلقة الخاصة مثل Veo 3.1 حتى الآن.

جدول المقارنة المباشرة
إليك أداء النموذجين عبر المعايير التي تهمّ فعليًا في العمل السينمائي الاحترافي:
| الميزة | Veo 3.1 | Wan 2.6 |
|---|
| أقصى دقة | 1080p | من 720p إلى 1080p |
| الصوت الأصلي | نعم | لا |
| تحويل الصورة إلى فيديو | محدود | كامل (إصدار I2V) |
| دقة حركة الكاميرا | ممتازة | جيدة |
| الاتساق الزمني | ممتاز | جيد |
| فيزياء الشخص | ممتازة | جيدة جدًا |
| ديناميكيات السوائل والأقمشة | جيدة جدًا | ممتازة |
| سرعة التوليد | متوسطة | سريعة |
| دعم الضبط الدقيق | لا | نعم |
| الالتزام بالأوامر | عالٍ جدًا | عالٍ |
| الأوزان المفتوحة | لا | نعم |
💡 يتوفر إصدار سريع في النموذجين لاختبار الأفكار الأولية: Veo 3.1 Fast وWan 2.6 I2V Flash هما أفضل نقطتي بداية لاختبار أفكار الأوامر قبل الالتزام بتشغيلات توليد عالية الجودة.
المشاهد التي يتعامل معها كل نموذج بأفضل شكل
الحركة البطيئة ومشاهد الماء
يتعامل النموذجان مع تسلسلات الحركة البطيئة، لكن فيزياء الماء هي المكان الذي تظهر فيه الفجوة بينهما بأوضح صورة. يُنتج Wan 2.6 ديناميكيات سوائل أكثر إقناعًا: الرشّ وانتشار التموجات عبر سطح الماء وأنماط كسر الأمواج عند الشاطئ وسلوك التوتر السطحي للقطرات الصغيرة، كلها تبدو دقيقة فيزيائيًا ومتسقة من إطار إلى آخر. يُظهر عرض الماء في Veo 3.1 قوة واضحة، لكنه يُظهر أحيانًا تشوهات دورية طفيفة على الأسطح المائية الكبيرة عند الفحص الدقيق.

مشاهد الليل والإضاءة الخافتة
يتعامل Veo 3.1 مع مشاهد الإضاءة الخافتة بشكل أفضل في بنية الضوضاء وتماسك مصدر الضوء. تُلقي أعمدة الإنارة برَكًا مقنعة من الضوء بمنحنيات تلاشٍ دقيقة. وتتبع انعكاسات النيون في برك المطر منطق البصريات الفيزيائية: يتوافق لون الانعكاسات وشكلها وتشوهها مع مصادر الضوء الفعلية في المشهد. ويُنتج تدريب النموذج على لقطات الأفلام الحقيقية بنية حبيبية وتدرّجًا في الإضاءات العالية يبدوان كإضاءة خافتة فوتوغرافية حقيقية، لا كظلام مولّد بالذكاء الاصطناعي.
يقدّم Wan 2.6 في الإضاءة الخافتة نتائج ممتازة في التكوينات المضبوطة، لكنه يولّد أحيانًا مصادر ضوء تومض قليلًا بين الإطارات، أو ينتج اتجاهات ظلال غير متسقة في المشاهد ذات مصادر الضوء المتعددة المتنافسة. المشاهد الليلية ذات المصدر الواحد تعمل بشكل أفضل بكثير من بيئات الإضاءة المتعددة المعقدة.

اللقطات الجوية والمناظر الطبيعية
تكشف التكوينات الجوية نقاط ضعف الاتساق الزمني بسرعة، لأن كل إطار يحتوي على كمّ هائل من المعلومات البصرية: ملمس التضاريس، وحركة السحب، وتغيّر سطح الماء، وعمق الضباب الجوي، وتفاصيل الغطاء النباتي، وكلها يجب أن تبقى متماسكة طوال المدة. يتعامل Veo 3.1 مع اللقطات الجوية للمناظر الطبيعية باتساق قوي: تتبع حركة السحب فيزياء معقولة، ويحافظ ملمس التضاريس على تفاصيله وألوانه دون انجراف، وتبقى الظروف الجوية مثل الضباب وزاوية الشمس مستقرة. ويؤدي Wan 2.6 أداءً أفضل في التكوينات الجوية الأبسط ذات البؤرة الواضحة الواحدة وخلفية بيئية أقل تعقيدًا.
كيفية استخدام النموذجين على PicassoIA
كلا Veo 3.1 وWan 2.6 T2V متاحان مباشرة على PicassoIA دون أي إعداد محلي، ودون متطلبات GPU، ودون تثبيت برامج.
تشغيل Veo 3.1 خطوة بخطوة
- انتقل إلى Veo 3.1 على PicassoIA
- اكتب أمرك النصي باستخدام لغة سينمائية محددة: "لقطة تتبع بطيئة لامرأة تمشي عبر حقل قمح عند الساعة الذهبية، بمظهر فيلم 35 ملم، عمق ميداني ضحل، وصوت الريح تمر عبر العشب"
- للتكرار الأسرع، استخدم Veo 3.1 Fast لاختبار تنويعات الأوامر قبل الالتزام بتصيير بجودة كاملة
- راجع المخرجات الصوتية مع الفيديو. إذا لم يتطابق الصوت المحيط مع قصدك البصري، فحسّن أمرك باستخدام أوصاف صوتية صريحة في نهاية الأمر
- للمقاطع الاجتماعية السريعة بمهلة تسليم أقصر، جرّب Veo 3.1 Lite
تقنيات الأوامر الأفضل مع Veo 3.1:
- حدّد حركة الكاميرا بمصطلحات الحوامل: "دفعة بطيئة للأمام" و_"متابعة محمولة"_ و_"لقطة واسعة ثابتة"_ و_"نزول الرافعة"_
- سمِّ إعدادات الإضاءة صراحةً: "مضاءة من الخلف بالشمس الغاربة من اليسار" و_"ضوء رئيسي واحد مبرَّر من نافذة على اليمين"_
- أضف مراجع لخام الفيلم أو الكاميرا: "استجابة ألوان Kodak Vision3" و_"عدسة أنامورفية مع توهج أفقي"_
- ضع الأوصاف الصوتية بعد الأوصاف المرئية لإعطاء الاثنين الوزن نفسه

تشغيل Wan 2.6 خطوة بخطوة
- لتحويل النص إلى فيديو، انتقل إلى Wan 2.6 T2V
- لتحريك صورة فوتوغرافية موجودة، استخدم Wan 2.6 I2V: ارفع صورتك، ثم صِف الحركة المحددة التي تريد إضافتها
- للتكرار الذي يبدأ بالسرعة، يولّد Wan 2.6 I2V Flash مخرجات مسودة في جزء من الوقت
- صِف الحركة بمصطلحات الفيزياء لا بلغة الفيلم: "يتحرك شعرها في نسيم ثابت من اليسار، وكل خصلة تستجيب بشكل مستقل" يتفوق على "مصوّر على فيلم 35 ملم مع رياح"
- ركّز تعقيد المشهد على شخص أو شخصين لأفضل اتساق زمني طوال مدة المقطع كاملةً
تقنيات الأوامر الأفضل مع Wan 2.6:
- الوصف الفيزيائي يتفوّق على الوصف السينمائي: صِف كيف تتصرف المواد، لا كيف ستلتقطها الكاميرا
- صِف الحالة الابتدائية والحالة النهائية المقصودة للحركة ضمن الأمر نفسه
- في I2V، امنح النموذج إذنًا صريحًا بإضافة الحركة: "تبدأ الشخصية بالمشي نحو الكاميرا" و_"يبدأ سطح الماء بالتموج إلى الخارج"_
- استخدم الأوامر النصية السلبية لكبح الانجراف: "بلا وميض، إضاءة متسقة، خلفية ثابتة"
النموذج المناسب لعملك
الاختيار بين Veo 3.1 وWan 2.6 لا يتعلق بأيهما متفوق موضوعيًا. الأمر يعتمد على ما يتطلبه مشروعك المحدد من خط توليد الفيديو الخاص به.
اختر Veo 3.1 عندما:
- يكون الصوت المتزامن مطلوبًا في مخرجاتك
- يكون توجيه الكاميرا السينمائي ومفرداته محوريين في قصدك الإبداعي
- تحتاج إلى اتساق زمني موثوق في مشاهد معقدة متعددة العناصر
- تكون دقة 1080p شرطًا صارمًا للتسليم
- تعمل بأوامر نصية فقط وتريد أقصى التزام بالأوامر
اختر Wan 2.6 عندما:
- تحرّك صورًا فوتوغرافية ثابتة أو رسومات توضيحية موجودة
- تكون سرعة التوليد وحجم التكرار أهم من الصقل في تمريرة واحدة
- تكون الدقة الفيزيائية لحركة السوائل والأقمشة والشعر هي الأولوية
- يكون الضبط الدقيق أو نسخ النماذج المدرّبة من المجتمع جزءًا من خط إنتاجك
- تريد مرونة البنية مفتوحة الأوزان

يقع النموذجان ضمن منظومة واسعة من أدوات تحويل النص إلى فيديو على PicassoIA، بما في ذلك Kling v3 Video للتحكم في الحركة السينمائية، وSeedance 2.0 لتوليد الصوت المدمج، وVeo 3 كسلف مُجرَّب له مجتمع قوي من الأوامر المختبرة. تتيح لك المنصة تشغيل وصف المشهد نفسه عبر نماذج متعددة ومقارنة المخرجات جنبًا إلى جنب، وهي الطريقة الأسرع والأكثر موثوقية لتحديد الأداة التي تنتج جودة الحركة التي تخدم لقطة بعينها.
إذا لم تختبر بعد أمرًا سينمائيًا صعبًا عبر Veo 3.1 وWan 2.6، فالوقت مناسب لتكتشف أي النموذجين تبدو فيزياؤه حقيقية في عينك. شغّل المشهد نفسه على النموذجين، وراقب كيف يتحرك القماش، وكيف تحافظ الوجوه على شكلها، وكيف تحاكي الكاميرا الثقل والمسافة. ذلك الانطباع الأول، سواء هبطت الحركة بإقناع أم كشفت عن طبيعتها الاصطناعية، هو المعيار الوحيد الذي يهم فعليًا حين يكون جمهورك يشاهد.