السؤال ليس أيّ نموذج لتوليد الفيديو يملك أكبر عدد من الميزات أو أسرع وقت توليد. السؤال الذي يهم فعلًا بسيط جدًا: هل يبدو واقعيًا؟
في عام 2025، تقدّم نموذجان على بقية المنافسين وأثارا نقاشًا حقيقيًا بين صنّاع المحتوى والباحثين وصنّاع الأفلام: Sora 2 Pro من OpenAI وWan 2.7 Pro من فريق الأبحاث في Alibaba. يدّعي كلاهما الواقعية الفوتوغرافية، وينتج كلاهما لقطات قد تخدع المشاهد العادي. لكنهما يفعلان ذلك بطرق مختلفة، ويخفقان في مواضع مختلفة، ومعرفة هذه الفروق ستوفّر عليك ساعات من وقت التوليد الضائع.
هذا تحليل جنبًا إلى جنب للنموذجين عبر الأبعاد التي تهم: فيزياء الحركة، والواقعية البشرية، ودقة الإضاءة، والحالات الحدّية التي يتعطل فيها كل نموذج بهدوء.
لماذا تُعدّ الواقعية المعيار الوحيد الذي يهم؟
ماذا تعني كلمة "واقعي" فعلًا في فيديو الذكاء الاصطناعي؟
عندما يقول أحدهم إن الفيديو "يبدو واقعيًا"، فهو لا يصف خاصية واحدة. إنه يصف مجموعة من الأشياء يقيّمها نظرك البصري في وقت واحد. جلد يتصرف كجلد. ماء يتحرك بالقصور الذاتي الصحيح. ضوء يسقط من مصدر واحد معقول ولا يتغيّر بين الإطارات. شعر يتفاعل مع الريح كما يفعل الشعر، لا كما تفعل محاكاة الأقمشة.
لهذا يصعب قياس الواقعية بمعايير موحّدة. قد ينجح نموذج في تفاصيل الجلد وفي الوقت نفسه يفشل تمامًا في ضبابية الحركة. وقد يملك نموذج آخر ديناميكيات سوائل مثالية لكنه ينتج وجوهًا تحمل ذلك الإحساس المزعج المعروف بوادي الغرابة في اللقطات المقرّبة. النماذج التي تسجّل أعلى الدرجات ليست تلك المثالية في شيء واحد، بل تلك التي لديها أقل عدد من الإخفاقات الكارثية.
المعيار الذي يستخدمه معظم صنّاع المحتوى فعلًا
عمليًا، الاختبار الذي يجريه معظم صنّاع المحتوى بسيط: يولّدون الأمر النصي نفسه في النموذجين، ثم يطلبون من شخص لم يشاهد فيديو الذكاء الاصطناعي من قبل أن يكتشف الزيف. إذا تردّد ذلك الشخص، نجح النموذج. وإذا أشار فورًا إلى يد عائمة أو إلى مصدر ضوء يظهر من العدم، فقد أخفق.

💡 أفضل اختبار للواقعية ليس المواصفات التقنية. إنه عرض النتيجة على شخص لا يعرف ما الذي يجب أن يبحث عنه.
Sora 2 Pro: ما الذي أصابت فيه OpenAI؟
وصل Sora 2 Pro بوصفه أقوى نموذج فيديو تطلقه OpenAI حتى الآن، والتحسينات على Sora 2 الأصلي ليست طفيفة. من الواضح أن الفريق أعطى الأولوية للاتساق الزمني فوق كل شيء آخر، وهذا يظهر بوضوح.
الاتساق الزمني كنقطة قوة أساسية
أكثر ما يلفت في Sora 2 Pro هو طريقة تصرّف الأشياء عبر الزمن. في معظم نماذج فيديو الذكاء الاصطناعي، تنجرف الأشياء. فنجان القهوة ينزلق ببطء عبر الطاولة خلال 10 ثوانٍ دون سبب. وسترة الشخص تتغيّر درجاتها بشكل خفيف بين اللقطات. الاتساق الزمني في Sora 2 Pro يتصدّر الفئة فعلًا. تبقى الأشياء في أماكنها، وتبقى مصادر الضوء حيث يجب أن تكون، وتحافظ الأسطح على ملمس ثابت عبر الإطارات.
هذا مهم جدًا في اللقطات الأطول. عند حدّ 5 إلى 10 ثوانٍ، تبدأ معظم النماذج في إظهار الانجراف. يصمد Sora 2 Pro بشكل أفضل بكثير، ولهذا أصبح الخيار الأول لصنّاع المحتوى الذين ينتجون ما سيُشاهَد لا ما سيُلتقط كلقطة شاشة فقط.
البيئات الواقعية
يتعامل Sora 2 Pro مع لقطات البيئات المعقدة بثقة حقيقية. مشاهد خارجية بإضاءة طبيعية، وبيئات حضرية بشوارع مبللة، ومشاهد داخلية بمصادر ضوء عملية. من الواضح أن النموذج تدرّب على مكتبة ضخمة من السينما الحقيقية، لأن فهمه لكيفية تشتّت الضوء في الفضاء يكاد لا يتميز غالبًا عن لقطات الكاميرا الحقيقية.

حيث تقع حدود Sora 2 Pro
نقاط الضعف حقيقية. تبقى تشريح اليد نقطة ضعف متكررة، وإن كانت أقل سوءًا بكثير مما كانت عليه في النماذج السابقة. لا تزال مشاهد الحشود المعقدة التي تضم أشخاصًا كثيرين يتحركون بشكل فردي تُظهر عيوب تزامن، حين يتحرك عدد كبير من الناس بأنماط متشابهة جدًا. كما يميل النموذج إلى جمالية "الصقل السينمائي" التي قد تعمل فعليًا ضد الواقعية الخام في اللقطات ذات الطابع الوثائقي. كل شيء يبدو مثاليًا بعض الشيء، ومُصحَّح الألوان أكثر من اللازم. اللقطات الحقيقية فيها عيوب يصححها Sora 2 Pro دون وعي.
| نقطة القوة | نقطة الضعف |
|---|
| الاتساق الزمني | تشريح اليد أثناء الحركة |
| الإضاءة البيئية | تزامن الحشود |
| دقة ملمس الأسطح | جمالية سينمائية مفرطة |
| الاستقرار في المقاطع الطويلة | الأسلوب الخام أو الوثائقي |
Wan 2.7 Pro: كيف غيّرت Alibaba قواعد اللعبة
يمثّل Wan 2.7 T2V قفزة معمارية كبيرة مقارنة بسلالة Wan 2.1 وWan 2.5. فإذا كانت الإصدارات السابقة مُبهرة بفضل نسبة التكلفة إلى الجودة، فإن Wan 2.7 Pro ينافس في الصدارة من حيث جودة المخرجات الخام.
فيزياء الحركة كعامل تمييز
هنا يتقدّم Wan 2.7 Pro على شبه كل شيء. ديناميكيات السوائل، ومحاكاة الأقمشة، وحركة الشعر، وسلوك الدخان والنار: كلها تُعالَج بدقة فيزيائية تجعل Sora 2 Pro يبدو مصطنعًا قليلًا بالمقارنة. عندما يمرّ شخص في لقطة من Wan 2.7 عبر ستارة، تستجيب الستارة كما تستجيب الستارة فعلًا. وعندما تصطدم قطرات المطر بسطح في مشهد من Wan 2.7، تتناثر القطرات بفيزياء مقنعة.
يبدو أن النموذج يملك فهمًا أقوى بشكل جوهري لميكانيكا نيوتن، وهذه القوة تنعكس على تقريبًا كل سيناريو يتضمن حركة.

حركة الإنسان ودورات المشي
بالنسبة لكثير من صنّاع المحتوى، الاختبار الحاسم لأي ذكاء اصطناعي للفيديو هو شخص يمشي. دورات المشي متجذّرة بعمق في إدراكنا البصري، ونلاحظ فورًا أي خلل طفيف. دورات المشي في Wan 2.7 Pro هي، في معظم الظروف، الأكثر إقناعًا في المجال. انتقال وزن طبيعي، وضربة قدم مناسبة، وحركة جذع صحيحة. هذه هي الجودة التي تجعل اللقطات قابلة للاستخدام في السياقات التجارية.
يوسّع Wan 2.7 I2V وWan 2.7 R2V هذه القدرة إلى تحويل الصورة إلى فيديو وسير العمل القائم على فيديو مرجعي على التوالي، مما يجعل محرك الفيزياء متاحًا عبر عدة أنماط توليد.
حيث تقع حدود Wan 2.7 Pro
المقايضة مقابل قوة Wan 2.7 Pro في الفيزياء هي الاتساق الزمني في المقاطع الطويلة. في المقاطع التي تتجاوز 6 إلى 8 ثوانٍ، يبدأ النموذج بإظهار انجراف أكبر من Sora 2 Pro. تتحرك الأشياء قليلًا حين ينبغي ألا تتحرك. وقد يتغيّر مصدر الضوء بشكل طفيف. الأمر ليس كارثيًا، لكنه ملحوظ عند الفحص الدقيق.
الواقعية في الجلد أيضًا أقل إقناعًا قليلًا في لقطات الوجه المقرّبة جدًا. يميل Wan 2.7 Pro إلى إنتاج جلد أنعم من الطبيعي، وهذا يضر بالواقعية في اللقطات المقرّبة الكبيرة بشكل مفارق، رغم أن المظهر العام يبدو أكثر طبيعية عند المسافات المتوسطة.
💡 للمقاطع القصيرة كثيفة الحركة، يفوز Wan 2.7 Pro. أما للقطات الأطول والكاميرا الثابتة، فيحتفظ Sora 2 Pro بالتفوق.
فيزياء الحركة: الخط الفاصل الحقيقي
محاكاة السوائل والجسيمات
اختُبر النموذجان بالمجموعة نفسها من الأوامر النصية الصعبة التي تشمل الماء والنار والدخان والنباتات المتأثرة بالرياح. الفجوة هنا كبيرة وواضحة.
حققت محاكاة السوائل في Wan 2.7 Pro نتائج أكثر إقناعًا باستمرار. أمواج محيط بمستوى طاقة صحيح. قهوة تُحرّك بسلوك دوّامة صحيح. بخار يتصاعد من كوب بتباين كثافة مناسب. ينتج Sora 2 Pro سلوكًا معقولًا للسوائل، لكنه يبدو أكثر إجرائية قليلًا، وأقل استنادًا إلى الفيزياء.

حركة الكاميرا والتثبيت
يتمتع Sora 2 Pro بميزة فيما يخص حركة الكاميرا. لقطات الدولي، وحركات البان البطيئة، ومحاكاة الكاميرا المحمولة: النموذج يعرف كيف تتحرك الكاميرات، وينتج اهتزاز الكاميرا بخصائص أصيلة. أما حركة الكاميرا في Wan 2.7 Pro فهي أكثر اصطناعية قليلًا، إذ تبدو بعض حركاتها متحركة أكثر منها مسجّلة فيزيائيًا.
تفاعل الأجسام والتلامس
عندما تتفاعل الأجسام مع بعضها أو مع الأسطح، يتعامل Wan 2.7 Pro عادةً مع ديناميكيات التلامس بشكل أفضل. شخص يجلس يتفاعل مع الكرسي بإقناع. كتاب موضوع على طاولة يتفق مع المنطق الفيزيائي. ينتج Sora 2 Pro أحيانًا أجسامًا عائمة أو تداخلًا في سيناريوهات التفاعل، خاصة في الإطارات المحيطة مباشرة بلحظة التلامس.
الوجوه والبشرة والواقعية البشرية
اختبار اللقطة المقرّبة
هنا يتخذ كثير من صنّاع المحتوى قرارهم النهائي. هل ولّدت صورة شخصية؟ هل قرّبتها إلى 50% من التكبير؟ إذا استطعت رؤية تفاصيل المسام الفردية، وتشتت الضوء تحت الجلد بشكل متسق، وعيونًا تملك ملمس قزحية أصيلًا، فقد نجح النموذج.
ينتج Sora 2 Pro وجوهًا بدقة بنيوية استثنائية. النسب دقيقة، والتعبيرات معقولة. نادرًا ما ينتج النموذج الهندسة المشوّهة التي ابتُلي بها الذكاء الاصطناعي للفيديو في مراحله الأولى. مع ذلك، يحتفظ ملمس الجلد في اللقطات المقرّبة جدًا بجودة معالَجة قليلًا، كأن فلتر تنعيم للبشرة طُبّق أثناء التدريب.

الوجوه في Wan 2.7 Pro أقل اتساقًا من الناحية البنيوية قليلًا، لكن في لقطات المسافة المتوسطة (الرأس والكتفين)، تبدو الواقعية في الجلد أكثر طبيعية. أقل نعومة، وأدق فيزيائيًا على المستوى الإدراكي. المفارقة أن Wan 2.7 Pro يخسر أمام Sora 2 Pro في اختبارات الوجه الكبيرة، لكنه يفوز في المسافات التي تُؤطَّر فيها الوجوه فعلًا في السينما الحقيقية.
عرض العين ووادي الغرابة
عرض العين هو أسرع طريق إلى منطقة وادي الغرابة في فيديو الذكاء الاصطناعي. تحسّن النموذجان بشكل كبير، لكن عيون Sora 2 Pro ما تزال تُظهر أحيانًا تلك الجودة المميزة لظاهرة "العين الزجاجية"، حيث تبدو القزحية والحدقة صحيحتين لكن التفاعل الديناميكي للضوء لا يستجيب بشكل طبيعي لتغيّرات إضاءة المشهد. يتعامل Wan 2.7 Pro مع هذا بشكل أفضل في ظروف الإضاءة الثابتة، لكن حركة العين عبر قطع الكاميرا تبقى نقطة ضعف في النموذجين.
الإضاءة والملمس والتفاصيل البيئية
محاكاة الضوء الطبيعي
Sora 2 Pro ببساطة أفضل في الضوء. يملك النموذج فهمًا متفوقًا لكيفية تشتّت الضوء عبر الغلاف الجوي، وارتداده عن الأسطح، وإنشائه لتفاصيل ظلال واقعية. لقطات الساعة الذهبية من Sora 2 Pro استثنائية، مع جودة الضوء الحجمي التي تتطلب عادةً تصويرًا سينمائيًا حقيقيًا أو ساعات من التصيير ثلاثي الأبعاد.
إضاءة Wan 2.7 Pro كفؤة لكنها أكثر تسطّحًا في السيناريوهات متعددة المصادر المعقدة. المشاهد التي تجمع بين الضوء الاصطناعي والطبيعي، أو المشاهد المنتقلة من داخلي إلى خارجي، تُظهر انقطاعًا أكبر في مخرجات Wan 2.7 Pro.

دقة مواد الأسطح
يتعامل النموذجان بشكل جيد مع الأسطح الشائعة: الخرسانة، والخشب، والقماش، والزجاج. يظهر التباين في المواد المعقدة أو غير المعتادة. الجلد المتآكل، والمعدن الصدئ، والرمل الرطب بآثار الأقدام، والملمس المحدد للطوب القديم، هي المواضع التي تُظهر فيها تدريبات Wan 2.7 Pro المبنية على الفيزياء مزايا. سلوك المادة أثناء الحركة أدق، خاصة في المواد التي تتشوّه أو تستجيب للتلامس.
الواقعية في المدن والعمارة
في البيئات الحضرية، يؤدي النموذجان بمستوى عالٍ، لكن Sora 2 Pro يتفوق بوضوح في الدقة المعمارية. المباني تحافظ على هندسة صحيحة عبر حركات الكاميرا. المنظور لا ينحرف بشكل خفي. لصنّاع المحتوى الذين ينتجون لقطات لبيئات العالم الحقيقي، هذا الاتساق مهم.

حيث ما يزال النموذجان يعانيان
المشكلات التي لم تُحلّ بعد
لم يتمكن أيّ من النموذجين من حل فئات معينة من الواقعية. تستحق هذه المعرفة قبل أن تنفق النقاط على أوامر نصية ستفشل باستمرار:
- حركة اليد التفصيلية: ما يزال النموذجان ينتجان أيديًا بهندسة غير صحيحة في المشاهد النشطة. الأيدي الثابتة لا بأس بها. أما الأيدي المتحركة والمفصلية فتبقى غير موثوقة.
- النص داخل المشهد: أي نص مرئي في فيديو مولّد، على اللافتات أو الشاشات أو الكتب، سيكون مشوّهًا أو غير صحيح. هذه ليست مشكلة في الأمر النصي يمكن حلها.
- الحشود عالية الكثافة: الحشود الكبيرة ذات أنماط الحركة المتميزة لكل فرد تُربك النموذجين. تظهر عيوب التزامن عند حوالي 15 شخصًا أو أكثر.
- المقاطع الطويلة التي تتجاوز 10 ثوانٍ: يُظهر النموذجان تدهورًا في الجودة في المقاطع الممتدة. يصمد Sora 2 Pro لفترة أطول، لكن لا يمكن الاعتماد على أي منهما بعد 12 إلى 15 ثانية.
- أشخاص حقيقيون بعينهم: لا ينبغي استخدام أي من النموذجين لتوليد لقطات واقعية لأفراد حقيقيين أحياء.
💡 يعمل النموذجان بأفضل شكل مع موضوعات عامة في بيئات جيدة الإضاءة وبسيطة فيزيائيًا. التعقيد هو عدو الواقعية في فيديو الذكاء الاصطناعي من الجيل الحالي.
لماذا ما يزال الشكل القصير هو الأفضل؟
الاستنتاج العملي من كل نقطة ضعف ذُكرت أعلاه هو أن النموذجين محسّنان للمقاطع القصيرة المركّزة. أعلى جودة مخرجات من Sora 2 Pro وWan 2.7 Pro تأتي من مشاهد مدتها من 4 إلى 8 ثوانٍ، بشخص واحد، ومصدر ضوء واضح، وخلفية محدودة التعقيد. هذا ليس قيدًا يجب مقاومته، بل قيد إنتاجي يجب التصميم من حوله.
كيف تولّد فيديوهات واقعية بالذكاء الاصطناعي على PicassoIA
كل من Sora 2 Pro وWan 2.7 T2V متاحان مباشرة على PicassoIA، إلى جانب عائلة Wan 2.7 الكاملة بما في ذلك Wan 2.7 I2V لسير عمل تحويل الصورة إلى فيديو.
اختيار النموذج المناسب لحالة الاستخدام
استخدم هذا الجدول كمرجع سريع:
الأوامر النصية لأقصى قدر من الواقعية
أكبر عامل يحدد جودة المخرجات هو دقة الأمر النصي. الأوامر الغامضة تنتج نتائج متوسطة. الأوامر المحددة التي تتضمن تفاصيل الكاميرا والإضاءة تنتج نتائج سينمائية. هذه بعض المبادئ التي تحسّن المخرجات باستمرار:
- سمِّ الكاميرا: عبارة "مصوّر بفيلم 35 ملم" أو "لقطات Arri Alexa" تشير إلى توزيع التدريب الذي تريده.
- حدّد مصدر الضوء: عبارة "شمس بعد الظهر الدافئة من اليسار" تتفوق على "إضاءة طبيعية".
- صِف الحركة صراحةً: عبارة "دولي بطيء للداخل" أو "مشي وحديث بكاميرا محمولة" تمنح النموذج هدفًا للحركة.
- حدّد المسافة: عبارة "لقطة متوسطة" مقابل "لقطة مقرّبة جدًا" تؤثر بشكل كبير على كيفية توزيع النموذج لتفاصيل الملمس.
سير عمل التكرار
لا ينتج أيّ من النموذجين أفضل مخرجاته من التوليد الأول. يشغّل صنّاع المحتوى المحترفون عادةً من 3 إلى 5 نسخ من الأمر النصي، ثم يختارون ويحسّنون. على PicassoIA، يمكنك أيضًا استخدام Wan 2.7 I2V لتحريك صورة ثابتة اخترتها بالفعل، وهذا يتجاوز العشوائية التركيبية في تحويل النص إلى فيديو ويمنحك تحكمًا أكبر في الإطار الأول.
لمن يريد الذهاب أبعد، يقدّم LTX 2 Pro وKling v2.6 بنيات بديلة تتفوق أحيانًا على Sora 2 Pro وWan 2.7 Pro في أنواع معينة من الأوامر النصية. وVeo 3.1 وRay 2 720p وPixverse v5 تكمّل مجموعة أدوات متنوعة عندما تظهر نقاط ضعف نموذج ما.

الحكم: الواقعية المرتبطة بالسياق هي الفائزة
لا يوجد فائز واحد هنا. Sora 2 Pro هو النموذج الأقوى للقطات التي يجب أن تصمد مع مرور الوقت، في إضاءة متحكَّم بها، وبعمل كاميرا ثابت أو متعمَّد. Wan 2.7 Pro هو النموذج الأقوى للمحتوى الديناميكي الذي يعتمد على الحركة، حيث تكون الدقة الفيزيائية في دفعات قصيرة أهم من الاتساق على المدى الطويل.
الإجابة الحقيقية لصنّاع المحتوى الجادين هي أن يكون النموذجان ضمن أدواتهم، وأن يعرفوا أي المشكلات يحل كل منهما. على PicassoIA، يمكنك التبديل بين Sora 2 Pro وعائلة Wan 2.7 الكاملة وأكثر من 80 نموذجًا آخر من واجهة واحدة، دون إدارة مفاتيح API أو قوائم انتظار GPU أو فواتير من عدة مزودين.
سؤال أيّ النماذج يبدو واقعيًا لا يملك جوابًا واحدًا. لكن معرفة ما يُجيده كل نموذج تعني أن تتوقف عن التخمين وتبدأ التوليد بهدف. جرّب النموذجين على أوامرك النصية الخاصة، وسيتضح الفرق خلال بضع عمليات توليد.

ابدأ الاختبار على picassoia.com/en/all-models، حيث يتوفر كل نموذج في هذه المقارنة إلى جانب المجموعة الكاملة من أدوات تحويل النص إلى فيديو وتحويل الصورة إلى فيديو وتحرير الفيديو. محتواك الخاص هو المعيار الوحيد الذي يهم فعلًا.