أصبح السباق بين Veo 3.1 من Google و Sora 2 Pro من OpenAI أمرًا ملموسًا لا نظريًا. فقد أُطلق النموذجان، وكلاهما متاح عبر منصات مثل PicassoIA، وكلاهما خضع لسلسلة من الأوامر النصية الواقعية دون فلاتر، ودون انتقاء للنتائج، ودون دعاية من الشركات. يعرض هذا المقال ما أعادته النماذج.
أجرينا اثني عشر أمرًا نصيًا متطابقًا على النموذجين، تغطي حركة البشر ومشاهد البيئة والحركة التجريدية والسرد السينمائي. كانت النتائج مبهرة أحيانًا ومحبطة أحيانًا أخرى، وهذا بالضبط نوع البيانات الذي يحتاجه صنّاع المحتوى قبل اعتماد سير عمل معين. إذا كنت تنتظر مقارنة صادقة جنبًا إلى جنب تعامل النموذجين بالمساواة، فهذه هي.

ما الذي تقيسه هذه الاختبارات فعلًا
قبل الخوض في المخرجات، من المهم توضيح ما نقيسه ولماذا هو مهم. توليد الفيديو بالذكاء الاصطناعي لا يقتصر على كون المقطع جميلًا. تنقسم قابلية الاستخدام الفعلية إلى أربعة محاور تحدد ما إذا كانت اللقطات صالحة للاستخدام في الإنتاج.
دقة تنفيذ الأمر النصي
هل يفعل النموذج ما طلبته؟ إذا كتبت "امرأة تركض في المطر ليلًا بحركة بطيئة"، فهل يطابق الناتج هذا الوصف إطارًا بإطار، أم ينحرف إلى شيء قريب منه بشكل غامض؟ دقة تنفيذ الأمر النصي هي الفرق بين أداة تعمل وأداة تحتاج إلى إعادة توليد مستمرة للاقتراب من المطلوب.
الاتساق الزمني
هل تحافظ الأشخاص والأشياء على تماسكها الفيزيائي طوال المقطع؟ الوجه الذي يتشوّه بين الإطارات، أو اليد التي تكتسب أصابع وتفقدها، يجعل اللقطات غير صالحة للاستخدام بغض النظر عن جودتها البصرية الأولية. هذه من أصعب المشكلات في توليد الفيديو بالذكاء الاصطناعي، وهي المشكلة التي تظهر فيها أغلب النماذج تصدعات واضحة حتى الآن.
الواقعية الفوتوغرافية وجودة الحركة
يتعلق هذا بمدى معقولية الحركة فيزيائيًا. الكائنات البشرية الحقيقية تملك اهتزازات دقيقة، وتحولات في الوزن، وحركة ثانوية في الملابس والشعر. النماذج التي تحاكي ذلك بدقة تنتج فيديو يبدو مقنعًا بسرعة التشغيل الطبيعية دون أن يثير استجابة وادي الغرابة (uncanny valley).
سرعة التوليد
في سير العمل الإنتاجي، الوقت من ذهب. النموذج الذي يستغرق ثماني دقائق لإنتاج مقطع مدته خمس ثوانٍ، مقابل آخر يسلّمه في تسعين ثانية، يمثل فرقًا كبيرًا في سير العمل عندما تكرر تحسين الأوامر النصية عبر مشروع كامل.

أوامر الاختبار الـ 12 التي استخدمناها
صمّمنا أوامر نصية في أربع فئات لاختبار قدرات مختلفة في النماذج. أُرسلت الأوامر الاثنا عشر نفسها إلى النموذجين دون أي تعديل.
الفئة 1: حركة الإنسان
- لقطة مقرّبة بالحركة البطيئة لوجه امرأة تتفاعل مع المطر
- رجل يركض عبر شارع مدينة مبلل بالمطر ليلًا
- شخصان يتصافحان في مكتب مضاء بضوء الشمس
الفئة 2: الطبيعة والبيئة
- أمواج المحيط تتكسر على منحدر صخري عند الغروب
- أوراق الخريف تتساقط في حديقة، والرياح مرئية في الأشجار
- لقطة جوية لوادٍ جبلي عند الفجر
الفئة 3: التجريد والمفاهيم
- حبر ينتشر في الماء، لقطة ماكرو، حبر أسود وماء أبيض
- ساعة تذوب على سطح صحراء حار
- دخان ملوّن يتصاعد حلزونيًا في غرفة مظلمة
الفئة 4: الدراما السينمائية
- امرأة ترتدي فستانًا أحمر تقف على حافة سطح عمارة ليلًا، وأضواء المدينة في الأسفل
- سيارتان تتسابقان عبر نفق فارغ، بإضاءة عملية فقط
- نار مخيم تتأجج في غابة، دون أشخاص، فقط النار والأشجار
💡 لماذا هذه الأوامر؟ تختبر حركة الإنسان الاتساق الزمني. وتختبر الطبيعة محاكاة الفيزياء. وتختبر التجريدية التفسير الإبداعي. وتختبر السينمائية الإضاءة والتكوين والمزاج. معًا تضغط على كل بُعد يهم في إنتاج المحتوى الحقيقي.

نتائج Veo 3.1: ما الذي أنتجه فعلًا
يمثل Veo 3.1 من Google تحسنًا كبيرًا على Veo 3. يقدّم النموذج مخرجات أصلية بدقة 1080p، وتماسكًا زمنيًا أقوى، وفهمًا محسّنًا بشكل ملحوظ للعلاقات الفيزيائية بين السبب والنتيجة بين الأشياء والبيئات.
حيث يتفوق Veo 3.1
كانت حركة الإنسان المجال الذي أبهر فيه Veo 3.1 بأكبر قدر من الثبات. فقد ظهر وجه المرأة وهي تتفاعل مع المطر بتعابير دقيقة مقنعة، وقطرات الماء تتفاعل بشكل صحيح مع ملمس الجلد، وهوية الوجه ثابتة عبر كل الإطارات. أما الرجل الذي يركض في شارع مبلل فقد أظهر انتقالًا واقعيًا للوزن، وضبابية حركة مناسبة على أطرافه، وانعكاسات على الرصيف المبلل تتبع مصدر الضوء بشكل صحيح.
كانت مشاهد الطبيعة قوية بالقدر نفسه تقريبًا. اتسمت أمواج المحيط بميكانيكا رغوة معقولة فيزيائيًا، وانحنت قمة الموجة وانكسرت بشكل صحيح عند واجهة المنحدر، وبقيت الإضاءة على الصخور ثابتة من إطار إلى آخر. تحركت أوراق الخريف بعشوائية حقيقية بدلًا من نمط المحاكاة المتكرر الذي تنتجه النماذج الأرخص غالبًا.
كان الصوت المولَّد عاملًا مميزًا كبيرًا. ينتج Veo 3.1 صوتًا أصليًا متزامنًا، وليس صوتًا مضافًا في مرحلة ما بعد الإنتاج. تطابقت أصوات المطر مع شدة ارتطام الماء بالأسطح، وتزامنت طقطقة نار المخيم مع حركة اللهب المرئية، وكان لصوت محركات السيارات المتسابقة فصل ستيريو واقعي مع مرور المركبات عبر إطار النفق. هذه قدرة تغيّر سير عمل إنتاج المحتوى بشكل ملموس.
حيث يقصّر Veo 3.1
كشفت الأوامر التجريدية والمفاهيمية عن نوع من التحفظ في النموذج. جاءت "ساعة تذوب على سطح صحراء" حرفية وبخيال بصري محدود، فغاب عنها الطابع السريالي الذي يوحي به الأمر النصي. كان انتشار الحبر في الماء متقنًا تقنيًا، لكنه افتقر إلى الديناميكيات الفوضوية حقًا للسوائل التي تراها في التصوير الماكرو الحقيقي.
بلغ زمن التوليد في المتوسط نحو أربع دقائق لكل مقطع مدته خمس ثوانٍ، وهو زمن مقبول لكنه ليس سريعًا للعمل التكراري. يخفّض إصدار Veo 3.1 Fast هذا الزمن بشكل كبير مقابل تراجع طفيف في الجودة، ويقدم Veo 3.1 Lite خيارًا أسرع ودقة أقل لاختبار الفكرة قبل الالتزام بالتصيير الكامل.

نتائج Sora 2 Pro: ما الذي أنتجه فعلًا
يجلب Sora 2 Pro فلسفة OpenAI في محاكاة العالم إلى توليد الفيديو. ففي حين يميل Veo 3.1 نحو الدقة التقنية، يتجه Sora 2 Pro نحو التفسير الإبداعي والنطاق السينمائي. يشكّل هذا الفرق كل مخرج بطرق واضحة فورًا.
جودة التفسير الإبداعي
كان أداء Sora 2 Pro في فئة الدراما السينمائية رائعًا حقًا. بدت المرأة ذات الفستان الأحمر على السطح ليلًا وكأنها إطار من إنتاج رفيع المستوى، بمزاج ولغة بصرية متقنة. حملت أضواء المدينة في الأسفل توهج عدسة وعمقًا، وفصلًا لدرجة حرارة اللون بين الدافئ والبارد. بدا التكوين مقصودًا بشكل تركيبي يوحي بأن النموذج فهم النية الجمالية وراء الأمر النصي، لا محتواه الحرفي فقط.
أعطى أمر نار المخيم نتيجة تجاوزت المطلوب حرفيًا: طبقة ضباب خفيفة انسابت بين الأشجار، وتكيّف التعريض الضوئي ديناميكيًا مع تغيّر شدة النار بنمط طبيعي يشبه التنفس. هذا النوع من التزيين الإخراجي هو ما يميّز Sora 2 Pro عن النماذج التي تنفّذ الأوامر ببساطة دون تفسير.
مشكلات الالتزام بالأمر النصي
الوجه الآخر للتفسير الإبداعي هو الانحراف. في اثنين من أصل اثني عشر أمرًا، أنتج Sora 2 Pro مخرجات قوية بصريًا لكنها تختلف اختلافًا ملحوظًا عما طُلب. أمر "شخصان يتصافحان في مكتب مضاء بضوء الشمس" أنتج مشهدًا بدا أقرب إلى مفاوضة متوترة في قاعة اجتماعات معتمة الإضاءة، ووصلت لقطة "لقطة جوية لوادٍ جبلي عند الفجر" بضوء منتصف الصباح دون أي دفء للفجر.
بالنسبة لصنّاع المحتوى الذين يحتاجون إلى تنفيذ حرفي للأمر النصي بدلًا من التزيين الإبداعي، يمثل هذا الانحراف عقبة حقيقية تتطلب هندسة أوامر إضافية لإدارته.
الاتساق الزمني تحت الضغط
أظهر Sora 2 Pro مشكلات طفيفة في الاتساق في اثنين من الأوامر النصية الاثني عشر الخاصة بحركة الإنسان. فقد تغيّر ملمس كم سترة الرجل الراكض في منتصف المقطع تقريبًا، وظهر في مصافحة المكتب خلل مؤقت في شكل اليد عند علامة الثانيتين تقريبًا. كانت هذه العيوب خفيفة بما يكفي لتمرّ في المشاهدة العابرة، لكنها لن تصمد أمام الفحص الدقيق في حالات الاستخدام التجاري التي يُدقَّق فيها كل إطار.

تفصيل نتائج المواجهة المباشرة
بعد تشغيل الأوامر الاثني عشر كلها وتقييم كل مخرج من 1 إلى 10 عبر المحاور الأربعة، هذه هي النتائج الإجمالية:
| الفئة | Veo 3.1 | Sora 2 Pro |
|---|
| دقة تنفيذ الأمر النصي | 8.7 | 7.2 |
| الاتساق الزمني | 8.9 | 7.8 |
| الواقعية الفوتوغرافية | 8.4 | 8.6 |
| الإبداع في المخرجات | 7.1 | 9.2 |
| سرعة التوليد | 7.0 | 7.5 |
| مزامنة الصوت الأصلي | 9.1 | 8.3 |
| المتوسط الإجمالي | 8.2 | 8.1 |
النتائج متقاربة للغاية، وهذا يعكس الواقع الفعلي لفضاء توليد الفيديو بالذكاء الاصطناعي في الفئة العليا: كلا النموذجين ممتاز حقًا، والفروق أصبحت ظرفية أكثر منها جوهرية.
💡 الجواب الحقيقي عن أيهما أفضل: يعتمد على ما تحتاجه من المخرج. Veo 3.1 للدقة وإتقان الصوت. Sora 2 Pro للأجواء والإحساس السينمائي.

مسألة الصوت
هناك عامل يستحق قسمًا خاصًا به: الصوت المتزامن المدمج. هذه ليست ميزة ثانوية.
ينتج Veo 3.1 صوتًا متزامنًا مع المحتوى البصري على المستوى التوليدي. عندما يسقط المطر، تسمع صوته متزامنًا مع لحظة ارتطام الماء المرئية. عندما تتسارع السيارة، يتبع صوت المحرك الحركة المرئية بدقة. هذا مهم جدًا لمحتوى وسائل التواصل الاجتماعي، حيث يفقد المقطع الذي لا يبدو صوته مقنعًا تفاعل الجمهور فورًا مقارنة بمقطع يبدو صوته غامرًا وواقعيًا.
Sora 2 Pro يدعم توليد الصوت هو الآخر، لكن المزامنة كانت أقل دقة قليلًا في اختباراتنا. انحرف صوت النار قليلًا عن طقطقة اللهب المرئية في أطول مقطع، وبدت أصوات المحيط في مشاهد الطبيعة أحيانًا أقرب إلى مشاهد صوتية عامة منها إلى صوت يتفاعل مع ما يحدث على الشاشة فعلًا.
بالنسبة لصنّاع المحتوى الذين يخططون لإضافة موسيقى مخصصة أو تعليق صوتي على أي حال، يقل أهمية هذا الفرق. لكن للمحتوى السريع لوسائل التواصل الاجتماعي حيث يجب أن يعمل الصوت مباشرة من المولّد، يتمتع Veo 3.1 حاليًا بالأفضلية.
ما الذي تنتجه النماذج الأخرى
لا يوجد هذان النموذجان في فراغ. فقد قدّم فضاء تحويل النص إلى فيديو الأوسع بدائل قوية تستحق المعرفة قبل أن تلتزم بنموذج واحد:
Seedance 2.5 من ByteDance يقدّم مقاطع تصل إلى 30 ثانية مع صوت مدمج واتساق زمني قوي، مما يجعله بديلًا موثوقًا للمحتوى الأطول الذي لا يغطيه Veo 3.1 ولا Sora 2 Pro بهذه المدة.
Ray 3.2 من Luma AI يجلب إمكانات HDR سينمائية وجودة حركة قوية، خاصة في الأوامر البيئية والطبيعية حيث يكون التعامل مع النطاق الديناميكي أفضل من المعتاد بشكل ملحوظ.
Kling v3 Video من Kwai ينتج مخرجات 1080p مقنعة مع معالجة جيدة بشكل خاص للأشخاص وحركة الشخصيات، و Kling v2.6 يقدم بديلًا أسرع بجودة قريبة جدًا في معظم أنواع الأوامر.
Wan 2.7 T2V يقدم تحويل نص إلى فيديو بدقة 1080p وبجودة عالية، مع سرعة توليد تناسب سير العمل التكراري السريع، مما يجعله خيارًا افتراضيًا متينًا للفرق التي تحتاج إلى حجم كبير من الإنتاج.
LTX 2.3 Pro من Lightricks يتجه نحو دقة 4K، مما يجعله خيارًا عمليًا عندما تكون الدقة أهم من سرعة التوليد.
💡 جميع هذه النماذج متاحة عبر PicassoIA دون الحاجة إلى تثبيت برامج. يمكنك التنقل بينها بحرية لإيجاد الأنسب لكل مشروع.

استخدام Veo 3.1 و Sora 2 Pro
تستضيف PicassoIA كلًا من Veo 3.1 و Sora 2 Pro مباشرة. إليك كيفية الحصول على أفضل المخرجات من كل منهما.
تشغيل Veo 3.1 بفعالية
اكتب أوامر نصية وصفية وحرفية. يكافئ Veo 3.1 التحديد. ضمّن اتجاه الإضاءة، ووقت اليوم، وزاوية الكاميرا، وسلوك الشخص، والتفاصيل البيئية. فالأمر "امرأة بشعر كستنائي تمشي بين أوراق الخريف في حديقة الساعة 5 مساءً، إضاءة دافئة من الجانب الأيسر، وكاميرا تتحرك ببطء بانوراميًا" سيتفوق على "امرأة في حديقة" بفارق كبير.
استخدم إصدارات السرعة للتكرار. يفيد Veo 3.1 Fast في اختبار تنويعات الأوامر النصية قبل الالتزام بالتصيير الكامل. أما Veo 3.1 Lite فهو مثالي لاختبار الفكرة بأقل تكلفة عندما تحتاج فقط إلى معرفة ما إذا كان اتجاه المشهد ينجح.
دع الصوت يؤدي دوره. لا تخطط لكتم صوت المخرج افتراضيًا. اكتب أوامر تراعي ما تريد سماعه، وسيولّد النموذج صوتًا متزامنًا يخدم المقطع دون جهد إضافي.
تشغيل Sora 2 Pro بفعالية
استخدم لغة الإخراج. يستجيب Sora 2 Pro بقوة للتوجيه السينمائي. عبارات مثل "إضاءة فيلم نوار"، و"الساعة الذهبية"، و"عمق ميداني ضحل"، و"دوللي بطيء نحو الداخل"، و"توهج عدسة درامي" تنتج نتائج تركّز على نقاط قوة النموذج وتخرج مخرجات تبدو سينمائية حقًا.
توقّع الإضافات الإبداعية وتعامل معها. سيزيّن النموذج المشهد. إذا كان ذلك مشكلة لبريف معين، فإن إضافة "بالضبط كما هو موصوف، دون عناصر إضافية" إلى أمرك النصي ستجعله أكثر تحفظًا دون أن تفقد جودته.
جرّب أيضًا Sora 2. النسخة غير Pro أسرع ولها تكلفة أقل لكل توليد، وفي كثير من أنواع الأوامر لا يكون فرق الجودة كبيرًا بما يكفي لتبرير الفجوة، خاصة في المحتوى الاجتماعي.

أيهما يجب أن تستخدم
إليك تفصيلًا مباشرًا حسب حالة الاستخدام، بناءً على النتائج الفعلية لهذه الاختبارات:
لا يوجد نموذج أفضل في كل شيء. المحترفون الذين يعملون عبر أنواع مختلفة من المحتوى سينتهي بهم الأمر غالبًا إلى استخدام الاثنين، كل منهما في الفئة التي يتفوق فيها.
💡 أقوى نهج إنتاجي: استخدم Veo 3.1 كمولّد أساسي للمقاطع المتطلبة تقنيًا حيث تهم الدقة ومزامنة الصوت، واللجوء إلى Sora 2 Pro عندما يتطلب البريف الأجواء والسرد البصري بدلًا من الدقة.
لماذا يتحرك هذا المجال بهذه السرعة
تلقى النموذجان تحديثات كبيرة هذا العام وحده. تحسّن Veo 3.1 بشكل كبير على Veo 3، خاصة في الاتساق الزمني ومزامنة الصوت، وهما المجالان الأضعف في سلفه. دفع Sora 2 Pro السقف الإبداعي أعلى من Sora 2 بطرق تظهر فورًا في الأوامر السينمائية.
هذا المعدل من التغيير يعني أن أي اختبار معياري هو لقطة لحظية. تعكس النتائج أعلاه ما ينتجه النموذجان حتى سبتمبر 2025. وبحلول وقت قراءتك لهذا، قد يظهر Veo 3.2 أو إصدار جديد من Sora يغيّر المقارنة في هذا الاتجاه أو ذاك.
الفكرة الأكثر ديمومة هي المنهجية: شغّل أوامرك الخاصة، وقيّمها وفق المحاور التي تهم عملك تحديدًا، وحدّث أدواتك بناءً على ما تكتشفه فعلًا في الممارسة. لا يمكن لأي اختبار معياري منشور، بما في ذلك هذا، أن يحل محل الاختبار على بريفاتك الخاصة.

أجرِ اختباراتك بنفسك الآن
المخرجات في هذا المقال جاءت من أوامر نصية حقيقية شُغّلت عبر منصة PicassoIA. كل نموذج مذكور، بما في ذلك Veo 3.1، و Sora 2 Pro، و Seedance 2.5، و Ray 3.2، و Kling v3، و Kling v2.6، و Wan 2.7 T2V، و LTX 2.3 Pro، متاح في مكان واحد دون الحاجة إلى حسابات منفصلة أو مفاتيح API لكل منها.
أفضل طريقة لتكوين رأيك المستنير هي أن تأخذ الأوامر الاثني عشر من هذا المقال، وتشغّلها بنفسك، وتقيّم ما يعود. سيُرجّح نوع محتواك وتفضيلاتك الجمالية المحاور الأربعة بشكل مختلف عن تقييمنا، مما يعني أن أفضل نموذج لك قد يختلف عن نموذجنا، وهذا بالضبط هو المقصود.
تصفح جميع النماذج وابدأ التوليد من picassoia.com/en/all-models.