ستون ثانية. هذه هي المدة التي يمنحها المشاهد المتوسط لفيديو YouTube Shorts قبل أن يمرّره. عندما أطلقت OpenAI نموذج Sora 2.5، بدأ صنّاع المحتوى يطرحون سؤالًا واحدًا فورًا: هل يستطيع هذا النموذج فعلًا إنتاج محتوى قصير يحافظ على انتباه المشاهد؟ أجرينا عليه اختبارًا منظمًا عبر اثنتي عشرة فئة من الأوامر النصية، قسنا فيه ثبات المخرجات، وإيقاع المقاطع، ومعالجة الصيغة العمودية، والتكلفة الفعلية لكل ثانية. النتائج أعقد مما توحي به الضجة الأولى.

ما الذي يقدّمه Sora 2.5 فعلًا
أهم ما يميّز Sora 2.5 هو فيديو الذكاء الاصطناعي عالي الدقة من الأوامر النصية، مع تماسك أفضل في الحركة مقارنةً بسابقيه. بالنسبة إلى YouTube Shorts تحديدًا، فإن المواصفات المهمة هي: دعم 9:16 بشكل أصلي، وإخراج يصل إلى 20 ثانية لكل توليد في المستوى القياسي، وثبات أفضل للشخص عبر الإطارات مقارنةً مع Sora 2. على PicassoIA يمكنك الوصول إلى Sora 2 وSora 2 Pro لمقارنة المستويين جنبًا إلى جنب مع هذا النموذج الجديد.
لكن المواصفات على الورق لا تعني الأداء داخل سير عمل محتوى عمودي. إليك ما يحدث فعلًا عند تشغيله.
الإخراج العمودي 9:16: الواقع
يدعم Sora 2.5 تصيير نسبة 9:16 بشكل أصلي، وهذا أول ما يجب التحقق منه في أي سير عمل موجّه إلى Shorts. تصل دقة الإخراج إلى 1080 x 1920 بكسل عند الإعداد الصحيح. لكن هناك تحفظ: إذا لصقت أمرًا نصيًا دون تحديد الصيغة العمودية صراحةً، فإن Sora 2.5 يعتمد الإطار العريض 16:9 افتراضيًا. وهذا يعني خطوات معالجة لاحقة تُدخل تشوهات على الحواف، وتستهلك نقاط التوليد على مقطع لا يمكنك استخدامه مباشرة.
💡 أدرج دائمًا "vertical 9:16 portrait orientation" في كل أمر نصي تستخدمه لـ Shorts. بدونه، ستقتطع مخرجاتك وتُضعف جودتها قبل أن يصل المقطع إلى الخط الزمني للمونتاج.
مشكلات مدة المقطع والإيقاع
تتراوح مدة Shorts الأقوى أداءً في الخوارزمية بين 15 و45 ثانية. يولّد Sora 2.5 حتى 20 ثانية لكل أمر في المستوى القياسي. الوصول إلى 45 أو 60 ثانية يتطلب إما دمج عدة توليدات معًا، أو الترقية إلى خطة Pro للحصول على إخراج أطول. ولا يعدّ أي من المسارين سلسًا. غالبًا ما تُظهر نقاط الوصل بين التوليدات اختلافًا خفيفًا لكنه ملحوظ في الإضاءة أو الحركة، وهو ما يلتقطه المشاهدون المتمرسون فورًا.
كذلك يسير الإيقاع نفسه أبطأ قليلًا مما تكافئه خلاصة Shorts. فحيث قد يقطع المونتير البشري كل 2 إلى 3 ثوانٍ في مقطع رائج، يميل إخراج Sora 2.5 إلى إبقاء كل لقطة من 4 إلى 6 ثوانٍ في سلوكه الافتراضي، وهذا يبدو بطيئًا مقارنةً بمحتوى Shorts المُنشأ أصلًا لهذه الصيغة.

كيف صمّمنا هذا الاختبار
قبل الخوض في النتائج، تهم المنهجية. فاختبارات "جرّبته وهذا رأيي" لا تقول شيئًا مفيدًا. إليك بالضبط كيف جرى هذا التقييم.
فئات الأوامر النصية الـ 12 التي اختبرناها
بنينا 12 فئة متميزة من الأوامر النصية تحاكي ما ينتجه صنّاع Shorts الفعليون يوميًا:
- مناظر طبيعية خارجية سينمائية (طبيعة، لقطات سفر مساندة)
- مشاهد الشوارع الحضرية (حياة المدينة، لقطات الحشود)
- مقاطع بأسلوب الرأس المتحدث (مقدّم يواجه الكاميرا)
- تسلسلات أكشن بقطع سريع (رياضة، حركة)
- لقطات عرض المنتجات (لقطات مقرّبة للأشياء)
- مقاطع نمط الحياة والمزاج (روتين الصباح، الحياة اليومية)
- انتقالات بصرية تجريدية (للموسيقى أو المحتوى المونتاجي)
- لقطات الطعام والطهي (مشاهد مطبخ مقرّبة)
- لقطات تعليمية من فوق الكتف (تسجيلات شاشة وعروض توضيحية)
- العمارة والمساحات الداخلية (العقارات، محتوى التصميم)
- مشاهد ليلية وإضاءة خافتة (مقاطع أجواء)
- محتوى نصي على الشاشة (إحصاءات، اقتباسات، تعليقات توضيحية)
تلقّت كل فئة خمسة تنويعات للأوامر النصية، ليصل المجموع إلى 60 توليدًا فرديًا عبر الاختبار كاملًا.
ما الذي قِسناه
قُيّم كل مقطع وفق أربعة معايير، مرجّحة بحسب مدى تأثير كل عامل فعليًا في أداء Shorts:
| المعيار | الوزن | ما الذي تحقّقنا منه |
|---|
| التماسك البصري | 30% | لا وميض، ولا تشوهات تحوّل |
| ثبات الشخص | 25% | الشخص نفسه عبر كل الإطارات |
| ملاءمة الإيقاع | 25% | سرعة الحركة تتوافق مع عادات مشاهدة Shorts |
| دقة الأمر النصي | 20% | المخرج يطابق ما وُصف |

أداء المشاهد السينمائية
هنا يتألق Sora 2.5 أكثر من غيره. سجّلت المناظر الطبيعية الخارجية، والبيئات الحضرية، واللقطات المعمارية باستمرار أكثر من 80% في جميع المعايير. الحركة الفيزيائية مقنعة: الماء يتحرك بوزن معقول، والرياح بين الأشجار تبدو طبيعية، وحركة الكاميرا تبدو مقصودة ومُركّبة بعناية لا عشوائية وفق الخوارزمية.
بالنسبة إلى صنّاع محتوى السفر، أو قنوات الطبيعة، أو لقطات الأجواء الهادئة، يقدّم Sora 2.5 مقاطع تصمد عند العرض بملء الشاشة على هاتف حديث. كما أن تصيير الملمس على الأسطح العضوية، من أوراق الشجر والحجر والرمال، قوي بشكل خاص، ويمنح المخرجات جودة فوتوغرافية ترفعها فوق نماذج الجيل السابق.
المناظر الطبيعية الخارجية
الأمر النصي المختبر: "Golden hour cliff edge overlooking ocean, slow dolly-forward, warm amber light, 9:16 portrait."
جودة المخرج: 87/100. ظل الأفق ثابتًا، وبقيت الإضاءة متماسكة عبر المقطع البالغ 18 ثانية، وبدت حركة الاقتراب البطيئة كأنها تكوين سينمائي مقصود. هذا النوع من اللقطات المساندة كان سيكلّف فريق إنتاج نصف يوم تصوير في الموقع لالتقاطه. بالنسبة إلى صنّاع السفر أو قنوات المحتوى الهادئ، تستحق هذه الفئة وحدها اختبارًا جادًا.
مشاهد الشوارع الحضرية
أعطت الأوامر الحضرية نتائج أكثر تفاوتًا. ظهرت الحشود بواقعية على مسافة، لكن بدأ يظهر تشوّه خفيف في الوجوه لأي مارّ يبقى في الإطار أكثر من 4 ثوانٍ. بالنسبة إلى لقطات الإدراج المساندة التي لا يتصدّر فيها وجه مركز الإطار، يكون المخرج نظيفًا. أما في أي مشهد تتوقف فيه الكاميرا عند شخص واحد، فيبدأ الثبات بالانحراف بطرق لن تجتاز تدقيق المشاهد المتفحص.
💡 نصيحة لمشاهد الشوارع: استخدم أوامر الحشود مع لقطات تأسيسية واسعة وتكوين يبتعد عن الحركة. تجنّب كل ما يتطلب أن يبقى المارّ شخصًا مستقرًا قابلًا للتمييز عبر عدة ثوانٍ من اللقطات.
أين ينهار Sora 2.5
ظهرت ثلاثة أنماط فشل باستمرار عبر توليداتنا الـ 60. لا يُعدّ أيٌّ منها عائقًا حاسمًا لكل حالة استخدام، لكن بالنسبة إلى YouTube Shorts تحديدًا، يشكّل اثنان منها مشكلة كبيرة.
ثبات الشخصيات عبر المقاطع
هذه أهم محدودية لصنّاع Shorts. إذا كان محتواك يتطلب ظهور الشخص نفسه أو المنتج أو الشخصية نفسها باستمرار عبر عدة مقاطع، فإن Sora 2.5 لا يستطيع تحقيق ذلك أصلًا. كل توليد جديد ينشئ شخصًا جديدًا. يتغيّر لون الشعر، وتختلف ملامح الوجه، وتتبدّل الملابس. ودمج هذه المقاطع في Short متماسك يتطلب إما مدخلات صور مرجعية كثيفة، أو عملًا كبيرًا بعد الإنتاج يُلغي القيمة الزمنية لتوليد الذكاء الاصطناعي تمامًا.

بالنسبة إلى القنوات التي تقدّم محتوى تقوده شخصيات أو علامة شخصية، تمثّل هذه الفجوة عائقًا حاسمًا. تحلّ نماذج تحويل الصورة إلى فيديو على PicassoIA هذه المشكلة بطريقة مختلفة: تزوّدها بصورة مرجعية لموضوعك، ويتحرك النموذج انطلاقًا من نقطة بداية ثابتة، محافظًا على المظهر طوال المقطع كله.
تصيير النصوص والطباعة
فشلت الفئة 12 في اختبارنا، أي محتوى النصوص على الشاشة، أشدّ الفشل. لا يستطيع Sora 2.5 تصيير نص مقروء داخل الفيديو المولَّد بشكل موثوق. تتلطّخ الحروف، ويتعطّل الإملاء في منتصف المقطع، وأي أمر يطلب ظهور نص في المشهد ينتج مشكلات في الوضوح في نحو 70% من المخرجات.
بالنسبة إلى Shorts التي تعتمد على النصوص الحركية بأسلوب التعليقات، أو الإحصاءات المعروضة على الشاشة، أو أي كلمات مكتوبة كجزء من التكوين البصري، لا يُعدّ Sora 2.5 الأداة المناسبة دون طبقة معالجة لاحقة تضيف النص كعنصر تراكبي منفصل.
التكلفة لكل ثانية من الإخراج
وفق التسعير الحالي، يكلّف إخراج Sora 2.5 القياسي نحو 0.15 إلى 0.20 دولار لكل ثانية من الفيديو المولَّد. يكلّف Short مدته 45 ثانية ما بين 6.75 و9.00 دولار من نقاط التوليد الخام، دون احتساب إعادة المحاولة للمخرجات الفاشلة. وعلى جدول نشر أسبوعي من خمسة Shorts، يصل ذلك إلى 135 إلى 225 دولارًا أسبوعيًا تكلفةً للتوليد وحده، قبل أي تكاليف مونتاج أو توزيع. بالنسبة إلى صنّاع المحتوى الذين يحتاجون حجمًا يوميًا ثابتًا، يصبح هذا الهيكل السعري قيدًا جادًا.

المقارنة مع المنافسين
لا يعمل Sora 2.5 وحيدًا. إليك موقعه بين أقوى أدوات توليد الفيديو بالذكاء الاصطناعي المتاحة حاليًا لسير عمل YouTube Shorts:
| النموذج | الأفضل لـ | دعم الصيغة العمودية | ثبات الشخصيات | التكلفة |
|---|
| Sora 2.5 | لقطات سينمائية مساندة | نعم (يدويًا) | منخفض | $$$ |
| Seedance 2.5 | مشاهد متعددة وسريعة | نعم (أصلي) | متوسط | $$ |
| Veo 3.1 | مقاطع متزامنة مع الصوت | نعم | متوسط إلى مرتفع | $$$ |
| Kling v3 | محتوى تقوده الشخصيات | نعم | مرتفع | $$ |
| Ray 3.2 | سينمائي بنطاق HDR | نعم | متوسط | $$ |
| Pixverse v6 | صوت وفيديو بالذكاء الاصطناعي | نعم | متوسط | $ |
| Wan 2.7 I2V | تحويل الصورة إلى فيديو | نعم | مرتفع جدًا | $ |
يحكي عمود التكلفة جزءًا كبيرًا من القصة. تقدّم عدة أدوات جودة سينمائية مماثلة بجزء من سعر Sora 2.5، مع ثبات أفضل بوضوح للشخصيات في المحتوى الذي تقوده الشخصيات. والنماذج في الفئات الأدنى تكلفةً تملك أيضًا أزمنة إخراج أسرع، وهذا مهم حين تنشر خمسة Shorts أو أكثر أسبوعيًا.
أفضل نماذج الذكاء الاصطناعي لفيديوهات YouTube Shorts
استنادًا إلى نتائج الاختبار وبيانات المقارنة المباشرة، إليك النماذج التي تفوّقت باستمرار في سير العمل الموجّه إلى Shorts.

يتعامل Seedance 2.5 من ByteDance مع أوامر Shorts السريعة متعددة المشاهد بشكل أفضل من Sora 2.5 في اختباراتنا. دعم الصيغة العمودية الأصلي موثوق دون إعداد يدوي، ويتوافق إيقاع الحركة بشكل طبيعي مع أسلوب المونتاج السريع الذي ينجح في خلاصة Shorts. وبالنسبة إلى من يريدون تجربة سير العمل مجانًا أولًا، يعمل Seedance 2.5 Lite حتى 10 ثوانٍ لكل مقطع دون تكلفة، وهذا يكفي لتغطية قسم كامل من أي Short تبنيه.
بالنسبة إلى المحتوى الذي تقوده الشخصيات، حيث يهم ثبات الشخص فعلًا، يُعدّ Kling v3 الأقوى أداءً في هذه المقارنة. يحافظ الإخراج السينمائي بدقة 1080p على مظهر الشخص ثابتًا عبر مدة المقطع كاملة. وعند اقترانه بصورة مرجعية، يتعامل مع المحتوى الشخصي والعلامة الشخصية بطريقة لا يستطيع Sora 2.5 مضاهاتها اليوم. وبالنسبة إلى من يحتاجون تحكمًا دقيقًا في الحركة عبر حركة الشخصيات، يذهب Kling v3 Motion Control بهذه القدرة أبعد بدقة على مستوى طبقة الحركة.
تضيف نماذج Veo من Google شيئًا يفتقر إليه Sora 2.5 في المستوى القياسي: صوتًا متزامنًا أصليًا. بالنسبة إلى Shorts التي يجب أن تتطابق فيها الأصوات المحيطة أو الحوار أو الأجواء الموسيقية مع المخرج البصري، يولّد Veo 3 الصوت مع الفيديو بدلًا من الحاجة إلى مسار صوتي منفصل في مرحلة ما بعد الإنتاج. يرفع Veo 3.1 ذلك إلى إخراج كامل بدقة 1080p مع تزامن أدق بين الصورة والصوت، بينما يقلّص Veo 3.1 Fast زمن انتظار التوليد بشكل كبير دون تراجع كبير في الجودة.

إذا كان سير عمل Shorts يبدأ من صورة فوتوغرافية، أو رسم توضيحي، أو صورة منتج، فإن مسار تحويل الصورة إلى فيديو يحل مشكلة ثبات الشخص بالكامل. يأخذ Wan 2.7 I2V الصورة المزوّدة كأول إطار، ويتحرك إلى الأمام انطلاقًا منها، محافظًا على مظهر الشخص طوال المقطع. ويتولى Wan 2.7 T2V المرافق تحويل النص إلى فيديو بدقة 1080p للقطات المساندة الخالصة واحتياجات لقطات البيئة.
بالنسبة إلى صنّاع المحتوى ذوي الميزانيات الأضيق الذين ما زالوا يريدون نتائج سينمائية، يقدّم Pixverse v6 فيديو بالذكاء الاصطناعي بدقة 1080p مع توليد صوتي، بتكلفة أدنى بكثير. يتعامل الإخراج مع تسلسلات الأكشن ذات القطع السريع بكفاءة، وتضيف طبقة الصوت بالذكاء الاصطناعي أجواءً دون خطوة منفصلة لتصميم الصوت. أما سلفه Pixverse v5.6 فيبقى خيارًا متينًا للتوليد بالدفعات على نطاق واسع، حين تحتاج إلى حجم إخراج كبير ضمن ميزانية محددة.
كيف تنشئ Shorts على PicassoIA
كل نموذج مذكور أعلاه متاح مباشرةً عبر PicassoIA دون إعداد API أو متطلبات حوسبة محلية. إليك بالضبط كيف يسير سير العمل.
الخطوة 1: اختر نموذجك
اختر بحسب نوع محتواك:
الخطوة 2: اكتب الأمر النصي لـ Shorts
للأمر النصي المحسّن لـ Shorts بنية محددة. أدرج العناصر الخمسة كلها في كل أمر نصي:
- الشخص والحركة ("امرأة شابة تمشي عبر سوق للزهور")
- البيئة ("شارع أوروبي ضيق، ضوء الصباح")
- سلوك الكاميرا ("لقطة تتبع بطيئة على مستوى العين")
- الصيغة ("صورة عمودية 9:16، 1080p")
- المزاج والأجواء ("ساعة ذهبية دافئة، حبيبات الفيلم، Kodak Portra")
💡 أكبر ترقية منفردة للأمر النصي: أضف حركة الكاميرا. اللقطات الثابتة تقل أداءً في Shorts باستمرار. اقتراب بطيء، أو دوران لطيف، أو حركة تتبع تمنح المشاهد سببًا بصريًا أكبر ليشاهد حتى النهاية، وتمنح الخوارزمية بيانات حركة أكثر لفهرستها.
الخطوة 3: اضبط الدقة والمدة
بالنسبة إلى YouTube Shorts، استهدف أقصى دقة يدعمها النموذج الذي اخترته. يخرج Kling v3 وVeo 3.1 بدقة 1080p، وهي تعمل بسلاسة على أي جهاز بسطوع كامل. المقاطع الأقصر، من 10 إلى 20 ثانية لكل توليد، أسهل في الدمج ضمن Short متماسك، وتتيح تحكمًا إبداعيًا أكبر في الإيقاع النهائي من محاولة انتزاع 45 ثانية من مخرج واحد.
الخطوة 4: نزّل وعدّل
يسلّم PicassoIA المخرجات كملفات MP4 تنزّلها مباشرةً إلى جهازك. ومن هناك تتولى أدوات المونتاج العمودي المعتادة كل شيء: CapCut، أو DaVinci Resolve، أو محرر Shorts المدمج في تطبيق YouTube للهاتف.

ما الذي ينتشر فعلًا على Shorts
جودة فيديو الذكاء الاصطناعي ليست سوى جزء من معادلة الأداء. عبر القنوات التي توسّعت باستخدام المحتوى المُولَّد بالذكاء الاصطناعي خلال عام 2025، تظهر ثلاثة أنماط باستمرار في المقاطع التي تجاوزت 500 ألف مشاهدة.
1. أول 3 إطارات تجذب دون سياق. Shorts التي بدأت بسؤال، أو بصورة مفاجئة، أو بحركة جارية بالفعل تفوّقت على المقاطع التي بدأت بلقطات تأسيسية. يجعل فيديو الذكاء الاصطناعي من السهل توليد افتتاحيات تبدأ بالحركة، لأنك لست مقيّدًا بمكان وقوف مشغّل الكاميرا. ابدأ من منتصف الحركة، لا من منتصف الإعداد.
2. الإيقاع متوافق مع BPM الموسيقى. المقاطع التي تتزامن فيها القطعات مع النبضة احتفظت بالمشاهدين بشكل أفضل بكثير من المقاطع ذات توقيت المونتاج العشوائي. وحين تتحكم في التوليد، فإنك تتحكم في مدة كل مقطع، أي أنك تستطيع تصميم لقطات تُقطع بدقة على النبضة منذ البداية، بدلًا من إجبار المونتاج على مطابقة لقطات موجودة.
3. التكوين العمودي الأصلي يتفوّق على الإطار العريض المقصوص في كل مرة. فجوة الأداء بين المحتوى المُكوَّن عموديًا أصلًا والمحتوى الأفقي المقصوص قابلة للقياس وثابتة. القنوات التي بنت خط إنتاج محتواها ليفكّر في 9:16 منذ مرحلة الأمر النصي، بدلًا من قصّ مخرجات 16:9، أظهرت معدلات إكمال أعلى باستمرار في بيانات التحليلات التي راجعناها.
💡 نمط واحد يستحق أن تنسخه فورًا: استخدم فيديو الذكاء الاصطناعي للطبقة البصرية فقط، وسجّل تعليقك الصوتي بنفسك كمسار صوتي منفصل في مرحلة ما بعد الإنتاج. يحقق الجمع بين صوت بشري أصيل وصور مصقولة بالذكاء الاصطناعي تقييمًا أعلى لقيمة الإنتاج المدركة من أي عنصر وحده، ويمنح قناتك صوتًا مميزًا لا يستطيع مخرج الذكاء الاصطناعي وحده تكراره.

أنشئ أول Short بالذكاء الاصطناعي الآن
Sora 2.5 نموذج قادر فعلًا، ويكسب سمعته في اللقطات السينمائية المساندة والمشاهد الطبيعية. أما بالنسبة إلى من يحتاجون ثبات الشخصيات، أو الصوت الأصلي، أو مسارًا أكثر فعالية من حيث التكلفة لتحقيق حجم نشر منتظم، فإن النماذج المتاحة على PicassoIA تسدّ هذه الفجوة بسرعة، وفي أغلب الحالات تتجاوزه.
أداة PicassoIA Video مجانية وغير محدودة، ما يجعلها نقطة البداية الخالية من المخاطر لأي صانع محتوى يريد اختبار إنتاج Shorts بالذكاء الاصطناعي دون الالتزام باشتراك مدفوع. ولّد مقطعًا، ونزّله، وضعه إلى جانب محتواك الحالي لترى بالضبط كيف يؤدي قبل توسيع نطاق سير العمل.
من Sora 2 Pro للجودة السينمائية المتميزة إلى Seedance 2.5 Lite للتكرار السريع المجاني، تغطي الأدوات المتاحة عبر picassoia.com/en/all-models كل نقطة على طيف الجودة والسرعة والميزانية. اختر النموذج الذي يناسب هدف النشر الحالي لديك، وجرّب الاختبار بنفسك. بيانات قناتك الفعلية تتفوّق على أي معيار.