خمسة أشياء فاجأتنا في Sora 2 Pro
بعد اختبار موسّع، برزت خمسة أمور في Sora 2 Pro: ثبات زمني لافت عبر المقاطع الطويلة، وتحكم دقيق بشكل مفاجئ في الكاميرا، ومزامنة أصلية للصوت. يكسر هذا النموذج عدة افتراضات حول موقع تقنية توليد الفيديو اليوم.
بعد اختبار موسّع، برزت خمسة أمور في Sora 2 Pro: ثبات زمني لافت عبر المقاطع الطويلة، وتحكم دقيق بشكل مفاجئ في الكاميرا، ومزامنة أصلية للصوت. يكسر هذا النموذج عدة افتراضات حول موقع تقنية توليد الفيديو اليوم.
هناك فجوة بين ما تعلنه شركات الذكاء الاصطناعي وما تقدمه نماذجها فعليًا. وهذا يحدث مع كل إصدار رئيسي. تقرأ المواد الصحفية، وتشاهد مقاطع العرض المنتقاة بعناية، وتكوّن مجموعة من التوقعات، ثم يفككها الواقع بهدوء. هذا ما جعل العمل مع Sora 2 Pro مثيرًا للاهتمام حقًا: فقد فاجأنا، لكن ليس بالطرق التي توقعناها. تفوقت عدة قدرات على توقعاتنا بوضوح. وطرحت قليل منها أسئلة جديدة تمامًا. إليك الأشياء الخمسة التي فاجأتنا أكثر في Sora 2 Pro، موثقةً بأمانة من اختبار عملي موسّع.
قبل الدخول في المفاجآت، توجيه سريع. Sora 2 Pro هو النموذج الرائد الحالي لتحويل النص إلى فيديو من OpenAI، ويمثل الفئة العليا في عائلة Sora 2. وهو مبني على Sora 2، الذي قدّم الصوت المتزامن إلى المجموعة. ترفع فئة Pro سقف الدقة، وتطيل الحد الأقصى لمدة المقطع، وتخصص قدرة حوسبة أكبر بكثير لكل توليد لتحسين الثبات وجودة الحركة طوال المقطع.
قبل بدء الاختبار، قارنّا بشكل مكثف مع Veo 3.1 من Google، وKling v2.6 من Kwai، وSeedance 2.5 من ByteDance. وقد أعجبنا كل منها فعلًا في مجالات مختلفة. وضع Kling v2.6 معيارًا عاليًا لسلاسة الحركة. وكان Veo 3.1 المتصدر الواضح في جودة الصوت المدمج. وتميّز Seedance 2.5 في سرعة التوليد الخالصة. لذلك كانت توقعاتنا لنموذج Sora 2 Pro معايَرة وفقًا لذلك: قوي بشكل عام، مع بقاء المنافسين قريبين خلفه.
كنا مخطئين بخمس طرق محددة.
تشترك معظم نماذج فيديو الذكاء الاصطناعي في نسخة من المشكلة نفسها: تنجرف العناصر. يتغير لون قميص الشخصية بشكل خفي بين الإطارات. يختفي جسم ثم يعود للظهور. ينتقل وشم عبر ذراع شخص خلال مقطع مدته عشر ثوانٍ. هذه أكثر الشكاوى إلحاحًا من المستخدمين المحترفين لأدوات فيديو الذكاء الاصطناعي، وهي التي تجعل المقاطع المولدة تبدو مصطنعة بوضوح حتى عندما تبدو الإطارات الفردية واقعية كالصور الفوتوغرافية.

يتعامل Sora 2 Pro مع انجراف الزمن بشكل أفضل بكثير من أي شيء اختبرناه بهذا الطول من التوليد. في تسلسل لامرأة تمشي في شارع باريسي ممطر، بقي لون معطفها وحزامها وحمالة حقيبتها وشعرها ثابتًا بصريًا طوال المقطع. شغّلنا الأمر النصي نفسه عدة مرات للتحقق مما إذا كان الثبات مجرد قيمة بذرة محظوظة، واستمرت النتائج عبر خمسة توليدات منفصلة. ثم ذهبنا أبعد: يضع رجل فنجان قهوة على طاولة، ويغادر الإطار، ثم يعود. كان الفنجان في الموضع نفسه عندما عاد. قد يبدو هذا توقعًا أساسيًا. عمليًا، لم يكن مضمونًا قبل هذا الجيل من النماذج.
💡 ما يحدث هنا: يبدو أن النموذج يحافظ على تمثيلات داخلية أقوى للحالة عبر الإطارات، فيتعامل مع كل فيديو لا كسلسلة من مخرجات صور شبه مستقلة، بل كعالم متماسك تتطور حالته مع الزمن. والفرق العملي في جودة المخرجات كبير.
عندما يكون الثبات الزمني غير موثوق، تعوّض ذلك بطرق تقيّد خياراتك الإبداعية. تُبقي المقاطع قصيرة للحد من الإطارات التي قد يتراكم فيها الانجراف. تتجنب اللقطات القريبة التي تكشف عدم اتساق الشخصيات. تقطع المشهد بوتيرة أعلى لإخفاء أخطاء الاستمرارية. تختار أوامر نصية أبسط تبقى مستقرة، بدل أوامر تخدم فعلًا المحتوى الذي تريد إنتاجه.
مع Sora 2 Pro تصبح هذه المعالجة أقل ضرورة. اللقطات الأطول تعمل جيدًا. واللقطات القريبة صارت ممكنة. والأوامر النصية التي تضم عناصر محددة متعددة تبقى متماسكة على امتداد مدة المقطع. هذا ليس تحسينًا بسيطًا في سهولة الاستخدام. إنه يغيّر نوع المحتوى الذي يمكنك إنتاجه في عملية توليد واحدة، دون قضاء ساعات في التصحيح اليدوي.
التحفظ: ما زال الثبات ينهار في المشاهد المعقدة ذات الشخصيات المتعددة والتغيرات الكبيرة في الخلفية، خاصة عندما تتفاعل الشخصيات بشكل وثيق مع بعضها. إنه أفضل، لكنه ليس مثاليًا.
كانت محاكاة الفيزياء في فيديو الذكاء الاصطناعي تاريخيًا أوضح علامة على أن شيئًا ما قد وُلّد بشكل اصطناعي. يتصرف الماء كالهلام. ينغرس القماش في الأسطح أو يطفو بشكل غير طبيعي. تتقلص النار وتتمدد في فترات عشوائية. هذه ليست عيوبًا خفية. إنها مرئية فورًا لأي مشاهد أمضى وقتًا في مراقبة سلوك المواد الفيزيائية في العالم الحقيقي.

أجرينا مجموعة من الأوامر النصية المتخصصة في الفيزياء مع Sora 2 Pro: سائل يُصبّ في كوب، وقماش يُلقى على أثاث فيسقط بشكل طبيعي إلى الأرض، وورقة تُجعّد ثم تُفرد ببطء. لم تكن النتائج مثالية، لكنها كانت مقنعة بطريقة لم تحققها النماذج السابقة إلا نادرًا.
تدل دقة الفيزياء بهذا المستوى في نموذج توليدي عادةً على أحد أمرين: تنوع ضخم في بيانات التدريب يستهدف السلوك الفيزيائي في العالم الحقيقي تحديدًا، أو تغييرات معمارية تحسّن الاستدلال السببي متعدد الإطارات. تشير أدلتنا من الاختبار إلى أنه الأمران معًا. وصفت الورقة البيضاء الأصلية لنموذج Sora التدريب على فيديوهات بمقاييس زمنية ودقات مختلفة كثيرة، وهذا يبني معرفة فيزيائية ضمنية من خلال الملاحظة. تطبّق نسخة Pro هذا الأساس بعائد أكثر ثباتًا عبر التسلسلات الأطول.
ملاحظة مقارنة: يتعامل Kling v2.6 وVeo 3.1 كلاهما بشكل جيد مع بعض سيناريوهات الفيزياء، لكن أيًّا منهما لم يضاهِ Sora 2 Pro في اختبارات القماش والسوائل تحديدًا.
ادّعت نماذج فيديو الذكاء الاصطناعي امتلاك التحكم بالكاميرا منذ فترة. تقول الوثائق إن عليك وصف حركة الكاميرا في الأمر النصي. عمليًا، كان هذا يعني عادةً أن إدراج كلمات مثل "dolly in بطيء" يجعل الكاميرا تتحرك إلى حد ما في بعض الاتجاهات خلال جزء من المقطع. وكانت الدقة السينمائية الفعلية، حيث تحدد حركة وتحصل عليها منفذة بأمانة، نادرة إلى درجة جعلتها غير موثوقة لأعمال الإنتاج.

استجاب Sora 2 Pro لتعليمات الكاميرا بدقة فاجأتنا فعلًا. اختبرنا مجموعة من الحركات:
| تعليمات الكاميرا | النتيجة |
|---|---|
| Dolly in بطيء نحو الشخص | نُفّذت بشكل صحيح، وبسرعة ثابتة طوال المقطع |
| لقطة جوية بالرافعة تنزل للأسفل | سقوط عمودي نظيف والأفق ثابت |
| ميل بزاوية هولندية، موضع ثابت | حُفظ الميل الصحيح طوال مدة المقطع الكاملة |
| Rack focus من المقدمة إلى الخلفية | تحوّل التركيز نُفّذ عند المنتصف الصحيح |
| لقطة متابعة محمولة مع اهتزاز خفيف | حركة عضوية، وليست تذبذبًا ميكانيكيًا |
| Pan بطيء لليسار عبر منظر طبيعي | سرعة سلسة وثابتة مع منظور متوازٍ صحيح |
كانت نتيجة الكاميرا المحمولة الأكثر إثارة للإعجاب في المجموعة. توليد اهتزاز كاميرا أصيل، لا تذبذب مبرمج، يتطلب من النموذج فهم ما يسبب الحركة المحمولة، لا مجرد تقليد نمطها البصري. تحمل الحركة العضوية للكاميرا تباينًا دقيقًا في السرعة والاتجاه، وهو ما تخطئه المحاكاة الميكانيكية باستمرار. أما Sora 2 Pro فقد أصاب.
بالنسبة لأي شخص ينتج محتوى يحتاج لغة بصرية محددة، فهذا مهم جدًا. مقدّم حديث يقترب ببطء بحركة dolly in عندما يصل الشخص إلى لحظة مهمة في كلامه. لقطة تأسيسية تنزل من الأعلى إلى مستوى الشارع خلال خمس ثوانٍ. لقطة متابعة بأسلوب وثائقي تُبقي الشخص في المنتصف بينما يتحرك المحيط حوله. هذه أمور معتادة في إنتاج الفيديو الاحترافي. والقدرة على استدعائها بموثوقية من أمر نصي تغيّر ما يستطيع صانع محتوى منفرد تسليمه فعلًا.
💡 نصيحة: كن دقيقًا في وصف الكاميرا. يعمل "dolly in بطيء"، لكن "dolly in بطيء لمدة 5 ثوانٍ من لقطة عريضة إلى لقطة متوسطة، مع بقاء الشخص في المنتصف طوال الوقت" يعطي التزامًا أفضل بشكل ملحوظ. فالمدة والتأطير وموضع الشخص كلها مهمة.
ما زال الصوت المدمج في فيديو الذكاء الاصطناعي قدرة حديثة نسبيًا. تبدو معظم التطبيقات كنظامين منفصلين يعملان بالتوازي الفضفاض: واحد يولّد الفيديو، وآخر يولّد الصوت، مع محاولة تنسيق تُضاف فوقهما لاحقًا. وتظهر الفواصل في توقيت أحداث الصوت المنفصلة، حيث تصل لحظات الصوت والصورة في أوقات مختلفة قليلًا.

يولّد Sora 2 Pro صوتًا يتتبع الأحداث البصرية بدقة تتجاوز ما توقعناه. في اختباراتنا:
يتمتع Veo 3.1 بجودة توليد صوت إجمالية أقوى في سيناريوهات الأجواء الصوتية والموسيقية. ينتج مشاهد صوتية محيطية أغنى بعمق نسيجي أكبر. أما ما يفعله Sora 2 Pro بشكل أفضل بوضوح فهو التزامن الدقيق للأحداث، خاصة للأصوات الفيزيائية المنفصلة المرتبطة بلحظات بصرية محددة. إذا كان مقطعك يضم أحداث صوت واضحة يجب أن تقع على إطارات محددة، فإن Sora 2 Pro هو الخيار الأكثر موثوقية حاليًا.
يبقى الكلام النقطة الأضعف عبر جميع النماذج. توليد كلام بجودة الحوار، مع بقائه متزامنًا مع حركات الشفاه على الشاشة، ما زال قيدًا نشطًا عبر المجال كله. يؤدي النموذج بشكل أفضل عندما لا تتحدث الشخصيات مباشرة على الشاشة، أو عندما يكون الكلام تعليقًا صوتيًا من خارج الكادر. وهذا صحيح عبر جميع العروض الحالية، بما في ذلك Seedance 2.5 وRay 3.2. وهو الحد الكبير التالي لفيديو الذكاء الاصطناعي كفئة.
كان هذا أكثر ما فاجأنا. ظل التزام الأوامر النصية في فيديو الذكاء الاصطناعي متفاوتًا لأن توليد الفيديو يملك درجات حرية أكثر بكثير من توليد الصور. إطارات أكثر. عناصر متحركة. سببية زمنية. كل بُعد إضافي يخلق طريقة جديدة لأن يسيء النموذج تفسير جزء من مواصفاتك أو يُسقطه بهدوء خلال التوليد.

أخذ Sora 2 Pro أوامر نصية معقدة متعددة العناصر وأعاد نتائج تعكس محاولة حقيقية لاحترام كل شرط محدد. اختبرنا ذلك بأوامر كثيفة عمدًا تحتوي على قيود متعددة في آنٍ واحد:
مثال على الأمر النصي: "تستند دراجة حمراء إلى جدار أصفر في زقاق ضيق. تمر قطة بجانب الدراجة من اليسار إلى اليمين، وتتوقف لتشم الإطار الأمامي، ثم تواصل سيرها. الإضاءة في منتصف النهار، وتلقي ظلالًا قصيرة مباشرة أسفل الأجسام."
النتيجة: كانت الدراجة حمراء. وكان الجدار أصفر. تحركت القطة من اليسار إلى اليمين، وتوقفت عند الإطار، ثم استأنفت حركتها. كانت الظلال قصيرة واتجاهها صحيحًا، متوافقة مع شمس منتصف النهار العمودية.
تم احترام كل عنصر محدد طوال مدة المقطع الكاملة. قد يبدو هذا توقعًا بسيطًا، لكنه لم يكن كذلك عمليًا في الماضي. كانت النماذج السابقة عند هذا المستوى من التعقيد تحترم عادةً ثلاثة أو أربعة عناصر، بينما تنحرف عن غيرها بهدوء. ربما تتخطى القطة لحظة التوقف، أو تكون الظلال خاطئة، أو يتغير لون الجدار تدريجيًا خلال المقطع، أو تنتقل الدراجة من موضعها بين الإطارات. يُعد تنفيذ Sora 2 Pro لعدة شروط في الوقت نفسه ميزة حقيقية لحالات الاستخدام الإنتاجية.
الالتزام القوي بالأوامر النصية مفيد جدًا في سيناريوهات الإنتاج التي تحتاج فيها إلى نتائج بصرية محددة. لكنه يعني أيضًا أن الأوامر الغامضة أو المفتوحة تنتج نتائج صحيحة لكنها محافظة، بدل تفسيرات إبداعية. وعندما تترك للنموذج مساحة لملء تفاصيله بنفسه، يميل إلى البقاء حذرًا بدل السعي إلى شيء مثير للاهتمام. وهذا هو التوازن الصحيح إذا كنت تنتج محتوى بمتطلبات بصرية محددة. وقد يكون أقل ملاءمة للتوليد الاستكشافي الذي تريد فيه من النموذج أن يتجاوز تعليماتك الصريحة ويضيف تفسيره الخاص.

يتوفر Sora 2 Pro مباشرةً على PicassoIA إلى جانب أكثر من 100 نموذج آخر لتوليد الفيديو، ما يتيح لك مقارنة مخرجات Sora 2 Pro وVeo 3.1 وKling v2.6 وغيرها دون تبديل المنصات أو الحسابات.
الخطوة 1: افتح Sora 2 Pro على PicassoIA وادخل واجهة التوليد مباشرةً من صفحة النموذج.
الخطوة 2: اكتب أمرك النصي بدقة. ضمّن الشخص، وتسلسل الحركة، والبيئة، وظروف الإضاءة، ووصف حركة الكاميرا. كلما كان الإدخال أدق، أداء Sora 2 Pro أفضل، نظرًا لقوة التزامه بالأوامر النصية.
الخطوة 3: اضبط الدقة. للحصول على مخرجات بجودة نهائية، استخدم أعلى إعداد دقة متاح. تظهر مزايا الثبات في Sora 2 Pro بوضوح أكبر في الدقات العالية، حيث يصبح الانجراف الزمني أوضح في المخرجات منخفضة الجودة.
الخطوة 4: أرسل وانتظر. يستغرق Sora 2 Pro وقتًا أطول للتوليد من نماذج أسرع مثل LTX 2 Pro أو Wan 2.7 T2V. يبرر فرق الجودة وقت الانتظار للمخرجات النهائية. أما للمسودات والتمريرات الأولية، فغالبًا ما يكون نموذج أسرع أكثر كفاءة للتكرار.
الخطوة 5: راجع النتيجة. إذا انهار الثبات الزمني أو دقة الفيزياء، أعد التوليد بمشهد مبسّط قليلًا أو بمدة مقطع أقصر. سقف الثبات في Sora 2 Pro مرتفع، لكن المشاهد التي تحتوي عناصر متحركة كثيرة في آنٍ واحد قد تتجاوزه.
الخطوة 6: كرّر لغة الكاميرا. إذا لم تنجح حركة الكاميرا بدقة، فحسّن الوصف بتفاصيل المدة والتأطير. يستجيب Sora 2 Pro جيدًا لتعليمات الكاميرا التي تتضمن التوقيت ("dolly بطيء لمدة 4 ثوانٍ") إلى جانب الاتجاه.

💡 بنية أمر نصي تعمل جيدًا:
[Subject + starting state] + [Action sequence with causal steps] + [Environment details: surface, light source, time of day] + [Camera movement with duration and framing]
إن اختبار Sora 2 Pro بمعزل عن غيره يروي جزءًا فقط من القصة. إليك مقارنته بالنماذج التي نقيسها بانتظام أكبر على PicassoIA:

| القدرة | Sora 2 Pro | Veo 3.1 | Kling v2.6 | Seedance 2.5 |
|---|---|---|---|---|
| الثبات الزمني | الأفضل في فئته | قوي | جيد | جيد |
| محاكاة الفيزياء | الأفضل في فئته | قوي | متوسط | جيد |
| دقة التحكم بالكاميرا | الأفضل في فئته | قوي | قوي | متوسط |
| تزامن أحداث الصوت | قوي | الأفضل في فئته | لا يوجد | لا يوجد |
| التزام الأوامر متعددة العناصر | الأفضل في فئته | قوي | جيد | جيد |
| سرعة التوليد | بطيء | متوسط | سريع | الأسرع |
| أقصى دقة | عالية | عالية | عالية | عالية |
يفوز Seedance 2.5 في الإنتاجية الخام إذا كانت السرعة قيدك الأساسي. ينتج Veo 3.1 أجواء صوتية محيطية أقوى للمشاهد الموسيقية والطبيعية. يُعد Kling v2.6 الخيار الأكثر كفاءة لسلاسة الحركة في المقاطع القصيرة. يوازن Ray 3.2 بين الجودة والسرعة بشكل جيد لاحتياجات الإنتاج متوسطة المستوى. ويبقى P Video خيارًا متينًا للتكرار السريع على المشاهد البسيطة.
ليس Sora 2 Pro أسرع نموذج على المنصة ولا أكثرها كفاءة من حيث التكلفة. لكنه يكسب موقعه بفعل الأشياء الأهم لمخرجات الإنتاج بجودة عالية عبر التسلسلات الأطول: الحفاظ على تماسك المشاهد، والالتزام بأمرك النصي بدقة، والسماح للفيزياء بأن تتصرف كفيزياء لا كتقريب معقول لها.
تشير الأشياء الخمسة التي فاجأتنا في Sora 2 Pro جميعًا إلى الاتجاه نفسه: الفجوة بين فيديو الذكاء الاصطناعي والفيديو المنتج بشكل احترافي تضيق أسرع مما توقع معظم العاملين في المجال. كان يُفترض أن تكون الثبات الزمني ودقة الفيزياء والتحكم بالكاميرا ومزامنة الصوت ودقة الأوامر النصية مشكلات تستغرق سنوات تتطلب ابتكارًا معماريًا متواصلًا. لم يحل Sora 2 Pro كل ذلك بالكامل، لكنه حرّك الخط بشكل ملموس في الأشياء الخمسة كلها ضمن إصدار نموذج واحد.

إذا لم تستخدم بعد نموذج فيديو ذكاء اصطناعي من الجيل الحالي في عمل إنتاجي حقيقي، فالوقت مناسب للبدء الآن. نضجت الأدوات متجاوزة مرحلة التجريب التي كانت تتطلب فيها المخرجات تصحيحًا يدويًا مكثفًا قبل أن تصبح صالحة للاستخدام. يمنحك PicassoIA الوصول إلى Sora 2 Pro إلى جانب المجال التنافسي الكامل، بما في ذلك Veo 3.1 وKling v2.6 وRay 3.2 وP Video، لتختار النموذج المناسب لكل نوع مشروع دون الالتزام بمنصة واحدة أو التسجيل في خدمات متعددة.
ابدأ بمشهد كنت ستطلب إنتاجه بتكلفة إنتاج حقيقية عادةً. اكتب أمرًا نصيًا دقيقًا ومحددًا. وشاهد ما يعيده Sora 2 Pro. قد تفاجئك النتيجة أيضًا.
تصفح جميع نماذج توليد الفيديو على picassoia.com/en/all-models.
اختر لغتك