Sora 2 Pro هو النموذج الرائد لتوليد الفيديو لدى OpenAI، ويعمل بطريقة تختلف عن كل ما سبقه. فمولّدات الفيديو بالذكاء الاصطناعي السابقة كانت تربط الإطارات ببعضها بفواصل واضحة وانجراف زمني، أما Sora 2 Pro فيبني المشاهد من تمثيل موحّد للمكان والزمن. والنتيجة لقطات تتماسك عبر الثواني بطريقة تبدو مبنية على أسس فيزيائية، لا مجمّعة خوارزمياً. إذا كنت تتساءل عما يفعله هذا النموذج فعلاً في الخلفية، وما الذي يلزم للحصول على نتائج تستحق الاستخدام، فهذا هو الشرح الذي تحتاجه.

النموذج الذي يقف خلف المخرجات
محوّل انتشاري، وليس متنبئاً بالإطارات
يقوم Sora 2 Pro على بنية المحوّل الانتشاري (diffusion transformer)، وهي انحراف مهم عن أساليب التنبؤ بالإطارات المتكررة القديمة. فبدلاً من السؤال "ماذا يأتي بعد هذا الإطار؟"، يعالج النموذج الزمن كبُعد مكاني إلى جانب العرض والارتفاع. يُعامَل الفيديو كحجم من البيانات، ويتعلم النموذج إزالة الضوضاء من هذا الحجم كاملاً دفعة واحدة.
وهذا مهم لأنه يلغي مشكلة الانجراف التي أرّقت مولّدات الفيديو السابقة. فحين يتنبأ النموذج بإطار واحد في كل مرة، تتراكم الأخطاء الصغيرة: تتحرك يد الشخصية قليلاً، ينتقل الظل في الاتجاه الخاطئ، ويرتعش عنصر في الخلفية. أما Sora 2 Pro فيرى المقطع كاملاً في الوقت نفسه أثناء التدريب، فيكون قد استوعب كيف تبدو الحركة المتسقة عبر الزمن، بدلاً من تقريبها خطوة بخطوة.
رقع الزمكان
المدخل الخام لنموذج Sora 2 Pro مجموعة من رقع الزمكان (spacetime patches)، وهي مكعبات صغيرة من بيانات الفيديو تشمل بكسلات عدة إطارات عند موقع مكاني ثابت. تُغذّى هذه الرقع إلى محوّل ينتبه إلى كل الرقع في الأبعاد الثلاثة. يستطيع النموذج أن يربط ما يحدث في الركن العلوي الأيسر عند الثانية الأولى بما يحدث في الركن السفلي الأيمن عند الثانية الثالثة.
هذا الخيار المعماري هو ما يمكّن Sora 2 Pro من التعامل مع التفاعلات المعقدة: شخص يلتقط جسماً، أو ماء يتناثر على جدار، أو دخان يتبدد مع الرياح. النموذج لا يتبع قاعدة تقول إن "السائل ينتشر إلى الخارج". لقد شاهد من اللقطات الحقيقية ما يكفي لتلتقط تمثيلاته الداخلية السلوك الإحصائي للأنظمة الفيزيائية لا محاكاتها المبسّطة.

ما الذي ينتجه Sora 2 Pro فعلاً
الدقة والمدة
يُخرج Sora 2 Pro الفيديو بدقة تصل إلى 1080p وبمدد لقطات تمتد حتى 20 ثانية. وهذا يجعله أقدر بكثير من سلفه، الذي كان يبلغ مدداً أقصر ويقدم جودة مكانية أقل اتساقاً بدقة Full HD.
لا تقتصر المخرجات على دقة واحدة أو مدة واحدة. يتكيّف النموذج مع الأوامر التي تطلب نسب عرض إلى ارتفاع مختلفة، فيتعامل مع الصيغ العمودية للمحتوى القصير، وكذلك مع إطار الشاشة العريضة 16:9 المستخدم في إنتاج الأفلام والبث.
واقعية الحركة والفيزياء الناشئة
من أوضح الطرق لرؤية قدرات Sora 2 Pro طريقة تعامله مع الحركة الثانوية: حركة الشعر والقماش والماء والأوراق التي تنتج عن فعل أساسي. في مولّدات الفيديو القديمة، كانت هذه العناصر إما تبقى ثابتة أو تتحرك بأنماط تكرارية واضحة. أما Sora 2 Pro فيولّد حركة ثانوية تستجيب للسياق.
شخص يركض تحت المطر يكون شعره المبلل يتحرك مع تسارعه. وباب يُفتح في نسمة هواء يجعل الستارة خلفه تتفاعل بتأخر طفيف. هذه ليست قوانين فيزياء مبرمجة، بل سلوكيات ناشئة من تدريب النموذج على مكتبات واسعة من الفيديو الحقيقي، حيث ظهرت هذه العلاقات الفيزيائية بثبات كافٍ لتُدمج في أوزان النموذج.
تماسك المشهد عبر الزمن
الاتساق الزمني هو المقياس الذي ما زال معظم مولّدات الفيديو بالذكاء الاصطناعي تعاني فيه: أجسام تختفي في منتصف المقطع، ووجوه تتغير شكلها بخفة بين اللقطات، وحركة كاميرا لا تلتزم بطول بؤري ثابت. يعالج Sora 2 Pro هذه المشكلات عبر آلية الانتباه في الزمكان.
يُنتج أمر يصف لقطة رافعة بطيئة فوق أفق مدينة عند الغروب مقطعاً تتغير فيه زاوية الضوء بواقعية مع حركة الكاميرا، وتحافظ المباني على نسبها طوال المقطع، ويُطبَّق الضباب الجوي باتساق من المقدمة حتى البعد. النموذج لا يُصيّر في 3D، لكنه تعلم من الفيديو المسطح ما يكفي عن البنية المكانية، فتحترم مخرجاته الهندسة ثلاثية الأبعاد بإقناع.

كيف يعمل محرك الأوامر
ترميز النص واللغة السينمائية
حين تُرسل أمراً إلى Sora 2 Pro، يُرمَّز النص إلى تمثيل عالي الأبعاد باستخدام نموذج لغوي. يلتقط هذا التمثيل ليس الأسماء والأفعال فقط، بل اللغة السينمائية: أوصاف البعد البؤري للعدسة، وظروف الإضاءة، وسرعة الحركة، والنبرة العاطفية.
يستجيب النموذج بشكل مختلف لعبارة "لقطة عامة تأسيسية" مقارنةً بعبارة "لقطة مقربة ضيقة". ويستجيب لعبارة "ضوء مسطح وغائم" مقارنةً بعبارة "ضوء شمس مباشر واتجاهي بزاوية 45 درجة". هذا المعجم السينمائي ليس مطابقة أنماط سطحية. فقد دُرِّب النموذج على فيديو مقترن بأوصاف تفصيلية، تتضمن شروحات بمستوى الإنتاج، فاستوعب ما تقابله هذه المصطلحات بصرياً.
ما الذي يجعل الأمر النصي قوياً
| عنصر الأمر النصي | النسخة الضعيفة | النسخة القوية |
|---|
| الشخص | "امرأة تمشي" | "امرأة في الثلاثينات ترتدي معطفاً صوفياً تمشي بخطى سريعة على أحجار مرصوفة مبللة" |
| الإضاءة | "إضاءة جيدة" | "ضوء صباحي غائم ومنتشر مع توهج أصفر دافئ من نافذة مقهى قريب" |
| الكاميرا | "لقطة قريبة" | "لقطة بورتريه بعدسة 85mm ومجال عمق ضيق عند f/1.8" |
| الحركة | "الكاميرا تتحرك" | "دفع بطيء نحو الشخص خلال 8 ثوانٍ" |
| الجو | "ضبابي" | "ضباب أرضي كثيف عند الفجر، مدى الرؤية 20 متراً، والنفَس مرئي في الهواء البارد" |
نصيحة: كلما أضفت مزيداً من التحديد السينمائي، استطاع Sora 2 Pro أن يربط توليده بنية بصرية دقيقة. فكّر بما قد يقوله المخرج لمدير التصوير.
الأمر السلبي والقيود
يدعم Sora 2 Pro مدخلات الأمر النصي السلبي، التي تخبر النموذج بما يتجنبه. وهذا مفيد لكبح أنماط الفشل الشائعة: فعبارة "بدون اهتزاز الكاميرا" تساعد على تثبيت المخرجات بأسلوب الكاميرا المحمولة، و"بدون نصوص متراكبة" تمنع النموذج من توليد كلمات عائمة لا معنى لها، و"بدون تشوّه العدسة" تساعد على الحفاظ على نسب واقعية في الأوامر ذات الزاوية الواسعة.
استخدام الأوامر السلبية بدقة، إلى جانب أمر إيجابي مفصّل، من أكثر الطرق موثوقية للحصول على نتائج متسقة دون تكرار كثير.

Sora 2 Pro مقابل Sora 2
ما الذي يتغير في فئة Pro
Sora 2 هو الإصدار القياسي من النموذج. يتشارك الإصداران البنية الأساسية نفسها، لكن إصدار Pro يأتي باختلافات مهمة:
- لقطات أطول: تمدد فئة Pro نافذة التوليد بشكل كبير مقارنةً بالفئة القياسية
- سقف دقة أعلى: إخراج كامل بدقة 1080p مقابل سقف أقل في النسخة القياسية
- حوسبة ذات أولوية: تُعالَج التوليدات أسرع عبر بنية تحتية مخصصة
- التزام أقوى بالأوامر: خضع نموذج Pro للضبط الدقيق بخطوات تعزيز إضافية تركز على اتباع الأوامر المعقدة متعددة البنود بدقة
للتفكير السريع أو المحتوى القصير، يُعد Sora 2 خياراً عملياً. أما للمخرجات بمستوى احترافي حيث تهم الدقة والمدة، فتنتج فئة Pro نتائج تتحدث عن نفسها بوضوح.
أين لا تزال الفجوات ظاهرة
ليس Sora 2 Pro متفوقاً بالتساوي في كل السيناريوهات. النص داخل الفيديو يبقى غير موثوق، إذ تنجرف الحروف أو تتشوه عبر الإطارات. ودقة توقيت الحركة قيد آخر: إذا كان أمرك يتطلب حدوث شيء بالضبط عند علامة الثانية الثالثة، فلا يستطيع النموذج تنفيذ ذلك بيقين.
قد تُنتج التفاعلات متعددة الشخصيات، خاصة تلك التي تتضمن تلامساً جسدياً أو تنسيقاً حركياً معقداً، نتائج تنهار فيها أعداد الأطراف أو العلاقات المكانية. هذه قيود معروفة لنهج المحوّل الانتشاري عند الحجم الحالي، وليست أخطاءً خاصة بنموذج Sora 2 Pro.
كيف يقارن Sora 2 Pro بالمنافسين
المشهد التنافسي الحالي
أصبح مجال تحويل النص إلى فيديو تنافسياً بحق. يُنتج Veo 3 من Google مخرجات عالية الجودة مع توليد صوت أصلي مدمج. ويقدم Kling v3 من Kuaishou اتساقاً قوياً للوجوه وحركة سينمائية. ويجمع Seedance 2.0 من ByteDance توليد الفيديو مع تركيب الصوت المدمج. ويتيح LTX 2 Pro من Lightricks مخرجات بدقة 4K بسرعات تكرار عالية.
ما يتفوق فيه Sora 2 Pro على معظم هذه النماذج هو معالجة تعقيد المشهد. فالأوامر التي تتضمن عناصر متفاعلة متعددة، وتفاصيل بيئية متراكبة، وحركة كاميرا مستمرة، تميل إلى البقاء متماسكة لفترات أطول على Sora 2 Pro مقارنةً بالنماذج المنافسة.
| النموذج | أقصى دقة | أقصى مدة | صوت أصلي | أبرز ميزة |
|---|
| Sora 2 Pro | 1080p | 20 ثانية | لا | تعقيد المشهد، والتماسك الزمني |
| Veo 3 | 1080p | 8 ثوانٍ | نعم | مزامنة الصوت، والالتزام بالأوامر |
| Kling v3 | 1080p | 10 ثوانٍ | لا | اتساق الوجوه، والحركة السينمائية |
| Seedance 2.0 | 1080p | 10 ثوانٍ | نعم | السرعة، وتوليد الصوت |
| LTX 2 Pro | 4K | 5 ثوانٍ | لا | الدقة، والتكرار السريع |

كيفية استخدام Sora 2 Pro على PicassoIA
يتيح لك PicassoIA الوصول المباشر إلى Sora 2 Pro دون أي إعداد محلي، أو متطلبات لوحدة معالجة رسومية GPU، أو قوائم انتظار. تأخذك الخطوات التالية من أمر نصي فارغ إلى مقطع فيديو جاهز.
الخطوة 1: افتح صفحة النموذج
انتقل إلى Sora 2 Pro على PicassoIA. تُحمَّل الواجهة مع حقل للأمر النصي وإعدادات التوليد الظاهرة في الشريط الجانبي. لا يلزم أي برنامج إضافي أو إعداد حساب.
الخطوة 2: اكتب أمراً متعدد الطبقات
يمثل الأمر النصي أداة التحكم الأساسية لديك. فكّر في خمس طبقات:
- الشخص: من أو ما الموجود في الإطار، وما الذي يفعله بالضبط
- المكان: الموقع، ووقت اليوم، والطقس، وملمس الأسطح المحدد
- الكاميرا: التأطير (عام أو متوسط أو ضيق)، ونوع العدسة، ووصف الحركة
- الإضاءة: الاتجاه، والجودة (قاسية أو ناعمة)، ودرجة حرارة اللون
- جودة الحركة: السرعة، ومستوى الطاقة، والحركة الثانوية التي تُضمَّن
أمر مثل "صياد يرتدي معدات مطرية باهتة يسحب شباك الصيد على رصيف خشبي عند الفجر، ضباب يرتفع عن ميناء رمادي، دفع بطيء من متوسط إلى لقطة مقربة، ضوء غائم منتشر، والنفَس مرئي في الهواء البارد، والحبال مبللة وثقيلة في يديه" سينتج نتائج أفضل بكثير من أمر مثل "صياد على رصيف".
الخطوة 3: اضبط إعداداتك
يعرض PicassoIA معايير التوليد الأساسية مباشرة في الواجهة:
- نسبة العرض إلى الارتفاع: 16:9 للشاشة العريضة القياسية، و9:16 للمحتوى العمودي
- المدة: ابدأ بمدة 5 ثوانٍ أثناء اختبار الأوامر، ثم مدّدها بعد أن تصل إلى صيغة تعمل
- الدقة: 1080p للمخرجات النهائية، وإعدادات أقل للمسودات السريعة أثناء التفكير
الخطوة 4: كرّر بهدف
التوليد الأول هو إثبات مفهوم. انظر إلى ما ينجح مكانياً وما لا ينجح. إذا كان موضع الشخص صحيحاً لكن الإضاءة مسطحة، فأعد صياغة تلك العبارة تحديداً. إذا كانت حركة الكاميرا سريعة جداً، فصفها بإبطاء في الأمر. كل مراجعة تستهدف مشكلة محددة بدلاً من إعادة كتابة كل شيء من الصفر.
نصيحة: احتفظ بسجل للأوامر. الفرق بين توليد متوسط وآخر ممتاز غالباً ما يكون عبارة واحدة. ومعرفة تلك العبارة توفر وقتاً كبيراً في المشروع التالي.
الخطوة 5: نزّل وطبّق
تُنزَّل التوليدات المكتملة كملفات MP4 قياسية، جاهزة لأي تطبيق مونتاج: Premiere Pro أو DaVinci Resolve أو Final Cut أو CapCut. لا تتضمن الملفات أي علامة مائية عند توليدها عبر PicassoIA، مما يجعلها صالحة للاستخدام في المشاريع التجارية من اليوم الأول.

ما الذي يصلح له Sora 2 Pro فعلاً
النمذجة البصرية السريعة في مرحلة ما قبل الإنتاج
هنا يغيّر Sora 2 Pro الاقتصاد بأكبر قدر. فالمخرج الذي يعرض فكرة على عميل يستطيع توليد نماذج مشاهد من وثيقة المعالجة في صباح واحد، بدلاً من تكليف رسوم متحركة تمهيدية. لا تحل هذه المقاطع محل الإنتاج، لكنها تنقل النية المكانية بطريقة لا تستطيعها الرسوم المصورة الثابتة، ويمكن تكرارها في الوقت الفعلي أثناء اجتماع العرض.
المحتوى الاجتماعي على نطاق واسع
يستطيع صانعو المحتوى القصير الذين لديهم لغة بصرية متسقة استخدام Sora 2 Pro لإنتاج لقطات للخلفيات والقطع المتداخلة ولقطات التأسيس التي يتعذر تصويرها بشكل مستقل. يستطيع صانع محتوى سياحي توليد لقطات إضافية لمواقع لم يزرها. ويستطيع مسوّق منتجات إنتاج لقطات سياق لأسلوب الحياة دون تنظيم يوم تصوير أو تنسيق طاقم.
التعليم والتصوير العلمي
غالباً ما يحتاج الباحثون والمتخصصون في نقل العلم إلى لقطات غير موجودة أصلاً: تصور لعملية بيولوجية، أو إعادة بناء تاريخية، أو ظاهرة فيزيائية بحجم يستحيل تصويره. يستطيع Sora 2 Pro إنتاج تقريبات بصرية معقولة أكثر إفادة من الرسوم الثابتة، دون الحاجة إلى خط إنتاج للرسوم ثلاثية الأبعاد أو ميزانية للرسوم المتحركة.

الحدود العملية التي يجب أن تعرفها
لا يوجد صوت أصلي
يُنتج Sora 2 Pro فيديو صامتاً. إذا كان مشروعك يتطلب كلاماً أو موسيقى أو مؤثرات صوتية متزامنة، فستضيفها في مرحلة ما بعد الإنتاج. تقدم نماذج مثل Veo 3 وSeedance 2.0 صوتاً أصلياً، وهذه ميزة إنتاجية حقيقية في سير العمل الذي يكون فيه توقيت الصوت حاسماً منذ البداية.
لا توجد شخصيات ثابتة عبر المقاطع
لا يحافظ النموذج على شخصيات غير مسمّاة متسقة عبر توليدات منفصلة. لا يمكنك طلب ملامح شخص بعينه وتتوقع الدقة عبر عدة مقاطع. لثبات الشخصيات المضبوط عبر سلسلة، تحتاج إلى نموذج يقبل صورة مرجعية، أو تعالج الاتساق في المونتاج باستخدام أدوات تبديل الوجوه في مرحلة ما بعد الإنتاج.
لا يوجد توقيت دقيق للإطارات
كما ذكرنا، لا يمكن التحكم في التوقيت الدقيق بالأوامر النصية وحدها. يفسر النموذج الإيقاع من الأوصاف النثرية، وهي بطبيعتها غير دقيقة. عبارة "يحدث شيء بالضبط عند علامة الثانية الثالثة" ليست تعليمة موثوقة. إذا كان مشروعك يتطلب توقيتاً دقيقاً، فخطط للتعامل معه في المونتاج، لا في الأمر النصي.
تصفية المحتوى
يتضمن Sora 2 Pro تصفية للمحتوى تمنع توليد المحتوى الضار، والتصويرات الواقعية لأفراد حقيقيين محددين، وفئات أخرى تحددها سياسة الاستخدام لدى OpenAI. هذه المرشحات نشطة وقت التشغيل، وتسري بغض النظر عن طريقة صياغة الأوامر.

ابدأ الإبداع مع Sora 2 Pro الآن
كل ادعاء في هذا المقال عن سلوك الفيزياء، والاتساق الزمني، والاستجابة للأوامر يعكس خصائص مرئية في مخرجات النموذج. أسرع طريقة للانتقال من القراءة إلى الاقتناع هي إجراء اختبار خاص بك على مشهد كنت تتخيله دون أن تتمكن من تصويره.
Sora 2 Pro متاح الآن على PicassoIA إلى جانب مكتبة تضم أكثر من 100 نموذج لتوليد الفيديو، من بينها Veo 3 و Kling v3 وSeedance 2.0 وLTX 2 Pro. تشغيل الأمر نفسه عبر عدة نماذج بالتوازي من أكثر الطرق فعالية لمعايرة الأداة التي تناسب متطلباتك البصرية المحددة. عملية التكرار سريعة، وستخبرك النتائج عن موقع هذه التقنية الحقيقي أكثر من أي وصف مكتوب.
