Sora 2: كيف يعمل نموذج OpenAI لتوليد الفيديو بالذكاء الاصطناعي (وما الذي يستطيع فعله فعلًا)

Sora 2 هو نموذج OpenAI لتحويل النص إلى فيديو، ينتج لقطات بدقة HD مع صوت متزامن من الأوامر النصية المكتوبة. يشرح هذا المقال طريقة عمل النموذج من الداخل، وجودة مخرجاته الفعلية، ومقارنته بنماذج منافسة مثل Veo 3 وKling، وكيفية استخدامه على PicassoIA اليوم.

Sora 2: كيف يعمل نموذج OpenAI لتوليد الفيديو بالذكاء الاصطناعي (وما الذي يستطيع فعله فعلًا)
Cristian Da Conceicao
مؤسس Picasso IA

لا يكتفي نموذج Sora 2 من OpenAI بتوليد مقاطع فيديو. إنه يصوغ حركة معقولة، وسلوكًا للضوء، وتفاعلًا فيزيائيًا انطلاقًا من وصف مكتوب، ثم يغلفها بصوت متزامن يُولَّد جنبًا إلى جنب مع اللقطات. صدر Sora 2 بعد أن أثبت النموذج الأصلي Sora أن الفكرة قابلة للتحقق، وهو الإصدار الذي جعل التقنية عملية: دقة أعلى، ومقاطع أطول، وحركة أكثر تماسكًا، وعلاقة بين الأمر والنتيجة تسلك السلوك الذي تتوقعه فعلًا. سواء كنت صانع أفلام أو منشئ محتوى أو مجرد شخص يحاول فهم وجهة الوسائط المولّدة بالذكاء الاصطناعي، فإن Sora 2 يمثل علامة واضحة على المدى الذي وصل إليه توليد الفيديو من النص. يشرح هذا المقال بالتفصيل طريقة عمل النموذج، وما ينتجه، وكيف يقارن بالمنافسين، وكيفية استخدامه على PicassoIA اليوم.

محطة عمل لتحرير الفيديو بالذكاء الاصطناعي مع خط زمني متعدد المسارات ومصغرات لقطات معالجة الألوان متتابعة

ما هو Sora 2 فعليًا

Sora 2 نموذج لتوليد الفيديو مبني على معمارية Diffusion Transformer. فعلى عكس مولّدات الفيديو السابقة التي كانت تربط إطارات الصور بحيل التدفق الضوئي (optical flow)، تدرّب Sora 2 على مجموعة بيانات ضخمة من الفيديوهات المقترنة بأوصاف نصية، فتعلّم كيف تتغير البكسلات عبر الزمن لا عبر المكان وحده. هذا الفرق مهم جدًا. فأغلب مولّدات الصور تتعلم "كيف تبدو الأشياء". أما Sora 2 فيتعلم "كيف تتحرك الأشياء".

يقبل النموذج أمرًا نصيًا، واختياريًا صورة مرجعية، ثم يُخرج مقطع فيديو يطابق المشهد الموصوف. كان Sora الأصلي ينتج مقاطع تصل إلى 60 ثانية. أما Sora 2 فيحسّن ذلك بتماسك أقوى في المقاطع الطويلة، ومعالجة أفضل لتعليمات حركة الكاميرا، وتوليد صوتي أصلي مدمج في تمريرة الاستدلال نفسها.

الانتقال من الصورة إلى الزمن

تعمل نماذج الانتشار للصور عادةً في فضاء كامن ثنائي الأبعاد. تصف مشهدًا، فيزيل النموذج الضوضاء من حقل ضوضاء عشوائي خطوة بخطوة حتى يظهر شيء متماسك. أما الفيديو فمختلف جوهريًا: مخرجه بنية ثلاثية الأبعاد يكون فيها المحور الثالث هو الزمن. يقسّم Sora 2 الفيديو إلى رقع مكانية زمنية (spatiotemporal patches)، وهي كتل صغيرة من البكسلات عبر المكان والزمن معًا، ثم يعالجها بمحوّل يُعمل الانتباه على البعدين في آن واحد. هذا يعني أنه لا يولّد الإطار 1 ثم يولّد الإطار 2 بالرجوع إلى الإطار 1. بل يولّد المقطع كاملًا في تمريرة متماسكة واحدة، ولهذا تبدو الحركة أقرب إلى تسلسل زمني حقيقي منها إلى كتاب رسوم متحركة يُقلَّب.

صورة جوية واسعة بطائرة مسيّرة لمدينة ساحلية متوسطية في الساعة الذهبية، وأسطح قرميدية تتدرج نحو ميناء أزرق

كيف يتعامل مع الحركة والفيزياء

من أبرز الانتقادات التي وُجهت إلى جيل الفيديو الأول بالذكاء الاصطناعي أن الأشياء كانت تتحرك، لكنها تتحرك بشكل خاطئ. كان الشعر يتشوه، والماء يتكرر بشكل مصطنع، والأيدي تكتسب أصابع أو تفقدها بين الإطارات. لا يحل Sora 2 هذه المشكلات بالكامل، لكنه يعالجها بدرجة كبيرة عبر التدريب على أسبقيات فيزيائية (physics priors) مستمدة من العالم الحقيقي. فعندما تصف "كوب ماء يسقط من على طاولة"، يعتمد النموذج على أنماط مكتسبة لانتشار السوائل، وشظايا الزجاج، وظلال الاصطدام. هو لا يحاكي الفيزياء بمعادلات، بل يقاربها عبر التعرف على الأنماط على نطاق واسع، وعند حجم Sora 2 تكون هذه المقاربة في كثير من الأحيان غير قابلة للتمييز عن اللقطات الحقيقية.

التقنية وراء المخرجات

الانتشار عبر الزمن

الآلية الأساسية هي الانتشار، وهي العملية نفسها التي تشغّل مولّدات الصور الحديثة. تبدأ بالضوضاء. ثم تطبّق عملية إزالة ضوضاء متعلَّمة مشروطة بتضمين نصي. تكرر ذلك حتى يظهر الإشارة. وفي الفيديو، تعمل هذه العملية على فضاء كامن زمني بدلًا من فضاء الصورة المسطح. يستخدم Sora 2 عمود فقري من نوع Diffusion Transformer (DiT)، حيث تتولى آلية الانتباه في المحوّل العلاقات المكانية (هذا البكسل قرب ذاك البكسل) والعلاقات الزمنية (هذا الإطار قرب ذاك الإطار). والنتيجة نموذج "يفكر" في الزمن بالطبيعية نفسها التي يفكر بها في المكان.

مركز بيانات حديث عالي الأداء مع رفوف خوادم تمتد على طول ممر طويل، ومؤشرات LED زرقاء وبيضاء على هياكل من الألومنيوم المصقول

التماسك المكاني والزمني

التماسك هو الكلمة التي تفصل بين الذكاء الاصطناعي للفيديو الجيد والذكاء الاصطناعي للفيديو الممتاز. التماسك المكاني يعني أن تبدو الأشياء متطابقة من إطار إلى الذي يليه. فالسيارة الحمراء في الإطار 1 تظل سيارة حمراء في الإطار 300. أما التماسك الزمني فيعني أن تبدو الحركة معقولة فيزيائيًا بدلًا من أن تكون مولّدة عشوائيًا. يحقق Sora 2 الاثنين عبر نظام تدريبه، الذي شمل تعليقات مفصّلة على الفيديوهات تصف لا ما هو موجود في المشهد فحسب، بل كيف يتغير عبر الزمن. تضمّن خط التدريب إعادة توصيف مجموعات كبيرة من بيانات الفيديو بأوصاف زمنية أغنى، ليتعلم النموذج ربط أنماط لغوية محددة بسلوكيات حركية محددة.

💡 في أوامر Sora 2 الخاصة بك، صف الحركة بوضوح. "امرأة تمشي في حديقة" أضعف من "امرأة تمشي ببطء في حديقة مشمسة، ومعطفها يتحرك مع نسيم خفيف، والكاميرا تتبعها على مستوى الكتف". لغة الزمن والحركة تحسّن التماسك بشكل ملحوظ.

ما الذي ينتجه Sora 2

الدقة وطول المقطع

ينتج Sora 2 فيديو بدقة تصل إلى 1080p في المستوى القياسي، وإلى 4K في إعداد Pro. تتراوح المقاطع من 5 ثوانٍ إلى نحو 20 ثانية في الوضع القياسي، مع توليد ممتد متاح في Pro. نسبة العرض إلى الارتفاع الأصلية هي 16:9 بعرض الشاشة، مع دعم المخرجات العمودية والمربعة لاستخدامات وسائل التواصل الاجتماعي. معدل الإطارات الافتراضي 24 fps لإحساس سينمائي، مع توفر 30 fps لأسلوب وثائقي أكثر. وعند 1080p/24fps مع تحسينات التماسك في Sora 2، تبدو المخرجات فعلًا كتصوير سينمائي مقصود عندما يُكتب الأمر جيدًا.

امرأة ذات شعر بني محمر ترتدي فستان صيف أزرق فاتح تسير عبر حقل قمح ذهبي، وشمس العصر المتأخرة تنساب من اليمين

مزامنة الصوت

هذه أكثر قدرات Sora 2 إثارة للدهشة. كانت نماذج تحويل النص إلى فيديو السابقة تنتج مقاطع صامتة. أما Sora 2 فيولّد صوتًا محيطيًا، وتصميمًا صوتيًا جويًا، وفي بعض الحالات موسيقى، متزامنًا مع المحتوى المرئي. يتضمن فيديو أمواج البحر صوت الأمواج، ويتضمن مشهد شارع مزدحم ضجيج المرور وهمهمة الحشود. الصوت لا يُضاف في ما بعد الإنتاج، بل يُولَّد بالتوازي مع الفيديو أثناء التشغيل، ما يعني أن النموذج تعلّم الروابط بين المحتوى البصري وبيئته الصوتية المقابلة. الجودة ليست جاهزة للبث في كل الحالات، لكنها لإنشاء المحتوى والنماذج الأولية تمثل تسريعًا كبيرًا لسير العمل.

Sora 2 مقابل المنافسين

يزدحم مجال تحويل النص إلى فيديو في 2027 بخيارات بديلة قوية. ويعتمد موقع Sora 2 في هذا المشهد على ما تعطيه الأولوية.

النموذجأقصى دقةصوت أصليالاستخدام الأمثل
Sora 21080pنعمالمشاهد السردية
Sora 2 Pro4Kنعمالإنتاج عالي الدقة
Veo 31080pنعمالمشاهد الخارجية الواقعية كالصور الفوتوغرافية
Kling v3 Video1080pلامخرجات سينمائية سريعة
Seedance 2.01080pنعمالمشاهد ذات الحركة الديناميكية
Kling v2.61080pلاالتكرار السريع

اثنان من المحترفين المبدعين جالسان حول طاولة اجتماعات زجاجية يقارنان مخرجات فيديو الذكاء الاصطناعي جنبًا إلى جنب على جهازين لوحيين

Veo 3 وKling وSeedance

يُعد Veo 3 من Google أقرب نظير لنموذج Sora 2 من حيث تعقيد المعمارية. كلاهما يولّد صوتًا أصليًا، وكلاهما يتعامل مع أوصاف المشاهد المعقدة بتماسك قوي. تكمن قوة Veo 3 في الواقعية في المشاهد الخارجية والطبيعية. أما ميزة Sora 2 فتظهر في الأوامر السردية ذات الشخصيات المتعددة وتعليمات حركة الكاميرا الصريحة.

يضحّي Kling v3 Video من Kwai بالصوت مقابل السرعة والتحكم في الحركة السينمائية. وهو باستمرار من أسرع النماذج المتاحة بجودة إنتاجية. إذا كنت تحتاج إلى تكرار سريع لأسلوب بصري دون اهتمام بالصوت، فإن Kling v3 يبقى خيارًا رائدًا.

يتميز Seedance 2.0 من ByteDance بقوة خاصة في الحركة الديناميكية: المشاهد ذات الحركة السريعة، ومشاهد الأكشن، والمحتوى عالي الطاقة. كما يولّد الصوت بشكل أصلي، ما يجعله منافسًا قويًا لنموذج Sora 2 لمنشئي المحتوى الذين يفضلون الطاقة على الصقل السردي.

أين يتفوق Sora 2 وأين يخسر

يتفوق Sora 2 في الالتزام بالأمر عند الأوصاف المعقدة. عندما تكتب مشهدًا مفصلًا بزوايا كاميرا محددة، وسلوكيات محددة للأشخاص، وظروف إضاءة محددة، يتبع Sora 2 هذا الوصف بأمانة أكبر من معظم البدائل. ويتفوق أيضًا في الجمع بين الدقة والتماسك والصوت الأصلي في نموذج واحد.

أما نقاط ضعفه فتتمثل في أن سرعة التوليد ليست نقطة قوته. مقارنةً بنموذج Kling v2.6 أو الإصدارات السريعة من نماذج أخرى، يستغرق Sora 2 وقتًا أطول لكل مقطع. وللتكرار السريع على المفاهيم البصرية، قد تكون النماذج الأسرع أكثر عملية في المراحل الأولى من المشروع.

كتابة أوامر تنجح

صورة ماكرو قريبة لكابلات ألياف بصرية مجمعة معًا، والضوء ينتقل عبر أنوية الزجاج، وخلفية داكنة غير لامعة

يستجيب Sora 2 جيدًا للغة محددة وسينمائية. دُرّب النموذج على محتوى فيديو موصوف بغنى، وهذا يعني أن الأوامر الغامضة تنتج نتائج عامة، والأوامر المفصلة تنتج نتائج محددة ومضبوطة. وليس هذا أمرًا عارضًا، بل هو نتيجة مباشرة لكيفية تعلّم النموذج ربط اللغة بالحركة.

ما الذي يستجيب له النموذج

  • لغة الكاميرا: مصطلحات مثل "dolly in" و"tracking shot" و"rack focus" و"aerial pull-back" تنتج سلوكيات كاميرا حقيقية، لا مشاهد ثابتة فقط.
  • أوصاف الإضاءة: عبارات مثل "Golden hour backlight" و"overcast diffused light" و"hard side-lighting" تؤثر مباشرة في النبرة البصرية للمخرجات.
  • تفاصيل سلوك الشخص: "امرأة تركض" أضعف من "امرأة تندفع عبر رصيف مبتل، وذراعاها تتأرجحان، ومعطفها يتطاير خلفها".
  • الوقت من اليوم والطقس: هذه المؤشرات تؤثر في الطبقة الصوتية كما تؤثر في البصرية. "شارع مدينة في مساء ممطر" ينتج مشاهد مطر وصوت مطر معًا.
  • ملمس الأسطح: ذكر "أرصفة حجرية مبللة" أو "رمال صحراوية جافة" أو "رخام مصقول" يمنح النموذج سياقًا للمادة يؤثر في طريقة تصرف الضوء داخل المشهد.

أخطاء شائعة في أوامر الفيديو

  1. وصف الصور لا الحركة: "جبل جميل عند الغروب" أمر نصي لصورة. أما "لقطة واسعة تقترب ببطء من جبل عند الغروب بينما تنجرف الغيوم فوق القمة" فهو أمر نصي لفيديو.
  2. تحميل المشهد بالأشخاص: يتعامل النموذج جيدًا مع المشاهد التي تضم شخصًا أو شخصين رئيسيين. أما خمسة أشخاص بسلوكيات فردية فغالبًا ما ينتجون حركة غير متماسكة.
  3. تجاهل الكاميرا تمامًا: توليد الفيديو بدون تعليمات كاميرا يعتمد افتراضيًا على لقطات ثابتة. لغة الكاميرا ليست اختيارية إذا أردت نتائج سينمائية.
  4. إغفال إشارات الزمن: "غابة" قد تكون في أي وقت من اليوم وبأي طقس. أما "غابة صباحية ضبابية مع ضباب منخفض يتدحرج بين الأشجار" فيمنح النموذج سياقًا زمنيًا وجويًا يمكنه التصرف بناءً عليه.

💡 قبل التوليد، اقرأ أمرك بصوت مرتفع. إذا بدا كأنه تعليق على صورة، فأضف الحركة وسلوك الكاميرا والوقت والأجواء قبل الإرسال.

كيفية استخدام Sora 2 على PicassoIA

يتوفر Sora 2 على PicassoIA دون الحاجة إلى حساب مباشر لدى OpenAI أو مفتاح API. تغلف المنصة النموذج بواجهة نظيفة مع عناصر تحكم كاملة في الدقة والمدة وإعدادات الصوت.

مخرج أفلام يحمل لوح تصوير تقليدي في موقع تصوير سينمائي احترافي، مع أضواء صندوقية لينة ومعدات كاميرا ظاهرة

خطوة بخطوة مع Sora 2

  1. افتح صفحة نموذج Sora 2 على PicassoIA.
  2. في حقل الأمر النصي، أدخل وصف المشهد كاملًا. اذكر الشخص والحركة وزاوية الكاميرا والإضاءة ووقت اليوم.
  3. اختر الدقة المطلوبة. لأغلب استخدامات وسائل التواصل الاجتماعي، تكون 720p أو 1080p مناسبة.
  4. اضبط مدة المقطع بين 5 و20 ثانية حسب تعقيد المشهد.
  5. فعّل توليد الصوت إذا كنت تحتاج إلى صوت محيطي في مخرجاتك.
  6. انقر على Generate وانتظر اكتمال التشغيل. يستغرق Sora 2 عادةً من 30 ثانية إلى بضع دقائق حسب الدقة وطول المقطع.
  7. حمّل المقطع أو انسخ الرابط المستضاف لتضمينه مباشرة في مشروعك.

متى تختار Sora 2 Pro

Sora 2 Pro هو المستوى المطور الذي يتيح الوصول إلى مخرجات 4K ومدد مقاطع أطول. اختره عندما:

  • تحتاج إلى مخرجات للعرض على الشاشات الكبيرة أو للبث
  • يتطلب مشروعك مقاطع أطول من 15 ثانية
  • تنتج محتوى لأغراض تجارية تكون فيها الدقة أمرًا لا يُتنازل عنه
  • تحتاج إلى أعلى درجة متاحة من الالتزام بالأمر للمشاهد السردية المعقدة متعددة الشخصيات

بالنسبة لمقاطع وسائل التواصل السريعة أو اختبارات المفاهيم السريعة، يكفي Sora 2 القياسي، وهو أسرع في التوليد بشكل ملحوظ.

نماذج أخرى تستحق التجربة

مدير إبداعي يرتدي كنزة سوداء ذات ياقة عالية يشير نحو جدار زجاجي كبير مغطى بإطارات لوحات قصصية مطبوعة للفيديو وملاحظات

إذا لم يكن Sora 2 مناسبًا لسير عملك المحدد، فإن كتالوج الفيديو على PicassoIA يوفر بدائل قوية بأولويات مختلفة.

للسرعة

يولّد Kling v3 Video وKling v2.6 مقاطع بجودة سينمائية بسرعة أكبر بكثير من Sora 2. وفي سير العمل الذي يتطلب عشرات التكرارات في الجلسة الواحدة، تصبح السرعة عاملًا حقيقيًا. يتعامل النموذجان جيدًا مع تعليمات حركة الكاميرا، وينتجان مخرجات 1080p بتماسك بصري قوي.

يمثل Seedance 2.0 Fast خيار التكرار السريع للمحتوى الديناميكي. فهو يضحّي ببعض التماسك مقابل سرعة التوليد، ما يجعله مثاليًا للمسودات الأولية واختبار المفاهيم قبل الالتزام بالنموذج النهائي.

للجودة السينمائية

يمثل Veo 3.1 أحدث إصدارات Google، ويقدم مخرجات 1080p مع صوت أصلي وتحسينات في الواقعية مقارنةً بنموذج Veo 3 الأساسي. وبالنسبة للبيئات الطبيعية واللقطات على طريقة الأفلام الوثائقية، فهو ينافس Sora 2 Pro مباشرة في هذا المستوى.

يدعم LTX 2 Pro من Lightricks مخرجات 4K، ويتميز بحركة كاميرا مضبوطة ومستقرة. بالنسبة للقطات المنتجات، وتصورات العمارة، أو أي محتوى تكون فيه حركة الكاميرا الناعمة والمتعمدة هي الأولوية، يستحق LTX 2 Pro المقارنة المباشرة مع Sora 2 Pro.

ابدأ توليد الفيديو بالذكاء الاصطناعي اليوم

لم تكن الفجوة بين الوصف النصي ومقطع الفيديو المصقول أصغر من ذلك أبدًا. لقد نقل Sora 2 هذه العلامة بشكل كبير: تماسك أفضل، وصوت متزامن حقيقي، وعلاقة بين اللغة والمخرجات تكافئ الوصف الدقيق بدلًا من أن تعاقبه.

يجمع PicassoIA بين Sora 2 وSora 2 Pro إلى جانب أكثر من 100 نموذج فيديو، من بينها Veo 3 وKling v3 Video وSeedance 2.0، في مكان واحد. وهذا يجعل من العملي تشغيل الأمر نفسه عبر نماذج متعددة، ومقارنة المخرجات جنبًا إلى جنب، واختيار النموذج الذي يناسب المشهد الذي تحاول بناءه.

ابدأ بمشهد واحد. اكتبه كما يوجّه مدير التصوير طاقمه: الشخص، والحركة، والكاميرا، والضوء، والوقت. شاهد ما يفعله Sora 2 به. ثم شغّل الأمر نفسه عبر Kling أو Veo. ستتضح الفروق بين النماذج سريعًا، وهذه المقارنة هي ما ينمّي لديك حدسًا حقيقيًا لاختيار النموذج المناسب لأي مشروع.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة