Sora 2.5 بالصوت والفيديو معًا: كيف يعمل

يولّد Sora 2.5 من OpenAI فيديو وصوتًا متزامنين من أمر نصي واحد، دون أي خطوة معالجة لاحقة. يشرح هذا المقال البنية التقنية وراء هذا الإنجاز، ويكشف كيف يبدو الناتج وكيف يُسمع عمليًا، ويوضح المواضع التي ما زال النموذج يتعثر فيها، ويستعرض نماذج توليد الفيديو المتاحة اليوم التي تقدّم مخرجات صوت وفيديو أصلية، حتى تبدأ بإنتاج محتوى متزامن الآن.

Sora 2.5 بالصوت والفيديو معًا: كيف يعمل
Cristian Da Conceicao
مؤسس Picasso IA

كل إصدار كبير لتوليد الفيديو بالذكاء الاصطناعي خلال العام الماضي تفاخر بجودة الصورة. حركة سلسة، وتكوين سينمائي، وملمس واقعي كالصور الفوتوغرافية. أما الصوت فكان دائمًا فكرة متأخرة، يُضاف في مرحلة ما بعد الإنتاج، أو يغيب تمامًا. غيّر Sora 2.5 هذه المعادلة. يُنتج الإصدار الأحدث من نموذج توليد الفيديو لدى OpenAI الصوت مع الفيديو في تمريرة واحدة، من أمر نصي واحد، دون أي محرك صوتي خارجي أو خطوة معالجة لاحقة. يبدو هذا التحول بسيطًا، لكنه من الناحية التقنية ليس كذلك.

يشرح هذا المقال بالتفصيل كيف يجمع Sora 2.5 بين توليد الصوت والفيديو، وكيف تبدو البنية من الداخل، وكيف يبدو الناتج عمليًا، وأين ما زال النموذج يتعثر، وكيف يمكنك توليد محتوى صوتي ومرئي متزامن اليوم باستخدام أدوات توليد الفيديو المتاحة على PicassoIA.

صانع محتوى يراقب مخرجات صوتية ومرئية متزامنة

ماذا يفعل Sora 2.5 فعلًا

أمر نصي واحد، ومخرجان

الخلاصة المختصرة: تكتب أمرًا نصيًا، فيولّد النموذج فيديو يحمل صوته بالفعل. الصوت ليس خطوة منفصلة. ولا يُولَّد بنموذج آخر ثم يُدمج لاحقًا. يُنتج Sora 2.5 التدفقين معًا في عملية توليد مشتركة واحدة، تتعامل مع الصوت والفيديو بوصفهما جانبين لمخرج واحد.

وهذا اختلاف جوهري عن طريقة عمل معظم خطوط إنتاج الفيديو بالذكاء الاصطناعي سابقًا. كان نموذج تحويل النص إلى فيديو يُنتج مقطعًا صامتًا. وإذا أردت صوتًا، فلديك خياران: إضافة الموسيقى أو التعليق الصوتي يدويًا، أو تمرير الفيديو إلى نموذج تركيب صوتي منفصل. كلا الطريقتين تخلق مشكلة عدم تطابق زمني: صوت يناسب الجو العام للمشهد، لكنه لا يتوافق فعليًا مع الأحداث البصرية المحددة التي تجري فيه.

يتجنب Sora 2.5 هذه المشكلة بتوليد توكنات الصوت والفيديو معًا. حين تتكسر موجة على الشاشة، تسمع ارتطامها في الإطار نفسه. وحين يتكلم شخص في المشهد المُولَّد، تتطابق الكلمات مع حركة الفم. وحين تضرب الخطوات الأرض، ينعكس الاصطدام في قناة الصوت في اللحظة الدقيقة للتلامس.

ملاحظة: يتوفر Sora 2.5 عبر API وعبر Sora 2 وSora 2 Pro على PicassoIA.

أنواع الصوت التي يُنشئها

لا يقتصر Sora 2.5 على فئة واحدة من الأصوات. يمكن للنموذج توليد:

  • أجواء صوتية محيطة: الرياح، والمطر، وضجيج المدينة، وأصوات الحشود
  • مؤثرات صوتية: الارتطامات، وصفق الأبواب، وجريان الماء، والأصوات الميكانيكية
  • موسيقى: خلفيات موسيقية بسيطة تتناسب مع النبرة البصرية
  • كلام: شخصيات تتحدث حوارًا يطابق حركة الفم
  • صوت مختلط: مزيج من كل ما سبق في مقطع واحد

لا يتفوق النموذج بالقدر نفسه في كل هذه الفئات. الأجواء المحيطة والمؤثرات الصوتية هي الأقوى أداءً. أما توليد الحوار، فرغم أنه يعمل، يُظهر تفاوتًا أكبر، وهو الفئة الأكثر احتمالًا لإنتاج تشوهات أو صوتيات غير متطابقة.

ميكروفون استوديو يمثل توليد الصوت بالذكاء الاصطناعي

التقنية وراء الصوت والفيديو الموحّدين

نماذج الانتشار ومشفّرات الصوت

بُني Sora في الأصل على بنية انتشار للفيديو تستخدم محوّل الزمكان (spatial-temporal transformer). سمح ذلك بنمذجة كيفية تطور البكسلات عبر الإطارات بشكل متماسك. يوسّع Sora 2.5 هذه البنية بدمج مسار انتشار صوتي يعمل بالتوازي مع المسار البصري.

على المستوى التقني، يأخذ النموذج الأمر النصي ويشفّره باستخدام عمود فقري من نموذج لغوي كبير، قريب في روحه من GPT 5 أو Gemini 3 Pro. يؤثر هذا الأمر المشفّر في مساري توليد الفيديو والصوت في وقت واحد. يتشارك المساران الإشارة الشرطية نفسها، وهذا هو السبب الرئيسي في بقاء الصوت والفيديو متطابقين.

كابلات ألياف ضوئية تمثل تدفق البيانات في الشبكات العصبونية

يستخدم المسار الصوتي تمثيل الطيف اللوغاريتمي (mel-spectrogram) بدلًا من الموجات الخام. يولّد النموذج أطيافًا ترددية زمنية، تُفكّ شفرتها لاحقًا إلى صوت مسموع. وتوليد الأطياف بدلًا من الموجات أيسر حسابيًا للتدريب الانتشاري واسع النطاق، كما أن تمثيلات الأطياف مفهومة جيدًا في أبحاث تعلم الآلة للصوت.

كيف يعمل التزامن الزمني

التحدي الجوهري في توليد الصوت والفيديو معًا هو التزامن الزمني: ضمان أن تحدث الأحداث الصوتية في الوقت نفسه مع الأحداث البصرية التي تسببها.

يتعامل Sora 2.5 مع هذا عبر طبقات الانتباه المتقاطع (cross-attention) الموجودة بين مساري الصوت والفيديو في نقاط متعددة من عملية التوليد. خلال خطوات إزالة الضوضاء في الانتشار، يتبادل المساران المعلومات حول ما يحدث في كل طابع زمني. حين يزيل مسار الفيديو الضوضاء عن إطار يُظهر جسمًا يصطدم بآخر، ينتبه مسار الصوت لهذا الحدث ويولّد الصوت العابر المناسب.

آلية الانتباه متعدد الوسائط هذه هي الميزة المعمارية الأساسية. فبدونها، يمكنك توليد فيديو جيد وصوت جيد كلٌّ على حدة، لكن لن يكون هناك ضمان بأنهما يشيران إلى اللحظة الزمنية نفسها أو يصفان الحدث المادي نفسه.

عامل بيانات التدريب

البنية وحدها لا تنتج تزامنًا جيدًا. بيانات التدريب هي التي تقوم بالعبء الأكبر. دُرّب Sora 2.5 على مجموعة من الفيديوهات المقترنة بمسارات صوتية عالية الجودة، تشمل محتوى مسجّلًا باحتراف تتزامن فيه الأحداث الصوتية والبصرية بطبيعتها.

وهذا مهم لأن النموذج يتعلم العلاقة الإحصائية بين الأحداث البصرية والأصوات المرتبطة بها من أمثلة واقعية. يُصدر باب السيارة المغلق صوته كما يحدث في الحياة الواقعية، ليس لأن النموذج يملك معرفة بالفيزياء، بل لأنه رأى عشرات الآلاف من أصوات أبواب السيارات الحقيقية مقترنة بصور أبواب سيارات حقيقية.

وجودة بيانات التدريب تفسّر أيضًا لماذا يُعد الحوار أصعب من الصوت المحيط. فالكلام الدقيق صوتيًا والمقترن بوجوه متزامنة الشفاه إشارة أندر وأكثر ضوضاء للتعلم منها من صوت المطر على النافذة.

نصيحة: مزامنة الشفاه الدقيقة تخصص مستقل. نماذج مثل Omni Human 1.5 وLipsync 2 Pro مبنية خصيصًا لهذه المهمة، وتتفوق باستمرار على نماذج الفيديو العامة في دقة الحوار.

مخطط تحرير فيديو يُظهر مسارات صوت وفيديو متزامنة

كيف يبدو الناتج

دقة الفيديو ومدته

يُولّد Sora 2.5 فيديو بدقة تصل إلى 1080p، بمدد تتراوح من بضع ثوانٍ إلى نحو 20 ثانية في المستوى القياسي. ويمدد إصدار Pro هذه المخرجات إلى مدد أطول. جودة الفيديو عالية وفق معايير المحتوى المولَّد بالذكاء الاصطناعي، مع تماسك جيد في الحركة وتصيير واقعي كالصور الفوتوغرافية في معظم السيناريوهات.

يعاني النموذج أكثر مع المشاهد المعقدة التي تضم شخصيات متعددة، وللقطات القريبة جدًا للوجوه البشرية ذات التعابير الدقيقة، والسيناريوهات الديناميكية الكثيفة في الفيزياء مثل محاكاة السوائل. أما المشاهد البسيطة والموصوفة بوضوح، ذات الإضاءة الواضحة والحركة المحددة، فتعطي أقوى النتائج.

الميزةالقياسيPro
أقصى دقة1080p1080p
أقصى مدة~10 ثوانٍ~20 ثانية
أنواع الصوتالكلالكل
جودة الحوارمتوسطةأفضل
سرعة التوليدأسرعأبطأ

جودة الصوت عمليًا

يُظهر الصوت الناتج من Sora 2.5 في الاختبارات المضبوطة أداءً قويًا في:

  • الأصوات البيئية: المطر، والرياح، والحشود، والآلات
  • الارتطامات الإيقاعية: الخطوات، والتصادمات، وأصوات الأبواب
  • المصاحبة الموسيقية البسيطة: الأوتار، والبيانو، والخلفيات المحيطة

وتظهر نقاط الضعف في:

  • الحوار المعقد: صوتيات غير متطابقة، وتشوه أحيانًا في الكلام السريع
  • الانتقالات الصوتية السريعة: أصوات تتغير فجأة خلال مقطع قصير جدًا
  • البيئات الصوتية غير الشائعة: أماكن نادرة ذات خصائص صدى غير معتادة

عمق البت ومعدل العينات في الصوت يضاهيان المعايير الاحترافية للصوت. الجودة التقنية للإشارة الصوتية ليست هي القيد. القيد هو الدقة الدلالية، أي هل تظهر الأصوات الصحيحة في اللحظات الصحيحة وبالسياق الصوتي الملائم للمشهد.

محرران يقارنان مخرجات فيديو بالذكاء الاصطناعي على شاشتين

أين يقصّر

الاتساق في المقاطع الطويلة

يتعامل Sora 2.5 مع المقاطع القصيرة بإتقان. لكن عند تجاوز 15 إلى 20 ثانية تظهر مشكلات الاتساق. تصبح مشكلات الاستمرارية البصرية، حين يتغير مظهر شخصية أو إضاءة المشهد بشكل خفي بين المقاطع، أكثر وضوحًا. وتزيد مشكلات الصوت الأمر سوءًا: قد يتغير الجو الصوتي المحيط في طابعه أو حجمه بطرق لا تحدث في تسجيل حقيقي.

هذا قيد معروف في توليد الفيديو الحالي القائم على الانتشار. فالحفاظ على حالة متماسكة عبر تسلسلات زمنية طويلة أمر صعب حسابيًا، ومُتحدٍّ معماريًا للنماذج التي تولّد المحتوى بإزالة الضوضاء من ضوضاء عشوائية. ويتوقع المجتمع أن تمدّ الإصدارات القادمة نوافذ التوليد المتماسك، لكن السقف الحالي حقيقي.

حساسية الأمر النصي

تعتمد جودة مخرجات Sora 2.5 بشدة على الأمر النصي. الأوامر الغامضة تنتج نتائج غير متوقعة. والنموذج حساس جدًا لدرجة تحديد أوصاف الصوت في الأمر. كتابة "مقهى مزدحم" تنتج صوتًا يختلف عن "مقهى مزدحم تُصدر فيه آلات الإسبريسو بخارًا، وتُعزف موسيقى جاز خافتة في الخلفية، ويتحدث الناس بهدوء في المقاعد الجانبية".

إذا أردت صوتًا محددًا، فعليك أن تصفه بدقة. لا يستنتج النموذج قصد الصوت من الإشارات البصرية وحدها عند كتابة الأمر. وهذا يختلف عن طريقة إدراك البشر للصوت في الحياة، حيث نعرف بالحدس كيف يبدو المشهد دون أن يُخبرنا أحد. ويعتمد النموذج على توجيه نصي صريح ليرجّح تفسيرًا صوتيًا لمشهد على آخر.

نصيحة: عامل الصوت كعنصر من الدرجة الأولى في أمرك النصي. صف الأصوات بوضوح كما تصف العناصر البصرية تمامًا. حدّد مصادر الصوت، ومستويات الحجم، والطابع الصوتي.

يدان تكتبان أمر فيديو بالذكاء الاصطناعي على لوحة مفاتيح ميكانيكية

كيف تتعامل نماذج الفيديو الأخرى مع الصوت

نماذج الصوت الأصلي الجديرة بالمعرفة

Sora 2.5 ليس النموذج الوحيد الذي يولّد الصوت مع الفيديو. وقد توسعت هذه القدرة بسرعة عبر مشهد الفيديو بالذكاء الاصطناعي. هذه هي النماذج على PicassoIA التي تُنتج صوتًا متزامنًا أصليًا:

Veo 3 من Google يولّد فيديو بصوت أصلي من أمر نصي، يشمل الحوار والأصوات المحيطة والموسيقى. ويقدّم Veo 3 Fast القدرة نفسها بأوقات توليد أسرع. ويحسّن Veo 3.1 وVeo 3.1 Fast النسخة الأصلية باتساق أفضل ودقة صوتية أعلى تصل إلى 1080p.

Seedance 2.0 من ByteDance يتضمن توليد صوت مدمجًا، ويُخرج بدقة 1080p. أما شقيقه الأصغر Seedance 2.0 Mini فيُنتج صوتًا أصليًا أيضًا. ويتيح المستوى المجاني Seedance 2.5 Lite مقاطع تصل إلى 10 ثوانٍ دون تكلفة.

Pixverse v6 يولّد فيديو سينمائيًا بصوت ذكاء اصطناعي بدقة تصل إلى 1080p، مع أداء قوي في المشاهد الغنية بالحركة.

Flux 3 من Black Forest Labs يولّد فيديو بصوت متزامن من مدخلات نصية وصورية.

Q3 Turbo من Vidu يُخرج فيديو بدقة 1080p مع صوت أصلي، وهو سريع بشكل ملحوظ قياسًا إلى مستوى جودته.

Wan 2.2 S2V (Sound to Video) يأخذ الصوت مدخلًا لتوجيه توليد الفيديو، وهو نهج معكوس ما زال يُنتج مخرجات متزامنة بإحكام.

Grok Imagine Video 1.5 من xAI يدعم تحويل الصورة إلى فيديو مع مخرجات صوتية أصلية.

Ovi I2V من Character AI يولّد فيديو بصوت من أي صورة فوتوغرافية.

Audio to Video من Lightricks يسلك النهج المعاكس: تزوّده بملف صوتي وصورة، فيحرّك النموذج الصورة لتتطابق مع الصوت. وهو مفيد بشكل خاص حين يكون لديك المسار الصوتي مسبقًا وتحتاج أن تستجيب الصور له.

النموذجصوت أصلينوع المدخلأقصى دقة
Veo 3.1نعمنص1080p
Seedance 2.0نعمنص/صورة1080p
Pixverse v6نعمنص/صورة1080p
Flux 3نعمنص/صورة1080p
Q3 Turboنعمنص1080p
Wan 2.2 S2Vنعم (مدفوع بالصوت)صوت/صورة720p
Grok Imagine Video 1.5نعمصورة1080p

نماذج مزامنة الشفاه لدقة الصوت

حين يكون المطلوب هو كلام بشري متزامن مع وجه، فإن نموذجًا عامًا للصوت والفيديو لا يكون غالبًا الأداة الصحيحة. النماذج المخصصة لمزامنة الشفاه تتفوق باستمرار على نماذج الفيديو العامة في دقة الحوار، لأنها مدرّبة خصيصًا على مشكلة ربط الصوتيات بحركة الفم.

رجل يتحدث في استوديو تسجيل وخلفه شاشات مراقبة لفيديو مزامنة الشفاه

Omni Human 1.5 من ByteDance يأخذ صورة ومقطعًا صوتيًا ويولّد فيديو مزامنة شفاه واقعيًا. يتعامل مع التعابير الوجهية المعقدة وحركات الرأس بشكل أفضل من معظم النماذج العامة، ما يجعله الخيار المفضل لمحتوى الحديث أمام الكاميرا.

Lipsync 2 Pro من Sync مبني خصيصًا لمزامنة الشفاه الدقيقة على مستوى الصوتيات. وهو المعيار للدبلجة والعروض التقديمية المؤسسية بجودة الإنتاج، حيث لا تقبل دقة الحوار التنازل.

P Video Avatar يولّد فيديوهات أفاتار متحدثة من صورة واحدة، ومفيد لإنشاء متحدثين شخصيين أو محتوى للتواصل الاجتماعي بسرعة.

React 1 من Sync يضيف مزامنة شفاه واقعية إلى أي فيديو موجود، بأخذ مسار صوتي مدخلًا وتعديل حركات الفم القائمة دون تغيير بقية الإطار.

Kling Lip Sync من Kwai يطابق حركات الفم مع الصوت في أي فيديو، مع سجل قوي في اللغات المعقدة صوتيًا.

سير العمل العملي هنا هو توليد المشهد بنموذج مثل Veo 3.1 أو Seedance 2.0، ثم تحسين الحوار بنموذج مزامنة شفاه مخصص إذا لم تكن دقة الكلام في المخرج الأصلي كافية لحالتك.

فيديو بالذكاء الاصطناعي مع الصوت على PicassoIA

Veo 3 وVeo 3.1 لصوت متزامن

تمثل سلسلة Veo من Google أقوى قدرة متاحة حاليًا على المنصة لتوليد الصوت والفيديو معًا بشكل أصلي. يُنتج Veo 3.1 مخرجات بدقة 1080p مع صوت متزامن، ويعالج الحوار والأصوات المحيطة وتأليف الموسيقى ضمن تمريرة توليد واحدة. ويحتاج الأمر النصي إلى أوصاف صوتية صريحة للحصول على أفضل ما فيه.

Veo 3.1 Fast هو الخيار حين تحتاج إلى التكرار بسرعة. يوفر زمن استجابة أقل مع جودة تزامن صوت وفيديو مقاربة، ما يجعله الخيار المناسب لاستكشاف الأوامر قبل الالتزام بتشغيل بجودة كاملة.

Seedance 2.0 للصوت المدمج

مشهد شاطئ مولّد بالذكاء الاصطناعي بواقعية فوتوغرافية يوضح جودة مخرجات الفيديو

Seedance 2.0 من ByteDance خيار قوي لتوليد الصوت المدمج بدقة 1080p. يتفوق بشكل خاص في الصوت البيئي والمشاهد السينمائية، وغالبًا ما يكون أسرع من Veo في أطوال المقاطع المتقاربة. ويوفّر Seedance 2.0 Mini القدرة الصوتية الأصلية نفسها بتكلفة أقل للمخرجات القصيرة.

للتجريب المجاني، يدعم Seedance 2.5 Lite مقاطع تصل إلى 10 ثوانٍ مع صوت دون تكلفة. وهو أسرع طريق لاختبار شعور توليد الصوت والفيديو المتزامنين قبل استثمار نقاط مدفوعة.

نماذج أخرى للتجربة

يمنحك Sora 2 وSora 2 Pro على PicassoIA الوصول إلى جيل Sora الحالي من OpenAI. ويُعد Sora 2 Pro الفئة الأعلى سعةً للمخرجات الأطول والأعلى جودة، مع دقة صوت أفضل في المشاهد المعقدة.

يُعد Kling v3 Omni Video من Kwai خيارًا آخر بدقة 1080p يستحق التجربة للمخرجات المجمّعة من صوت وفيديو. ويقدّم Kling v2.6 حركة سينمائية مع اتساق جيد عبر المقاطع الأطول.

لكتابة النصوص بمساعدة نموذج لغوي كبير وتحسين الأوامر قبل التوليد، يُعد Claude Opus 4.7 وGemini 3.5 Flash خيارين قويين لصياغة أوامر صوتية دقيقة.

نصيحة سير العمل: اكتب أمر الفيديو أولًا في نموذج لغوي كبير. صف المشهد بالتفصيل، مع عناصر صوتية صريحة. ثم الصق الأمر المحسّن مباشرة في Veo 3.1 أو Seedance 2.0 للتوليد. فرق جودة الأمر قابل للقياس.

ابدأ في إنتاج محتواك الخاص بالصوت والصورة

أثبت Sora 2.5 أن توليد الصوت والفيديو الموحّد من أمر نصي ممكن بجودة عالية. والبنية، أي التكييف المشترك على تمثيل نصي واحد مع انتباه متعدد الوسائط بين مساري الصوت والفيديو، أصبحت الآن المخطط الذي تتبعه الصناعة الأوسع. ويطبّق Veo 3.1 وSeedance 2.0 وPixverse v6 وFlux 3 وعدد من النماذج الأخرى على PicassoIA نسخهم الخاصة من النهج نفسه.

الفجوة بين ما يستطيع أمر نصي واحد إنتاجه اليوم، وما كان يتطلب سابقًا فريق إنتاج كاملًا بمسجّلين ومازجين ومحرري ما بعد الإنتاج، تضيق بسرعة.

محترف إبداع يولّد محتوى بالذكاء الاصطناعي في مساحة عمل استوديو منزلي حديث

إذا أردت أن تختبر ذلك بنفسك، فأسرع طريق هو Seedance 2.5 Lite كنقطة دخول مجانية، ثم انتقل إلى Veo 3.1 Fast حين تحتاج إلى مخرجات بجودة الإنتاج. اكتب أوامرك بأوصاف صوتية صريحة، واحرص على أن تبقى مقاطعك دون 10 ثوانٍ لتحقيق أعلى جودة، واستخدم نموذج مزامنة شفاه مخصصًا مثل Lipsync 2 Pro إذا كانت دقة الحوار حاسمة لمشروعك.

كل هذه الأدوات متاحة على picassoia.com/en/all-models. جرّب أمرًا نصيًا، وانظر ما يُنتجه، وعدّل. أفضل طريقة لفهم ما ينتجه الذكاء الاصطناعي المتزامن للصوت والفيديو هي أن تولّده وتسمعه بنفسك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة