تنجح معظم نماذج الفيديو بالذكاء الاصطناعي في الجانب البصري، لكنها تتعثر في الصوت. ربما رأيت لقطات مذهلة لشلال مصحوبة بصوت عام وباهت لتدفق الماء، لا يتناسب مع زاوية التصوير أو المسافة أو سرعة الماء على الشاشة. يختلف Sora 2 Pro عن ذلك، إذ لا يضيف نظامه الصوتي الأصلي صوتًا إلى الفيديو فحسب، بل يستنتج كيف يجب أن يبدو صوت المشهد، ثم يركّب ذلك الصوت من الصفر، إطارًا بإطار. والنتيجة شيء يلفتك حقًا: صوت ينتمي إلى الصورة.
يتناول هذا المقال بالتفصيل سبب ذلك، والقرارات التقنية التي تجعل صوت Sora 2 Pro مقنعًا إلى هذا الحد، وكيف يقارن بأفضل النماذج القادرة على توليد الصوت في السوق. كما يشرح خطوات استخدامه على PicassoIA للاستفادة القصوى من الصورة والصوت معًا.
ما المقصود بالصوت الأصلي فعلًا؟
قبل مقارنة النماذج، من المفيد توضيح معنى "الصوت الأصلي" ولماذا هو أصعب مما يبدو.
إنه ليس طبقة معالجة لاحقة
عملت معظم نماذج الفيديو الأولى القادرة على توليد الصوت بتوليد الفيديو أولًا، ثم تشغيل نموذج صوت منفصل يحلل الإطارات ويضيف الصوت. والمشكلة واضحة في الممارسة: نظام الصوت لا يعرف ما قصده نموذج الفيديو. فهو يرى شفتي رجل تتحركان ويضيف كلامًا، لكن التوقيت يتأخر نصف ثانية، وصوت الغرفة لا يتطابق مع البيئة البصرية للمشهد.
يعني الصوت الأصلي أن الصوت يُولَّد ضمن التمرير الأمامي نفسه الذي يُولَّد فيه الفيديو. يملك النموذج سياقًا زمنيًا ومكانيًا عمّا يجري بصريًا أثناء تحديده ما يجب أن يكون عليه الصوت. في Sora 2 Pro لا تُعد هذه الميزة إضافة مُلحقة، بل هي مدمجة في البنية من الأساس.
ما بعد مزامنة الشفاه
عندما يسمع الناس عبارة "الصوت في فيديو الذكاء الاصطناعي"، يفكرون غالبًا في مزامنة الشفاه: هل يتطابق الفم مع الكلمات؟ هذا أسهل معيار يمكن تجاوزه، وتجتازه معظم النماذج الحالية بشكل مقبول. أما المشكلة الأصعب فهي كل ما عدا ذلك.
فكّر في مشهد داخل حمام مبلّط: هناك صدى، والرنين الخفيف للأسطح الصلبة، وكل خطوة لها بصمة صوتية محددة. أو مشهد في غابة: زقزقة الطيور تأتي من اتجاه يتوافق مع مكان ظهور الطيور في الإطار، والهدير المنخفض للرياح بين أغصان الأشجار. يتعامل Sora 2 Pro مع هذه الإشارات الصوتية البيئية بتماسك لم تحاوله النماذج السابقة أصلًا.
ملاحظة: هذا ما يفصل الصوت الجيد عن الصوت الرائع في فيديو الذكاء الاصطناعي. ليس مزامنة الشفاه، بل الاستدلال المكاني والبيئي وراء كل طبقة صوتية.
أصوات محيطة تتنفس
من أكثر ما يلفت الانتباه في مخرجات Sora 2 Pro أن طبقة الصوت المحيط تتسم بسلوك ديناميكي. مشهد الحشود لا يحتوي على ضجيج جمهور مكرر وثابت. تتغير شدة الصوت وكثافته مع بُعد الكاميرا وكثافة الحشد في الإطار. تتشقق النار بتنويعات تتزامن مع الشدة البصرية للهب. ويصبح صوت المطر أثقل حين يُظهر الإطار هطولًا أغزر.
هذا ليس سحرًا. إنه نتيجة التدريب على كميات هائلة من بيانات الفيديو والصوت المقترنة، حيث احتاج النموذج إلى تعلّم العلاقة بين الصورة والصوت عبر آلاف السيناريوهات الواقعية.

الميزة التقنية وراء صوت Sora 2 Pro
التدريب المشترك على بيانات الصورة والصوت
أهم قرار معماري في نظام الصوت لدى Sora 2 Pro هو أن رموز الصورة والصوت تُدرَّب معًا، لا بالتتابع. لا يتعلم النموذج توليد الفيديو، ثم يتوقف، ثم يتعلم توليد الصوت. بل يتعلم العلاقة بينهما في آن واحد.
يكتسب هذا الأمر أهمية لأن تماسك الصوت في العالم الحقيقي مرتبط ارتباطًا وثيقًا بالسياق البصري. يتغير صوت الخطوات تبعًا لمادة الأرضية الظاهرة في الإطار. ويتغير الطابع الصوتي للمكان تبعًا لهندسة المكان ومواده الظاهرة في المشهد. يستطيع النموذج المدرَّب بشكل مشترك أن يتعلم هذه العلاقات من الملاحظة المباشرة. أما النموذج المدرَّب بالتتابع فعليه أن يخمّنها من استدلال غير مباشر.
محاكاة الفولي في الوقت الفعلي
الفولي هو فن إنشاء مؤثرات صوتية محددة لأفعال محددة: صرير سترة جلدية، وطقطقة كعب على الرخام، وخشخشة ورقة رسالة تُفتح. في السينما التقليدية، يقضي فنانو الفولي ساعات في أداء هذه الأصوات متزامنةً مع الصورة. يحاكي Sora 2 Pro توليد الفولي بشكل إجرائي.
يعني هذا أنك حين تطلب منه توليد مشهد لشخص يكتب على لوحة مفاتيح، لا تحصل على صوت كتابة عام. يحمل صوت الكتابة طابع نوع لوحة المفاتيح المحدد الظاهر في الإطار (ميكانيكية مقابل غشائية)، ويؤثر الطابع الصوتي للغرفة في ذيل الصدى لصوت الكتابة، ويتطابق إيقاع الصوت وسرعته مع الإيقاع البصري لحركات الأصابع.

الصوت المكاني وإدراك العمق
يُخرج Sora 2 Pro صوتًا ستيريو مع معلومات مكانية مُشفّرة فيه. تُصدر الأجسام الموجودة على يسار الإطار صوتًا يظهر في القناة اليسرى بشكل رئيسي. وتتغير شدة الأجسام المتحركة نحو الكاميرا أو بعيدًا عنها بطريقة تحاكي المسافة الصوتية. يمنح هذا المخرجات جودةً ثلاثية الأبعاد يفتقر إليها توليد الصوت الأحادي المسطح تمامًا.
يظهر هذا بوضوح خاص في المشاهد التي تضم عدة مصادر صوتية: فالحوار بين شخصين ينتج أصواتًا متباعدة مكانيًا في المجال الصوتي، تطابق مواضعهما البصرية في الإطار. إنه تأثير دقيق، لكنه الفارق بين صوت يبدو موضوعًا بعناية في المشهد وصوت يبدو مُسقطًا عليه من مكتبة جاهزة.
جودة الكلام وطبيعيته
عندما يولّد Sora 2 Pro الكلام، فإنه يتجاوز مجرد الوضوح. يركّب النموذج كلامًا يتضمن الاضطرابات الطبيعية والتشوهات الصوتية للكلام البشري الحقيقي: أنفاس خفيفة بين العبارات، وتغيّر طفيف في جودة الصوت حين يدير المتحدث وجهه عن الكاميرا، وضغط جودة الصوت في المكالمة الهاتفية حين يُظهر المشهد شخصًا يستخدم هاتفه.
هذه تفاصيل يلاحظها المشاهدون البشر بشكل لاواعٍ. حين تغيب، يبدو الصوت مصطنعًا. وحين تكون حاضرة، يبدو المشهد واقعيًا ببساطة.
مقارنة المشهد
تقدّم عدة نماذج اليوم توليد الصوت الأصلي. إليك كيف تقارن بنموذج Sora 2 Pro عبر الفئات الأكثر أهمية للمخرجات الاحترافية.
Veo 3 مقابل صوت Sora 2 Pro
كان Veo 3 من Google من أوائل النماذج التي تحدّت المجال حقًا في الصوت الأصلي، ولا يزال أقرب منافس لنموذج Sora 2 Pro. يتعامل Veo 3 مع الصوت المحيط والبيئي بإتقان استثنائي، خاصة في المشاهد الطبيعية. أما المجال الذي يتفوق فيه Sora 2 Pro فهو السيناريوهات الكثيفة بالحوار: تركيب الكلام لدى Sora 2 Pro أكثر طبيعيًا بقليل، ودقة مزامنة الشفاه فيه أعلى بهامش ضئيل في اللقطات المقربة وأطر البورتريه.
يضيّق Veo 3.1 وVeo 3 Fast الفجوة أكثر. تضحي النسخة Fast ببعض دقة الصوت مقابل توليد أسرع بكثير، وهو خيار يستحق النظر إليه حين تكون السرعة أهم من الدقة الصوتية.
Seedance مقابل Sora: جنبًا إلى جنب
| الميزة | Sora 2 Pro | Seedance 2.0 | Seedance 2.5 |
|---|
| الصوت الأصلي | نعم | نعم | نعم |
| الصوت المكاني | نعم | جزئي | جزئي |
| دقة الفولي | عالية | متوسطة | متوسطة إلى عالية |
| طبيعية الكلام | عالية جدًا | عالية | عالية |
| تماسك البيئة الصوتية | عالٍ جدًا | متوسط | متوسط إلى عالٍ |
| أقصى مدة للفيديو | تختلف حسب الأمر النصي | 30 ثانية | 30 ثانية |
| الدقة | حتى HD | حتى 1080p | حتى 1080p |
يُعد Seedance 2.5 الأقوى في تشكيلة Bytedance من حيث الصوت، ويوفر حدًا أقصى للمدة يبلغ 30 ثانية، وهي ميزة كبيرة للمحتوى الأطول حيث تقصّر مقاطع Sora 2 Pro القصيرة. لكن من حيث الجودة الصوتية الخام للمقاطع ذات الطول القياسي، يظل Sora 2 Pro هو المعيار.
Kling v3 في المشهد
فاجأ Kling v3 Video الناس بجودة صوته عند إطلاقه. إنه يتعامل جيدًا مع أصوات الصدمات والصوت المتزامن مع الحركة: مشاهد الأفعال التي تصطدم فيها الأجسام أو يتحرك الناس بسرعة تميل إلى أن تبدو حادة وموقوتة بشكل صحيح. أما ما يتراجع فيه أمام Sora 2 Pro فهو الطبقات المحيطة الأدق. صوت الخلفية لدى Kling v3 مقنع، لكنه أقل استجابة ديناميكية لما يحدث فعليًا في الإطار لحظة بلحظة.

نماذج أخرى تستحق المعرفة
- Flux 3: توليد صوت متزامن مع تماسك بصري قوي. أفضل للمحتوى الذي تغلب عليه الموسيقى من مشاهد الحوار الكثيفة.
- Wan 2.2 S2V: متخصص في الصوت المتزامن، مفيد حين تريد تحريك الرسوم المتحركة للفيديو انطلاقًا من مقطع صوتي موجود بدلًا من توليد الصوت من أمر بصري.
- Pixverse v6: صوت ذكاء اصطناعي جيد للمشاهد السينمائية. أقل دقة في الكلام لكنه قوي في الصوت المحيط الشبيه بالموسيقى التصويرية وتصميم أصوات الأفعال.
- Hailuo 02: مخرجات بصرية 1080p متينة مع صوت كفء. أنسب للسرد البصري البحت منه للبيئات الصوتية المعقدة.
- Ray 3.2: مخرجات HDR بصرية متميزة. الصوت كافٍ لكنه ليس نقطة القوة الأساسية في تصميم هذا النموذج.
أين يتألق صوت Sora 2 Pro أكثر
لا تستفيد كل حالة استخدام بالقدر نفسه من إمكانيات الصوت لدى Sora 2 Pro. إليك المواضع التي يقدم فيها أعلى أداء باستمرار.
مشاهد الطبيعة والأجواء

يظهر استدلال الصوت البيئي بوضوح أكبر في محتوى الطبيعة. يُنتج مشهد لجرف ساحلي رياحًا تتغير شدتها مع تغيّر زاوية الكاميرا بالنسبة لوجه الجرف. ويطبّق مشهد الغابة المطيرة طبقات من أصوات قطرات المطر الفردية على أوراق كبيرة، مع الصوت العميق للماء على التربة، والطقطقة متوسطة التردد على الأسطح الصخرية. لم يكن هذا المستوى من التفاصيل الصوتية متاحًا في الفيديو بالذكاء الاصطناعي قبل أن يجعله Sora 2 Pro معيارًا.
بالنسبة لصنّاع المحتوى الذين يعدّون محتوى السفر أو الأفلام الوثائقية عن الطبيعة أو محتوى الفيديو الصوتي المحيط، هذا هو أقوى سبب لاختيار Sora 2 Pro على منافسيه. الصوت ليس موجودًا فحسب، بل حاضر بشكل مقنع.
الكلام البشري والحوار

بالنسبة لأي مشهد يتضمن كلامًا بشريًا، ينتج تركيب Sora 2 Pro حوارًا بإيقاع طبيعي. يولّد النموذج ما يبدو كمحادثة حقيقية لا كلام مُصطنع: سرعة مناسبة، وأنماط تنفس طبيعية، وتنويعات صوتية طفيفة حين يكون المتحدثون متحمسين عاطفيًا مقارنة بحين يلقون شرحًا محايدًا.
يجعل هذا النموذج قويًا بشكل خاص للمحتوى السردي والفيديو التجاري والشروحات التعليمية والمحتوى الاجتماعي الذي يكون فيه الحوار الوسيلة الأساسية للتواصل. ودقة مزامنة الشفاه في أطر البورتريه واللقطات المقربة تُعد باستمرار من بين الأعلى بين جميع النماذج المتاحة حاليًا.
أصوات الأفعال والصدمات
حين تصطدم الأجسام أو تنكسر أو تسقط أو تضرب بعضها في توليد من Sora 2 Pro، تطابق أصوات الصدمات الثقل البصري للأجسام المعنية. يختلف الطابع الصوتي لكوب سيراميك يسقط عن طابع مقلاة معدنية تضرب الأرضية نفسها. ويختلف الصدى لباب خشبي يُغلق بقوة في ممر إسمنتي عنه للباب نفسه في غرفة أرضيتها خشبية. هذه الفروق هي ما يمنح مشاهد الأفعال مصداقيتها الفيزيائية، ويتعامل Sora 2 Pro معها بدقة تبدو مقصودة لا عرضية.
نصيحة: للحصول على أفضل النتائج في مشاهد الأصوات الحركية، كن محددًا في أمرك النصي بشأن المواد المعنية. "كوب سيراميك يسقط من سطح رخامي" سينتج نتائج أدق صوتيًا من "كوب يسقط من على الطاولة".

كيفية استخدام Sora 2 Pro على PicassoIA
يستضيف PicassoIA Sora 2 Pro مباشرة إلى جانب Sora 2، النسخة القياسية من النموذج. تُعد النسخة القياسية نقطة بداية جيدة لاختبار الأوامر النصية والتحقق من سلوك الصوت قبل الالتزام بمخرجات مستوى Pro.
كتابة الأوامر النصية التي تطلق صوتًا رائعًا
أهم ما يجب معرفته: يولّد Sora 2 Pro الصوت بناءً على ما تصفه. إذا لم يذكر أمرك النصي شيئًا عن البيئة الصوتية، يستنتج النموذج أفضل تقدير من السياق البصري، وغالبًا ما يكون التقدير جيدًا. لكن حين تتضمن أمرك النصي تفاصيل صوتية صراحةً، تكون النتائج أقوى باستمرار.
تشمل الأوامر النصية الفعّالة الموجهة للصوت ما يلي:
- تفاصيل البيئة الصوتية: "في كاتدرائية حجرية كبيرة ذات أسقف عالية"، "في مكتب صغير مفروش بالسجاد"، "في الهواء الطلق على جرف ساحلي عاصف"
- مصادر صوتية محددة: "صوت المطر على سقف معدني"، "خطوات على حصى متناثر"، "حشد يتمتم من بعيد خلف الشخص"
- النبرة الصوتية العاطفية: "هادئ وتأملي مع صوت الغرفة المحيط فقط"، "صمت متوتر تقطعه همهمة منخفضة للبنية"، "حيوي مع ضجيج الحشود وطبقات المرور"
تجنّب الصفات الفضفاضة مثل "صوت رائع" أو "صوت واقعي". يتعامل النموذج مع الواقعية بشكل افتراضي. ما يستفيد منه فعلًا هو السياق المحدد عن المكان والمواد والقصة الصوتية للمشهد.
نصائح للحصول على أفضل صوت
1. حدد أسطح المواد بوضوح. إذا تضمن المشهد خطوات، فحدد مادة الأرضية. وإذا تضمن أصواتًا بشرية، فحدد حجم المكان وطابعه. يستخدم النموذج هذه الإشارات لاستنتاج الفيزياء الصوتية الصحيحة للمشهد.
2. استخدم LTX 2 Pro للحصول على صور 4K حين يكون الصوت ثانويًا. ينتج LTX 2 Pro فيديو 4K متميزًا بسرعة عالية، لكن طبقة الصوت لديه أخف من طبقة Sora 2 Pro. بالنسبة للمحتوى البصري البحت الذي ستضيف إليه صوتك الخاص في ما بعد الإنتاج، فهو الخيار الأفضل من حيث منحنى التكلفة مقابل الجودة.
3. فكّر في Audio to Video للمحتوى المدفوع بالموسيقى. حين تريد أن يتحرك الفيديو استجابةً لمقطع صوتي موجود، صُمم نموذج Audio to Video المخصص على PicassoIA لهذا السير العمل تحديدًا. وهو يعكس ترتيب التوليد المعتاد تمامًا.
4. كرر تحسين الأوامر النصية قبل التوليدات الطويلة. يولّد Sora 2 Pro بتكلفة حوسبة أعلى من النماذج الأخف. اختبر أمرك النصي بمدة أقصر أولًا للتحقق من أن الصوت يتصرف كما تتوقع، قبل توليد مقطع كامل الطول.
5. ادمج مع رفع الدقة عند الحاجة. إذا كانت مادتك الأصلية ذات دقة منخفضة، يمكن لأدوات رفع الدقة في PicassoIA أن ترفع دقة المخرجات البصرية دون التأثير في طبقة الصوت، فتحصل على جودة صوت Sora 2 Pro والدقة البصرية التي تحتاجها معًا.

ماذا يعني هذا لصنّاع المحتوى
يغيّر جودة الصوت لدى Sora 2 Pro سير العمل لفئة محددة من صنّاع المحتوى: الأشخاص الذين كانوا يستخدمون فيديو الذكاء الاصطناعي لإنتاج مسودات خام، ثم يقضون وقتًا ومالًا في إضافة الصوت بأداة مخصصة لاحقًا.
بالنسبة لمحتوى الحديث أمام الكاميرا على وسائل التواصل، والفيديوهات التعريفية التجارية، ومقاطع السفر القصيرة، والأفلام السردية القصيرة، والحلقات الصوتية المحيطة المتكررة، يمكن لنموذج Sora 2 Pro الآن إنتاج محتوى جاهز للنشر فعلًا من توليد واحد. وهذا ضغط لسير العمل كان مستحيلًا قبل اثني عشر شهرًا.
والنتيجة المترتبة على ذلك أنه يرفع سقف ما يعنيه "فيديو ذكاء اصطناعي جيد". حين يبدأ المشاهدون بتوقع صوت متزامن ومتماسك مكانيًا من فيديو الذكاء الاصطناعي، سيبدو النموذج الذي ينتج مخرجات بصرية مبهرة لكنها صوتيًا باهتة قديمًا. إن جودة الصوت لدى Sora 2 Pro ليست ميزة إضافية بقدر ما هي مؤشر على الاتجاه الذي يتجه إليه الخط الأساسي للفئة بأكملها.
بالنسبة للفرق التي تنتج المحتوى على نطاق واسع، يغيّر هذا أيضًا نموذج التكلفة. كانت إضافة صوت احترافي إلى الفيديو المولَّد بالذكاء الاصطناعي تتطلب إما مصمم صوت، أو مكتبة فولي، أو وقت محرر. يخفض Sora 2 Pro ذلك إلى الصفر في نسبة كبيرة من حالات الاستخدام، ويتراكم التوفير بشكل كبير عند الإنتاج الضخم.


ابدأ بإنشاء فيديوهاتك الخاصة مع PicassoIA
أفضل طريقة لفهم كيف يبدو صوت Sora 2 Pro فعليًا هي أن تولّد شيئًا بنفسك. يتيح لك PicassoIA الوصول المباشر إلى Sora 2 Pro وSora 2 إلى جانب مجموعة كاملة من النماذج القادرة على توليد الصوت، ومنها Veo 3 وSeedance 2.5 وKling v3 Video وPixverse v6.
جرّب مشهد طبيعة بتفاصيل بيئة صوتية دقيقة في أمرك النصي. جرّب مشهد حوار في نوع محدد من الغرف. جرّب تسلسل فعل مع أوصاف مادية صريحة. سيتضح الفرق بين Sora 2 Pro والنماذج التي تولّد الصوت كفكرة لاحقة فورًا عند أول تشغيل.
يقدّم PicassoIA أيضًا أكثر من 87 نموذجًا لتحويل النص إلى فيديو عبر مجموعة واسعة من التخصصات. وحين تجد الجودة السمعية البصرية التي تبحث عنها مع Sora 2 Pro، يمكنك استخدام المنصة لتوسيع نطاق الإنتاج: أدوات تحرير الفيديو والتحسين ومزامنة الشفاه والمؤثرات متاحة كلها إلى جانب نماذج التوليد.
يمكنك الاطلاع على الكتالوج الكامل للنماذج على picassoia.com/en/all-models.