الصوت الأصلي في Sora 2 Pro يغيّر كل شيء في إنشاء الفيديو بالذكاء الاصطناعي

يُنتج Sora 2 Pro من OpenAI الآن صوتًا أصليًا متزامنًا مع كل مقطع فيديو يولّده، ليسد أكبر فجوة في إنشاء الفيديو بالذكاء الاصطناعي. يشرح هذا المقال كيف يعمل نظام الصوت من الداخل، وكيف يقارن بنماذج منافسة مثل Veo 3 وSeedance 2.0، وكيف يمكن للمبدعين الاستفادة منه الآن على PicassoIA.

الصوت الأصلي في Sora 2 Pro يغيّر كل شيء في إنشاء الفيديو بالذكاء الاصطناعي
Cristian Da Conceicao
مؤسس Picasso IA

أول مرة أنشأ فيها معظم الناس فيديو بالذكاء الاصطناعي دون الحاجة إلى إضافة صوت لاحقًا، حدث شيء ما. الصوت الأصلي في Sora 2 Pro هو تلك اللحظة: إنجاز تقني يبدو كتحسين في سير العمل، إذ يزيل بهدوء الاحتكاك الذي جعل فيديو الذكاء الاصطناعي لا يبدو منتجًا نهائيًا. لم يعد هناك داعٍ لتصدير مقطع صامت، ونقله إلى DAW، والبحث عن مقاطع صوتية خالية من حقوق الملكية، والأمل في أن يظل التزامن سليمًا. الصوت موجود ببساطة، يُولَّد بالتوازي مع المحتوى المرئي، ومتزامنًا مع ما يحدث على الشاشة.

هذا التحول أكبر مما يبدو.

مهندس صوت يدرس موجات الصوت على شاشة في استوديو خافت الإضاءة، مع توهج كهرماني من الشاشة، 85mm f/1.4، حبيبات فيلم Kodak Portra 400

ماذا تعني "الصوت الأصلي" فعلًا؟

الصمت لم يكن مجانيًا قط

ظلّت مولّدات فيديو الذكاء الاصطناعي تنتج مقاطع صامتة لسنوات. وكان لهذا الصمت ثمن خفي. كان كل فيديو يحتاج إلى مرور ثانٍ: مؤثرات صوتية تُجلب أو تُولَّد بشكل منفصل، وموسيقى تُختار وتُقص، وخلفيات صوتية تُضاف لملء الفراغات، وكل ذلك يُزامَن يدويًا. بالنسبة إلى محتوى التواصل الاجتماعي القصير، قد يستغرق هذا ساعة. أما للمقاطع الأطول أو الدفعات الكبيرة، فكان يتراكم بسرعة.

الافتراض المترسخ في معظم سير العمل الإنتاجي هو أن الصورة والصوت مشكلتان منفصلتان تتطلبان مسارين منفصلين. Sora 2 Pro يرفض هذا الافتراض على مستوى البنية.

كيف يولّد Sora 2 Pro الصوت

الصوت الأصلي في هذا السياق يعني أن النموذج يولّد الصوت كجزء من تمرير تشغيل النموذج نفسه الذي ينتج إطارات الفيديو. الصوت ليس فكرة لاحقة تُلصق من مكتبة، ولا يُنتَج بواسطة نموذج ثانوي يقرأ الفيديو النهائي كمدخل. بل ينبثق من إشارات التكييف نفسها: الأمر النصي، وأي صور مرجعية، والتمثيل الزمني الداخلي لما يحدث إطارًا تلو الآخر.

النتيجة هي المحاذاة السببية. عندما يُغلق باب في الفيديو عند الإطار 47، يظهر صوت الارتطام في الصوت في اللحظة نفسها تمامًا. وعندما يتدفق الماء فوق الصخور، يتطابق طيف الصوت المولَّد مع الحجم والسرعة اللذين توحي بهما الحركة المرئية. هذا ليس تقريبًا. إنه تزامن متأصل في طريقة معالجة النموذج للزمن.

💡 ماذا يعني هذا عمليًا: تكتب أمرًا نصيًا، فتحصل على مقطع جاهز مع صوت مطابق. وغالبًا ما يمكن نشر هذا المقطع مباشرة دون أي خطوة معالجة صوتية لاحقة.

البنية التقنية وراء الصوت

لقطة علوية لمحطة عمل احترافية لتحرير الفيديو، بشاشتين تعرضان خطوط زمنية وموجات صوتية، مكتب من خشب الجوز، ضوء صباحي، Kodak Portra 400

التكييف متعدد الوسائط

تتعامل البنية مع إطارات الفيديو ومخططات الطيف الصوتي على أنهما وجهان لحدث واحد. أثناء التدريب، يرى النموذج بيانات فيديو وصوت مقترنة ويتعلم فضاءً كامنًا مشتركًا تتطور فيه الحركة البصرية والنسيج الصوتي معًا. وفي وقت الاستدلال، يفكّ النموذج الشيفرة عن التدفقين معًا من ذلك التمثيل المشترك.

وهذا انحراف مهم عن النماذج التي تولّد الفيديو أولًا، ثم تطبّق مرحلة منفصلة لوصف الصوت أو توليفه. يظهر الفرق في الجودة بوضوح أكبر في الأحداث العابرة: وقع الخطوات، والصدمات، والتفاعلات مع الأشياء، والمحتوى القريب من الكلام. النموذج الذي يولّد الصوت من مقطع فيديو جاهز قد يصف ما حدث، لكن النموذج الذي يولّد الاثنين معًا يستطيع إنتاج إحساس الحدث وهو يتكشّف.

المحاذاة الزمنية: من الصوت إلى الإطار

المحاذاة الزمنية هي أصعب جزء في أي نظام لتوليد الصوت والصورة. الإدراك البشري حساس جدًا لأخطاء التزامن بين الصوت والصورة. تُظهر الدراسات أن المشاهدين يلاحظون تأخّر الصوت عند نحو 45 إلى 75 ميلي ثانية، وتقدّمه عند نحو 125 ميلي ثانية. وما يتجاوز هذه العتبات يبدو "غير صحيح" للمشاهد حتى لو لم يستطع أن يحدد السبب.

يعالج Sora 2 Pro هذا على مستوى النموذج، لا عبر خوارزميات محاذاة لاحقة. فتمثيلات الزمن للتدفقين مرتبطة على مستوى البنية، ما يعني أن النموذج لا يستطيع إنتاج صوت يصل قبل مُحفّزه البصري أو بعده بقدر كبير دون أن يتكبد خسارة في التدريب. والنتيجة العملية هي تزامن بين الصوت والصورة بجودة قريبة من جودة البث، دون أي تصحيح يدوي.

المحيطي مقابل المؤثرات الصوتية مقابل الموسيقى

ليست كل الأصوات متساوية في مدى استفادتها من التوليد الأصلي. إليك كيف تتوزع الأنواع الثلاثة الرئيسية:

نوع الصوتأداء Sora 2 Proهل ما تزال البدائل اليدوية مفيدة؟
المحيطي / صوت الغرفةممتازنادرًا
المؤثرات الصوتية (الأجسام وضربات الخطى)جيد جدًاللعمل الدقيق
الحوار / الكلامجيد (غير محدد)للكلام المكتوب سلفًا
الموسيقى المؤلفةمحدودللتأليف الموسيقي

النقطة المثالية هي المشهد الصوتي المحيطي وصوت الأحداث بأسلوب المؤثرات الصوتية. أما المحتوى الذي يحتاج إلى موسيقى تصويرية مؤلفة أو كلمات أغنية محددة، فما يزال أداة صوت مخصصة منطقية. لكن بالنسبة إلى غالبية محتوى الفيديو الاجتماعي والتحريري والإعلاني، يغطي الصوت الأصلي المساحة المطلوبة.

كيف يقارن بالنماذج المنافسة

صانع أفلام في استوديو تصوير تجاري بإضاءة Fresnel تنغستن، وفريق يضبط ميكروفون الذراع، 50mm f/2.8، Kodak Portra 800

جودة الصوت: Veo 3 مقابل Sora 2 Pro

كان Veo 3 من Google أحد أوائل النماذج المتاحة على نطاق واسع التي جاءت بصوت أصلي، ووضع معيارًا مبكرًا لهذه الفئة. يتفوق Veo 3 في المشاهد الصوتية الطبيعية والأجواء السينمائية. ويُعد توليد حواراته من أقوى النماذج في هذا المجال للصوت الحواري غير المكتوب مسبقًا.

يتميز Sora 2 Pro في الصوت المرتبط بالاصطدامات الحركية، وفي جودة الحركة البصرية نفسها أولًا. فاستجابة المؤثرات الصوتية للأشخاص والأجسام سريعة الحركة أدق، والجودة البصرية الشاملة تعني أن الصوت لديه تفاصيل أكثر ليستجيب لها. فكّر في الأمر هكذا: الصورة الأفضل تمنح توليد الصوت مادة أغنى للعمل بها.

يضيّق Veo 3.1 الفجوة أكثر لصالح Google في أنواع محتوى معينة، لا سيما المشاهد الطبيعية الخارجية ومشاهد الحشود. وكلا النموذجين في المقدمة لتوليد فيديو بصوت أصلي بجودة الإنتاج.

Seedance 2.0 ونهج ByteDance

يتخذ نموذج ByteDance، Seedance 2.0، زاوية مختلفة. فبدلًا من محاولة تغطية الطيف الكامل من المحيطي والمؤثرات والموسيقى، يركز Seedance 2.0 على الصوت البيئي النقي والمؤثرات الصوتية المتوافقة مع الحركة، مع توليد بزمن استجابة منخفض جدًا. والنتيجة نموذج أسرع في التوليد وموثوق للغاية في جبهة تزامن الصوت، لكنه أضيق في التشكيلة الصوتية.

يذهب Seedance 2.0 Mini أبعد من ذلك في السرعة، ما يجعله خيارًا قويًا عندما تنتج كميات كبيرة من المحتوى القصير وتحتاج إلى مخرجات متزامنة مع الصوت على نطاق واسع دون انتظار تشغيل نماذج أبطأ.

تزامن الصوت في Wan 2.2 S2V

يقلب Wan 2.2 S2V (Sound-to-Video) النموذج رأسًا على عقب: تزوّده بمدخل صوتي، فيولّد فيديو يطابقه. وهذا عكس نهج Sora 2 Pro تمامًا، لكن يمكن الجمع بين الاثنين في سير عمل واحد. ولّد أولًا فيديو متزامنًا مع الصوت عبر Sora 2 Pro، ثم استخدم Wan 2.2 S2V لتمديد مقاطع محددة أو إعادة تصميمها مع اتخاذ الصوت إشارة توجيه.

بالنسبة إلى النماذج ذات الصوت المدمج على PicassoIA، تشمل القائمة أيضًا Flux 3 وPixverse v6 وQ3 Turbo، وكل منها يأتي مع توليد صوت مدمج بمستويات جودة متفاوتة.

محترفان إبداعيان جنبًا إلى جنب عند محطتي عمل يقارنان مخرجات الفيديو وهما يرتديان سماعات الرأس، ضوء نهاري طبيعي، ألوان Fujifilm Provia

حالات استخدام واقعية تغيّرت

صنّاع المحتوى القصير

قبل الصوت الأصلي، كان صانع المحتوى القصير الذي ينتج محتوى يوميًا يواجه مهمة متكررة لتجميع الصوت لكل فيديو. فترخيص الموسيقى من المكتبات، والبحث عن المؤثرات الصوتية، وضبط التزامن كانت تستهلك وقتًا كبيرًا. ومع Sora 2 Pro، يطلب صانع المحتوى مقطعًا لنمط الحياة أو لقطة لمنتج، فيحصل على فيديو مسموع بالكامل ومتزامن وجاهز للاستخدام.

تتراكم ميزة السرعة. فصانع المحتوى الذي ينتج 10 مقاطع يوميًا يوفّر نحو 10 إلى 20 دقيقة لكل مقطع في العمل الصوتي وحده. وخلال شهر، تكون هذه ساعات استُعيدت للقرارات الإبداعية الفعلية بدلًا من التجميع التقني.

💡 نصيحة: في المحتوى القصير، اكتب إشارات صوتية صراحةً في أمر الفيديو النصي. عبارات مثل "أمواج تتكسر في الخلفية" أو "أجواء مقهى مزدحم" تؤثر مباشرة في توليد الصوت إلى جانب المخرجات المرئية.

صانع محتوى شاب في استوديو منزلي صغير يسجّل نفسه أمام كاميرا وشاشة، 50mm f/2.5، Kodak Portra 400

المعاينة المسبقة للأفلام ولوحات القصص

ظلت المعاينات المسبقة دائمًا عروضًا صامتة. تبني المسودة الخام، وتضيف موسيقى مؤقتة، وتأمل أن يتمكن فريق الإنتاج من تجاوز فراغ الصوت لتقييم الإيقاع. يغيّر توليد الصوت الأصلي ما تنقله المعاينة المسبقة. يستطيع المخرج الآن عرض معاينة مولّدة بالذكاء الاصطناعي يتردّد فيها وقع الخطوات في المكان الصحيح، وتُغلق الأبواب بثقل مناسب، ويحدد الصوت المحيطي النبرة العاطفية لكل مشهد.

هذه ليست أداة لما بعد الإنتاج. إنها أداة لعرض الفكرة والتخطيط، وهي تقصّر المسافة بين المفهوم والموافقات بشكل ملحوظ.

رسام لوحات قصص عند طاولة رسم مائلة في وقت متأخر من الليل، ضوء مصباح مكتبي دافئ، لوحات قصص مبعثرة، 35mm f/4، حبيبات Kodak Tri-X

إعلانات التواصل الاجتماعي وفيديو المنتجات

يُشغَّل فيديو الإعلانات على منصات التواصل تلقائيًا. يصادف المشاهدون المحتوى أثناء التمرير وهواتفهم غير مكتومة، وأول نصف ثانية من الصوت تعمل كمرشّح: إما أن تواصل المشاهدة أو تواصل التمرير. فالفيديو الذي يفتتح بصوت محيطي مناسب، أو صدمة منتج، أو لحظة بصوت حواري، يجذب الانتباه بشكل مختلف عن مقطع صامت ينتظر أن يُنقر عليه.

يدعم Grok Imagine Video 1.5 وHailuo 02 أيضًا الصوت الأصلي، مما يمنح المعلنين خيارات نماذج أكثر بحسب الأسلوب البصري الذي تتطلبه الحملة.

مختص تسويق عند مكتب واقف يراجع المحتوى على شاشة كبيرة، ضوء نهاري طبيعي عبر نوافذ ممتدة من الأرض إلى السقف، ألوان Fujifilm 400H

كيفية استخدام Sora 2 Pro على PicassoIA

يجعل PicassoIA Sora 2 Pro متاحًا دون الحاجة إلى مفاتيح API أو إعداد بطاقة ائتمان على مستوى النموذج. سير العمل بسيط.

خطوة بخطوة

  1. افتح صفحة النموذج: انتقل إلى Sora 2 Pro على PicassoIA.
  2. اكتب أمرك النصي: صف المشهد بدقة. ضمّن البيئة، وفعل الشخص، وجودة الإضاءة، وأي إشارات صوتية تريد أن تؤثر في توليد الصوت.
  3. حدد الدقة: اختر دقة الإخراج. للمحتوى الجاهز للإنتاج، اختر أعلى خيار متاح.
  4. وَلِّد: أرسل الأمر النصي. زمن تشغيل النموذج في Sora 2 Pro أطول من النماذج الأخف، لكن جودة المخرجات تبرر الانتظار.
  5. راجع تزامن الصوت: شغّل المقطع المولَّد مع الصوت قبل التنزيل. وتحقّق من لحظات الحركة السريعة بحثًا عن محاذاة الصوت.
  6. نزّل وانشر: المقطع جاهز للاستخدام المباشر. لا حاجة إلى خطوة صوتية ثانية.

نصائح لنتائج صوتية أفضل

  • سمِّ الأصوات في أمرك النصي: "طقطقة نار المدفأة"، "المطر على الزجاج"، "ضجيج مرور المدينة من بعيد" إشارات تكييف فعّالة.
  • صف الفضاء الصوتي: "في كاتدرائية كبيرة ذات صدى" أو "في غرفة تسجيل صغيرة وجافة" تشكّل استجابة الغرفة للصوت المولَّد.
  • وازن الحركة البصرية مع توقعات الصوت: الأمر الذي يصف عاصفة عنيفة لكنه يُظهر بحيرة هادئة سيولّد صوتًا متضاربًا. اجعلهما متسقين.
  • مقاطع أقصر لدقة التزامن: مقاطع من 5 إلى 10 ثوانٍ تمنح النموذج النافذة الأنظف لتزامن دقيق. المقاطع الأطول تُدخل متغيرات أكثر.

💡 يستحق التجربة أيضًا: Veo 3 وSeedance 2.0 لأساليب بصرية مختلفة، وكلاهما بصوت أصلي. غالبًا ما تكشف المقارنات الجنبية أي نموذج يناسب نوع محتواك بشكل أفضل.

لقطة مقربة لميكروفون استوديو مع موجات صوتية ضبابية في الخلفية، ضوء نافذة بعد الظهر الدافئ، 135mm f/2.0، حبيبات Kodak Portra 400

نماذج PicassoIA الأخرى ذات الصوت المدمج

Sora 2 Pro هو النموذج الرئيسي، لكنه ليس النموذج الوحيد على PicassoIA الذي ينتج فيديو متزامنًا مع الصوت. إذا دفعتك الميزانية أو السرعة أو الأسلوب البصري نحو اتجاه آخر، فهذه النماذج تستحق المعرفة.

أفضل النماذج لفيديو متزامن مع الصوت

النموذجنوع الصوتالأفضل لـالسرعة
Sora 2 Proصوت أصلي كاملالفيديو عالي الإنتاجأبطأ
Veo 3صوت أصلي + حوارسينمائي، خارجيمتوسطة
Seedance 2.0صوت بيئيقصير، اجتماعيسريع
Flux 3صوت متزامنفني، مُنمَّطمتوسطة
Pixverse v6صوت بالذكاء الاصطناعيإعلان سينمائيسريع
Q3 Turboصوت مدمج1080p، أعمال الدفعاتسريع
Grok Imagine Video 1.5صوت أصليتحويل الصورة إلى فيديومتوسطة

بالنسبة إلى سير العمل الذي تريد فيه توجيه الفيديو بملف صوتي بدلًا من أمر نصي، يعكس Audio to Video من Lightricks التدفق كليًا: زوّده بملف صوت، فيولّد رسومًا متحركة متزامنة. ويكمل LTX 2 Pro وKling v3 Video الخيارات عالية الدقة للمبدعين الذين يحتاجون إلى مخرجات 4K مع دقة حركة قوية، رغم أن تطبيقاتهما الصوتية أضيق من تطبيق Sora 2 Pro.

ما الذي يأتي بعد الصوت الأصلي

حاسوب محمول في مقهى يعرض منصة توليد فيديو في المتصفح، ضوء مقهى بعد الظهر الدافئ، 50mm f/2.0، حبيبات Kodak Portra 400

الصوت الأصلي ليس النهاية. إنه الأساس الذي تبني عليه الجولة التالية من المنافسة. الأسئلة المفتوحة الآن تدور حول التحكم: هل يمكنك تحديد سرعة BPM الدقيقة للموسيقى الخلفية؟ هل يمكنك تزويد مقطع صوتي مرجعي وطلب من النموذج مطابقة طاقته؟ هل يمكنك توليد صوت لمنطقة واحدة فقط من الإطار مع إبقاء منطقة أخرى صامتة؟

هذه مشكلات قابلة للحل. تعمل عدة مجموعات بحثية بالفعل على توليد الصوت المدرك للفضاء، حيث يتوافق المجال الصوتي مع هندسة المشهد ثلاثية الأبعاد، لا مع المحتوى البصري الإجمالي فقط. نموذج يعرف أن مصدر الصوت على الجانب الأيسر من الإطار ويتحرك نحو اليمين يستطيع توزيع الصوت بين القناتين بشكل مناسب دون أي تعليمات من المستخدم.

يتجه مسار فيديو الذكاء الاصطناعي نحو محتوى سمعي بصري مُؤلَّف بالكامل، ومتزامن بالكامل، وقابل للتحكم بالكامل، يُولَّد من النص وحده. ويمثّل Sora 2 Pro خطوة مهمة على هذا المسار. سير عمل تجميع الصوت اليدوي لفيديو الذكاء الاصطناعي لم يختفِ بعد، لكن أيامه باتت معدودة بوضوح.

النماذج التي كانت تتطلب ساعات من العمل الصوتي بعد الإنتاج تسلّمك الآن مقطعًا نهائيًا جاهزًا للبث في دقائق. هذا ما يغيّره الصوت الأصلي في Sora 2 Pro فعلًا: ليس جودة الصوت فحسب، بل شكل يوم الإنتاج بأكمله.

ابدأ إنشاء فيديو متزامن مع الصوت الآن

أفضل طريقة لفهم ما يفعله الصوت الأصلي بسير عملك هي تجربته على أمر نصي كنت ستكافح عادةً لإيجاد صوت له. سوق مزدحم في مدينة أجنبية. عاصفة رعدية فوق سهول مفتوحة. كشف منتج مع نقرة ميكانيكية مُرضية. اكتب المشهد، وولّده، واستمع إليه.

يستضيف PicassoIA أكثر من 87 نموذجًا لتوليد الفيديو، من بينها Sora 2 Pro وVeo 3 وSeedance 2.0 وFlux 3، وكل نموذج آخر قادر على الصوت ورد في هذا المقال. يمكنك تشغيل اختبارات جنبًا إلى جنب على الأمر النصي نفسه عبر نماذج متعددة لتجد النموذج الذي يناسب نوع محتواك. لا حاجة إلى إعداد، ولا مقاطع صامتة.

انتهى الصمت.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة