ما لا يخبرك به أحد عن صوت Veo 3.1

تكمن القوة الخفية في Veo 3.1 في صوته. يشرح هذا المقال كيف يولّد النموذج الصوت الأصلي، ويزامن الحوار، ويبني أجواء صوتية محيطة، وما الذي تحتاج إلى معرفته لتستخدمه جيدًا في مشاريع فيديو الذكاء الاصطناعي.

ما لا يخبرك به أحد عن صوت Veo 3.1
Cristian Da Conceicao
مؤسس Picasso IA

كل حديث عن Veo 3.1 يركّز على الدقة: الحواف الحادة، والملمس الواقعي كالصور الفوتوغرافية، والمخرجات بدقة 1080p التي تجعل المقاطع القصيرة تبدو وكأنها خرجت من موقع تصوير سينمائي. ما يكاد أحد يتحدث عنه هو الصوت. ليس لأنه غير مهم، بل لأن معظم الناس لا يعرفون ما الذي يفعله فعلًا.

يأتي Veo 3.1 مع توليد صوت أصلي مدمج مباشرةً في النموذج. هذا يعني أن الصوت لا يُضاف فوق الفيديو بعد انتهاء تصييره. بل يُنتَج متزامنًا مع كل إطار، من الأمر النصي نفسه الذي يقود المخرجات المرئية. نباح كلب في حديقة، وصرير ألواح خشبية في ممر هادئ، وحشد يتفاعل مع عرض حي: النموذج "يسمع" هذه المشاهد كما "يراها"، ويولّد الصوت المناسب لها.

هذا يغيّر طريقة كتابتك للأوامر النصية. ويغيّر ما يمكنك توقعه من مخرجاتك. ويغيّر أيضًا طريقة دخول الفيديو المولَّد بالذكاء الاصطناعي إلى سير العمل الإنتاجي الحقيقي. إليك ما تحتاج إلى معرفته فعلًا.

مهندس صوت يستمع أمام طاولة المزج وعلى الشاشة موجة صوتية

طبقة الصوت التي لا يذكرها أحد

ليس مجرد ضوضاء خلفية

عندما يلاحظ الناس لأول مرة أن Veo 3.1 ينتج صوتًا، يفترضون أنه مجرد تمرير صوتي محيط بسيط: هدير خلفي عام يُربط بالبيئة التي يصوّرها الفيديو. هذا الافتراض خاطئ، ويقلّل بشكل كبير من قيمة ما يفعله النموذج.

يعمل نظام الصوت في Veo 3.1 على ثلاث طبقات مختلفة على الأقل في وقت واحد: الصوت المحيط بالبيئة، والمؤثرات الصوتية الخاصة بالأجسام (ما يسميه مصممو الصوت Foley)، والكلام أو المحتوى الصوتي عندما يوحي الأمر النصي بوجود بشري. لكل من هذه الطبقات منطق توليد خاص بها. وتستجيب كل منها بشكل مختلف لطريقة صياغتك للأمر النصي.

الصوت المحيط هو الأساس. في مشهد غابة في الهواء الطلق، يعني ذلك حفيف الريح بين الأوراق، ونداءات الطيور البعيدة، والطنين المنخفض الخفيف للمساحات المفتوحة. وفي مشهد حضري، يعني ذلك ضجيج المرور، وتدفق أصوات الشارع، والخصائص الصوتية لبيئة خارجية واسعة. وفي مشهد داخلي، يعني ذلك نغمة الغرفة: ذلك الصمت الذي ليس صامتًا تمامًا، والمتشكّل بمواد الجدران وحجم الغرفة.

💡 نصيحة: إذا أردت صوتًا محيطًا أغنى، فصف البيئة الصوتية بوضوح في أمرك النصي. فعبارة "داخل كاتدرائية ذات جدران حجرية" ستنتج نغمة غرفة مختلفة بوضوح عن عبارة "مكتب حديث مفتوح المساحة".

ثلاثة أشياء يولّدها النموذج فعلًا

ينتج النموذج ثلاث فئات صوتية في معظم المخرجات الناجحة:

  • البيئة المحيطة: النسيج الخلفي المستمر للمكان، المتشكّل بخصائصه المادية
  • مؤثرات صوتية على طريقة Foley: أصوات مرتبطة بأجسام وأفعال محددة على الشاشة
  • المحتوى الصوتي: الحوار أو الكلام أو الأداء الصوتي عندما تظهر أشخاص وتُطلب منهم الكلام

الفئة الثالثة هي التي يقلّل منها معظم المبدعين. عندما يتضمن أمرك النصي شخصًا يتكلم، لا يكتفي النموذج بتوليد حركة الشفاه، بل يولّد صوتًا يرافقها. الكلام في معظم الحالات لن يكون لغة بشرية مفهومة، لكنه يحمل إيقاع الكلام وسرعته ونبرته العاطفية كما لو كان شخص يتحدث فعلًا. وهذا مفيد للقطات الثانوية (B-roll)، ونماذج العروض التقديمية، وأي مشهد يكون فيه الكلام الضمني أهم من كلمات بعينها.

ميكروفون احترافي في استوديو تسجيل مع إضاءة مسرحية درامية

كيف يولّد Veo 3.1 الصوت

مسار التحويل من النص إلى الصوت

يعتمد Veo 3.1 على بنية توليد مشتركة للفيديو والصوت. وهذا هو الجزء الذي لا يشرحه أحد بوضوح. فالنموذج لا يولّد الفيديو أولًا ثم يربط الصوت به في مرحلة ثانية. بل يولّد الفيديو والصوت معًا من التمثيل الكامن نفسه للمشهد.

عمليًا، يعني هذا أن الصوت مدرك سببيًا لمحتوى الفيديو. فعندما يتحرك شيء على الشاشة، يعرف النموذج أن الحركة حدثت، ويمكنه إنتاج حدث صوتي متزامن معها. باب يُغلق بعنف: تسمع صوت الطرقة. يد تضرب طاولة: يصل الصدم في الإطار الصحيح. هذه التزامنات ليست مثالية، لكنها أدق بكثير من أي نظام لمطابقة الصوت مع الفيديو يعمل كمعالجة لاحقة منفصلة.

دُرّب النموذج على بيانات مقترنة من الصوت والفيديو بحجم كبير. كل فيديو في مجموعة تدريبه كان يحمل صوته الأصلي، وهذا ما علّم النموذج كيف تبدو المشاهد الواقعية صوتيًا من الداخل. وهذا يختلف عن مسارات تحويل النص إلى كلام أو قواعد بيانات المؤثرات الصوتية. النموذج يمتلك فهمًا صوتيًا مستوعبًا للعالم، ويطبّقه عند توليد أي مشهد.

ماذا يعني "الصوت الأصلي" فعلًا

الصوت الأصلي يعني أن الصوت يُنتَج بواسطة النموذج نفسه الذي أنتج الفيديو. لا تُستدعى أي خدمة صوت خارجية، ولا يُستعلَم عن أي مكتبة صوتية. يولّد تشغيل النموذج الوسيطين معًا في الوقت نفسه.

هذا مهم لأسباب عدة. أولًا، يضمن التزامن على مستوى الإطار. ثانيًا، يعني أن الصوت يرث شروط الأمر النصي نفسها التي يرثها الفيديو. ثالثًا، يعني أنك لا تستطيع بسهولة استبدال الصوت وإعادة إرفاقه دون أن تفقد ذلك التزامن.

الوجه الآخر: لا يمكنك أيضًا التحكم في الصوت بشكل مستقل. إذا أردت مقطوعة موسيقية محددة، أو تعليقًا صوتيًا بلغة معينة، أو مؤثرًا صوتيًا دقيقًا، فالصوت الأصلي لن يوفّر ذلك. ما يوفّره هو بيئة صوتية متماسكة ومعقولة تطابق المشهد المرئي، ويولّدها تلقائيًا من أمرك النصي.

موجة صوتية معروضة على شاشة حاسوب محمول في استوديو منزلي

تفصيل جودة الصوت

أداء الصوت المحيط

الصوت المحيط هو المجال الذي يُظهر فيه Veo 3.1 أكثر اتساقًا. فالبيئات الطبيعية في الهواء الطلق، والشوارع الحضرية، والمساحات الداخلية تحظى جميعها بمعالجة محيطية مقنعة. ويتعامل النموذج مع الصدى وصوتيات الغرف بإتقان خاص: مقطع يدور في مبنى حجري كبير سينتج ذيول صدى أطول بوضوح من مقطع يدور في غرفة نوم مفروشة بالسجاد.

يميل توازن الترددات نحو الواقعية. هدير الترددات المنخفضة الثقيل في المشاهد التي تتضمن مركبات، وحضور واضح للترددات العالية في مشاهد النهار في الخارج، وملمس أكثر تسطحًا وتخفيفًا في المساحات الداخلية المغلقة. هذه الصفات تنشأ من بيانات التدريب، لا من قواعد نمذجة صوتية صريحة.

بالنسبة لصانعي محتوى الفيديو، يعني ذلك أن الصوت المحيط من Veo 3.1 غالبًا ما يكون قابلًا للاستخدام كنقطة بداية في سير عمل الصوت بعد الإنتاج. لن يحل محل تسجيل الصوت الميداني الاحترافي أو جلسات Foley المتخصصة، لكنه يوفّر طبقة مرجعية يمكن البناء عليها، أو تراكبها، أو استخدامها لملء اللقطات القصيرة دون البدء من الصمت.

الحوار ومزامنة الصوت

مزامنة الصوت من أكثر نقاط القوة إثارة للدهشة في النموذج. عندما يبدو شخص مرئي في الفيديو وكأنه يتحدث، يتضمن الصوت أصواتًا تطابق حركة فمه تقريبًا. الإيقاع يتتبع الحركة بشكل جيد. والنبرة العاطفية، سواء كانت واثقة أو مترددة أو آمرة، تطابق وصف الأمر النصي.

ما لا يفعله هو إنتاج كلمات أو عبارات يمكن التعرف عليها. يبقى الكلام ما يسميه مصممو الصوت "walla": الصوت البديل لحشد أو فرد يوحي بالكلام دون أن يحمل معنى محددًا. وهذا مناسب تمامًا لمعظم حالات استخدام اللقطات الثانوية والمعاينة.

أما حالات الاستخدام التي تتطلب كلامًا مفهومًا، فتحتاج إلى نموذج متخصص لتوليد الصوت. وعلى PicassoIA، تقدم النماذج Seedance 2.0 وSeedance 2.5 أيضًا توليدًا صوتيًا أصليًا بخصائص صوتية مختلفة. ولتحقيق مزامنة شفاه فعلية مع كلام حقيقي، فإن الجمع بين مخرجات نموذج الفيديو وأداة منفصلة للصوت ومزامنة الشفاه هو سير العمل الإنتاجي المعتمد.

💡 نصيحة: صف الحالة العاطفية للمتحدث وإيقاعه في أمرك النصي: "امرأة تتحدث بهدوء وتروٍّ إلى جمهور". هذا يؤثر في إيقاع الصوت الكلامي المولَّد، لا في الأداء البصري فقط.

امرأة تتحدث مع ميكروفون ياقي، صورة شخصية بإضاءة نافذة

المؤثرات الصوتية وFoley

تصبح نتائج المؤثرات الصوتية الخاصة بالأجسام أقل قابلية للتنبؤ. فالأصوات على طريقة Foley، كالخطوات والصدمات وحفيف الأقمشة وأصوات الأبواب، تعتمد على قدرة النموذج على تحديد فعل معين في الفيديو بدقة، ونسبة الحدث الصوتي الصحيح إليه.

عندما يكون الحدث المرئي واضحًا ومتمركزًا في الإطار، يصيب النموذج غالبًا. يد تكتب على لوحة مفاتيح تُنتج أصوات نقر. كرة ترتد تُنتج أصوات ارتطام. باب سيارة يُغلق يُنتج الصوت المميز لارتطام الصفيح بالمطاط المحكم.

عندما يكون الفعل هامشيًا، أو سريع الحركة، أو غامضًا بصريًا، ينهار التوافق. قد يتأخر الحدث الصوتي قليلًا، أو يُنسب إلى جسم خاطئ، أو يغيب تمامًا. هذا مجال يُظهر فيه Veo 3.1 تحسنًا واضحًا مقارنة مع Veo 3، لكنه ما زال يتطلب انتباهًا دقيقًا لما تضعه في مركز الإطار من أجسام وأفعال.

شارع مدينة في مساء ممطر مع انعكاس على بركة ماء، مشهد صوتي محيط

عندما ينهار الصوت

البيئات الصوتية المعقدة

يتعثر النموذج عندما تكون مصادر صوتية متنافسة كثيرة موجودة في الوقت نفسه. فسوق مزدحم فيه موسيقى وضجيج حشود ومحادثات فردية ينتج صوتًا يمزج هذه العناصر بشكل غير متسق. ولا يملك المزيج البنية الطبقية التي ينتجها مصمم صوت بشري. وتنجرف العناصر المختلفة إلى المقدمة وتخرج منها دون منطق واضح.

الحل العملي: اجعل المشاهد الصوتية بسيطة في أوامرك النصية. مصدر صوتي أساسي واحد مع الصوت المحيط هو النمط الموثوق. فعبارة "عازف شارع يعزف الغيتار الأكوستيك على رصيف هادئ في الصباح" ستنتج صوتًا أفضل من عبارة "مهرجان شارع فيه فرق متعددة، وباعة ينادون، وأطفال يلعبون". النموذج يتعامل مع الثانية بصريًا، لكن الصوت يتحول إلى تيار ممزوج.

مشكلة الحساسية للأمر النصي

صوت Veo 3.1 يتأثر بقوة بلغة الأمر النصي. الكلمات التي توحي بالصوت تنتج تفاصيل صوتية أكثر: "عاصفة رعدية"، "مطعم مزدحم"، "محرك يعمل". أما الكلمات التي توحي بمحتوى بصري بحت دون إيحاء بالصوت، مثل "لوحة تصوّر جبالًا"، أو "بورتريه بأسلوب فني"، فتنتج صوتًا أهدأ وأبسط، أو صمتًا شبه تام.

هذا ليس خللًا. إنها الطريقة التي دُرّب بها النموذج على التصرف. إذا أردت صوتًا غنيًا في مخرجاتك، فعليك كتابة أوامر تصف أحداثًا صوتية، لا تراكيب بصرية فقط. فكّر فيما قد يسمعه شخص موجود في المشهد، وأدرجه في وصفك.

💡 نصيحة: أضف سطرًا مخصصًا لوصف الصوت إلى أوامرك النصية. بعد الوصف البصري، اكتب: "Audio: sound of..." هذا الإطار الصريح يحسّن جودة الصوت بشكل ملحوظ في الأوامر الأطول أو الأكثر تعقيدًا.

مخرج أفلام يراجع فيديو ذكاء اصطناعي في غرفة مونتاج مظلمة، وهج الشاشة

Veo 3.1 مقابل نماذج أخرى تدعم الصوت

ليس كل نموذج لتحويل النص إلى فيديو ينتج صوتًا أصليًا. فكثير من النماذج الشائعة ما زالت تُخرج مقاطع فيديو بلا صوت. إليك كيف تقارن النماذج الحالية القادرة على الصوت على PicassoIA:

النموذجنوع الصوتجودة المزامنةالأفضل لـ
Veo 3.1فيديو وصوت مشتركان أصليانممتازةالمشاهد الطبيعية، والحوار
Veo 3.1 Fastفيديو وصوت مشتركان أصليانجيدةالتكرارات السريعة مع الصوت
Veo 3.1 Liteفيديو وصوت مشتركان أصليانجيدةمخرجات فيديو وصوت خفيفة
Seedance 2.0صوت مدمججيدةمشاهد الحركة الديناميكية
Seedance 2.5صوت مدمججيدةمحتوى فيديو وصوت طويل
Pixverse v6صوت ذكاء اصطناعي سينمائيجيدةالمخرجات السينمائية
Kling v2.1لا يوجد صوت أصليغير متاحالتركيز على الجودة البصرية
Wan 2.7 T2Vلا يوجد صوت أصليغير متاحالتركيز على دقة HD

الميزة الفارقة الرئيسية في Veo 3.1 هي بنية التوليد المشتركة. فالنماذج التي تضيف الصوت كمعالجة لاحقة، حتى الجيدة منها، تُظهر انحرافًا في التوقيت تلتقطه الأذن المدربة فورًا. والنهج الأصلي في Veo 3.1 يتجنب هذه المشكلة من أساسها، لا عبر مزج أفضل، بل لأنه لا توجد خطوة مزامنة يمكن أن تخطئ فيها.

محطة ما بعد الإنتاج الصوتي بشاشتين تعرضان موجات صوتية

كيفية استخدام Veo 3.1 على PicassoIA

يستضيف PicassoIA نموذج Veo 3.1 كاملًا، إلى جانب إصداره الأسرع Veo 3.1 Fast وإصداره الأخف Veo 3.1 Lite. والحصول على أفضل مخرجات صوتية مسألة تتعلق ببنية الأمر النصي.

الخطوة 1: اختر إصدار Veo 3.1 المناسب

استخدم Veo 3.1 الكامل للمخرجات النهائية التي يهم فيها الصوت. واستخدم Veo 3.1 Fast للتكرار واختبار الأوامر النصية. واستخدم Veo 3.1 Lite عندما تحتاج إلى إنتاجية سريعة لمشاهد أبسط.

الخطوة 2: اكتب أمرًا نصيًا يراعي الصوت

اكتب أمرك النصي في جزأين. أولًا، صف المشهد البصري بالتفصيل. ثانيًا، أضف ملاحظة صوتية محددة في النهاية:

  • المرئي: "باريستا في مقهى مزدحم يحضّر جرعة إسبريسو، لقطة مقربة على حامل المرشح وهو يُحكم تثبيته في رأس المجموعة."
  • الملاحظة الصوتية: "Audio: espresso machine hissing, grinding sound, ambient café chatter in background, ceramic cup on tile counter."

الخطوة 3: تحقق من تزامن الصوت والصورة عند التشغيل

بعد التوليد، شغّل المقطع مرة واحدة مع الصوت قبل أن تقرر الإبقاء عليه. استمع بعناية إلى:

  • هل تتوافق البيئة المحيطة مع الإعداد المرئي؟
  • هل لأي ارتطامات أو حركات على الشاشة أحداث صوتية مقابلة؟
  • هل مستوى الصوت العام مناسب، فلا يكون مشوهًا ولا شبه صامت؟

الخطوة 4: عالج إخفاقات الصوت بتغيير الأمر النصي

إذا كان الصوت ضعيفًا أو غير متطابق، فلا تكتفِ بإعادة التوليد. غيّر الأمر النصي. أضف تفاصيل صوتية أكثر. ضع الأحداث الصوتية المحورية في مقدمة وصفك. غالبًا ما يتفوق التوليد الثاني بأمر نصي أفضل يركّز على الصوت على إعادة توليد الأمر نفسه.

الخطوة 5: ادمج مع أدوات صوتية متخصصة عند الحاجة

للكلام المفهوم، أضف طبقة صوت باستخدام نموذج لتحويل النص إلى كلام بعد التوليد. ولتأليف موسيقى مخصصة، استخدم أدوات توليد الموسيقى بالذكاء الاصطناعي على PicassoIA بشكل منفصل، ثم امزجها لاحقًا. الصوت الأصلي في Veo 3.1 أساس متين، وليس سقف ما يمكن تحقيقه في المزيج النهائي.

طاقم إنتاج أفلام في موقع تصوير خارجي مع ميكروفون مثبت على عصا

ما الذي يغيّره صوت Veo 3.1 فعلًا

السبب الذي يجعل الصوت أهم مما يدركه معظم المبدعين: إنه يغيّر الجودة المُدرَكة للمقطع بأكمله. فالفيديو الذي يبدو رائعًا لكنه يبدو خاطئًا صوتيًا يُقرأ على أنه مزيف فورًا. الأذن قاسية جدًا في كشف عدم التطابق بين الصوت والصورة. وعندما تكون البيئة المحيطة صحيحة، وعندما تقع المؤثرات الصوتية في اللحظة المناسبة، وعندما تناسب نغمة الغرفة المكان، يبدو حتى الفيديو غير الكامل أكثر واقعية.

يحقق Veo 3.1 الصوت الصحيح بالقدر الكافي غالبًا، بحيث يكون السلوك الافتراضي، أي التوليد بأمر نصي جيد واستخدام المخرجات الأصلية، أفضل من معظم سلاسل معالجة الصوت بعد الإنتاج المطبّقة على نماذج الفيديو بلا صوت. وهذا تحول كبير عن الوضع الذي كان عليه توليد الفيديو بالذكاء الاصطناعي قبل اثني عشر شهرًا.

النماذج المتأخرة في الصوت، حتى المبهرة تقنيًا منها مثل Kling v2.1، تتطلب منك أن تجد الصوت وتقطّعه وتزامنه بنفسك. وهذا ليس سير عمل بسيطًا. فهو يضيف وقتًا، ويتطلب مهارات تحرير صوت، ويترك غالبًا وصلة يلاحظها المستمعون المدققون.

ما يزيله Veo 3.1 من هذه العملية هو خطوة البحث عن الصوت ومزامنته بالكامل. فالصوت يأتي مع الفيديو، متطابقًا على مستوى الإطار، ومبنيًا من الأمر النصي نفسه. وهذا ليس تيسيرًا بسيطًا. بالنسبة للمبدعين المستقلين والفرق الصغيرة، هو الفارق بين مقطع قابل للاستخدام ومقطع يحتاج ساعتين إضافيتين من العمل قبل أن يصبح جاهزًا للنشر.

تناثر قطرة ماء في ضوء الساعة الذهبية، تصور ماكرو لموجة صوتية

ابدأ الإبداع بالصوت

أفضل طريقة لفهم صوت Veo 3.1 هي إنتاج بضعة مقاطع بتوجيه صوتي متعمّد، والاستماع بعناية إلى ما يعود. النموذج يكافئ كتابة الأوامر النصية المحددة والواعية بالصوت بطرق تُسمع فورًا عند التشغيل الأول.

يمنحك PicassoIA وصولًا مباشرًا إلى Veo 3.1، وVeo 3.1 Fast، وVeo 3.1 Lite، وإلى مكتبة تحويل النص إلى فيديو القادرة على الصوت الأوسع، دون الحاجة إلى إعداد وحدة GPU محلية أو بيانات اعتماد API. أنت تكتب الأمر النصي، والمنصة تتولى التوليد، ويأتي الصوت مع الفيديو في كل مقطع.

جرّب كتابة مشهد يحتوي على حدث صوتي واضح ومحوري: حداد عند سندانه، وعاصفة مطر على نافذة، وعازف يعزف في محطة مترو. اكتب الصوت في أمرك النصي صراحةً. ثم استمع إلى ما يبنيه النموذج.

الفجوة بين ما ينتجه Veo 3.1 وما كنت ستحتاج فيه إلى فريق صوت لما بعد الإنتاج تضيق أسرع مما يدرك معظم الناس. الصوت موجود بالفعل. معظم المبدعين فقط لم يبدؤوا الاستماع بعد.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة