كيف يضيف Veo 3.1 صوتًا حقيقيًا إلى الفيديوهات (دون استوديو)

نظرة مفصّلة على كيفية توليد نموذج Veo 3.1 من Google للصوت الواقعي والمتزامن مباشرةً داخل فيديوهات الذكاء الاصطناعي، بما يشمل الأصوات المحيطة والحوار والموسيقى الصادرة من داخل المشهد، والاستدلال الصوتي القائم على الفيزياء، ونصائح عملية لاستخدامه على PicassoIA.

كيف يضيف Veo 3.1 صوتًا حقيقيًا إلى الفيديوهات (دون استوديو)
Cristian Da Conceicao
مؤسس Picasso IA

ظل الصوت لوقت طويل النصف المنسي من الفيديو. يمكنك بناء مشهد مذهل بصريًا، لكن ما إن تشغّله في صمت حتى يبدو شيء ما خاطئًا. كانت هذه الفجوة، أي غياب الصوت حيث يجب أن يكون، القيد الأبرز في توليد الفيديو بالذكاء الاصطناعي لسنوات. يسدّ Veo 3.1 هذه الفجوة بطريقة تبدو أقرب إلى تحوّل جوهري في ماهية توليد الفيديو بالذكاء الاصطناعي منها إلى تحديث لميزة.

ميكروفون استوديو احترافي على حامل كروم بضوء نافذة طبيعي، مع ظهور إطارات فيديو الذكاء الاصطناعي على شاشات ضبابية في الخلفية

ما الذي تغيّر بين Veo 3 و3.1

كان الصوت دائمًا الحلقة الضعيفة

قدّم Veo 3 توليد الصوت الأصلي إلى منظومة الفيديو من Google، وكان مثيرًا للإعجاب فعلًا بمقاييس زمنه. لكن المستخدمين الأوائل لاحظوا تفاوتات. مشهد لأمواج تتكسر قد يبدو صوته نظيفًا أكثر من اللازم، ومنتظمًا أكثر مما ينبغي، ويفتقر إلى التراكب الفوضوي لأمواج حقيقية. وكثيرًا ما لم يتطابق صوت شخص يضحك في الفيديو تمامًا مع توقيت حركة فمه. لم تكن هذه إخفاقات كارثية، لكنها كانت واضحة بما يكفي لتتطلب إصلاحات في ما بعد الإنتاج.

لا يكتفي Veo 3.1 بمعالجة هذه المشكلات. بل يعيد التفكير في العلاقة بين توليد الصورة وتوليد الصوت من الأساس. يتعامل النموذج مع الصوت بوصفه مخرجًا متساوي الأهمية، لا فكرة لاحقة تُضاف فوق إطارات الفيديو المكتملة.

ثلاث طبقات صوتية يستطيع Veo 3.1 التعامل معها

ما يجعل صوت Veo 3.1 ذا قيمة عملية هو أنه يعمل عبر ثلاث فئات صوتية مختلفة في وقت واحد:

  • الأجواء الصوتية المحيطة: أصوات البيئة في الخلفية مثل الرياح والمطر وحركة المرور والحشود والطبيعة
  • الحوار والكلام: الكلمات المنطوقة وردود الفعل والضحك وغيرها من الأصوات البشرية غير اللفظية
  • الموسيقى الصادرة من داخل المشهد: موسيقى تنبع من داخل المشهد نفسه، مثل راديو يعمل أو موسيقي يعزف أمام الكاميرا

هذه ليست أوضاعًا منفصلة تتنقل بينها. يمزج Veo 3.1 الفئات الثلاث في الوقت الفعلي بناءً على ما يفهمه من السياق البصري. مشهد يظهر عازف شوارع يعزف قرب مقهى في ظهيرة ماطرة سيجمع في الوقت نفسه صوت المطر وهمهمة الحشد والأداء الموسيقي الحي، بمستوى صوت نسبي مناسب لكل عنصر.

منظر جوي لغطاء غابة خضراء كثيفة في الصباح الباكر مع ضباب يتحرك بين قمم الأشجار

كيف يعمل توليد الصوت فعلًا

يبدأ من السياق، لا من قاعدة بيانات

كانت معظم أدوات الصوت الأولى بالذكاء الاصطناعي تعمل بمطابقة المحتوى البصري مع قاعدة بيانات من الأصوات المسجّلة مسبقًا. كنت تحصل على مقطع "مطر" أو مقطع "حشد" يبدو معقولًا، لكنه لا يبدو صحيحًا تمامًا أبدًا لأنه عام بطبيعته. يتبع Veo 3.1 نهجًا مختلفًا جوهريًا.

يولّد النموذج الصوت بالطريقة نفسها التي يولّد بها الفيديو: بالتنبؤ بما ينبغي أن يأتي بعد ذلك، استنادًا إلى كل ما يفهمه عن المشهد. لا يبحث عن "صوت المطر". بل يستنتج كيف ينبغي أن يبدو المطر، بالنظر إلى كثافة الغيوم، والسطح الذي يصطدم به المطر، وما إذا كان رذاذًا خفيفًا أم مطرًا غزيرًا، ومدى قرب الكاميرا الافتراضية من الحدث.

💡 لهذا السبب يبدو صوت Veo 3.1 أكثر دقة في كثير من الأحيان من مؤثرات Foley المصنوعة يدويًا في الإنتاجات محدودة الميزانية. فقد استوعب النموذج أنماطًا من كمّ هائل من الفيديوهات الواقعية المصحوبة بصوت متزامن، متعلّمًا ليس فقط كيف تبدو الأشياء صوتيًا، بل لماذا تبدو بالشكل الذي تبدو عليه.

الاستدلال الصوتي القائم على الفيزياء

من أكثر جوانب خط الصوت في Veo 3.1 إثارة للإعجاب تقنيًا ما يصفه الباحثون بالنمذجة الفيزيائية الضمنية. فقد تعلّم النموذج روابط عميقة بين الخصائص الفيزيائية وبصمتها الصوتية.

يُحدث الماء عند اصطدامه بأسطح مختلفة أصواتًا مختلفة. ولخطوات المشي على الحصى والسجاد والخشب الصلب ملمس صوتي متميز. وإغلاق باب في حمام صغير مغطى بالبلاط يُحدث صدى يختلف عن إغلاقه في غرفة نوم مفروشة بالسجاد. يلتقط Veo 3.1 الإشارات البصرية في المشهد المولَّد، بما في ذلك مواد الجدران وأبعاد الغرفة وخصائص أسطح الأجسام، ويستخدمها لتشكيل المخرج الصوتي وفقًا لذلك.

ينتج عن هذا نوع من الواقعية الصوتية لم يكن بالإمكان تحقيقه سابقًا إلا عبر عمل احترافي متخصص في التصميم الصوتي.

دور المحاذاة الزمنية

قد يكون جعل الصوت يطابق الصورة بدقة في التوقيت أصعب من جعله يبدو صحيحًا من الأساس. فتصفيق يصل بعد نصف ثانية متأخرًا، أو كلمة لا تتزامن مع حركة الشفاه، يكسر وهم الواقعية فورًا.

يعالج Veo 3.1 هذا الأمر عبر نهج تدريب مشترك تُولَّد فيه التوكنات البصرية والتوكنات الصوتية بتنسيق محكم. فبدلًا من إنتاج إطارات الفيديو أولًا ثم إسناد الصوت لاحقًا، يبني النموذج التمثيلين معًا في وقت واحد أثناء تشغيله. والنتيجة هي تزامن صوتي دقيق على مستوى الإطار يصمد حتى في المشاهد سريعة الحركة أو مشاهد الأكشن المكثفة.

شاب يجلس على مقعد في حديقة عامة ويضحك بطبيعية مع ضوء شمس بعد الظهيرة الدافئ يُبرز وجهه

صوت من الواقع يبدو صحيحًا

الأجواء الصوتية المحيطة

هنا يترك Veo 3.1 أكبر أثر باستمرار. فالصوت البيئي هو الأصعب في التزييف لأن البشر يألفون بوعيهم الباطن كيف تبدو الأماكن صوتيًا. الغابة عند الفجر تختلف صوتيًا عنها عند الظهر. والشاطئ في الصيف يختلف صوتيًا عن الشاطئ نفسه تحت سماء غائمة في الخريف.

يتعامل النموذج مع هذه الفروق بقدر من الدقة لم تستطع أدوات الفيديو بالذكاء الاصطناعي السابقة مضاهاته. فالأمر "شارع هادئ في مدينة أوروبية بعد المطر مباشرةً" سينتج صوتًا يتضمن الطابع الصوتي المحدد للحجارة المبللة، وحركة المرور البعيدة وهي تتسرب بين فجوات المباني، وصوت قطرات الماء المتساقطة أحيانًا من مظلة قماشية، لا مجرد مقطع "أجواء خارجية" عام.

هذه الدقة هي ما يفصل مخرجات Veo 3.1 عن أي شيء سبقه في توليد الفيديو بالذكاء الاصطناعي.

شارع مدينة مبلل بالمطر ليلًا مع هالات برتقالية من أعمدة الإنارة تنعكس على الحجارة المرصوفة وعابر يحمل مظلة

الصوت البشري والحوار

عندما يضم المشهد شخصيات تبدو وكأنها تتكلم، يولّد Veo 3.1 صوتًا يطابق حركة أفواهها ونبرتها العاطفية. وفي المشاهد التي لا يكون فيها المحتوى المنطوق المحدد جزءًا من الأمر النصي، ينتج النموذج صوتًا على مستوى الفونيمات يخلق انطباعًا مقنعًا بالحوار دون توليد لغة يمكن تمييزها.

أما في المشاهد التي تُحدَّد فيها الكلمات المنطوقة أو الأداء العاطفي في الأمر النصي، فيحاول النموذج مطابقة الأداء البصري للمتحدث مع إيقاع الصوت ونبرته. وتعتمد الدقة هنا بشدة على مدى تحديد الأمر النصي. الأوامر العامة تنتج نتائج تقريبية. أما الأوامر المفصّلة التي تصف النبرة والإيقاع والحالة العاطفية فتنتج تزامنًا أفضل بوضوح.

💡 نصيحة للأوامر النصية: عند كتابة أوامر لمشاهد فيها حوار، حدّد المغزى العاطفي بدلًا من الكلمات الحرفية. فالأمر "امرأة تتحدث بهدوء وإلحاح إلى شخص آخر عبر طاولة مقهى" سينتج نتائج أفضل تزامنًا من مجرد "شخصان يتحدثان".

موسيقى تناسب الحالة

تُعالَج الموسيقى الصادرة من داخل المشهد، أي الموسيقى التي تنبع من داخل المشهد نفسه، بأناقة خاصة في Veo 3.1. فمشهد يظهر شخصًا يعزف الغيتار على شرفة سيولّد صوتًا يطابق أسلوب العزف الظاهر، سواء بالنقر على الأوتار أو بالضرب عليها، وببطء أو بحيوية. ومشهد يظهر فيه جهاز تشغيل أسطوانات سيُنتج صوتًا مناسبًا للنوع الموسيقي والحقبة التقريبية التي يوحي بها السياق البصري.

الموسيقى الخلفية غير الصادرة من داخل المشهد خارج النطاق الأساسي لنموذج Veo 3.1 حاليًا. لكن بالنسبة للمحتوى الذي تحتاج فيه الموسيقى إلى أن تأتي من داخل الإطار، فجودة التزامن مذهلة فعلًا، وتمثل واحدًا من أوضح التحسينات مقارنةً بنموذج Veo 3.

لقطة مقرّبة لأسطوانة فينيل قديمة تدور على جهاز تشغيل تحت ضوء متوهج دافئ يكشف الأخاديد الحلزونية الدقيقة

كيفية استخدام Veo 3.1 على PicassoIA

Veo 3.1 متاح مباشرةً على PicassoIA إلى جانب نسخته الأسرع Veo 3.1 Fast، التي تضحي بقدر بسيط من دقة الصوت مقابل تقليص كبير في وقت التوليد. إليك كيفية الحصول على نتائج قوية من الاثنين.

إعداد أول أمر نصي لك

الخطوة 1: افتح صفحة نموذج Veo 3.1 على PicassoIA.

الخطوة 2: اكتب الأمر النصي متضمّنًا إشارات صوتية صريحة. لا تفترض أن النموذج سيستنتج الصوت من الصورة وحدها. اذكر العناصر الصوتية مباشرةً ضمن وصف المشهد.

مثال على أمر نصي: "امرأة في الثلاثينات من عمرها تسير في شارع باريسي مبلل بالمطر عند الغسق. صوت كعبيها على الحجارة المبللة، وحركة مرور بعيدة تتسرب بين المباني، وعازف أكورديون يعزف من مدخل على بُعد خمسين مترًا."

الخطوة 3: اختر المدة والدقة المفضّلتين لك. للحفاظ على اتساق الصوت، تمنح المقاطع التي تبلغ 8 ثوانٍ أو أكثر النموذج سياقًا زمنيًا أوسع للحفاظ على تصميم صوتي متماسك طوال المقطع.

الخطوة 4: راجع المخرجات. تحقق من أن الأحداث المرئية تتوافق مع الأصوات المقابلة لها. تزامن Veo 3.1 قوي، لكن الأوامر النصية غير المعتادة أو شديدة التعقيد قد تؤدي أحيانًا إلى انحراف طفيف في التوقيت.

الخطوة 5: إذا لم يكن تزامن الصوت دقيقًا تمامًا، فأعد صياغة أمرك ليكون أكثر تحديدًا بشأن التوقيت والسبب المادي للأصوات داخل المشهد.

نصائح لنتائج صوتية أفضل

التقنيةلماذا تنجح
سمِّ المواد المحددة في المشهديستخدم النموذج خصائص الأسطح لحساب الاستجابة الصوتية
صِف الغرفة أو المساحة الخارجية بالتفصيلتعتمد أنماط الصدى والعكس بشدة على السياق المكاني
حدّد وقت اليوم وظروف الطقستتغير ملامح الأصوات المحيطة بشكل كبير حسب الحالة البيئية
ضمّن السلوك البشري ولغة الجسدالوضعية والإيماءات وحركة الفم كلها تؤثر في الكلام والمخرج الصوتي
تجنّب المشاهد الصوتية المزدحمة في أمر نصي واحدتقلل مصادر الصوت المتنافسة المتعددة من وضوح كل عنصر على حدة
استخدم Veo 3.1 Fast للتكرار السريعاختبر تنويعات الأوامر النصية بسرعة، ثم انتقل إلى Veo 3.1 الكامل للمخرج النهائي

مساحة عمل احترافية للتصميم الصوتي بشاشة تعرض موجات صوتية متزامنة مع لقطات فيديو للمحيط

Veo 3.1 مقابل نماذج الفيديو الأخرى بالذكاء الاصطناعي التي تحتوي على صوت

تقدم عدة نماذج أخرى الآن صوتًا أصليًا أو تضيفه بنشاط. إليك كيف تتقارن في الاستخدام العملي عبر الفئات الأكثر أهمية.

النموذجصوت أصليالأجواء المحيطةتزامن الحوارالموسيقى الصادرة من المشهد
Veo 3.1نعمممتازجيد جدًانعم
Veo 3نعمجيدجيدجزئي
Sora 2نعمجيدمتفاوتمحدود
Seedance 2.0نعمجيدجيدجزئي
Seedance 1.5 Proنعممتوسطمتوسطمحدود
Hailuo 02جزئيأساسيأساسيلا
Kling v3 Videoلالالالا
Vidu Q3 Turboنعمأساسيأساسيلا

الفجوة بين Veo 3.1 وبقية المجال كبيرة، خاصةً في الصوت المحيط والصوت الصادر من داخل المشهد. فمعظم نماذج الفيديو بالذكاء الاصطناعي من الجيل الحالي ما زالت تنتج مخرجات صامتة أو تقدم مطابقة صوتية أساسية فقط. والقفزة من Veo 3 إلى 3.1 مهمة لكنها تدريجية. أما القصة الأكبر فهي مدى تقدّم كلا نموذجي Veo على البدائل التي لم تلتزم بعد بتوليد الفيديو الذي يُبنى على الصوت منذ البداية.

أمواج المحيط تتكسر على شاطئ رملي عند الساعة الذهبية مع رغوة تندفع فوق الرمال المبللة وقطرات ماء معلّقة في منتصف الاصطدام

عندما لا يزال توليد الصوت يواجه صعوبات

Veo 3.1 مبهر في معظم حالات الاستخدام، لكن معرفة حدوده الحالية تساعدك على التخطيط حولها بفعالية.

المشاهد الصوتية المزدحمة

عندما يضم المشهد مصادر صوتية كثيرة في وقت واحد، مثل سوق مزدحم أو حشد في مهرجان أو مشهد أكشن فوضوي يتضمن اصطدامات متعددة، يميل النموذج إلى إنتاج انطباع صوتي معقول عن البيئة، بدلًا من تراكب كل حدث صوتي متميز بأصالة. ستحصل على إحساس مقنع بالعام لمكان مزدحم، لكن ليس على التعقيد الحقيقي لأصوات فردية كثيرة متداخلة تُنجَز كل منها بدقة كاملة.

طريقة التعامل مع ذلك: استخدم مقاطع متتالية أقصر لإرساء عناصر صوتية فردية كلٌ على حدة. فلقطة عريضة تمهيدية لسوق، ثم لقطة مقرّبة لكشك محدد، ستنتج صوتًا أكثر تفصيلًا من محاولة التقاط كل شيء في توليد واحد.

التوقيت الموسيقي الدقيق

عندما يتضمن المشهد أداءً موسيقيًا متزامنًا، مثل طبّال يضرب نمطًا إيقاعيًا محددًا أو عازف بيانو يعزف لحنًا معروفًا، يتعامل النموذج مع الانطباع العام للموسيقى بشكل جيد، لكنه قد يتعثر في توقيت النغمات الدقيق، لا سيما في المقاطع التي تتجاوز عشر ثوانٍ.

ينبغي وضع هذا في الحسبان قبل استخدام Veo 3.1 لمحتوى فيديو موسيقي يتطلب تزامنًا محكمًا مع الإيقاع. ولتلك الحالات المحددة، ما زال توليد المسار المرئي بشكل منفصل ومزامنة الصوت يدويًا في مرحلة ما بعد الإنتاج يعطي نتائج أكثر موثوقية.

💡 لتوليد الموسيقى بالذكاء الاصطناعي دون فيديو، يقدّم PicassoIA أيضًا نماذج متخصصة في توليد الموسيقى بالذكاء الاصطناعي تنشئ مقطوعات صوتية كاملة من أوامر نصية، يمكنك إقرانها بمخرجات Veo 3.1 للحصول على تحكم إبداعي كامل.

شابة ذات بشرة داكنة ناعمة وشعر طبيعي ترتدي سماعات أذن بيضاء، وعيناها مغمضتان في استماع مركّز أمام جدار كريمي دافئ

ابدأ الإبداع على PicassoIA

الأهم في قدرة Veo 3.1 على توليد الصوت ليس التقنية نفسها. بل ما تعنيه لمن يستطيع إنتاج محتوى فيديو عالي الجودة. كان التصميم الصوتي يتطلب أدوات مخصصة وخبرة متخصصة وغالبًا محترفًا منفصلًا. يختصر Veo 3.1 هذه العملية كلها في أمر نصي واحد.

يغيّر ذلك اقتصاديات إنتاج الفيديو بطريقة حقيقية وعملية. فصانع المحتوى على وسائل التواصل، وصاحب الأعمال الصغيرة، وصانع الأفلام المستقل، يستطيعون الآن إنتاج محتوى فيديو بصوت محيط بجودة احترافية دون استوديو صوت أو فنان Foley أو برنامج تحرير صوتي. ما كان يتطلب خط إنتاج لما بعد الإنتاج يمكن أن يحدث الآن في خطوة التوليد نفسها التي تُنتج الصورة.

يمنحك PicassoIA الوصول إلى Veo 3.1 وVeo 3.1 Fast إلى جانب أكثر من 87 نموذجًا آخر لتوليد الفيديو، بما في ذلك Kling v3 Video وWan 2.6 T2V وHailuo 02. يمكنك مقارنة المخرجات عبر النماذج، واختبار أساليب مختلفة للأوامر النصية، والعثور على المزيج المناسب لاحتياجاتك الإبداعية المحددة.

إذا لم تجرّب بعد توليد الفيديو بالذكاء الاصطناعي مع صوت أصلي، فالوقت مناسب الآن للبدء. اكتب وصفًا مفصّلًا للمشهد، وضمّن إشارات صوتية صريحة في أمرك النصي، وشاهد ما ينتجه Veo 3.1. كثيرًا ما تفاجئ النتائج حتى صنّاع الفيديو المتمرسين الذين اعتادوا قيود الأدوات السابقة.

الفجوة بين ما يستطيع الأمر النصي إنتاجه وما يتطلب إعداد إنتاج احترافيًا كاملًا تضيق بسرعة. ويُعد Veo 3.1 سببًا مهمًا في ذلك.

مكتب خشبي لمخرج أفلام من الأعلى مع لوح تصوير ومرشحة ميكروفون موجّهة وكاميرا وأسكتشات قصة مصوّرة وحاسوب محمول يعرض خط زمن لتحرير الفيديو

شارك هذا المقال

اختر لغتك

مقالات ذات صلة