ظل الصوت لوقت طويل النصف المنسي من الفيديو. يمكنك بناء مشهد مذهل بصريًا، لكن ما إن تشغّله في صمت حتى يبدو شيء ما خاطئًا. كانت هذه الفجوة، أي غياب الصوت حيث يجب أن يكون، القيد الأبرز في توليد الفيديو بالذكاء الاصطناعي لسنوات. يسدّ Veo 3.1 هذه الفجوة بطريقة تبدو أقرب إلى تحوّل جوهري في ماهية توليد الفيديو بالذكاء الاصطناعي منها إلى تحديث لميزة.

ما الذي تغيّر بين Veo 3 و3.1
كان الصوت دائمًا الحلقة الضعيفة
قدّم Veo 3 توليد الصوت الأصلي إلى منظومة الفيديو من Google، وكان مثيرًا للإعجاب فعلًا بمقاييس زمنه. لكن المستخدمين الأوائل لاحظوا تفاوتات. مشهد لأمواج تتكسر قد يبدو صوته نظيفًا أكثر من اللازم، ومنتظمًا أكثر مما ينبغي، ويفتقر إلى التراكب الفوضوي لأمواج حقيقية. وكثيرًا ما لم يتطابق صوت شخص يضحك في الفيديو تمامًا مع توقيت حركة فمه. لم تكن هذه إخفاقات كارثية، لكنها كانت واضحة بما يكفي لتتطلب إصلاحات في ما بعد الإنتاج.
لا يكتفي Veo 3.1 بمعالجة هذه المشكلات. بل يعيد التفكير في العلاقة بين توليد الصورة وتوليد الصوت من الأساس. يتعامل النموذج مع الصوت بوصفه مخرجًا متساوي الأهمية، لا فكرة لاحقة تُضاف فوق إطارات الفيديو المكتملة.
ثلاث طبقات صوتية يستطيع Veo 3.1 التعامل معها
ما يجعل صوت Veo 3.1 ذا قيمة عملية هو أنه يعمل عبر ثلاث فئات صوتية مختلفة في وقت واحد:
- الأجواء الصوتية المحيطة: أصوات البيئة في الخلفية مثل الرياح والمطر وحركة المرور والحشود والطبيعة
- الحوار والكلام: الكلمات المنطوقة وردود الفعل والضحك وغيرها من الأصوات البشرية غير اللفظية
- الموسيقى الصادرة من داخل المشهد: موسيقى تنبع من داخل المشهد نفسه، مثل راديو يعمل أو موسيقي يعزف أمام الكاميرا
هذه ليست أوضاعًا منفصلة تتنقل بينها. يمزج Veo 3.1 الفئات الثلاث في الوقت الفعلي بناءً على ما يفهمه من السياق البصري. مشهد يظهر عازف شوارع يعزف قرب مقهى في ظهيرة ماطرة سيجمع في الوقت نفسه صوت المطر وهمهمة الحشد والأداء الموسيقي الحي، بمستوى صوت نسبي مناسب لكل عنصر.

كيف يعمل توليد الصوت فعلًا
يبدأ من السياق، لا من قاعدة بيانات
كانت معظم أدوات الصوت الأولى بالذكاء الاصطناعي تعمل بمطابقة المحتوى البصري مع قاعدة بيانات من الأصوات المسجّلة مسبقًا. كنت تحصل على مقطع "مطر" أو مقطع "حشد" يبدو معقولًا، لكنه لا يبدو صحيحًا تمامًا أبدًا لأنه عام بطبيعته. يتبع Veo 3.1 نهجًا مختلفًا جوهريًا.
يولّد النموذج الصوت بالطريقة نفسها التي يولّد بها الفيديو: بالتنبؤ بما ينبغي أن يأتي بعد ذلك، استنادًا إلى كل ما يفهمه عن المشهد. لا يبحث عن "صوت المطر". بل يستنتج كيف ينبغي أن يبدو المطر، بالنظر إلى كثافة الغيوم، والسطح الذي يصطدم به المطر، وما إذا كان رذاذًا خفيفًا أم مطرًا غزيرًا، ومدى قرب الكاميرا الافتراضية من الحدث.
💡 لهذا السبب يبدو صوت Veo 3.1 أكثر دقة في كثير من الأحيان من مؤثرات Foley المصنوعة يدويًا في الإنتاجات محدودة الميزانية. فقد استوعب النموذج أنماطًا من كمّ هائل من الفيديوهات الواقعية المصحوبة بصوت متزامن، متعلّمًا ليس فقط كيف تبدو الأشياء صوتيًا، بل لماذا تبدو بالشكل الذي تبدو عليه.
الاستدلال الصوتي القائم على الفيزياء
من أكثر جوانب خط الصوت في Veo 3.1 إثارة للإعجاب تقنيًا ما يصفه الباحثون بالنمذجة الفيزيائية الضمنية. فقد تعلّم النموذج روابط عميقة بين الخصائص الفيزيائية وبصمتها الصوتية.
يُحدث الماء عند اصطدامه بأسطح مختلفة أصواتًا مختلفة. ولخطوات المشي على الحصى والسجاد والخشب الصلب ملمس صوتي متميز. وإغلاق باب في حمام صغير مغطى بالبلاط يُحدث صدى يختلف عن إغلاقه في غرفة نوم مفروشة بالسجاد. يلتقط Veo 3.1 الإشارات البصرية في المشهد المولَّد، بما في ذلك مواد الجدران وأبعاد الغرفة وخصائص أسطح الأجسام، ويستخدمها لتشكيل المخرج الصوتي وفقًا لذلك.
ينتج عن هذا نوع من الواقعية الصوتية لم يكن بالإمكان تحقيقه سابقًا إلا عبر عمل احترافي متخصص في التصميم الصوتي.
دور المحاذاة الزمنية
قد يكون جعل الصوت يطابق الصورة بدقة في التوقيت أصعب من جعله يبدو صحيحًا من الأساس. فتصفيق يصل بعد نصف ثانية متأخرًا، أو كلمة لا تتزامن مع حركة الشفاه، يكسر وهم الواقعية فورًا.
يعالج Veo 3.1 هذا الأمر عبر نهج تدريب مشترك تُولَّد فيه التوكنات البصرية والتوكنات الصوتية بتنسيق محكم. فبدلًا من إنتاج إطارات الفيديو أولًا ثم إسناد الصوت لاحقًا، يبني النموذج التمثيلين معًا في وقت واحد أثناء تشغيله. والنتيجة هي تزامن صوتي دقيق على مستوى الإطار يصمد حتى في المشاهد سريعة الحركة أو مشاهد الأكشن المكثفة.

صوت من الواقع يبدو صحيحًا
الأجواء الصوتية المحيطة
هنا يترك Veo 3.1 أكبر أثر باستمرار. فالصوت البيئي هو الأصعب في التزييف لأن البشر يألفون بوعيهم الباطن كيف تبدو الأماكن صوتيًا. الغابة عند الفجر تختلف صوتيًا عنها عند الظهر. والشاطئ في الصيف يختلف صوتيًا عن الشاطئ نفسه تحت سماء غائمة في الخريف.
يتعامل النموذج مع هذه الفروق بقدر من الدقة لم تستطع أدوات الفيديو بالذكاء الاصطناعي السابقة مضاهاته. فالأمر "شارع هادئ في مدينة أوروبية بعد المطر مباشرةً" سينتج صوتًا يتضمن الطابع الصوتي المحدد للحجارة المبللة، وحركة المرور البعيدة وهي تتسرب بين فجوات المباني، وصوت قطرات الماء المتساقطة أحيانًا من مظلة قماشية، لا مجرد مقطع "أجواء خارجية" عام.
هذه الدقة هي ما يفصل مخرجات Veo 3.1 عن أي شيء سبقه في توليد الفيديو بالذكاء الاصطناعي.

الصوت البشري والحوار
عندما يضم المشهد شخصيات تبدو وكأنها تتكلم، يولّد Veo 3.1 صوتًا يطابق حركة أفواهها ونبرتها العاطفية. وفي المشاهد التي لا يكون فيها المحتوى المنطوق المحدد جزءًا من الأمر النصي، ينتج النموذج صوتًا على مستوى الفونيمات يخلق انطباعًا مقنعًا بالحوار دون توليد لغة يمكن تمييزها.
أما في المشاهد التي تُحدَّد فيها الكلمات المنطوقة أو الأداء العاطفي في الأمر النصي، فيحاول النموذج مطابقة الأداء البصري للمتحدث مع إيقاع الصوت ونبرته. وتعتمد الدقة هنا بشدة على مدى تحديد الأمر النصي. الأوامر العامة تنتج نتائج تقريبية. أما الأوامر المفصّلة التي تصف النبرة والإيقاع والحالة العاطفية فتنتج تزامنًا أفضل بوضوح.
💡 نصيحة للأوامر النصية: عند كتابة أوامر لمشاهد فيها حوار، حدّد المغزى العاطفي بدلًا من الكلمات الحرفية. فالأمر "امرأة تتحدث بهدوء وإلحاح إلى شخص آخر عبر طاولة مقهى" سينتج نتائج أفضل تزامنًا من مجرد "شخصان يتحدثان".
موسيقى تناسب الحالة
تُعالَج الموسيقى الصادرة من داخل المشهد، أي الموسيقى التي تنبع من داخل المشهد نفسه، بأناقة خاصة في Veo 3.1. فمشهد يظهر شخصًا يعزف الغيتار على شرفة سيولّد صوتًا يطابق أسلوب العزف الظاهر، سواء بالنقر على الأوتار أو بالضرب عليها، وببطء أو بحيوية. ومشهد يظهر فيه جهاز تشغيل أسطوانات سيُنتج صوتًا مناسبًا للنوع الموسيقي والحقبة التقريبية التي يوحي بها السياق البصري.
الموسيقى الخلفية غير الصادرة من داخل المشهد خارج النطاق الأساسي لنموذج Veo 3.1 حاليًا. لكن بالنسبة للمحتوى الذي تحتاج فيه الموسيقى إلى أن تأتي من داخل الإطار، فجودة التزامن مذهلة فعلًا، وتمثل واحدًا من أوضح التحسينات مقارنةً بنموذج Veo 3.

كيفية استخدام Veo 3.1 على PicassoIA
Veo 3.1 متاح مباشرةً على PicassoIA إلى جانب نسخته الأسرع Veo 3.1 Fast، التي تضحي بقدر بسيط من دقة الصوت مقابل تقليص كبير في وقت التوليد. إليك كيفية الحصول على نتائج قوية من الاثنين.
إعداد أول أمر نصي لك
الخطوة 1: افتح صفحة نموذج Veo 3.1 على PicassoIA.
الخطوة 2: اكتب الأمر النصي متضمّنًا إشارات صوتية صريحة. لا تفترض أن النموذج سيستنتج الصوت من الصورة وحدها. اذكر العناصر الصوتية مباشرةً ضمن وصف المشهد.
مثال على أمر نصي: "امرأة في الثلاثينات من عمرها تسير في شارع باريسي مبلل بالمطر عند الغسق. صوت كعبيها على الحجارة المبللة، وحركة مرور بعيدة تتسرب بين المباني، وعازف أكورديون يعزف من مدخل على بُعد خمسين مترًا."
الخطوة 3: اختر المدة والدقة المفضّلتين لك. للحفاظ على اتساق الصوت، تمنح المقاطع التي تبلغ 8 ثوانٍ أو أكثر النموذج سياقًا زمنيًا أوسع للحفاظ على تصميم صوتي متماسك طوال المقطع.
الخطوة 4: راجع المخرجات. تحقق من أن الأحداث المرئية تتوافق مع الأصوات المقابلة لها. تزامن Veo 3.1 قوي، لكن الأوامر النصية غير المعتادة أو شديدة التعقيد قد تؤدي أحيانًا إلى انحراف طفيف في التوقيت.
الخطوة 5: إذا لم يكن تزامن الصوت دقيقًا تمامًا، فأعد صياغة أمرك ليكون أكثر تحديدًا بشأن التوقيت والسبب المادي للأصوات داخل المشهد.
نصائح لنتائج صوتية أفضل
| التقنية | لماذا تنجح |
|---|
| سمِّ المواد المحددة في المشهد | يستخدم النموذج خصائص الأسطح لحساب الاستجابة الصوتية |
| صِف الغرفة أو المساحة الخارجية بالتفصيل | تعتمد أنماط الصدى والعكس بشدة على السياق المكاني |
| حدّد وقت اليوم وظروف الطقس | تتغير ملامح الأصوات المحيطة بشكل كبير حسب الحالة البيئية |
| ضمّن السلوك البشري ولغة الجسد | الوضعية والإيماءات وحركة الفم كلها تؤثر في الكلام والمخرج الصوتي |
| تجنّب المشاهد الصوتية المزدحمة في أمر نصي واحد | تقلل مصادر الصوت المتنافسة المتعددة من وضوح كل عنصر على حدة |
| استخدم Veo 3.1 Fast للتكرار السريع | اختبر تنويعات الأوامر النصية بسرعة، ثم انتقل إلى Veo 3.1 الكامل للمخرج النهائي |

Veo 3.1 مقابل نماذج الفيديو الأخرى بالذكاء الاصطناعي التي تحتوي على صوت
تقدم عدة نماذج أخرى الآن صوتًا أصليًا أو تضيفه بنشاط. إليك كيف تتقارن في الاستخدام العملي عبر الفئات الأكثر أهمية.
الفجوة بين Veo 3.1 وبقية المجال كبيرة، خاصةً في الصوت المحيط والصوت الصادر من داخل المشهد. فمعظم نماذج الفيديو بالذكاء الاصطناعي من الجيل الحالي ما زالت تنتج مخرجات صامتة أو تقدم مطابقة صوتية أساسية فقط. والقفزة من Veo 3 إلى 3.1 مهمة لكنها تدريجية. أما القصة الأكبر فهي مدى تقدّم كلا نموذجي Veo على البدائل التي لم تلتزم بعد بتوليد الفيديو الذي يُبنى على الصوت منذ البداية.

عندما لا يزال توليد الصوت يواجه صعوبات
Veo 3.1 مبهر في معظم حالات الاستخدام، لكن معرفة حدوده الحالية تساعدك على التخطيط حولها بفعالية.
المشاهد الصوتية المزدحمة
عندما يضم المشهد مصادر صوتية كثيرة في وقت واحد، مثل سوق مزدحم أو حشد في مهرجان أو مشهد أكشن فوضوي يتضمن اصطدامات متعددة، يميل النموذج إلى إنتاج انطباع صوتي معقول عن البيئة، بدلًا من تراكب كل حدث صوتي متميز بأصالة. ستحصل على إحساس مقنع بالعام لمكان مزدحم، لكن ليس على التعقيد الحقيقي لأصوات فردية كثيرة متداخلة تُنجَز كل منها بدقة كاملة.
طريقة التعامل مع ذلك: استخدم مقاطع متتالية أقصر لإرساء عناصر صوتية فردية كلٌ على حدة. فلقطة عريضة تمهيدية لسوق، ثم لقطة مقرّبة لكشك محدد، ستنتج صوتًا أكثر تفصيلًا من محاولة التقاط كل شيء في توليد واحد.
التوقيت الموسيقي الدقيق
عندما يتضمن المشهد أداءً موسيقيًا متزامنًا، مثل طبّال يضرب نمطًا إيقاعيًا محددًا أو عازف بيانو يعزف لحنًا معروفًا، يتعامل النموذج مع الانطباع العام للموسيقى بشكل جيد، لكنه قد يتعثر في توقيت النغمات الدقيق، لا سيما في المقاطع التي تتجاوز عشر ثوانٍ.
ينبغي وضع هذا في الحسبان قبل استخدام Veo 3.1 لمحتوى فيديو موسيقي يتطلب تزامنًا محكمًا مع الإيقاع. ولتلك الحالات المحددة، ما زال توليد المسار المرئي بشكل منفصل ومزامنة الصوت يدويًا في مرحلة ما بعد الإنتاج يعطي نتائج أكثر موثوقية.
💡 لتوليد الموسيقى بالذكاء الاصطناعي دون فيديو، يقدّم PicassoIA أيضًا نماذج متخصصة في توليد الموسيقى بالذكاء الاصطناعي تنشئ مقطوعات صوتية كاملة من أوامر نصية، يمكنك إقرانها بمخرجات Veo 3.1 للحصول على تحكم إبداعي كامل.

ابدأ الإبداع على PicassoIA
الأهم في قدرة Veo 3.1 على توليد الصوت ليس التقنية نفسها. بل ما تعنيه لمن يستطيع إنتاج محتوى فيديو عالي الجودة. كان التصميم الصوتي يتطلب أدوات مخصصة وخبرة متخصصة وغالبًا محترفًا منفصلًا. يختصر Veo 3.1 هذه العملية كلها في أمر نصي واحد.
يغيّر ذلك اقتصاديات إنتاج الفيديو بطريقة حقيقية وعملية. فصانع المحتوى على وسائل التواصل، وصاحب الأعمال الصغيرة، وصانع الأفلام المستقل، يستطيعون الآن إنتاج محتوى فيديو بصوت محيط بجودة احترافية دون استوديو صوت أو فنان Foley أو برنامج تحرير صوتي. ما كان يتطلب خط إنتاج لما بعد الإنتاج يمكن أن يحدث الآن في خطوة التوليد نفسها التي تُنتج الصورة.
يمنحك PicassoIA الوصول إلى Veo 3.1 وVeo 3.1 Fast إلى جانب أكثر من 87 نموذجًا آخر لتوليد الفيديو، بما في ذلك Kling v3 Video وWan 2.6 T2V وHailuo 02. يمكنك مقارنة المخرجات عبر النماذج، واختبار أساليب مختلفة للأوامر النصية، والعثور على المزيج المناسب لاحتياجاتك الإبداعية المحددة.
إذا لم تجرّب بعد توليد الفيديو بالذكاء الاصطناعي مع صوت أصلي، فالوقت مناسب الآن للبدء. اكتب وصفًا مفصّلًا للمشهد، وضمّن إشارات صوتية صريحة في أمرك النصي، وشاهد ما ينتجه Veo 3.1. كثيرًا ما تفاجئ النتائج حتى صنّاع الفيديو المتمرسين الذين اعتادوا قيود الأدوات السابقة.
الفجوة بين ما يستطيع الأمر النصي إنتاجه وما يتطلب إعداد إنتاج احترافيًا كاملًا تضيق بسرعة. ويُعد Veo 3.1 سببًا مهمًا في ذلك.
