في ما مضى، كان إنتاج فيديو بصوت مقنع يعني أحد أمرين: إما أن تستعين بمصمم صوت، أو ترضى بالصمت. غيّرت Google هذا مع Veo 3.1، وهو نموذج لتحويل النص إلى فيديو يولّد صوتًا متزامنًا ومتعدد الطبقات مباشرةً من الأمر النصي نفسه الذي تستخدمه لوصف المشاهد. لا أدوات منفصلة. لا مرحلة ما بعد الإنتاج. لا جلسة فولي. يأتي الصوت مدمجًا، دقيقًا على مستوى الإطار ومحددًا للبيئة منذ التوليدة الأولى.
يشرح هذا المقال بالتفصيل كيف يتعامل Veo 3.1 مع تصميم الصوت تلقائيًا: ما الذي يتكوّن منه الصوت فعليًا، وكيف يقرأ النموذج نصك بحثًا عن الإشارات الصوتية، وأين يقف مقارنةً بالنماذج المنافسة، وكيف يمكنك تطبيقه اليوم عبر PicassoIA.
ماذا يفعل Veo 3.1 فعليًا بالصوت
يعرف معظم الناس Veo 3.1 بوصفه أقوى نموذج من Google لتحويل النص إلى فيديو. ما يحظى بقدر أقل من الاهتمام أن محرك الصوت ليس ميزة ثانوية تُضاف فوق نموذج بصري فقط. يُولَّد الصوت والصورة معًا في عملية التشغيل نفسها، ويُدرَّب النموذج على بيانات فيديو وصوت مقترنة، بحيث يبقى ما تراه وما تسمعه متزامنين.
ليست خطوة منفصلة
كانت نماذج فيديو الذكاء الاصطناعي السابقة تتعامل مع الصوت كمهمة تأتي بعد التوليد. كنت تولّد الفيديو، ثم تمرّره عبر نموذج منفصل لتوليد الصوت. أنتج سير العمل المكوّن من خطوتين مشكلات مستمرة في التوقيت: خطوات تصل متأخرة بإطار، وصوت رياح ينقطع في منتصف المقطع، وحوار يبدو منفصلًا عن فم المتحدث.
يلغي Veo 3.1 هذا المسار بجعل الصوت مخرجًا أساسيًا من النموذج نفسه. تعالج البنية العلاقة الزمنية بين الحركة والصوت أثناء التدريب، فالباب الذي يُغلق في الإطار الثالث ينتج صدمته الصوتية في الإطار الثالث، لا في الخامس.
قراءة الأمر النصي بحثًا عن الإشارات الصوتية
عندما تكتب أمرًا نصيًا لنموذج Veo 3.1، يحلّل النموذج المعلومات البصرية والسمعية معًا في الوقت نفسه. يمنحه أمر مثل "عازفون في فرقة جاز يقدّمون عرضهم في حانة تحت الأرض مضاءة بالشموع، والمطر يتساقط في الخارج، وجمهور يتمتم" أربعة أهداف صوتية متميزة:
- موسيقى الجاز الحية بما فيها قسم الإيقاع والآلة القائدة والديناميكيات
- الصدى الصوتي للمكان الذي يشكّله قبو منخفض السقف بجدران من الطوب العاكس
- المطر على الزجاج ينتج ضوضاء بيضاء غير منتظمة في الترددات المتوسطة
- أجواء الحشد بمستوى أحاديث منخفض خلف الموسيقى
يطبّق النموذج هذه العناصر في طبقات، ويضيف معالجة صوتية تطابق البيئة الموصوفة. يتصرف صدى القبو السفلي بشكل مختلف عن قاعة الحفلات أو حمام مبلط. هذا الاستدلال الصوتي المكاني، حيث تشكّل الخصائص الفيزيائية للمكان الموصوف المخرجَ الصوتي، من أكثر جوانب نظام الصوت في Veo 3.1 فائدةً عمليًا.

الطبقات الصوتية الثلاث التي يولّدها Veo 3.1
يحمل كل فيديو ينتجه Veo 3.1 ثلاث طبقات صوتية متميزة. فهم كل واحدة منها يساعدك على كتابة أوامر أفضل وتوقّع المخرج بدقة.
الطبقة الأولى: الصوت المحيط
الصوت المحيط هو البصمة البيئية للمشهد. إنه ما يملأ المساحة الإدراكية ويخبر دماغ المشاهد بمكان تصوير الفيديو قبل أن يلاحظ ذلك بوعي. يستنتج Veo 3.1 الصوت المحيط من وصف المشهد بدرجة كبيرة من التحديد.
يُنتج مشهد الغابة زقزقة الطيور، وطنين الحشرات، وصوت الرياح بين الأوراق، والحضور منخفض التردد للهواء الطلق. ويُنتج شارع المدينة ضجيج المرور، وأصوات أبواق بعيدة، وخطى المشاة، وانعكاسات على واجهات المباني. ويُنتج مكتب فارغ في الليل طنين الإضاءة الفلورية، وصوت الاهتزاز الخفيف لنظام التهوية، والبصمة الصوتية لغرفة ذات جدران صلبة.
لا يلجأ النموذج إلى مقطع صوتي عام باسم "أجواء خارجية". بل يجمع مشهدًا صوتيًا متعدد الطبقات يطابق الموقع الموصوف، بما في ذلك طريقة اختلاف الانعكاسات الصوتية بين الفضاءات المفتوحة والمغلقة، وبين الغرف المكسوّة بالأثاث الناعم وتلك ذات الأسطح الصلبة.
الطبقة الثانية: الحوار والكلام
عندما يتضمن أمرك شخصيات تتحدث، يولّد Veo 3.1 صوت كلام متزامنًا مع حركة الفم المرئية. يمكنك تحديد نبرة الصوت، والحالة العاطفية، وسرعة الكلام، والطابع الصوتي للصوت في أمرك، ويستجيب النموذج لهذه الأوصاف.
يُنتج وصف "طبيب متعب يبلغ أسرة مريض بخبر صعب بهدوء في غرفة استشارات بالمستشفى" أداءً صوتيًا مختلفًا تمامًا عن "معلّق رياضي متحمس يعلن هدفًا في الثانية الأخيرة داخل ملعب مكتظ". يستنتج النموذج الحجم والإيقاع والثقل العاطفي وصدى الغرفة من هذه الأوصاف، ويبني أداءً صوتيًا يطابقها.
💡 نصيحة: حدّد الحالة العاطفية للكلام بعبارات ملموسة. فعبارة "يتحدث بإلحاح بصوت خافت" أو "يهمس بتردد مع فترات صمت طويلة" تنتج نتائج أدق من مجرد كتابة "يتحدث".
تنتج محاذاة مزامنة الشفاه، أي مطابقة الكلام المولّد لحركة الفم المرئية في الفيديو، مباشرةً من منهجية التدريب المزدوج. تعلّم النموذج العلاقة بين أشكال الفم وأصوات الفونيمات عبر آلاف الساعات من فيديو حقيقي.

الطبقة الثالثة: المؤثرات الصوتية والفولي
تغطي الطبقة الثالثة الأحداث الصوتية المنفصلة: خطى على أسطح مختلفة، وصدمات الأجسام، والأبواب، والآلات، والطقس، والحيوانات، والأجهزة المنزلية. في إنتاج الأفلام التقليدي، تُنتج هذه الأصوات فنانو الفولي في استوديوهات تسجيل مخصصة، فيطابقون الأصوات الفيزيائية مع الحركة على الشاشة إطارًا بإطار.
يولّد Veo 3.1 هذه الأصوات حسابيًا. تنتج شخصية تمشي على إسمنت مبلل خطوات ثقيلة ومكتومة قليلًا. والشخصية نفسها على أرضية خشبية جافة تنتج صوتًا أخف وأوضح مع محتوى أعلى في الترددات. يتتبع النموذج الخصائص المادية من الأمر النصي، ويطبّق البصمة الصوتية المناسبة على كل حدث صوتي.
يظهر التوقيت الزمني بوضوح أكبر في أصوات الفولي. يربط النموذج كل صدمة خطوة بالإطار الذي تلامس فيه القدم الأرض، لا بإيقاع خطوات متوسط. هذا الاهتمام بالتوقيت هو ما يميّز توليد الفولي في Veo 3.1 عن الأنظمة السابقة التي أنتجت أحداثًا صوتية بفواصل معقولة إحصائيًا دون دقة حقيقية على مستوى الإطار.
البنية التقنية وراء الصوت
لفهم سبب أداء الصوت في Veo 3.1 بهذه الجودة، نحتاج إلى نظرة موجزة على طريقة عمل مسار التدريب.
التدريب متعدد الوسائط على بيانات فيديو وصوت مزدوجة
الميزة الأساسية أن Veo 3.1 دُرِّب على كميات كبيرة من فيديو واقعي مقترن بصوته الأصلي، لا على فيديو وصوت دُرِّبا بشكل منفصل ثم جرى دمجهما لاحقًا في المعالجة. عندما يتعلم النموذج من بيانات مزدوجة، يتعلم العلاقة الإحصائية بين الأحداث البصرية والأحداث الصوتية في كل نقطة زمنية في الوقت نفسه.
والنتيجة نموذج استوعب كيف يبدو صوت جسم يصطدم بسطح مقارنةً بإطار الصدمة البصرية، وكيف ينبغي أن يبدو الكلام بالنظر إلى شكل الفم المرئي للمتحدث، وكيف يبدو مكان فيزيائي معين بالنظر إلى إشارات العمق البصرية في المشهد. هذه ليست تقديرات تُحسب بعد التوليد، بل خصائص مدموجة في أوزان النموذج عبر التدريب.

المحاذاة الزمنية
لا تُوضع الأحداث الصوتية في Veo 3.1 عند طوابع زمنية محتملة إحصائيًا. يحافظ النموذج على تطابق على مستوى الإطار بين الأحداث البصرية والصوتية طوال التوليد. تتزامن أصوات الصدمات مع الصدمات المرئية. ويتزامن الكلام مع حركة الشفاه المرئية. وتستجيب الأصوات المحيطة لتغيّر عمق المشهد، فتصل الأصوات من المصادر البعيدة أخفت وأكثر صدىً من الأصوات القريبة.
يتعامل النظام أيضًا مع الصوت خارج الشاشة. قد تظهر في الصوت سيارة تمر على حافة الإطار، أو هاتف يرن في غرفة مجاورة، حتى عندما لا يكون مصدر الصوت ظاهرًا في اللقطة. يستنتج النموذج موقع الأصوات وطبيعتها من البيئة الموصوفة كاملةً، لا مما يظهر على الشاشة فقط.
جودة مخرج الصوت
ينتج Veo 3.1 الصوت بمستويات جودة مناسبة للاستخدام المباشر في النشر الرقمي. يصمد الصوت عند تشغيله على مكبرات مراقبة احترافية دون الطنين أو انحراف الطبقة أو تشويه القص، وهي عيوب طبعت تاريخيًا الصوت المولّد بالذكاء الاصطناعي بطابع اصطناعي. ومع مخرج فيديو بدقة 1080p، يصبح الملف الكامل جاهزًا للإنتاج في معظم تطبيقات الويب والتواصل الاجتماعي والبث.
كيفية استخدام Veo 3.1 على PicassoIA
يعمل Veo 3.1 على PicassoIA في ثلاثة إصدارات: Veo 3.1 القياسي، وVeo 3.1 Fast للتكرار السريع، وVeo 3.1 Lite للتوليد بكميات كبيرة وبتكلفة أقل. قدرات الصوت فعّالة في الإصدارات الثلاثة.
أنماط الأوامر التي تنتج صوتًا أفضل
تتناسب جودة مخرج الصوت في Veo 3.1 طرديًا مع مقدار المعلومات السمعية التي تضمّنها في الأمر النصي. الأمر الذي يصف المحتوى البصري وحده سينتج صوتًا، لكن الأمر الذي يصف ما تراه وما تسمعه معًا ينتج نتائج أغنى بكثير.
أمر ضعيف: "رجل يمشي عبر محطة قطارات."
أمر قوي: "رجل يرتدي معطفًا من الصوف يمشي بخطوات سريعة عبر محطة قطارات مزدحمة في ساعة الذروة، وحذاؤه الجلدي يتردد صداه على أرضيات الرخام، وإعلانات المكبرات تعلن المغادرات فوق الرؤوس، وهدير قطار يغادر على رصيف قريب، وصوت عجلات حقائب المسافرين وأحاديثهم المكتومة يملأ المكان."
يمنح الأمر الثاني النموذج سبعة أهداف صوتية متميزة. يساهم كل منها في مسار صوتي أكثر تحديدًا وطبقات أغنى. والفرق في جودة المخرج بين الأمرين مسموع فورًا.

اختيار الإصدار المناسب
| الإصدار | السرعة | الأفضل لـ | جودة الصوت |
|---|
| Veo 3.1 | قياسية | المخرج النهائي، والمشاهد الصوتية المعقدة | الأعلى |
| Veo 3.1 Fast | أسرع 2-3 مرات | تكرار الأوامر، والاختبارات السريعة | عالية |
| Veo 3.1 Lite | سريعة | الدفعات كبيرة الحجم | جيدة |
بالنسبة للمشاهد التي تضم مصادر صوتية متعددة في وقت واحد أو بيئات صوتية معقدة، ينتج Veo 3.1 القياسي أدق تركيبة من الطبقات. استخدم Veo 3.1 Fast لاختبار صياغة الأمر وتحسينها قبل الالتزام بتوليد بجودة كاملة.
تنزيل المخرج واستخدامه
يُدرج كل فيديو يولّده Veo 3.1 على PicassoIA مسار الصوت مدمجًا مباشرةً في ملف MP4. لا توجد خطوة تنزيل منفصلة للصوت ولا حاجة إلى مازج صوتي. يمكنك نقل ملف المخرج مباشرةً إلى برنامج تحرير الفيديو للتجميع النهائي، أو نشره كما هو عندما يلبي المحتوى المولّد معاييرك.
Veo 3.1 مقابل نماذج أخرى تدعم الصوت
ليس Veo 3.1 نموذج فيديو الذكاء الاصطناعي الوحيد الذي يتضمن صوتًا مدمجًا، لكنه يتعامل مع تصميم الصوت بطريقة مختلفة عن منافسيه الرئيسيين. إليك مقارنته بثلاثة بدائل قوية متاحة على PicassoIA.

مقارنة مع Seedance 2.0
يولّد Seedance 2.0 من ByteDance صوتًا مدمجًا مع فيديو سريع وذي حركة عالية. ومحرك الصوت فيه مناسب بشكل خاص للمحتوى النشط حيث تتتابع أصوات متعددة بسرعة. في المشاهد الرياضية، ومشاهد الحركة، أو الإعلانات التجارية عالية الطاقة، غالبًا ما ينتج Seedance 2.0 نتائج أكثر تأثيرًا لأنه يعطي الأولوية للخصائص الإيقاعية والقرعية للصوت.
يتفوق Veo 3.1 عليه في المشاهد التي تتطلب فروقًا عاطفية دقيقة، أو حوارًا هادئًا، أو بيئات صوتية محيطة متعددة الطبقات حيث تكون الدقة أهم من الطاقة.
💡 متى تستخدم Seedance 2.0 بدلًا من ذلك: الرياضة عالية الطاقة، والحركة السريعة، أو الإعلانات التجارية المفعمة بالحيوية حيث تكون القوة الصوتية أهم من الواقعية المحيطة.
مقارنة مع Pixverse v6
يجمع Pixverse v6 بين جودة بصرية سينمائية وصوت ذكاء اصطناعي درامي. بالنسبة للمحتوى الذي يحتاج إلى لوحة صوتية مرتفعة المستوى ومسرحية، تشمل نغمات أوركسترالية وتأكيدًا صوتيًا دراميًا، يُعد Pixverse v6 خيارًا جذابًا.
ينتج Veo 3.1 صوتًا أكثر طبيعية لا يدفع نحو الدراما المصطنعة. إذا كان هدفك واقعية على طريقة الأفلام الوثائقية بدلًا من التضخيم السينمائي، فإن Veo 3.1 هو الخيار الأنظف.
مقارنة مع Wan 2.2 S2V
يعكس Wan 2.2 S2V سير العمل المعتاد. فبدلًا من استنتاج الصوت من أمر بصري، يقبل مسار صوت موجودًا ويولّد فيديو متزامنًا معه. وهذا يجعله مثاليًا للمحتوى القائم على الموسيقى، أو عندما يكون لديك صوت بالفعل وتحتاج إلى مرئيات تُبنى حوله.
يعمل Veo 3.1 في الاتجاه المعاكس، فيولّد الصوت من وصف بصري. النموذجان يخدمان سيرَي عمل متكاملين. للإنشاء الكامل من الصفر بالأوامر النصية، يتفوق Veo 3.1. أما لتحريك مشهد حول صوت موجود، فإن Wan 2.2 S2V هو الأداة المناسبة.
نصائح الأوامر الصوتية التي تحقق نتائج
الحصول على صوت عالي الجودة من Veo 3.1 مهارة يمكن تعلمها. تنتج هذه الأساليب المحددة نتائج أفضل باستمرار.
صِف الغرفة، لا الموضوع فقط
يعتمد الطابع الصوتي لأي مكان على خصائصه الفيزيائية: الحجم، ومواد الأسطح، وكثافة الأثاث، ودرجة الانفتاح. تسمية هذه الخصائص تزوّد النموذج بالمعلومات اللازمة لتطبيق الصدى الصحيح، وملف الانعكاس، وأرضية الضوضاء المحيطة.
تحمل عبارة "مكتبة هادئة" معنى مختلفًا جوهريًا عن "مقهى مزدحم"، حتى لو كان في المشهدين شخص يتحدث في المقدمة. تشير المكتبة إلى أسطح ناعمة، وصمت شبه تام، وتحفظ. ويشير المقهى إلى أسطح صلبة، وأحاديث متداخلة متعددة، وأصوات آلة إسبريسو، وموسيقى خلفية. تظهر كلتا التفاصيل في الصوت.
سمِّ النبرة العاطفية
أوصاف مثل "متوتر"، و"مبهج"، و"حزين"، و"قلِق" لا تشكّل الموسيقى الخلفية التي قد يولّدها النموذج فحسب، بل تشكّل اللوحة الصوتية كلها. تميل المشاهد المتوترة إلى إنتاج تفاصيل متفرقة عالية الترددات ودفء منخفض الترددات ضئيل. وتنتج المشاهد المبهجة صوتًا أكثر امتلاءً ودفئًا مع نشاط خلفي أكثر حيوية. يستخدم النموذج الأوصاف العاطفية كإشارات مزج صوتي شاملة.

تجنب التناقضات الداخلية
إذا وصفت "مرآبًا صامتًا ومهجورًا" ثم ذكرت "حشدًا يحتفل"، فإن النموذج يحل التناقض بترجيح الإشارات البصرية المهيمنة. لن تحصل على ما توقعت. حافظ على تماسك السياق الصوتي داخل أمرك بالكامل. إذا تغيّر المشهد صوتيًا بشكل كبير بين بدايته ونهايته، فأشر إلى ذلك كتغيّر زمني في الوصف لا كتناقض ثابت.
قاعدة مادة السطح
كلما تلامس شخصية أو جسم سطحًا ماديًا، حدّد المادة. فعبارات مثل "خطى على الحصى"، و"كوب زجاجي يسقط على البلاط"، و"قبضة تضرب طاولة خشبية" تمنح النموذج الخصائص المادية اللازمة لتوليد نتيجة صوتية دقيقة. الأسطح غير المحددة تنتج أصواتًا عامة من الناحية الصوتية. وكلما سمّيت خصائص مادية أكثر، أصبح تصميم الصوت أكثر تحديدًا من الناحية الفيزيائية.
استخدامات حقيقية تستحق المعرفة
تختلف القيمة العملية لتصميم الصوت التلقائي في Veo 3.1 حسب نوع المحتوى الذي تنتجه.
وسائل التواصل الاجتماعي والمحتوى القصير
بالنسبة لصناع المحتوى الذين يعملون في الفيديو القصير، يزيل Veo 3.1 الحاجة إلى بحث صوتي منفصل، أو ترخيص موسيقى من مكتبة، أو مكتبة مؤثرات صوتية. مقطع مدته 5 ثوانٍ لصب القهوة، أو أمواج تتكسر على الشاطئ، أو مطر على نافذة يصل بمشهد صوتي كامل ومحدد. وعلى المنصات المحمولة حيث يكون الصوت مفعّلًا افتراضيًا لدى معظم المستخدمين، غالبًا ما تكون هذه الطبقة الصوتية هي ما يوقف التمرير.

التسويق والإنتاج التجاري
تستفيد العلامات التي تحتاج إلى كميات كبيرة من المحتوى المرئي بجودة صوت ثابتة من سير عمل Veo 3.1 القائم على أمر واحد. يمكن لأمر واحد مفصّل أن ينتج عدة نسخ من مفهوم حملة واحد ببيئات صوتية مختلفة، ما يتيح اختبارات A/B دون تكلفة إنتاج إضافية. لقطات المنتجات مع أجواء نمط الحياة، ومقاطع الشهادات المعتمدة على الحوار، والأفلام التعريفية بالعلامة ذات الأجواء كلها ممكنة ضمن منصة واحدة.
التصور المسبق للأفلام
في تطوير الأفلام الاحترافي، يتضمن التصور المسبق إنشاء تقريبات أولية للمشاهد قبل الالتزام بميزانيات الإنتاج الكاملة. يتيح Veo 3.1 التصور المسبق الشامل للصوت، حيث يمكن للمخرجين سماع نسخة تقريبية من التصميم الصوتي للمشهد إلى جانب الفكرة البصرية. وبالنسبة للمشاهد التي يكون فيها الصوت محوريًا للتأثير العاطفي، ومنها مشاهد الرعب، واللحظات الدرامية الرقيقة، أو المشاهد المدفوعة بالموسيقى، تغيّر هذه القدرة بشكل كبير ما يستطيع التصور المسبق إيصاله لفرق الإنتاج.
💡 نصيحة احترافية: استخدم Veo 3.1 Fast للتكرارات السريعة في التصور المسبق، والقياسي Veo 3.1 للعروض المصقولة أمام أصحاب القرار.

الوثائقي والتعليمي
تستفيد الأفلام الوثائقية والفيديوهات التعليمية من صوت محيط طبيعي يُرسّخ المقاطع في أماكن تبدو حقيقية. مع Veo 3.1، يمكن لفيلم وثائقي عن علم الأحياء البحرية أن يعرض مشهدًا تحت الماء بضغوط صوتية منخفضة التردد مناسبة، وفقاعات، وتموّج محيط مكتوم دون أي تسجيل ميداني. ويمكن لفيديو تعليمي عن روما القديمة أن يعرض مشهد منتدى بضجيج الحشود، وصوت صنادل على الحجر، والخصائص الصوتية لمساحة عامة مفتوحة.
ابدأ بأمر واحد
Veo 3.1 متاح على PicassoIA إلى جانب Veo 3.1 Fast، و Veo 3.1 Lite، و Seedance 2.5، و Kling v3، و Pixverse v6، و Flux 3، وأكثر من مئة نموذج آخر لتحويل النص إلى فيديو. تعمل جميعها عبر الواجهة نفسها، لذا يستغرق التبديل بينها للمقارنة ثوانٍ لا ساعات.
اكتب أمرًا نصيًا واحدًا مفصّلًا وولّد أول فيديو لك باستخدام Veo 3.1 اليوم. ضمّن مادة سطح واحدة، ووصف غرفة واحدًا، ونبرة عاطفية واحدة. شغّل النتيجة مع الصوت. لاحظ كيف تظهر التفاصيل الصوتية من أمرك في المخرج. الفجوة بين ما تكتبه وما تسمعه أصغر مما يتوقعه معظم الناس، وتصبح أصغر كلما وصفت العالم الذي تريد من النموذج أن يسمعه بدقة أكبر.
المكتبة الكاملة للنماذج موجودة على picassoia.com/en/all-models.
