وصل Veo 3.1 من Google بادعاء تعثّرت فيه أغلب أدوات الفيديو بالذكاء الاصطناعي: صوت ينتمي فعلًا إلى الفيديو الذي يرافقه. ليس صوتًا معالَجًا لاحقًا، ولا مُضافًا من نموذج منفصل. صوت يُولَّد أصليًا، ومتزامنًا، كجزء من المخرج الموحّد نفسه. هذا فرق حقيقي، وبعد تجربة Veo 3.1 على عشرات الأوامر النصية التي تغطي البيئات الخارجية والحوار والموسيقى والمشاهد الصوتية المعقّدة، إليك ما يبدو عليه فعلًا.
ماذا يعني "الصوت الأصلي" فعلًا؟

تعمل أغلب مولّدات الفيديو بالذكاء الاصطناعي في مرحلتين منفصلتين. أولًا، ينتج نموذج انتشار الفيديو الإطارات البصرية. ثم يُضيف نموذج صوت منفصل أو محرّر بشري الصوت لاحقًا. هذا المسار يُنتج الانفصال الذي لاحظته غالبًا في كثير من فيديوهات الذكاء الاصطناعي: خطوات تصل متأخرة عن الإيقاع، ورياح لا تطابق شدة اهتزاز الأغصان، أو حوار يبدو مسجّلًا في حمّام حتى حين يُظهر المشهد حقلًا مفتوحًا.
يسلك Veo 3.1 مسارًا معماريًا مختلفًا. يُولَّد الصوت والفيديو معًا، أي أن النموذج يفهم بشكل مشترك ما يحدث بصريًا وكيف ينبغي أن يبدو صوت المشهد. النتيجة ليست مثالية دائمًا، لكنها مختلفة فعلًا بطريقة يمكن سماعها.
الطريقة القديمة مقابل الطريقة الجديدة
| الأسلوب | مصدر الصوت | التزامن | سقف الجودة |
|---|
| تراكب بعد المعالجة | نموذج صوت منفصل | مطابقة يدوية أو آلية | محدود بالفجوة بين النموذجين |
| التوليد المشترك الأصلي | النموذج نفسه، في التمريرة نفسها | متأصل | مرتبط بسياق الفيديو |
الجدول أعلاه بسيط، لكنه يلتقط جوهر المفاضلة. التوليد الأصلي لا يضمن صوتًا أفضل، لكنه يضمن صوتًا أكثر تماسكًا.
لماذا كان التزامن الجزء الأصعب
التزامن ليس مشكلة توقيت فقط. إنه مشكلة دلالية. عندما يُغلق باب بعنف في الفيديو، يحتاج نموذج الصوت إلى معرفة ليس فقط متى يحدث الإغلاق، بل أيضًا نوع الباب، ومدى ثقله في الصوت، والبصمة الصوتية للغرفة، ومدى علو صوت الإغلاق مقارنةً بالخلفية المحيطة. تحقيق كل ذلك بدقة يتطلب أن يفهم نموذج الصوت محتوى الفيديو فعلًا، لا أن يطابق الموجات الصوتية مع الطوابع الزمنية فقط.
💡 ما الذي يستحق الانتباه: في أوامر Veo 3.1 الخاصة بك، صِف البيئة الصوتية بوضوح. عبارة مثل "ممر رخامي بصدى" أو "خلفية مقهى خارجي خافتة" ستدفع الصوت الأصلي نحو نتيجة أكثر تحديدًا ودقة.
الاستماع الأول: جودة الأصوات المحيطة

الأصوات المحيطة هي المجال الذي يُبهر فيه Veo 3.1 بأكبر قدر من الثبات. البيئات الخارجية تستفيد تحديدًا من نهج التوليد الأصلي، لأن جزءًا كبيرًا مما يجعل الصوت الخارجي حقيقيًا هو تراكب أصوات متعددة في وقت واحد: رياح تمر عبر مواد مختلفة، وحركة مرور بعيدة، وطيور على مسافات متفاوتة، والهمهمة المنخفضة لتغيّر ضغط الهواء.
البيئات الخارجية
أنتج اختبار أمر لمشهد غابة صوتًا تضمّن بشكل صحيح تغريد الطيور، وحفيف الأوراق الخفيف مع مرور نسيم في الكادر، ومصدر ماء بعيد. لم يُطلب أيٌّ من هذه الأصوات صراحةً، بل استُنتجت من المحتوى البصري. تلك هي النتيجة الأبرز: يقرأ Veo 3.1 المشهد ويملأ الواقع الصوتي دون أن يُطلب منه ذلك.
أعطت مشاهد المطر نتائج قوية بشكل خاص. صوت المطر على أسطح مختلفة، كالخرسانة والعشب وسقيفة قماشية، اختلف بشكل مناسب في كل مشهد حتى مع تطابق الأمر النصي. هذا المستوى من الصوت المرتبط بالمادة شيء يحتاج نموذج صوت منفصل إلى تعليمات صريحة لتقليده.
المشاهد الداخلية وصدى الغرفة
الصوت الداخلي أصعب. صدى الغرفة، أي أرضية الضوضاء الأساسية لأي مساحة مغلقة، من الأشياء التي يقضي مهندسو الصوت المحترفون وقتًا طويلًا عليها لأنها غير مرئية إلى أن تخطئ. في الاختبار، تعامل Veo 3.1 مع المساحات الكبيرة ذات الأصداء بشكل جيد. أنتج مشهد كاتدرائية رنينًا منخفض التردد مقنعًا مع انعكاسات مبكرة طبيعية.
كانت الغرف الصغيرة المعالجة صوتيًا أقل نجاحًا. أنتجت بعض المخرجات تأثير "الحمّام" الخفيف، وهو صدى زائد خفي لكنه ملحوظ، جعل المشاهد الحميمية تبدو كبيرة قليلًا. هذا لا يفسد المخرج، لكنه مسموع لأي شخص عمل مع تسجيلات غرف حقيقية.
الكلام والحوار

الحوار هو القسم الذي تصبح فيه الانطباعات الأولى معقّدة. يستطيع Veo 3.1 توليد كلام مفهوم من أوامر وصفية، وهذا إنجاز كبير أصلًا. لكن الكلام هو أيضًا المكان الذي تكون فيه الفجوة بين صوت الذكاء الاصطناعي والتسجيل الصوتي الاحترافي أوضح ما يكون.
ما مدى وضوح الحوار؟
في الاختبارات مع أوامر حوار واضحة وبسيطة (مذيع أخبار يتحدث مباشرةً إلى الكاميرا، ومرشد سياحي يعطي تعليمات في الخارج)، كانت قابلية الفهم عالية. كانت الكلمات واضحة، وكان الإيقاع طبيعيًا، وتطابقت الطاقة مع المشهد الموصوف.
تظهر الصعوبة في سيناريوهات الكلام الأكثر تعقيدًا: حوار سريع متبادل بين شخصيتين، أو كلام بمدى عاطفي واسع، أو حوار يتداخل مع ضوضاء محيطة عالية. في هذه الحالات، انخفض الوضوح، وفي بعض الحالات القليلة كان من الصعب تمييز كلمات بعينها.
الخلاصة: بالنسبة للسرد والمونولوج والحوار المُعدّ بوضوح، فإن توليد الكلام في Veo 3.1 قابل للاستخدام فعلًا. أما حوارات المشاهد المتعددة الشخصيات المعقدة، فما زال عملًا قيد التطوير.
دقة اللهجة والنطق
كان سلوك اللهجات غير متسق. طلب شخصية بلهجة إقليمية محددة أحيانًا أنتج تقريبًا مقنعًا، وأحيانًا أنتج صوتًا عامًا مع بعض التنغيمات الزخرفية. هذا ليس مقتصرًا على Veo 3.1، إذ يؤثر في معظم نماذج توليد الصوت، لكنه أمر يستحق المعرفة عند التخطيط لإنتاجات تعتمد على تمثيل صوتي إقليمي أصيل.
💡 نصيحة عملية: إذا كانت دقة اللهجة مهمة لإنتاجك، فولّد عدة إصدارات من الأمر نفسه واختر أفضلها. يتيح لك Veo 3.1 على PicassoIA التكرار بسرعة دون إعادة بناء الإعداد كاملًا من الصفر.
الموسيقى والتأليف الموسيقي

كانت الموسيقى الخلفية في فيديوهات الذكاء الاصطناعي تاريخيًا الحلقة الأضعف. تنتج أغلب النماذج موسيقى إما غير متوافقة مع المزاج البصري لنغميًا، أو مربكة زمنيًا، مع تغيّرات في الأوتار وإيقاعات لا تتوافق مع الحركة على الشاشة.
مطابقة المزاج
يتعامل Veo 3.1 مع المزاج بشكل أفضل بكثير من النماذج السابقة. أنتج مشهد خارجي بحركة بطيئة لعشب طويل يتمايل مع الريح مقطوعة موسيقية هادئة وبسيطة بلا كلمات، بتباعد توافقي مناسب. وأنتج مشهد شارع حضري ليلًا خلفية غنية بالجهير وكثيفة الإيقاع، تطابقت مع طاقة الإيقاع البصري.
يبدو أن النموذج يقرأ إيقاع المشهد البصري وتركيبة الألوان وكثافة المشهد ليستنتج الطابع الموسيقي المناسب. هذا تخمين مبني على المخرجات، لكن الاتساق عبر أوامر متنوعة يوحي بأنه ليس صدفة.
الإيقاع ومحاذاة الضربات
محاذاة الضربات للأحداث البصرية هي المشكلة الأصعب، و Veo 3.1 لم يصل إليها بالكامل بعد. في تسلسلات الحركة، تتبّع إيقاع الموسيقى الطاقة العامة للمشهد، لكن ضربات الإيقاع المحددة نادرًا ما تتطابق مع القطعات البصرية أو ذروات الحركة. بالنسبة لأغلب التطبيقات، هذا مقبول. أما في المحتوى الشبيه بالفيديو الموسيقي حيث تكون المحاذاة الدقيقة مهمة، فستحتاج المخرجات الحالية إلى تعديل يدوي في ما بعد الإنتاج.
يُصيب النموذج النوع والطابع، لكنه لم يُصب الإيقاع بدقة بعد.
كيف يقارن بالنماذج الأخرى

لوضع Veo 3.1 في سياقه، يجب النظر إلى ما تنتجه نماذج الفيديو الأخرى ذات الصوت الأصلي حاليًا، لأن المجال تحرك بسرعة.
Veo 3.1 مقابل Veo 3
كان Veo 3 أول نموذج من Google يقدّم توليد الصوت الأصلي، وكان بداية مهمة. أما Veo 3.1 فيطوّر هذا الأساس بدلًا من إعادة كتابته. أصبحت جودة الصوت المحيط أكثر اتساقًا بشكل ملحوظ. وتحسّن وضوح الحوار في الأوامر متوسطة التعقيد. مشكلة صدى الغرف الداخلية موجودة في الاثنين، لكنها أخف قليلًا في 3.1.
إذا كنت تستخدم حاليًا Veo 3 Fast للتوليدات السريعة، فإن Veo 3.1 Fast وVeo 3.1 Lite يقدمان مستوى السرعة نفسه مع بنية الصوت المحدثة في الأساس.
Veo 3.1 مقابل Seedance 2.0
Seedance 2.0 وشقيقه الأصغر Seedance 2.0 Mini كلاهما نموذجان قادران على الصوت الأصلي من ByteDance. في اختبار جنبًا إلى جنب على أوامر متكافئة، أنتج Seedance 2.0 صوتًا بوضوح أعلى قليلًا في الترددات العالية، بينما قدّم Veo 3.1 محتوى محيطيًا منخفض التردد أكثر إقناعًا. لا يتفوق أحدهما بشكل قاطع؛ فكل واحد يناسب حالات استخدام مختلفة.
بالنسبة للمحتوى الذي يعتمد على الكلام بشكل كبير، كانت النتائج قريبة بما يكفي بحيث لن يلاحظ الفرق شخص غير متخصص. أما للعمل السينمائي الصوتي المحيط بحتًا، فيتفوق Veo 3.1 بقليل في مصداقية الترددات المنخفضة.
Veo 3.1 مقابل Sora 2
يقدّم Sora 2 من OpenAI أيضًا توليد صوت متزامن. تظل جودته البصرية في التسلسلات الطويلة قوية، لكن اختبارات Sora 2 للصوت أظهرت توليدًا موسيقيًا أكثر اتساقًا، على حساب طبقة صوتية محيطة أقل إقناعًا. النموذجان يخدمان ملفات إنتاج مختلفة.
من النماذج الأخرى التي تستحق التجربة في الموضوع نفسه Pixverse v6، الذي يقدم فيديو سينمائيًا مع صوت بالذكاء الاصطناعي، وFlux 3 لتوليد الصوت المتزامن بدقة عالية. وللفرق التي تريد أسرع تكرار ممكن، يستحق Seedance 2.5 نظرة أيضًا.
كيفية استخدام Veo 3.1 على PicassoIA

يتيح لك PicassoIA الوصول المباشر إلى Veo 3.1 دون أي إعداد لواجهة API أو إدارة لبطاقة ائتمان خارج حسابك. إليك كيفية الحصول على صوت نظيف من المحاولة الأولى.
خطوة بخطوة
- افتح Veo 3.1 على PicassoIA
- اكتب أمرك النصي، متضمنًا الوصف البصري والوصف الصوتي الصريح معًا
- حدّد الدقة المطلوبة (1080p متاحة)
- أرسل التوليد وانتظر المخرج، الذي يُسلّم الفيديو والصوت كملف موحد واحد
- عاين الصوت في المشغّل المدمج قبل التنزيل
- إذا كان وضوح الصوت منخفضًا، فعدّل التفاصيل الصوتية في أمرك وأعد التوليد
للتنويعات والمقارنات، جرّب أيضًا Veo 3.1 Lite لتكرارات أسرع بدقة أقل قليلًا، أو Veo 3.1 Fast عندما تكون السرعة أهم من أقصى جودة.
نصائح للأوامر من أجل صوت أفضل

تتأثر جودة الصوت الأصلي في Veo 3.1 مباشرةً بمدى دقة وصفك للبيئة الصوتية في أمرك. إليك الأنماط الأكثر فعالية من الاختبار:
- سمِّ الفضاء الصوتي: "حمّام صغير مبلّط" مقابل "ردهة رخامية كبيرة" ينتجان صدى غرفة مختلفًا تمامًا
- رتّب طبقات الأصوات: صِف عناصر الصوت الأساسية والثانوية والخلفية بشكل منفصل داخل الأمر نفسه
- استخدم لغة المسافة والحجم: "حركة مرور بعيدة"، و"همهمة حشد قريب"، و"نقرة قلم من مسافة قريبة" تمنح النموذج إشارات مكانية
- صِف المزاج صوتيًا: "المشهد يبدو خافتًا وقريبًا، كأن الهواء ثقيل" سيدفع نحو صوت أهدأ وأكثر حميمية
- حدّد خصائص الكلام: "راوٍ واثق وغير مستعجل" مقابل "أسلوب سريع ومتحمس" سيشكّل النبرة والإيقاع
💡 اختبار سريع: خذ أي أمر استخدمته من قبل دون وصف صوتي، وأضف ثلاث جمل تحديدًا عن صوت المشهد، ثم قارن المخرجات. الفرق في تماسك الصوت يكون عادةً كبيرًا.
ما الذي ما زال يحتاج إلى تطوير

الصراحة بشأن القيود أنفع من التفاؤل، لذلك إليك المجالات المحددة التي لا يرقى فيها الصوت الأصلي في Veo 3.1 بعد إلى معايير الإنتاج الاحترافي.
عيوب الصوت
كانت أكثر مشكلة متكررة في الاختبار تشوّهًا خفيفًا لكنه مسموع ناتجًا عن الضغط يظهر في المحتوى ذي الترددات العالية، وأكثر ما يُلاحظ في المشاهد التي تضم إيقاعات معدنية، أو الحروف الساكنة الحادة في الكلام، أو أصوات محيطة حادة الطبقة مثل الحشرات ليلًا. ليست هي الطابع المهيمن للصوت، لكنها موجودة. من يستخدم المخرج في سياق احترافي سيحتاج إلى تشغيل تمريرة خفيفة لتقليل الضوضاء واسعة النطاق قبل التسليم.
يظهر عيب ثانٍ عند حدود مقاطع الصوت في المقاطع الأطول. استمرارية الصوت الأصلي في Veo 3.1 عبر المقاطع الممتدة جيدة لكنها ليست سلسة تمامًا. عند نقطة انتقال النموذج بين مقاطعه الداخلية، يحدث أحيانًا عدم اتساق خفيف في الملمس، شبيه بوصلة تلاشٍ متدرج خافتة.
المشاهد الصوتية المعقّدة
أنتجت الأوامر التي وصفت بيئات صوتية معقدة فعلًا (سوق خارجي مزدحم في مدينة ممطرة، أو ملعب تتداخل فيه هتافات الجمهور والموسيقى الحية وإعلانات مكبرات الصوت في الوقت نفسه) مخرجات كانت فيها العناصر الفردية قابلة للتمييز، لكن التراكب بدا مسطحًا قليلًا. الأصوات كانت موجودة، لكن التموضع المكاني وعلاقات الحجم النسبي لم تكن مقنعة بالكامل.
هذا جزئيًا قيد من قيود الطليعة، وجزئيًا تحدٍ في الأوامر. وصف المشاهد الصوتية المعقدة نصيًا صعب فعلًا، والنموذج يبذل قصارى جهده مع مدخلات غامضة بطبيعتها.
ما يساعد: قسّم المشاهد الصوتية المعقدة إلى طبقات مرتبة حسب الأولوية في أمرك. ابدأ بالصوت المهيمن، ثم أضف الأصوات الثانوية، ثم حدّد الخلفية. إعطاء النموذج تسلسلًا هرميًا واضحًا يعمل به ينتج مخرجات أكثر إقناعًا من وصف كل شيء بالتفصيل نفسه.
ثلاث طبقات صوتية محددة ومرتبة بوضوح حسب البروز تتفوق باستمرار على فقرة واحدة كثيفة تصف كل شيء دفعة واحدة.
جرّبه بنفسك

الانطباعات الأولى من الاختبار لها حدود واضحة. طبيعة جودة الصوت ذاتية بما يكفي لدرجة أن أذنيك أنت، على أنواع المحتوى الخاصة بك، هما الاختبار الموثوق الوحيد.
يمنحك Veo 3.1 على PicassoIA الوصول إلى توليد الصوت الأصلي الآن، دون أعباء إعداد. إذا كنت تنتج محتوى يعتمد على الأجواء الصوتية المحيطة أو التعليق الصوتي أو المشاهد الصوتية الطبيعية، فهو يستحق تقييمًا حقيقيًا على حالات استخدامك الفعلية.
للمقارنة، شغّل الأمر نفسه عبر Veo 2 (الذي لا يملك صوتًا أصليًا) واستمع إلى الفرق الذي يحدثه التوليد الأصلي على المستوى البنيوي. ثم قارن مخرج Veo 3.1 مع Hailuo 02 أو Grok Imagine Video 1.5 لترى كيف يقف المجال الحالي عبر المزوّدين.
تغطي النماذج المتاحة على PicassoIA المدى الكامل لما هو ممكن حاليًا في توليد الفيديو بالذكاء الاصطناعي. نماذج الفيديو ذات الصوت الأصلي ما زالت تطورًا حديثًا، لكن الفجوة بين أفضل المخرجات اليوم وحيث يبدأ ما بعد الإنتاج الاحترافي تضيق أسرع مما توقعه معظم الناس في المجال.
ابدأ بأمر تعرف شكله بصريًا، وأضف وصفًا صوتيًا محددًا، وشاهد ما يعود به. الصوت في المخرج سيخبرك بأكثر مما يخبرك به أي مقال انطباعات أولى.