توليد الصوت في Veo 3.1: فيديوهات الذكاء الاصطناعي بصوت وحوار
Veo 3.1 هو أقوى نموذج لتحويل النص إلى فيديو من Google، وميزته المميزة هي توليد الصوت الأصلي. يشرح هذا المقال كيف ينتج النموذج حوارًا متزامنًا وأصواتًا محيطة ومؤثرات صوتية مباشرةً من الأوامر النصية، مع خطوات تفصيلية للحصول على أفضل النتائج الغنية بالصوت، وحالات استخدام واقعية في صناعة المحتوى والتسويق والأفلام السردية.
كانت فيديوهات الذكاء الاصطناعي تبدو متشابهة لفترة من الزمن. حركة سلسة، وصور جميلة، ثم صمت. أو الأسوأ، مقطع موسيقي عام خالٍ من حقوق الملكية يُضاف في المونتاج. يغيّر Veo 3.1 هذه المعادلة تمامًا. يُنتج نموذج توليد الفيديو الأحدث من Google صوتًا متزامنًا بشكل أصلي كجزء من عملية التوليد نفسها، وليس كفكرة لاحقة. الحوار والأصوات المحيطة وخطوات الأقدام والطقس وضجيج الحشود، كلها تخرج من النموذج جنبًا إلى جنب مع الإطارات. هذا التحوّل من فيديو الذكاء الاصطناعي الصامت إلى فيديو الذكاء الاصطناعي بصوت وحوار مهم جدًا لكل من ينتج محتوى فيديو على نطاق واسع.
ما الذي يختلف فعلًا في Veo 3.1
تُخرج معظم نماذج تحويل النص إلى فيديو ملفات فيديو. هذا كل شيء. تكتب أمرًا نصيًا فتحصل على صور متحركة، ثم تحلّ مشكلة الصوت بنفسك في مرحلة تحرير منفصلة وبأداة منفصلة. بُني Veo 3.1 على فلسفة مختلفة منذ البداية: الفيديو والصوت ناتج واحد يُولَّد معًا، ويستند الاثنان إلى الأمر النصي نفسه.
هذه ليست طبقة صوت تُضاف بعد المعالجة. يعالج النموذج أمرك النصي ويولّد المسار المرئي والمسار الصوتي في وقت واحد، مع أصوات تطابق ما يحدث على الشاشة. سيُنتج الأمر الذي يصف شخصًا يمشي على الحصى ليلًا صوت طقطقة الحصى تحت القدمين، والأصوات المحيطة بالليل، ومشهد تلك اللحظة متزامنًا معها.
هذا مهم لأن:
مشكلات تزامن الصوت التي تُصيب الصوت المضاف يدويًا تختفي تمامًا
الصوت المحيط يبدو أصيلًا ومناسبًا للمشهد دون جهد إضافي
يبقى الحوار متزامنًا مع حركة الفم تلقائيًا
يقل وقت ما بعد الإنتاج بشكل كبير للمحتوى القصير
تستند البنية الأساسية إلى نهج Google متعدد الوسائط من أبحاثها حول Gemini، حيث تُتعلَّم تمثيلات الصوت والصورة معًا بدلًا من فصلهما. والفرق هو بين نموذج يعرف شكل الأشياء ونموذج يعرف كيف تبدو الأشياء وكيف تُسمع وكيف تُحَسّ في آنٍ واحد.
الصوت الأصلي: أكثر من ضوضاء خلفية
حين يسمع الناس عبارة "توليد الصوت بالذكاء الاصطناعي" يتخيلون غالبًا موسيقى مولَّدة أو حلقات صوتية محيطة بسيطة. ناتج الصوت في Veo 3.1 أكثر دقة بكثير من ذلك.
ثلاث طبقات صوتية مختلفة يتعامل معها النموذج:
البيئة المحيطة: النسيج الصوتي للمكان. المطبخ يبدو كمطبخ، والملعب يبدو كملعب.
المؤثرات الصوتية: تفاعلات الأجسام والحركات وظواهر الطقس. المطر يبدو كمطر ويتفاعل مع شدة المطر الموصوفة في الأمر النصي.
الحوار: كلام الشخصيات في الفيديو، بأصوات تطابق الشخصيات الظاهرة على الشاشة.
يستنتج النموذج الصوت الذي ينبغي أن يكون حاضرًا من القرائن السياقية في أمرك النصي ومن المحتوى المرئي المُولَّد. لا تحتاج إلى وصف كل صوت على حدة. الأمر الذي يذكر "مقهى في صباح ممطر" سيُنتج طبيعيًا صوت آلة الإسبريسو، وهمهمة المحادثات الخافتة، وصوت المطر على النوافذ، وموسيقى محيطة ناعمة معتادة في هذا النوع من الأماكن.
💡 نصيحة للأمر النصي: وصف وقت اليوم ونوع المكان والنبرة العاطفية يمنح Veo 3.1 سياقًا صوتيًا أغنى للعمل عليه. "محطة مترو مزدحمة في ساعة الذروة" ستُنتج صوتًا متزامنًا أغنى بكثير من مجرد "محطة قطار".
توليد حوار يبدو حقيقيًا
يُعد هذا على الأرجح أكثر جوانب Veo 3.1 إثارة للإعجاب من الناحية التقنية. توليد حوار يبقى متزامنًا مع حركة الشفاه في الفيديو أمر صعب فعلًا. على النموذج أن يولّد شخصية مرئية بفم ينطق، وأن يولّد كلامًا صوتيًا يطابق الكلمات، وأن يُبقي المسارين متوافقين زمنيًا طوال المقطع.
النتائج ليست مثالية مع كل الأوامر، لكن بالنسبة لمقاطع الحوار القصيرة يكون التزامن أفضل بوضوح من أي شيء كان متاحًا من قبل في نظام تحويل النص إلى فيديو.
ما ينجح جيدًا مع الحوار:
تبادلات قصيرة من 1 إلى 3 جمل لكل متحدث
وصف واضح في الأمر النصي لمن يتكلم وما يقوله
سيناريوهات حوارية طبيعية بدلًا من الأداء المسرحي
ما يحتاج إلى عناية في كتابة الأمر:
عدة متحدثين في تبادل سريع للكلام
لهجات قوية أو أنماط كلام غير قياسية
مفردات تقنية أو أسماء علم غير شائعة
بالنسبة لحالات الاستخدام التي تتطلب حوارًا صوتيًا مصقولًا وقابلًا للتحكم بدرجة عالية، فإن الجمع بين Veo 3.1 ونموذج مخصص لتحويل النص إلى كلام يمنحك تحكمًا أدق. يتيح لك Speech 2.6 HD توليد مخرجات صوتية محددة مع تحكم دقيق في النبرة والإيقاع، ويمكنك استخدامه لكتابة تعليق صوتي دقيق يرافق المرئيات المُولَّدة.
المؤثرات الصوتية المدمجة في النموذج
تتطلب المؤثرات الصوتية في إنتاج الفيديو التقليدي مكتبة أصوات ومحررًا ووضعًا يدويًا دقيقًا للصوت إطارًا بإطار. يولّد Veo 3.1 هذه المؤثرات تلقائيًا من وصف المشهد وحده.
فئة الصوت
كيف يتعامل معها النموذج
مثال على سياق الأمر النصي
خطوات الأقدام
مادة السطح مستنتجة من السياق المرئي
"المشي على أرضيات خشبية"
الطقس
المطر والرياح والرعد مطابقة لشدة المشهد المرئي
"عاصفة قوية خارج نافذة"
الحشود
الكثافة والطاقة مطابقتان للمشهد المرئي
"ساحة سوق خارجية مزدحمة"
تفاعل الأجسام
فيزياء المادة مُحاكاة في الصوت
"تحطم زجاج على أرضية من البلاط"
المركبات
أصوات المحرك والحركة حسب نوع المركبة
"دراجة نارية تتسارع على الطريق السريع"
الطبيعة
الرياح والماء والحياة البرية حسب نوع البيئة
"نهر يجري عبر غابة صنوبر"
القيد الرئيسي أن جودة صوت النموذج مرتبطة بدقة أمرك النصي. الأوامر المرئية الغامضة تميل إلى إنتاج صوت غامض أو عام. كلما قدّمت تفاصيل أكثر عن البيئة المادية للمشهد، أصبح توليد الصوت السياقي أدق.
بالنسبة للمشاريع التي تحتاج إلى مقطع موسيقي مُولَّد فوق الصوت الأصلي للفيديو، يتكامل Lyria 2 من Google بشكل طبيعي مع منظومة Veo. يمثل Music-01 من MiniMax خيارًا قويًا آخر لتوليد مقاطع مخصصة بعناصر غنائية كاملة يمكنك دمجها في ناتجك النهائي.
كيفية استخدام Veo 3.1 على PicassoIA
Veo 3.1 متاح مباشرة على المنصة بواجهة نظيفة وبسيطة. توليد الصوت ليس مفتاحًا منفصلًا أو معاملًا يجب تفعيله، بل يحدث تلقائيًا ضمن كل عملية توليد.
الخطوة 1: الوصول إلى النموذج
انتقل إلى صفحة نموذج Veo 3.1 في مجموعة تحويل النص إلى فيديو. سترى حقل إدخال الأمر النصي فورًا. لا حاجة لأي إعداد إضافي لتفعيل إخراج الصوت.
للحصول على توليد أسرع بجودة صوت مشابهة، يستخدم Veo 3.1 Fast النموذج الأساسي نفسه مع سرعة تشغيل محسّنة. هذه النسخة مفيدة بشكل خاص عندما تعدّل الأوامر النصية بسرعة وتحتاج إلى تقييم جودة الصوت عبر عدة نسخ من الأمر في جلسة قصيرة.
الخطوة 2: كتابة الأوامر النصية للحصول على مخرجات غنية بالصوت
تحدد بنية أمرك النصي جودة الصوت بقدر ما تحدد جودة الصورة. يُنتج هذا النموذج أفضل النتائج الصوتية بثبات:
[Scene setting + time + location] + [Characters and action] + [Dialogue if needed] + [Atmosphere and mood]
مثال على أمر نصي:
"ركن شارع مزدحم في طوكيو عند الغسق، مشاة يعبرون تحت لافتات النيون، عازف شارع يعزف الغيتار الصوتي قرب مدخل متجر للمواد الغذائية، يبدأ مطر خفيف بالهطول، أصوات المدينة تختلط بلحن الغيتار، حركة مرور بعيدة، أجواء مسائية دافئة"
يمنح هذا النموذج سياقًا كافيًا لتوليد صوت محيط متعدد الطبقات وواقعي، مع مصادر صوتية متميزة إلى جانب المحتوى المرئي.
الخطوة 3: تضمين الحوار في أمرك النصي
حين تريد كلامًا منطوقًا في الفيديو، أدرج نص الحوار مباشرة في أمرك النصي مع تحديد واضح للمتحدث:
"موظفان يقفان بجوار آلة القهوة في مكتب حديث، يقول أحدهما 'هل رأيت نتائج الربع؟' ويرد الآخر 'أفضل من المتوقع' - بنبرة محادثة طبيعية، وأصوات مكتب محيطة في الخلفية"
أبقِ الحوار قصيرًا. الجمل التي تتراوح بين 10 و15 كلمة لكل متحدث تُنتج تزامنًا أفضل لحركة الشفاه باستمرار من الفقرات الطويلة. إذا احتاج مشهدك إلى حوار ممتد، فولّده كمقاطع قصيرة متعددة بدلًا من أمر نصي واحد طويل.
الخطوة 4: المراجعة والتكرار
بعد التوليد، راجع المسار المرئي والمسار الصوتي كلًا على حدة قبل أن تقرر إعادة التوليد. مشكلات شائعة يجب التحقق منها:
انزياح تزامن الصوت: هل يتطابق صوت الحوار مع حركة الشفاه طوال مدة المقطع كاملة؟
أصوات غير مقصودة: هل توجد أصوات لم تُوصف أو تُلمّح في الأمر النصي؟
توازن مستوى الصوت: هل تطغى الأصوات المحيطة على الحوار أو المؤثرات الصوتية المهمة؟
إذا أخفق الصوت بينما المرئيات صحيحة، فإن إضافة سياق صوتي وصفي أكثر إلى الأمر النصي الأساسي نفسه كثيرًا ما تصحح الأمر في التوليد الثاني دون فقدان الإطار البصري الذي تريده.
بالنسبة لسير العمل الذي تحتاج فيه إلى تحريك صورة ثابتة موجودة مع مسار صوتي، فإن Audio to Video من Lightricks أداة مكملة على المنصة. يتيح لك إدخال ملف صوتي وتوليد حركة مرئية متطابقة من صورة مصدر، وهو سير عمل مختلف تمامًا عن Veo 3.1 لكنه مفيد لمشاريع محددة.
Veo 3.1 مقابل نماذج فيديو الذكاء الاصطناعي الأخرى
توليد الصوت الأصلي هو الميزة المميزة لنموذج Veo 3.1، لكن من المفيد رؤيته في سياق مقارن مع نماذج أخرى متاحة لأعمال الفيديو.
الفرق بين النماذج التي تقبل الصوت كمدخل والنماذج التي تولّد الصوت بشكل أصلي فرق مهم وكثيرًا ما يُساء فهمه. يولّد Veo 3.1 صوتًا كمخرج. يستخدم LTX-2.3-Pro الصوت كمدخل لتحريك المرئيات. كلاهما سير عمل صالح لأهداف إبداعية مختلفة.
الانتقال من فيديو الذكاء الاصطناعي الصامت إلى فيديو الذكاء الاصطناعي بصوت متزامن يفتح تطبيقات عملية لم تكن ممكنة من قبل دون فريق إنتاج كامل.
محتوى وسائل التواصل الاجتماعي
يستفيد محتوى الفيديو القصير على منصات مثل TikTok وInstagram Reels وYouTube Shorts كثيرًا من الصوت الأصلي. لم يعد صناع المحتوى بحاجة إلى إعدادات تسجيل صوتي منفصلة لإنتاج محتوى بأسلوب الحديث أمام الكاميرا أو مشاهد مكتوبة مسبقًا. يمكن أن يبقى سير العمل بالكامل داخل خط توليد الذكاء الاصطناعي، من الأمر النصي إلى مخرج جاهز للنشر.
عروض المنتجات
يحتاج فيديو منتج يعرض خلاطًا أثناء العمل إلى صوت المحرك. ويحتاج إعلان السيارة إلى هدير المحرك. ويحتاج إعلان الأحذية الرياضية إلى خطوات على الخرسانة. يُنتج Veo 3.1 هذه الأصوات بشكل طبيعي من الأوامر الوصفية، ما يلغي خطوة تصميم الصوت للمقاطع الترويجية القصيرة دون التفريط في الأصالة.
الأفلام السردية القصيرة
بالنسبة للمحتوى السردي الذي يتحدث فيه الشخصيات، يتيح توليد الحوار في Veo 3.1 إنتاج مشاهد مكتوبة قصيرة بصوت دون اختيار ممثلين أو تسجيلهم أو إخراجهم. جودة الناتج للمشاهد القصيرة كافية لأعمال إثبات المفهوم ولوحات المزاج، وفي كثير من الحالات للنشر المباشر على المنصات الإبداعية.
المحتوى التدريبي والتعليمي
مقاطع الشرح بالتعليق الصوتي مناسبة تمامًا لهذا النموذج. يتعامل مع صوت راوٍ يتحدث فوق المرئيات عندما يُطلب ذلك بسياق واضح للمشهد والكلام. تصبح مواد التدريب المؤسسي ومقاطع التعليمات ومقاطع التهيئة للمنتجات ممكنة دون استوديو تسجيل أو راوٍ محترف.
💡 نصيحة إنتاج: اجمع بين Veo 3.1 للمقاطع المرئية القصيرة ذات الصوت المحيط، وبين Speech 2.6 HD للتعليق الصوتي المكتوب الأطول. ولّد صوت المشهد أصليًا في Veo 3.1، ثم أضف تعليقًا صوتيًا دقيق التحكم من نموذج تحويل النص إلى كلام للمقاطع التي تتطلب دقة كلمة بكلمة.
المحتوى الموسيقي والأداء
يستطيع الموسيقيون والفنانون توليد مرئيات أداء ذات أجواء مع صوت مناسب للسياق. الأمر الذي يصف عازف بيانو في قاعة حفلات فارغة ليلًا سيُنتج المرئيات وصوت مفاتيح البيانو في آن واحد، ما يخلق محتوى مؤثرًا للمنصات الموسيقية ومشاركته على وسائل التواصل دون حجز جلسة تسجيل أو قاعة.
أنماط أوامر نصية تنتج صوتًا أفضل
بعد اختبارات مكثفة، تُنتج بنى معينة للأوامر النصية باستمرار صوتًا متزامنًا أعلى جودة. تستحق هذه الأنماط الاحتفاظ بها كقوالب قابلة لإعادة الاستخدام.
للصوت المحيط للمشهد:
"[الموقع] في [وقت اليوم]، [الطقس أو الأجواء]، أصوات [عناصر بيئية محددة]، [المزاج العام]"
لمشاهد الحوار:
"[وصف الشخصية] في [الموقع]، يقول [اسم الشخصية أو دورها] '[حوار قصير]'، [أصوات المكان في الخلفية]"
لمشاهد الحركة بمؤثرات صوتية:
"[الفاعل] [فعل الحركة] عبر [سطح المادة]، [معدل السرعة أو الشدة]، [وصف صوت التفاعل مع المادة]"
ما يجب تجنبه:
تجنب كلمات الأجواء الغامضة مثل "غامر" دون تفاصيل مادية محددة
لا تصف الصوت كطبقة منفصلة تُضاف إلى المشهد، بل ادمجه في وصف المشهد بشكل طبيعي
تجنب سلاسل الحوار الطويلة جدًا في أمر نصي واحد، وقسّم المحادثات المعقدة إلى توليدات قصيرة متعددة
💡 لأقصى درجة من التوافق بين الصوت والصورة: عامل أمرك النصي كتوجيه مشهد في سيناريو فيلم. كلما قرأ كأنه "داخلي. مقهى ممطر - مساءً - صديقان يتحدثان على طاولة في الزاوية، آلة الإسبريسو في الخلفية، المطر على النوافذ"، بنى النموذج صوتًا متعدد الطبقات ومتطابقًا دون تخمين.
أنشئ فيديوهاتك الغنية بالصوت الآن
إذا كنت تنتج فيديو الذكاء الاصطناعي بمخرجات صامتة ثم تعالج الصوت لاحقًا في المونتاج، فإن تجربة توليد فيديو يخرج فيه الصوت مع الإطارات من المحاولة الأولى تغيّر سير العمل الإبداعي بشكل حقيقي. تصبح حلقة التغذية الراجعة أكثر إحكامًا، ويكون التكرار أسرع، ويتطلب الناتج النهائي جهدًا إنتاجيًا أقل بكثير للوصول إلى حالة جاهزة للنشر.
Veo 3.1 متاح الآن على المنصة. ابدأ بوصف مشهد بسيط يتضمن موقعًا محددًا ووقتًا من اليوم وإشارة صوتية أو اثنتين. جرّب مشهدًا داخل مقهى، أو شارعًا مدينيًا ممطرًا، أو تبادل حوار قصير بين شخصين. لاحظ كيف يتوافق الصوت مع ما يظهر على الشاشة، ثم كرّر التجربة بأوصاف أدق.
بالنسبة لسير العمل الذي يحتاج إلى مرونة صوتية إضافية تتجاوز ما يولّده Veo 3.1 بشكل أصلي، تغطي المنصة كاملة كل طبقة صوتية قد تحتاجها. يتعامل Audio to Video من Lightricks مع تحريك المرئيات المدفوع بالصوت انطلاقًا من صور موجودة. يُنتج Lyria 2 وMusic-01 مقاطع موسيقية مخصصة مولّدة بالذكاء الاصطناعي لتأليف الموسيقى التصويرية. يتولى Speech 2.6 HD وVoice Cloning التعليق الصوتي الدقيق وعمل أصوات الشخصيات.
معًا، تمنحك هذه الأدوات تحكمًا كاملًا في كل طبقة صوتية في الفيديو النهائي. وVeo 3.1 هو نقطة بداية هذا السير.