Veo 3.1 لتوليد الفيديو مع الصوت: ماذا يفعل وكيف تستخدمه الآن

يولّد Veo 3.1 فيديو بدقة 1080p مع صوت أصلي متزامن بالكامل من أمر نصي واحد، ويتعامل مع الكلام والأصوات المحيطة والموسيقى في آنٍ واحد. يشرح هذا المقال بالتفصيل كيف تعمل طبقة الصوت، وما الذي يميز إصدارات 3.1، وكيف تكتب أوامر نصية تنتج مخرجات صوتية قوية، وكيف يقارن Veo 3.1 بالنماذج المنافسة المتاحة على PicassoIA.

Veo 3.1 لتوليد الفيديو مع الصوت: ماذا يفعل وكيف تستخدمه الآن
Cristian Da Conceicao
مؤسس Picasso IA

يقدّم Veo 3.1 من Google شيئًا احتاج توليد الفيديو بالذكاء الاصطناعي إلى سنوات كي يتقنه: إنه يولّد الصوت في الوقت نفسه مع اللقطات، لا بعد الانتهاء منها. أمر نصي واحد، ومخرج واحد، والاثنان متزامنان. إذا كنت تستخدم أدوات فيديو بالذكاء الاصطناعي تُخرج مقاطع صامتة تضطر بعدها إلى إضافة موسيقى خالية من حقوق الملكية من مكان آخر، فهذا تحوّل مهم في الإحساس الفعلي بسير العمل.

ماذا يفعل Veo 3.1 فعلًا

تصوير مرئي لموجة صوتية للذكاء الاصطناعي على لوحة OLED شفافة

Veo 3.1 نموذج لتحويل النص إلى فيديو من Google DeepMind، وينتج مقاطع فيديو بدقة 1080p مع صوت أصلي متزامن. لا يأتي الصوت من مرحلة منفصلة أو من خطوة تحويل نص إلى كلام مُلحقة به. بل يُولَّد بالتزامن مع إطارات الفيديو، أي أن الحوار والأصوات المحيطة والموسيقى والضوضاء البيئية كلها جزء من التنبؤ نفسه.

يأخذ النموذج أمرًا نصيًا بلغة طبيعية، ويعيد ملف MP4 يكون فيه ما تراه وما تسمعه قد أُنتجا معًا. فالمشهد الذي يوصف بأنه "طاهٍ في مطبخ مطعم مزدحم ينادي على الطلبات" سينتج لقطات لذلك المطبخ مع الصوت الواقعي لطرقعة الأواني، وهمهمة الخلفية، وصوت ينادي بالطلبات، وكلها متوقتة على الحركة المرئية.

يختلف هذا عما كانت تفعله معظم نماذج الفيديو السابقة، إذ كانت تنتج الفيديو ثم تسمح لك اختياريًا بإضافة الصوت فوقه يدويًا. التزامن في Veo 3.1 جزء أصيل من عملية التوليد، وليس إضافة لاحقة.

أبرز الإمكانات في لمحة:

  • توليد صوت أصلي يشمل الكلام والأصوات المحيطة والموسيقى
  • دقة إخراج 1080p للمحتوى بجودة نهائية
  • تحويل النص إلى فيديو من أوامر نصية مفصّلة بلغة طبيعية
  • عناصر تحكم متعددة في الأسلوب تشمل الكادرة السينمائية والإضاءة وسرعة الحركة
  • ثلاثة إصدارات من النموذج مُحسَّنة لمفاضلات مختلفة بين السرعة والجودة

💡 نصيحة: كلما كان أمرك النصي أكثر تحديدًا بشأن البيئة الصوتية، كان الصوت الناتج أقوى. اذكر أصواتًا بعينها مثل "طقطقة نار المخيم" أو "حركة مرور بعيدة ومطر على الزجاج"، بدلًا من وصف عام للمكان.

الصوت الذي يأتي مع الفيديو

مبدع محترف يرتدي سماعات ويستمع إلى صوت فيديو مولَّد بالذكاء الاصطناعي

تتعامل طبقة الصوت في Veo 3.1 مع ثلاثة أنواع مختلفة من الأصوات، ولكل منها سلوك مختلف استجابةً لأمرك النصي.

1. الصوت المحيط والبيئي

هذا هو الصوت الخلفي الذي يطابق البيئة المادية التي تصفها. مشهد الغابة يولّد صوت الرياح بين الأوراق وتغريد الطيور. ومكتب داخلي يولّد طقطقة لوحة المفاتيح وهدير أجهزة التكييف. ويستنتج النموذج كيف ينبغي أن يبدو صوت المكان بناءً على السياق المرئي، حتى حين لا تسمّي الأصوات صراحةً. وشارع المدينة يولّد ضوضاء المرور تلقائيًا.

2. الكلام والحوار

عندما يتضمن أمرك أشخاصًا يتكلمون، يولّد Veo 3.1 حركة شفاه وصوتًا متطابقين. وأوامر مثل "امرأة تشرح فكرة وهي تمشي في حديقة" تنتج صوتًا بطول حوار يتوقت وفق إيقاع الكلام الطبيعي. ولن تكون شخصية الصوت شخصًا محددًا تستطيع تسميته، لكن النبرة والإيقاع والجنس تنبع من وصف المشهد.

3. الموسيقى التصويرية

عندما تطلب سياقًا سينمائيًا أو عاطفيًا، قد يولّد النموذج موسيقى خلفية تناسب المزاج. وهذا أقل حتمية من الصوت المحيط، لكنه يظهر بثبات حين يتضمن الأمر إشارة عاطفية أو سردية قوية. صِف الحالة العاطفية للمشهد صراحةً: "متوتر"، "مبتهج"، "تأملي".

ما يجعل هذا مفيدًا أنك لست مقيدًا بالاختيار من مكتبات أصوات جاهزة. فالصوت توليدي، ولذلك يطابق سيناريوهات محددة جدًا لا تغطيها أي مكتبة جاهزة.

يد تكتب أمرًا نصيًا مفصّلًا لفيديو بالذكاء الاصطناعي على لوحة مفاتيح ميكانيكية مضاءة من الخلف

💡 نصيحة: لأعمال التعليق الصوتي التي تحتاج إلى تحكم دقيق في النص، اجمع Veo 3.1 مع نماذج تحويل النص إلى كلام المخصصة على PicassoIA، مثل ElevenLabs v3 أو Gemini 3.1 Flash TTS. الكلام المدمج في Veo 3.1 قوي للحوار الطبيعي في المشاهد، أما تحويل النص إلى كلام المستقل فيمنحك دقة على مستوى النص.

لإنشاء موسيقى تتجاوز ما يولّده نموذج الفيديو، يُنتج Lyria 3 Pro وLyria 3 تكوينات أصلية كاملة الطول يمكنك مزامنتها مع اللقطات في مرحلة ما بعد الإنتاج.

Veo 3.1 مقابل Veo 3 مقابل Veo 3.1 Lite

شاشتان متجاورتان تعرضان مقارنة لجودة فيديو الذكاء الاصطناعي

ثلاثة إصدارات من Veo متاحة على PicassoIA، وكل منها يلبي احتياجات مختلفة. وهذا تقسيمها:

النموذجالدقةالصوتالسرعةالاستخدام الأمثل
Veo 3.11080pمتزامن أصليقياسيةمخرجات نهائية عالية الجودة
Veo 3.1 Fast1080pمتزامن أصليسريعةالتكرار والمسودات بجودة كاملة
Veo 3.1 Liteقياسيةصوت أصليالأسرعالمعاينات السريعة والإنتاج بكميات كبيرة
Veo 31080pصوت أصليقياسيةخط الأساس للجيل السابق
Veo 3 Fast1080pصوت أصليسريعةالتكرار السريع على أوامر Veo 3

متى تستخدم Veo 3.1: للمحتوى النهائي الذي يجب أن تصمد فيه الدقة البصرية والتزامن الصوتي عند عرضه بملء الشاشة. فيديوهات التسويق، ومقاطع الريلز الاجتماعية، والعروض التوضيحية، وعروض المنتجات.

متى تستخدم Veo 3.1 Fast: عندما تكون في مرحلة تكرار الأوامر وتحتاج إلى رؤية كيف تبدو اللقطة قبل الالتزام بتوليد كامل. الجودة نفسها التي يقدمها 3.1، مع زمن توليد أسرع بشكل ملحوظ.

متى تستخدم Veo 3.1 Lite: عندما تحتاج إلى الكمية. مقاطع قصيرة متعددة، ونماذج أولية سريعة، ومواقف يهم فيها التكلفة أو الوقت أكثر من الوصول إلى أقصى سقف لجودة المخرجات.

القفزة من Veo 3 إلى Veo 3.1 تكمن أساسًا في الالتزام بالأمر النصي والاتساق بين الصورة والصوت. والمشاهد ذات الحركة المعقدة، والعناصر المتعددة، والبيئات الصوتية المفصّلة هي التي تُظهر أوضح تحسن بين الجيلين.

Veo 3.1 Lite ليس نسخة أدنى

يُساء فهم Veo 3.1 Lite كثيرًا على أنه نموذج أقل شأنًا. فبالنسبة لسير العمل عالي الحجم الذي تولّد فيه عشرات المقاطع، أو للمحتوى الاجتماعي الذي سيُشاهد على الهاتف بمستوى صوت 70%، يناسب إصدار Lite تمامًا. والتوليد الصوتي الأصلي موجود فيه. احتفظ بالإصدار الكامل Veo 3.1 للمخرجات التي ستُعرض على شاشات كبيرة أو يراجعها أصحاب القرار.

كيف تستخدم Veo 3.1 على PicassoIA

منظر جوي لمساحة عمل حديثة لصانع محتوى مع شاشة ولوحة مفاتيح

تتيح لك PicassoIA الوصول إلى Veo 3.1 وVeo 3.1 Fast وVeo 3.1 Lite إلى جانب أكثر من 100 نموذج آخر لتحويل النص إلى فيديو، وكلها في واجهة واحدة. وهذا هو سير العمل:

الخطوة 1: اختر الإصدار

انتقل إلى قسم تحويل النص إلى فيديو على PicassoIA، واختر Veo 3.1 للحصول على مخرجات بجودة كاملة. وإذا كنت في مرحلة تطوير الأوامر وتريد التكرار بسرعة، فابدأ بالإصدار Veo 3.1 Fast لتقليل زمن التوليد دون التضحية بالجودة.

الخطوة 2: اكتب أمرًا منظمًا

يتكون الأمر النصي القوي لنموذج Veo 3.1 من ثلاث طبقات:

  • الموضوع المرئي: ما في المشهد وما الذي يحدث فيه
  • البيئة: الموقع والإضاءة ووقت اليوم والأجواء العامة
  • إشارات الصوت: أصوات محددة، ومقاطع حوار، والمزاج الموسيقي، وأي صمت

مثال: "بائع متجول في سوق الصباح يقطع فاكهة طازجة، وشمس الصباح الدافئة ترسم ظلالًا طويلة على الكشك، وهمهمة سوق مزدحم في الخلفية، وقطع نقود تطقطق على السطح الخشبي، وراديو يعزف بهدوء من داخل محل قريب."

الخطوة 3: حدّد المدة

يدعم Veo 3.1 مقاطع بأطوال متفاوتة. المقاطع القصيرة (5-8 ثوانٍ) تمنحك اتساقًا أكبر إطارًا بإطار وتزامنًا أدق بين الصورة والصوت. أما للمحتوى السردي الأطول، ففكّر في توليد مقاطع قصيرة متعددة ثم دمجها معًا.

الخطوة 4: راجع الصوت والفيديو معًا

عند وصول المخرج، شاهده مع تشغيل الصوت فورًا. فالصوت والفيديو يُولَّدان معًا، لذلك إذا كان للأمر نية صوتية قوية فستسمعها في الثواني الأولى. وإذا لم يطابق الصوت توقعك، فالسبب في الغالب هو عدم تحديد الأمر وليس قدرة النموذج.

الخطوة 5: كرّر باستخدام Fast

Veo 3.1 Fast هو أداتك الأساسية للتكرار. شغّل 3 إلى 4 إصدارات مع تعديلات طفيفة على الأمر قبل الالتزام بالتوليد النهائي. فسلوك الصوت يتغير بشكل ملحوظ مع تغييرات صغيرة في وصف البيئة.

💡 نصيحة: أضف انتقالات واضحة للمشهد في أوامرك. فعبارة "يبدأ صامتًا، ثم يُفتح باب ويملأ صوت المطر الغرفة" تمنح النموذج قوسًا زمنيًا يستطيع اتباعه في توليد الصوت.

كتابة الأوامر التي تحقق النتائج

صورة مقربة لعناصر التحكم في مزج الصوت على جهاز لوحي احترافي باللمس

تعود معظم المخرجات الضعيفة من Veo 3.1 إلى أوامر غامضة. النموذج قادر، والعامل المحدد هو ما تقدّمه له.

ما يتجاهله مقابل ما يستجيب له

يستجيب Veo 3.1 للسبب والنتيجة المادية في الأوامر. إذا كان شيء في المشهد سينتج صوتًا فعليًا، فسمِّه. النموذج يفهم العلاقة السببية وسيولّد الصوت المناسب للحركة التي تصفها.

أوامر ضعيفة الإشارة (مخرجات صوتية ضعيفة):

  • "شارع مدينة مزدحم"
  • "أشخاص سعداء في حدث ما"
  • "مشهد طبيعي"

أوامر قوية الإشارة (مخرجات صوتية قوية):

  • "شارع مدينة مزدحم في ساعة الذروة: أبواق سيارات، وفرامل حافلة تصفر، ومشاة يتحدثون، وشاحنة توصيل تتراجع مع صوت تحذير"
  • "ثلاثة أصدقاء يضحكون على طاولة في مطعم مزدحم، وأحاديث متداخلة، وطقطقة كؤوس، والطاهي ينادي الطلبات من خلف منصة التقديم في المطبخ"
  • "الرياح تمر بين الأعشاب الطويلة في حقل مفتوح عند الغسق: حشرات تزقزق بإيقاع، وبومة بعيدة، وحفيف ناعم للأوراق مع كل هبة ريح"

الفرق ليس في الإبداع، بل في التحديد. سمِّ مصادر الصوت التي تريدها، صراحةً.

اقتران الصورة بالصوت في الأوامر

يربط النموذج الصوت بالحركة. الشخصية الموصوفة بأنها "تركض" تولّد وقع خطوات، والموسيقي الموصوف بأنه "يعزف على الغيتار" يولّد صوت الغيتار. استخدم ذلك بوعي: صِف الفعل المادي الذي يُنتج الصوت، بدلًا من تسمية الصوت نفسه فقط.

الفعل المادي في الأمرالصوت الناتج
"يصبّ الماء من إبريق في كوب"تناثر الماء وانسكابه واستقرار السائل
"يكتب بسرعة على لوحة مفاتيح"طقطقة ميكانيكية سريعة للوحة المفاتيح
"تنطلق سيارة إلى الطريق السريع"صوت تسارع المحرك واحتكاك الإطارات وصوت الرياح
"يندلع تصفيق في مسرح مكتظ"تصفيق الجمهور وهتافات وصدى القاعة المحيط
"المطر يضرب النافذة بخيوط متواصلة"ارتطام المطر واهتزاز الزجاج ورعد بعيد

زاوية الكاميرا تؤثر في منظور الصوت

يأخذ النموذج في الحسبان المسافة الضمنية للميكروفون بناءً على زاوية الكاميرا التي تصفها. اللقطة المقربة للوجه تولّد صوتًا حميميًا من مسافة قريبة، ولقطة الإنشاء الجوية تولّد صوتًا محيطًا بيئيًا من مسافة بعيدة. ويمكنك كتابة زاوية الكاميرا في أوامرك للتأثير في طابع الصوت:

"لقطة مقربة من فوق الكتف وهي تهمس في الهاتف" تنتج صوتًا مختلفًا جدًا عن "لقطة عريضة لامرأة تتحدث في الهاتف داخل حديقة."

استخدم ذلك للتحكم في طريقة ترجيح الصوت الأمامي مقابل الصوت الخلفي في المخرج.

إعدادات توليد الصوت التي تستحق المعرفة

شخص في مقهى يحمل هاتفًا يعرض فيديو نهائيًا مولَّدًا بالذكاء الاصطناعي

لا يوفّر Veo 3.1 لوحة مزج صوت منفصلة. فالصوت نتاج مباشر لأمرك وتفسير النموذج له. ومعرفة أنواع المحتوى التي تنتج صوتًا موثوقًا تساعدك على تخطيط الأوامر بفعالية أكبر.

دقة الصوت حسب نوع المحتوى:

  • الصوت المحيط والبيئي: قوي جدًا. فالبيئات المادية تولّد صوت خلفية واقعيًا ومقنعًا في كل توليد تقريبًا. وهذه أكثر الفئات موثوقية.
  • الكلام والحوار: دقة عالية للمشاهد ذات المتحدث الواحد عند وضوح نية الأمر. أما المشاهد متعددة المتحدثين بأكثر من شخصين فهي أقل موثوقية في التمييز بين الأصوات.
  • الموسيقى: تعتمد بشدة على مدى وضوح وصفك للسياق الموسيقي. فعبارة "بيانو جاز نشيط في حانة" تنتج بيانو جاز، أما كلمة "موسيقى" وحدها فتنتج موسيقى خلفية عامة بجودة متفاوتة.
  • المؤثرات الصوتية المرتبطة بالحركة: موثوقة للغاية حين يكون الفعل واضحًا في الأمر. وكلما كان الفعل المادي الموصوف أوضح، كانت المؤثرة الصوتية المقابلة أنظف.

ماذا تفعل عندما يفشل الصوت:

إذا كان لمقطع مولَّد بعينه صوت لا يطابق الصورة أو نية الأمر، فلا تكرّر المحاولة بالأمر نفسه. غيّر متغيرًا واحدًا: أضف إشارات صوتية أكثر وضوحًا، أو بسّط عدد العناصر، أو أعد صياغة وصف البيئة. فالمشاهد المعقدة متعددة العناصر ذات مصادر الصوت المتنافسة أصعب على النموذج في الموازنة بثبات.

لأعمال التعليق الصوتي التي تحتاج إلى دقة على مستوى النص، ولّد لقطتك في Veo 3.1، ثم ولّد الصوت الدقيق عبر ElevenLabs v3 أو Speech 2.8 HD، ثم زامنهما في مرحلة ما بعد الإنتاج. وبهذا تحصل على الأفضل من الاثنين: المخرج البصري السينمائي من Veo والتحكم الدقيق في التعليق الصوتي.

بالنسبة للمشاريع متعددة اللغات، يغطي Gemini 3.1 Flash TTS أكثر من 70 لغة مع 30 شخصية صوتية مميزة، ويتناسب بسلاسة مع اللقطات المولّدة بـ Veo.

أين يقع Veo 3.1 بين نماذج الفيديو الأخرى

لقطة عريضة لمختبر وسائط حديث فيه عدد من محرري الفيديو عند محطات العمل

بات في مجال فيديو الذكاء الاصطناعي نماذج قوية كافية بحيث يعتمد الاختيار الصحيح على ما يهم في مخرجك تحديدًا. وهذه مقارنة Veo 3.1 بالنماذج الأخرى المتاحة على PicassoIA:

النموذجالصوتالدقةالميزة الأساسية
Veo 3.1متزامن أصلي1080pتماسك الصورة والصوت، والالتزام بالأمر النصي
Seedance 2.0صوت أصلي1080pاتساق المشهد، وجودة الحركة
Sora 2صوت أصليHDالتماسك في المحتوى الطويل، ودقة الفيزياء
Ray 3.2HDRHDRالمظهر السينمائي، وتدرج الألوان بتقنية HDR
Kling v3نعم1080pتحريك الشخصيات، والحركة المعبّرة
Pixverse v6صوت ذكاء اصطناعي أصلي1080pسرعة إنجاز المخرج السينمائي
Wan 2.7 T2Vقياسي1080pمرونة النموذج مفتوح الأوزان، والتخصيص

الميزة الخاصة بنموذج Veo 3.1 تكمن في جودة طبقة الصوت وتزامنها. لا يوجد نموذج آخر في هذه القائمة ينتج الصوت المحيط والكلام والموسيقى كمخرج واحد مترابط بإحكام مع الصورة. وSeedance 2.0 هو على الأرجح النظير الأقرب من حيث جودة المخرجات الإجمالية، وهو يولّد صوتًا أصليًا أيضًا.

أما للجماليات البصرية البحتة دون متطلب صوتي، فيبقى Ray 3.2 بديلًا قويًا بفضل مخرجاته ذات الألوان بتقنية HDR. وللمشاهد المعتمدة على الشخصيات ذات الحركة المعبّرة، يستحق Kling v3 التشغيل بالتوازي.

الإجابة العملية هي: استخدم Veo 3.1 عندما يكون الصوت مهمًا بقدر أهمية الفيديو. واستخدم نماذج أخرى عندما تكون تحسّن بالأساس الجماليات البصرية أو جودة الحركة وتخطط للتعامل مع الصوت بشكل منفصل.

مجموعة Veo الكاملة متاحة الآن

الإصدارات الثلاثة من Veo 3.1، وهي Veo 3.1 وVeo 3.1 Fast وVeo 3.1 Lite، إضافة إلى Veo 3 وVeo 3 Fast، متاحة على PicassoIA دون الحاجة إلى حساب Google منفصل أو إعداد API. ويمكنك الوصول إلى الإصدارات الخمسة كلها من الواجهة نفسها، إلى جانب كل نموذج فيديو آخر على المنصة.

ابدأ توليد الفيديوهات الآن

صانع محتوى عند مكتب واقف يشير إلى شاشة كبيرة تعرض فيديو سينمائيًا بالذكاء الاصطناعي

Veo 3.1 متاح بالفعل على PicassoIA. فأكثر من 110 نماذج فيديو على المنصة تعني أنك لست محصورًا في أسلوب مخرج واحد. شغّل Veo 3.1 لمشهد، وشغّل Seedance 2.0 لآخر، وقارن بينهما، واختر ما نجح. لا يوجد التزام بنموذج واحد.

لخط إنتاج صوتي-بصري كامل، تعمل هذه الأدوات معًا ولا تتنافس:

  • Veo 3.1: الصوت المحيط والبيئي والمرتبط بالمشهد، مدمج مباشرة في توليد الفيديو
  • ElevenLabs v3: توليد صوت دقيق من نصوص مكتوبة، مع التحكم في المدى العاطفي
  • Gemini 3.1 Flash TTS: تعليق صوتي متعدد اللغات وسريع على نطاق واسع، بأكثر من 70 لغة و30 شخصية صوتية
  • Lyria 3 Pro: مقطوعات موسيقية أصلية كاملة مؤلفة من وصف نصي
  • Speech 2.8 HD: مخرجات صوت بجودة الاستوديو مع تحكم دقيق في العاطفة

البنية التحتية لإنتاج مقطع صوتي-بصري كامل، من الإطار الأول إلى تلاشي الصوت الأخير، باتت في مكان واحد. والمتغير الوحيد هو مدى دقتك في تحديد أوامرك.

جرّب Veo 3.1 على PicassoIA بمشهد كنت تتخيله. ابدأ بتفاصيل: سمِّ الموقع ووقت اليوم والأصوات المحددة التي تتوقعها وزاوية الكاميرا. وانظر ما الذي سيعود إليك. يمكنك دائمًا حذف تفصيل وإعادة التشغيل، لكن مسودة أولى دقيقة تدفع النموذج أبعد وتُظهر لك أسرع ما الذي يستطيع فعلًا.

جميع النماذج المذكورة في هذا المقال، من Veo 3.1 إلى مجموعة أدوات الصوت الكاملة، متاحة على picassoia.com/en/all-models.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة