Veo 3.1 غيّر توليد الفيديو بالذكاء الاصطناعي إلى الأبد: ما عليك معرفته

يرفع Veo 3.1 من Google سقف توليد الفيديو بالذكاء الاصطناعي بفيزياء حركة أدق، وتوليد صوت سينمائي، ودقة في تطبيق الأوامر النصية تنافس الإنتاج الاحترافي. إليك ما يميّزه عن كل نموذج سبقه، ولماذا تتابعه الصناعة كلها باهتمام.

Veo 3.1 غيّر توليد الفيديو بالذكاء الاصطناعي إلى الأبد: ما عليك معرفته
Cristian Da Conceicao
مؤسس Picasso IA

شهد مجال الفيديو بالذكاء الاصطناعي تحوّلًا حين أطلقت Google Veo 3.1، ولم يكن هذا التحوّل بسيطًا. فعلى عكس التحديثات التدريجية التي تفصل عادةً بين إصدارات النموذج الواحد، جاء Veo 3.1 بمجموعة من التحسينات التي تمثّل مجتمعةً قفزة حقيقية: فيزياء حركة أدق، ودقة أعلى بكثير في تطبيق الأوامر النصية، وتوليد صوت مدمج يعمل فعلًا. بالنسبة لمن يتابعون تطوّر توليد الفيديو بالذكاء الاصطناعي من نماذج تجريبية ضبابية ومتقطعة إلى جودة تقترب من الإنتاج الاحترافي، يبدو هذا الإصدار كأنه اللحظة التي أصبح فيها الأمر جادًا.

ماذا يفعل Veo 3.1 فعلًا

مخرج أفلام محترف يكتب أوامر نصية على محطة عمل تعرض لقطات فيديو مولّدة بالذكاء الاصطناعي

Veo 3.1 نموذج لتحويل النص إلى فيديو مبني على الانتشار (diffusion)، طوّرته Google DeepMind. في جوهره، يأخذ أمرًا نصيًا ويعيد مقاطع فيديو، لكن وصفه بأنه "مجرد نموذج لتحويل النص إلى فيديو" يُغفل الفكرة الأساسية. ما يميّز Veo 3.1 عن الساحة المزدحمة بمولّدات الفيديو بالذكاء الاصطناعي هو جودة ما يحدث بين الإطارات.

تواجه معظم النماذج صعوبة في الاتساق الزمني، أي القدرة على الحفاظ على تماسك الأشياء والوجوه والبيئات عبر الزمن. يتعامل Veo 3.1 مع هذا الأمر بشكل أفضل بوضوح من سابقيه. لا يتشوّه الشعر، ولا تتضاعف الأيدي، ويتصرف الماء كما يتصرف الماء.

💡 معلومة سريعة: يُخرج Veo 3.1 مقاطع فيديو تصل مدتها إلى 8 ثوانٍ بدقة 720p، مع دقة عرض محسّنة مقارنةً مع Veo 3 وVeo 2.

فيزياء حركة تصمد أمام الاختبار

أول ما تلاحظه عندما تولّد مقطعًا باستخدام Veo 3.1 هو طريقة تفاعل الأشياء مع محيطها. تنسدل الأقمشة وتتثنى بشكل معقول، وتتموّج السوائل وتتناثر بوزن فيزيائي حقيقي. وتبدو حركات الكاميرا مقصودة لا مرتجفة.

يكتسب هذا الأمر أهمية لأن إحدى أكثر حالات الفشل شيوعًا في الفيديو بالذكاء الاصطناعي هي مشكلة "الأشياء العائمة"، حيث تبدو العناصر في المشهد وكأنها معزولة عن بعضها، متجاهلة الجاذبية والزخم. Veo 3.1 ليس مثاليًا، لكنه أقرب بكثير إلى الواقعية الفيزيائية من Veo 3 أو Veo 2.

أبرز تحسينات الحركة:

  • ديناميكا الأجسام الصلبة: تسقط الأشياء وترتد وتصطدم بطريقة أكثر طبيعية
  • محاكاة السوائل: يتصرف الماء والدخان والضباب بوزن فيزيائي
  • حركة الشخصيات: تبدو خطوات المشي والركض بشرية
  • فيزياء الكاميرا: تبدو حركات البانوراما والإمالة والدوللي مقصودة سينمائيًا

دقة في تطبيق الأوامر النصية بمستوى جديد

التحسين الرئيسي الثاني هو مدى أمانة Veo 3.1 في اتباع الأوامر النصية المعقدة. كانت نماذج الفيديو السابقة تتمسك بأبرز عناصر الأمر وتتجاهل الباقي. اطلب "امرأة ترتدي معطفًا أحمر تسير في شارع طوكيو ممطر ليلًا مع انعكاسات النيون على الرصيف المبلل"، وستحصل على... امرأة، ربما شارع، والمطر اختياري.

يحتفظ Veo 3.1 بعدة صفات في الوقت نفسه. يبقى المعطف أحمر، ويبقى الرصيف مبللًا، وتبقى أضواء النيون في الانعكاسات. هذا المستوى من الالتزام بالأمر النصي هو ما يحتاجه المحترفون المبدعون فعلًا لبناء سير عمل إنتاجي موثوق.

منظر جوي لاستوديو إبداعي حديث يعمل فيه مصممون على محطات تحرير الفيديو

كيف يقف أمام المنافسين

لم يعرف سوق توليد الفيديو بالذكاء الاصطناعي تنافسًا أشد من هذا قط. لديك Sora-2 من OpenAI، وGen-4.5 من Runway، وKling v3 من Kuaishou، وLTX-2.3-Pro من Lightricks، وكثير غيرها. لكل منها نقاط قوته. فأين يقع Veo 3.1 في هذا الترتيب؟

Veo 3.1 مقابل Sora-2

الميزةVeo 3.1Sora-2
فيزياء الحركةممتازجيد جدًا
دقة تطبيق الأوامر النصيةممتازجيد
الصوت المدمجنعملا
دقة الإخراج720pحتى 1080p
مدة المقطعحتى 8 ثوانٍحتى 20 ثانية
التوفرعبر المنصاتمحدود

يتفوق Sora-2 على Veo 3.1 في طول المقطع وأقصى دقة عرض. لكن Veo 3.1 يملك ما لا يملكه Sora-2: توليد الصوت الأصلي. بالنسبة لصنّاع المحتوى الذين يريدون مخرجًا متكاملًا للصورة والصوت دون سير عمل منفصل للصوت، فإن هذه ميزة مهمة.

Veo 3.1 مقابل Kling v3 و Gen-4.5

يُعد Kling v3 باستمرار من أقوى نماذج تحويل النص إلى فيديو المتاحة، مع تحريك شخصيات استثنائي ونطاق أسلوبي قوي. أما Gen-4.5 من Runway فهو أداة بمستوى احترافي، تتميز بتحكم عميق في الكاميرا وسير عمل إنتاجي راسخ.

يتنافس Veo 3.1 بشكل مباشر مع كليهما من حيث جودة المخرجات، ويتقدم عليهما تحديدًا في:

  • البيئات الواقعية كالصور الفوتوغرافية: تُعرض المناظر الطبيعية والمدن والأماكن الطبيعية بعمق أكبر
  • تماسك الإضاءة: تبقى الظلال والإضاءات متسقة مع تحرك الكاميرا
  • الصوت الأصلي: لا يقدم أي من Kling v3 أو Gen-4.5 حاليًا توليدًا صوتيًا مدمجًا

منظر درامي لمرتفعات بركانية أيسلندية عند شروق الشمس مع أشعة ذهبية حجمية

مشكلة الصوت تم حلها

هنا يفعل Veo 3.1 شيئًا مختلفًا فعلًا. فكل مولّد فيديو آخر في السوق ينتج فيديو فقط. يأتي الصوت، إن احتجت إليه، كخطوة منفصلة: تولّد المقطع، ثم تضيف الموسيقى أو أصوات الطبيعة أو الصوت المحيط أو الحوار في مرحلة ما بعد الإنتاج.

يولّد Veo 3.1 صوتًا متزامنًا ضمن العملية نفسها. وهذا يعني أنك إذا طلبت مقطعًا لأمواج المحيط تتكسر على شاطئ صخري عند الغروب، ستحصل على الفيديو و_صوت_ تلك الأمواج معًا، متزامنًا مع المشهد.

صوت أصلي دون معالجة لاحقة

يغطي توليد الصوت في Veo 3.1 عدة فئات:

الصوت المحيط: الرياح والمطر والحشود والمحيط وحركة المرور وتغريد الطيور

أصوات الأشياء: وقع الخطوات، وصرير الأبواب، ومحركات المركبات، وجريان الماء

الموسيقى: يمكن للنموذج أن يولّد خلفيات موسيقية بسيطة تتناسب مع مزاج المشهد

الحوار: يمكن للشخصيات في المشهد أن تتحدث، رغم أن الحوار المعقد ما زال مجالًا للتحسين

💡 نصيحة احترافية: للحصول على أفضل نتائج صوتية، كن واضحًا في أمرك النصي. بدلًا من "شارع مزدحم"، اكتب "شارع مزدحم في وسط المدينة مع أصوات بوق السيارات، وأصوات بناء بعيدة، وأحاديث المارة". فالتحديد في وصف الصوت يحسّن جودة المخرجات بشكل مباشر.

مخرج فيديو ذكر واثق يقف مطويّ الذراعين ويدرس لقطات أمواج محيط سينمائية على شاشة استوديو

تسدّ هذه القدرة فجوة كبيرة بين المحتوى المولّد بالذكاء الاصطناعي والفيديو المنتج بالطرق التقليدية. فإعلان ترويجي مدته 30 ثانية كان يتطلب سابقًا خطوة توليد فيديو، وخطوة ترخيص موسيقى، وخطوة تصميم صوت، ومزجًا نهائيًا، أصبح الآن يمكن إنتاجه في سير عمل بمخرج واحد محتمل.

لمن هذا فعلًا

لا يستفيد الجميع بالتساوي مما يقدمه Veo 3.1. فنقاط قوة النموذج تناسب حالات استخدام محددة أكثر من غيرها.

صنّاع المحتوى الأفراد واستوديوهات الإنتاج المستقلة

إذا كنت يوتيوبرًا أو صانع محتوى قصير أو شركة إنتاج صغيرة، فإن Veo 3.1 يقلّص فجوة الموارد بينك وبين الإنتاجات الكبيرة. يعني الصوت المدمج أنك تستطيع إنتاج مقطع مصقول دون سير عمل منفصل لتصميم الصوت. كما أن الدقة القوية في تطبيق الأوامر النصية تعني إعادة تصوير أقل ووقتًا أقل في التكرار.

بالنسبة للقطات الداعمة (b-roll)، ومحتوى وسائل التواصل الاجتماعي، وعروض المنتجات، والفيديوهات الترويجية القصيرة، فإن Veo 3.1 أداة عملية بعائق دخول منخفض.

فرق التسويق والعلامات التجارية

ستجد فرق العلامات التجارية التي تعمل على الإعلانات الإبداعية والحملات الاجتماعية أو إطلاقات المنتجات أن تصيير البيئات الواقعية مفيد بشكل خاص. فأمر نصي مثل "لقطة مقرّبة لساعة فاخرة على حزام جلدي فوق سطح من الرخام، إضاءة استوديو دافئة، دوران بطيء، عمق ميداني سينمائي" يُنتج الآن شيئًا ينافس تصوير منتج أساسي.

امرأة ذات شعر أحمر داكن ونمش تبتسم أثناء العمل على حاسوب محمول فوق أريكة حديثة مشرقة

أفضل حالات الاستخدام لفرق التسويق:

  • عرض المنتجات والنماذج الأولية
  • محتوى داعم لوسائل التواصل الاجتماعي وملء المساحات
  • تصوّر المفاهيم قبل الالتزام بتصوير حي
  • اختبار المفاهيم الإبداعية (A/B) بتكلفة منخفضة

كيفية استخدام Veo 3.1 على PicassoIA

يوفّر PicassoIA النموذجين Veo 3.1 وVeo 3.1 Fast مباشرةً ضمن مجموعة تحويل النص إلى فيديو، ما يجعلهما متاحين دون الحاجة إلى إعداد API أو ضبط إعدادات المطورين. إليك كيفية الاستفادة منهما إلى أقصى حد.

فريق متنوع من ثلاثة محترفين يتعاونون حول شاشة تعمل باللمس في مساحة عمل مشتركة على الطراز الاسكندنافي

كتابة الأوامر النصية خطوة بخطوة

تحدد جودة مخرجاتك بالكامل تقريبًا جودة الأمر النصي. إليك بنية موثوقة:

1. الموضوع والفعل ابدأ بالشخص أو العنصر الرئيسي وما يفعله. مثال: "امرأة ترتدي فستانًا أبيض تسير عبر حقل من الخزامى"

2. البيئة والمكان صف الموقع والوقت من اليوم بتحديد. مثال: "...عند الساعة الذهبية في بروفانس بفرنسا، مع تلال متدرجة في الخلفية"

3. الإضاءة حدد ظروف الإضاءة بدقة. مثال: "...ضوء شمس دافئ من الخلف يخلق تأثير الهالة، وظلال طويلة عبر صفوف الخزامى"

4. الكاميرا حدد حركة الكاميرا ونوع اللقطة. مثال: "...دوللي بطيء يقترب من لقطة متوسطة إلى مقرّبة، وعمق ميداني ضحل"

5. الصوت (Veo 3.1 فقط) صف البيئة الصوتية. مثال: "...مع نسيم خفيف يمر بين الخزامى، وتغريد طيور بعيد، وموسيقى محيطية ناعمة"

مثال كامل لأمر نصي:

"امرأة ترتدي فستانًا أبيض تسير ببطء عبر حقل من الخزامى عند الساعة الذهبية في بروفانس بفرنسا. تلال متدرجة في الخلفية. ضوء الشمس الدافئ من الخلف يخلق تأثير الهالة ويلقي ظلالًا طويلة على صفوف الخزامى. دوللي بطيء يقترب من لقطة متوسطة إلى مقرّبة، وعمق ميداني ضحل. نسيم خفيف بين الخزامى، وتغريد طيور بعيد، وموسيقى محيطية ناعمة."

نصائح للحصول على نتائج سينمائية

النصيحةلماذا تنجح
استخدم مفردات تصوير الأفلام"عمق الميدان" و"البوكيه" و"الحبيبات" تشير إلى نية سينمائية
حدد وقتًا معينًا من اليوم"الساعة الذهبية" تعطي إضاءة مختلفة عن "بعد الظهر"
حدد حركة الكاميرا"دوللي يقترب" مقابل "لقطة ثابتة" يغيّر الإحساس تمامًا
أضف تفاصيل الطقس"غائم" مقابل "سماء صافية" يؤثر في المزاج والظلال
أدرج مرجعًا للملمس"جلد متآكل" و"رخام مصقول" يضيفان واقعية فيزيائية

💡 خيار السرعة: للتكرار السريع، استخدم Veo 3.1 Fast، الذي يقدم مخرجات أسرع بجودة أقل قليلًا. وهو مثالي لاختبار تنويعات الأوامر النصية قبل الالتزام بتوليد بجودة كاملة.

امرأة تحمل هاتفًا ذكيًا يعرض مقارنة جنبًا إلى جنب لجودة فيديو بالذكاء الاصطناعي

ما زال لديه مجال للتطور

لا يخلو أي نموذج من الحدود، ويكشف Veo 3.1 عن قيوده بصراحة.

حدود المدة

ثماني ثوانٍ هي السقف الحالي لمقطع واحد. وفي أي مشروع يتطلب لقطات مستمرة أطول، ستحتاج إلى دمج عدة مخرجات معًا في المونتاج. هذا ممكن لكنه يضيف عناء. تتمتع نماذج مثل Sora-2 بمقاطع تصل إلى 20 ثانية بميزة هنا للاحتياجات طويلة المدى.

اتساق الأسلوب عبر المقاطع

توليد عدة مقاطع من أوامر نصية مرتبطة لا يضمن الاتساق البصري بينها. قد تتغير الإضاءة، وقد يختلف مظهر الشخصية قليلًا. وفي المشاريع التي تحتاج هوية بصرية متسقة عبر مقاطع كثيرة، ستحتاج إلى وضع قوالب للأوامر النصية واختبارها بعناية قبل التوسع في الإنتاج.

حلول بديلة مفيدة:

  • استخدم قيمة البذرة نفسها عبر المقاطع المرتبطة لأسلوب أكثر اتساقًا
  • حافظ على وصف الشخص نفسه في جميع الأوامر النصية ضمن التسلسل
  • ولّد مخرجات إضافية واختر الأكثر تناسقًا في المونتاج
  • ادمج مقاطع Veo 3.1 مع مرور لرفع الدقة للمسة النهائية

منظور من زاوية منخفضة لممر مركز بيانات تابع لشركة Google مع رفوف خوادم مضاءة تمتد إلى البعيد

الصورة الأكبر

يشير إطلاق Veo 3.1 إلى الاتجاه الذي يتجه إليه المجال كله. قبل عام، كان الفيديو المولّد بالذكاء الاصطناعي مجرد فضول. قبل ثمانية عشر شهرًا، كان بالكاد يعمل. اليوم، يمثل Veo 3.1 وKling v3 وGen-4.5 وLTX-2.3-Pro وWan 2.6 جيلًا من الأدوات القادرة على إنتاج لقطات لا يخجل محترف من استخدامها في سياقها.

يغيّر توليد الصوت في Veo 3.1 تحديدًا اقتصاديات إنتاج المحتوى. أدوات أقل مطلوبة، وتكرار أسرع، وتكلفة أقل لكل مخرج. بالنسبة لصانع محتوى منفرد أو فريق صغير، فإن هذا تحول حقيقي فيما يمكن تحقيقه.

شابة ذات شعر داكن تبتسم وهي تنظر إلى هاتفها على شرفة مقهى في برشلونة تغمرها إضاءة ذهبية دافئة

ما سيأتي لاحقًا ليس صعب التوقع: مقاطع أطول، ودقة أعلى، وثبات أفضل للشخصيات، وتحكم أدق في الصوت. النماذج التي تُطلق اليوم هي الحد الأدنى، لا السقف.

ابدأ الإنتاج الآن

إن كنت تتابع فيديوهات الذكاء الاصطناعي من بعيد، فهذه لحظة مناسبة للتوقف عن المتابعة والبدء في الإنتاج. Veo 3.1 متاح الآن على PicassoIA دون الحاجة إلى إعداد API. تكتب أمرًا نصيًا، فتحصل على فيديو مع صوت.

تتوفر نماذج الفيديو الأخرى على المنصة، ومنها Kling v3 وGen-4.5 وSora-2 وLTX-2.3-Pro وPixVerse v5.6، إذا أردت مقارنة المخرجات أو البحث عن النموذج الذي يناسب أسلوبك. لكل نموذج طابعه الخاص، وأفضل طريقة لمعرفة أيها يناسب حالتك هي تشغيلها جنبًا إلى جنب.

اكتب أمرًا نصيًا. ولّد مقطعًا. وشاهد ما يفعله Veo 3.1 به.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة