يأتي Veo 3.1 من Google في وقت يتحرك فيه مجال الفيديو بالذكاء الاصطناعي أسرع مما يستطيع معظم المبدعين مواكبته. قبل ستة أشهر، كان "الفيديو المولّد بالذكاء الاصطناعي" يعني حلقات مهتزة، ووجوهًا تتشوّه، وعيوبًا زمنية تصرخ بأنها اصطناعية. اليوم تغيّر المعيار تغيّرًا كبيرًا، حتى إن السؤال لم يعد هل يستطيع الذكاء الاصطناعي إنتاج لقطات تستحق المشاهدة، بل هل يستطيع إنتاج لقطات تقف جنبًا إلى جنب مع عمل مصوّر سينمائي محترف. ويقدّم Veo 3.1 حجة قوية بأن الجواب نعم.
هذه مراجعة عملية للنموذج Veo 3.1، أحدث نموذج لتوليد الفيديو من Google DeepMind. نتناول ما يميّزه، وأين يُظهر أفضل أداء، وأين يتعثر، وكيف يقارن بأقوى المنافسين المتاحين حاليًا.

ماذا يفعل Veo 3.1 فعليًا
Veo 3.1 نموذج لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو، طورته Google DeepMind. يولّد مقاطع فيديو تصل مدتها إلى دقيقة من أمر نصي مكتوب، ويمكن تثبيتها اختياريًا على صورة إدخال. يعمل النموذج بدقة تصل إلى 4K، ومعدل إطارات يصل إلى 60 إطارًا في الثانية، وينتج مخرجات تعكس ما تسمّيه DeepMind "الطلاقة السينمائية" في حركة الكاميرا، وفيزياء الإضاءة، وتكوين المشهد.
ما يفصل Veo 3.1 عن أسلافه وعن معظم المنافسين هو الاتساق الزمني. فقد كانت نماذج الفيديو السابقة بالذكاء الاصطناعي تعاني بشكل معروف من أشياء تختفي بين الإطارات، ووجوه تتشوّه فجأة في منتصف المقطع، وحركات كاميرا تبدو منفصلة عن فيزياء المشهد. يتعامل Veo 3.1 مع هذه المشكلات بصورة أفضل بكثير، وإن لم يكن ذلك بشكل مثالي.
مبنيّ على بنية الانتشار لدى DeepMind
يستخدم Veo 3.1 بنية محوّل انتشار للفيديو، مدرّبة على مجموعة بيانات ضخمة مملوكة تشمل لقطات سينمائية مرخّصة، ومواد وثائقية، وبيانات تدريب اصطناعية. يمنح هذا النموذج مفردات من التصوير السينمائي الاحترافي لا تملكها النماذج الأرخص ببساطة. عندما تطلب "لقطة تتبّعية من زاوية منخفضة لعدّاء يركض في زقاق مرصوف بالحجارة مبلّل عند الغسق"، لا يكتفي Veo 3.1 بإنتاج الشخص والخلفية. بل ينتج انزياحًا منظوريًا مقنعًا، ورطوبة جوية في الهواء، وتلك التأثيرات الطفيفة لتثبيت الكاميرا التي تجعل اللقطة تبدو مُلتقطة لا مُصيَّرة.
💡 نصيحة: كلما كانت لغتك السينمائية أكثر تحديدًا، أدّى Veo 3.1 أداءً أفضل. استشهد بحركات كاميرا حقيقية مثل "dolly zoom" أو "handheld verité" أو "orbital crane shot" لتحصل على مخرجات أفضل بشكل ملحوظ.
الصوت الأصلي: ميزة فارقة حقيقية
ميزة واحدة تفصل Veo 3.1 عن كل منافس تقريبًا هي توليد الصوت الأصلي. يولّد النموذج أصواتًا محيطية متزامنة، ومؤثرات صوتية، وصوتًا جويًا كجزء من مخرجات المقطع. يتضمن مشهد الشاطئ أصوات الأمواج والرياح. ويتضمن شارع المدينة حركة المرور وهمهمة الحشود. هذه ليست معالجة لاحقة تُضاف بعد التوليد. الصوت والفيديو يُصنَعان معًا، ما يعني أن الصوت يطابق الديناميكية البصرية بطريقة تبدو عضوية لا مُطبَّقة فوق الصورة.

تفصيل الجودة السينمائية
تماسك الحركة
هنا يتفوّق Veo 3.1 بوضوح أكبر على بقية المجال. يشير تماسك الحركة إلى مدى ثبات سلوك الأشياء والأشخاص والبيئات عبر الإطارات. ينبغي للشخص الذي يمشي أن يتأرجح بذراعيه بطريقة معقولة فيزيائيًا. وينبغي لعلم يرفرف في الريح أن يتصرف وفق تيار هوائي ثابت، لا أن يغيّر اتجاهه عشوائيًا. يحافظ Veo 3.1 على هذا التماسك أفضل من أي نموذج متاح للعموم في الوقت الحالي.
في الاختبارات مع أشخاص حقيقيين، يتعامل النموذج مع المشي الطبيعي، وحركة الوجه، والحركة الثانوية (الشعر والملابس) بدرجة من الدقة تقترب من اللقطات المرجعية. تبقى الحركة السريعة نقطة ضعف جزئية. فالأشخاص الذين يتحركون بسرعة عالية يُظهرون أحيانًا تشوّهًا طفيفًا عند حواف الإطار، خاصة عندما تحتوي الخلفية على تفاصيل دقيقة.
الإضاءة والعمق
يتعامل Veo 3.1 مع الإضاءة كفيزياء لا كفلتر بصري. اطلب "مشهدًا داخليًا بمصباح عملي واحد يُلقي ظلالًا حادة"، وسيضع النموذج الظلال بشكل صحيح وفق موضع مصدر الضوء الموصوف. تتصرف الانعكاسات المتوهجة على الأسطح المبللة بواقعية. ويُنتج التشتت تحت السطحي على الجلد في ضوء ناعم موجّه الدفء الذي يُنفق المصورون السينمائيون آلاف الدولارات على معدات الإضاءة لتحقيقه في موقع التصوير.
يُعالَج عمق المجال بالدقة نفسها. حدّد عمق مجال ضحل، وستحصل العناصر الأمامية على فصل بوكيه طبيعي عن الخلفية، حيث يعكس حجم دائرة البوكيه وشكلها البعد البؤري الضمني. هذا المستوى من المحاكاة البصرية في نموذج فيديو توليدي مثير للإعجاب حقًا.

Veo 3.1 مقابل المنافسين
يضم مجال تحويل النص إلى فيديو خمسة منافسين جادّين في الوقت الحالي. إليك كيف يقارن Veo 3.1 بكل واحد منهم.
Veo 3.1 مقابل Sora 2
يظل Sora 2 Pro من OpenAI أقرب منافس من حيث الدقة السينمائية الخام. يُنتج النموذجان لقطات يمكن الخلط بينها وبين فيديو حقيقي في ظل ظروف مضبوطة. تنقسم الفروقات الأساسية إلى ثلاثة مجالات. أولًا، يتضمن Veo 3.1 صوتًا أصليًا بينما لا يتضمنه Sora 2. ثانيًا، يتعامل Veo 3.1 مع المقاطع الأطول مدةً بثبات أكبر دون انجراف ملحوظ. ثالثًا، يميل Sora 2 إلى تقديم تفسيرات أكثر تعبيرًا وأسلوبية قليلًا للأوامر، بينما يميل Veo 3.1 نحو الحرفية الواقعية.
بالنسبة للمبدعين الذين يحتاجون إلى لقطات تندمج بسلاسة مع المحتوى الواقعي، يتفوق Veo 3.1. أما لمن يريدون تفسيرات سينمائية بحس بصري أكبر، فإن Sora 2 Pro ينافس عن قرب.
Veo 3.1 مقابل Kling v3
يُعدّ Kling v3 من Kuaishou الرائد في السرعة ضمن هذه المقارنة. فهو يولّد المقاطع أسرع بكثير من Veo 3.1 بتكلفة متقاربة لكل ثانية من المخرجات. وبالنسبة لمحتوى وسائل التواصل الاجتماعي حيث تهم سرعة الإنجاز أكثر من دقة 4K، يمثّل Kling v3 خيارًا قويًا. مع ذلك، لا يضاهي عمقه السينمائي عمق Veo 3.1، خاصة في سيناريوهات الإضاءة المعقدة والمشاهد متعددة الأشخاص، حيث يكون الاتساق الزمني حاسمًا.

حالات استخدام واقعية للمبدعين
وسائل التواصل الاجتماعي والمحتوى القصير
Veo 3.1 فعّال جدًا في إنشاء محتوى قصير بجودة سينمائية على المنصات التي تكافئ الجودة البصرية. تُعدّ لقطات المنتجات، ولقطات نمط الحياة، ولقطات b-roll بأسلوب السفر، وفيديوهات الخلفية ذات الأجواء المحيطة للإعلانات مجالات يتفوّق فيها النموذج. ومخرجاته الصوتية الأصلية مفيدة بشكل خاص هنا، لأن المنصات تكافئ الفيديوهات التي يتطابق صوتها مع المحتوى البصري بشكل طبيعي.
يُعدّ الإصدار السريع الخيار الأفضل للمحتوى الاجتماعي عالي الحجم، حيث تهم السرعة أكثر من مخرجات 4K. ينتج مقاطع 1080p بالطابع السينمائي نفسه وبسرعة توليد أكبر بنحو الضعف تقريبًا، ما يجعله مثاليًا للفرق التي تُجري عدة اختبارات إبداعية يوميًا.
سير عمل الإنتاج الاحترافي
بالنسبة لفرق الإنتاج، يُستخدم Veo 3.1 بأكثر الطرق طبيعيةً كأداة للتخطيط البصري المسبق ولقطات b-roll. يشير التخطيط البصري المسبق إلى توليد تمثيلات بصرية تقريبية للّقطات المخطط لها قبل الالتزام بالإنتاج الفعلي. يستطيع المخرج أن يصف لقطة رافعة معقدة ويرى تمثيلًا واقعيًا لها خلال دقائق بدلًا من أيام من العمل التقليدي للتخطيط البصري المسبق. وتوفيرات التكلفة والوقت هنا كبيرة.
أما لقطات b-roll، فيتعامل النموذج مع اللقطات التأسيسية، ولقطات الإدراج، ولقطات القطع ذات الأجواء المحيطة بشكل مقنع. فاللقطات الخارجية الواسعة للمواقع، ولقطات نمط الحياة المجردة، والصور المقرّبة للبيئة كلها حالات استخدام قوية. أما لقطات أشخاص محددين بأسمائهم فلا تناسب النموذج، لأنه يولّد أشخاصًا مجهولين لا يعيد إنتاج أشخاص حقيقيين.

أين يقصّر
لا توجد مراجعة صادقة لنموذج ذكاء اصطناعي توليدي تتجاهل القيودَ الحقيقية، ويملك Veo 3.1 عدة قيود تستحق المعرفة قبل أن تلتزم به.
اليدان وتفاصيل الحركة الدقيقة: ما زال النموذج يتعثر مع الأيدي التي تؤدي مهام معقدة. فالأصابع المتحركة، وكتابة لوحة المفاتيح، وعزف الآلات الموسيقية، وتسلسلات الحركة الدقيقة المشابهة تُنتج عيوبًا أكثر من غيرها من الموضوعات.
النص داخل الفيديو: النص المعروض على الشاشة داخل إطار الفيديو غير موثوق. تتشوّه الحروف بين الإطارات. وإذا كنت تحتاج إلى تراكبات نصية دقيقة، فأضفها في مرحلة ما بعد الإنتاج بدلًا من طلبها مباشرة في الأمر النصي.
الاستمرارية السردية في المقاطع الطويلة: بينما يتعامل Veo 3.1 مع المقاطع التي تصل إلى دقيقة بشكل جيد في المحتوى الجوي، تبقى الاستمرارية السردية عبر المقاطع الأطول غير ثابتة. قد يتغيّر مظهر الشخصية الواحدة عبر مقطع مدته 45 ثانية بطرق تكسر وهم اللقطة المتصلة.
سرعة التوليد بدقة 4K: يستغرق توليد المخرجات بالدقة الكاملة وقتًا ملحوظًا. إذا كان سير عملك يتطلب تكرارًا سريعًا بدقة 4K، فخصّص وقتًا إضافيًا، أو استخدم الإصدار السريع وارفع الدقة في مرحلة ما بعد الإنتاج.
💡 نصيحة: اقرن Veo 3.1 Fast بنموذج للدقة الفائقة لرفع دقة المخرجات بعد التوليد. ستحصل على سرعة الإصدار السريع مع جودة بصرية قريبة من 4K في النتيجة النهائية، وبتكلفة أقل لكل توليد.

كيفية استخدام Veo 3.1 على PicassoIA
Veo 3.1 متاح مباشرة على PicassoIA. إليك سير العمل للحصول على أول مقطع سينمائي لك من النموذج.
الخطوة 1: افتح صفحة النموذج
انتقل إلى صفحة نموذج Veo 3.1 على PicassoIA. سترى حقل إدخال الأمر النصي، وخيار رفع صورة اختياري لتوليد تحويل الصورة إلى فيديو، ولوحة إعدادات التوليد. إذا أردت مخرجات أسرع لاختبار اتجاه أمرك النصي، فانتقل أولًا إلى Veo 3.1 Fast، وتحقق من أمرك، ثم شغّل المخرجات النهائية عبر Veo 3.1 الكامل للحصول على أقصى جودة.
الخطوة 2: اكتب أمرًا نصيًا سينمائيًا
ينبغي أن يتبع أمرك النصي هذا الهيكل: الشخص والحركة + البيئة + حركة الكاميرا + ظروف الإضاءة + المزاج أو الجو العام. التحديد في لغة الكاميرا والإضاءة هو ما يفصل الفيديو العادي بالذكاء الاصطناعي عن المخرجات السينمائية.
أمر نصي ضعيف: "a woman walking on a beach"
أمر نصي قوي: "a woman in a white linen dress walking barefoot on a wide sand beach at golden hour, slow dolly shot tracking alongside her from knee height, warm side light creating long shadows on the wet sand, calm ocean in background with gentle surf, atmospheric coastal haze diffusing the horizon"
الفرق في جودة المخرجات بين هذين الأمرين النصيين كبير. يكافئ Veo 3.1 التحديد السينمائي أكثر من أي نموذج فيديو آخر تقريبًا.
الخطوة 3: حدّد المدة والصوت
يدعم Veo 3.1 مدد مقاطع تتراوح من 5 إلى 60 ثانية. وبالنسبة لمحتوى وسائل التواصل الاجتماعي، فإن 8 إلى 15 ثانية هي النقطة المثالية. فعّل توليد الصوت الأصلي للحصول على صوت محيطي متزامن مع مخرجاتك. وحدها هذه الميزة تميّز Veo 3.1 عن Sora 2، وKling v3، وGen-4.5، وعن معظم المنافسين الآخرين على المنصة.
الخطوة 4: ولّد وكرّر
شغّل مقطعك الأول. إذا لم يكن التكوين أو الحركة مناسبين تمامًا، فعدّل عناصر محددة بدلًا من إعادة كتابة الأمر النصي بالكامل. غيّر متغيرًا واحدًا في كل مرة: بدّل زاوية الكاميرا، أو عدّل وصف الإضاءة، أو غيّر فعل الشخص. هذا الأسلوب يوصلك إلى نتيجة قوية أسرع من البدء من جديد في كل تكرار.

Veo 3.1: التقييم الواقعي
Veo 3.1 هو أقوى نموذج لتحويل النص إلى فيديو لإنتاج مخرجات واقعية كالصور الفوتوغرافية بجودة سينمائية متاح حاليًا. فالجمع بين تماسك الحركة، ودقة الإضاءة، وتوليد الصوت الأصلي يضعه في المقدمة على المنافسين في السيناريوهات الأهم لعمل المحتوى الاحترافي وشبه الاحترافي.
من يستفيد أكثر
- صانعو المحتوى الذين ينتجون فيديوهات نمط الحياة أو السفر أو العلامات التجارية على نطاق واسع
- فرق وسائل التواصل الاجتماعي التي تحتاج إلى لقطات b-roll عالية الجودة دون تكاليف إنتاج فعلي
- صنّاع الأفلام الذين يستخدمون الذكاء الاصطناعي للتخطيط البصري المسبق أو التكرار السريع للمفاهيم
- وكالات التسويق التي تنتج أصول فيديو للمنتجات والحملات بإنجاز سريع
- المطورون الذين يبنون تطبيقات وخطوط فيديو فوق الواجهة البرمجية API
التسعير والقيمة
يعمل Veo 3.1 وفق نموذج تسعير يحتسب التكلفة بالثانية. يكلّف إصدار 4K أكثر لكل ثانية من إصدار 1080p السريع. وفي معظم سير العمل الإنتاجي، يقدّم الإصدار السريع بدقة 1080p قيمة جيدة، بينما يُخصَّص Veo 3.1 الكامل للَّقطات الرئيسية وملفات التسليم النهائية التي تكون فيها الدقة مهمة.
في الفئة السريعة، تُسعَّر الجودة السينمائية لنموذج Veo 3.1 بتنافسية مقارنة مع Kling v3 وHailuo 2.3 وبدائل أخرى ضمن النطاق السعري نفسه. أنت لا تدفع علاوة مقابل الجِدّة. أنت تدفع مقابل فرق جودة قابل للقياس في تماسك الحركة والإضاءة والصوت.

ابدأ الإنشاء باستخدام Veo 3.1
إذا كنت تنتظر أن يصل توليد الفيديو بالذكاء الاصطناعي إلى مرحلة تكون فيها مفيدة فعلًا لعمل المحتوى الاحترافي، فإن Veo 3.1 هو تلك المرحلة. الفجوة بين الفيديو المولّد بالذكاء الاصطناعي واللقطات المُلتقطة بالكاميرا تضيق أسرع مما توقّع أي شخص، والأدوات المتاحة على PicassoIA تضع هذه التقنية في متناول المبدعين من كل المستويات دون الحاجة إلى ميزانية إنتاج.
أفضل طريقة لترى ما يستطيع Veo 3.1 فعله هي أن تشغّل أمرًا نصيًا بنفسك. انتقل إلى صفحة Veo 3.1 على PicassoIA، واكتب أول أمر نصي سينمائي لك باستخدام الهيكل أعلاه، وشاهد المخرجات. قارن النموذج الكامل مع Veo 3.1 Fast لسير عملك المحدد، وألقِ نظرة على الجيل السابق Veo 3 لترى كم قطع النموذج من الشوط في دورة تطوير واحدة. كما يوفّر PicassoIA نماذج للدقة الفائقة لرفع دقة المقاطع المولّدة، وأدوات جودة الفيديو للتثبيت وتصحيح الألوان، ونماذج توليد الصوت لتأليف الموسيقى التصويرية لفيديوهاتك النهائية، ما يجمع خط إنتاج الذكاء الاصطناعي الكامل في مكان واحد دون حسابات متعددة أو تنقّل بين المنصات.