ليس Veo 3.1 من Google نموذج الفيديو الوحيد المتاح بالذكاء الاصطناعي حاليًا، لكنه النموذج الذي أثار أكثر النقاشات جدية بين صنّاع الأفلام ومبدعي الفيديو. السبب بسيط: يتعامل مع حركة الكاميرا بطريقة كانت تتطلب في السابق معدّة تصوير فعلية، ومشغّلًا مدرَّبًا، وتنظيفًا واسعًا في مرحلة ما بعد الإنتاج. هذا ادعاء قوي، ويستحق نظرة متأنية إلى ما يفعله Veo 3.1 بشكل مختلف، وأين ينجح باستمرار، وكيف يمكنك توظيفه.
ما الذي تغيّر بين Veo 2 وVeo 3.1
الفجوة بين Veo 2 وVeo 3.1 ليست مجرد ترقية إصدار. في Veo 2، كانت تعليمات حركة الكاميرا تفسيرية في أحسن الأحوال. كان النموذج يستطيع تقريب دفعة بطيئة نحو الشخص أو حركة Pan، لكن المنطق المكاني كان غير متسق. العناصر في المقدمة تنجرف بطرق لا تتطابق مع مسار الكاميرا المقصود، وكانت المشاهد المعقدة تكسر الوهم بالكامل.
يتعامل Veo 3.1 مع حركة الكاميرا باعتبارها تعليمة من الدرجة الأولى. لقد تعلّم العلاقة الفيزيائية بين موضع العدسة وطولها البؤري وعمق المشهد. عندما تصف حركة Dolly-in، يتصرف التباعد المنظوري بين عناصر المقدمة والخلفية كما كان سيتصرف في موقع تصوير حقيقي. هذا ليس أمرًا بسيطًا. إنه الفرق الجوهري بين لقطات تبدو حقيقية ولقطات تبدو مولَّدة بالذكاء الاصطناعي.

التحوّل الفيزيائي
أكبر تحسين داخلي في Veo 3.1 هو ما وصفه المهندسون بالاستدلال في فضاء المشهد. بدلًا من التنبؤ بالبكسلات في 2D وإضافة متجهات الحركة لاحقًا، يبني النموذج نموذجًا مكانيًا عاملًا للمشهد قبل أن يلتزم بأي إطار. ثم تُطبَّق تعليمات الكاميرا على ذلك النموذج المكاني، لا على صورة مسطّحة.
النتيجة فورية: تتحرك العناصر في المقدمة أسرع من عناصر الخلفية أثناء الحركات الجانبية، وتبقى إشارات العمق متسقة أثناء دفعات الاقتراب، ويظهر تشوّه العدسات واسعة الزاوية بشكل طبيعي عند حواف الإطار أثناء الحركات القصوى. تبدو اللقطة ثلاثية الأبعاد لأن النموذج يعمل في فضاء ثلاثي الأبعاد محاكى، لا يقرّب الحركة فوق سطح ثنائي الأبعاد.
💡 هذا النموذج المكاني هو أيضًا سبب قدرة Veo 3.1 على إبقاء موضوع واضح داخل الإطار أثناء حركات القوس المعقدة، دون أن يبدو الشخص مشوّهًا أو منزلقًا، وهي مشكلة متكررة في الإصدارات السابقة من النموذج.
الصوت الأصلي يغيّر كل شيء
قدّم Veo 3 الصوت الأصلي المتزامن. ويحسّن Veo 3.1 هذه الميزة بشكل كبير. عندما تنفّذ الكاميرا حركة Whip Pan سريعة، لا يستمر الصوت كما لو كانت اللقطة ثابتة. يتموضع الصوت المحيطي وفق اتجاه الكاميرا، وهذا تفصيل دقيق لكنه مهم إدراكيًا. أصبحت لقطة التتبع التي تلاحق شخصًا متحركًا تبدو كلقطة تتبع، لا كتسجيل ثابت موضوع فوق صور متحركة.
تفيد مزامنة الصوت المكاني هذه أيضًا كأداة تشخيص أثناء الإنتاج. إذا ولّدت مقطعًا وبدا الصوت ثابتًا بينما الصورة تتحرك، فمن المرجح أن تعليمة الكاميرا لم تُسجَّل كما قصدت. وعدم تطابق الصوت والصورة مكانيًا مؤشر مبكر موثوق على أن الأمر النصي يحتاج إلى تعديل قبل أن تنفق نقاطًا على توليد بدقة كاملة.
الحركات الست للكاميرا التي يتقنها Veo 3.1
لا تتعامل كل النماذج مع كل حركات الكاميرا بالمستوى نفسه من الجودة. الحركات التالية هي تلك التي يكون فيها Veo 3.1 موثوقًا فعلًا ويمكن تكرار نتائجه عبر التوليدات.
Pan وTilt
حركة Pan هي دوران أفقي حول المحور الرأسي للكاميرا. أما Tilt فهي مكافئها الرأسي. يستجيب Veo 3.1 لكلتيهما بوضوح عندما يحدد الأمر النصي الاتجاه والسرعة. أهم ما يمكنك فعله هو منح النموذج سياقًا مرجعيًا: صف ما يظهر في بداية الحركة وما ينبغي أن يظهر في نهايتها.
أوامر تعطي نتائج موثوقة:
- "slow pan left revealing a wide cityscape at sunrise"
- "quick upward tilt from the dusty floor to the cathedral ceiling"
- "gentle pan right following the subject as they walk toward the door"
يحافظ النموذج على حدة الحواف أثناء حركات Pan البطيئة، ويضيف ضبابية حركة مناسبة أثناء الحركات السريعة، بما يطابق ما كان مشغّل الكاميرا سيلتقطه بسرعة غالق تبلغ 1/50 من الثانية. هذه المعايرة التلقائية لضبابية الحركة من التفاصيل التي تجعل اللقطات تبدو راسخة فوتوغرافيًا.

لقطات Dolly وTruck
حركة Dolly هي تقدّم أو تراجع على امتداد محور العدسة. أما Truck فهي انتقال جانبي دون دوران. وهذه هي الحركات التي فشلت فيها معظم نماذج الذكاء الاصطناعي تاريخيًا، لأنها تتطلب تغيّرًا متسقًا في المنظور عبر كل بكسل في الإطار في وقت واحد.
يتعامل Veo 3.1 مع الحركتين بوضوح. تنتج حركة Dolly-in المطلوبة منظورًا متمددًا بشكل صحيح، إذ تكبر العناصر القريبة أسرع من البعيدة. وتحافظ لقطات Truck على ثبات رأسي بينما ينزلق المشهد أفقيًا بطريقة تبدو راسخة فيزيائيًا. التباعد المنظوري صحيح. وهذا التفصيل هو ما يجعل حركة Dolly تبدو كحركة Dolly لا كتكبير بالعدسة، وهو التفصيل الذي لا تزال معظم النماذج المنافسة تخطئ فيه.
حركات Orbit وArc
حركة Orbit هي دوران بزاوية 360 درجة أو قوس جزئي حول موضوع ما، تحافظ فيه الكاميرا على نصف قطر ثابت أثناء الدوران. وهي من أكثر الحركات إشباعًا سينمائيًا، وتُستخدم غالبًا لإضافة دراما حول شخصية أو جسم مركزي. وهي كذلك من أصعب الحركات في فيديو الذكاء الاصطناعي، لأنها تتطلب من النموذج الحفاظ على حجم ثابت للشخص، واتجاه إضاءة متسق عليه، وخلفية تدور بالمنظور الصحيح طوال القوس.
يتعامل Veo 3.1 مع هذا بمستوى يثير الإعجاب باستمرار. يبقى الشخص في المركز وحادًا، ويبدو التباعد المنظوري للخلفية مقنعًا، ولا تنقلب الإضاءة على الشخص عشوائيًا عندما تعبر الكاميرا حد الظل. هذه النقطة الأخيرة تستحق الذكر، لأن معظم النماذج تنتج عدم اتساق واضح في اتجاه الضوء أثناء حركات Orbit.
💡 للكشف الدرامي عن الشخص، جرّب: "الكاميرا تدور ببطء بزاوية 180 درجة حول شخص يقف في حقل مفتوح، والخلفية تتحول من غابة الصباح إلى سماء مفتوحة." يُعالَج الانتقال البيئي عبر القوس بشكل متسق.
حركات Crane وPedestal
تحرك لقطة Crane الكاميرا رأسيًا عبر الفضاء، لا تكتفي بإمالة العدسة. أما حركة Pedestal فهي انتقال رأسي مماثل على مسار مستوٍ. وتمنح هذه الحركات الرأسية اللقطة إحساسًا بالثقل وبحجم معماري لا تستطيع الحركات الأفقية تقديمه.
يتعامل Veo 3.1 مع الانتقالات الرأسية بالمستوى نفسه من الاتساق المكاني الذي يتعامل به مع الأفقية. تنتج حركة Crane-up من مستوى الشارع إلى ارتفاع السطح تقليصًا صحيحًا للحجم الظاهري للعناصر عند مستوى الأرض، وانفتاحًا تدريجيًا للسماء. ومع Pan بطيء عند القمة، تكون النتيجة من نوع اللقطات التأسيسية التي كانت تتطلب في السابق استئجار طائرة مسيّرة ومشغّلًا معتمدًا.
لماذا تبدو الحركة حقيقية

الاستيفاء الإطاري مع الوعي بالمشهد
يولّد Veo 3.1 بمعدل 24 إطارًا في الثانية. وبين الإطارات المفتاحية يستخدم نظام استيفاء يراعي المشهد بدلًا من التدفق البصري العام. عندما يمر شخص أمام عنصر في الخلفية أثناء حركة الكاميرا، يتعامل الاستيفاء بشكل صحيح مع حدث الحجب وكشف الحجب. أما التدفق البصري العام فينتج آثار تمويه عند نقاط الحدود هذه. ينتج Veo 3.1 حوافًا نظيفة وحادة حتى عند حدود الحركة.
هذا أكبر سبب منفرد في أن اللقطات تُقرأ كحقيقية لا كمولَّدة بالذكاء الاصطناعي. فالتمويه عند حدود الحركة هو العلامة البصرية الأساسية في فيديو الذكاء الاصطناعي. وقد خفّضه Veo 3.1 إلى حد أن التعرّف عليه يتطلب فحصًا إطارًا بإطار عند تكبير عالٍ، بدلًا من أن يكون واضحًا عند أول تشغيل.
لا انهيار للمنظور
تعاني معظم نماذج فيديو الذكاء الاصطناعي مما يمكن وصفه بانهيار المنظور. عندما تتحرك الكاميرا نحو موضوع ما، لا تتراجع الخلفية بشكل متناسب. والنتيجة مظهر مسطح ملصوق، يبدو فيه الشخص معلّقًا أمام صورة ثابتة بدلًا من أن يوجد في فضاء ثلاثي الأبعاد.
يحافظ Veo 3.1 على نسب المنظور الصحيحة طوال أي حركة كاميرا. يتطابق معدل تراجع الخلفية البصري مع السرعة الأمامية للكاميرا. هذا التفصيل الواحد هو ما يجعل اللقطات تبدو مكانية حقًا، وهو الدليل الأوضح على أن النموذج استوعب فيزياء الكاميرا الحقيقية، بدلًا من أن يتعلم تقريب الحركة جماليًا.
معايرة ضبابية الحركة
للقطات الكاميرا الحقيقية ضبابية حركة تتوافق مع سرعة الغالق وسرعة الموضوع بالنسبة للإطار. يعايّر Veo 3.1 ضبابية الحركة وفق سرعة حركة الكاميرا. فحركة Whip Pan سريعة تنتج ضبابية واضحة عبر الإطار، بينما حركة Dolly بطيئة لا تنتج تقريبًا أي ضبابية. وهذا تفصيل تتجاهله كثير من نماذج الذكاء الاصطناعي تمامًا، فتعتمد إما على ضبابية كثيفة في كل المشهد أو لا تضيفها إطلاقًا. يغيّرها Veo 3.1 بشكل صحيح حسب سرعة الحركة، فتبدو اللقطة مصوّرة لا مولَّدة.
كتابة أوامر نصية تعمل فعلًا

كلمات تُطلق حركة الكاميرا
يستجيب Veo 3.1 بأكثر الطرق موثوقية لمفردات التصوير السينمائي المعتمدة في الصناعة. هذه ليست كلمات سحرية. إنها المصطلحات التي تظهر باستمرار في السيناريوهات الاحترافية ووثائق الإنتاج التي تدرّب عليها النموذج. استخدامها يوضح النية السينمائية بجلاء.
| الحركة المطلوبة | مصطلحات الأمر النصي الموثوقة |
|---|
| دفعة للأمام | "dolly in"، "slow push toward"، "creeping forward" |
| سحب للخلف | "dolly out"، "pull back revealing"، "retreat to wide" |
| حركة أفقية | "truck left/right"، "lateral tracking move" |
| صعود رأسي | "crane up"، "pedestal rise"، "ascend slowly" |
| دوران حول الشخص | "orbit"، "arc around"، "180-degree arc" |
| دوران جانبي | "pan left/right"، "slow horizontal sweep" |
| دوران رأسي | "tilt up/down"، "look up toward"، "sweep down to" |
دمج حركات متعددة
يتعامل Veo 3.1 مع حركات الكاميرا المركّبة عندما تُوصف بالتتابع. يقرأ النموذج وصف الحركة بالترتيب الزمني وينفّذ كل مرحلة بالتسلسل ضمن مدة المقطع.
مثال يعمل بشكل جيد:
"تبدأ الكاميرا منخفضة عند مستوى الأرض، ترتفع ببطء بحركة Crane بينما تتتبّع يمينًا في الوقت نفسه، وتنتهي بلقطة عريضة من الأعلى تنظر إلى المشهد كاملًا أسفلها."
عند تكديس أكثر من حركتين، أضف عبارة وصل بين المراحل. كلمات مثل "smoothly continuing into" أو "transitioning to" تخبر النموذج أن الحركات ينبغي أن تمتزج لا أن تقطع، وهذا يقلّل من آثار التثبيت عند نقطة الانتقال.
ما يجب تجنّبه
ثلاثة أخطاء شائعة في الأوامر النصية تنتج نتائج كاميرا ضعيفة في كل نماذج فيديو الذكاء الاصطناعي، بما في ذلك Veo 3.1:
- أوصاف السرعة الغامضة: عبارات مثل "dynamic camera" أو "interesting angles" تمنح النموذج هامشًا واسعًا أكثر من اللازم. حدّد السرعة: slow أو medium أو fast، أو مرجعًا زمنيًا مثل "over 4 seconds".
- حركات تُلغي بعضها: عبارة "Dolly in while simultaneously pulling back" تُلغي نفسها هندسيًا. اختر محورًا واحدًا للحركة والتزم به.
- غياب مرساة الموضوع: بدون موضوع واضح تتابعه أو تدور حوله، تنتج تعليمات حركة الكاميرا نتائج عشوائية. صف الموضوع وحركة الكاميرا دائمًا في الجملة نفسها، ليعرف النموذج ما الذي تتحرك الكاميرا بالنسبة إليه.
كيفية استخدام Veo 3.1 على PicassoIA
Veo 3.1 متاح مباشرة على PicassoIA إلى جانب Veo 3.1 Fast وVeo 3.1 Lite. إليك سير عمل عملي لتوليد الفيديو المرتكز على حركة الكاميرا:
الخطوة 1: اختر الإصدار المناسب
استخدم Veo 3.1 الكامل للحركات المركّبة ولقطات Orbit وأي مخرجات بجودة الإنتاج. استخدم Veo 3.1 Fast للتكرار السريع على الحركات البسيطة التي يُختبر فيها دقة الحركة. واحجز Veo 3.1 Lite لاختبارات المفاهيم السريعة حيث تكون جودة الحركة ثانوية أمام السرعة.
الخطوة 2: بنِّ أمرك النصي في ثلاث طبقات
اكتب أمرك النصي في ثلاثة أجزاء متتالية:
- وصف الموضوع: من أو ما يظهر في الإطار، مع البيئة المحددة
- تعليمة الكاميرا: الحركة الدقيقة مع الاتجاه والسرعة
- المزاج أو الجو: جودة الإضاءة والنبرة والوقت من اليوم
مثال:
"تقف امرأة ترتدي فستانًا من الكتان الأزرق عند حافة منحدر صخري يطل على وادٍ مضاء بالشمس. تبدأ الكاميرا قريبة من وجهها، ثم تتراجع ببطء بحركة Dolly لتكشف المشهد الطبيعي الكامل الممتد خلفها. ضوء الساعة الذهبية، طبيعي، واقعي كالصور الفوتوغرافية."
الخطوة 3: عدّل السرعة أولًا
بعد التوليد الأول، يكون التعديل الأكثر شيوعًا المطلوب هو سرعة الحركة. إذا كانت الحركة سريعة جدًا، أضف "slow, deliberate" إلى تعليمة الكاميرا. وإذا بدا المقطع ساكنًا رغم التعليمة، فأضف "continuous movement throughout the shot" للإشارة إلى أن الحركة ينبغي أن تستمر طوال مدة المقطع الكاملة بدلًا من أن تتوقف.
الخطوة 4: اقرأ الصوت كمؤشر على الحركة
يعكس الصوت الأصلي في Veo 3.1 الموضع المكاني للكاميرا. إذا بدا الصوت المولَّد كتسجيل ثابت بينما الصورة تتحرك، فهذا يعني أن تعليمة الكاميرا لم تُسجَّل بالكامل. أعد التوليد بعبارة حركة أوضح قبل أن تلتزم بمخرج عالي الدقة.
💡 وفّر النقاط أثناء الاختبار: شغّل أول تكرارين أو ثلاثة على Veo 3.1 Fast، ثم انتقل إلى Veo 3.1 الكامل فقط عندما يكون الأمر النصي والتوقيت محددين بدقة.
مقارنة نماذج التحكم في الحركة

Veo 3.1 ليس الخيار الوحيد عندما تكون الحركة السينمائية مهمة. هناك ثلاثة نماذج أخرى على PicassoIA تتبنى نهجًا مختلفًا في التحكم بالكاميرا، ولكل منها نقاط قوة واضحة في سياقات إنتاج محددة.
Kling v3 Motion Control
يعتمد Kling v3 Motion Control على نظام إدخال قائم على المسارات. فبدلًا من وصف الحركة نصيًا، ترسم مسار الكاميرا أو تحدده كمنحنى مباشرة في الواجهة. وهذا أدق من اللغة في الأقواس المخصصة، ويحتاج تكرارًا أقل. وهو يتفوق في المسارات القابلة للتكرار والدقيقة، حيث قد تختلف نتائج الأمر النصي في Veo 3.1 بشكل طفيف بين التوليدات.
الأنسب لما يلي: لقطات المنتجات، وجولات المعمار، وأي لقطة يكون فيها تكرار المسار الدقيق عبر عدة مقاطع شرطًا صارمًا. إذا احتجت القوس نفسه مرتين ويجب أن يتطابقا إطارًا بإطار، فإن Kling v3 Motion Control هو الخيار الصحيح.
Video 01 Director
يقبل Video 01 Director من MiniMax عناصر تحكم بالكاميرا مسمّاة (pan وtilt وzoom وroll وtruck وpedestal) كمعاملات منفصلة إلى جانب الأمر النصي. يعطي هذا النهج المعتمد على المعاملات المنظمة نتائج متسقة للغاية في الحركات البسيطة أحادية المحور، لأن تعليمة الكاميرا تُعامل كبيانات منظمة لا كمهمة تفسير لغوي.
الأنسب لما يلي: صنّاع المحتوى الذين يحتاجون إلى نتائج قابلة للتنبؤ في الإنتاج لحركات مسمّاة بسيطة أحادية المحور، ويريدون تقليل عدد محاولات التوليد اللازمة للحصول على اللقطة.
Ray 3.2
يقدّم Ray 3.2 من Luma مخرجات HDR مع تركيز قوي على دقة الإضاءة أثناء الحركة. فبينما يعطي Veo 3.1 الأولوية للفيزياء المكانية، يعطي Ray 3.2 الأولوية لسلوك الضوء: تتحرك الظلال بشكل صحيح مع زاوية الكاميرا، وتتغيّر الانعكاسات عندما تنتقل الكاميرا، وتتتبع الأضواء الساطعة بشكل سليم أثناء حركات Dolly.
الأنسب لما يلي: اللقطات التي تكون فيها جودة الإضاءة أثناء الحركة هي الأولوية، خاصة المشاهد الداخلية ذات إعدادات الإضاءة العملية المعقدة.
| النموذج | نقطة القوة | أفضل نوع حركة | أسلوب الإدخال |
|---|
| Veo 3.1 | الفيزياء المكانية، الحركات المركّبة | Orbit وDolly وتسلسلات متراكمة | أمر نصي |
| Kling v3 Motion Control | دقة المسار، قابلية التكرار | Arc والتتبع المخصص | مسار مرسوم |
| Video 01 Director | منظّم، متسق | حركات مسمّاة أحادية المحور | معاملات مسمّاة |
| Ray 3.2 | دقة الإضاءة أثناء الحركة | Dolly والدفع للأمام | أمر نصي |
ابدأ الإبداع

انتقلت حركة الكاميرا في فيديو الذكاء الاصطناعي من كونها مجرد جدّة إلى شيء مفيد فعلًا في سير العمل الإنتاجي الحقيقي. وقد دفع Veo 3.1 هذا الحد إلى أبعد مدى، وهو متاح الآن دون معدات أو طاقم تصوير أو تصاريح مواقع.
لم يعد الحاجز أمام اللقطات السينمائية هو الوصول إلى رافعة أو مسار Dolly أو معدّة تحكم بالحركة. إنه معرفة كيف تصف ما تريده. إذا كنت تستطيع التمييز بين Pan وTilt، وبين Dolly وTruck، وبين Orbit وArc، فلديك بالفعل المفردات اللازمة للعمل مع Veo 3.1 على المستوى الاحترافي. أمثلة الأوامر النصية في هذا المقال نقطة انطلاق. جرّبها، وعدّل السرعة، وكدّس حركتين معًا، وانظر إلى مدى صمود الفيزياء المكانية.
يتيح لك PicassoIA الوصول إلى Veo 3.1، وVeo 3.1 Fast، وKling v3 Motion Control، وVideo 01 Director، وRay 3.2، وأكثر من 100 نموذج فيديو آخر في مكان واحد. اكتب الحركة التي كنت تحاول تصويرها، والصقها في المنصة، وانظر كيف تبدو أول تجربة. وقت الإنتاج بالدقائق، لا بأيام التصوير.
