يزعم كل نموذج لتوليد الفيديو بالذكاء الاصطناعي أنه قادر على "الإخراج السينمائي". لكن Veo 3.1 يحقق ذلك فعلًا. يأتي أحدث إصدار من Google بميزة لم يتمكن أي نموذج آخر من إتقانها على نطاق واسع: التحكم السينمائي بالكاميرا عبر الأوامر النصية، إذ يستجيب لمفردات صنّاع الأفلام الحقيقيين. اقتراب تدريجي (dolly in)، ولقطات تتبّع، ومسحات جوية، وتغيير التركيز (rack focus)، وزوايا مائلة (Dutch angles). هذه ليست حركات عشوائية ناتجة عن أخطاء. إنها حركات متعمّدة، ومتجاوبة، ومتسقة إلى حد لافت عندما تعرف كيف تطلبها.
هذا ما توصلنا إليه بعد اختبار كل حركة كاميرا رئيسية بشكل مفصّل، وتجربة عشرات الأوامر النصية على Veo 3.1، وتسجيل الإخفاقات، وإعادة المحاولة، ثم المقارنة المباشرة مع أبرز مولّدات الفيديو بالذكاء الاصطناعي الحالية.
ما المقصود بالتحكم بالكاميرا في Veo 3.1
"التحكم بالكاميرا" مصطلح ملتبس المعنى. في معظم نماذج الفيديو بالذكاء الاصطناعي، يعني أن المشهد يتحرك. تنجرف الأشياء، وتهبّ الريح فتتطاير الشعر، ويدير الشخص رأسه. هذه حركة، وليست تحكمًا بالكاميرا.
يفصل Veo 3.1 بين الأمرين. فـالكاميرا كيان مستقل له حركته الخاصة، بمعزل عن فعل الشخص داخل المشهد. عندما تكتب "اقتراب بطيء (slow dolly-in) نحو رجل جالس عند البار"، تتحرك الكاميرا فعليًا عبر الفضاء نحو الشخص. لا ينحني الرجل نحوك. الكاميرا هي التي تتحرك نحوه.
لهذا التمييز أهمية كبيرة في سرد القصص. الاقتراب التدريجي يخلق حميمية نفسية، والابتعاد التدريجي يخلق إحساسًا بالعزلة، والهبوط الجوي المتدرج (aerial crane down) يوحي بالوصول والضخامة. هذه ليست حركات قابلة للتبادل. ويدرك Veo 3.1 أيّها تريد.
المفردات التي يستجيب لها
دُرّب Veo 3.1 على مفردات التصوير السينمائي الحقيقية. وقد أنتجت هذه المصطلحات النتيجة المقصودة باستمرار في اختباراتنا:
- Dolly in / Dolly out: تتحرك الكاميرا فعليًا للأمام أو للخلف عبر الفضاء
- Pan left / Pan right: تدور الكاميرا حول محورها الرأسي
- Tilt up / Tilt down: تدور الكاميرا حول محورها الأفقي
- Crane up / Crane down: تتحرك الكاميرا عموديًا عبر الفضاء على قوس رأسي
- Tracking shot: تتبع الكاميرا الشخص جانبيًا بمسافة ثابتة
- Aerial / Bird's eye: منظور من الأعلى، غالبًا مع حركة للأمام
- Low angle: تُوضع الكاميرا أسفل خط نظر الشخص، وتنظر إلى الأعلى
- Dutch angle: تُمال الكاميرا على محور الدوران، فينتج إطار مائل
- Rack focus: ينتقل مستوى التركيز بين الأشخاص في المقدمة والخلفية
- Whip pan: دوران سريع يُنتج ضبابية حركة بين اللقطات
- Handheld: اهتزاز عضوي خفيف للكاميرا، وليس حركة مثبّتة
المصطلحات التي لم تنجح بشكل موثوق: "zoom" (أنتج غالبًا تكبيرًا رقميًا لا بصريًا)، و"تأثير الدوار" (vertigo effect) بنتائج غير متسقة، و"مدار 360 درجة" (360 orbit) الذي انزلق في معظم الاختبارات إلى دوران جزئي.

اللقطات التي اختبرناها
قسّمنا الاختبارات إلى سبع فئات أساسية في التصوير السينمائي. هذا ما وجدناه.
لقطات الإنشاء العريضة
تُعد لقطة الإنشاء العريضة الأساس في معظم المشاهد السينمائية. يتعامل Veo 3.1 معها بواقعية لافتة، خاصة عند دمجها مع حركة رافعة بطيئة (slow crane) أو حركة جوية.
أفضل بنية للأمر النصي: [Location description] + [time of day and weather] + [camera movement, e.g., slow crane up from ground level to reveal the full skyline] + [film grain and lens description]
النتيجة: أنتج Veo 3.1 لقطات إنشاء عريضة متسقة، تتطابق فيها حركة الكاميرا مع القوس الموصوف. فحركة "رفع بطيء من مستوى الأرض" بدأت فعلًا من مستوى الأرض، وارتفعت بثبات، واستقرت على منظر واسع. هذا هو سلوك مشغّل كاميرا محترف.

لقطات الاقتراب التدريجي (Dolly)
هنا يتميّز Veo 3.1 فعلًا عن المنافسين. فالوهم بالعمق الذي تخلقه حركة الاقتراب الحقيقية صعب المحاكاة حسابيًا، كما هو معروف. تُنتج معظم نماذج الذكاء الاصطناعي تكبيرًا رقميًا بدلًا منها، وهو تكبير يضغط العمق بدلًا من أن يتحرك عبره.
أنتج Veo 3.1 حركة اقتراب حقيقية في نحو 80% من الاختبارات. أما النسبة المتبقية، أي 20%، فأظهرت حركة مختلطة، جزء منها اقتراب وجزء تكبير. وعند حدوث الإخفاقات، رفعت إضافة العبارة "camera physically moves forward, not zoom, true dolly motion" إلى الأمر النصي معدل النجاح إلى نحو 95%.
💡 نصيحة احترافية: ميّز دائمًا بوضوح بين الاقتراب (dolly) والتكبير (zoom) في أمرك النصي. اكتب: "slow dolly-in toward the subject, camera physically moving through space, not a zoom." هذه الإضافة وحدها تُحدث فرقًا ملموسًا في دقة المخرجات.
لقطات التتبّع
أدت لقطات التتبّع، حيث تتبع الكاميرا موضوعًا متحركًا جانبيًا، أداءً جيدًا عندما كان الشخص محددًا بوضوح وكان اتجاه الحركة صريحًا.
ما نجح: "Track the subject left to right as they walk along the sidewalk, camera at shoulder height, maintaining consistent distance of 3 meters"
ما لم ينجح بشكل موثوق: تتبّع شخص حول زاوية أو عبر حشد. فقد فقد النموذج أحيانًا استمرارية الشخص عند ظهور عوائق.

اللقطات الجوية والطائرات المسيّرة
لقطات Veo 3.1 الجوية مبهرة فعلًا. فالفيزياء في الحركة الجوية، والدوران الدقيق لمستوى المنظور، والطريقة التي تستطيل بها الظلال عند زوايا الشمس المنخفضة، كلها تُعرض بواقعية تصمد أمام التدقيق.
يستجيب النموذج بشكل جيد لهذه الأوامر:
- "Bird's eye view looking straight down"
- "Aerial shot with slow forward movement"
- "Descending aerial crane toward the subject"
تجنّب استخدام "drone shot" كمصطلح. فقد أعطت كلمة "Aerial" نتائج أفضل باستمرار في اختباراتنا.
لقطات الزاوية المنخفضة والزاوية المائلة

تُظهر لقطات الزاوية المنخفضة من Veo 3.1 تشوّهًا منظوريًا صحيحًا عند تحديدها بزوايا قصوى. فكتابة "camera positioned 15cm above ground level, looking up at 45 degrees" تنتج نتيجة مختلفة بوضوح عن "low angle shot". هنا تفوز الدقة في كل مرة.
كانت الزوايا المائلة (Dutch angles) أقل اتساقًا. فقد فهم النموذج المقصود في نحو 65% من الاختبارات، لكن درجة الميلان كانت غير متوقعة. حدّد الزاوية بالأرقام: "camera tilted 15 degrees counterclockwise on its roll axis."
تغيير التركيز (Rack focus)
تمثل مشاهد تغيير التركيز، حيث ينتقل مستوى التركيز من شخص إلى آخر، إحدى أبرز قدرات Veo 3.1. وفي اختبار المقهى الذي أجريناه ("rack focus from the coffee cup in the foreground to the woman's face in the background")، كان الانتقال سلسًا ومدروس الدافع وحسن التوقيت داخل المقطع.

وهذا مهم. فتغيير التركيز يتطلب من النموذج التعامل مع العمق كأداة سردية زمنية. أما معظم النماذج المنافسة فتسطّح العمق في مجال ضحل وثابت، أو تنتج ضبابية تدريجية بلا اتجاه واضح.
الحركة المحمولة (Handheld) والحركة الوثائقية
هنا أظهر Veo 3.1 الحركة الأكثر طبيعية في الإحساس. فالحركات الدقيقة العضوية، والتنفس الخفيف للإطار، والأفق غير المستوي، بدت كلها أصيلة. ويعود ذلك إلى أن الحركة المحمولة لا تتطلب دقة رياضية صارمة. فالفوضى المضبوطة أسهل محاكاة من حركة الاقتراب الميكانيكية الدقيقة.
كيف تطلب حركات الكاميرا
العامل الأهم على الإطلاق في التحكم بالكاميرا في Veo 3.1 هو دقة الأمر النصي. الأوامر الغامضة تنتج نتائج غامضة، والأوامر السينمائية تنتج نتائج سينمائية.
صيغة الأمر ذي الطبقات الأربع
ابنِ كل أمر للكاميرا من أربع طبقات:
- الشخص والمشهد: من أو ما الموجود في الإطار، وأين، وماذا يفعل
- موضع الكاميرا: الارتفاع، والزاوية، والمسافة عن الشخص
- حركة الكاميرا: نوع الحركة بدقة، واتجاهها، وسرعتها
- الأجواء البصرية: ظروف الإضاءة، وحبيبات الفيلم، ونوع العدسة
مثال ناجح:
"تقف امرأة ترتدي فستانًا أحمر عند نهاية رصيف طويل وفارغ يمتد فوق المحيط عند الغسق. الكاميرا موضوعة على ارتفاع الركبة ومائلة قليلًا نحو الأعلى، على مسافة 10 أمتار. حركة دوللي للأمام بطيئة نحو الشخص خلال 8 ثوانٍ، مع تحرك الكاميرا فعليًا في الفضاء، وليس تكبيرًا بالزوم. إضاءة خلفية برتقالية دافئة من شمس الغروب، وحبيبات فيلم، وعدسة 50 ملم، وواقعية كالصور الفوتوغرافية."
قارن ذلك بـ: "A woman on a pier, cinematic."
يمنح الأمر الأول Veo 3.1 كل ما يحتاجه. أما الثاني فنتيجته محض صدفة.
لغة السرعة التي تنجح
يستجيب Veo 3.1 لأوصاف السرعة النسبية بنتائج متسقة:
| وصف السرعة | ما ينتجه |
|---|
| "Very slow" / "imperceptibly slow" | حركة شبه ثابتة وهادئة تأملية |
| "Slow" | حركة متعمدة وواضحة للعين |
| "Medium" / "steady" | وتيرة وثائقية عادية |
| "Fast" | حركة عالية الطاقة وموجهة نحو الأكشن |
| "Rapid" / "whip" | انتقالات عالية السرعة |
دمج حركات الكاميرا
يمكنك دمج حركات الكاميرا، لكن استخدم إشارة زمنية. بدلًا من "dolly in and tilt up"، اكتب "begin with a slow dolly-in, then tilt up to reveal the skyline at the end of the move". التعليمات المتسلسلة تعمل بشكل أفضل من المتزامنة.

Veo 3.1 مقابل المنافسين
التحكم بالكاميرا نادر في مولّدات الفيديو بالذكاء الاصطناعي. إليك مقارنة الساحة الحالية:
لماذا يتصدر Veo 3.1: الميزة الأساسية هي الدقة في الاستجابة لمفردات السينما. فقد تدرّب Veo 3.1 على مجموعة من الأعمال تشمل إنتاج أفلام حقيقي. فعندما تقول "Dutch angle"، يعرف ما هي الزاوية المائلة ولماذا يلجأ إليها صنّاع الأفلام.
ومع ذلك، يستحق Kling v3 Motion Control الإشادة لنظام التحكم في المسار الذي يتيح للمستخدمين رسم مسارات الكاميرا يدويًا. إنه نهج مختلف، بصري أكثر منه نصيًا، ويناسب المستخدمين الذين يفضلون رسم الحركة على وصفها.
يُنتج Ray 3.2 من Luma بعضًا من أكثر اللقطات صقلًا من الناحية البصرية في هذه الفئة، مع تصيير HDR ينافس Veo 3.1 أو يتفوق عليه في الواقعية الفوتوغرافية الخام. لكن نقطة ضعفه تكمن في دقة حركة الكاميرا. فـ"Dolly in" في Ray 3.2 غالبًا ما يُفسَّر على أنه تكبير.
يعتمد Video 01 Director نهجًا منظمًا بقائمة مُعدّة مسبقًا من حركات الكاميرا. وهو موثوق تحديدًا لأنه مقيّد. لكن القيود تعني أنك لا تستطيع أن تطلب لقطة تتبّع محمولة بزاوية مائلة لشخص يمر حول زاوية. أما Veo 3.1 فيمكنه محاولة ذلك، وينجح غالبًا.
استخدام Veo 3.1 على PicassoIA
Veo 3.1 متاح مباشرة على PicassoIA إلى جانب نماذجه الشقيقة. تستضيف المنصة الإصدارات الثلاثة: Veo 3.1 الكامل، وVeo 3.1 Fast الأسرع، وVeo 3.1 Lite الخفيف.
أي إصدار تستخدم
- Veo 3.1: استخدمه عندما تحتاج إلى أعلى دقة في التحكم بالكاميرا وأعلى جودة. الأفضل للمخرجات النهائية وأعمال العملاء واللقطات الرئيسية.
- Veo 3.1 Fast: استخدمه للتكرار والاختبار. اكتب أمر الكاميرا هنا، وتحقق من أن الحركة تعمل، ثم اعتمد النموذج الكامل.
- Veo 3.1 Lite: استخدمه للمسودات المفاهيمية السريعة، أو عندما تكون سرعة التوليد أهم من الالتزام الدقيق بحركة الكاميرا.
سير عمل التكرار
التحكم بالكاميرا في الفيديو بالذكاء الاصطناعي يكافئ التكرار. هذا هو سير العمل الذي نوصي به على PicassoIA:
- اكتب مسودة أمر الكاميرا باستخدام صيغة الطبقات الأربع أعلاه
- ولّد مقطعًا تجريبيًا باستخدام Veo 3.1 Fast
- راجع ما إذا كانت حركة الكاميرا تطابق قصدك
- عدّل الصياغة وأعد الاختبار
- عندما تكون الحركة صحيحة، ولّد النسخة النهائية باستخدام Veo 3.1
هذا يوفر وقت توليد كبيرًا، ويضمن أن مخرجاتك النهائية تطابق ما قصدته.

تستضيف PicassoIA أيضًا بدائل قوية تكمّل Veo 3.1 في سيناريوهات محددة. يتعامل Kling v3 Video مع تسلسلات الأكشن بواقعية فيزيائية عالية. ويقدّم Pixverse v6 مخرجات سينمائية متزامنة مع الصوت للمشاهد العاطفية. وينتج Seedance 2.5 مقاطع متسقة بشكل استثنائي مدتها 30 ثانية عندما تحتاج إلى لقطات أطول.
عندما ينهار التحكم بالكاميرا
Veo 3.1 ليس مثاليًا. ومعرفة أنماط فشله لا تقل أهمية عن معرفة نقاط قوته.
استمرارية الشخص في الحركات الطويلة
في الحركات الطويلة للكاميرا التي تغطي مسافة مكانية كبيرة (أكثر من 3 ثوانٍ من مسار الاقتراب)، ينجرف الأشخاص أحيانًا داخل الإطار. فالشخص الذي ينبغي أن يبقى في المنتصف ينزاح ببطء إلى أحد الجانبين أثناء اقتراب ممتد. ويبدو أن هذه مشكلة في التماسك الزمني، وليست مشكلة في حسابات الكاميرا.
حل بديل: في الحركات الطويلة، قسّمها إلى مقطعين. ولّد بداية الحركة ونهايتها بشكل منفصل، ثم اجمعهما في المونتاج.
تزامن حركة الشخص والكاميرا
عندما تتحرك الكاميرا والشخص الرئيسي معًا في اللحظة نفسها، يتراجع التحكم بالكاميرا بشكل ملحوظ. تتبّع شخص يركض أمر مقبول. أما تتبّع شخص يركض مع رفع الكاميرا في الوقت نفسه فينتج نتائج غير متوقعة. يعطي النموذج الأولوية لحركة الشخص على حركة الكاميرا عندما تتنافس الاثنتان.
حل بديل: إذا كنت تحتاج إلى حركة مركبة معقدة، فإن أدوات رسم المسار في Kling v3 Motion Control تتعامل مع الحركة المشتركة بشكل أكثر موثوقية من خلال تحديد المسار بصراحة.
المشاهد الداخلية منخفضة التباين
غالبًا ما أنتجت حركة الكاميرا في الأماكن الداخلية المظلمة أو منخفضة التباين ضبابية حركة. وكان النموذج يواجه صعوبة في حساب تغييرات موضع الكاميرا في البيئات التي تكون فيها إشارات العمق المكاني غامضة. أما المشاهد المضاءة جيدًا والتي تتميز بفصل واضح بين المقدمة والخلفية، فكان أداؤها أفضل بكثير.

مشكلة التكبير مقابل الاقتراب
هذا أكثر أنماط الفشل شيوعًا في Veo 3.1. فالفرق بين الاقتراب والتكبير دقيق حسابيًا: كلاهما يجعل الشخص يبدو أكبر في الإطار، لكن الاقتراب يغيّر المنظور (parallax) بينما التكبير لا يفعل. وفي نحو 20% من الاختبارات التي لم تتضمن لغة صريحة ضد التكبير، عاد Veo 3.1 إلى التكبير.
الحل بسيط ومتسق: أضف "not a zoom, true camera movement through space, parallax visible on background elements" إلى أي أمر اقتراب أو دفع للكاميرا.
ماذا يغيّر هذا لصنّاع الأفلام بالذكاء الاصطناعي
كان التصوير السينمائي دائمًا عن التحكم. ليس فقط في ما تصوره، بل في كيفية تأطير الكاميرا له، وحركتها خلاله، وكشفه للمشاهد.
حتى الآن، منحت نماذج الفيديو بالذكاء الاصطناعي المبدعين التحكم في الشخصيات لا في الكاميرا. كان بإمكانك وضع شخصية في مشهد، وجعلها تمشي. لكن الكاميرا كانت مراقبًا سلبيًا، لا مشاركًا مبدعًا.
يغيّر Veo 3.1 هذه العلاقة. فالكاميرا أصبحت الآن أداة يمكنك توجيهها باللغة. ليس بشكل مثالي، وليس دائمًا من المحاولة الأولى، لكن بما يكفي لبناء سير عمل إنتاجي حقيقي حولها.
بالنسبة لصنّاع المحتوى القصير، يعني هذا تنوعًا في اللقطات داخل المقطع الواحد، لا مجرد تنوع في المحتوى. لقطة رئيسية، ورد فعل بلقطة مقربة، وإنشاء عريض، وتتبّع متابع. هذه خيارات تصويرية سينمائية حقيقية متاحة عبر النص.
بالنسبة لصنّاع الأفلام السردية الذين يجرّبون القصص، يعني هذا اختبار اللغة البصرية قبل أي إنتاج فعلي. يمكنك اختبار ما إذا كانت الزاوية المائلة تناسب مشهدًا نفسيًا، أو ما إذا كان الكشف بالرافعة البطيئة يناسب تسلسل وصول، قبل أن تقضي يومًا كاملًا في موقع التصوير.
💡 نماذج الفيديو المتاحة على PicassoIA، من Veo 3.1 إلى Ray 3.2، وKling v3، وSeedance 2.5، تدفع هذا الفن إلى الأمام كل شهر. والفجوة بين فيديو الذكاء الاصطناعي والإنتاج الاحترافي تضيق أسرع مما يدركه معظم العاملين في المجال.

جرّبه على PicassoIA
إذا لم تجرّب من قبل التحكم بالكاميرا في Veo 3.1 بشكل مباشر، فابدأ بمقارنة بسيطة. شغّل وصف المشهد نفسه مرتين: مرة بدون لغة كاميرا، ومرة بتطبيق صيغة الطبقات الأربع.
بدون تحكم بالكاميرا:
"A woman standing at a window looking out at the rain."
مع التحكم بالكاميرا:
"A woman standing at a window looking out at the rain. Camera positioned at mid-distance, slightly below eye level. Slow dolly-in over 6 seconds, camera physically moving through space toward her, not a zoom. Soft overcast window light from the right, 50mm equivalent, Kodak film grain."
سيخبرك الفرق بكل شيء عن سبب أهمية مفردات التحكم بالكاميرا. أمران يصفان المشهد نفسه. أحدهما صورة فوتوغرافية، والآخر فيلم.
Veo 3.1، وVeo 3.1 Fast، وVeo 3.1 Lite متاحة كلها على PicassoIA الآن. وكذلك 117 نموذج فيديو آخر، و91 مولّد صور، وأدوات رفع الدقة، ومحررات الفيديو، ومجموعة الأدوات الكاملة لإنتاج المحتوى بالذكاء الاصطناعي على picassoia.com/en/all-models.
المفردات السينمائية التي تعرفها بالفعل كصانع أفلام تعمل مع Veo 3.1. وجّه الكاميرا. حدّد اللقطة. ابدأ التصوير.