الحركة السينمائية لا تعتمد على كاميرا باهظة الثمن. لم تكن كذلك يومًا. إنها تعتمد على القصد: أن تعرف بدقة أين تتحرك الكاميرا، ولماذا تتحرك، وما الانفعال الذي تولّده تلك الحركة. لعقود، كانت هذه المعرفة محصورة في الأشخاص: مصوّرون سينمائيون أمضوا سنوات في تعلّم لغة الفيلم. Veo 4 هو أول نموذج لتوليد الفيديو بالذكاء الاصطناعي يتحدث هذه اللغة فعلًا.
يتناول هذا المقال كيفية استخدامه. ليس نظرية توليد الفيديو بالذكاء الاصطناعي، ولا نظرة عامة واسعة. بل بنية الأوامر النصية المحددة، ومفردات الحركة، والحيل المتعلقة بالعمق، التي تنتج فيديوهات يمكنك فعلًا دمجها في مشروع حقيقي.
ما الذي يميّز Veo 4
تنتج معظم مولّدات الفيديو بالذكاء الاصطناعي حركة، لكنها لا تنتج حركة مقصودة. قد ينجرف الشخص عبر الخلفية، وقد تبدو الكاميرا وكأنها تهتز أو تتأرجح قليلًا. لكن هذه الحركات تبدو عرضية. ولا تُقرأ كخيارات سينمائية متعمدة. يغيّر Veo 4 هذا بثلاث طرق ملموسة.
تصيير يراعي الفيزياء
يفهم نموذج الحركة في Veo 4 العلاقات الفيزيائية. عندما تتحرك الكاميرا بسلاسة لتمر بجوار جسم أمامي، يتحرك الجسم الأمامي بسرعة وتتحرك الخلفية ببطء. هذه الحركة المتوازية تحدث تلقائيًا. وعندما يرفع شخص ذراعه، تنثني الملابس استجابةً للجاذبية والحركة، لا عشوائيًا. وعندما يلتقط الماء الضوء، تتتبع الانعكاسات الساطعة زاوية الكاميرا.
قد يبدو هذا أمرًا ثانويًا، لكنه السبب الأكبر وراء المظهر السينمائي لمخرجات Veo 4. ولهذا السبب يعطي أمر نصي مثل "slow dolly push toward the actor" لقطة تبدو كأفضل ما يقدمه Veo 3.1، بدلًا من شخص متجمد على خلفية متحركة.

صوت أصلي لا ينحرف
يولّد Veo 4 الصوت أصليًا إلى جانب الفيديو، والأهم أن الصوت يبقى متزامنًا مع الأحداث الفيزيائية. تلامس الخطوات الأرض في اللحظة نفسها. وتتغير أصوات الماء مع تغيّر المسافة من الكاميرا. هذا التزامن زمني: إذ يتعامل النموذج مع الصوت والصورة كمخرج موحّد، لا كتيارين منفصلين تأمل أن يتطابقا لاحقًا في المونتاج.
وقد حسّنت أنظمة منافسة مثل Seedance 2.5 وHailuo 2.3 تزامن الصوت مع الصورة بشكل ملحوظ. لكن تعامل Veo 4 مع الصوت المكاني، حيث يتغير المجال الستيريو مع انتقال الأشخاص يسارًا ويمينًا داخل الإطار، ما زال متقدمًا على غيره.
حركات كاميرا سينمائية يتعامل معها Veo 4 فعليًا
ليست كل حركات الكاميرا تُترجم بالقدر نفسه من النجاح إلى أوامر توليد الفيديو. بعضها ثابت تمامًا، وبعضها يحتاج إلى صياغة محددة جدًا كي يستجيب. إليك ما يعمل فعلًا.
لقطات الدولي ودفعات التقريب البطيئة
دفعة الدولي هي الحركة الأقوى في Veo 4. فالدولي الأفقي البطيء، أو الدفع الأمامي نحو مشهد ما، ينتج فصلًا موثوقًا للعمق المتوازي بين المقدّمة والخلفية. والمفتاح هو تحديد السرعة و_نقاط المرجع من البداية إلى النهاية_.
تنجح بشكل جيد:
- "دولي بطيء للداخل يبدأ من 3 أمتار إلى الخلف وينتهي بلقطة متوسطة قريبة لوجه الشخص"
- "تتحرك الكاميرا ببطء إلى الأمام عبر العشب الطويل نحو مزرعة بعيدة"
- "دولي جانبي إلى اليسار يتتبع الشخصية وهي تمشي في الزقاق"
لا تنجح:
- "دولي" دون اتجاه أو سرعة أو نقطة نهاية
- "حرّك الكاميرا" دون تحديد مكاني

💡 نصيحة: اقرن أوامر الدولي بجسم في المقدمة. فالأمر "تمر الكاميرا بسرعة بجوار عمود إنارة، كاشفةً حشدًا في الخلفية" يمنح النموذج مرجعًا مكانيًا ينتج عمقًا متوازيًا أقوى من دولي في مساحة فارغة.
اللقطات الجوية والمنظورات العلوية
تنتج اللقطات الجوية في Veo 4 بعضًا من أكثر مخرجاته إبهارًا بصريًا. يمتلك النموذج بيانات تدريب قوية لحركة الطائرات المسيّرة، ويتعامل مع الارتفاع بإقناع: تتضاءل الأجسام في الحجم الظاهر بالمعدل الصحيح، وتتبع الظلال الزاوية بدقة.
أوامر جوية فعّالة:
- "منظر جوي علوي مباشر من الأعلى ينجرف ببطء فوق مظلة غابة كثيفة"
- "تتراجع الطائرة المسيّرة وترتفع في الوقت نفسه من حافة جرف لتكشف الساحل كاملًا أسفلها"
- "لقطة رافعة جوية ترتفع من مستوى الشارع إلى ارتفاع السطح، والمدينة تتسع أسفلها"
كشف الرافعة الصاعدة فعّال بشكل خاص. ينتج Veo 4 حركة عمودية مقنعة تبدو مرتكزة فيزيائيًا، حتى عندما يكون تغيّر الارتفاع دراماتيكيًا.

تتعامل نماذج مثل Ray 3.2 وKling v3 Video مع الحركة الجوية بشكل جيد أيضًا، لكن ثبات البيئة لدى Veo 4 عبر الحركات الجوية الطويلة أكثر استقرارًا من إطار إلى آخر.
لقطات التتبع التي تلاحق الشخص
تلاحق الحركة المتحركة لشخص ما أصعب على نماذج الذكاء الاصطناعي من حركات الكاميرا في مشهد ثابت، لأنها تتطلب من النموذج تحريك الشخص وتحريك الكاميرا بالسرعة نفسها في الوقت ذاته. يتعامل Veo 4 مع هذا بشكل أفضل من نماذج Google السابقة.
صيغ تتبع مجرّبة:
- "تتبع الكاميرا لراكب الدراجة جنبًا إلى جنب بالسرعة نفسها، مع الحفاظ على مسافة ثابتة في الإطار، وعمق ميدان ضحل"
- "لقطة متابعة من فوق الكتف خلف العداء عبر زقاق ضيق، مع بقاء الكاميرا على بُعد 2 متر إلى الخلف"
- "لقطة تتبع جانبية تلاحق السيارة من اليسار إلى اليمين، والخلفية ضبابية بفعل الحركة"
تُعد مواصفة عمق الميدان حاسمة للقطات التتبع. فإخبار Veo 4 بأن الخلفية يجب أن تكون ضبابية يساعده على الالتزام بعلاقة "الشخص يتبع الكاميرا"، بدلًا من تصيير كل شيء بتفاصيل حادة، وهو ما قد ينتج مظهرًا غريبًا يشبه ألعاب الفيديو.

بنية الأوامر النصية للحركة
العامل الأكبر تأثيرًا في جودة مخرجات Veo 4 هو طريقة بناء الأمر النصي. يكتب معظم الناس أوامرهم كوصف لصورة ثابتة. أما الحركة السينمائية فتتطلب نوعًا مختلفًا من الأوامر: أمر يصف التغيّر عبر الزمن.
صيغة الأمر المكوّن من 5 أجزاء
يتبع كل أمر حركة قوي في Veo 4 هذا الهيكل:
| الجزء | العنصر | مثال |
|---|
| 1 | إعداد المشهد (من، ماذا، أين) | "امرأة ترتدي معطفًا أحمر تقف على رصيف محطة قطار" |
| 2 | ظروف الإضاءة | "ضوء صباحي غائم، ظلال ناعمة ومتساوية" |
| 3 | وضعية بداية الكاميرا | "لقطة عامة من مستوى الأرض، على بعد 10 أمتار" |
| 4 | وصف الحركة (ماذا يتحرك وكيف) | "تتحرك الكاميرا ببطء نحوها مع وصول القطار من اليمين" |
| 5 | حالة النهاية أو المزاج | "تنتهي بلقطة قريبة لتعابير وجهها، مع خلفية بوكيه دافئة" |
ينبغي أن يصف وصف الحركة في الجزء 4 دائمًا الحركة كـ_تسلسل له اتجاه وإيقاع_. فكلمات مثل "ببطء" و"بثبات" و"تدريجيًا" تساعد Veo 4 على فهم أن هذه حركة سلسة ومضبوطة، لا قطعًا أو قفزات.
كلمات الحركة التي تعمل فعلًا
تُطلق مفردات معينة باستمرار حركة أفضل في Veo 4:
حركات الكاميرا:
- Dolly in / Dolly out (دولي للأمام أو للخلف أفقيًا)
- Lateral dolly left / right (انزلاق جانبي)
- Crane up / Crane down (ارتفاع أو هبوط عمودي)
- Slow push toward (دفع للأمام بإيقاع متعمّد)
- Orbit around (حركة دائرية حول الشخص)
- Pull back to reveal (حركة للخلف مع توسّع الإطار)
صفات الحركة:
- Steadily، smoothly، with subtle drift
- Gradually accelerating، decelerating to a stop
- Gentle camera sway لإحساس الكاميرا المحمولة دون اهتزاز
ما يجب تجنبه:
- "Zoom in" يُطلق تكبيرًا بصريًا بدلًا من دولي فعلي
- "حركة سريعة" دون اتجاه تنتج اهتزازًا عشوائيًا للكاميرا
- "لقطة ملحمية" صفات جودة غامضة مماثلة لا تصف شيئًا

💡 نصيحة متقدمة: اكتب وصف الحركة بزمن المضارع المستمر: "الكاميرا تدور ببطء حول الشخصية" بدلًا من "دُر حول الشخصية". هذا الإطار الزمني يساعد النموذج على تصيير الفعل كعملية مستمرة، لا كتغيّر في الحالة.
الحركة البطيئة وتسريع الإيقاع
تمثّل الحركة البطيئة المجال الذي يتميز فيه Veo 4 عن معظم مولّدات الفيديو بالذكاء الاصطناعي الأخرى. ينتج النموذج حركة بطيئة بمعدل إطارات عالٍ مقنِع فعلًا، دون التقطّع أو تشوّهات التشويه الشائعة في أنظمة أخرى.
كيفية تفعيل الحركة البطيئة
يستجيب Veo 4 لأوامر الحركة البطيئة على مستوى التوليد نفسه. لا تحتاج إلى معالجة لاحقة أو إعادة توقيت. النموذج يصيّر بالسرعة الموصوفة مباشرة.
أوامر حركة بطيئة فعّالة:
- "حركة بطيئة للغاية: تاج الماء يتشكّل عندما تلامس القطرة السطح، بما يعادل 1000 إطار في الثانية"
- "حركة بطيئة لرياضي يقفز، والملابس تتموج في هواء يتباطأ، بمظهر 120 إطارًا في الثانية"
- "دفع بطيء للداخل على أوراق خريفية متساقطة، كل ورقة تدور منفردةً بمعدل 60 إطارًا في الثانية"
صياغة ما يعادل fps مفيدة بشكل خاص. يفسّرها Veo 4 كمرجع للجودة يتعلق بضبابية الحركة وكثافة الإطارات، فينتج مخرجات بالقدر المناسب من النعومة الزمنية لكل سرعة محددة.

الاتساق الزمني: ماذا يعني
الاتساق الزمني هو مقياس مدى ثبات الأجسام والإضاءة عبر الإطارات. في الفيديو غير المتسق زمنيًا تومض أجسامه، أو تتغير ألوانها قليلًا، أو تتشوّه أشكالها من إطار إلى آخر. وهذا هو العيب الأكثر شيوعًا في فيديو الذكاء الاصطناعي.
يحسّن Veo 4 الاتساق الزمني من خلال ما يبدو أنه آلية تثبيت في الفضاء الكامن: تُثبَّت عناصر المشهد الأساسية في تمثيل دائم يرجع إليه النموذج عبر كل الإطارات المولّدة. والنتيجة العملية أن الظل الذي يُلقى في الإطار الأول يبقى ثابتًا في شكله واتجاهه حتى الإطار 90، حتى لو كانت الكاميرا تتحرك.
طرق لتشجيع الاتساق الزمني:
- أبقِ أوصاف الإضاءة بسيطة وموجّهة: "مصدر ضوء واحد من أعلى اليسار"
- تجنّب طلب عدة أشياء متحركة في الوقت نفسه
- استخدم "خلفية ثابتة" صراحةً عندما تريد أن تتحرك الكاميرا بينما يبقى المشهد ساكنًا
- أشِر إلى "بدون وميض" أو "ثابت" أو "إضاءة متسقة" كمعدّلات جودة

العمق المتوازي وعمق الميدان في Veo 4
العمق المتوازي وعمق الميدان هما ما يفصل اللقطة السينمائية عن اللقطة المسطحة. يتعامل Veo 4 معهما بشكل جيد عند صياغة الأمر بالشكل الصحيح.
طبقات العمق
يحدث العمق المتوازي عندما تتحرك العناصر الأمامية عبر الإطار أسرع من العناصر الخلفية حين تتحرك الكاميرا. في التصوير الفوتوغرافي الحقيقي، هذه فيزياء تلقائية. أما في فيديو الذكاء الاصطناعي، فيجب وصف الطبقات المكانية صراحةً.
بنية أمر العمق متعدد الطبقات:
- سمِّ العنصر الأمامي ومسافته: "عمود سياج خشبي على بعد متر واحد"
- سمِّ الشخص في المنتصف: "شخص يقف على بعد 5 أمتار"
- سمِّ الخلفية: "تلّة على بعد 50 مترًا"
- حدّد حركة الكاميرا: "تتحرك الكاميرا يسارًا"
عندما تكون الطبقات الأربع كلها واضحة، يصيّر Veo 4 فصل العمق المتوازي بدقة. تمرّ العناصر الأمامية بسرعة، ويبقى الشخص في الوسط تقريبًا، وتنجرف الخلفية ببطء.

تسلسلات تغيير التركيز
تغيير التركيز، أي انتقال الكاميرا من مستوى عمق إلى آخر مع بقاء الاثنين داخل الإطار، يُعد من المجالات المتقدمة في السينما بالنسبة للذكاء الاصطناعي. يتعامل Veo 4 معه عند صياغته بمستويات بؤرية واضحة قبل وبعد.
صيغ تغيير التركيز التي تعمل:
- "تغيير التركيز من بتلات زهور حادة في المقدمة إلى زوجين خارج التركيز في الخلفية، ويستغرق الانتقال 2 ثانية"
- "سحب التركيز: يبدأ حادًا على آلية القفل عند مسافة 1 متر، ثم ينزلق ببطء إلى وجه امرأة عند مسافة 3 أمتار"
- "تحوّل البوكيه: تصبح قطرات التكاثف على النافذة في المقدمة ضبابية، ثم تعود إلى الحدة، بينما تنعم خلفية الشارع"

💡 رؤية أساسية: تكون انتقالات تغيير التركيز أكثر إقناعًا عندما تحدّد مدة السحب. فعبارة "انتقال تركيز مدته 2 ثانية" تخبر Veo 4 بأن هذا خيار إبداعي مقصود ومضبوط الإيقاع، وليس خطأ يجب إخفاؤه.
Veo 3.1 على PicassoIA: الأقرب المتاح الآن
Veo 4 غير متاح بعد على PicassoIA كنموذج قابل للاختيار. أقرب مكافئ من سلسلة Veo التابعة لشركة Google متوفر حاليًا على المنصة هو Veo 3.1، الذي يشترك في بنية الحركة الأساسية نفسها، ويُنتج مخرجات بجودة سينمائية باستخدام لغة الأوامر ذاتها الموصوفة أعلاه.
كيفية استخدام Veo 3.1 على PicassoIA
- انتقل إلى Veo 3.1 على PicassoIA
- اكتب أمرك النصي باتباع الصيغة المكونة من 5 أجزاء أعلاه: المشهد، والإضاءة، وبداية الكاميرا، ووصف الحركة، وحالة النهاية
- اضبط مدة المخرج على الحد الأقصى المتاح (المقاطع الأطول تمنح الحركة وقتًا أكبر لتُقرأ)
- راجع الفيديو المولّد للتأكد من الاتساق الزمني قبل التنزيل
- إذا بدا عمق الحركة المتوازية مسطحًا، فأضف طبقات أمامية ومتوسطة وخلفية صريحة إلى أمرك وأعد التوليد
Veo 3.1 Fast متاح أيضًا للتجارب الأسرع، وينتج دقة أقل قليلًا لكن بمفردات الحركة نفسها. وVeo 3.1 Lite هو الخيار الأسرع والأقل تكلفة لرسم أفكار الحركة قبل الالتزام بتشغيل كامل على Veo 3.1. ولا يزال Veo 3 خيارًا قويًا للمقاطع كثيفة الحركة التي تريد فيها تزامنًا أصليًا للصوت مع الصورة.
الإعدادات التي تنتج مخرجات سينمائية
| الإعداد | الموصى به | السبب |
|---|
| المدة | الحد الأقصى المتاح | الحركة تحتاج إلى وقت لتُقرأ |
| نسبة العرض إلى الارتفاع | 16:9 أو 2.39:1 | الصيغ العريضة تعزز الإحساس السينمائي |
| معدّل النمط | "واقعي، حبيبات الفيلم، مظهر Kodak" | يتجاوز أي مخرجات مصمّمة بأسلوب افتراضي |
| طول الأمر | من 80 إلى 120 كلمة | قصير بما يكفي ليبقى متماسكًا، وطويل بما يكفي للتحكم في الحركة |
مقارنة Veo 4 بالنماذج الأخرى
Veo 4 ليس الخيار القوي الوحيد للحركة السينمائية. إليك موقعه مقارنةً بأفضل النماذج المتاحة حاليًا على PicassoIA:
| النموذج | الحركة السينمائية | الحركة البطيئة | الاتساق الزمني | تزامن الصوت | الأفضل لـ |
|---|
| Veo 3.1 | ممتاز | جيد جدًا | ممتاز | أصلي | مخرجات بجودة الأفلام |
| Kling v3 Video | جيد جدًا | جيد | جيد جدًا | أصلي | الإعلانات التجارية |
| Gen 4.5 | جيد جدًا | جيد | ممتاز | لا يوجد | أعمال قريبة من المؤثرات البصرية |
| Ray 3.2 | جيد | جيد جدًا | جيد | أصلي | مقاطع سينمائية سريعة |
| Sora 2 | ممتاز | ممتاز | جيد جدًا | محدود | حركة عالية الدقة |
| Kling v3 Motion Control | جيد جدًا | جيد | جيد جدًا | أصلي | مسارات كاميرا دقيقة |
| Seedance 2.5 | جيد | جيد | جيد | أصلي | المحتوى طويل المدى |
| LTX 2.3 Pro | جيد | جيد جدًا | جيد | لا يوجد | مخرجات بدقة 4K |
تكمن ميزة Veo 4 في الجمع بين الاتساق الزمني _و_تزامن الصوت. معظم النماذج المنافسة قوية في أحدهما دون الآخر. أما للتحكم الخالص في حركة الكاميرا مع تحديد صريح للحركة، فإن Kling v3 Motion Control هو المنافس الأقرب، إذ يوفر واجهة مخصصة لمسار الكاميرا بدلًا من الاعتماد الكامل على لغة الأمر النصي.
3 أخطاء تقتل الحركة السينمائية
لغة حركة غامضة
عبارة "حركة كاميرا ملحمية" لا تخبر Veo 4 بشيء مفيد. وكذلك عبارة "لقطة سينمائية". يحتاج النموذج إلى تفاصيل محددة: الاتجاه، والسرعة، ووضعية البداية، وحالة النهاية. كل متغير تتركه غير محدد يملؤه النموذج عشوائيًا، وهذا ما يجعل اللقطات تبدو صحيحة تقريبًا لكنها تخطئ المقصود تمامًا.
الحل: استبدل كل صفة جودة غامضة بوصف حركة ملموس. فـ"ملحمية" تصبح "مدار بطيء بزاوية 180 درجة". و"سينمائية" تصبح "دفع دولي بما يعادل 30 إطارًا في الثانية مع عمق ميداني ضحل".
تجاهل نسبة العرض إلى الارتفاع
تعتمد معظم مخرجات الفيديو بالذكاء الاصطناعي افتراضيًا على نسبة 1:1 أو 16:9 القياسية. أما العمل السينمائي الحقيقي فيُنجز بالشاشة العريضة، وتؤثر نسبة العرض إلى الارتفاع في طريقة قراءة الحركة. لقطة دولي بنسبة 1:1 تبدو كمقطع على وسائل التواصل الاجتماعي. أما اللقطة نفسها بنسبة 2.39:1 أنامورفيك فتبدو كفيلم.
الحل: حدد "نسبة عرض إلى ارتفاع 2.39:1" أو "شاشة عريضة أنامورفيك" في أمرك. حتى إن قُصّت المخرجات إلى 16:9، سيُكوّن النموذج اللقطة بمنطق مكاني للشاشة العريضة: تبدو الحركة الأفقية أوسع، وتكون طبقات العمق أكثر ضغطًا.
حركة كثيرة دفعة واحدة
طلب حركة الكاميرا وحركة الشخص وحركة البيئة في الوقت نفسه (الرياح، والماء، والحشود) يُثقل نظام الاتساق الزمني. ينتج النموذج كل عنصر حركة بشكل مقبول منفردًا، لكن التفاعلات بينها تُضعف الثبات من إطار إلى آخر بسرعة.
الحل: اختر عنصرًا متحركًا واحدًا في كل لقطة، واجعل كل شيء آخر ثابتًا. دولي للكاميرا عبر مشهد ساكن أكثر سينمائية من كاميرا ثابتة على مشهد تتحرك فيه كل الأشياء. افصل الحركة المعقدة إلى مقاطع منفصلة وادمجها في المونتاج.
ابدأ في إنتاج لقطات بجودة الأفلام
الفجوة بين فيديو الذكاء الاصطناعي الذي يبدو كنموذج أولي والفيديو الذي ينتمي إلى إنتاج حقيقي هي، بشكل شبه كامل، مشكلة في حرفية الأوامر النصية. يملك Veo 4 القدرة الأساسية على إنتاج لقطات تتبع، وحركات دولي، وحركة بطيئة، وعمق متوازٍ، وتسلسلات تغيير تركيز تصمد أمام التدقيق المهني. ما يحتاجه منك هو الدقة: مسافات محددة بالاسم، وإضاءة موصوفة، وتعليمات حركة متسلسلة، وطبقات عمق صريحة.
Veo 3.1 على PicassoIA هو المكان المناسب للبدء اليوم. تنطبق لغة الأوامر نفسها مباشرةً، ويُنتج النموذج مخرجات توضح ما تستطيع بنية Veo 4 تحقيقه. وإلى جانب Veo، تقدم المنصة أيضًا Kling v3 Motion Control لأعمال المسارات الدقيقة، وGen 4.5 للاستقرار بجودة المؤثرات البصرية، وPixverse v6 للتجريب السينمائي السريع.
إذا كنت تتعامل مع فيديو الذكاء الاصطناعي كآلة قمار تكتب فيها شيئًا وتأمل في الأفضل، فإن النماذج المذكورة هنا، عند استخدامها مع بنية الأوامر الواردة أعلاه، ستغيّر ذلك. الحركة السينمائية قابلة للتعلم. ابدأ التجريب على picassoia.com/en/all-models.