الفرق بين فيديو بالذكاء الاصطناعي سهل النسيان وآخر يوقف المشاهد عن التمرير غالبًا يعود إلى بضع عشرات من الكلمات. لا آلاف، ولا حتى مئات. الكلمات في أمرك النصي هي ما يحدد الحركة وسلوك الكاميرا والنبرة الجوية والتدفق الزمني، ومعظم الناس يكتبون وصفًا للمشهد دون أن يفكروا في أيٍّ من ذلك.
هذا ليس انتقادًا. هكذا يبدأ معظم الناس. تكتب ما تراه في ذهنك، وتضغط على توليد، فتحصل على شيء يشبه صورة فوتوغرافية قررت أن تتحرك. الموضوع صحيح، لكن الفيديو يبدو ساكنًا أو عشوائيًا أو خاطئًا. الخلل ليس في النموذج، بل في التعليمات.
فيما يلي، نشرح بالتفصيل ما الذي يفصل الأمر الذي ينتج فيديو سينمائيًا بالذكاء الاصطناعي عن الأمر الذي ينتج حلقة مشوشة من البكسلات.
لماذا تفشل الأوامر القصيرة في الفيديو
توليد الصور وتوليد الفيديو مهمتان مختلفتان جوهريًا، لكن كثيرًا من المستخدمين يكتبون أوامر الفيديو بالطريقة نفسها التي يكتبون بها أوامر الصور. الأمر النصي للصورة الثابتة يصف حالة، أما أمر الفيديو فيحتاج إلى وصف تغيّر عبر الزمن.
عندما تكتب "امرأة تمشي عبر غابة"، يضطر نموذج الفيديو إلى استنتاج ما يلي:
- ما سرعة مشيها؟
- هل تتبعها الكاميرا، أم تبقى ثابتة، أم تدور أفقيًا؟
- ما الذي يتغير في الخلفية مع حركتها؟
- هل تتغير الإضاءة؟
- كيف تتطور الأحداث خلال 5 ثوانٍ؟
سيقدّر نموذج مثل Seedance 2.0 أو Veo 3 كل هذه الأمور بأفضل تخمين ممكن، لكن "أفضل تخمين" ليس هو قصدك. الأوامر القصيرة تسلّم التحكم للنموذج، أما الأوامر المفصّلة فتعيد التحكم إليك.
💡 المبدأ الأساسي: كل عنصر تتركه غير محدد في أمر الفيديو هو قرار تسلّمه للذكاء الاصطناعي. كن مقصودًا فيما تحدده.

العناصر الخمسة الأساسية التي يحتاجها كل أمر فيديو
هذه المكونات الخمسة ليست إضافات اختيارية. إنها اللبنات الأساسية لفيديو يتصرف فعلًا كما تريد.

1. الموضوع والحالة الابتدائية
صِف الشخص بدقة. ليس فقط من هو أو ما هو، بل أيضًا موقعه الدقيق وجلسته وعلاقته بالبيئة في الإطار الأول.
ضعيف: "رجل في مدينة"
قوي: "رجل في منتصف العمر يرتدي معطفًا رماديًا يقف عند حافة تقاطع مدينة مبلل بالمطر، رأسه مائل قليلًا إلى الأسفل، ويداه في جيبيه"
النسخة القوية تمنح النموذج إطارًا ابتدائيًا محددًا، وكل ما يليه يُبنى عليه.
2. توجيه الحركة
هذا ما يضيفه الفيديو على الصور، وهو العنصر الأكثر تجاهلًا. تحتاج إلى وصف ما يتحرك، وكيف يتحرك، وبأي وتيرة.
تشمل توجيهات الحركة:
- حركة الموضوع ("تستدير ببطء"، "الحشد يندفع إلى الأمام"، "الأوراق تتساقط")
- حركة الكاميرا ("تقريب بطيء بالعربة"، "إمالة لطيفة إلى الأعلى"، "لقطة ثابتة مقفلة")
- الحركة البيئية ("يتصاعد البخار من فتحة تهوية"، "تمر السيارات بضبابية في الخلفية")
تستجيب نماذج مثل Kling v2.6 وWan 2.7 T2V جيدًا للغة الحركة الصريحة. الحركة الغامضة تنتج نتائج مفككة.
3. التسلسل الزمني
تولّد نماذج الفيديو بالذكاء الاصطناعي مدة ثابتة من المحتوى، عادةً بين 4 و10 ثوانٍ حسب النموذج. ينبغي أن يصف أمرك قوس تلك الثواني، لا لحظة ثابتة فقط.
فكّر فيه كنص مصغّر: ماذا يحدث في بداية تلك الثواني ووسطها ونهايتها؟
مثال: "تفتح الكاميرا على لقطة قريبة لفنجان قهوة. خلال الثواني القليلة التالية تتراجع ببطء لتكشف مقهى مزدحمًا. وبحلول الإطار الأخير يتضح الشخص، امرأة على طاولة في الزاوية."
هذا يخبر النموذج بما يجب أن يعطيه الأولوية في كل لحظة من التوليد.
4. الإضاءة والأجواء
الإضاءة ليست بصرية فقط. في أوامر الفيديو، تشير أيضًا إلى المزاج ووقت اليوم وجودة الحركة. تتحرك الظلال بشكل مختلف في ضوء الظهيرة القاسي عنه في الغيوم الناعمة. حدّد:
- وقت اليوم ("الساعة الذهبية"، "الساعة الزرقاء"، "شمس منتصف النهار فوق الرأس")
- اتجاه مصدر الضوء ("ضوء يدخل من الأعلى إلى اليسار"، "موضوع مضاء من الخلف")
- جودة الضوء ("ناعم منتشر"، "قاسٍ موجَّه"، "أعمدة ضوء حجمية تدخل من النافذة")
- العناصر الجوية ("ضباب الصباح"، "غبار في الهواء"، "مطر على الزجاج")
5. مواصفات الكاميرا
أخبر النموذج بنوع الكاميرا التي قد تلتقط هذا المشهد نظريًا. هذا يثبّت الطابع الجمالي كله.
مصطلحات مفيدة: البعد البؤري للعدسة ("واسعة 35mm"، "بورتريه 85mm")، وعمق المجال ("f/1.8 ضحل"، "f/11 تركيز عميق")، ونوع الحركة ("اهتزاز يدوي خفيف"، "جيمبال ناعم"، "حامل ثلاثي ثابت")، وطريقة معالجة الفيلم ("Kodak Portra 400"، "حبيبات فيلم 35mm").
حركات الكاميرا التي تنجح فعلًا
ليست كل أوصاف حركة الكاميرا متساوية. بعضها يُفسَّر بثبات عبر النماذج، وبعضها غامض وينتج سلوكًا عشوائيًا.

هذه مصطلحات الكاميرا التي تنتج نتائج موثوقة في معظم منصات تحويل النص إلى فيديو:
| المصطلح | ما الذي يفعله | أفضل استخدام عندما |
|---|
| تقريب بطيء بالعربة (Slow dolly-in) | تتحرك الكاميرا فعليًا للأمام نحو الموضوع | يكون الموضوع ثابتًا |
| تبعيد بطيء بالعربة (Slow dolly-out) | تتحرك الكاميرا للخلف، كاشفةً المحيط | إنشاء سياق أو إحساس بالحجم |
| تحريك أفقي يمينًا/يسارًا (Pan left/right) | تدور الكاميرا أفقيًا حول محور ثابت | إظهار مساحة واسعة |
| إمالة لأعلى/لأسفل (Tilt up/down) | تدور الكاميرا عموديًا حول محور ثابت | إظهار الارتفاع أو العمق |
| لقطة تتبعية (Tracking shot) | تتبع الكاميرا موضوعًا متحركًا | يكون الموضوع في حركة |
| لقطة دائرية (Orbit shot) | تدور الكاميرا حول الموضوع | التركيز على منتج أو شخصية |
| لقطة ثابتة مقفلة (Static lockoff) | لا تتحرك الكاميرا | إبراز حركة الموضوع |
💡 نصيحة احترافية: اجمع حركة واحدة للموضوع مع حركة واحدة للكاميرا كحد أقصى. أكثر من حركتين متزامنتين غالبًا ما يجعل النماذج تختار واحدة وتتجاهل البقية، أو تنتج مخرجات غير مستقرة.
تتعامل نماذج مثل LTX 2 Pro وHailuo 02 مع تعليمات حركة الكاميرا بثبات خاص. وكلاهما متاح على PicassoIA.
كيف تصف الحركة عبر الزمن
هذا هو القسم الذي تخطئ فيه معظم الأوامر، وإصلاحه يحقق أكبر تحسن منفرد في مخرجات الفيديو بالذكاء الاصطناعي.
توليد الفيديو بالذكاء الاصطناعي ليس عرضًا ثابتًا للصور. يولّد النموذج كل إطار بناءً على احتمال ما سيأتي بعده. يمكن لأمرك أن يؤثر في هذا التدفق الزمني بأن يكون مرتبًا بحسب التسلسل الزمني.

فكّر كمخرج لا كرسام
الرسام يصف ما هو موجود، والمخرج يصف ما يحدث. هاتان العقليتان تنتجان أوامر مختلفة تمامًا.
عقلية الرسام: "منظر جبلي بالثلج وضباب الصباح."
عقلية المخرج: "يلتف ضباب الصباح حول وادٍ جبلي. خلال عدة ثوانٍ، ينفذ شعاع دافئ من ضوء الشمس فوق الحافة ويجتاح قاع الوادي ببطء من اليسار إلى اليمين بينما يبدأ الضباب في التلاشي."
النسخة الثانية توجّه النموذج إلى السببية والتسلسل الزمني، لا إلى المظهر فقط.
استخدم لغة الانتقال
من الكلمات التي تشير إلى التغيّر عبر الزمن:
- "مع تقدم اللقطة..."
- "خلال الثواني القليلة التالية..."
- "تدريجيًا، يبدأ..."
- "بحلول الإطار الأخير..."
- "تكشف الكاميرا ببطء..."
هذه العبارات تعلّم النموذج أن ما يحدث حدث زمني، لا وصف ثابت.
تجنّب الحركة المتناقضة
من الأخطاء الشائعة وصف حالتين غير متوافقتين في الوقت نفسه. "شخصية تركض بسرعة بينما تنجرف الكاميرا برفق" غالبًا ما تنتج مخرجات غير مستقرة، لأن حركة الموضوع السريعة وحركة الكاميرا البطيئة يصعب تنسيقهما. إما أن تبطّئ الموضوع، أو تطابق طاقة الكاميرا مع وتيرة الموضوع.
الإضاءة والأجواء بالشكل الصحيح
الإضاءة هي المجال الذي تبقى فيه معظم الأوامر عامة أكثر من اللازم. عبارات مثل "ضوء طبيعي" أو "إضاءة درامية" لا تقول للنموذج تقريبًا أي شيء.

لغة وقت اليوم التي تنجح
| العبارة | التأثير البصري |
|---|
| الساعة الذهبية (Golden hour) | درجات كهرمانية دافئة، وظلال أفقية طويلة، وضوء ناعم يلتف حول الموضوع |
| الساعة الزرقاء (Blue hour) | لوحة باردة قليلة التشبع، وتوهج محيطي من السماء، وعمق ما قبل الفجر |
| غيوم منتشرة (Overcast diffused) | لا ظلال حادة، وتعريض متساوٍ، وألوان خافتة |
| شمس منتصف النهار القاسية (Harsh midday sun) | تباين عالٍ، وظلال قصيرة، وألوان مشبعة |
| صورة ظلية مضاءة من الخلف (Backlit silhouette) | موضوع داكن على خلفية ساطعة، وإضاءة حافة هالية |
| ضوء صباحي حجمي (Volumetric morning light) | أعمدة ضوء مرئية عبر الجو، وطابع ضبابي |
تفهم هذه العبارات جميع نماذج تحويل النص إلى فيديو الرئيسية، بما فيها Pixverse v5 وWan 2.7 I2V وSora 2.
الطبقات الجوية
أضف العناصر الجوية بعد وصف الإضاءة الأساسية:
- "مع جزيئات غبار مرئية في أعمدة الضوء"
- "ضباب الصباح يلطّف الخلفية"
- "سراب حراري يتصاعد من الرصيف"
- "المطر مرئي كخطوط على خلفية داكنة"
كل واحدة من هذه تضيف حركة إلى الفيديو تتجاوز حركة الموضوع الأساسية، فتملأ الإطار بالحياة دون الحاجة إلى تسلسل حركي معقد.
الفرق بين أوامر الصورة وأوامر الفيديو
إليك مقارنة مباشرة لترى التطور عمليًا.

أمر الصورة: "امرأة ترتدي فستانًا أحمر تقف في حقل عبّاد الشمس عند الساعة الذهبية، عدسة 85mm، عمق مجال ضحل، Kodak Portra 400."
أمر الفيديو للمشهد نفسه: "تقف امرأة ترتدي فستانًا أحمر مديرةً ظهرها إلى الكاميرا في حقل واسع من عبّاد الشمس عند الساعة الذهبية. مع تقدم اللقطة، ترفع ذراعيها ببطء إلى الخارج وكفّاها للأعلى، بينما تبدأ نسمة لطيفة بالمرور بين رؤوس عبّاد الشمس حولها. تدور الكاميرا دورة بطيئة من خلفها نحو جانبها الأيمن، فتكشف منظرها الجانبي بحلول الإطار الأخير. تخلق إضاءة جانبية دافئة من الشمس المنخفضة على اليمين إضاءة حافة قوية على فستانها ورؤوس عبّاد الشمس القريبة. مصوّر بعدسة 85mm عند f/1.8، عمق مجال ضحل، وحبيبات فيلم Kodak Portra 400."
أمر الصورة يصف حالة، وأمر الفيديو يصف حدثًا. كل جملة إضافية تتحكم في السلوك الزمني، لا في المظهر فقط.
أخطاء الأوامر الشائعة (وطرق إصلاحها)
هذه الأنماط تنتج بانتظام مخرجات فيديو ضعيفة، ومعها بدائل مصححة.

الخطأ 1: لا توجد توجيهات حركة
- سيئ: "طائر على غصن في غابة."
- الإصلاح: "طائر صغير جاثم على غصن ينشر جناحيه فجأة ويطير، وتبقى الكاميرا ثابتة وهو يرتفع خارج الإطار أمام مظلة خضراء ضبابية."
الخطأ 2: إشارات أسلوب متناقضة
- سيئ: "لقطات سينمائية واقعية بطائرة مسيّرة بأسلوب الأنمي."
- الإصلاح: اختر أسلوبًا واحدًا. خلط لغات بصرية غير متوافقة يشتت مخرجات النموذج وينتج أسلوبين دون أن يجيد أيًّا منهما.
الخطأ 3: عدد كبير من الموضوعات
- سيئ: "ثلاثة أشخاص يتحدثون، وكلب يركض، وسيارة تطلق بوقها، وطائرة تحلّق فوق الرأس."
- الإصلاح: موضوع أساسي واحد، وعنصر ثانوي واحد كحد أقصى. "رجل على مقعد حديقة يقرأ جريدة بينما يمرّ كلب يهرول في الخلفية."
الخطأ 4: عدم تحديد الحالة النهائية
- سيئ: "نار تشتعل في موقد." (يدور النموذج في حلقة.)
- الإصلاح: "تنخفض ألسنة اللهب في موقد حجري. مع تقدم اللقطة، تشتعل قطعة خشب كبيرة ببطء وتزداد النار شدة، فتلقي ضوءًا برتقاليًا أقوى على رف الموقد الحجري."
الخطأ 5: أجواء عامة
- سيئ: "إضاءة جميلة."
- الإصلاح: "ضوء موجَّه ناعم يدخل من نافذة كبيرة في الأعلى إلى اليسار، فيلقي ظلًا واحدًا قويًا على الأرضية، بطابع دافئ كهرماني لما بعد الظهر."
نصائح خاصة بكل نموذج على PicassoIA
تستجيب النماذج المختلفة لأساليب مختلفة في الأوامر. إليك ما يجب معرفته قبل التوليد.

يستجيب نموذج ByteDance الرئيسي جيدًا جدًا للبنى السينمائية المرتبة زمنيًا. ووعيه الصوتي المدمج يعني أن الأوامر التي تصف أجواء كالمطر أو ضوضاء الحشود أو الأصوات المحيطة غالبًا ما تنتج صوتًا متزامنًا. ضمّن البيئة المحيطة بتفصيل.
يتعامل Veo 3.1 من Google مع المشاهد المعقدة متعددة العناصر بشكل أفضل من معظم النماذج. يستفيد من لغة حركة الكاميرا الصريحة، ويستجيب لمصطلحات لغة الأفلام مثل "لقطة تأسيسية"، و"لقطة تتبعية"، و"لقطة ردّ فعل". قوي في التسلسلات السردية.
الإصدار v3 من Kling مُحسَّن لمخرجات سينمائية بدقة 1080p. استخدم أوصاف إضاءة عالية التحديد وحركة موضوع دقيقة. يتعامل مع الحركة البطيئة المتعمدة بشكل خاص جيدًا، ويجد صعوبة مع الأوامر التي تصف حركة فوضوية متزامنة.
يتعامل نموذج Wan 2.7 مع تحويل النص إلى فيديو بدقة 1080p بثبات قوي. يستفيد من أوصاف البيئة التفصيلية، ويستجيب لتفاصيل المعمار والمشاهد الطبيعية. ممتاز للقطات التأسيسية وسرد القصص البيئي.
يعطي نموذج Lightricks الأولوية للسرعة ومخرجات 4K. استخدم أوامر موجزة ومحددة للغاية. الفقرات الطويلة تُضعف الإشارة. ركّز على موضوع واحد، وحركة واحدة، وبيئة واحدة، وحالة إضاءة واحدة.
يتميز Ray 2 من Luma بقوة خاصة في الحركة السلسة والعضوية. الأوامر التي تصف ظواهر طبيعية مثل الماء والنار والرياح والنمو العضوي تميل إلى إنتاج نتائج مقنعة بشكل استثنائي هنا.
صيغة تنجح باستمرار
بعد الاختبار عبر نماذج متعددة، تنتج بنية الأمر هذه نتائج موثوقة:
[الموضوع + موضعه/حالته الابتدائية] + [ما يفعله الموضوع خلال اللقطة] + [حركة الكاميرا] + [تفاصيل البيئة/الخلفية] + [مواصفات الإضاءة] + [تفاصيل الكاميرا/العدسة] + [الجو]
مكتوبة كأمر كامل:
"شابة ذات شعر داكن تجلس إلى مكتب خشبي، ذقنها مستندة إلى إحدى يديها، تحدّق عبر نافذة مغطاة بخطوط المطر. مع تقدم اللقطة، تزفر ببطء فتسترخي كتفاها، ثم تمد يدها إلى الأمام لتغلق شاشة حاسوبها المحمول. تثبت الكاميرا لقطة متوسطة ثابتة من جانبها الأيسر. خلفها، تنساب قطرات المطر على زجاج نافذة كبيرة تُظهر مدينة رمادية ضبابية. تملأ إضاءة غيوم منتشرة من النافذة الإطار بالتساوي، فتلقي ظلالًا ناعمة على سطح المكتب. مصوّر بعدسة 50mm عند f/2.4، مع حبيبات فيلم Kodak Portra 400، ودفء خفيف لنغمة الغرفة الصوتية المحيطة."
هذا المستوى من التحديد ممكن لأي مشهد في نحو دقيقتين إلى ثلاث دقائق. الأمر ليس معقدًا، لكنه يتطلب التفكير زمنيًا لا ثابتًا.
جرّبه على PicassoIA الآن
يستضيف PicassoIA أكثر من 87 نموذجًا لتحويل النص إلى فيديو في مكان واحد، من مولّد PicassoIA Video المجاني وغير المحدود، وصولًا إلى Sora 2 Pro وGen 4.5 وSeedance 2.0 وKling v2.6.
ابدأ بالصيغة أعلاه. اختر مشهدًا واحدًا. اكتبه كاملًا باستخدام العناصر الخمسة. ولّد على النموذج المجاني أولًا لاختبار البنية، ثم انتقل إلى النموذج المدفوع الذي تختاره بعد أن تبدو الحركة والتوقيت صحيحين.
النتيجة الأولى لن تكون مثالية. هذا ليس هدف التجربة. الهدف هو فهم العنصر الذي ينبغي تعديله بعد ذلك. كتابة أوامر الفيديو بالذكاء الاصطناعي مهارة تتراكم بسرعة، وحلقة التغذية الراجعة على PicassoIA سريعة بما يكفي للتكرار عدة مرات في جلسة واحدة.
أفضل أمر فيديو لديك لا يبعد عنك سوى تعديل واحد عن أمر متوسط. والنماذج بانتظارك.