الصيغة التي تسيطر اليوم على كل تغذية محتوى هي الصيغة العمودية. ليس لأن الصيغة الأفقية اختفت، بل لأن أحدًا لم يعد يشاهدها بالطريقة نفسها. تعتمد YouTube Shorts و TikTok و Instagram Reels جميعها نسبة 9:16، وتُعرض كلها على هاتف يُمسك عموديًا، وتكافئ صنّاع المحتوى الذين يتحركون بسرعة.
المشكلة أن إنشاء فيديو عمودي مدته 30 ثانية كان يستغرق ساعات. تصوير، ثم استيراد، ثم قص، ثم إضافة موسيقى، ثم تصدير، ثم تغيير الحجم. أما اليوم فقد اختصرت مولّدات الفيديو بالذكاء الاصطناعي هذا المسار إلى دقائق. تكتب أمرًا نصيًا، وتختار نموذجًا، فتحصل على مقطع عمودي جاهز للرفع. لا كاميرا، ولا حامل ثلاثي، ولا تطبيق مونتاج.
يشرح هذا المقال بالتفصيل كيفية تحقيق ذلك، وأي مولّدات الفيديو بالذكاء الاصطناعي تعمل بأفضل شكل مع Shorts، وكيف تكتب أوامر نصية تنتج نتائج تستحق النشر.
لماذا يهيمن الفيديو العمودي الآن
نسبة 9:16 أصبحت الخيار الافتراضي
لم يغيّر الهاتف الذكي طريقة استهلاك الناس للمحتوى فحسب، بل غيّر أيضًا شكل "الوضع الطبيعي" على الشاشة. لسنوات كانت نسبة 16:9 المعيار العالمي لأن شاشات التلفزيون وأجهزة الكمبيوتر عريضة. لكن الهواتف طويلة. وحين جعلت منصات المحتوى القصير الصيغة العمودية الخيار الافتراضي، اضطرت صناعة إنشاء المحتوى بأكملها إلى اللحاق بها.
تقدّم YouTube Shorts اليوم أكثر من 70 مليار مشاهدة يوميًا. وتجاوز TikTok مليار مستخدم نشط. وتُعد Instagram Reels الصيغة الأسرع نموًا. وبنت كل منصة كبرى خوارزمية التوصية الخاصة بها حول المحتوى بنسبة 9:16، ما يعني أن الفيديوهات الأفقية يتم تقليل ظهورها قبل أن تتاح لها فرصة أصلًا.
إذا كنت تنشئ محتوى لا يتناسب مع الصيغة العمودية، فأنت تبدأ من موقع خاسر بنيويًا.
ما الذي يغيّره الذكاء الاصطناعي في سير العمل
لم يكن العائق التقليدي أمام الفيديو العمودي هو الإبداع، بل الإنتاج. فالتصوير يتطلب معدات وإضاءة وشخصًا يُصوَّر. والمونتاج يتطلب وقتًا ومهارات برمجية وثباتًا. وحتى مع هاتف جيد، ينتج معظم الناس محتوى غير منتظم لأن تكلفة الإنتاج أعلى من أن تُحتمل باستمرار.
تزيل مولّدات الفيديو بالذكاء الاصطناعي معظم هذه التكلفة. فبدلًا من إعداد اللقطة، تصفها. وبدلًا من مونتاج اللقطات، تستلم مقطعًا جاهزًا. وبدلًا من قضاء فترة بعد الظهر في منشور واحد، يمكنك توليد خمس أو عشر نسخ متنوعة في ساعة واحدة، وجدولتها على مدار الأسبوع.
وتجاوزت جودة المخرجات أيضًا عتبة مهمة. فنماذج مثل Kling v3 Video و Veo 3.1 و Hailuo 2.3 تنتج لقطات قادرة على شد الانتباه في تغذية Shorts. الحركة سلسة، والإضاءة واقعية، والدقة البصرية عالية إلى درجة أن المشاهد لا يلاحظ فورًا أنها من الذكاء الاصطناعي.

ما الذي تحتاجه قبل أن تبدأ
أمرك النصي هو سيناريوك
في إنتاج الفيديو التقليدي، تكتب سيناريو، ثم تصوره، ثم تقوم بالمونتاج. أما مع توليد الفيديو بالذكاء الاصطناعي، فإن الأمر النصي هو السيناريو وقائمة اللقطات والتوجيه البصري معًا. فهو يخبر النموذج بما يعرضه، وكيف يؤطره، وما المزاج العام، وكيف يجب أن تتحرك الأشياء.
الأمر النصي الضعيف ينتج مخرجات عامة. أما الأمر النصي المحدد فينتج شيئًا يمكنك نشره فعلًا.
إليك الفرق:
ضعيف: "امرأة تمشي في مدينة"
قوي: "امرأة واثقة في أواخر العشرينات، ببشرة زيتونية، ترتدي معطفًا أحمر، تمشي على رصيف مزدحم مبلل بالمطر في شوارع نيويورك ليلًا، انعكاسات النيون على الأسفلت المبتل، حركة بطيئة، إطار عمودي 9:16، إضاءة سينمائية، عمق ميداني ضحل"
النسخة الثانية تخبر الذكاء الاصطناعي عن التأطير والإضاءة والمزاج وسرعة الحركة والأسلوب البصري. أما النسخة الأولى فلا تمنحه شيئًا يعمل عليه.
💡 نصيحة: حدّد دائمًا "الصيغة العمودية" أو "نسبة العرض إلى الارتفاع 9:16" أو "الاتجاه العمودي" في أمرك النصي عند العمل مع النماذج التي تدعم ذلك. بعض النماذج تعتمد نسبة 16:9 افتراضيًا إذا لم تحدد غير ذلك.
نسبة العرض إلى الارتفاع أهم مما تظن
ليست كل مولّدات الفيديو بالذكاء الاصطناعي تدعم مخرجات 9:16 بشكل أصلي. فبعضها يُنتج لقطات 16:9 فقط، ما يعني أنك ستضطر إلى قص النتيجة أو إضافة أشرطة علوية وسفلية لها من أجل Shorts. وغالبًا ما يؤدي ذلك إلى قطع الموضوع الرئيسي أو انهيار التكوين.
قبل اختيار النموذج، تحقّق مما إذا كان يدعم المخرجات العمودية. فـ Kling v2.6 وPixverse v5 وSeedance 1 Pro تقدم جميعها مخرجات 9:16، ما يجعلها خيارات قوية لإنتاج Shorts.

أفضل نماذج الذكاء الاصطناعي للفيديوهات العمودية
يضم مشهد الفيديو بالذكاء الاصطناعي عشرات النماذج، وهي ليست متساوية في إنتاج محتوى جاهز لـ Shorts. إليك أين تقف أفضل الخيارات الآن.
Kling v3 Video: الخيار الأفضل لمحتوى Shorts
يُعد Kling v3 Video حاليًا النموذج الأكثر موثوقية لإنشاء محتوى عمودي قصير مصقول. يُنتج مخرجات سينمائية، ويتعامل مع الحركة بإتقان، ويدعم نسبة 9:16 بشكل أصلي. وثبات الحركة فيه قوي بشكل خاص، أي أن الأشياء والأشخاص يتحركون بسلاسة بدلًا من أن ينجرفوا أو يتشوهوا كما تفعل النماذج الأقدم.
بالنسبة لحالات استخدام Shorts، تناسبه تمامًا قدرته على توليد مقاطع من 5 إلى 10 ثوانٍ. فمقطع Shorts يتراوح عادةً بين 15 و60 ثانية، ويمكنك ربط عدة توليدات معًا للوصول إلى الطول المستهدف.
| الميزة | التقييم |
|---|
| الجودة البصرية | ممتازة |
| ثبات الحركة | ممتاز |
| دعم العمودي | 9:16 بشكل أصلي |
| السرعة | سريع |
| الأفضل لـ | Shorts سينمائية، مقاطع سردية |
Veo 3.1 للواقعية السينمائية
يقدم Veo 3.1 من Google فئة مختلفة تمامًا من حيث الواقعية الفوتوغرافية. فالمقاطع التي ينتجها يصعب فعلًا تمييزها عن تصوير الكاميرات الحقيقي، خاصة في المشاهد الخارجية والطبيعية. كما يدعم توليد الصوت الأصلي، أي أن الذكاء الاصطناعي ينشئ أصواتًا محيطة تتناسب مع المشهد المرئي.
بالنسبة لمحتوى Shorts الذي يحتاج إلى أن يبدو واقعيًا، مثل مشاهد السفر وعروض المنتجات ومقاطع الطبيعة، يُعد Veo 3.1 أفضل خيار متاح. لكن ثمن ذلك هو بطء التوليد، فهو يستغرق وقتًا أطول من النماذج الأسرع مثل Wan 2.5 T2V Fast. وإذا أردت المستوى السينمائي نفسه مع الصوت في إصدار أسبق قليلًا، فإن Veo 3 خيار قوي أيضًا.
Pixverse v5 للسرعة
عندما تحتاج إلى الكمية، عندما تنتج 10 مقاطع Shorts في الأسبوع وتحتاج إلى سرعة في الإنجاز، يكون Pixverse v5 الأداة المناسبة. أوقات التوليد فيه قصيرة، والمخرجات البصرية ما زالت تنافسية. يتعامل جيدًا مع المشاهد الديناميكية، ولقطات الحركة، والقطع السريعة، والمحتوى الغني بالحركة.
لن يضاهي Kling v3 Video أو Veo 3.1 في الدقة البصرية الخام، لكنه خيار قوي لمخرجات وسائل التواصل التي تحتاج إلى سرعة.
Wan 2.6 T2V للاستخدام المفتوح
يُعد Wan 2.6 T2V من أكثر النماذج المفتوحة قدرة المتاحة. بالنسبة لصنّاع المحتوى الذين يريدون التجريب المكثف، ينتج مخرجات بجودة HD ويتعامل مع مجموعة واسعة من أنواع المشاهد. ويمكنك إقرانه بنموذج Wan 2.6 I2V إذا أردت تحريك صورة محددة سبق أن أنشأتها، وهو سير عمل يناسب Shorts التي تعتمد أسلوبًا بصريًا ثابتًا.

كيف تصنع فيديو عموديًا على PicassoIA
يتيح لك PicassoIA الوصول إلى جميع النماذج المذكورة أعلاه في مكان واحد، دون الحاجة إلى حسابات منفصلة أو مفاتيح API. إليك الخطوات بالتفصيل.
الخطوة 1: اختر نموذجك
انتقل إلى مجموعة تحويل النص إلى فيديو واختر النموذج الذي يناسب هدفك. بالنسبة لمحتوى Shorts، يُعد Kling v3 Video أو Kling v2.6 نقطتي البداية الأكثر اتساقًا. وإذا أردت أقصى درجات الواقعية الفوتوغرافية، فاختر Veo 3.1.
الخطوة 2: اكتب أمرًا نصيًا قويًا
استخدم هذه البنية أساسًا:
[الموضوع + الحركة] + [البيئة/المكان] + [ظروف الإضاءة] + [حركة الكاميرا] + [المزاج/الأجواء] + [نسبة العرض إلى الارتفاع: 9:16]
مثال: "شابة تقف على سطح مبنى وقت الساعة الذهبية، أفق المدينة خلفها، حركة كاميرا بطيئة نحو الأعلى، ضوء خلفي دافئ وناعم، مزاج سينمائي، صيغة عمودية 9:16"
اجعل أمرك النصي بين 40 و80 كلمة. القصير جدًا يمنح النموذج حرية زائدة، والطويل جدًا تبدأ فيه التعليمات المتعارضة بإضعاف المخرجات.
💡 نصيحة: أضف حركات كاميرا محددة إلى أمرك النصي. فعبارات "دفع بطيء نحو الداخل" و"ميلان نحو الأعلى" و"لقطة دائرية حول الشخص" و"حركة دوللي يدوية" تنتج كلها نتائج مختلفة، وتجعل مقاطع Shorts أكثر حيوية وقصدية.
الخطوة 3: اضبط نسبة العرض إلى الارتفاع على 9:16
في إعدادات النموذج، ابحث عن خيار نسبة العرض إلى الارتفاع واختر 9:16 أو عمودي. بعض النماذج تسميه "vertical" أو "mobile". هذا يضمن أن المخرجات مُعدّة مسبقًا للرفع المباشر إلى Shorts، دون حاجة إلى قص.
الخطوة 4: وَلِّد وحمّل
شغّل التوليد. تستغرق معظم النماذج ما بين 30 ثانية و3 دقائق حسب النموذج وطول المقطع. راجع المخرجات وتحقق من:
- التأطير الصحيح (الشخص غير مقطوع عند الحواف)
- حركة سلسة (دون قفزات مفاجئة أو تشوهات)
- إضاءة ثابتة طوال مدة المقطع
إذا كان أي من ذلك غير صحيح، فعدّل أمرك النصي وأعد التوليد. كرر المحاولة بسرعة. والهدف هو الوصول إلى صيغة للأمر النصي تنتج مخرجات موثوقة لأسلوب محتواك، ثم التوسع من هناك.

كتابة الأوامر النصية للفيديوهات العمودية
الحصول على مخرجات متسقة وعالية الجودة من نماذج الفيديو بالذكاء الاصطناعي يعتمد على كتابة الأوامر النصية. وإليك ما يحدث فرقًا فعليًا.
كيف يبدو الأمر النصي الجيد للفيديو العمودي
أكبر خطأ هو كتابة أمر نصي يصف مشهدًا دون النظر إلى كيفية تأطيره. للفيديو العمودي قواعد تكوين مختلفة عن الأفقي. الإطار طويل وضيق، وموضع الشخص له تأثير مختلف. والحركة التي تتجه للأعلى أو للأسفل تبدو أفضل من الحركة الجانبية.
ابنِ أوامرك النصية حول سيناريوهات تناسب الصيغة العمودية:
- كشوفات من الأعلى إلى الأسفل: شلال، شخص واقف بطوله، مبنى في المدينة
- صور مقربة للوجه: الوجه، الجزء العلوي من الجسم، شخص واحد في منتصف الإطار
- مناظر طبيعية عمودية: منحدرات، غابات بأشجار عالية، درجات سلم، لقطات للمصاعد
- زوايا من الأسفل إلى الأعلى: النظر إلى مبنى من الأسفل، النظر إلى شخص من الأسفل
تجنب المشاهد الواسعة والبانورامية. فهي تبدو خاطئة في الصيغة العمودية، لأن أكثر أجزاء التكوين إثارة تنتهي عند الحواف حيث يقطعها الإطار.
حركات الكاميرا التي تنجح في Shorts
تنتج تعليمات الكاميرا التالية نتائج قوية باستمرار في توليد الفيديو العمودي بالذكاء الاصطناعي:
| حركة الكاميرا | أفضل حالة استخدام |
|---|
| دفع بطيء نحو الداخل | كشوفات درامية، لحظات عاطفية |
| ميلان نحو الأعلى | أشخاص طوال، إبراز الحجم |
| زاوية منخفضة نحو الأعلى | صور شخصية، لقطات قوة |
| اهتزاز يدوي خفيف | مشاهد الشارع، إضفاء الطابع الأصيل |
| دوران حول الشخص | لقطات المنتجات، كشف الشخصيات |
| تثبيت ثابت | لحظات الحوار، مشاهد الطبيعة |
عند استخدام Kling v3 Motion Control، يمكنك تحديد حركة الكاميرا بدقة أكبر، والتحكم في مسار الكاميرا الافتراضية إطارًا بإطار.

حالات استخدام واقعية لـ Shorts المولّدة بالذكاء الاصطناعي
عروض المنتجات
الفيديو العمودي بالذكاء الاصطناعي قوي بشكل خاص في محتوى المنتجات. يمكنك توليد مقطع يعرض منتجًا في بيئة مثالية دون أن تمتلك المنتج، أو تستأجر استوديو، أو توظف مصورًا. الموضة ومستحضرات التجميل والطعام وإكسسوارات التقنية، كلها فئات تنتج محتوى Shorts قويًا بالذكاء الاصطناعي.
بالنسبة لفيديوهات المنتجات، تعمل النماذج التي تتعامل مع تحويل الصورة إلى فيديو بشكل جيد. ابدأ بصورة منتج لديك بالفعل، ثم حرّكها باستخدام Wan 2.6 I2V أو Kling v2.6. والنتيجة مقطع فيديو قصير يعرض المنتج في مشهد متحرك، وهو أكثر جذبًا بكثير من منشور صورة ثابتة.
محتوى السفر دون السفر
بعض أفضل مقاطع Shorts المولّدة بالذكاء الاصطناعي أداءً هي محتوى سفر. يشاهده الناس بشغف لأن مشاهده مثيرة للتطلع. وتنتج مولّدات الفيديو مثل Veo 3.1 لقطات سفر لا يمكن تمييزها عن تصوير الكاميرات الحقيقي بدقة العرض المعتادة.
يمكنك إنتاج سلسلة سفر عمودية كاملة حول أي وجهة دون حجز رحلة طيران. والمفتاح هو كتابة أوامر نصية محددة جغرافيًا. فالأمر "زقاق مرصوف بالحصى متعرج في لشبونة عند الغسق، ضوء ذهبي، وزهر الجهنمية ينسكب فوق جدران مطلية بالأبيض" ينتج مخرجات أكثر أصالة بكثير من "شارع أوروبي".
Shorts القائمة على القصص
المقاطع القصيرة السردية، وهي قصص قصيرة جدًا مدتها من 15 إلى 30 ثانية، تحقق أداءً استثنائيًا على Shorts لأنها تخلق حلقة إكمال. يشاهد الناس حتى النهاية ليعرفوا ما يحدث. وتتعامل نماذج الفيديو بالذكاء الاصطناعي مع اللحظات السردية القصيرة بشكل جيد عندما تحدد المشهد بوضوح في أمرك النصي.
بالنسبة للمحتوى السردي متعدد المقاطع، ولّد كل "مشهد" على حدة، ثم اجمعها في محرر بسيط على الهاتف. لا تحتاج إلى حزمة مونتاج كاملة لربط خمسة مقاطع ذكاء اصطناعي مدة كل منها 5 ثوانٍ في Short مدته 25 ثانية.

3 أخطاء شائعة يجب تجنبها
تجاهل المنطقة الآمنة
تضع منصات الفيديو العمودي عناصر واجهة المستخدم فوق المحتوى. فـ YouTube Shorts تعرض العنوان والوصف وأزرار الإعجاب والتعليق واسم القناة فوق إطار الفيديو. وإذا كان موضوعك الرئيسي أو الحركة المهمة قريبًا من الحافة السفلية أو اليمنى للإطار، فستغطيه واجهة المنصة جزئيًا.
حافظ على وضع موضوعك الرئيسي في وسط الإطار، خاصة بين 20% و80% من الارتفاع العمودي. وتجنب وضع العناصر المهمة في أسفل المقطع العمودي تمامًا.
حركة كثيرة وقصة قليلة
تتعامل مولّدات الفيديو بالذكاء الاصطناعي اليوم مع الحركة بشكل جيد، لكن الحركة من أجل الحركة وحدها لا تُبقي المشاهدين. فالمقطع الذي يُظهر كاميرا تتحرك على بيئة جميلة يحقق احتفاظًا أقل من مقطع يحدث فيه شيء ما، حتى لو كان هذا "الشيء" بسيطًا مثل شخص يلتفت لينظر إلى الكاميرا.
قبل التوليد، اسأل نفسك: لماذا يشاهد المتفرج هذا المقطع؟ امنح المقطع هدفًا حتى لو كان مشهدًا محيطيًا مدته 10 ثوانٍ.
طول الأمر النصي الخاطئ
هناك نطاق مثالي لأوامر فيديو الذكاء الاصطناعي، يتراوح تقريبًا بين 40 و80 كلمة. أقل من 30 كلمة، يملأ النموذج الكثير من الفراغات بقيم افتراضية عامة. وأكثر من 100 كلمة، تبدأ التعليمات المتعارضة في إنتاج نتائج غير متوقعة، حيث يبدو أن النموذج يتجاهل أجزاء من الأمر النصي جزئيًا.
اختبر أوامرك النصية أولًا في نطاق 50 إلى 70 كلمة. وبمجرد أن تصل إلى صيغة تعمل، وسّعها أو اختصرها من هناك.

نماذج أخرى تستحق الاستكشاف
إلى جانب الخيارات الأولى أعلاه، هناك نماذج أخرى تنتج نتائج قوية في سياقات محددة:
- Seedance 1.5 Pro: ممتاز لمحتوى نمط الحياة والموضة. يتعامل بإقناع مع حركة الإنسان.
- LTX 2.3 Pro: مخرجات بدقة 4K لأعلى دقة ممكنة في Shorts.
- Hailuo 2.3: قوي للمشاهد السينمائية الغنية بالتفاصيل البيئية.
- Gen 4.5: نموذج Runway بتحكم دقيق في الحركة، ومتين للمحتوى السردي المكتوب مسبقًا.
- Ray: توليد سريع، ومناسب للتكرار السريع عند اختبار أساليب أوامر نصية جديدة.
💡 نصيحة: اختبر الأمر النصي نفسه عبر 2 إلى 3 نماذج وقارن النتائج. فلكل نموذج "شخصية" بصرية مختلفة، ويمكن لأمر نصي واحد أن ينتج مخرجات مختلفة جذريًا حسب النموذج الذي تستخدمه.

أول Short بالذكاء الاصطناعي يبدأ من هنا
لم يعد العائق أمام إنشاء محتوى فيديو عمودي لـ Shorts سوى أمر نصي جيد و3 دقائق. لا معدات تحتاج إلى إعداد، ولا مقاطع تحتاج إلى استيراد، ولا خط زمني للمونتاج تحتاج إلى إدارته.
الصنّاع الذين يستفيدون أكثر من هذا السير هم من يتعاملون مع كتابة الأوامر النصية كمهارة تستحق التطوير. فكل توليد يعلّمك شيئًا عن طريقة فهم النموذج للغة، وما التفاصيل البصرية التي تحتاج إلى تحديدها، وأي حركات كاميرا تناسب أي موضوعات.
ابدأ بـ Kling v3 Video أو Kling v2.6 في أول مقاطع Shorts لك. اكتب أمرًا نصيًا محددًا وبصريًا من 60 كلمة. اضبط النسبة على 9:16. ولّد. شاهد النتيجة وعدّل من هناك.
يتوفر لدى Picasso IA أكثر من 89 نموذجًا لتحويل النص إلى فيديو في مكان واحد. يمكنك تجربة Veo 3.1 وPixverse v5 وWan 2.6 T2V وكل نموذج آخر في هذا المقال دون التنقل بين المنصات أو إدارة اشتراكات منفصلة. يحدث سير إنتاج فيديو الذكاء الاصطناعي العمودي بالكامل، من الأمر النصي إلى المقطع النهائي، في مكان واحد.
الخوارزمية تكافئ النشر المنتظم. وتوليد الفيديو بالذكاء الاصطناعي يجعل النشر المنتظم ممكنًا. وهذا المزيج هو ما يبني جمهورًا على Shorts.
