Veo 3.1 للفيديو العمودي وفيديو السوشيال ميديا: ماذا يقدّم وكيف تستخدمه

Veo 3.1 هو نموذج Google الأكثر تطورًا لتوليد الفيديو بالذكاء الاصطناعي لمحتوى الوضع العمودي. يشرح هذا المقال مواصفات الإخراج بنسبة 9:16، وتوليد الصوت الأصلي، وأدائه مقارنةً مع Veo 3 وVeo 2، إلى جانب استراتيجيات كتابة الأوامر النصية ودليل خطوة بخطوة لتوليد أول ريل لوسائل التواصل.

Veo 3.1 للفيديو العمودي وفيديو السوشيال ميديا: ماذا يقدّم وكيف تستخدمه
Cristian Da Conceicao
مؤسس Picasso IA

لم يعد الفيديو العمودي مجرد فكرة ثانوية للهواتف المحمولة. إنه الصيغة السائدة على كل منصة رئيسية، والطلب على محتوى 9:16 المولّد بالذكاء الاصطناعي بلغ أعلى مستوياته على الإطلاق. يمثل Veo 3.1 من Google أحدث استجابة لهذا الطلب، وهو يفعل شيئًا لا تزال معظم نماذج توليد الفيديو بالذكاء الاصطناعي عاجزة عنه: يتعامل مع الإخراج بالوضع العمودي كمواطن من الدرجة الأولى، لا كنسخة مقتطعة من مقطع بعرض الشاشة.

ما هو Veo 3.1 فعليًا

Veo 3.1 هو نموذج Google لتوليد الفيديو بالذكاء الاصطناعي من الجيل الثالث، وقد صُمم لتوليد فيديو عالي الجودة من الأوامر النصية. وبينما ركزت الإصدارات السابقة بشكل أساسي على الإخراج السينمائي بنسبة 16:9، تأتي هذه النسخة بدعم موسّع للصيغ العمودية، وترابط حركي أدق في المقاطع القصيرة، وتوليد صوتي مدمج لا يحتاج إلى معالجة لاحقة.

يندرج النموذج ضمن مجموعة تضم أيضًا Veo 3.1 Fast للتكرارات السريعة، وVeo 3.1 Lite لأحمال العمل الأخف. لكل إصدار حالة استخدام محددة، لكن Veo 3.1 الرئيسي هو الذي تلجأ إليه عندما لا تقبل الجودة أي تنازل.

الفرق الذي يصنعه الصوت الأصلي

تولّد معظم أدوات تحويل النص إلى فيديو مقاطع صامتة تحتاج إلى عمل صوتي منفصل. أما Veo 3.1 فيولّد صوتًا محيطيًا متزامنًا ومؤثرات صوتية، وفي بعض الحالات حوارًا، مباشرةً من الأمر النصي. بالنسبة إلى فيديو وسائل التواصل، لهذا أهمية كبيرة. فمقطع لمطر يهطل على شارع في المدينة ينبغي أن يبدو كمطر يهطل على شارع في المدينة، وVeo 3.1 يقدم ذلك دون خطوات إضافية.

يكتسب هذا الأمر أهمية خاصة في TikTok وReels، حيث يُشغَّل الصوت تلقائيًا افتراضيًا، وتؤدي المقاطع التي لا تحتوي على صوت أداءً أسوأ بشكل ملحوظ في بيانات مدة المشاهدة.

1080p بنسبة 9:16

دقة الإخراج هي 1080p بنسبة العرض إلى الارتفاع 9:16، وهي تطابق تنسيق العرض الأصلي في Instagram Reels وTikTok وYouTube Shorts وSnapchat. لا حاجة إلى قص أو إعادة تنسيق. ما تولّده هو ما تنشره.

امرأة تصوّر فيديو سيلفي عموديًا مستلقية على أرضية رخامية بيضاء، والهاتف الذكي مرفوع فوق وجهها بكلتا يديها

لماذا غيّر الفيديو العمودي كل شيء

انتقل الفيديو بالوضع العمودي من خطأ يرتكبه المبتدئون إلى الخيار الصحيح للتوزيع عبر وسائل التواصل. حدث هذا التحول بسرعة، ودفعه أمر واحد: الطريقة التي يمسك بها الناس هواتفهم فعلًا.

الأرقام وراء المحتوى العمودي

تحقق Instagram Reels وصولًا أعلى بشكل ملحوظ من منشورات الخلاصة العادية. صُمم TikTok منذ البداية حصريًا لنسبة 9:16. تجاوزت YouTube Shorts 70 مليار مشاهدة يوميًا. هذه الصيغة ليست رائجة مؤقتًا، بل راسخة، وهي تكافئ المحتوى الذي أُنشئ بالوضع العمودي لا المحتوى المكيّف من عرض الشاشة.

الفيديو المولّد بالذكاء الاصطناعي الذي يُخرج 9:16 بشكل أصلي يتجاوز مشكلة التكييف تمامًا. لا توجد أشرطة سوداء ولا قصّات محرجة ولا شخص مقطوع عند الحواف. التكوين مبني للصيغة منذ البداية.

9:16 مقابل 16:9 على وسائل التواصل

هاتفان ذكيان فاخران جنبًا إلى جنب على طاولة بيضاء بسيطة، أحدهما يعرض فيديو أفقيًا بنسبة 16:9 والآخر فيديو عموديًا بنسبة 9:16

يظهر فرق الأداء بين المحتوى العمودي الأصلي والمحتوى الأفقي المعاد استخدامه في بيانات الاحتفاظ بالمشاهدين. يمسك المستخدمون على الأجهزة المحمولة الهاتف عموديًا، والفيديو العمودي يملأ شاشتهم. أما مقطع 16:9 بأشرطة علوية وسفلية فيشغل أقل من نصفها. وبالنسبة إلى المحتوى القصير، حيث تحدد الثانيتان الأوليان ما إذا كان المشاهد سيتجاوز المحتوى بالتمرير، فإن مساحة الشاشة هذه ليست تفصيلًا صغيرًا.

يستحق المعرفة: تفضّل المنصات خوارزميًا المحتوى الذي يُبقي المستخدمين يشاهدون بملء الشاشة. للمحتوى الأصلي بنسبة 9:16 ميزة بنيوية قبل احتساب أي مشاهدة.

Veo 3.1 مقابل Veo 3 مقابل Veo 2

تطورت مجموعة Veo من Google بسرعة. كان Veo 2 قويًا بالفعل في الإخراج السينمائي. أضاف Veo 3 الصوت الأصلي. يحسّن Veo 3.1 كليهما، ويضيف معالجة أفضل لنسبة 9:16 مع تتبّع أدق للأشخاص في التكوينات العمودية.

الميزةVeo 2Veo 3Veo 3.1
الصوت الأصليلانعمنعم، محسّن
إخراج 9:16محدودنعممحسّن
الدقة1080p1080p1080p
ترابط الحركةجيدجيد جدًاممتاز
اتباع الأمر النصيقويقويأقوى

التحسين الأهم

أكثر تحسين عملي من Veo 3 إلى Veo 3.1 يتعلق بطريقة تعامل النموذج مع الإطار العمودي. كانت الإصدارات السابقة تنتج أحيانًا مساحة علوية محرجة أو تقطع الأشخاص عند الركبتين في الأوامر النصية ذات الاتجاه العمودي. يتعامل Veo 3.1 مع التكوين بشكل أكثر طبيعية، فيضع الأشخاص في المكان المناسب داخل إطار طويل.

وهذا مهم بشكل خاص للأوامر التي تصف أشخاصًا، وهم غالبية محتوى الفيديو على وسائل التواصل. الموضة واللياقة والطبخ والسفر ونمط الحياة، كل هذه الفئات تتطلب نموذجًا يفهم كيف يبدو البشر داخل إطار بصيغة عمودية.

متى تستخدم كل إصدار

للمحتوى المصقول الذي لديك وقت لتكراره: Veo 3.1.

للمسودات السريعة واختبارات الأفكار: Veo 3.1 Fast.

للاستخدامات الخفيفة أو القليلة النقاط: Veo 3.1 Lite.

للمشاريع القديمة الموجودة بالفعل في سير عمل: يبقى Veo 3 Fast خيارًا متينًا.

لقطة مقرّبة ليدي امرأة وهي تكتب على حاسوب محمول، وواجهة توليد فيديو بالذكاء الاصطناعي تعرض صورًا مصغرة لفيديوهات بالوضع العمودي على الشاشة

كيفية استخدام Veo 3.1 على PicassoIA

يوفر PicassoIA وصولًا مباشرًا إلى Veo 3.1 دون أي إعداد لواجهة برمجة التطبيقات (API)، ودون تسجيل حساب لدى Google، ودون قوائم انتظار. سير العمل بسيط.

الخطوة 1: افتح صفحة النموذج

انتقل إلى Veo 3.1 على PicassoIA. ستجد حقل الأمر النصي وخيارات المعاملات مباشرةً في الصفحة.

الخطوة 2: اكتب الأمر النصي

ينبغي أن يصف أمرك النصي الشخص، والحركة، والبيئة، والمزاج. بالنسبة إلى فيديو وسائل التواصل، حدّد أيضًا نسبة العرض إلى الارتفاع أو نية التأطير داخل الأمر النصي نفسه. مثال:

"امرأة ترتدي فستانًا صيفيًا مرجانيًا تمشي عبر سوق خارجي مشمس، وفي الخلفية بائعون ومنتجات زراعية ملوّنة، تأطير عمودي بصيغة البورتريه، ضوء بعد ظهر ذهبي، سينمائي، واقعي كالصور الفوتوغرافية"

كلما كان وصف الحركة أدق، كان الناتج أفضل. الأوامر الغامضة مثل "فتاة في سوق" تنتج نتائج عامة. وصف وتيرة المشي واتجاه الضوء وعمق الخلفية يمنح النموذج ما يحتاجه.

الخطوة 3: اضبط معاملات التنسيق

اختر نسبة العرض إلى الارتفاع 9:16. اختر دقة 1080p إذا كان الخيار متاحًا. مدة من 5 إلى 8 ثوانٍ مثالية للمقاطع الاجتماعية التي ستُعرض في حلقة أو تُدمج مع غيرها.

الخطوة 4: ولّد وراجع

يستغرق التوليد ما بين 30 ثانية و2 دقيقة حسب الطابور. وعندما يصبح الفيديو جاهزًا، عاين المقطع في المتصفح قبل تنزيله. تحقق من تأطير الشخص، وتماسك الحركة، ومزامنة الصوت إذا كان الأمر النصي يطلب صوتًا.

إذا لم تكن النتيجة الأولى هي ما تحتاجه، فأعد التوليد بأمر نصي محسّن بدلًا من محاولة إصلاحها في مرحلة ما بعد الإنتاج. النموذج يستجيب جيدًا للتكرار.

شاب يرتدي كنزة بيضاء بياقة دائرية كحلية يصوّر نفسه بحلقة إضاءة وهاتف ذكي على حامل ثلاثي القوائم في شقة حديثة مضيئة

كتابة أوامر نصية تنجح

الأمر النصي هو المتغير الأهم. Veo 3.1 قادر، لكنه يبلغ أقصى أدائه فقط عندما يكون الأمر النصي محددًا.

3 بنى للأوامر النصية تحقق نتائج جيدة

البنية 1: الشخص + الحركة + البيئة + الضوء + الأسلوب

"باريستا يرتدي مريلة بيضاء يصب رسمًا فنيًا من الحليب في كوب خزفي، لقطة مقرّبة ليدين، أجواء مقهى دافئة بإضاءة محيطية ناعمة، تأطير عمودي، سينمائي، واقعي كالصور الفوتوغرافية"

البنية 2: المزاج + الشخص + الحركة + المكان

"بهجة، تدور شابة في حقل زهور عند الغروب، حركة بطيئة، لقطة عريضة تنتقل إلى لقطة متوسطة، ضوء ذهبي دافئ، صيغة فيديو عمودية"

البنية 3: المشهد + حركة الكاميرا + التفاصيل

"سوق ليلي مزدحم في جنوب شرق آسيا، تميل الكاميرا ببطء إلى الأعلى من أكشاك الطعام في الشارع نحو سماء مضيئة بالنيون، إحساس محمول باليد، اتجاه عمودي، ضباب جوي رطب"

ما يجب تجنبه

  • التعليمات المتعارضة: لا تطلب لقطة واسعة تأسيسية ولقطة مقرّبة في المقطع نفسه. اختر واحدة.
  • الأوامر المثقلة: نادرًا ما يحسّن أكثر من 80 كلمة النتائج. احذف كل ما لا يصف عنصرًا مرئيًا.
  • غياب إشارات الاتجاه: إذا أردت نسبة 9:16، فاذكر ذلك في الأمر النصي. عبارتا "تأطير عمودي" أو "اتجاه بصيغة البورتريه" تحددان نية التكوين.

يستحق الملاحظة: صِف الحركة بوضوح. عبارة "امرأة تمشي" أضعف من "امرأة تمشي ببطء، وذراعاها بجانبها، وكعباها يطرقان البلاط". النموذج يُظهر ما تصفه، لا ما تتخيله.

منظور جوي من الأعلى لساحة حضرية مصوّرة بهاتف ذكي ممسوك بالوضع العمودي، مع ظهور أظافر مطلية بطرف فرنسي

نماذج أخرى لتوليد الفيديو بالذكاء الاصطناعي تستحق التجربة

يمثل Veo 3.1 الخيار الأقوى حاليًا للفيديو العمودي على وسائل التواصل، لكنه ليس الوحيد. وبحسب نوع المحتوى لديك، هناك بدائل تستحق المعرفة.

للسرعة

يمثل Veo 3.1 Fast الخيار الأول الواضح للمسودات. وخارج عائلة Veo، فإن Seedance 2.0 من ByteDance سريع، ويُخرج بدقة 1080p مع صوت، ويتعامل جيدًا مع الأشخاص. وللمعاينات شبه الفورية، يقدم LTX 2.3 Fast إخراجًا بدقة 4K بسرعة.

للجودة

عندما تكون الجودة هي الأولوية ويكون وقت التصيير ثانويًا، ينتج Kling v3 Omni Video نتائج سينمائية مع تحكم قوي في الحركة. يولّد LTX 2.3 Pro مقاطع بدقة 4K مع دقة تفاصيل عالية. ويمثل Pixverse v5 خيارًا متينًا آخر، مع دعم موثوق للصيغة العمودية وإخراج واضح بدقة 1080p.

كل من هذه النماذج متاح على PicassoIA بالوصول نفسه دون إعداد، مثل Veo 3.1.

مساحة عمل إبداعية من الأعلى، تضم دفتر ملاحظات وهاتفًا يعرض لوحة قصة مصوّرة لفيديو عمودي وسماعات أذن ونبتة صبار على مكتب من خشب البلوط

ما الذي يصنعه صنّاع المحتوى الحقيقيون

تجاوزت حالات استخدام فيديو الذكاء الاصطناعي العمودي المحتوى التجريبي بكثير. يقدّم صنّاع المحتوى هذا الفيديو لجمهور حقيقي على كل منصة اجتماعية رئيسية.

محتوى السفر

تُعد مقاطع السفر القصيرة من أكثر الصيغ أداءً في فيديو الذكاء الاصطناعي. يمكن لأمر نصي يصف زقاقًا ضيقًا في لشبونة، أو عبّارة تعبر إسطنبول، أو سوقًا فجرية في بانكوك، أن ينتج مقطعًا مقنعًا بأجوائه في أقل من دقيقتين. وعند دمجه مع تعليق صوتي حقيقي أو وصف، يعمل المحتوى كمنشور اجتماعي جاهز للنشر.

في محتوى السفر، تحدد الدقة الفرق بين المقاطع المنسية والمقاطع التي تحافظ على الانتباه. اسم المدينة، ووقت اليوم، والطقس، وتفصيل بصري مميز أو اثنان. "سوق سمك صباحي في أوساكا، بائعون يرتدون أحذية مطاطية، أرضيات حجرية مبللة، ضباب في الهواء، صيغة عمودية" ينتج شيئًا له إحساس حقيقي بالمكان.

الموضة ونمط الحياة

الموضة فئة أخرى يتألق فيها Veo 3.1. يمكن توليد مقطع لعارضة بزي محدد، في مكان محدد، بتأطير عمودي في دقائق، واستخدامه في لوحات المزاج أو معاينات المنتجات أو محتوى وسائل التواصل. يتعامل النموذج مع ملمس القماش والحركة الطبيعية بهذه الدقة.

محتوى نمط الحياة، من روتين الصباح وطقوس القهوة إلى جولات الشقق، يتبع النهج نفسه. تتوافق صيغة 9:16 والأسلوب البصري بشكل طبيعي مع ما يتوقعه جمهور المنصات.

امرأة على مقعد حديقة وقت الساعة الذهبية تصوّر فيديو سيلفي عموديًا، مضاءة بإضاءة حافة أمام سماء زرقاء مفتوحة والشمس الدافئة خلفها

مقارنة الإخراج عبر الصيغ

السؤال العملي لمعظم صنّاع المحتوى هو ما إذا كان ينبغي التوليد بنسبة 9:16 بشكل أصلي أو التوليد بنسبة 16:9 ثم القص. الجواب، مع Veo 3.1، هو دائمًا الأصلي.

عندما يعرف النموذج نسبة العرض إلى الارتفاع أثناء التوليد، فإنه يكوّن المشهد لتلك النسبة. يُوضع الأشخاص لإطار طويل، وتُرتّب عمق المجال واتجاه الإضاءة والعناصر البيئية وفق طريقة رؤية المشاهد لها على شاشة الهاتف. كثيرًا ما يزيل القص بعد التوليد لمقطع بنسبة 16:9 عناصر سياقية كانت موضوعة على جانبي الإطار.

يستحق التذكّر: ولّد بشكل عمودي، لا بشكل أفقي. يعمل النموذج بشكل أفضل عندما يعرف ما يصنعه منذ البداية.

امرأة في غرفة مظلمة تشاهد فيديو عموديًا على هاتف ذكي، وتضيء شاشته الزرقاء الباردة جانبًا واحدًا من وجهها في منظر جانبي

مواصفات المنصات في لمحة

قبل التوليد، يفيد معرفة الأهداف لكل منصة:

المنصةالصيغةالدقةأقصى مدة
TikTok9:161080x192060 دقيقة
Instagram Reels9:161080x192015 دقيقة
YouTube Shorts9:161080x19203 دقائق
Snapchat9:161080x192060 ثانية
Pinterest9:161080x192015 دقيقة

يُخرج Veo 3.1 بدقة 1080x1920 بشكل أصلي، وهي تطابق كل منصة في هذا الجدول دون أي خطوة لتغيير الحجم.

ابدأ بتوليد أول ريل لك

إنتاج فيديو وسائل التواصل بالذكاء الاصطناعي أسرع مما كان عليه في أي وقت مضى، وقد بلغت الجودة مستوى يجعل إخراج الذكاء الاصطناعي منافسًا للمحتوى المُنتج في فئات كثيرة. يتولى Veo 3.1 الصيغة والصوت والدقة. مهمتك أنت هي الأمر النصي.

ابدأ بمشهد واحد محدد. اكتبه كما تصف صورة فوتوغرافية لشخص لم يرها. ضمّن الشخص والحركة والمكان والضوء والاتجاه. شغّل ذلك على Veo 3.1، وراجع النتيجة، وعدّل متغيرًا واحدًا في كل مرة.

يمنحك PicassoIA الوصول إلى Veo 3.1، وVeo 3.1 Fast، وVeo 3.1 Lite، وعشرات النماذج الأخرى في الواجهة نفسها. إذا لم يعطك نموذج ما ما تحتاجه، فالنموذج التالي على بُعد نقرة واحدة. المنصة هي أسرع طريقة للعثور على ما يناسب فئة المحتوى الخاصة بك.

اصنع شيئًا عموديًا.

امرأة تجلس متربعة على شرفة سطح عند الغروب، بجانبها حاسوب محمول يعرض نتائج فيديو بالذكاء الاصطناعي وهاتف ذكي يعرض معاينة فيديو عمودي، والأفق المتوسطي خلفها

شارك هذا المقال

اختر لغتك

مقالات ذات صلة