Veo 3.1 لفيديوهات TikTok وYouTube Shorts: ذكاء اصطناعي لفيديو عمودي يحقق نتائج فعلية

Veo 3.1 من Google هو أول نموذج ذكاء اصطناعي لتوليد الفيديو مبني أصلًا للمحتوى القصير العمودي. يشرح هذا المقال كيف يعمل لمنشئي المحتوى على TikTok وYouTube Shorts، وكيف يقارن بكل من Kling v3 وSora 2 وPixVerse v5.6، وكيف تستخدمه على PicassoIA لتوليد فيديو بنسبة 9:16 مع صوت مدمج خلال دقائق قليلة.

Veo 3.1 لفيديوهات TikTok وYouTube Shorts: ذكاء اصطناعي لفيديو عمودي يحقق نتائج فعلية
Cristian Da Conceicao
مؤسس Picasso IA

يلتهم الفيديو القصير الإنترنت، وإطار 9:16 أصبح ساحة المعركة الجديدة على الانتباه. وصل Veo 3.1 من Google كردّ مباشر على واحدة من أكثر المشكلات إلحاحًا التي يواجهها صنّاع المحتوى: توليد فيديو عمودي يبدو جيدًا فعلًا على TikTok وYouTube Shorts، دون قضاء ساعات في استوديو المونتاج أو توظيف فريق إنتاج. إذا كنت تنتظر أن يتوقف توليد الفيديو بالذكاء الاصطناعي عن أن يبدو كعرض تقني، وأن يبدأ العمل كأداة إنتاج حقيقية، فهذا هو النموذج الذي يستحق اهتمامك الآن.

ماذا يفعل Veo 3.1 فعلًا

Veo 3.1 هو أحدث إصدار من نموذج توليد الفيديو الرئيسي لدى Google DeepMind. يأخذ الأوامر النصية باللغة الطبيعية ويحوّلها إلى مقاطع فيديو عالية الجودة. لكن هذا الوصف يقلل من قيمته. القصة الحقيقية في ما يميّزه عن كل نموذج تحويل نص إلى فيديو آخر في السوق حاليًا: دعم الصيغة العمودية أصلًا، وتوليد صوت متزامن مدمج، وحركة دقيقة من ناحية الفيزياء تبقى متماسكة عبر القطعات. هذه ليست ادعاءات تسويقية، بل خصائص تقنية محددة تجعل Veo 3.1 قابلًا للاستخدام في المحتوى الاجتماعي القصير على نطاق واسع.

صانع محتوى يصوّر فيديو عموديًا في ساحة حضرية مشمسة في الهواء الطلق

كيف يتعامل مع صيغة 9:16

بُنيت معظم نماذج تحويل النص إلى فيديو حول الإطار السينمائي 16:9. وكان الفيديو العمودي فكرة لاحقة، يُنجز غالبًا بقص مخرجات عريضة مع خسارة تفاصيل مهمة عند الحواف. تم تدريب Veo 3.1 مع وضع التكوينات العمودية في الاعتبار. عندما تحدد مخرجات بنسبة 9:16، يقوم النموذج فعلًا بتكوين المشهد لتلك النسبة، فيضع الأشخاص في المساحة العمودية بدل ضغط مشهد أفقي داخل إطار طويل وضيّق.

هذا الفرق مهم جدًا لـTikTok وYouTube Shorts. وجه متحدث يملأ الإطار العمودي، أو عرض منتج يشغل فيه المنتج العمود العمودي كاملًا، أو مقطع رقص بتأطير من الرأس إلى القدمين، كلها تكوينات يفهمها Veo 3.1 بشكل أصلي. وتبدو المقاطع الناتجة مصنوعة للهاتف، لا مكيّفة له.

نصيحة احترافية: عند كتابة الأوامر النصية للصيغ العمودية، حدّد "إطار عمودي، الشخص في المنتصف، لقطة من الرأس إلى القدمين" أو "صورة مقرّبة بتكوين عمودي" للحصول على مخرجات مُحسّنة للهاتف بشكل ثابت منذ التوليد الأول.

الصوت مدمج من البداية

قدّم Veo 3 توليد الصوت المتزامن، ويطوّره Veo 3.1 بشكل ملحوظ. يمكن للنموذج توليد مؤثرات صوتية محيطية، وخلفيات موسيقية، وحتى حوارات تتزامن مع حركة الشفاه على الشاشة. بالنسبة إلى صنّاع TikTok الذين يريدون نشر المحتوى بسرعة، يلغي هذا واحدة من أكثر خطوات ما بعد الإنتاج استهلاكًا للوقت: البحث عن الصوت ومزامنته.

يعمل توليد الصوت بأفضل شكل مع الأصوات المحيطية، ونغمات موسيقية بسيطة، والصوت البيئي. أما الطلبات الموسيقية المعقدة والمحددة للغاية فستظل تحتاج إلى أداة صوت مخصصة. لكن بالنسبة إلى المقاطع الاجتماعية القصيرة التي تحتاج فقط إلى صوت يبعث الحياة بدل الصمت، فإن الصوت المدمج في Veo 3.1 قابل للاستخدام فعلًا دون أي إعداد إضافي.

Veo 3.1 مقابل أدوات الفيديو الأخرى بالذكاء الاصطناعي

لديك خيارات متعددة. ازدحم مجال تحويل النص إلى فيديو بسرعة كبيرة، واختيار النموذج المناسب للمحتوى الاجتماعي القصير يعتمد بشكل كبير على ما تحتاجه فعلًا من كل توليد.

صورة مقرّبة ليدين تمسكان هاتفًا ذكيًا يعرض واجهة تحرير فيديو عمودي

النموذجالصيغة العموديةالصوتجودة الحركةالسرعة
Veo 3.19:16 أصليمدمجممتازةمتوسطة
Veo 3.1 Fast9:16 أصليمدمججيدةسريعة جدًا
Kling v3قص/تغيير حجملاممتازةمتوسطة
Sora 2جزئيةلاممتازةبطيئة
PixVerse v5.6جيدةلاجيدةسريعة

مقارنة بـKling v3

يُعد Kling v3 من Kwai على الأرجح أقوى منافس من ناحية جودة الحركة الخام. محاكاة الفيزياء فيه، خاصة لحركة الإنسان وديناميكيات الأقمشة، ممتازة. أما نقطة ضعفه في المحتوى الاجتماعي القصير فهي مسألة الصيغة العمودية: مخرجات Kling v3 أفقية افتراضيًا، وخط أنابيب القص إلى الصيغة العمودية يُدخل مشكلات واضحة في التأطير. بالنسبة إلى المنشئين الذين يعتمد محتواهم اعتمادًا كليًا على إطار 9:16، فهذه نقطة احتكاك كبيرة في سير العمل. يفوز Veo 3.1 في هذه المقارنة بوضوح بفضل مخرجاته الأصلية للصيغة.

مقارنة بـSora 2

ينتج Sora 2 من أكثر مقاطع الفيديو المتماسكة سينمائيًا المتاحة حاليًا. يتفوق في تكوينات المشاهد المعقدة، والمقاطع الممتدة، والحفاظ على الاتساق البصري عبر الفيديو. لكن المفاضلة تكمن في السرعة والدعم العمودي. Sora 2 أبطأ بشكل ملحوظ في التوليد، وقد صُمم حول مخرجات سينمائية أفقية. بالنسبة إلى المنشئين الذين ينشرون يوميًا على TikTok أو YouTube Shorts، تهم سرعة التوليد بقدر أهمية الجودة. يفوز Veo 3.1 في سرعة التكرار مع الحفاظ على جودة تنافسية لحالات استخدام وسائل التواصل الاجتماعي.

مقارنة بـPixVerse v5.6

يحتل PixVerse v5.6 موقعًا مثيرًا للاهتمام: فهو سريع، ويتعامل مع الصيغ العمودية بشكل جيد نسبيًا، وينتج مخرجات ذات طابع أسلوبي تحقق أداءً جماليًا جيدًا على وسائل التواصل الاجتماعي. كما أنه أسهل في الوصول للمبتدئين بفضل متطلبات الأوامر النصية الأبسط. يملك Veo 3.1 سقفًا أعلى في الواقعية وتماسك الحركة، لكن PixVerse v5.6 يستحق المعرفة بالنسبة إلى المنشئين الذين يحتاجون إلى مخرجات بكميات كبيرة وبسرعة أعلى لكل مقطع.

منشئو TikTok يستخدمونه بطريقة مختلفة

حالات الاستخدام الأكثر إثارة لاهتمامي لـVeo 3.1 على TikTok ليست الواضحة. نعم، فالفيديو التكميلي (B-roll) المولَّد بالذكاء الاصطناعي مفيد. لكن المنشئين الذين يحققون انتشارًا حقيقيًا يستخدمون النموذج بطرق أكثر تحديدًا واستراتيجية تتجاوز توليد المقاطع البسيط.

شابة آسيوية مستلقية على السرير تتصفح محتوى فيديو عموديًا على هاتفها الذكي

فيديوهات المنتجات بدون كاميرا

ينشئ صنّاع المحتوى في التجارة الإلكترونية على TikTok Shop فيديوهات عرض المنتجات بالكامل عبر Veo 3.1. أمر مثل "لقطة مقرّبة عمودية لمحفظة جلدية بنية على سطح من الرخام، يداد تلتقطانها وتعرضان الداخل، إضاءة استوديو دافئة، 9:16" ينتج عرضًا للمنتج قابلًا للاستخدام، كان سيتطلب قبل عامين فقط إعداد كاميرا كاملة وجلسة تصوير مخصصة. المخرجات ليست مثالية، لكنها بسرعات التمرير على TikTok وأحجام شاشات الهواتف مقنعة بما يكفي لدفع النقرات.

بالنسبة إلى المنشئين الذين يديرون عشرات المنتجات، يمثل هذا تحولًا جوهريًا في سير العمل. فبدلًا من جدولة جلسات التصوير، يجمعون الأوامر النصية في دفعات ويراجعون المخرجات. ينتقل عنق الزجاجة من الإنتاج إلى كتابة النصوص الإعلانية.

محتوى السفر دون ميزانية

كان محتوى السفر على TikTok يتطلب تقليديًا التواجد فعليًا في المكان الذي تصوّره. يغيّر Veo 3.1 هذه المعادلة، لا بإحلال المحتوى الحقيقي عن السفر (فالمحتوى الأصيل ما زال يحقق أداءً أفضل لدى الجمهور)، بل بسدّ الفجوات. يمكن لمنشئ محتوى السفر أن يستخدم Veo 3.1 لتوليد فيديو عمودي أجوائي للوجهات بين الرحلات الحقيقية، أو لإنشاء مقدمات سينمائية، أو لإنتاج محتوى توضيحي لنصائح السفر وأدلة الوجهات دون الوقوف أمام كاميرا في ذلك اليوم.

مهم: تشترط إرشادات مجتمع TikTok الإفصاح عندما يكون المحتوى مولّدًا بالذكاء الاصطناعي. استخدام علامة الذكاء الاصطناعي المدمجة في المنصة، أو تضمين إفصاح واضح في التعليقات التوضيحية، يحمي حسابك ويبني ثقة الجمهور على المدى الطويل.

YouTube Shorts: الأرقام لا تكذب

تجاوزت مشاهدات YouTube Shorts 70 مليار مشاهدة يوميًا في 2024. تكافئ خوارزمية المنصة الاتساق ومعدل الإكمال فوق معظم العوامل الأخرى. يعالج Veo 3.1 كلا العاملين بشكل مباشر، ولهذا يصبح أداة ذات قيمة في سير عمل YouTube Shorts الجاد.

شابة من أصول أفريقية تعمل على مكتب منزلي مع حامل هاتف بجانب حاسوبها المحمول

وقت المشاهدة أهم من عدد المشاهدات

تعطي خوارزمية Shorts الأولوية لمدة مشاهدة المستخدمين لمقطعك مقارنةً بطوله الكامل. فالفيديو العمودي المؤطر بإتقان مع حركة جذابة في أول ثانيتين يحقق أداءً أفضل بكثير من مقطع مكوّن بشكل سيئ ولكن فيه خطاف جيد في الثانية الخامسة. تبدأ التكوينات العمودية الأصلية في Veo 3.1 بالتأطير الصحيح من الإطار الأول. لا يوجد شريط أسود محرج، ولا شخص مقطوع، ولا مساحات فارغة في الزوايا تشير إلى أن المقطع صُنع لصيغة مختلفة.

يُترجم هذا مباشرةً إلى نسبة مشاهدة متوسطة أفضل، والتي بدورها تُترجم إلى توزيع خوارزمي أكبر على رف Shorts وصفحة الاستقبال.

تكرار النشر مع الذكاء الاصطناعي

منشئو YouTube Shorts الذين ينشرون يوميًا يتفوقون باستمرار على من ينشرون بشكل متقطع، مع ثبات بقية الظروف. المشكلة أن النشر اليومي بجودة التصوير بالكاميرا غير مستدام جسديًا للمنشئين المستقلين. يزيل Veo 3.1 عنق زجاجة الإنتاج من المعادلة. يمكن لمنشئ المحتوى أن يجمّع 7 إلى 10 نصوص لـShorts في فترة بعد الظهر، ويولّد مقاطع الفيديو المقابلة، ويجدول أسبوعًا كاملًا من المحتوى في جلسة عمل واحدة.

سير العمل العملي: اكتب النصوص يوم الاثنين، وولّد الفيديو يوم الثلاثاء، وراجع وأضف التعليقات يوم الأربعاء، وجدوِل النشر من الخميس حتى الأربعاء التالي. هذا إيقاع إنتاج كان مستحيلًا فعلًا دون توليد الذكاء الاصطناعي قبل عامين.

كيف تستخدم Veo 3.1 على PicassoIA

يتوفر Veo 3.1 مباشرةً عبر PicassoIA، ما يعني أنه يمكنك توليد فيديو عمودي للمحتوى القصير دون إدارة وصول API، أو الدفع بشكل منفصل عبر Google، أو إعداد أي شيء تقني. تعمل العملية كاملة داخل المتصفح.

امرأة بنمش وشعر أحمر داكن تشاهد محتوى فيديو عموديًا على هاتفها الذكي في مقهى

الخطوة 1: اكتب أمرًا نصيًا عموديًا

العامل الأكبر تأثيرًا على جودة مخرجات Veo 3.1 هو طريقة كتابة الأمر النصي. بالنسبة إلى TikTok وYouTube Shorts، يجب أن يتضمن كل أمر نصي هذه العناصر:

  • نسبة العرض إلى الارتفاع صراحةً: "إطار عمودي، تكوين 9:16"
  • موضع الشخص: "الشخص في المنتصف ومؤطر من الرأس حتى الخصر" أو "صورة مقرّبة تملأ الإطار العمودي"
  • حركة الكاميرا: "اقتراب بطيء من الأسفل" أو "لقطة ثابتة ومقفلة" أو "كاميرا محمولة بحركة خفيفة"
  • اتجاه الإضاءة: "ضوء طبيعي ناعم من النافذة من اليسار" أو "إضاءة خلفية دافئة في الساعة الذهبية"
  • إشارة المدة: "مقطع مدته 6 ثوانٍ" أو "مشهد مدته 15 ثانية"

مثال على أمر نصي: "شابة في مطبخ مشرق، إطار عمودي 9:16، تقلّب القهوة بملعقة وتبتسم بهدوء للكاميرا، لقطة مقرّبة من الصدر إلى الأعلى، ضوء نافذة طبيعي من اليسار، خلفية ضبابية ناعمة، مقطع مدته 8 ثوانٍ، واقعي كالصور الفوتوغرافية"

الخطوة 2: اضبط المعاملات الصحيحة

صورة مقرّبة ليدي امرأة تكتبان على حاسوب محمول مع واجهة توليد فيديو عمودي على الشاشة

عند استخدام Veo 3.1 عبر PicassoIA، لهذه الإعدادات أكبر تأثير على جودة المخرجات:

  • المدة: بالنسبة إلى TikTok، يُعد من 6 إلى 15 ثانية لكل مقطع النطاق الأمثل. وتميل فيديوهات YouTube Shorts التي تتراوح بين 30 و60 ثانية إلى الأداء بشكل أفضل في رف الاكتشاف الخاص بالفيديوهات الطويلة.
  • الدقة: ولّد دائمًا بأعلى دقة متاحة. يقلل الضغط أثناء الرفع الجودة بالفعل، لذا فالبدء بدقة أعلى يحافظ على تفاصيل أكثر.
  • الصوت: حدّد ما إذا كنت تريد صوتًا محيطيًا أو موسيقى أو صمتًا. إذا كنت ستضيف تعليقًا صوتيًا خاصًا بك لاحقًا، فاطلب "بدون صوت" للحفاظ على المخرجات نظيفة للتركيب.

بالنسبة إلى المنشئين الذين يحتاجون إلى تكرارات أسرع بتكلفة أقل، يتوفر Veo 3.1 Fast على المنصة نفسها وينتج مخرجات في جزء من وقت التوليد. يُعد التنازل في الجودة ضئيلًا لحالات استخدام وسائل التواصل الاجتماعي، حيث يُضغط المخرج النهائي ويُشاهد على شاشة الهاتف بمسافة التمرير المعتادة.

الخطوة 3: انشر وكرّر

لن تكون الدفعة الأولى من Shorts المولَّدة بالذكاء الاصطناعي هي أفضل ما لديك. يكمن منحنى التعلم مع Veo 3.1 في فهم أي بنى للأوامر النصية تنتج أي نتائج بصرية بشكل ثابت. احتفظ بمستند عمل يضم أنجح أوامرك النصية والمخرجات التي أنتجتها. بعد أسبوعين إلى ثلاثة أسابيع من النشر المنتظم، ستملك مكتبة أوامر نصية شخصية تنتج باستمرار الجمالية التي يتميز بها محتواك دون البدء من الصفر في كل مرة.

المنشئون الذين يحققون أفضل النتائج ليسوا من يولّدون فيديو مثاليًا واحدًا. إنهم يولّدون 50 فيديو، ويدرسون ما لاقى صدى لدى جمهورهم، ويبنون نظامًا قابلًا للتكرار حول هذه النتائج.

ما الذي لا يستطيع Veo 3.1 فعله بعد

التقييم الصادق مهم هنا. Veo 3.1 هو أفضل نموذج متاح حاليًا لتوليد الفيديو العمودي بالذكاء الاصطناعي، ومع ذلك لديه قيود حقيقية تستحق الفهم قبل أن تبني استراتيجية المحتوى كاملة حوله.

شاب يسجّل فيديو بأسلوب السيلفي بهاتفه الذكي على شرفة سطح منزل في الساعة الذهبية

مشكلة الاتساق

إذا أردت توليد سلسلة فيديوهات يظهر فيها الشخص نفسه عبر عدة مقاطع، فلن يحافظ Veo 3.1 على مظهر تلك الشخصية دون جهد كبير في هندسة الأوامر. يولّد النموذج كل مقطع من الصفر. الشخصية في المقطع الأول بشعر داكن وقميص أزرق ستبدو مختلفة بوضوح في المقطع السادس. هذا هو القيد الأساسي في بنية تحويل النص إلى فيديو الحالية: إنها توليدية، لا مستمرة.

بالنسبة إلى المنشئين الذين يبنون سلسلة قائمة على شخصية على TikTok أو YouTube Shorts، فهذا يعني أنك إما تتجاوز القيد عبر صيغ محتوى تجريدية، ولقطات القطع (cutaway)، وهياكل قائمة على التعليق الصوتي، أو تكمّل Veo 3.1 بأداة لثبات الشخصيات. نماذج مثل Kling V3 Motion Control أو DreamActor-M2.0 على PicassoIA يمكن أن تساعد في سد هذه الفجوة عبر ربط الحركة بصورة مرجعية محددة.

حيث تظل اللمسة البشرية الأفضل

هناك صيغ محتوى يتفوق فيها كاميرا حقيقية وشخص حقيقي على توليد الذكاء الاصطناعي في المستقبل المنظور:

  • محتوى ردود الفعل: لا يمكن تكرار ردود الفعل البشرية الأصيلة على أحداث حقيقية بشكل مقنع
  • التعليق والمقالات الرأيّة: تُبنى الثقة بالوجوه التي يتعرف عليها المشاهدون مع الوقت
  • محتوى الاتجاهات اللحظية: توليد الذكاء الاصطناعي ليس سريعًا بما يكفي للحاق بدورة اتجاه مدتها 24 ساعة
  • بناء العلامة الشخصية: تتطلب علاقات صنّاع المحتوى طويلة الأمد حضورًا بشريًا أصيلًا

Veo 3.1 أداة لتسريع الإنتاج، وليس بديلًا عن صانع المحتوى. المنشئون الذين ينجحون به يستخدمونه لفعل المزيد من الأشياء التي يُجيدونها أصلًا، لا لإزالة أنفسهم من المعادلة كليًا.

أنشئ أول فيديو عمودي لك بالذكاء الاصطناعي اليوم

استوديو محتوى مشرق وبسيط لصانع محتوى يضم ثلاثة هواتف ذكية مثبتة على حوامل ثلاثية عمودية

لم يكن حاجز إنتاج الفيديو القصير أقل منه الآن. يمنحك Veo 3.1 على PicassoIA وصولًا إلى أكثر نماذج الفيديو العمودي بالذكاء الاصطناعي قدرةً المتاحة، مباشرةً في المتصفح، دون أي إعداد تقني. لا تحتاج إلى بيانات اعتماد API، ولا حساب حوسبة سحابية، ولا خلفية في التطوير.

ابدأ بأمر نصي واحد. اكتب مشهدًا عموديًا بسيطًا، وولّده، وشاهده، وحدّد شيئًا واحدًا تودّ تغييره. ثم غيّره وولّد مرة أخرى. حلقة التكرار هذه هي ما يبني لديك الحدس لإنشاء محتوى فيديو قصير بالذكاء الاصطناعي قوي باستمرار. يكافئ النموذج التحديد في كتابة الأوامر، وكل توليد يعلّمك شيئًا عما يستجيب له النموذج.

صورة مقرّبة لشابة تصوّر نفسها بشكل عمودي بضوء طبيعي دافئ في الهواء الطلق

إلى جانب Veo 3.1، يوفر PicassoIA أيضًا Kling v3، وLTX-2.3-Pro، وHailuo 2.3، وGen-4.5 by Runway للتجربة دون تبديل المنصة. إذا لم ينتج Veo 3.1 بالضبط ما تحتاجه للقطة من نوع معيّن، فالأداة المناسبة لتلك المهمة على بعد بضع نقرات. المنظومة كاملة متاحة من المكان نفسه، ما يعني تكرارًا أسرع ووقتًا أقل في إدارة الحسابات عبر خدمات متعددة.

تكافئ منظومة الفيديو القصير المنشئين الذين ينشرون بشكل جيد، وبثبات، وبما يناسب الصيغة أصلًا. Veo 3.1 يتعامل مع الصيغة أصلًا. والباقي يعود إليك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة