Vidu 2.0: نموذج توليد الفيديو بالذكاء الاصطناعي الجديد وكيفية استخدامه

Vidu 2.0 من أكثر نماذج توليد الفيديو بالذكاء الاصطناعي قدرةً المتاحة اليوم، إذ يقدّم مخرجات بدقة 1080p، وثباتًا للشخصيات قائمًا على الصور المرجعية، وتحكمًا دقيقًا في حركة الكاميرا. يشرح هذا المقال كل ميزة فيه، ويقارنه بأبرز البدائل مثل Kling و Wan و Sora، ويوضح لك بالتفصيل كيفية استخدام نماذج Vidu على PicassoIA لإنتاج نتائج سينمائية من أمر نصي واحد.

Vidu 2.0: نموذج توليد الفيديو بالذكاء الاصطناعي الجديد وكيفية استخدامه
Cristian Da Conceicao
مؤسس Picasso IA

إذا كتبت جملة وحصلت على فيديو بدقة 1080p يبدو وكأنه صُوّر بكاميرا سينمائية، فأنت تعمل مع Vidu 2.0. أطلقته شركة Shengshu Technology في 2024، ودفع جودة تحويل النص إلى فيديو إلى مستوى لم تكن معظم الأدوات تتجاوز مجرد الوعد به. يغطي هذا المقال بالتفصيل ما يفعله Vidu 2.0، وكيف يتعامل مع أصعب جوانب توليد الفيديو، وأين يقف أمام المنافسة الحالية، وكيف تبدأ باستخدام نماذج Vidu الآن عبر PicassoIA.

ماذا يفعل Vidu 2.0 فعلًا

Vidu 2.0 نموذج لتوليد الفيديو قائم على الانتشار (diffusion)، مدرّب على إنتاج مقاطع عالية الدقة من أوامر نصية أو صور مرجعية. المنتج الأساسي بسيط: تصف مشهدًا، فيعرضه النموذج على شكل فيديو. ما يميّز Vidu 2.0 عن الأساليب الأقدم هو طريقة معالجته للحركة والثبات وسلوك الكاميرا في الوقت نفسه.

بنته شركة Shengshu Technology بالتعاون مع باحثين من جامعة Tsinghua، ما يمنحه دعمًا أكاديميًا قويًا إلى جانب تطبيقه التجاري. ويظهر ذلك في جودة المخرجات، خاصة في طريقة تعامله مع الحركة القائمة على الفيزياء والعلاقات المكانية بين الأشياء في المشهد.

شخص يكتب أمرًا نصيًا لفيديو على لوحة مفاتيح

من النص إلى 1080p في ثوانٍ

كانت معظم نماذج تحويل النص إلى فيديو الأولى لا تتجاوز مخرجات 512p ضبابية، بحواف مرتعشة وحركة تبدو وكأنها مُستكملة بين الإطارات في حلم محموم. ينتج Vidu 2.0 فيديوهات بدقة 1080p مع جودة حركة سينمائية، ويصل إلى مقاطع تصل مدتها إلى 16 ثانية في مرور واحد. يتعامل النموذج مع أوصاف المشاهد المعقدة دون العيوب الشائعة التي أثقلت كاهل أسلافه: لا خلفيات تتمايل، ولا وجوه تذوب، ولا أشياء تخترق بعضها أثناء المقطع.

السرعة أيضًا لافتة. يعمل Vidu 2.0 بسرعة كافية لتكون عمليًا في سير عمل الإنتاج، لا كعرض تجريبي فقط. يمكنك تكرار الأوامر النصية، وتجربة بدائل، ومراجعة النتائج دون أن تضيع نصف يوم في انتظار التصيير. وهذا مهم لأن التكرار هو ما يصنع الفيديو الجيد بالذكاء الاصطناعي. فالناتج الأول نادرًا ما يكون النهائي.

وضع المرجع للشخصيات المتسقة

من أصعب المشكلات التي لم تُحل بعد في توليد الفيديو بالذكاء الاصطناعي الحفاظ على ثبات الأشخاص عبر عدة مقاطع. إذا ولّدت خمسة مشاهد مختلفة بالشخصية نفسها، فإن معظم النماذج تتعامل مع كل مشهد كتوليد جديد. تبدو الشخصية مختلفة قليلًا في كل مقطع: شكل فك مختلف، ولون عيون مختلف، وملمس شعر مختلف. ويصبح تجميع هذه المقاطع في سرد متماسك شبه مستحيل.

قدّم Vidu 2.0 وضع الصورة المرجعية الذي يثبّت النموذج على شخص محدد من صورة مرفوعة. والنتيجة ثبات الشخصية عبر عدة توليدات. وهذه ميزة عملية فعلًا لمن يبني سلسلة أو فيلمًا قصيرًا أو محتوى لعلامة تجارية تهم فيها الهوية البصرية. ارفع صورة شخصية واضحة، وصف المشهد، وسيضع النموذج هذا الشخص تحديدًا في الفيديو الذي تولّده بدلًا من ابتكار وجه جديد من الصفر.

Vidu 2.0 مقابل المنافسين

منظر علوي لعدة واجهات لتوليد الفيديو بالذكاء الاصطناعي على أجهزة محمولة

شهد مجال تحويل النص إلى فيديو في 2024 و2025 ازدحامًا سريعًا. أطلقت Sora 2 من OpenAI، وVeo 3 من Google، وKling v2.1 من Kuaishou، وSeedance 2.0 من ByteDance خلال أشهر متقاربة. ولكل منها نقطة قوة مختلفة، واختيار النموذج المناسب لمهمة بعينها أهم من اختيار النموذج "الأفضل" بشكل مجرد.

كيف يتموضع

النموذجالدقةثبات الشخصياتالتحكم في الكاميراالصوت الأصلي
Vidu 2.01080pنعم، وضع المرجعنعملا
Sora 21080pمحدودنعمنعم
Veo 31080pلانعمنعم
Kling v2.11080pمحدودنعملا
Seedance 2.01080pلانعمنعم
Hailuo 021080pلامحدودلا

يتفوق Vidu 2.0 بوضوح في ثبات الشخصيات. إذا كان سير عملك يتطلب ظهور الشخص نفسه أو الشيء نفسه بثبات عبر عدة مقاطع، فلا يوجد نموذج آخر في هذه الفئة يتعامل مع ذلك بهذا القدر من الاتساق. أما نقطة ضعف Vidu فهي الصوت الأصلي. نماذج مثل Veo 3 وSeedance 2.0 تولّد أصواتًا محيطية متزامنة داخل الفيديو. لا يتضمن Vidu الصوت في مخرجاته، ما يفرض خطوة إضافية في مرحلة ما بعد الإنتاج إذا كان الصوت مهمًا في المنتج النهائي.

امرأة تراجع مخرجات فيديو بالذكاء الاصطناعي على شاشة مثبتة على الحائط

أين يقصّر Vidu 2.0

غياب توليد الصوت هو القيد الرئيسي. في محتوى وسائل التواصل الاجتماعي الذي يكون فيه الصوت المحيطي مهمًا، ستحتاج إلى إضافة الصوت لاحقًا، أو استخدام نموذج مثل Hailuo 02 أو Wan 2.7 T2V عندما يكون الصوت أولوية في مشروع بعينه.

حساسية الأوامر النصية نقطة أخرى تستحق الذكر. يستجيب Vidu 2.0 بقوة للأوامر النصية المُحكمة، لكنه قد ينتج نتائج غير متسقة إذا كان الوصف غامضًا أو يحتوي على تعليمات مكانية متعارضة. وهذا ليس حكرًا على Vidu، لكنه أوضح في Vidu منه لدى بعض المنافسين. النموذج يكافئ التحديد الدقيق، وهو أمر يتعلمه معظم المستخدمين عبر التكرار.

💡 نصيحة: إذا بدت مخرجاتك غير صحيحة، فالمشكلة غالبًا في الأمر النصي. صِف زاوية الكاميرا والإضاءة وفعل الشخص بوضوح قبل تعديل أي إعداد آخر.

خمس ميزات تستحق المعرفة

تحكم في الكاميرا يعمل فعلًا

يدعم Vidu 2.0 تعليمات حركة الكاميرا الصريحة. يمكنك تحديد حركات الدولي (dolly)، واتجاهات البانوراما، وسلوك التكبير، واللقطات الدائرية باستخدام اللغة الطبيعية. هذا ليس ضمانًا لتنفيذ مثالي، لكنه موثوق بما يكفي للاستخدام في تخطيط الإنتاج. وصف "دفعة بطيئة للداخل نحو الشخص من مسافة متوسطة" ينتج باستمرار حركة كاميرا أمامية واضحة، وهذا أكثر مما تستطيع كثير من النماذج تقديمه بثبات.

يفيد هذا التحكم خصوصًا في أعمال التصوير التمهيدي (pre-visualization)، حيث تحتاج إلى اختبار توزيع الممثلين وزوايا الكاميرا قبل الالتزام بتصوير فعلي. توليد خمس حركات كاميرا مختلفة للمشهد نفسه يكلّفك خمسة مدخلات نصية ودقائق قليلة. أما فعل ذلك بكاميرا حقيقية فيكلّف يوم تصوير كامل.

مخرج محترف مع كاميرا سينمائية في الساعة الذهبية

مشاهد متعددة الأشخاص

تعاني معظم نماذج تحويل النص إلى فيديو عندما تضع شخصين أو أكثر في الإطار نفسه. تتداخل الشخصيات عند الحواف، وتنحرف الأحجام بين الإطارات، وتبدو التفاعلات مستحيلة فيزيائيًا بحلول الثانية الثالثة من المقطع. يتعامل Vidu 2.0 مع الأوامر متعددة الأشخاص بشكل أفضل من معظم النماذج، فيحافظ على الفصل بين الأشخاص والعلاقات المكانية المعقولة بينهم طوال مدة المقطع. ليس مثاليًا، لكنه أكثر موثوقية بكثير مما كان ممكنًا قبل اثني عشر شهرًا فقط.

المفاضلة بين السرعة والجودة

يعمل Vidu على عدة مستويات جودة. تضحّي أوضاع التوليد الأسرع ببعض سلاسة الحركة مقابل السرعة، وتظهر هذه التضحية أكثر في حركة الخلفية المعقدة وديناميكية الشعر أو القماش. تنتج أوضاع الجودة العالية مخرجات أنظف لكنها تستغرق وقتًا أطول في التصيير. عمليًا، يعمل الوضع السريع جيدًا للمسودات والتكرار، بينما يكون وضع الجودة الكاملة ما تريده قبل التصدير النهائي. وأكثر الطرق كفاءة هي التعامل معهما كأداتين منفصلتين لمراحل مختلفة من سير العمل.

محترف مبدع في مساحة عمل مشتركة يراجع لقطات الفيديو

دقة تصمد عند مستوى البكسل

تبدو مخرجات 1080p من نموذج تحويل النص إلى فيديو مثيرة للإعجاب، حتى تكبّر الصورة وترى ارتعاش الملمس أو ترددًا في الحواف أو بشرة تبدو مرسومة بشكل غير متسق من إطار إلى آخر. يصمد Vidu 2.0 عند مستوى البكسل أفضل من معظم نماذج فئته. تبقى التفاصيل الدقيقة، مثل ملمس القماش وحركة الشعر وتفاصيل العمارة في الخلفية، مستقرة بشكل معقول عبر الإطارات بدلًا من أن تتذبذب بين نسخ متشابهة قليلًا من نفسها.

نظام الصورة المرجعية عمليًا

ارفع صورة لشخص أو منتج أو شيء، وسيستخدمها Vidu 2.0 كمرساة بصرية للتوليد. يعالج النموذج المرجع وقت الأمر النصي ويدمج مظهر الموضوع في المخرجات. وهذا يفتح سير عمل لم يكن ممكنًا مع الأوامر النصية وحدها: اختيار شخص محدد للظهور في مشهد، والحفاظ على مظهر المنتج متسقًا مع الهوية البصرية للعلامة عبر عدة مقاطع، وبناء سرد متعدد المشاهد تظهر فيه الشخصية نفسها مرارًا.

💡 نصيحة: استخدم صورًا مرجعية واضحة ومضاءة جيدًا بخلفية محايدة أو بسيطة. كلما كان المرجع أنظف، كان النموذج أقدر على عزل الخصائص البصرية للموضوع وإعادة إنتاجها.

كيفية استخدام Vidu على PicassoIA

يقدّم PicassoIA نموذجين من Vidu: Q3 Turbo وQ3 Pro. كلاهما من خط تطوير Vidu، ويمثلان أسهل طريقة لتشغيل توليد الفيديو القائم على Vidu دون إعداد أي بنية تحتية محلية أو إدارة بيانات اعتماد API بشكل مباشر.

امرأة تعمل في استوديو منزلي وتراجع محتوى فيديو

اختر النموذج المناسب

Q3 Turbo هو الخيار الأسرع. يولّد فيديو 1080p مع الصوت، ومحسّن للسرعة، ما يجعله الخيار الصحيح للتكرار والمسودات ومحتوى وسائل التواصل حين تريد نتائج سريعة. يتعامل مع معظم الأوامر النصية بشكل جيد، ويُنتج حركة نظيفة عبر كامل مدة المقطع. ميزة السرعة كبيرة عندما تختبر عدة بدائل للأمر النصي على المفهوم نفسه.

يعطي Q3 Pro الأولوية للجودة على السرعة. تحتوي المخرجات على تفاصيل بصرية أكثر، وتكون الحركة أنعم عبر الانتقالات المعقدة، وتنتج الأوصاف المشهدية المفصلة توزيعات مكانية أدق. استخدم Q3 Pro عندما تولّد أصلًا نهائيًا لا مسودة عمل.

بالنسبة لمعظم سير العمل، النهج الصحيح هو التكرار باستخدام Q3 Turbo حتى تنتج بنية الأمر النصي نتائج متسقة، ثم تشغيل النسخة النهائية عبر Q3 Pro للمخرج النهائي.

اكتب أمرًا نصيًا يعمل

جودة مخرجاتك مرتبطة مباشرة بتحديد الأمر النصي. المدخلات الغامضة تنتج مخرجات عامة. يحتاج النموذج إلى معلومات واضحة عما يوجد في المشهد، وكيف هو مضاء، وكيف تتحرك الكاميرا، وماذا يفعل الشخص.

أمر نصي ضعيف: "a woman walking in a city"

أمر نصي قوي: "A woman in her 30s in a light beige coat walks at a calm pace through a tree-lined urban street in autumn, morning light filtering through orange leaves, handheld camera following slightly behind at eye level, warm color grade, slight film grain, 1080p"

يستغرق الأمر النصي الأقوى 15 ثانية إضافية للكتابة، لكنه ينتج مخرجات مختلفة جوهريًا. بتفكيكه، يحدد النص القوي مظهر الشخص، والملابس، وتفاصيل المكان، ووقت اليوم، وجودة الإضاءة، وموضع الكاميرا، ونوع الحركة، والصفات الأسلوبية. كل عنصر يضيّق تفسير النموذج باتجاه قصدك الفعلي.

لوحة تخطيط مسطحة للقصص المصورة ومساحة عمل تخطيط إبداعي

إعدادات المخرجات

يتيح كل من Q3 Turbo وQ3 Pro على PicassoIA ضبط مدة المقطع ونسبة العرض إلى الارتفاع. بالنسبة لمحتوى وسائل التواصل، يناسب التنسيق العمودي 9:16 منصات Reels وTikTok بشكل أفضل. أما للعمل السينمائي فالمعيار هو 16:9. ابدأ بمقاطع من 4 إلى 6 ثوانٍ للتحقق من أمرك النصي قبل الالتزام بتصيير أطول. مقطع مدته 4 ثوانٍ يثبت فكرة المشهد يستحق أكثر من مقطع مدته 16 ثانية يكشف عن مشكلة في الأمر النصي في منتصفه.

نصائح للأوامر النصية للحصول على نتائج حقيقية

ما يجب تضمينه

  • زاوية الكاميرا أولًا: ابدأ أمرك النصي بنوع اللقطة. "لقطة مقربة من زاوية منخفضة" أو "لقطة جوية واسعة" تحدد الإطار البصري كله قبل أن يعالج النموذج أي شيء آخر. وهي أعلى عنصر تأثيرًا في أمرك النصي.
  • تفاصيل الإضاءة: "ضوء صباح غائم" و"شمس منتصف النهار القاسية من الأعلى" تنتجان نتائج مختلفة بوضوح. لا تترك الإضاءة غامضة إذا كان لديك مظهر محدد في ذهنك.
  • حركة واحدة واضحة: "بانوراما بطيئة إلى اليمين" أكثر موثوقية من "حركة ديناميكية بطاقة كبيرة". كل تعليمة كاميرا تتنافس مع الأخرى، والواحدة هي التي تنتصر.
  • المزاج والملمس: "حبيبات فيلم خشنة على خامة Kodak" مقابل "مظهر رقمي نظيف" سيؤثر بشكل ملموس في أسلوب المخرجات حتى إذا بقي وصف المشهد كما هو.
  • تفاصيل الشخص: العمر والملابس والوضعية والتعبير كلها تضيّق تفسير النموذج. كلما كنت أكثر تحديدًا، قلّ ما يحتاج النموذج إلى اختراعه.

ما يجب تجنّبه

  • تعليمات مكانية متعارضة: "لقطة جوية مقربة تنظر إلى الأعلى من الأسفل" تخلق تناقضًا يحله النموذج بشكل سيئ. اختر واحدة.
  • أشخاص كثيرون: أكثر من 2 إلى 3 أشخاص متميزين في مقطع واحد يزيد احتمال عدم الاستقرار البصري بين الإطارات.
  • إشارات زمنية غامضة: "إحساس قديم الطراز" لا يعني شيئًا للنموذج. صِف الصفات البصرية مباشرة: "حبيبات فيلم 16mm، وتدرج لوني دافئ باهت، وومضة خفيفة".
  • كلمات أسلوبية دون أساس: كلمة "سينمائي" وحدها لا تفعل الكثير. زاوِج كل كلمة أسلوب مع وصف بصري ملموس: "سينمائي مع وهج عدسة anamorphic في ضوء الصباح".

💡 نصيحة: اختبر متغيرًا واحدًا في كل مرة. غيّر زاوية الكاميرا وأعد التوليد. ثم غيّر الإضاءة وأعد التوليد. هذا يجعل من الأسهل بكثير عزل ما يدفع فرق الجودة بين المخرجات.

ثلاث طرق لتشغيله في العمل

إعداد استوديو تصوير المنتجات لمقاطع الفيديو

مقاطع وسائل التواصل الاجتماعي

يُعد محتوى الفيديو القصير حالة الاستخدام الأكثر حجمًا في توليد الفيديو بالذكاء الاصطناعي حاليًا. وQ3 Turbo مناسب لذلك جدًا. يمكنك إنتاج 10 إلى 15 بديلًا لفكرة واحدة في الوقت الذي كان يستغرقه تصوير واحد. يعني نظام الصورة المرجعية أن علامتك التجارية أو منتجك أو شخصياتك المتكررة تبقى متسقة بصريًا عبر المنشورات، وهذا مهم عندما تبني جمهورًا يحتاج إلى التعرف على لغتك البصرية عبر عدة قطع من المحتوى.

بالنسبة للمقاطع التي يكون فيها الصوت المحيطي مهمًا لتجربة المشاهد، اقرن توليدات Vidu الخاصة بك بنموذج Pixverse v5 أو Hailuo 02 للحصول على بدائل مع صوت، ثم اختر أفضل مخرجات من الاثنين.

فيديوهات المنتجات

يجعل وضع الصورة المرجعية Vidu 2.0 عمليًا بشكل خاص للتجارة الإلكترونية وعرض المنتجات. ارفع صورة منتج واضحة، وصف المشهد من حوله، وولّد فيديو يضع المنتج في سياقه دون تصوير فعلي. زجاجة عطر على طاولة رخام في حمام مضيء بالشمس. زوج أحذية على شارع من حجارة مرصوفة مبلل بالمطر. ساعة على معصم أمام خلفية خريفية في الهواء الطلق. كل من هذه المشاهد قابل للتحقيق من صورة منتج واحدة وأمر نصي جيد الصياغة.

هذا ليس بديلًا كاملًا لفيديو المنتجات الاحترافي، لكنه يغطي معظم الحالات التي تحتاج فيها إلى محتوى حركي بسرعة، ولا يكون التصوير الفعلي عمليًا ضمن الجدول الزمني أو الميزانية.

مشاريع الأفلام القصيرة

بالنسبة للكتّاب والمخرجين الذين يستخدمون الذكاء الاصطناعي أداةً للتصوير التمهيدي أو رسم القصص المصورة، يغيّر ثبات الشخصيات في Vidu 2.0 ما هو ممكن. ولّد الشخصية نفسها في عدة مشاهد باستخدام وضع المرجع، واختبر توزيع الكاميرا والإضاءة قبل الالتزام بالإنتاج، وشارك المراجع البصرية مع المتعاونين دون الحاجة إلى إنشاء أي أصول مادية. وتتقلص المسافة بين النص المكتوب والمرجع البصري الذي يستطيع فريق كامل التفاعل معه بشكل كبير.

يكمّل نموذجا LTX 2 Pro وKling v3 Video على PicassoIA نموذج Vidu بشكل جيد في حالة الاستخدام هذه. استخدمهما للمشاهد التي تتطلب صفات أسلوبية مختلفة، أو عندما تريد مقارنة المخرجات من عدة نماذج قبل تحديد الاتجاه البصري للمشروع.

امرأة تشاهد فيديو مولّدًا بالذكاء الاصطناعي على جهاز لوحي في غرفة المعيشة

ابدأ إنتاج الفيديوهات على PicassoIA

يمثل Vidu 2.0 خطوة مهمة في جودة الفيديو بالذكاء الاصطناعي. تضعه مخرجاته بدقة 1080p، وثبات الشخصيات القائم على المراجع، والتحكم في الكاميرا، في الفئة العليا من النماذج المتاحة لعام 2024. غياب الصوت الأصلي قيد حقيقي، لكنه قابل للإدارة حسب سير عملك، وجودة المخرجات البصرية تعوّض عنه في معظم الحالات.

أسرع طريقة لترى ما يستطيع النموذج فعلًا القيام به هي أن تبدأ بأمر نصي محدد ومفصل بدلًا من أمر غامض، وأن تستخدم Q3 Turbo في تكراراتك الأولى، ثم تنتقل إلى Q3 Pro بمجرد أن تصل إلى بنية أمر نصي تنتج نتائج جيدة باستمرار.

يتيح لك PicassoIA الوصول إلى نموذجي Vidu إلى جانب أكثر من 100 خيار آخر لتحويل النص إلى فيديو، من بينها Wan 2.7 T2V، وSeedance 2.0، وVeo 3، وSora 2. تشغيل الأمر النصي نفسه عبر عدة نماذج ومقارنة النتائج مباشرة هو غالبًا أسرع طريقة لتعرف أي نموذج يناسب احتياجك الإبداعي فعلًا، والقيام بهذه المقارنة من منصة واحدة دون إدارة حسابات متعددة ميزة حقيقية عندما تعمل بسرعة الإنتاج.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة