Veo 3.1 Ingredients to Video: استخدم صور المرجع لتوليد فيديو بالذكاء الاصطناعي

تتيح لك ميزة Ingredients to Video في Veo 3.1 استخدام صور مرجعية لتثبيت كل تفصيل بصري في فيديو الذكاء الاصطناعي الذي تنشئه، من الإضاءة والألوان إلى هوية الشخص أو الشيء الظاهر فيه. يشرح هذا المقال بدقة كيف تعمل الميزة، وكيف تستخدمها خطوة بخطوة على PicassoIA، وكيف تكتب الأوامر النصية التي تحقق نتائج متسقة وعالية الجودة عبر عدة عمليات توليد.

Veo 3.1 Ingredients to Video: استخدم صور المرجع لتوليد فيديو بالذكاء الاصطناعي
Cristian Da Conceicao
مؤسس Picasso IA

إذا كان لديك مجلد من صور المرجع وفكرة واضحة عما يجب أن يحدث في المشهد، فقد صُممت ميزة Ingredients to Video في Veo 3.1 لهذه اللحظة تحديدًا. فبدلًا من الاعتماد كليًا على الأوصاف النصية لتحديد الأسلوب البصري ومظهر الشخص والمزاج، يمكنك تزويد النموذج بصورة مرجعية ودعه يتولى المهمة الصعبة عنك. والنتيجة فيديو يشبه فعلًا المشهد الذي تخيلته.

صور فوتوغرافية مرجعية مرتبة على لوحة فلين جاهزة لتوليد فيديو بالذكاء الاصطناعي

ماذا تفعل "Ingredients to Video" فعلًا

الاسم مقصود. فكلمة "Ingredients" تشير إلى أن مدخلاتك، بما فيها الصورة المرجعية وأمرك النصي، مواد خام يجمعها النموذج لإنتاج المخرجات. لا يكتفي Veo 3.1 بتحريك صورة ثابتة. بل يستخدم المعلومات البصرية داخل المرجع كنقطة ارتكاز في التكوين، ثم يولّد حركة تمتد بشكل طبيعي من تلك النقطة.

وهذا يختلف جوهريًا عن أدوات تحويل الصورة إلى فيديو التي تضيف حركة خفيفة إلى الصورة فقط. يُركّب Veo 3.1 إطارات جديدة بناءً على ما يستنتجه من الإضاءة والعمق والعلاقات المكانية وخصائص الشخص من المرجع. ويمكن للفيديو الناتج أن يُظهر حركة كاميرا وفعلًا لشخص وتفاصيل بيئية لم تكن موجودة في الصورة الأصلية.

دور صور المرجع

الصورة المرجعية في هذا السياق ليست مجرد إطار أول. إنها وثيقة مواصفات بصرية. يقرأ Veo 3.1 منها:

  • هوية الشخص: بنية الوجه، ونسب الجسم، ولون البشرة، وملمس الشعر
  • ظروف الإضاءة: الاتجاه، والحدّة، ودرجة حرارة اللون
  • نوع البيئة: داخلية، أو خارجية، أو طبيعية، أو حضرية
  • لوحة الألوان: الدرجات السائدة والدرجات المميزة التي تنتقل إلى الفيديو المولّد
  • عمق المجال الظاهر: طابع البوكيه، ومؤشرات مسافة التركيز

كلما احتوت صورتك المرجعية على معلومات أكثر، استطاع Veo 3.1 ضبط مخرجاته بدقة أكبر. فصورة شخصية واضحة وجيدة الإضاءة تمنح النموذج مادة أغنى للعمل من لقطة هاتف ذكي غير واضحة.

كيف يقرأ Veo 3.1 السياق البصري

درّب Google DeepMind نموذج Veo 3.1 على مجموعات بيانات فيديو ضخمة، ما يعني أن لديه معرفة مسبقة قوية بكيفية تطور المشاهد مع الزمن. فعندما تُظهر الصورة المرجعية امرأة واقفة قرب نافذة في ضوء بعد الظهر، يعرف النموذج أن هذه الإضاءة تنتج حركات معينة للظلال مع مرور الوقت، وانعكاسات ضوئية محددة على البشرة والقماش، وتحولات محددة في الألوان المحيطة. هذه المعرفة السياقية هي ما يميز Veo 3.1 عن أدوات التحريك الأبسط.

💡 نصيحة متقدمة: الصور المرجعية ذات الإضاءة الاتجاهية القوية تنتج أكثر مخرجات الفيديو تماسكًا بصريًا. أما الإضاءة المسطحة والملبدة بالغيوم فتمنح النموذج مادة أقل للعمل عليها.

رجل يمسك صورة فوتوغرافية مرجعية بينما تعرض لابتوب واجهة توليد فيديو بالذكاء الاصطناعي

لماذا تغيّر صور المرجع كل شيء

للأوامر النصية وحدها قيد أساسي: الكلمات تصف مفاهيم، لا تفاصيل دقيقة. يمكنك أن تكتب "امرأة بشعر بني دافئ في ضوء الساعة الذهبية" فيتخذ النموذج قرارًا تقديريًا بشأن شكل ذلك. أضف صورة مرجعية للشخص والمشهد والإضاءة بالضبط، وسيضيق ذلك التقدير بشكل كبير.

الثبات دون حيل في الأوامر

من أكثر ما يزعج في توليد فيديو الذكاء الاصطناعي عدم الثبات. فتوليد مقطع ثانٍ يظهر الشخصية نفسها والمكان نفسه والإضاءة نفسها كما في الأول يتطلب هندسة دقيقة للأوامر، ومع ذلك تتفاوت النتائج. وتحل صور المرجع جزءًا كبيرًا من هذه المشكلة.

عندما تستخدم الصورة المرجعية نفسها في عدة عمليات توليد باستخدام Veo 3.1، يثبّت النموذج كل مخرج على البصمة البصرية نفسها. سيحتفظ الشخص في مرجعك بالوجه نفسه، وستحتفظ الغرفة بدرجة حرارة اللون نفسها، وسيسقط الضوء من الاتجاه نفسه. لهذا يُعد توليد الفيديو المسترشد بالمرجع الطريقة الأكثر عملية لأي شخص ينتج سلسلة من المقاطع.

نقل الأسلوب أثناء الحركة

تعمل صور المرجع أيضًا كمراجع للأسلوب، وليس كمراجع للشخص أو العنصر الرئيسي فقط. قدّم صورة لها طابع سينمائي محدد أو تصحيح لوني معين أو أسلوب تكويني محدد، وسينقل Veo 3.1 تلك الصفات إلى إطارات الفيديو التي يولّدها. وهكذا يستخدم صانعو الأفلام ومنتجو المحتوى لوحات المراجع في الإنتاج التقليدي: لترسيخ اللغة البصرية قبل بدء التصوير.

ينطبق المنطق نفسه هنا. صورتك المرجعية هي وثيقة لغتك البصرية.

حالات استخدام حقيقية تنجح

حالة الاستخدامما تقدمهما يولّده Veo 3.1
حملة أزياءصورة عارضة بزي محددمقطع مدته 5 ثوانٍ بحركة طبيعية
عرض منتجصورة منتج مسطحة أو لقطة رئيسيةكشف دائري بإضاءة سينمائية
محتوى السفرصورة لوجهة طبيعيةبانورama سينمائية بحركة جوية
صورة رمزية لمواقع التواصلصورة شخصية بمظهر محددحلقة قصيرة بحركة دقيقة طبيعية
العقاراتصورة لغرفة داخليةحركة كاميرا سلسة عبر المساحة

شاشة مقسمة تعرض صورة مرجعية بجانب إطارات فيديو مولّدة بالذكاء الاصطناعي

كيفية استخدام Veo 3.1 على PicassoIA

يتوفر Veo 3.1 مباشرةً عبر PicassoIA دون أي إعداد لواجهة API أو تثبيت محلي. إليك سير العمل الدقيق لاستخدامه مع صور المرجع.

الخطوة 1: اختر صورة المرجع

قبل أن تفتح الأداة، خصص وقتًا لاختيار المرجع المناسب. أهم الصفات:

  • الدقة: 1024 بكسل أو أكثر في الضلع القصير. الدقة الأعلى تمنح النموذج تفاصيل أكثر لاستخراجها.
  • الوضوح: تركيز حاد على الموضوع الرئيسي. ضبابية الحركة في المرجع تخلق غموضًا.
  • التكوين: ضع موضوعك بالطريقة التي تريده أن يظهر بها في الفيديو.
  • الإضاءة: اختر صورة مرجعية تحمل الإضاءة التي تريدها في الفيديو النهائي. لن يخترع النموذج إضاءة أفضل مما تقدمه له.

تجنب استخدام لقطات الشاشة من مواقع التواصل الاجتماعي. فآثار الضغط والعلامات المائية تُدخل ضوضاء في قراءة النموذج للصورة.

الخطوة 2: جهّز الأمر النصي

مع Veo 3.1، يجب أن يركز أمرك النصي على الحركة والفعل، لا على المظهر. تتولى الصورة المرجعية المظهر. ويجب أن يجيب أمرك عن السؤال: ماذا يحدث في هذا المشهد؟

هياكل أوامر قوية:

  1. الفعل أولًا: "يمشي ببطء عبر حديقة مضيئة بالشمس، وتتساقط الأوراق من حولها، ونسيم لطيف يتخلل شعرها"
  2. الكاميرا أولًا: "حركة انزلاق بطيئة إلى داخل الغرفة، ويتحول التركيز من الجسم الأمامي إلى الشخص"
  3. الجو أولًا: "ضوء الفجر يزداد إشراقًا تدريجيًا، وضباب يرتفع من العشب، وطيور تعبر الإطار"

اجعل الأوامر النصية بين 30 و80 كلمة. يعالج Veo 3.1 الأوامر الأطول، لكن الأوامر الأقصر والأكثر تحديدًا تعطي نتائج أكثر إحكامًا.

الخطوة 3: اضبط الإعدادات وشغّل

على PicassoIA، تمنحك واجهة Veo 3.1 المعاملات الأساسية:

المعاملالإعداد الموصى بهملاحظات
صورة المرجعالصورة التي اخترتهاارفعها مباشرة من جهازك
الأمر النصيوصف يركز على الحركة30 إلى 80 كلمة
المدةمن 5 إلى 8 ثوانٍالأمثل للاستخدام على مواقع التواصل والويب
نسبة العرض إلى الارتفاع16:9 أو 9:16طابق منصة النشر
البذرةقيمة ثابتةاستخدم البذرة نفسها لإعادة التشغيل بثبات

اضغط على توليد وانتظر. يستغرق Veo 3.1 عادةً من 60 إلى 120 ثانية لكل عملية توليد.

💡 احفظ قيمة البذرة: إذا حصلت على نتيجة تعجبك، فدوّن قيمة البذرة قبل الإغلاق. يمكنك استخدام قيمة البذرة نفسها مع تعديلات طفيفة على الأمر النصي للحصول على سلسلة نتائج متسقة.

ما الذي تتوقعه من النتائج

نادرًا ما تكون أول عمليات التوليد هي المخرجات النهائية. استخدم التشغيل الأول لتقييم ما إذا كان النموذج قد قرأ المرجع بشكل صحيح. تحقق من:

  • التفسير الصحيح للموضوع: هل يتطابق الشخص أو الشيء في الفيديو مع مرجعك؟
  • استمرارية الإضاءة: هل يتوافق اتجاه الضوء ودرجة حرارة اللون مع المرجع؟
  • طبيعية الحركة: هل تبدو الحركة منطقية من الناحية الفيزيائية؟

إذا بدا الشخص خاطئًا، فقد تكون الصورة المرجعية غامضة أكثر من اللازم. وإذا كانت الإضاءة غير صحيحة، فقد يكون أمرك النصي يتجاوز المرجع. عدّل وأعد التشغيل.

جدار لوحة مزاج إبداعية مغطى بصور فوتوغرافية مرجعية

نصائح للأوامر النصية تنجح مع صور المرجع

يخلق الجمع بين صورة مرجعية وأمر نصي توترًا صغيرًا: على النموذج أن يوفّق بين مصدرين للمعلومات. ومعرفة طريقة حل النموذج لهذا التوتر تساعدك على كتابة أوامر أفضل.

صف الحركة، لا المظهر

هذه أهم قاعدة في التوليد المسترشد بالمرجع. إذا كانت صورتك المرجعية تُظهر امرأة بفستان أحمر، وكان أمرك النصي "امرأة بفستان أحمر تمشي"، فأنت تكرر دون داع ما يوصله المرجع بالفعل. والأسوأ أنه إذا قال أمرك "امرأة بفستان أزرق تمشي"، فأنت تخلق تعارضًا ينتج مخرجات غير متوقعة.

اكتب الأوامر كما لو أن النموذج يرى بالفعل من هو وما هو الموجود في المرجع بالضبط. صف ما يفعلونه، لا كيف يبدون.

3 هياكل للأوامر تعطي نتائج جيدة

الهيكل 1: الموضوع + الحركة + البيئة "يدير رأسه ببطء لينظر خلف كتفه، وتظهر ابتسامة خفيفة، ونسيم بعد الظهر الدافئ يتحرك عبر القماش"

الهيكل 2: حركة الكاميرا + نقطة التركيز "ترتفع الكاميرا ببطء من مستوى المكتب إلى مستوى العين، وتكشف الاستوديو كاملًا خلف الشخص، مع عمق مجال ضحل طوال المشهد"

الهيكل 3: الجو + مرور الوقت "يشتد ضوء الصباح خلال 5 ثوانٍ، وتدور الظلال قليلًا، ويتلاشى البخار المتصاعد من الفنجان في الهواء"

ما يجب تجنبه في الأمر النصي

  • أوصاف المظهر التي تتعارض مع صورة المرجع
  • كلمات الأسلوب الغامضة مثل "سينمائي" أو "واقعي كالصور الفوتوغرافية" لأن صورة المرجع تحدد الأسلوب أصلًا
  • كلمات الحركة الغامضة مثل "حركة طبيعية"، فكن محددًا فيما يتحرك وكيف يتحرك
  • الأوامر الطويلة جدًا التي تحتوي على تعليمات متعارضة متعددة

💡 حل التعارض: عندما يتعارض أمرك النصي مع صورة المرجع، فإن Veo 3.1 يُرجّح عمومًا صورة المرجع في مظهر الموضوع، ويُرجّح الأمر النصي في اتجاه الحركة. استفد من هذا بشكل متوقع.

امرأة من الجانب تفحص نتائج فيديو مولّد بالذكاء الاصطناعي على شاشة كبيرة

Veo 3.1 مقابل نماذج تحويل الصورة إلى فيديو الأخرى

يضم PicassoIA أكثر من 87 نموذجًا لتوليد الفيديو. واختيار المناسب منها لعمل صور المرجع يتطلب معرفة ما يتفوق فيه كل نموذج.

Veo 3.1 مقابل Kling V3

يُعد Kling V3 منافسًا قويًا للفيديو المسترشد بالمرجع. يتعامل مع الحركة المعقدة ويُنتج مقاطع أطول بدقة فيزيائية مدهشة. أما Veo 3.1 فيتفوق في دقة الإضاءة، وتحديدًا في مدى حفاظه على طابع الإضاءة في صورة المرجع. وبالنسبة لأعمال البورتريه والأزياء حيث تكون درجة لون البشرة واتجاه الضوء بالغي الأهمية، يُعد Veo 3.1 الخيار الأكثر موثوقية.

Veo 3.1 مقابل Wan 2.6 i2v

Wan 2.6 Image-to-Video أسرع وأكثر سهولة في الوصول لكل عملية توليد عمومًا. وهو ممتاز للتحريك البسيط حيث تعمل الصورة المرجعية كإطار أول حرفي. أما Ingredients to Video في Veo 3.1 فهو الخيار الأفضل عندما تريد من النموذج توليد فيديو يتجاوز المحتوى الحرفي للمرجع، فيخلق مشاهد لم تكن الصورة المرجعية تلمّح إليها إلا ضمنيًا.

متى تختار Veo 3.1 Fast

Veo 3.1 Fast هو الإصدار المناسب عندما تعمل على تجربة الاختلافات بسرعة. يُنتج أوقات توليد أقصر مقابل تنازل بسيط في الجودة. وسير العمل الذي يتبعه معظم المحترفين: كرّر التجربة باستخدام Veo 3.1 Fast حتى يصبح تفسير المرجع والحركة صحيحين، ثم شغّل النسخة النهائية عبر Veo 3.1 للحصول على أعلى جودة.

النموذجالأفضل لـالسرعةدقة المرجع
Veo 3.1المخرجات النهائية، والأعمال الحساسة للإضاءةمتوسطةعالية جدًا
Veo 3.1 Fastالتكرار والاختبارسريعةعالية
Kling V3المقاطع الطويلة، والحركة المعقدةمتوسطةعالية
Wan 2.6 i2vالتحريك السريع، وكفاءة الميزانيةسريعةمتوسطة

تصوير علوي لمجموعة مختارة من الصور الفوتوغرافية المرجعية على سطح من الكتان

أخطاء شائعة مع صور المرجع

تعود معظم عمليات التوليد الفاشلة إلى إحدى ثلاث مشكلات في المدخلات، لا إلى قيود النموذج.

المدخلات منخفضة الدقة

رفع صورة مرجعية مضغوطة أو صغيرة هو أسرع طريق للحصول على مخرجات غير متسقة. فعندما لا يستطيع النموذج تمييز التفاصيل الدقيقة في المرجع، يملأ الفجوات بمعارفه المسبقة. والنتيجة فيديو يلتقط الحالة العامة للمرجع دون تفاصيله. يبدو شخصك مختلفًا، والضوء في غير موضعه.

الحد الأدنى الموصى به: 1024×576 بكسل للمحتوى بنسبة 16:9. واستهدف 1920×1080 بكسل عندما تكون تفاصيل الموضوع مهمة.

الأوامر المتعارضة

الأمر النصي الذي يصف مظهر موضوعك غالبًا ما يتجاوز تأثير صورة المرجع أو يطمسه. ويحدث ذلك لأن Veo 3.1 يستقبل الاثنين كتعليمات عليه أن يرجّح بينهما. وكلما كان وصف المظهر أدق وأكثر تفصيلًا، ابتعد بالنموذج أكثر عن المرجع.

الحل بسيط: انزع من أمرك كل لغة تصف المظهر، واستبدلها بلغة الحركة وحدها.

تجاهل نسبة العرض إلى الارتفاع

يجب أن تشترك صورة المرجع والفيديو الناتج في نسبة العرض إلى الارتفاع نفسها. فرفع صورة بورتريه مربعة 1:1 كمرجع وطلب مخرج بنسبة 16:9 يجبر النموذج على اختراع ما هو خارج الإطار. وأحيانًا ينجح هذا. لكنه غالبًا ينتج نسبًا مشوهة أو استقراءً خاطئًا للبيئة.

اقطع صورة المرجع لتطابق نسبة المخرج التي تنويها قبل رفعها.

أيدٍ تمسك جهازًا لوحيًا يعرض واجهة توليد فيديو بالذكاء الاصطناعي مع شبكة من صور المرجع

ماذا يمكنك أن تبني الآن

توليد الفيديو المسترشد بالمرجع مع Veo 3.1 ليس أمرًا نظريًا. هذه أنواع محددة من المحتوى تعطي نتائج قوية على هذا السير اليوم.

محتوى الأزياء ونمط الحياة

هنا تكون التقنية مفيدة فورًا أكثر من غيرها. فالعلامات التجارية للأزياء وصناع المحتوى المتعلق بنمط الحياة يحتاجون فيديو لمنتجات محددة يرتديها أشخاص محددون في أماكن محددة. يتيح لك التوليد المسترشد بالمرجع البدء من أصول تصوير موجودة، وتقليل ساعات التصوير، وإنتاج مخرجات أكثر.

يمكن لصورة واحدة عالية الجودة لعارضة أزياء أن تصبح مقطعًا مدته 5 ثوانٍ، ودراسة مقربة لملمس القماش، وفيديو لنمط حياة في الهواء الطلق، مع اتساق بصري عبر كل المخرجات.

السفر والفيديو عن الوجهات

غالبًا ما يملك منتجو محتوى السفر صورًا من مواقع التصوير لكنهم يحتاجون فيديو. ويسد التوليد المسترشد بالمرجع هذه الفجوة. تتحول صورة منظر طبيعي إلى بانوراما سينمائية بطيئة، وتتحول صورة لداخل معماري إلى انزلاق سلس عبر المكان. ويثبّت المرجع النموذج على التفاصيل البصرية للموقع الفعلي بدلًا من تفسير عام للمشهد.

مقاطع عرض المنتجات

تحتاج العلامات التجارية للتجارة الإلكترونية فيديو لمنتجاتها، لكنها لا تملك دائمًا ميزانية إنتاج كاملة. فصورة منتج رئيسية كمرجع، مع أمر نصي لحركة دوران أو كشف، تنتج فيديو منتج قابلًا للاستخدام يطابق التصوير الحالي للعلامة. وتنتقل الألوان والإضاءة ومعالجة الخلفية في المرجع مباشرة إلى الفيديو.

استوديو فيديو احترافي بعدة شاشات تعرض مخرجات فيديو مولّدة بالذكاء الاصطناعي

ابدأ الإنشاء بمراجعك الخاصة

أسرع طريقة لترى ما تفعله ميزة Ingredients to Video في Veo 3.1 هي أن تجربها بنفسك. اختر صورة تملكها بالفعل تتمتع بإضاءة واضحة وموضوع حاد. اكتب أمرًا قصيرًا للحركة في جملة واحدة تصف ما يجب أن يحدث في المشهد. ارفع الاثنين إلى Veo 3.1 على PicassoIA وشغّل أول عملية توليد لك.

ستُظهر لك النتيجة الأولى أكثر عن تفاعل صور المرجع مع هذا النموذج من أي شرح مكتوب. ومن هناك، عدّل اختيارك للمرجع، وحسّن أمرك النصي، وجرّب Veo 3.1 Fast لدورات تكرار أسرع، وقارن النتائج مع Kling V3 أو Wan 2.6 i2v لتجد ما يناسب احتياجات محتواك.

يمنحك PicassoIA الوصول إلى كل هذه النماذج في مكان واحد، فيمكنك تشغيل المرجع نفسه عبر أنظمة متعددة ومقارنة المخرجات جنبًا إلى جنب. وهذه المقارنة المباشرة هي أقوى حلقة تغذية راجعة متاحة لبناء الحدس حول توليد فيديو الذكاء الاصطناعي بصور المرجع.

لوحة القصة المصورة (storyboard) مع صور مرجعية لتخطيط سير عمل فيديو الذكاء الاصطناعي

شارك هذا المقال

اختر لغتك

مقالات ذات صلة