إذا كان لديك مجلد من صور المرجع وفكرة واضحة عما يجب أن يحدث في المشهد، فقد صُممت ميزة Ingredients to Video في Veo 3.1 لهذه اللحظة تحديدًا. فبدلًا من الاعتماد كليًا على الأوصاف النصية لتحديد الأسلوب البصري ومظهر الشخص والمزاج، يمكنك تزويد النموذج بصورة مرجعية ودعه يتولى المهمة الصعبة عنك. والنتيجة فيديو يشبه فعلًا المشهد الذي تخيلته.

ماذا تفعل "Ingredients to Video" فعلًا
الاسم مقصود. فكلمة "Ingredients" تشير إلى أن مدخلاتك، بما فيها الصورة المرجعية وأمرك النصي، مواد خام يجمعها النموذج لإنتاج المخرجات. لا يكتفي Veo 3.1 بتحريك صورة ثابتة. بل يستخدم المعلومات البصرية داخل المرجع كنقطة ارتكاز في التكوين، ثم يولّد حركة تمتد بشكل طبيعي من تلك النقطة.
وهذا يختلف جوهريًا عن أدوات تحويل الصورة إلى فيديو التي تضيف حركة خفيفة إلى الصورة فقط. يُركّب Veo 3.1 إطارات جديدة بناءً على ما يستنتجه من الإضاءة والعمق والعلاقات المكانية وخصائص الشخص من المرجع. ويمكن للفيديو الناتج أن يُظهر حركة كاميرا وفعلًا لشخص وتفاصيل بيئية لم تكن موجودة في الصورة الأصلية.
دور صور المرجع
الصورة المرجعية في هذا السياق ليست مجرد إطار أول. إنها وثيقة مواصفات بصرية. يقرأ Veo 3.1 منها:
- هوية الشخص: بنية الوجه، ونسب الجسم، ولون البشرة، وملمس الشعر
- ظروف الإضاءة: الاتجاه، والحدّة، ودرجة حرارة اللون
- نوع البيئة: داخلية، أو خارجية، أو طبيعية، أو حضرية
- لوحة الألوان: الدرجات السائدة والدرجات المميزة التي تنتقل إلى الفيديو المولّد
- عمق المجال الظاهر: طابع البوكيه، ومؤشرات مسافة التركيز
كلما احتوت صورتك المرجعية على معلومات أكثر، استطاع Veo 3.1 ضبط مخرجاته بدقة أكبر. فصورة شخصية واضحة وجيدة الإضاءة تمنح النموذج مادة أغنى للعمل من لقطة هاتف ذكي غير واضحة.
كيف يقرأ Veo 3.1 السياق البصري
درّب Google DeepMind نموذج Veo 3.1 على مجموعات بيانات فيديو ضخمة، ما يعني أن لديه معرفة مسبقة قوية بكيفية تطور المشاهد مع الزمن. فعندما تُظهر الصورة المرجعية امرأة واقفة قرب نافذة في ضوء بعد الظهر، يعرف النموذج أن هذه الإضاءة تنتج حركات معينة للظلال مع مرور الوقت، وانعكاسات ضوئية محددة على البشرة والقماش، وتحولات محددة في الألوان المحيطة. هذه المعرفة السياقية هي ما يميز Veo 3.1 عن أدوات التحريك الأبسط.
💡 نصيحة متقدمة: الصور المرجعية ذات الإضاءة الاتجاهية القوية تنتج أكثر مخرجات الفيديو تماسكًا بصريًا. أما الإضاءة المسطحة والملبدة بالغيوم فتمنح النموذج مادة أقل للعمل عليها.

لماذا تغيّر صور المرجع كل شيء
للأوامر النصية وحدها قيد أساسي: الكلمات تصف مفاهيم، لا تفاصيل دقيقة. يمكنك أن تكتب "امرأة بشعر بني دافئ في ضوء الساعة الذهبية" فيتخذ النموذج قرارًا تقديريًا بشأن شكل ذلك. أضف صورة مرجعية للشخص والمشهد والإضاءة بالضبط، وسيضيق ذلك التقدير بشكل كبير.
الثبات دون حيل في الأوامر
من أكثر ما يزعج في توليد فيديو الذكاء الاصطناعي عدم الثبات. فتوليد مقطع ثانٍ يظهر الشخصية نفسها والمكان نفسه والإضاءة نفسها كما في الأول يتطلب هندسة دقيقة للأوامر، ومع ذلك تتفاوت النتائج. وتحل صور المرجع جزءًا كبيرًا من هذه المشكلة.
عندما تستخدم الصورة المرجعية نفسها في عدة عمليات توليد باستخدام Veo 3.1، يثبّت النموذج كل مخرج على البصمة البصرية نفسها. سيحتفظ الشخص في مرجعك بالوجه نفسه، وستحتفظ الغرفة بدرجة حرارة اللون نفسها، وسيسقط الضوء من الاتجاه نفسه. لهذا يُعد توليد الفيديو المسترشد بالمرجع الطريقة الأكثر عملية لأي شخص ينتج سلسلة من المقاطع.
نقل الأسلوب أثناء الحركة
تعمل صور المرجع أيضًا كمراجع للأسلوب، وليس كمراجع للشخص أو العنصر الرئيسي فقط. قدّم صورة لها طابع سينمائي محدد أو تصحيح لوني معين أو أسلوب تكويني محدد، وسينقل Veo 3.1 تلك الصفات إلى إطارات الفيديو التي يولّدها. وهكذا يستخدم صانعو الأفلام ومنتجو المحتوى لوحات المراجع في الإنتاج التقليدي: لترسيخ اللغة البصرية قبل بدء التصوير.
ينطبق المنطق نفسه هنا. صورتك المرجعية هي وثيقة لغتك البصرية.
حالات استخدام حقيقية تنجح
| حالة الاستخدام | ما تقدمه | ما يولّده Veo 3.1 |
|---|
| حملة أزياء | صورة عارضة بزي محدد | مقطع مدته 5 ثوانٍ بحركة طبيعية |
| عرض منتج | صورة منتج مسطحة أو لقطة رئيسية | كشف دائري بإضاءة سينمائية |
| محتوى السفر | صورة لوجهة طبيعية | بانورama سينمائية بحركة جوية |
| صورة رمزية لمواقع التواصل | صورة شخصية بمظهر محدد | حلقة قصيرة بحركة دقيقة طبيعية |
| العقارات | صورة لغرفة داخلية | حركة كاميرا سلسة عبر المساحة |

كيفية استخدام Veo 3.1 على PicassoIA
يتوفر Veo 3.1 مباشرةً عبر PicassoIA دون أي إعداد لواجهة API أو تثبيت محلي. إليك سير العمل الدقيق لاستخدامه مع صور المرجع.
الخطوة 1: اختر صورة المرجع
قبل أن تفتح الأداة، خصص وقتًا لاختيار المرجع المناسب. أهم الصفات:
- الدقة: 1024 بكسل أو أكثر في الضلع القصير. الدقة الأعلى تمنح النموذج تفاصيل أكثر لاستخراجها.
- الوضوح: تركيز حاد على الموضوع الرئيسي. ضبابية الحركة في المرجع تخلق غموضًا.
- التكوين: ضع موضوعك بالطريقة التي تريده أن يظهر بها في الفيديو.
- الإضاءة: اختر صورة مرجعية تحمل الإضاءة التي تريدها في الفيديو النهائي. لن يخترع النموذج إضاءة أفضل مما تقدمه له.
تجنب استخدام لقطات الشاشة من مواقع التواصل الاجتماعي. فآثار الضغط والعلامات المائية تُدخل ضوضاء في قراءة النموذج للصورة.
الخطوة 2: جهّز الأمر النصي
مع Veo 3.1، يجب أن يركز أمرك النصي على الحركة والفعل، لا على المظهر. تتولى الصورة المرجعية المظهر. ويجب أن يجيب أمرك عن السؤال: ماذا يحدث في هذا المشهد؟
هياكل أوامر قوية:
- الفعل أولًا: "يمشي ببطء عبر حديقة مضيئة بالشمس، وتتساقط الأوراق من حولها، ونسيم لطيف يتخلل شعرها"
- الكاميرا أولًا: "حركة انزلاق بطيئة إلى داخل الغرفة، ويتحول التركيز من الجسم الأمامي إلى الشخص"
- الجو أولًا: "ضوء الفجر يزداد إشراقًا تدريجيًا، وضباب يرتفع من العشب، وطيور تعبر الإطار"
اجعل الأوامر النصية بين 30 و80 كلمة. يعالج Veo 3.1 الأوامر الأطول، لكن الأوامر الأقصر والأكثر تحديدًا تعطي نتائج أكثر إحكامًا.
الخطوة 3: اضبط الإعدادات وشغّل
على PicassoIA، تمنحك واجهة Veo 3.1 المعاملات الأساسية:
| المعامل | الإعداد الموصى به | ملاحظات |
|---|
| صورة المرجع | الصورة التي اخترتها | ارفعها مباشرة من جهازك |
| الأمر النصي | وصف يركز على الحركة | 30 إلى 80 كلمة |
| المدة | من 5 إلى 8 ثوانٍ | الأمثل للاستخدام على مواقع التواصل والويب |
| نسبة العرض إلى الارتفاع | 16:9 أو 9:16 | طابق منصة النشر |
| البذرة | قيمة ثابتة | استخدم البذرة نفسها لإعادة التشغيل بثبات |
اضغط على توليد وانتظر. يستغرق Veo 3.1 عادةً من 60 إلى 120 ثانية لكل عملية توليد.
💡 احفظ قيمة البذرة: إذا حصلت على نتيجة تعجبك، فدوّن قيمة البذرة قبل الإغلاق. يمكنك استخدام قيمة البذرة نفسها مع تعديلات طفيفة على الأمر النصي للحصول على سلسلة نتائج متسقة.
ما الذي تتوقعه من النتائج
نادرًا ما تكون أول عمليات التوليد هي المخرجات النهائية. استخدم التشغيل الأول لتقييم ما إذا كان النموذج قد قرأ المرجع بشكل صحيح. تحقق من:
- التفسير الصحيح للموضوع: هل يتطابق الشخص أو الشيء في الفيديو مع مرجعك؟
- استمرارية الإضاءة: هل يتوافق اتجاه الضوء ودرجة حرارة اللون مع المرجع؟
- طبيعية الحركة: هل تبدو الحركة منطقية من الناحية الفيزيائية؟
إذا بدا الشخص خاطئًا، فقد تكون الصورة المرجعية غامضة أكثر من اللازم. وإذا كانت الإضاءة غير صحيحة، فقد يكون أمرك النصي يتجاوز المرجع. عدّل وأعد التشغيل.

نصائح للأوامر النصية تنجح مع صور المرجع
يخلق الجمع بين صورة مرجعية وأمر نصي توترًا صغيرًا: على النموذج أن يوفّق بين مصدرين للمعلومات. ومعرفة طريقة حل النموذج لهذا التوتر تساعدك على كتابة أوامر أفضل.
صف الحركة، لا المظهر
هذه أهم قاعدة في التوليد المسترشد بالمرجع. إذا كانت صورتك المرجعية تُظهر امرأة بفستان أحمر، وكان أمرك النصي "امرأة بفستان أحمر تمشي"، فأنت تكرر دون داع ما يوصله المرجع بالفعل. والأسوأ أنه إذا قال أمرك "امرأة بفستان أزرق تمشي"، فأنت تخلق تعارضًا ينتج مخرجات غير متوقعة.
اكتب الأوامر كما لو أن النموذج يرى بالفعل من هو وما هو الموجود في المرجع بالضبط. صف ما يفعلونه، لا كيف يبدون.
3 هياكل للأوامر تعطي نتائج جيدة
الهيكل 1: الموضوع + الحركة + البيئة
"يدير رأسه ببطء لينظر خلف كتفه، وتظهر ابتسامة خفيفة، ونسيم بعد الظهر الدافئ يتحرك عبر القماش"
الهيكل 2: حركة الكاميرا + نقطة التركيز
"ترتفع الكاميرا ببطء من مستوى المكتب إلى مستوى العين، وتكشف الاستوديو كاملًا خلف الشخص، مع عمق مجال ضحل طوال المشهد"
الهيكل 3: الجو + مرور الوقت
"يشتد ضوء الصباح خلال 5 ثوانٍ، وتدور الظلال قليلًا، ويتلاشى البخار المتصاعد من الفنجان في الهواء"
ما يجب تجنبه في الأمر النصي
- أوصاف المظهر التي تتعارض مع صورة المرجع
- كلمات الأسلوب الغامضة مثل "سينمائي" أو "واقعي كالصور الفوتوغرافية" لأن صورة المرجع تحدد الأسلوب أصلًا
- كلمات الحركة الغامضة مثل "حركة طبيعية"، فكن محددًا فيما يتحرك وكيف يتحرك
- الأوامر الطويلة جدًا التي تحتوي على تعليمات متعارضة متعددة
💡 حل التعارض: عندما يتعارض أمرك النصي مع صورة المرجع، فإن Veo 3.1 يُرجّح عمومًا صورة المرجع في مظهر الموضوع، ويُرجّح الأمر النصي في اتجاه الحركة. استفد من هذا بشكل متوقع.

Veo 3.1 مقابل نماذج تحويل الصورة إلى فيديو الأخرى
يضم PicassoIA أكثر من 87 نموذجًا لتوليد الفيديو. واختيار المناسب منها لعمل صور المرجع يتطلب معرفة ما يتفوق فيه كل نموذج.
Veo 3.1 مقابل Kling V3
يُعد Kling V3 منافسًا قويًا للفيديو المسترشد بالمرجع. يتعامل مع الحركة المعقدة ويُنتج مقاطع أطول بدقة فيزيائية مدهشة. أما Veo 3.1 فيتفوق في دقة الإضاءة، وتحديدًا في مدى حفاظه على طابع الإضاءة في صورة المرجع. وبالنسبة لأعمال البورتريه والأزياء حيث تكون درجة لون البشرة واتجاه الضوء بالغي الأهمية، يُعد Veo 3.1 الخيار الأكثر موثوقية.
Veo 3.1 مقابل Wan 2.6 i2v
Wan 2.6 Image-to-Video أسرع وأكثر سهولة في الوصول لكل عملية توليد عمومًا. وهو ممتاز للتحريك البسيط حيث تعمل الصورة المرجعية كإطار أول حرفي. أما Ingredients to Video في Veo 3.1 فهو الخيار الأفضل عندما تريد من النموذج توليد فيديو يتجاوز المحتوى الحرفي للمرجع، فيخلق مشاهد لم تكن الصورة المرجعية تلمّح إليها إلا ضمنيًا.
متى تختار Veo 3.1 Fast
Veo 3.1 Fast هو الإصدار المناسب عندما تعمل على تجربة الاختلافات بسرعة. يُنتج أوقات توليد أقصر مقابل تنازل بسيط في الجودة. وسير العمل الذي يتبعه معظم المحترفين: كرّر التجربة باستخدام Veo 3.1 Fast حتى يصبح تفسير المرجع والحركة صحيحين، ثم شغّل النسخة النهائية عبر Veo 3.1 للحصول على أعلى جودة.
| النموذج | الأفضل لـ | السرعة | دقة المرجع |
|---|
| Veo 3.1 | المخرجات النهائية، والأعمال الحساسة للإضاءة | متوسطة | عالية جدًا |
| Veo 3.1 Fast | التكرار والاختبار | سريعة | عالية |
| Kling V3 | المقاطع الطويلة، والحركة المعقدة | متوسطة | عالية |
| Wan 2.6 i2v | التحريك السريع، وكفاءة الميزانية | سريعة | متوسطة |

أخطاء شائعة مع صور المرجع
تعود معظم عمليات التوليد الفاشلة إلى إحدى ثلاث مشكلات في المدخلات، لا إلى قيود النموذج.
المدخلات منخفضة الدقة
رفع صورة مرجعية مضغوطة أو صغيرة هو أسرع طريق للحصول على مخرجات غير متسقة. فعندما لا يستطيع النموذج تمييز التفاصيل الدقيقة في المرجع، يملأ الفجوات بمعارفه المسبقة. والنتيجة فيديو يلتقط الحالة العامة للمرجع دون تفاصيله. يبدو شخصك مختلفًا، والضوء في غير موضعه.
الحد الأدنى الموصى به: 1024×576 بكسل للمحتوى بنسبة 16:9. واستهدف 1920×1080 بكسل عندما تكون تفاصيل الموضوع مهمة.
الأوامر المتعارضة
الأمر النصي الذي يصف مظهر موضوعك غالبًا ما يتجاوز تأثير صورة المرجع أو يطمسه. ويحدث ذلك لأن Veo 3.1 يستقبل الاثنين كتعليمات عليه أن يرجّح بينهما. وكلما كان وصف المظهر أدق وأكثر تفصيلًا، ابتعد بالنموذج أكثر عن المرجع.
الحل بسيط: انزع من أمرك كل لغة تصف المظهر، واستبدلها بلغة الحركة وحدها.
تجاهل نسبة العرض إلى الارتفاع
يجب أن تشترك صورة المرجع والفيديو الناتج في نسبة العرض إلى الارتفاع نفسها. فرفع صورة بورتريه مربعة 1:1 كمرجع وطلب مخرج بنسبة 16:9 يجبر النموذج على اختراع ما هو خارج الإطار. وأحيانًا ينجح هذا. لكنه غالبًا ينتج نسبًا مشوهة أو استقراءً خاطئًا للبيئة.
اقطع صورة المرجع لتطابق نسبة المخرج التي تنويها قبل رفعها.

ماذا يمكنك أن تبني الآن
توليد الفيديو المسترشد بالمرجع مع Veo 3.1 ليس أمرًا نظريًا. هذه أنواع محددة من المحتوى تعطي نتائج قوية على هذا السير اليوم.
محتوى الأزياء ونمط الحياة
هنا تكون التقنية مفيدة فورًا أكثر من غيرها. فالعلامات التجارية للأزياء وصناع المحتوى المتعلق بنمط الحياة يحتاجون فيديو لمنتجات محددة يرتديها أشخاص محددون في أماكن محددة. يتيح لك التوليد المسترشد بالمرجع البدء من أصول تصوير موجودة، وتقليل ساعات التصوير، وإنتاج مخرجات أكثر.
يمكن لصورة واحدة عالية الجودة لعارضة أزياء أن تصبح مقطعًا مدته 5 ثوانٍ، ودراسة مقربة لملمس القماش، وفيديو لنمط حياة في الهواء الطلق، مع اتساق بصري عبر كل المخرجات.
السفر والفيديو عن الوجهات
غالبًا ما يملك منتجو محتوى السفر صورًا من مواقع التصوير لكنهم يحتاجون فيديو. ويسد التوليد المسترشد بالمرجع هذه الفجوة. تتحول صورة منظر طبيعي إلى بانوراما سينمائية بطيئة، وتتحول صورة لداخل معماري إلى انزلاق سلس عبر المكان. ويثبّت المرجع النموذج على التفاصيل البصرية للموقع الفعلي بدلًا من تفسير عام للمشهد.
مقاطع عرض المنتجات
تحتاج العلامات التجارية للتجارة الإلكترونية فيديو لمنتجاتها، لكنها لا تملك دائمًا ميزانية إنتاج كاملة. فصورة منتج رئيسية كمرجع، مع أمر نصي لحركة دوران أو كشف، تنتج فيديو منتج قابلًا للاستخدام يطابق التصوير الحالي للعلامة. وتنتقل الألوان والإضاءة ومعالجة الخلفية في المرجع مباشرة إلى الفيديو.

ابدأ الإنشاء بمراجعك الخاصة
أسرع طريقة لترى ما تفعله ميزة Ingredients to Video في Veo 3.1 هي أن تجربها بنفسك. اختر صورة تملكها بالفعل تتمتع بإضاءة واضحة وموضوع حاد. اكتب أمرًا قصيرًا للحركة في جملة واحدة تصف ما يجب أن يحدث في المشهد. ارفع الاثنين إلى Veo 3.1 على PicassoIA وشغّل أول عملية توليد لك.
ستُظهر لك النتيجة الأولى أكثر عن تفاعل صور المرجع مع هذا النموذج من أي شرح مكتوب. ومن هناك، عدّل اختيارك للمرجع، وحسّن أمرك النصي، وجرّب Veo 3.1 Fast لدورات تكرار أسرع، وقارن النتائج مع Kling V3 أو Wan 2.6 i2v لتجد ما يناسب احتياجات محتواك.
يمنحك PicassoIA الوصول إلى كل هذه النماذج في مكان واحد، فيمكنك تشغيل المرجع نفسه عبر أنظمة متعددة ومقارنة المخرجات جنبًا إلى جنب. وهذه المقارنة المباشرة هي أقوى حلقة تغذية راجعة متاحة لبناء الحدس حول توليد فيديو الذكاء الاصطناعي بصور المرجع.
