أبقِ الشخصية نفسها مميّزة في كل لقطة من فيديو الذكاء الاصطناعي. تقارن هذه المقالة الأدوات المجانية التي تُثبّت الوجه، وتعرض سير عمل بالصور المرجعية مبنيًا على PicassoIA، وتقدّم أوامر نصية جاهزة للنسخ لأوراق الشخصيات والمقاطع المتحركة والقصص متعددة المشاهد.
تولّد مقطعًا رائعًا لامرأة ترتدي معطف مطر زيتي اللون وهي تمشي في سوق ماطر. ثم تولّد اللقطة التالية، فتظهر بأنف مختلف وشعر مختلف ومعطف تغيّر لونه بصمت. هذه هي المشكلة اليومية لأي شخص يروي قصة بفيديو الذكاء الاصطناعي، وهي بالضبط ما صُمم سير عمل مولّد فيديو الشخصيات المتسقة بالذكاء الاصطناعي لحلّه. والخبر الجيد أنك لا تحتاج إلى استوديو مدفوع. تكفي بضع أدوات مجانية، وصورة مرجعية قوية واحدة، وبنية أوامر قابلة للتكرار لإبقاء الشخص نفسه على الشاشة من المقطع الأول حتى العاشر.
تشرح هذه المقالة سبب انحراف الشخصيات، وأي الأدوات المجانية تحافظ على الهوية بأفضل شكل، وسير عمل من أربع خطوات بالصور المرجعية، ودليلين عمليين على PicassoIA، وأوامر نصية يمكنك لصقها مباشرة في أي مولّد.
لماذا تنحرف الشخصيات بين المقاطع
كل أداة فيديو بالذكاء الاصطناعي هي في جوهرها آلة احتمالات. إذا طلبت منها "امرأة ترتدي معطف مطر" مرتين، فستحصل على امرأتين مختلفتين، لأن الطلب لا يحدد من هي هذه المرأة. الاتساق ليس مفتاحًا تشغّله. إنه شيء تبنيه بإعطاء النموذج أكثر من جملة واحدة يتمسك بها.
كيف يبدو انحراف الهوية
نادرًا ما يظهر الانحراف كفشل كبير واحد. بل يتسلل عبر تغيّرات صغيرة تتراكم عبر سلسلة من اللقطات:
انحراف الوجه: يلين خط الفك، أو تقترب العينان من بعضهما، أو يتغير شكل الأنف بين المقاطع.
انحراف الملابس: يظهر زر على ياقة، أو يتحول الوشاح من الأصفر الخردلي إلى البرتقالي، أو يظهر شعار من العدم.
انحراف الأسلوب: تبدو اللقطة الأولى كفيلم 35 ملم محبب، بينما تبدو الثانية كإعلان تجاري لامع.
انحراف الحركة: داخل المقطع الواحد، يتشوه الوجه بشكل خفي أثناء التفات سريع للرأس أو أثناء مشي طويل نحو الكاميرا.
يلاحظ المشاهدون الأنواع الأربعة في أقل من ثانية، حتى وإن لم يستطيعوا تحديد ما الخطأ. الشخصية التي لا تبدو كما كانت تتوقف ببساطة عن أن تبدو شخصية.
لماذا يحدث ذلك
كل توليد يبدأ من ضوضاء عشوائية. ووصف نصي مثل "شابة، شعر كستنائي محمر، نمش" ينطبق على آلاف الوجوه المختلفة، لذلك يختار النموذج وجهًا جديدًا في كل مرة. الكلمات وصف فضفاض للشخص. أما الصورة فليست كذلك.
لهذا السبب تربط كل طريقة موثوقة في هذه المقالة النموذج بصورة، بدلًا من فقرة أطول.
💡 قاعدة عامة: استخدم الصور لتحديد من هي الشخصية، واستخدم النص لتحديد ما تفعله. لا تطلب من الأمر النصي أن يؤدي دور الصورة المرجعية أبدًا.
الأدوات المجانية التي تحافظ على الشخصية
تنقسم أدوات الفيديو المجانية إلى ثلاث فئات، وتتعامل كل منها مع الهوية بطريقة مختلفة:
تحويل الصورة إلى فيديو. تقدّم الإطار الأول بنفسك، فيكون الوجه في الإطار الأول هو مرجعك تمامًا.
تحويل المرجع إلى فيديو. تقدّم صورة مرجعية أو أكثر، أو مقاطع، ويحافظ النموذج على تعرّف الشخص مع ابتكار المشهد.
نقل الحركة. تقدّم صورة للشخصية مع فيديو للحركة التي تريدها، فيُسقط النموذج تلك الحركة على شخصيتك.
نموذج الفيديو لا يكون أكثر اتساقًا من الصورة الثابتة التي تقدمها له، لذلك يحدث معظم العمل الحقيقي قبل أن تُصيَّر اللقطة الأولى.
سير عمل الصورة المرجعية
تتكون العملية كاملة من أربع خطوات. نفّذها بالترتيب ولا تتخطَّ أيًا منها.
ابدأ بصفحة الشخصية
قبل أن تلمس أداة الفيديو، اصنع مجموعة من الصور الثابتة لشخصيتك: منظر أمامي، ومنظر جانبي، ومنظر ثلاثي الأرباع، وتعبير أو اثنان. يناسب Nano Banana Pro هذه الخطوة جيدًا، لأنه يقبل حتى 14 صورة مرجعية إلى جانب أمرك النصي. وبمجرد أن تحصل على صورة شخصية تعجبك، أعِدها إلى النموذج واطلب الزوايا الأخرى.
ثم اكتب كتلة هوية واحدة: فقرة واحدة من كلمات ثابتة تصف الشخصية. الصقها كما هي، دون تغيير، في بداية كل أمر نصي لبقية المشروع.
a woman in her late twenties with a short auburn bob, light freckles across her nose and cheeks, hazel eyes, a small silver stud earring, an olive-green waxed cotton raincoat and a mustard-yellow wool scarf
الملموس يتفوق على الشاعري. طول الشعر وملمح واحد للوجه وزيّ واحد تقدّم أكثر من صفحة كاملة من الصفات.
ثبّت الملابس والوجه
تسبب الملابس انحرافًا أكثر من الوجوه. اختر زيًا واحدًا بقصة بسيطة ولونين سادّين. فالشعارات والكتابات والخصل المتدلية والمجوهرات المتراكبة والأنماط المزدحمة تجذب الانحراف، لأن النموذج يضطر إلى إعادة اختراعها في كل إطار.
عندما تكون الصورة الثابتة قريبة من الصواب، أصلحها بدلًا من إعادة توليدها. يقبل PicassoIA Image Editor Pro حتى ثلاث صور مرجعية، ويتيح لك الإشارة إليها داخل الأمر النصي بعبارات مثل "الصورة 1" و"الصورة 2" وهكذا. جرّب شيئًا مثل: "حافظ على الوجه والشعر من الصورة 1. غيّر الوشاح فقط إلى أصفر خردلي." ولأن النموذج غير محدود، يمكنك تنفيذ عشرات التصحيحات الصغيرة حتى تصبح الصفحة نظيفة.
حرّك من الإطار الأول
اختر أفضل صورة ثابتة واستخدمها كإطار أول في توليد تحويل الصورة إلى فيديو. يتعامل كل من Seedance 2.5 Lite وPicassoIA Video مع صورة الإدخال باعتبارها الإطار الافتتاحي، ويرثان نسبة عرضها إلى ارتفاعها. وهذا يعني أن الوجه في الإطار الأول هو مرجعك، وأن النموذج يحتاج فقط إلى الحفاظ على ثباته لمدة خمس إلى عشر ثوانٍ.
اكتب الأمر النصي عن الحركة فقط. لا تصف الوجه مرة أخرى، لأن الصورة قامت بذلك بالفعل. من أسطر الحركة الجيدة: "تدير رأسها نحو الكاميرا"، "تمشي إلى الأمام تحت مطر خفيف"، "اقتراب بطيء بالكاميرا". احتفظ بحركة واحدة لكل مقطع.
اربط المشاهد بالإطارات الأخيرة
لمواصلة القصة، صدّر الإطار الأخير من المقطع الأول من أي مشغّل فيديو، واستخدمه كإطار أول للمقطع الثاني. يملك Seedance 2.5 Lite أيضًا خيار صورة الإطار الأخير: مع تحديد إطار أول، يتحرك المقطع من ذلك الإطار نحو الإطار الذي تقدمه، وهو مفيد للانتقالات المخططة.
احتفظ بسجل إنتاج بسيط حتى تستطيع تكرار أي شيء نجح:
المشهد
الصورة المصدر
البذرة
سطر الحركة
1. السوق
منظر أمامي، معطف المطر
4821
تلتفت نحو الكاميرا وتبتسم
2. الرصيف
منظر ثلاثي الأرباع
4821
تنظر إلى ساعتها
3. المقهى
منظر جانبي
7390
تلفّ يديها حول فنجان
💡 نصيحة: احفظ البذرة لكل مقطع يعجبك. إعادة تشغيل الأمر النصي نفسه بالبذرة نفسها تعيد إنتاج النتيجة، فيمكنك تغيير كلمة واحدة ومعرفة ما الذي أحدثته تلك الكلمة بالضبط.
Seedance 2.5 Lite خطوة بخطوة
Seedance 2.5 Lite هو الإصدار الخفيف من Seedance 2.5. يُصيَّر بدقة 480p و720p، وينتج مقاطع تصل إلى 10 ثوانٍ مع صوت متزامن، ويستطيع أعضاء Wonder تشغيله دون تكلفة لكل مقطع. وهذا الجانب الأخير مهم في عمل الاتساق، لأنك ستعيد التوليد كثيرًا.
افتح صفحة النموذج وارفع صورة شخصيتك الثابتة إلى Input image. اترك نسبة العرض إلى الارتفاع على match_input_image حتى يحتفظ المقطع بتأطير مرجعك.
اكتب أمرًا نصيًا عن الحركة فقط. أفضل النتائج تأتي من الأوصاف السينمائية المرتبة زمنيًا: ما الذي يتحرك، وكيف تتحرك الكاميرا، وما الذي يتغير خلال اللقطة.
اختر الدقة. استخدم 480p للمسودات السريعة، و720p، وهي الافتراضية، للنسخ التي تنوي الاحتفاظ بها.
حدّد المدة. اختر 5 ثوانٍ للحركة السريعة، أو 10 ثوانٍ عندما يحتاج الفعل إلى مساحة أكبر.
أدخل بذرة. أي عدد صحيح يناسب. اكتبه في سجلك.
أضف صورة إطار أخير (اختياري). ارفع إطارًا ختاميًا عندما تريد أن ينتهي المقطع على وضعية أو مشهد محدد.
قرّر بشأن الصوت. خيار Save audio مفعّل افتراضيًا. أوقفه إذا كنت تخطط لإضافة مقطوعتك الخاصة.
وَلِّد وقارن. شغّل ثلاثة أو أربعة اختلافات، واحتفظ بأفضلها، ودوّن أي صياغة تسببت في الانحراف.
تفضّل تنسيقًا قابلًا للتوقع؟ يعمل PicassoIA Video بالطريقة نفسها مع صورة إدخال، لكن كل مقطع يكون 5 ثوانٍ ثابتة بمعدل 24 إطارًا في الثانية، بدقة 480p أو 720p. وهذا يسهّل قص تسلسل كامل إلى الطول نفسه.
💡 نصيحة: جرّب المسودة بدقة 480p حتى تبدو الحركة صحيحة، ثم أعد تشغيل الأمر النصي الفائز والبذرة نفسها بدقة 720p.
Wan 2.7 R2V للمقاطع المرجعية
Wan 2.7 R2V نموذج لتحويل المرجع إلى فيديو. يقرأ مادتك المرجعية ويستخدمها لتثبيت هوية الشخص عبر الفيديو كله، فيمكنك وضع شخصية معروفة في مشهد جديد تمامًا دون تقديم إطار أول. يُخرج بدقة 720p أو 1080p، ويدعم النسب 16:9 و9:16 و1:1 و4:3 و3:4.
الإعدادات المهمة:
الصور المرجعية: صورة واحدة أو أكثر لشخصيتك بصيغة JPG أو PNG أو BMP أو WebP.
الفيديوهات المرجعية: مقاطع قصيرة بصيغة MP4 أو MOV للشخصية نفسها، عندما تريد أن تنتقل الملامح والحركة معًا.
الأمر النصي: صف المشهد والفعل. قل "المرأة من المرجع" بدلًا من وصفها من جديد.
نوع اللقطة:single لشخص واحد، وmulti للمشاهد التي تضم عدة أشخاص.
الأمر النصي السلبي: اذكر ما يجب ألا يظهر، مثل تسريحة شعر متغيرة أو أشخاص إضافيين.
البذرة: أي قيمة من 0 إلى 2147483647 لنتيجة قابلة للتكرار.
عندما تكون الحركة الأهم
بعض اللقطات تحتاج إلى حركة محددة، لا إلى وجه ثابت فقط. يأخذ Kling v3 Motion Control صورة للشخصية مع مقطع مرجعي قصير، ويُسقط الحركة على شخصيتك. يصيّر الوضع القياسي بدقة 720p للمعاينات السريعة، ويصيّر الوضع الاحترافي بدقة 1080p للمقاطع النهائية.
يغيّر إعداد اتجاه الشخصية حد الطول. عند ضبطه على image، تتجه الشخصية بالطريقة نفسها التي تتجه بها صورتك الثابتة، وتصل المقاطع إلى 10 ثوانٍ. وعند ضبطه على video، تتبع الشخصية الشخص الموجود في المقطع المرجعي، ويمكن أن تصل المقاطع إلى 30 ثانية. ولأن الشخصية تأتي من صورتك الثابتة، تبقى الهوية ثابتة بينما تأتي الحركة من المقطع. ويمكن لأمر نصي قصير أن يضيف تفاصيل المشهد فوق ذلك.
أوامر نصية يمكنك نسخها
استبدل الأجزاء بين الأقواس واترك كل شيء آخر كما هو مكتوب تمامًا.
أمر صفحة الشخصية
Photorealistic portrait of [IDENTITY BLOCK]. Neutral grey backdrop, soft window light from the left, 85mm lens, shallow depth of field, natural skin texture, relaxed expression, [front view / three-quarter view / profile view].
نفّذه ثلاث مرات، وغيّر الزاوية بين الأقواس فقط. تبقى كل كلمة أخرى مطابقة تمامًا.
أمر الحركة للإطارات الأولى
She turns her head slowly toward the camera and smiles, raindrops slide off the edge of her hood, shoppers drift past in soft focus behind her. Slow dolly-in, gentle handheld movement, late afternoon light.
لاحظ ما هو غائب: الشعر والنمش والمعطف. الإطار الأول يحمل كل ذلك.
أمر المقطع المرجعي
The woman from the reference images walks through a rainy outdoor market, stops at a fruit stall and lifts an orange to smell it. Medium tracking shot at eye level, warm string lights, light rain, shallow depth of field.
أقرِنه بأمر نصي سلبي:
different face, changed hairstyle, different coat, extra people, text, watermark, blurry, distorted hands
خطة قصة من أربعة مشاهد
المشهد
الموقع
سطر الحركة
الكاميرا
1
سوق ماطر
تمشي بين أكشاك الفاكهة
تتبع بطيء
2
رصيف القطار عند الغسق
تنظر إلى ساعتها، وتنظر إلى نهاية السكة
ثابتة
3
مقعد بجانب نافذة المقهى
تلفّ يديها حول فنجان، وتلقي نظرة إلى الخارج
اقتراب بطيء
4
سطح منزل عند الفجر
تشد وشاحها، وتدير رأسها نحو الشروق
بانوراما إلى اليمين
للحصول على صورة ثابتة لكل موقع، اطلب من PicassoIA Image Editor Pro: "ضع المرأة من الصورة 1 على رصيف قطار عند الغسق. حافظ على وجهها وشعرها وملابسها كما هي." ثم حرّك كل صورة ثابتة بسطر الحركة من الجدول.
أخطاء تكسر الاتساق
إعادة كتابة كتلة الهوية
استبدال "كاريه كستنائي" بعبارة "شعر قصير مائل إلى الحمرة" يمنح النموذج مهمة جديدة، وسيستغل الحرية الممنوحة له. انسخ الكتلة والصقها. لا تعِد كتابتها من الذاكرة أبدًا.
طلب الكثير من مقطع واحد
الدوران السريع، وعبور الحشود أمام الوجه، والتسلسلات الطويلة من الأفعال، كلها تدفع النموذج إلى إعادة رسم الشخصية في منتصف اللقطة. أعطِ كل مقطع حركة واحدة، واقطع بين المقاطع.
معظم المشكلات الأخرى تعود إلى الأسباب القليلة نفسها:
المشكلة
السبب المرجح
الحل
يتغير الوجه في منتصف المقطع
التفات سريع للرأس أو مقطع طويل
قلّل المدة إلى 5 ثوانٍ وأبطئ سطر الحركة
يتغير لون المعطف بين المشاهد
وصف اللون بكلمات مختلفة
أعِد استخدام كتلة الهوية حرفيًا
تبدو المقاطع كأنها من أفلام مختلفة
تغيّرت صياغة العدسة والإضاءة
أعِد استخدام سطر العدسة والإضاءة نفسه في كل أمر نصي
يبدو الوجه ناعمًا أو ممسوحًا
مرجع منخفض الدقة
ابدأ من صورة ثابتة أوضح بدقة 2K أو 4K أنشأها Nano Banana Pro
جرّب ذلك مع شخصيتك الخاصة
يمكن إنجاز العملية كاملة في فترة بعد ظهر واحدة. اختر شخصية، واكتب كتلة الهوية، وابنِ صفحة من خمس صور باستخدام Nano Banana Pro، ثم هذّبها باستخدام PicassoIA Image Editor Pro، ثم حرّك مشهدين أو ثلاثة باستخدام Seedance 2.5 Lite. وسجّل كل بذرة على طول الطريق.
لن تكون محاولتك الأولى مثالية، وهذا طبيعي. كل مرة تكشف لك أي الكلمات تحافظ على ثبات الشخصية وأيها يتيح لها الانزلاق. افتح PicassoIA، وأنشئ صور شخصيتك، وارفع أفضلها كإطار أول، وصيّر أول مقطع متسق لك اليوم. وعندما تريد مقارنة نماذج فيديو أخرى جنبًا إلى جنب، تصفّح الكتالوج الكامل على picassoia.com/en/all-models.