مولّد فيديو الشخصيات المتسقة بالذكاء الاصطناعي: أدوات مجانية وأوامر نصية جاهزة

أبقِ الشخصية نفسها مميّزة في كل لقطة من فيديو الذكاء الاصطناعي. تقارن هذه المقالة الأدوات المجانية التي تُثبّت الوجه، وتعرض سير عمل بالصور المرجعية مبنيًا على PicassoIA، وتقدّم أوامر نصية جاهزة للنسخ لأوراق الشخصيات والمقاطع المتحركة والقصص متعددة المشاهد.

مولّد فيديو الشخصيات المتسقة بالذكاء الاصطناعي: أدوات مجانية وأوامر نصية جاهزة
Cristian Da Conceicao
مؤسس Picasso IA

تولّد مقطعًا رائعًا لامرأة ترتدي معطف مطر زيتي اللون وهي تمشي في سوق ماطر. ثم تولّد اللقطة التالية، فتظهر بأنف مختلف وشعر مختلف ومعطف تغيّر لونه بصمت. هذه هي المشكلة اليومية لأي شخص يروي قصة بفيديو الذكاء الاصطناعي، وهي بالضبط ما صُمم سير عمل مولّد فيديو الشخصيات المتسقة بالذكاء الاصطناعي لحلّه. والخبر الجيد أنك لا تحتاج إلى استوديو مدفوع. تكفي بضع أدوات مجانية، وصورة مرجعية قوية واحدة، وبنية أوامر قابلة للتكرار لإبقاء الشخص نفسه على الشاشة من المقطع الأول حتى العاشر.

تشرح هذه المقالة سبب انحراف الشخصيات، وأي الأدوات المجانية تحافظ على الهوية بأفضل شكل، وسير عمل من أربع خطوات بالصور المرجعية، ودليلين عمليين على PicassoIA، وأوامر نصية يمكنك لصقها مباشرة في أي مولّد.

لماذا تنحرف الشخصيات بين المقاطع

أربع صور مطبوعة لامرأة ترتدي معطف مطر أخضر، بملامح وجه مختلفة قليلًا، موضوعة على طاولة من خشب البلوط

كل أداة فيديو بالذكاء الاصطناعي هي في جوهرها آلة احتمالات. إذا طلبت منها "امرأة ترتدي معطف مطر" مرتين، فستحصل على امرأتين مختلفتين، لأن الطلب لا يحدد من هي هذه المرأة. الاتساق ليس مفتاحًا تشغّله. إنه شيء تبنيه بإعطاء النموذج أكثر من جملة واحدة يتمسك بها.

كيف يبدو انحراف الهوية

نادرًا ما يظهر الانحراف كفشل كبير واحد. بل يتسلل عبر تغيّرات صغيرة تتراكم عبر سلسلة من اللقطات:

  • انحراف الوجه: يلين خط الفك، أو تقترب العينان من بعضهما، أو يتغير شكل الأنف بين المقاطع.
  • انحراف الملابس: يظهر زر على ياقة، أو يتحول الوشاح من الأصفر الخردلي إلى البرتقالي، أو يظهر شعار من العدم.
  • انحراف الأسلوب: تبدو اللقطة الأولى كفيلم 35 ملم محبب، بينما تبدو الثانية كإعلان تجاري لامع.
  • انحراف الحركة: داخل المقطع الواحد، يتشوه الوجه بشكل خفي أثناء التفات سريع للرأس أو أثناء مشي طويل نحو الكاميرا.

يلاحظ المشاهدون الأنواع الأربعة في أقل من ثانية، حتى وإن لم يستطيعوا تحديد ما الخطأ. الشخصية التي لا تبدو كما كانت تتوقف ببساطة عن أن تبدو شخصية.

لماذا يحدث ذلك

كل توليد يبدأ من ضوضاء عشوائية. ووصف نصي مثل "شابة، شعر كستنائي محمر، نمش" ينطبق على آلاف الوجوه المختلفة، لذلك يختار النموذج وجهًا جديدًا في كل مرة. الكلمات وصف فضفاض للشخص. أما الصورة فليست كذلك.

لهذا السبب تربط كل طريقة موثوقة في هذه المقالة النموذج بصورة، بدلًا من فقرة أطول.

💡 قاعدة عامة: استخدم الصور لتحديد من هي الشخصية، واستخدم النص لتحديد ما تفعله. لا تطلب من الأمر النصي أن يؤدي دور الصورة المرجعية أبدًا.

الأدوات المجانية التي تحافظ على الشخصية

منظور من زاوية منخفضة لمكتب مونتاج بشاشتين، مع كوب ونبتة صغيرة

تنقسم أدوات الفيديو المجانية إلى ثلاث فئات، وتتعامل كل منها مع الهوية بطريقة مختلفة:

  1. تحويل الصورة إلى فيديو. تقدّم الإطار الأول بنفسك، فيكون الوجه في الإطار الأول هو مرجعك تمامًا.
  2. تحويل المرجع إلى فيديو. تقدّم صورة مرجعية أو أكثر، أو مقاطع، ويحافظ النموذج على تعرّف الشخص مع ابتكار المشهد.
  3. نقل الحركة. تقدّم صورة للشخصية مع فيديو للحركة التي تريدها، فيُسقط النموذج تلك الحركة على شخصيتك.

إليك كيف تتوزع الخيارات الرئيسية في PicassoIA:

الأداةالأسلوبما تقدّمه لهالمخرجاتزاوية التكلفة
Seedance 2.5 Liteتحويل الصورة إلى فيديوصورة إطار أول واحدة، وإطار أخير اختياري480p أو 720p، 5 أو 10 ثوانٍ، صوت متزامنغير محدود لأعضاء Wonder
PicassoIA Videoتحويل الصورة إلى فيديوصورة إطار أول واحدة480p أو 720p، 5 ثوانٍ ثابتة بمعدل 24 إطارًا في الثانية، صوت متزامنمجاني وغير محدود
Wan 2.7 R2Vتحويل المرجع إلى فيديوصور مرجعية أو مقاطع فيديو720p أو 1080pمجاني للتجربة عبر الإنترنت
Kling v3 Motion Controlنقل الحركةصورة للشخصية مع فيديو مرجعي720p أو 1080p، حتى 10 أو 30 ثانيةمجاني للتجربة عبر الإنترنت
Nano Banana Proتحويل المرجع إلى صورةحتى 14 صورة مرجعيةصور ثابتة بدقة 1K أو 2K أو 4Kمجاني للتجربة عبر الإنترنت
PicassoIA Image Editor Proتعديل الصورحتى 3 صور مرجعيةWebP أو JPG أو PNGغير محدود

إذن، أيها تفتح أولًا؟

نموذج الفيديو لا يكون أكثر اتساقًا من الصورة الثابتة التي تقدمها له، لذلك يحدث معظم العمل الحقيقي قبل أن تُصيَّر اللقطة الأولى.

سير عمل الصورة المرجعية

تتكون العملية كاملة من أربع خطوات. نفّذها بالترتيب ولا تتخطَّ أيًا منها.

ابدأ بصفحة الشخصية

لوحة فلين مثبت عليها صور أمامية وجانبية وثلاثية الأرباع مطبوعة لامرأة واحدة، مع عينات من الأقمشة

قبل أن تلمس أداة الفيديو، اصنع مجموعة من الصور الثابتة لشخصيتك: منظر أمامي، ومنظر جانبي، ومنظر ثلاثي الأرباع، وتعبير أو اثنان. يناسب Nano Banana Pro هذه الخطوة جيدًا، لأنه يقبل حتى 14 صورة مرجعية إلى جانب أمرك النصي. وبمجرد أن تحصل على صورة شخصية تعجبك، أعِدها إلى النموذج واطلب الزوايا الأخرى.

ثم اكتب كتلة هوية واحدة: فقرة واحدة من كلمات ثابتة تصف الشخصية. الصقها كما هي، دون تغيير، في بداية كل أمر نصي لبقية المشروع.

a woman in her late twenties with a short auburn bob, light freckles across her nose and cheeks, hazel eyes, a small silver stud earring, an olive-green waxed cotton raincoat and a mustard-yellow wool scarf

الملموس يتفوق على الشاعري. طول الشعر وملمح واحد للوجه وزيّ واحد تقدّم أكثر من صفحة كاملة من الصفات.

ثبّت الملابس والوجه

لقطة مقرّبة جدًا لكُمّ معطف مطر زيتي أخضر من الشمع ووشاح من صوف أصفر خردلي معلّق على عمود خشبي

تسبب الملابس انحرافًا أكثر من الوجوه. اختر زيًا واحدًا بقصة بسيطة ولونين سادّين. فالشعارات والكتابات والخصل المتدلية والمجوهرات المتراكبة والأنماط المزدحمة تجذب الانحراف، لأن النموذج يضطر إلى إعادة اختراعها في كل إطار.

عندما تكون الصورة الثابتة قريبة من الصواب، أصلحها بدلًا من إعادة توليدها. يقبل PicassoIA Image Editor Pro حتى ثلاث صور مرجعية، ويتيح لك الإشارة إليها داخل الأمر النصي بعبارات مثل "الصورة 1" و"الصورة 2" وهكذا. جرّب شيئًا مثل: "حافظ على الوجه والشعر من الصورة 1. غيّر الوشاح فقط إلى أصفر خردلي." ولأن النموذج غير محدود، يمكنك تنفيذ عشرات التصحيحات الصغيرة حتى تصبح الصفحة نظيفة.

حرّك من الإطار الأول

محرر فيديو ينظر إلى إطار متوقف لامرأة ترتدي معطف مطر أخضر على شاشة

اختر أفضل صورة ثابتة واستخدمها كإطار أول في توليد تحويل الصورة إلى فيديو. يتعامل كل من Seedance 2.5 Lite وPicassoIA Video مع صورة الإدخال باعتبارها الإطار الافتتاحي، ويرثان نسبة عرضها إلى ارتفاعها. وهذا يعني أن الوجه في الإطار الأول هو مرجعك، وأن النموذج يحتاج فقط إلى الحفاظ على ثباته لمدة خمس إلى عشر ثوانٍ.

اكتب الأمر النصي عن الحركة فقط. لا تصف الوجه مرة أخرى، لأن الصورة قامت بذلك بالفعل. من أسطر الحركة الجيدة: "تدير رأسها نحو الكاميرا"، "تمشي إلى الأمام تحت مطر خفيف"، "اقتراب بطيء بالكاميرا". احتفظ بحركة واحدة لكل مقطع.

اربط المشاهد بالإطارات الأخيرة

لمواصلة القصة، صدّر الإطار الأخير من المقطع الأول من أي مشغّل فيديو، واستخدمه كإطار أول للمقطع الثاني. يملك Seedance 2.5 Lite أيضًا خيار صورة الإطار الأخير: مع تحديد إطار أول، يتحرك المقطع من ذلك الإطار نحو الإطار الذي تقدمه، وهو مفيد للانتقالات المخططة.

احتفظ بسجل إنتاج بسيط حتى تستطيع تكرار أي شيء نجح:

المشهدالصورة المصدرالبذرةسطر الحركة
1. السوقمنظر أمامي، معطف المطر4821تلتفت نحو الكاميرا وتبتسم
2. الرصيفمنظر ثلاثي الأرباع4821تنظر إلى ساعتها
3. المقهىمنظر جانبي7390تلفّ يديها حول فنجان

💡 نصيحة: احفظ البذرة لكل مقطع يعجبك. إعادة تشغيل الأمر النصي نفسه بالبذرة نفسها تعيد إنتاج النتيجة، فيمكنك تغيير كلمة واحدة ومعرفة ما الذي أحدثته تلك الكلمة بالضبط.

Seedance 2.5 Lite خطوة بخطوة

أيادٍ على حاسوب محمول في استوديو منزلي مضيء، مع صفحة توليد فيديو غير واضحة

Seedance 2.5 Lite هو الإصدار الخفيف من Seedance 2.5. يُصيَّر بدقة 480p و720p، وينتج مقاطع تصل إلى 10 ثوانٍ مع صوت متزامن، ويستطيع أعضاء Wonder تشغيله دون تكلفة لكل مقطع. وهذا الجانب الأخير مهم في عمل الاتساق، لأنك ستعيد التوليد كثيرًا.

  1. افتح صفحة النموذج وارفع صورة شخصيتك الثابتة إلى Input image. اترك نسبة العرض إلى الارتفاع على match_input_image حتى يحتفظ المقطع بتأطير مرجعك.
  2. اكتب أمرًا نصيًا عن الحركة فقط. أفضل النتائج تأتي من الأوصاف السينمائية المرتبة زمنيًا: ما الذي يتحرك، وكيف تتحرك الكاميرا، وما الذي يتغير خلال اللقطة.
  3. اختر الدقة. استخدم 480p للمسودات السريعة، و720p، وهي الافتراضية، للنسخ التي تنوي الاحتفاظ بها.
  4. حدّد المدة. اختر 5 ثوانٍ للحركة السريعة، أو 10 ثوانٍ عندما يحتاج الفعل إلى مساحة أكبر.
  5. أدخل بذرة. أي عدد صحيح يناسب. اكتبه في سجلك.
  6. أضف صورة إطار أخير (اختياري). ارفع إطارًا ختاميًا عندما تريد أن ينتهي المقطع على وضعية أو مشهد محدد.
  7. قرّر بشأن الصوت. خيار Save audio مفعّل افتراضيًا. أوقفه إذا كنت تخطط لإضافة مقطوعتك الخاصة.
  8. وَلِّد وقارن. شغّل ثلاثة أو أربعة اختلافات، واحتفظ بأفضلها، ودوّن أي صياغة تسببت في الانحراف.

تفضّل تنسيقًا قابلًا للتوقع؟ يعمل PicassoIA Video بالطريقة نفسها مع صورة إدخال، لكن كل مقطع يكون 5 ثوانٍ ثابتة بمعدل 24 إطارًا في الثانية، بدقة 480p أو 720p. وهذا يسهّل قص تسلسل كامل إلى الطول نفسه.

💡 نصيحة: جرّب المسودة بدقة 480p حتى تبدو الحركة صحيحة، ثم أعد تشغيل الأمر النصي الفائز والبذرة نفسها بدقة 720p.

Wan 2.7 R2V للمقاطع المرجعية

منظور علوي لصور مطبوعة وورقة تصغير للصور وهاتف ودفتر رسم على مكتب من خشب البلوط

Wan 2.7 R2V نموذج لتحويل المرجع إلى فيديو. يقرأ مادتك المرجعية ويستخدمها لتثبيت هوية الشخص عبر الفيديو كله، فيمكنك وضع شخصية معروفة في مشهد جديد تمامًا دون تقديم إطار أول. يُخرج بدقة 720p أو 1080p، ويدعم النسب 16:9 و9:16 و1:1 و4:3 و3:4.

الإعدادات المهمة:

  • الصور المرجعية: صورة واحدة أو أكثر لشخصيتك بصيغة JPG أو PNG أو BMP أو WebP.
  • الفيديوهات المرجعية: مقاطع قصيرة بصيغة MP4 أو MOV للشخصية نفسها، عندما تريد أن تنتقل الملامح والحركة معًا.
  • الأمر النصي: صف المشهد والفعل. قل "المرأة من المرجع" بدلًا من وصفها من جديد.
  • نوع اللقطة: single لشخص واحد، وmulti للمشاهد التي تضم عدة أشخاص.
  • الأمر النصي السلبي: اذكر ما يجب ألا يظهر، مثل تسريحة شعر متغيرة أو أشخاص إضافيين.
  • الدقة: 720p للتجارب، و1080p (الافتراضية) للتصييرات النهائية.
  • البذرة: أي قيمة من 0 إلى 2147483647 لنتيجة قابلة للتكرار.

عندما تكون الحركة الأهم

بعض اللقطات تحتاج إلى حركة محددة، لا إلى وجه ثابت فقط. يأخذ Kling v3 Motion Control صورة للشخصية مع مقطع مرجعي قصير، ويُسقط الحركة على شخصيتك. يصيّر الوضع القياسي بدقة 720p للمعاينات السريعة، ويصيّر الوضع الاحترافي بدقة 1080p للمقاطع النهائية.

يغيّر إعداد اتجاه الشخصية حد الطول. عند ضبطه على image، تتجه الشخصية بالطريقة نفسها التي تتجه بها صورتك الثابتة، وتصل المقاطع إلى 10 ثوانٍ. وعند ضبطه على video، تتبع الشخصية الشخص الموجود في المقطع المرجعي، ويمكن أن تصل المقاطع إلى 30 ثانية. ولأن الشخصية تأتي من صورتك الثابتة، تبقى الهوية ثابتة بينما تأتي الحركة من المقطع. ويمكن لأمر نصي قصير أن يضيف تفاصيل المشهد فوق ذلك.

أوامر نصية يمكنك نسخها

يد تكتب في دفتر بجانب كوب شاي وصورة مطبوعة لامرأة ترتدي معطف مطر

استبدل الأجزاء بين الأقواس واترك كل شيء آخر كما هو مكتوب تمامًا.

أمر صفحة الشخصية

Photorealistic portrait of [IDENTITY BLOCK]. Neutral grey backdrop, soft window light from the left, 85mm lens, shallow depth of field, natural skin texture, relaxed expression, [front view / three-quarter view / profile view].

نفّذه ثلاث مرات، وغيّر الزاوية بين الأقواس فقط. تبقى كل كلمة أخرى مطابقة تمامًا.

أمر الحركة للإطارات الأولى

She turns her head slowly toward the camera and smiles, raindrops slide off the edge of her hood, shoppers drift past in soft focus behind her. Slow dolly-in, gentle handheld movement, late afternoon light.

لاحظ ما هو غائب: الشعر والنمش والمعطف. الإطار الأول يحمل كل ذلك.

أمر المقطع المرجعي

The woman from the reference images walks through a rainy outdoor market, stops at a fruit stall and lifts an orange to smell it. Medium tracking shot at eye level, warm string lights, light rain, shallow depth of field.

أقرِنه بأمر نصي سلبي:

different face, changed hairstyle, different coat, extra people, text, watermark, blurry, distorted hands

خطة قصة من أربعة مشاهد

المشهدالموقعسطر الحركةالكاميرا
1سوق ماطرتمشي بين أكشاك الفاكهةتتبع بطيء
2رصيف القطار عند الغسقتنظر إلى ساعتها، وتنظر إلى نهاية السكةثابتة
3مقعد بجانب نافذة المقهىتلفّ يديها حول فنجان، وتلقي نظرة إلى الخارجاقتراب بطيء
4سطح منزل عند الفجرتشد وشاحها، وتدير رأسها نحو الشروقبانوراما إلى اليمين

للحصول على صورة ثابتة لكل موقع، اطلب من PicassoIA Image Editor Pro: "ضع المرأة من الصورة 1 على رصيف قطار عند الغسق. حافظ على وجهها وشعرها وملابسها كما هي." ثم حرّك كل صورة ثابتة بسطر الحركة من الجدول.

أخطاء تكسر الاتساق

إعادة كتابة كتلة الهوية

استبدال "كاريه كستنائي" بعبارة "شعر قصير مائل إلى الحمرة" يمنح النموذج مهمة جديدة، وسيستغل الحرية الممنوحة له. انسخ الكتلة والصقها. لا تعِد كتابتها من الذاكرة أبدًا.

طلب الكثير من مقطع واحد

الدوران السريع، وعبور الحشود أمام الوجه، والتسلسلات الطويلة من الأفعال، كلها تدفع النموذج إلى إعادة رسم الشخصية في منتصف اللقطة. أعطِ كل مقطع حركة واحدة، واقطع بين المقاطع.

معظم المشكلات الأخرى تعود إلى الأسباب القليلة نفسها:

المشكلةالسبب المرجحالحل
يتغير الوجه في منتصف المقطعالتفات سريع للرأس أو مقطع طويلقلّل المدة إلى 5 ثوانٍ وأبطئ سطر الحركة
يتغير لون المعطف بين المشاهدوصف اللون بكلمات مختلفةأعِد استخدام كتلة الهوية حرفيًا
تبدو المقاطع كأنها من أفلام مختلفةتغيّرت صياغة العدسة والإضاءةأعِد استخدام سطر العدسة والإضاءة نفسه في كل أمر نصي
يبدو الوجه ناعمًا أو ممسوحًامرجع منخفض الدقةابدأ من صورة ثابتة أوضح بدقة 2K أو 4K أنشأها Nano Banana Pro

جرّب ذلك مع شخصيتك الخاصة

امرأة ترتدي معطف مطر زيتي اللون ووشاحًا أصفر خردليًا تمشي في سوق خارجي ماطر

يمكن إنجاز العملية كاملة في فترة بعد ظهر واحدة. اختر شخصية، واكتب كتلة الهوية، وابنِ صفحة من خمس صور باستخدام Nano Banana Pro، ثم هذّبها باستخدام PicassoIA Image Editor Pro، ثم حرّك مشهدين أو ثلاثة باستخدام Seedance 2.5 Lite. وسجّل كل بذرة على طول الطريق.

لن تكون محاولتك الأولى مثالية، وهذا طبيعي. كل مرة تكشف لك أي الكلمات تحافظ على ثبات الشخصية وأيها يتيح لها الانزلاق. افتح PicassoIA، وأنشئ صور شخصيتك، وارفع أفضلها كإطار أول، وصيّر أول مقطع متسق لك اليوم. وعندما تريد مقارنة نماذج فيديو أخرى جنبًا إلى جنب، تصفّح الكتالوج الكامل على picassoia.com/en/all-models.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة