ما الذي يتقنه Kling v3 Omni Video في تحرير الفيديو متعدد المدخلات

يغيّر Kling v3 Omni Video طريقة تفكير صنّاع المحتوى في توليد الفيديو، إذ يقبل عدة مدخلات في آن واحد. من الصور المرجعية إلى الأوامر النصية، يدمج النموذج هذه المدخلات ليصنع مقاطع متماسكة وسينمائية. يتناول هذا المقال كل ميزة من ميزات الإدخال المتعدد، وحالات الاستخدام الواقعية، وكيفية تكرار سير العمل على PicassoIA.

ما الذي يتقنه Kling v3 Omni Video في تحرير الفيديو متعدد المدخلات
Cristian Da Conceicao
مؤسس Picasso IA

تحرير الفيديو متعدد المدخلات ليس مجرد تحديث بسيط لميزة. إنه الفرق بين أداة تولّد مقاطع وأداة تفهم فعلًا ما تحاول بناءه. يُعدّ Kling v3 Omni Video أول نموذج في تشكيلة Kling يتعامل مع عدة مدخلات مرجعية في وقت واحد، إذ يجمع بين الأوامر النصية وصور الشخص أو العنصر الرئيسي والمراجع الأسلوبية في مخرج واحد متماسك. والنتيجة سير عمل لتوليد الفيديو يبدو أقرب إلى الإخراج منه إلى التخمين.

عدة صور مرجعية مرتبة على طاولة مع تراكب لمعالجة الذكاء الاصطناعي

ماذا يعني "متعدد المدخلات" فعلًا؟

تعمل معظم نماذج توليد الفيديو انطلاقًا من مصدر واحد: إما أمر نصي أو صورة مرجعية. تكتب ما تريده، أو تُريه النموذج، ثم يحاول تفسير هذه الإشارة الواحدة قدر استطاعته. ويظهر القصور بسرعة. فالأوامر النصية وحدها تعاني من ضعف الدقة البصرية، والمدخلات بصورة واحدة تفقد التفاصيل عندما تمتد الحركة إلى ما بعد الإطار الأول.

يحل تحرير الإدخال المتعدد هذه المشكلة بالسماح للنموذج بالاستدلال من مصادر متعددة في آن واحد. فبدلًا من استنتاج نيتك من إشارة واحدة، يقرأ عدة إشارات معًا ويدمجها في مخرج يحترمها جميعًا.

نص مع مراجع صور في الوقت نفسه

يقبل Kling v3 Omni Video أمرًا نصيًا لوصف الحركة مع صورة مرجعية واحدة أو أكثر. ويمكن للصور أن تؤدي أدوارًا مختلفة. فقد تحدد صورة الشخص الرئيسي، وقد تحدد أخرى البيئة المحيطة، وقد ترسّخ ثالثة أسلوب الإضاءة. يقرأ النموذج كل مدخل لمعرفة ما يضيفه، ثم يوازن بينها أثناء التوليد.

هذا يختلف جوهريًا عن إصدارات Kling السابقة. كانت Kling v2.6 وKling v2.1 Master أدوات قوية لتحويل الصورة إلى فيديو، لكنهما اعتمدا على صورة أساسية واحدة مع نص يوجّه الحركة فقط. تمتد بنية Omni هذا المبدأ لتقبل مدخلات بنيوية تشكّل المخرج كله، لا الإطار الأول وحده.

كيف يعالج النموذج المدخلات المكدسة

داخليًا، يعالج النموذج المدخلات المرجعية عبر آلية الانتباه المتقاطع، التي تُرجّح مساهمة كل مدخل بحسب دوره في الأمر النصي. إذا قال أمرك النصي "المرأة تمشي في شارع المدينة"، فإن النموذج يستخدم صورة المرجع للشخص لتحديد مظهر المرأة، ومرجع البيئة لتحديد الشارع، والنص لتحديد مسار الحركة.

💡 نصيحة: عند استخدام عدة صور مرجعية، تأكد من أن كل صورة تضيف شيئًا مختلفًا. فإرسال صورتين متشابهتين للشخص نفسه من زاوية قريبة جدًا يضيف ضوضاء بدلًا من المعلومات.

لوحة مونتاج فيديو احترافية مع مسارات إدخال متعددة على الشاشة

الأنماط الثلاثة التي يتعامل معها Kling v3 Omni

يغطي نظام الإدخال المتعدد في Kling v3 Omni Video ثلاث حالات استخدام مختلفة. ويخدم كل منها نوعًا مختلفًا من صنّاع المحتوى.

تحويل الصورة إلى فيديو مع مرجع الشخص

هذا هو النمط الأكثر مباشرة. تزوّد النموذج بصورة عالية الجودة لشخصك، وتكتب أمرًا نصيًا للحركة، فيحرّك النموذج الشخص مع الحفاظ على مظهره في كل إطار. يبقى لون الشعر وتفاصيل الملابس وملامح الوجه وحتى الملمس المحدد ثابتة طوال المقطع.

في عمل الشخصيات، يغني هذا عن وصف الشخصية نصيًا بالكامل. فبدلًا من كتابة "امرأة بشعر داكن مموج ترتدي سترة حمراء"، تُري النموذج بالضبط من تقصده. الدقة هنا فورية، والنتائج أكثر ثباتًا بكثير.

يذهب Kling v3 Motion Control إلى أبعد من ذلك بإضافة تحكم مباشر في حركة الجسم، لكن نموذج Omni الأساسي يتعامل مع تحريك الشخصيات الحر دون تلك القيود.

مزج الأسلوب والمشهد

يستخدم النمط الثاني الصور المرجعية لا لتحديد شخص، بل لتحديد أسلوب بصري أو بيئة. يمكنك أن تزوّد النموذج بصورة لزقاق محدد في برشلونة، ثم تستخدم أمرًا نصيًا لوضع شخصية تمشي فيه دون أن تصوّر هناك فعلًا.

ينجح هذا لأن النموذج يفصل بين المحتوى الدلالي (ما هو موجود في الصورة) والمعلومات الأسلوبية والمكانية (كيف هي الإضاءة، وكيف تبدو الأسطح، وكيف يُرتَّب الفراغ). تتحول صورة المكان المرجعية إلى مخطط بصري، لا إلى تعليمة صارمة بعبارة "حرّك هذا".

💡 نصيحة: في مراجع المواقع، تعمل الصور المعمارية ذات ظروف الإضاءة المتسقة بشكل أفضل من لقطات الهاتف العادية. يقرأ النموذج اتجاه الضوء وجودة الظل مباشرة من الصورة المرجعية.

تراكب أوامر الحركة

يتضمن النمط الثالث تراكب أوصاف الحركة مع صور مرجعية تُظهر سياق الحركة. يمكنك أن تزوّد النموذج بصورة لراقص في منتصف وضعية، وأمر نصي يصف مسار الحركة، فيُدخل النموذج تحولات بين المرجع الثابت والحركة الموصوفة.

ينجح هذا النمط بشكل خاص في النوع من العمل الذي كان يتطلب سابقًا تحريكًا إطارًا بإطار: إيماءات محددة، وحركات كاميرا دقيقة، وعروض منتجات مضبوطة يكون فيها مسار الحركة مهمًا بقدر أهمية الهوية البصرية للشيء نفسه.

الشخص نفسه مصوَّر من ثلاث زوايا مختلفة في استوديوهات متطابقة

أين تقصر النماذج ذات المدخل الواحد

فهم ما يتقنه Kling v3 Omni Video يتطلب فهم ما تخطئ فيه النماذج ذات المدخل الواحد. هذه ليست عيوبًا خاصة بالمنافسين، بل كانت قيودًا في إصدارات Kling السابقة أيضًا.

مشكلة الاتساق

عندما يولّد نموذج يعتمد على النص وحده فيديو، عليه أن يخترع التفاصيل البصرية من الصفر. كل إطار هو تفسير جديد لوصفك. والنتيجة شخصية تبدو مختلفة قليلًا في الإطار 12 مقارنةً بالإطار 48، أو خلفية تتغير درجة لونها في منتصف المقطع.

تتحسن النماذج ذات الصورة الواحدة في هذا الجانب، لكنها ما تزال تعاني عندما تبتعد الحركة بالشخص عن وضعيته الأولى. فإذا أدار الشخص جسده 90 درجة عن زاوية مرجعه، يصبح النموذج عمليًا في حالة استقراء، وهنا يبدأ انحراف الهوية.

يمنح الإدخال المتعدد النموذج نقاط ارتكاز متعددة. يمكنه أن يستدل على المظهر من زوايا مختلفة تُقدَّم كمراجع، وهذا يقلل الانحراف بشكل كبير حتى عبر تسلسلات الحركة المعقدة.

انجراف الأسلوب عبر الزمن

حتى النماذج التي تتمتع باتساق قوي من صورة واحدة كثيرًا ما تسمح للأسلوب بالانجراف في المقاطع الأطول. تتلاشى الإضاءة الدافئة من صورة المرجع نحو منتصف المقطع، ثم تعود بشكل غير ثابت في النهاية. ويتغير التدرج اللوني قليلًا. هذه عيوب ناتجة عن فقدان النموذج تتبّع المرجع عندما ينتقل الانتباه نحو توليد حركة معقولة.

تُبقي بنية Omni مراجع الأسلوب نشطة طوال التوليد، بدلًا من استخدامها فقط لتكييف الإطار الأول. وهذا ما يجعلها مختلفة حقًا عن نماذج مثل Veo 3 أو Hailuo 02، التي تتفوق في تحويل النص إلى فيديو سينمائي لكنها لا تقدم الترسيخ نفسه للشخص عبر عدة مراجع.

مقارنة جنبًا إلى جنب بين صورة مرجعية وإطارات فيديو مولّدة بالذكاء الاصطناعي

كيف يحافظ Kling v3 Omni على اتساق المرئيات

الاتساق هو ما يفصل المقاطع التي يمكنك استخدامها فعلًا عن المقاطع التي تبدو مبهرة لثلاث ثوانٍ ثم تنهار.

ثبات الشخص عبر الإطارات

يحقق Kling v3 Omni Video ثبات الشخص عبر ربط المرجع: صورة مرجع الشخص ليست مجرد مدخل تكييف عند الإطار صفر، بل تبقى قيدًا مستمرًا طوال عملية الانتشار. ويقارن النموذج الإطارات المولّدة بالمرجع باستمرار أثناء أخذ العينات.

عمليًا، يعني هذا أن ملمس الملابس يبقى دقيقًا. فالقميص المخطط يبقى مخططًا بعرض الخطوط الصحيح بدلًا من أن يذوب في نقش غامض. وتفاصيل المجوهرات تستمر. وتبقى ملامح الوجه قابلة للتعرف عليها عبر الحركة بدلًا من أن تلين إلى تقريب عام.

الميزةنماذج الصورة الواحدةKling v3 Omni Video
اتساق الشخص عبر 5 ثوانٍمتوسط (80-90%)عالٍ (95%+)
الحفاظ على الأسلوب في منتصف المقطعيتراجعمحفوظ
دعم المراجع متعددة الزوايالانعم
فصل الخلفية عن الشخصمحدودقوي
الالتزام بحركة الأمر النصيجيدممتاز

الترابط الزمني

يشير الترابط الزمني إلى مدى سلاسة اتصال إطار بالإطار الذي يليه عبر المقطع كله. فالفيديو غير المترابط يبدو كعرض شرائح: كل إطار معقول بذاته، لكن الانتقالات بينها تبدو متقطعة أو مستحيلة فيزيائيًا.

يساعد الإدخال المتعدد على الترابط الزمني لأن النموذج لديه قيود أكثر يلتزم بها. مع أمر نصي وحده، يتمتع النموذج بحرية هائلة في تفسير كل إطار. ومع مرجع شخص ومرجع أسلوب مثبتين، تضيق مساحة الحلول، وتصبح القرارات المتبقية حول مسارات الحركة وانتقالات الإضاءة أكثر ضبطًا.

💡 نصيحة: لأقصى ترابط زمني، اجعل أمر الحركة محددًا لكن غير مزدحم. حركة واحدة واضحة لكل مقطع أفضل من ثلاث حركات متزامنة مكدسة في أمر واحد.

مخرج إبداعي يراجع شبكة فيديو مولّدة بالذكاء الاصطناعي على شاشة عرض كبيرة

سير العمل الأكثر استفادة

ليس كل مشروع فيديو يحتاج إلى تحرير متعدد المدخلات. فبالنسبة للرسوم المتحركة التجريدية أو مقاطع تحويل النص إلى فيديو ذات الطابع الأسلوبي، سينتج نموذج مثل Seedance 2.5 أو Ray 3.2 نتائج قوية بالقدر نفسه وإعداد أقل. يكتسب تحرير الإدخال المتعدد قيمته في سير عمل محددة.

سير عمل تحريك الشخصيات

إذا كنت تحرّك شخصًا أو شخصية معينة عبر عدة مقاطع، فإن تحرير الإدخال المتعدد يوفّر وقتًا كبيرًا. بدونه، تكتب الوصف المفصّل للشخصية نفسه في كل أمر نصي وتأمل أن يفسره النموذج بثبات. ومعه، تزوّد المرجع مرة واحدة ويتولى النموذج الباقي.

يكتسب هذا أهمية خاصة في المحتوى المتسلسل: قنوات YouTube التي تبني فيديوهات متكررة يقودها شخصية، وحملات تسويقية يظهر فيها متحدث باسم العلامة التجارية، أو مشاريع سردية تتابع البطل نفسه عبر المشاهد. يمكن أن تحمل كل لقطة حركة مختلفة وبيئة مختلفة ومزاجًا مختلفًا، لكن الشخصية تبقى متطابقة بصريًا.

مقاطع عرض المنتجات

يقع التسويق للمنتجات في موقع مثالي لسير العمل متعدد المدخلات. لديك صور منتجات عالية الجودة من مكتبتك الحالية. وتريد أن يظهر ذلك المنتج بألوانه وتشطيباته الدقيقة، متحركًا في مجموعة متنوعة من البيئات.

يتيح لك الإدخال المتعدد تزويد صورة المنتج كمرجع للعنصر الرئيسي، ووصف البيئة والحركة نصيًا، وتوليد فيديو متسق للمنتج دون إعادة التصوير. يقرأ النموذج التشطيب السطحي الدقيق للمنتج من صورتك المرجعية، لا من وصفك له.

بالنسبة لعلامات التجارة الإلكترونية، يختصر هذا ما كان سيستغرق عادةً يومًا كاملًا من تصوير الفيديو إلى أمر نصي وبضع صور مرجعية.

منتج فاخر مصوَّر من أربع زوايا على سطح استوديو أبيض

انتقالات المشاهد بأسلوب متطابق

يواجه صنّاع الأفلام الوثائقية والسردية الذين يعملون بالفيديو المولّد بالذكاء الاصطناعي مشكلة محددة: يبدو كل مقطع مولّد مختلفًا قليلًا، مما يجعل القطع فجة. يحل تحرير الإدخال المتعدد هذه المشكلة بالسماح لك باستخدام إطار من مقطع سابق كمرجع أسلوب أو بيئة للمقطع التالي، فيتسلسل الاتساق البصري عبر المتتالية.

هذا قريب مما تسميه خطوط VFX التقليدية "تطوير المظهر". فبمجرد أن تثبّت مظهر المشهد، تُدرَّج كل لقطة فيه لتطابقه. يتيح لك تحرير الإدخال المتعدد فعل الشيء نفسه أثناء التوليد، لا في مرحلة ما بعد الإنتاج.

بدائل قوية على PicassoIA

Kling v3 Omni Video ليس النموذج الوحيد على PicassoIA الذي يستحق المعرفة للعمل المعتمد على المراجع أو المتعدد المدخلات. وبحسب احتياجاتك المحددة، قد تناسبك هذه البدائل بشكل أفضل.

Wan 2.7 R2V للعمل القائم على المراجع

صُمّم Wan 2.7 R2V (من المرجع إلى الفيديو) خصيصًا حول فكرة تحريك الشخص من صور مرجعية. يتفوق في تحريك الشخصيات من مرجع واحد قوي، ويُنتج نتائج متسقة جدًا للمحتوى ذي الطابع البورتريهي. إذا كان سير عملك يركز أساسًا على الشخصيات مع احتياجات بيئية محدودة، فقد تكون التكرارات مع Wan 2.7 R2V أسرع.

الثمن: Wan 2.7 R2V أقل مرونة في مزج عدة أنواع مختلفة من المراجع. فهو محسّن لمراجع الأشخاص، لا لسير العمل المدمج الذي يجمع الشخص والبيئة والأسلوب، وهو ما يتعامل معه نموذج Omni.

يمكنك أيضًا إقرانه مع Wan 2.7 I2V لتحريك الصورة إلى فيديو عندما يناسب نهج مرجع الشخص مشروعك أكثر من خط Omni الكامل.

Seedance 2.5 للمحتوى الطويل

يدعم Seedance 2.5 حتى 30 ثانية لكل توليد، مما يجعله الخيار الصحيح عندما يكون الطول أهم من الاتساق متعدد المراجع. بالنسبة لمحتوى وسائل التواصل الاجتماعي الذي يقبل مقطعًا طويلًا واحدًا مع تنوع طبيعي للذكاء الاصطناعي، يقدم Seedance 2.5 جودة سينمائية مع صوت أصلي على نطاق واسع.

النسخة المجانية، Seedance 2.5 Lite، تتعامل مع مقاطع أقصر تصل إلى 10 ثوانٍ، وتستحق التجربة قبل الالتزام بمستوى Pro.

Kling o1 لتحرير لقطات موجودة

إذا كان لديك لقطات فيديو موجودة وتريد إعادة تنسيقها بدلًا من توليدها من الصفر، فإن Kling o1 هو نموذج Kling المخصص للتحرير. يعيد كتابة محتوى الفيديو بناءً على تعليمات نصية مع الحفاظ على الحركة والبنية الأساسية. وبالجمع مع Wan 2.7 Videoedit أو Lucy Edit 2، تحصل على خط كامل لما بعد الإنتاج داخل PicassoIA.

لرفع دقة اللقطات المولّدة لاحقًا، يتعامل Real ESRGAN Video مع رفع الدقة إلى 4K، بينما يرفع Video Increase Resolution المخرج إلى 8K عندما تكون أقصى جودة للتسليم مهمة.

أيدٍ ترتب صورًا مرجعية مطبوعة على مكتب من خشب القيقب مع حاسوب محمول بالقرب منها

كيفية استخدام Kling v3 Omni على PicassoIA

يتوفر Kling v3 Omni Video مباشرةً على PicassoIA. سير العمل بسيط بمجرد أن تفهم كيف تتوافق حقول الإدخال مع بنية النموذج.

خطوة بخطوة

الخطوة 1: جهّز صورك المرجعية. اجمع الصور التي تريد استخدامها كمراجع. بالنسبة لعمل الشخصيات، استخدم بورتريهًا نظيفًا بإضاءة جيدة ورؤية واضحة لوجه الشخص وتفاصيل ملابسه المحددة. أما مراجع البيئة، فاستخدم صورًا ذات إضاءة متسقة وموجّهة بدلًا من اللقطات المسطحة الملبدة بالغيوم.

الخطوة 2: افتح صفحة النموذج. انتقل إلى Kling v3 Omni Video على PicassoIA. سترى لوحة الإدخال مع حقول للصورة الأساسية، والمراجع الثانوية الاختيارية، والأمر النصي للحركة.

الخطوة 3: ارفع المرجع الأساسي. خانة الصورة الأساسية هي الأهم. هذه الصورة هي التي تحدد الشخص الرئيسي أو المشهد. ارفع أعلى نسخة جودة لديك. يقرأ النموذج بالدقة الكاملة للصورة المرفوعة، لذا فإن مرجعًا بدقة 4K واضحة سينتج مخرجًا أحدّ من قصاصة مضغوطة بدقة 720p.

الخطوة 4: اكتب أمر حركة محددًا. صِف الحركة بتسلسل زمني. "تقف المرأة، ثم تلتفت قليلًا نحو اليسار بينما يتحرك شعرها مع النسيم" أفضل من "امرأة جميلة في محيط طبيعي". يجب أن يضيف أمر الحركة معلومات لا تستطيع المراجع أن توفرها وحدها.

الخطوة 5: اضبط المدة والدقة. يدعم النموذج مخرجات من 5 إلى 10 ثوانٍ. للتجربة، تكون 5 ثوانٍ سريعة وتغطي معظم احتياجات المحتوى الاجتماعي. خيارات الدقة المتاحة هي 720p و1080p.

الخطوة 6: ولّد وراجع. يختلف وقت التوليد حسب الدقة وحمل الخادم، ويستغرق عادةً من 60 إلى 90 ثانية. راجع المخرج بحثًا عن مشكلات الاتساق، خاصةً حول الإطارات في منتصف المقطع حيث يكون الانحراف أكثر شيوعًا.

💡 نصيحة: إذا أظهر مخرجك الأول انحراف الشخص في النصف الثاني من المقطع، فجرّب تقصير أمر الحركة. فالحركة الموصوفة بإفراط تجبر النموذج على الابتعاد أكثر عن قيود المرجع.

نصائح المعلمات لأفضل النتائج

المعلمةالإعداد الموصى بهالسبب
الأمر النصي السلبي"blurry, low quality, distorted face, inconsistent"يقلل التشوهات
المدة5 ثوانٍ للتجارب، و10 ثوانٍ للنسخ النهائيةموازنة بين السرعة والجودة
الدقة1080p للتسليماتأقصى درجات دقة المخرج
مقياس CFG7-9يوازن بين الالتزام بالأمر والطبيعية
قوة المرجع0.8 فأكثر لعمل الشخصياتيعطي الأولوية للدقة البصرية

إذا أردت التحكم في وضعية الجسم بدلًا من التحريك الحر، فانتقل إلى Kling v3 Motion Control للتحريك الموجّه بالهيكل العظمي للشخص المرفوع.

يستحق الذكر أيضًا أن Gen 4 Aleph وAleph 2 من Runway يقدمان نهجًا مكملًا، إذ تعدّل إطارًا واحدًا ويعيد النموذج تنسيق الفيديو كله ليطابقه. وفي سير عمل معين، يمنحك دمج مقاطع Omni مع إعادة التنسيق القائمة على Aleph اتساقًا في التوليد وتحكمًا بعد التوليد معًا.

شاشة بجودة السينما تعرض إطار فيديو لغابة واقعية مولّد بالذكاء الاصطناعي

ابنِ أول فيديو لك متعدد المدخلات الآن

يغيّر توليد الفيديو متعدد المدخلات طريقة تخطيطك للتصوير والإنتاج. فعندما تتمكن من تزويد عدة مراجع في توليد واحد، تتوقف عن التفكير في "ما الذي يمكنني وصفه" وتبدأ في التفكير في "ما الذي أريد أن أُظهره". هذا التحول في الإطار الذهني هو مكمن الفائدة الإبداعية الحقيقية.

Kling v3 Omni Video على PicassoIA متاح الآن، إلى جانب كل نموذج آخر في سلسلة Kling، بما في ذلك Kling v3 Video وKling v2.5 Turbo Pro لتكرار أسرع بتكلفة أقل. ابدأ بصورة مرجعية لديك بالفعل، واكتب أمر حركة واحدًا واضحًا، وولّد أول مقطع لك في أقل من دقيقتين.

مكتبة أدوات توليد الفيديو وتحريره الكاملة، بما في ذلك Wan 2.7 I2V وLTX 2 Retake وModify Video، متاحة كلها عبر PicassoIA دون تثبيت أي شيء. تصفّح كل شيء على picassoia.com/en/all-models.

فريق إنتاج أفلام يراجع لقطات فيديو مولّدة بالذكاء الاصطناعي على شاشة مثبتة على الحائط

شارك هذا المقال

اختر لغتك

مقالات ذات صلة