إذا كنت تتابع عالم فيديو الذكاء الاصطناعي عن قرب، فأنت تعرف مدى السرعة التي تتطور بها الأمور. النماذج التي بدت مبهرة قبل ستة أشهر تبدو اليوم بطيئة مقارنةً بما هو متاح الآن. يقف Kling 3.0 Omni في قمة هذا التطور. طوّرته Kuaishou، ويمثل إعادة تفكير في كيفية تعامل توليد فيديو الذكاء الاصطناعي مع التعقيد وفيزياء الحركة والإدخال متعدد الوسائط على نطاق واسع. النتائج تتحدث عن نفسها بطريقة لم تستطع الإصدارات السابقة تحقيقها.

ما الذي يميّز Kling 3.0 Omni
تقع معظم أدوات فيديو الذكاء الاصطناعي في إحدى فئتين: سريعة لكن منخفضة الجودة، أو عالية الجودة لكنها بطيئة إلى حدّ مُرهِق. يتجاوز Kling 3.0 Omni هذه المفاضلة من خلال بنية Omni الخاصة به، وهي تشير إلى قدرته على معالجة أنواع متعددة من الإدخال في وقت واحد مع الحفاظ على أمانة مخرجات 1080p الكاملة. وليست هذه ترقية مُلحقة. أُعيد بناء البنية خصيصًا للتعامل مع التعقيد الذي لم تستطع أنظمة تحويل النص إلى فيديو السابقة إدارته بهذه الدقة.
تشير كلمة "Omni" في الاسم إلى شيء محدد: يقبل هذا النموذج النصوص والصور وبيانات الحركة المرجعية كمدخلات في عملية توليد واحدة. وهذا تحول مهم عن إصدارات Kling السابقة، التي كانت تتطلب أوضاع نموذج منفصلة لسير عمل تحويل النص إلى فيديو وسير عمل تحويل الصورة إلى فيديو. كل شيء يعمل الآن عبر نظام واحد موحّد.
بنية "Omni"
على المستوى التقني، تقدّم بنية Omni فضاء توكنات موحّدًا لتوليد الفيديو. فبدلًا من ترميز إدخالات النص والصورة عبر مسارين منفصلين ودمجهما في مرحلة متأخرة من العملية، يدمج Kling 3.0 Omni هذه الإشارات مبكرًا. والنتيجة تماسك مكاني أقوى عبر الإطارات، وتفسير أكثر طبيعية للعلاقة بين الأشخاص والبيئات طوال مدة المقطع كاملةً.
ما يعنيه ذلك عمليًا: عندما تكتب أمرًا نصيًا يصف شخصًا يمشي تحت المطر، لا يولّد النموذج شخصًا ثم يضيف المطر كطبقة تأثير منفصلة. بل يولّد المشهد كحدث فيزيائي موحّد، فيؤثر المطر في الشعر والملابس وانعكاسات الرصيف بطريقة متماسكة وواقعية. فالبيئة والشخص يوجدان في العالم الفيزيائي نفسه، لا كعنصرين مولّدين منفصلين يُدمجان معًا.
يحسّن هذا النهج أيضًا طريقة تعامل النموذج مع الانتقالات. ففي معظم أنظمة فيديو الذكاء الاصطناعي، تبتعد الإطارات الأولى والأخيرة من المقطع كثيرًا عن الإطارات الوسطى. يحافظ Kling 3.0 Omni على الاتساق البصري من الإطار الافتتاحي حتى الختام، وهذا أمر بالغ الأهمية لأي شخص يجمع مقاطع معًا في مرحلة ما بعد الإنتاج.
أوضاع الجودة مقابل السرعة
يعمل Kling v3 Omni Video بمستويين للمخرجات. يقدّم الوضع القياسي مقاطع بدقة 720p في أقل من دقيقتين، وهو مناسب للتكرار السريع واختبار الأوامر النصية. أما وضع الدقة العالية فيُخرج بدقة 1080p الكاملة مع وقت معالجة أطول، وهو مصمم للمقاطع بجودة الإنتاج حيث تهم كل تفصيلة.
هذا ليس مجرد فرق في الدقة. يطبّق وضع الدقة العالية تمريرات إضافية لتماسك الزمن تنعّم الحركة بين الإطارات وتقلل من عيوب الوميض التي تعاني منها النماذج الأرخص أثناء حركة الكاميرا السريعة أو عندما يكون عدة أشخاص نشطين في الإطار نفسه. وللتسليم النهائي، هو الوضع الوحيد الذي يستحق الاستخدام.

أبرز القدرات التي تستحق المعرفة
يغطي Kling 3.0 Omni مساحة واسعة، لكن هناك قدرات قليلة تتميز بأنها أفضل فعلًا مما تقدمه النماذج المنافسة حاليًا. هذه هي الميزات التي ستغيّر طريقة تفكيرك في فيديو الذكاء الاصطناعي كأداة إنتاج، لا كمجرد لعبة جديدة.
تحويل النص إلى فيديو يعمل فعلًا
أول خيبة أمل يواجهها معظم الناس مع أدوات فيديو الذكاء الاصطناعي هي الفجوة بين ما يصفه الأمر النصي وما يولّده النموذج. يضيّق Kling 3.0 Omni هذه الفجوة بدرجة كبيرة من خلال تحليل اللغة الطبيعية عالي الدقة. فالأوامر الطويلة والمفصّلة التي تتضمن تعليمات حركة الكاميرا وأفعال الشخص والظروف المحيطة تُنفَّذ كلٌّ على حدة، ولا تُدمج في تفسير غامض.
أوامر مثل "امرأة ترتدي معطفًا أحمر تمشي ببطء عبر شارع مبلّط بالحصى مبلل، والكاميرا تتحرك يسارًا، وضوء صباح غائم" تنتج نتائج يظهر فيها كل عنصر موصوف وفي موضعه الصحيح. المعطف أحمر. الشارع مبلل وعاكس. الكاميرا تتحرك بانورامياً. الإضاءة تطابق صباحًا غائمًا. هذا المستوى من الدقة كان تاريخيًا يتطلب تعديلًا لاحقًا في أدوات منفصلة، أو محاولات توليد متكررة بأوامر معدّلة.
تماسك الحركة والفيزياء
أكبر قفزة تقنية في Kling 3.0 Omni مقارنةً بالإصدارات السابقة هي تماسك الحركة. كانت النماذج السابقة قادرة على توليد حركة جيدة لشخص واحد، لكنها كانت تعاني عندما تتحرك عناصر متعددة في الوقت نفسه. فشخص يمشي بينما يتطاير شعره وتتبعثر الحمام في الخلفية كان ينتج نتائج غير متسقة، وأحيانًا فوضوية. كان الأشخاص يتغيرون في مظهرهم أثناء المقطع، وكانت الخلفيات تومض.
يعالج الإصدار v3 هذا الأمر من خلال نمذجة الحركة الواعية بالفيزياء المحسّنة. تبقى ديناميكية الأقمشة وتفاعلات السوائل والتراكيب متعددة الأشخاص متماسكة بشكل أكثر موثوقية طوال مدة المقطع. شاهد القماش يتحرك مع الريح، وشاهد الماء ينسكب من وعاء، وشاهد شخصين يتفاعلان في الإطار نفسه، وستلاحظ الفرق فورًا مقارنةً بما أنتجته الإصدارات السابقة.

حساسية الأمر النصي
من الصفات المغفول عنها في Kling v3 Omni Video طريقة تعامله مع الفراغ البصري والسياق الضمني. إذا وصف أمرك مشهدًا داخليًا بنافذة في الخلفية، يستنتج النموذج الإضاءة الخارجية المناسبة والعمق دون أن يُخبر بذلك صراحةً. هذا النوع من الاستنتاج السياقي يقلّل من حجم هندسة الأوامر المطلوبة للحصول على نتائج احترافية.
كما يستجيب جيدًا للغة توجيهات الكاميرا. مصطلحات مثل "زاوية منخفضة" و"لقطة تتبع" و"تحويل التركيز" و"دولي للأمام" يتم تفسيرها وتطبيقها بثبات، ما يمنح من يعرف لغة السينماتوغرافي ميزة واضحة. هذا ليس نموذجًا يحتاجك إلى تطويع أوامرك في بنى غير طبيعية. اكتب كما يتحدث المخرج، وسيتبع النموذج ذلك.
Kling 3.0 Omni مقابل أدوات فيديو الذكاء الاصطناعي الأخرى
إليك مقارنة Kling v3 Omni Video بالنماذج الرائدة الأخرى المتاحة حاليًا:
يوضّح الجدول موقع Kling 3.0 Omni في المشهد الأوسع. فدعمه للإدخال متعدد الوسائط وتماسك الحركة يتقدمان على بقية النماذج، بينما يبقى توليد الصوت الأصلي نقطة ضعف مقارنةً ببعض المنافسين. وفيما يخص الجودة البصرية الخالصة مع تحكم دقيق بالأوامر النصية، فهو حاليًا أقوى خيار متاح عبر منصة موجّهة للمستخدم العادي.
كيفية استخدام Kling 3.0 Omni على PicassoIA
Kling v3 Omni Video متاح مباشرة عبر PicassoIA، ما يجعله في متناول اليد دون الحاجة إلى بيانات اعتماد API أو حساب مطوّر أو أي إعداد محلي. تستغرق العملية الكاملة من الأمر النصي حتى تنزيل المقطع أقل من عشر دقائق بمجرد أن تعرف ما تفعله.

الخطوة 1: اكتب أمرًا نصيًا قويًا
انتقل إلى صفحة Kling v3 Omni Video على PicassoIA وابحث عن حقل إدخال الأمر النصي. يجب أن يتبع أمرك بنية الشخص + الفعل + البيئة + الإضاءة + الكاميرا:
💡 بنية الأمر النصي: "[الشخص يقوم بالفعل]، [وصف البيئة]، [ظروف الإضاءة]، [زاوية الكاميرا وحركتها]."
مثال على أمر نصي يعمل جيدًا:
"طاهٍ يرتدي مريلة بيضاء يرتّب بعناية طبقًا ملوّنًا على منضدة رخامية داكنة، مصابيح معلّقة دافئة وناعمة فوقه، لقطة علوية مقرّبة تتراجع ببطء لتكشف المطبخ بأكمله"
تجنّب الأوصاف الغامضة مثل "جميل" أو "مذهل". التحديد ينتصر دائمًا. تلقّى النموذج بيانات كافية ليعرف شكل "زقاق باريسي ضيق عند الغسق مع أرصفة حجرية مبللة"، ويحتاج إلى هذا المستوى من الوصف ليؤدي على أفضل وجه.
الخطوة 2: اختر المدة والوضع
يعرض PicassoIA معاملات التوليد الرئيسية مباشرةً أسفل حقل الأمر النصي:
- المدة: 5 ثوانٍ أو 10 ثوانٍ. لاختبار الأوامر النصية والتحقق من التكوين، ابدأ بمدة 5 ثوانٍ. وللمخرجات النهائية، استخدم 10 ثوانٍ.
- الوضع: قياسي (720p، أسرع) أو عالي الدقة (1080p، أبطأ). شغّل الوضع القياسي أولًا للتحقق من تكوين المشهد، ثم انتقل إلى وضع الدقة العالية للمقطع النهائي.
- نسبة العرض إلى الارتفاع: 16:9 للمقاطع الأفقية والشاشة العريضة، و9:16 لتنسيقات الفيديو العمودي على وسائل التواصل، و1:1 للمخرجات المربعة.
سير العمل المكوّن من خطوتين، أي الاختبار بالجودة القياسية قبل الالتزام بتوليد عالي الدقة، يوفّر وقتًا كبيرًا. فالتكوين الذي لا ينجح بدقة 720p لن يُنقذ بتصيّره بدقة 1080p.
الخطوة 3: أضف صورة مرجعية (اختياري)
تقبل بنية Omni صورة إدخال إلى جانب الأمر النصي. تعمل هذه الصورة كـمرساة بصرية للمشهد. ارفع صورة لمكان محدد، وسيستخدمها النموذج كمرجع للبيئة مع تطبيق الأفعال والحركة الموصوفة في أمرك النصي.
هذا الأسلوب قوي بشكل خاص لمحتوى العلامات التجارية، حيث تحتاج إلى مشاهد في موقع محدد أو منتج معيّن ظاهر في الإطار. وبدلًا من وصف كل تفصيلة في البيئة نصيًا، تترك الصورة تحمل تلك المعلومات، وتركّز أمرك على ما يتحرك وكيف يتحرك.

💡 نصيحة: استخدم صورة مرجعية نظيفة وجيدة الإضاءة دون معالجة مكثفة أو مرشحات. يقرأ النموذج معلومات الإضاءة من الصورة المرجعية، لذا فإن الصورة المعرّضة بشكل زائد أو المنمّقة ستدفع المخرجات في اتجاه غير مقصود.
الخطوة 4: وَلّد وكرّر
اضغط على التوليد وانتظر المعالجة. عادةً ما يكتمل الوضع القياسي خلال 60 إلى 90 ثانية على بنية PicassoIA التحتية. ويستغرق وضع الدقة العالية بين 3 و5 دقائق حسب الحمل.
عند وصول المقطع، تحقّق من هذه الأمور قبل اعتباره نهائيًا:
- ثبات الأشخاص طوال المدة الكاملة (هل تبقى الوجوه والأشياء متسقة من إطار إلى آخر؟)
- استقرار الخلفية (انتبه للاهتزاز أو الوميض في العناصر البيئية الثابتة)
- بداية الحركة ونهايتها (هل يبدأ الفعل وينتهي بشكل طبيعي داخل المقطع؟)
- عيوب الحواف على الأشخاص المتحركين، وخصوصًا حول الشعر واليدين
إذا فشل أي من هذه الأمور، فغالبًا ما يكون الحل الأكثر فعالية هو إضافة لغة مكانية أكثر تحديدًا إلى الأمر النصي، ثم إعادة التوليد بالوضع القياسي أولًا. الأوامر الغامضة تنتج نتائج غير متسقة، والأوامر المفصّلة تنتج نتائج موثوقة.
كيف تكتب الأوامر النصية لنموذج Kling 3.0 Omni بشكل صحيح
الفرق بين مخرجات متوسطة ومقطع جاهز للإنتاج يعود غالبًا كليًا إلى طريقة بناء الأمر النصي. يكافئ Kling 3.0 Omni التحديد أكثر من أي إصدار سابق في سلسلة Kling، وأكثر من معظم النماذج المنافسة في هذه الفئة.

معادلة الشخص والفعل والبيئة
أكثر بنية موثوقة للأوامر النصية في Kling v3 Omni Video تتكون من خمسة عناصر:
[من] + [ماذا يفعل] + [أين] + [مصدر الضوء] + [توجيه الكاميرا]
- من: صف المظهر الجسدي باختصار. "امرأة في الثلاثينيات من عمرها بشعر قصير داكن وسترة كتان" أفضل من "امرأة" فقط. كلما كان وصف الشخص أدق، كان الشخص أكثر اتساقًا عبر الإطارات.
- ماذا يفعل: استخدم أفعالًا نشطة ومحددة. "يسكب القهوة ببطء في فنجان خزفي أبيض" أفضل من "يعدّ القهوة". يمنح الفعل والمفعول به معًا النموذج مسار حركة محددًا يتبعه.
- أين: أدرج ملمس الأسطح وإشارات العمق والمقياس. "زقاق باريسي ضيق بأرصفة حجرية مبللة، ومبانٍ حجرية شاهقة على الجانبين، وشرفة مقهى ظاهرة في الخلفية" يمنح النموذج بيانات مكانية كافية لبناء عمق ومنظور دقيقين.
- مصدر الضوء: حدّد الاتجاه والجودة. "ضوء بعد الظهر الدافئ من اليسار، يُلقي ظلالًا طويلة على الأرضية" يتفوق على "يوم مشمس" لأنه يمنح النموذج زاوية إضاءة محددة يطبقها بثبات.
- الكاميرا: استخدم مصطلحات سينمائية حقيقية. "لقطة واسعة تعريفية تقترب ببطء إلى لقطة متوسطة مقرّبة" أفضل من "الكاميرا تتقدم للأمام". النموذج تلقّى تدريبًا على اللغة السينمائية ويستجيب لها بدقة.
ما يجب تجنبه في الأوامر النصية
بعض عادات الأوامر النصية التي تنجح جيدًا مع مولّدات الصور تضر فعليًا بمخرجات فيديو الذكاء الاصطناعي. إدراك ذلك يوفّر الكثير من التوليدات الفاشلة:
- كلمات الأسلوب دون تحديد بصري مثل "سينمائي" أو "واقعي كالصور الفوتوغرافية" غامضة جدًا بالنسبة إلى نموذج الفيديو. صف الجودة البصرية الفعلية بدلًا من ذلك: "مصوّر بفيلم 35 ملم بحبيبات طبيعية وعمق ميدان ضحل."
- تكديس الصفات دون سياق. "غروب جميل مذهل رائع" يُقرأ على أنه ضجيج بالنسبة إلى النموذج. أما "غروب بدرجات كهرمانية ووردية، والشمس على ارتفاع 10 درجات فوق الأفق، وغيوم مضاءة من حوافها" فينجح لأنه يمنح النموذج معاملات بصرية فعلية يطبقها.
- طلب مواقع كاميرا متناقضة. وصف لقطة مقرّبة ولقطة تعريفية واسعة في الوقت نفسه يخلق التباسًا مكانيًا لا يستطيع النموذج حله بتماسك.
- ازدحام المشهد بأشخاص كثيرين وأفعال متزامنة. يتعامل Kling v3 Omni Video مع شخص إلى ثلاثة أشخاص نشطين بشكل جيد. وإذا زاد العدد عن ذلك، يبدأ تماسك الحركة بالتفكك، خاصة في المشاهد ذات الحركة السريعة.

حالات استخدام واقعية تنجح
معرفة طريقة عمل النموذج مفيدة. لكن رؤية الأماكن التي يحقق فيها قيمة ثابتة فعلًا أكثر فائدة. تمثل حالات الاستخدام الثلاث هذه المجالات التي أثبت فيها Kling 3.0 Omni نفسه في سير عمل إنتاج حقيقي.
محتوى وسائل التواصل الاجتماعي
يستخدم صنّاع المحتوى القصير Kling v3 Omni Video لتوليد لقطات B-roll كانت ستتطلب تصويرًا في مواقع وطاقمًا كاملًا. يمكن لعلامة تجارية للياقة البدنية توليد مقاطع لشخص يتمرن في بيئات متنوعة دون حجز يوم إنتاج واحد. ويمكن لحساب سفر إنتاج لقطات تعريفية لمدن دون أن يكون في تلك المدن. ويمكن لعلامة تجارية لنمط الحياة إنتاج محتوى موسمي دون إعادة التصوير كل ربع سنة.
يعني دعم نسبة العرض إلى الارتفاع 9:16 أن المخرجات تُدرج مباشرة في Instagram Reels وTikTok وYouTube Shorts دون قص أو إعادة تنسيق. وبالنسبة إلى الحسابات التي تنشر عدة مرات أسبوعيًا، فإن توفير الوقت كبير.
فيديوهات عرض المنتجات
مدخل الصورة المرجعية قوي بشكل خاص لمحتوى المنتجات. ارفع صورة منتج نظيفة، وصف البيئة وحركة الكاميرا في الأمر النصي، وسيولّد النموذج مقطعًا يُظهر المنتج في سياقه. زجاجات العطور على منضدات رخامية، والأحذية الرياضية على أرصفة خارجية، وأكواب القهوة في ضوء الصباح، ومنتجات العناية بالبشرة على أرفف الحمامات: كلها ممكنة بأمر نصي منظم جيدًا وصورة مرجعية نظيفة للمنتج.

ما كان يتطلب في السابق حجز استوديو ومنسّقًا للأدوات ومصوّرًا وطاقم فيديو، يمكن الآن نمذجته أوليًا في أقل من ساعة. قد تذهب المخرجات النهائية إلى تصوير حقيقي للمحتوى الرئيسي، لكن مرحلتي الابتكار والموافقة تتسارعان بشكل كبير عندما يتمكن العملاء من الاستجابة لصور متحركة بدلًا من لوحات مزاج ثابتة.
مشاهد الأفلام القصيرة
يستخدم صنّاع الأفلام المستقلون Kling v3 Omni Video إلى جانب Kling v3 Motion Control لنمذجة تكوينات المشاهد قبل الالتزام بالإنتاج. ولّد المشهد بالذكاء الاصطناعي أولًا، وراجع التأطير وديناميكيات الحركة، ثم صوّر بممثلين حقيقيين مستخدمًا مخرجات الذكاء الاصطناعي مرجعًا بصريًا للمخرج ومدير التصوير.
يغيّر سير العمل هذا مرحلة ما قبل الإنتاج بشكل جوهري. فالتخطيط المصوّر يصبح تفاعليًا بدلًا من أن يكون ثابتًا. يمكنك اختبار ثلاثة أساليب مختلفة للكاميرا في المشهد نفسه في الوقت الذي يستغرقه رسم لوحة واحدة من لوحات التخطيط المصوّر. القرارات التي كانت تُتخذ في موقع التصوير تُتخذ الآن قبل وصول أي شخص إلى الموقع.
نماذج Kling أخرى تستحق التجربة
تغطي عائلة Kling على PicassoIA نطاقًا واسعًا من حالات الاستخدام يتجاوز v3 Omni. مطابقة النموذج المناسب للمهمة المناسبة أهم من اللجوء دائمًا إلى النموذج الرائد:
إذا كان سير عملك يعتمد على تحريك صور موجودة أكثر من توليد مشاهد من الصفر، فإن Kling v2.6 Motion Control يستحق التجربة إلى جانب Kling 3.0 Omni. يكمّل النموذجان بعضهما بشكل جيد عبر مراحل مختلفة من سير عمل إنتاج الفيديو.

ابدأ الإنشاء باستخدام Kling 3.0 Omni
يرفع Kling 3.0 Omni سقف ما هو ممكن في توليد فيديو الذكاء الاصطناعي من أمر نصي واحد. فبنية Omni وتحسين نمذجة الفيزياء ودعم الإدخال متعدد الوسائط تتضافر لتشكيل أداة تسرّع سير عمل إنتاج الفيديو فعلًا، لا أداة تنتج مقاطع عرض مبهرة لكنها عديمة الفائدة في خط إنتاج حقيقي.
أقوى الأوامر النصية هي تلك المحددة والموجّهة كالمخرج والمستندة إلى لغة بصرية حقيقية. ابدأ ببنية الشخص والفعل والبيئة والضوء والكاميرا، واختبر بالجودة القياسية قبل الالتزام بمخرجات الدقة العالية، واستخدم مدخل الصورة المرجعية كلما احتجت إلى تثبيت المشهد في موقع أو منتج محدد.
توجّه إلى Kling v3 Omni Video على PicassoIA وأدخل أمرًا نصيًا حقيقيًا، شيئًا من مشروع فعلي تعمل عليه الآن. ستُظهر لك النتائج بالضبط أين يناسب سير عملك وأين ستحتاج إلى طاقم تصوير. تمنحك مكتبة PicassoIA الكاملة من نماذج تحويل النص إلى فيديو مرونة مطابقة النموذج المناسب لكل مهمة. Kling 3.0 Omni هو النموذج الرائد حاليًا، لكن الأداة الصحيحة تعتمد دائمًا على المخرجات المحددة التي تسعى إليها.