Kling 3.0: ما الذي تغيّر عن 2.6 وما الذي يمكنك فعله الآن

يمثّل الإصدار 3.0 من Kling AI قطيعة واضحة مع 2.6، إذ يقدّم توليفًا أدق للحركة، والتزامًا أفضل بالأوامر النصية، ومدد فيديو أطول، وثلاثة إصدارات متخصصة من النموذج. يستعرض هذا المقال كل تغيير مهم بين النسختين، وما يعنيه لفيديوهاتك، وكيف تستفيد منه اليوم.

Kling 3.0: ما الذي تغيّر عن 2.6 وما الذي يمكنك فعله الآن
Cristian Da Conceicao
مؤسس Picasso IA

تُصدر Kling إصدارات جديدة بوتيرة يصعب مواكبتها. وصل الإصدار 2.6 قبل 3.0 بأشهر قليلة، وكان يُعدّ بالفعل من أقوى نماذج تحويل النص إلى فيديو المتاحة. لذلك، حين طُرح Kling v3 Video، لم يكن السؤال "هل هو أفضل؟" بل "في أي جوانب تحديدًا، وهل يغيّر طريقة عملي؟". بعد اختبار النسختين جنبًا إلى جنب على عشرات الأوامر النصية، تبيّن أن الفروق حقيقية وقابلة للقياس، وتستحق المعرفة قبل أن تقرر أي نموذج تستخدمه في سير عملك.

امرأة شابة تسير ببطء عبر حقل قمح مغمور بضوء الشمس في الساعة الذهبية

ما هو Kling 3.0 فعليًا

الفريق الذي يقف وراءه

يأتي Kling v3 Video من Kuaishou، منصة الفيديوهات القصيرة الصينية. تعمل Kuaishou على تطوير عائلة هذا النموذج بوتيرة مكثفة منذ الإصدار 1.0، ويمثل الانتقال من الإصدارات 2.x إلى 3.0 إعادة بناء معمارية حقيقية وليس مجرد تحديث بسيط. ينقسم النموذج الآن إلى ثلاثة إصدارات متمايزة، كل منها مُحسَّن لسير عمل إبداعي مختلف، وهو في حد ذاته تغيير هيكلي كبير مقارنة بالإصدارات السابقة.

لماذا كان 2.6 أساسًا قويًا

كان Kling v2.6 مبهرًا حقًا بمقاييس زمنه. تعامل مع مخرجات 1080p، وأنتج حركة سلسة في المشاهد البسيطة، واستجاب بشكل معقول للأوامر المباشرة. أما المشكلات المتكررة فكانت: انهيار المشاهد المعقدة التي تضم عدة أشخاص، وحركات الكاميرا السريعة التي تسبب تشوهات الشبح (ghosting)، والتعليمات الدقيقة حول التأطير أو سلوك الشخص التي يتم تجاهلها جزئيًا. ويستهدف الإصدار 3.0 تقريبًا نقاط الألم نفسها، ما يجعل المقارنة بين النسختين مفيدة بشكل خاص.

معرفة أوجه قصور 2.6 تدلّك أيضًا على ما يجب أن تنظر إليه أولًا عند تقييم 3.0. إذا كانت إحباطاتك الحالية مع توليد الفيديو بالذكاء الاصطناعي تتعلق بحركة غير متوقعة، أو ملمس ناعم أكثر من اللازم، أو أوامر لا تُنفَّذ إلا جزئيًا، فهذه هي الأقسام الأكثر صلة بك في هذا المقال.

الإصدارات الثلاثة الجديدة للنموذج

من أهم التغييرات البنيوية في Kling 3.0 إدخال ثلاثة إصدارات متمايزة للنموذج. فبينما كان Kling v2.6 نموذجًا واحدًا بمستويات جودة مختلفة، ينقسم الإصدار 3 إلى أدوات متخصصة مبنية على حالات استخدام محددة.

منظر جوي من أعلى لقرية صيد ساحلية عند الفجر بأسطح قرميدية وميناء بلون التركواز

Kling v3 Video

يُعدّ Kling v3 Video الأداة الأساسية لتحويل النص إلى فيديو في التشكيلة الجديدة. يأخذ الأوامر النصية ويولّد مقاطع سينمائية بترابط حركي محسّن ووضوح أساسي أعلى من v2.6. هذا هو الإصدار الذي سيلجأ إليه معظم المستخدمين في المشاريع العامة: عروض المنتجات، ومحتوى وسائل التواصل الاجتماعي، والمشاهد السردية، وأي عمل يعتمد فقط على وصف نصي.

Kling v3 Motion Control

يكتسب Kling v3 Motion Control أهميته الخاصة هنا. يمنحك هذا الإصدار تحكمًا منظمًا في طريقة حركة الأشخاص والكاميرات داخل المشهد. في 2.6، كان يُوصف تحرك الكاميرا في الأمر النصي ثم يُفسَّر بشكل فضفاض. أما في v3 Motion Control، فتُحترم معاملات الحركة بدقة أكبر بكثير، وهذا مهم جدًا لمن يبنون تسلسلات مرسومة مسبقًا (storyboard) أو يحاولون الحفاظ على الاتساق البصري عبر لقطات متعددة.

Kling v3 Omni Video

يُعدّ Kling v3 Omni Video الأوسع بين الإصدارات الثلاثة. يتعامل مع مسارات تحويل النص إلى فيديو وتحويل الصورة إلى فيديو معًا، ما يجعله مفيدًا حين تملك نقطة بداية بصرية وتريد تحريكها. وتعكس تسمية "omni" أنه يقبل أنواعًا أكثر من المدخلات دون الحاجة إلى التنقل بين أدوات منفصلة، ما يبسّط سير العمل الذي يجمع بين إنشاء المحتوى الأصلي وتحريك الأصول الموجودة.

جودة الحركة: القفزة الأكبر

إذا شغّلت الأمر النصي نفسه على v2.6 وv3 Video، فستلاحظ فرق جودة الحركة خلال الثانية الأولى. ينتج الإصدار 3.0 حركة تبدو مقصودة ومنطقية فيزيائيًا. لا تنجرف الأشخاص ولا تتأرجح بين الإطارات. يبدو الوزن والقصور الذاتي صحيحين عندما تمشي الشخصية أو تمدّ يدها أو تدير رأسها.

نهر جبلي شديد الصفاء يتدفق فوق حجارة مغطاة بالطحالب مع قطرات ماء مجمّدة في الهواء

الاتساق من إطار إلى إطار

الترابط الزمني (temporal coherence) هو المصطلح التقني لمدى ظهور الفيديو كأنه المشهد نفسه من إطار إلى آخر. وفي توليد الفيديو بالذكاء الاصطناعي، هنا تحديدًا تستمر معظم النماذج في المعاناة. مع 2.6، كانت الخلفيات المعقدة والعناصر الثانوية مثل الحشود والأوراق والماء تتحرك أو تنبض بطرق خفية تكسر الانغماس. قد يبدو الشخص الرئيسي في المقدمة جيدًا، لكن تفاصيل الخلفية كانت تحمل طابعًا مضطربًا يبدو مصطنعًا.

في 3.0، تحافظ هذه العناصر الثانوية على ثباتها بشكل أكبر بكثير. تبقى الحشود حشودًا، ويجري الماء في الاتجاه نفسه، ولا تقفز الظلال بين الإطارات. يبرز هذا التحسن أكثر في المقاطع الأطول: عند علامة الثانية الخامسة في توليد من 2.6، كنت غالبًا تلاحظ انجرافًا متراكمًا. في 3.0، يبدو الإطار الأخير وكأنه ينتمي إلى اللقطة المتصلة نفسها التي بدأت بالإطار الأول.

بالنسبة للمحتوى الذي يعيش على وسائل التواصل الاجتماعي أو في العروض المهنية، يكفي هذا الفرق في ثبات الخلفية وحده ليكون مهمًا. إنه الفرق بين مقطع يشدّ الانتباه ومقطع يشتّت المشاهد بخفاء.

كيف تغيّرت حركة الإنسان

كانت حركة الإنسان أوضح نقاط الضعف في إصدارات Kling السابقة. الإصدار 2.6 تحسّن كثيرًا عن 2.0، لكن خطوات المشي كانت تتعثر أحيانًا، وكان تفصيل اليدين والأصابع غير متسق في أحسن الأحوال. كانت اللقطات المقرّبة لأشخاص يمسكون أشياء من أصعب اللقطات إنجازًا على الإطلاق.

في الإصدار 3.0، تصبح حركة الأطراف أنعم وأقرب إلى المنطق البيولوجي. تصمد أفضل طوال مدة المقطع الكاملة حركات الجري والإشارات باليدين، وحتى تعابير الوجه الخفيفة. ويبدو أن النموذج يملك تمثيلات داخلية أفضل لكيفية حركة أجسام البشر في الفضاء ثلاثي الأبعاد، وهو ما يظهر في انتقال الوزن والزخم بشكل أكثر طبيعية.

💡 إذا كنت تولّد أشخاصًا يمشون أو يركضون أو يتفاعلون، فالتحسن في 3.0 واضح فورًا. جرّب الأمر النصي نفسه في النسختين قبل أن تلتزم بسير عمل معين.

الدقة البصرية والوضوح

لقطة مقرّبة جدًا لعين بشرية بقزحية كهرمانية-بندقية دافئة وتفاصيل حادة للرموش

مخرجات أوضح في كل المجالات

قدّم الإصدار 2.6 مخرجات 1080p جيدة. يرفع الإصدار 3.0 السقف أعلى، مع تفاصيل أوضح بشكل ملحوظ على مستوى كل إطار عبر المقطع. تُصيَّر التفاصيل الدقيقة للأقمشة ونسيج الملابس والأوراق والبشرة بدقة أكبر. وهذا تحسّن في الدقة جزئيًا، لكنه أيضًا مكسب جوهري في طريقة تعامل النموذج مع تفاصيل السطح داخل كل إطار على حدة.

يظهر الفرق العملي بأوضح صورة في اللقطات المقرّبة والمتوسطة. حيث كان 2.6 ينتج لقطة مقرّبة للوجه تبدو ناعمة قليلًا، ينتج 3.0 صورة تبدو فوتوغرافية حقًا.

الميزةKling v2.6Kling v3
أقصى دقة1080p1080p+ (تصيير أوضح)
حدة الإطارجيدةأعلى بوضوح
تفاصيل البشرة والملمسمتوسطةعالية
تفاصيل الخلفيةمقبولةتفاصيل دقيقة متسقة
ثبات الحركةجيدعالٍ جدًا
التعامل مع عدة أشخاصغير متسقتحسّن كبير

تصيير الملمس والإضاءة

تحسّن اتساق الإضاءة عبر الإطارات بشكل ملحوظ أيضًا. في 2.6، إذا احتوى المشهد على ضوء اتجاهي قوي، مثل غروب الشمس أو مصباح داخلي واحد، فقد يتغيّر موضع مصدر الضوء أو شدته الظاهرة بين الإطارات. في 3.0، يحافظ على موضعه طوال المقطع. وهذا يجعل إعدادات الإضاءة السينمائية عملية بطريقة لم تكن ممكنة من قبل.

الخيارات الأسلوبية التي كانت تتطلب تكرارًا كبيرًا لتنجح، مثل الإضاءة الخلفية الحافة (rim lighting)، وضوء النافذة، والمشاهد المضاءة بالشموع، صارت تعطي نتائج أكثر موثوقية، وتنجح من المحاولة الأولى أو الثانية. وهذا مهم بشكل خاص لفيديوهات المنتجات ومحتوى الأزياء، حيث يكون الضوء المتسق والمُجمِّل متطلبًا أساسيًا.

الالتزام بالأوامر النصية أخيرًا يعمل

لقطة مقرّبة لرجل يرتدي سترة عنق رمادية يحدّق بتركيز في شاشة كبيرة تعرض موجات ألوان

كان ضعف الالتزام بالأوامر النصية أكثر القيود إحباطًا في v2.6. كان بإمكانك كتابة أمر دقيق ومنظم جيدًا، فينتج النموذج شيئًا قريبًا مما وصفته، لكن مع تفاصيل محددة خاطئة أو غائبة. وكلما زاد تعقيد التعليمات، زادت احتمالية تجاهل أجزاء منها.

المشاهد المعقدة تُصيَّر بشكل صحيح الآن

يحسّن الإصدار 3.0 تنفيذ التعليمات بشكل جوهري. عندما تصف فعلًا محددًا، وإعدادًا محددًا، وأسلوبًا بصريًا محددًا، يعكس المخرج الثلاثة جميعًا بدقة أعلى بشكل ملحوظ. هذا هو الفرق بين نموذج يولّد "شيئًا يشبه أمرك تقريبًا" ونموذج ينفّذ فعلًا ما كتبته.

💡 في 3.0، اكتب أوامر نصية أكثر تحديدًا. صار النموذج قادرًا على الاستفادة من هذه الدقة. الأوامر العامة ما زالت تنتج مخرجات مقبولة، لكن الأوامر المفصّلة تنتج الآن نتائج أفضل بكثير مما كانت عليه في v2.6.

تعمل الأوامر التي تصف تفاعلات محددة بين الأشخاص بشكل أفضل كثيرًا. كان أمر مثل "امرأة تناول كوب قهوة لرجل يرتدي سترة صفراء" من نوع التعليمات متعددة الأشخاص التي يُفسدها 2.6 غالبًا، فينتج شخصين في الإطار الصحيح دون أن يتضح التفاعل المقصود. في 3.0، يبقى هذا التفاعل متماسكًا.

الأوامر متعددة الأشخاص

مع v2.6، كانت المشاهد التي تضم شخصين تنتج غالبًا تشوهات بصرية غريبة: أشخاص يندمجون لفترة وجيزة، أو شخص يفقد هويته البصرية المحددة عبر الإطارات. يتعامل الإصدار 3.0 مع الأوامر متعددة الأشخاص بشكل أفضل بكثير. يحتفظ كل شخص بهويته البصرية بثبات أكبر طوال المقطع، وتبدو التفاعلات بينهم طبيعية لا عرضية.

هذا التحسن مهم بشكل خاص لمشاهد الحوار، ومحتوى الرياضة الذي يضم شخصين أو أكثر، وأي محتوى تجاري تحتاج فيه عدة منتجات أو شخصيات بشرية إلى التواجد بوضوح في الإطار نفسه.

التحكم بالكاميرا يصبح جادًا

مصوران محترفان يقفان على حافة صخرية ساحلية عند الساعة الذهبية مع أمواج محيط تتكسر في الأسفل

حركات الكاميرا المبرمجة

قدّم Kling v2.6 Motion Control تعليمات لحركة الكاميرا، لكنها كانت تُفسَّر بشكل فضفاض. قد يُنتج أمر يطلب دفعة بطيئة بالكاميرا (dolly push-in) شيئًا يشبه التكبير (zoom)، أو تكون سرعة الحركة غير متسقة طوال مدة المقطع.

يعامل Kling v3 Motion Control تعليمات الكاميرا بدقة أكبر بكثير. تتطابق سرعة pan وزاوية tilt وسلوك التتبع بشكل أوثق مع ما تصفه. وهذا ذو قيمة خاصة لصنّاع المحتوى الذين يبنون تسلسلات متعددة اللقطات يعتمد اتساقها البصري على سلوك كاميرا متسق من مقطع إلى آخر.

Pan و Tilt والتتبع في الأوامر النصية

في v3 Motion Control، يمكنك وصف سلوك الكاميرا بثقة معقولة أنه سيُحترم. فالتعليمات مثل: pan بطيء لليسار، ولقطة تتبع تلاحق شخصًا، ودفعة نحو لقطة مقرّبة، صارت تنتج الآن حركة قريبة جدًا مما تقصده.

حركة الكاميرادقة v2.6v3 Motion Control
Pan يسارًا/يمينًاتقريبيةعالية
Tilt لأعلى/لأسفلغالبًا ما تُتجاهلتُحترم
Push-in / dollyتفسير فضفاضتطابق قريب
تتبع شخصغير متسقتحسّن ملحوظ
Orbit / لقطة دائريةنادرًا ما تكون صحيحةأدق

لكل من يبني فيديوهات للعلامات التجارية، أو تسلسلات الفيديوكليب، أو أي محتوى يكون فيه تكوين اللقطة وتصميم حركة الكاميرا خيارين إبداعيين مقصودين، يمثّل v3 Motion Control تحسينًا حقيقيًا في سير العمل.

السرعة والكفاءة

فريق إنتاج أفلام محترف في استوديو داخل مستودع مع أضواء تنغستن دافئة ومخرج يراجع التشغيل

زمن التوليد مقارنة بالإصدار 2.6

لا يضحّي الإصدار 3.0 بسرعة التوليد مقابل تحسينات الجودة. في معظم الحالات، تكون أزمنة التوليد قريبة من v2.6. قد يستغرق إصدار Kling v3 Omni Video وقتًا أطول قليلًا بسبب تعامله الأوسع مع المدخلات، لكن نموذج v3 Video القياسي يعمل بالوتيرة نفسها تقريبًا لسلفه.

بالنسبة لسير العمل عالي الحجم، يهم هذا كثيرًا. الحصول على مخرجات أفضل دون طوابير أطول يعني أن v3 ترقية مباشرة بلا أي مقايضة في الإنتاجية.

اختيار الإصدار المناسب

يعني تقسيم الإصدار 3 إلى ثلاثة نماذج أن تكون مقصودًا في اختيار الإصدار. اللجوء إلى v3 Video افتراضيًا يناسب معظم حالات تحويل النص إلى فيديو. وحين تكون حركة الكاميرا أولوية، يكون v3 Motion Control الخيار الصحيح. وعند البدء من صورة موجودة، يتولى v3 Omni Video مسار تحويل الصورة إلى فيديو بكفاءة. اختيار الإصدار الخاطئ لا ينتج نتائج كارثية، لكن اختيار الإصدار الصحيح ينتج نتائج أفضل بوضوح.

كيف تستخدم Kling v3 على PicassoIA

امرأة ذات شعر مجعد داكن تبتسم أمام شاشة لابتوب في ضوء شمس الصباح الدافئ وهي جالسة على سرير كتان أبيض

يتيح لك PicassoIA الوصول إلى الإصدارات الثلاثة من Kling v3 دون الحاجة إلى إعداد أي API. إليك كيفية الاستفادة منها بكفاءة.

الخطوة 1: اختر الإصدار المناسب

ابدأ بتحديد سير العمل الذي ينطبق على مشروعك:

الخطوة 2: اكتب أوامر نصية محددة

بالنظر إلى تحسّن الالتزام بالأوامر النصية في 3.0، اكتب تعليمات أكثر تفصيلًا مما كنت ستستخدمه في 2.6. صِف الشخص، والفعل، والمحيط، والإضاءة، وموضع الكاميرا معًا.

بنية الأمر النصي التي تعمل جيدًا مع Kling v3:

[Subject] + [Action] + [Environment] + [Lighting] + [Camera angle and movement]

مثال: "امرأة ترتدي سترة كتان حمراء تسير بخطى واثقة عبر ساحة حجرية مبللة بالمطر عند الغسق، إضاءة مصباح دافئة من الجهة اليسرى، لقطة تتبع واسعة على مستوى العين تتحرك ببطء من اليسار إلى اليمين"

الخطوة 3: صِف سلوك الكاميرا صراحةً

عند استخدام Kling v3 Motion Control، حدّد الاتجاه والسرعة ونوع الحركة مباشرة. تنجح عبارة "pan بطيء لليمين"، وتنجح عبارة "دفعة سينمائية نحو وجه الشخص" أكثر. يستخدم النموذج هذه الأوصاف بأمانة أكبر بكثير مما كان يفعل سلفه.

الخطوة 4: كرّر بقابلية للتنبؤ

حتى مع تحسن الالتزام في 3.0، تبقى المخرجات الأولى نقطة انطلاق لا منتجًا نهائيًا. عدّل الأوامر بناءً على ما ينتجه النموذج. ولأن 3.0 يتبع التعليمات بأمانة أكبر، فإن تعديلات صغيرة في الأمر تنتج نتائج أكثر قابلية للتنبؤ. أنت تتكرر نحو هدف محدد بدلًا من التخمين.

💡 يتيح لك PicassoIA تشغيل عدة إصدارات من Kling على الأمر النصي نفسه للمقارنة المباشرة. ولّد باستخدام v3 Video وv3 Motion Control بالتوازي لترى أيهما يخدم مشروعك بشكل أفضل.

يستحق الانتقال

امرأة ترتدي معطفًا تفصيليًا لونه جملي تقف تحت عمود إنارة حديدي كلاسيكي في شارع مدينة مبلل بالمطر ليلًا

الفجوة بين Kling v2.6 والإصدار 3.0 ليست مجرد تحسين طفيف. فاجتماع تماسك زمني أفضل، والتزام أعلى بكثير بالأمر النصي، وتحكم منظم في الكاميرا، وتفاصيل بصرية أكثر حدة يعني أن مقاطع الفيديو التي كانت تتطلب ثلاث أو أربع محاولات في 2.6 تنجح الآن في محاولة أو محاولتين. ويتراكم هذا الأثر بسرعة مع أي حجم من إنتاج المحتوى.

أكثر سير العمل تأثرًا بهذه الترقية مباشرة:

  • فيديوهات المنتجات ذات الإخراج والحركات الكاميرا المحددة صارت تعمل بموثوقية
  • مقاطع وسائل التواصل الاجتماعي التي تضم أشخاصًا تبدو أكثر صقلًا دون محاولات إضافية
  • التسلسلات المرسومة مسبقًا ذات السلوك الثابت للكاميرا صار إنتاجها عمليًا
  • تحريك الصور عبر v3 Omni Video يمنح الأصول البصرية الموجودة حركة حقيقية

إذا كنت تستخدم v2.6 كخيار افتراضي، فإن الحجة للانتقال إلى v3 Video واضحة: تحسينات الجودة حقيقية، وسرعة التوليد قريبة، وبنية الإصدارات الثلاثة تقلل التخمين في عمليتك.

أفضل طريقة للتحقق من ذلك لحالتك الخاصة هي تشغيل أوامرك الحالية عبر Kling v3 Video على PicassoIA ومقارنة النتائج مباشرة. الإصدارات الثلاثة متاحة كلها على المنصة إلى جانب عشرات نماذج الفيديو الرائدة الأخرى مثل Seedance 2.0، وVeo 3، وSora 2. سواء بقيت مع Kling أو أردت مقارنته بالمنافسين، يجمع PicassoIA كل الخيارات في مكان واحد دون الحاجة إلى إعداد أي API.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة