غيّر Kling معنى توليد الفيديو بالذكاء الاصطناعي. فتحديث O3، أطمح إصدارات KwaiVGI حتى الآن، لا يكتفي بإضافة معاملات جديدة إلى نظام قائم، بل يعيد بناء مسار التشغيل الأساسي بطبقة استدلال مستعارة من بنية النماذج اللغوية، والنتائج واضحة فورًا لكل من استخدم الإصدارات السابقة. الحركة تبدو واقعية. الأوامر النصية تُحترم بطرق لم تكن ممكنة من قبل. والفجوة بين "ما وصفته" و"ما حصلت عليه" بدأت أخيرًا تضيق.

ما هو Kling O3 فعليًا
تحمل تسمية "O" في Kling O3 دلالة محددة. فقد استعارت KwaiVGI نمط تسمية يشير إلى توليد معزّز بالاستدلال، على غرار ما بدأت مختبرات أخرى تمييزه بين النماذج التوليدية الخام وتلك التي تضيف حوسبة إضافية وقت الاستدلال. مع O3، أصبح مسار توليد الفيديو في Kling يُجري استدلالًا متعدد الخطوات حول أمرك النصي قبل توليد أي إطار.
وهذا مهم لأن نماذج تحويل النص إلى فيديو التقليدية تفسر الأوامر في تمريرة أمامية واحدة. ترى كلماتك وتبدأ فورًا بالتنبؤ بالبكسلات. وعندما تكون الأوامر معقدة، تفشل هذه الأنظمة في التفاصيل: تستدير الشخصية في الاتجاه الخاطئ، وتنهار الفيزياء في النصف الثاني من المقطع، ويختفي الإضاءة الموصوفة بعد ثلاث ثوانٍ. يعالج Kling O3 هذه المشكلة على مستوى البنية، لا عبر المعالجة اللاحقة.
التحوّل في تسمية سلسلة O
تمثل تسمية سلسلة O عتبة داخلية واضحة لدى KwaiVGI. فالإصدارات السابقة من Kling، بما فيها Kling v2.1 Master وKling v2.6، كانت تحسينات على البنية الأساسية نفسها. أما O3 فهو أول إصدار يدمج ما تصفه KwaiVGI بطبقة "حل النية": نموذج ثانوي يحلل الأمر النصي، ويحدد الغموض، ويبني مخططًا داخليًا للمشهد قبل بدء التوليد.
تغييرات البنية الأساسية
ثلاثة تغييرات تحدد ما هو مختلف في الداخل:
- تمريرة حل النية: يُحلَّل الأمر النصي ويُفكَّك إلى عناصر المشهد (الشخص، والحركة، والبيئة، والإضاءة، وحركة الكاميرا) قبل بدء التوليد.
- نمذجة الحركة المدركة للفيزياء: وحدة محاكاة فيزيائية تقيّد حركة القماش والشعر والسوائل والأجسام الصلبة لتبدو واقعية طوال مدة المقطع كاملة.
- تماسك زمني ممتد: يحافظ النموذج على ثبات الشخص والبيئة عبر مقاطع مدتها 10 ثوانٍ، لا 5 ثوانٍ فقط.
هذه ليست ادعاءات تسويقية. فهي قابلة للقياس في المخرجات. شخصية تمشي تحت المطر، وُصفت مرة واحدة، تبقى مبتلّة ومتسقة طوال المقطع. ويد تلتقط كوبًا تحترم الجاذبية وفيزياء القبضة دون الحاجة إلى أوامر سلبية.
ميزات جديدة تستحق المعرفة

فيزياء الحركة والواقعية
هذا هو التحسن الأبرز، وهو يظهر في كل فئة من فئات المخرجات. فقد أنتج Kling v2.5 Turbo Pro نتائج ممتازة للأشخاص الثابتين أو المتحركين ببطء، لكنه تعثر أمام الحركة السريعة ومشاهد الحشود والتفاعلات بين أجسام متعددة. أما O3 فيتعامل مع الحالات الثلاث بعدد أقل ملحوظ من العيوب.
تحسينات محددة ستلاحظها:
| نوع الحركة | أداء v2.6 | أداء O3 |
|---|
| الشعر والقماش في الريح | ارتعاش متقطع | سلس ومتسق فيزيائيًا |
| السوائل والمائع | غالبًا مسطحة وثابتة | تموجات ورذاذ واقعي |
| حشد من عدة أشخاص | انحراف في الهوية بعد 3 ثوانٍ | ثابت طوال المقطع كاملًا |
| حركة الكاميرا السريعة | تفاوت في ضبابية الحركة | بانورama سينمائية نظيفة |
| تفاصيل اليد والأصابع | تشوه شائع | دقة عالية في معظم اللقطات |
ملاحظة: تختلف النتائج حسب تعقيد الأمر النصي والشخص. لا تزال مشاهد الحشود الكثيفة التي تضم أكثر من 8 أشخاص تُظهر تراجعًا في التماسك بعد 7 ثوانٍ.
مدد مقاطع أطول
كانت الإصدارات السابقة من Kling تصل بثبات إلى 5 ثوانٍ فقط لمخرجات بجودة احترافية. وكانت مقاطع 10 ثوانٍ متاحة لكنها جاءت على حساب الاتساق: كانت الشخصيات تنحرف، والخلفيات تتغير، وغالبًا ما كان النصف الثاني من المقطع يبدو وكأنه توليد مختلف تمامًا.
يمدّ O3 المدة الموثوقة إلى 10 ثوانٍ دون هذا التنازل. فنظام التماسك الزمني يحافظ على أمانة المشهد من الإطار الأول حتى الإطار المئتين والأربعين. وبالنسبة للإنتاج التجاري، فهذا أمر بالغ الأهمية. فلقطة مولّدة بالذكاء الاصطناعي مدتها 10 ثوانٍ تُعد مقطعًا قابلًا للاستخدام فعليًا، لا مجرد حلقة قصيرة.
التزام أفضل بالأوامر النصية
تحدث طبقة حل النية أكبر أثر ملموس على الالتزام بالأوامر النصية. فالاختبار على 50 أمرًا نصيًا يُظهر أن أوصاف المشاهد المعقدة تُحترم بنسبة أعلى بنحو 40 بالمئة من v2.6. وعناصر محددة كانت تتطلب حلولًا التفافية صارت تعمل من المحاولة الأولى:
- زوايا كاميرا مسمّاة (ميل هولندي، لقطة تتبع بزاوية منخفضة، من فوق الكتف)
- ظروف إضاءة موصوفة (ضوء منتشر غائم، شمس الظهيرة القاسية، ضوء مصباح عملي)
- علاقات بين الأشخاص ("يقف على بعد ثلاثة أقدام خلفه"، "ينظر بعيدًا عن الكاميرا")
- تعليمات زمنية ("يتوقف، ثم يواصل المشي")
دمج الصوت الأصلي
يتضمن O3 أول طبقة متكاملة لتوليد الصوت لدى Kling. فالإصدارات السابقة كانت تتطلب تركيبًا صوتيًا منفصلًا ومزامنة يدوية. مع O3، يمكن تحديد الأصوات المحيطة والمؤثرات الصوتية والخلفيات الموسيقية في الأمر النصي، وتوليدها مع الفيديو في الوقت نفسه. ودقة المزامنة، خصوصًا لوقع الخطوات والأصوات البيئية، قوية بما يكفي للاستخدام في مونتاج أولي دون معالجة لاحقة إضافية.
Kling O3 مقارنةً بالإصدارات السابقة

O3 مقابل v2.6 جنبًا إلى جنب
كان Kling v2.6 بالفعل أقوى إصدار في سلسلة v2، مع مخرجات 1080p محسّنة وتعامل أفضل مع حركة الكاميرا مقارنةً بـ Kling v2.1. والقفزة من v2.6 إلى O3 أكبر من أي خطوة سابقة بين الإصدارات.
أبرز الفروقات الملحوظة:
- ثبات الشخص عند 10 ثوانٍ: ينحرف v2.6 بوضوح ابتداءً من الإطار 90. أما O3 فيثبت.
- استمرارية الإضاءة: كان v2.6 يغيّر أحيانًا درجة حرارة اللون في منتصف المقطع. O3 لا يفعل ذلك.
- عرض النصوص: لا يتميز أي من الإصدارين هنا، لكن O3 يحاول عرض نصوص لم تُطلب بعدد أقل من المرات.
- سرعة التوليد: يبطؤ O3 بنحو 15 بالمئة عن v2.6 بسبب تمريرة الاستدلال. وهذا هو التراجع الوحيد.
حيث يظل v2.5 Turbo Pro هو الأفضل
يبقى Kling v2.5 Turbo Pro الخيار الأمثل لحالة واحدة محددة: المحتوى قصير الشكل بكميات كبيرة، حيث تهم السرعة أكثر من طول المقطع أو دقة الفيزياء. فبنيته التوربينية تولّد مقاطع 5 ثوانٍ أسرع من O3، وبالنسبة لمحتوى وسائل التواصل الذي سيُقص ويُحرَّر على أي حال، فإن ميزة السرعة حقيقية.
وبالنسبة لأي عمل يتطلب مدد مقاطع تتجاوز 5 ثوانٍ، أو فيزياء حركة واقعية، أو أوصافًا معقدة للمشاهد، فإن O3 هو الخيار الواضح.
حالات استخدام حقيقية تنجح

محتوى وسائل التواصل الاجتماعي
تنعكس تحسينات O3 مباشرة على جودة محتوى وسائل التواصل. فمدة 10 ثوانٍ الموثوقة تغطي معظم متطلبات المنصات القصيرة. والالتزام الأفضل بالأوامر النصية يعني إعادة توليد أقل قبل الحصول على مقطع قابل للاستخدام. وطبقة الصوت الأصلية تقلل عدد الأدوات المنفصلة اللازمة في سير عمل أساسي.
الأنسب لـ: Instagram Reels وTikTok وYouTube Shorts حيث لا يمكن تبرير التكلفة الإنتاجية للفيديو التقليدي.
ما ينجح جيدًا: اكتب أوامر نصية تحدد حركة الكاميرا بوضوح. فـ"دفعة بطيئة من متوسط اللقطة إلى القريبة" تعطي نتائج أفضل من "تكبير". وحدّد النبرة العاطفية بمصطلحات بيئية: "ضوء ناعم غائم، شارع هادئ، شخص واحد" يُقرأ بشكل أفضل من "مزاج حزين".
الإعلانات والمحتوى التجاري
هنا يبدأ O3 منافسة ميزانيات الإنتاج. فتصوير المنتجات، ولقطات أسلوب حياة العلامة التجارية، وسير العمل من لوحة الإلهام إلى الفيديو، كلها قابلة للتطبيق. يدعم Kling v3 Video مخرجات نظيفة بجمالية متسقة مع معايير العلامات التجارية، دون المعالجة المنمّقة التي تؤثر في بعض المنافسين.
💡 نصيحة: للقطات المقربة للمنتجات، أدرج مواصفات العدسة في أمرك النصي. فـ"مصوّر بعدسة ماكرو 100 مم، فتحة f/2.8، صندوق ضوء استوديو من الأعلى إلى اليسار" يمنح محلل النية قيودًا محددة تحسّن الجودة بشكل ملحوظ.
إنتاج الأفلام القصيرة
مع مقاطع 10 ثوانٍ، يصبح O3 أداة مشروعة في سير عمل صناعة الأفلام منخفضة الميزانية. يمكن للمخرجين توليد لقطات تأسيسية، ولقطات إدراجية، ولقطات قطع، ولقطات بيئية كانت ستتطلب التصوير في موقع. ويضيف إصدار Kling v3 Motion Control طبقة إضافية من التحكم في الكاميرا مفيدة بشكل خاص لتخطيط اللقطات وتصوير لوحات القصة المصورة.
مثال عملي: مشهد من فيلم قصير مدته 90 ثانية يضم 15 لقطة. بمتوسط 6 ثوانٍ لكل لقطة، تحتاج إلى 15 مقطعًا مولّدًا مختلفًا. مع تحسينات O3 في الاتساق، يرتفع احتمال أن تكون جميع المقاطع البالغ عددها 15 صالحة للاستخدام دون إعادة تصوير، وهذا يخفّض إجمالي الوقت المستثمر بشكل ملحوظ مقارنةً بتوليد v2.
تصوير المنتجات
تحصل فرق التجارة الإلكترونية والمنتجات الصناعية على قيمة فورية من تحسينات الفيزياء في O3. فإظهار كيف تتحرك قطعة قماش، وكيف تُفتح عبوة، وكيف تعمل آلية: كل ذلك يستفيد من نظام الحركة المدرك للفيزياء. كانت الإصدارات السابقة من Kling تقارب هذه الحركات بنتائج تبدو معقولة لكنها غير متسقة فيزيائيًا. أما O3 فيقيّد الحركة لتتصرف كما ستتصرف المواد فعليًا.
كيفية استخدام Kling O3 على PicassoIA

يمنحك PicassoIA وصولًا مباشرًا إلى عائلة Kling الكاملة من النماذج دون إعداد API أو تهيئة تقنية. يتوفر Kling v3 Omni Video إلى جانب Kling v3 Video وKling v3 Motion Control من واجهة واحدة.
كتابة الأوامر النصية خطوة بخطوة
الخطوة 1: حدّد الشخص بدقة.
لا تكتب "امرأة تمشي". اكتب "امرأة في أوائل الثلاثينات ترتدي معطفًا صوفيًا كحلي، تمشي ببطء في شارع مرصوف بالحجارة مبتل بالمطر في أمستردام عند الغسق".
الخطوة 2: حدّد البيئة.
كل عنصر بيئي تسميه هو عنصر يستطيع محلل النية تثبيته. "أضواء شوارع كهرمانية دافئة تنعكس على الرصيف المبتل، مارة غير واضحين في الخلفية، أوراق شجر على الأرض".
الخطوة 3: سمِّ الكاميرا.
"لقطة تتبع متوسطة من الجانب، تتحرك إلى اليسار بالسرعة نفسها للشخص، اهتزاز خفيف للعدسة، معادلة 50 مم".
الخطوة 4: حدّد المدة والمزاج.
"مقطع مدته 10 ثوانٍ. المزاج هادئ وتأملي. دون قطعات مفاجئة للكاميرا".
الخطوة 5: أضف الصوت عند الحاجة.
"صوت محيطي: مطر خفيف، حركة مرور بعيدة، وقع خطوات على حجر مبتل. دون موسيقى".
نصائح المعاملات لأفضل النتائج
| المعامل | التوصية |
|---|
| المدة | ابدأ بمدة 5 ثوانٍ، وارفعها إلى 10 ثوانٍ بعد التحقق من الأمر النصي |
| حركة الكاميرا | حدّدها دائمًا بوضوح: "ثابتة"، "دفعة بطيئة لليمين"، "تتبّع" |
| الإضاءة | صِف الاتجاه والجودة: "ضوء نافذة ناعم من اليسار" |
| الأوامر النصية السلبية | استخدمها لاستبعاد الأنماط: "دون نص، دون علامة مائية، دون مظهر CGI" |
| البذرة | احفظ قيم البذرة للإصدارات المختلفة من التوليدات الناجحة |
كيف يقف Kling O3 أمام منافسيه

مقابل Sora 2
ينتج Sora 2 بعضًا من أكثر مخرجات الفيديو بالذكاء الاصطناعي تماسكًا بصريًا، مع أداء قوي بشكل خاص في الأوامر التجريدية والمُنمّقة. أما للمخرجات الواقعية القائمة على الفيزياء، مع مدد موثوقة تبلغ 10 ثوانٍ، فإن O3 أكثر اتساقًا. قوة Sora 2 في الحرية الإبداعية، وقوة O3 في الجودة التقنية المتوقعة.
مقابل Veo 3
يتصدر Veo 3 المجال في جودة مزامنة الصوت، مع صوت أصلي جاهز للإنتاج فعليًا في حالات كثيرة. ويقترب صوت O3 من ذلك لكنه لم يصل بعد إلى مستوى Veo 3 في مزامنة الموسيقى والصوت البشري. أما في جودة الفيديو الخالصة وفيزياء الحركة، فإن O3 منافس، ويتقدم في بعض فئات الاختبار من حيث تماسك الشخص في المقاطع الطويلة.
مقابل Hailuo 02
يمثل Hailuo 02 الخيار الاقتصادي لتوليد 1080p بسرعة. فهو يولّد أسرع من O3، وجودة مخرجاته قوية للأوامر المباشرة. ويتميز O3 بالتعامل مع المشاهد المعقدة: لقطات متعددة الأشخاص، وفيزياء مفصّلة، ومدد طويلة. وبالنسبة للأوامر البسيطة ذات الشخص الواحد، تصغر الفجوة.
| النموذج | أقصى مدة | الفيزياء | الالتزام بالأوامر | الصوت | السرعة |
|---|
| Kling O3 | 10 ثوانٍ | ممتازة | ممتاز | جيد | متوسطة |
| Sora 2 | 20 ثانية | جيدة جدًا | جيد جدًا | جيد | بطيئة |
| Veo 3 | 8 ثوانٍ | جيدة جدًا | جيد | ممتاز | متوسطة |
| Hailuo 02 | 6 ثوانٍ | جيدة | جيد | لا يوجد | سريعة |
التحكم في الحركة: ميزة خفية

من أقل القدرات تداولًا في O3 نظام التحكم في الحركة. يتيح لك Kling v3 Motion Control تحديد مسار الكاميرا عبر نظام إحداثيات، أو برسم مسار مباشرةً على الإطار. وهذا ليس جديدًا في الجيل v3: فقد قدّم Kling v2.6 Motion Control التحكم في الكاميرا القائم على المسارات. لكن نسخة O3 تستجيب للمسار والتعليمات بلغة طبيعية في الوقت نفسه.
يمكنك أن تكتب "قوس بطيء من اليسار إلى اليمين، يرتفع بزاوية 20 درجة" إلى جانب أمر نصي يصف المشهد، وتُحترم التعليمتان معًا. كانت الأنظمة السابقة غالبًا تعطي الأولوية لأحدهما على الآخر. وهذا ما يجعل O3 الخيار الأقوى لعمل الكاميرا السينمائي ضمن نماذج تحويل النص إلى فيديو الحالية.
سيناريوهات عملية للتحكم في الحركة:
- كشف بأسلوب الطائرة المسيّرة: "قوس صاعد بزاوية 45 درجة مع دوران 90 درجة في اتجاه عقارب الساعة، يكشف عن منظر ساحلي بالأسفل"
- تركيز على الشخصية: "لقطة ثابتة، تركيز بالانتقال من جسم في المقدمة إلى الشخص في منتصف المسافة المتوسطة عند علامة 3 ثوانٍ"
- مشي بالتتبّع: "تتبّع الشخص من الخلف على مسافة ثابتة، مع اهتزاز يدوي خفيف، والحفاظ على ارتفاع مستوى العين"
الأفاتار وتحريك الشخصيات

يستفيد نموذج Kling Avatar v2، وهو منفصل عن O3، من تطورات التماسك الزمني نفسها. وإذا كان عملك يتضمن تحريك شخصيات متسقة، أو تحريك صورة مرجعية لشخص، أو إنشاء فيديو متحدث من صورة ثابتة، فإن Avatar v2 مقترنًا بخلفيات مولّدة باستخدام O3 يمنحك سير عمل إنتاجي كان يتطلب سابقًا استثمارًا كبيرًا في سلسلة الأدوات.
بالنسبة لفرق العلامات التجارية والتسويق، يغطي هذا المزيج:
- فيديوهات متحدثين مولّدة من صور فوتوغرافية
- محتوى وسائل تواصل تقوده شخصيات دون تكاليف اختيار ممثلين
- سير عمل للتوطين حيث تحتاج الشخصية إلى التحدث بعدة لغات
- فيديوهات العرض التقديمي والتواصل الداخلي بسرعة
لا تزال Kling v1.6 Pro وKling v1.5 Pro متاحين للفرق التي لديها سير عمل راسخ يعتمد على خصائص مخرجاتهما المحددة. وأحيانًا تُفضَّل مخرجات الإصدارات الأقدم من أجل الاتساق الأسلوبي داخل مشاريع أطول بدأت على تلك النماذج.
💡 يستحق المعرفة: يعني تاريخ إصدارات Kling الكامل على PicassoIA أنه يمكنك تشغيل الأمر النصي نفسه عبر إصدارات متعددة في جلسة واحدة، ومقارنة المخرجات مباشرةً. وهذه طريقة سريعة لتحديد الإصدار الذي يناسب أسلوبًا بصريًا معينًا.
لماذا يهم هذا الإصدار صنّاع المحتوى
كان مسار توليد الفيديو بالذكاء الاصطناعي واضحًا: كل جيل يضيّق الفجوة بين "ما وصفته" و"ما تحصل عليه". ما يجعل O3 مهمًا ليس ميزة واحدة مذهلة، بل تراكم التحسينات في الالتزام بالأوامر والفيزياء والمدة والصوت ضمن إصدار واحد متماسك.
بالنسبة لصنّاع المحتوى الذين جربوا إصدارات Kling السابقة ووجدوها غير متوقعة أكثر من اللازم للاستخدام الاحترافي، يستحق O3 تقييمًا ثانيًا. فطبقة حل النية وحدها تغيّر تجربة كتابة الأوامر بما يكفي، لدرجة أن الإحباطات من مخرجات v1.x وv2.x قد لا تنطبق على الأوامر نفسها عند تشغيلها عبر O3.
ثلاثة أمور لاختبارها في جلستك الأولى:
- أمر نصي تخليت عنه سابقًا لأن المخرجات كانت غير متسقة أكثر من اللازم
- مشهد معقد متعدد العناصر (شخص مع بيئة مع إضاءة محددة)
- مقطع مدته 10 ثوانٍ مع حركة كاميرا محددة بلغة طبيعية
ستكون النتائج أسرع وأدق من أي إصدار سابق من Kling.
ابدأ التوليد باستخدام Kling O3

قراءة ما يفعله Kling O3 تجربة مختلفة عن استخدامه. فالتحسينات في فيزياء الحركة، ودقة الالتزام بالأوامر، ومدة المقطع، أمور تشعر بها فورًا في أول توليد يطابق فعلًا ما وصفته.
يمنحك PicassoIA الوصول إلى Kling v3 Video، وKling v3 Omni Video، وKling v3 Motion Control إلى جانب أكثر من 100 نموذج آخر لتحويل النص إلى فيديو في مكان واحد. لا مفاتيح API. لا تهيئة للنماذج. تكتب أمرًا نصيًا، وتختار نموذجًا، وتحصل على مقطعك.
أفضل نقطة انطلاق هي أمر نصي جربته من قبل على نموذج أقدم، وأحبطك بنتائج غير متسقة. شغّله عبر O3 وشاهد كيف يتعامل محلل النية مع الوصف نفسه. والفرق عادةً هو أسرع طريقة لترى ما تغيّر في هذا الجيل.
جرّب الآن على PicassoIA واجعل O3 يعمل في مشروعك التالي.