غيّر Kling 3.0 للتو المعيار الذي يُقاس به شكل الفيديو المولَّد بالذكاء الاصطناعي. أطلقته Kuaishou Technology في عام 2025، وهو الجيل الثالث الكبير من عائلة نماذج Kling، والنتائج لافتة: دقة حركة سينمائية، وتماسك يدوم عدة ثوانٍ، وجودة دقة تضاهي اللقطات المصوّرة بكاميرات حقيقية. إذا كنت تتابع أدوات فيديو الذكاء الاصطناعي، فإن Kling 3.0 هو النموذج الذي سيجعلك تتوقف لتعيد النظر فيما يستطيع الذكاء الاصطناعي فعله.
ما هو Kling 3.0 فعلًا
Kling نظام لتوليد الفيديو بالذكاء الاصطناعي طورته Kuaishou، إحدى أكبر منصات الفيديو القصير في الصين. تمتلك الشركة البنية التحتية لمئات الملايين من بثوث الفيديو اليومية، ما يعني أنها درّبت نماذجها على حجم استثنائي من بيانات حركة الفيديو الواقعية، من مشاهد الشوارع إلى الرياضة والأفلام السردية.
الإصدار 3.0 ليس تحديثًا هامشيًا. فهو يقدّم بنية جديدة لتركيب الحركة، ونسخة مخصصة للتحكم في الحركة، وخط توليد شامل يتعامل مع المدخلات النصية والصورية بدقة أعلى من الإصدارات السابقة.
مختبر الفيديو في Kuaishou
يدير قسم أبحاث الذكاء الاصطناعي في Kuaishou واحدة من أغنى بيئات التدريب بالبيانات في العالم. ولأن التطبيق الأم يعالج يوميًا كميات ضخمة من الفيديو القصير، تصل نماذج Kling إلى أنماط حركة دقيقة عبر مجموعة واسعة من الموضوعات: ميكانيكا جسم الإنسان، والفيزياء الطبيعية، وحركة الحشود، والحركة السائلة. وهذا الأساس التدريبي هو ما يميّز Kling عن النماذج المدرّبة على مجموعات بيانات منتقاة لكنها أصغر.
يعكس إصدار v3 تركيزًا محددًا على معقولية الحركة: أن يثني الشخص كوعه بشكل صحيح عندما يمد يده إلى جسم ما، وأن يتصرف الماء كالماء الحقيقي عندما يتدفق على سطح، وأن يبقى فرق المنظور بين المقدمة والخلفية متماسكًا عبر الإطارات عندما تتحرك الكاميرا.

القفزة من الإصدارات v2.x
نماذج Kling v2.x، مثل Kling v2.6 وKling v2.1 Master، كانت منافسة بالفعل للنماذج الرائدة. كانت تولّد مقاطع بدقة من 720p إلى 1080p مع ثبات معقول للموضوعات. لكن كانت لها قيود واضحة: تنجرف الوجوه في المقاطع التي تستمر عدة ثوانٍ، وتتمسح الأجسام سريعة الحركة بشكل غير طبيعي، وتتدهور المشاهد المعقدة التي تضم عدة موضوعات متحركة بعد الثانيتين الأوليين.
يعالج Kling 3.0 أنماط الفشل الثلاثة هذه بشكل مباشر. وتشمل التغييرات المعمارية:
- طبقات الانتباه الزمني التي تحافظ على هوية الموضوع عبر مدد أطول للمقطع
- أولويات الحركة المدركة للفيزياء التي ترجّح سلوك الأجسام الطبيعي أثناء التوليد
- التصيير متعدد المقاييس الذي يوزّع ميزانيات التفاصيل بذكاء، فيكون الموضوع حادًا مع ضبابية عمق ميدان مناسبة في الخلفيات
💡 النتيجة العملية: مقاطع Kling 3.0 بمدة من 5 إلى 10 ثوانٍ تتماسك بطرق لم تفعلها الإصدارات السابقة. الشخص الذي يعبر الغرفة عند الثانية 7 يبدو كالشخص نفسه عند الثانية 1.
نماذج Kling v3 الثلاثة
أطلقت Kuaishou Kling 3.0 في ثلاثة إصدارات متمايزة، لكل منها محسّن لحالة استخدام محددة.
Kling v3 Video
Kling v3 Video هو النموذج الرائد لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو. تعطيه أمرًا نصيًا أو صورة مصدر، فيعيد مقطع فيديو سينمائيًا عالي الجودة. يُخرج بدقة تصل إلى 1080p، ويتعامل جيدًا مع موضوعات متنوعة، من الأشخاص إلى المناظر الطبيعية والمشاهد التجريدية.
هذا هو النموذج الذي تلجأ إليه عندما تريد مخرجات بجودة الإنتاج دون قيود متخصصة. إنه الخيار الأقوى متعدد الأغراض في عائلة v3.
الأفضل لـ: محتوى وسائل التواصل الاجتماعي، والأفلام القصيرة، وعروض المنتجات، والتجريب الإبداعي.

Kling v3 Motion Control
Kling v3 Motion Control مصمَّم للمستخدمين الذين يحتاجون إلى تحديد الكيفية الدقيقة لتحرك الموضوعات والكاميرات داخل المقطع. يمكنك تحديد مسارات الحركة، وسلوكيات الكاميرا من تحريك أفقي ورأسي وتكبير، وأقواس حركة الموضوع. يلتزم النموذج بهذه القيود مع الحفاظ على الجودة الواقعية كالصور الفوتوغرافية في البنية الأساسية لـ v3.
هذا مهم لأن معظم نماذج تحويل النص إلى فيديو تعامل الحركة كناتج ثانوي للأمر النصي. أما Motion Control فيعاملها كمدخل أساسي من المستوى الأول. إذا احتجت إلى حركة عربة كاميرا محددة، أو موضوع يمشي من اليسار إلى اليمين بوتيرة معينة، فهذا الإصدار يوفّر تحكمًا لا تستطيع هندسة الأوامر وحدها تحقيقه.
الأفضل لـ: الإعلانات التجارية، والتسلسلات السردية المضبوطة، وإنتاج مقاطع الموسيقى المصورة، وأي مشروع تكون فيه تنسيق الحركة مهمًا.
Kling v3 Omni Video
Kling v3 Omni Video هو أكثر الإصدارات تنوعًا. يقبل مدخلات نصية وصورية وشروطًا إضافية في الوقت نفسه، ما يعني أنك تستطيع تقديم صورة مرجعية للأسلوب، وأمر نصي للحركة، ومقطع صوتي للمزامنة. ويدمج النموذج هذه المدخلات في مخرج واحد متماسك.
بنية Omni هي ما يطلبه مجتمع فيديو الذكاء الاصطناعي الأوسع منذ زمن: نموذج لا يجبرك على الاختيار بين التحكم النصي والتحكم بالصور. تحصل على الاثنين في الوقت نفسه، ولا تتراجع جودة المخرجات عندما تُراكب المدخلات.
الأفضل لـ: الإنتاجات المعقدة، وسير العمل الإبداعي متعدد المدخلات، والمحتوى الذي يتطلب ثباتًا في الأسلوب مع مرجع بصري.

كيف تعمل التقنية
يقوم Kling 3.0 على العمود الفقري لمحوّل الانتشار (DiT)، وهي العائلة المعمارية نفسها التي تشغّل نماذج الصور الرائدة مثل Flux، لكنها ممتدة إلى البعد الزمني. تساعدك تفاصيل خط التشغيل على كتابة أوامر نصية أفضل وعلى ضبط توقعات واقعية لكل توليد.
خط تحويل النص إلى فيديو
عندما تقدّم أمرًا نصيًا إلى Kling v3، يمر عبر عدة مراحل:
- التحليل الدلالي: يستخرج النموذج اللغوي الكيانات (الموضوعات والخلفيات والأجسام)، والأفعال (الكلمات التي تصف الحركة)، والسمات (الألوان والإضاءة والأسلوب)
- تخطيط الإطارات المفتاحية: يولّد النموذج مراسي مكانية لبداية المقطع ووسطه ونهايته تتسق مع الفعل الموصوف
- الانتشار الزمني: يُركَّب الفيديو الكامل عبر إزالة التشويش تكراريًا من موتر كامن ثلاثي الأبعاد يمثل جميع الإطارات في الوقت نفسه، لا بالتتابع
- رفع الدقة والتحديد: يضيف مسار معالجة لاحق التفاصيل عند الدقة النهائية
تركيب الإطارات المتعددة في الوقت نفسه في الخطوة 3 هو الفرق المعماري الجوهري عن نماذج الفيديو القديمة التي كانت تولّد الإطارات واحدًا تلو الآخر. فمن خلال التفكير في جميع الإطارات معًا، يستطيع النموذج فرض التماسك الزمني دون تراكم الأخطاء عبر التسلسل.

تصيير تحويل الصورة إلى فيديو
عندما تزوّد بصورة إدخال، يستخدم Kling v3 الصورة كقيد صارم على الإطار الأول. تُوجَّه عملية الانتشار لتبدأ من توزيع البكسلات في صورتك، ثم تطوّرها إلى الأمام في الزمن وفق الأمر النصي.
هذا أصعب مما يبدو. يجب على النموذج في الوقت نفسه أن:
- يحافظ على الهوية البصرية لموضوعات صورة المصدر
- يضيف حركة معقولة تناسب الأمر النصي
- يحافظ على استمرارية الإضاءة مع تطور المشهد
- يضمن ألا تعود الأجسام التي تخرج من الإطار كأجسام مختلفة
يتعامل Kling v3 Video مع هذا بدقة موضوعات أفضل بشكل ملحوظ من الإصدارات السابقة. إذا حرّكت صورة شخصية، فالوجه في نهاية المقطع هو الوجه نفسه في بدايته.
نظام تماسك الحركة
من أهم الإسهامات التقنية في Kling 3.0 نظام تماسك الحركة. تتعامل نماذج انتشار الفيديو التقليدية مع الحركة كشيء ينشأ من عملية إزالة التشويش إطارًا بإطار. والنتيجة أن التناقضات الطفيفة تتراكم، وتنهار المقاطع الأطول.
يقدّم Kling 3.0 شبكة أولويات حركة مخصصة تعمل بالتوازي مع عملية الانتشار الرئيسية. هذه الشبكة:
- تتنبأ بمسارات حركة معقولة فيزيائيًا للموضوعات المكتشفة
- تعاقب شبكة الانتشار الرئيسية عندما تنتهك الحركة المولَّدة هذه الأولويات
- تطبّق ترجيحًا خاصًا على مفاصل الجسم، ونقاط ملامح الوجه، وحواف الأجسام الصلبة
الأثر العملي أن الموضوعات تتحرك كالأجسام الحقيقية بدلًا من أن تتحرك كتقريبات ضبابية لأجسام حقيقية. تتأرجح الأذرع بتوازن طبيعي. وتنسدل الأقمشة وتتحرك بثقل مناسب. ويحافظ الماء على ديناميكيات سوائل واقعية طوال مدة المقطع كاملة.
💡 نصيحة للأوامر النصية: لأن Kling 3.0 يملك أولويات حركة قوية، لا تحتاج إلى وصف الفيزياء بالتفصيل في أوامرك. فعبارة "امرأة تمشي عبر غرفة" ستُنتج حركة مشي طبيعية دون أن تحدد حركة الذراعين أو طول الخطوة.

Kling 3.0 مقابل الأسماء الكبرى
إليك مقارنة Kling 3.0 بنماذج الفيديو بالذكاء الاصطناعي الرائدة الأخرى المتاحة حاليًا:
| النموذج | أقصى دقة | جودة الحركة | الالتزام بالنص | السرعة | أنواع المدخلات |
|---|
| Kling v3 Video | 1080p | ممتازة | عالٍ | متوسطة | نص، صورة |
| Kling v3 Omni | 1080p | ممتازة | عالٍ جدًا | متوسطة | نص، صورة، صوت |
| Sora 2 | 1080p | جيدة جدًا | عالٍ جدًا | بطيئة | نص، صورة |
| Veo 3 | 1080p | جيدة جدًا | عالٍ | متوسطة | نص |
| Seedance 2.0 | 1080p | جيدة | عالٍ | سريعة | نص، صورة |
| Hailuo 02 | 1080p | جيدة | متوسط | سريعة | نص، صورة |
يُظهر الجدول نقاط القوة الأساسية في Kling 3.0: جودة حركة تضاهي الأفضل في المجال أو تتفوق عليه، مع مرونة قوية في المدخلات المتعددة وبسرعة توليد ليست بطيئة بشكل مؤلم. لدى Sora 2 جودة مقاربة لكن أوقات انتظار أطول بكثير. وSeedance 2.0 أسرع، لكنه لا يصمد بالقدر نفسه في سيناريوهات الحركة المعقدة.
يتفوق Veo 3 في توليد الصوت الأصلي، لكن من أجل جودة الفيديو الخالصة وواقعية الحركة، يبقى Kling 3.0 الخيار الأقوى لمعظم حالات الإنتاج.

كيفية استخدام Kling v3 على PicassoIA
الإصدارات الثلاثة من Kling v3 متاحة مباشرة على PicassoIA. لا حاجة إلى إعداد مفتاح API ولا متطلبات حوسبة محلية. تصل إليها عبر متصفح المجموعة وتبدأ التوليد فورًا.
الخطوة 1: اختر الإصدار
توجّه إلى Kling v3 Video للإدخال النصي أو الصوري القياسي. استخدم Kling v3 Motion Control إذا احتجت إلى تحديد سلوك الكاميرا أو مسار الموضوع. واستخدم Kling v3 Omni Video عند العمل مع عدة أنواع من المدخلات في الوقت نفسه.
الخطوة 2: جهّز أمرك النصي
لتحويل النص إلى فيديو، صف الموضوع أولًا، ثم الفعل، ثم البيئة والإضاءة. أبقِه دون 200 كلمة. يتعامل Kling 3.0 مع الأوامر المعقدة بشكل جيد، لكن الوضوح يتفوق على الطول.
لتحويل الصورة إلى فيديو، ارفع صورة مصدر نظيفة وجيدة الإضاءة. يحافظ النموذج على هوية الشخص في صورتك، لذا استثمر في إدخال جيد. الصور ذات الاتجاه الرأسي تعمل بشكل خاص جيدًا لأنها تمنح النموذج موضوعًا بؤريًا واضحًا يرتكز عليه.
الخطوة 3: اضبط الدقة والمدة
تتيح لك PicassoIA اختيار الدقة (720p أو 1080p) ومدة المقطع (5 أو 10 ثوانٍ لمعظم إصدارات Kling v3). للاختبار الأولي، استخدم 720p لمدة 5 ثوانٍ. هذا أسرع ويحفظ نقاط التوليد لديك أثناء تحسين أمرك النصي. انتقل إلى 1080p ومدة 10 ثوانٍ عندما يكون لديك أمر يعمل جيدًا.
الخطوة 4: كرّر
النتيجة الأولى نادرًا ما تكون المخرج النهائي. غيّر متغيرًا واحدًا في كل مرة: عدّل وصف الفعل، أو بدّل حالة الإضاءة، أو جرّب صورة مصدر مختلفة. Kling 3.0 ثابت بما يكفي بحيث تُنتج التغييرات الصغيرة في الأمر النصي تغييرات اتجاهية متوقعة في المخرج.
💡 نصيحة سريعة: إذا كان وجه موضوعك ينحرف بين الإطارات، فأضف وصفًا جسديًا محددًا لمظهره في الأمر النصي. عبارات مثل "عينان بنيتان، فك زاوي، شعر داكن قصير" تمنح النموذج مراسي هوية أقوى ليحافظ عليها عبر المقطع.

أين يتفوق (وأين لا يفعل)
لا يوجد نموذج مثالي. يملك Kling 3.0 نقاط قوة حقيقية وقيودًا فعلية تستحق المعرفة قبل أن تدمجه في سير عمل.
يتعامل بشكل جيد مع هذه الحالات
حركة الإنسان: المشي والجري والإيماءات وتعابير الوجه. هذه أعمق نقاط قوة Kling. وقد تم تدريب شبكة أولويات الحركة بكثافة واضحة على موضوعات بشرية، وهذا يظهر في النتائج. تظهر ميكانيكا الجسم الطبيعية دون الحاجة إلى طلبها.
البيئات الطبيعية: المحيط والغابات والطقس والنار. تمتد نمذجة الفيزياء في Kling 3.0 إلى العناصر البيئية. تسقط الأمطار بسرعات معقولة. تتحرك الألسنة النارية بعدم انتظام عضوي. وتستجيب الأوراق للرياح مع تأخر مناسب.
حركة الكاميرا: الاقتراب، والبانوراما، ولقطات الرافعة. لأن Kling v3 Motion Control يتضمن تحكمًا صريحًا بالكاميرا، فإن حركة الكاميرا المقصودة من أكثر القدرات موثوقية في عائلة v3.
المشاهد متعددة الموضوعات: يتعامل Kling 3.0 مع موضوعين إلى ثلاثة موضوعات متمايزة في الإطار نفسه بشكل أفضل من معظم المنافسين. يحافظ كل موضوع على حركته المستقلة دون أن يتدخل آخر فيها.

قيود صريحة
النص والرسومات: أي نص تريده في إطار الفيديو سيكون خاطئًا على الأغلب. هذا قيد أساسي في نماذج الانتشار، وليس خاصًا بنموذج Kling. خطّط لإضافة النص في مرحلة ما بعد الإنتاج.
الحركة السريعة جدًا: إيماءات اليد السريعة، والرياضة بسرعتها الكاملة، ورمي الأجسام بسرعة عالية. تعمل شبكة أولويات الحركة جيدًا بسرعات المشي البشري، لكنها تبدأ في التمويه وإنتاج العيوب عند سرعات تتطلب نوافذ زمنية قصيرة جدًا.
التفاعلات الدقيقة مع الأجسام: إمساك اليد بكأس ماء أمر ممكن. أما إمساك اليد بجسم صغير محدد ووضعه بدقة على هدف معين فليس موثوقًا. لا تزال معالجة الأجسام بالتفاصيل الحركية الدقيقة مشكلة مفتوحة في جميع نماذج فيديو الذكاء الاصطناعي.
التماسك طويل المدى بعد 10 ثوانٍ: يصمد Kling 3.0 جيدًا حتى 10 ثوانٍ. وبعد ذلك تتراكم انجرافات الموضوع وعدم الاتساق البيئي. بالنسبة للأعمال الأطول، ولّد عدة مقاطع ثم حرّرها معًا.
ابدأ الإبداع مع Kling v3
يمثل Kling 3.0 الذروة الحالية لما يمكن أن يُنتجه توليد الفيديو بالذكاء الاصطناعي المتاح للجميع. فجودة الحركة وثبات الموضوعات والمرونة في المدخلات المتعددة في عائلة v3 تضع قدرة سينمائية جادة في متناول أي شخص لديه رؤية إبداعية ومتصفح.
الإصدارات الثلاثة، Kling v3 Video، وKling v3 Motion Control، وKling v3 Omni Video، متاحة على PicassoIA إلى جانب أكثر من 87 نموذجًا آخر لتوليد الفيديو، من بينها Seedance 2.0، وVeo 3، وLTX 2.3 Pro، وPixverse v5. يمكنك تجربتها جميعًا، ومقارنة المخرجات، واكتشاف ما يناسب نوع المحتوى الذي تعمل عليه، دون الالتزام بمورد واحد أو بإعداد تقني واحد.
أفضل طريقة لترى ما يستطيع Kling 3.0 فعله هي أن تشغّله. افتح أول توليد لك، وصف ما تريد أن تراه يتحرك، وشاهد ما يعود إليك. لم تكن الفجوة بين ما تتخيله وما تحصل عليه أصغر من هذا قط.
