Kling 3.0 ليس تحديثًا تدريجيًا. عانت كل الأجيال السابقة من فيديو الذكاء الاصطناعي من المشكلات الثلاث نفسها: وجوه تنجرف بين الإطارات، وحركات كاميرا تبدو مضافة على عجل في مرحلة ما بعد الإنتاج، وفيزياء تنهار بمجرد دخول شيء ناعم أو سائل إلى الكادر. يعالج Kling 3.0 الثلاث معًا، والنتائج واضحة فورًا. تخرج المقاطع بتماسك من إطار إلى آخر، وهو نوع من التماسك كان يتطلب قبل ذلك ساعات من التتبع والتركيب لتقليده.
يغطي هذا المقال طريقة عمل Kling v3 Video، وكيفية كتابة أوامر تنتج مخرجات سينمائية حقيقية، وكيفية تشغيله على PicassoIA من الأمر النصي الأول حتى المقطع النهائي.

ما الذي يميّز Kling 3.0
تعالج معظم نماذج انتشار الفيديو الإطارات بشكل مستقل. يُؤخذ كل إطار من التوزيع المتعلَّم نفسه دون الرجوع إلى ما كان يحتويه الإطار السابق. ولهذا تنحرف الشخصيات، ويتحرك القماش كأنه تحت الماء، ويتحول الشعر إلى شعر شخص آخر بحلول الإطار 12. وهذه مشكلة أساسية في البنية، وليست مشكلة في الأوامر النصية.
طبقة الفيزياء
يستخدم Kling 3.0 آلية للاتساق الزمني تحمل الحالة الفيزيائية إلى الأمام عبر المقطع كله. فبدلًا من إعادة الضبط في كل إطار، يتتبع النموذج:
- ثنيات القماش التي تحافظ على موضعها وتتحرك بقصور ذاتي صحيح مع تحرك الشخص
- السوائل التي تتبع الجاذبية طوال مدة المقطع بدلًا من أن ترتعش وتتحول إلى ضوضاء
- الشعر الذي يحافظ على موضعه وإضاءته نفسها بدلًا من تغيير أسلوبه بين الإطارات
- البشرة وملامح الوجه التي تبقى الهوية نفسها من الإطار الأول إلى الأخير
والنتيجة العملية هي لقطات تجتاز اختبار المشاهدة العادية. فالشخص الذي لم يستخدم فيديو الذكاء الاصطناعي من قبل لن يلحظ على الفور أنه اصطناعي. وهذه العتبة هي كل شيء بالنسبة لأي شخص يستخدم فيديو الذكاء الاصطناعي في الإنتاج.
قراءة الأوامر السينمائية
كانت إصدارات Kling السابقة تواجه سقفًا في تعقيد الأوامر النصية. فكثيرًا ما كانت التعليمات الدقيقة لحركة الكاميرا، والأوصاف المتعددة الجمل، والمصطلحات الخاصة بالأفلام، تنهار إلى مخرجات عامة. أما Kling 3.0 فيقرأ هذه الأوامر بمستوى دقة مختلف جوهريًا.
عند طلب "زاوية منخفضة مع إمالة هولندية (Dutch tilt)، وتتبّع إلى اليسار على ارتفاع الركبة، بمكافئ عدسة 50 ملم، ومضاءة من الخلف بشمس الصباح من اليمين"، يُنتج النموذج الآن هذا بالضبط، لا تقريبًا خشنًا. لقد تقلصت الفجوة بين ما تصفه وما تحصل عليه بشكل كبير، وهذا ما يجعل الكتابة السينمائية الدقيقة للأوامر النصية عملية وممكنة، لا مجرد طموح.
متى تستخدم كل نموذج
قبل كتابة الأمر النصي، يفيد معرفة الإصدار المناسب للمهمة من عائلة Kling. يوفر PicassoIA المجموعة الكاملة.

سير العمل المعتاد: أنشئ نموذجًا أوليًا باستخدام Kling v2.6 للسرعة والاقتصاد، ثم أنهِ العمل على Kling v3 Video للحصول على الجودة. انتقل إلى Kling v3 Motion Control عندما تملك صورة مرجعية وتحتاج إلى مسار كاميرا محدد لا يمكن للأوامر النصية وحدها إنتاجه بموثوقية.
أوامر تنجح فعلًا
أكثر أوجه الإخفاق شيوعًا في فيديو الذكاء الاصطناعي هو الكتابة له كما لو كان محرك بحث. فعبارة "غروب جبلي مع غيوم دراماتيكية" استعلام، وليست وصفًا للقطة. يستجيب Kling 3.0 لدقة بمستوى مدير التصوير، والفرق في جودة المخرجات بين الاستعلام والوصف السينمائي الحقيقي ليس طفيفًا.

البنية ذات الأجزاء الأربعة
لكل أمر قوي موجّه إلى Kling أربعة مكونات، تُكتب بهذا الترتيب:
- الشخص والحركة: من أو ما هو، مع تفاصيل محددة عن المظهر، ومادة الملابس ولونها، والسلوك
- مواصفات الكاميرا: الزاوية والارتفاع ونوع الحركة وما يعادل البعد البؤري
- البيئة والإضاءة: الموقع، ووقت اليوم، وموضع مصدر الضوء، وجودة لونه
- الجو والملمس: إحساس نوع الفيلم، والحبيبات، ودرجة حرارة اللون، والمزاج
أمر ضعيف:
امرأة تمشي عبر مدينة ممطرة ليلًا.
أمر سينمائي باستخدام البنية ذات الأجزاء الأربعة:
امرأة في أوائل الثلاثينيات (30s) من عمرها، ترتدي معطفًا صوفيًا داكنًا، تسير وحدها في شارع مدينة لامع بالمطر عند الساعة 2 فجرًا، والكاميرا تتتبعها على ارتفاع الورك من جانبها الأيسر بما يعادل 85 ملم، وعمق ميداني ضحل يحوّل سلسلة أعمدة الإنارة خلفها إلى كرات كهرمانية دافئة، وضوء حجمي من مصباح بخار الصوديوم فوق رأسها مباشرة يخلق هالة ناعمة على شعرها الداكن، وحبيبات فيلم Kodak Vision 3، وظلال زرقاء داكنة مع إبرازات دافئة، وجو هادئ وتأملي.
يُزيل الأمر الثاني الغموض عند كل نقطة قرار كان النموذج سيملؤها عشوائيًا. والفرق في المخرجات كبير جدًا.
ما يجب استبعاده
تُضعف عدة إضافات شائعة جودة المخرجات باستمرار:
- كلمات مزاج غامضة دون أساس مادي: "دراماتيكي" و"سينمائي" و"قوي" دون تحديد ما الذي يصنع تلك الصفات
- أكثر من حركة كاميرا رئيسية واحدة: الجمع بين "دولي للداخل" و"مدار" في مقطع مدته 5 ثوانٍ يُنتج تقريبًا دائمًا حركة مكانية غير متماسكة
- حركات متعددة للشخصية في الوقت نفسه: حركة رئيسية واحدة لكل مقطع موثوقة؛ أما حركتان أو أكثر فغالبًا ما تُنتج عيوبًا أو تداخلًا
- تعليمات مكانية متناقضة: طلب لقطة مقرّبة جدًا ولقطة لكامل الجسم في الأمر نفسه
💡 نصيحة: اقرأ أمرك كما لو كنت تُطلع مدير تصوير حقيقيًا على المشروع. إذا كان أي شيء غامضًا لمحترف بشري، فسيكون غامضًا للنموذج. تحديد اتجاه مصدر الضوء في كل أمر هو التغيير الأعلى تأثيرًا الذي يتجاهله معظم الناس تمامًا.
حركات الكاميرا والبعد البؤري
هنا يُظهر Kling 3.0 أوضح تحسن على الإصدارات السابقة في العائلة. يستجيب النموذج الآن لمفردات التصوير السينمائي المحددة بطرق تنتج نتائج يمكن التحقق منها والتنبؤ بها، وليس تقريبات فضفاضة.

حركات تنجح في كل مرة
| مصطلح الأمر | ما الذي ينتجه |
|---|
slow dolly-in | اقتراب تدريجي نحو الشخص، نظيف ومستقر |
gentle pan left أو pan right | مسح أفقي، قوي للمناظر الطبيعية والكشوفات |
low-angle upward tilt | يجعل الأشخاص يبدون مهيبين، ويخلق منظورًا دراماتيكيًا |
aerial crane descending | منظور من الأعلى ينزل تدريجيًا إلى مستوى الأرض |
handheld slight shake | واقعية وثائقية مع اهتزاز مضبوط |
orbit 180 degrees | الكاميرا تدور حول الشخص، قوية لكشف الشخصيات |
rack focus foreground to subject | سحب للتركيز ينتج انتقالًا سينمائيًا في العمق |
استخدم حركة كاميرا واحدة لكل مقطع. فالجمع بين حركتين في توليد واحد ينتج عدم تماسك مكاني بحلول منتصف المقطع. اختر واحدة ونفّذها كاملة.
اختيار البعد البؤري
يفسّر Kling 3.0 أوصاف البعد البؤري على أنها تعليمات ضغط مكاني فعلية، وليست مجرد وسوم أسلوبية. فتحديد البعد البؤري يغيّر هندسة المشهد:
- 24 ملم: زاوية عريضة مع سياق بيئي وانحناء طفيف في الأطراف. قوية للقطات التأسيسية.
- 50 ملم: منظور طبيعي أقرب إلى الرؤية البشرية. متعدد الاستخدامات ومحايد إدراكيًا.
- 85 ملم: عمق ميداني ضحل مع فصل قوي عن الخلفية. الخيار الأساسي للقطات الشخصيات.
- 135 ملم: ضغط شديد للخلفية يقرّب العناصر البعيدة بصريًا، مما يخلق إحساسًا مضغوطًا وحميميًا بالمساحة.
💡 نصيحة: اعتمد 85 ملم كخيار افتراضي لأي لقطة تتضمن شخصًا. فهو يُجمّل الشخص، ويخلق فصلًا بصريًا عن الخلفيات، ويقدم المظهر الأكثر ارتباطًا بالسينما الروائية الاحترافية. ابدأ منه، ولا تحد عنه إلا عندما تتطلب اللقطة شيئًا محددًا.
الحفاظ على ثبات الشخصيات
يُعد ثبات الشخصية عبر تسلسل من عدة مقاطع من أصعب مشكلات توليد فيديو الذكاء الاصطناعي. فالوجه الذي يتغير بشكل طفيف بين التوليدات يدمّر وهم المشهد المتماسك. يتعامل Kling 3.0 مع هذا الأمر بشكل أفضل من أي إصدار سابق في العائلة، لكنه لا يزال يتطلب انضباطًا متعمدًا في كتابة الأوامر عبر التسلسل كله.

طريقة الصورة المرجعية
الطريقة الأكثر موثوقية للحفاظ على ثبات الشخصية هي توليد تحويل الصورة إلى فيديو. أنشئ أولًا لقطة مرجعية لشخصيتك باستخدام نموذج تحويل النص إلى صورة، ثم مرّر تلك الصورة إلى Kling v2.1 أو Kling Avatar v2 في وضع تحويل الصورة إلى فيديو. تثبّت الصورة المرجعية مظهر الشخصية، ويحملها النموذج عبر المقطع بدقة عالية.
أما لعمل الشخصيات بتحويل النص إلى فيديو دون صورة مرجعية، فاستخدم أوصافًا دقيقة جدًا في كل أمر لكل مقطع:
- العمر الدقيق، ولون الشعر وطوله، ولون العينين
- قطعة ملابس محددة مع ملمس المادة ولون دقيق
- ملامح مميزة: ندبة معينة، أو نمش، أو إكسسوار محدد
- كرّر هذه الأوصاف بالحرف نفسه في كل أمر لكل مقطع في التسلسل
فمتى غيّرت وصفًا واحدًا، يعامله النموذج كإذن بتغيير الشخصية.
ربط المشاهد في تسلسل
لا يرث Kling 3.0 الحالة تلقائيًا بين التوليدات المنفصلة. فكل مقطع مستقل ولا يملك ذاكرة لما سبقه. للحفاظ على الاستمرارية البصرية عبر التسلسل:
- أنهِ وصف كل أمر لمقطع بالشخصية في وضعية محددة وثابتة
- ابدأ أمر المقطع التالي من الوضعية نفسها تمامًا
- احمل جميع أوصاف الشخصية إلى الأمام بالحرف نفسه
- حافظ على إعداد الإضاءة نفسه ما لم تكن تنتقل عمدًا إلى بيئة جديدة
هذا هو العمل نفسه الذي يقوم به مشرف السيناريو في موقع تصوير حقيقي. لا يستطيع النموذج فعله تلقائيًا، لكنه يحترم المعلومات التي تقدمها بدقة.
كيفية استخدام Kling v3 على PicassoIA
يتيح لك PicassoIA الوصول المباشر إلى مجموعة Kling v3 الكاملة دون إعداد API، أو تثبيت محلي، أو حساب مطور. يتكون سير العمل من الأمر النصي إلى المقطع النهائي من خمس خطوات.

الخطوة 1: اختر النموذج. انتقل إلى Kling v3 Video للعمل السينمائي القياسي بتحويل النص إلى فيديو. إذا كنت تحرّك صورة مرجعية بمسار كاميرا محدد، فافتح Kling v3 Motion Control بدلًا منه. وللتحريك الوجهي من صورة ثابتة، فإن Kling Avatar v2 هو الأداة المناسبة.
الخطوة 2: اضبط المعاملات قبل الكتابة. اختر 16:9 للمخرجات السينمائية القياسية. اضبط المدة على 5 ثوانٍ، وهي النافذة المثالية لحركة كاميرا كاملة واحدة. اختر 1080p لأي مقطع معدّ للنسخة النهائية. واستخدم 720p للاختبار فقط.
الخطوة 3: اكتب الأمر باستخدام البنية ذات الأجزاء الأربعة. الشخص، ثم الكاميرا، ثم البيئة، ثم الجو، بهذا الترتيب. استهدف 80 إلى 120 كلمة. إذا قلّ الأمر عن 50 كلمة، يملأ النموذج الفراغات بشكل عشوائي. وإذا تجاوز 150 كلمة، يُنتج تفاصيل متعارضة تؤدي إلى عدم التماسك.
الخطوة 4: ثبّت حركة الكاميرا أولًا. يختبر توليدك الأول ما إذا كان سلوك الكاميرا صحيحًا. فإذا كانت الحركة صحيحة، يصبح إصلاح كل شيء آخر أسهل عبر التكرار. أما إذا كانت الحركة خاطئة، فلا يهم الباقي. أكّد الكاميرا، ثم حسّن الشخص والجو.
الخطوة 5: اربط المقاطع في برنامج المونتاج. كل مقطع في التسلسل توليد منفصل. حافظ على أوصاف الشخصية متطابقة عبر كل الأوامر. أضف الصوت في مرحلة ما بعد الإنتاج، إذ لا يولّد Kling صوتًا أصليًا.
💡 نصيحة: يوفر Kling v2.1 Master و Kling v1.6 Standard ثباتًا جيدًا للشخصيات بتكلفة أقل. استخدمهما في مرحلة التكرار المبكرة قبل الانتقال إلى v3 للنسخ النهائية.
كيف يُقارن Kling 3.0 بالمنافسة
تضم مساحة فيديو الذكاء الاصطناعي حاليًا عدة نماذج قوية. ويعتمد موقع Kling 3.0 بينها على ما يحتاجه مقطعك تحديدًا.

مقارنة جنبًا إلى جنب
متى يتفوق Kling
يكون Kling 3.0 النموذج المناسب عندما:
- ثبات الشخصية عبر عدة مقاطع أمر غير قابل للتفاوض: لا يضاهيه في هذا إلا Sora 2
- دقة لغة الكاميرا مهمة: يقرأ Kling مصطلحات التصوير السينمائي بموثوقية أكبر من معظم البدائل
- المشاهد الثقيلة على الفيزياء حاضرة: يتصرف الماء والقماش والشعر والحركة للأجسام الرخوة بطبيعية أكبر من النماذج المماثلة
- سيُعالج الصوت بشكل منفصل في مرحلة ما بعد الإنتاج: غياب الصوت الأصلي ليس قيدًا إذا كان سير عملك يضيف الصوت في المونتاج
عندما تحتاج إلى صوت أصلي يُولَّد مع الفيديو، فإن Seedance 2.0 أو Veo 3 هما الخياران العمليان. وعندما تكون السرعة الخام أهم من الجودة القصوى، يقدم Kling v2.6 مخرجات سريعة بدقة 720p مع الحفاظ على الاتساق الزمني نفسه الذي بُنيت عليه عائلة v3.
4 أخطاء توقف عن ارتكابها
تعود معظم مخرجات فيديو الذكاء الاصطناعي الرديئة إلى الأخطاء الأربعة نفسها. ومعالجتها مباشرة تنقل النتائج إلى نطاق جودة مختلف بشكل واضح.

لا يوجد تحديد لاتجاه الضوء في الأمر
أوصاف الإضاءة العامة تنتج مخرجات عامة. فعبارة "إضاءة دراماتيكية" لا تخبر النموذج شيئًا عن الإعداد المادي للقطة. أما "ضوء حجمي من الأعلى يسارًا بزاوية 45 درجة، يلقي ظلالًا طويلة نحو اليمين، ودرجة حرارة لون دافئة 3200K" فتمنح النموذج تهيئة مادية محددة لإعادة إنتاجها. هذا التغيير الواحد ينتج أكبر قفزة ملحوظة في الجودة من أي شيء يمكنك تعديله في الأمر.
الاختبار على النموذج المتقدم قبل أن تنجح الفكرة
تشغيل Kling v3 Video قبل التأكد من فكرة الأمر يهدر الوقت والنقاط معًا. فالسير الصحيح هو تجربة النموذج الأولي على Kling v2.6، والتأكد من أن حركة الكاميرا والتكوين الأساسي يعملان، ثم إنهاء العمل على v3. وسلوك الأوامر ينتقل جيدًا بين الإصدارات داخل عائلة النموذج نفسها.
تغيير عدة متغيرات في كل تكرار
عندما يخرج توليد خاطئًا وتغيّر في الوقت نفسه الشخص والكاميرا والإضاءة، تفقد القدرة على تشخيص ما الذي أصلحه. غيّر متغيرًا واحدًا في كل تكرار، وعامل كل توليد كتجربة مضبوطة. ستتحسن المخرجات أسرع، وستبني مفردات أوامر موثوقة في الطريق.
وصف الكمية بدلًا من الدقة
أمر من 200 كلمة مليء بلغة المزاج ينتج مخرجات أسوأ من أمر من 90 كلمة مع مواصفات مادية دقيقة. فكلمات أكثر عن كيف "يشعر" شيء ما أو "ينقل" إحساسًا لا تساعد النموذج. أما كلمات أكثر عن المكان الدقيق لمصدر الضوء، وما البعد البؤري، ومن أي مادة صُنعت منها ملابس الشخصية، فتساعد النموذج كثيرًا.
💡 نصيحة: احذف من أمرك أي جملة لا تصف جسمًا ماديًا أو موضعًا أو مادة أو حركة. إذا لم تظهر في ورقة إعداد الكاميرا، فغالبًا ما تنتمي إلى لوحة المزاج.
ما الذي تجربه على PicassoIA الآن
تُعد مجموعة Kling v3 المعيار الإنتاجي الحالي لفيديو الذكاء الاصطناعي السينمائي. يتولى Kling v3 Video معظم العمل السردي. ويتولى Kling v3 Motion Control الأمر عندما تحتاج إلى مسار كاميرا دقيق من صورة مرجعية. ويغطي Kling v3 Omni Video سيناريوهات متعددة المدخلات ومرنة.
إلى جانب Kling، يوفر PicassoIA Seedance 2.0 لتوليد يتضمن الصوت أصلًا، وKling Avatar v2 لتحريك الوجوه ومقاطع الرأس المتحدث، و PicassoIA Video للتوليد المجاني غير المحدود عندما تريد تجربة الأفكار دون أي ضغط على التكلفة. يضم الكتالوج الكامل أكثر من 87 نموذجًا لتحويل النص إلى فيديو من Google و OpenAI و ByteDance و Luma و Minimax، وكلها متاحة من الواجهة نفسها.

الفجوة بين فيديو ذكاء اصطناعي متوسط وآخر سينمائي حقيقي ليست فجوة في النموذج. إنها فجوة في الأوامر. حركة الكاميرا، والبعد البؤري، واتجاه الضوء، ومرجع نوع الفيلم: هذه هي المواصفات المادية التي يحتاجها النموذج لإنتاج لقطات تصمد فعلًا أمام الشاشة.
اختر مشهدًا كنت تتخيله. طبّق البنية ذات الأجزاء الأربعة. اكتبه بدقة. شغّله على Kling v3 Video. المقطع السينمائي الناجح الأول يغيّر ما تعتقده عن الفيديو الذي يمكن للذكاء الاصطناعي إنتاجه فعلًا. اكتشف ما يمكن للمجموعة الكاملة فعله على picassoia.com/en/all-models.