تغيّر شيء ما مع إطلاق Kling 3.0. كانت نماذج تحويل النص إلى فيديو السابقة تنتج مشاهد تبدو كفيديو، لكنها تبدو خاطئة، كأنك تشاهد رسومًا متحركة تبذل جهدًا زائدًا لتبدو مصوّرة. أما Kling 3.0 فينتج لقطات تملك فيها الحركة نفسها وزنًا، فتتصرف الأقمشة كأقمشة، وتنكسر الموجة بفوضى الماء الحقيقية. والوصول إلى هذه النتيجة يتطلب فهم ما يحدث بين لحظة ضغطك على Enter ولحظة ظهور ملف الفيديو على شاشتك.
ماذا يفعل Kling 3.0 فعلًا
النص مخطط للحركة
الأمر النصي الذي تُدخله إلى Kling 3.0 ليس مجرد وصف. إنه مواصفة للزمن. يقرأ النموذج كلماتك ويستخرج ثلاثة أنواع متمايزة من المعلومات: هوية الشخص أو الشيء (ما هو)، والدلالة الحركية (ماذا يفعل)، والسياق البيئي (أين وفي أي ظروف). تُعالج هذه الطبقات الثلاث بشكل منفصل، ثم يُعاد دمجها أثناء التوليد.
عندما تكتب "امرأة تمشي في شارع من الحجارة المرصوفة عند الغسق"، لا يولّد النموذج صورة ثابتة ثم يضيف حلقة مشي متحركة فوقها. بل يبني التسلسل المكاني الزمني كله كبنية موحّدة. تتحرك الظلال وفق اتجاه الضوء الذي لمّحت إليه. تحمل خطوتها الاهتزاز الدقيق لمشية حقيقية. تعكس حجارة الشارع المبتلة الضوء بزوايا تتغير مع حركتها عبر الإطار. كل عنصر يشارك في نظام الحركة في الوقت نفسه.
أكثر من مجرد إطارات مفتاحية
عملت أنظمة تحويل النص إلى فيديو الأولى بتوليد إطار بداية وإطار نهاية، ثم إيجاد الإطارات الوسيطة بينهما بالاستيفاء. لهذا بدت مقاطع الذكاء الاصطناعي القديمة كتحوّل ناعم لكنه بلا روح بين لحظتين مجمّدتين. لم يكن هناك إحساس بالاستمرارية لأنها لم تكن موجودة أصلًا. كانت الإطارات الوسيطة تخمينات، لا فيزياء.
لا يعمل Kling 3.0 بهذه الطريقة. تولّد البنية ما يسميه الباحثون تسلسلات زمنية كاملة، بدلًا من أزواج من الإطارات. كل إطار يدرك كل إطار آخر في المقطع. يعرف النموذج أن الإطار 47 يجب أن يتسق مع الإطار 12 ليس فقط من حيث موضع الجسم، بل أيضًا من حيث سرعة الحركة، وتطوّر الإضاءة، والحالة الفيزيائية. هذا الإدراك عبر المقطع كله هو ما يلغي مشكلة "فيزياء الهلام" التي أرّقت النماذج السابقة، وما زالت أوضح علامة على الفيديو المولّد بالذكاء الاصطناعي.

داخل محرك الحركة
التحليل الدلالي أولًا
قبل توليد أي إطار واحد، يجري Kling 3.0 تحليلًا دلاليًا عميقًا لأمرك النصي. يحدد كل اسم، وكل فعل، والأهم من ذلك، كل علاقة ضمنية بينها. تعطي كلمة "يتدحرج" عند تطبيقها على أوراق الخريف متجهات حركة مختلفة تمامًا عن "يسقط". وعبارة "نسيم لطيف" لا تؤثر في الشعر والأوراق فقط، بل تؤثر أيضًا في كيفية تحرك ظلال تلك الأوراق على الأرض، مما يغيّر الإضاءة المحيطة في المشهد كله لحظة بعد لحظة.
هنا حقق Kling 3.0 قفزته الأهم مقارنةً بالإصدارات السابقة. يمتلك النموذج مفردات أوسع بكثير من العناصر الأولية للحركة، وهي أنماط حركة محددة مسبقًا مستخلصة من ملايين الساعات من اللقطات الواقعية المحللة. عندما يصادف فعلًا حركيًا أو وصفًا حركيًا في أمرك، يسترجع العنصر الأولي المقابل له ويكيّفه مع أشخاصك وبيئتك المحددة. والنتيجة أن أفعال الحركة تحمل ثقلًا فيزيائيًا حقيقيًا، لا مجرد أسهم اتجاهية.
يحسم النموذج أيضًا تعارضات الحركة قبل بدء التوليد. إذا وصف أمرك "شمعة تتراقص في رياح عاتية"، يوفّق النموذج بين الاضطراب المتمايل المتضمن في لهب الشمعة والبيئة المحيطة، ويطبّق الحركة المناسبة على الدخان والظلال وأي قماش قريب في الوقت نفسه. كل ذلك يأتي من تحليل جملتك، لا من قواعد مبرمجة مسبقًا.
الانتشار الزمني: إطارًا بإطار
تستخدم عملية التوليد الفعلية بنية انتشار معدّلة صُمّمت خصيصًا للاتساق الزمني. يولّد الانتشار التقليدي للصور مخرجًا واحدًا عبر إزالة الضوضاء تدريجيًا من حقل ضوضاء عشوائي حتى تظهر صورة متماسكة. أما انتشار الفيديو فينفّذ هذه العملية على كتلة كاملة من الإطارات في الوقت نفسه، مما يعني أن عملية إزالة الضوضاء للإطار 1 والإطار 60 مرتبطتان رياضيًا منذ البداية.
يستخدم Kling 3.0 ما يبدو أنه آلية انتباه ثلاثية الأبعاد تعمل عبر البعدين المكانيين داخل كل إطار، وعبر البعد الزمني عبر المقطع. كل بكسل في كل لحظة زمنية له علاقة مع البكسل المقابل له في نقطة زمنية مختلفة. والنتيجة أن الأجسام لا ترتعش بين الإطارات، ولا تتشوّه الوجوه، وتبقى الملامس متسقة، وتحافظ العناصر المتحركة على خصائصها الفيزيائية طوال المقطع دون أي حيل ما بعد المعالجة.

💡 نصيحة للأوامر النصية: صِف الحركة بأفعال محددة وظروف فيزيائية واضحة. "ورقة شجر تنجرف ببطء نحو الأسفل في هواء ساكن تمامًا" ستنتج حركة أكثر واقعية من "ورقة شجر تسقط"، لأن النموذج يملك مرتكزات دلالية أكثر للفيزياء التي يحتاج إلى محاكاتها.
كيف تبقى الفيزياء واقعية
الأقمشة والشعر وديناميكا السوائل
من أوضح التحسينات في Kling 3.0 معالجة ما يسميه الفريق الحركة الثانوية، أي حركة العناصر المرتبطة فيزيائيًا بالشخص المتحرك الأساسي أو المتأثرة به. عندما يمشي شخص، يتحرك شعره وسترته وشاله وإكسسواراته استجابةً فيزيائية لحركته. عانت النماذج السابقة هنا، لأن الحركة الثانوية تتطلب من النموذج أن يحمل تمثيلًا داخليًا للعلاقة الفيزيائية بين الأجسام، لا أن يحرّكها بشكل مستقل.
يستخدم Kling 3.0 نهج توليد مشروطًا بالفيزياء. خلال التدريب، استوعب النموذج كميات هائلة من اللقطات المُعلَّمة بخصائص فيزيائية: وزن القماش ونسيجه، ومرونة الشعر وسُمكه، ولزوجة السوائل، وسلوك الجسيمات في ظروف جوية مختلفة. بنى نموذجًا ليس لشكل هذه الأشياء عندما تتحرك فحسب، بل للأسباب الميكانيكية التي تجعلها تتحرك بهذه الطريقة. عندما يصف أمرك امرأة ترتدي فستانًا من الحرير المنسدل وتركض تحت المطر، يطبّق النموذج القيود الفيزيائية المكتسبة ليضمن أن يتصرف القماش كحرير مبلول بالسرعة، لا كعباءة CGI خفيفة بلا وزن في الفراغ.

حركة الكاميرا الطبيعية
من الميزات التي لا تُقدَّر بما يكفي في Kling 3.0 سلوك الكاميرا الضمني. عندما لا تحدد حركة للكاميرا، لا يلجأ النموذج إلى لقطة ثابتة تمامًا. بل يطبّق حضورًا خفيفًا وطبيعيًا للكاميرا يحاكي الحركات الدقيقة لمصوّر محترف يحمل الكاميرا باليد. تنفّس خفيف للكاميرا. وإعادة تأطير بالكاد ملحوظة مع تحرك الشخص. وهذا يضيف واقعية على طريقة الأفلام الوثائقية، تجعل اللقطات تبدو مسجّلة لا مُولَّدة.
عندما تحدد حركة للكاميرا، مثل "دوللي بطيء للأمام" أو "بانورامية إلى اليسار تتبع الشخص"، يتعامل Kling 3.0 مع الكاميرا كجسم فيزيائي يتحرك عبر المشهد ثلاثي الأبعاد. يتغير عمق الميدان مع تغيّر المسافة البؤرية. ويتصرف الانزياح المنظوري بين العناصر الأمامية والخلفية بشكل صحيح. وتتحرك الأجسام على مسافات مختلفة عبر الإطار بسرعات مختلفة تمامًا كما تفعل في التصوير الضوئي الحقيقي بعدسة فعلية.
Kling v3 مقابل الإصدارات السابقة
| الميزة | Kling v1.6 | Kling v2.1 | Kling v3 |
|---|
| الدقة | 720p | 720p / 1080p | 1080p أصلية |
| الاتساق الزمني | متوسط | جيد | ممتاز |
| الحركة الثانوية (القماش، الشعر) | أساسية | محسّنة | مشروطة بالفيزياء |
| الالتزام بالأمر النصي | 70% | 82% | 94% |
| التحكم في الكاميرا | علامة يدوية | علامة يدوية | ضمني + صريح |
| درجة واقعية الحركة | 6.2 / 10 | 7.8 / 10 | 9.1 / 10 |
القفزة من Kling v2.1 إلى Kling v3 Video ليست تدريجية. أُعيد تصميم البنية حول الاتساق الزمني من الأساس، ولهذا يكون الفارق في واقعية الحركة بين هذين الإصدارين أكبر من مجموع كل قفزات الإصدارات السابقة.

ما الذي يتحكم فيه أمرك النصي
حركة الأشخاص
أوضح أداة تحكم هي طريقة وصفك لما يفعله الأشخاص. يستجيب Kling 3.0 لما يلي:
- أوصاف السرعة: "ببطء"، و"بسرعة"، و"تدريجيًا" تنتج جميعها سرعات حركة وأنماط تسارع مختلفة بشكل قابل للقياس
- جودة الحركة: "يتعثر"، و"يخطو بخطوات واسعة"، و"ينزلق" تربط كل منها بمكتبات عناصر أولية مختلفة للحركة، بوضعيات وإيقاعات مختلفة
- أفعال التفاعل: كيفية تفاعل الأشخاص مع الأشياء والبيئات تؤثر في العنصرين معًا، لا في الشخص وحده
- السياق العاطفي: "يركض بفرح" مقابل "يركض بذعر" ينتجان وضعية مختلفة، ومرجحة مختلفة للذراعين، ونمط مختلف لضربة القدم، وتعبيرات وجه دقيقة مختلفة طوال المقطع
كل كلمة حركية هي قيد حقيقي على التوليد. اللغة الحركية الغامضة تنتج حركة غامضة. اللغة الحركية المحددة تنتج حركة لها طابع فيزيائي واضح يمكنك التعرف عليه والتنبؤ به.
البيئة والأجواء
الكلمات البيئية في أمرك لا تكتفي بتحديد الخلفية. إنها تقيّد فيزياء كل شيء في المشهد. وصف "عاصفة مطرية شديدة" يخبر النموذج بتطبيق فيزياء المطر على كل سطح مكشوف: لمعان الماء على البشرة، والشعر المبتل الملتصق، وتموجات البرك من كل قطرة، وتقلّص وضوح الخلفية، والجودة العاكسة المحددة للرصيف المبتل تحت مصادر الضوء المختلفة.
للوقت من اليوم وأوصاف الإضاءة وزن خاص، لأنها تؤثر في تطوّر الضوء إطارًا بإطار عبر المشهد كله. يمنح "الساعة الذهبية تتلاشى إلى الغسق" النموذج قوسًا ضوئيًا، أي أنه يولّد مقطعًا يتغير فيه جودة الضوء فعلًا عبر مدته، فيتبدل مستوى حرارة اللون، وطول الظلال، والإبراز اللامع على كل سطح في المشهد.

سلوك الكاميرا
يمكنك تحديد سلوك الكاميرا مباشرةً باستخدام اللغة السينمائية التي دُرِّب Kling 3.0 على تفسيرها:
- نوع اللقطة: "لقطة مقرّبة"، و"لقطة عريضة"، و"لقطة متوسطة"، و"لقطة مقرّبة جدًا"
- حركة الكاميرا: "دوللي للداخل"، و"بانورامية لليمين"، و"رافعة للأعلى"، و"لقطة تتبعية"، و"مدار حول الشخص"
- سلوك العدسة: "عمق ميدان ضحل"، و"تحويل التركيز إلى الخلفية"، و"تشوّه العدسة الواسعة"
- شخصية الكاميرا: "محمولة باليد"، و"مثبتة"، و"ستيديكام"، و"درون"
💡 نصيحة احترافية: اجمع نوع اللقطة مع حركة الكاميرا للحصول على أقصى تحكم. "دوللي بطيء للداخل من لقطة متوسطة إلى مقرّبة، عمق ميدان ضحل، ستيديكام" يمنح النموذج مجموعة تعليمات بصرية كاملة، وينتج نتائج أكثر سينمائية بكثير من وصف حركة الشخص وحده.
كيفية استخدام Kling v3 على PicassoIA
يضم PicassoIA ثلاثة إصدارات من Kling v3، كل منها مناسب لحالة استخدام مختلفة قليلًا.
الخطوة 1: اختر الإصدار المناسب
| النموذج | أفضل استخدام | الرابط |
|---|
| Kling v3 Video | تحويل النص إلى فيديو عام، ومقاطع سينمائية | افتح النموذج |
| Kling v3 Omni Video | من النص إلى 1080p مع مدة ممتدة | افتح النموذج |
| Kling v3 Motion Control | تحريك الشخصيات بدقة والتحكم في الوضعيات | افتح النموذج |
بالنسبة لمعظم أعمال تحويل النص إلى فيديو، ابدأ بالنموذج Kling v3 Video. يتعامل مع أوسع نطاق من الأوامر النصية، وينتج أكثر المخرجات سينمائية وثباتًا، مع أقل قدر من الجهد في صياغة الأوامر.
الخطوة 2: اكتب أمرًا نصيًا قويًا
ابنِ أمرك النصي من خمس طبقات:
- الشخص + الفعل: من يفعل ماذا، وبأي مستوى من الطاقة
- البيئة: أين، وتحت أي ظروف فيزيائية، وما الأسطح والمواد الموجودة
- الإضاءة: وقت اليوم، وجودة الضوء، واتجاهه، ومستوى حرارة اللون
- الكاميرا: نوع اللقطة، والحركة، وسلوك العدسة، وشخصية الكاميرا
- المزاج: النبرة الجوية والعاطفية للمشهد
أمر ضعيف: "امرأة تركض على الشاطئ"
أمر قوي: "امرأة شابة ترتدي فستانًا من الكتان الأبيض تركض حافية القدمين على طول شاطئ مهجور عند الفجر، وشعرها يتطاير خلفها، ورمال مبتلة تحت قدميها، ولقطة تتبعية منخفضة الزاوية على ارتفاع الخصر تسير بمحاذاتها، وضوء خلفي دافئ وناعم من الشمس الصاعدة يُلقي ظلًا طويلًا أمامها"
يمنح الأمر القوي النموذج الطبقات الخمس كلها. والفرق في جودة المخرجات بين هذين الأمرين ليس طفيفًا.

الخطوة 3: حدّد المدة وخيارات المخرجات
- المدة: 5 ثوانٍ مناسبة للقطات التأسيسية ومحتوى المنتجات. أما 10 ثوانٍ فتمنحك مساحة لقوس حركي يضم بداية ووسطًا ونهايةً.
- نسبة العرض إلى الارتفاع: 16:9 للمحتوى السينمائي والأفقي. و9:16 لمحتوى Reels والمحتوى العمودي القصير.
- الوضع: استخدم وضع أعلى جودة للمحتوى الرئيسي حين يكون زمن التوليد أقل أهمية من دقة المخرجات.
💡 إذا أخفق التوليد الأول في الفيزياء أو جودة الحركة، فعدّل متغيرًا واحدًا في كل مرة. أكثر الحلول شيوعًا هو إضافة وصف سرعة صريح وظرف إضاءة محدد. كلاهما يثبّت خيارات الحركة لدى النموذج بشكل ملحوظ، ويحسّن الواقعية الفيزيائية في التوليدات اللاحقة.
حالات استخدام حقيقية تستحق المعرفة
محتوى وسائل التواصل الاجتماعي
يُستخدم Kling 3.0 بكثافة في محتوى اجتماعي يبدو مصوّرًا وهو ليس كذلك. محتوى الأزياء، وإعلانات السفر التشويقية، ولقطات المنتجات بأسلوب الحياة المتحرك، كلها تُولَّد من وصف نصي واحد. وقد بلغت جودة الحركة مستوى لم يعد معه الجمهور يتعرّف فورًا على اللقطات بوصفها مولّدة بالذكاء الاصطناعي، وهذا يغيّر القيمة العملية بشكل كبير.

تصوّر المفاهيم
بالنسبة للكتّاب والمخرجين وفرق العمل الإبداعي، يتيح Kling 3.0 طريقة لإخراج الأفكار قبل أن تُرفع الكاميرا أصلًا. يتحول وصف مشهد من سيناريو إلى مقطع مرجعي متحرك خلال دقائق. تتوقف لوحة المزاج عن كونها ثابتة. ويصبح ملمس المشهد المقترح، وجودة ضوئه، وطاقته، شيئًا يستطيع فريق إبداعي بأكمله التفاعل معه وتعديله دون أي تكلفة إنتاج.

السرد القصصي دون كاميرا
يُعد السرد القصصي القصير أكثر التطبيقات مباشرةً. يسجّل الراوي الصوت، ويولّد Kling 3.0 المرئيات المقابلة من أوصاف مشاهد جيدة الكتابة. وبالجمع مع أداة مزامنة شفاه مثل Kling Avatar v2 لمقاطع الحديث أمام الكاميرا، يمكنك إنتاج قطعة سردية قصيرة دون أي إنتاج مادي على الإطلاق.
بالنسبة للسرديات الأطول، فإن الجمع بين Kling v3 Video وKling v2.6 للقطات المساندة، وKling v2.1 Master للقطات الرئيسية، يمنحك سير عمل إنتاج يغطي مستويات جودة مختلفة داخل مشروع واحد، وبتكاليف مختلفة.
ابدأ الآن
التقنية وراء Kling 3.0 جديدة فعلًا. ليست تحسينًا لما كان موجودًا من قبل، بل نهج مختلف لكيفية تمثيل الحركة وتوليدها. وهذا ما يجعل الوقت الحالي مناسبًا لاستخدامها فعلًا بدلًا من قراءة المزيد عنها فحسب.

افتح Kling v3 Video على PicassoIA. اكتب أمرًا نصيًا باستخدام بنية الطبقات الخمس الموضحة أعلاه. ابدأ بشخص تهتم به فعلًا، ومكان يمكنك وصفه بقدر من التحديد، وإضاءة لها طابع واضح. ولّد المقطع. ثم عدّل عنصرًا واحدًا وولّد مرة أخرى. يستجيب النموذج بوضوح للتغييرات في لغتك، ما يعني أنك ستكوّن حدسًا لمفردات حركته بسرعة.
إذا كنت تحتاج إلى تحريك دقيق للشخصيات، فإن Kling v3 Motion Control يمنحك طبقة إضافية من التأثير على وضعية الجسم ومسار الحركة. وبالنسبة لأي عمل يتطلب لقطات متسقة تتجاوز خمس ثوانٍ، فإن Kling v3 Omni Video يمدّ المدة دون أن يفقد الاتساق الزمني.
لا تحتاج إلى معدات كاميرا، ولا إلى فريق تصوير، ولا إلى تصريح تصوير في موقع. تحتاج إلى وصف محدد بما يكفي ليكون تعليمة فيزيائية حقيقية. اكتب ذلك، وسيتولى Kling 3.0 الباقي.