كيف تنشئ فيديوهات بالذكاء الاصطناعي باستخدام Kling 3.5: نتائج تبهر فعلًا

غيّر Kling 3.5 شكل توليد الفيديو بالذكاء الاصطناعي في الواقع العملي. يشرح هذا المقال طريقة عمل النموذج، وما الذي يميّزه عن سلسلة Kling v2.x، وكيف تصيغ أوامر نصية تنتج نتائج سينمائية، وكيف تشغّله مجانًا عبر منصات مثل PicassoIA. إذا كنت تريد مخرجات حقيقية لا وعودًا غامضة، فهذا هو المكان المناسب للبدء.

كيف تنشئ فيديوهات بالذكاء الاصطناعي باستخدام Kling 3.5: نتائج تبهر فعلًا
Cristian Da Conceicao
مؤسس Picasso IA

Kling 3.5 ليس فكرة ولا وعدًا. إنه يعمل الآن على منصات عامة، وينتج مقاطع فيديو تصمد أمام الفحص الدقيق، والأشخاص الذين يولّدونها ليسوا محترفين في المؤثرات البصرية بعقود من الخبرة. إنهم صنّاع محتوى، ومخرجون مستقلون، ومسوّقون، ومجرّبون فضوليون اكتشفوا أمرًا واحدًا: جودة المخرجات تتحدد تقريبًا بالكامل بجودة الأمر النصي. يشرح هذا المقال طريقة عمل Kling 3.5، وموقعه ضمن عائلة نماذج Kling، وكيف تحصل بالضبط على نتائج تستحق المشاركة.

ماذا يفعل Kling 3.5 فعليًا

Kling 3.5 نموذج لتوليد الفيديو من Kwai (الفريق الذي يقف وراء KlingAI)، ويمثّل جيل البنية 3.x. فإذا كانت سلسلة 2.x منافسة بالفعل في الاتساق الزمني وواقعية الحركة، فقد رفع الجيل 3.x جودة السينما والتصيير المدرك للفيزياء والتماسك في المقاطع الطويلة إلى مستوى أعلى بشكل ملموس.

يقبل النموذج نوعين من المدخلات: أمر نصي وحده، أو صورة مقترنة بأمر نصي للتحريك الموجّه. يُنتج الوضعان مقاطع يصل طولها إلى 10 ثوانٍ بدقة تصل إلى 1080p، وذلك حسب الإصدار الذي تختاره.

المحرك الأساسي

ما يميّز Kling عن كثير من نماذج الفيديو المنافسة هو توليف الحركة المدرك للفيزياء. عندما تطلب منه إظهار "امرأة تمشي تحت المطر"، تصطدم القطرات بالأرض وتتناثر. تتحرك الأقمشة بسحب وقصور ذاتي واقعيين. وتعكس البرك المشهد بدقة معقولة. هذا ليس مضمونًا في كل توليد، لكنه متسق بما يكفي ليكون مهمًا في العمل الإنتاجي الحقيقي.

يفهم النموذج أيضًا لغة الكاميرا جيدًا. مصطلحات مثل "slow dolly-in" أو "tracking shot" أو "handheld follow" تشكّل فعلًا سلوك الكاميرا الافتراضية، مما يجعل Kling 3.5 مفيدًا حقًا لسرد القصص، بدلًا من إنتاج مقاطع حركة عشوائية فقط.

نظرة سريعة على جودة المخرجات

فيديو سينمائي بالذكاء الاصطناعي يُظهر امرأة تمشي في الحي المالي بطوكيو وقت الساعة الذهبية

عند 1080p، تصمد مخرجات Kling 3.5 أمام الفحص الدقيق. تُصيَّر البشرة بملمس دقيق واقعي، ويُظهر القماش النسيج والتدلي، وتلقي الإضاءة البيئية ظلالًا تبدو دقيقة. النموذج قوي بشكل خاص في الإضاءة الطبيعية في الهواء الطلق: الساعة الذهبية، والسماء الغائمة، والمشاهد الداخلية التي يكون فيها مصدر ضوء رئيسي واحد، كلها تُنتج نتائج ممتازة.

أما نقاط ضعفه فهي: حشود الخلفية المعقدة، والأيدي أثناء الحركة (وما زالت نقطة فشل شائعة في فيديو الذكاء الاصطناعي عبر جميع النماذج)، والمشاهد التي تتطلب ثباتًا صارمًا للأجسام على مدى فترات طويلة. المقاطع التي مدتها خمس ثوانٍ نظيفة عمومًا. وإذا مددتها إلى عشر ثوانٍ فقد تلاحظ انحرافًا طفيفًا في الثبات.

كيف يختلف Kling 3.5 عن الإصدارات السابقة

Kling v2.x مقابل v3.x: الفجوة الفعلية

القفزة من Kling v2.1 Master إلى سلسلة v3 حقيقية وقابلة للقياس. في مخرجات v2.x تكون الحركة سلسة لكنها اصطناعية قليلًا، مع نوع من "الانزلاق" الخاص بالذكاء الاصطناعي الذي تلتقطه العين المدرّبة بسرعة. عالجت سلسلة v3.x هذا بنمذجة أكثر طبيعية للقصور الذاتي عبر الأشخاص والبيئات.

قدّم Kling v2.6 بالفعل تحسينات ملموسة في دقة الألوان والالتزام بالأوامر مقارنة بالإصدارين v2.0 و v2.1. وقد دفعت بنية v3.x هذه العلاقة إلى أبعد من ذلك بكثير.

الميزةKling v2.xKling v3.x (3.5)
أقصى دقة1080p1080p
طبيعية الحركةجيدةأفضل بوضوح
الالتزام بالأمر النصيمتوسطقوي
محاكاة الفيزياءأساسيةمحسّنة
التحكم في الكاميرامحدودأكثر استجابة
الاتساق عند 10 ثوانٍمتفاوتأكثر ثباتًا

ما الذي تحسّن في سلسلة 3.x

ثلاثة أمور تبرز عمليًا عند مقارنة v2.x بـ v3.x:

  1. تحديد الأمر النصي يُترجم إلى نتائج أفضل. في v2.x، كانت كتابة "soft volumetric morning light from the left" تنتج مشهدًا صحيحًا تقريبًا بنسبة 60% من الوقت. في v3.5، يظهر اتجاه الإضاءة المحدد في المخرجات بموثوقية أكبر بكثير.
  2. ازداد ثبات الخلفية. تحتفظ عناصر الخلفية الثابتة (الجدران والسماء والأرصفة) بتفاصيلها بشكل أفضل عبر المدة الكاملة للمقطع.
  3. تبدو حركة الإنسان أكثر عضوية. تحمل مشية المشي وحركات الرأس وإيماءات اليد ثقلًا حقيقيًا وتباطؤًا، بدلًا من حركة بسرعة ثابتة.

كتابة أوامر نصية تنتج نتائج حقيقية

هنا يخفق معظم الناس. الفجوة بين مخرجات Kling المتوسطة ومخرجات مبهرة فعلًا تكون دائمًا تقريبًا في الأمر النصي، لا في إعدادات النموذج.

تشريح أمر Kling جيد

يحتوي الأمر النصي القوي لـ Kling 3.5 على أربع طبقات:

  1. الشخص والفعل: ما الموجود في الإطار وما الذي يفعله.
  2. البيئة والأجواء: المكان، ووقت اليوم، والطقس أو الإضاءة.
  3. سلوك الكاميرا: كيف تتحرك الكاميرا الافتراضية أو تبقى ثابتة.
  4. تفاصيل الملمس والمواد: كيف تبدو الأسطح، وكيف يتصرف القماش، وكيف تظهر البشرة.

أمر ضعيف: "A woman walking in a city at night."

أمر قوي: "A woman in her thirties wearing a charcoal wool coat walks at an even pace down a rain-slick cobblestone alley in central Paris, 11pm, amber streetlights reflected in the wet stones below. The camera follows from behind at chest height on a gentle tracking shot. Her breath is faintly visible. The coat fabric catches the streetlight on her right shoulder."

ينتج كلا الأمرين مخرجات. لكن الثاني وحده ينتج مشهدًا يستحق المشاهدة.

مساحة عمل لتخطيط الأوامر النصية بملاحظات مكتوبة بخط اليد وفنجان قهوة على مكتب خشبي

أخطاء شائعة في الأوامر النصية

  • سرد الصفات دون وصف التفاصيل: عبارات مثل "Cinematic, dramatic, professional" لا تضيف شيئًا. صِف اتجاه الضوء الفعلي، والسطح الفعلي، وحركة الكاميرا الفعلية.
  • إثقال الأمر النصي: ينتج Kling 3.5 مقاطع فيديو مدتها من 5 إلى 10 ثوانٍ. مشهد واحد واضح يتفوق على ثلاثة مشاهد غامضة مكدسة في توليد واحد.
  • تجاهل لغة الكاميرا: يستجيب النموذج للمصطلحات السينمائية. استخدم "slow dolly-in" أو "wide establishing shot" أو "close-up at eye level" أو "handheld follow" لتشكيل سلوك الكاميرا الافتراضية.
  • تجاهل النهاية: صِف ما يحدث عبر المقطع، لا ما يبدو عليه المشهد في البداية فقط.

قوالب أوامر نصية تنجح

بيئة حضرية:

[وصف الشخص والملابس] يمشي عبر [منطقة محددة في المدينة] وقت [وقت اليوم]، [حالة الطقس]. تتحرك الكاميرا [نوع الحركة] على ارتفاع [الارتفاع]. يلقي [مصدر الإضاءة] [ظلًا أو انعكاسًا محددًا]. [تفصيل ملمس السطح].

الطبيعة / المناظر الطبيعية:

لقطة عريضة لمنظر من نوع [نوع المنظر الطبيعي] وقت [وقت اليوم]. [الطقس/الجو]. [العنصر الأمامي] في تركيز حاد. تتحرك الكاميرا [الحركة] من [الموضع الابتدائي] إلى [الموضع النهائي]. [نوع الفيلم أو لوحة الألوان].

داخلي / شخص:

[الشخص] [الفعل] في [المساحة الداخلية المحددة]. يأتي [مصدر الضوء الرئيسي الوحيد] من [الاتجاه]، فيلقي [التأثير]. تتحرك الكاميرا [الحركة] على ارتفاع [الارتفاع]. [ملمس السطح أو القماش].

تحويل النص إلى فيديو: من الكلمات إلى مشاهد

يتولى Kling v3 Video وKling v3 Omni Video توليد تحويل النص إلى فيديو بشكل خالص. تقدّم الأمر النصي وحده، ويبني النموذج المشهد كاملًا من الصفر.

ما يتعامل معه النموذج بشكل جيد

  • أشخاص في حالة حركة: المشي والجري والاستدارة والجلوس الواقعي.
  • بيئات خارجية: الشوارع والحقول والغابات والسواحل وأسطح المدن.
  • الظروف الجوية: المطر والضباب والساعة الذهبية والسماء الرمادية الغائمة.
  • حركات الكاميرا: التتبع والدولي واللقطات العريضة الثابتة.

شخص يكتب أوامر نصية لفيديوهات الذكاء الاصطناعي على حاسوب محمول ليلًا في مكتب منزلي مظلم

يؤدي النموذج أداءً جيدًا بشكل خاص عندما يصف الأمر النصي شخصًا واحدًا في بيئة خارجية بإضاءة محددة بوضوح. هنا يُنتج Kling 3.5 باستمرار أكثر مخرجات تبدو كأنها لقطات حقيقية. المشاهد الداخلية جيدة لكنها تحتاج إلى صياغة أوامر أكثر حذرًا لمنع الإضاءة من أن تصبح مسطّحة.

أين لا يزال يواجه صعوبات

النص داخل الإطار غير موثوق، وهي مشكلة معروفة في تقريبًا كل نماذج الفيديو في هذه المرحلة. تفقد مشاهد الحشود المعقدة تماسكها بسرعة. لا يمكن إجراء قطعات متعددة داخل توليد واحد، لذا يكون كل مقطع لقطة مستمرة واحدة.

بالنسبة لسير العمل الذي يحتاج إلى دقة أعلى في الأوامر النصية، يقرن بعض المستخدمين Kling بنماذج لغوية كبيرة مثل Claude Opus 4.7 أو GPT 5 لتحسين الأوامر النصية وتوسيعها قبل إرسالها إلى نموذج الفيديو. وكلاهما متاح على PicassoIA.

تحويل الصورة إلى فيديو: تحريك الصور الثابتة

هذه ربما أكثر قدرة مبهرة فورًا يقدمها Kling 3.5. تقدّم صورة ثابتة كإطار أول، وتضيف أمرًا نصيًا للحركة، فيحرّكها النموذج إلى الأمام في الزمن.

اختيار الصورة المصدر المناسبة

ليست كل الصور تتحرك بالقدر نفسه من الجودة. أفضل صور المصدر لتحويل الصورة إلى فيديو باستخدام Kling 3.5:

  • شخص واضح له مساحة للحركة: الشخص الذي تحيط به مساحة في الإطار يتحرك بطبيعية أكبر من القص الضيق.
  • إضاءة محددة: التباين العالي بين المناطق المضاءة والمظللة يساعد النموذج على الحفاظ على اتساق الإضاءة طوال التحريك.
  • معالجة لاحقة ثقيلة بالحد الأدنى: الصور المفرطة الحدة أو المفلترة بكثافة تميل إلى إدخال عيوب في التحريك.
  • نسبة عرض إلى ارتفاع 16:9: تطابق النسبة الأصلية للنموذج وتتجنب عيوب القص.

فارس يظهر ظلًا أمام غروب الشمس في هضاب اسكتلندا، صورة مصدر سينمائية مثالية لفيديو الذكاء الاصطناعي

كتابة أوامر الحركة لتحويل الصورة إلى فيديو (I2V)

عند استخدام صورة كإطار بداية، يصف أمر الحركة ما يتغير خلال 5 إلى 10 ثوانٍ التالية. فكّر فيه كتوجيه للحركة إلى الأمام انطلاقًا من لحظة متجمدة.

بنية أمر I2V القوي: "[Subject in image] begins to [specific action]. Camera [movement]. [Environmental element] responds naturally. The scene progresses over 5 seconds with [lighting or atmospheric detail]."

يقرأ النموذج الصورة لتحديد الحالة الابتدائية، ويقرأ أمرك لتحديد المسار. عندما يكون الاثنان محددين، تكون النتيجة موثوقة. وعندما يتناقض الأمر مع محتوى الصورة (كطلب المطر حين تُظهر الصورة المصدر شاطئًا مشمسًا)، تصبح النتائج غير متوقعة.

التحكم في الحركة في سلسلة Kling v3

يضيف Kling v3 Motion Control طبقة من توجيه الكاميرا الصريح تتجاوز بكثير ما يمكن أن تحققه لغة الأمر النصي وحدها.

ما الذي يفعله التحكم في الحركة

بدلًا من استنتاج سلوك الكاميرا من النص، يتيح لك التحكم في الحركة تحديد مسار الكاميرا والدوران ومعاملات التقريب مباشرة. وهذا مفيد بشكل خاص في:

  • إنشاء لقطات الدولي التي تحافظ على موضع ثابت للشخص في الإطار
  • إنتاج دوران حول نقطة اهتمام مركزية
  • توليد تسلسلات تقريب بطول بؤري بداية ونهاية محددين

حركات الكاميرا التي يمكنك توجيهها

يتعرف نظام التحكم على عدة أنواع من الحركة:

  • Dolly in / Dolly out: تتحرك الكاميرا فعليًا للأمام أو للخلف عبر المشهد.
  • Pan left / Pan right: تدور الكاميرا حول محورها الرأسي.
  • Tilt up / Tilt down: تدور الكاميرا حول محورها الأفقي.
  • Orbit: تدور الكاميرا حول الشخص مع الحفاظ على تركيزها عليه.
  • Crane up / Crane down: ترتفع الكاميرا أو تنخفض عموديًا.

دمج حركتين، مثل panning بطيء مع crane up خفيف، ينتج عملًا كاميراويًا مركّبًا يبدو كتصوير سينمائي حقيقي، لا كرسوم متحركة رقمية.

يشغّل Kling v2.6 Motion Control نظام التحكم نفسه على نموذج v2.6 إذا أردت مقارنة المخرجات عبر الأجيال على اللقطة نفسها.

مخرج أفلام يدرس مخططات التحكم في الحركة على جهاز لوحي داخل استوديو أفلام احترافي

كيف تستخدم Kling v3 على PicassoIA

تمنحك PicassoIA الوصول إلى كامل تشكيلة نماذج Kling v3 دون اشتراك منفصل في KlingAI. إليك كيف يسير سير العمل عمليًا.

الخطوة 1: اختر نموذجك

انتقل إلى picassoia.com/en/all-models وابحث عن "Kling" لرؤية القائمة الكاملة. لأغلب نقاط البداية:

الخطوة 2: جهّز أمرك النصي

واجهة منصة PicassoIA على جهاز MacBook في مساحة عمل مشتركة مع إطلالة على أفق المدينة

في حقل الأمر النصي، استخدم بنية الطبقات الأربع من الأعلى: الشخص والفعل، والبيئة والأجواء، وسلوك الكاميرا، وتفاصيل الملمس. أبقه دون 200 كلمة. لا تنتج الأوامر الأطول مخرجات أفضل باستمرار، وعند طول معين تبدأ في إدخال تناقضات يضطر النموذج إلى التوفيق بينها.

بالنسبة لتحويل الصورة إلى فيديو، ارفع صورة المصدر من حقل إدخال الصورة الذي يظهر عند اختيار نموذج متوافق. يقبل النظام صيغ JPG و PNG و WebP.

الخطوة 3: راجع وكرّر

شغّل التوليد مرة واحدة. إذا لم تكن المخرجات كما تريد، فحدّد عنصرًا واحدًا محددًا لتغييره قبل إعادة التشغيل. تغيير كل شيء دفعة واحدة يجعل من المستحيل معرفة أي تعديل نجح.

أكثر التحسينات شيوعًا في الممارسة:

  • المخرجات ساكنة جدًا: أضف وصفًا أوضح للحركة في الأمر النصي.
  • الكاميرا لا تتحرك كما هو متوقع: استخدم مصطلحات سينمائية أكثر تحديدًا ("slow dolly-in from 3 meters" بدلًا من "camera moves forward").
  • الإضاءة تبدو مسطّحة: أضف مصدر ضوء محددًا مع الاتجاه ("single diffused light from camera right").
  • الشخص يبدو غير طبيعي: صِف الحالة الجسدية للشخص بمزيد من التفصيل (الخطوة، والوضعية، وسلوك الملابس في المشهد).

💡 عادة مفيدة: بعد كل توليد، اكتب جملة واحدة تصف بدقة ما ستغيّره قبل إعادة التشغيل. هذا يُبقي التكرار مركّزًا ويقلّل عدد التوليدات التي تحتاجها.

نماذج فيديو أخرى بالذكاء الاصطناعي تستحق التجربة

Kling 3.5 ممتاز لكنه ليس الخيار الوحيد الذي يستحق الاحتفاظ به ضمن أدواتك. تتعامل عدة نماذج أخرى على PicassoIA مع حالات استخدام مختلفة أو تنتج جماليات متميزة تناسب مشروعًا بعينه بشكل أفضل.

نماذج لها نقاط قوة مختلفة

مقارنة على شاشتين مزدوجتين لمخرجات نماذج فيديو الذكاء الاصطناعي في إعداد استوديو نظيف

Seedance 2.5 من ByteDance ينتج مقاطع تصل إلى 30 ثانية مع صوت أصلي، وهو ما لا يقدمه Kling حاليًا. بالنسبة للفيديوهات التي تحتاج إلى صوت محيط أو مزامنة مع الموسيقى، يستحق Seedance أن يُشغَّل بالتوازي.

Veo 3.1 من Google ينتج تحويل نص إلى فيديو بدقة 1080p مع تكامل صوتي قوي. تصيير البيئات الطبيعية لديه، خاصة الماء والسماء، نظيف بشكل خاص.

Ray 3.2 من Luma خيار سريع للقطات السينمائية مع مخرجات HDR. إذا كنت تحتاج إلى إنجاز سريع ولا تحتاج إلى عمق جودة الحركة في Kling، فإن Ray 3.2 بديل قوي.

Wan 2.7 T2V ينتج تحويل نص إلى فيديو بدقة 1080p ببنية مفتوحة الأوزان، مما يعني أنه يميل إلى تفسير الأوامر غير المعتادة أو الإبداعية بحرية أكبر من النماذج التجارية المضبوطة بإحكام.

Kling v2.5 Turbo Pro لا يزال ذا صلة بالمستخدمين الذين يحتاجون إلى سرعة توليد عالية ولديهم بالفعل أسلوب أمر نصي ينتج نتائج موثوقة في جيل v2.5.

النموذجنقطة القوة الأساسيةالصوتأقصى مدة
Kling v3 Omni Videoجودة سينمائيةلا10 ثوانٍ
Seedance 2.5مقاطع طويلة مع صوتنعم30 ثانية
Veo 3.1بيئات طبيعية + صوتنعم8 ثوانٍ
Ray 3.2HDR، إنجاز سريعلا10 ثوانٍ
Wan 2.7 T2Vمرونة في الأوامر الإبداعيةلا10 ثوانٍ

ابدأ بإنشاء مقاطعك الخاصة

توليد الفيديو بالذكاء الاصطناعي مع Kling 3.5 يكافئ التحديد ويعاقب الغموض. الأشخاص الذين ينتجون أكثر المخرجات إبهارًا لا يستخدمون عتادًا أفضل ولا إعدادات سرية. إنهم يكتبون أوامر نصية أدق، ويدرسون ما ينجح عبر التوليدات، ويكررون التجربة بقصد.

منظر جوي لطريق جبلي عند الفجر مع سيارة واحدة تمر عبر غابة صنوبر، مشهد فيديو سينمائي بالذكاء الاصطناعي

تجمع PicassoIA تشكيلة Kling v3 الكاملة إلى جانب أكثر من 80 نموذج فيديو آخر في مكان واحد. شغّل Kling v3 Omni Video لأعمال تحويل النص إلى فيديو، وانتقل إلى Kling v3 Motion Control عندما تحتاج إلى مسارات كاميرا دقيقة، وقارن النتائج مع Seedance 2.5 أو Veo 3.1 في الجلسة نفسها دون التبديل بين المنصات.

أسرع طريقة لتصبح أفضل في استخدام Kling 3.5 هي تشغيله. خذ قوالب الأوامر النصية من هذا المقال، وغيّر عنصرًا واحدًا في كل مرة، وراقب كيف يتغير المخرج استجابة لذلك. وخلال بضع جلسات ستكون لديك صورة واضحة عمّا يستجيب له هذا النموذج وما يتجاهله.

انتقل إلى picassoia.com/en/all-models واختر نموذج Kling v3 الذي يناسب نقطة بدايتك.

شابة على سطح منزل عند الغروب تشاهد تشغيل فيديو مولّد بالذكاء الاصطناعي على حاسوب محمول

شارك هذا المقال

اختر لغتك

مقالات ذات صلة