تقلّصت الفجوة بين "المحتوى المولَّد بالذكاء الاصطناعي" و"اللقطات التي تبدو حقيقية" بسرعة تفوق توقعات الجميع. يقف نموذجان وراء معظم هذا التقدم حاليًا: Kling 3.0 من Kuaishou و Veo 3.1 من Google. ينتج كلاهما فيديوهات تخدع المشاهد العادي بانتظام. وكلاهما متاح للاستخدام العام. ويقترب كلاهما من الواقعية الفوتوغرافية من زاويتين تقنيتين مختلفتين جوهريًا، ما يعني أن الخيار الصحيح يعتمد بشدة على ما تنوي إنتاجه.
هذه مقارنة مباشرة تركّز على سؤال واحد: أيّ النموذجين يُنتج فيديو أكثر إقناعًا، يبدو كأنه صُوّر بكاميرا حقيقية؟

ما الذي يميّز Kling 3.0
Kling 3.0 هو الإصدار الكبير الثالث من Kuaishou Technology، إحدى أكبر منصات الفيديو في الصين. ما بناه الفريق ليس نموذج انتشار صور بسيطًا جرى تكييفه للزمن. تعامل بنية Kling الفيديو كمسألة محاكاة فيزيائية: للأجسام كتلة، والضوء يتصرف وفق قواعد، والاتساق الزمني مفروض على مدة المقطع بأكملها بدلًا من الإطار تلو الآخر.
يُطرح النموذج على PicassoIA في ثلاثة إصدارات جاهزة للإنتاج. يتولى Kling v3 Video سير العمل القياسي لتحويل النص إلى فيديو وتحويل الصورة إلى فيديو. ويضيف Kling v3 Omni Video مخرجات متعددة الوسائط تشمل صوتًا متزامنًا. ويتيح Kling v3 Motion Control نقل الحركة بالاعتماد على مرجع، فتتمكن من تصميم حركة دقيقة برفع مقطع مرجعي.
البنية الكامنة وراء Kling 3.0
الابتكار الجوهري في Kling 3.0 هو آلية الانتباه الزمني المستندة إلى الفيزياء. فبدلًا من توقع كل إطار على حدة ثم لصقها معًا، يحافظ النموذج على حالة مستمرة للمشهد، فيتتبع موضع كل جسم، وسرعته، وكيف يجب أن يتطور تفاعله مع الضوء. لهذا تتصرف المياه والأقمشة والشعر في مخرجات Kling بطريقة تبدو صحيحة فيزيائيًا، لا ناعمة بشكل زخرفي.
على مستوى التصيير، يدعم Kling 3.0 دقة تصل إلى 1080p ومدد مقاطع تصل إلى 10 ثوانٍ، وهي حاليًا من أطول المدد القصوى في قطاع تحويل النص إلى فيديو الاحترافي. بالنسبة للمحررين الذين يجمعون سرديات متعددة اللقطات، فإن القدرة على توليد مقاطع مدتها 10 ثوانٍ بدلًا من 5 أو 8 ثوانٍ تعني قصًّا أقل بكثير يجب إدارته.
ما الذي صحّحه 3.0 من الإصدارات السابقة
كان لدى Kling v2.x نمطا فشل موثّقان جيدًا. كانت الأيدي أوضح مشكلة: الأصابع الزائدة، والمفاصل الملتحمة، والجمود غير الطبيعي أثناء الإيماءات، كانت تظهر بكثرة تجعل لقطات الأيدي المقرّبة غير موثوقة. أما الثاني فكان التعابير الدقيقة للوجه. فبينما حافظ v2.1 على ثبات الهوية بشكل معقول، كانت التحولات العاطفية داخل المقطع الواحد تبدو آلية في كثير من الأحيان.
يعالج الإصدار 3.0 الأمرين عبر وحدة مخصّصة لتماسك أجزاء الجسم، وهي مكوّن يطبّق قيودًا إضافية على الأطراف ومناطق ملامح الوجه أثناء التوليد. والنتيجة العملية أيدٍ تتحرك بشكل طبيعي عبر الإيماءات المعقدة، ووجوه تحافظ على تعابير متسقة عاطفيًا طوال المقطع كله.

ما الذي يفعله Veo 3.1 فعليًا
أصدر فريق DeepMind التابع لشركة Google الإصدار Veo 3 بوصفه قفزة نوعية في جودة فيديو الذكاء الاصطناعي، ويُحسّن 3.1 هذا الأساس بثبات أفضل ومزامنة صوتية أقوى بكثير. فبينما يسعى Kling إلى الواقعية عبر محاكاة الفيزياء، يسعى Veo 3.1 إليها عبر دقة التصيير، وتحديدًا الطريقة التي يتفاعل بها الضوء مع المواد.
يتوفر Veo 3.1 في إصدارين على PicassoIA. تعطي النسخة القياسية الأولوية لأقصى جودة. ويقلّل Veo 3.1 Fast زمن التوليد بشكل كبير، ما يجعله عمليًا لسير العمل التكراري حيث تحتاج إلى اختبار عدة تنويعات للأمر النصي قبل اعتماد التصيير النهائي.
مقاربة Google في التصيير
يكمن التمايز التقني لنموذج Veo 3.1 في فهمه لخصائص المواد وسلوك الضوء. يبدو أن النموذج تدرّب بتركيز كبير على مبادئ التصيير القائم على الفيزياء: التشتت تحت السطحي على المواد العضوية مثل الجلد وأنسجة النبات، والانعكاس المرآتي على الأسطح الصلبة مثل المعدن والزجاج، والتلاشي الناعم للظلال كلما ابتعدت عن الأجسام المسببة لها.
الأثر العملي كبير في اللقطات المقرّبة. فصورة لوجه شخص في ضوء نافذة الصباح تُصيَّر كما كانت ستلتقطها كاميرا سينمائية فعلًا: إبرازات دافئة على عظام الخد، وتعبئة ظل أبرد على الجانب المظلل، وتوهّج شفاف يمرّ عبر غضروف الأذن يسميه المصورون "انتقال الحافة" (rim transmission). هذه تفاصيل دقيقة، لكنها بالضبط ما يستخدمه النظام البصري البشري لتقييم ما إذا كانت اللقطة تبدو حقيقية.
المزامنة الصوتية الأصلية
يولّد Veo 3.1 الصوت المحيطي بشكل أصلي إلى جانب مخرجات الفيديو. يُولَّد الصوت والصورة معًا في عملية متزامنة، ما يعني أن خطوات الأقدام تقع على الإيقاع، وأن الأصوات البيئية تتطابق مع الأحداث المرئية، وأن العلاقة بين الصوت والصورة تبدو عضوية لا مُضافة بعد التصوير.
بالنسبة لصانعي المحتوى المستقلين وفرق الإنتاج الصغيرة، يختصر هذا الجدول الزمني للإنتاج كثيرًا. مشهد كان يتطلب سابقًا الحصول على مؤثرات صوتية منفصلة وعملًا إضافيًا للمزامنة، يخرج من Veo 3.1 جاهزًا للاستخدام، أو قريبًا منه.
ملاحظة: يوفّر Kling v3 Omni Video أيضًا توليد الصوت، ما يجعله الإصدار المناسب من Kling عندما تكون الأصوات المتزامنة أولوية.

الواقعية وجهًا لوجه
ينتج كلا النموذجين لقطات يمكن أن تمر كحقيقية في المشاهدة العادية. تظهر الفروق عند الفحص الدقيق.
البشرة وتفاصيل الوجه
يصيّر Kling 3.0 البشرة بملمس متسق عبر الحركة. تبقى المسام والشعيرات الخفيفة وتفاصيل السطح الدقيقة ثابتة من إطار إلى آخر، دون ظاهرة "انزلاق البشرة" الشائعة في نماذج الانتشار الفيديوية الأقدم. يميل النموذج إلى درجات بشرة أدفأ، ويتعامل مع الضوء الطبيعي الخارجي بتميّز كبير. وهو قوي بشكل خاص حين يكون الأشخاص في حركة، إذ يحافظ على تماسك ملمس السطح عبر الإيماءات وحركات الرأس.
يصيّر Veo 3.1 البشرة مع تركيز أكبر على تفاعل الضوء. في بيئات الإضاءة الداخلية المضبوطة، خاصة تلك التي يكون فيها مصدر اتجاهي قوي، ينتج Veo 3.1 أكثر اللقطات المقرّبة للبشر إقناعًا بين أي نموذج تحويل نص إلى فيديو متاح حاليًا. تجعل محاكاة التشتت تحت السطحي البشرة تبدو شفافة فعلًا لا معتمة، وهذه هي الإشارة البصرية الأساسية التي يستخدمها البشر للتمييز بين الجلد الحي وصورة ثابتة.
الخلاصة بشأن الوجوه: Veo 3.1 في الإضاءة الاستوديوية المضبوطة وأعمال الجمال المقرّبة. Kling 3.0 في سيناريوهات الضوء الخارجي والطبيعي مع أشخاص في حركة.

ضبابية الحركة والاتساق الزمني
يولّد Kling 3.0 ضبابية الحركة كحدث دقيق فيزيائيًا. تنتج الأجسام سريعة الحركة ضبابية في الاتجاه الصحيح وبالشدة الصحيحة بناءً على سرعتها النسبية إلى سرعة الغالق المحاكاة. وعبر مدة المقطع الكاملة البالغة 10 ثوانٍ، يحافظ النموذج على هندسة المشهد دون انجراف، وهو نمط فشل شائع حين تتحرك أجسام الخلفية ببطء من إطار إلى آخر.
يتفوّق Veo 3.1 في محاكاة حركة الكاميرا. تبدو حركات الدوللي للأمام، واهتزاز الكاميرا المحمولة، وانتقالات التركيز البؤري أصيلة. لكن في المشاهد التي تضم عدة أشخاص يتحركون بشكل مستقل، ينتج Veo 3.1 أحيانًا عدم اتساق في الخلفية، حيث تتحرك العناصر البيئية الثابتة بشكل طفيف عبر المقطع.
الخلاصة بشأن الحركة: Kling 3.0 للمشاهد الديناميكية متعددة الأشخاص ذات المدد الطويلة. Veo 3.1 للقطات شخص واحد مع حركة كاميرا معقدة.
سلوك الإضاءة عبر السيناريوهات
| السيناريو | Kling 3.0 | Veo 3.1 |
|---|
| إضاءة داخلية ناعمة ومنتشرة | جيد جدًا | ممتاز |
| الساعة الذهبية في الخارج | ممتاز | جيد جدًا |
| الإضاءة الخافتة / مشاهد الليل | جيد | جيد جدًا |
| إضاءة طبيعية وصناعية مختلطة | جيد جدًا | ممتاز |
| الأسطح العاكسة المرآتية | جيد | ممتاز |
| التشتت تحت السطحي للجلد | جيد | ممتاز |
| فيزياء الأقمشة | ممتاز | جيد جدًا |
| فيزياء المياه والسوائل | ممتاز | جيد |

الأرقام جنبًا إلى جنب
| الميزة | Kling 3.0 | Veo 3.1 |
|---|
| أقصى دقة للمخرجات | 1080p | 1080p |
| أقصى مدة للمقطع | 10 ثوانٍ | 8 ثوانٍ |
| مخرجات الصوت الأصلية | عبر إصدار Omni | نعم، لكل المخرجات |
| التحكم في الحركة | نموذج مخصص | لا |
| محاكاة الفيزياء | قوية جدًا | قوية |
| ثبات هوية الوجه | ممتاز | ممتاز |
| دقة هندسة الأيدي | جيد جدًا | جيد |
| الالتزام بالأمر النصي | جيد جدًا | ممتاز |
| سرعة التوليد | سريع | متوسط |
| تصيير المواد | جيد | ممتاز |
| واقعية حركة الكاميرا | جيد جدًا | ممتاز |
| متاح على PicassoIA | نعم | نعم |
قدرة Kling على التحكم في الحركة فريدة بين النماذج الرائدة الحالية. لا يقدّم أي منافس مباشر مستوى الدقة الحركية نفسه عبر نقل الحركة بالاعتماد على مرجع.
أي نموذج لأي مشروع
الإجابة الصحيحة ليست دائمًا "أفضل نموذج بشكل عام". بل هي النموذج الذي يناسب متطلبات مشهدك المحدد.

فيديو السوشال ميديا القصير
يُعد Veo 3.1 الخيار الأقوى لمحتوى السوشال ميديا عالي الحجم. فالمزامنة الصوتية الأصلية، والالتزام الممتاز بالأمر النصي، وسرعة التوليد السريعة لنموذج Veo 3.1 Fast تعني أنك تستطيع تجربة اتجاهات إبداعية متعددة في الوقت الذي يستغرقه إنهاء تصيير واحد مع نماذج أبطأ. والحد الأقصى البالغ 8 ثوانٍ يغطي تقريبًا كل صيغة قصيرة دون قيود.
المشاريع السينمائية والسردية
يمنحك Kling v3 Video بمدة 10 ثوانٍ لكل مقطع مادة أكثر للعمل بها في كل توليد. وعند دمجه مع Kling v3 Motion Control لحركة شخصيات دقيقة، ينتج عن ذلك لقطات بجودة حركية سينمائية لا يضاهيها منافس حالي بهذا السعر.
الإعلانات للمنتجات والتجارية
تجعل دقة تصيير المواد في Veo 3.1 منه الخيار الأول لتصوير المنتجات. فطريقة تعامله مع الإبرازات المرآتية على الزجاج والمعدن والأسطح المصقولة ترقى إلى مستوى غالبًا ما يتجاوز ما قد تتوقعه من توليد تحويل النص إلى فيديو. وبالنسبة لفئات المنتجات الفاخرة التي تشير فيها جودة المادة إلى التموضع المتميز، يكتسب هذا أهمية كبيرة.
نصيحة سير العمل: استخدم Veo 3.1 للقطات المنتج الرئيسية، وKling v3 Omni Video للقطات أسلوب الحياة مع الصوت، ثم ادمجها معًا. التداخل الأسلوبي قريب بما يكفي ليعمل دون تدخل كبير في تصحيح الألوان.
استخدام Kling v3 على PicassoIA
النموذجان متاحان مباشرة على PicassoIA. إليك كيفية استخراج أقصى قدر من الواقعية من كل منهما.
مع Kling v3 Video:
- افتح صفحة النموذج واختر وضع تحويل النص إلى فيديو أو تحويل الصورة إلى فيديو
- صف الخصائص الفيزيائية بوضوح: "تناثر قطرات الماء مع توتر السطح"، "قميص قطني يتجعد عند المرفقين أثناء الإيماءة"
- حدّد سلوك الكاميرا: "دفع بطيء نحو 50mm"، "اهتزاز خفيف كأنه محمول باليد"، "لقطة واسعة تأسيسية ثابتة"
- سمِّ مصدر الضوء واتجاهه: "شمس الصباح من اليسار تُنشئ ظلالًا طويلة ناعمة"
- اضبط مدة المقطع على 10 ثوانٍ للمشاهد التي تحتاج إلى تطور كامل للحركة
نصائح للأمر النصي مع Kling v3:
- كن صريحًا بشأن الفيزياء: "مياه تتناثر مع قوس قطرات طبيعي"، "معطف صوف ثقيل يتطاير مع الريح"
- حدّد حركة الكاميرا مع السرعة: "دفع بطيء جدًا"، "بانوراما سريعة نحو اليمين"
- سمِّ مصدر الإضاءة دائمًا: "الساعة الذهبية من اليسار"، "ضوء نهاري منتشر ملبّد بالغيوم دون ظلال حادة"
مع Kling v3 Motion Control:
- ارفع فيديو مرجعيًا يُظهر الحركة التي تريد نقلها
- صف الشخصية أو الموضوع المستهدف في الأمر النصي
- يربط النموذج هندسة حركة المرجع بالشخص المستهدف تلقائيًا
- يعمل بأفضل شكل حين تكون حركة المرجع ونسب جسم موضوعك متشابهة
استخدام Veo 3.1 على PicassoIA
مع Veo 3.1:
- انتقل إلى نموذج Veo 3.1 على PicassoIA
- اكتب أوصاف الإضاءة أولًا في أمرك النصي، قبل الحركة أو الشخص: "ضوء نافذة ناعم من اليسار، بنغمة صباحية دافئة"
- حدّد خصائص المواد للأجسام: "فولاذ مقاوم للصدأ مصقول بالفرشاة"، "ملمس جدار خرساني مطفي"، "زجاج مصنفر شفاف"
- أضف البيئة المحيطة للمزامنة الصوتية: "مطبخ هادئ، ضجيج خفيف للمرور في الشارع، عصافير عبر نافذة مفتوحة"
- استخدم Veo 3.1 Fast لتجربة الأوامر النصية، ثم شغّل المخرج النهائي على Veo 3.1 القياسي
بنية الأمر النصي لنموذج Veo 3.1 التي تعظّم الواقعية:
- جودة الضوء أولًا: "ضوء نهاري ملبّد بالغيوم ومنتشر مع ظلال ناعمة"
- الشخص والحركة ثانيًا: "امرأة في عمر 30s تمشي نحو الكاميرا"
- البيئة ثالثًا: "عبر شارع مدينة مبلل بالمطر عند الغسق"
- مواصفات الكاميرا أخيرًا: "مصوّرة بعدسة 35mm، مع اهتزاز خفيف كأنها محمولة باليد"

الحكم الفعلي على الواقعية
من أجل الجودة الواقعية الفوتوغرافية البحتة في الإضاءة المضبوطة: يتقدّم Veo 3.1. فتصيير المواد وفيزياء الضوء لديه تنتج لقطات تبدو كأنها صُوّرت في استوديو حقيقي أكثر مما تبدو كأنها مولّدة بخوارزمية. تجتاز اللقطات المقرّبة للوجوه والمنتجات والأسطح اختبار "هل هذا حقيقي؟" بنسبة أعلى باستمرار من أي نموذج حالي آخر.
من أجل الواقعية الفيزيائية في المشاهد الديناميكية المعقدة: يحتفظ Kling 3.0 بالصدارة. فعندما يتحرك أشخاص متعددون، وعندما تكون الأحداث المدفوعة بالفيزياء مثل التناثر والسقوط وحركة الأقمشة محورية في اللقطة، وعندما تحتاج إلى مقاطع مدتها 10 ثوانٍ بهندسة متسقة طوال الوقت، يكون Kling 3.0 الأداة الأكثر موثوقية.
لا يتفوّق أيّ من النموذجين بشكل شامل. كلٌّ منهما قوي بطريقة مختلفة، وهذا تحديدًا ما يجعل امتلاك الوصول إلى كليهما داخل منصة واحدة يغيّر ما هو ممكن لصنّاع الفيديو على أي مستوى.

جرّبهما الآن
يمنحك PicassoIA الوصول إلى Kling v3 Video، وKling v3 Omni Video، وKling v3 Motion Control، وVeo 3.1، وVeo 3.1 Fast كلها في مكان واحد. لا حسابات منفصلة، ولا إعداد API، ولا خطوات إضافية سوى كتابة أمر نصي.
أسرع طريقة لتكوين رأي حقيقي حول النموذج الذي يناسب سير عملك هي تشغيل الأمر النصي نفسه على النموذجين ومقارنة المخرجات جنبًا إلى جنب. تصبح الفروق في طريقة تعامل كل نموذج مع الضوء والبشرة والحركة واضحة في مقارنة واحدة، وستجعل متطلبات مشروعك الخاصة الاختيار الصحيح واضحًا فورًا.
شغّل مقطعك الأول الآن، وشاهد بالضبط أين يكتسب كل نموذج سمعته.