Kling 3.0: إنشاء مشاهد سينمائية بمزامنة الشفاه بالذكاء الاصطناعي

يقدّم Kling 3.0 مزامنة الشفاه على مستوى الفونيمات في توليد الفيديو بالذكاء الاصطناعي، لينتج نتائج بجودة سينمائية للدبلجة والمحتوى المترجَم محليًا والإنتاج المرئي الاحترافي. يشرح هذا المقال طريقة عمل التقنية، وما الذي تغيّر في الإصدار 3.0، ويقدّم شرحًا خطوة بخطوة لاستخدام Kling Lip Sync على PicassoIA إلى جانب نماذج مزامنة الشفاه الاحترافية الأخرى.

Kling 3.0: إنشاء مشاهد سينمائية بمزامنة الشفاه بالذكاء الاصطناعي
Cristian Da Conceicao
مؤسس Picasso IA

ظلّت دقة مزامنة الشفاه الحلقة الأضعف في توليد الفيديو بالذكاء الاصطناعي لسنوات. تنجح معظم النماذج في الملامح العامة، لكنها تنهار عند التفاصيل: حركات الفك الدقيقة التي تكشف الأداء الاصطناعي، والتأخر الطفيف بين الحروف الساكنة وحركة الفم الظاهرة، وجمود عضلات الوجه حين يتطلب الصوت تعبيرًا. يعالج Kling 3.0 كل ذلك بشكل مباشر، والنتائج مختلفة فعلًا عمّا سبقه.

قرب شديد جدًا لشفاه في منتصف مقطع صوتي، تصوير ماكرو، ملمس بشرة طبيعي، 8K RAW

ما الذي يفعله Kling 3.0 فعلًا

Kling 3.0 هو أحدث جيل من بنية توليد الفيديو لدى KwaiVgi، صُمّم خصيصًا لإنتاج مخرجات بجودة السينما مع تحريك دقيق للوجه ومزامنة دقيقة. فبينما كانت النماذج السابقة تركّز على جودة الحركة كميزة ثانوية، يجعل الإصدار 3.0 مزامنة الشفاه أولوية رئيسية في مسار التوليد.

محرك مزامنة الشفاه

يعمل نظام مزامنة الشفاه في Kling 3.0 على مستوى الفونيم، وهو أصغر وحدة صوتية في الكلام المنطوق. فبدل مطابقة المقاطع الصوتية الكبيرة مع أشكال الفم، يتتبع النموذج الفونيمات الفردية ويحرّك الفم استنادًا إليها، فينتج حركة تبدو دقيقة من الناحية الفيزيائية لا تقريبية.

يجمع المحرك بين:

  • اكتشاف الفونيمات من المسار الصوتي
  • تتبع معالم الوجه في الفيديو أو الصورة المصدر
  • التنعيم الزمني لإزالة الاهتزاز بين الإطارات
  • مزج التعبيرات للحفاظ على طبيعية الوجه أثناء الكلام

أوضاع المشاهد السينمائية

يقدّم Kling 3.0 أوضاع مشاهد مخصصة تضبط طريقة تعامل النموذج مع الإضاءة وضبابية الحركة وتصحيح الألوان في المخرجات. وبدلًا من إعداد توليد عام واحد، يمكن للمستخدمين الاختيار من بين:

الوضعالأنسب لاستخدامجودة المخرجات
Cinematicالأفلام والدراما والمحتوى الطويل1080p / 4K
Expressiveمقاطع الموسيقى والمشاهد العاطفية1080p
Naturalالمدونات المصوّرة والمحتوى العادي720p / 1080p
Broadcastالأخبار والفيديو المؤسسي1080p

يطبّق كل وضع مسار معالجة لاحقة مختلفًا، ما يعني أن المادة المصدر نفسها قد تنتج مخرجات بنغمات لونية مختلفة تمامًا دون أي عمل يدوي على تصحيح الألوان.

فريق إنتاج أفلام يعمل على مشروع سينمائي في استوديو، معدات احترافية، أسلوب وثائقي

Kling 3.0 مقابل الإصدارات السابقة

القفزة من Kling 2.0 إلى 3.0 ليست تحسينًا تدريجيًا. أُعيد تدريب بنية النموذج الأساسية على مجموعة بيانات أكبر بكثير، مع تركيز خاص على لقطات الوجه القريبة بمعدل 24 إطارًا في الثانية وما فوق. والنتيجة إصدار يتعامل مع مواد الفيديو الاحترافية بطريقة لم تستطع الإصدارات السابقة بلوغها.

ما الذي تغيّر في 3.0

تشمل التغييرات المعمارية الرئيسية:

  1. معالجة صوتية ثنائية المسار تفصل نطاقات الترددات الصوتية للأصوات البشرية عن الصوت الخلفي قبل توليد حركة الشفاه، فتمنع الموسيقى الخلفية أو الأصوات المحيطة من إفساد المزامنة
  2. مزج واعٍ بالمشاعر يقرأ المشاعر من الصوت المدخل ويعدّل مجموعات عضلات الوجه المحيطة لتتطابق معه، لا الشفاه وحدها
  3. تغيير الدقة يسمح بمعالجة مادة مصدر تصل إلى 4K دون عيوب ناتجة عن خفض الدقة
  4. نقاط ارتكاز زمنية تثبّت المزامنة أولًا على الأصوات الساكنة القوية، ثم تملأ الانتقالات الأنعم للحركات، وهو النهج نفسه الذي يتبعه المتحركون البشر

أرقام الدقة التي تهم

يتفوّق Kling 3.0 بشكل ملحوظ على الأجيال السابقة في مقاييس دقة مزامنة الشفاه:

  • الدقة على مستوى الإطار: 94.3% من محاذاة الفونيم مع الإطار
  • الاتساق الزمني: انحراف أقل من 1.2 إطار على مقاطع مدتها 60 ثانية
  • الحفاظ على التعبير: 89% من الحفاظ على تعبير الوجه الأصلي أثناء المزامنة

هذه ليست مجرد اختبارات تقنية. فهي تترجم مباشرة إلى فيديوهات تصمد عند المشاهدة المدققة، وهو النوع الذي تحتاجه إنتاجات الأفلام.

ممثلة تلقي مونولوجًا عاطفيًا على خشبة مسرح سينمائية، إضاءة ثلاثية النقاط، ARRI Alexa Mini LF

مزامنة الشفاه بالذكاء الاصطناعي: كيف تعمل فعلًا

معرفة العملية وراء مزامنة الشفاه بالذكاء الاصطناعي تساعدك على استخدامها بفعالية أكبر. يتعامل معظم الناس مع هذه الأدوات كصناديق سوداء، ولهذا يفوّتون المتغيرات القابلة للتحكم التي تؤثر بشكل كبير في جودة المخرجات.

اكتشاف الفونيمات في الوقت الفعلي

تتفكك كل كلمة منطوقة إلى فونيمات، وهي وحدات الصوت الفردية التي تكوّن اللغة. في الإنجليزية، تحتوي كلمة "beautiful" على سبعة فونيمات مميزة. تحدّد وحدة التحليل الصوتي في Kling 3.0 هذه الوحدات، ويعطيها مواضع زمنية على المسار الصوتي، ويربطها بأشكال الفم المقابلة لها والمسماة visemes.

دُرّب النموذج على بيانات صوت وفيديو مقترنة، ما منحه مخزونًا كبيرًا من انتقالات visemes الطبيعية. وعند تزويده بصوت نظيف، يستطيع النموذج الاختيار من بين آلاف الانتقالات التي تبدو طبيعية، بدلًا من الاستيفاء بين أوضاع فم عامة.

💡 نصيحة احترافية: جودة الصوت تؤثر مباشرة في جودة المخرجات. استخدم مسارًا صوتيًا نظيفًا ومعزولًا دون ضغط كثيف. فالصوت المضغوط يفقد بيانات التوقيت الدقيقة التي يعتمد عليها كاشف الفونيمات.

دعم متعدد اللغات

يدعم Kling 3.0 مزامنة الشفاه عبر 17 لغة، مع دقة كاملة على مستوى الفونيم في:

  • الإنجليزية والإسبانية والفرنسية والألمانية والإيطالية والبرتغالية
  • الماندرين واليابانية والكورية
  • العربية والهندية والروسية والبولندية والهولندية والتركية والسويدية والتايلاندية

بالنسبة لسير عمل الدبلجة، يكتسب هذا أهمية كبيرة. يمكن إعادة مزامنة فيديو مسجّل بالإنجليزية مع تعليق صوتي بالإسبانية مع حركة شفاه مرئية دقيقة. يأخذ النموذج في الحسبان مجموعات الفونيمات المختلفة في كل لغة بدلًا من تطبيق مكتبة موحدة لأشكال الفم.

الاتساق الزمني

من أكثر أنماط الفشل شيوعًا في مزامنة الشفاه بالذكاء الاصطناعي الانجراف الزمني: تبدأ المزامنة دقيقة ثم تنزلق تدريجيًا خارج المحاذاة على امتداد طول المقطع. يعالج Kling 3.0 ذلك بنقاط ارتكاز زمنية، وهي أحداث مزامنة صارمة يثبّت النموذج عليها على فترات ثابتة عبر المقطع.

توضع نقاط الارتكاز عند:

  • الأصوات الساكنة القوية (P، B، M، F، V)
  • فترات الصمت الأطول من 200 ملي ثانية
  • المقاطع المشددة التي يرصدها وحدة النبرة والإيقاع

بين نقاط الارتكاز، يستكمل النموذج حركة الفم بسلاسة، فيحافظ على طبيعية النتيجة مع منع تراكم الانجراف.

صورة بروفايل جانبي لامرأة تتحدث إلى ميكروفون مكثف في استوديو تسجيل، إضاءة جانبية دافئة، Kodak Portra 800

حالات استخدام تغيّر كل شيء

تتجاوز التطبيقات العملية لدقة مزامنة الشفاه في Kling 3.0 مجرد الطرافة. هذه حالات استخدام على مستوى الإنتاج، يطبّقها صنّاع المحتوى والاستوديوهات والعلامات التجارية فعلًا الآن.

دبلجة الأفلام على نطاق واسع

تتطلب الدبلجة التقليدية للأفلام جلسات ADR (استبدال الحوار الآلي)، حيث يعيد الممثلون الصوتيون تسجيل الحوارات في استوديو، ثم يزامن المونتيرون الصوت الجديد يدويًا مع حركات الشفاه الأصلية. لفيلم روائي واحد، قد تستغرق هذه العملية أسابيع وتكلّف عشرات الآلاف من الدولارات لكل نسخة لغوية.

مع Kling 3.0، يتغيّر مسار الدبلجة إلى:

  1. تسجيل الممثلين الصوتيين وهم يقرؤون النصوص المترجمة
  2. تشغيل الفيديو عبر Kling Lip Sync مع المسار الصوتي الجديد
  3. مراجعة المخرجات والموافقة عليها
  4. تصيير المخرج النهائي بدقة الإنتاج

بالنسبة للمحتوى القصير وفيديوهات التسويق والإنتاجات المستقلة، فإن هذا السير أسرع وأقل تكلفة بشكل ملحوظ من الدبلجة التقليدية.

صنّاع المحتوى الاجتماعي

بالنسبة لصنّاع المحتوى الذين ينتجون محتوى بعدة لغات، يلغي Kling 3.0 الحاجة إلى إعادة تصوير الفيديوهات لجماهير مختلفة. يمكن ترجمة تسجيل واحد إلى لغات متعددة مع مزامنة دقيقة للشفاه، ما يتيح ليوم تصوير واحد أن يخدم جماهير إقليمية متعددة.

تتيح أوضاع المشهد السينمائي أيضًا للمبدعين تطبيق معالجات بصرية مختلفة على المادة الأساسية نفسها. يمكن تصيير مقابلة بسيطة لمتحدث أمام الكاميرا بالوضع الطبيعي لمنصة Instagram، وبالوضع السينمائي لمنصة YouTube، وبوضع البث لمنصة LinkedIn، مع تدرج ألوان وخصائص حركة مناسبة لكل منها.

التسويق وفيديوهات العلامات التجارية

تواجه فرق التسويق التي تعمل مع مواد لمتحدثين رسميين تحديًا متكررًا: يصبح فيديو المتحدث المعتمد قديمًا، لكن إعادة التصوير مكلفة. مع مزامنة الشفاه بالذكاء الاصطناعي، يمكن تحديث الفيديو بمسارات تعليق صوتي جديدة دون الحاجة إلى إنتاج جديد. تبقى المرئيات متسقة بينما يتغير المحتوى المنطوق.

💡 مهم: تأكد دائمًا من امتلاكك الحقوق المناسبة لمحتوى الفيديو والصوت الذي تستخدمه في سير عمل مزامنة الشفاه بالذكاء الاصطناعي. فاستخدام مواد دون تصاريح مناسبة يثير مشكلات قانونية بغض النظر عن التقنية المستخدمة.

منظر علوي من الأعلى لمكتب مخرج مبدع يضم جدول مونتاج ومايكروفون ودفترًا، Kodak Portra 160

كيفية استخدام Kling Lip Sync على PicassoIA

يتضمن PicassoIA نموذج Kling Lip Sync مباشرة في منصته، ما يعني أنه يمكنك تشغيل مزامنة الشفاه المدعومة بتقنية Kling 3.0 دون أي إعداد محلي أو تهيئة لواجهة API. إليك سير العمل الكامل.

الخطوة 1: اختر الفيديو أو الصورة

انتقل إلى نموذج Kling Lip Sync على PicassoIA. لديك خياران للإدخال:

  • إدخال فيديو: ارفع مقطع فيديو موجودًا يظهر فيه وجه. سيستبدل النموذج حركة الشفاه بتحريك متزامن يطابق صوتك. يعمل بأفضل شكل مع المقاطع التي يكون فيها الوجه واضحًا ومواجهًا للكاميرا.
  • إدخال صورة: قدّم صورة ثابتة وسيحرّك النموذج الشفاه انطلاقًا من الصورة الساكنة. هذا مثالي لإنشاء بورتريهات متحدثة من الصور.

أفضل الممارسات لمادة المصدر:

  • يجب أن يشغل الوجه 30% على الأقل من الإطار
  • تجنّب الظلال الكثيفة على منطقة الفم
  • الزوايا الأمامية أو ثلاثية الأرباع هي الأفضل
  • تعطي مقاطع الفيديو التي تتراوح مدتها بين 3 و30 ثانية أكثر النتائج اتساقًا

الخطوة 2: ارفع الصوت

يحدث معظم المعالجة في مدخل الصوت. يقبل Kling Lip Sync على PicassoIA:

  • ملفات MP3 وWAV
  • الصوت المستخرج من ملفات الفيديو
  • الصوت المولّد بتحويل النص إلى كلام (TTS)

للحصول على أنظف النتائج، استخدم ملف WAV موحّد المستوى بتردد 44.1kHz أو 48kHz. وإذا كنت تستخدم صوتًا من TTS، يتوفر على PicassoIA عدة نماذج تحويل النص إلى كلام يمكنك استخدامها مباشرة في المنصة قبل تمرير المخرج إلى نموذج مزامنة الشفاه.

💡 نصيحة سير العمل: ولّد التعليق الصوتي أولًا باستخدام نموذج TTS، ثم نزّل النتيجة وارفعها إلى نموذج Kling Lip Sync كخطوة ثانية. هذا يُبقي توليد الصوت والمرئيات على المنصة نفسها.

الخطوة 3: اضبط الإعدادات وشغّل

يعرض نموذج Kling Lip Sync على PicassoIA عدة خيارات للإعداد:

المعاملالخياراتالتأثير
Sync ModePhoneme / SyllablePhoneme أدق؛ Syllable أسرع
ExpressionPreserve / Natural / Expressiveمدى تعديل التعبير الأصلي
StabilizationOn / Offيقلل من اهتزاز حركة الرأس أثناء المزامنة
Output Resolution720p / 1080pدقة التصيير النهائية

بالنسبة للتطبيقات السينمائية، استخدم وضع مزامنة Phoneme مع Preserve expression و Stabilization on. أما للمحتوى الأكثر ديناميكية مثل مقاطع الموسيقى، فيُنتج وضع Expressive نتائج أكثر حيوية.

اضغط على التوليد وسيعالج النموذج مدخلاتك. يستغرق التوليد عادةً من 30 إلى 90 ثانية حسب طول المقطع ودقة المخرجات.

الحصول على أفضل النتائج

بعض الممارسات التي تنتج مخرجات أفضل بثبات:

  • قُصّ الصوت لإزالة الصمت في البداية. حتى فجوة صامتة مدتها 200 ملي ثانية في البداية قد تؤدي إلى تأخر بدء المزامنة.
  • طابق لغة الصوت مع إعداد اللغة إن كان متاحًا. استخدام نموذج فونيمات إنجليزي مع صوت بالإسبانية سينتج أشكال فم غير صحيحة.
  • استخدم معامل Stabilization لأي مادة يتحرك فيها الشخص. فبدونه، قد تبدو حركة الشفاه المولّدة منفصلة عن حركة الرأس.
  • جرّب مقطعًا مدته 5 ثوانٍ أولًا قبل معالجة المادة كاملة. هذا يتيح لك التحقق من جودة المزامنة وضبط المعاملات دون انتظار تصيير كامل.

بورتريه درامي بزاوية منخفضة لامرأة تتحدث على سطح مبنى وقت الساعة الذهبية، Sony A1، Kodak Ektar 100، واقعي كالصور الفوتوغرافية

نماذج مزامنة شفاه أخرى تستحق المعرفة

يتضمن PicassoIA عدة نماذج أخرى لمزامنة الشفاه إلى جانب Kling Lip Sync. وبحسب حالة الاستخدام لديك، قد يقدّم أحد هذه البدائل نتائج أفضل لنوع المحتوى الذي تعمل عليه.

sync-react-1 للفيديوهات الغنية بالمشاعر

يضيف sync-react-1 من Sync طبقة تفاعل عاطفي فوق مزامنة الشفاه المعيارية. فبينما يركّز Kling على مطابقة الفونيمات مع visemes بدقة، يعدّل React-1 أيضًا وضع الحاجبين وشدّة الخدين وفتحة الجفن بناءً على المحتوى العاطفي للصوت. بالنسبة للمونولوجات الدرامية والخطابات العاطفية، أو أي محتوى تحمل فيه تعابير الوجه وزنًا لا يقل عن دقة الشفاه، ينتج React-1 مخرجات أكثر تعبيرًا بوضوح.

Pixverse Lipsync للرسوم المتحركة

يتعامل Pixverse Lipsync مع المواد المصدر المنمّطة والمرسومة بشكل أفضل من النماذج التي تركّز على الواقعية الفوتوغرافية. إذا كان فيديو المصدر يبدو بطابع الرسوم المتحركة أو منمّطًا قليلًا، أو كنت تعمل مع أفاتارات مرسومة، فإن نموذج Pixverse أنسب للمادة.

يقدّم sync-lipsync-2-pro معالجة بجودة استوديو مصممة لخطوط الإنتاج الاحترافية، مع دقة مخرجات أعلى وتحكم أكبر في معاملات المزامنة.

مقارنة سريعة

النموذجنقطة القوةأفضل حالة استخدام
Kling Lip Syncدقة على مستوى الفونيمالفيديو السينمائي والدبلجة
sync-react-1تحريك واعٍ بالمشاعرالدراما والمحتوى العاطفي
Pixverse Lipsyncدعم المواد المنمّطةالأفاتارات المتحركة والفيديو المنمّط
sync-lipsync-2-proمخرجات بجودة استوديوالإنتاجات الاحترافية
bytedance-omni-humanتحريك من صورة إلى فيديوتحويل الصور الثابتة إلى فيديو متحدث
veed-fabric-10فيديو صورة متحدثةإنشاء المحتوى السريع

قرب لأيدي مصوّر سينمائي على عجلة التركيز في كاميرا سينمائية، عدسة Cooke anamorphic، إضاءة تنغستن دافئة، Hasselblad 8K

النتائج في الواقع

عند مقارنة مخرجات مزامنة شفاه Kling 3.0 مع النماذج الأخرى المتاحة، تظهر مزايا ثابتة في مجالات محددة. يظهر الفرق بأوضح صورة في ثلاث فئات.

الدقة عبر اللهجات وسرعات الكلام

في الظروف الواقعية، مع جودة صوت متفاوتة وأنواع مختلفة من فيديوهات المصدر، يحافظ Kling 3.0 على دقة المزامنة عبر أنواع اللهجات المختلفة وسرعات الكلام وبيئات التسجيل. ويتعامل النموذج القائم على الفونيمات مع المتحدثين السريعين والكلام الذي فيه لكنة قوية بشكل أفضل من البدائل القائمة على المقاطع، حيث تضغط السرعات العالية بيانات التوقيت بدرجة تكفي لإحداث عدم تزامن مرئي.

جودة المخرجات بدقة التوزيع

تنتج أوضاع المخرجات السينمائية فيديوهات لا تبدو مولّدة بالذكاء الاصطناعي عند الفحص العابر. فعلم الألوان وخصائص الحركة وتحريك الوجه تصمد جيدًا عند مراجعتها بسرعة التشغيل العادية. الفحص إطارًا إطارًا يكشف عمل النموذج، لكن لأغراض التوزيع، تكون المخرجات بجودة الإنتاج.

💡 ما يجب الانتباه إليه: أكثر مشكلات الجودة شيوعًا هي عيوب الدمج المرئية حول الفم والفك، حيث تلتقي الحركة المولّدة بالفيديو الأصلي. تكون هذه العيوب أوضح في حالات الإضاءة عالية التباين. إن ظهرت لك في المخرجات، جرّب تعديل إعداد الاستقرار، أو قدّم نسخة من فيديو المصدر بإضاءة أنعم وأكثر انتشارًا على الوجه.

أين يقصّر Kling 3.0

تقتضي الأمانة في التقييم ذكر القيود:

  • زوايا الرأس المتطرفة (لقطات البروفايل بزاوية 90 درجة) لا تزال تنتج نتائج أقل دقة
  • الكلام السريع جدًا بأكثر من 280 كلمة تقريبًا في الدقيقة قد يسبب عيوب ضغط المقاطع
  • فيديو المصدر منخفض الدقة دون 480p يُدخل فقدانًا مرئيًا في الجودة في المخرجات بغض النظر عن إعدادات التوليد

في سيناريوهات الإنتاج القياسية، نادرًا ما تنطبق هذه القيود. وتصبح ذات صلة أساسًا في الحالات الحدّية أو في سير عمل استعادة الأرشيف.

مصوّرة سينمائية محترفة تراجع لقطات سينمائية على شاشات كبيرة، غرفة تدرج ألوان، Kodak Vision3

جرّبه على محتواك الخاص

يجمع Kling 3.0 بين الدقة على مستوى الفونيم ودعم تعدد اللغات والأوضاع السينمائية المخصصة، ما يجعل مزامنة الشفاه بجودة احترافية في متناول صنّاع المحتوى الأفراد والاستوديوهات الصغيرة وفرق الإنتاج التي تعمل دون ميزانيات كبيرة لما بعد الإنتاج.

الأدوات متاحة الآن على PicassoIA. يتعامل نموذج Kling Lip Sync مع مدخلات الفيديو والصور معًا، ويعالج الصوت على مستوى الفونيم، ويقدّم مخرجات بدقات مناسبة للتوزيع الاحترافي. وإلى جانبه تمنحك sync-react-1 و sync-lipsync-2-pro وPixverse Lipsync وbytedance-omni-human وveed-fabric-10 خيارات تناسب كل نوع من المحتوى وكل متطلبات الإنتاج.

أفضل طريقة لترى ما تستطيع التقنية فعله هي أن تختبرها بمادتك الخاصة. ارفع مقطعًا، وقدّم مسارًا صوتيًا نظيفًا، وشاهد ما ينتجه Kling 3.0. الفجوة في الجودة بين مزامنة الشفاه المولّدة بالذكاء الاصطناعي والدبلجة التقليدية تتقلص أسرع مما أدرك معظم العاملين في الإنتاج، والنماذج المتاحة اليوم جيدة بما يكفي بالفعل لمجموعة واسعة من التطبيقات الاحترافية.

لقطة سينمائية عريضة لامرأة في فناء متوسطي، أشجار بوغنفيليا مزهرة، ARRI Alexa 35، Fujifilm Velvia 50، واقعي كالصور الفوتوغرافية

شارك هذا المقال

اختر لغتك

مقالات ذات صلة