كيف يُحرّك الذكاء الاصطناعي شفاه شخصيات الأنمي على أصوات حقيقية

غيّرت تقنية مزامنة الشفاه بالذكاء الاصطناعي طريقة تعامل صنّاع الأنمي والمعجبين والاستوديوهات مع الدبلجة الصوتية. يشرح هذا المقال بالتفصيل آلية عملية المزامنة، وأي نماذج الذكاء الاصطناعي تقدم أفضل أداء على الوجوه المُنمّطة، وكيف تنتج شخصيات أنمي تتحدث باستخدام أدوات مزامنة الشفاه في PicassoIA دون أي خبرة تقنية.

كيف يُحرّك الذكاء الاصطناعي شفاه شخصيات الأنمي على أصوات حقيقية
Cristian Da Conceicao
مؤسس Picasso IA

ابتعدت مزامنة الشفاه بالذكاء الاصطناعي كثيرًا عن الدبلجة الركيكة لمحاولات الترجمة الأولى، حين كانت أفواه الشخصيات تتحرك لثلاث ثوانٍ بينما ينتهي الصوت الإنجليزي في ثانية واحدة. اليوم، تحلل نماذج مزامنة الشفاه العصبية الفونيمات الصوتية في أجزاء من الألف من الثانية، وتولّد حركات للفم دقيقة على مستوى الإطار تطابق أي صوت، بأي لغة، لأي شخصية، بما في ذلك شخصيات الأنمي.

السؤال الذي يطرحه معظم الناس السؤال ليس هل تنجح هذه التقنية، بل كيف تعمل، وأي الأدوات تحقق نتائج فعلًا دون شهادة في علوم الحاسوب أو ميزانية إنتاج. يتناول هذا المقال الأمرين معًا.

ما الذي يجعل مزامنة شفاه الأنمي صعبة

الأنمي ليس لقطات من تصوير حي. لا توجد عضلات حقيقية لتتبعها، ولا بيانات هندسية للوجه يمكن الرجوع إليها، ولا خط أساس طبيعي لمزامنة الشفاه. تتعامل استوديوهات الدبلجة التقليدية مع هذا بتوقيت النصوص وفق حركات الفم الموجودة أصلًا، لكن النتيجة تبقى دائمًا حلًا وسطًا. أما الذكاء الاصطناعي فيتعامل مع المشكلة بطريقة مختلفة.

فجوة الفونيمات في فن الأنمي

تعتمد وجوه شخصيات الأنمي على مفردات بصرية مبسطة. أشكال الفم مُنمّطة، ومحدودة بعدد صغير من الأوضاع المميزة: مفتوح، ومغلق، ونصف مفتوح، وبعض الاختلافات للتعبيرات. أما الكلام البشري الحقيقي فيتضمن عشرات أشكال الفونيمات المختلفة في الثانية، وكثير منها لا مقابل له في رسوم الأنمي المعتادة.

عند محاولة مزامنة صوت حقيقي مع شخصية أنمي، تصطدم فورًا بهذه الفجوة. يقول الصوت كلمة "you" فيحتاج فم الشخصية إلى شكل مستدير محدد. ويقول الصوت كلمة "strength" فتتطلب مجموعة الحروف الساكنة انتقالات سريعة لم يرسمها الرسام الأصلي أبدًا.

لماذا تفشل الدبلجة التقليدية

تحل بيوت الدبلجة المحترفة هذه المشكلة بإعادة كتابة النصوص لتناسب حركات الفم الموجودة، وهي عملية تُعرف بمطابقة حركات الشفاه. تنجح هذه الطريقة، لكنها تضحي بدقة الترجمة، وتتطلب كُتّاب سيناريو مكلفين، وتستغرق أسابيع. ومع ذلك تبقى النتيجة مصطنعة.

الذكاء الاصطناعي لا يعيد كتابة النص، بل يعيد توليد الوجه.

سير عمل مزامنة الشفاه بالذكاء الاصطناعي على محطة صوت رقمية مع موجات صوتية وبيانات مزامنة الفم

كيف يحل الذكاء الاصطناعي مشكلة المزامنة

يأتي الاختراق في مزامنة الشفاه بالذكاء الاصطناعي من تدريب الشبكات العصبية على مجموعات ضخمة من بيانات الوجوه البشرية وهي تتحدث. تتعلم هذه النماذج العلاقة الدقيقة بين الإشارات الصوتية ومواضع الفم المرئية، ثم تطبّق هذه المعرفة على أي وجه، بما في ذلك الوجوه المُنمّطة في الأنمي.

تحليل الصوت ورسم خريطة الفونيمات

الخطوة الأولى في أي مسار لمزامنة الشفاه بالذكاء الاصطناعي هي تحليل الصوت. يقسّم النموذج الصوت المُدخل إلى فونيمات، وهي وحدات الصوت المنفردة التي يتكون منها الكلام. تحتوي الإنجليزية على نحو 44 فونيمًا. يحدد النموذج كل فونيم ومدته وموضعه على خط الزمن الصوتي.

يُقابل كل فونيم فيزيم، أي شكل بصري للفم. والتقابل ليس واحدًا لواحد: الفونيمان "b" و"p" يشتركان في فيزيم شبه متطابق (الشفتان مضمومتان)، بينما يشترك "a" و"ah" في شكل مفتوح على اتساعه. تحتفظ أداة مزامنة الشفاه الجيدة بجدول مفصّل لتقابل الفونيمات والفيزيمات، وتستخدمه لبناء خط زمني للحركة.

💡 يعتمد الفرق بين مزامنة الشفاه الجيدة والممتازة على عدد الإطارات الوسيطة التي يولّدها النموذج بين الفونيمات. الأدوات الرخيصة تتخطى الإطارات، أما النماذج الجيدة فتُنشئ انتقالات سلسة.

الشبكات العصبية للتنبؤ بشكل الفم

بمجرد وجود خط الزمن للفونيمات، يحتاج النموذج إلى معرفة الطريقة الدقيقة لتشكيل فم هذه الشخصية تحديدًا ليطابق كل فيزيم. هنا يكتسب التعلّم العميق تعقيده المبرر.

يحلل النموذج هندسة فم الشخصية الموجودة (تكفي صورة ثابتة واحدة مع النماذج الحديثة)، ويتعلم نسبها وأسلوبها، ثم يولّد مواضع جديدة للفم تتسق أسلوبيًا مع الصورة الأصلية وتطابق الصوت في الوقت نفسه.

بالنسبة للأنمي تحديدًا، دُربت أفضل النماذج على مجموعات بيانات تتضمن وجوهًا مُنمّطة، لذلك تدرك أن فم الأنمي عند الفونيم "ah" يختلف جوهريًا عن فم الإنسان الواقعي عند الفونيم نفسه، حتى لو كان الحدث الصوتي الأساسي متطابقًا.

توليد الحركة إطارًا تلو الآخر

الخطوة الأخيرة هي تركيب الإطارات. يولّد النموذج فيديو جديدًا يُظهر فيه كل إطار فم الشخصية في موضع الفيزيم الصحيح لتلك اللحظة في الصوت. وتولّد النماذج عالية الجودة مثل Lipsync 2 Pro بمعدلات إطارات تصل إلى 30 fps، فتنتج حركات سلسة وطبيعية من صورة مصدر واحدة.

لقطة مقرّبة جدًا لفم بشري يشكّل أشكال فونيمات دقيقة أثناء التسجيل في الاستوديو

أفضل نماذج مزامنة الشفاه بالذكاء الاصطناعي حاليًا

لا تتعامل كل نماذج مزامنة الشفاه مع وجوه الأنمي بالدرجة نفسها من الكفاءة. أهم عوامل التمييز هي دعم الوجوه المُنمّطة، وتحمّل جودة الصوت، ودقة المخرجات.

النموذجأفضل استخدامالسرعةدعم الأنمي
Lipsync 2 Proدقة عالية، صوت طويلمتوسطةقوي
Kling Lip Syncمقاطع قصيرة، وسائل التواصلسريعةجيد
Omni Human 1.5تحويل الصورة إلى فيديو متحدثمتوسطةممتاز
Lipsync Precisionالدبلجة مع الترجمةبطيئةمتوسط
React 1إعادة مزامنة الفيديو الواقعيسريعةمتوسط

مزامنة Lipsync 2 Pro

Lipsync 2 Pro هو الخيار الأدق. يتعامل مع ملفات الصوت الأطول دون انحراف، ويحافظ على هوية الوجه ثابتة طوال الفيديو، وينتج انتقالات نظيفة بين الفونيمات. إذا كنت تريد أدق مزامنة لمشهد حواري، فهذا هو النموذج الذي يجب تشغيله أولًا.

Lipsync 2 (النسخة الأساسية) أسرع، ويعمل جيدًا مع المقاطع القصيرة التي تكون فيها سرعة الإنجاز أهم من دقة الميلي ثانية.

Kling Lip Sync

Kling Lip Sync من Kwaivgi مُحسَّن لمحتوى الفيديوهات القصيرة. يعالج بسرعة ويُخرج نتائج نظيفة لمقاطع وسائل التواصل الاجتماعي التي تقل مدتها عن 30 ثانية. يتعامل النموذج جيدًا مع الوجوه المُنمّطة، وهذا ما يجعله خيارًا قويًا لمحتوى الأنمي، حيث تكون صورة الشخصية المصدر رسمًا 2D مسطحًا وليست صورة فوتوغرافية.

Omni Human 1.5

يتميز Omni Human 1.5 من ByteDance بأنه يحرك الرأس بالكامل، لا الفم وحده. عندما تتحدث الشخصية، يومئ الرأس قليلًا، وترمش العينان بشكل طبيعي، وتظهر تعبيرات دقيقة تتسق مع النبرة العاطفية للصوت. بالنسبة لشخصيات الأنمي، يُنتج هذا نتيجة أكثر إقناعًا بكثير من المزامنة التي تقتصر على الفم.

يوفر Omni Human (النسخة الأساسية) النهج نفسه في تحريك الجسم كاملًا بدرجة دقة أقل قليلًا، ما يجعله مفيدًا عندما تحتاج إلى تكرار أسرع في مشروع ما.

HeyGen Lipsync Precision

تم تصميم Lipsync Precision من HeyGen لسير عمل الدبلجة. يقبل مدخل فيديو ومسار صوتيًا، ثم يعيد مزامنة حركات الفم مع الصوت الجديد. إذا كنت تُعرّب حلقة أنمي من اليابانية إلى الإسبانية، يتولى Precision إعادة ضبط توقيت الرسوم المتحركة الموجودة بدلًا من توليد إطارات جديدة من الصفر.

للحصول على مخرجات متعددة اللغات، استخدمه مع Video Translate لأتمتة مسار الدبلجة عبر اللغات.

💡 Lipsync Speed هو خيار HeyGen الأسرع للتجارب السريعة، استخدمه لاختبار جودة المزامنة قبل تشغيل Precision الكامل.

صانع محتوى على مكتبه يسجل صوتًا يتزامن مع حركة شخصية على شاشتين

كيف تحصل على الصوت الصحيح أولًا

جودة مخرجات مزامنة الشفاه لا تتجاوز جودة مدخل الصوت. وهنا يقصّر معظم الصنّاع، ثم يتساءلون لماذا تبدو النتيجة غير صحيحة.

اختيار نموذج تحويل النص إلى كلام

إذا لم يكن لديك ممثل صوتي يسجل، فأنت بحاجة إلى نموذج تحويل نص إلى كلام ينتج صوتًا طبيعيًا ومعبّرًا مع نطق واضح للفونيمات. الصوت الرتيب من التحويل النصي يُنتج نتائج مزامنة جامدة وبلا حياة.

يُعد ElevenLabs V3 المعيار الحالي للتحويل النصي المعبّر والمناسب للشخصيات. يتعامل مع التنغيم العاطفي وتنوع الإيقاع والنفس المسموع، وكلها تُغذي مخرجات مزامنة أكثر طبيعية.

يقدم MiniMax Speech 2.8 HD صوتًا بجودة الاستوديو، يُولَّد بسرعة ونطقه نظيف. وهو خيار قوي عندما تحتاج إلى أصوات شخصيات كثيرة ومختلفة على نطاق واسع.

أما لاستنساخ الصوت تحديدًا، فيتيح Chatterbox من Resemble AI رفع عينة من أي صوت وإعادة إنتاجه مع تحكم كامل في العاطفة. وهذا مفيد جدًا لمشاريع الدبلجة التي يقوم بها المعجبون، حيث يهم الاتساق عبر الحلقات.

استنساخ الصوت من أجل أصالة الشخصية

عند دبلجة مسلسل أنمي موجود، يكسر استخدام صوت تحويل نص عام الانغماس فورًا. يحل استنساخ الصوت هذه المشكلة بالتقاط الخصائص المميزة لصوت الممثل الأصلي للشخصية (أو لبديل مختار)، واستخدامها أساسًا لكل الصوت المولّد.

يدعم Qwen3 TTS استنساخ الصوت مع أداء متعدد اللغات قوي، ما يجعله مفيدًا بشكل خاص عندما تكون المادة الأصلية باليابانية والمخرج المستهدف بالإنجليزية أو لغة أخرى.

يغطي ElevenLabs v2 Multilingual أكثر من 30 لغة ويحافظ على النبرة العاطفية عبرها، وهو أمر أساسي عندما يجب أن يبدو صوت الشخصية متسقًا سواء كانت تتحدث الإنجليزية أو الفرنسية أو البرتغالية.

💡 ولّد دائمًا صوت التعليق قبل البدء في مزامنة الشفاه. تشغيل المزامنة على صوت مؤقت ثم إعادة تشغيلها على الصوت النهائي يضاعف وقت المعالجة وتكلفتها.

غرفة تسجيل في استوديو دبلجة احترافي تُرى من الأعلى، وممثل صوتي يؤدي أمام الميكروفون

كيفية استخدام مزامنة الشفاه على PicassoIA

تضم فئة مزامنة الشفاه في PicassoIA 12 نموذجًا، وكلها متاحة من الواجهة نفسها دون أي تثبيت محلي. إليك سير العمل الذي يحقق أفضل النتائج لشخصيات الأنمي.

الخطوة 1: جهّز صورة المصدر

صورة المصدر هي العامل الأكبر تأثيرًا في جودة المخرجات. استخدم رسمًا عالي الدقة لوجه الشخصية، ويفضل أن يكون بتعبير محايد والفم مغلقًا قليلًا أو مسترخيًا. تجنب الصور التي تكون فيها الشخصية في منتصف تعبير ما، لأن النموذج سيحتاج إلى جهد أكبر للانتقال من تلك الحالة.

إذا كانت صورة المصدر منخفضة الدقة، فمرّرها أولًا عبر نموذج لرفع الدقة في PicassoIA. رفع الدقة بمقدار 2 إلى 4 مرات قبل تشغيل المزامنة يمنع النموذج من توليد حركات فم ضبابية أو مبيّنة البكسلات.

الخطوة 2: ولّد صوتك أو ارفعه

قبل فتح أداة المزامنة، جهّز صوتك كملف WAV أو MP3 نظيف. إذا كنت تولّده عبر تحويل النص إلى كلام، فنزّل المخرجات من ElevenLabs V3 أو MiniMax Speech 2.8 HD أولًا.

أزل ضوضاء الخلفية من الصوت قبل رفعه. حتى الضوضاء الخفيفة للغرفة قد يربك كشف الفونيمات ويسبب حركات فم غير متطابقة.

الخطوة 3: شغّل نموذج المزامنة

افتح Omni Human 1.5 لتحريك الرأس كاملًا، أو Lipsync 2 Pro للمزامنة الدقيقة للفم. ارفع صورة المصدر وملف الصوت. بالنسبة لمعظم محتوى الأنمي، تعمل الإعدادات الافتراضية جيدًا دون تعديل.

إذا كانت للشخصية نسب غير معتادة (عيون كبيرة جدًا، أو فم صغير، أو ملامح غير بشرية)، فجرّب Kling Lip Sync كبديل، لأن بيانات تدريبه تتضمن نطاقًا أوسع من أنواع الوجوه المُنمّطة.

الخطوة 4: صدّر وشارك

عادةً ما تكون مخرجات فيديو نماذج مزامنة الشفاه في PicassoIA بصيغة MP4 وبدقة صورة المصدر نفسها. للمشاركة على منصات التواصل، أبقِ المقاطع أقل من 60 ثانية واستخدم Lipsync Speed بدلًا من Precision لتقليل وقت المعالجة دون خسارة كبيرة في الجودة للمحتوى القصير.

أما لاحتياجات البث أو العرض عالي الدقة، فشغّل الفيديو النهائي عبر نموذج لتحسين الفيديو بالذكاء الاصطناعي بعد ذلك لرفع الدقة وتثبيت المخرجات.

محرر ما بعد الإنتاج يراجع مسارات صوتية متزامنة على شاشة كبيرة ليلًا في غرفة المونتاج

حالات استخدام حقيقية تنجح الآن

مشاريع الدبلجة التي يقوم بها المعجبون

تدبلج مجتمعات المعجبين الأنمي منذ عقود، لكن مزامنة الشفاه بالذكاء الاصطناعي تزيل أكبر عقبتين: توقيت النص وتحرير حركات الفم. يمكن لفريق صغير من شخصين أو ثلاثة أن ينتج اليوم دبلجة كاملة لحلقة بمزامنة دقيقة خلال أيام بدلًا من شهور.

سير العمل: اكتب النص المترجم، ثم ولّد أصوات الشخصيات عبر Chatterbox Pro أو ElevenLabs v2 Multilingual، ثم شغّل كل مشهد عبر Lipsync 2 Pro. تعمل المنظومة كلها على منصة واحدة.

محتوى YouTube ووسائل التواصل الاجتماعي

يحظى محتوى الأفاتار المتحدث على YouTube ومنصات الفيديو قصيرة الشكل بجمهور ضخم. أصبحت أفاتارات الأنمي المولّدة بالذكاء الاصطناعي التي تتحدث بصوت صانع المحتوى أو بصوت شخصية خيالية شكلًا متناميًا، وصار مستوى الإنتاج المطلوب في متناول صنّاع المحتوى الأفراد.

صُمم P Video Avatar تحديدًا لهذه الحالة، إذ يحرك صورة فوتوغرافية أو رسمًا توضيحيًا ليصبح أفاتارًا متحدثًا باستمرار، متزامنًا مع أي مدخل صوتي. يعمل بشكل جيد بصفة خاصة لقنوات الشخصيات التي يكون فيها الأفاتار الحضور الثابت على الشاشة.

هاتف ذكي يحمله شخص يعرض فيديو شخصية متحدثة مع شكل موجة صوتية أسفل الفيديو

الروايات المرئية والألعاب المستقلة

يستخدم مطورو الروايات المرئية وصنّاع الألعاب المستقلة مزامنة الشفاه بالذكاء الاصطناعي لتحريك حوارات الشخصيات دون توظيف رسامي حركة لكل مشهد. صورة شخصية واحدة ثابتة مع سطر صوتي تنتج شخصية متحدثة متحركة بالكامل، جاهزة لمحرك اللعبة.

يناسب Fabric 1.0 من VEED سير العمل هذا جيدًا، لأنه يتعامل مع مدخلات الصور بسلاسة وينتج مخرجات بأسلوب بصري متسق، وهذا مهم عندما تظهر الشخصية في عشرات مشاهد الحوار المختلفة داخل المشروع نفسه.

يُعد PixVerse Lipsync خيارًا قويًا آخر لمحتوى الألعاب، إذ يوفر سرعات مزامنة عالية تناسب دورات التطوير التكرارية، حيث قد تحتاج إلى إعادة تسجيل الأسطر ومزامنتها بشكل متكرر.

مراهق يشاهد محتوى على حاسوب محمول في غرفة نوم مضاءة بدفء وبضوء مصباح مكتبي كهرماني

3 أخطاء تُفسد مزامنة الشفاه بالذكاء الاصطناعي

استخدام صور مصدر منخفضة الدقة

إذا كانت صورة المدخل أقل من 512 بكسل في العرض، فلن يملك النموذج تفاصيل كافية لتوليد أوضاع فم مقنعة. ارفع دقة صورة المصدر أولًا. الوقت الإضافي في المعالجة يوفّر عدة محاولات مزامنة فاشلة، ويتجنب مخرجات ضبابية لا يمكن لأي معالجة لاحقة إصلاحها.

صوت بضوضاء خلفية كثيرة

الموسيقى والصدى وأجواء الغرفة تربك كشف الفونيمات. يبدأ النموذج بربط الأصوات بالفيزيمات الخطأ، فتنتج نتيجة يتحرك فيها الفم على الموسيقى الخلفية بدلًا من محتوى الكلام. شغّل صوتك عبر أداة إزالة الضوضاء قبل رفعه إلى أي نموذج لمزامنة الشفاه.

تخطي توليد الصوت الغني بالفونيمات

غالبًا ما تضغط نماذج تحويل النص إلى كلام العامة الفونيمات الدقيقة أو تتخطاها في الكلام السريع. لا يعرف نموذج المزامنة إلا ما يخبره به الصوت: إذا قُطعت الحروف الساكنة "t" و"d" في الصوت، فسيتخطى الرسم المتحرك أوضاع الفم تلك أيضًا. استخدم نموذج تحويل نص إلى كلام عالي الدقة مثل ElevenLabs V3 أو MiniMax Speech 2.8 HD اللذين يحافظان على النطق الكامل للفونيمات في الصوت الناتج.

💡 سجّل أو ولّد بمعدل عينة أعلى مما تظن أنك تحتاجه. 44.1 kHz كحد أدنى، و48 kHz للمخرجات الاحترافية. تقليل المعدل سهل، لكن جودة الصوت المفقودة بسبب معدلات العينة المنخفضة لا يمكن استرجاعها.

لقطة علوية لمساحة عمل إبداعية فيها جهاز لوحي يعرض أشكال فم الفونيمات وملاحظات مكتوبة بخط اليد

ابدأ بتحريك شخصياتك الخاصة

التقنية التي كانت تتطلب استوديو رسوم متحركة كاملًا أصبحت متاحة اليوم لأي شخص لديه صورة شخصية وملف صوتي. أزالت مزامنة الشفاه بالذكاء الاصطناعي الحاجز التقني بين أداء صوتي وشخصية متحركة كاملة تبدو وتُسمع كالأصل تمامًا.

تجمع فئة مزامنة الشفاه في PicassoIA 12 نموذجًا متخصصًا في مكان واحد، من المزامنة الدقيقة للحوار مع Lipsync 2 Pro إلى تحريك الجسم كاملًا مع Omni Human 1.5، دون الحاجة إلى تثبيت أي برنامج محلي.

ابدأ بصورة شخصية واحدة ومقطع صوتي قصير. شغّلهما عبر Kling Lip Sync أو Omni Human 1.5 وانظر كيف تبدو النتيجة. ادمج مخرجات المزامنة مع صوت مولّد من ElevenLabs V3 أو Chatterbox لتحصل على سير عمل كامل للصوت والحركة للشخصية داخل المنصة، دون أي تثبيت ولا حاجة إلى بطاقة ائتمان للتجربة.

إذا أردت الاطلاع على كل النماذج المتاحة في مزامنة الشفاه وتوليد الصوت، تصفّح الكتالوج الكامل على picassoia.com/en/all-models.

ممثلة صوتية محترفة تؤدي خلف زجاج استوديو مع مهندس مزج مرئي في المقدمة أمام محطة العمل الرقمية

شارك هذا المقال

اختر لغتك

مقالات ذات صلة