Wan 2.7 يضيف مزامنة الصوت لمقاطع الفيديو غير الخاضعة للرقابة

يأتي Wan 2.7 بمزامنة صوتية مدمجة لتوليد الفيديو بالذكاء الاصطناعي غير الخاضع للرقابة، ما يتيح للمبدعين إنتاج مقاطع فيديو ناطقة بشفاه متطابقة تمامًا مع الصوت. يتناول هذا المقال طريقة عمل مزامنة الصوت في Wan 2.7، وأفضل نماذج مزامنة الشفاه للعمل معه على PicassoIA، وأي أدوات تحويل النص إلى كلام تنتج أنظف مدخلات صوتية، وسير عمل خطوة بخطوة لإنتاج محتوى احترافي لشخص يتحدث أمام الكاميرا دون أي قيود على المحتوى.

Wan 2.7 يضيف مزامنة الصوت لمقاطع الفيديو غير الخاضعة للرقابة
Cristian Da Conceicao
مؤسس Picasso IA

غيّر Wan 2.7 للتو مفهوم توليد الفيديو بالذكاء الاصطناعي للمبدعين الذين يعملون خارج قيود المنصات المُنقّحة. يقدّم التحديث مزامنة صوتية أصلية ضمن مسار توليد الفيديو مباشرة، فلا تكتفي مقاطعك بالحركة، بل تتحدث، مع حركات فم مرسومة بدقة على الصوت في الوقت الفعلي، ودون أي ترقيع بعد المعالجة. بالنسبة لمن ينتجون محتوى لشخص يتحدث أمام الكاميرا، أو فيديو مدبلج، أو شخصيات متحركة، فهذا هو التحديث الذي يهم فعلًا.

ماذا يفعل Wan 2.7 فعلًا

ظلت سلسلة Wan من Wan Video تتصدر قوائم الأداء منذ شهور، لكن الإصدار 2.7 يمثل تحولًا حقيقيًا في أولويات النموذج. ركزت الإصدارات السابقة على جودة الحركة وتحجيم الدقة. يضيف الإصدار 2.7 طبقة الصوت كعنصر أساسي، أي أن النموذج يقرأ مدخلًا صوتيًا ويستخدمه لقيادة الرسوم المتحركة للوجه مباشرةً أثناء مرحلة التوليد، وليس كتصحيح ثانوي لمزامنة الشفاه يُطبَّق بعد ذلك.

يُحدث هذا فرقًا عمليًا لمن ينتجون محتوى لشخص يتحدث أمام الكاميرا، أو فيديو مدبلج، أو شخصيات متحركة تحتاج إلى أن تبدو وتُسمع كأنها تقول شيئًا فعلًا. والنتيجة مزامنة أدق بوضوح من الأدوات التي تطبّق محاذاة الصوت كمرحلة منفصلة في مسار العمل.

ثلاثة إصدارات، سير عمل واحد

يأتي Wan 2.7 في ثلاثة أوضاع مختلفة، يغطي كل منها نقطة بداية مختلفة في سير الإنتاج:

  • Wan 2.7 T2V: تحويل النص إلى فيديو. تكتب أمرًا نصيًا فيولّد النموذج مقطعًا بحركة ومزامنة صوتية مدمجتين، انطلاقًا من وصف نصي خالص.
  • Wan 2.7 I2V: تحويل الصورة إلى فيديو. تزوّده بصورة شخصية أو صورة ثابتة لشخصية، فيحرّك الشخصية بحركة شفاه مدفوعة بالصوت تنطلق من الصورة المصدر.
  • Wan 2.7 R2V: تحويل المرجع إلى فيديو. يتيح لك تثبيت مظهر شخصية معينة وتحريكها بثبات عبر عدة مقاطع دون اختلاف بصري بين اللقطات.

الإصدارات الثلاثة متاحة على PicassoIA، وتدعم خرجًا بدقة 1080p مع تفعيل ميزة مزامنة الصوت الأصلية افتراضيًا.

تصور بياني لموجة صوتية بالذكاء الاصطناعي على شاشة احترافية تعرض واجهة مزامنة الصوت

كيف تعمل مزامنة الصوت في Wan 2.7

تحليل الصوت على مستوى الإطار

كان النهج القديم لمزامنة الشفاه في فيديو الذكاء الاصطناعي يقوم على الترقيع: توليد الفيديو أولًا، ثم تشغيل نموذج منفصل لتشويه منطقة الفم لتطابق ملف صوتي. يُدخل هذا النهج الطبقي تشوهات عند حدود الإطارات، خصوصًا أثناء الكلام السريع أو الصوت الكثيف بالحروف الساكنة. كما أن العملية ذات المرحلتين لا تأخذ في الحسبان أن الشخص المتحدث يحمل جسده بطريقة مختلفة قليلًا، وأن أنماط تنفسه تتغير، وأن عضلات رقبته تتحرك.

يعالج Wan 2.7 الصوت في الوقت نفسه الذي يولّد فيه كل إطار. يستخدم النموذج طبقات انتباه صوتي، وهي أجزاء من الشبكة العصبية تنتبه للمعلومات الطيفية في الإشارة الصوتية وتترجمها إلى بيانات تشوّه عضلات الوجه. والنتيجة أن أشكال الفونيمات، أي هيئات الفم المحددة لأصوات مثل "B" و"M" و"F" والحركات، تُولَّد أصلًا وليست مُلصقة لاحقًا.

💡 ما معنى ذلك عمليًا: لا توجد فواصل بعد المعالجة. حركة خط الفك، وضغط الشفتين في أصوات "P"، والشد الطفيف في الخد أثناء صوت "S"، كل ذلك ينبثق من عملية التوليد ولا يُرسم فوقها. تحصل على وضعية وتنفس وتعبيرات تنتمي فعلًا إلى شخص يتكلم.

ما الذي يجعله غير خاضع للرقابة

يشير وصف "غير خاضع للرقابة" في Wan 2.7 إلى أمرين مختلفين. أولًا، لا يطبّق النموذج أثناء التوليد فلترة للمحتوى تجعله يرفض المخرجات أو يُضعف جودتها عندما يخرج الموضوع عن إرشادات المحتوى السائدة. ثانيًا، تعمل مزامنة الصوت بصرف النظر عن المحتوى المنطوق، ولا توجد فلترة على مستوى العبارات تتسبب في تعطل مزامنة الشفاه أو عدم دقتها في الحوار الموجّه للبالغين.

وهذا مهم لأن كثيرًا من أدوات مزامنة الشفاه في السوق تفشل بصمت، أو تنتج مخرجات متدنية الجودة، أو تحجب التوليد كليًا للمحتوى الذي لا يناسب العائلات. يتعامل Wan 2.7 مع الإشارة الصوتية كبيانات، ويعالجها دون حكم تحريري، ما يجعله مفيدًا فعلًا لصانعي المحتوى الناضج، ولمنتجي المحتوى للبالغين، ولكل من يبني محتوى يتطلب رسومًا متحركة صوتية غير مقيّدة وبأعلى جودة.

الدقة ومواصفات الخرج

يدعم Wan 2.7 عبر الإصدارات الثلاثة ما يلي:

المواصفةWan 2.7 T2VWan 2.7 I2VWan 2.7 R2V
أقصى دقة1080p1080p1080p
مزامنة الصوتأصليةأصليةأصلية
غير خاضع للرقابةنعمنعمنعم
نقطة البدايةأمر نصيصورة + صوتصورة مرجعية
ثبات الشخصيةلكل مقطعلكل مقطععبر المقاطع

منشئ محتوى محترف يتحدث إلى ميكروفون استوديو بإضاءة طبيعية للاستوديو

أفضل أدوات مزامنة الشفاه المتاحة حاليًا

تمثل مزامنة الصوت في خطوة توليد الفيديو نصف المعادلة. النصف الآخر هو تطبيق مزامنة الشفاه على لقطات موجودة، أو إضافتها إلى صور ثابتة لم تُولَّد باستخدام Wan 2.7. هذه هي الأدوات الأفضل في هذا المجال حاليًا على PicassoIA.

Sync Lipsync 2 والإصدار 2 Pro

صُمّم Sync Lipsync 2 خصيصًا لمحاذاة الصوت مع الشفاه بدقة عالية. تزوّده بفيديو أو صورة وملف صوتي، فيُخرج النموذج مقطعًا تتطابق فيه حركات الفم مع الكلام على مستوى الفونيم. سير العمل مباشر: ارفع المصدر، ثم ارفع الصوت، ثم احصل على الخرج.

أما الإصدار Pro، Lipsync 2 Pro، فيضيف خرجًا بدقة أعلى، ومعالجة أفضل للوجوه المائلة جانبيًا، وأداءً محسّنًا مع أنماط الكلام السريعة. إذا كنت تعمل مع متحدثين سريعين، أو تجمعات كثيفة من الحروف الساكنة، أو وجوه غير مواجهة للكاميرا بالكامل، فإن الإصدار Pro يتعامل مع الحالات الحدّية التي يصعب على الإصدار الأساسي التعامل معها.

يتميز النموذجان بقوة خاصة مع الأشخاص في الصور الفوتوغرافية الواقعية، وهو ما يتوافق جيدًا مع نوع المخرجات الذي ينتجه Wan 2.7.

Omni Human 1.5 من ByteDance

يتبنى Omni Human 1.5 من ByteDance نهجًا مختلفًا. فبدلًا من مطابقة الصوت مع فيديو موجود مسبقًا، يولّد الرسوم المتحركة للوجه من صورة شخصية واحدة وملف صوتي. والخرج فيديو ناطق يبدو طبيعيًا، لم يكن للوجه فيه وجود مرئي من قبل، بل كان مجرد صورة ثابتة.

هذا ما يجعل Omni Human 1.5 رفيقًا طبيعيًا للصور الشخصية المولّدة بالذكاء الاصطناعي. ولّد صورة شخصية بأدوات الصور في PicassoIA، ثم مرّرها إلى Omni Human 1.5 مع الصوت الناتج من التحويل إلى كلام، فتحصل على شخصية ناطقة دون أي لقطات مصدر. كما يتعامل النموذج جيدًا مع المراجع لكامل الجسد، لا مع قصّات الوجه فقط، وهذا مهم للمحتوى الذي يمتد كادره إلى ما تحت الكتفين.

Kling Lip Sync

يُعد Kling Lip Sync من KwaiVGI أحد الخيارات الأسرع في هذا المجال. يعالج محاذاة الصوت والفيديو بسرعة دون التضحية بجودة تصيير منطقة الفم. وبالنسبة للمبدعين الذين يكررون عدة نسخ أو يختبرون تنويعات للحوار، فإن ميزة السرعة حقيقية. يتعامل جيدًا مع اتجاهات متعددة للوجه، ويعمل بشكل نظيف على اللقطات القريبة والمتوسطة على حد سواء.

أما المبدعون الذين يحتاجون أعلى دقة ممكنة في خرج بمستوى احترافي، فإن Lipsync Precision من HeyGen هو الخيار المرجعي، مع مزامنة دقيقة لكل إطار عبر المقاطع الأطول.

منشئة محتوى تراجع مقطعًا لمزامنة الشفاه بالذكاء الاصطناعي على هاتف ذكي في المنزل

كيفية استخدام Wan 2.7 على PicassoIA

يستضيف PicassoIA الإصدارات الثلاثة من Wan 2.7 مع خرج بدقة كاملة للمستخدمين المشتركين. إليك كيفية استخدام Wan 2.7 I2V لإنشاء مقطع بمزامنة صوتية من صورة شخصية:

الخطوة 1: جهّز صورة المصدر

ولّد أو ارفع صورة شخصية واقعية فوتوغرافيًا. يعمل النموذج بأفضل شكل مع الصور التي يظهر فيها الوجه بوضوح، مواجهًا أو بزاوية خفيفة، مع إضاءة جيدة على ملامح الوجه. استخدم أدوات توليد الصور في PicassoIA للحصول على صورة شخصية أساسية عالية الجودة إن لم تكن تملك واحدة.

الخطوة 2: جهّز الصوت

سجّل أو ولّد مقطعًا صوتيًا بصيغة WAV أو MP3. كلما كان الصوت أنظف، كانت جودة المزامنة أفضل. تجنب الصدى الثقيل، والأصوات المتداخلة، وضوضاء الخلفية. راجع قسم التحويل إلى كلام أدناه لمعرفة أفضل خيارات توليد الصوت لإنتاج صوت نظيف وذي تعبير.

الخطوة 3: اختر Wan 2.7 I2V على PicassoIA

انتقل إلى صفحة Wan 2.7 I2V وافتح واجهة التوليد.

الخطوة 4: ارفع الملفات واضبط الإعدادات

  • ارفع صورتك الشخصية كإطار مرجعي
  • ارفع ملف الصوت لمزامنة الصوت
  • اضبط الدقة على 1080p لأقصى جودة للخرج
  • اكتب أمرًا نصيًا للحركة يصف حركة الرأس والمشهد (مثلًا: "امرأة تتحدث مباشرة إلى الكاميرا، حركة طبيعية خفيفة للرأس، تعبير محايد، إضاءة دافئة داخل المكان")

الخطوة 5: ولّد وراجع

اضغط على التوليد وراجع جودة مزامنة الشفاه، خصوصًا في الكلمات الكثيفة بالحروف الساكنة وفي الانتقالات بين الأصوات الصائتة. إذا احتاجت المزامنة إلى مرور ثانٍ للتحسين، فمرّر الخرج عبر Sync Lipsync 2 Pro للتصحيح الدقيق.

💡 نصيحة احترافية: الإصدار R2V، Wan 2.7 R2V، يتيح لك إعادة استخدام الوجه نفسه للشخصية عبر عدة مقاطع. ولّد مقطعًا أساسيًا واحدًا، ثم استخدم R2V لكل اللقطات اللاحقة للحفاظ على ثبات الشخصية عبر سلسلة كاملة.

منظر علوي لمساحة عمل منشئ محتوى محترف تضم حاسوبًا محمولًا ومعدات تسجيل

نماذج التحويل إلى كلام التي تتناغم معه

تعتمد جودة مزامنة الصوت على المدخل الصوتي بقدر اعتمادها على النموذج الذي يعالجه. تنتج خيارات تحويل النص إلى كلام هذه نوع الخرج الصوتي النظيف والطبيعي الذي يمنح Wan 2.7 أفضل مادة للعمل عليها.

ElevenLabs V3

يظل ElevenLabs V3 من أكثر نماذج التحويل إلى كلام تعبيرًا المتاحة. يتعامل مع النبرة العاطفية، وتنوع الإيقاع، وأنماط التنفس الطبيعية بطريقة تجعل الصوت الناتج يبدو كإنسان حقيقي سُجّل في استوديو احترافي. وبالنسبة لمزامنة الشفاه، يترجم هذا التعبير إلى أنماط فونيمية أكثر تنوعًا تبدو طبيعية عند تحريكها. أما خرج التحويل إلى كلام الرتيب فيميل إلى إنتاج حركة فم مسطحة ومتكررة تبدو مصطنعة حتى مع محاذاة جيدة.

يدعم V3 أكثر من 30 لغة واستنساخ الصوت من مقاطع مرجعية قصيرة، ما يجعله عمليًا لبناء صوت شخصية مخصص والحفاظ عليه عبر سلسلة محتوى طويلة.

Speech 2.8 HD

صُمّم Speech 2.8 HD من MiniMax لخرج بجودة استوديو وبمعدلات بت صوتية أعلى. تتميز أصواته الافتراضية بدفء طبيعي يناسب المحتوى الموجّه لجمهور ناضج. يدعم النموذج استنساخ الصوت، ما يتيح لك إنشاء صوت شخصية ثابت وتطبيقه على كل مقطع في السلسلة. يمنح معدل البت عالي الدقة Wan 2.7 تفاصيل ترددية أكثر للعمل عليها أثناء المزامنة، وهذا يساعد في الأصوات الصفيرية والاحتكاكية التي يميل الصوت منخفض الجودة إلى طمسها.

Chatterbox

يمنحك Chatterbox من Resemble AI تحكمًا مباشرًا في الأداء العاطفي عبر معاملات المشاعر. يمكنك ضبط الثقة، أو الدفء، أو الإلحاح في لحظات محددة من النص دون إعادة تسجيل السطر كله. وبالنسبة لمنشئي المحتوى الذين يحتاجون إلى صوت شخصية يتغير نبرته في منتصف المقطع، فهذا المستوى من التحكم مفيد. ويعمل الإصدار Chatterbox Turbo بسرعة أكبر بكثير لسير عمل التكرار السريع.

نموذج التحويل إلى كلامالتعبيريةاللغاتاستنساخ الصوتالأفضل لـ
ElevenLabs V3عالية جدًاأكثر من 30نعمالسرد، الحوار
Speech 2.8 HDعاليةمتعددةنعمالتعليق الصوتي، السلاسل
Chatterboxمتوسطة إلى عاليةالإنجليزية أساسًانعمالمقاطع المدفوعة بالعاطفة

إعداد تسجيل في استوديو منزلي بألواح صوتية وميكروفون احترافي في ضوء الساعة الذهبية

Wan 2.7 مقابل الإصدارات السابقة

يستحق التطور من إصدار إلى آخر في سلسلة Wan المتابعة إذا كنت تحدد أي إصدار تستخدم لمشروع معين:

الإصدارأقصى دقةمزامنة الصوتغير خاضع للرقابةالسرعة
Wan 2.5 T2V720pلالامتوسطة
Wan 2.6 T2V1080pجزئيةجزئيمتوسطة
Wan 2.7 T2V1080pأصليةنعمسريعة
Wan 2.7 I2V1080pأصليةنعممتوسطة
Wan 2.7 R2V1080pأصليةنعممتوسطة

الفارق بين 2.6 و 2.7 يكمن تحديدًا في بنية دمج الصوت. كان Wan 2.6 يتمتع بجودة حركة جيدة وتحسينات في الدقة، لكنه كان يتطلب تطبيق مزامنة الصوت كمعالجة لاحقة. أما الإصدار 2.7 فيدمجها على مستوى التوليد، وهذا هو التغيير المعماري المهم الذي يلغي مشكلة التشوهات الناتجة عن المرحلتين.

للتوضيح، يدعم Wan 2.2 S2V أيضًا الفيديو المتزامن مع الصوت، لكنه يستهدف حالة استخدام مختلفة. هو محسّن لمحتوى التواصل الاجتماعي القصير مع مطابقة صوتية آلية، لا للرسوم المتحركة التفصيلية المدفوعة بالصوت التي يوفرها الإصدار 2.7.

شابة ترتدي سترة بلون الخمري تستخدم أدوات إنشاء المحتوى بالذكاء الاصطناعي

المجموعة الصحيحة لمحتوى بمزامنة صوتية

يتطلب بناء سير عمل موثوق لمحتوى بمزامنة صوتية اختيار الأدوات المناسبة في كل خطوة. واستنادًا إلى النماذج المتاحة على PicassoIA الآن، إليك ثلاث مجموعات أدوات إنتاج مجربة:

لمقاطع الشخص المتحدث انطلاقًا من صورة شخصية:

  1. ولّد صورة شخصية باستخدام أدوات الصور في PicassoIA
  2. ولّد الصوت باستخدام ElevenLabs V3 أو Speech 2.8 HD
  3. حرّك الصورة باستخدام Wan 2.7 I2V
  4. حسّن مزامنة الشفاه باستخدام Lipsync 2 Pro عند الحاجة

للمحتوى المدبلج أو المترجم:

  1. مقطع فيديو مصدر (لقطات موجودة أو مولّدة حديثًا)
  2. ولّد الصوت المدبلج باللغة المستهدفة باستخدام ElevenLabs V2 Multilingual
  3. طبّق المزامنة باستخدام Lipsync Precision من HeyGen للمحاذاة الدقيقة لكل إطار

للمقاطع الناطقة المدفوعة بالنص بالكامل:

  1. اكتب النص واوصف المشهد في أمر نصي
  2. شغّل Wan 2.7 T2V مع تفعيل مدخل الصوت
  3. استخدم P Video Avatar لتقديم الشخصية عبر سلسلة كاملة بالاعتماد على الشخصية

💡 مهم: عند استخدام Wan 2.7 I2V لمحتوى للبالغين، تنطبق المعالجة غير الخاضعة للرقابة للنموذج على توليد الصورة ومرحلة مزامنة الصوت معًا. يعكس الخرج الصوت بدقة دون تدهور أو تشوهات ناتجة عن الفلترة، بصرف النظر عن المحتوى المنطوق.

فريق متنوع من منشئي المحتوى يعمل على أدوات الفيديو بالذكاء الاصطناعي في مكتب حديث

جرّبه على PicassoIA

جميع النماذج الواردة في هذا المقال متاحة الآن على PicassoIA. سواء أردت أن تبدأ بنموذج Wan 2.7 T2V لمقطع مدفوع بالنص، أو أن ترفع صورة شخصية إلى Wan 2.7 I2V لتحيي شخصية، أو أن تمرر لقطاتك عبر Sync Lipsync 2 Pro لمحاذاة صوت نظيفة، فالكتالوج الكامل موجود على picassoia.com/en/all-models.

ميزة مزامنة الصوت في Wan 2.7 ليست تحديثًا ثانويًا. فهي تسد فجوة أزعجت صنّاع المحتوى طويلًا، وهي الانفصال بين الفيديو المولَّد والصوت الذي يُفترض أن يقوده. ومع المزامنة الأصلية داخل مرحلة التوليد، ودعم الصوت غير الخاضع للرقابة، وثلاثة إصدارات جاهزة للإنتاج على المنصة، تمثل هذه الميزة الأداة العملية التي كانت مفقودة في معظم مسارات العمل الموجهة للبالغين وغير المقيّدة.

اختر شخصية، واكتب سيناريو، وولّد شيئًا يستحق المشاهدة.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة