لديك صورة لجدتك وهي تضحك في حفل زفاف عام 1994، ولديك أغنيتها المفضلة. قبل سنوات قليلة، كان دمج الاثنين يتطلب محرر فيديو وصبرًا كبيرًا، وكانت النتيجة تبدو كرسالة فدية تتحرك أمامك. اليوم، أداة توليد فيديو مزامنة الشفاه بالذكاء الاصطناعي المجانية للتجربة عبر الإنترنت تقرأ الصوت، وتدرس الوجه، وتحرك الشفتين والخدين والحاجبين، فيبدو الشخص في الصورة وكأنه يغني كل كلمة. يعرض هذا المقال النماذج الأفضل في ذلك، وكيفية تجهيز الصورة والأغنية، وكيفية إصلاح الأخطاء التي تفسد معظم المحاولات الأولى.
💡 الخلاصة السريعة: اختر صورة واضحة أمامية الوجه، واجعل الصوت أقل من 35 ثانية، ثم شغّلهما عبر Omni Human 1.5 أو Fabric 1.0 على PicassoIA. كل ما يلي يهدف إلى جعل هذه المحاولة الأولى تبدو جيدة.
ماذا يفعل مولّد مزامنة الشفاه؟
مولّد مزامنة الشفاه هو نموذج تحويل صورة إلى فيديو مع مهارة إضافية: إنه يستمع. تعطيه صورة ثابتة وملف صوتي، فيبني مقطعًا قصيرًا تتطابق فيه أشكال الفم مع المقاطع الصوتية، وتتبع الفك والخدان الإيقاع، ويضيف الرأس حركات طبيعية صغيرة. بعض الأدوات تضيف أيضًا رمشًا ورفعًا للحاجبين وحركة للكتفين حتى لا يبدو المقطع كدمية.
صورة واحدة وملف صوتي واحد
الوصفة دائمًا تقوم على المكونين نفسيهما. الصورة توفر الهوية: شكل الوجه والبشرة والشعر والملابس والخلفية. أما الصوت فيوفر الأداء: التوقيت والنبرة والتنفس. ويقوم النموذج بالجزء الصعب بينهما، إذ يتوقع كيف سيتحرك هذا الوجه بالذات أثناء إصدار هذا الصوت بالذات.

لهذا تستطيع الأداة نفسها أن تجعل جدة تغني تهويدة، أو تجعل تميمة شركة تقرأ إعلانًا عن منتج، أو تجعل صورة عائلية قديمة تقول "عيد ميلاد سعيد" بالإسبانية. فعلى سبيل المثال، يقبل Omni Human 1.5 التعليق الصوتي بالإنجليزية والإسبانية واليابانية والكورية والصينية والإندونيسية، ويعمل مع الوجوه ولقطات الجسم الكاملة وحتى الشخصيات المرسومة.
أين تقع كلمة "مجاني" فعلًا؟
كلمة "مجاني" هدف متحرك في هذا المجال. يصف PicassoIA Fabric 1.0 بأنه مجاني للتجربة عبر الإنترنت، بلا حاجة إلى برمجة أو إعداد كاميرا. تتغير حدود الاستخدام، لذلك تحقق من صفحة النموذج قبل التخطيط لدفعة كبيرة. الثابت هو الجانب الاقتصادي: صورة شخصية تغني تكلّفك بضع دقائق انتظار بدلًا من طاقم تصوير، ومصاريفك الحقيقية الوحيدة هي صورة مصدر جيدة وملف صوتي جيد.
لماذا يصنع الناس صورًا تغني؟
صور الغناء ليست حيلة تتلاشى بعد أسبوع. إنها تحل ثلاث مشكلات مختلفة لثلاث مجموعات مختلفة من الناس، وتستخدم كل مجموعة الأداة بطريقة مختلفة قليلًا.
أعياد الميلاد والهدايا
الهدية الشخصية تنجح لأن فيها تفاصيل لا يستطيع أحد غيرك نسخها. خذ صورة العائلة من حفل الزفاف، وأضف تسجيلًا للعائلة كلها وهي تغني، فتحصل على مقطع يُعاد تشغيله طوال المساء. وفيديوهات الذكرى تعمل بالطريقة نفسها: صورة مقرونة بأغنية مفضلة، ومتحركة بلطف، غالبًا ما تترك أثرًا أعمق من عرض الشرائح.

⚠️ الإذن مهم. حرّك فقط الوجوه التي لديك الحق في استخدامها، واقرنها فقط بموسيقى تملكها أو تولّدها بنفسك. المقطع المحترم الذي يُصنع لفرد من العائلة يختلف تمامًا عن وضع كلمات في فم شخص غريب.
صناع المحتوى
الفيديو القصير يكافئ الابتكار، والصورة التي تغني فجأة ما زالت توقف التمرير. يستخدم صناع المحتوى هذه الميزة في مقدمات قصيرة، وقنوات لشخصيات، ومقاطع موسيقية تشويقية، وصيغ ردود الفعل. والميزة الكبرى هي قابلية التكرار: بمجرد أن تحصل على صورة شخصية لشخصية تعجبك، تستطيع استبدال الصوت وإنتاج مقطع جديد كل يوم دون تصوير أي شيء.

الموسيقيون والنماذج الأولية
يستخدم الفنانون المستقلون صور الغناء لمعاينة مقطع موسيقي قبل دفع تكلفة تصوير. يمكن لصورة لألبوم أو شخصية مُنمّقة أو تميمة أن تؤدي المقطع الأساسي كإعلان تشويقي. إنها رخيصة وسريعة، وتمنح المعجبين وجهًا يرتبطون به بالأغنية بينما لا يزال الفيديو الموسيقي الحقيقي مجرد خطة.
بدأ المعلمون ومدرّسو اللغات يفعلون شيئًا مشابهًا. سجّل قافية قصيرة أو أغنية مفردات، وحرّك صورة شخصية لشخصية ودودة، فيحصل الطلاب على معلم يغني ولا يتعب أبدًا. وتبديل الصوت إلى لغة أخرى يعيد استخدام الوجه نفسه، فيمكن لصورة واحدة أن تخدم فصلًا كاملًا من الطلاب بمستويات مختلفة.
اختر النموذج المناسب
يعرض PicassoIA 12 نموذجًا لمزامنة الشفاه، وهي تنقسم إلى فئتين: أدوات تبدأ من صورة، وأدوات تبدأ من فيديو موجود. وبالنسبة لصور الغناء، تحتاج إلى الفئة الأولى.
نماذج الصورة إلى الغناء
| النموذج | ما تقدمه | الأفضل لـ | إعدادات بارزة |
|---|
| Omni Human 1.5 | صورة + صوت أقل من 35 ثانية | الوجوه الواقعية، والغناء، ولقطات الجسم كاملًا | أمر نصي اختياري، والوضع السريع، وقيمة البذرة |
| Fabric 1.0 | صورة + صوت | مقاطع سريعة للمتحدثين والغناء | 480p أو 720p |
| P Video Avatar | صورة + نص مكتوب أو صوت | الأفاتار المتحدث بأصوات مدمجة | أكثر من 30 صوتًا، و10 لغات، حتى 1080p |
| Omni Human | صورة + صوت | فيديوهات متحدثة من صورة واحدة | نموذج Omni Human الأصلي |
إذا كان هدفك حالة الاستخدام الرئيسية، أي وجه يغني أغنية حقيقية، فابدأ بـ Omni Human 1.5. تتضمن أمثلته المنشورة أمرًا نصيًا بسيطًا مثل "امرأة تغني وتعزف على غيتارها" مقترنًا بملف WAV، ويتيح حقل الأمر النصي توجيه المشهد والكاميرا وحركة الجسم. أما Fabric 1.0 فهو المسار الأسرع عندما تحتاج فقط إلى أن يتبع الفم الصوت، وتريد ملفًا نظيفًا بدقة 720p.
P Video Avatar مختلف: يمكنك كتابة الكلمات بالضبط واختيار صوت، أو رفع ملف صوتك الخاص. وهو الخيار الأفضل للمقاطع الحوارية أكثر من الأغاني، لكن حقل video_prompt فيه مفيد لوصف الطريقة التي ينبغي أن يبدو بها الشخص أثناء الكلام.
خيارات الفيديو إلى الفيديو
إذا كان لديك بالفعل مقطع للشخص وتريد فقط تبديل الصوت، فهذه النماذج تعمل على الفيديو بدلًا من الصورة الثابتة:

💡 قاعدة عامة: صورة ثابتة تدخل، ومقطع يغني يخرج، يعني Omni Human 1.5 أو Fabric 1.0. فيديو متحرك يدخل، وصوت جديد يخرج، يعني أحد نماذج Sync أو Kling أو HeyGen.
ابدأ بصورة قوية
صورة المصدر تحدد معظم النتيجة. لا يمكن إنقاذ الصورة الضعيفة بملف صوتي أفضل، لذلك امنح هذه الخطوة خمس دقائق قبل أن تضغط على التوليد.
ما الذي يجعل الوجه يتزامن جيدًا
- أمامي أو بزاوية ثلاثية الأرباع خفيفة. يحتاج النموذج إلى رؤية زاويتي الفم.
- شفاه وأسنان مرئية. الفم المسترخي والمفتوح قليلًا يمنح النموذج مادة أكثر للعمل من الشفاه المشدودة المغلقة.
- إضاءة متساوية على الوجه. ضوء النافذة الناعم أفضل من الظلال الحادة من الأعلى التي تخفي الفك.
- تركيز حاد على العينين والفم. إذا كان الوجه عرضه 80 بكسلًا فقط، فستبدو النتيجة ناعمة.
- مساحة واضحة حول الرأس. الشعر واليدان والميكروفونات التي تعبر الذقن تربك منطقة الفم.

صور تفشل
الصور الجماعية التي يكون فيها كل وجه صغيرًا جدًا، والنظارات الشمسية التي تخفي نصف الوجه، والأيدي التي تحجب الفم، والمناظر الجانبية المتطرفة للوجه، ولقطات الشاشة المضغوطة بشدة، كلها تنتج نتائج مطاطية. وإذا كان لديك فقط مسح عائلي منخفض الدقة، فمرّره أولًا عبر نموذج لرفع الدقة. الوجه الأكثر حدة عند المدخل يعني وجهًا أكثر حدة عند المخرج.
تستحق صور الأبيض والأسود القديمة ذكرًا خاصًا. غالبًا ما تتزامن بشكل جميل لأن التباين مرتفع والإضاءة بسيطة، لكن حبيبات الفيلم والخدوش قد تُقرأ كضوضاء. مرور سريع للترميم لإزالة الغبار وتحديد العينين يمنح نموذج مزامنة الشفاه سطحًا أهدأ لتحريكه، ويصبح المقطع النهائي أقل اهتزازًا بكثير.
أعدّ الأغنية أو الصوت
ملف الصوت هو النصف الثاني من الوصفة، وهو الجزء الذي يتعجّله معظم الناس. الأصوات النظيفة تنتج أشكال فم نظيفة. أما المزيج الموحل مع طبول عالية ومغنٍّ مدفون فيعطي النموذج القليل جدًا ليتبعه.
اكتب الأغنية
لا تحتاج إلى استوديو تسجيل، ولا حتى إلى صوت. يستضيف PicassoIA عائلة كاملة من نماذج الموسيقى التي تنتج مقاطع من أمر نصي:
اكتب كلمات قصيرة، وحدد النوع الموسيقي والمزاج، وولّد نسختين أو ثلاثًا. اختر النسخة التي يظهر فيها الصوت بوضوح فوق الآلات.

سجّل الصوت أو ولّده
إذا كنت تفضّل الكلام على الغناء، فاستخدم نموذج تحويل النص إلى كلام مثل Speech 2.8 HD للتعليقات الصوتية بجودة الاستوديو، أو Gemini 3.1 Flash TTS للحصول على 30 صوتًا بأكثر من 70 لغة، أو ElevenLabs v3 للأداء الطبيعي. كما يصلح تسجيل بالهاتف في غرفة هادئة، طالما لا يوجد صدى ولا أحاديث في الخلفية.
اقطع قبل الرفع. يرفض Omni Human 1.5 الصوت الذي يتجاوز 35 ثانية، لذلك قصّ مقطعك إلى أفضل 20 إلى 30 ثانية، وغالبًا ما يكون المقطع الأساسي. وللأغنية الأطول، قسّمها إلى أجزاء، وولّد كل جزء بالصورة نفسها وقيمة البذرة نفسها، ثم ادمج المقاطع في أي محرر فيديو.
كيف تستخدم Omni Human 1.5
إليك سير العمل الكامل، من صفحة فارغة حتى مقطع غناء جاهز. النمط نفسه ينطبق على نماذج الصور الأخرى، وما يتغير فقط هو الإعدادات.
ست خطوات على PicassoIA
- افتح صفحة Omni Human 1.5 على PicassoIA.
- ارفع الصورة: صورة شخصية واضحة يظهر فيها الوجه.
- ارفع الصوت: ملف MP3 أو WAV أقل من 35 ثانية.
- أضف أمرًا نصيًا اختياريًا لتوجيه المشهد، مثل "تغني بهدوء مع ابتسامة دافئة، وحركة خفيفة للرأس، والكاميرا ثابتة."
- قرّر الوضع السريع. فعّله للمسودات السريعة، وأوقفه للحصول على أفضل تفاصيل.
- شغّل التوليد، وراجع المقطع ثم نزّله. إذا أعجبتك النتيجة وأردت تغييرًا صغيرًا، فأعد استخدام قيمة البذرة حتى يبقى الباقي مستقرًا.

أفكار أوامر نصية لتجربتها في الخطوة 4:
- "تغني المقطع الأساسي وعيناها مغمضتان، مع إيماءات صغيرة على الإيقاع، والكاميرا تقترب ببطء."
- "رجل يغني للكاميرا بابتسامة مسترخية، وكتفاه يتمايلان برفق، وإضاءة داخلية ناعمة."
- "يضحك الطفل بين الأسطر ويغني بتعابير واسعة، وبإحساس الكاميرا المحمولة."
- "لقطة هادئة ومستقرة، وحركة رأس محدودة، ورمش طبيعي." (الأفضل للمقاطع الجادة أو تلك الخاصة بالذكرى)
اجعل الأوامر النصية من جملة أو جملتين. صف التعبير وحركة الجسم والكاميرا، واترك الفم للصوت. فالإفراط في توجيه الأمر النصي يميل إلى مقاومة مزامنة الشفاه بدلًا من مساعدتها.
توقع أن تنتظر بضع دقائق لا بضع ثوانٍ. استغرقت أمثلة التوليد المنشورة في صفحة النموذج نحو ثلاث إلى ست دقائق مع تفعيل الوضع السريع، لذا رتّب محاولاتك في طابور واشتغل بشيء آخر أثناء التصيير.
Fabric 1.0 للمقاطع السريعة
لدى Fabric 1.0 صيغة أقصر: ارفع الصورة، وارفع الصوت، واختر 480p للسرعة أو 720p للنسخة النهائية. لا يوجد أمر نصي تكتبه، ما يجعله خيارًا جيدًا عندما تريد مزامنة فم موثوقة ولا شيء آخر. وتقول صفحة النموذج إنه يقرأ الصوت مقطعًا مقطعًا، وإن مثالًا منشورًا جرى تصييره في نحو ثلاث دقائق.
P Video Avatar للنصوص المكتوبة
P Video Avatar يتجاوز خطوة الصوت. اكتب نص الصوت، واختر أحد أكثر من 30 صوتًا، واختر لغة من العشر المتاحة، واضبط الدقة على 720p أو 1080p. استخدم أمر الصوت للنبرة والإيقاع ("دافئ، بطيء، مرح")، وأمر الفيديو لطريقة تصرف الشخص أثناء الكلام. وإذا كان لديك تسجيل بدلًا من ذلك، فارفعه وسيتم تجاوز الصوت المدمج.
أصلح المشكلات المعتادة
تعود معظم النتائج السيئة إلى عدد قليل من الأسباب. استخدم هذا الجدول قبل إعادة أي تشغيل.
| المشكلة | السبب المحتمل | الحل |
|---|
| الفم يتحرك بالكاد | الشفاه مخفية أو صغيرة أو في الظل داخل الصورة | استخدم صورة أوضح يظهر فيها الفم |
| يفشل التوليد فورًا | الصوت أطول من 35 ثانية في Omni Human 1.5 | قصّ الصوت أو قسّمه |
| الشفاه تنحرف عن الإيقاع | مزيج كثيف مع آلات عالية | استخدم صوتًا أنظف أو نسخة أخرى من الأغنية |
| الوجه يتشوه عند دوران الرأس | زاوية حادة أو وجه محجوب | استخدم صورة شخصية أمامية |
| المقطع يبدو جامدًا | لا يوجد توجيه للحركة | أضف أمرًا نصيًا قصيرًا يصف التعبير وحركة الرأس |
| الأسنان أو الشفاه تبدو غريبة | مصدر بدقة منخفضة | ارفع دقة الصورة أولًا، ثم أعد المحاولة |

💡 اختبر بمقطع صغير. شغّل مقطعًا مدته 10 ثوانٍ في الوضع السريع أو بدقة 480p أولًا. إذا تزامنت حركة الفم بشكل جيد وبقي الوجه ثابتًا، فاستخدم التصيير الأطول لإنتاج المقطع الكامل مدته 30 ثانية بجودة أعلى. بذلك توفّر الوقت في كل محاولة فاشلة.
بعض العادات تصنع الفرق بين مقطع يبدو مقبولًا ومقطع يشاركه الناس:
- احتفظ بصورة شخصية واحدة لكل مشروع. الاتساق عبر المقاطع يبني التعرّف.
- طابق المزاج مع الموسيقى. أغنية حزينة فوق صورة مبتسمة تبدو غريبة، لذلك اختر صورة بتعبير مناسب.
- أضف لمسة صوتية خفيفة. لمسة صدى خفيفة على صوت جاف تجعل المقطع النهائي يبدو كأداء حقيقي.
- راقب الثانية الأولى والأخيرة. اقطع أي بداية أو نهاية محرجة في المحرر.
اجعل صورتك تغني اليوم
كل ما في هذا المقال يستغرق وقتًا أقل مما تظن على الأرجح. اختر صورة شخصية واحدة، واكتب أو ولّد مقطعًا أساسيًا مدته 20 ثانية، وشغّل الاثنين عبر Omni Human 1.5 أو Fabric 1.0. لن تكون محاولتك الأولى مثالية، وهذا لا بأس به. أما الثانية، بصورة أفضل وأغنية مقصوصة، فغالبًا ما تكون مثالية.

يجمع Picasso IA سلسلة العمل كلها في مكان واحد: توليد الصور للصورة الشخصية، ونماذج الموسيقى وتحويل النص إلى كلام للصوت، ونماذج مزامنة الشفاه لإحياء الوجه. أنشئ صورة شخصية، وأعطها أغنية، وأرسل النتيجة إلى الشخص الذي صُنعت من أجله. تصفح كل النماذج على picassoia.com/en/all-models وشاهد كيف تبدو أغنية صورتك المفضلة.