كيف تصنع مقدّمين بالذكاء الاصطناعي لفيديوهاتك في دقائق

هل تريد مقدّمًا متقنًا في فيديوهاتك دون توظيف ممثل أو حجز استوديو؟ تعمل أدوات مزامنة الشفاه والأفاتار بالذكاء الاصطناعي على تحريك أي وجه ليلقي نصّك أمام الكاميرا. من عروض المنتجات إلى المحتوى متعدد اللغات، إليك كيفية إنتاج فيديوهات مقدّمين احترافية في دقائق باستخدام أدوات الذكاء الاصطناعي المتاحة الآن.

كيف تصنع مقدّمين بالذكاء الاصطناعي لفيديوهاتك في دقائق
Cristian Da Conceicao
مؤسس Picasso IA

لديك رسالة تريد إيصالها، ومنتج تريد تقديمه، ودورة تريد بيعها. كان ما يفصلك عن فيديو مقدّم متقن هو كاميرا واستوديو وإضاءة جيدة وساعات من المونتاج. أما اليوم فلم يعد أيٌّ من ذلك ضروريًا.

تتيح لك تقنية المقدّمين بالذكاء الاصطناعي أن تأخذ صورة واحدة، وتقرنها بتسجيل صوتي أو نص مكتوب، لتنتج فيديو لشخص واقعي يُلقي رسالتك. تتحرك الشفاه، ويتفاعل الوجه، ويتزامن التوقيت مع الصوت بدقة تكاد تبلغ مستوى الإطار الواحد. ما كان يتطلب يوم إنتاج كامل صار يستغرق دقائق.

يشرح هذا المقال بالتفصيل كيف تعمل هذه التقنية، وأي النماذج تقدّم أفضل النتائج، وكيف يمكنك أن تبدأ في صنع فيديوهات المقدّمين الخاصة بك اليوم.

ما هو المقدّم بالذكاء الاصطناعي فعلًا؟

المقدّم بالذكاء الاصطناعي فيديو لوجه بشري واقعي يتحدث أمام الكاميرا، حيث أُنشئ الوجه والصوت أو حُرّكا بواسطة الذكاء الاصطناعي بدلًا من تسجيلهما بشكل مباشر. تبدو النتيجة كفيديو تقليدي لشخص يتحدث أمام الكاميرا، لكنها لا تتطلب تصويرًا فعليًا.

لقطة مقرّبة لمقدّمة محترفة تتحدث أمام الكاميرا في استوديو بث

هناك طريقتان مختلفتان، ومعرفة الفرق بينهما مهمة عند اختيار أدواتك.

تحريك الصورة إلى فيديو

تزوّد النموذج بصورة ثابتة (صورة شخصية، أو صورة مقرّبة للرأس، وحتى صورة مولّدة بالذكاء الاصطناعي)، فيحرّك النموذج الوجه ليتطابق مع مسار صوتي. النتيجة فيديو يبدو فيه الشخص الموجود في الصورة وهو يتحدث. هذه أكثر الطرق شيوعًا لأنها تحتاج إلى صورة واحدة وملف صوتي واحد فقط.

توليد الأفاتار الكامل

بدلًا من تحريك صورة، تبني بعض الأدوات أفاتارًا من الصفر وتُصيّره وهو يلقي نصّك. أنت تحدد المظهر والصوت والخلفية. يُصمَّم Avatar IV by HeyGen لهذا الغرض تحديدًا، إذ يُنتج مقدّمًا افتراضيًا مُصيَّرًا بالكامل من صورة، مع هوية ثابتة عبر كل فيديو تصنعه.

كلتا الطريقتين تنتجان فيديو لشخص يتحدث أمام الكاميرا. الفرق يكمن في مصدر الوجه، والخيار بينهما يعتمد على ما إذا كان لديك وجه محدد في ذهنك بالفعل، أم تريد إنشاء وجه من الصفر.

لماذا يتحوّل صنّاع المحتوى إلى المقدّمين بالذكاء الاصطناعي

الأسباب العملية واضحة، لكن يستحق حجم ما يتغير عند إزالة عائق الإنتاج أن يُشرح بوضوح.

مقدّم رجل في استوديو منزلي بمكتب، مع إضاءة حلقية وإعداد ميكروفون

لا حاجة إلى كاميرا ولا إعادة تصوير

صورة شخصية واحدة هي كل ما يلزم كمدخل. تعمل صورة شخصية جيدة التُقطت قبل ثلاث سنوات بشكل مثالي. ويعمل وجه مولّد بالذكاء الاصطناعي أيضًا. لا يحتاج المقدّم إلى الحضور، أو حفظ النصوص، أو إعادة التسجيل لأنه نسي كلمة. عندما يتغيّر النص، غيّر الصوت وأعد التوليد. يبقى الوجه كما هو تمامًا.

الإنتاج بكل اللغات

هنا تتفوق أدوات المقدّمين بالذكاء الاصطناعي فعلًا على الإنتاج التقليدي. يأخذ Video Translate by HeyGen فيديو موجودًا ويعيد دبلجته إلى أكثر من 150 لغة، مع مزامنة حركة الشفاه تلقائيًا مع الصوت المترجم الجديد. يتحول فيديو مسجّل واحد إلى حملة عالمية دون أي تصوير إضافي.

التوسع دون تكلفة متناسبة

ينمو الإنتاج التقليدي للفيديو بشكل خطي: كلما زادت الفيديوهات زادت ساعات الاستوديو، وأتعاب المقدّمين، وساعات المونتاج. أما إنتاج المقدّمين بالذكاء الاصطناعي فلا يتوسع بهذه الطريقة. بمجرد أن تضبط سير عملك، يتطلب إنتاج 50 فيديو مقدّمًا تقريبًا الجهد نفسه لكل وحدة كما يتطلب إنتاج 5. بالنسبة لعمليات المحتوى كبيرة الحجم (منصات التعلم الإلكتروني، وكتالوجات المنتجات، وفرق وسائل التواصل الاجتماعي) يُعد هذا الفرق كبيرًا.

مخرجات متسقة في كل مرة

المقدّمون البشريون لهم أيام مزاج سيئ، أما المقدّمون بالذكاء الاصطناعي فلا. يحمل كل فيديو الطاقة نفسها، والإطار نفسه، والإيقاع نفسه في الإلقاء. وبالنسبة لتناسق العلامة التجارية عبر مكتبة محتوى كبيرة، لهذه الموثوقية قيمة حقيقية. يبدو المقدّم متطابقًا في فيديو أُنتج اليوم وفيديو أُنتج بعد ستة أشهر.

يستحق المعرفة: يعمل المقدّمون بالذكاء الاصطناعي بأفضل شكل مع المحتوى المكتوب مسبقًا والموجَّه مباشرة إلى الكاميرا. أما أي محتوى يتطلب أداءً جسديًا حقيقيًا، أو ارتجالًا، أو تفاعلًا مباشرًا مع الجمهور، فيظل يستفيد من شخص حقيقي.

النماذج التي تقدّم النتائج فعلًا

ليست كل أدوات مزامنة الشفاه والأفاتار بالجودة نفسها. بعضها سريع لكنه خشن بعض الشيء، وبعضها أبطأ لكنه ينتج مخرجات قريبة من جودة البث. إليك تفصيل للخيارات الرئيسية المتاحة الآن.

صانع محتوى يحرّر خط زمن فيديو على إعداد احترافي بشاشتين

أدوات مزامنة الشفاه: تحريك أي وجه

تأخذ هذه النماذج صورة أو فيديوًا موجودًا، وتزامن حركة الشفاه مع مسار صوتي. يبقى الوجه متسقًا مع صورتك الأصلية طوال الفيديو.

النموذجأفضل استخدامالسرعة
Omni Human 1.5تحريك واقعي من صورة واحدةمتوسطة
Lipsync Precisionمزامنة دقيقة إطارًا بإطارمتوسطة
Lipsync Speedتسليم سريع للمسوداتسريعة
Lipsync 2 Proجودة مزامنة بمستوى احترافيمتوسطة
React 1إعادة مزامنة لقطات فيديو موجودةمتوسطة
Kling Lip Syncمطابقة الشفاه في أي فيديوسريعة
P Video Avatarأفاتار متحدث من صورةسريعة
Fabric 1.0من صورة إلى فيديو متحدثسريعة
Pixverse Lipsyncمقاطع سريعة لوسائل التواصل الاجتماعيسريعة

أدوات الأفاتار وتحريك الشخصيات

تذهب هذه الأدوات أبعد، فتُنشئ شخصيات متحركة بالكامل، أو تولّد حركة تعبيرية عبر تسلسلات فيديو أطول.

  • Dreamactor M2.0 يحرّك أي شخصية بحركة جسدية مفصّلة، وهو مفيد عندما تريد حركة تتجاوز الرأس المتحدث الثابت.
  • Kling Avatar v2 يحوّل أي وجه إلى مقدّم فيديو بتعابير دقيقة طبيعية وحركة رأس طبيعية.
  • Video Agent by HeyGen يأخذ أمرًا نصيًا وينتج فيديو مقدّم متقنًا مكتملًا بتعليق صوتي، ولقطات b-roll، وانتقالات. وهو من الأدوات القليلة التي تتعامل مع بنية الفيديو كاملة، لا مع تحريك الوجه وحده.
  • Avatar IV يتيح لك إنشاء أفاتار متحدث مخصص من صورة واحدة، وهو مثالي لبناء هوية مقدّم متسقة للعلامة التجارية.

كيفية استخدام Omni Human 1.5 على PicassoIA

Omni Human 1.5 من ByteDance هو أحد أكثر نماذج مزامنة الشفاه من الصورة إلى الفيديو قدرة المتاحة. ينتج تحريكًا واقعيًا للوجه من صورة ثابتة واحدة متطابقًا مع مسار صوتي. إليك سير العمل الكامل من البداية حتى تصدير الفيديو.

لقطة مقرّبة جدًا لفم امرأة وفكها أثناء الكلام، مع ميكروفون استوديو في المقدمة

الخطوة 1: جهّز صورتك الشخصية

يجب أن تستوفي صورتك المصدر هذه المعايير:

  • صورة أمامية أو بزاوية خفيفة يظهر فيها الوجه بوضوح
  • إضاءة متساوية على الوجه دون ظلال كثيفة في جانب واحد
  • حد أدنى 512x512 بكسل (الدقة الأعلى تنتج تحريكًا أوضح)
  • أن يشغل الوجه 40% على الأقل من الإطار لأفضل رصد لملامح الوجه

إذا لم تكن لديك صورة مناسبة، فولّدها أولًا باستخدام أي نموذج لتحويل النص إلى صورة على PicassoIA. يمنح وجهٌ مولّد بالذكاء الاصطناعي بإضاءة محايدة وخلفية بسيطة النموذجَ ظروف إدخال مثالية.

الخطوة 2: جهّز الصوت

لديك خياران لمسار الصوت:

  1. سجّل صوتك بنفسك: يعمل التسجيل النظيف في غرفة هادئة بميكروفون مناسب بشكل جيد. تجنّب الغرف ذات الجدران الصلبة التي تُحدث صدى. صدّره بصيغة MP3 أو WAV.
  2. ولّده بتحويل النص إلى كلام: يقدم PicassoIA نماذج لتحويل النص إلى كلام تحوّل نصّك المكتوب إلى صوت طبيعي. هذا يعني أن سير عملك كله يبقى في مكان واحد، وتصبح المراجعات فورية.

ملاحظة مهمة: ارفع مسار الصوت وحده. لا تضمّن موسيقى خلفية في ملف الصوت الذي ترفعه. يقرأ النموذج الموجة الصوتية كاملة ليقود حركة الشفاه، وستنتج ترددات الموسيقى أشكالًا غير صحيحة للشفاه.

الخطوة 3: شغّل النموذج

  1. افتح Omni Human 1.5 على PicassoIA
  2. ارفع صورتك الشخصية في حقل إدخال الصورة
  3. ارفع ملف الصوت النظيف
  4. اضبط شدة الحركة على 0.5 للحركة الطبيعية؛ ارفعها إلى 0.7 لتحريك أكثر تعبيرًا مع حركة أوضح للرأس
  5. اضبط دقة الإخراج على 720p للمقاطع الاجتماعية أو 1080p للمخرجات الاحترافية
  6. ابدأ التوليد

تستغرق المعالجة من 60 إلى 120 ثانية تقريبًا حسب طول الصوت.

الخطوة 4: راجع وحسّن

شاهد المخرجات وتحقق من:

  • تطابق حركات الشفاه مع الحروف الساكنة والمتحركة بشكل صحيح طوال الصوت
  • وميض طبيعي وحركات دقيقة للرأس بين الجمل
  • عدم وجود تشوهات حول الفك أو خط الشعر أو الرقبة

إذا بدت المزامنة غير دقيقة قليلًا على مقاطع صوتية محددة، فأعد التوليد بتغيير قيمة البذرة. وإذا بدت حركة الشفاه جامدة أو آلية، فارفع معامل الحركة. أما النصوص الأطول من 90 ثانية فقسّم الصوت إلى مقاطع مدة كل منها 30 ثانية، وولّدها بشكل منفصل، ثم ادمج المقاطع في أي برنامج مونتاج فيديو قياسي.

نصيحة: للحصول على أكثر النتائج طبيعية، اختر صوتًا يتوقف فيه المتحدث لحظات قصيرة بين الجمل. تمنح هذه الوقفات الطبيعية للتنفس النموذجَ حدودًا واضحة بين العبارات، وتنتج جودة مزامنة أفضل بشكل عام.

اختيار الصوت المناسب لمقدّمك

لا يكون فيديو المقدّم بالذكاء الاصطناعي مقنعًا إلا بقدر الصوت الذي يقف خلفه. يُقاد تحريك الوجه بالموجة الصوتية، لذلك يعطي الصوت الطبيعي نتائج أفضل في حركة الشفاه من الصوت المسطح الآلي.

منظر علوي من الجو لمساحة عمل إبداعية، فيها جهاز لوحي ودفتر وكوب قهوة على مكتب من خشب البلوط

تحوّل نماذج تحويل النص إلى كلام في PicassoIA النص المكتوب إلى صوت يبدو بشريًا، بإيقاع وتنغيم طبيعيين. الميزة مقارنة بتسجيل صوتك بنفسك: يمكنك تعديل النص وإعادة توليد الصوت خلال ثوانٍ دون إعادة تسجيل أي شيء. غيّر جملة، وأعد توليد الصوت، وأعد تشغيل مزامنة الشفاه. تستغرق دورة المراجعة كاملة أقل من دقيقتين، ولا تُتلف أي عمل سابق.

بالنسبة للمحتوى الدولي، يتكامل Video Translate بقوة مع أي سير عمل لمزامنة الشفاه. بمجرد أن يكون لديك فيديو مقدّم بالإنجليزية، تعيد أداة الترجمة دبلجته إلى لغة أخرى وتعيد مزامنة حركة الشفاه تلقائيًا مع الصوت الجديد. سير إنتاج واحد يتوسع إلى كل سوق تحتاجه، دون أي تصوير إضافي.

تركيبة مفيدة لصنّاع المحتوى ذوي الحجم الكبير: استخدم Lipsync Speed لمراجعات المسودات السريعة حيث تتحقق من النص والإيقاع، ثم أعد تشغيل النسخة النهائية عبر Lipsync Precision أو Lipsync 2 Pro للنسخة المنشورة. يوفّر هذا نقاط التوليد مع الاستمرار في تقديم مخرجات متقنة في النهاية.

حالات استخدام من الواقع

تعمل فيديوهات المقدّمين بالذكاء الاصطناعي عبر مجموعة واسعة من صيغ المحتوى. إليك الحالات التي تحقق فيها أعلى قيمة عملية.

سيدة أعمال واثقة تقدّم عرضًا أمام شاشة عريضة في قاعة اجتماعات مؤسسية

عروض المنتجات وفيديوهات التسويق

يقدّم متحدث المنتج، ويستعرض الميزات، ويوجّه الدعوة إلى الإجراء. يتطلب الإنتاج التقليدي لهذا الشكل حجز مقدّم واستوديو ومشغّل كاميرا. أما مع المقدّم بالذكاء الاصطناعي فتكتب النص، وتختار الوجه، ويصبح لديك فيديو خلال 10 دقائق. وعندما يتغير المنتج، تحدّث النص وتعيد توليد الأجزاء التي تغيّرت فقط.

التعلم الإلكتروني والتدريب المؤسسي

تستفيد الدورات الإلكترونية كثيرًا من وجه مقدّم متسق عبر كل وحدة. الدورات التي كانت تتطلب من المقدّم إعادة التسجيل كلما حُدِّث المحتوى أصبحت تُراجَع الآن بإعادة توليد جزء صوتي واحد وإعادة تشغيل مزامنة الشفاه. ولا يمكن أن يظهر مدرّب متطابق عبر دورة من 40 وحدة سُجّلت على مدى 12 شهرًا إلا بالمقدّمين بالذكاء الاصطناعي.

محتوى قصير لوسائل التواصل الاجتماعي

تحتاج الفيديوهات القصيرة على المنصات الاجتماعية عادةً إلى وجه يتحدث. تنتج أدوات المقدّمين بالذكاء الاصطناعي مقطعًا لشخص يتحدث من أي نص خلال دقائق. وبالنسبة للفرق التي تدير حسابات اجتماعية متعددة أو تنشر يوميًا، يعني ذلك محتوى متسقًا يقوده مقدّم بحجم يستحيل تحقيقه بجداول التسجيل التقليدية.

يستحق الملاحظة: يناسب Lipsync 2 الفيديو القصير بفضل معالجته السريعة وإخراجه النظيف للمقاطع التي تقل عن 60 ثانية.

المحتوى متعدد اللغات على نطاق واسع

بدلًا من تصوير نسخ منفصلة من الفيديو بكل لغة مستهدفة، تنتج مرة واحدة وتوطّن المحتوى بأدوات مزامنة الشفاه. يتولى Video Translate الترجمة وإعادة المزامنة تلقائيًا. يمكن لفيديو مقدّم واحد أن يخدم 10 أسواق إقليمية دون أي تكلفة إنتاج إضافية.

ما الذي يؤثر في جودة المخرجات

صانع فيديو رجل يسجّل في كابينة بودكاست بألواح عزل صوتي من الإسفنج وإضاءة صندوق ناعمة من الأعلى

ليس كل فيديو مقدّم بالذكاء الاصطناعي يبدو متقنًا من المحاولة الأولى. تؤثر هذه العوامل بشكل مباشر في النتيجة:

جودة الصورة المصدر

  • الصور ذات الدقة الأعلى تنتج تحريكًا أوضح وأكثر تفصيلًا
  • الإضاءة المتساوية على الوجه تتجنب تشوهات الظلال في المخرجات المتحركة
  • تجنّب الإضاءة الجانبية القوية، والفلاتر المنمّقة الكثيفة، والصور التي يكون فيها الوجه مُخفى جزئيًا

وضوح الصوت

  • التسجيلات الصوتية النظيفة الخالية من ضوضاء الخلفية تنتج مزامنة أفضل لحركة الشفاه
  • الأصوات الطبيعية (من تحويل نص إلى كلام عالي الجودة أو من ميكروفون جيد) تنتج حركة وجه أكثر عضوية
  • الوقفات الطبيعية القصيرة بين الجمل تساعد النموذج على التعامل مع التنفس وإعادة ضبط الفم بشكل صحيح

اختيار النموذج

  • النماذج السريعة تضحّي ببعض الدقة مقابل السرعة؛ استخدمها للمسودات ومحتوى وسائل التواصل حيث لا تكون المزامنة شبه المثالية ضرورية
  • تستحق النماذج الدقيقة مثل Lipsync Precision و Lipsync 2 Pro وقت المعالجة الإضافي للمخرجات الاحترافية النهائية

بنية النص

  • النصوص الأقصر والمقسّمة تنتج نتائج أكثر اتساقًا من ملفات صوتية طويلة واحدة
  • النصوص ذات الإيقاع الطبيعي للجمل والنطق الواضح تنتج حركة شفاه أفضل من الجمل المتداخلة أو المفردات التقنية الكثيفة

3 أخطاء يقع فيها الناس في المحاولة الأولى

لقطة مقرّبة جدًا لشاشة هاتف ذكي تعرض فيديو على وسائل التواصل الاجتماعي لمقدّمة تتحدث

استخدام صورة مصدر منخفضة الجودة أو منمّقة. تنتج الصورة المفلترة بكثرة أو صورة الرأس منخفضة الدقة تحريكًا غير واضح وكثير التشوهات. ابدأ بأوضح صورة شخصية طبيعية متاحة لديك. وإذا لم تكن لديك واحدة، فولّد وجهًا واقعيًا باستخدام أي نموذج صور على PicassoIA.

تغذية النموذج بصوت يتضمن موسيقى خلفية. يضمّن بعض المستخدمين موسيقى خلفية أو أصواتًا محيطة في ملف الصوت الذي يرفعونه إلى أداة مزامنة الشفاه. يحلل النموذج الموجة الصوتية كاملة ليقود حركة الشفاه، لا ترددات الصوت وحدها. تربك الموسيقى الخلفية التحليل وتنتج أشكالًا غير صحيحة للشفاه. ارفع مسار الصوت النظيف وحده.

افتراض أن تكون المخرجات الأولى نهائية. كل توليد يحمل تباينًا. قد تنتج عناقيد الحروف الساكنة غير المعتادة أو الإلقاء سريع الإيقاع أشكالًا غير طبيعية للشفاه على كلمة بعينها. تحل إعادة التوليد بقيمة بذرة مختلفة، أو إعادة صياغة جملة واحدة في النص، معظم الحالات خلال محاولة أو اثنتين.

أنشئ أول فيديو مقدّم لك اليوم

سير العمل لفيديو المقدّم بالذكاء الاصطناعي هو: اختر وجهًا، وقدّم صوتًا، وشغّل نموذج مزامنة الشفاه. هذا هو الإجراء كله. لا تحتاج إلى خلفية تقنية، ولا برامج متخصصة، ولا معدات إنتاج.

شابة تشاهد فيديو على تلفاز كبير في غرفة معيشة دافئة

أسرع نقطة بداية هي Omni Human 1.5 على PicassoIA. ارفع صورة شخصية، وسجّل نصًا مدته 30 ثانية، وشاهد ما ينتجه النموذج. ستُظهر لك تلك المخرجات الأولى بالضبط ما هو ممكن اليوم.

ولمزيد من التقدم، ادمج وجهًا مولّدًا بالذكاء الاصطناعي من أي نموذج لتحويل النص إلى صورة مع صوت من أدوات تحويل النص إلى كلام في PicassoIA ونصّك. كل عنصر مولّد بالذكاء الاصطناعي، ومُنتَج في مكان واحد، وجاهز للنشر. دون أي مدخلات من العالم الحقيقي في أي خطوة.

بالنسبة للفرق التي تنتج محتوى بعدة لغات، ادمج Video Translate مع Lipsync Speed للتوطين على نطاق واسع. سير عمل واحد، أسواق كثيرة، دون تصوير إضافي.

النماذج سريعة بما يكفي لتجعل التكرار شبه بلا تكلفة. جرّب وجوهًا مختلفة، وأصواتًا مختلفة، وإعدادات مختلفة لشدة الحركة. وخلال عدد قليل من التوليدات ستجد التركيبة التي تناسب محتواك وجمهورك، ومن تلك النقطة يصبح إنتاج كل فيديو تصنعه أسرع.

يجمع PicassoIA كل هذه الأدوات في منصة واحدة، من توليد الوجوه وتحويل النص إلى كلام إلى مزامنة الشفاه وترجمة الفيديو. إذا كنت تؤجل إضافة مقدّم إلى فيديوهاتك لأن الإنتاج بدا معقدًا أو مكلفًا، فلم يعد ذلك العائق قائمًا.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة