التعليق الصوتي بالذكاء الاصطناعي لبرامج PowerPoint وPremiere Pro وDaVinci Resolve دون ميكروفون

اكتب السيناريو مرة واحدة، وولّد سردًا صوتيًا نظيفًا بصوت ذكاء اصطناعي، ثم أدرجه في PowerPoint أو Premiere Pro أو DaVinci Resolve. تقارن هذه المقالة نماذج الأصوات، وتعرض الإعدادات الدقيقة ومسارات القوائم ومستويات الصوت المستهدفة، ثم تضيف التسميات التوضيحية والدبلجة والصور المرافقة للشرائح لإنهاء المشروع.

التعليق الصوتي بالذكاء الاصطناعي لبرامج PowerPoint وPremiere Pro وDaVinci Resolve دون ميكروفون
Cristian Da Conceicao
مؤسس Picasso IA

يفترض أن يستغرق عرض من عشر شرائح بعد ظهر واحد. أما السرد الصوتي فيستغرق بقية الأسبوع. تسجّل الشريحة 3، فينبح كلب، فتعيد التسجيل، ثم تكتشف نطقًا خاطئًا لاسم منتج في الشريحة 7، فتختلف نبرة الشرائح من 1 إلى 6 عن بقية العرض. التعليق الصوتي بالذكاء الاصطناعي لبرامج PowerPoint و Premiere Pro و DaVinci Resolve يلغي هذه الدائرة المتكررة: تكتب السيناريو مرة واحدة، وتولّد صوتًا نظيفًا لكل شريحة أو مشهد، ثم تضع الملفات في المحرر الذي تستخدمه أصلًا.

تتبع هذه المقالة المسار كاملًا. ستختار نموذج صوت، وتكتب سيناريو يبدو منطوقًا بدلًا من أن يبدو مقروءًا، وتشغّله على PicassoIA، ثم تربط الصوت ببرامج PowerPoint وPremiere Pro وDaVinci Resolve باستخدام مسارات قوائم وإعدادات محددة. والنتيجة سير عمل قابل للتكرار لعروض التدريب ومقاطع YouTube وعروض المنتجات وعروض العملاء، ولا تحتاج أيًّا منها إلى ميكروفون.

اختيار نموذج الصوت المناسب

ليس كل نموذج لتحويل النص إلى كلام مناسبًا لكل مهمة. قد يبدو صوت مثالي في شرح منتج هادئ باهتًا في إعلان قصير ومفعم بالحيوية مدته 30 ثانية. توفر PicassoIA 24 نموذجًا لتحويل النص إلى كلام، لذا فالسؤال المفيد هو أي نموذجين أو ثلاثة تحتاجها فعلًا.

غرفة تسجيل منزلية فارغة مع ميكروفون مكثف مغبّر وألواح عزل صوتي من الإسفنج

النماذج جنبًا إلى جنب

هذه مقارنة بين أكثر الخيارات فائدة للسرد الصوتي للشرائح والفيديو:

النموذجالأنسب لـالسمة البارزة
Speech 2.8 HDسرد الشرائح والدروس والسيناريوهات الطويلةعشرة أنماط عاطفية، وتصدير بصيغتي WAV وFLAC، وعلامات توقف مدمجة، وأكثر من 40 لغة
Speech 2.8 Turboمسودات سريعة وإعادة كتابة سريعةالسرعة أولًا، وهو من عائلة 2.8 HD نفسها
ElevenLabs V3السرد المعبّر وقراءات الشخصياتأكثر من 25 شخصية صوتية، ومنزلقات للأسلوب والثبات
ElevenLabs v2 Multilingualسيناريو واحد بلغات كثيرةأكثر من 30 لغة
Gemini 3.1 Flash TTSالإطلاقات العالمية30 صوتًا، وأكثر من 70 لغة
Qwen3 TTSالأصوات المخصصة أو المستنسخةاستنساخ صوت أو تصميم صوت جديد

اختر نموذجًا واحدًا لكل مشروع والتزم به. فخلط ثلاثة أصوات مختلفة في عرض واحد يجعل المشاهدين ينتبهون إلى الصوت بدلًا من الرسالة.

💡 نصيحة: ولّد الفقرة نفسها المكوّنة من 20 ثانية بثلاثة نماذج، وشغّلها متتالية على سماعات الرأس، ثم اختر قبل أن تلمس السيناريو الحقيقي. خمس دقائق هنا توفر إعادة تصيير كاملة لاحقًا.

استنساخ صوتك الخاص

إذا كان يجب أن يبدو العرض بصوتك، أو بصوت المتحدث باسم شركتك، فإن Voice Cloning ينشئ صوتًا مخصصًا يمكن إعادة استخدامه. ويُدرج معرّف الصوت الذي يعيده مباشرةً في Speech 2.8 HD، فتحافظ كل شريحة لاحقة على النبرة نفسها. ويقدم Qwen3 TTS مسارًا مشابهًا إذا كنت تفضّل تصميم صوت من وصف نصي. واستنسخ فقط الأصوات التي تملكها أو التي حصلت على إذن كتابي لاستخدامها.

سماعات استوديو موضوعة على مكتب من خشب الجوز بجانب دفتر مكتوب بخط اليد

اكتب سيناريو يبدو منطوقًا

يقرأ تحويل النص إلى كلام ما تعطيه له حرفيًا. السيناريو المكتوب للعين ينتج سردًا جامدًا، لذا عدّله للأذن قبل أن تولّد أي شيء.

منظر علوي لمكتب من خشب البلوط عليه سيناريو مطبوع وحاسوب محمول وقهوة وساعة توقيت

الأرقام والاختصارات والتوقفات

بعض العادات البسيطة تعالج معظم اللحظات الآلية:

  • اجعل الجمل قصيرة. استهدف بين 15 و20 كلمة. إذا ضاق نفسك وأنت تقرأ بصوت عالٍ، فسيبدو النموذج مستعجلًا أيضًا.
  • اكتب المصطلحات الصعبة كما تُنطق. اكتب "S Q L" إذا أردت الحروف، و"sequel" إذا أردت كلمة.
  • فعّل English Normalization في Speech 2.8 HD عندما يحتوي السيناريو على تواريخ أو أسعار أو أرقام كبيرة.
  • أضف علامات التوقف. كتابة <#0.5#> تُدرج نصف ثانية من الصمت، وهي مثالية مباشرة بعد تغيير الشريحة.
  • اقرأه بصوت عالٍ مرة واحدة بنفسك. أي شيء يجعلك تتعثر سيجعل النموذج يتعثر أيضًا.

يسير السرد بسرعة تقارب 150 كلمة في الدقيقة، أي نحو 2.5 كلمة في الثانية. استخدم هذا الجدول لتحديد حجم كل شريحة قبل أن تكتبها:

مدة الشريحة أو المشهدعدد الكلمات المستهدف
10 ثوانٍنحو 25 كلمة
20 ثانيةنحو 50 كلمة
30 ثانيةنحو 75 كلمة
60 ثانيةنحو 150 كلمة

ملف واحد لكل شريحة أو مشهد

ولّد كل شريحة كملف صوتي مستقل، وسمّها بالترتيب: slide-01.wav، slide-02.wav، وهكذا. عندما يغيّر العميل صياغة الشريحة 6، تعيد توليد ملف واحد فقط بدلًا من إعادة تصيير السرد كاملًا، وتحافظ كل شريحة أخرى على توقيتها الدقيق. ينطبق المبدأ نفسه على الفيديو: ملف واحد لكل مشهد، بما يتطابق مع ترتيب المخطط الزمني.

استخدم Speech 2.8 HD على PicassoIA

يُعد Speech 2.8 HD النموذج الأساسي في هذا السير لأنه يصدّر صوتًا دون فقدان، ويدعم التوقفات المدمجة، ويمنحك تحكمًا مباشرًا في العاطفة والسرعة.

يد على لوحة اللمس لحاسوب محمول مع محرر موجات صوتية على الشاشة

الخطوة 1: الصق السيناريو

افتح صفحة النموذج والصق سرد الشريحة الواحدة في حقل Text. تقبل كل مرة تشغيل ما يصل إلى 10,000 حرف، وهو أكثر بكثير مما تحتاجه أي شريحة. أضف علامات التوقف الآن.

الخطوة 2: اضبط الصوت والعاطفة والسرعة

هذه هي الإعدادات المهمة للحصول على صوت جاهز للمحرر:

الإعدادالقيمة الموصى بهاالسبب
Voice IDWise_Woman (الافتراضي) أو صوت شرح مثل English_Explanatory_Manأداء واضح وثابت
Emotioncalm أو neutral للتدريب، وauto للتسويقيحافظ على نبرة متسقة
Speedمن 0.95 إلى 1.05النطاق المسموح من 0.5 إلى 2.0، لكن التغييرات الصغيرة تبدو طبيعية
Pitch0النطاق من ناقص 12 إلى زائد 12 نصف نغمة
Language boostEnglish أو Automaticيساعد على الأسماء والمصطلحات الأجنبية
English normalizationمفعّل للأرقام والتواريخيضيف قدرًا بسيطًا من التأخير
Audio formatWAVدون فقدان، ومقبول في كل محرر
Sample rate44100أعلى خيار متاح
Channelmonoالصوت الواحد يحتاج قناة واحدة
Subtitle enableمفعّل إذا أردت التسميات التوضيحيةيعيد الطوابع الزمنية على مستوى الجملة

الخطوة 3: ولّد واستمع ثم نزّل

شغّل النموذج، ثم استمع عبر سماعات الرأس. غيّر إعدادًا واحدًا في كل مرة: إذا بدا السطر متحمسًا أكثر من اللازم، فبدّل العاطفة قبل أن تلمس السرعة. وعندما يبدو الصوت صحيحًا، نزّل الملف وأعد تسميته بما يطابق شريحته.

تظهر ثلاثة أخطاء مرارًا وتكرارًا. توليد عرض كامل كملف طويل واحد يجعل التعديلات اللاحقة مؤلمة. ودفع السرعة إلى 1.3 لتناسب شريحة مزدحمة يجعل الصوت مستعجلًا، لذا اقطع الكلمات بدلًا من ذلك. وتجاهل الاستماع عبر سماعات الرأس يسمح لأخطاء النطق الصغيرة بالوصول إلى التصدير النهائي. امنح كل شريحة دقيقة إضافية، فتبقى مرحلة التحرير سلسة.

💡 نصيحة لـ ElevenLabs V3: يحتوي ElevenLabs V3 على حقلين هما Previous Text وNext Text. الصق الشريحة السابقة والشريحة التالية، وسيعدّل النموذج التنغيم عند الحدود، فينساب الصوت من شريحة إلى أخرى.

التعليق الصوتي بالذكاء الاصطناعي في PowerPoint

تعد PowerPoint أسرع مكان لرؤية النتيجة. يمكن مشاركة العرض المسرود كفيديو، أو تشغيله في كشك معلومات، أو إرساله إلى أشخاص لن ينضموا إلى مكالمة مباشرة أبدًا.

مقدّم عرض بجانب شاشة عرض في قاعة اجتماعات مضيئة

إرفاق الصوت بكل شريحة

  1. حدّد الشريحة الأولى في جزء الصور المصغرة.
  2. اختر Insert، ثم Audio، ثم Audio on My PC واختر slide-01.wav.
  3. في تبويب Playback، اضبط Start على Automatically، وفعّل Hide During Show حتى لا يظهر رمز المتحدث.
  4. انقر Trim Audio لقراءة المدة الدقيقة للمقطع.
  5. في تبويب Transitions، فعّل After ضمن Advance Slide، واكتب تلك المدة مع إضافة نصف ثانية من الفسحة.
  6. كرر الخطوات لكل شريحة.

يبدأ الصوت الآن تلقائيًا، وتنتقل الشريحة عندما تنتهي الجملة. لا حاجة إلى أي نقر أثناء التشغيل. وإذا كانت الشريحة تحتوي على حركات، فاضبطها على Start: After Previous حتى يتزامن تسلسل الظهور مع الصوت بدلًا من انتظار النقر.

💡 نصيحة: بالنسبة للعروض التي تنتقل عبر البريد الإلكتروني، صدّر السرد من Speech 2.8 HD بصيغة MP3 بمعدل 128 kbps بدلًا من WAV. يبقى الملف صغيرًا، ولن يلاحظ أحد الفرق على سماعات الحاسوب المحمول.

تصدير فيديو مسرود

انتقل إلى File، ثم Export، ثم Create a Video. اختر Full HD (1080p)، واترك Use Recorded Timings and Narrations محددًا، ثم انقر Create Video. تحترم PowerPoint توقيتات الانتقال التي كتبتها، لذا يتطابق الفيديو مع الصوت ثانية بثانية.

التعليق الصوتي بالذكاء الاصطناعي في Premiere Pro

في مونتاج الفيديو يكون الصوت هو المرتكز. لا يتغير إيقاع الصوت الناتج بالذكاء الاصطناعي بين اللقطات، لذا يمكنك تثبيت السرد أولًا ثم قص الصور لتتوافق معه.

محرر فيديو يُرى من الخلف أمام إعداد شاشتين مع مخطط زمني متعدد المسارات

الاستيراد والمزامنة مع المخطط الزمني

  1. اضغط Ctrl+I (وCmd+I على Mac) واستورد كل ملفات الصوت إلى مجلد اسمه VO.
  2. اسحب scene-01.wav إلى A1 في بداية التسلسل، ثم ضع الملفات التالية واحدًا تلو الآخر.
  3. استخدم أداة Razor (C) والحذف مع الإزاحة (ripple delete) لتقليص أي فجوة أطول مما تريد.
  4. اضغط M على الكلمات الدقيقة التي يجب أن تتغير عندها الصورة، ثم قص اللقطات وفق هذه العلامات.

يحوّل Premiere ملفات 44.1 kHz تلقائيًا لتتوافق مع تسلسل 48 kHz، لذا لا تحتاج إلى إعادة أخذ العينات يدويًا.

التنظيف باستخدام Essential Sound

افتح Window، ثم Essential Sound، وحدّد مقاطع الصوت، ثم انقر Dialogue. ضمن Loudness، اضغط Auto-Match. ضع الموسيقى على مسار مستقل، وصنّفها على أنها Music، وفعّل Ducking مقابل مقاطع الحوار حتى تنخفض الموسيقى كلما تحدث الصوت. وإذا بدا أي صوت للحرف S حادًا، فأضف تأثير DeEsser إلى مسار الصوت.

المسارالمحتوىالهدف
A1التعليق الصوتي بالذكاء الاصطناعيمصنّف كـ Dialogue، مع Auto-Match
A2الموسيقىمصنّف كـ Music، ومخفوض تحت A1
A3المؤثرات الصوتيةمنخفضة في المزج، ولا تطغى على الصوت أبدًا
المزج النهائيالتسلسل كاملًاحوالي ناقص 14 LUFS لفيديو الويب

💡 نصيحة: إذا كان سطر واحد يبدو خاطئًا، فلا تصلحه بالإضافات. عدّل النص، وأعد توليد ذلك الملف الواحد بالإعدادات نفسها، واستبدله على المخطط الزمني. يستغرق ذلك وقتًا أقل من تصحيحه بالأذن.

التعليق الصوتي بالذكاء الاصطناعي في DaVinci Resolve

يكافئ Resolve النهج نفسه. ثبّت الصوت أولًا، ثم ابنِ كل شيء آخر حوله. النسخة المجانية من Resolve كافية لكل خطوة أدناه.

يدان تضبطان أزرار التحكم في جهاز مزج صوتي مدمج

بناء المونتاج في صفحة Edit

  1. اضغط Ctrl+I أو اسحب ملفات الصوت إلى Media Pool.
  2. في صفحة Edit، أفلت كل ملف على Audio 1 بحسب ترتيب المشاهد.
  3. اضغط B لأداة Blade لقص الصمت في بداية كل مقطع ونهايته، ثم أغلق الفجوات بالحذف مع الإزاحة (ripple delete).
  4. اضغط M لوضع علامات المخطط الزمني عند الكلمات التي يجب أن تتغير عندها الصورة.

يعيد Resolve أخذ العينات لملفات 44.1 kHz إلى المخطط الزمني 48 kHz بنفسه.

موازنة المستويات في Fairlight

انتقل إلى صفحة Fairlight. انقر بزر الفأرة الأيمن على مقاطع الصوت واختر Normalize Audio Levels حتى يصل كل مشهد إلى مستوى الصوت نفسه. تحقق من النتيجة على عداد مستوى الصوت، واضبط ناقل Main 1 حتى يقترب المخطط الزمني النهائي من ناقص 14 LUFS للتسليم على الويب. أما الموسيقى، فإما أن تتحكم بمستواها يدويًا عبر الأتمتة، أو تستخدم ضاغطًا على مسار الموسيقى مع الصوت كمصدر للتحكم الجانبي (side-chain).

هذه مقارنة الأدوات الثلاث في المهام نفسها:

المهمةPowerPointPremiere ProDaVinci Resolve
استيراد الصوتInsert، Audio، Audio on My PCFile، ImportFile، Import، Media
أفضل صيغة ملفMP3 بمعدل 128 kbpsWAVWAV
طريقة التوقيتAdvance Slide، Afterأداة Razor والحذف مع الإزاحةأداة Blade والحذف مع الإزاحة
مطابقة المستوياتمستوى تشغيل الصوتEssential Sound، Auto-MatchNormalize Audio Levels في Fairlight
التصديرCreate a VideoExport (Ctrl+M)صفحة Deliver

التسميات التوضيحية والدبلجة والصور

التعليق الصوتي ليس سوى جزء من العمل النهائي. السيناريو نفسه يغذي التسميات التوضيحية والترجمات والصور على الشاشة.

امرأة ترتدي سماعات تستمع في مساحة عمل مشتركة مضيئة مع حامل ثلاثي في المقدمة

تسميات ودبلجة من سيناريو واحد

للتسميات التوضيحية، فعّل بيانات الترجمة النصية في Speech 2.8 HD للحصول على طوابع زمنية على مستوى الجملة، أو شغّل الصوت النهائي عبر GPT-4o Transcribe للحصول على نص مكتوب، ثم ادمج التسميات في مقطع مصدّر باستخدام Autocaption.

بالنسبة للغات الأخرى، هناك مساران نظيفان:

  • أعد توليد الصوت. ترجم السيناريو، واحتفظ بالإعدادات نفسها، ثم شغّله مرة أخرى عبر Gemini 3.1 Flash TTS أو ElevenLabs v2 Multilingual.
  • ادبلج الفيديو النهائي. يترجم ElevenLabs Dubbing الفيديو إلى أكثر من 90 لغة في مرور واحد.

لإضافة مسار صوتي جديد إلى ملف MP4 موجود دون فتح محرر، يستبدل Video Audio Merge المسار الصوتي أو يمزجه معه.

صور الشرائح ولقطات B-Roll الثابتة

السرد الرائع فوق صور ضعيفة يخسر الجمهور مع ذلك. ولّد صورًا فوتوغرافية ثابتة لشرائحك ولقطات التقطيع باستخدام نموذج لتحويل النص إلى صورة: P Image سريع للمسودات، بينما يناسب Seedream 4.5 وFLUX.2 Pro الصور الرئيسية. صف العدسة والإضاءة وملامح الأسطح، واضبط النسبة على 16:9 حتى تملأ الصورة الشريحة أو إطار المخطط الزمني دون قص.

مصمم يثبّت صورًا مطبوعة على جدار أبيض كلوحة مزاج بصرية

جرّبه في مشروعك القادم

اختر العرض أو الفيديو الذي كنت تؤجل تسجيله. الصق شريحته الأولى في Speech 2.8 HD على Picasso IA، واضغط تشغيل، ثم أفلت الملف في PowerPoint أو Premiere Pro أو DaVinci Resolve. بعد ذلك، ولّد الشريحة التالية بصوت مختلف وقارن. وبحلول الملف الثالث ستعرف أي صوت يناسب محتواك، وأي إعدادات لن تحتاج إلى لمسها مرة أخرى.

كل ما في هذا السير موجود في مكان واحد: الأصوات، والتفريغ النصي، والتسميات التوضيحية، والدبلجة، وتوليد الصور. تصفح الكتالوج الكامل على picassoia.com/en/all-models، واختبر صوتين أو ثلاثة على سيناريوك الخاص، ودع عرضك القادم يسرد نفسه.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة