AI Voice Generator Free: تحويل النص إلى كلام وأصوات الشخصيات

قارن مولّدات الصوت المجانية بالذكاء الاصطناعي التي تستحق التجربة في تحويل النص إلى كلام وأصوات الشخصيات. تعرّف على طريقة تعامل Speech 2.8 HD و ElevenLabs V3 و Gemini 3.1 Flash TTS و Qwen3 TTS و Chatterbox مع السرد والمشاعر وتصميم الصوت واستنساخه، مع إعدادات يمكنك نسخها.

AI Voice Generator Free: تحويل النص إلى كلام وأصوات الشخصيات
Cristian Da Conceicao
مؤسس Picasso IA

لديك نص، وموعد تسليم، ولا يوجد ميكروفون تثق به. وربما لديك أيضًا شخصية ثعلب تحتاج إلى صوت خشن، أو عرض توضيحي لمنتج يبدو أفضل منطوقًا منه مكتوبًا. مولّد الصوت بالذكاء الاصطناعي يسد هذه الفجوة: تلصق النص، وتختار صوتًا، فيعود إليك ملف صوتي جاهز خلال ثوانٍ. تحسّنت أدوات الصوت المجانية بشكل ملحوظ خلال العام الماضي، والفرق بين قراءة آلية مسطحة وأداء مقنع يعتمد الآن على النموذج الذي تختاره والإعدادات التي تعدّلها. يقارن هذا المقال نماذج تحويل النص إلى كلام التي تستحق التجربة، ويشرح كيف تُبنى أصوات الشخصيات فعلًا، ويمرّ على نموذج واحد خطوة بخطوة حتى تسجّل أول تسجيل لك اليوم.

💡 الإجابة السريعة: للسرد العادي، استخدم Speech 2.8 HD. للأداء التعبيري، جرّب ElevenLabs V3. لصوت تبتكره من وصف مكتوب، استخدم Qwen3 TTS.

كيف تعمل مولّدات الصوت بالذكاء الاصطناعي

من النص إلى الصوت

يحوّل نموذج تحويل النص إلى كلام كلماتك إلى صوت في ثلاث خطوات تقريبية. أولًا يحوّل النص إلى وحدات صوتية (phonemes)، وهي وحدات الأصوات الصغيرة في اللغة. ثم يتنبأ بالطريقة التي سيؤدّي بها إنسان هذه الكلمات: أين يتوقف، وأي مقطع يُشدَّد، وكيف يرتفع الصوت في نهاية السؤال. وأخيرًا يصيّر موجة صوتية يمكنك تشغيلها وتنزيلها وإدراجها في برنامج المونتاج.

كانت الأنظمة القديمة تجمع شظايا صوتية مسجّلة صغيرة، ولهذا كانت متقطعة وآلية. أما النماذج العصبية الحديثة فتولّد الأداء كله دفعة واحدة، فيمتد التنفس والإيقاع والمشاعر عبر الجملة كاملة بدلًا من أن تعيد الضبط عند كل كلمة.

شاب يرتدي هودي رمادي يكتب نص تعليق صوتي على حاسوب محمول على مكتب خشبي في ضوء صباحي هادئ

تعتمد صيغة الإخراج على النموذج. فمثلًا يصدّر Speech 2.8 HD بصيغ MP3 وWAV وFLAC أو PCM الخام، لذلك يصلح التوليد نفسه لمقطع سريع على وسائل التواصل أو لمونتاج دون فقدان في الجودة.

لماذا تختلف الأدوات المجانية

المجاني لا يعني المتطابق. هناك أربعة عوامل تفصل مولّدًا عن آخر:

  • مكتبة الأصوات: يقدّم Gemini 3.1 Flash TTS 30 صوتًا، بينما يعرض ElevenLabs V3 أكثر من 25 شخصية صوتية.
  • نطاق اللغات: قد يتعامل نموذج مع 10 لغات، وآخر مع أكثر من 70 لغة.
  • ضوابط الأداء: إعدادات مسبقة للمشاعر، أو أوامر أسلوب بلغة طبيعية، أو وسوم مضمّنة تحدد الهمس أو الضحك.
  • استنساخ الصوت: هل يمكنك إحضار عينة صوتية خاصة بك بدلًا من الاختيار من قائمة جاهزة.

تصف PicassoIA معظم النماذج أدناه بأنها متاحة للتجربة مجانًا عبر الإنترنت، لذلك يمكنك تمرير الفقرة نفسها عبر عدة نماذج والاحتفاظ بالنموذج الذي يناسبك.

أفضل نماذج تحويل النص إلى كلام المجانية

إليك المقارنة المختصرة قبل التفاصيل. لكل نموذج في الجدول صفحته الخاصة مع عينات من المخرجات.

النموذجأفضل استخدامعناصر التحكم المميزةاللغات
Speech 2.8 HDالسرد الطويل10 مشاعر، والطبقة الصوتية، والسرعة، وعلامات التوقفأكثر من 40 تلميحًا للغة
ElevenLabs V3القراءات التعبيريةشريط الأسلوب، والثبات، ورفع التشابهيُحدَّد برمز اللغة
Gemini 3.1 Flash TTSنطاق اللغات30 صوتًا، ووسوم مضمّنة، وأمر الأسلوبأكثر من 70 رمز لغة
Play Dialogمشاهد لشخصين15 صوتًا، ووضع الصوتينقرابة 40
Qwen3 TTSالأصوات المبتكرة والمستنسخة3 أوضاع، و9 متحدثين جاهزين10

يعتمد الاختيار الصحيح على المهمة. إذا كان الصوت هو المنتج نفسه، مثل فصل من كتاب مسموع أو درس تعليمي، فأعطِ الأولوية للثبات وحدود الإدخال الطويلة. وإذا كان الصوت لحظة لشخصية، فأعطِ الأولوية لضوابط المشاعر والاستنساخ. وإذا كنت تنشر في عدة أسواق، فابدأ بالنموذج الذي يدرج أكبر عدد من اللغات، واختبر كيف ينطق اسم علامتك التجارية قبل أن تعتمد نصًا كاملًا.

Speech 2.8 HD للسرد

يُعد Speech 2.8 HD الخيار الأكثر أمانًا لأي شيء طويل: فيديوهات الشرح، ووحدات الدورات التدريبية، وفصول الكتب المسموعة. يقبل التشغيل الواحد ما يصل إلى 10,000 حرف، أي نحو 1,600 كلمة تقريبًا، لذلك تتسع مقالة كاملة في تسجيل واحد.

إعدادات المشاعر أهم مما يظنه معظم الناس. فالجملة نفسها عند ضبطها على هادئ ثم على متفاجئ تبدو كأنها لمتحدثين مختلفين. الحالات المتاحة هي: تلقائي، وسعيد، وحزين، وغاضب، وخائف، ومشمئز، ومتفاجئ، وهادئ، وسلس، ومحايد.

نقطة القوة الأخرى هي دعم اللغات. يضم الحقل language_boost أكثر من 40 خيارًا، من الإنجليزية والإسبانية إلى اليابانية والعربية والهندية، ويُحسّن النطق عندما يتضمن النص مفردات غير شائعة. اضبطه على Automatic إذا لم تكن متأكدًا، وسيكتشف النموذج اللغة بنفسه.

بودكاستر مبتسم يرتدي قميصًا من الدنيم يتحدث إلى ميكروفون معلّق على ذراع في غرفة ذات ألواح صوتية خضراء داكنة

ElevenLabs V3 للتعبير

يميل ElevenLabs V3 نحو الأداء. يمتد شريط الأسلوب من 0 إلى 1، من السرد العادي إلى ما يقترب من التمثيل، بينما يحافظ إعداد الثبات على أن تبدو الجملة 40 كالجملة 1.

يتيح حقلان اختياريان، هما النص السابق والنص التالي، للنموذج تعديل التنغيم عند حدود الجمل. وهذا مفيد عندما تولّد نصًا طويلًا على أجزاء وتريد أن تختفي الفواصل بينها. وتضم قائمة الأصوات حتى شخصية راوٍ باسم Grimblewood، وهي المستخدمة في مثال قصة التنين الخاص بالنموذج.

Gemini 3.1 Flash للغات

يقدّم Gemini 3.1 Flash TTS 30 صوتًا وأكثر من 70 رمز لغة. وأفضل ميزة فيه هي الترميز المضمّن: اكتب [whispering] أو [laughing] أو [shouting] أو [sigh] مباشرة داخل الجملة فيتغيّر الأداء عند تلك العبارة بالضبط.

يحدد أمر أسلوب منفصل، مثل "تحدّث ببطء وثقة"، النبرة العامة. ويقتصر الإدخال على 4,000 بايت، لذلك قسّم النص الطويل إلى أقسام.

💡 اختبار عادل: اكتب ثلاث جمل: واحدة هادئة، وواحدة متحمسة، وواحدة تحتوي على اسم صعب النطق. مرّر هذه الأسطر نفسها عبر كل نموذج تفكر فيه. ستظهر الفروق خلال ثوانٍ.

أصوات شخصيات تبدو حيّة

صوت الشخصية هو صوت مرتبط بشخصية: العمر، واللهجة، والموقف، وطريقة مميزة في التفاعل. هناك ثلاث طرق عملية لبنائه.

صمّم الصوت بالكلمات

يملك Qwen3 TTS وضع تصميم الصوت حيث تصف المتحدث بلغة بسيطة، ويولّده النموذج من الصفر. يكفي وصف مثل "صوت أنثوي دافئ ودود بلكنة بريطانية خفيفة" للبدء. أضف تعليمات أسلوب مثل "نبرة متحمسة" أو "تحدّث ببطء وهدوء" لتوجيه الأداء.

صيغة موثوقة للأوصاف هي: العمر، ثم النبرة، ثم اللهجة، ثم الإيقاع، ثم المزاج، بهذا الترتيب. فالوصف "محقق متوسط العمر متعب، منخفض الصوت وخشن، إيقاع بطيء، فكاهة جافة" يمنح النموذج خمس تعليمات واضحة بدلًا من صفة غامضة واحدة. شغّل الوصف نفسه على سطرين مختلفين من الحوار للتأكد من أن الصوت يحافظ على ثباته.

هل تفضّل خيارًا جاهزًا؟ يتضمن النموذج نفسه تسعة متحدثين جاهزين: Aiden وDylan وEric وOno_anna وRyan وSerena وSohee وUncle_fu وVivian.

لقطة من زاوية منخفضة لممثلة صوت في منتصف أدائها داخل كابينة تسجيل مبطنة، مع ميكروفون وفلتر حماية من الهواء في المقدمة

استنسخ صوتًا من مقطع

يعني الاستنساخ نقل صوت متحدث حقيقي إلى نص جديد. يتعامل نموذجان مع هذا بشكل جيد:

  • Chatterbox: يستنسخ الصوت من بضع ثوانٍ من الصوت المرجعي، ويضيف شريط مبالغة (0.5 هو الوضع المحايد). يحمل كل ناتج علامة مائية غير مسموعة، فيبقى الصوت قابلًا للتتبع.
  • MiniMax Voice Cloning: يقبل ملفات MP3 أو M4A أو WAV بمدة من 10 ثوانٍ إلى 5 دقائق، مع خيار تقليل الضوضاء، ويعيد معرّف صوت قابل لإعادة الاستخدام.

معرّف الصوت هذا ليس محصورًا في أداة واحدة. يقبل حقل الصوت في Speech 2.8 HD معرّفًا أعاده نموذج الاستنساخ، لذلك يمكن لعينة نظيفة واحدة أن تسرد كل نص تكتبه بعد ذلك. تبدو العينة الجيدة هكذا:

  • متحدث واحد فقط، دون موسيقى أو ضجيج خلفية.
  • غرفة هادئة وناعمة. غرفة نوم بستائر وسرير تتفوق على حمّام مبلّط في كل مرة.
  • إيقاع طبيعي بجمل متنوعة، لا قراءة رتيبة من قائمة.
  • مسافة ثابتة من الميكروفون، نحو عرض كف اليد، طوال التسجيل.

يد امرأة تمسك هاتفًا ذكيًا قرب فمها لتسجيل عينة صوتية قصيرة وهي جالسة على سرير بملاءات بيضاء من الكتان

💡 الإذن أولًا: استنسخ صوتك أنت فقط، أو صوتًا حصلت على إذن كتابي لاستخدامه. ويُعد التسجيل الواضح والقصير لنفسك أفضل عينة، لأنك تتحكم في الغرفة والميكروفون.

شخصيتان في مشهد واحد

صُمم Play Dialog للحوار لا للسرد. اختر صوتين من بين 15 صوتًا، وضع على الأسطر التسميات Voice 1: وVoice 2:، فيؤدي النموذج تبادلًا كاملًا في تشغيل واحد. ويحصل كل صوت أيضًا على أمر أسلوب خاص به. يجمع مشهد العينة في النموذج بين متحدث غاضب وآخر مذنب، ويُسمع التوتر بوضوح.

هل تريد وجهًا يناسب الصوت؟ أنشئ صورة شخصية باستخدام P Image, ثم حرّكها بنموذج مزامنة شفاه مثل Omni Human 1.5 أو Fabric 1.0، اللذين يحوّلان صورة وملف صوتي إلى فيديو متحدث.

استخدم Speech 2.8 HD على PicassoIA

يُعد Speech 2.8 HD أفضل نموذج للبدء لأن إعداداته واضحة وكل واحد منها يؤدي وظيفة واحدة. إليك سير العمل بالتفصيل.

خطوة بخطوة

  1. افتح صفحة Speech 2.8 HD على PicassoIA.
  2. ألصق النص في حقل text. الحد هو 10,000 حرف.
  3. اترك voice_id على القيمة الافتراضية Wise_Woman في أول تجربة، أو ألصق معرّف صوت مستنسخ.
  4. اضبط emotion. أبقِ auto في التشغيل الأول، ثم قارن مع calm أو happy لاحقًا.
  5. عدّل speed (من 0.5 إلى 2.0) وpitch (من ناقص 12 إلى زائد 12 نصف نغمة). القيم المحايدة هي 1.0 و0.
  6. اختر language_boost، إما لغة محددة أو Automatic.
  7. اختر audio_format: MP3 للويب، وWAV أو FLAC للمونتاج. يصل معدل بت MP3 إلى 256 kbps.
  8. ولّد الصوت، واستمع إليه، وغيّر إعدادًا واحدًا، ثم أعد التشغيل.

منظر من الأعلى لمكتب خشبي عليه حاسوب محمول وسماعات استوديو ودفتر وفنجان قهوة، مع أيدٍ فوق الحاسوب

💡 تغيير واحد في كل تشغيل. إذا غيّرت السرعة والطبقة الصوتية والمشاعر معًا، فلن تعرف أيها أصلح المشكلة.

علامات التوقف والمشاعر

يؤدي الصمت دورًا لا يقل عن الكلام. أدرج علامة مثل <#0.5#> في أي موضع من النص لإضافة توقف لمدة نصف ثانية:

Welcome back.<#0.8#> Today we are testing three voices.<#0.4#> Ready?

لقراءة أكثر حيوية بأسلوب YouTube، تقترح صفحة النموذج سرعة 1.2 مع طبقة صوتية زائد 2. وبالنسبة للأرقام والتواريخ في النص الإنجليزي، فعّل english_normalization حتى تُقرأ عبارات مثل "2027" و"3/4" كما يقولها الإنسان. وهذا يضيف قدرًا بسيطًا من التأخير. وفعّل subtitle_enable إذا احتجت أيضًا إلى طوابع زمنية على مستوى الجملة للترجمات.

الإعدادات التي تغيّر الصوت

لقطة مقرّبة جدًاليد تحرّك مفتاح تمرير على لوحة مزج تناظرية بمقابض رمادية وعلامات بيضاء

السرعة والطبقة الصوتية

تغيّر السرعة مدى استعجال الصوت أو استرخائه. وتغيّر الطبقة الصوتية العمر والحجم: فالطبقة المنخفضة توحي بالكبر والثقل، والمرتفعة توحي بالصغر والخفة. استخدم هذه القيم كنقطة بداية، ثم عدّلها بالسمع:

الهدفالسرعةالطبقة الصوتيةالمشاعر
كتاب مسموع هادئ0.90calm
سرد فيديو أكثر حيوية1.2+2auto
شخصية متوترة1.0-3fearful
إعلان منتج سريع1.3+1fluent
راوية مسنّة0.85-4calm

لمستوى الصوت إعداد خاص هو volume، حيث تمثل 1.0 القيمة الافتراضية للكسب. ارفعه فقط إذا كان الصوت خافتًا جدًا تحت خلفية موسيقية، ويفضل تطبيع الصوت في برنامج المونتاج عندما يكون ذلك ممكنًا. أما في المشاريع التي تحتوي على موسيقى، فاختر WAV ومعدل عينات 44,100 Hz حتى لا يُضغط شيء قبل المزج النهائي.

أوامر المشاعر والأسلوب

يطلب كل نموذج المشاعر بطريقة مختلفة، ومعرفة الفرق توفّر كثيرًا من المحاولات المتكررة:

النموذجكيف توجّه الأداء
Speech 2.8 HDقائمة منسدلة للمشاعر تضم 10 إعدادات مسبقة
Gemini 3.1 Flash TTSأمر بلغة طبيعية مع وسوم مضمّنة
Qwen3 TTSتعليمة أسلوب بنص حر
Chatterboxشريط المبالغة
ElevenLabs V3شريط أسلوب من 0 إلى 1

مشاريع تستحق البناء

السرد والبودكاست

أسرع نتيجة ممكنة هي تحويل ما كتبته بالفعل إلى صوت. ألصق مقالة مدونة في Speech 2.8 HD، ونزّل ملف MP3، وانشره كنسخة مسموعة من الصفحة. تتبع مقدمات البودكاست ووحدات الدورات وفصول الكتب المسموعة النمط نفسه. بدّل تلميح اللغة، فيتحول النص نفسه إلى نسخة إسبانية أو يابانية دون جلسة تسجيل جديدة.

شابة بجوار نافذة قطار تستمع إلى كتاب مسموع عبر سماعات الأذن، مع كتاب ورقي وشال صوف على حجرها

قبل النشر، شغّل الصوت عبر نموذج تفريغ مثل GPT 4o Transcribe أو Gemini 3 Pro. وقراءة النص المفرّغ هي أسرع طريقة لاكتشاف اسم علامة تجارية منطوق بشكل خاطئ.

الألعاب والرسوم المتحركة

يستخدم المطورون المستقلون ومُصمّمو الرسوم المتحركة الأصوات المولّدة للحوار المؤقت، والعروض الأولية المتحركة، والأسطر الكاملة للشخصيات. وإليك روتينًا عمليًا: اكتب سطرًا واحدًا، ثم أدِّه بخمس طرق باستخدام Qwen3 TTS في تصميم الصوت، مثل طفل عصبي، ومحقق متعب، وروبوت بائع مرح، وكبير هادئ، وخصم ساخر. اختر الفائز، واحفظ الوصف، وأعد استخدامه لكل سطر تنطقه تلك الشخصية.

منظر علوي لطاولة رسام توضيحي عليها رسومات قلم رصاص لشخصية ثعلب مثبتة في صف، وميكروفون في الزاوية

الدورات ومقاطع التدريب

يتغير محتوى التدريب كثيرًا، وإعادة تسجيل معلّق بشري في كل مرة تتغير فيها قائمة ما تصبح مكلفة. مع الصوت المولّد تعدّل الجملة وتعيد توليد تلك الفقرة وحدها. حافظ على الصوت نفسه والسرعة والطبقة الصوتية في كل درس حتى تبدو السلسلة كأنها لمدرّس واحد، واكتب الإعدادات في دليل أسلوب قصير.

تحتاج إلى ترجمات؟ فعّل subtitle_enable في Speech 2.8 HD لتحصل على طوابع زمنية على مستوى الجملة مع الصوت، ثم مرّرها إلى برنامج المونتاج. وبالنسبة للدروس الطويلة، قسّم النص حسب الشريحة، واستخدم حقلي النص السابق والنص التالي في ElevenLabs V3 حتى ينساب التنغيم من جزء إلى آخر.

أخطاء تجعل الصوت مزيفًا

معظم النتائج الآلية تأتي من النص والإعدادات لا من النموذج. انتبه لهذه الأمور:

  1. الكتابة للعين. الجمل الطويلة ذات الثلاث عبارات يصعب نطقها. اقرأ النص بصوت عالٍ أولًا، واحذف كل نَفَس لا تستطيع أخذه.
  2. تخطي تسجيل التجربة. ولّد جملتين قبل أن تلتزم بإدخال 10,000 حرف.
  3. دفع المشاعر إلى الحد الأقصى. يلاحظ Chatterbox أن قيم المبالغة المتطرفة قد تكون غير مستقرة. ابدأ من المنتصف وتحرك بخطوات صغيرة.
  4. تجاهل الأسماء والأرقام. أعد كتابة الأسماء الصعبة صوتيًا، وفعّل التطبيع الإنجليزي للتواريخ.
  5. الاستنساخ من عينة مليئة بالضوضاء. استخدم 10 ثوانٍ على الأقل من كلام نظيف، وفعّل تقليل الضوضاء عندما تكون الغرفة مليئة بالصدى.
  6. ترك اللغة دون تحديد. اسم فرنسي داخل نص إنجليزي يُقرأ بشكل أفضل عندما تعطي النموذج تلميحًا باللغة.

مهندس صوت ذو لحية رمادية يستمع بتركيز عند لوحة تحكم بين مكبري استوديو

سجّل أول صوت لك اليوم

اختر فقرة واحدة كتبتها بالفعل. افتح Speech 2.8 HD، وشغّلها بالصوت الافتراضي، ثم أعد تشغيلها بمشاعر مختلفة. وبمجرد أن تسمع الفرق، ابنِ شخصية في Qwen3 TTS بكتابة جملة واحدة تصف من هو المتحدث.

كل شيء موجود في مكان واحد على PicassoIA: الأصوات، والصور الشخصية من نماذج الصور مثل P Image، وفيديوهات الصور المتحدثة. ابدأ بجملة واحدة، وغيّر إعدادًا واحدًا، واضغط توليد، واستمر في التجربة حتى يبدو الصوت كالشخص الذي في ذهنك. شخصيتك الأولى لا تبعد عنك سوى وصف واحد.

احفظ الإعدادات التي نجحت، وشارك الصوت مع صديق لم يسمع النص من قبل، واسأله عما يلاحظه أولًا. فإذا ذكر الصوت بدلًا من الكلمات، فاضبط الإيقاع والتوقفات وشغّله مرة أخرى.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة