Gemini TTS مقابل ElevenLabs: أيّ الأصوات تبدو أفضل؟

يسلك Gemini 3.1 Flash TTS وElevenLabs V3 طريقين متعاكسين نحو صوت مقنع: الأول تُوجّهه بلغة بسيطة ووسوم، والثاني تضبطه بمنزلقات. إليك موضع تفوّق كل منهما في المشاعر والاتساق واللغات والمشاريع الحقيقية، إضافةً إلى اختبار استماع أعمى عادل يمكنك تجربته على نصّك.

Gemini TTS مقابل ElevenLabs: أيّ الأصوات تبدو أفضل؟
Cristian Da Conceicao
مؤسس Picasso IA

صوتان يقرآن الجملة نفسها تمامًا. أحدهما يتوقف نصف نبضة قبل الجملة الساخرة الختامية، والآخر يسرع فيها فيبدو كإعلان في محطة قطارات. هذه الفجوة الصغيرة تحدد هل سيُكمل المستمع المعلّق الصوتي أم سيتخطاه، وهذا بالضبط ما تحكم عليه حين تضع Gemini TTS بجانب ElevenLabs.

تتجاهل معظم مقالات المقارنة الأمر الأهم: لا يفوز أي محرك في كل نص. Gemini 3.1 Flash TTS و ElevenLabs V3 مبنيان على فكرتين مختلفتين للتحكم. يتيح الأول لك توجيه الصوت بجمل بسيطة ووسوم بين أقواس. ويمنحك الثاني مقابض للثبات والتشابه والأسلوب والسرعة. أيّهما يبدو أفضل يعتمد على ما تُدخله فيه ومقدار التوجيه الذي تريده.

يشرح هذا المقال ما يقدمه كل نموذج فعليًا على PicassoIA، ومعنى "يبدو أفضل" بعد أن تضع سماعات الرأس، وأيّ المشاريع تناسب أيّ محرك، وكيف تُجري اختبار استماع أعمى عادلًا في نحو عشر دقائق. لن تجد هنا أرقامًا مختلقة في لوحة نتائج. ستجد منهجًا يعطيك إجابة صادقة عن نصوصك أنت.

الإجابة المختصرة

إن أردت الحكم قبل التفاصيل، فها هو. اختر Gemini 3.1 Flash TTS حين تريد توجيه الأداء بالكلمات، مثل: "قلها بدفء، بشيء من الإرهاق، كأنها نهاية يوم طويل." اختر ElevenLabs V3 حين تريد صوتًا قابلًا للضبط ويمكن تكراره، حيث تُبقي إعدادات الثبات والتشابه الجملة الأربعين مطابقة للجملة الأولى.

منظر علوي لمكتب خشبي عليه حاسوب محمول وزوجان من سماعات الرأس ودفتر ملاحظات مُعدّ لاختبار استماع للأصوات

الموقفالخيار الأفضلالسبب
قراءة إعلان قصير بمشاعر محددةGemini 3.1 Flash TTSأمر نصي للأسلوب مع وسوم مثل [whispering] تشكّل الأداء سطرًا بسطر
سرد طويل يجب أن يبقى ثابتًاElevenLabs V3تعزيز الثبات والتشابه يُثبّت شخصية الصوت
نص واحد بلغات كثيرةGemini 3.1 Flash TTSأكثر من 70 رمز لغة في نموذج واحد
مسودات سريعة لفحص الإيقاعElevenLabs Flash v2.5مصمم لإنجاز سريع
مقدمة بودكاست حواريةجرّب الاثنينالذوق هو الحكم، والذوق شخصي

💡 نصيحة: استمع إلى كل صوت بسماعات الرأس، وبالنص نفسه وبالمستوى الصوتي نفسه. مكبرات الحاسوب المحمول تُخفي الأنفاس والنقرات والنهايات المسطحة التي تكشف الصوت الاصطناعي.

محرّكان صوتيان مختلفان

قبل أن تقارن الصوت، من المفيد أن تعرف ما الذي تسمح به كل أداة تغييره فعليًا. الإعدادات تشكّل النتيجة أكثر مما يتوقع معظم الناس.

Gemini 3.1 Flash TTS

يأتي Gemini 3.1 Flash TTS مع 30 صوتًا مُسمّى، منها Kore (الافتراضي) وPuck وCharon وFenrir وZephyr وAoede. تكتب النص في حقل النص، ثم تضيف أمرًا نصيًا للأسلوب منفصلًا بلغة بسيطة. عبارات مثل "تحدّث ببطء وثقة" أو "استخدم نبرة هادئة ودودة" تغيّر الإيقاع واللهجة والمزاج دون أن تمس النص نفسه.

ما يميّزه هو التوجيه المضمّن. يمكنك إضافة وسوم مثل [sigh] و [laughing] و [whispering] و [shouting] أو [extremely fast] داخل الجملة مباشرة. هذا يعني أن سطرًا واحدًا قد يُقال همسًا بينما يُصرخ السطر التالي، وكل ذلك في توليد واحد. يقبل كل حقل حتى 4,000 بايت، وهذا يكفي لعرض توضيحي لمنتج أو شرح قصير.

في أمثلة التشغيل على PicassoIA، انتهت مقاطع Gemini في نحو أربع إلى ستٍّ ونصف ثوانٍ. هذه عينة صغيرة وليست اختبارًا معياريًا، لكنها تدل على أن المسودات لن تبطئك.

ElevenLabs V3 وإصداراته الأسرع

يقدّم ElevenLabs V3 أكثر من 25 شخصية صوتية مثل Rachel (الافتراضية) وDrew وAria وRoger وSarah وJames. بدلًا من أمر نصي حر للأسلوب، تحصل على ضوابط رقمية:

  • السرعة: من 0.25x إلى 4x
  • المبالغة في الأسلوب: من 0 إلى 1، من السرد المسطح إلى الأداء المسرحي
  • الثبات: من 0 إلى 1، والافتراضي 0.5
  • تعزيز التشابه: من 0 إلى 1، والافتراضي 0.75
  • النص السابق والنص التالي: سياق يجعل التنغيم يقع في مكانه الصحيح عند حدود الجمل

إن بدا V3 أثقل مما تحتاج، فالعائلة لديها خيارات أخف على المنصة نفسها. يركّز Flash v2.5 و Turbo v2.5 على السرعة، بينما يستهدف v2 Multilingual التعليق الصوتي بأكثر من 30 لغة.

أيدٍ تضبط مقبضًا دوّارًا على لوحة خلط صوت تماثلية قديمة بجوار زوج من سماعات الرأس

ماذا يعني "يبدو أفضل" حقًا

كلمة "أفضل" زئبقية. قد يفوز صوت في عرض مدته عشر ثوانٍ ثم ينهار عند الدقيقة الثامنة. قسّم السؤال إلى ثلاثة أشياء يمكنك سماعها فعلًا.

الطبيعية والإيقاع

الكلام الطبيعي غير متساوٍ. يسرّع الإنسان في العبارات المألوفة، ويبطئ عند الكلمات المهمة، ويتنفس حيث توجد فاصلة. الصوت الاصطناعي الضعيف يُلقي كل كلمة بالثقل نفسه.

انتبه لهذه الإشارات:

  • موضع الوقفات: هل يتنفس الصوت حيث يتنفس الإنسان؟
  • النبر: هل يؤكد الكلمة التي تحمل المعنى؟
  • الأرقام والأسماء: هل تبدو "3.5 مليون" كقراءة إنسان أم كقراءة روبوت؟
  • نهايات الجمل: هل ترتفع الأسئلة، أم تنتهي مسطّحة؟

قيّم كل نقطة من واحد إلى خمسة على دفتر ملاحظات. يبدو ذلك مملًا، لكن بعد ثلاثة مقاطع ستبدأ أذناك في ملاحظة أنماط كنت ستفوّتها في استماع عابر.

امرأة ترتدي سترة كريمية تتكلم أمام ميكروفون مكثّف مزوّد بفلتر بوب في غرفة صغيرة معالجة صوتيًا

المشاعر والأداء التمثيلي

هنا يبدو الفرق بين النهجين أوضح ما يكون. مع Gemini 3.1 Flash TTS، أنت تصف المشاعر: "أنت تتحدث إلى صديق، مستمتعًا ومرتاحًا." وتتولى الوسوم اللحظات التي تحتاج إلى دفعة إضافية، كضحكة أو همسة. يشبه ذلك أن تُعطي ملاحظات لممثل صوتي.

مع ElevenLabs V3، تأتي المشاعر في الغالب من الصوت الذي تختاره إضافةً إلى منزلق الأسلوب. القيم المنخفضة تعطي قراءة محايدة، والقيم الأعلى تدفع نحو أداء مسرحي، لكن الإفراط في الدفع قد يبدو تمثيلًا مبالغًا فيه. كما تساعد حقلا النص السابق والنص التالي النموذج على تحديد كيف ينبغي أن تقع الجملة، لأنه يعرف ما جاء قبلها وما يليها.

💡 نصيحة: غيّر متغيرًا واحدًا في كل مرة. إن بدّلت الصوت وإعداد الأسلوب معًا، فلن تعرف أبدًا أيّ تغيير جعل المقطع أفضل.

شاب يرتدي جاكيت دنيم وسماعات أذن تغطي الأذنين على أرضية مضاءة بضوء الشمس، يقارن صوتين على حاسوب محمول

الاتساق في النصوص الطويلة

قد يبدو الصوت رائعًا لثلاثين ثانية ثم ينحرف بحلول الفقرة الخامسة. يظهر هذا الانحراف على شكل طبقة صوت مختلفة قليلًا، أو لهجة جديدة، أو مزاج يتغيّر دون سبب.

يعالج ElevenLabs V3 ذلك بإعدادي الثبات والتشابه، وهما مصممان لأن تُبقي الجملة الثانية عشرة من كتاب مسموع شبيهة بالجملة الأولى. أما Gemini 3.1 Flash TTS فيتعامل مع الأمر بطريقة مختلفة: لأن كل طلب محدود بحد أقصى 4,000 بايت، تقسّم النصوص الطويلة إلى أجزاء وتعيد استخدام الصوت نفسه وأمر الأسلوب نفسه لكل جزء. انسخ الأمر حرفيًا، فتغيير صغير في الصياغة قد يبدّل النبرة بين الأقسام.

مقارنة الضوابط واللغات

هذه صورة الميزات من صفحات النماذج، جنبًا إلى جنب.

الضابطGemini 3.1 Flash TTSElevenLabs V3
الأصوات3025+
توجيه الأسلوبأمر نصي بلغة بسيطةمنزلق الأسلوب من 0 إلى 1
المشاعر المضمّنةوسوم مثل [whispering] و [laughing] و [shouting]غير متاحة في إعدادات PicassoIA
السرعةأمر نصي أو وسم [extremely fast]سرعة من 0.25x إلى 4x
ثبات الصوتالصوت نفسه والأمر نفسه لكل جزءالثبات وتعزيز التشابه
سياق الجملليس حقلًا منفصلًاالنص السابق والنص التالي
إدخال اللغةأكثر من 70 رمز لغةحقل رمز اللغة

الأوامر والوسوم والمنزلقات

لا يتفوق أحد النهجين على الآخر على الورق. كلٌّ منهما يناسب شخصية مختلفة.

إن كنت تفكر بالكلمات، فمسار Gemini يبدو طبيعيًا. تكتب جملة عن الطريقة التي ينبغي أن يبدو بها الصوت، ثم ترى ما يحدث. وإن كنت تفكر بالأرقام، فمسار ElevenLabs يبدو طبيعيًا. تعدّل الثبات من 0.5 إلى 0.7، ثم تعيد التشغيل وتقارن. الفرق التي تنتج النوع نفسه من الصوت كل أسبوع تفضّل المنزلقات غالبًا، لأن الإعدادات سهلة التسجيل والتكرار.

💡 نصيحة: احتفظ بملف نصي بسيط يحمل اسم الصوت وكل الإعدادات والأمر الفائز. بعد ثلاثة أسابيع ستكون ممتنًا لأنك فعلت ذلك.

اللغات وتنوع الأصوات

يقبل Gemini 3.1 Flash TTS أكثر من 70 رمز لغة، وتشمل صيغًا إقليمية مثل en-US وen-GB وen-IN وes-MX وfr-CA وpt-BR. تحويل نص إسباني من إسبانيا إلى المكسيك يتطلب تغيير قائمة منسدلة واحدة. أما ElevenLabs V3 فيأخذ رمز لغة قصيرًا مثل en أو es أو fr، وتضم العائلة أيضًا v2 Multilingual و Turbo v2.5 لاحتياجات لغوية أوسع.

في العمل بغير الإنجليزية، لا تثق بأذنيك إن لم تكن متقنًا للغة. اطلب من متحدث أصلي أن يستمع إلى عشر ثوانٍ من كل مقطع. أخطاء اللهجة وأنماط النبر الغريبة لا يلحظها المتحدثون بلغة ثانية، لكن أهل اللغة يلاحظونها فورًا.

فريق متنوع من زملاء العمل حول طاولة في مكتب مشرق يستمعون إلى متحدث على حاسوب محمول

أيّ الخيارات يناسب مشروعك

الآن الجزء العملي. طابِق المحرك مع المهمة بدلًا من تتويج فائز عام واحد.

البودكاست والمقابلات

بالنسبة للمقدمات والخواتيم وقراءات الإعلانات، الشخصية هي الأهم. تحتاج مقدمة البودكاست إلى صوت يحمل ابتسامة، وتحتاج قراءة الراعي إلى طاقة لا تبدو فجّة. يُعد Gemini 3.1 Flash TTS نقطة بداية قوية هنا، لأن أمر أسلوب مثل "حماسي، سريع، ودود" يقوم بالجزء الأكبر من العمل، والوسوم تتيح لك إضافة ضحكة أو تعليق همسًا.

لبرنامج متكرر يجب أن يبقى فيه صوت المضيف متطابقًا كل أسبوع، فإن ElevenLabs V3 مع إعدادات ثبات مقفلة هو الخيار الأكثر أمانًا.

بودكاستر يرتدي هودي أخضر داكنًا يتحدث إلى ميكروفون بث أمام طاولة بودكاست وخلفه جدار من الطوب

الدورات والكتب المسموعة

الصيغ الطويلة تعاقب الانحراف والإرهاق. يقضي المستمعون ساعة مع الصوت، فتتكرر العيوب الصغيرة مئات المرات. هنا تكتسب أدوات الاتساق في ElevenLabs V3 قيمتها، وتساعد حقول النص السابق والنص التالي الفصول على الاتصال دون فواصل مسموعة. أبطئ السرعة قليلًا للدروس الكثيفة، نحو 0.9، وسيشكرك المستمعون.

يمكنك مع ذلك استخدام Gemini 3.1 Flash TTS للدورات. قسّم كل درس إلى أقسام أقل من 4,000 بايت، وأبقِ أمر الأسلوب متطابقًا، وستبقى النتيجة ثابتة.

امرأة تسجل دورة إلكترونية في مكتب منزلي مشرق بميكروفون USB وكاميرا على حامل ثلاثي

رجل مسن يرتدي نظارة قراءة يستمع إلى كتاب مسموع بسماعات الأذن على كرسي بذراعين وبجواره كوب شاي

التعليق الصوتي للفيديو

يجب أن يتطابق سرد الفيديو مع توقيت الصورة، لذا يفيد التحكم في السرعة. يمنحك ElevenLabs V3 منزلق سرعة من 0.25x إلى 4x، مما يسهّل إدخال سطر في فجوة زمنية محددة. ويتيح لك Gemini 3.1 Flash TTS طلب قراءة أسرع أو أبطأ في الأمر النصي، ويتألق حين يحتاج مشهد إلى لحظة عاطفية، مثل همسة قبل الكشف.

هل تترجم فيديو موجودًا؟ ElevenLabs Dubbing مصمم لهذا بالتحديد، إذ يحوّل فيديو مكتملًا إلى أكثر من 90 لغة. وإن لم يناسب أيٌّ من المرشحين الرئيسيين ذوقك، فإن MiniMax Speech 2.8 HD يستحق استماعًا سريعًا كرأي ثالث.

محرر فيديو عند مكتب واقف في استوديو علوي عند الغسق، وعلى الشاشة خط زمني وبجواره ميكروفون

كيف تشغّل الاثنين على PicassoIA

قراءة المواصفات تكفي إلى حد ما. أذناك لهما الكلمة الأخيرة. إليك اختبارًا عادلًا يمكنك إنهاؤه في عشر دقائق.

الإعدادات للبدء

افتح صفحة Gemini 3.1 Flash TTS وصفحة ElevenLabs V3 في تبويبين.

  1. الصق النص نفسه في حقل النص في Gemini وفي حقل الأمر في ElevenLabs V3.
  2. إعدادات Gemini: الصوت Kore، واللغة en-US، وأمر أسلوب مثل "تحدّث بنبرة دافئة وواثقة وبإيقاع طبيعي."
  3. إعدادات ElevenLabs V3: الصوت Rachel، والسرعة 1، والأسلوب 0، والثبات 0.5، وتعزيز التشابه 0.75، واللغة en.
  4. ولّد المقطعين ونزّلهما.
  5. أعد تسمية الملفات إلى A وB. اطلب من صديق أن يخلط ترتيبهما حتى لا تعرف أيهما هو.
  6. استمع بسماعات الرأس، وقيّم كل مقطع على المقياس ذي الخمس نقاط، ثم اكشف الفائز.
  7. كرر بصوت ثانٍ من كل نموذج، لأن صوتًا واحدًا نادرًا ما يروي القصة كاملة.
الجولةصوت Gemini 3.1 Flash TTSصوت ElevenLabs V3
الأولىKoreRachel
الثانيةPuckDrew
الثالثةCharonRoger

نص يكشف نقاط الضعف

نص الاختبار الجيد ليس فقرة لطيفة، بل فخّ. ضمّن رقمًا، واسمًا، واختصارًا، وسؤالًا، وتعجبًا، وتعليقًا جانبيًا هادئًا. جرّب هذا:

"يفتح استوديونا الجديد أبوابه في 14 مارس، ونتوقع 3,500 زائر. سيفتح الدكتور أوكونكو الأبواب في 9:30 صباحًا. انتظر، هل سمعت ذلك؟ نفدت التذاكر في ساعتين! بصراحة، لم أكن أظن أن الأمر سينجح. [whispering] لكننا هنا الآن."

يتفاعل Gemini مع الوسم بين الأقواس. إعدادات ElevenLabs V3 على PicassoIA لا تعرض الوسوم المضمّنة، لذا احذف الوسم من هذه النسخة، وقيّم كيف تقع السطر الهادئ الأخير وحده.

💡 نصيحة: شغّل الاختبار مرتين. إن كان المقطع رائعًا مرة ومتوسطًا في الثانية، فأنت تعرف الآن مقدار التباين الذي يمكن توقعه في الإنتاج.

أضف موسيقى وتحقق بالنصوص المكتوبة

نادرًا ما يعمل الصوت وحده. خطوتان إضافيتان تحوّلان مقطعًا جيدًا إلى عمل مكتمل.

مهاد موسيقي تحت صوتك

مهاد آلي هادئ يجعل الكلام الاصطناعي يبدو أدفأ. لدى PicassoIA عدة نماذج موسيقية لتجربتها: Lyria 3، و Lyria 3 Pro، و Stable Audio 2.5، و MiniMax Music 2.6، و ElevenLabs Music. اطلب مقطعًا موسيقيًا بلا غناء، بطاقة منخفضة وإيقاع ثابت، ثم اخفض مستواه تحت الصوت في برنامج المونتاج حتى تبقى الكلمات واضحة.

النسخ لاكتشاف الأخطاء

هذه حيلة تُزيل الرأي من الاختبار. مرّر كل مقطع صوتي إلى نموذج تحويل الكلام إلى نص مثل GPT-4o Transcribe أو Gemini 3 Pro، ثم قارن النص الناتج بنصك الأصلي. إذا عادت كلمة خاطئة، فالأرجح أن الصوت نطقها بشكل خاطئ أو ابتلع مقطعًا منها. عُدّ حالات عدم التطابق لكل مقطع. ليس ذلك مقياسًا مثاليًا للجمال، لكنه يكشف أسماء العلامات التجارية والأرقام التي يشوّهها الصوت، وهي الأخطاء التي يلاحظها المستمعون أولًا.

جرّب الصوتين بنفسك

أصبحت تملك الصورة الكاملة. Gemini 3.1 Flash TTS يمنحك كرسي المخرج: صف الأداء ودع الوسوم تتولى اللحظات. و ElevenLabs V3 يمنحك لوحة مزج: اضبط الثبات والأسلوب والسرعة حتى يتصرف الصوت كما تريد. لا أحد منهما خاطئ، وكثير من صانعي المحتوى يُبقون الاثنين مفتوحين بحسب يومهم.

أسرع طريقة لحسم الجدل هي أن تسمع الاثنين يقرآن كلماتك أنت. افتح PicassoIA، والصق فقرة من فيديو أو بودكاست أو درس قادم، وشغّلها على النموذجين. أضف مهادًا موسيقيًا، وراجع النص المكتوب، واختر الصوت الذي لن يتخطّاه جمهورك. وبينما أنت هناك، جرّب دمج السرد مع صور ومقاطع أُنشئت على المنصة نفسها، وابنِ المشروع كله في مكان واحد. معلقك الصوتي التالي على بُعد بضع نقرات.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة