بديل ElevenLabs: خيارات مجانية ومفتوحة المصدر واستنساخ الأصوات

تنفد النقاط بسرعة وتقف شروط التراخيص في الطريق، لذلك يبحث كثير من صنّاع المحتوى عن بديل ElevenLabs. يقارن هذا المقال الأدوات المجانية المستضافة ومحركات المصدر المفتوح وخيارات استنساخ الأصوات، مع الإعدادات وملاحظات التراخيص وأفضل الاختيارات للبودكاست والإعلانات والكتب الصوتية.

بديل ElevenLabs: خيارات مجانية ومفتوحة المصدر واستنساخ الأصوات
Cristian Da Conceicao
مؤسس Picasso IA

يصبح دفع ثمن مولّد الأصوات مرهقًا في اللحظة التي يستهلك فيها فصل واحد من كتاب صوتي كل نقاطك الشهرية. هذه هي القصة وراء معظم عمليات البحث عن بديل ElevenLabs: الأصوات رائعة، لكن الحدود وشروط التراخيص والتسعير لكل حرف تدفع الناس إلى البحث في مكان آخر. الخبر الجيد أن السوق صار يقدم خيارات حقيقية. بعضها مجاني للتجربة في المتصفح، وبعضها مفتوح المصدر ويعمل على جهازك، وقليل منها يستنسخ صوتًا من مقطع لا يتجاوز عشر ثوانٍ.

يرتب هذا المقال الخيارات حسب ما تحتاجه فعلًا. ستعرف أين تتوقف المستويات المجانية عن كونها مجانية، وأي محركات مفتوحة المصدر تستحق التثبيت، وكيف يعمل استنساخ الأصوات عمليًا، ومرورًا خطوة بخطوة على Chatterbox في PicassoIA. تأتي الموسيقى والتفريغ النصي في الختام، لأن معظم مشاريع الصوت تحتاج إليهما عاجلًا أم آجلًا.

لماذا يبحث الناس عن بديل ElevenLabs

اكتسب ElevenLabs سمعته بجدارة. أصواته تحمل المشاعر، ومخرجاته متعددة اللغات قوية، ومحرره مصقول. لا يجادل أحد جديّ في ذلك. يظهر الاحتكاك لاحقًا، حين يبدأ مشروع حقيقي ويستمر العداد في العمل.

يد تدير مقبض ألومنيوم مصقول على واجهة صوت مدمجة

مشكلة النقاط

يُبنى التسعير على النقاط، وتنفد النقاط بسرعة. وفّرت الخطة المجانية تاريخيًا نحو 10,000 نقطة شهريًا، أي ما يقارب عشر دقائق من الكلام. يستغرق نص مقالة من 3,000 كلمة يُقرأ بصوت عالٍ نحو 20 دقيقة بالسرعة الطبيعية للكلام، لذلك تكفي تسجيلة سرد واحدة مع إعادتين أو ثلاث لتفريغ الحساب.

💡 حساب سريع: 150 كلمة في الدقيقة سرعة سرد مريحة. نص من 3,000 كلمة يعني 20 دقيقة من الصوت قبل أن تحسب أي إعادة تسجيل.

تتغير حدود الخطط كثيرًا، لذا تعامل مع أي رقم تقرؤه، بما في ذلك هذا الرقم، على أنه لقطة لحظية، وراجع صفحة الأسعار الحالية قبل أن تقرر.

مخاوف التراخيص والخصوصية

تتكرر ثلاث شكاوى أخرى مرارًا:

  • حقوق الاستخدام التجاري. عادةً ما تشترط الباقات المجانية ذكر المصدر أو تمنع الاستخدام التجاري، لذلك تنتهي قناة YouTube مُدرة للربح باشتراك في باقة مدفوعة على أي حال.
  • بيانات الصوت. رفع تسجيل لصوتك أو لصوت عميل أو لصوت الرئيس التنفيذي لعميل يعني الوثوق بسياسة الاحتفاظ بالبيانات لدى جهة أخرى.
  • الارتباط بمزوّد واحد. الصوت المستنسخ الموجود داخل حساب مزوّد واحد لا يمكن نقله إلى أداة أخرى.

تفسر هذه النقاط الثلاث سبب انقسام البدائل إلى فريقين: أدوات مستضافة بحدود سخية، ونماذج مفتوحة المصدر تتحكم أنت فيها.

خيارات مجانية تعمل فعلًا

كلمة "مجاني" ملتبسة في هذا السوق. قبل أن تقضي عصر يوم كامل في التجربة، حدد نوع المجانية التي تشترك فيها.

مضيف بودكاست يضحك أمام ميكروفون ديناميكي أسود في غرفة مليئة بالكتب

المستويات المجانية في الأدوات المستضافة

توفر المستويات المجانية المستضافة بداية سريعة دون أي إعداد. تكتب النص وتضغط على التوليد ثم تنزّل الملف. في PicassoIA يمكنك تشغيل عدة نماذج صوتية مباشرة من المتصفح، منها Chatterbox Turbo وSpeech 2.8 Turbo وGemini 3.1 Flash TTS، الذي يقدم 30 صوتًا بأكثر من 70 لغة. لاختبارات السرد والإعلانات القصيرة والمقاطع الاجتماعية، هذا يكفي.

تناسب المستويات المجانية المستضافة هذه المهام أكثر من غيرها:

  • اختبار النص. اسمع كيف تبدو فقرة قبل أن تلتزم بصوت معين.
  • الإعلانات القصيرة والريلز. نادرًا ما تصل ثلاثون ثانية من الصوت إلى الحد الشهري.
  • فحص اللغات. شغّل السطر نفسه بثلاث لغات وقارن بينها.

سير العمل المعقول يجمع العالمين. اكتب وجرّب الأصوات على أداة مستضافة، فلا شيء يحتاج إلى تثبيت، ثم انقل المهام الطويلة، مثل فصول الكتب الصوتية أو دورة كاملة، إلى نموذج مفتوح المصدر بعد أن تعرف الصوت والإعدادات التي تفضلها. تنفق النقاط على القرارات، ولا تنفق شيئًا على الكمية.

ما الذي يكلفه "المجاني" عادةً

كل مسار مجاني يقايض شيئًا. يوضح هذا الجدول ما تتنازل عنه:

المسار المجانيما تتنازل عنهالاستخدام الأنسب
مستوى مجاني مستضافحدود شهرية وطوابير أبطأ في أوقات الذروةالإعلانات القصيرة والاختبارات السريعة
مفتوح المصدر على جهازكوقت الإعداد ووحدة GPU قادرةالسرد الطويل والصوت الخاص
أوزان مفتوحة بترخيص غير تجاريالحق في تحقيق الدخل من المخرجاتالمشاريع الهواة والأبحاث
أصوات النظام المدمجةالصوت الطبيعيإمكانية الوصول والمسودات الأولية

أصوات مفتوحة المصدر يمكنك تشغيلها

يقلب المصدر المفتوح نموذج التكلفة. تدفع بوقت الإعداد بدلًا من النقاط، وبمجرد أن يعمل التثبيت، تكلّف الدقيقة الألف من الصوت الكهرباء نفسها التي كلّفتها الدقيقة الأولى.

منظر علوي لمكتب خشبي عليه سماعات ودفتر وحاسوب محمول وواجهة صوت

Chatterbox و Qwen3 TTS

يستحق نموذجان نظرة أولى لأن كليهما يستنسخ الأصوات، ويمكن تجربتهما على PicassoIA دون تثبيت أي شيء.

Chatterbox من Resemble AI صدر بترخيص MIT، ويصفه مطوروه بأنه أول نموذج TTS مفتوح المصدر يتضمن التحكم في تضخيم المشاعر. يستنسخ Chatterbox صوتًا من بضع ثوانٍ من صوت مرجعي، ويضبط التعبيرية بمنزلق واحد، ويتيح تثبيت البذرة للحصول على تسجيلات قابلة للتكرار. تحمل كل مخرجات علامة مائية غير مسموعة، فيبقى الصوت المولَّد قابلًا للتتبع. هناك نسختان شقيقتان لحاجات أخرى: Chatterbox Turbo للسرعة، وChatterbox Pro لأعمال التعليق الصوتي.

Qwen3 TTS من Qwen يعمل في ثلاثة أوضاع. يقدم Qwen3 TTS تسعة متحدثين جاهزين، واستنساخ الصوت من مقطع مرجعي مع نصه، وتصميم الصوت، حيث تصف الصوت بلغة عادية، مثل راوٍ هادئ من الذكور مع لكنة فرنسية خفيفة، فيبنيه النموذج. يتحدث 10 لغات، منها الإنجليزية والإسبانية والفرنسية والألمانية واليابانية والكورية، ويتيح حقل تعليمات الأسلوب إضافة إشارات مثل "تحدث ببطء" أو "نبرة متحمسة".

محركات محلية تستحق التجربة

إذا أردت كل شيء على عتادك الخاص، فلهذه المشاريع مجتمعات نشطة:

  • Kokoro: نموذج صغير يبلغ نحو 82 مليون معامل بترخيص Apache. يعمل بسرعة على حاسوب محمول متواضع ويبدو نظيفًا للسرد، لكنه لا يستنسخ الأصوات.
  • Piper: مصمم للعمل دون اتصال وخفيف بما يكفي لجهاز Raspberry Pi. أصواته وظيفية أكثر منها معبّرة، وهذا يناسب مشاريع المنزل الذكي وقارئات الشاشة.
  • XTTS-v2 من Coqui: يستنسخ صوتًا من نحو ست ثوانٍ من الصوت عبر 17 لغة. ترخيصه يقيّد الاستخدام التجاري، والشركة التي تقف وراءه أوقفت نشاطها في أوائل 2024.
  • Bark: مرخّص بترخيص MIT ويستطيع إنتاج ضحكات وتنهدات، لكن النتائج تتفاوت كثيرًا من تشغيل إلى آخر.

💡 اقرأ ملف الترخيص. كلمة "مفتوح" تعني أحيانًا شيفرة مفتوحة مع أوزان نموذج مقيّدة. افحص المستودع قبل أن تضع صوتًا مستنسخًا على قناة تحقق دخلًا.

استنساخ الأصوات دون جدار دفع

استنساخ الصوت هو الميزة التي يدفع الناس ثمنها غالبًا. وضعها ElevenLabs عادةً ضمن الخطط المدفوعة، ولهذا السبب يهم هذا القسم كل من يراقب ميزانيته.

شاب يعدّل موجة صوتية على شاشة عريضة في مكتب منزلي خافت الإضاءة

كم من الصوت تحتاج

أقل مما يتوقع معظم الناس، بشرط أن يكون نظيفًا:

  • بضع ثوانٍ: تكفي Chatterbox لإنتاج استنساخ قابل للتعرّف.
  • من 10 ثوانٍ إلى 5 دقائق: النطاق الذي يقبله MiniMax Voice Cloning في ملفات MP3 أو M4A أو WAV بحجم أقل من 20 ميغابايت.
  • مقطع قصير مع نصه: ما يطلبه Qwen3 TTS في وضع الاستنساخ. كتابة ما يقوله المتحدث تحسّن المطابقة.

يعمل MiniMax Voice Cloning بطريقة مختلفة عن غيره. ترفع عينة مرة واحدة، فتحصل على ملف صوتي قابل لإعادة الاستخدام، ثم تطبّق ذلك الصوت على نماذج كلام مثل Speech 2.6 HD وSpeech 2.6 Turbo وSpeech 02 HD وSpeech 02 Turbo. يمكن لتقليل الضوضاء وتسوية مستوى الصوت الاختياريتين إنقاذ تسجيلات أُجريت خارج غرفة هادئة.

يتبع المقطع المرجعي الجيد خمس قواعد بسيطة:

  1. سجّل في غرفة هادئة بأثاث ناعم.
  2. أبقِ الميكروفون على مسافة ثابتة.
  3. تحدث بوتيرتك الطبيعية دون موسيقى في الخلفية.
  4. اجعل متحدثًا واحدًا فقط.
  5. صدّر ملف WAV نظيفًا أو MP3 بمعدل بت مرتفع.

يتعامل Qwen3 TTS مع الاستنساخ بشكل مختلف قليلًا. بدّل الوضع إلى استنساخ الصوت، وارفع الصوت المرجعي، والصق ما يقوله المتحدث في Reference Text، ثم اكتب السطر الجديد الذي تريد نطقه. يعمل تخطي النص لكن المطابقة تصبح أضعف، خاصة في الأسماء والكلمات غير المألوفة. إذا لم يكن لديك أي عينة، يتيح وضع تصميم الصوت أن تصف متحدثًا بدلًا منها، وتعدّل تعليمات الأسلوب مثل بطيء ودافئ طريقة الأداء.

الموافقة والعلامات المائية

استنسخ فقط الأصوات التي تملكها أو لديك إذن خطي صريح باستخدامها. احتفظ بهذا الإذن في ملفاتك، وضع علامة على الصوت الاصطناعي حيثما تطلب المنصة ذلك. يساعد Chatterbox هنا، لأن علامته المائية المدمجة تحافظ على قابلية تتبع المقاطع المولدة دون أن تغيّر طريقة سماعها.

كيفية استخدام Chatterbox على PicassoIA

Chatterbox هو أقرب شيء إلى إجابة مجانية ومفتوحة المصدر لاستنساخ الأصوات التعبيرية، لذلك إليك تشغيلًا كاملًا عبر صفحة النموذج الخاصة به.

ممثلة صوتية بوضعية جانبية تتحدث أمام فلتر بوب داخل كابينة تسجيل مبطنة

تحضير المقطع المرجعي

اختر تسجيلًا من 10 إلى 30 ثانية للصوت الذي تريده، واحذف الصمت في البداية، وأزل الموسيقى أو الضوضاء الخلفية. ارفعه في حقل Audio Prompt. إذا تركت الحقل فارغًا، يعود Chatterbox إلى صوته الافتراضي، وهذا مفيد لأول اختبار لنصك.

ضبط المنزلقات

الصق نصك في Prompt، ثم اضبط عناصر التحكم. القيم الافتراضية نقطة بداية آمنة:

الإعدادالافتراضيوظيفتهنصيحة
Exaggeration0.5يضبط مدى تعبيرية الأداءجرّب 0.3 للسرد الهادئ و0.6 إلى 0.7 للقراءات الحماسية. القيم المتطرفة قد تبدو غير مستقرة.
CFG Weight0.5يتحكم في الإيقاعخفّضه نحو 0.3 إذا كان المتحدث في المرجع يتكلم بسرعة.
Temperature0.8يضبط التنوع بين التسجيلاتاخفضه للحصول على مخرجات متوقعة، وارفعه لمزيد من الشخصية.
Seed0يثبت التسجيلالصفر يعني عشوائي. عندما يبدو تسجيل صحيحًا، دوّن البذرة وأعد استخدامها.

غيّر إعدادًا واحدًا في كل مرة، وإلا فلن تعرف أي منزلق أصلح المشكلة.

فحص النتيجة

شغّل التوليد واستمع بسماعات الرأس وقارن المخرجات بالنص. تعمل النصوص الطويلة بشكل أفضل إذا قسمتها إلى فقرات من بضع جمل لكل منها، ثم ولّدها واحدة تلو الأخرى. لاكتشاف الكلمات المتخطاة أو المنطوقة خطأ بسرعة، مرّر الصوت الناتج عبر GPT-4o Transcribe وقارن النص بأصلك.

💡 حيلة إعادة التسجيل: احتفظ بالبذرة، وغيّر قيمة التضخيم بمقدار 0.1 فقط، ثم ولّد من جديد. ستحصل على الصوت نفسه بأداء مختلف قليلًا.

مقارنة جنبًا إلى جنب

هذه طريقة مقارنة المسارات الرئيسية، استنادًا إلى ما توثّقه كل أداة عن نفسها:

الخيارالنوعاستنساخ الصوتنموذج التكلفةالأفضل لـ
ElevenLabsمستضافخطط مدفوعةنقاط شهريةالتعليق الصوتي متعدد اللغات والمصقول
Chatterboxمفتوح المصدر، MITنعم، من بضع ثوانٍمجاني للتشغيل محليًاالسرد التعبيري
Qwen3 TTSأوزان مفتوحةنعم، مع تصميم الصوتمجاني للتشغيل محليًاالمشاريع متعددة اللغات
MiniMax Voice Cloningمستضافنعم، من 10 ثوانٍ إلى 5 دقائقخدمة مستضافةملفات صوتية قابلة لإعادة الاستخدام
Kokoroمفتوح المصدرلامجاني للتشغيل محليًاالسرد السريع دون اتصال
Piperمفتوح المصدرلامجاني للتشغيل محليًاالأجهزة دون اتصال
XTTS-v2أوزان مفتوحة، غير تجارينعممجاني للاستخدام الشخصيالمشاريع الشخصية

الحكم الصريح: ما زال ElevenLabs يضع المعيار في الصقل وتغطية اللغات، ولا ينبغي لأحد أن يتظاهر بغير ذلك. ما تغيّر هو الفجوة. بالنسبة لمقدمات البودكاست وفيديوهات المنتجات والشروحات وأصوات الشخصيات، تبدو الخيارات أعلاه جيدة بما يكفي ليصبح العامل الحاسم هو التكلفة والترخيص والتحكم، لا الجودة الخام. شغّل نصك الخاص على اثنين أو ثلاثة منها قبل أن تدفع مقابل أي شيء.

مكبر صوت استوديو بشبكة من نسيج منسوج بجانب نبتة عصارية صغيرة

الاختيار حسب حالة الاستخدام

  • مقدمات البودكاست وخواتيمه: Chatterbox مع بذرة ثابتة يحافظ على اتساق كل حلقة.
  • فيديوهات المنتجات والإعلانات: Speech 2.8 HD يستهدف التعليق الصوتي بجودة الاستوديو.
  • المحتوى متعدد اللغات: Qwen3 TTS وGemini 3.1 Flash TTS يتعاملان مع لغات كثيرة.
  • حوار بصوتين: Play Dialog مصمم للصوت الحواري.
  • تطبيقات ذات زمن استجابة منخفض: Realtime TTS 1.5 Max يستهدف استجابات أقل من 200 ملّي ثانية.
  • البقاء مع أصوات ElevenLabs: ElevenLabs v3 وFlash v2.5 متاحان أيضًا على PicassoIA، لذا يمكنك مقارنتهما بالبدائل في مكان واحد.

صاحب مشروع صغير يسجل سردًا لمنتج على مكتب مضيء

ما وراء الكلام: الموسيقى والنصوص المفرّغة

يبيع ElevenLabs أيضًا توليد الموسيقى والتفريغ النصي، لذلك يجب أن يتعامل البديل المنصف مع هاتين المهمتين كذلك. وكلاهما متاح على PicassoIA.

موسيقى دون صداع التراخيص

يحتاج التعليق الصوتي غالبًا إلى مسار موسيقي تحته. تولّد هذه النماذج الموسيقى من أمر نصي:

  • Music 2.6 من MiniMax يكتب أغاني كاملة، مع الغناء.
  • Lyria 3 Pro من Google ينشئ أغاني كاملة الطول.
  • Stable Audio 2.5 يؤلف الموسيقى من وصف نصي، وهو مناسب للخلفيات الآلية.
  • ElevenLabs Music موجود إن أردت البقاء داخل ذلك النظام البيئي.

موسيقية تعزف على غيتار أكوستيك بجانب ميكروفون مكثف في استوديو منزلي

تحويل الصوت إلى نص

يغلق التفريغ النصي الدائرة. يقبل GPT-4o Transcribe ملفات MP3 و MP4 و WAV و M4A و OGG و WebM، ويأخذ رمز اللغة وفق ISO لدقة أعلى، ويقبل أمرًا نصيًا قصيرًا للأسلوب. GPT-4o Mini Transcribe هو الخيار الأخف، وGemini 3 Pro يقدم نصوصًا مفرّغة دقيقة أيضًا.

رجل مسن بشعر فضي يستمع إلى كتاب صوتي بسماعات الرأس في مكتبة

تشمل الاستخدامات العملية:

  • التأكد من أن الصوت المستنسخ قرأ نصك كلمة بكلمة.
  • إضافة ترجمات إلى فيديو مسرود.
  • تحويل حلقات البودكاست إلى مقالات مكتوبة.
  • تدوين المقابلات التي سجلتها بهاتفك.

ابنِ أول تعليق صوتي لك اليوم

لا تحتاج إلى اشتراك شهري لتحصل على صوت اصطناعي مقنع. اختر نصًا قصيرًا واحدًا، واستنسخ صوتًا عبر Chatterbox أو MiniMax Voice Cloning، وضع تحته مسارًا من Stable Audio 2.5، وتحقق من النتيجة عبر GPT-4o Transcribe. يستغرق هذا المسار دقائق، لا عصرًا كاملًا.

يجمع PicassoIA نماذج الكلام والموسيقى والتفريغ النصي في مكان واحد، فيمكنك مقارنتها على نصك الخاص بدلًا من الاعتماد على ورقة المواصفات. افتح قائمة النماذج الكاملة، وسجّل عينة مدتها عشر ثوانٍ، واستمع إلى ما يفعله صوتك بفقرة جديدة. جرّب المنزلقات، وجرّب صوتًا ثانيًا، واحتفظ بالتسجيل الذي يشبهك أكثر.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة