يصبح دفع ثمن مولّد الأصوات مرهقًا في اللحظة التي يستهلك فيها فصل واحد من كتاب صوتي كل نقاطك الشهرية. هذه هي القصة وراء معظم عمليات البحث عن بديل ElevenLabs: الأصوات رائعة، لكن الحدود وشروط التراخيص والتسعير لكل حرف تدفع الناس إلى البحث في مكان آخر. الخبر الجيد أن السوق صار يقدم خيارات حقيقية. بعضها مجاني للتجربة في المتصفح، وبعضها مفتوح المصدر ويعمل على جهازك، وقليل منها يستنسخ صوتًا من مقطع لا يتجاوز عشر ثوانٍ.
يرتب هذا المقال الخيارات حسب ما تحتاجه فعلًا. ستعرف أين تتوقف المستويات المجانية عن كونها مجانية، وأي محركات مفتوحة المصدر تستحق التثبيت، وكيف يعمل استنساخ الأصوات عمليًا، ومرورًا خطوة بخطوة على Chatterbox في PicassoIA. تأتي الموسيقى والتفريغ النصي في الختام، لأن معظم مشاريع الصوت تحتاج إليهما عاجلًا أم آجلًا.
لماذا يبحث الناس عن بديل ElevenLabs
اكتسب ElevenLabs سمعته بجدارة. أصواته تحمل المشاعر، ومخرجاته متعددة اللغات قوية، ومحرره مصقول. لا يجادل أحد جديّ في ذلك. يظهر الاحتكاك لاحقًا، حين يبدأ مشروع حقيقي ويستمر العداد في العمل.

مشكلة النقاط
يُبنى التسعير على النقاط، وتنفد النقاط بسرعة. وفّرت الخطة المجانية تاريخيًا نحو 10,000 نقطة شهريًا، أي ما يقارب عشر دقائق من الكلام. يستغرق نص مقالة من 3,000 كلمة يُقرأ بصوت عالٍ نحو 20 دقيقة بالسرعة الطبيعية للكلام، لذلك تكفي تسجيلة سرد واحدة مع إعادتين أو ثلاث لتفريغ الحساب.
💡 حساب سريع: 150 كلمة في الدقيقة سرعة سرد مريحة. نص من 3,000 كلمة يعني 20 دقيقة من الصوت قبل أن تحسب أي إعادة تسجيل.
تتغير حدود الخطط كثيرًا، لذا تعامل مع أي رقم تقرؤه، بما في ذلك هذا الرقم، على أنه لقطة لحظية، وراجع صفحة الأسعار الحالية قبل أن تقرر.
مخاوف التراخيص والخصوصية
تتكرر ثلاث شكاوى أخرى مرارًا:
- حقوق الاستخدام التجاري. عادةً ما تشترط الباقات المجانية ذكر المصدر أو تمنع الاستخدام التجاري، لذلك تنتهي قناة YouTube مُدرة للربح باشتراك في باقة مدفوعة على أي حال.
- بيانات الصوت. رفع تسجيل لصوتك أو لصوت عميل أو لصوت الرئيس التنفيذي لعميل يعني الوثوق بسياسة الاحتفاظ بالبيانات لدى جهة أخرى.
- الارتباط بمزوّد واحد. الصوت المستنسخ الموجود داخل حساب مزوّد واحد لا يمكن نقله إلى أداة أخرى.
تفسر هذه النقاط الثلاث سبب انقسام البدائل إلى فريقين: أدوات مستضافة بحدود سخية، ونماذج مفتوحة المصدر تتحكم أنت فيها.
خيارات مجانية تعمل فعلًا
كلمة "مجاني" ملتبسة في هذا السوق. قبل أن تقضي عصر يوم كامل في التجربة، حدد نوع المجانية التي تشترك فيها.

المستويات المجانية في الأدوات المستضافة
توفر المستويات المجانية المستضافة بداية سريعة دون أي إعداد. تكتب النص وتضغط على التوليد ثم تنزّل الملف. في PicassoIA يمكنك تشغيل عدة نماذج صوتية مباشرة من المتصفح، منها Chatterbox Turbo وSpeech 2.8 Turbo وGemini 3.1 Flash TTS، الذي يقدم 30 صوتًا بأكثر من 70 لغة. لاختبارات السرد والإعلانات القصيرة والمقاطع الاجتماعية، هذا يكفي.
تناسب المستويات المجانية المستضافة هذه المهام أكثر من غيرها:
- اختبار النص. اسمع كيف تبدو فقرة قبل أن تلتزم بصوت معين.
- الإعلانات القصيرة والريلز. نادرًا ما تصل ثلاثون ثانية من الصوت إلى الحد الشهري.
- فحص اللغات. شغّل السطر نفسه بثلاث لغات وقارن بينها.
سير العمل المعقول يجمع العالمين. اكتب وجرّب الأصوات على أداة مستضافة، فلا شيء يحتاج إلى تثبيت، ثم انقل المهام الطويلة، مثل فصول الكتب الصوتية أو دورة كاملة، إلى نموذج مفتوح المصدر بعد أن تعرف الصوت والإعدادات التي تفضلها. تنفق النقاط على القرارات، ولا تنفق شيئًا على الكمية.
ما الذي يكلفه "المجاني" عادةً
كل مسار مجاني يقايض شيئًا. يوضح هذا الجدول ما تتنازل عنه:
| المسار المجاني | ما تتنازل عنه | الاستخدام الأنسب |
|---|
| مستوى مجاني مستضاف | حدود شهرية وطوابير أبطأ في أوقات الذروة | الإعلانات القصيرة والاختبارات السريعة |
| مفتوح المصدر على جهازك | وقت الإعداد ووحدة GPU قادرة | السرد الطويل والصوت الخاص |
| أوزان مفتوحة بترخيص غير تجاري | الحق في تحقيق الدخل من المخرجات | المشاريع الهواة والأبحاث |
| أصوات النظام المدمجة | الصوت الطبيعي | إمكانية الوصول والمسودات الأولية |
أصوات مفتوحة المصدر يمكنك تشغيلها
يقلب المصدر المفتوح نموذج التكلفة. تدفع بوقت الإعداد بدلًا من النقاط، وبمجرد أن يعمل التثبيت، تكلّف الدقيقة الألف من الصوت الكهرباء نفسها التي كلّفتها الدقيقة الأولى.

Chatterbox و Qwen3 TTS
يستحق نموذجان نظرة أولى لأن كليهما يستنسخ الأصوات، ويمكن تجربتهما على PicassoIA دون تثبيت أي شيء.
Chatterbox من Resemble AI صدر بترخيص MIT، ويصفه مطوروه بأنه أول نموذج TTS مفتوح المصدر يتضمن التحكم في تضخيم المشاعر. يستنسخ Chatterbox صوتًا من بضع ثوانٍ من صوت مرجعي، ويضبط التعبيرية بمنزلق واحد، ويتيح تثبيت البذرة للحصول على تسجيلات قابلة للتكرار. تحمل كل مخرجات علامة مائية غير مسموعة، فيبقى الصوت المولَّد قابلًا للتتبع. هناك نسختان شقيقتان لحاجات أخرى: Chatterbox Turbo للسرعة، وChatterbox Pro لأعمال التعليق الصوتي.
Qwen3 TTS من Qwen يعمل في ثلاثة أوضاع. يقدم Qwen3 TTS تسعة متحدثين جاهزين، واستنساخ الصوت من مقطع مرجعي مع نصه، وتصميم الصوت، حيث تصف الصوت بلغة عادية، مثل راوٍ هادئ من الذكور مع لكنة فرنسية خفيفة، فيبنيه النموذج. يتحدث 10 لغات، منها الإنجليزية والإسبانية والفرنسية والألمانية واليابانية والكورية، ويتيح حقل تعليمات الأسلوب إضافة إشارات مثل "تحدث ببطء" أو "نبرة متحمسة".
محركات محلية تستحق التجربة
إذا أردت كل شيء على عتادك الخاص، فلهذه المشاريع مجتمعات نشطة:
- Kokoro: نموذج صغير يبلغ نحو 82 مليون معامل بترخيص Apache. يعمل بسرعة على حاسوب محمول متواضع ويبدو نظيفًا للسرد، لكنه لا يستنسخ الأصوات.
- Piper: مصمم للعمل دون اتصال وخفيف بما يكفي لجهاز Raspberry Pi. أصواته وظيفية أكثر منها معبّرة، وهذا يناسب مشاريع المنزل الذكي وقارئات الشاشة.
- XTTS-v2 من Coqui: يستنسخ صوتًا من نحو ست ثوانٍ من الصوت عبر 17 لغة. ترخيصه يقيّد الاستخدام التجاري، والشركة التي تقف وراءه أوقفت نشاطها في أوائل 2024.
- Bark: مرخّص بترخيص MIT ويستطيع إنتاج ضحكات وتنهدات، لكن النتائج تتفاوت كثيرًا من تشغيل إلى آخر.
💡 اقرأ ملف الترخيص. كلمة "مفتوح" تعني أحيانًا شيفرة مفتوحة مع أوزان نموذج مقيّدة. افحص المستودع قبل أن تضع صوتًا مستنسخًا على قناة تحقق دخلًا.
استنساخ الأصوات دون جدار دفع
استنساخ الصوت هو الميزة التي يدفع الناس ثمنها غالبًا. وضعها ElevenLabs عادةً ضمن الخطط المدفوعة، ولهذا السبب يهم هذا القسم كل من يراقب ميزانيته.

كم من الصوت تحتاج
أقل مما يتوقع معظم الناس، بشرط أن يكون نظيفًا:
- بضع ثوانٍ: تكفي Chatterbox لإنتاج استنساخ قابل للتعرّف.
- من 10 ثوانٍ إلى 5 دقائق: النطاق الذي يقبله MiniMax Voice Cloning في ملفات MP3 أو M4A أو WAV بحجم أقل من 20 ميغابايت.
- مقطع قصير مع نصه: ما يطلبه Qwen3 TTS في وضع الاستنساخ. كتابة ما يقوله المتحدث تحسّن المطابقة.
يعمل MiniMax Voice Cloning بطريقة مختلفة عن غيره. ترفع عينة مرة واحدة، فتحصل على ملف صوتي قابل لإعادة الاستخدام، ثم تطبّق ذلك الصوت على نماذج كلام مثل Speech 2.6 HD وSpeech 2.6 Turbo وSpeech 02 HD وSpeech 02 Turbo. يمكن لتقليل الضوضاء وتسوية مستوى الصوت الاختياريتين إنقاذ تسجيلات أُجريت خارج غرفة هادئة.
يتبع المقطع المرجعي الجيد خمس قواعد بسيطة:
- سجّل في غرفة هادئة بأثاث ناعم.
- أبقِ الميكروفون على مسافة ثابتة.
- تحدث بوتيرتك الطبيعية دون موسيقى في الخلفية.
- اجعل متحدثًا واحدًا فقط.
- صدّر ملف WAV نظيفًا أو MP3 بمعدل بت مرتفع.
يتعامل Qwen3 TTS مع الاستنساخ بشكل مختلف قليلًا. بدّل الوضع إلى استنساخ الصوت، وارفع الصوت المرجعي، والصق ما يقوله المتحدث في Reference Text، ثم اكتب السطر الجديد الذي تريد نطقه. يعمل تخطي النص لكن المطابقة تصبح أضعف، خاصة في الأسماء والكلمات غير المألوفة. إذا لم يكن لديك أي عينة، يتيح وضع تصميم الصوت أن تصف متحدثًا بدلًا منها، وتعدّل تعليمات الأسلوب مثل بطيء ودافئ طريقة الأداء.
الموافقة والعلامات المائية
استنسخ فقط الأصوات التي تملكها أو لديك إذن خطي صريح باستخدامها. احتفظ بهذا الإذن في ملفاتك، وضع علامة على الصوت الاصطناعي حيثما تطلب المنصة ذلك. يساعد Chatterbox هنا، لأن علامته المائية المدمجة تحافظ على قابلية تتبع المقاطع المولدة دون أن تغيّر طريقة سماعها.
كيفية استخدام Chatterbox على PicassoIA
Chatterbox هو أقرب شيء إلى إجابة مجانية ومفتوحة المصدر لاستنساخ الأصوات التعبيرية، لذلك إليك تشغيلًا كاملًا عبر صفحة النموذج الخاصة به.

تحضير المقطع المرجعي
اختر تسجيلًا من 10 إلى 30 ثانية للصوت الذي تريده، واحذف الصمت في البداية، وأزل الموسيقى أو الضوضاء الخلفية. ارفعه في حقل Audio Prompt. إذا تركت الحقل فارغًا، يعود Chatterbox إلى صوته الافتراضي، وهذا مفيد لأول اختبار لنصك.
ضبط المنزلقات
الصق نصك في Prompt، ثم اضبط عناصر التحكم. القيم الافتراضية نقطة بداية آمنة:
| الإعداد | الافتراضي | وظيفته | نصيحة |
|---|
| Exaggeration | 0.5 | يضبط مدى تعبيرية الأداء | جرّب 0.3 للسرد الهادئ و0.6 إلى 0.7 للقراءات الحماسية. القيم المتطرفة قد تبدو غير مستقرة. |
| CFG Weight | 0.5 | يتحكم في الإيقاع | خفّضه نحو 0.3 إذا كان المتحدث في المرجع يتكلم بسرعة. |
| Temperature | 0.8 | يضبط التنوع بين التسجيلات | اخفضه للحصول على مخرجات متوقعة، وارفعه لمزيد من الشخصية. |
| Seed | 0 | يثبت التسجيل | الصفر يعني عشوائي. عندما يبدو تسجيل صحيحًا، دوّن البذرة وأعد استخدامها. |
غيّر إعدادًا واحدًا في كل مرة، وإلا فلن تعرف أي منزلق أصلح المشكلة.
فحص النتيجة
شغّل التوليد واستمع بسماعات الرأس وقارن المخرجات بالنص. تعمل النصوص الطويلة بشكل أفضل إذا قسمتها إلى فقرات من بضع جمل لكل منها، ثم ولّدها واحدة تلو الأخرى. لاكتشاف الكلمات المتخطاة أو المنطوقة خطأ بسرعة، مرّر الصوت الناتج عبر GPT-4o Transcribe وقارن النص بأصلك.
💡 حيلة إعادة التسجيل: احتفظ بالبذرة، وغيّر قيمة التضخيم بمقدار 0.1 فقط، ثم ولّد من جديد. ستحصل على الصوت نفسه بأداء مختلف قليلًا.
مقارنة جنبًا إلى جنب
هذه طريقة مقارنة المسارات الرئيسية، استنادًا إلى ما توثّقه كل أداة عن نفسها:
| الخيار | النوع | استنساخ الصوت | نموذج التكلفة | الأفضل لـ |
|---|
| ElevenLabs | مستضاف | خطط مدفوعة | نقاط شهرية | التعليق الصوتي متعدد اللغات والمصقول |
| Chatterbox | مفتوح المصدر، MIT | نعم، من بضع ثوانٍ | مجاني للتشغيل محليًا | السرد التعبيري |
| Qwen3 TTS | أوزان مفتوحة | نعم، مع تصميم الصوت | مجاني للتشغيل محليًا | المشاريع متعددة اللغات |
| MiniMax Voice Cloning | مستضاف | نعم، من 10 ثوانٍ إلى 5 دقائق | خدمة مستضافة | ملفات صوتية قابلة لإعادة الاستخدام |
| Kokoro | مفتوح المصدر | لا | مجاني للتشغيل محليًا | السرد السريع دون اتصال |
| Piper | مفتوح المصدر | لا | مجاني للتشغيل محليًا | الأجهزة دون اتصال |
| XTTS-v2 | أوزان مفتوحة، غير تجاري | نعم | مجاني للاستخدام الشخصي | المشاريع الشخصية |
الحكم الصريح: ما زال ElevenLabs يضع المعيار في الصقل وتغطية اللغات، ولا ينبغي لأحد أن يتظاهر بغير ذلك. ما تغيّر هو الفجوة. بالنسبة لمقدمات البودكاست وفيديوهات المنتجات والشروحات وأصوات الشخصيات، تبدو الخيارات أعلاه جيدة بما يكفي ليصبح العامل الحاسم هو التكلفة والترخيص والتحكم، لا الجودة الخام. شغّل نصك الخاص على اثنين أو ثلاثة منها قبل أن تدفع مقابل أي شيء.

الاختيار حسب حالة الاستخدام

ما وراء الكلام: الموسيقى والنصوص المفرّغة
يبيع ElevenLabs أيضًا توليد الموسيقى والتفريغ النصي، لذلك يجب أن يتعامل البديل المنصف مع هاتين المهمتين كذلك. وكلاهما متاح على PicassoIA.
موسيقى دون صداع التراخيص
يحتاج التعليق الصوتي غالبًا إلى مسار موسيقي تحته. تولّد هذه النماذج الموسيقى من أمر نصي:

تحويل الصوت إلى نص
يغلق التفريغ النصي الدائرة. يقبل GPT-4o Transcribe ملفات MP3 و MP4 و WAV و M4A و OGG و WebM، ويأخذ رمز اللغة وفق ISO لدقة أعلى، ويقبل أمرًا نصيًا قصيرًا للأسلوب. GPT-4o Mini Transcribe هو الخيار الأخف، وGemini 3 Pro يقدم نصوصًا مفرّغة دقيقة أيضًا.

تشمل الاستخدامات العملية:
- التأكد من أن الصوت المستنسخ قرأ نصك كلمة بكلمة.
- إضافة ترجمات إلى فيديو مسرود.
- تحويل حلقات البودكاست إلى مقالات مكتوبة.
- تدوين المقابلات التي سجلتها بهاتفك.
ابنِ أول تعليق صوتي لك اليوم
لا تحتاج إلى اشتراك شهري لتحصل على صوت اصطناعي مقنع. اختر نصًا قصيرًا واحدًا، واستنسخ صوتًا عبر Chatterbox أو MiniMax Voice Cloning، وضع تحته مسارًا من Stable Audio 2.5، وتحقق من النتيجة عبر GPT-4o Transcribe. يستغرق هذا المسار دقائق، لا عصرًا كاملًا.
يجمع PicassoIA نماذج الكلام والموسيقى والتفريغ النصي في مكان واحد، فيمكنك مقارنتها على نصك الخاص بدلًا من الاعتماد على ورقة المواصفات. افتح قائمة النماذج الكاملة، وسجّل عينة مدتها عشر ثوانٍ، واستمع إلى ما يفعله صوتك بفقرة جديدة. جرّب المنزلقات، وجرّب صوتًا ثانيًا، واحتفظ بالتسجيل الذي يشبهك أكثر.