كيف تستخدم ElevenLabs لتوليد الأصوات مجانًا دون أن تنفق شيئًا

شرح مفصّل لأدوات ElevenLabs المجانية لتوليد الأصوات: إعداد الحساب، والحدود الشهرية للأحرف، واستنساخ الصوت الفوري، وتكامل API، وأفضل البدائل المجانية عندما لا تكفيك 10,000 حرف شهريًا.

كيف تستخدم ElevenLabs لتوليد الأصوات مجانًا دون أن تنفق شيئًا
Cristian Da Conceicao
مؤسس Picasso IA

الفجوة بين تحويل النص إلى كلام الآلي والأصوات التي تخدع الناس فعلًا أُغلقت قبل عامين تقريبًا. لم تكتفِ ElevenLabs بإغلاقها، بل فتحت آفاقًا أوسع على الجانب الآخر. المشكلة أن معظم الناس يصلون إلى سقف الباقة المجانية قبل أن يكتشفوا ما تستطيع هذه التقنية فعله حقًا. يشرح هذا المقال بالتفصيل كيفية استخدام ElevenLabs لتوليد الأصوات مجانًا، وما تعنيه الحدود عمليًا، وإلى أين تتجه عندما لا تكفي 10,000 حرف شهريًا.

ما الذي تتضمنه باقة ElevenLabs المجانية فعليًا

تقدم ElevenLabs مستوى مجانيًا مفيدًا فعلًا، وليس مجرد نسخة تجريبية. إليك ما تحصل عليه دون إدخال بطاقة ائتمان:

حصة الأحرف

تتضمن الباقة المجانية 10,000 حرف شهريًا. قد يبدو ذلك كثيرًا. عمليًا، تعادل 10,000 حرف تقريبًا:

  • من 1,500 إلى 1,700 كلمة من المحتوى السردي
  • حلقة بودكاست واحدة مدتها من 7 إلى 10 دقائق
  • نحو 12 إلى 15 تعليقًا صوتيًا قصيرًا لمنصات التواصل الاجتماعي (من 60 إلى 80 كلمة لكل منها)

عند استنفاد هذه الأحرف يتوقف التوليد حتى إعادة التعيين الشهرية. تُعاد ضبط العداد في اليوم نفسه من التقويم الذي أنشأت فيه حسابك، وليس في اليوم الأول من الشهر.

خيارات الأصوات بلا تكلفة

تمنحك الباقة المجانية إمكانية الوصول إلى:

  • أكثر من 30 صوتًا جاهزًا بأعمار وأجناس ولهجات مختلفة
  • استنساخ الصوت الفوري: حتى 3 أصوات مخصصة
  • 10 لغات للتوليد القياسي
  • جودة صوت قياسية بصيغة MP3 بمعدل 128kbps

ما لا تشمله الباقة المجانية: استنساخ الصوت الاحترافي (نموذج الدقة العالية)، وحقوق الترخيص التجاري، وأداة Projects للكتب الصوتية الطويلة، والدبلجة (Dubbing)، وصيغ جودة صوت أعلى مثل PCM أو FLAC.

ما لا يمكنك فعله مجانًا

الميزةمجانيةStarter (5 دولارات/شهر)Creator (22 دولارًا/شهر)
الأحرف شهريًا10,00030,000100,000
الترخيص التجاريلانعمنعم
استنساخ الصوت الاحترافيلالانعم
جودة الصوت128kbps192kbps192kbps
أداة Projectsلالانعم

فجوة الترخيص التجاري هي الأهم. أي محتوى تولّده بالباقة المجانية لا يمكن نظريًا استخدامه في منتجات مدفوعة، أو أعمال للعملاء، أو محتوى مُحقَّق الدخل.

كيفية إعداد حسابك المجاني في ElevenLabs

يستغرق الإعداد نحو دقيقتين.

امرأة تسجل حسابًا على حاسوب محمول على مكتب خشبي كريمي

إنشاء الحساب خطوة بخطوة

  1. انتقل إلى elevenlabs.io واضغط على Sign Up
  2. أدخل بريدك الإلكتروني أو استخدم تسجيل الدخول عبر Google أو GitHub
  3. أكّد بريدك الإلكتروني عبر رابط التحقق
  4. سجّل الدخول وستصل مباشرة إلى صفحة Speech Synthesis

لا تُطلب بطاقة ائتمان في هذه الخطوة. لا تطلب المنصة معلومات الدفع إلا عندما تختار الترقية.

اختيار أول صوت لك

تصنّف مكتبة الأصوات في اللوحة اليسرى حسب:

  • الجنس: ذكر، أنثى، غير ثنائي
  • العمر: شاب، متوسط العمر، كبير السن
  • اللهجة: أمريكية، بريطانية، أسترالية، هندية، وغيرها
  • حالة الاستخدام: سرد، أخبار، محادثة، شخصيات

💡 صفِّ حسب "Conversational" للمحتوى الاجتماعي، و"Narration" للنصوص الطويلة. تميل فئة "News" إلى أن تكون الأكثر حيادًا وجدية في المحتوى الإخباري.

توليد أول صوت مجاني لك

لوحة استخدام حصة الصوت على شاشة حاسوب MacBook على مكتب كريمي

واجهة تحويل النص إلى كلام

الواجهة الرئيسية بسيطة. الصق نصك في منطقة النص الكبيرة، واختر صوتًا من الشريط الجانبي، واضغط Generate. الفروق الدقيقة الحقيقية موجودة في لوحة الإعدادات أسفل مربع النص:

  • Stability: يتحكم في مدى ثبات الصوت عبر الجمل. القيمة الأقل تعني تعبيرًا أكبر، والأعلى يعني رتابة أكثر. الإعداد بين 0.5 و0.65 نقطة بداية قوية.
  • Similarity Enhancement: مدى تطابق المخرجات مع عينة الصوت الأصلية. أبقِه فوق 0.75 للحصول على أفضل النتائج.
  • Style Exaggeration: يضخّم الأسلوب الطبيعي للصوت. مفيد للسرد الدرامي، لكنه محفوف بالمخاطر في محتوى الأعمال.

ضبط إعدادات الصوت

يتجاهل معظم المبتدئين هذه المنزلقات ثم يتساءلون لماذا يبدو الصوت باهتًا. Stability له أكبر تأثير. إذا بدا صوتك آليًا ومتساويًا، فاخفضه نحو 0.4. وإذا بدا متقلبًا وغير متوقع، فارفعه نحو 0.8.

💡 أضف فترات صمت طبيعية إلى نصك باستخدام علامة الحذف ... أو نقطة متبوعة بمسافة. في الباقات المدفوعة يعمل بناء SSML مثل <break time="1.0s" />، لكن حيل علامات الترقيم البسيطة هذه فعّالة في الباقة المجانية أيضًا.

تنزيل ملف الصوت

بعد التوليد، يظهر مشغّل صوت أخضر أسفل مربع النص. اضغط على أيقونة Download (سهم يشير إلى الأسفل) لحفظ الملف بصيغة MP3. يُسمّى الملف بطابع زمني. لا يوجد تنزيل جماعي، لذا إذا ولّدت 10 مقاطع فستنزلها واحدًا تلو الآخر.

استنساخ الصوت المجاني في ElevenLabs

رجل يتحدث في ميكروفون مكثف كبير الغشاء في استوديو تسجيل

هنا تكتسب ElevenLabs سمعتها. حتى الباقة المجانية تمنحك استنساخ الصوت الفوري، وهو أكثر إثارة للإعجاب مما يتوقعه معظم الناس.

أساسيات استنساخ الصوت الفوري

ينشئ استنساخ الصوت الفوري (IVC) نموذج صوت من عينة صوتية ترفعها. وهو أقل دقة من نموذج استنساخ الصوت الاحترافي (الذي يتطلب أكثر من 30 دقيقة من صوت نظيف، وهو ميزة مدفوعة)، لكنه يكفي تمامًا لمعظم الحالات.

انتقل إلى Voices > Add Voice > Instant Voice Clone، ثم ارفع:

  • ملف WAV أو MP3
  • صوتًا نظيفًا بين 30 ثانية و5 دقائق
  • متحدثًا واحدًا مع أقل قدر من الضوضاء الخلفية
  • إيقاع قراءة طبيعي يعمل بشكل أفضل من الكلام العفوي

ما تحتاجه

تعتمد جودة الاستنساخ كليًا على جودة الصوت المصدر. مقطع مسجّل بهاتف ذكي في غرفة هادئة يتفوق على تسجيل احترافي في مساحة ذات صدى. موسيقى الخلفية هي أكبر عدو لدقة الاستنساخ.

💡 سجّل داخل خزانة ملابس محاطًا بالملابس المعلّقة. القماش يمتص الانعكاسات الصوتية أفضل من معظم إعدادات الألواح الإسفنجية، ولا يكلّف شيئًا.

حدود الباقة المجانية

في الباقة المجانية يمكنك إنشاء حتى 3 أصوات مستنسخة. لإنشاء رابع، يجب حذف أحد الأصوات الثلاثة الموجودة. تُحفظ الأصوات المستنسخة في حسابك فقط ولا يمكن مشاركتها علنًا. يُحتسب الصوت المولّد من صوت مستنسخ ضمن حصة 10,000 حرف الشهرية مثل الأصوات الجاهزة تمامًا.

استخدام ElevenLabs API مجانًا

مطوّر أمام محطة عمل بشاشتين تعرض كود API

تتضمن الطبقة المجانية وصولًا إلى API. يفاجئ هذا كثيرًا من المطورين الذين يفترضون أن واجهات API تكون دائمًا خلف جدار دفع.

حدود طبقة API المجانية

يشارك مفتاح API المجاني حصة 10,000 حرف الشهرية نفسها مع واجهة الويب. لا توجد حصة منفصلة لواجهة API. كل حرف يُولَّد عبر API يقلل ما يمكنك توليده في المتصفح، والعكس صحيح.

نقطة نهاية API لتحويل النص إلى كلام هي:

POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}

تستخدم المصادقة ترويسة xi-api-key مع مفتاحك من صفحة Profile Settings.

إعداد Python و JavaScript

Python:

import requests

url = "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID"
headers = {
    "xi-api-key": "YOUR_API_KEY",
    "Content-Type": "application/json"
}
payload = {
    "text": "Your script here",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {"stability": 0.6, "similarity_boost": 0.8}
}
response = requests.post(url, json=payload, headers=headers)
with open("output.mp3", "wb") as f:
    f.write(response.content)

JavaScript (Node.js):

const response = await fetch(
  `https://api.elevenlabs.io/v1/text-to-speech/${voiceId}`,
  {
    method: 'POST',
    headers: { 'xi-api-key': apiKey, 'Content-Type': 'application/json' },
    body: JSON.stringify({ text: script, model_id: 'eleven_multilingual_v2' })
  }
);
const buffer = await response.arrayBuffer();

أفضل حالات الاستخدام ضمن الحد المجاني

الوصول إلى API بدون تكلفة عملي في:

  • النماذج الأولية: اختبر تكامل الصوت في تطبيقك قبل الالتزام بباقة مدفوعة
  • الأتمتة منخفضة الحجم: سكربت يولّد تعليقًا صوتيًا يوميًا واحدًا لأداة داخلية
  • المشاريع الشخصية: مقاطع مقدمة البودكاست، وأصوات الإشعارات، وتطبيقات المساعد الشخصي

لا تبنِ منتجًا إنتاجيًا يواجه العملاء اعتمادًا على API المجاني. سقف 10,000 حرف حدّ صارم بلا فترة سماح.

عندما لا تكفي 10,000 حرف

صديقان يستمعان إلى صوت معًا في مقهى أمام حاسوب MacBook

يصل معظم الناس إلى الحد المجاني أسرع مما يتوقعون. إليك كيفية حساب احتياجاتك الشهرية الفعلية وثلاث طرق لتمديد حصتك.

حساب احتياجاتك الشهرية

احسب الأحرف في نصوصك، لا الكلمات. متوسط طول الكلمة الإنجليزية نحو 5 أحرف مع المسافة التي تليها.

نوع المحتوىمتوسط الطولالأحرف المستخدمة
مقطع اجتماعي مدته 60 ثانية~130 كلمة~780 حرف
سرد صوتي لفيديو على YouTube مدته 5 دقائق~700 كلمة~4,200 حرف
حلقة بودكاست مدتها 10 دقائق~1,400 كلمة~8,400 حرف
فصل كامل من كتاب مسموع~3,500 كلمة~21,000 حرف

حلقة بودكاست واحدة مدتها 10 دقائق تستهلك 84% من حصتك الشهرية المجانية. حلقتان، وتكون قد انتهيت من الشهر قبل انتهاء الأسبوع الثاني.

ثلاث طرق لتمديد الباقة المجانية

1. اكتب نصوصًا أكثر إيجازًا. احذف الكلمات الحشوية قبل التوليد. كل عبارة غير ضرورية تستهلك أحرفًا. حرّر أولًا، ثم ولّد.

2. أنشئ حسابات مجانية متعددة. كل عنوان بريد إلكتروني جديد يحصل على 10,000 حرف جديدة. ليس أنيقًا، لكنه ضمن شروط الخدمة من الناحية التقنية للمشاريع الشخصية. تجنب هذا الأسلوب في الأعمال التجارية.

3. وَلِّد على دفعات في بداية الشهر. تُعاد ضبط حصتك في تاريخ إنشاء حسابك. إذا ولّدت في اليوم الأول، فستحصل على التقويم الشهري كاملًا قبل أن تحين إعادة الضبط التالية.

PicassoIA: أصوات ElevenLabs بلا سقف شهري

شابة تستمع بسماعات أذن على أريكة كريمية مع حاسوب محمول

هذا هو الجزء الذي لا يعرفه معظم مستخدمي ElevenLabs. تشغّل PicassoIA نماذج ElevenLabs نفسها مباشرة على منصتها، إلى جانب مكتبة من محركات TTS المنافسة. وبدلًا من الوصول إلى سقف شهري للأحرف، تدفع مقابل كل توليد، وهذا يكون أرخص بكثير للاستخدام المتقطع أو الكثيف الحجم.

ElevenLabs v3 على PicassoIA

ElevenLabs v3 هو النموذج الأكثر تعبيرًا بين نماذج ElevenLabs، بمدى عاطفي غني وأكثر الإيقاعات الصوتية طبيعية بين جميع الإصدارات. على PicassoIA تصل إليه مباشرة دون الحاجة إلى حساب ElevenLabs أو متابعة عدّاد شهرك. وهو الخيار الأفضل للسرد الطويل، وحوار الشخصيات، وأي محتوى تكون فيه عاطفة الصوت هي الرسالة.

ElevenLabs v2 متعدد اللغات

يدعم ElevenLabs v2 Multilingual أكثر من 30 لغة بجودة لهجة ثابتة. إذا كان محتواك موجّهًا إلى جمهور غير ناطق بالإنجليزية، فهذا النموذج يتعامل مع الإسبانية والفرنسية والألمانية والبرتغالية واليابانية والكورية وغيرها، دون تسرّب اللهجة الذي يعاني منه كثير من أنظمة TTS متعددة اللغات.

منظر علوي لمكتب يعرض واجهة اختيار نموذج الصوت على حاسوب محمول

ElevenLabs Flash v2.5 للسرعة

عندما يكون زمن الإنجاز أهم من أعلى جودة عاطفية، يقدّم ElevenLabs Flash v2.5 توليفًا شبه فوري بزمن استجابة منخفض جدًا. وهو مصمم للتطبيقات الفورية: الترجمة الحية، والتطبيقات التفاعلية، وسيناريوهات البث. تبقى جودة المخرجات ممتازة، لكنها لا تبلغ العمق العاطفي الكامل للإصدار v3.

يقع ElevenLabs Turbo v2.5 بين Flash والإصدار الكامل v3 في المفاضلة بين السرعة والجودة، ويدعم 32 لغة بتوليد أسرع من النموذج القياسي.

نماذج TTS الرائدة الأخرى على PicassoIA

ElevenLabs ليست الخيار القوي الوحيد في المجموعة. تتفوق عدة نماذج عليها في مجالات محددة:

  • Minimax Speech 2.8 HD: مخرجات بجودة استوديو مع إيقاع تنفّس طبيعي بشكل خاص. ممتاز للكتب الصوتية والسرد الطويل.
  • Gemini 3.1 Flash TTS: 30 صوتًا مدمجًا عبر أكثر من 70 لغة. نموذج Google صاحب أوسع تغطية لغوية متاحة في أي مكان.
  • Inworld Realtime TTS 2: زمن استجابة أقل من 100 ميلي ثانية للتطبيقات المباشرة. الأسرع في المجموعة لحالات الاستخدام الفورية.
  • Qwen3 TTS: استنساخ صوت قوي مع تحكم في العاطفة، من فريق أبحاث الذكاء الاصطناعي في Alibaba.
  • Chatterbox: توليف صوتي بتحكم عاطفي من Resemble AI، مع تحكم دقيق في معاملات السعادة والحزن والغضب والحماس.
  • Play Dialog: محسّن للحوار الطبيعي متعدد المتحدثين، مثالي للمحادثات المكتوبة ومحتوى على طراز البودكاست.
  • Minimax Voice Cloning: أنشئ صوت ذكاء اصطناعي مخصصًا من عينة قصيرة دون حد شهري للصوت المولّد.

💡 متى تستخدم أيًّا منها: ElevenLabs v3 للسرد العاطفي باللغة الإنجليزية. Gemini 3.1 Flash TTS للتوسع متعدد اللغات. Inworld Realtime TTS 2 للتطبيقات المباشرة والفورية. Minimax Speech 2.8 HD للمخرجات بجودة الكتب الصوتية.

تفريغ الصوت مجانًا أيضًا

هاتف ذكي يعرض تصورًا لموجة صوتية وهو في اليد خارج المنزل

توليد الصوت ليس سوى نصف المعادلة. إذا كنت تنتج محتوى صوتيًا، فستحتاج أيضًا إلى استخراج النص منه، سواء للترجمات المصاحبة أو إعادة الاستخدام أو التحرير حسب النص المفرّغ. تتعامل نماذج تحويل الكلام إلى نص في PicassoIA مع هذا الجانب من سير العمل أيضًا.

GPT-4o Transcribe على PicassoIA

GPT-4o Transcribe هو أفضل نموذج للتفريغ لدى OpenAI، بأقل معدلات أخطاء الكلمات عبر اللهجات ومستويات جودة الصوت المتغيّرة. يتعامل مع الضوضاء الخلفية والمتحدثين المتعددين والمفردات التقنية بشكل أفضل من النماذج الأقدم المبنية على Whisper. للمقاطع الصوتية القصيرة والمتوسطة التي تقل عن 30 دقيقة، يُعد هذا الخيار الافتراضي.

يقدّم GPT-4o Mini Transcribe دقة مماثلة بتكلفة أقل، ويناسب أعمال التفريغ عالية الحجم حيث تعالج ملفات كثيرة في جلسة واحدة.

Gemini 3 Pro للتسجيلات الطويلة

يتعامل Gemini 3 Pro مع ملفات الصوت الطويلة بنافذة سياق ضخمة، مما يجعله الخيار الصحيح للمقابلات الكاملة، والاجتماعات المسجّلة، وحلقات البودكاست التي تمتد لساعة. كما يُخرج نصوصًا مفرّغة منظمة تتضمن تحديد المتحدثين وعلامات التوقيت.

💡 سير العمل: ولّد النص عبر ElevenLabs v3 أو Minimax Speech 2.8 HD، ثم أنتج المحتوى، وشغّل Gemini 3 Pro على الصوت النهائي لإنشاء نص مفرّغ مع ترجمات لأغراض إمكانية الوصول وتحسين محركات البحث.

ابدأ توليد أصوات حقيقية الآن

رجل أعمال محترف واثق بسماعات حول رقبته أمام نافذة مكتب ممسكًا بفنجان قهوة

الطبقة المجانية من ElevenLabs أداة حقيقية بجودة مخرجات حقيقية. حدّ 10,000 حرف هو السقف الصادق، وليس نسخة معاينة مقيّدة عمدًا. للمشاريع الشخصية، والسرد العرضي، وتجارب API الأولية، يصمد هذا الحد. وعندما يصبح هذا السقف مشكلة، تتوفر نماذج ElevenLabs نفسها على PicassoIA دون حسابات الحصة الشهرية، إلى جانب أكثر من 20 محرك تحويل نص إلى كلام آخر لكل حالة استخدام.

النقطة الأوسع أن جودة الصوت بالذكاء الاصطناعي تجاوزت التصور الذهني لدى معظم الناس عن شكل تحويل النص إلى كلام. أصبح الحاجز أمام السرد الاحترافي والمحتوى متعدد اللغات والأصوات الواقعية للشخصيات مسألة معرفة أي نموذج تختاره وأين تصل إليه.

تجمع PicassoIA أكثر من 23 نموذجًا لتحويل النص إلى كلام، من ElevenLabs v3 وFlash v2.5 إلى Minimax Speech 2.8 HD وInworld Realtime TTS 2 وGemini 3.1 Flash TTS وChatterbox، إلى جانب ثلاثة نماذج لتحويل الكلام إلى نص للتفريغ. تصفح المجموعة كاملة على picassoia.com/en/all-models وولّد مقطعًا صوتيًا كان يتطلب في السابق استوديو احترافيًا لإنتاجه.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة