كيف تستخدم ElevenLabs لتوليد الأصوات مجانًا دون أن تنفق شيئًا
شرح مفصّل لأدوات ElevenLabs المجانية لتوليد الأصوات: إعداد الحساب، والحدود الشهرية للأحرف، واستنساخ الصوت الفوري، وتكامل API، وأفضل البدائل المجانية عندما لا تكفيك 10,000 حرف شهريًا.
شرح مفصّل لأدوات ElevenLabs المجانية لتوليد الأصوات: إعداد الحساب، والحدود الشهرية للأحرف، واستنساخ الصوت الفوري، وتكامل API، وأفضل البدائل المجانية عندما لا تكفيك 10,000 حرف شهريًا.
الفجوة بين تحويل النص إلى كلام الآلي والأصوات التي تخدع الناس فعلًا أُغلقت قبل عامين تقريبًا. لم تكتفِ ElevenLabs بإغلاقها، بل فتحت آفاقًا أوسع على الجانب الآخر. المشكلة أن معظم الناس يصلون إلى سقف الباقة المجانية قبل أن يكتشفوا ما تستطيع هذه التقنية فعله حقًا. يشرح هذا المقال بالتفصيل كيفية استخدام ElevenLabs لتوليد الأصوات مجانًا، وما تعنيه الحدود عمليًا، وإلى أين تتجه عندما لا تكفي 10,000 حرف شهريًا.
تقدم ElevenLabs مستوى مجانيًا مفيدًا فعلًا، وليس مجرد نسخة تجريبية. إليك ما تحصل عليه دون إدخال بطاقة ائتمان:
تتضمن الباقة المجانية 10,000 حرف شهريًا. قد يبدو ذلك كثيرًا. عمليًا، تعادل 10,000 حرف تقريبًا:
عند استنفاد هذه الأحرف يتوقف التوليد حتى إعادة التعيين الشهرية. تُعاد ضبط العداد في اليوم نفسه من التقويم الذي أنشأت فيه حسابك، وليس في اليوم الأول من الشهر.
تمنحك الباقة المجانية إمكانية الوصول إلى:
ما لا تشمله الباقة المجانية: استنساخ الصوت الاحترافي (نموذج الدقة العالية)، وحقوق الترخيص التجاري، وأداة Projects للكتب الصوتية الطويلة، والدبلجة (Dubbing)، وصيغ جودة صوت أعلى مثل PCM أو FLAC.
| الميزة | مجانية | Starter (5 دولارات/شهر) | Creator (22 دولارًا/شهر) |
|---|---|---|---|
| الأحرف شهريًا | 10,000 | 30,000 | 100,000 |
| الترخيص التجاري | لا | نعم | نعم |
| استنساخ الصوت الاحترافي | لا | لا | نعم |
| جودة الصوت | 128kbps | 192kbps | 192kbps |
| أداة Projects | لا | لا | نعم |
فجوة الترخيص التجاري هي الأهم. أي محتوى تولّده بالباقة المجانية لا يمكن نظريًا استخدامه في منتجات مدفوعة، أو أعمال للعملاء، أو محتوى مُحقَّق الدخل.
يستغرق الإعداد نحو دقيقتين.

لا تُطلب بطاقة ائتمان في هذه الخطوة. لا تطلب المنصة معلومات الدفع إلا عندما تختار الترقية.
تصنّف مكتبة الأصوات في اللوحة اليسرى حسب:
💡 صفِّ حسب "Conversational" للمحتوى الاجتماعي، و"Narration" للنصوص الطويلة. تميل فئة "News" إلى أن تكون الأكثر حيادًا وجدية في المحتوى الإخباري.

الواجهة الرئيسية بسيطة. الصق نصك في منطقة النص الكبيرة، واختر صوتًا من الشريط الجانبي، واضغط Generate. الفروق الدقيقة الحقيقية موجودة في لوحة الإعدادات أسفل مربع النص:
يتجاهل معظم المبتدئين هذه المنزلقات ثم يتساءلون لماذا يبدو الصوت باهتًا. Stability له أكبر تأثير. إذا بدا صوتك آليًا ومتساويًا، فاخفضه نحو 0.4. وإذا بدا متقلبًا وغير متوقع، فارفعه نحو 0.8.
💡 أضف فترات صمت طبيعية إلى نصك باستخدام علامة الحذف
...أو نقطة متبوعة بمسافة. في الباقات المدفوعة يعمل بناء SSML مثل<break time="1.0s" />، لكن حيل علامات الترقيم البسيطة هذه فعّالة في الباقة المجانية أيضًا.
بعد التوليد، يظهر مشغّل صوت أخضر أسفل مربع النص. اضغط على أيقونة Download (سهم يشير إلى الأسفل) لحفظ الملف بصيغة MP3. يُسمّى الملف بطابع زمني. لا يوجد تنزيل جماعي، لذا إذا ولّدت 10 مقاطع فستنزلها واحدًا تلو الآخر.

هنا تكتسب ElevenLabs سمعتها. حتى الباقة المجانية تمنحك استنساخ الصوت الفوري، وهو أكثر إثارة للإعجاب مما يتوقعه معظم الناس.
ينشئ استنساخ الصوت الفوري (IVC) نموذج صوت من عينة صوتية ترفعها. وهو أقل دقة من نموذج استنساخ الصوت الاحترافي (الذي يتطلب أكثر من 30 دقيقة من صوت نظيف، وهو ميزة مدفوعة)، لكنه يكفي تمامًا لمعظم الحالات.
انتقل إلى Voices > Add Voice > Instant Voice Clone، ثم ارفع:
تعتمد جودة الاستنساخ كليًا على جودة الصوت المصدر. مقطع مسجّل بهاتف ذكي في غرفة هادئة يتفوق على تسجيل احترافي في مساحة ذات صدى. موسيقى الخلفية هي أكبر عدو لدقة الاستنساخ.
💡 سجّل داخل خزانة ملابس محاطًا بالملابس المعلّقة. القماش يمتص الانعكاسات الصوتية أفضل من معظم إعدادات الألواح الإسفنجية، ولا يكلّف شيئًا.
في الباقة المجانية يمكنك إنشاء حتى 3 أصوات مستنسخة. لإنشاء رابع، يجب حذف أحد الأصوات الثلاثة الموجودة. تُحفظ الأصوات المستنسخة في حسابك فقط ولا يمكن مشاركتها علنًا. يُحتسب الصوت المولّد من صوت مستنسخ ضمن حصة 10,000 حرف الشهرية مثل الأصوات الجاهزة تمامًا.

تتضمن الطبقة المجانية وصولًا إلى API. يفاجئ هذا كثيرًا من المطورين الذين يفترضون أن واجهات API تكون دائمًا خلف جدار دفع.
يشارك مفتاح API المجاني حصة 10,000 حرف الشهرية نفسها مع واجهة الويب. لا توجد حصة منفصلة لواجهة API. كل حرف يُولَّد عبر API يقلل ما يمكنك توليده في المتصفح، والعكس صحيح.
نقطة نهاية API لتحويل النص إلى كلام هي:
POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}
تستخدم المصادقة ترويسة xi-api-key مع مفتاحك من صفحة Profile Settings.
Python:
import requests
url = "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID"
headers = {
"xi-api-key": "YOUR_API_KEY",
"Content-Type": "application/json"
}
payload = {
"text": "Your script here",
"model_id": "eleven_multilingual_v2",
"voice_settings": {"stability": 0.6, "similarity_boost": 0.8}
}
response = requests.post(url, json=payload, headers=headers)
with open("output.mp3", "wb") as f:
f.write(response.content)
JavaScript (Node.js):
const response = await fetch(
`https://api.elevenlabs.io/v1/text-to-speech/${voiceId}`,
{
method: 'POST',
headers: { 'xi-api-key': apiKey, 'Content-Type': 'application/json' },
body: JSON.stringify({ text: script, model_id: 'eleven_multilingual_v2' })
}
);
const buffer = await response.arrayBuffer();
الوصول إلى API بدون تكلفة عملي في:
لا تبنِ منتجًا إنتاجيًا يواجه العملاء اعتمادًا على API المجاني. سقف 10,000 حرف حدّ صارم بلا فترة سماح.

يصل معظم الناس إلى الحد المجاني أسرع مما يتوقعون. إليك كيفية حساب احتياجاتك الشهرية الفعلية وثلاث طرق لتمديد حصتك.
احسب الأحرف في نصوصك، لا الكلمات. متوسط طول الكلمة الإنجليزية نحو 5 أحرف مع المسافة التي تليها.
| نوع المحتوى | متوسط الطول | الأحرف المستخدمة |
|---|---|---|
| مقطع اجتماعي مدته 60 ثانية | ~130 كلمة | ~780 حرف |
| سرد صوتي لفيديو على YouTube مدته 5 دقائق | ~700 كلمة | ~4,200 حرف |
| حلقة بودكاست مدتها 10 دقائق | ~1,400 كلمة | ~8,400 حرف |
| فصل كامل من كتاب مسموع | ~3,500 كلمة | ~21,000 حرف |
حلقة بودكاست واحدة مدتها 10 دقائق تستهلك 84% من حصتك الشهرية المجانية. حلقتان، وتكون قد انتهيت من الشهر قبل انتهاء الأسبوع الثاني.
1. اكتب نصوصًا أكثر إيجازًا. احذف الكلمات الحشوية قبل التوليد. كل عبارة غير ضرورية تستهلك أحرفًا. حرّر أولًا، ثم ولّد.
2. أنشئ حسابات مجانية متعددة. كل عنوان بريد إلكتروني جديد يحصل على 10,000 حرف جديدة. ليس أنيقًا، لكنه ضمن شروط الخدمة من الناحية التقنية للمشاريع الشخصية. تجنب هذا الأسلوب في الأعمال التجارية.
3. وَلِّد على دفعات في بداية الشهر. تُعاد ضبط حصتك في تاريخ إنشاء حسابك. إذا ولّدت في اليوم الأول، فستحصل على التقويم الشهري كاملًا قبل أن تحين إعادة الضبط التالية.

هذا هو الجزء الذي لا يعرفه معظم مستخدمي ElevenLabs. تشغّل PicassoIA نماذج ElevenLabs نفسها مباشرة على منصتها، إلى جانب مكتبة من محركات TTS المنافسة. وبدلًا من الوصول إلى سقف شهري للأحرف، تدفع مقابل كل توليد، وهذا يكون أرخص بكثير للاستخدام المتقطع أو الكثيف الحجم.
ElevenLabs v3 هو النموذج الأكثر تعبيرًا بين نماذج ElevenLabs، بمدى عاطفي غني وأكثر الإيقاعات الصوتية طبيعية بين جميع الإصدارات. على PicassoIA تصل إليه مباشرة دون الحاجة إلى حساب ElevenLabs أو متابعة عدّاد شهرك. وهو الخيار الأفضل للسرد الطويل، وحوار الشخصيات، وأي محتوى تكون فيه عاطفة الصوت هي الرسالة.
يدعم ElevenLabs v2 Multilingual أكثر من 30 لغة بجودة لهجة ثابتة. إذا كان محتواك موجّهًا إلى جمهور غير ناطق بالإنجليزية، فهذا النموذج يتعامل مع الإسبانية والفرنسية والألمانية والبرتغالية واليابانية والكورية وغيرها، دون تسرّب اللهجة الذي يعاني منه كثير من أنظمة TTS متعددة اللغات.

عندما يكون زمن الإنجاز أهم من أعلى جودة عاطفية، يقدّم ElevenLabs Flash v2.5 توليفًا شبه فوري بزمن استجابة منخفض جدًا. وهو مصمم للتطبيقات الفورية: الترجمة الحية، والتطبيقات التفاعلية، وسيناريوهات البث. تبقى جودة المخرجات ممتازة، لكنها لا تبلغ العمق العاطفي الكامل للإصدار v3.
يقع ElevenLabs Turbo v2.5 بين Flash والإصدار الكامل v3 في المفاضلة بين السرعة والجودة، ويدعم 32 لغة بتوليد أسرع من النموذج القياسي.
ElevenLabs ليست الخيار القوي الوحيد في المجموعة. تتفوق عدة نماذج عليها في مجالات محددة:
💡 متى تستخدم أيًّا منها: ElevenLabs v3 للسرد العاطفي باللغة الإنجليزية. Gemini 3.1 Flash TTS للتوسع متعدد اللغات. Inworld Realtime TTS 2 للتطبيقات المباشرة والفورية. Minimax Speech 2.8 HD للمخرجات بجودة الكتب الصوتية.

توليد الصوت ليس سوى نصف المعادلة. إذا كنت تنتج محتوى صوتيًا، فستحتاج أيضًا إلى استخراج النص منه، سواء للترجمات المصاحبة أو إعادة الاستخدام أو التحرير حسب النص المفرّغ. تتعامل نماذج تحويل الكلام إلى نص في PicassoIA مع هذا الجانب من سير العمل أيضًا.
GPT-4o Transcribe هو أفضل نموذج للتفريغ لدى OpenAI، بأقل معدلات أخطاء الكلمات عبر اللهجات ومستويات جودة الصوت المتغيّرة. يتعامل مع الضوضاء الخلفية والمتحدثين المتعددين والمفردات التقنية بشكل أفضل من النماذج الأقدم المبنية على Whisper. للمقاطع الصوتية القصيرة والمتوسطة التي تقل عن 30 دقيقة، يُعد هذا الخيار الافتراضي.
يقدّم GPT-4o Mini Transcribe دقة مماثلة بتكلفة أقل، ويناسب أعمال التفريغ عالية الحجم حيث تعالج ملفات كثيرة في جلسة واحدة.
يتعامل Gemini 3 Pro مع ملفات الصوت الطويلة بنافذة سياق ضخمة، مما يجعله الخيار الصحيح للمقابلات الكاملة، والاجتماعات المسجّلة، وحلقات البودكاست التي تمتد لساعة. كما يُخرج نصوصًا مفرّغة منظمة تتضمن تحديد المتحدثين وعلامات التوقيت.
💡 سير العمل: ولّد النص عبر ElevenLabs v3 أو Minimax Speech 2.8 HD، ثم أنتج المحتوى، وشغّل Gemini 3 Pro على الصوت النهائي لإنشاء نص مفرّغ مع ترجمات لأغراض إمكانية الوصول وتحسين محركات البحث.

الطبقة المجانية من ElevenLabs أداة حقيقية بجودة مخرجات حقيقية. حدّ 10,000 حرف هو السقف الصادق، وليس نسخة معاينة مقيّدة عمدًا. للمشاريع الشخصية، والسرد العرضي، وتجارب API الأولية، يصمد هذا الحد. وعندما يصبح هذا السقف مشكلة، تتوفر نماذج ElevenLabs نفسها على PicassoIA دون حسابات الحصة الشهرية، إلى جانب أكثر من 20 محرك تحويل نص إلى كلام آخر لكل حالة استخدام.
النقطة الأوسع أن جودة الصوت بالذكاء الاصطناعي تجاوزت التصور الذهني لدى معظم الناس عن شكل تحويل النص إلى كلام. أصبح الحاجز أمام السرد الاحترافي والمحتوى متعدد اللغات والأصوات الواقعية للشخصيات مسألة معرفة أي نموذج تختاره وأين تصل إليه.
تجمع PicassoIA أكثر من 23 نموذجًا لتحويل النص إلى كلام، من ElevenLabs v3 وFlash v2.5 إلى Minimax Speech 2.8 HD وInworld Realtime TTS 2 وGemini 3.1 Flash TTS وChatterbox، إلى جانب ثلاثة نماذج لتحويل الكلام إلى نص للتفريغ. تصفح المجموعة كاملة على picassoia.com/en/all-models وولّد مقطعًا صوتيًا كان يتطلب في السابق استوديو احترافيًا لإنتاجه.
اختر لغتك