ElevenLabs v4: ما الجديد في الأصوات وواجهة API

أطلقت ElevenLabs نموذجي Eleven v4 وv4 Turbo في 28 سبتمبر 2026. يشرح هذا المقال أكثر من 90 لغة، والوسوم الصوتية القابلة للتكديس، واستنساخ الصوت من 10 ثوانٍ، ومعرّفات النماذج الجديدة، وزمن الاستجابة، والتسعير، ثم يوضح كيف تكتب نصوصًا باستخدام ElevenLabs v3 على PicassoIA اليوم.

ElevenLabs v4: ما الجديد في الأصوات وواجهة API
Cristian Da Conceicao
مؤسس Picasso IA

في 28 سبتمبر 2026، أطلقت ElevenLabs نموذجين للكلام في وقت واحد: Eleven v4 وEleven v4 Turbo. إذا كنت تطوّر ميزات صوتية، أو تسجّل تعليقًا صوتيًا للفيديوهات، أو تدير بودكاست، فالخلاصة السريعة هي: لغات أكثر، ووسوم صوتية يمكنك تكديسها، وحد أعلى أطول للطلب، ونموذج سريع موجّه إلى وكلاء الصوت المباشرين. التفاصيل الأطول موجودة أدناه، مع الأرقام وتغييرات واجهة API وطريقة عملية لتجربة نصوصك اليوم.

💡 تنبيه: تقدّم ElevenLabs خصمًا ترويجيًا لمدة أسبوعين على واجهة API ينتهي في 12 أكتوبر 2026. إذا كنت تخطط لتجربة v4 بحجم كبير، فهذا التاريخ أهم من أي ميزة في هذه الصفحة.

ما هو Eleven v4 فعليًا

أعلنت ElevenLabs النموذجين في اليوم نفسه، وهما متاحان في منصة الوكلاء الخاصة بها، وفي استوديو الإبداع، وعبر واجهة API العامة. الفكرة الأساسية بسيطة: أصوات تبدو كشخص يؤدي دورًا، لا كشخص يقرأ نصًا.

Eleven v4 هو النموذج التعبيري. هو الخيار حين يكون الأداء مهمًا: الكتب الصوتية، والإعلانات التشويقية، وحوارات الشخصيات، والإعلانات. أما Eleven v4 Turbo فيتنازل عن قدر من المدى مقابل السرعة. صُمّم لوكلاء الصوت، وهو النوع من المنتجات التي يجعل فيها توقفٌ مدته نصف ثانية المتصلَ يتساءل إن كانت المكالمة قد انقطعت.

يأتي النموذجان بعد Eleven v3، الذي كان يدعم الوسوم الصوتية المضمّنة أصلًا. يحافظ v4 على هذه الفكرة ويعالج نقاط الضعف: أصوات تنحرف في القراءات الطويلة، وقائمة لغات توقفت عند نحو 70 لغة، وغياب دعم الاستنساخ الاحترافي للأصوات.

مكتب يظهر فيه حاسوب محمول، ونص مطبوع، وسماعات رأس، وقهوة من الأعلى

الأرقام في لمحة

المواصفةEleven v3Eleven v4Eleven v4 Turbo
معرّف نموذج APIeleven_v3eleven_v4eleven_v4_turbo
اللغات70+90+90+
الأحرف لكل طلب5,00010,000غير منشور
السرعةقياسيةقياسيةنحو 150 ms حتى أول كلام
مصمَّم لـالسرد التعبيريالسرد التعبيري، والقراءات الطويلةوكلاء الصوت المباشرون

تأتي هذه الأرقام من منشور إطلاق ElevenLabs، ووثائق النماذج الخاصة بها، والتقارير الصحفية عن الأسبوع الأول. وحيث لا يوجد رقم، فذلك لأن الشركة لم تنشره، وقد وضعتُ عبارة "غير منشور" بدلًا من التخمين.

أصوات متماسكة

وسوم صوتية قابلة للتكديس

الميزة الأبرز هي التوجيه. تكتب الوسوم داخل النص بين أقواس مربعة، ويتفاعل النموذج معها. تقدّم ElevenLabs أمثلة مثل [laughs]، و[said angrily in French accent]، و[light rain]، و[phone buzzing]. لاحظ أن القائمة تجمع بين العاطفة واللهجة والمؤثرات الصوتية في صيغة واحدة.

الجديد هو التكديس. وفقًا لتقرير TechCrunch، يمكنك الآن وضع عدة وسوم متتالية، ويتبع النموذج التسلسل بدلًا من أن يتجاهل كل شيء ما عدا واحدًا. قد يبدو السطر هكذا:

[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.

هذا مثال على الأسلوب، وليس نسخة من الوثائق، لذا اختبر صياغتك أنت. الوسوم القصيرة والملموسة عادةً أكثر أمانًا من الوسوم الشعرية.

الاتساق عبر النصوص الطويلة

إذا سبق أن ولّدت فصلًا على أجزاء، فأنت تعرف المشكلة. السطر 40 يبدو وكأنه لراوٍ مختلف عن السطر 3. تقول ElevenLabs إن v4 يقرأ النبرة والإيقاع وسياق النص كله، ويحافظ على ثبات الصوت، حتى عندما تعيد توليد سطر واحد لاحقًا.

هناك رقم مرتبط بذلك. يذكر موقع The Decoder أن v4 حقق درجة نطق بلغت 91.7 بالمئة مقابل 85.6 بالمئة لـ v3. وهذا رقم من الشركة المصنّعة، لذا اعتبره مؤشرًا على الاتجاه، لا وعدًا بشأن نصّك.

💡 نصيحة: الإنتاجات الطويلة تحتاج خطة للإعادة. ولّد حسب الفقرة، وأبقِ كل فقرة تحت حد الأحرف، وأعد التصيير للأسطر التي لا تعجبك فقط. ثبات v4 مصمَّم ليجعل هذا السير آمنًا.

راوٍ ذكر كبير السن يقرأ كتابًا مطبوعًا أمام ميكروفون في كابينة صوتية صغيرة

أكثر من 90 لغة ولهجة

تنتقل قائمة اللغات من نحو 70 إلى أكثر من 90. يشير TechCrunch إلى تحسّن ملحوظ في الجودة باليابانية، والبرتغالية البرازيلية، والماندرين، والكانتونية، وتذكر التقارير الصحفية لغات جديدة مدعومة مثل المنغولية والأوديا.

هناك تفصيل قد يفوتك. الأصوات المستنسخة التي تتحدث بلغة أخرى تحتفظ بلهجة أصلية في تلك اللغة، ولا تنزلق نحو لهجة صاحب الصوت الأصلي مع تقدّم النص. بالنسبة لمن يوطّن صوت علامة تجارية، فهذا هو الفرق بين قراءة إسبانية مقنعة وقراءة أمريكية بكلمات إسبانية.

أما التصنيفات الخارجية، فتقول ElevenLabs إن v4 يحتل المركز الأول في لوحة متصدرين مستقلة لتوليد الكلام، بدرجة Elo قدرها 1319 حسبما أوردت مقالات الإطلاق. وفي الاختبارات العمياء، تستشهد الشركة بأن نحو 75 بالمئة من المستمعين يفضّلون v4 على النماذج المنافسة، بينما يضع The Decoder النطاق بين 65 و81 بالمئة حسب المنافس.

💡 نظرة واقعية: لوحات المتصدرين تستخدم جملًا اختبارية قصيرة. شغّل نصّك أنت، بلغتك، قبل أن تعتمد أي نموذج لمشروع.

استنساخ الصوت أصبح أفضل

استنساخ فوري من 10 ثوانٍ

تحتاج الاستنساخات الصوتية الفورية إلى 10 ثوانٍ من الصوت فقط. تقول ElevenLabs إن البنية الجديدة تجعل الاستنساخ أسرع، وتحافظ على هوية الصوت بشكل أفضل عبر مقطع أطول. وتساعد مكتبة أصوات أكبر أيضًا: تذكر تقارير الإطلاق أكثر من 17,500 صوت للاختيار منها.

جودة عينة الـ10 ثوانٍ تحدد معظم النتيجة. سجّل في غرفة هادئة بلا موسيقى أو ضجيج مروحة، وحافظ على المسافة نفسها من الميكروفون طوال الوقت، وتحدث بوتيرتك الطبيعية بدلًا من التمثيل. العينة النظيفة والرتيبة تتفوق دائمًا على عينة حيوية لكنها مشوشة.

لقطة مقرّبة من زاوية منخفضة لميكروفون مكثّف مع فلتر رذاذ في استوديو مكسو بالخشب

عودة الاستنساخ الاحترافي

لم يدعم v3 الاستنساخ الاحترافي للأصوات. أما v4 فيدعمه، وهو موجّه إلى أعلى مستويات الدقة: راوٍ سيقرأ صوته المستنسخ مئات الساعات من الصوت.

يتطلب كل استنساخ موافقة موثّقة من صاحب الصوت. وهذه ليست مجرد ملاحظة هامشية. إذا كنت تستنسخ صوتًا لصالح عميل، فاحصل على الإذن كتابةً قبل أن ترفع ثانية واحدة من المقطع الصوتي.

ما الذي يتغير لمطوّري API

معرّفات النماذج والحدود

تغيير النموذج يتطلب تعديل حقل واحد. وفقًا لوثائق ElevenLabs، يبقى هيكل جسم الطلب كما هو، ويتغيّر model_id فقط:

{
  "text": "[laughs] That is not what the invoice said.",
  "model_id": "eleven_v4"
}

استخدم eleven_v4_turbo للنسخة منخفضة الزمن. الحد الأقصى لكل طلب هو 10,000 حرف، وتعادل ElevenLabs ذلك نحو عشر دقائق من الصوت، أي ضعف 5,000 حرف المسموح بها في eleven_v3. يأتي الإخراج بصيغة MP3 أو WAV/PCM أو µ-law، والبث ثنائي الاتجاه عبر WebSocket مدعوم، وهذا مهم إذا كان نصّك يصلك توكنًا توكنًا من نموذج لغوي كبير.

النماذج الأقدم ما زالت متاحة. وفقًا للوثائق، يتعامل eleven_flash_v2_5 مع 40,000 حرف لكل طلب بـ32 لغة وبزمن نحو 75 ms، ويدعم eleven_multilingual_v2 29 لغة. ما زال بإمكانك الوصول إلى الاثنين على PicassoIA عبر Flash v2.5 وv2 Multilingual.

مطوّر برمجيات يكتب على مكتب بشاشتين وأكواد غير واضحة على الشاشات

الزمن والبث

Turbo هو الخبر الأبرز هنا. تذكر ElevenLabs أن متوسط الزمن حتى أول كلام يبلغ نحو 150 ms، ومتوسط زمن التشغيل نحو 100 ms. ويقارن The Decoder ذلك بـ262 ms لـ Cartesia Sonic 3.6.

بالنسبة لوكلاء الصوت، الادعاء الأكثر إثارة للاهتمام يتعلق بالتوقيت. يمكن للنموذج أن يبدأ إنتاج الصوت بمجرد أن يبدأ النموذج اللغوي الذي خلفه في إنتاج إجابته، فيسمع المتصل الرد بينما ما زال باقيه يُكتب.

ثمة تحفظان. لم تنشر ElevenLabs رقم زمن استجابة لـ v4 القياسي، ولم تظهر بعد أي اختبارات مستقلة للزمن. قِس من منطقتك، وبشبكتك أنت، لأن كل أرقام الشركات المصنّعة تستثني ذلك.

التسعير وموعد 12 أكتوبر

سعر القائمة لكل مليون حرف هو 80 دولارًا لنموذج v4 و40 دولارًا لنموذج v4 Turbo. حتى 12 أكتوبر 2026، يخفّض عرض الإطلاق هذه الأسعار إلى 22 دولارًا و11 دولارًا. إليك تكلفة 100,000 حرف، أي نحو 100 دقيقة من الكلام، في كل حالة:

النموذجسعر القائمةسعر الإطلاق100,000 حرف بسعر القائمة100,000 حرف بسعر الإطلاق
Eleven v480 دولارًا لكل مليون22 دولارًا لكل مليون8.00 دولار2.20 دولار
Eleven v4 Turbo40 دولارًا لكل مليون11 دولارًا لكل مليون4.00 دولار1.10 دولار

إذا كنت في مرحلة التقييم، فالخصم يتيح لك تشغيل مقارنة حقيقية بتكلفة منخفضة. وإذا كنت تضع ميزانية لمنتج، فخطّط على أساس سعر القائمة، لأن هذا ما ستدفعه بعد انتهاء العرض.

أي نموذج لأي مهمة

موظّف دعم عملاء مبتسم يرتدي سماعة رأس في مكتب مفتوح ومضيء

الاختيار الصحيح يعتمد على الغرض من الصوت، لا على أحدث النماذج.

المهمةالأنسبالسبب
كتاب صوتي أو سرد طويلEleven v4اتساق الصوت وحد 10,000 حرف
وكيل صوتي أو روبوت هاتفيEleven v4 Turboنحو 150 ms حتى أول كلام
دفعات كبيرة ورخيصة ومتعددة اللغاتFlash v2.540,000 حرف لكل طلب وسعر أقل
مسودات تعبيرية يمكنك تشغيلها اليومEleven v3متاح على PicassoIA الآن
قراءات متعددة اللغات مستقرة ومجرَّبةv2 Multilingualنموذج ناضج بـ29 لغة

تقسيم عملي للفرق الصغيرة: اكتب المسودة على نموذج أسرع وأرخص بينما النص ما زال يتغير، ثم صيّر الصوت النهائي على النموذج التعبيري. يصبح العمل الصوتي مكلفًا حين تعيد توليد فصل كامل بعد كل تعديل، لذا ثبّت الكلمات أولًا، وأنفق الأحرف المدفوعة الثمن في النهاية. وإذا كان منتجك يجمع الحاجتين، مثل دورة مسموعة مع مساعد أسئلة وأجوبة مباشر، يمكنك استخدام v4 للدروس وTurbo للمساعد، لأن النموذجين يشتركان في صيغة الطلب نفسها.

3 أخطاء شائعة

  1. الحكم بناءً على جملة واحدة. سطر تجريبي لا يثبت شيئًا عن فصل من 40 فقرة. اختبر نصّك الأطول والأكثر صعوبة.
  2. استخدام النموذج التعبيري لوكيل مباشر. إذا كان المتصل ينتظر، فـ Turbo هو الأداة الصحيحة حتى لو بدا v4 أغنى قليلًا.
  3. وضع الميزانية على سعر الإطلاق. ينتهي الخصم في 12 أكتوبر 2026. سعّر مشروعك بـ80 دولارًا و40 دولارًا لكل مليون حرف.

كيف تستخدم ElevenLabs v3 على PicassoIA

وقت كتابة هذا المقال، لا يوجد v4 في كتالوج PicassoIA. أما ElevenLabs v3 فموجود، وهو أقرب نموذج إليه: من العائلة نفسها، ويتبع العادة ذاتها في قراءة التوجيه المضمّن. هذا يجعله مكانًا جيدًا لكتابة النصوص وتجربة الأصوات بينما يصل v4 إلى منصات أكثر.

خطوة بخطوة

  1. افتح صفحة ElevenLabs v3 ضمن مجموعة تحويل النص إلى كلام.
  2. الصق نصك في حقل Prompt.
  3. اختر voice من القائمة التي تضم 26 خيارًا. الصوت الافتراضي هو Rachel، ومن الخيارات الأخرى Aria وRoger وSarah وJames.
  4. حدد language code، على سبيل المثال en أو es أو fr.
  5. اترك أشرطة التمرير على قيمها الافتراضية في التشغيل الأول، ثم اضغط توليد واستمع.
  6. اضبط إعدادًا واحدًا في كل مرة ثم ولّد من جديد. تغيير ثلاثة أشياء في وقت واحد لن يخبرك بشيء.

يدان تضبطان مفاتيح تمرير على لوحة مزج تناظرية

الإعدادات المهمة

الإعدادالنطاقالافتراضيماذا يفعل
Speed0.25 إلى 4.01إيقاع القراءة كلها
Style0.0 إلى 1.00يدفع الأداء من الحياد نحو المسرحية
Stability0.0 إلى 1.00.5القيمة الأعلى تُبقي الصوت أكثر ثباتًا عبر نص طويل
Similarity boost0.0 إلى 1.00.75مدى التزام الإخراج بالصوت المختار
Previous text / Next textنصفارغيمنح النموذج سياقًا حتى تتوافق النغمة عند حواف الجمل

عادتان ستوفران عليك الوقت. أولًا، الصق الفقرة التي قبل فقرتك الحالية والتي بعدها في حقلي السياق، حتى يتصل كل جزء مولَّد بجيرانه بسلاسة. ثانيًا، جرّب وسومًا بين أقواس مثل [whispers] في الأمر النصي، واستمع إلى طريقة تعامل النموذج معها. هذا هو أسلوب التوجيه نفسه الذي صُمم عليه v4، لذا ستفيدك هذه الممارسة مع v4 أيضًا.

لمقارنة أصوات أخرى، تتضمن المجموعة نفسها MiniMax Speech 2.8 HD وGemini 3.1 Flash TTS وInworld Realtime TTS 2.

ما بعد الكلام: الموسيقى والنصوص المكتوبة

نموذج الصوت نادرًا ما يعمل وحده. معظم المشاريع التي تحتاج إلى سرد تحتاج أيضًا إلى خلفية موسيقية، أو نص مكتوب، أو نسخة مترجمة. الثلاثة متاحة على PicassoIA.

ألّف مع ElevenLabs Music

ElevenLabs Music يحوّل الأمر النصي إلى أغنية. في عمل السرد، اطلب موسيقى بلا كلمات، وثابتة، وخافتة في المزج. اكتب الحالة المزاجية والإيقاع والآلات بكلمات بسيطة، مثل "غيتار أكوستيك بطيء، غرفة دافئة، بلا غناء، 70 BPM". وإذا أردت المقارنة، فإن Lyria 3 Pro وMusic 2.6 يقبلان الأمر النصي من النوع نفسه.

موسيقي بجوار غيتار أكوستيك يضبط مركّب صوتي في استوديو منزلي صغير

فرّغ النص باستخدام GPT-4o أو Gemini

بعد وجود السرد، ستحتاج إلى تسميات توضيحية وسجل نصي. GPT-4o Transcribe يحوّل الصوت إلى نص، وGPT-4o Mini Transcribe هو الخيار الأخف للمسودات السريعة. وGemini 3 Pro مسار ثالث، مفيد حين تريد مقارنة طريقة تعامل كل نموذج مع الأسماء والأرقام.

حيلة مفيدة: فرّغ السرد الذي ولّدته وقارنه بالنص الأصلي. أي اختلاف يشير إلى كلمة تعثر عندها الصوت، ويمكنك إصلاحها بتعديل في الكتابة أو بتلميح للنطق.

دبلجة الفيديوهات إلى أكثر من 90 لغة

ElevenLabs Dubbing يأخذ فيديو جاهزًا وينتج نسخًا بلغات أخرى. وهو يتكامل بشكل طبيعي مع قائمة اللغات الأوسع في v4، لأن التوطين هو المجال الذي يكون فيه اتساق الصوت أكثر فائدة.

شابة تتحدث إلى ميكروفون وهي تشاهد مشهدًا سينمائيًا في استوديو دبلجة

دورك الآن للتجربة

أفضل طريقة للحكم على نموذج صوتي هي أن تعطيه نصّك وتستمع. لا تحتاج إلى استوديو، ولا إلى بند في الميزانية، ولا إلى أسبوع من الإعداد للبدء.

إليك خطة لفترة بعد الظهر:

  • اكتب نصًا من 150 كلمة فيه تحوّل عاطفي في المنتصف.
  • صيّره على ElevenLabs v3 بثلاثة أصوات مختلفة وتغيير واحد في شريط الأسلوب (Style).
  • أضف خلفية موسيقية من ElevenLabs Music.
  • فرّغ الناتج بـGPT-4o Transcribe وتحقق من الكلمات مقابل نصّك.

عندما يصل v4 إلى المنصة التي تفضّلها، ستعرف مسبقًا أي الوسوم والأصوات والإعدادات تناسب مادتك، وستتمكن من وضع الميزانية على أساس أسعار القائمة بثقة.

افتح Picasso IA وجرّب نصك الأول اليوم. اختر صوتًا، وأضف وسمًا مكدّسًا واحدًا، واستمع إلى الفرق الذي يحدثه التوجيه.

صديقان يضحكان أثناء تسجيل بودكاست حول طاولة خشبية دائرية

شارك هذا المقال

اختر لغتك

مقالات ذات صلة