أسعار OpenAI TTS API: الأصوات وtts-1-hd مقابل ElevenLabs

تفرض OpenAI سعر 15 دولارًا لكل مليون حرف على tts-1، و30 دولارًا على tts-1-hd، ونحو 0.015 دولار للدقيقة على gpt-4o-mini-tts. يعرض هذا التحليل كل صوت متاح، ويحسب التكلفة الفعلية لمقال وكتاب صوتي، ويضع الأرقام بجانب ElevenLabs.

أسعار OpenAI TTS API: الأصوات وtts-1-hd مقابل ElevenLabs
Cristian Da Conceicao
مؤسس Picasso IA

تُعد واجهة API الخاصة بتحويل النص إلى كلام من OpenAI من أرخص الطرق لإضافة صوت إلى تطبيق أو دورة تدريبية أو بودكاست، ويمكن تلخيص قائمة الأسعار في جملة واحدة: سعر tts-1 هو $15 لكل مليون حرف، وسعر tts-1-hd هو $30 لكل مليون، ونحو $0.015 لكل دقيقة من الصوت على gpt-4o-mini-tts الأحدث. تتقاضى ElevenLabs $0.10 لكل 1,000 حرف على نماذجها الرائدة، أي أكثر من ثلاثة أضعاف سعر tts-1-hd. يعتمد ما إذا كان هذا الفرق يستحق الدفع على الأصوات واللغات ومدى الحاجة إلى أن يبدو الأداء بشريًا. تعرض هذه الصفحة كل أسعار OpenAI، وتسرد الأصوات نموذجًا تلو الآخر، وتعمل على أمثلة تكلفة حقيقية، وتضع الأرقام بجانب ElevenLabs حتى تختار قبل كتابة سطر واحد من الشيفرة.

💡 حساب سريع: الدقيقة الواحدة من السرد تساوي تقريبًا 900 حرف. تكلّف نحو 0.014 دولار على tts-1، و0.027 دولار على tts-1-hd، و0.09 دولار على ElevenLabs v3 أو Multilingual v2.

ما تفرضه OpenAI لكل حرف

تحتسب OpenAI نموذجيها الكلاسيكيين للكلام وفق أحرف الإدخال، لا وفق ثواني الصوت. أنت تدفع مقابل النص الذي ترسله، لذا تكلّف القراءة البطيئة والدرامية المبلغ نفسه الذي تكلّفه القراءة السريعة. تسرد صفحة نموذج tts-1-hd نقطة نهاية الكلام (v1/audio/speech) بوصفها المسار الوحيد المدعوم، وتخدم نقطة النهاية نفسها كلًا من tts-1 وgpt-4o-mini-tts.

أسعار tts-1 وtts-1-hd

قائمة الأسعار الرسمية قصيرة. لا توجد رسوم اشتراك ثابتة ولا حد أدنى للإنفاق: تضيف رصيدًا إلى حسابك، وكل طلب يخصم منه.

النموذجالسعرلكل 1,000 حرفالأنسب لـ
tts-115 دولارًا لكل مليون حرف0.015 دولارالتطبيقات والمساعدات ذات زمن الاستجابة المنخفض
tts-1-hd30 دولارًا لكل مليون حرف0.030 دولارالصوت النهائي الذي يُعاد تشغيله
gpt-4o-mini-tts0.60 دولار لكل مليون توكن نصي، و12 دولارًا لكل مليون توكن صوتيمبني على التوكنات، نحو 0.015 دولار للدقيقةأداء قابل للتوجيه والتعبير

منظر علوي لمكتب من خشب الجوز عليه آلة حاسبة وفاتورة فارغة وعملات معدنية وميكروفون مكثّف، يُستخدم لتخطيط تكاليف تحويل النص إلى كلام

يكلّف نموذج HD ضعف السعر بالضبط. بالنسبة إلى نص نموذجي يظل المبلغ زهيدًا، ولهذا نادرًا ما يكون القرار الحقيقي متعلقًا بالمال. تعرض صفحة نموذج tts-1-hd حدودًا للطلبات تتراوح بين 2,500 و10,000 طلب في الدقيقة حسب مستوى استخدامك، وهي أعلى بكثير مما ترسله معظم التطبيقات.

gpt-4o-mini-tts يحتسب بالتوكن

يكسر أحدث نموذج نمط التسعير القائم على الحروف. يُحتسب $0.60 لكل مليون توكن نصي للإدخال، و**$12 لكل مليون توكن صوتي** للإخراج، وهو ما يعادل نحو $0.015 لكل دقيقة من الصوت المولَّد. يقترب هذا السعر تقريبًا من سعر tts-1، لكنه يضيف حقل instructions تصف فيه طريقة الأداء بلغة بسيطة، مثل "تحدّث ببطء، كمعلم صبور". لا تتيح نماذج tts-1 مثل هذا التحكم.

مطوّر برمجيات على مكتب للوقوف أمام شاشتين تعرضان محررات شيفرة غير واضحة، ويدمج واجهة API لتحويل النص إلى كلام في تطبيق

يبدو الاستدعاء البسيط باستخدام SDK الرسمي للغة Python كما يلي:

from openai import OpenAI

client = OpenAI()

with client.audio.speech.with_streaming_response.create(
    model="tts-1-hd",
    voice="coral",
    input="Your order shipped this morning and should arrive on Friday.",
    response_format="mp3",
) as response:
    response.stream_to_file("order-update.mp3")

بدّل اسم النموذج إلى gpt-4o-mini-tts وأضف سلسلة instructions لتوجيه طريقة الأداء. يقبل كل طلب حتى 4,096 حرفًا من الإدخال، لذا يجب تقسيم النصوص الطويلة إلى أجزاء ثم دمجها لاحقًا.

الأصوات التي تحصل عليها فعليًا

عدد الأصوات هو الفرق الأكبر بين نماذج OpenAI الثلاثة، وهو أهم مما تعترف به معظم صفحات الأسعار. النموذج الرخيص الذي يملك صوتًا واحدًا لا يعجبك ليس رخيصًا.

منظور من زاوية منخفضة لمقدّم بودكاست يرتدي سترة من قماش الكوردروي ويتحدث إلى ميكروفون بث في استوديو مضاء بدفء

تسعة أصوات على tts-1 وtts-1-hd

يشترك النموذجان الكلاسيكيان في التسعة أصوات نفسها: alloy، ash، coral، echo، fable، onyx، nova، sage، shimmer. هذا يكفي لتغطية راوٍ ومساعد ودود ومعلن بصوت أعمق، لكنه لا يكفي لطاقم من شخصيات مختلفة.

أربعة أصوات إضافية على النموذج الأحدث

يقدّم gpt-4o-mini-tts 13 صوتًا. يحتفظ بالتسعة الأصلية ويضيف ballad وverse وmarin وcedar. توصي OpenAI باستخدام marin أو cedar عندما تريد أفضل جودة.

النموذجالأصواتالأسماء
tts-19alloy، ash، coral، echo، fable، onyx، nova، sage، shimmer
tts-1-hd9التسعة نفسها
gpt-4o-mini-tts13التسعة مع ballad وverse وmarin وcedar

تنطبق بعض التفاصيل العملية على النماذج الثلاثة:

  • صيغ الإخراج: MP3 افتراضيًا، بالإضافة إلى Opus، AAC، FLAC، WAV، PCM. صيغتا WAV، PCM هما الأسرع في الإرجاع.
  • البث المتدفق: تدعم API البث المجزّأ، لذا يمكن أن يبدأ التشغيل قبل توليد الملف كاملًا.
  • اللغات: نحو 99 لغة، تبعًا لدعم Whisper للغات. تشير OpenAI إلى أن الأصوات مُحسّنة للإنجليزية، لذا اختبر لغتك المستهدفة قبل أن تلتزم بها.
  • الإفصاح: تتطلب سياسات الاستخدام إشعارًا واضحًا للمستخدمين النهائيين بأن الصوت مولَّد بالذكاء الاصطناعي وليس بشريًا.

tts-1 أم tts-1-hd؟

يستخدم النموذجان التسعة أصوات نفسها والإدخال نفسه، لذا فالتبديل بينهما تغيير لكلمة واحدة في الكود. وهذا يجعل الاختيار سهل الاختبار: وَلّد فقرة واحدة بكل نموذج واستمع إليها على الجهاز الذي يستخدمه جمهورك فعلًا.

لقطة مقرّبة جدًا لسماعات استوديو بوسادات أذن جلدية موضوعة على طاولة خشبية في ضوء الصباح

ماذا تشتري 15 دولارًا إضافيًا؟

تضع OpenAI tts-1 بوصفه الخيار ذا زمن الاستجابة الأقل، وtts-1-hd بوصفه الخيار الأعلى جودة. توقّع أداءً أنعم وأثبت في المقاطع الطويلة من نموذج HD، وتوقّع أن تكون الفجوة أسهل ما يكون في السماعات الأذنية. أما على مكبر صوت الهاتف داخل تطبيق صاخب فلن يلاحظها كثير من المستمعين.

كيف تختار بينهما

  • اختر tts-1 للردود في المحادثات، والمساعدات الصوتية، والإشعارات، وكل ما ينبغي أن يصل فيه الصوت الأول بسرعة.
  • اختر tts-1-hd للكتب الصوتية ودروس الدورات والبودكاست والإعلانات، أي الصوت الذي يعيد الناس تشغيله ويحكمون عليه بدقة.
  • اختر gpt-4o-mini-tts عندما يحتاج الصوت إلى مزاج معيّن: وكيل دعم هادئ، أو معلن منتجات متحمس، أو همس.

💡 قاعدة عامة: بالنسبة إلى المحتوى النهائي الحساب بسيط. تحويل كتاب صوتي من 80,000 كلمة على HD بدلًا من النموذج العادي يضيف نحو 7.20 دولار إلى الفاتورة، لذا اعتمد HD كخيار افتراضي متى كان المستمعون سيسمعون الصوت أكثر من مرة.

أمثلة التكلفة الفعلية

تفترض كل الأرقام أدناه سرعة سرد تبلغ 150 كلمة في الدقيقة، ونحو 6 أحرف لكل كلمة مع المسافات، أي 900 حرف في الدقيقة. نصوصك الخاصة ستختلف، لذا تعامل مع هذه الأرقام على أنها تقديرات للميزانية لا فواتير.

المهمةtts-1tts-1-hdgpt-4o-mini-ttsElevenLabs FlashElevenLabs v3 أو Multilingual v2
مقال من 1,000 كلمة (6,000 حرف)0.09 دولار0.18 دولارنحو 0.10 دولار0.30 دولار0.60 دولار
كتاب صوتي من 80,000 كلمة (480,000 حرف)7.20 دولار14.40 دولارنحو 8.00 دولار24.00 دولار48.00 دولار
مليون حرف شهريًا15 دولارًا30 دولارًانحو 16.70 دولار50 دولارًا100 دولار

راوٍ لكتاب صوتي يقرأ مخطوطة سميكة داخل كابينة صوت مبطّنة بالإسفنج، كما تُرى من خلف زجاج غرفة التحكم

مقال من 1,000 كلمة

يكلّف تحويل تدوينة إلى نسخة صوتية قابلة للاستماع أقل من 10 سنتات على tts-1، وأقل من ربع دولار على HD. وحتى بالسعر الأعلى لـ ElevenLabs يبلغ المبلغ 60 سنتًا، لذا بالنسبة إلى السرد العرضي يكاد فرق السعر لا يهم. اختر بناءً على جودة الصوت، لا على التكلفة.

كتاب صوتي من 80,000 كلمة

الكتاب الكامل هو حيث تتضح الفجوة: 14.40 دولار على tts-1-hd مقابل 48 دولارًا على أعلى نماذج ElevenLabs، لقرابة تسع ساعات من الصوت. الراوي البشري يكلّف أكثر بكثير لكل ساعة منتجة من أي عمود في ذلك الجدول، لذا فكل خيار هنا يمثل جزءًا بسيطًا من تكلفة حجز استوديو.

مليون حرف شهريًا

عند حجم التطبيقات تتباعد الفئات. المنتج الذي ينطق مليون حرف شهريًا يدفع من 15 إلى 100 دولار حسب المزود والنموذج. انتبه لإعادة المحاولات: إذا أعدت توليد كل مقطع ثالث، فأضف الثلث إلى كل رقم. خزّن الصوت المُولَّد للعبارات المتكررة مثل التحيات ورسائل الخطأ، لأن النص نفسه لا يحتاج إلى أن يُدفع ثمنه مرتين.

OpenAI TTS مقابل ElevenLabs

يوضح جدول التكلفة من هو الأرخص. لكنه لا يوضح من يبدو صوته أفضل في حالتك، ولا ما يحدث عندما يتجاوز نصك حدّ الطلب الواحد.

زميلان يقارنان خيارات تحويل النص إلى كلام على مكتب مشترك، أحدهما يشير إلى حاسوب محمول بينما يدوّن الآخر ملاحظات

العاملOpenAI tts-1-hdElevenLabs Flash v2.5ElevenLabs Multilingual v2 و v3
سعر API لكل 1,000 حرف$0.030$0.05$0.10
اللغاتنحو 993229 (v2)، 70+ (v3)
الحد الأقصى للحروف في كل طلب4,09640,00010,000 (v2)، 5,000 (v3)
الأصوات المدمجة9مكتبة واسعة مع استنساخ الصوتمكتبة واسعة مع استنساخ الصوت
التركيز على السرعةزمن استجابة أقل على tts-1نحو 75 ms وفق ما يعلنه المزوّدجودة أعلى وأبطأ

تأتي أرقام ElevenLabs من تحليلات أسعار منتصف عام 2026. تحدّث الشركة خططها كثيرًا، لذا تأكد من الأرقام الحالية في صفحة الأسعار الخاصة بها قبل أن تضع ميزانية.

السعر لكل 1,000 حرف

عبر API، يبلغ سعر tts-1 نحو $0.015، ويبلغ سعر tts-1-hd نحو $0.030، ويبلغ سعر ElevenLabs Flash و Turbo نحو $0.05، ويبلغ سعر Multilingual v2 و v3 نحو $0.10. وبذلك تبلغ تكلفة ElevenLabs Flash نحو 1.7 مرة تكلفة tts-1-hd، ونماذجها الرائدة نحو 3.3 مرة. أما الاشتراكات فتضم النقاط بدلًا من ذلك: تحصل الخطة المجانية على 10,000 نقطة شهريًا، بنقطة واحدة لكل حرف على النماذج القياسية، وبنصف نقطة على Flash و Turbo.

جودة الصوت والتعبير

السعر ليس إلا جزءًا من الصورة. بنت ElevenLabs سمعتها على أداء معبّر وطبيعي، ويضيف Eleven v3 مدى عاطفيًا وحوارًا متعدد المتحدثين عبر أكثر من 70 لغة. أما رد OpenAI فهو القابلية للتوجيه: يقبل gpt-4o-mini-tts تعليمات بلغة بسيطة عن اللهجة والنبرة والسرعة والعاطفة، وهو أمر لا يستطيع أي من نموذجي tts-1 فعله.

إذا كنت تحتاج إلى طاقم من الشخصيات تبدو أصواتها مختلفة في كل مشهد، فمكتبة أصوات ElevenLabs والاستنساخ يمنحانك مساحة أوسع. وإذا كنت تحتاج إلى صوت واحد موثوق ورخيص، فتفوز OpenAI في التكلفة. الاختبار الوحيد الصادق هو تشغيل الفقرة نفسها عبر الخيارين والاستماع.

الحدود واللغات والترخيص

تحدد حدود الطلبات شكل الكود لديك. تحدّ OpenAI الإدخال عند 4,096 حرفًا، وتحدّه Eleven v3 عند 5,000 حرف، لذا يحتاج النص الطويل إلى تقسيم وطريقة للحفاظ على ثبات الصوت بين الأجزاء. يقبل Flash v2.5 40,000 حرف، ما يعني عددًا أقل من عمليات الدمج في القراءات الطويلة.

الترخيص مختلف أيضًا. الخطة المجانية لـ ElevenLabs لا تمنح ترخيصًا تجاريًا، وتبدأ الحقوق التجارية مع أول خطة مدفوعة. وتشترط OpenAI إبلاغ المستخدمين النهائيين بأن الصوت مولّد بالذكاء الاصطناعي. اقرأ شروط الطرفين قبل إرسال الصوت إلى العملاء.

كيف تستخدم ElevenLabs v3 على PicassoIA

قبل أن تدفع بالحرف، يمكنك سماع الجانب الخاص بـ ElevenLabs في هذه المقارنة داخل المتصفح. تعرض مجموعة تحويل النص إلى كلام في PicassoIA 24 نموذجًا، من بينها ElevenLabs v3 وFlash v2.5 وTurbo v2.5 وMultilingual v2، إضافة إلى خيارات من MiniMax وGoogle وInworld وResemble AI. الصق النص، واختر صوتًا، وسيعود الصوت خلال ثوانٍ.

شاب يرتدي قبعة صوفية يستمع إلى عينة صوت بالذكاء الاصطناعي عبر سماعة أذن واحدة بجانب نافذة

الخطوات داخل المتصفح

  1. افتح صفحة ElevenLabs v3 في مجموعة تحويل النص إلى كلام.
  2. الصق النص في حقل Prompt.
  3. اختر voice من القائمة المنسدلة. الافتراضي هو Rachel، والقائمة تضم أكثر من 25 شخصية.
  4. حدد language code. الافتراضي هو en؛ استخدم es أو fr للإسبانية أو الفرنسية.
  5. اترك stability على 0.5، وsimilarity boost على 0.75، وstyle على 0، وspeed على 1 في التشغيل الأول.
  6. شغّل النموذج، واستمع، وعدّل إعدادًا واحدًا في كل مرة، ثم حمّل الملف الذي يعجبك.

الإعدادات التي تغيّر النتيجة

  • Stability: القيم الأعلى تُبقي الصوت ثابتًا عبر نص طويل، والقيم الأدنى تسمح بمزيد من التنوع.
  • Style: شريط تمرير من 0 إلى 1 ينقل الأداء من السرد المحايد نحو قراءة أكثر مسرحية.
  • Speed: من 0.25x إلى 4x، وهو مفيد لإبطاء سرد الدروس التعليمية.
  • Previous and next text: الصق الجمل التي قبل المقطع وبعده حتى تبقى النغمة طبيعية عند الوصل. هذا هو الحل لحدود الأحرف لكل طلب المذكورة أعلاه.

لاختبار سريع من نوع A/B، شغّل الفقرة نفسها عبر Flash v2.5 للسرعة، وMiniMax Speech 2.8 HD للجودة بأسلوب الاستوديو، وGemini 3.1 Flash TTS لأصواته الثلاثين وأكثر من 70 لغة، وInworld TTS 1.5 Max للتعليقات الصوتية السريعة متعددة اللغات. ثم قارن النتائج بعينة tts-1-hd من حسابك.

الموسيقى والنسخ أيضًا

الصوت نادرًا ما يكون المهمة الصوتية الوحيدة. يحتاج الفيديو الترويجي إلى موسيقى خلفية، ويحتاج البودكاست إلى نص مكتوب للتسميات التوضيحية والبحث.

موسيقي عند مكتب خشبي مع وحدة تحكم بأزرار الإيقاع وشاشة استوديو في ضوء غروب دافئ، يؤلف مقطعًا موسيقيًا

توليد الموسيقى. لمسار خلفي، جرّب MiniMax Music 2.6 أو Lyria 3 Pro أو ElevenLabs Music أو Stable Audio 2.5. صِف النوع والمزاج والإيقاع في جملة واحدة، ودع النموذج يرسم المقطع.

صحفية في مقهى تكتب على حاسوب محمول بجانب جهاز تسجيل صوتي صغير وفنجان كابتشينو، وتحوّل مقابلة إلى نص

تفريغ الصوت. لتحويل السرد النهائي أو المقابلة إلى نص، استخدم GPT-4o Transcribe أو GPT-4o Mini Transcribe أو Gemini 3 Pro. ويصلح النص المنسوخ كتسميات توضيحية وملاحظات للعرض ومرحلة تدقيق لغوي: إذا أخطأ النص في كلمة، فمن المرجح أن يخطئ المستمع فيها أيضًا.

خط إنتاج بسيط يربط كل ذلك: اكتب النص، ووَلّد الصوت، وأضف مسارًا موسيقيًا، ثم فرّغ المزيج النهائي لتتحقق من الصياغة.

جرّبه بنفسك اليوم

جداول الأسعار لا تكفي وحدها. أسرع طريقة لحسم المقارنة بين OpenAI وElevenLabs هي سماع نصك الخاص بعدة أصوات ومعرفة تكلفة كل خيار عند حجمك. افتح PicassoIA، والصق فقرة في نموذج تحويل النص إلى كلام، وقارنها بمقطع tts-1-hd. ثم أضف مسارًا موسيقيًا، وفرّغ النتيجة، وولّد عدة صور واقعية كالصور الفوتوغرافية لغلاف حلقتك أو فيديوك. كل ما تحتاجه لاختبار سير عمل كامل للصوت والصورة موجود في مكان واحد، فجرّب بحرية، واحتفظ بالتركيبة التي يبدو صوتها الأفضل.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة