أصوات OpenAI TTS: عينات صوتية وخيارات وأيها تختار

ثلاثة عشر صوتًا من OpenAI TTS، وثلاثة نماذج، ولا معاينة صوتية. تقارن هذه المقالة كل صوت، وتوضح أي نموذج يدعمه، وتقدّم نصًا للاختبار كي تجرّبها بنفسك، وتفصّل التكاليف الفعلية، وتوصي بخيارات مبدئية للسرد والروبوتات الداعمة والفيديو القصير.

أصوات OpenAI TTS: عينات صوتية وخيارات وأيها تختار
Cristian Da Conceicao
مؤسس Picasso IA

ثلاثة عشر اسمًا للأصوات، وثلاثة نماذج، ولا معاينة صوتية في الصفحة التي عليك أن تختار منها. هذا أول حاجز يصطدم به معظم المطوّرين مع نقطة النهاية الخاصة بالكلام من OpenAI. تبدو Alloy وash وballad وcoral وecho وfable وnova وonyx وsage وshimmer وverse وmarin وcedar متساوية المعقولية في قائمة منسدلة، لكنها لا تتصرف بالطريقة نفسها على كل نموذج، ولن تبدو متطابقة على نصّك. تشرح هذه المقالة ما هو كل صوت من أصوات OpenAI TTS، وأي نموذج يدعمه، وكيف تجرّب الأصوات الثلاثة عشر جميعها في أقل من عشر دقائق، وكيف تبدو الفاتورة، وأي صوت تبدأ به للسرد وروبوتات الدعم والفيديو القصير. كما تشير إلى أدوات الكلام على PicassoIA التي تقع بجانب عرض OpenAI، بما في ذلك أداة معها دليل يمكنك تشغيله اليوم.

ما الذي تقدّمه OpenAI TTS فعلًا

تحوّل واجهة API الخاصة بتحويل النص إلى كلام من OpenAI النصوص المكتوبة إلى مقاطع صوتية عبر نقطة نهاية واحدة. ترسل اسم النموذج واسم الصوت ونصّك، فتحصل في المقابل على ملف صوتي. الجزء الذي يُربك كثيرين هو أن النموذج الذي تختاره هو ما يحدد عدد الأصوات التي يمكنك استخدامها ومقدار التحكم الذي تحصل عليه في طريقة الأداء.

ثلاثة نماذج، ثلاثة أسعار

النموذجالأصواتالسعرالأنسب لـ
tts-1915 دولارًا لكل مليون حرفالمسودات السريعة قليلة التكلفة والتشغيل المباشر
tts-1-hd930 دولارًا لكل مليون حرفصوت بجودة أعلى يُصيَّر مسبقًا
gpt-4o-mini-tts130.60 دولار لكل مليون توكن نصي داخل، و12 دولارًا لكل مليون توكن صوتي خارجنبرة وإيقاع ولهجة قابلة للتوجيه عبر التعليمات

يُسعَّر النموذجان الأقدم حسب عدد الأحرف. أما gpt-4o-mini-tts فيُسعَّر بالتوكنات، ما يعني أن تكلفتك تتبع طول الصوت لا طول النص.

لقطة مقرّبة لشبكة ميكروفون استوديو فضي على مكتب خشبي

صيغ الإخراج والبث المباشر

يعود الصوت بصيغة MP3 افتراضيًا، مع Opus وAAC وFLAC وWAV وPCM كبدائل. ولكل منها وظيفة:

  • MP3 هو الخيار الآمن الافتراضي للمواقع والبودكاست.
  • Opus مناسب للبث عبر الإنترنت لأنه يبقى صغير الحجم.
  • AAC يعمل جيدًا على الهواتف ومحررات الفيديو.
  • FLAC يحتفظ بكل التفاصيل، وهذا مهم إذا كنت تخطط لتعديل الملف لاحقًا.
  • WAV وPCM غير مضغوطين، لذلك هما الخيار حين يكون زمن الاستجابة أهم من حجم الملف.

يمكن لنقطة النهاية أن تبثّ الصوت أثناء توليده، فيبدأ التشغيل قبل اكتمال المقطع كله. وهذا يصنع فرقًا حقيقيًا لمساعدي الصوت، حيث يبدو توقف لثانيتين كأن المكالمة انقطعت.

نظرة سريعة على الأصوات الثلاثة عشر

منظر علوي لمكتب عليه ثلاث عشرة كوبًا صغيرًا وسماعة رأس ودفتر ملاحظات

يعمل تسعة أصوات على كل النماذج. وأربعة أخرى تعمل فقط على gpt-4o-mini-tts. إليك القائمة الكاملة، مع ملاحظة حول الطريقة التي يصف بها المستمعون عادةً كل صوت.

💡 اقرأ هذا أولًا: لا تنشر OpenAI توصيفات شخصية لأصواتها، لذلك يعكس عمود "يوصف عادةً بأنه" ما يقوله المطوّرون والمستمعون غالبًا، وليس مواصفة رسمية. تعامل معه كقائمة مختصرة، ودع أذنيك تحسمان القرار النهائي.

الأصوات الأصلية التسعة

الصوتيوصف عادةً بأنهيعمل على
alloyمحايد، متوازن، متعدد الاستخداماتالنماذج الثلاثة كلها
ashألطف، خشن قليلًا، حواريالنماذج الثلاثة كلها
coralدافئ، ودود، قريب من المستمعالنماذج الثلاثة كلها
echoواضح، ثابت، مباشر وعمليالنماذج الثلاثة كلها
fableإحساس الراوي، معبّر، يُسمع غالبًا كلهجة بريطانيةالنماذج الثلاثة كلها
novaمشرق، نشيط، متفائلالنماذج الثلاثة كلها
onyxعميق، موثوق، هادئالنماذج الثلاثة كلها
sageمتزن، متأمل، إيقاعه منتظمالنماذج الثلاثة كلها
shimmerخفيف، واضح، لطيفالنماذج الثلاثة كلها

هذه التسعة هي الأقدم، لذلك فهي الأكثر استخدامًا، والأسهل في العثور على آراء عنها. إذا كان منتجك يعمل أصلًا مع alloy أو nova، فنادرًا ما يكون هناك سبب للتبديل إلا إذا حلّت الأصوات الجديدة مشكلة محددة.

الأصوات الأربعة الأحدث

الصوتيوصف عادةً بأنهيعمل على
balladناعم، لحني، لطيفgpt-4o-mini-tts فقط
verseمعبّر، ديناميكي، حيويgpt-4o-mini-tts فقط
marinطبيعي، مصقول، بجودة رائدةgpt-4o-mini-tts فقط
cedarطبيعي، راسخ، دافئgpt-4o-mini-tts فقط

توصي وثائق OpenAI نفسها باستخدام marin أو cedar للحصول على أفضل جودة، ما يجعلهما الاختبار الأول الطبيعي لأي مشروع جديد. ولأنهما يعملان فقط على gpt-4o-mini-tts، فإن اختيارهما يعني أيضًا أنك تحصل على حقل التعليمات، وهو المكان الذي تكمن فيه المرونة الحقيقية.

جرّب الأصوات ووجّه طريقة الأداء

امرأة ترتدي سماعات رأس تقارن ملفات صوتية على حاسوب محمول مع نص مطبوع بجانبها

لا يمكن أن يعيش الصوت داخل صفحة نصية، لذلك أسرع طريق للحصول على عينات حقيقية هو أن تولّدها بنفسك. تستغرق ثلاثة عشر مقطعًا لنفس النص بضع دقائق وتكلّف بضعة سنتات.

نص يكشف الأصوات الضعيفة

نص الاختبار الجيد ليس فقرة جميلة، بل اختبار إجهاد. استخدم شيئًا مثل هذا:

الطلب 4,817 سيُشحن في 3 مارس إلى الدكتور أوكونكوو في 22 شارع بيرشوود. انتظر، هل قلتَ يوم الخميس؟ بصراحة، لم أكن أتوقع وصول التوصيل مبكرًا، لكننا هنا. ثلاثة أشياء تذكّرها: احتفظ بالإيصال، وتحقق من الختم، واتصل بنا إذا شعرت بأي شيء غير طبيعي.

يجمع النص رقمًا طويلًا وتاريخًا واسم عائلة صعبًا وسؤالًا ولحظة عاطفية خفيفة وقائمة. الأصوات التي تبدو رائعة في جملة واحدة كثيرًا ما تتعثر في واحد من هذه. ثم شغّل هذه الحلقة:

from openai import OpenAI
from pathlib import Path

client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
          "onyx", "sage", "shimmer", "verse", "marin", "cedar"]

for voice in voices:
    out = Path(f"sample_{voice}.mp3")
    with client.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice=voice,
        input=script,
        instructions="Speak clearly in a warm, even tone.",
    ) as response:
        response.stream_to_file(out)

استمع بسماعات جيدة، وقيّم كل مقطع وفق أربعة أمور:

  1. الأرقام والأسماء: هل يخرج "4,817" كعبارة طبيعية واحدة؟
  2. السؤال: هل ترتفع الطبقة الصوتية عند "هل قلتَ يوم الخميس؟"؟
  3. الإيقاع: هل تبدو الفواصل كأنفاس أم كتوقفات حادة؟
  4. الإرهاق: هل تتحمّل هذا الصوت عشر دقائق متواصلة؟

التعليمات التي تغيّر طريقة الأداء

في gpt-4o-mini-tts، يتيح حقل التعليمات أن تصف بلغة بسيطة كيف ينبغي أن يبدو الصوت. تشير OpenAI إلى أنه يمكن توجيه النموذج في اللهجة والمدى العاطفي والتنغيم والتقليد والسرعة والنبرة والهمس. أما النموذجان الأقدمان tts-1 وtts-1-hd فلا يدعمانه.

التعليمةما الذي تتوقعه
"تحدّث بنبرة مبهجة وإيجابية."أداء مرتفع وودود، مناسب للتعريف بالمنتج
"هادئ، بطيء، كقصة قبل النوم."أداء أنعم مع توقفات أطول
"محترف وموجز، كمذيع أخبار."إيقاع أكثر إحكامًا وعاطفة أقل بروزًا
"اهمس بالجملة الأخيرة."نهاية خافتة لتأثير درامي
"تحدّث باعتذار لكن بثقة."مفيد لنصوص الدعم عند التأخير

💡 نصيحة: اجعل التعليمات قصيرة وملموسة. جملة واضحة واحدة تتفوق عادةً على فقرة من الصفات، وتغيير تعليمة واحدة في كل مرة يوضح بجلاء ما الذي غيّر النتيجة.

أي صوت يناسب أي مهمة

الجدول أدناه مجموعة من نقاط البداية للتجريب، وليس قواعد. الأصوات مسألة ذوق، ونصّك أهم من أي توصيف.

المهمةالخيار الأولالبديل
الكتب الصوتية والقراءات الطويلةcedarsage
الدعم وروبوتات الهاتفmarincoral
عروض المنتجاتalloyecho
الإعلانات والمقاطع القصيرةnovaverse
التأمل والمحتوى الهادئballadshimmer

السرد والقراءات الطويلة

رجل مسن يستمع إلى كتاب صوتي في كرسي بذراعين بجانب مصباح

الاستماع الطويل يُرهق الأصوات ذات الشخصية القوية. صوت مشرق يسحرك لخمس عشرة ثانية قد يُنهكك عند الدقيقة العاشرة. في السرد، اختر صوتًا هادئًا ومتزنًا، ثم استخدم التعليمات لإضفاء الدفء. قسّم المخطوطة عند فواصل الفقرات، لأن لكل طلب حدًا أقصى لطول الإدخال، والمقاطع الأقصر تمنح الصوت بداية جديدة. راجع مرجع API الحالي للاطلاع على الحد الدقيق.

المساعدون وروبوتات الدعم

موظف دعم يرتدي سماعة رأس يتحدث أمام إعداد بشاشتين في مكتب مشرق

بالنسبة للروبوت، الصفتان الفائزتان هما الوضوح ونبرة مقنعة تحت ضغط خفيف. اختبر صوتك على أسوأ الرسائل التي ترسلها: الاستردادات والتأخيرات والأعطال. الصوت الذي يبدو مبتهجًا وهو يقدّم أخبارًا سيئة يبدو غير متناسب مع الموقف، لذلك اكتب تعليمات مثل "هادئ ومخلص" في كل طلب. ويمكنك دمج ذلك مع البث المباشر لتبدأ الردود بسرعة.

الإعلانات والمقاطع القصيرة

شاب يسجّل فيديو عموديًا في مطبخ بهاتف على حامل ثلاثي

المقاطع القصيرة تكافئ الطاقة. اعتمد على nova أوverse، وأضف تعليمة مثل "نشيط وسريع وحواري"، وأبقِ الجمل قصيرة كي لا يضطر الأداء إلى الإسراع أبدًا. صيّر نسختين أو ثلاثًا واختر بالأذن، فالفرق بين تسجيل جيد وآخر رائع غالبًا ما يكون صفة واحدة مُغيَّرة.

التكاليف والحدود بالأرقام الفعلية

منظر علوي لدفتر حسابات وآلة حاسبة وفواتير على مكتب خشبي

لكل حرف مقابل لكل توكن

تبلغ مخطوطة من 10,000 كلمة نحو 60,000 حرف، وحوالي 67 دقيقة من الكلام بإيقاع طبيعي. بالنسبة لـgpt-4o-mini-tts، كان تقدير OpenAI عند الإطلاق نحو 1.5 سنت لكل دقيقة من الصوت، وهكذا يُحسب الصف الأخير أدناه.

النموذجالتكلفة التقريبية لـ 10,000 كلمة
tts-1نحو 0.90 دولار
tts-1-hdنحو 1.80 دولار
gpt-4o-mini-ttsنحو 1.00 دولار

هذه الأرقام صغيرة بما يكفي لتكون جودة الصوت هي ما يحدد النموذج، لا السعر. التكلفة الأكبر هي وقتك في إعادة تصيير المقاطع التي أخطأت النبرة، وهذا سبب آخر لاستخدام حقل التعليمات.

دعم اللغات

تدرج OpenAI دعم أكثر من 50 لغة، من الأفريقانية والعربية إلى التشيكية والدنماركية والهولندية، مع ملاحظة أن الأصوات محسّنة حاليًا للإنجليزية. عمليًا، يعمل النص غير الإنجليزي، لكن اللهجة قد تنحرف نحو النطق الإنجليزي. اختبر كل لغة تقدمها، واطلب من متحدث أصلي أن يستمع قبل الإطلاق.

الإفصاح والأصوات المخصصة

تشترط سياسات الاستخدام الخاصة بـ OpenAI إفصاحًا واضحًا للمستخدمين النهائيين بأن الصوت الذي يسمعونه مولَّد بالذكاء الاصطناعي وليس صوت إنسان. اجعل هذه العبارة جزءًا من منتجك نفسه، لا من الحروف الصغيرة. الأصوات المخصصة متاحة، لكنها تمر عبر عملية منفصلة تتطلب تسجيلات موافقة من المتحدث وعينات صوتية، لذا خطّط لوقت إضافي إذا كنت تريد صوتًا خاصًا بعلامتك التجارية.

بدائل على PicassoIA

لا يعرض PicassoIA نماذج الكلام الخاصة بـ OpenAI. ما يقدّمه هو مجموعة كبيرة من المحركات الأخرى في فئة Generate speech، بالإضافة إلى أدوات للمهمتين المحيطتين بعمل الصوت: فحص النتيجة وإضافة صوت خلفي تحتها.

محركات كلام أخرى

النموذجالسمة البارزة
Gemini 3.1 Flash TTS30 صوتًا، وأكثر من 70 رمز لغة، وأوامر أسلوب ووسوم تعبيرية
MiniMax Speech 2.8 HDتعليقات صوتية بجودة الاستوديو
ElevenLabs V3تعليقات صوتية بالذكاء الاصطناعي طبيعية ومعبّرة
Inworld TTS 1.5 Maxتعليقات صوتية سريعة تدعم 15 لغة
Chatterboxاستنساخ الصوت مع التحكم في المشاعر
Qwen3 TTSاستنساخ صوت أو تصميم صوتك الخاص

فحص النتيجة بالنسخ النصي

طريقة سريعة لاكتشاف الأسماء التي نُطقت بشكل خاطئ هي تشغيل الصوت المُولَّد مرة أخرى عبر تحويل الكلام إلى نص ومقارنته بنصّك. يتعامل كلاهما، GPT-4o Transcribe وGPT-4o Mini Transcribe، مع هذه المهمة، وGemini 3 Pro رأي ثالث جيد. إذا أسقط النص كلمة أو غيّرها، فالأرجح أن المستمع سمع الشيء نفسه.

أضف موسيقى تحت الصوت

منتج موسيقى يضبط مؤشر التحكم على لوحة مزج كبيرة في استوديو منزلي خافت

التعليق الصوتي بلا خلفية قد يبدو عاريًا. أنشئ مقطعًا في فئة Generate music وامزجه منخفضًا خلف السرد. ElevenLabs Music، وMiniMax Music 2.6، وLyria 3 Pro، وStable Audio 2.5 تحوّل جميعها أمرًا نصيًا إلى مقطع موسيقي. اطلب "موسيقى آلية هادئة بلا غناء، وإيقاع ثابت" حتى لا ينافس شيء الكلمات.

استخدم Gemini 3.1 Flash TTS على PicassoIA

حاسوب محمول ومايكروفون مكثف صغير ودفتر عليه قائمة أصوات مكتوبة بخط اليد على مكتب مشرق

بما أن أصوات OpenAI غير مستضافة هناك، فأقرب بديل هو Gemini 3.1 Flash TTS، الذي يمنحك سير عمل مشابهًا مع قائمة أصوات أكبر. إليك طريقة تشغيله:

  1. افتح صفحة النموذج واعثر على نموذج الإدخال.
  2. الصق نصك في حقل Text. الحد هو 4,000 بايت، لذا قسّم النصوص الأطول.
  3. اختر صوتًا من بين 30 خيارًا. الافتراضي هو Kore، وأسماء مثل Puck وCharon وFenrir وAoede وZephyr نقاط بداية جيدة.
  4. اكتب أمرًا للأسلوب في حقل Prompt. الافتراضي هو "Say the following." استبدله بشيء مثل "تحدّث ببطء وثقة" أو "استخدم نبرة هادئة وودودة".
  5. حدد رمز اللغة. الافتراضي هو en-US، وتتوفر أكثر من 70 رمزًا.
  6. صيّر واستمع وعدّل. غيّر شيئًا واحدًا في كل تشغيل حتى تعرف ما الذي أحدث الفرق.
الإعدادنصيحة
وسوم النصأضف [whispering] أو [laughing] أو [shouting] أو [sigh] أو [extremely fast] مباشرة قبل العبارة التي يجب أن تؤثر فيها
Promptصف الإيقاع والنبرة واللهجة في جملة واحدة
Voiceجرّب ثلاثة أصوات على الفقرة نفسها قبل الحسم
Language codeطابقه مع لغة النص لا مع لغتك

💡 نصيحة: شغّل المقطع النهائي عبر GPT-4o Transcribe للتأكد من أن كل اسم ورقم خرج كما كُتب.

جرّبه بنفسك على Picasso IA

اختيار أصوات OpenAI TTS مهمة استماع، وأسرع طريقة لتتحسن فيها هي توليد المقاطع ومقارنتها. خذ نص الاختبار أعلاه، وشغّله على الأصوات الثلاثة عشر، ثم شغّل النص نفسه عبر Gemini 3.1 Flash TTS وMiniMax Speech 2.8 HD على Picasso IA. أضف خلفية موسيقية ناعمة، وافحص النص المكتوب، واحتفظ بالصوت الذي ما زال يبدو صحيحًا عند الاستماع العاشر. افتح Picasso IA، والصق نصك، وابدأ بصوت واحد وتعليمة واحدة. تعليقك الصوتي الأول القابل للاستخدام أقرب مما توحي به القائمة المنسدلة.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة