ثلاثة عشر صوتًا من OpenAI TTS، وثلاثة نماذج، ولا معاينة صوتية. تقارن هذه المقالة كل صوت، وتوضح أي نموذج يدعمه، وتقدّم نصًا للاختبار كي تجرّبها بنفسك، وتفصّل التكاليف الفعلية، وتوصي بخيارات مبدئية للسرد والروبوتات الداعمة والفيديو القصير.
ثلاثة عشر اسمًا للأصوات، وثلاثة نماذج، ولا معاينة صوتية في الصفحة التي عليك أن تختار منها. هذا أول حاجز يصطدم به معظم المطوّرين مع نقطة النهاية الخاصة بالكلام من OpenAI. تبدو Alloy وash وballad وcoral وecho وfable وnova وonyx وsage وshimmer وverse وmarin وcedar متساوية المعقولية في قائمة منسدلة، لكنها لا تتصرف بالطريقة نفسها على كل نموذج، ولن تبدو متطابقة على نصّك. تشرح هذه المقالة ما هو كل صوت من أصوات OpenAI TTS، وأي نموذج يدعمه، وكيف تجرّب الأصوات الثلاثة عشر جميعها في أقل من عشر دقائق، وكيف تبدو الفاتورة، وأي صوت تبدأ به للسرد وروبوتات الدعم والفيديو القصير. كما تشير إلى أدوات الكلام على PicassoIA التي تقع بجانب عرض OpenAI، بما في ذلك أداة معها دليل يمكنك تشغيله اليوم.
ما الذي تقدّمه OpenAI TTS فعلًا
تحوّل واجهة API الخاصة بتحويل النص إلى كلام من OpenAI النصوص المكتوبة إلى مقاطع صوتية عبر نقطة نهاية واحدة. ترسل اسم النموذج واسم الصوت ونصّك، فتحصل في المقابل على ملف صوتي. الجزء الذي يُربك كثيرين هو أن النموذج الذي تختاره هو ما يحدد عدد الأصوات التي يمكنك استخدامها ومقدار التحكم الذي تحصل عليه في طريقة الأداء.
ثلاثة نماذج، ثلاثة أسعار
النموذج
الأصوات
السعر
الأنسب لـ
tts-1
9
15 دولارًا لكل مليون حرف
المسودات السريعة قليلة التكلفة والتشغيل المباشر
tts-1-hd
9
30 دولارًا لكل مليون حرف
صوت بجودة أعلى يُصيَّر مسبقًا
gpt-4o-mini-tts
13
0.60 دولار لكل مليون توكن نصي داخل، و12 دولارًا لكل مليون توكن صوتي خارج
نبرة وإيقاع ولهجة قابلة للتوجيه عبر التعليمات
يُسعَّر النموذجان الأقدم حسب عدد الأحرف. أما gpt-4o-mini-tts فيُسعَّر بالتوكنات، ما يعني أن تكلفتك تتبع طول الصوت لا طول النص.
صيغ الإخراج والبث المباشر
يعود الصوت بصيغة MP3 افتراضيًا، مع Opus وAAC وFLAC وWAV وPCM كبدائل. ولكل منها وظيفة:
MP3 هو الخيار الآمن الافتراضي للمواقع والبودكاست.
Opus مناسب للبث عبر الإنترنت لأنه يبقى صغير الحجم.
AAC يعمل جيدًا على الهواتف ومحررات الفيديو.
FLAC يحتفظ بكل التفاصيل، وهذا مهم إذا كنت تخطط لتعديل الملف لاحقًا.
WAV وPCM غير مضغوطين، لذلك هما الخيار حين يكون زمن الاستجابة أهم من حجم الملف.
يمكن لنقطة النهاية أن تبثّ الصوت أثناء توليده، فيبدأ التشغيل قبل اكتمال المقطع كله. وهذا يصنع فرقًا حقيقيًا لمساعدي الصوت، حيث يبدو توقف لثانيتين كأن المكالمة انقطعت.
نظرة سريعة على الأصوات الثلاثة عشر
يعمل تسعة أصوات على كل النماذج. وأربعة أخرى تعمل فقط على gpt-4o-mini-tts. إليك القائمة الكاملة، مع ملاحظة حول الطريقة التي يصف بها المستمعون عادةً كل صوت.
💡 اقرأ هذا أولًا: لا تنشر OpenAI توصيفات شخصية لأصواتها، لذلك يعكس عمود "يوصف عادةً بأنه" ما يقوله المطوّرون والمستمعون غالبًا، وليس مواصفة رسمية. تعامل معه كقائمة مختصرة، ودع أذنيك تحسمان القرار النهائي.
الأصوات الأصلية التسعة
الصوت
يوصف عادةً بأنه
يعمل على
alloy
محايد، متوازن، متعدد الاستخدامات
النماذج الثلاثة كلها
ash
ألطف، خشن قليلًا، حواري
النماذج الثلاثة كلها
coral
دافئ، ودود، قريب من المستمع
النماذج الثلاثة كلها
echo
واضح، ثابت، مباشر وعملي
النماذج الثلاثة كلها
fable
إحساس الراوي، معبّر، يُسمع غالبًا كلهجة بريطانية
النماذج الثلاثة كلها
nova
مشرق، نشيط، متفائل
النماذج الثلاثة كلها
onyx
عميق، موثوق، هادئ
النماذج الثلاثة كلها
sage
متزن، متأمل، إيقاعه منتظم
النماذج الثلاثة كلها
shimmer
خفيف، واضح، لطيف
النماذج الثلاثة كلها
هذه التسعة هي الأقدم، لذلك فهي الأكثر استخدامًا، والأسهل في العثور على آراء عنها. إذا كان منتجك يعمل أصلًا مع alloy أو nova، فنادرًا ما يكون هناك سبب للتبديل إلا إذا حلّت الأصوات الجديدة مشكلة محددة.
الأصوات الأربعة الأحدث
الصوت
يوصف عادةً بأنه
يعمل على
ballad
ناعم، لحني، لطيف
gpt-4o-mini-tts فقط
verse
معبّر، ديناميكي، حيوي
gpt-4o-mini-tts فقط
marin
طبيعي، مصقول، بجودة رائدة
gpt-4o-mini-tts فقط
cedar
طبيعي، راسخ، دافئ
gpt-4o-mini-tts فقط
توصي وثائق OpenAI نفسها باستخدام marin أو cedar للحصول على أفضل جودة، ما يجعلهما الاختبار الأول الطبيعي لأي مشروع جديد. ولأنهما يعملان فقط على gpt-4o-mini-tts، فإن اختيارهما يعني أيضًا أنك تحصل على حقل التعليمات، وهو المكان الذي تكمن فيه المرونة الحقيقية.
جرّب الأصوات ووجّه طريقة الأداء
لا يمكن أن يعيش الصوت داخل صفحة نصية، لذلك أسرع طريق للحصول على عينات حقيقية هو أن تولّدها بنفسك. تستغرق ثلاثة عشر مقطعًا لنفس النص بضع دقائق وتكلّف بضعة سنتات.
نص يكشف الأصوات الضعيفة
نص الاختبار الجيد ليس فقرة جميلة، بل اختبار إجهاد. استخدم شيئًا مثل هذا:
الطلب 4,817 سيُشحن في 3 مارس إلى الدكتور أوكونكوو في 22 شارع بيرشوود. انتظر، هل قلتَ يوم الخميس؟ بصراحة، لم أكن أتوقع وصول التوصيل مبكرًا، لكننا هنا. ثلاثة أشياء تذكّرها: احتفظ بالإيصال، وتحقق من الختم، واتصل بنا إذا شعرت بأي شيء غير طبيعي.
يجمع النص رقمًا طويلًا وتاريخًا واسم عائلة صعبًا وسؤالًا ولحظة عاطفية خفيفة وقائمة. الأصوات التي تبدو رائعة في جملة واحدة كثيرًا ما تتعثر في واحد من هذه. ثم شغّل هذه الحلقة:
from openai import OpenAI
from pathlib import Path
client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
"onyx", "sage", "shimmer", "verse", "marin", "cedar"]
for voice in voices:
out = Path(f"sample_{voice}.mp3")
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice=voice,
input=script,
instructions="Speak clearly in a warm, even tone.",
) as response:
response.stream_to_file(out)
استمع بسماعات جيدة، وقيّم كل مقطع وفق أربعة أمور:
الأرقام والأسماء: هل يخرج "4,817" كعبارة طبيعية واحدة؟
السؤال: هل ترتفع الطبقة الصوتية عند "هل قلتَ يوم الخميس؟"؟
الإيقاع: هل تبدو الفواصل كأنفاس أم كتوقفات حادة؟
الإرهاق: هل تتحمّل هذا الصوت عشر دقائق متواصلة؟
التعليمات التي تغيّر طريقة الأداء
في gpt-4o-mini-tts، يتيح حقل التعليمات أن تصف بلغة بسيطة كيف ينبغي أن يبدو الصوت. تشير OpenAI إلى أنه يمكن توجيه النموذج في اللهجة والمدى العاطفي والتنغيم والتقليد والسرعة والنبرة والهمس. أما النموذجان الأقدمان tts-1 وtts-1-hd فلا يدعمانه.
التعليمة
ما الذي تتوقعه
"تحدّث بنبرة مبهجة وإيجابية."
أداء مرتفع وودود، مناسب للتعريف بالمنتج
"هادئ، بطيء، كقصة قبل النوم."
أداء أنعم مع توقفات أطول
"محترف وموجز، كمذيع أخبار."
إيقاع أكثر إحكامًا وعاطفة أقل بروزًا
"اهمس بالجملة الأخيرة."
نهاية خافتة لتأثير درامي
"تحدّث باعتذار لكن بثقة."
مفيد لنصوص الدعم عند التأخير
💡 نصيحة: اجعل التعليمات قصيرة وملموسة. جملة واضحة واحدة تتفوق عادةً على فقرة من الصفات، وتغيير تعليمة واحدة في كل مرة يوضح بجلاء ما الذي غيّر النتيجة.
أي صوت يناسب أي مهمة
الجدول أدناه مجموعة من نقاط البداية للتجريب، وليس قواعد. الأصوات مسألة ذوق، ونصّك أهم من أي توصيف.
المهمة
الخيار الأول
البديل
الكتب الصوتية والقراءات الطويلة
cedar
sage
الدعم وروبوتات الهاتف
marin
coral
عروض المنتجات
alloy
echo
الإعلانات والمقاطع القصيرة
nova
verse
التأمل والمحتوى الهادئ
ballad
shimmer
السرد والقراءات الطويلة
الاستماع الطويل يُرهق الأصوات ذات الشخصية القوية. صوت مشرق يسحرك لخمس عشرة ثانية قد يُنهكك عند الدقيقة العاشرة. في السرد، اختر صوتًا هادئًا ومتزنًا، ثم استخدم التعليمات لإضفاء الدفء. قسّم المخطوطة عند فواصل الفقرات، لأن لكل طلب حدًا أقصى لطول الإدخال، والمقاطع الأقصر تمنح الصوت بداية جديدة. راجع مرجع API الحالي للاطلاع على الحد الدقيق.
المساعدون وروبوتات الدعم
بالنسبة للروبوت، الصفتان الفائزتان هما الوضوح ونبرة مقنعة تحت ضغط خفيف. اختبر صوتك على أسوأ الرسائل التي ترسلها: الاستردادات والتأخيرات والأعطال. الصوت الذي يبدو مبتهجًا وهو يقدّم أخبارًا سيئة يبدو غير متناسب مع الموقف، لذلك اكتب تعليمات مثل "هادئ ومخلص" في كل طلب. ويمكنك دمج ذلك مع البث المباشر لتبدأ الردود بسرعة.
الإعلانات والمقاطع القصيرة
المقاطع القصيرة تكافئ الطاقة. اعتمد على nova أوverse، وأضف تعليمة مثل "نشيط وسريع وحواري"، وأبقِ الجمل قصيرة كي لا يضطر الأداء إلى الإسراع أبدًا. صيّر نسختين أو ثلاثًا واختر بالأذن، فالفرق بين تسجيل جيد وآخر رائع غالبًا ما يكون صفة واحدة مُغيَّرة.
التكاليف والحدود بالأرقام الفعلية
لكل حرف مقابل لكل توكن
تبلغ مخطوطة من 10,000 كلمة نحو 60,000 حرف، وحوالي 67 دقيقة من الكلام بإيقاع طبيعي. بالنسبة لـgpt-4o-mini-tts، كان تقدير OpenAI عند الإطلاق نحو 1.5 سنت لكل دقيقة من الصوت، وهكذا يُحسب الصف الأخير أدناه.
النموذج
التكلفة التقريبية لـ 10,000 كلمة
tts-1
نحو 0.90 دولار
tts-1-hd
نحو 1.80 دولار
gpt-4o-mini-tts
نحو 1.00 دولار
هذه الأرقام صغيرة بما يكفي لتكون جودة الصوت هي ما يحدد النموذج، لا السعر. التكلفة الأكبر هي وقتك في إعادة تصيير المقاطع التي أخطأت النبرة، وهذا سبب آخر لاستخدام حقل التعليمات.
دعم اللغات
تدرج OpenAI دعم أكثر من 50 لغة، من الأفريقانية والعربية إلى التشيكية والدنماركية والهولندية، مع ملاحظة أن الأصوات محسّنة حاليًا للإنجليزية. عمليًا، يعمل النص غير الإنجليزي، لكن اللهجة قد تنحرف نحو النطق الإنجليزي. اختبر كل لغة تقدمها، واطلب من متحدث أصلي أن يستمع قبل الإطلاق.
الإفصاح والأصوات المخصصة
تشترط سياسات الاستخدام الخاصة بـ OpenAI إفصاحًا واضحًا للمستخدمين النهائيين بأن الصوت الذي يسمعونه مولَّد بالذكاء الاصطناعي وليس صوت إنسان. اجعل هذه العبارة جزءًا من منتجك نفسه، لا من الحروف الصغيرة. الأصوات المخصصة متاحة، لكنها تمر عبر عملية منفصلة تتطلب تسجيلات موافقة من المتحدث وعينات صوتية، لذا خطّط لوقت إضافي إذا كنت تريد صوتًا خاصًا بعلامتك التجارية.
بدائل على PicassoIA
لا يعرض PicassoIA نماذج الكلام الخاصة بـ OpenAI. ما يقدّمه هو مجموعة كبيرة من المحركات الأخرى في فئة Generate speech، بالإضافة إلى أدوات للمهمتين المحيطتين بعمل الصوت: فحص النتيجة وإضافة صوت خلفي تحتها.
طريقة سريعة لاكتشاف الأسماء التي نُطقت بشكل خاطئ هي تشغيل الصوت المُولَّد مرة أخرى عبر تحويل الكلام إلى نص ومقارنته بنصّك. يتعامل كلاهما، GPT-4o Transcribe وGPT-4o Mini Transcribe، مع هذه المهمة، وGemini 3 Pro رأي ثالث جيد. إذا أسقط النص كلمة أو غيّرها، فالأرجح أن المستمع سمع الشيء نفسه.
أضف موسيقى تحت الصوت
التعليق الصوتي بلا خلفية قد يبدو عاريًا. أنشئ مقطعًا في فئة Generate music وامزجه منخفضًا خلف السرد. ElevenLabs Music، وMiniMax Music 2.6، وLyria 3 Pro، وStable Audio 2.5 تحوّل جميعها أمرًا نصيًا إلى مقطع موسيقي. اطلب "موسيقى آلية هادئة بلا غناء، وإيقاع ثابت" حتى لا ينافس شيء الكلمات.
استخدم Gemini 3.1 Flash TTS على PicassoIA
بما أن أصوات OpenAI غير مستضافة هناك، فأقرب بديل هو Gemini 3.1 Flash TTS، الذي يمنحك سير عمل مشابهًا مع قائمة أصوات أكبر. إليك طريقة تشغيله:
افتح صفحة النموذج واعثر على نموذج الإدخال.
الصق نصك في حقل Text. الحد هو 4,000 بايت، لذا قسّم النصوص الأطول.
اختر صوتًا من بين 30 خيارًا. الافتراضي هو Kore، وأسماء مثل Puck وCharon وFenrir وAoede وZephyr نقاط بداية جيدة.
اكتب أمرًا للأسلوب في حقل Prompt. الافتراضي هو "Say the following." استبدله بشيء مثل "تحدّث ببطء وثقة" أو "استخدم نبرة هادئة وودودة".
حدد رمز اللغة. الافتراضي هو en-US، وتتوفر أكثر من 70 رمزًا.
صيّر واستمع وعدّل. غيّر شيئًا واحدًا في كل تشغيل حتى تعرف ما الذي أحدث الفرق.
الإعداد
نصيحة
وسوم النص
أضف [whispering] أو [laughing] أو [shouting] أو [sigh] أو [extremely fast] مباشرة قبل العبارة التي يجب أن تؤثر فيها
Prompt
صف الإيقاع والنبرة واللهجة في جملة واحدة
Voice
جرّب ثلاثة أصوات على الفقرة نفسها قبل الحسم
Language code
طابقه مع لغة النص لا مع لغتك
💡 نصيحة: شغّل المقطع النهائي عبر GPT-4o Transcribe للتأكد من أن كل اسم ورقم خرج كما كُتب.
جرّبه بنفسك على Picasso IA
اختيار أصوات OpenAI TTS مهمة استماع، وأسرع طريقة لتتحسن فيها هي توليد المقاطع ومقارنتها. خذ نص الاختبار أعلاه، وشغّله على الأصوات الثلاثة عشر، ثم شغّل النص نفسه عبر Gemini 3.1 Flash TTS وMiniMax Speech 2.8 HD على Picasso IA. أضف خلفية موسيقية ناعمة، وافحص النص المكتوب، واحتفظ بالصوت الذي ما زال يبدو صحيحًا عند الاستماع العاشر. افتح Picasso IA، والصق نصك، وابدأ بصوت واحد وتعليمة واحدة. تعليقك الصوتي الأول القابل للاستخدام أقرب مما توحي به القائمة المنسدلة.