Fish Audio API: تسعير تحويل النص إلى كلام واستنساخ الصوت، بندًا بندًا

تحتسب Fish Audio تحويل النص إلى كلام بسعر 15 دولارًا لكل مليون بايت UTF-8، والنسخ الصوتي بسعر 0.36 دولار لكل ساعة صوت، وتصميم الصوت بسعر سنت واحد لكل طلب. يحوّل هذا التحليل هذه الأسعار إلى ميزانيات مشاريع فعلية، ويقارن خطط الويب بواجهة API، ويوضح موضع استنساخ الصوت.

Fish Audio API: تسعير تحويل النص إلى كلام واستنساخ الصوت، بندًا بندًا
Cristian Da Conceicao
مؤسس Picasso IA

تبيع Fish Audio الكلام بحسب البايت، وهذه التفصيلة وحدها تفسّر تقريبًا كل مفاجأة في الفاتورة. تتقاضى Fish Audio API مبلغ 15 دولارًا لكل مليون بايت UTF-8 من النص في تحويل النص إلى كلام، و0.36 دولار لكل ساعة صوت في النسخ الصوتي، و0.01 دولار لكل طلب في تصميم الصوت. ولا يظهر استنساخ الصوت كبند منفصل في جدول الأسعار، وهذا ما يجعل الميزانية أبسط مما تبدو للوهلة الأولى.

يحوّل هذا التفصيل هذه الأسعار إلى ميزانيات مشاريع حقيقية: منشور مدونة، وكتاب صوتي، وروبوت دعم، وشهر من مقدمات البودكاست. وستجد أيضًا مقارنة خطط الويب مع API، وأين تبدأ حدود المعدل في التأثير فعلًا، وكيف يقارن السعر بمحركات الكلام الأخرى. الأرقام مأخوذة من تسعير Fish Audio المنشور ووثائق المطورين، وقد تتغيّر، لذا أعد التحقق منها قبل أن تدفع المال.

💡 إجابة سريعة: تكلّف ساعة من الكلام الإنجليزي عبر API نحو $1.25. أما مقال من 1,000 كلمة يُسرد من أوله إلى آخره فيكلّف نحو 8 سنتات.

ما تتقاضاه Fish Audio مقابل كل بايت

ميكروفون مكثف مع فلتر للهمهمة في غرفة تسجيل مكسوّة بالخشب

بطاقة الأسعار

كل الأسعار الخاصة بالمطورين تتسع في جدول واحد.

الخدمةالنموذج أو الميزةالسعر
تحويل النص إلى كلامs2.1-pro15.00 دولارًا لكل مليون بايت UTF-8
تحويل النص إلى كلامs2-pro15.00 دولارًا لكل مليون بايت UTF-8
تحويل النص إلى كلامs115.00 دولارًا لكل مليون بايت UTF-8
تحويل النص إلى كلامs2.1-pro-free0.00 دولار لكل مليون بايت UTF-8
النسخ الصوتيالنموذجان المتاحان0.36 دولار لكل ساعة صوت
تصميم الصوتكل طلب ناجح0.01 دولار

توصي الوثائق باستخدام s2.1-pro للمشاريع الجديدة، والنماذج الثلاثة المدفوعة لها سعر واحد، لذا فاختيار أحدها قرار يتعلق بالجودة لا بالمال. الإصدار المجاني s2.1-pro مدرج بسعر صفر، وهو مناسب لتجربة النص وتجهيز النموذج الأولي أثناء اختبار السيناريو.

المقياس الذي تعتمده Fish Audio: مليون بايت يعادل تقريبًا 180,000 كلمة إنجليزية، أو نحو 12 ساعة من الكلام. اقسم 15 دولارًا على 12 فتحصل على الرقم الذي يستحق الحفظ، وهو 1.25 دولار لكل ساعة من الصوت المكتمل.

لماذا البايت وليس الحرف؟

البايت هو الحجم الذي يشغله نصّك بعد ترميزه بصيغة UTF-8. وبالنسبة للنص الإنجليزي البسيط، يساوي الحرف الواحد بايتًا واحدًا، لذا فإن 15 دولارًا لكل مليون بايت تعني أيضًا 15 دولارًا لكل مليون حرف. لكن اللغات الأخرى تغيّر هذه المعادلة:

  • الحروف اللاتينية المزودة بعلامات والحروف السيريلية تأخذ نحو 2 بايت لكل منها.
  • الحروف الصينية واليابانية والكورية تأخذ نحو 3 بايتات لكل منها.
  • الرموز التعبيرية (Emoji) تأخذ 4 بايتات.
  • المسافات وعلامات الترقيم بايتات أيضًا، لذا فإن نصًا محشوًا بتوجيهات مسرحية يكلّف أكثر من النص نفسه بعد تقليمه.

منظر علوي لمكتب عليه دفتر حسابات مكتوب بخط اليد وصفحات مخطوطة مطبوعة

💡 قِس قبل الإرسال: في Python، يعيد len(text.encode("utf-8")) عدد البايتات الدقيق لنص ما. اضرب الناتج في 0.000015 فتحصل على السعر بالدولار.

تكاليف حقيقية لمشاريع حقيقية

تبدو الأرقام على بطاقة الأسعار مجردة إلى أن تربطها بعمل فعلي. تستخدم هذه الأمثلة النسبة التي تعتمدها Fish Audio، أي 180,000 كلمة لكل مليون بايت.

المهمةمدة الصوتالبايتات المرسلةالتكلفة
مقالة من 1,000 كلمةحوالي 4 دقائقحوالي 5,600حوالي 0.08 دولار
30 ملخصًا يوميًا مدته خمس دقائق2.5 ساعةحوالي 208,000حوالي 3.13 دولار
كتاب صوتي من 80,000 كلمةحوالي 5.3 ساعةحوالي 444,000حوالي 6.67 دولار
10,000 رد دعم من 300 حرفحوالي 36 ساعة3,000,00045.00 دولار
مليون حرف يابانيمتفاوتةحوالي 3,000,000حوالي 45.00 دولار

السرد والكتب الصوتية

كتاب صوتي كامل بأقل من ثمن ساندويتش هو العنوان الرئيسي هنا. حتى مع خطة إنتاج سخية تتضمن خمس إعادات تصيير كاملة لعنوان من 80,000 كلمة، تقترب التكلفة من 33 دولارًا. تتبع الفاتورة النص الذي ترسله، لا الثواني التي تعود بها، لذا فإبطاء الصوت باستخدام أداة السرعة (تسمح الوثائق بين 0.5 و2.0) لا يرفع السعر.

امرأة ترتدي كنزة رمادية تقرأ مخطوطة مطبوعة في ميكروفون استوديو

الروبوتات والحجم الكبير

الرسائل القصيرة تتراكم بهدوء. فروبوت دعم يجيب على 10,000 سؤال بردود من 300 حرف يستهلك ثلاثة ملايين بايت، أي 45 دولارًا. خزّن مؤقتًا أي رد يتكرر. فالترحيب الذي يُنطق 50,000 مرة ينبغي توليده مرة واحدة وتخزينه.

اللغات غير اللاتينية

احسب الميزانية بالبايت لا بالحروف كلما لم تكن اللغة إنجليزية. فمليون حرف ياباني أو صيني يكلّف حوالي 45 دولارًا، أي ثلاثة أضعاف الرقم الإنجليزي، والنص السيريلي يقارب 30 دولارًا. الصوت ليس أطول، لكن العداد يعمل على الحجم بعد الترميز.

أربع طرق لتقليص الفاتورة

العادات الصغيرة تحدث فرقًا حين يزداد الحجم:

  1. جرّب على الإصدار المجاني أولًا. اضبط إيقاع النص وعلاماته على s2.1-pro-free، وتحقق من حدوده في الوثائق، ثم صيّر النسخ النهائية على نموذج مدفوع.
  2. احذف الزوائد. أزل التوجيهات المسرحية والمسافات المكررة وأي ترميز متبقٍ قبل إرسال النص.
  3. خزّن الجمل المتكررة مؤقتًا. ينبغي توليد الترحيبات وعبارات القوائم والتنويهات مرة واحدة وتخزينها.
  4. صيّر النص فقرةً فقرة. فالخطأ المطبعي يكلّفك عندها فقرة واحدة لا فصلًا كاملًا.

استنساخ الصوت وتكلفته

ليس في بطاقة الأسعار رسوم لاستنساخ الصوت. استنادًا إلى صفحة الأسعار، يُحتسب توليد الكلام بصوت مستنسخ كتحويل نص إلى كلام عادي، بحسب البايت. أما ما يتغير فهو سير العمل.

الاستنساخ الفوري مقابل الأصوات المحفوظة

تصف الوثائق مسارين:

  • الاستنساخ الفوري: مرّر ملف الصوت المرجعي مباشرة مع طلب الكلام. لا يُخزَّن شيء، وهذا مناسب للمهام المنفردة.
  • الأصوات الدائمة: أنشئ صوتًا مرة واحدة، واحصل على معرّف صوت قابل لإعادة الاستخدام، واستدعِه من أي طلب لاحق. يجعل وضع التدريب السريع الافتراضي الصوت قابلًا للاستخدام تقريبًا فورًا.

الأصوات المحفوظة خاصة افتراضيًا. يمكنك تحويل أحدها إلى غير مدرج، فيحصل على رابط قابل للمشاركة، أو إلى عام، فيُضاف إلى مكتبة الأصوات المجتمعية.

يدا مهندس صوت مستقرتان على مؤشرات لوحة مزج تناظرية

يبدو الطلب إلى نقطة نهاية TTS على النحو التالي:

POST /v1/tts
Authorization: Bearer <your token>
model: s2.1-pro

{
  "text": "Your script goes here.",
  "reference_id": "<voice id>",
  "format": "mp3",
  "latency": "balanced"
}

يأخذ حقل latency القيمة balanced، وتصفها Fish Audio بأنها نحو 300 ميلي ثانية حتى أول صوت، أو normal، وهي الخيار الذي يفضّل الاستقرار. صيغ الإخراج هي mp3 وwav وopus وpcm. وتشير مواد Fish Audio أيضًا إلى وسوم العواطف المضمّنة للتحكم في النبرة، لذا راجع مرجع API لمعرفة الصيغة الدقيقة قبل الاعتماد عليها.

العينات والموافقة والحقوق

يبدأ الاستنساخ الجيد بتسجيل جيد. تطلب الوثائق صوتًا نظيفًا أحادي القناة لمتحدث واحد، بمدة لا تقل عن 10 ثوانٍ لكل مقطع، وتشير إلى أن دقيقة أو دقيقتين من كلام واضح تحسّنان الدقة. الملفات المقبولة هي wav وmp3 وm4a وopus، وإزالة ضوضاء الخلفية مفعّلة افتراضيًا. وتذكر صفحات التسويق عينة مدتها 15 ثانية عبر 30 لغة أو أكثر، لذا اعتبر 10 إلى 15 ثانية الحد الأدنى لا الهدف.

يدان تمسكان هاتفًا ذكيًا لتسجيل عينة صوتية في غرفة معيشة هادئة

الحقوق أهم من السعر. يحق للمشتركين المدفوعين استخدام أصوات موثّقة يملكونها في الأعمال التجارية، بينما يقتصر ناتج الخطة المجانية على المشاريع الشخصية غير التجارية. تحقق من شروط الترخيص لخطتك قبل نشر أي عمل تجاري، وإذا استنسخت صوت عميل أو متعاقد، فاحصل على إذن كتابي أولًا.

💡 قاعدة عامة: استنسخ صوتك أنت، أو صوتًا استأجرته لهذا الغرض، أو صوتًا معه إذن موقّع. ولا شيء غير ذلك.

خطط الويب مقابل API

تبيع Fish Audio أيضًا خططًا شهرية لمن يعملون في الاستوديو الإلكتروني بدلًا من كتابة الشيفرة.

الخطةالسعر الشهريالنقاطمدة التوليد المعلنةميزات إضافية
Free0 دولار8,000حوالي 7 دقائق500 حرف لكل توليد، و3 أماكن للأصوات العامة
Plus11 دولارًا250,000حتى 200 دقيقة15,000 حرف لكل توليد، و10 أصوات خاصة، وصوت احترافي واحد
Pro75 دولارًا2,000,000حتى 1,620 دقيقة30,000 حرف لكل توليد، و5 أصوات احترافية، و3 مقاعد للفريق
Max749 دولارًا25,000,000حتى 6,250 دقيقة15 صوتًا احترافيًا، و10 مقاعد للفريق
Enterpriseمخصص، يُفوتر سنويًامخصصمخصصعدم الاحتفاظ بالبيانات، ونشر محلي، و SOC2

يخفّض الدفع السنوي السعر الشهري: خطة Plus بسعر 132 دولارًا في السنة، وخطة Pro بسعر 900 دولار، وخطة Max بسعر 8,988 دولارًا.

ثلاثة زملاء يقارنون قوائم أسعار مطبوعة حول طاولة خشبية

أين تتفوق API

حوّل الدقائق المعلنة لكل خطة إلى إنفاق عبر API بسعر $1.25 في الساعة، وستلاحظ أن الفرق كبير.

الخطةالدقائق المعلنةالصوت نفسه عبر APIسعر الخطة
Plus200حوالي $4.17$11
Pro1,620حوالي $33.75$75
Max6,250حوالي $130.21$749

تلك أرقام الدقائق هي الأرقام الواردة في صفحة الخطط نفسها، لذا فالمقارنة تقريبية. ومع ذلك، النمط واضح: تشتري الخطة استوديو الويب وفتحات الأصوات ومقاعد الفريق، بينما يكون الصوت الخام أرخص بحسب البايت. مكانُ المطورين ووظائف الدفعات والمسارات الآلية الطبيعي هو API. أما المحررون والمسوّقون الذين لا يفتحون الطرفية أبدًا، فقد يدفعون بسرور مقابل الواجهة.

إليك شهر محسوب لفريق بودكاست صغير. يولّد الفريق 40 ساعة من الكلام (50.00 دولار)، وينسخ 40 ساعة من تسجيلات الضيوف الخام (14.40 دولار)، ويجرّب 20 تصميمًا جديدًا للصوت (0.20 دولار). المجموع 64.60 دولار. وهذا أقل من خطة Pro بسعر 75 دولارًا، التي تعلن عن 27 ساعة توليد فقط، ويحتفظ الفريق معها بالتحكم الكامل في الأتمتة والتخزين.

النسخ الصوتي وتصميم الصوت والحدود

النسخ الصوتي بسعر 0.36 دولار للساعة

تكلّف خدمة التعرف على الكلام في Fish Audio 0.36 دولار لكل ساعة صوت، وتُحتسب على المدة المعالجة مقرّبةً إلى أقرب ثانية. تكلّف عشر ساعات من المقابلات 3.60 دولار، ومئة ساعة تكلّف 36 دولارًا. اقرنها بتحويل النص إلى كلام وستتمكن من بناء حلقة تنسخ تسجيلًا، وتعدّل النص، ثم تنطق الناتج من جديد بصوت مستنسخ.

سماعات استوديو مستقرة فوق كومة من صفحات نسخ مظللة

تصميم الصوت بسنت واحد

ينشئ تصميم الصوت أصواتًا جديدة من وصف مكتوب بدلًا من تسجيل، ويمكن لطلب واحد أن يعيد عدة مرشحين. والرسوم هي 0.01 دولار لكل طلب POST ناجح، وتُطبَّق مرة واحدة مهما عاد من أصوات مرشحة. مئة محاولة تصميم تكلّف دولارًا واحدًا، لذا جرّب بحرية.

مستويات التزامن

تعتمد حدود السرعة على المبلغ الذي دفعته مسبقًا:

المستوىالإنفاق المدفوع مسبقًاالطلبات المتزامنة
Starterأقل من 100 دولار5
Elevated100 دولار أو أكثر15
High Volume1,000 دولار أو أكثر50
Enterpriseمخصصمخصص

يُفعَّل المستوى فور وصولك إلى حد الدفع المسبق، ولا يلزم إنفاق الرصيد أولًا. وإذا كنت تخطط لسرد نحو 80 ساعة شهريًا (100 دولار من الكلام)، فإن شحنة بقيمة 100 دولار تشتري الصوت والتوازي بثلاثة أضعاف.

ممر ضيق بين خزائن خوادم سوداء في مركز بيانات

كيف يقارن السعر

الأسعار أدناه كما وردت في مقارنة المطورين لدى Fish Audio ومراجعة أسعار لجهة خارجية. اعتبرها نقطة بداية، وتحقق منها في صفحة كل مزوّد.

المحركالسعر المعلن لكل مليون حرف
Fish Audio15 دولارًا (لكل مليون بايت)
Google Cloud TTS، الأصوات القياسية4 دولارات
Amazon Polly، القياسي / العصبي4 / 16 دولارًا
Azure TTS، الأصوات العصبية15 دولارًا
ElevenLabs Flash v2.5حوالي 60 دولارًا
ElevenLabs v2 Multilingualحوالي 120 إلى 165 دولارًا

ما يخفيه الجدول

السعر ليس معيارًا للجودة. تذكر مراجعات الأسعار لجهات خارجية أن S2 Pro من Fish Audio يحقق نتائج جيدة في اختبارات الاستماع الأعمى، بينما تمتلك ElevenLabs مجموعة ميزات أنضج. والمحرك الرخيص الذي يحتاج إلى ثلاث إعادات تصيير لكل فقرة لم يعد رخيصًا. وتغيّر اللغات غير اللاتينية الحسبة أيضًا، لأن البايتات ترفع التكلفة إلى ثلاثة أضعاف في اليابانية والصينية.

الحل هو اختبار مقارن: شغّل النص نفسه المكوّن من 200 كلمة عبر عدة محركات، وقيّم النتائج بأذنك. وعلى Picasso IA يمكنك فعل ذلك في مكان واحد مع ElevenLabs v3، وMiniMax Speech 2.8 HD، وQwen3 TTS، وChatterbox، وGemini 3.1 Flash TTS.

شغّل استنساخ الصوت على PicassoIA

إذا أردت أن تسمع نسخة مستنسخة قبل كتابة شيفرة التكامل، فإن MiniMax Voice Cloning يحوّل تسجيلًا قصيرًا إلى ملف تعريف صوتي قابل لإعادة الاستخدام. يعرض PicassoIA هذه الأداة للتجربة مجانًا عبر الإنترنت، دون الحاجة إلى أي برمجة.

اختر النموذج والعينة

  1. افتح صفحة MiniMax Voice Cloning وارفع ملف صوتك: بصيغة MP3 أو M4A أو WAV، بمدة من 10 ثوانٍ إلى 5 دقائق، وبحجم أقل من 20 ميغابايت.
  2. فعّل تقليل الضوضاء إذا كان التسجيل يحتوي على هسيس أو صدى الغرفة، وتطبيع مستوى الصوت إذا كان المستوى يتذبذب.
  3. اترك الدقة على القيمة الافتراضية 0.7 في البداية. وهي تحدد عتبة التحقق من النص بين 0 و1.
  4. اختر مستوى الكلام الذي ستدرّب عليه. الافتراضي هو Speech 2.6 HD، وSpeech 2.6 Turbo هو الخيار الأسرع.

وَلِّد كلامًا بالنسخة المستنسخة

شغّل النموذج وستحصل على ملف تعريف صوتي يمكنك إعادة استخدامه في أي عدد من عمليات تحويل النص إلى كلام يحتاجه المشروع. شغّل نصك عبر مستوى الكلام الذي دربته، ثم قارن النتيجة بما تسمعه من Fish Audio API.

مذيع بودكاست يرتدي سماعات وينظر إلى حاسوب محمول في استوديو منزلي مريح

💡 عينة أفضل، استنساخ أفضل: سجّل 30 ثانية بوتيرتك الطبيعية في غرفة مفروشة بالسجاد ومغطاة بالستائر، من دون موسيقى في الخلفية.

تغطي مساحة العمل نفسها بقية خط الصوت. أضف مسار خلفية باستخدام Stable Audio 2.5 أو MiniMax Music 2.6 أو ElevenLabs Music، ثم دقّق السرد بإعادة تشغيله عبر GPT-4o Transcribe أو Gemini 3 Pro.

ابنِ خط الصوت الخاص بك على Picasso IA

تجيب جداول الأسعار عن سعر الصوت. أما إن كان يستحق ذلك فلا يجيب عنه إلا أذنك أنت. افتح Picasso IA، وارفع عينة قصيرة إلى MiniMax Voice Cloning، واقرأ الفقرة نفسها عبر نموذجين أو ثلاثة من نماذج الكلام، ولاحظ أيها تثق به لعلامتك التجارية.

ثم أضف الموسيقى وفحصًا للنص المفرّغ، وسيكون لديك مسودة سير عمل صوتي كامل قبل إنفاق أي سنت على عقد API. خطة اختبار بسيطة تعمل جيدًا:

  • استنسخ عينة من 30 ثانية من صوتك.
  • اسرد 200 كلمة نفسها بثلاثة نماذج كلام مختلفة.
  • انسخ كل نتيجة وعدّ الكلمات التي أخطأ فيها المحرك.
  • سعّر الفائز باستخدام حسابة البايت أعلاه.

ابدأ اليوم بنص قصير واحد، وقارن النتائج جنبًا إلى جنب، ودع المقاطع التي تستمتع بها فعلًا تقرر أي محرك يحصل على ميزانيتك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة