Fish Audio API: تسعير تحويل النص إلى كلام واستنساخ الصوت، بندًا بندًا
تحتسب Fish Audio تحويل النص إلى كلام بسعر 15 دولارًا لكل مليون بايت UTF-8، والنسخ الصوتي بسعر 0.36 دولار لكل ساعة صوت، وتصميم الصوت بسعر سنت واحد لكل طلب. يحوّل هذا التحليل هذه الأسعار إلى ميزانيات مشاريع فعلية، ويقارن خطط الويب بواجهة API، ويوضح موضع استنساخ الصوت.
تبيع Fish Audio الكلام بحسب البايت، وهذه التفصيلة وحدها تفسّر تقريبًا كل مفاجأة في الفاتورة. تتقاضى Fish Audio API مبلغ 15 دولارًا لكل مليون بايت UTF-8 من النص في تحويل النص إلى كلام، و0.36 دولار لكل ساعة صوت في النسخ الصوتي، و0.01 دولار لكل طلب في تصميم الصوت. ولا يظهر استنساخ الصوت كبند منفصل في جدول الأسعار، وهذا ما يجعل الميزانية أبسط مما تبدو للوهلة الأولى.
يحوّل هذا التفصيل هذه الأسعار إلى ميزانيات مشاريع حقيقية: منشور مدونة، وكتاب صوتي، وروبوت دعم، وشهر من مقدمات البودكاست. وستجد أيضًا مقارنة خطط الويب مع API، وأين تبدأ حدود المعدل في التأثير فعلًا، وكيف يقارن السعر بمحركات الكلام الأخرى. الأرقام مأخوذة من تسعير Fish Audio المنشور ووثائق المطورين، وقد تتغيّر، لذا أعد التحقق منها قبل أن تدفع المال.
💡 إجابة سريعة: تكلّف ساعة من الكلام الإنجليزي عبر API نحو $1.25. أما مقال من 1,000 كلمة يُسرد من أوله إلى آخره فيكلّف نحو 8 سنتات.
ما تتقاضاه Fish Audio مقابل كل بايت
بطاقة الأسعار
كل الأسعار الخاصة بالمطورين تتسع في جدول واحد.
الخدمة
النموذج أو الميزة
السعر
تحويل النص إلى كلام
s2.1-pro
15.00 دولارًا لكل مليون بايت UTF-8
تحويل النص إلى كلام
s2-pro
15.00 دولارًا لكل مليون بايت UTF-8
تحويل النص إلى كلام
s1
15.00 دولارًا لكل مليون بايت UTF-8
تحويل النص إلى كلام
s2.1-pro-free
0.00 دولار لكل مليون بايت UTF-8
النسخ الصوتي
النموذجان المتاحان
0.36 دولار لكل ساعة صوت
تصميم الصوت
كل طلب ناجح
0.01 دولار
توصي الوثائق باستخدام s2.1-pro للمشاريع الجديدة، والنماذج الثلاثة المدفوعة لها سعر واحد، لذا فاختيار أحدها قرار يتعلق بالجودة لا بالمال. الإصدار المجاني s2.1-pro مدرج بسعر صفر، وهو مناسب لتجربة النص وتجهيز النموذج الأولي أثناء اختبار السيناريو.
المقياس الذي تعتمده Fish Audio: مليون بايت يعادل تقريبًا 180,000 كلمة إنجليزية، أو نحو 12 ساعة من الكلام. اقسم 15 دولارًا على 12 فتحصل على الرقم الذي يستحق الحفظ، وهو 1.25 دولار لكل ساعة من الصوت المكتمل.
لماذا البايت وليس الحرف؟
البايت هو الحجم الذي يشغله نصّك بعد ترميزه بصيغة UTF-8. وبالنسبة للنص الإنجليزي البسيط، يساوي الحرف الواحد بايتًا واحدًا، لذا فإن 15 دولارًا لكل مليون بايت تعني أيضًا 15 دولارًا لكل مليون حرف. لكن اللغات الأخرى تغيّر هذه المعادلة:
الحروف اللاتينية المزودة بعلامات والحروف السيريلية تأخذ نحو 2 بايت لكل منها.
الحروف الصينية واليابانية والكورية تأخذ نحو 3 بايتات لكل منها.
الرموز التعبيرية (Emoji) تأخذ 4 بايتات.
المسافات وعلامات الترقيم بايتات أيضًا، لذا فإن نصًا محشوًا بتوجيهات مسرحية يكلّف أكثر من النص نفسه بعد تقليمه.
💡 قِس قبل الإرسال: في Python، يعيد len(text.encode("utf-8")) عدد البايتات الدقيق لنص ما. اضرب الناتج في 0.000015 فتحصل على السعر بالدولار.
تكاليف حقيقية لمشاريع حقيقية
تبدو الأرقام على بطاقة الأسعار مجردة إلى أن تربطها بعمل فعلي. تستخدم هذه الأمثلة النسبة التي تعتمدها Fish Audio، أي 180,000 كلمة لكل مليون بايت.
المهمة
مدة الصوت
البايتات المرسلة
التكلفة
مقالة من 1,000 كلمة
حوالي 4 دقائق
حوالي 5,600
حوالي 0.08 دولار
30 ملخصًا يوميًا مدته خمس دقائق
2.5 ساعة
حوالي 208,000
حوالي 3.13 دولار
كتاب صوتي من 80,000 كلمة
حوالي 5.3 ساعة
حوالي 444,000
حوالي 6.67 دولار
10,000 رد دعم من 300 حرف
حوالي 36 ساعة
3,000,000
45.00 دولار
مليون حرف ياباني
متفاوتة
حوالي 3,000,000
حوالي 45.00 دولار
السرد والكتب الصوتية
كتاب صوتي كامل بأقل من ثمن ساندويتش هو العنوان الرئيسي هنا. حتى مع خطة إنتاج سخية تتضمن خمس إعادات تصيير كاملة لعنوان من 80,000 كلمة، تقترب التكلفة من 33 دولارًا. تتبع الفاتورة النص الذي ترسله، لا الثواني التي تعود بها، لذا فإبطاء الصوت باستخدام أداة السرعة (تسمح الوثائق بين 0.5 و2.0) لا يرفع السعر.
الروبوتات والحجم الكبير
الرسائل القصيرة تتراكم بهدوء. فروبوت دعم يجيب على 10,000 سؤال بردود من 300 حرف يستهلك ثلاثة ملايين بايت، أي 45 دولارًا. خزّن مؤقتًا أي رد يتكرر. فالترحيب الذي يُنطق 50,000 مرة ينبغي توليده مرة واحدة وتخزينه.
اللغات غير اللاتينية
احسب الميزانية بالبايت لا بالحروف كلما لم تكن اللغة إنجليزية. فمليون حرف ياباني أو صيني يكلّف حوالي 45 دولارًا، أي ثلاثة أضعاف الرقم الإنجليزي، والنص السيريلي يقارب 30 دولارًا. الصوت ليس أطول، لكن العداد يعمل على الحجم بعد الترميز.
أربع طرق لتقليص الفاتورة
العادات الصغيرة تحدث فرقًا حين يزداد الحجم:
جرّب على الإصدار المجاني أولًا. اضبط إيقاع النص وعلاماته على s2.1-pro-free، وتحقق من حدوده في الوثائق، ثم صيّر النسخ النهائية على نموذج مدفوع.
احذف الزوائد. أزل التوجيهات المسرحية والمسافات المكررة وأي ترميز متبقٍ قبل إرسال النص.
خزّن الجمل المتكررة مؤقتًا. ينبغي توليد الترحيبات وعبارات القوائم والتنويهات مرة واحدة وتخزينها.
صيّر النص فقرةً فقرة. فالخطأ المطبعي يكلّفك عندها فقرة واحدة لا فصلًا كاملًا.
استنساخ الصوت وتكلفته
ليس في بطاقة الأسعار رسوم لاستنساخ الصوت. استنادًا إلى صفحة الأسعار، يُحتسب توليد الكلام بصوت مستنسخ كتحويل نص إلى كلام عادي، بحسب البايت. أما ما يتغير فهو سير العمل.
الاستنساخ الفوري مقابل الأصوات المحفوظة
تصف الوثائق مسارين:
الاستنساخ الفوري: مرّر ملف الصوت المرجعي مباشرة مع طلب الكلام. لا يُخزَّن شيء، وهذا مناسب للمهام المنفردة.
الأصوات الدائمة: أنشئ صوتًا مرة واحدة، واحصل على معرّف صوت قابل لإعادة الاستخدام، واستدعِه من أي طلب لاحق. يجعل وضع التدريب السريع الافتراضي الصوت قابلًا للاستخدام تقريبًا فورًا.
الأصوات المحفوظة خاصة افتراضيًا. يمكنك تحويل أحدها إلى غير مدرج، فيحصل على رابط قابل للمشاركة، أو إلى عام، فيُضاف إلى مكتبة الأصوات المجتمعية.
يأخذ حقل latency القيمة balanced، وتصفها Fish Audio بأنها نحو 300 ميلي ثانية حتى أول صوت، أو normal، وهي الخيار الذي يفضّل الاستقرار. صيغ الإخراج هي mp3 وwav وopus وpcm. وتشير مواد Fish Audio أيضًا إلى وسوم العواطف المضمّنة للتحكم في النبرة، لذا راجع مرجع API لمعرفة الصيغة الدقيقة قبل الاعتماد عليها.
العينات والموافقة والحقوق
يبدأ الاستنساخ الجيد بتسجيل جيد. تطلب الوثائق صوتًا نظيفًا أحادي القناة لمتحدث واحد، بمدة لا تقل عن 10 ثوانٍ لكل مقطع، وتشير إلى أن دقيقة أو دقيقتين من كلام واضح تحسّنان الدقة. الملفات المقبولة هي wav وmp3 وm4a وopus، وإزالة ضوضاء الخلفية مفعّلة افتراضيًا. وتذكر صفحات التسويق عينة مدتها 15 ثانية عبر 30 لغة أو أكثر، لذا اعتبر 10 إلى 15 ثانية الحد الأدنى لا الهدف.
الحقوق أهم من السعر. يحق للمشتركين المدفوعين استخدام أصوات موثّقة يملكونها في الأعمال التجارية، بينما يقتصر ناتج الخطة المجانية على المشاريع الشخصية غير التجارية. تحقق من شروط الترخيص لخطتك قبل نشر أي عمل تجاري، وإذا استنسخت صوت عميل أو متعاقد، فاحصل على إذن كتابي أولًا.
💡 قاعدة عامة: استنسخ صوتك أنت، أو صوتًا استأجرته لهذا الغرض، أو صوتًا معه إذن موقّع. ولا شيء غير ذلك.
خطط الويب مقابل API
تبيع Fish Audio أيضًا خططًا شهرية لمن يعملون في الاستوديو الإلكتروني بدلًا من كتابة الشيفرة.
الخطة
السعر الشهري
النقاط
مدة التوليد المعلنة
ميزات إضافية
Free
0 دولار
8,000
حوالي 7 دقائق
500 حرف لكل توليد، و3 أماكن للأصوات العامة
Plus
11 دولارًا
250,000
حتى 200 دقيقة
15,000 حرف لكل توليد، و10 أصوات خاصة، وصوت احترافي واحد
Pro
75 دولارًا
2,000,000
حتى 1,620 دقيقة
30,000 حرف لكل توليد، و5 أصوات احترافية، و3 مقاعد للفريق
Max
749 دولارًا
25,000,000
حتى 6,250 دقيقة
15 صوتًا احترافيًا، و10 مقاعد للفريق
Enterprise
مخصص، يُفوتر سنويًا
مخصص
مخصص
عدم الاحتفاظ بالبيانات، ونشر محلي، و SOC2
يخفّض الدفع السنوي السعر الشهري: خطة Plus بسعر 132 دولارًا في السنة، وخطة Pro بسعر 900 دولار، وخطة Max بسعر 8,988 دولارًا.
أين تتفوق API
حوّل الدقائق المعلنة لكل خطة إلى إنفاق عبر API بسعر $1.25 في الساعة، وستلاحظ أن الفرق كبير.
الخطة
الدقائق المعلنة
الصوت نفسه عبر API
سعر الخطة
Plus
200
حوالي $4.17
$11
Pro
1,620
حوالي $33.75
$75
Max
6,250
حوالي $130.21
$749
تلك أرقام الدقائق هي الأرقام الواردة في صفحة الخطط نفسها، لذا فالمقارنة تقريبية. ومع ذلك، النمط واضح: تشتري الخطة استوديو الويب وفتحات الأصوات ومقاعد الفريق، بينما يكون الصوت الخام أرخص بحسب البايت. مكانُ المطورين ووظائف الدفعات والمسارات الآلية الطبيعي هو API. أما المحررون والمسوّقون الذين لا يفتحون الطرفية أبدًا، فقد يدفعون بسرور مقابل الواجهة.
إليك شهر محسوب لفريق بودكاست صغير. يولّد الفريق 40 ساعة من الكلام (50.00 دولار)، وينسخ 40 ساعة من تسجيلات الضيوف الخام (14.40 دولار)، ويجرّب 20 تصميمًا جديدًا للصوت (0.20 دولار). المجموع 64.60 دولار. وهذا أقل من خطة Pro بسعر 75 دولارًا، التي تعلن عن 27 ساعة توليد فقط، ويحتفظ الفريق معها بالتحكم الكامل في الأتمتة والتخزين.
النسخ الصوتي وتصميم الصوت والحدود
النسخ الصوتي بسعر 0.36 دولار للساعة
تكلّف خدمة التعرف على الكلام في Fish Audio 0.36 دولار لكل ساعة صوت، وتُحتسب على المدة المعالجة مقرّبةً إلى أقرب ثانية. تكلّف عشر ساعات من المقابلات 3.60 دولار، ومئة ساعة تكلّف 36 دولارًا. اقرنها بتحويل النص إلى كلام وستتمكن من بناء حلقة تنسخ تسجيلًا، وتعدّل النص، ثم تنطق الناتج من جديد بصوت مستنسخ.
تصميم الصوت بسنت واحد
ينشئ تصميم الصوت أصواتًا جديدة من وصف مكتوب بدلًا من تسجيل، ويمكن لطلب واحد أن يعيد عدة مرشحين. والرسوم هي 0.01 دولار لكل طلب POST ناجح، وتُطبَّق مرة واحدة مهما عاد من أصوات مرشحة. مئة محاولة تصميم تكلّف دولارًا واحدًا، لذا جرّب بحرية.
مستويات التزامن
تعتمد حدود السرعة على المبلغ الذي دفعته مسبقًا:
المستوى
الإنفاق المدفوع مسبقًا
الطلبات المتزامنة
Starter
أقل من 100 دولار
5
Elevated
100 دولار أو أكثر
15
High Volume
1,000 دولار أو أكثر
50
Enterprise
مخصص
مخصص
يُفعَّل المستوى فور وصولك إلى حد الدفع المسبق، ولا يلزم إنفاق الرصيد أولًا. وإذا كنت تخطط لسرد نحو 80 ساعة شهريًا (100 دولار من الكلام)، فإن شحنة بقيمة 100 دولار تشتري الصوت والتوازي بثلاثة أضعاف.
كيف يقارن السعر
الأسعار أدناه كما وردت في مقارنة المطورين لدى Fish Audio ومراجعة أسعار لجهة خارجية. اعتبرها نقطة بداية، وتحقق منها في صفحة كل مزوّد.
السعر ليس معيارًا للجودة. تذكر مراجعات الأسعار لجهات خارجية أن S2 Pro من Fish Audio يحقق نتائج جيدة في اختبارات الاستماع الأعمى، بينما تمتلك ElevenLabs مجموعة ميزات أنضج. والمحرك الرخيص الذي يحتاج إلى ثلاث إعادات تصيير لكل فقرة لم يعد رخيصًا. وتغيّر اللغات غير اللاتينية الحسبة أيضًا، لأن البايتات ترفع التكلفة إلى ثلاثة أضعاف في اليابانية والصينية.
إذا أردت أن تسمع نسخة مستنسخة قبل كتابة شيفرة التكامل، فإن MiniMax Voice Cloning يحوّل تسجيلًا قصيرًا إلى ملف تعريف صوتي قابل لإعادة الاستخدام. يعرض PicassoIA هذه الأداة للتجربة مجانًا عبر الإنترنت، دون الحاجة إلى أي برمجة.
اختر النموذج والعينة
افتح صفحة MiniMax Voice Cloning وارفع ملف صوتك: بصيغة MP3 أو M4A أو WAV، بمدة من 10 ثوانٍ إلى 5 دقائق، وبحجم أقل من 20 ميغابايت.
فعّل تقليل الضوضاء إذا كان التسجيل يحتوي على هسيس أو صدى الغرفة، وتطبيع مستوى الصوت إذا كان المستوى يتذبذب.
اترك الدقة على القيمة الافتراضية 0.7 في البداية. وهي تحدد عتبة التحقق من النص بين 0 و1.
شغّل النموذج وستحصل على ملف تعريف صوتي يمكنك إعادة استخدامه في أي عدد من عمليات تحويل النص إلى كلام يحتاجه المشروع. شغّل نصك عبر مستوى الكلام الذي دربته، ثم قارن النتيجة بما تسمعه من Fish Audio API.
💡 عينة أفضل، استنساخ أفضل: سجّل 30 ثانية بوتيرتك الطبيعية في غرفة مفروشة بالسجاد ومغطاة بالستائر، من دون موسيقى في الخلفية.
تجيب جداول الأسعار عن سعر الصوت. أما إن كان يستحق ذلك فلا يجيب عنه إلا أذنك أنت. افتح Picasso IA، وارفع عينة قصيرة إلى MiniMax Voice Cloning، واقرأ الفقرة نفسها عبر نموذجين أو ثلاثة من نماذج الكلام، ولاحظ أيها تثق به لعلامتك التجارية.
ثم أضف الموسيقى وفحصًا للنص المفرّغ، وسيكون لديك مسودة سير عمل صوتي كامل قبل إنفاق أي سنت على عقد API. خطة اختبار بسيطة تعمل جيدًا:
استنسخ عينة من 30 ثانية من صوتك.
اسرد 200 كلمة نفسها بثلاثة نماذج كلام مختلفة.
انسخ كل نتيجة وعدّ الكلمات التي أخطأ فيها المحرك.
سعّر الفائز باستخدام حسابة البايت أعلاه.
ابدأ اليوم بنص قصير واحد، وقارن النتائج جنبًا إلى جنب، ودع المقاطع التي تستمتع بها فعلًا تقرر أي محرك يحصل على ميزانيتك.