Fish Audio API: TTS और वॉइस क्लोनिंग की कीमत, हर लाइन का हिसाब
Fish Audio टेक्स्ट-टू-स्पीच के लिए प्रति मिलियन UTF-8 बाइट $15, ट्रांसक्रिप्शन के लिए प्रति ऑडियो घंटा $0.36 और वॉइस डिज़ाइन के लिए प्रति रिक्वेस्ट एक सेंट लेता है। यह ब्रेकडाउन इन दरों को असली प्रोजेक्ट बजट में बदलता है, वेब प्लान की तुलना API से करता है और बताता है कि वॉइस क्लोनिंग कहाँ फ़िट होती है।
Fish Audio भाषण को बाइट के हिसाब से बेचता है, और यही एक बात इनवॉइस की लगभग हर चौंकाने वाली रकम को समझा देती है। Fish Audio API टेक्स्ट-टू-स्पीच के लिए प्रति मिलियन UTF-8 बाइट $15 लेता है, ट्रांसक्रिप्शन के लिए प्रति ऑडियो घंटा $0.36, और वॉइस डिज़ाइन के लिए प्रति रिक्वेस्ट $0.01। उस रेट टेबल में वॉइस क्लोनिंग की कोई अलग लाइन नहीं है, जिससे बजट बनाना पहली नज़र में दिखने से कहीं आसान हो जाता है।
यह ब्रेकडाउन इन दरों को असली प्रोजेक्ट बजट में बदलता है: एक ब्लॉग पोस्ट, एक ऑडियोबुक, एक सपोर्ट बॉट, एक महीने के पॉडकास्ट इंट्रो। आप यह भी देखेंगे कि वेब प्लान API से कैसे तुलना करते हैं, रेट लिमिट कहाँ सबसे ज़्यादा अड़चन बनती है, और दूसरे स्पीच इंजन के मुकाबले कीमत कैसी ठहरती है। ये आंकड़े Fish Audio की प्रकाशित प्राइसिंग और डेवलपर डॉक्स से लिए गए हैं और बदल सकते हैं, इसलिए पैसा लगाने से पहले इन्हें दोबारा जाँच लें।
💡 त्वरित जवाब: API के ज़रिए अंग्रेज़ी भाषण का एक घंटा लगभग $1.25 पड़ता है। 1,000 शब्दों का एक लेख, शुरू से अंत तक नैरेट किया जाए, तो लगभग 8 सेंट लगते हैं।
Fish Audio प्रति बाइट कितना चार्ज करता है
रेट कार्ड
डेवलपर साइड की हर कीमत एक ही टेबल में समा जाती है।
सेवा
मॉडल या फ़ीचर
कीमत
टेक्स्ट-टू-स्पीच
s2.1-pro
$15.00 प्रति मिलियन UTF-8 बाइट
टेक्स्ट-टू-स्पीच
s2-pro
$15.00 प्रति मिलियन UTF-8 बाइट
टेक्स्ट-टू-स्पीच
s1
$15.00 प्रति मिलियन UTF-8 बाइट
टेक्स्ट-टू-स्पीच
s2.1-pro-free
$0.00 प्रति मिलियन UTF-8 बाइट
ट्रांसक्रिप्शन
दोनों उपलब्ध मॉडल
$0.36 प्रति ऑडियो घंटा
वॉइस डिज़ाइन
हर सफल रिक्वेस्ट
$0.01
डॉक्स नए प्रोजेक्ट्स के लिए s2.1-pro की सिफ़ारिश करते हैं, और तीनों पेड मॉडल एक ही कीमत पर आते हैं, इसलिए इनमें से चुनना पैसे का नहीं, क्वालिटी का फ़ैसला है। मुफ़्त s2.1-pro वर्ज़न की कीमत शून्य लिखी है, जो स्क्रिप्ट को टेस्ट करते समय प्रोटोटाइपिंग के लिए ठीक है।
Fish Audio का अपना पैमाना: दस लाख बाइट लगभग 180,000 अंग्रेज़ी शब्द, या लगभग 12 घंटे के भाषण के बराबर होते हैं। $15 को 12 से भाग दें, और वह संख्या मिलती है जो याद रखने लायक है, तैयार ऑडियो के प्रति घंटे $1.25।
बाइट क्यों, कैरेक्टर क्यों नहीं
बाइट वह यूनिट है जो आपका टेक्स्ट UTF-8 में एन्कोड होने के बाद घेरता है। सादी अंग्रेज़ी में एक कैरेक्टर एक बाइट के बराबर होता है, इसलिए प्रति मिलियन बाइट $15 का मतलब प्रति मिलियन कैरेक्टर $15 भी है। दूसरी लिपियाँ इस समीकरण को बदल देती हैं:
एक्सेंट वाले लैटिन अक्षर और सिरिलिक में हर अक्षर लगभग 2 बाइट लेता है।
चीनी, जापानी और कोरियाई कैरेक्टर में हर कैरेक्टर लगभग 3 बाइट लेता है।
इमोजी 4 बाइट लेते हैं।
स्पेस और विराम चिह्न भी बाइट हैं, इसलिए स्टेज डायरेक्शन से भरी स्क्रिप्ट उतनी ही छँटी हुई स्क्रिप्ट से ज़्यादा महँगी पड़ती है।
💡 भेजने से पहले मापें: Python में len(text.encode("utf-8")) किसी स्क्रिप्ट की सटीक बाइट गिनती लौटाता है। उसे 0.000015 से गुणा करें, और आपके पास डॉलर में कीमत होगी।
असली प्रोजेक्ट्स की असली लागत
रेट कार्ड पर लिखी संख्याएँ तब तक अमूर्त लगती हैं जब तक उन्हें काम से न जोड़ा जाए। ये उदाहरण Fish Audio के अपने अनुपात का इस्तेमाल करते हैं, यानी प्रति मिलियन बाइट 180,000 शब्द।
काम
ऑडियो की लंबाई
भेजी गई बाइट
लागत
एक 1,000 शब्दों का लेख
लगभग 4 मिनट
लगभग 5,600
लगभग $0.08
30 रोज़ाना पाँच-मिनट की ब्रीफ़िंग
2.5 घंटे
लगभग 208,000
लगभग $3.13
80,000 शब्दों की एक ऑडियोबुक
लगभग 5.3 घंटे
लगभग 444,000
लगभग $6.67
300 कैरेक्टर के 10,000 सपोर्ट जवाब
लगभग 36 घंटे
3,000,000
$45.00
दस लाख जापानी कैरेक्टर
अलग-अलग
लगभग 3,000,000
लगभग $45.00
नैरेशन और ऑडियोबुक
किसी पूरी ऑडियोबुक का खर्च एक सैंडविच की कीमत से भी कम होना यहाँ सबसे बड़ी सुर्खी है। 80,000 शब्दों के शीर्षक के पाँच पूरे री-रेंडर वाली उदार प्रोडक्शन रन भी लगभग $33 पर पहुँचती है। बिल उस टेक्स्ट पर चलता है जो आप भेजते हैं, उन सेकंडों पर नहीं जो वापस मिलते हैं, इसलिए स्पीड कंट्रोल से आवाज़ धीमी करने पर कीमत नहीं बढ़ती (डॉक्स 0.5 से 2.0 तक की अनुमति देते हैं)।
बॉट और ज़्यादा वॉल्यूम
छोटे मैसेज चुपचाप जुड़ते जाते हैं। 300 कैरेक्टर के जवाब वाला सपोर्ट बॉट 10,000 सवालों पर तीन मिलियन बाइट खर्च करता है, जो $45 है। जो भी जवाब बार-बार दोहराया जाए उसे कैश करें। 50,000 बार बोला जाने वाला अभिवादन एक बार बनाकर स्टोर करना चाहिए।
गैर-लैटिन लिपियाँ
जब लिपि अंग्रेज़ी न हो, तब बजट कैरेक्टर में नहीं, बाइट में बनाएँ। दस लाख जापानी या चीनी कैरेक्टर लगभग $45 पड़ते हैं, जो अंग्रेज़ी के आंकड़े से तीन गुना है, और सिरिलिक लगभग $30 के आसपास बैठता है। ऑडियो लंबा नहीं होता, पर मीटर एन्कोडेड आकार पर चलता है।
बिल घटाने के चार तरीके
वॉल्यूम बढ़ने पर छोटी आदतें मायने रखती हैं:
मुफ़्त वेरिएंट पर प्रोटोटाइप करें। s2.1-pro-free पर अपनी गति और विराम चिह्न तय करें, डॉक्स में उसकी सीमाएँ जाँचें, फिर फ़ाइनल पेड मॉडल पर रेंडर करें।
फ़ालतू हिस्से हटाएँ। टेक्स्ट भेजने से पहले स्टेज डायरेक्शन, बार-बार आने वाले स्पेस और बचा हुआ मार्कअप हटा दें।
दोहराने वाली लाइनें कैश करें। अभिवादन, मेन्यू प्रॉम्प्ट और डिस्क्लेमर एक बार बनाकर स्टोर करने चाहिए।
पैराग्राफ़ में रेंडर करें। तब एक टाइपो की कीमत पूरे चैप्टर के बजाय एक पैराग्राफ़ जितनी पड़ती है।
वॉइस क्लोनिंग और उसकी लागत
रेट कार्ड में क्लोनिंग की कोई फ़ीस नहीं है। प्राइसिंग पेज के आधार पर, क्लोन की गई आवाज़ से भाषण बनाना सामान्य टेक्स्ट-टू-स्पीच की तरह प्रति बाइट बिल होता है। बदलता है वर्कफ़्लो।
इंस्टेंट क्लोनिंग बनाम सेव की हुई आवाज़ें
डॉक्स में दो रास्ते बताए गए हैं:
इंस्टेंट क्लोनिंग: स्पीच रिक्वेस्ट के साथ सीधे रेफ़रेंस ऑडियो भेजें। कुछ भी स्टोर नहीं होता, जो एक-बार के कामों के लिए ठीक है।
पर्सिस्टेंट वॉइस: एक बार आवाज़ बनाएँ, एक दोबारा इस्तेमाल होने वाली voice ID पाएँ, और किसी भी बाद की रिक्वेस्ट में उसे कॉल करें। डिफ़ॉल्ट फ़ास्ट ट्रेनिंग मोड आवाज़ को लगभग तुरंत इस्तेमाल लायक बना देता है।
सेव की हुई आवाज़ें डिफ़ॉल्ट रूप से प्राइवेट होती हैं। आप किसी एक को अनलिस्टेड कर सकते हैं, जिससे शेयर करने लायक लिंक मिलता है, या पब्लिक, जिससे वह कम्युनिटी Voice Library में आ जाती है।
latency फ़ील्ड balanced लेता है, जिसे Fish Audio पहले ऑडियो तक लगभग 300 ms बताता है, या normal, जो स्थिरता को प्राथमिकता देता है। आउटपुट फ़ॉर्मेट mp3, wav, opus और pcm हैं। Fish Audio की सामग्री टोन कंट्रोल के लिए इनलाइन इमोशन टैग का भी ज़िक्र करती है, इसलिए इन पर भरोसा करने से पहले सटीक सिंटैक्स के लिए API रेफ़रेंस देख लें।
सैंपल, सहमति और अधिकार
अच्छा क्लोन अच्छी रिकॉर्डिंग से शुरू होता है। डॉक्स साफ़, मोनो, सिंगल-स्पीकर ऑडियो माँगते हैं, हर क्लिप में कम से कम 10 सेकंड, और यह नोट करते हैं कि एक-दो मिनट का साफ़ भाषण फ़िडेलिटी बेहतर करता है। स्वीकार्य फ़ाइलें wav, mp3, m4a और opus हैं, और बैकग्राउंड नॉइज़ हटाना डिफ़ॉल्ट रूप से चालू है। मार्केटिंग पेज 30 या अधिक भाषाओं में 15-सेकंड के सैंपल की बात करते हैं, इसलिए 10 से 15 सेकंड को लक्ष्य नहीं, न्यूनतम सीमा मानें।
अधिकार कीमत से ज़्यादा मायने रखते हैं। पेड सब्सक्राइबर कॉमर्शियल काम के लिए अपनी मालिकाना वेरिफ़ाइड आवाज़ें इस्तेमाल कर सकते हैं, जबकि फ़्री प्लान का आउटपुट केवल निजी, गैर-व्यावसायिक प्रोजेक्ट्स तक सीमित है। कुछ भी कॉमर्शियल प्रकाशित करने से पहले अपने प्लान की लाइसेंस शर्तें जाँचें, और अगर आप किसी क्लाइंट या कॉन्ट्रैक्टर की आवाज़ क्लोन करते हैं, तो पहले लिखित अनुमति लें।
💡 मोटा नियम: अपनी आवाज़, उस काम के लिए किराए पर ली गई आवाज़, या हस्ताक्षरित रिलीज़ वाली आवाज़ को ही क्लोन करें। बाकी कुछ नहीं।
वेब प्लान बनाम API
Fish Audio उन लोगों के लिए मासिक प्लान भी बेचता है जो कोड लिखने के बजाय वेब स्टूडियो में काम करते हैं।
प्लान
मासिक कीमत
क्रेडिट
बताया गया जनरेशन समय
अतिरिक्त सुविधाएँ
Free
$0
8,000
लगभग 7 मिनट
प्रति जनरेशन 500 कैरेक्टर, 3 पब्लिक वॉइस स्लॉट
Plus
$11
250,000
200 मिनट तक
प्रति जनरेशन 15,000 कैरेक्टर, 10 प्राइवेट वॉइस, 1 प्रोफ़ेशनल वॉइस
Pro
$75
2,000,000
1,620 मिनट तक
प्रति जनरेशन 30,000 कैरेक्टर, 5 प्रोफ़ेशनल वॉइस, 3 टीम सीट
सालाना बिलिंग मासिक दर घटा देती है: Plus $132 सालाना, Pro $900, और Max $8,988।
API कहाँ जीतता है
हर प्लान के बताए गए मिनटों को $1.25 प्रति घंटे की दर से API खर्च में बदलें, तो फ़र्क बड़ा है।
प्लान
बताए गए मिनट
API से वही ऑडियो
प्लान की कीमत
Plus
200
लगभग $4.17
$11
Pro
1,620
लगभग $33.75
$75
Max
6,250
लगभग $130.21
$749
ये मिनट संख्याएँ प्लान पेज के अपने आंकड़े हैं, इसलिए तुलना अनुमान भर है। फिर भी पैटर्न साफ़ है: प्लान वेब स्टूडियो, वॉइस स्लॉट और टीम सीट खरीदता है, जबकि कच्चा ऑडियो बाइट के हिसाब से सस्ता पड़ता है। डेवलपर, बैच जॉब और ऑटोमेटेड पाइपलाइन API पर ही ठीक बैठते हैं। जो एडिटर और मार्केटर कभी टर्मिनल नहीं खोलते, वे इंटरफ़ेस के लिए खुशी-खुशी पैसे दे सकते हैं।
एक छोटी पॉडकास्ट टीम के एक महीने का उदाहरण देखें। यह 40 घंटे का भाषण बनाती है ($50.00), 40 घंटे की कच्ची गेस्ट रिकॉर्डिंग ट्रांसक्राइब करती है ($14.40) और 20 नई वॉइस डिज़ाइन आज़माती है ($0.20)। कुल $64.60 होता है। यह $75 के Pro प्लान से कम है, जो केवल 27 घंटे जनरेशन बताता है, और टीम ऑटोमेशन व स्टोरेज पर पूरा नियंत्रण भी रखती है।
ट्रांसक्रिप्शन, वॉइस डिज़ाइन और सीमाएँ
ट्रांसक्रिप्शन, $0.36 प्रति घंटा
Fish Audio की स्पीच रिकग्निशन पर $0.36 प्रति ऑडियो घंटा लगता है, जो प्रोसेस हुई अवधि पर सबसे नज़दीकी सेकंड तक गिनी जाती है। दस घंटे के इंटरव्यू $3.60 के हैं, और सौ घंटे $36 के। इसे TTS के साथ जोड़ें तो ऐसा लूप बन सकता है जो रिकॉर्डिंग ट्रांसक्राइब करे, टेक्स्ट एडिट करे और नतीजे को क्लोन की हुई आवाज़ में वापस बोले।
एक सेंट में वॉइस डिज़ाइन
वॉइस डिज़ाइन लिखे हुए विवरण से नई आवाज़ें बनाता है, न कि रिकॉर्डिंग से, और एक रिक्वेस्ट कई उम्मीदवार आवाज़ें लौटा सकती है। शुल्क हर सफल POST रिक्वेस्ट पर $0.01 है, और यह एक बार लगता है, चाहे कितनी भी उम्मीदवार आवाज़ें वापस आएँ। सौ डिज़ाइन प्रयास एक डॉलर के हैं, इसलिए खुलकर प्रयोग करें।
कंकरेंसी टियर
स्पीड की सीमा इस पर निर्भर करती है कि आपने कितना प्रीपेड खर्च किया है:
टियर
प्रीपेड खर्च
एक साथ रिक्वेस्ट
Starter
$100 से कम
5
Elevated
$100 या अधिक
15
High Volume
$1,000 या अधिक
50
Enterprise
कस्टम
कस्टम
जैसे ही आप प्रीपेड सीमा पार करते हैं, टियर चालू हो जाता है, और उसके लिए बैलेंस पहले खर्च करना ज़रूरी नहीं है। अगर आप महीने में लगभग 80 घंटे नैरेट करने की योजना बनाते हैं ($100 का भाषण), तो $100 का टॉप-अप ऑडियो और तीन गुना समानांतर क्षमता, दोनों देता है।
कीमत की तुलना कैसे होती है
नीचे की कीमतें Fish Audio की डेवलपर तुलना और एक तीसरे-पक्ष प्राइसिंग रिव्यू में दी गई बताई गई कीमतें हैं। इन्हें शुरुआती बिंदु मानें और हर वेंडर के पेज पर पुष्टि करें।
कीमत क्वालिटी नहीं होती। तीसरे-पक्ष प्राइसिंग रिव्यू बताते हैं कि Fish Audio का S2 Pro ब्लाइंड लिसनिंग टेस्ट में अच्छे अंक लेता है, जबकि ElevenLabs की फ़ीचर सेट ज़्यादा परिपक्व है। जो सस्ता इंजन हर पैराग्राफ़ पर तीन री-रेंडर मांगता है, वह अब सस्ता नहीं रहता। गैर-लैटिन लिपियाँ हिसाब को भी बदल देती हैं, क्योंकि जापानी और चीनी के लिए बाइट लागत को तीन गुना कर देते हैं।
अगर इंटीग्रेशन कोड लिखने से पहले क्लोन सुनना चाहते हैं, तो MiniMax Voice Cloning एक छोटी रिकॉर्डिंग को दोबारा इस्तेमाल होने वाली वॉइस प्रोफ़ाइल में बदल देता है। PicassoIA इसे ऑनलाइन मुफ़्त में आज़माने योग्य बताता है, और कोड की ज़रूरत नहीं।
मॉडल और सैंपल चुनें
MiniMax Voice Cloning पेज खोलें और अपनी वॉइस फ़ाइल अपलोड करें: MP3, M4A या WAV, 10 सेकंड से 5 मिनट तक, 20 MB से कम।
अगर रिकॉर्डिंग में हिस हो या रूम टोन हो तो noise reduction चालू करें, और अगर लेवल डगमगाता हो तो volume normalization।
accuracy को शुरू में डिफ़ॉल्ट 0.7 पर रहने दें। यह 0 और 1 के बीच टेक्स्ट वैलिडेशन की सीमा तय करता है।
मॉडल चलाने पर आपको एक वॉइस प्रोफ़ाइल मिलती है, जिसे प्रोजेक्ट को जितनी चाहिए उतनी टेक्स्ट-टू-स्पीच रन में दोबारा इस्तेमाल किया जा सकता है। अपनी स्क्रिप्ट उसी स्पीच टियर पर चलाएँ जिस पर आपने ट्रेनिंग की थी, फिर नतीजे की तुलना उससे करें जो आप Fish Audio API से सुनते हैं।
💡 बेहतर सैंपल, बेहतर क्लोन: कालीन और पर्दों वाले कमरे में, बैकग्राउंड में कोई संगीत चले बिना, अपनी स्वाभाविक गति से 30 सेकंड रिकॉर्ड करें।
प्राइसिंग टेबल बताती हैं कि आवाज़ पर कितना खर्च होता है। यह सिर्फ़ आपके अपने कान बता सकते हैं कि वह खर्च सार्थक है या नहीं। Picasso IA खोलें, MiniMax Voice Cloning में एक छोटा सैंपल अपलोड करें, वही पैराग्राफ़ दो या तीन स्पीच मॉडल से पढ़वाएँ, और नोट करें कि अपने ब्रांड के लिए किस पर भरोसा करेंगे।
फिर संगीत और ट्रांसक्रिप्ट जाँच जोड़ें, और किसी API कॉन्ट्रैक्ट पर एक पैसा लगाने से पहले पूरे ऑडियो वर्कफ़्लो का ड्राफ़्ट तैयार हो जाता है। एक सीधी टेस्ट योजना अच्छी तरह काम करती है:
अपनी आवाज़ का 30 सेकंड का सैंपल क्लोन करें।
वही 200 शब्द तीन अलग स्पीच मॉडल से नैरेट करें।
हर नतीजे को ट्रांसक्राइब करें और गिनें कि इंजन ने कितने शब्द गलत पहचाने।
ऊपर बताए बाइट गणित से विजेता की कीमत निकालें।
आज ही एक छोटी स्क्रिप्ट से शुरू करें, नतीजों की साथ-साथ तुलना करें, और जिन क्लिप्स को आप सचमुच पसंद करें, वही तय करने दें कि आपका बजट किस इंजन को मिलेगा।