Fish Audio API: preços de TTS e clonagem de voz, linha por linha
A Fish Audio cobra texto para fala a US$ 15 por milhão de bytes UTF-8, transcrição a US$ 0,36 por hora de áudio e design de voz a um centavo por requisição. Este detalhamento transforma essas tarifas em orçamentos reais de projeto, compara os planos da web com a API e mostra onde a clonagem de voz se encaixa.
A Fish Audio vende fala por byte, e esse detalhe explica quase todas as surpresas na fatura. A API da Fish Audio cobra US$ 15 por milhão de bytes UTF-8 de texto para fala, US$ 0,36 por hora de áudio para transcrição e US$ 0,01 por requisição para design de voz. A clonagem de voz não tem linha própria nessa tabela de tarifas, o que torna o orçamento mais simples do que parece à primeira vista.
Este detalhamento transforma essas tarifas em orçamentos reais de projeto: um post de blog, um audiolivro, um bot de atendimento, um mês de vinhetas de podcast. Você também vai ver como os planos da web se comparam à API, onde os limites de taxa pesam e como o preço se posiciona frente a outros motores de fala. Os valores vêm da página de preços publicada pela Fish Audio e da documentação para desenvolvedores, e podem mudar, então confira-os novamente antes de gastar dinheiro.
💡 Resposta rápida: uma hora de fala em inglês custa cerca de US$ 1,25 pela API. Um artigo de 1.000 palavras, narrado do início ao fim, custa cerca de 8 centavos.
O que a Fish Audio cobra por byte
A tabela de tarifas
Todos os preços do lado do desenvolvedor cabem em uma tabela.
Serviço
Modelo ou recurso
Preço
Texto para fala
s2.1-pro
US$ 15,00 por milhão de bytes UTF-8
Texto para fala
s2-pro
US$ 15,00 por milhão de bytes UTF-8
Texto para fala
s1
US$ 15,00 por milhão de bytes UTF-8
Texto para fala
s2.1-pro-free
US$ 0,00 por milhão de bytes UTF-8
Transcrição
os dois modelos disponíveis
US$ 0,36 por hora de áudio
Design de voz
cada requisição bem-sucedida
US$ 0,01
A documentação recomenda o s2.1-pro para projetos novos, e os três modelos pagos têm o mesmo preço, então escolher entre eles é uma decisão de qualidade, não de dinheiro. A versão gratuita s2.1-pro aparece com valor zero, o que é adequado para prototipar enquanto você testa um roteiro.
A referência da própria Fish Audio: um milhão de bytes equivale a cerca de 180.000 palavras em inglês, ou por volta de 12 horas de fala. Dividindo US$ 15 por 12, você chega ao número que vale a pena memorizar: US$ 1,25 por hora de áudio finalizado.
Por que bytes, e não caracteres
Um byte é a unidade que o seu texto ocupa depois de codificado em UTF-8. Para inglês simples, um caractere equivale a um byte, então US$ 15 por milhão de bytes também são US$ 15 por milhão de caracteres. Outros alfabetos quebram essa equivalência:
Letras latinas acentuadas e cirílico ocupam cerca de 2 bytes cada.
Caracteres chineses, japoneses e coreanos ocupam cerca de 3 bytes cada.
Emojis ocupam 4 bytes.
Espaços e pontuação também são bytes, então um roteiro cheio de indicações de cena custa mais do que o mesmo roteiro enxuto.
💡 Meça antes de enviar: em Python, len(text.encode("utf-8")) retorna a contagem exata de bytes de um roteiro. Multiplique por 0,000015 e você tem o preço em dólares.
Custos reais para projetos reais
Números em uma tabela de tarifas parecem abstratos até você associá-los a um trabalho. Estes exemplos usam a proporção da própria Fish Audio de 180.000 palavras por milhão de bytes.
Trabalho
Duração do áudio
Bytes enviados
Custo
Um artigo de 1.000 palavras
cerca de 4 minutos
cerca de 5.600
cerca de US$ 0,08
30 boletins diários de cinco minutos
2,5 horas
cerca de 208.000
cerca de US$ 3,13
Um audiolivro de 80.000 palavras
cerca de 5,3 horas
cerca de 444.000
cerca de US$ 6,67
10.000 respostas de suporte de 300 caracteres
cerca de 36 horas
3.000.000
US$ 45,00
Um milhão de caracteres japoneses
varia
cerca de 3.000.000
cerca de US$ 45,00
Narração e audiolivros
Um audiolivro inteiro por menos do que custa um sanduíche é o grande destaque aqui. Mesmo uma produção generosa, com cinco regravações completas de um título de 80.000 palavras, fica perto de US$ 33. A fatura segue o texto que você envia, não os segundos que voltam, então desacelerar a voz com o controle de velocidade (a documentação permite de 0,5 a 2,0) não aumenta o preço.
Bots e alto volume
Mensagens curtas se acumulam sem que você perceba. Um bot de atendimento que responde 10.000 perguntas com respostas de 300 caracteres consome três milhões de bytes, o que dá US$ 45. Guarde em cache qualquer resposta que se repita. Uma saudação falada 50.000 vezes deve ser gerada uma vez e armazenada.
Alfabetos não latinos
Faça o orçamento em bytes, e não por caracteres, sempre que o idioma não for o inglês. Um milhão de caracteres japoneses ou chineses custa cerca de US$ 45, três vezes o valor do inglês, e o cirílico fica perto de US$ 30. O áudio não é mais longo, mas o medidor conta o tamanho codificado.
Quatro formas de reduzir a conta
Pequenos hábitos fazem diferença quando o volume cresce:
Prototipe com a versão gratuita. Faça o rascunho do ritmo e da pontuação no s2.1-pro-free, confira os limites na documentação e só então gere as versões finais com um modelo pago.
Tire os excessos. Remova indicações de cena, espaços em branco repetidos e marcações sobrando antes de enviar o texto.
Guarde em cache as falas que se repetem. Saudações, menus de voz e avisos legais devem ser gerados uma vez e armazenados.
Gere em parágrafos. Um erro de digitação então custa um parágrafo, e não um capítulo inteiro.
Clonagem de voz e o que ela custa
A tabela de tarifas não tem taxa de clonagem. Segundo a página de preços, gerar fala com uma voz clonada é cobrado como texto para fala comum, por byte. O que muda é o fluxo de trabalho.
Clonagem instantânea versus vozes salvas
A documentação descreve duas rotas:
Clonagem instantânea: envie o áudio de referência diretamente com a requisição de fala. Nada é armazenado, o que atende trabalhos pontuais.
Vozes persistentes: crie uma voz uma vez, receba um ID de voz reutilizável e chame-o em qualquer requisição posterior. O modo de treinamento rápido padrão deixa a voz utilizável quase de imediato.
Vozes salvas são privadas por padrão. Você pode mudar uma delas para não listada, o que gera um link compartilhável, ou para pública, o que a coloca na Voice Library, a biblioteca da comunidade.
Uma requisição ao endpoint de TTS tem esta aparência:
O campo latency aceita balanced, que a Fish Audio descreve como cerca de 300 ms até o primeiro áudio, ou normal, que favorece a estabilidade. Os formatos de saída são mp3, wav, opus e pcm. Os materiais da Fish Audio também mencionam tags de emoção inline para controlar o tom, então confira a referência da API para a sintaxe exata antes de depender delas.
Amostras, consentimento e direitos
Um bom clone começa com uma boa gravação. A documentação pede áudio limpo, mono e de um único falante, com pelo menos 10 segundos por trecho, e observa que um ou dois minutos de fala clara melhora a fidelidade. Os arquivos aceitos são wav, mp3, m4a e opus, e a remoção de ruído de fundo vem ativada por padrão. As páginas de marketing citam uma amostra de 15 segundos em 30 ou mais idiomas, então trate de 10 a 15 segundos como o mínimo, não como a meta.
Os direitos importam mais do que o preço. Assinantes pagos podem usar vozes verificadas que lhes pertencem em trabalhos comerciais, enquanto a saída do plano gratuito é limitada a projetos pessoais e não comerciais. Confira os termos de licença do seu plano antes de publicar qualquer coisa comercial, e se você clonar a voz de um cliente ou de um contratado, obtenha permissão por escrito antes.
💡 Regra prática: clone a sua própria voz, uma voz que você contratou para esse fim ou uma voz com autorização assinada. Nada além disso.
Planos da web versus a API
A Fish Audio também vende planos mensais para quem trabalha no estúdio web em vez de escrever código.
Plano
Preço mensal
Créditos
Tempo de geração informado
Extras
Free
US$ 0
8.000
cerca de 7 minutos
500 caracteres por geração, 3 vagas de voz pública
Plus
US$ 11
250.000
até 200 minutos
15.000 caracteres por geração, 10 vozes privadas, 1 voz profissional
Pro
US$ 75
2.000.000
até 1.620 minutos
30.000 caracteres por geração, 5 vozes profissionais, 3 vagas de equipe
Max
US$ 749
25.000.000
até 6.250 minutos
15 vozes profissionais, 10 vagas de equipe
Enterprise
Sob consulta, cobrado anualmente
Sob consulta
Sob consulta
Zero retenção de dados, implantação on-premise, SOC2
O faturamento anual reduz o valor mensal: o Plus sai por US$ 132 por ano, o Pro por US$ 900 e o Max por US$ 8.988.
Onde a API vence
Converta os minutos informados de cada plano em gasto na API a US$ 1,25 por hora e a diferença é grande.
Plano
Minutos informados
Mesmo áudio pela API
Preço do plano
Plus
200
cerca de US$ 4,17
US$ 11
Pro
1.620
cerca de US$ 33,75
US$ 75
Max
6.250
cerca de US$ 130,21
US$ 749
Esses números de minutos são os próprios da página de planos, então a comparação é aproximada. Ainda assim, o padrão é claro: um plano compra o estúdio web, as vagas de voz e as vagas de equipe, enquanto o áudio puro sai mais barato por byte. Desenvolvedores, trabalhos em lote e pipelines automatizados pertencem à API. Editores e profissionais de marketing que nunca abrem um terminal podem pagar com satisfação pela interface.
Aqui está um mês de exemplo para uma pequena equipe de podcast. Ela gera 40 horas de fala (US$ 50,00), transcreve 40 horas de gravação bruta de convidados (US$ 14,40) e testa 20 novos designs de voz (US$ 0,20). O total é US$ 64,60. Isso fica abaixo do plano Pro de US$ 75, que informa apenas 27 horas de geração, e a equipe mantém controle total sobre automação e armazenamento.
Transcrição, design de voz e limites
Transcrição a US$ 0,36 por hora
O reconhecimento de fala da Fish Audio custa US$ 0,36 por hora de áudio, cobrado pela duração processada, arredondada para o segundo mais próximo. Dez horas de entrevistas custam US$ 3,60, e cem horas custam US$ 36. Combine com TTS e você pode montar um ciclo que transcreve uma gravação, edita o texto e devolve o resultado falado com uma voz clonada.
Design de voz a um centavo
O design de voz cria novas vozes a partir de uma descrição escrita, em vez de uma gravação, e uma única requisição pode devolver vários candidatos. A cobrança é de US$ 0,01 por requisição POST bem-sucedida, aplicada uma vez, não importa quantas vozes candidatas voltem. Cem tentativas de design custam um dólar, então experimente à vontade.
Faixas de simultaneidade
Os limites de velocidade dependem de quanto você pagou antecipadamente:
Faixa
Gasto pré-pago
Requisições simultâneas
Starter
abaixo de US$ 100
5
Elevated
US$ 100 ou mais
15
High Volume
US$ 1.000 ou mais
50
Enterprise
Sob consulta
Sob consulta
Uma faixa passa a valer assim que você atinge o limite pré-pago dela, e o saldo não precisa ser gasto antes. Se você planeja narrar cerca de 80 horas por mês (US$ 100 de fala), uma recarga de US$ 100 compra o áudio e o triplo do paralelismo.
Como o preço se compara
Os preços abaixo são os informados no comparativo para desenvolvedores da Fish Audio e em uma análise independente de preços. Use-os como ponto de partida e confirme na página de cada fornecedor.
Preço não é qualidade. Análises independentes de preços relatam que o S2 Pro da Fish Audio vai bem em testes de escuta às cegas, enquanto a ElevenLabs tem um conjunto de recursos mais maduro. Um motor barato que exige três regravações por parágrafo deixa de ser barato. Os alfabetos não latinos também mudam a conta, porque os bytes triplicam o custo para japonês e chinês.
Se você quiser ouvir um clone antes de escrever código de integração, o MiniMax Voice Cloning transforma uma gravação curta em um perfil de voz reutilizável. O PicassoIA o lista como gratuito para testar online, sem precisar programar.
Escolha o modelo e a amostra
Abra a página do MiniMax Voice Cloning e envie seu arquivo de voz: MP3, M4A ou WAV, de 10 segundos a 5 minutos, com menos de 20 MB.
Ative a redução de ruído se a gravação tiver chiado ou o som do ambiente, e a normalização de volume se o nível oscilar.
Deixe a precisão no padrão de 0,7 no começo. Ela define o limite de validação do texto entre 0 e 1.
Execute o modelo e você recebe um perfil de voz que pode reutilizar em quantas rodadas de texto para fala o projeto precisar. Rode seu roteiro na faixa de fala que você treinou e depois compare o resultado com o que você ouve na API da Fish Audio.
💡 Melhor amostra, melhor clone: grave 30 segundos no seu ritmo natural, em um cômodo com carpete e cortinas, sem música por baixo.
Tabelas de preço respondem quanto custa uma voz. Só os seus próprios ouvidos respondem se ela vale a pena. Abra o Picasso IA, envie uma amostra curta para o MiniMax Voice Cloning, leia o mesmo parágrafo com dois ou três modelos de fala e anote qual deles você confiaria para representar a sua marca.
Depois adicione música e uma checagem de transcrição, e você terá um rascunho de um fluxo de trabalho de áudio completo antes de gastar um centavo em um contrato de API. Um plano de teste simples funciona bem:
Clone uma amostra de 30 segundos da sua própria voz.
Narre as mesmas 200 palavras com três modelos de fala diferentes.
Transcreva cada resultado e conte as palavras que o motor errou.
Calcule o preço do vencedor usando a conta de bytes acima.
Comece hoje com um roteiro curto, compare os resultados lado a lado e deixe os clipes que você realmente gosta decidirem qual motor recebe o seu orçamento.