Fish Audio API: preços de TTS e clonagem de voz, linha por linha

A Fish Audio cobra texto para fala a US$ 15 por milhão de bytes UTF-8, transcrição a US$ 0,36 por hora de áudio e design de voz a um centavo por requisição. Este detalhamento transforma essas tarifas em orçamentos reais de projeto, compara os planos da web com a API e mostra onde a clonagem de voz se encaixa.

Fish Audio API: preços de TTS e clonagem de voz, linha por linha
Cristian Da Conceicao
Fundador do Picasso IA

A Fish Audio vende fala por byte, e esse detalhe explica quase todas as surpresas na fatura. A API da Fish Audio cobra US$ 15 por milhão de bytes UTF-8 de texto para fala, US$ 0,36 por hora de áudio para transcrição e US$ 0,01 por requisição para design de voz. A clonagem de voz não tem linha própria nessa tabela de tarifas, o que torna o orçamento mais simples do que parece à primeira vista.

Este detalhamento transforma essas tarifas em orçamentos reais de projeto: um post de blog, um audiolivro, um bot de atendimento, um mês de vinhetas de podcast. Você também vai ver como os planos da web se comparam à API, onde os limites de taxa pesam e como o preço se posiciona frente a outros motores de fala. Os valores vêm da página de preços publicada pela Fish Audio e da documentação para desenvolvedores, e podem mudar, então confira-os novamente antes de gastar dinheiro.

💡 Resposta rápida: uma hora de fala em inglês custa cerca de US$ 1,25 pela API. Um artigo de 1.000 palavras, narrado do início ao fim, custa cerca de 8 centavos.

O que a Fish Audio cobra por byte

Microfone condensador com filtro pop em uma sala de gravação revestida de madeira

A tabela de tarifas

Todos os preços do lado do desenvolvedor cabem em uma tabela.

ServiçoModelo ou recursoPreço
Texto para falas2.1-proUS$ 15,00 por milhão de bytes UTF-8
Texto para falas2-proUS$ 15,00 por milhão de bytes UTF-8
Texto para falas1US$ 15,00 por milhão de bytes UTF-8
Texto para falas2.1-pro-freeUS$ 0,00 por milhão de bytes UTF-8
Transcriçãoos dois modelos disponíveisUS$ 0,36 por hora de áudio
Design de vozcada requisição bem-sucedidaUS$ 0,01

A documentação recomenda o s2.1-pro para projetos novos, e os três modelos pagos têm o mesmo preço, então escolher entre eles é uma decisão de qualidade, não de dinheiro. A versão gratuita s2.1-pro aparece com valor zero, o que é adequado para prototipar enquanto você testa um roteiro.

A referência da própria Fish Audio: um milhão de bytes equivale a cerca de 180.000 palavras em inglês, ou por volta de 12 horas de fala. Dividindo US$ 15 por 12, você chega ao número que vale a pena memorizar: US$ 1,25 por hora de áudio finalizado.

Por que bytes, e não caracteres

Um byte é a unidade que o seu texto ocupa depois de codificado em UTF-8. Para inglês simples, um caractere equivale a um byte, então US$ 15 por milhão de bytes também são US$ 15 por milhão de caracteres. Outros alfabetos quebram essa equivalência:

  • Letras latinas acentuadas e cirílico ocupam cerca de 2 bytes cada.
  • Caracteres chineses, japoneses e coreanos ocupam cerca de 3 bytes cada.
  • Emojis ocupam 4 bytes.
  • Espaços e pontuação também são bytes, então um roteiro cheio de indicações de cena custa mais do que o mesmo roteiro enxuto.

Vista de cima de uma mesa com um caderno de cálculos de custos escritos à mão e páginas impressas de manuscrito

💡 Meça antes de enviar: em Python, len(text.encode("utf-8")) retorna a contagem exata de bytes de um roteiro. Multiplique por 0,000015 e você tem o preço em dólares.

Custos reais para projetos reais

Números em uma tabela de tarifas parecem abstratos até você associá-los a um trabalho. Estes exemplos usam a proporção da própria Fish Audio de 180.000 palavras por milhão de bytes.

TrabalhoDuração do áudioBytes enviadosCusto
Um artigo de 1.000 palavrascerca de 4 minutoscerca de 5.600cerca de US$ 0,08
30 boletins diários de cinco minutos2,5 horascerca de 208.000cerca de US$ 3,13
Um audiolivro de 80.000 palavrascerca de 5,3 horascerca de 444.000cerca de US$ 6,67
10.000 respostas de suporte de 300 caracterescerca de 36 horas3.000.000US$ 45,00
Um milhão de caracteres japonesesvariacerca de 3.000.000cerca de US$ 45,00

Narração e audiolivros

Um audiolivro inteiro por menos do que custa um sanduíche é o grande destaque aqui. Mesmo uma produção generosa, com cinco regravações completas de um título de 80.000 palavras, fica perto de US$ 33. A fatura segue o texto que você envia, não os segundos que voltam, então desacelerar a voz com o controle de velocidade (a documentação permite de 0,5 a 2,0) não aumenta o preço.

Mulher de suéter cinza lendo um manuscrito impresso em um microfone de estúdio

Bots e alto volume

Mensagens curtas se acumulam sem que você perceba. Um bot de atendimento que responde 10.000 perguntas com respostas de 300 caracteres consome três milhões de bytes, o que dá US$ 45. Guarde em cache qualquer resposta que se repita. Uma saudação falada 50.000 vezes deve ser gerada uma vez e armazenada.

Alfabetos não latinos

Faça o orçamento em bytes, e não por caracteres, sempre que o idioma não for o inglês. Um milhão de caracteres japoneses ou chineses custa cerca de US$ 45, três vezes o valor do inglês, e o cirílico fica perto de US$ 30. O áudio não é mais longo, mas o medidor conta o tamanho codificado.

Quatro formas de reduzir a conta

Pequenos hábitos fazem diferença quando o volume cresce:

  1. Prototipe com a versão gratuita. Faça o rascunho do ritmo e da pontuação no s2.1-pro-free, confira os limites na documentação e só então gere as versões finais com um modelo pago.
  2. Tire os excessos. Remova indicações de cena, espaços em branco repetidos e marcações sobrando antes de enviar o texto.
  3. Guarde em cache as falas que se repetem. Saudações, menus de voz e avisos legais devem ser gerados uma vez e armazenados.
  4. Gere em parágrafos. Um erro de digitação então custa um parágrafo, e não um capítulo inteiro.

Clonagem de voz e o que ela custa

A tabela de tarifas não tem taxa de clonagem. Segundo a página de preços, gerar fala com uma voz clonada é cobrado como texto para fala comum, por byte. O que muda é o fluxo de trabalho.

Clonagem instantânea versus vozes salvas

A documentação descreve duas rotas:

  • Clonagem instantânea: envie o áudio de referência diretamente com a requisição de fala. Nada é armazenado, o que atende trabalhos pontuais.
  • Vozes persistentes: crie uma voz uma vez, receba um ID de voz reutilizável e chame-o em qualquer requisição posterior. O modo de treinamento rápido padrão deixa a voz utilizável quase de imediato.

Vozes salvas são privadas por padrão. Você pode mudar uma delas para não listada, o que gera um link compartilhável, ou para pública, o que a coloca na Voice Library, a biblioteca da comunidade.

Mãos de um engenheiro de som apoiadas nos faders de uma mesa de mixagem analógica

Uma requisição ao endpoint de TTS tem esta aparência:

POST /v1/tts
Authorization: Bearer <your token>
model: s2.1-pro

{
  "text": "Your script goes here.",
  "reference_id": "<voice id>",
  "format": "mp3",
  "latency": "balanced"
}

O campo latency aceita balanced, que a Fish Audio descreve como cerca de 300 ms até o primeiro áudio, ou normal, que favorece a estabilidade. Os formatos de saída são mp3, wav, opus e pcm. Os materiais da Fish Audio também mencionam tags de emoção inline para controlar o tom, então confira a referência da API para a sintaxe exata antes de depender delas.

Amostras, consentimento e direitos

Um bom clone começa com uma boa gravação. A documentação pede áudio limpo, mono e de um único falante, com pelo menos 10 segundos por trecho, e observa que um ou dois minutos de fala clara melhora a fidelidade. Os arquivos aceitos são wav, mp3, m4a e opus, e a remoção de ruído de fundo vem ativada por padrão. As páginas de marketing citam uma amostra de 15 segundos em 30 ou mais idiomas, então trate de 10 a 15 segundos como o mínimo, não como a meta.

Mãos segurando um celular para gravar uma amostra de voz em uma sala de estar silenciosa

Os direitos importam mais do que o preço. Assinantes pagos podem usar vozes verificadas que lhes pertencem em trabalhos comerciais, enquanto a saída do plano gratuito é limitada a projetos pessoais e não comerciais. Confira os termos de licença do seu plano antes de publicar qualquer coisa comercial, e se você clonar a voz de um cliente ou de um contratado, obtenha permissão por escrito antes.

💡 Regra prática: clone a sua própria voz, uma voz que você contratou para esse fim ou uma voz com autorização assinada. Nada além disso.

Planos da web versus a API

A Fish Audio também vende planos mensais para quem trabalha no estúdio web em vez de escrever código.

PlanoPreço mensalCréditosTempo de geração informadoExtras
FreeUS$ 08.000cerca de 7 minutos500 caracteres por geração, 3 vagas de voz pública
PlusUS$ 11250.000até 200 minutos15.000 caracteres por geração, 10 vozes privadas, 1 voz profissional
ProUS$ 752.000.000até 1.620 minutos30.000 caracteres por geração, 5 vozes profissionais, 3 vagas de equipe
MaxUS$ 74925.000.000até 6.250 minutos15 vozes profissionais, 10 vagas de equipe
EnterpriseSob consulta, cobrado anualmenteSob consultaSob consultaZero retenção de dados, implantação on-premise, SOC2

O faturamento anual reduz o valor mensal: o Plus sai por US$ 132 por ano, o Pro por US$ 900 e o Max por US$ 8.988.

Três colegas comparando tabelas de preços impressas em volta de uma mesa de madeira

Onde a API vence

Converta os minutos informados de cada plano em gasto na API a US$ 1,25 por hora e a diferença é grande.

PlanoMinutos informadosMesmo áudio pela APIPreço do plano
Plus200cerca de US$ 4,17US$ 11
Pro1.620cerca de US$ 33,75US$ 75
Max6.250cerca de US$ 130,21US$ 749

Esses números de minutos são os próprios da página de planos, então a comparação é aproximada. Ainda assim, o padrão é claro: um plano compra o estúdio web, as vagas de voz e as vagas de equipe, enquanto o áudio puro sai mais barato por byte. Desenvolvedores, trabalhos em lote e pipelines automatizados pertencem à API. Editores e profissionais de marketing que nunca abrem um terminal podem pagar com satisfação pela interface.

Aqui está um mês de exemplo para uma pequena equipe de podcast. Ela gera 40 horas de fala (US$ 50,00), transcreve 40 horas de gravação bruta de convidados (US$ 14,40) e testa 20 novos designs de voz (US$ 0,20). O total é US$ 64,60. Isso fica abaixo do plano Pro de US$ 75, que informa apenas 27 horas de geração, e a equipe mantém controle total sobre automação e armazenamento.

Transcrição, design de voz e limites

Transcrição a US$ 0,36 por hora

O reconhecimento de fala da Fish Audio custa US$ 0,36 por hora de áudio, cobrado pela duração processada, arredondada para o segundo mais próximo. Dez horas de entrevistas custam US$ 3,60, e cem horas custam US$ 36. Combine com TTS e você pode montar um ciclo que transcreve uma gravação, edita o texto e devolve o resultado falado com uma voz clonada.

Fones de ouvido de estúdio apoiados em uma pilha de páginas de transcrição marcadas

Design de voz a um centavo

O design de voz cria novas vozes a partir de uma descrição escrita, em vez de uma gravação, e uma única requisição pode devolver vários candidatos. A cobrança é de US$ 0,01 por requisição POST bem-sucedida, aplicada uma vez, não importa quantas vozes candidatas voltem. Cem tentativas de design custam um dólar, então experimente à vontade.

Faixas de simultaneidade

Os limites de velocidade dependem de quanto você pagou antecipadamente:

FaixaGasto pré-pagoRequisições simultâneas
Starterabaixo de US$ 1005
ElevatedUS$ 100 ou mais15
High VolumeUS$ 1.000 ou mais50
EnterpriseSob consultaSob consulta

Uma faixa passa a valer assim que você atinge o limite pré-pago dela, e o saldo não precisa ser gasto antes. Se você planeja narrar cerca de 80 horas por mês (US$ 100 de fala), uma recarga de US$ 100 compra o áudio e o triplo do paralelismo.

Corredor estreito entre racks de servidores pretos em um data center

Como o preço se compara

Os preços abaixo são os informados no comparativo para desenvolvedores da Fish Audio e em uma análise independente de preços. Use-os como ponto de partida e confirme na página de cada fornecedor.

MotorPreço informado por milhão de caracteres
Fish AudioUS$ 15 (por milhão de bytes)
Google Cloud TTS, vozes padrãoUS$ 4
Amazon Polly, padrão / neuralUS$ 4 / US$ 16
Azure TTS, vozes neuraisUS$ 15
ElevenLabs Flash v2.5cerca de US$ 60
ElevenLabs v2 Multilingualcerca de US$ 120 a US$ 165

O que a tabela não mostra

Preço não é qualidade. Análises independentes de preços relatam que o S2 Pro da Fish Audio vai bem em testes de escuta às cegas, enquanto a ElevenLabs tem um conjunto de recursos mais maduro. Um motor barato que exige três regravações por parágrafo deixa de ser barato. Os alfabetos não latinos também mudam a conta, porque os bytes triplicam o custo para japonês e chinês.

A saída é fazer um teste comparativo: rode o mesmo roteiro de 200 palavras em vários motores e julgue pelo ouvido. No Picasso IA você pode fazer isso em um só lugar com ElevenLabs v3, MiniMax Speech 2.8 HD, Qwen3 TTS, Chatterbox e Gemini 3.1 Flash TTS.

Faça clonagem de voz no PicassoIA

Se você quiser ouvir um clone antes de escrever código de integração, o MiniMax Voice Cloning transforma uma gravação curta em um perfil de voz reutilizável. O PicassoIA o lista como gratuito para testar online, sem precisar programar.

Escolha o modelo e a amostra

  1. Abra a página do MiniMax Voice Cloning e envie seu arquivo de voz: MP3, M4A ou WAV, de 10 segundos a 5 minutos, com menos de 20 MB.
  2. Ative a redução de ruído se a gravação tiver chiado ou o som do ambiente, e a normalização de volume se o nível oscilar.
  3. Deixe a precisão no padrão de 0,7 no começo. Ela define o limite de validação do texto entre 0 e 1.
  4. Escolha a faixa de fala para treinar. O padrão é o Speech 2.6 HD, e o Speech 2.6 Turbo é a opção mais rápida.

Gere fala com o clone

Execute o modelo e você recebe um perfil de voz que pode reutilizar em quantas rodadas de texto para fala o projeto precisar. Rode seu roteiro na faixa de fala que você treinou e depois compare o resultado com o que você ouve na API da Fish Audio.

Podcaster de fones de ouvido olhando para um notebook em um estúdio caseiro aconchegante

💡 Melhor amostra, melhor clone: grave 30 segundos no seu ritmo natural, em um cômodo com carpete e cortinas, sem música por baixo.

O mesmo espaço de trabalho cobre o resto de um pipeline de áudio. Adicione uma trilha de base com o Stable Audio 2.5, o MiniMax Music 2.6 ou a ElevenLabs Music, depois revise a narração passando-a de volta pelo GPT-4o Transcribe ou pelo Gemini 3 Pro.

Monte seu pipeline de voz no Picasso IA

Tabelas de preço respondem quanto custa uma voz. Só os seus próprios ouvidos respondem se ela vale a pena. Abra o Picasso IA, envie uma amostra curta para o MiniMax Voice Cloning, leia o mesmo parágrafo com dois ou três modelos de fala e anote qual deles você confiaria para representar a sua marca.

Depois adicione música e uma checagem de transcrição, e você terá um rascunho de um fluxo de trabalho de áudio completo antes de gastar um centavo em um contrato de API. Um plano de teste simples funciona bem:

  • Clone uma amostra de 30 segundos da sua própria voz.
  • Narre as mesmas 200 palavras com três modelos de fala diferentes.
  • Transcreva cada resultado e conte as palavras que o motor errou.
  • Calcule o preço do vencedor usando a conta de bytes acima.

Comece hoje com um roteiro curto, compare os resultados lado a lado e deixe os clipes que você realmente gosta decidirem qual motor recebe o seu orçamento.

Compartilhe este artigo

Escolha seu idioma