API de texto para fala gratuita: preços, Python e opções ilimitadas
Cada API de texto para fala gratuita tem regras diferentes: cotas mensais que são renovadas, testes de doze meses que expiram e modelos de código aberto sem medidor. Veja preços reais, código Python que funciona e um fluxo no navegador para testar as vozes antes de tudo.
Digite "API de texto para fala gratuita" em uma barra de pesquisa e você recebe três respostas muito diferentes. Uma cota mensal de um gigante da nuvem. Um pacote Python que discretamente usa servidores de outra pessoa. Um modelo de código aberto que você roda na sua própria máquina. As três são gratuitas, mas só uma é realmente ilimitada, e não é a que a maioria das pessoas espera.
Este artigo organiza as opções pelo custo real, mostra Python funcional para cada uma e termina com um jeito de testar vozes no navegador antes de escrever qualquer código de integração. Os valores vêm das páginas de preços dos provedores e de resumos publicados até outubro de 2026. Os preços mudam, então confirme os números antes de montar um orçamento com base neles.
O que "gratuito" realmente significa
Os provedores usam a palavra "gratuito" para três arranjos diferentes, e confundi-los é a forma como um protótipo vira uma fatura surpresa.
Cotas mensais recorrentes
Google Cloud e Microsoft Azure renovam uma cota gratuita todo mês, sem data de expiração. O Google oferece 4 milhões de caracteres de vozes Standard, e a camada F0 do Azure oferece 0,5 milhão de caracteres de vozes neurais. Fique abaixo do limite e a conta fica em zero indefinidamente. Ultrapasse no Google e você paga a taxa normal por caractere. A camada F0 do Azure tem teto, então você bate em um limite em vez de receber uma conta.
Testes de doze meses
A cota do Amazon Polly se aplica a contas novas durante os primeiros 12 meses. A AWS lista 1 milhão de caracteres neurais por mês, 500 mil caracteres de formato longo e 100 mil caracteres generativos, e resumos publicados colocam as vozes padrão em 5 milhões. Após o décimo segundo mês, o mesmo tráfego custa US$ 4 por milhão de caracteres nas vozes padrão e US$ 16 nas neurais. Um protótipo gratuito em janeiro pode trazer um item real na fatura no janeiro seguinte.
O ElevenLabs fica no meio-termo. Seu plano gratuito oferece cerca de 10.000 caracteres por mês, o que equivale a apenas dez a quinze minutos de áudio, e exige atribuição e proíbe uso comercial. É o suficiente para testar uma voz e pequeno demais para um produto. A mesma família de vozes também está disponível no PicassoIA como ElevenLabs v3.
Código aberto e ilimitado
A única opção realmente ilimitada é o software que você mesmo roda. O Piper funciona em uma CPU comum, com mais de 100 vozes em mais de 30 idiomas. O Kokoro é um modelo de 82 milhões de parâmetros que produz fala natural e, segundo relatos, roda cerca de 100 vezes mais rápido que o tempo real em uma GPU. Ninguém mede seu uso porque ninguém hospeda você. O preço é o seu próprio hardware, o tempo de configuração e a tarefa de verificar a licença de cada voz antes de vender qualquer coisa feita com ela.
Camadas gratuitas comparadas lado a lado
A tabela de preços
Provedor e camada
Cota gratuita
Expira?
Taxa paga depois
Google Cloud Standard
4M de caracteres por mês
Não
US$ 4 por 1M
Google Cloud Neural2
Cerca de 1M de caracteres por mês
Não
US$ 16 por 1M
Azure Neural (F0)
0,5M de caracteres por mês
Não
Pague conforme o uso
Amazon Polly Standard
5M de caracteres por mês
Após 12 meses
US$ 4 por 1M
Amazon Polly Neural
1M de caracteres por mês
Após 12 meses
US$ 16 por 1M
ElevenLabs Free
Cerca de 10K de caracteres por mês
Não
Planos pagos
Piper ou Kokoro
Sem limite
Não
Seu hardware
💡 As cotas são contadas por conta, por mês e por nível de voz. Vozes padrão e premium usam pools separados, então teste exatamente a voz que você pretende lançar.
O que um milhão de caracteres compra
Os próprios exemplos de preço da AWS dão cerca de 23 horas e 8 minutos de fala por milhão de caracteres. Use isso como regra prática. Os 4 milhões de caracteres Standard do Google equivalem a cerca de 90 horas de áudio por mês, e os 0,5 milhão do Azure, a cerca de 11 horas.
Um post de blog de 1.500 palavras tem perto de 9.000 caracteres. Nesse tamanho, a camada gratuita do Azure narra cerca de 55 posts por mês, e a do Google narra mais de 400. Um botão de leitura em voz alta em um blog de porte médio cabe em uma camada gratuita, desde que você armazene cada arquivo de áudio em vez de gerá-lo de novo a cada visualização de página.
Conte com cuidado. A maioria dos provedores mede cada caractere enviado, incluindo espaços, pontuação e tags de marcação, então remova o HTML antes da síntese e envie texto simples. Meça uma semana de tráfego real antes de confiar em qualquer estimativa.
Opções em Python sem custo
Três pacotes atendem à maioria dos scripts rápidos. Eles se instalam com pip, não exigem conta de faturamento e funcionam em poucas linhas, mas não são iguais.
gTTS em quatro linhas
from gtts import gTTS
tts = gTTS("Your order has shipped.", lang="en")
tts.save("order.mp3")
O gTTS é um wrapper não oficial do endpoint de fala por trás do Google Tradutor. Não há credencial nem cota publicada, e isso é exatamente o problema: o Google pode limitar ou alterar o endpoint sem aviso. Serve bem para um script de sala de aula. É arriscado para um recurso voltado ao cliente.
pyttsx3 funciona offline
import pyttsx3
engine = pyttsx3.init()
engine.setProperty("rate", 170)
engine.save_to_file("Your order has shipped.", "order.wav")
engine.runAndWait()
O pyttsx3 usa as vozes já instaladas no seu sistema operacional: SAPI5 no Windows, NSSpeechSynthesizer no macOS e eSpeak no Linux. Não há chamada de rede nem limite. Também existe uma voz que soa como um GPS de 2005, então avalie com os próprios ouvidos antes de se comprometer.
edge-tts para vozes melhores
import asyncio
import edge_tts
async def main():
speech = edge_tts.Communicate("Your order has shipped.", "en-US-AriaNeural")
await speech.save("order.mp3")
asyncio.run(main())
O edge-tts se conecta ao mesmo serviço de leitura em voz alta usado pelo navegador Edge. As vozes têm qualidade neural e o pacote é gratuito, mas é um cliente não oficial, sem contrato de serviço por trás. Trate-o como o gTTS: bom para projetos pessoais, uma aposta arriscada quando usuários pagantes dependem dele.
Modelos neurais locais
Piper e Kokoro são os dois para experimentar primeiro. O Piper recebe um arquivo de voz baixado e gera o áudio direto pela linha de comando:
echo "Your order has shipped." | piper --model en_US-lessac-medium.onnx --output_file order.wav
Ele é leve o bastante para um Raspberry Pi 4, o que o torna a escolha comum para quiosques offline, automação residencial e tudo que precisa continuar funcionando sem internet. O Kokoro precisa de mais memória, mas soa visivelmente mais natural e roda muito rápido em uma GPU.
Chamando uma API na nuvem a partir do Python
Quando você precisa de um SLA, de marcação SSML ou de dezenas de idiomas, um provedor de nuvem é o caminho honesto. O padrão é o mesmo em todos: autenticar, enviar texto, receber os bytes do áudio.
Um exemplo com Google Cloud
from google.cloud import texttospeech
client = texttospeech.TextToSpeechClient()
response = client.synthesize_speech(
input=texttospeech.SynthesisInput(text="Your order has shipped."),
voice=texttospeech.VoiceSelectionParams(
language_code="en-US", name="en-US-Standard-C"
),
audio_config=texttospeech.AudioConfig(
audio_encoding=texttospeech.AudioEncoding.MP3
),
)
with open("order.mp3", "wb") as f:
f.write(response.audio_content)
A autenticação vem da variável de ambiente GOOGLE_APPLICATION_CREDENTIALS, que aponta para um arquivo de conta de serviço, então nenhum segredo fica dentro do script. Troque en-US-Standard-C por uma voz Neural2 e a chamada continua idêntica. Só o pool de onde você tira a cota e o preço mudam.
Armazene em cache antes de pagar
import hashlib
import pathlib
def cached_speech(text, synthesize):
name = hashlib.sha256(text.encode()).hexdigest() + ".mp3"
path = pathlib.Path("audio_cache") / name
if not path.exists():
path.parent.mkdir(exist_ok=True)
path.write_bytes(synthesize(text))
return path
Calcular o hash do texto significa que uma frase repetida não custa nada na segunda vez. Para um recurso de leitura em voz alta, esse hábito sozinho costuma manter o tráfego dentro da camada gratuita. Mais dois hábitos ajudam: dividir textos longos nos limites de frase, já que a maioria dos provedores limita uma única requisição a alguns milhares de caracteres, e envolver cada chamada em uma nova tentativa com recuo exponencial para respostas de limite de taxa.
Opções ilimitadas e suas pegadinhas
Pesquise por "ilimitado" e as mesmas três promessas aparecem. Cada uma tem um custo.
Hospedar por conta própria custa tempo. Você instala modelos, gerencia dependências, acompanha a memória da GPU e atualiza tudo quando uma versão quebra algo. Para alguns milhares de requisições por mês, uma camada gratuita na nuvem sai mais barata que suas horas. Em milhões de requisições, rodar o Piper ou o Kokoro no seu próprio servidor começa a compensar.
Endpoints não oficiais quebram. O gTTS e o edge-tts dependem de serviços que os donos nunca prometeram a desenvolvedores. Eles podem ficar lentos, mudar de formato ou desaparecer. Se um recurso importa para seus clientes, dê a ele uma voz de reserva de um provedor com suporte.
Planos "ilimitados" medem outra coisa. Alguns serviços por assinatura anunciam fala ilimitada e depois limitam a concorrência, os direitos comerciais ou a qualidade da voz. Leia o parágrafo de uso justo antes de comprometer um produto com o plano.
A qualidade varia mais do que sugere o preço. Uma voz Standard e uma voz neural do mesmo provedor podem soar completamente diferentes, então uma cota generosa na camada mais barata pode não ser a voz que você queria de fato.
É o volume que faz isso importar. Um recurso de leitura em voz alta que narra cada artigo para os visitantes, incluindo pessoas que dependem do áudio para ler a web, pode consumir uma cota mensal em uma semana movimentada.
Escolhendo o caminho gratuito certo
Sua situação
Melhor caminho gratuito
Cuidado com
Script ou demo de fim de semana
gTTS ou edge-tts
Não oficial, pode quebrar
App ou dispositivo offline
pyttsx3 ou Piper
Vozes monótonas do pyttsx3
Recurso de produção pequeno
Google Standard ou Azure F0
A cota é renovada todo mês
Alto volume, custo fixo
Kokoro ou Piper hospedados por conta própria
Tempo de GPU e licenças de voz
Audiolivro ou narração de vídeo
Uma ferramenta de navegador sem código
Sem acesso à API
A maioria dos projetos reais combina duas linhas: uma voz local ou de nuvem gratuita para desenvolvimento, e um provedor com suporte para a versão que os clientes usam.
Antes de lançar, rode um teste de três frases na voz que escolher: uma com um preço como US$ 1.200,50, uma com uma abreviação como Dr. ou SQL, e uma com um nome difícil de pronunciar. Essas três linhas expõem a maioria dos problemas de normalização e custam menos de cem caracteres da sua cota.
Use o Speech 2.8 HD no PicassoIA
Às vezes você não precisa de integração nenhuma, só de um bom arquivo de narração. O Speech 2.8 HD no PicassoIA roda no navegador, então você pode testar vozes e configurações antes de decidir o que construir. No momento em que escrevo, a API para desenvolvedores do PicassoIA lista modelos de imagem e vídeo, e não de fala, então este é um fluxo de navegador, não um substituto direto dos provedores acima.
Cole seu roteiro
Abra a página do modelo e cole até 10.000 caracteres no campo de texto. Insira pausas com marcadores como <#0.5#>, que adiciona meio segundo de silêncio. Divida um roteiro longo em cenas e gere cada uma separadamente, para que uma única linha ruim nunca obrigue a refazer tudo.
Defina a voz e a emoção
Escolha uma voz (a padrão é Wise_Woman) e uma emoção: auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent ou neutral. A dica de idioma aceita mais de 40 idiomas, então um mesmo roteiro pode virar uma versão em espanhol ou japonês com uma única mudança no menu suspenso. Depois ajuste a entrega:
Velocidade: 0,5 a 2,0, com 1,0 como padrão
Tom: menos 12 a mais 12 semitons
Volume: 0 a 10, com 1,0 como padrão
💡 Para vídeos explicativos, experimente velocidade 1,1 e mantenha o tom a até dois semitons de zero. Mudanças maiores começam a soar artificiais.
Exporte no formato certo
O MP3 é o padrão e chega a 256 kbps, o que serve para podcasts e vídeos. WAV e FLAC são sem perdas para edição, e PCM dá áudio bruto para pipelines. Ative os metadados de legenda quando quiser marcações de tempo por frase para as legendas.
Outros modelos que valem a pena testar com o mesmo roteiro:
Roteiro, voz e trilha são três tarefas separadas, e cada uma tem um modelo. Escreva o roteiro com o Claude Sonnet 5 ou o Gemini 3.5 Flash, gere a narração com o Speech 2.8 HD e depois coloque uma base musical por baixo, em volume baixo, feita com o Lyria 3, o Music 2.6 ou o Stable Audio 2.5.
Um plano simples leva você do zero a uma voz funcionando em uma única sessão:
Escreva um roteiro de 150 palavras e gere-o com três vozes diferentes.
Escolha a melhor e anote as configurações de velocidade, tom e emoção.
Escolha o caminho gratuito da tabela que se encaixa no seu volume mensal.
Armazene cada arquivo gerado, para que cada frase seja paga apenas uma vez.
Abra o PicassoIA, cole um parágrafo do seu próprio projeto e teste três vozes com três emoções diferentes. Dez minutos de testes dizem mais do que qualquer página de preços e definem a voz antes de você escrever uma linha de código de integração. Já que estiver lá, gere uma imagem de miniatura ou um vídeo curto para acompanhar o áudio e então construa a partir da voz que você mais gostou.