API de texto para fala gratuita: preços, Python e opções ilimitadas

Cada API de texto para fala gratuita tem regras diferentes: cotas mensais que são renovadas, testes de doze meses que expiram e modelos de código aberto sem medidor. Veja preços reais, código Python que funciona e um fluxo no navegador para testar as vozes antes de tudo.

API de texto para fala gratuita: preços, Python e opções ilimitadas
Cristian Da Conceicao
Fundador do Picasso IA

Digite "API de texto para fala gratuita" em uma barra de pesquisa e você recebe três respostas muito diferentes. Uma cota mensal de um gigante da nuvem. Um pacote Python que discretamente usa servidores de outra pessoa. Um modelo de código aberto que você roda na sua própria máquina. As três são gratuitas, mas só uma é realmente ilimitada, e não é a que a maioria das pessoas espera.

Este artigo organiza as opções pelo custo real, mostra Python funcional para cada uma e termina com um jeito de testar vozes no navegador antes de escrever qualquer código de integração. Os valores vêm das páginas de preços dos provedores e de resumos publicados até outubro de 2026. Os preços mudam, então confirme os números antes de montar um orçamento com base neles.

O que "gratuito" realmente significa

Os provedores usam a palavra "gratuito" para três arranjos diferentes, e confundi-los é a forma como um protótipo vira uma fatura surpresa.

Cotas mensais recorrentes

Google Cloud e Microsoft Azure renovam uma cota gratuita todo mês, sem data de expiração. O Google oferece 4 milhões de caracteres de vozes Standard, e a camada F0 do Azure oferece 0,5 milhão de caracteres de vozes neurais. Fique abaixo do limite e a conta fica em zero indefinidamente. Ultrapasse no Google e você paga a taxa normal por caractere. A camada F0 do Azure tem teto, então você bate em um limite em vez de receber uma conta.

Testes de doze meses

A cota do Amazon Polly se aplica a contas novas durante os primeiros 12 meses. A AWS lista 1 milhão de caracteres neurais por mês, 500 mil caracteres de formato longo e 100 mil caracteres generativos, e resumos publicados colocam as vozes padrão em 5 milhões. Após o décimo segundo mês, o mesmo tráfego custa US$ 4 por milhão de caracteres nas vozes padrão e US$ 16 nas neurais. Um protótipo gratuito em janeiro pode trazer um item real na fatura no janeiro seguinte.

O ElevenLabs fica no meio-termo. Seu plano gratuito oferece cerca de 10.000 caracteres por mês, o que equivale a apenas dez a quinze minutos de áudio, e exige atribuição e proíbe uso comercial. É o suficiente para testar uma voz e pequeno demais para um produto. A mesma família de vozes também está disponível no PicassoIA como ElevenLabs v3.

Código aberto e ilimitado

A única opção realmente ilimitada é o software que você mesmo roda. O Piper funciona em uma CPU comum, com mais de 100 vozes em mais de 30 idiomas. O Kokoro é um modelo de 82 milhões de parâmetros que produz fala natural e, segundo relatos, roda cerca de 100 vezes mais rápido que o tempo real em uma GPU. Ninguém mede seu uso porque ninguém hospeda você. O preço é o seu próprio hardware, o tempo de configuração e a tarefa de verificar a licença de cada voz antes de vender qualquer coisa feita com ela.

Equipe de startup organizando opções de camadas gratuitas em um quadro branco

Camadas gratuitas comparadas lado a lado

A tabela de preços

Provedor e camadaCota gratuitaExpira?Taxa paga depois
Google Cloud Standard4M de caracteres por mêsNãoUS$ 4 por 1M
Google Cloud Neural2Cerca de 1M de caracteres por mêsNãoUS$ 16 por 1M
Azure Neural (F0)0,5M de caracteres por mêsNãoPague conforme o uso
Amazon Polly Standard5M de caracteres por mêsApós 12 mesesUS$ 4 por 1M
Amazon Polly Neural1M de caracteres por mêsApós 12 mesesUS$ 16 por 1M
ElevenLabs FreeCerca de 10K de caracteres por mêsNãoPlanos pagos
Piper ou KokoroSem limiteNãoSeu hardware

💡 As cotas são contadas por conta, por mês e por nível de voz. Vozes padrão e premium usam pools separados, então teste exatamente a voz que você pretende lançar.

O que um milhão de caracteres compra

Os próprios exemplos de preço da AWS dão cerca de 23 horas e 8 minutos de fala por milhão de caracteres. Use isso como regra prática. Os 4 milhões de caracteres Standard do Google equivalem a cerca de 90 horas de áudio por mês, e os 0,5 milhão do Azure, a cerca de 11 horas.

Um post de blog de 1.500 palavras tem perto de 9.000 caracteres. Nesse tamanho, a camada gratuita do Azure narra cerca de 55 posts por mês, e a do Google narra mais de 400. Um botão de leitura em voz alta em um blog de porte médio cabe em uma camada gratuita, desde que você armazene cada arquivo de áudio em vez de gerá-lo de novo a cada visualização de página.

Conte com cuidado. A maioria dos provedores mede cada caractere enviado, incluindo espaços, pontuação e tags de marcação, então remova o HTML antes da síntese e envie texto simples. Meça uma semana de tráfego real antes de confiar em qualquer estimativa.

Fatura impressa, calculadora e espresso sobre uma mesa de madeira

Opções em Python sem custo

Três pacotes atendem à maioria dos scripts rápidos. Eles se instalam com pip, não exigem conta de faturamento e funcionam em poucas linhas, mas não são iguais.

gTTS em quatro linhas

from gtts import gTTS

tts = gTTS("Your order has shipped.", lang="en")
tts.save("order.mp3")

O gTTS é um wrapper não oficial do endpoint de fala por trás do Google Tradutor. Não há credencial nem cota publicada, e isso é exatamente o problema: o Google pode limitar ou alterar o endpoint sem aviso. Serve bem para um script de sala de aula. É arriscado para um recurso voltado ao cliente.

Desenvolvedor digitando código Python em um espaço de coworking

pyttsx3 funciona offline

import pyttsx3

engine = pyttsx3.init()
engine.setProperty("rate", 170)
engine.save_to_file("Your order has shipped.", "order.wav")
engine.runAndWait()

O pyttsx3 usa as vozes já instaladas no seu sistema operacional: SAPI5 no Windows, NSSpeechSynthesizer no macOS e eSpeak no Linux. Não há chamada de rede nem limite. Também existe uma voz que soa como um GPS de 2005, então avalie com os próprios ouvidos antes de se comprometer.

edge-tts para vozes melhores

import asyncio
import edge_tts

async def main():
    speech = edge_tts.Communicate("Your order has shipped.", "en-US-AriaNeural")
    await speech.save("order.mp3")

asyncio.run(main())

O edge-tts se conecta ao mesmo serviço de leitura em voz alta usado pelo navegador Edge. As vozes têm qualidade neural e o pacote é gratuito, mas é um cliente não oficial, sem contrato de serviço por trás. Trate-o como o gTTS: bom para projetos pessoais, uma aposta arriscada quando usuários pagantes dependem dele.

Modelos neurais locais

Piper e Kokoro são os dois para experimentar primeiro. O Piper recebe um arquivo de voz baixado e gera o áudio direto pela linha de comando:

echo "Your order has shipped." | piper --model en_US-lessac-medium.onnx --output_file order.wav

Ele é leve o bastante para um Raspberry Pi 4, o que o torna a escolha comum para quiosques offline, automação residencial e tudo que precisa continuar funcionando sem internet. O Kokoro precisa de mais memória, mas soa visivelmente mais natural e roda muito rápido em uma GPU.

Raspberry Pi conectado a um pequeno alto-falante sobre uma bancada de trabalho

Chamando uma API na nuvem a partir do Python

Quando você precisa de um SLA, de marcação SSML ou de dezenas de idiomas, um provedor de nuvem é o caminho honesto. O padrão é o mesmo em todos: autenticar, enviar texto, receber os bytes do áudio.

Um exemplo com Google Cloud

from google.cloud import texttospeech

client = texttospeech.TextToSpeechClient()

response = client.synthesize_speech(
    input=texttospeech.SynthesisInput(text="Your order has shipped."),
    voice=texttospeech.VoiceSelectionParams(
        language_code="en-US", name="en-US-Standard-C"
    ),
    audio_config=texttospeech.AudioConfig(
        audio_encoding=texttospeech.AudioEncoding.MP3
    ),
)

with open("order.mp3", "wb") as f:
    f.write(response.audio_content)

A autenticação vem da variável de ambiente GOOGLE_APPLICATION_CREDENTIALS, que aponta para um arquivo de conta de serviço, então nenhum segredo fica dentro do script. Troque en-US-Standard-C por uma voz Neural2 e a chamada continua idêntica. Só o pool de onde você tira a cota e o preço mudam.

Técnico caminhando por um corredor de data center

Armazene em cache antes de pagar

import hashlib
import pathlib

def cached_speech(text, synthesize):
    name = hashlib.sha256(text.encode()).hexdigest() + ".mp3"
    path = pathlib.Path("audio_cache") / name
    if not path.exists():
        path.parent.mkdir(exist_ok=True)
        path.write_bytes(synthesize(text))
    return path

Calcular o hash do texto significa que uma frase repetida não custa nada na segunda vez. Para um recurso de leitura em voz alta, esse hábito sozinho costuma manter o tráfego dentro da camada gratuita. Mais dois hábitos ajudam: dividir textos longos nos limites de frase, já que a maioria dos provedores limita uma única requisição a alguns milhares de caracteres, e envolver cada chamada em uma nova tentativa com recuo exponencial para respostas de limite de taxa.

Opções ilimitadas e suas pegadinhas

Pesquise por "ilimitado" e as mesmas três promessas aparecem. Cada uma tem um custo.

Hospedar por conta própria custa tempo. Você instala modelos, gerencia dependências, acompanha a memória da GPU e atualiza tudo quando uma versão quebra algo. Para alguns milhares de requisições por mês, uma camada gratuita na nuvem sai mais barata que suas horas. Em milhões de requisições, rodar o Piper ou o Kokoro no seu próprio servidor começa a compensar.

Endpoints não oficiais quebram. O gTTS e o edge-tts dependem de serviços que os donos nunca prometeram a desenvolvedores. Eles podem ficar lentos, mudar de formato ou desaparecer. Se um recurso importa para seus clientes, dê a ele uma voz de reserva de um provedor com suporte.

Planos "ilimitados" medem outra coisa. Alguns serviços por assinatura anunciam fala ilimitada e depois limitam a concorrência, os direitos comerciais ou a qualidade da voz. Leia o parágrafo de uso justo antes de comprometer um produto com o plano.

A qualidade varia mais do que sugere o preço. Uma voz Standard e uma voz neural do mesmo provedor podem soar completamente diferentes, então uma cota generosa na camada mais barata pode não ser a voz que você queria de fato.

É o volume que faz isso importar. Um recurso de leitura em voz alta que narra cada artigo para os visitantes, incluindo pessoas que dependem do áudio para ler a web, pode consumir uma cota mensal em uma semana movimentada.

Homem ouvindo áudio em um smartphone em um terraço de café

Escolhendo o caminho gratuito certo

Sua situaçãoMelhor caminho gratuitoCuidado com
Script ou demo de fim de semanagTTS ou edge-ttsNão oficial, pode quebrar
App ou dispositivo offlinepyttsx3 ou PiperVozes monótonas do pyttsx3
Recurso de produção pequenoGoogle Standard ou Azure F0A cota é renovada todo mês
Alto volume, custo fixoKokoro ou Piper hospedados por conta própriaTempo de GPU e licenças de voz
Audiolivro ou narração de vídeoUma ferramenta de navegador sem códigoSem acesso à API

A maioria dos projetos reais combina duas linhas: uma voz local ou de nuvem gratuita para desenvolvimento, e um provedor com suporte para a versão que os clientes usam.

Antes de lançar, rode um teste de três frases na voz que escolher: uma com um preço como US$ 1.200,50, uma com uma abreviação como Dr. ou SQL, e uma com um nome difícil de pronunciar. Essas três linhas expõem a maioria dos problemas de normalização e custam menos de cem caracteres da sua cota.

Mulher gravando uma narração com um microfone de condensador

Use o Speech 2.8 HD no PicassoIA

Às vezes você não precisa de integração nenhuma, só de um bom arquivo de narração. O Speech 2.8 HD no PicassoIA roda no navegador, então você pode testar vozes e configurações antes de decidir o que construir. No momento em que escrevo, a API para desenvolvedores do PicassoIA lista modelos de imagem e vídeo, e não de fala, então este é um fluxo de navegador, não um substituto direto dos provedores acima.

Cole seu roteiro

Abra a página do modelo e cole até 10.000 caracteres no campo de texto. Insira pausas com marcadores como <#0.5#>, que adiciona meio segundo de silêncio. Divida um roteiro longo em cenas e gere cada uma separadamente, para que uma única linha ruim nunca obrigue a refazer tudo.

Defina a voz e a emoção

Escolha uma voz (a padrão é Wise_Woman) e uma emoção: auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent ou neutral. A dica de idioma aceita mais de 40 idiomas, então um mesmo roteiro pode virar uma versão em espanhol ou japonês com uma única mudança no menu suspenso. Depois ajuste a entrega:

  • Velocidade: 0,5 a 2,0, com 1,0 como padrão
  • Tom: menos 12 a mais 12 semitons
  • Volume: 0 a 10, com 1,0 como padrão

💡 Para vídeos explicativos, experimente velocidade 1,1 e mantenha o tom a até dois semitons de zero. Mudanças maiores começam a soar artificiais.

Exporte no formato certo

O MP3 é o padrão e chega a 256 kbps, o que serve para podcasts e vídeos. WAV e FLAC são sem perdas para edição, e PCM dá áudio bruto para pipelines. Ative os metadados de legenda quando quiser marcações de tempo por frase para as legendas.

Mulher ajustando configurações de áudio em um monitor em um estúdio iluminado

Outros modelos que valem a pena testar com o mesmo roteiro:

Faça sua primeira narração

Roteiro, voz e trilha são três tarefas separadas, e cada uma tem um modelo. Escreva o roteiro com o Claude Sonnet 5 ou o Gemini 3.5 Flash, gere a narração com o Speech 2.8 HD e depois coloque uma base musical por baixo, em volume baixo, feita com o Lyria 3, o Music 2.6 ou o Stable Audio 2.5.

Mãos de um músico sobre uma mesa de mixagem analógica

Um plano simples leva você do zero a uma voz funcionando em uma única sessão:

  1. Escreva um roteiro de 150 palavras e gere-o com três vozes diferentes.
  2. Escolha a melhor e anote as configurações de velocidade, tom e emoção.
  3. Escolha o caminho gratuito da tabela que se encaixa no seu volume mensal.
  4. Armazene cada arquivo gerado, para que cada frase seja paga apenas uma vez.

Abra o PicassoIA, cole um parágrafo do seu próprio projeto e teste três vozes com três emoções diferentes. Dez minutos de testes dizem mais do que qualquer página de preços e definem a voz antes de você escrever uma linha de código de integração. Já que estiver lá, gere uma imagem de miniatura ou um vídeo curto para acompanhar o áudio e então construa a partir da voz que você mais gostou.

Compartilhe este artigo

Escolha seu idioma