API Google Cloud Text to Speech: preços, vozes e plano gratuito

Preços da API Google Cloud Text to Speech em números simples: quanto custam por milhão de caracteres as vozes Standard, WaveNet, Neural2, Chirp 3 HD e Studio, qual é o tamanho real do plano gratuito e como estimar uma fatura mensal antes de colocar no ar, além de alternativas que funcionam no navegador.

API Google Cloud Text to Speech: preços, vozes e plano gratuito
Cristian Da Conceicao
Fundador do Picasso IA

O Google Cloud Text to Speech parece barato até chegar a primeira fatura. O número de destaque é US$ 4 por milhão de caracteres para as vozes básicas, mas as vozes que as pessoas realmente querem ouvir custam entre quatro e quarenta vezes mais, e a franquia gratuita diminui rápido conforme você sobe na escala de qualidade. Este artigo apresenta cada faixa de voz, o que o plano gratuito mensal inclui de fato, como estimar uma fatura antes de escrever qualquer linha de código e quando outro modelo de voz por IA é a escolha mais inteligente.

Os preços abaixo refletem as tarifas publicadas pelo Google em outubro de 2026. O Google reorganiza sua linha de vozes com frequência, então trate os números como uma base para planejamento e confirme-os no console de faturamento antes de fechar um orçamento.

O que a API faz de fato

A API Cloud Text-to-Speech recebe texto simples ou um documento SSML e devolve áudio. Você a chama por REST ou gRPC, ou por meio de bibliotecas cliente para Python, Node.js, Java, Go e C#. A autenticação é feita por uma conta de serviço, então um backend pode solicitar áudio sem nenhuma etapa de login feita por uma pessoa.

Um desenvolvedor freelancer trabalhando em um notebook ao lado de fones de ouvido e uma caneca, com a luz suave da manhã entrando pela janela

Formatos e limites de requisição

Cada resposta chega como MP3, LINEAR16 (WAV sem compressão), OGG_OPUS, MULAW ou ALAW. O MP3 serve para reprodução na web, o LINEAR16 serve para edição, e o MULAW ou ALAW servem para sistemas de telefonia que esperam codecs de telefonia. Uma única chamada aceita cerca de 5.000 bytes de entrada, então um roteiro longo precisa ser dividido em blocos e unido novamente do seu lado.

💡 Dica: Divida os roteiros nos limites de frase, nunca em um número fixo de bytes. Um corte no meio de uma frase deixa um salto de tom audível na junção.

Controles de SSML e de voz

SSML é a linguagem de marcação que molda a entrega. Com ela você adiciona pausas por meio de <break>, dá ênfase a uma palavra com <emphasis> e soletra datas, números e abreviações com <say-as>. Fora do SSML, a requisição expõe a velocidade de fala (de 0,25x a 4x) e o tom (de menos 20 a mais 20 semitons) como parâmetros simples. O Google lista centenas de vozes em mais de 50 idiomas e variantes, embora nem todo controle funcione em todas as faixas de voz.

Tipos de voz e seus preços

O Google vende a fala em faixas. O preço segue a tecnologia de voz por trás, não a duração do áudio, por isso escolher a faixa errada é o erro de orçamento mais comum.

Faixa de vozPreço por 1 milhão de caracteresGratuito por mêsIdeal para
StandardUS$ 44 milhões de caracteresAlertas, protótipos, narração simples
WaveNetUS$ 4Compartilhado com StandardUm tom mais caloroso pelo mesmo preço
Neural2US$ 161 milhão de caracteresLeitura natural na maioria dos apps
PolyglotUS$ 16Compartilhado com Neural2Um mesmo locutor em vários idiomas
Chirp 3 HDUS$ 301 milhão de caracteresNarração realista e expressiva
Voz personalizada instantâneaUS$ 60NenhumUma voz de marca clonada
StudioUS$ 160Franquia pequenaÁudio premium de longa duração

💡 Atenção: Páginas de preços de terceiros divergem sobre a cota gratuita do WaveNet, algumas indicam 1 milhão e outras 4 milhões, porque as linhas Standard e WaveNet mudaram ao longo dos anos. Confira os números atuais no seu console antes de confiar no valor maior.

Uma regra rápida para escolher: use Standard quando o áudio for curto e funcional, Neural2 quando as pessoas forem ouvi-lo todos os dias, Chirp 3 HD quando a voz fizer parte da experiência do produto e Studio apenas depois de ter ouvido o Chirp 3 HD e tê-lo achado insuficiente. Começar uma faixa abaixo e subir após o retorno real dos ouvintes mantém as primeiras faturas pequenas.

Standard e WaveNet

As vozes Standard são as mais antigas e mais baratas. Soam claramente sintéticas, com ritmo uniforme e emoção plana. Isso serve bem para uma notificação de entrega ou uma leitura de status, e os 4 milhões de caracteres gratuitos por mês absorvem uma quantidade surpreendente desse tráfego. As vozes WaveNet usam um vocoder neural que suaviza a parte robótica. Pelas tarifas atuais, custam o mesmo que o Standard, o que torna o Standard difícil de justificar para qualquer coisa que uma pessoa vá ouvir por mais de alguns segundos.

Neural2 e Polyglot

A Neural2 é a faixa do dia a dia. A pronúncia é limpa, o ritmo das frases soa natural, e US$ 16 por milhão de caracteres é um meio-termo justo. As vozes Polyglot, ainda marcadas como prévia na tabela de preços, permitem que um mesmo locutor alterne entre idiomas, o que ajuda uma linha de suporte que precisa ler um nome em espanhol dentro de uma frase em inglês. As duas faixas compartilham uma franquia mensal de 1 milhão de caracteres.

Chirp 3 HD e Studio

A Chirp 3 HD é a nova família premium do Google, construída em torno de 30 estilos de voz com nomes como Aoede, Puck, Charon e Kore. A US$ 30 por milhão de caracteres, custa quase o dobro da Neural2, mas soa muito mais próxima de um leitor humano, com respirações e entonação convincentes. As vozes Studio ficam em US$ 160 por milhão de caracteres, quarenta vezes a tarifa do Standard. A Chirp 3 HD geralmente chega perto o suficiente para que o Studio seja difícil de justificar fora de um conjunto restrito de trabalhos premium de longa duração.

Como funciona o plano gratuito

O que conta como caractere

A cobrança conta os caracteres do texto que você envia, incluindo espaços e pontuação. Uma palavra média em inglês tem cinco letras mais um espaço, então uma palavra custa cerca de seis caracteres. Com essa conta, 1 milhão de caracteres equivale a aproximadamente 166.000 palavras, ou cerca de 18,5 horas de fala em um ritmo tranquilo de 150 palavras por minuto.

As franquias são renovadas todo mês calendário e nunca acumulam. Caracteres não usados em março desaparecem em abril. Eles também são contabilizados por faixa, então 900.000 caracteres sobrando da Neural2 jamais vão abater uma fatura da Chirp 3 HD.

Vista de cima de uma mesa com calculadora, faturas impressas e contas escritas à mão, usadas para estimar custos de fala

O faturamento precisa estar ativo

O plano gratuito não é um teste sem cartão. Uma conta de faturamento precisa estar vinculada ao projeto antes que a API responda, mesmo que você nunca saia da franquia gratuita. Configure um alerta de orçamento de US$ 5 ou US$ 10 no primeiro dia e considere reduzir a cota da API no console, para que um loop descontrolado não gere uma conta de quatro dígitos durante a noite.

💡 Dica de especialista: Guarde em cache todo arquivo gerado. Uma saudação que toca 10.000 vezes por dia deve ser sintetizada uma vez e armazenada, e não cobrada 10.000 vezes.

Quanto custa de fato 1 milhão de caracteres

Os preços por caractere parecem minúsculos, então aqui estão as mesmas faixas calculadas sobre cargas de trabalho reais. Cada valor aplica primeiro a franquia gratuita da faixa.

Três exemplos de fatura mensal

Carga de trabalhoCaracteresStandardNeural2Chirp 3 HD
200 artigos de blog de 1.500 palavras1,8 milhãoUS$ 0US$ 12,80US$ 24,00
Menu telefônico, 50.000 prompts de 120 caracteres6 milhõesUS$ 8,00US$ 80,00US$ 150,00
Um romance de 80.000 palavras0,48 milhãoUS$ 0US$ 0US$ 0

O romance fica dentro da franquia gratuita na Neural2 ou na Chirp 3 HD, mas o mesmo livro no Studio custaria US$ 76,80 antes de qualquer franquia. A linha do menu telefônico mostra por que a escolha da faixa importa: um tráfego idêntico custa US$ 8 no Standard e US$ 150 na Chirp 3 HD. Guardar prompts repetidos em cache normalmente elimina a maior parte dessa diferença, porque um menu fixo tem apenas algumas centenas de frases únicas.

Custo por hora de áudio

Com 150 palavras por minuto e seis caracteres por palavra, uma hora de fala tem cerca de 54.000 caracteres. Preços antes de qualquer franquia gratuita:

FaixaCusto por hora de áudio
Standard e WaveNetUS$ 0,22
Neural2 e PolyglotUS$ 0,86
Chirp 3 HDUS$ 1,62
Voz personalizada instantâneaUS$ 3,24
StudioUS$ 8,64
Gemini 3.1 Flash TTS (cobrado por tokens)Cerca de US$ 1,81, estimativa independente

Leia esses valores como o preço da centésima hora, não da primeira. Os modelos de fala do Gemini, do Google, cobram de forma diferente, por tokens em vez de caracteres: cerca de US$ 1 por milhão de tokens de texto mais US$ 20 por milhão de tokens de áudio para o Gemini 3.1 Flash TTS. O custo então acompanha a duração do áudio que você gera, o que é mais fácil de prever para narrações e mais difícil para assistentes que não param de falar.

Onde a API se encaixa melhor

Audiolivros e narração

A narração de longa duração é onde a cobrança por caractere é mais previsível. Um livro de dez horas tem cerca de 540.000 caracteres, então, mesmo sem nenhuma franquia gratuita, a Chirp 3 HD custaria US$ 16,20 pelo conjunto. A contrapartida é o controle limitado sobre a interpretação. As vozes do Google leem o que você fornece, com controle emocional limitado além do SSML, então ficção com diálogos geralmente significa testar várias vozes para vários personagens.

Um narrador lendo um grosso livro de bolso dentro de uma cabine de gravação acolchoada

Menus telefônicos e suporte

A telefonia é a melhor correspondência para a lista de formatos da API. Solicite saída em MULAW ou ALAW para que o áudio entre direto em uma rede telefônica sem conversão, gere os prompts fixos uma vez e armazene os arquivos, e mantenha a síntese ao vivo para as partes que mudam, como nomes e números de pedido. Apenas a parte dinâmica deveria chegar à sua fatura.

Um andar de atendimento ao cliente bem iluminado, com atendentes de fone de ouvido em mesas brancas

Assistentes e acessibilidade

Alto-falantes inteligentes, apps de leitura e assistentes de carro têm um padrão em comum: respostas curtas, volume alto. As vozes Standard e Neural2 dão conta desse tráfego a baixo custo, e uma franquia gratuita generosa costuma significar que um produto pequeno não paga nada por meses. A latência também importa aqui, então teste o tempo de resposta a partir da sua própria região antes de se comprometer. Uma voz que soa perfeita, mas leva dois segundos para começar, parece quebrada em uma conversa.

Um alto-falante inteligente cinza-carvão fosco sobre a bancada de uma cozinha, ao lado de limões e uma xícara de café fumegante

A acessibilidade é um caso diferente. Quem depende de áudio para ler artigos longos ouve a voz por horas todos os dias, e um tom sintético e plano cansa rápido. Reserve orçamento para Neural2 ou Chirp 3 HD nesse caso, e deixe o ouvinte controlar a velocidade.

Um homem com bengala branca em um ponto de ônibus ouvindo o celular por fones de ouvido

Opções de voz além do Google Cloud

A API foi feita para desenvolvedores que mantêm um projeto na nuvem, uma conta de serviço e um console de faturamento. Se você precisa de uma narração para um vídeo, de um protótipo rápido ou de uma narração pontual, essa configuração é trabalho extra. A PicassoIA hospeda 24 modelos de texto para fala que você pode testar direto no navegador, sem nenhum projeto na nuvem para configurar.

Alternativas que valem a pena testar

ModeloDiferencialBoa escolha para
Gemini 3.1 Flash TTS30 vozes, mais de 70 códigos de idioma, tags de emoçãoNarração expressiva e roteiros multilíngues
ElevenLabs v3Narrações naturais, com som humanoStorytelling e leituras de personagens
MiniMax Speech 2.8 HDSaída com qualidade de estúdioNarração polida para vídeo
Inworld Realtime TTS 2Direção de voz em linguagem naturalAgentes conversacionais
Qwen3 TTSClona uma voz ou cria uma novaVozes personalizadas de marca
ElevenLabs DubbingTraduz vídeos para mais de 90 idiomasLocalização de imagens já gravadas

Um apresentador de podcast falando em um microfone condensador com filtro pop em um estúdio aconchegante

Se o seu projeto precisa de uma voz própria, e não de uma voz genérica, o MiniMax Voice Cloning cria uma voz personalizada a partir de uma amostra curta, e evita os US$ 60 por milhão de caracteres que o Google cobra por uma voz personalizada instantânea.

Como usar o Gemini 3.1 Flash TTS

O Gemini 3.1 Flash TTS é um bom primeiro teste porque os nomes de suas vozes se sobrepõem à linha Chirp 3 HD do Google. Aoede, Puck, Charon e Kore aparecem nas duas, o que facilita comparações lado a lado.

  1. Abra a página do modelo e cole seu roteiro no campo de texto. O limite é de 4.000 bytes por geração, então divida roteiros mais longos.
  2. Escolha uma voz entre as 30 opções. A padrão é Kore, e Puck, Charon, Fenrir e Aoede são boas opções para testar primeiro.
  3. Defina o código de idioma. O padrão é en-US, e a lista passa de 70 códigos, incluindo es-MX, fr-CA, pt-BR e ja-JP.
  4. Escreva um prompt de estilo em inglês simples, como "Say this in a calm, professional tone" ou "Speak with excitement and energy".
  5. Adicione tags expressivas dentro do roteiro: [whispering], [laughing], [shouting], [sigh] ou [extremely fast].
  6. Gere, ouça e baixe o arquivo de áudio. Altere uma configuração por vez para ouvir o que cada uma faz.
ParâmetroO que controlaPonto de partida
VozPersona, idade e tomKore para narração neutra
Código de idiomaSotaque e pronúnciaCorresponda à região do seu público
Prompt de estiloRitmo, emoção, entregaUma frase curta
Tags de textoExpressão no nível da fraseDuas ou três por parágrafo

💡 Dica: Use as tags com moderação. Um roteiro em que toda linha é [whispering] ou [shouting] soa cansativo. Use-as para contraste, não para decoração.

Música e transcrição junto com a fala

A fala raramente sai sozinha. Um vídeo precisa de uma base musical sob a narração, e um conteúdo falado precisa de uma transcrição para legendas, busca e acessibilidade. O Google vende a transcrição como um produto separado, com medidor próprio, então um projeto de fala pode terminar com duas linhas de cobrança antes mesmo de você adicionar música.

Para o lado musical, o Lyria 3 Pro cria canções completas a partir de um prompt de texto, o MiniMax Music 2.6 adiciona vocais e letra, e o Stable Audio 2.5 serve para bases instrumentais que ficam discretas sob uma voz. Escreva o prompt da música como faria ao orientar um compositor: gênero, andamento, instrumentos e clima. "Warm acoustic guitar, 90 BPM, unhurried, no vocals" gera uma base que não vai competir com a narração.

Um produtor musical em uma mesa entre monitores de estúdio, com um controlador MIDI compacto

Para transcrições, o GPT-4o Transcribe e o Gemini 3 Pro transformam gravações em texto, o que é útil para atas de reunião, entrevistas e legendas da narração que você acabou de gerar.

Vista aérea de colegas ao redor de uma mesa de conferência de vidro, com um pequeno gravador de voz no centro

Um fluxo simples funciona bem: escreva o roteiro, gere a voz, adicione uma base musical e depois transcreva a mixagem final para produzir legendas e conferir a pronúncia de nomes difíceis.

Faça sua primeira narração hoje

Tabelas de preços dizem apenas parte da história. A forma mais rápida de decidir entre uma API na nuvem e uma ferramenta no navegador é ouvir as duas lendo o mesmo parágrafo. Pegue 100 palavras do seu próprio projeto, rode-as no console do Google e depois cole-as no Gemini 3.1 Flash TTS ou no MiniMax Speech 2.8 HD e compare o ritmo, o aconchego e a pronúncia lado a lado.

Já que você está por lá, explore o restante da plataforma. Adicione uma base musical com o Lyria 3 Pro, gere legendas do resultado com o GPT-4o Transcribe e crie suas próprias imagens fotorrealistas para miniaturas e ilustrações de artigos com a Picasso IA. Experimente à vontade, mude uma variável por vez e guarde a combinação que soa certa. Navegue por todos os modelos em picassoia.com/en/all-models.

Compartilhe este artigo

Escolha seu idioma