Gemini TTS: vozes, preços, API e idiomas explicados
O Gemini TTS transforma um roteiro em fala com 30 vozes predefinidas, mais de 70 idiomas e tags expressivas como sussurrar e rir. Este artigo detalha cada voz por tom, a conta real de tokens por trás do preço, uma chamada de API em Python que funciona e uma rota no navegador que não exige configuração.
Uma narração de um minuto feita com o Gemini TTS custa cerca de três centavos na tarifa padrão. Esse número único explica por que desenvolvedores, podcasters e criadores de cursos não param de perguntar sobre ele. Os modelos de fala do Google transformam um roteiro em áudio com 30 vozes nomeadas, dezenas de idiomas e um jeito simples, em linguagem comum, de dirigir a interpretação. O que os vídeos de demonstração não mostram é tudo o que decide se a ferramenta serve para o seu projeto: qual voz combina com cada tipo de trabalho, como a conta de tokens se soma, como é a chamada de API e onde estão os limites. Abaixo você encontra cada um desses pontos com números reais, um exemplo em Python que funciona e uma rota sem código que você pode testar no navegador em menos de um minuto.
O que o Gemini TTS realmente faz
O Gemini TTS é o lado de saída de fala dos modelos Gemini, do Google. Você envia texto mais uma instrução opcional, e o modelo devolve áudio em vez de mais texto. Os motores tradicionais de texto para fala aplicam a mesma entrega fixa a todas as frases. Um modelo Gemini TTS lê a instrução e o roteiro juntos, então "diga isto como uma enfermeira cansada de plantão noturno" muda o ritmo, a respiração e o tom, não só a altura da voz.
Do texto ao áudio falado
Toda solicitação tem os mesmos três ingredientes: um roteiro, uma voz e uma instrução de estilo. A página do Gemini 3.1 Flash TTS no Picasso IA expõe esses itens em quatro campos: text, voice, prompt e language_code. Os padrões são a voz Kore, o idioma en-US e o prompt "Say the following.". Clique em gerar e um arquivo de áudio pronto chega em segundos. As duas amostras publicadas na página do modelo levaram cerca de 6,5 e 4,0 segundos. Um ciclo tão curto muda a forma de trabalhar: reescreva uma linha, gere de novo e compare as versões como faria com um narrador humano, sem a taxa de reserva nem as horas de estúdio.
Versões do modelo em uso
O Google lança mais de um modelo de TTS, e a escolha muda a sua conta:
Gemini 3.1 Flash TTS (prévia): cotado em US$ 1,00 por milhão de tokens de entrada de texto e US$ 20,00 por milhão de tokens de saída de áudio.
Gemini 2.5 Flash Preview TTS: exatamente metade do preço do 3.1 Flash nos dois lados.
Gemini 2.5 Pro Preview TTS: as mesmas tarifas do 3.1 Flash, sem camada gratuita.
Qual escolher? Opte pelo 3.1 Flash quando quiser o controle de interpretação mais recente. Opte pelo 2.5 Flash quando for narrar milhares de textos curtos, como notificações de aplicativos, em que a metade do preço faz diferença rápido. Escolha o 2.5 Pro apenas se preferir o resultado dele, já que custa o mesmo que o 3.1 Flash e não tem camada gratuita.
A documentação de fala do Google também lista modelos TTS mais novos das linhas Flash e Flash Lite. As tarifas deles não estavam na tabela de preços quando este artigo foi escrito, então confira a tabela antes de montar um orçamento com base neles.
As 30 vozes, organizadas por tom
O Gemini TTS traz 30 vozes predefinidas com nomes emprestados da astronomia e da mitologia. O Google atribui a cada uma um rótulo de uma palavra, como "Bright" ou "Firm", e esses rótulos são o atalho mais rápido para escolher. Trate-os como ponto de partida, porque um prompt de estilo pode deixar qualquer voz mais calorosa, mais rápida ou mais neutra.
Animadas e vibrantes
Sete vozes têm perfil energético: Zephyr (Bright), Puck (Upbeat), Autonoe (Bright), Laomedeia (Upbeat), Sadachbia (Lively), Fenrir (Excitable) e Leda (Youthful). Use-as em anúncios, vídeos curtos para redes sociais, tours de integração e conteúdo infantil, em qualquer lugar onde o ouvinte deva sentir impulso no primeiro segundo.
Calorosas e suaves
Seis vozes ficam do lado mais suave: Sulafat (Warm), Achird (Friendly), Vindemiatrix (Gentle), Achernar (Soft), Enceladus (Breathy) e Aoede (Breezy). Elas combinam com roteiros de meditação, histórias para dormir, aplicativos de bem-estar e mensagens de atendimento ao cliente.
Firmes e claras
Dez vozes transmitem autoridade: Kore (Firm), Orus (Firm), Alnilam (Firm), Iapetus (Clear), Erinome (Clear), Charon (Informative), Rasalgethi (Informative), Sadaltager (Knowledgeable), Schedar (Even) e Pulcherrima (Forward). A Kore é o padrão por um motivo: funciona bem em tutoriais, explicações e demonstrações de produto sem soar rígida.
As outras sete preenchem as lacunas. Algieba, Despina, Callirrhoe, Umbriel e Zubenelgenubi são suaves, tranquilas ou casuais, o que combina com conversas. Algenib (Gravelly) e Gacrux (Mature) trazem textura para personagens e narrativas.
Trabalho
Vozes para testar primeiro
Demonstração de produto
Kore, Charon, Sadaltager
Abertura de podcast
Puck, Fenrir, Algenib
Meditação
Vindemiatrix, Achernar, Enceladus
Anúncio em redes sociais
Zephyr, Sadachbia, Leda
Narração de audiolivro
Gacrux, Schedar, Sulafat
💡 Teste antes de decidir. Cole um parágrafo de 30 palavras, renderize-o com três vozes e ouça pelos alto-falantes que o seu público vai usar. Os rótulos são a descrição do Google. A decisão final é dos seus ouvidos.
Mais de 70 idiomas e sotaques
O campo de idioma aceita mais de 70 idiomas, e muitos vêm em variantes regionais. Isso importa mais do que parece: o espanhol mexicano e o castelhano diferem em vocabulário e ritmo, e o ouvinte percebe em uma frase.
Idioma
Códigos disponíveis
Inglês
en-US, en-GB, en-AU, en-IN
Espanhol
es-ES, es-MX, es-419
Francês
fr-FR, fr-CA
Português
pt-BR, pt-PT
Chinês
cmn-CN, cmn-tw
Árabe
ar-001, ar-EG
O fluxo de trabalho é simples. Escreva o roteiro no idioma de destino, defina o código correspondente e mantenha a voz. Na maioria dos casos, uma só voz consegue ler todos os idiomas da lista, então você mantém um mesmo som de marca em vários mercados. Outros códigos populares incluem de-DE, it-IT, ja-JP, ko-KR, hi-IN, tr-TR, pl-PL, nl-NL, sv-SE e vi-VN.
Idiomas menos comuns na lista
Além dos grandes mercados, a lista chega a cebuano (ceb-PH), crioulo haitiano (ht-HT), javanês (jv-JV), malgaxe (mg-MG), maithili (mai-IN), concani (kok-IN), sindi (sd-IN), basco (eu-ES), galego (gl-ES) e até latim (la-VA). A qualidade não será idêntica em todos eles, então peça a um falante nativo que revise qualquer conteúdo voltado ao cliente. Antes de localizar um curso inteiro, gere uma amostra de 20 segundos no idioma de destino com duas vozes e envie para um falante nativo com três perguntas: os nomes soam corretos, o ritmo parece natural e o sotaque corresponde à região que você pretende atingir? Se siglas confundirem o modelo, escreva-as foneticamente no roteiro. Se a sua fonte for um vídeo pronto, e não um roteiro, o ElevenLabs Dubbing traduz para mais de 90 idiomas na mesma plataforma.
Tags e prompts de estilo
Duas alavancas moldam a interpretação. As tags atuam sobre frases isoladas, e o prompt de estilo define o clima de toda a gravação.
Tags em linha para frases isoladas
As tags vão entre colchetes dentro do roteiro. A página do modelo lista [sigh], [laughing], [whispering], [shouting] e [extremely fast], e as amostras publicadas mostram que tags descritivas também funcionam. Uma delas começa com [like dracula] na voz Algenib. Outra usa [laughs] I did NOT expect that. [sigh] Can you believe it! na Callirrhoe.
Tag
O que esperar
[whispering]
Voz baixa, perto do microfone
[laughing]
Uma risada audível antes ou dentro da frase
[shouting]
Volume elevado e urgência
[sigh]
Um suspiro de cansaço ou alívio
[extremely fast]
Um ritmo rápido e comprimido
Prompts de estilo para gravações inteiras
O campo prompt aceita linguagem simples de até 4.000 bytes. Instruções curtas como "Say this in a calm, professional tone" ou "Speak with excitement and energy" já mudam o resultado. Instruções mais longas constroem uma cena: "You are having a casual conversation with a friend. Say the following in a friendly and amused way." Essa segunda forma é a que a amostra publicada com a Callirrhoe usa.
Veja como as duas alavancas se combinam em um anúncio de produto, narrado com a Puck. O prompt diz "Speak like a friendly presenter on a morning show, upbeat but not rushed." O roteiro diz Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! O prompt define o teto de energia, o sussurro cria um momento de intimidade, e o grito soa mais forte porque vem depois de uma frase tranquila. O contraste é o que torna as tags audíveis.
💡 Uma emoção por frase. Empilhar três tags em uma linha gera confusão. Coloque uma tag, ouça e então decida se a frase precisa de outra.
Quanto o Gemini TTS realmente custa
O áudio é cobrado em tokens, e a página de preços do Google explica a conversão: 25 tokens de áudio por segundo. Todo o resto decorre desse número.
Um minuto de fala são 60 segundos vezes 25 tokens, ou seja, 1.500 tokens de saída. A US$ 20,00 por milhão, isso dá 1.500 vezes 20 dividido por 1.000.000, ou US$ 0,03 por minuto. O texto que você envia quase não conta: 150 palavras faladas equivalem a cerca de 200 tokens de entrada, aproximadamente US$ 0,0002.
Duração do áudio
3.1 Flash padrão
3.1 Flash em lote
2.5 Flash padrão
1 minuto
US$ 0,03
US$ 0,015
US$ 0,015
10 minutos
US$ 0,30
US$ 0,15
US$ 0,15
1 hora
US$ 1,80
US$ 0,90
US$ 0,90
10 horas
US$ 18,00
US$ 9,00
US$ 9,00
Camada gratuita e descontos em lote
O Google oferece camada gratuita para os dois modelos Flash, enquanto o Pro é apenas pago. Os limites de uso da camada gratuita mudam, então confirme-os na página de preços antes de montar um plano de lançamento em cima deles. O modo em lote, isto é, tarefas assíncronas que terminam depois, reduz as duas tarifas pela metade. Isso o torna a escolha óbvia para audiolivros, bibliotecas de cursos ou qualquer acervo que você possa gerar durante a noite.
Um exemplo prático deixa isso concreto. Suponha que você narre um curso com 20 aulas de 8 minutos cada. São 160 minutos de áudio, que custam 160 vezes US$ 0,03, ou US$ 4,80, na tarifa padrão do 3.1 Flash, e US$ 2,40 em lote. Se estender para 100 aulas, você chega a US$ 24,00 no padrão ou US$ 12,00 em lote. Regravar uma aula depois de uma mudança no roteiro custa cerca de 24 centavos, e essa é a vantagem real: editar áudio deixa de ser um problema de agenda.
💡 Regra prática de orçamento. Multiplique os minutos de áudio finalizados por US$ 0,03 para a tarifa padrão do 3.1 Flash. A metade disso para o lote. Essas tarifas vêm de modelos de prévia, então confira-as de novo ao escalar.
Como chamar a API do Gemini TTS
Com o SDK de Python, uma solicitação de TTS é uma chamada generate_content comum com duas mudanças: uma modalidade de resposta de áudio e uma configuração de fala que nomeia a voz.
Um exemplo mínimo em Python
from google import genai
from google.genai import types
import wave
client = genai.Client() # reads your credentials from the environment
response = client.models.generate_content(
model="gemini-3.1-flash-tts-preview",
contents="Say warmly: Welcome back. Today we compare three voices.",
config=types.GenerateContentConfig(
response_modalities=["AUDIO"],
speech_config=types.SpeechConfig(
voice_config=types.VoiceConfig(
prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
)
),
),
)
pcm = response.candidates[0].content.parts[0].inline_data.data
with wave.open("welcome.wav", "wb") as f:
f.setnchannels(1)
f.setsampwidth(2)
f.setframerate(24000)
f.writeframes(pcm)
Alguns detalhes economizam tempo de depuração:
As credenciais ficam fora do arquivo. O cliente as lê de uma variável de ambiente, então nada secreto fica no seu repositório.
A instrução de estilo faz parte do texto do prompt. "Say warmly:" antes do roteiro faz o mesmo papel que o campo prompt do PicassoIA.
A saída é PCM bruto. Ela chega como áudio de 24 kHz, mono, 16 bits. O módulo wave envolve esse conteúdo em um arquivo WAV reproduzível, e o ffmpeg converte para MP3 se você precisar de arquivos menores.
Os nomes dos campos mudam nos modelos de prévia. Consulte a referência atual do Google se uma chamada falhar depois de uma atualização do SDK.
Dois falantes em uma chamada
A API aceita até dois falantes em uma única solicitação. Identifique as falas no roteiro, por exemplo "Host:" e "Guest:", e depois associe cada rótulo a uma voz na configuração de fala. É um caminho rápido para diálogos em estilo podcast ou para um FAQ com duas vozes. Combine uma voz firme com uma animada para que o ouvinte distinga as trocas de fala sem precisar de imagem. Para três ou mais vozes, gere as falas de cada locutor separadamente e una-as em um editor de áudio.
Para roteiros longos, divida por parágrafo, envie os blocos um de cada vez e guarde em cache todos os resultados. Assim, uma solicitação que falha custa um parágrafo, e não o capítulo inteiro. Modelos de prévia costumam ter limites de uso mais apertados do que os estáveis, então envolva as chamadas em uma nova tentativa com recuo exponencial. Registre a voz, o código do idioma e um hash do roteiro junto de cada arquivo, e você poderá gerar qualquer trecho depois com as mesmas configurações.
Experimente o Gemini TTS no seu navegador
Se você precisa de apenas alguns trechos, dispense o código. A página do modelo no PicassoIA apresenta o Gemini 3.1 Flash TTS como gratuito para testar online, sem configuração, e cada campo corresponde às opções da API acima.
Cole seu roteiro em Text. O limite é de 4.000 bytes, o bastante para uma explicação curta. Ele conta bytes, não caracteres, então roteiros em japonês ou árabe cabem menos caracteres do que em inglês.
Escolha uma Voice. Comece com a Kore e depois teste outras duas.
Defina o Language code que corresponde ao seu roteiro, como es-MX para espanhol mexicano.
Escreva um Prompt descrevendo tom e ritmo, ou deixe o padrão "Say the following." para uma leitura neutra.
Adicione tags como [whispering] onde quiser emoção, clique em gerar e baixe o áudio.
Para peças mais longas, divida o roteiro por seção e una os arquivos depois.
Configurações que valem a pena mudar
Campo
Padrão
Dica
Text
Nenhum
Até 4.000 bytes. Use tags com moderação
Voice
Kore
30 opções. Teste três antes de escolher
Prompt
Say the following.
Até 4.000 bytes. Defina tom, ritmo e sotaque
Language code
en-US
Corresponda ao idioma em que o roteiro está escrito
💡 Uma gravação sem vida geralmente significa um prompt curto. Aumente o prompt, não o roteiro. Diga quem está falando, para quem e por quê, e o ritmo e a ênfase tendem a acompanhar.
Combine com música e transcrições
A fala raramente é o projeto inteiro. Para uma trilha de fundo, experimente o Lyria 3 ou o Music 2.6 e misture-a discretamente por baixo da narração. Para legendas, rode o áudio no Gemini 3 Pro ou no GPT 4o Transcribe.
A transcrição também funciona como controle de qualidade. Transcreva a narração gerada e compare com o roteiro. Nomes de produtos pronunciados errado e palavras puladas aparecem como diferenças no texto muito antes de um ouvinte reclamar.
Faça sua primeira narração
O Gemini TTS se destaca em alguns trabalhos: narração de demonstrações de produto, aberturas de podcast e leituras de anúncios, versões em áudio de artigos e newsletters, vídeos de treinamento com tom consistente e trilhas multilíngues criadas a partir de um só roteiro. Se o seu projeto precisa de outro som, três outros modelos da mesma categoria valem um teste: o MiniMax Speech 2.8 HD para narrações com qualidade de estúdio, o ElevenLabs V3 para narração natural e o Inworld Realtime TTS 2 quando a velocidade de resposta é o que mais importa. Uma limitação a mais que vale conhecer: tanto a API quanto a página do PicassoIA trabalham com as 30 vozes predefinidas. Se você precisa de uma voz que soe como você ou como a sua marca, teste o MiniMax Voice Cloning ou o Qwen3 TTS.
A forma mais rápida de resolver a questão da voz é ouvi-la. Pegue um parágrafo do seu próprio projeto, abra o Gemini 3.1 Flash TTS no PicassoIA e gere-o com três vozes. Adicione uma tag [whispering], troque o código do idioma para ver como seu roteiro soa em um segundo mercado e compare os trechos lado a lado. Em dez minutos você vai saber qual voz é a sua, e pode testar o mesmo fluxo com modelos de música e transcrição no PicassoIA sempre que o projeto crescer.