Gemini TTS: vozes, preços, API e idiomas explicados

O Gemini TTS transforma um roteiro em fala com 30 vozes predefinidas, mais de 70 idiomas e tags expressivas como sussurrar e rir. Este artigo detalha cada voz por tom, a conta real de tokens por trás do preço, uma chamada de API em Python que funciona e uma rota no navegador que não exige configuração.

Gemini TTS: vozes, preços, API e idiomas explicados
Cristian Da Conceicao
Fundador do Picasso IA

Uma narração de um minuto feita com o Gemini TTS custa cerca de três centavos na tarifa padrão. Esse número único explica por que desenvolvedores, podcasters e criadores de cursos não param de perguntar sobre ele. Os modelos de fala do Google transformam um roteiro em áudio com 30 vozes nomeadas, dezenas de idiomas e um jeito simples, em linguagem comum, de dirigir a interpretação. O que os vídeos de demonstração não mostram é tudo o que decide se a ferramenta serve para o seu projeto: qual voz combina com cada tipo de trabalho, como a conta de tokens se soma, como é a chamada de API e onde estão os limites. Abaixo você encontra cada um desses pontos com números reais, um exemplo em Python que funciona e uma rota sem código que você pode testar no navegador em menos de um minuto.

O que o Gemini TTS realmente faz

O Gemini TTS é o lado de saída de fala dos modelos Gemini, do Google. Você envia texto mais uma instrução opcional, e o modelo devolve áudio em vez de mais texto. Os motores tradicionais de texto para fala aplicam a mesma entrega fixa a todas as frases. Um modelo Gemini TTS lê a instrução e o roteiro juntos, então "diga isto como uma enfermeira cansada de plantão noturno" muda o ritmo, a respiração e o tom, não só a altura da voz.

Um apresentador de podcast de moletom cinza falando em um microfone de braço articulado em um estúdio caseiro acolhedor

Do texto ao áudio falado

Toda solicitação tem os mesmos três ingredientes: um roteiro, uma voz e uma instrução de estilo. A página do Gemini 3.1 Flash TTS no Picasso IA expõe esses itens em quatro campos: text, voice, prompt e language_code. Os padrões são a voz Kore, o idioma en-US e o prompt "Say the following.". Clique em gerar e um arquivo de áudio pronto chega em segundos. As duas amostras publicadas na página do modelo levaram cerca de 6,5 e 4,0 segundos. Um ciclo tão curto muda a forma de trabalhar: reescreva uma linha, gere de novo e compare as versões como faria com um narrador humano, sem a taxa de reserva nem as horas de estúdio.

Versões do modelo em uso

O Google lança mais de um modelo de TTS, e a escolha muda a sua conta:

  • Gemini 3.1 Flash TTS (prévia): cotado em US$ 1,00 por milhão de tokens de entrada de texto e US$ 20,00 por milhão de tokens de saída de áudio.
  • Gemini 2.5 Flash Preview TTS: exatamente metade do preço do 3.1 Flash nos dois lados.
  • Gemini 2.5 Pro Preview TTS: as mesmas tarifas do 3.1 Flash, sem camada gratuita.

Qual escolher? Opte pelo 3.1 Flash quando quiser o controle de interpretação mais recente. Opte pelo 2.5 Flash quando for narrar milhares de textos curtos, como notificações de aplicativos, em que a metade do preço faz diferença rápido. Escolha o 2.5 Pro apenas se preferir o resultado dele, já que custa o mesmo que o 3.1 Flash e não tem camada gratuita.

A documentação de fala do Google também lista modelos TTS mais novos das linhas Flash e Flash Lite. As tarifas deles não estavam na tabela de preços quando este artigo foi escrito, então confira a tabela antes de montar um orçamento com base neles.

As 30 vozes, organizadas por tom

O Gemini TTS traz 30 vozes predefinidas com nomes emprestados da astronomia e da mitologia. O Google atribui a cada uma um rótulo de uma palavra, como "Bright" ou "Firm", e esses rótulos são o atalho mais rápido para escolher. Trate-os como ponto de partida, porque um prompt de estilo pode deixar qualquer voz mais calorosa, mais rápida ou mais neutra.

Close-up de cima das mãos de um engenheiro de som sobre uma mesa de mixagem com faders de alumínio escovado

Animadas e vibrantes

Sete vozes têm perfil energético: Zephyr (Bright), Puck (Upbeat), Autonoe (Bright), Laomedeia (Upbeat), Sadachbia (Lively), Fenrir (Excitable) e Leda (Youthful). Use-as em anúncios, vídeos curtos para redes sociais, tours de integração e conteúdo infantil, em qualquer lugar onde o ouvinte deva sentir impulso no primeiro segundo.

Calorosas e suaves

Seis vozes ficam do lado mais suave: Sulafat (Warm), Achird (Friendly), Vindemiatrix (Gentle), Achernar (Soft), Enceladus (Breathy) e Aoede (Breezy). Elas combinam com roteiros de meditação, histórias para dormir, aplicativos de bem-estar e mensagens de atendimento ao cliente.

Firmes e claras

Dez vozes transmitem autoridade: Kore (Firm), Orus (Firm), Alnilam (Firm), Iapetus (Clear), Erinome (Clear), Charon (Informative), Rasalgethi (Informative), Sadaltager (Knowledgeable), Schedar (Even) e Pulcherrima (Forward). A Kore é o padrão por um motivo: funciona bem em tutoriais, explicações e demonstrações de produto sem soar rígida.

As outras sete preenchem as lacunas. Algieba, Despina, Callirrhoe, Umbriel e Zubenelgenubi são suaves, tranquilas ou casuais, o que combina com conversas. Algenib (Gravelly) e Gacrux (Mature) trazem textura para personagens e narrativas.

TrabalhoVozes para testar primeiro
Demonstração de produtoKore, Charon, Sadaltager
Abertura de podcastPuck, Fenrir, Algenib
MeditaçãoVindemiatrix, Achernar, Enceladus
Anúncio em redes sociaisZephyr, Sadachbia, Leda
Narração de audiolivroGacrux, Schedar, Sulafat

💡 Teste antes de decidir. Cole um parágrafo de 30 palavras, renderize-o com três vozes e ouça pelos alto-falantes que o seu público vai usar. Os rótulos são a descrição do Google. A decisão final é dos seus ouvidos.

Mais de 70 idiomas e sotaques

O campo de idioma aceita mais de 70 idiomas, e muitos vêm em variantes regionais. Isso importa mais do que parece: o espanhol mexicano e o castelhano diferem em vocabulário e ritmo, e o ouvinte percebe em uma frase.

Cinco colegas em volta de uma mesa de carvalho em um escritório de tradução iluminado, comparando roteiros em idiomas diferentes

IdiomaCódigos disponíveis
Inglêsen-US, en-GB, en-AU, en-IN
Espanholes-ES, es-MX, es-419
Francêsfr-FR, fr-CA
Portuguêspt-BR, pt-PT
Chinêscmn-CN, cmn-tw
Árabear-001, ar-EG

O fluxo de trabalho é simples. Escreva o roteiro no idioma de destino, defina o código correspondente e mantenha a voz. Na maioria dos casos, uma só voz consegue ler todos os idiomas da lista, então você mantém um mesmo som de marca em vários mercados. Outros códigos populares incluem de-DE, it-IT, ja-JP, ko-KR, hi-IN, tr-TR, pl-PL, nl-NL, sv-SE e vi-VN.

Idiomas menos comuns na lista

Além dos grandes mercados, a lista chega a cebuano (ceb-PH), crioulo haitiano (ht-HT), javanês (jv-JV), malgaxe (mg-MG), maithili (mai-IN), concani (kok-IN), sindi (sd-IN), basco (eu-ES), galego (gl-ES) e até latim (la-VA). A qualidade não será idêntica em todos eles, então peça a um falante nativo que revise qualquer conteúdo voltado ao cliente. Antes de localizar um curso inteiro, gere uma amostra de 20 segundos no idioma de destino com duas vozes e envie para um falante nativo com três perguntas: os nomes soam corretos, o ritmo parece natural e o sotaque corresponde à região que você pretende atingir? Se siglas confundirem o modelo, escreva-as foneticamente no roteiro. Se a sua fonte for um vídeo pronto, e não um roteiro, o ElevenLabs Dubbing traduz para mais de 90 idiomas na mesma plataforma.

Tags e prompts de estilo

Duas alavancas moldam a interpretação. As tags atuam sobre frases isoladas, e o prompt de estilo define o clima de toda a gravação.

Close-up de um ator sussurrando em um filtro antipop dentro de uma cabine de voz, com um roteiro cheio de anotações

Tags em linha para frases isoladas

As tags vão entre colchetes dentro do roteiro. A página do modelo lista [sigh], [laughing], [whispering], [shouting] e [extremely fast], e as amostras publicadas mostram que tags descritivas também funcionam. Uma delas começa com [like dracula] na voz Algenib. Outra usa [laughs] I did NOT expect that. [sigh] Can you believe it! na Callirrhoe.

TagO que esperar
[whispering]Voz baixa, perto do microfone
[laughing]Uma risada audível antes ou dentro da frase
[shouting]Volume elevado e urgência
[sigh]Um suspiro de cansaço ou alívio
[extremely fast]Um ritmo rápido e comprimido

Prompts de estilo para gravações inteiras

O campo prompt aceita linguagem simples de até 4.000 bytes. Instruções curtas como "Say this in a calm, professional tone" ou "Speak with excitement and energy" já mudam o resultado. Instruções mais longas constroem uma cena: "You are having a casual conversation with a friend. Say the following in a friendly and amused way." Essa segunda forma é a que a amostra publicada com a Callirrhoe usa.

Veja como as duas alavancas se combinam em um anúncio de produto, narrado com a Puck. O prompt diz "Speak like a friendly presenter on a morning show, upbeat but not rushed." O roteiro diz Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! O prompt define o teto de energia, o sussurro cria um momento de intimidade, e o grito soa mais forte porque vem depois de uma frase tranquila. O contraste é o que torna as tags audíveis.

💡 Uma emoção por frase. Empilhar três tags em uma linha gera confusão. Coloque uma tag, ouça e então decida se a frase precisa de outra.

Quanto o Gemini TTS realmente custa

O áudio é cobrado em tokens, e a página de preços do Google explica a conversão: 25 tokens de áudio por segundo. Todo o resto decorre desse número.

Um criador freelancer fazendo as contas do orçamento em um caderno, ao lado de um notebook e de uma calculadora solar

ModeloEntrada de texto por 1M de tokensSaída de áudio por 1M de tokensCamada gratuita
Gemini 3.1 Flash TTS PreviewUS$ 1,00US$ 20,00Sim
Gemini 2.5 Flash Preview TTSUS$ 0,50US$ 10,00Sim
Gemini 2.5 Pro Preview TTSUS$ 1,00US$ 20,00Não

A conta de tokens em números simples

Um minuto de fala são 60 segundos vezes 25 tokens, ou seja, 1.500 tokens de saída. A US$ 20,00 por milhão, isso dá 1.500 vezes 20 dividido por 1.000.000, ou US$ 0,03 por minuto. O texto que você envia quase não conta: 150 palavras faladas equivalem a cerca de 200 tokens de entrada, aproximadamente US$ 0,0002.

Duração do áudio3.1 Flash padrão3.1 Flash em lote2.5 Flash padrão
1 minutoUS$ 0,03US$ 0,015US$ 0,015
10 minutosUS$ 0,30US$ 0,15US$ 0,15
1 horaUS$ 1,80US$ 0,90US$ 0,90
10 horasUS$ 18,00US$ 9,00US$ 9,00

Camada gratuita e descontos em lote

O Google oferece camada gratuita para os dois modelos Flash, enquanto o Pro é apenas pago. Os limites de uso da camada gratuita mudam, então confirme-os na página de preços antes de montar um plano de lançamento em cima deles. O modo em lote, isto é, tarefas assíncronas que terminam depois, reduz as duas tarifas pela metade. Isso o torna a escolha óbvia para audiolivros, bibliotecas de cursos ou qualquer acervo que você possa gerar durante a noite.

Um exemplo prático deixa isso concreto. Suponha que você narre um curso com 20 aulas de 8 minutos cada. São 160 minutos de áudio, que custam 160 vezes US$ 0,03, ou US$ 4,80, na tarifa padrão do 3.1 Flash, e US$ 2,40 em lote. Se estender para 100 aulas, você chega a US$ 24,00 no padrão ou US$ 12,00 em lote. Regravar uma aula depois de uma mudança no roteiro custa cerca de 24 centavos, e essa é a vantagem real: editar áudio deixa de ser um problema de agenda.

💡 Regra prática de orçamento. Multiplique os minutos de áudio finalizados por US$ 0,03 para a tarifa padrão do 3.1 Flash. A metade disso para o lote. Essas tarifas vêm de modelos de prévia, então confira-as de novo ao escalar.

Como chamar a API do Gemini TTS

Com o SDK de Python, uma solicitação de TTS é uma chamada generate_content comum com duas mudanças: uma modalidade de resposta de áudio e uma configuração de fala que nomeia a voz.

Vista por cima do ombro de um desenvolvedor digitando ao lado de um monitor com um editor de código escuro

Um exemplo mínimo em Python

from google import genai
from google.genai import types
import wave

client = genai.Client()  # reads your credentials from the environment

response = client.models.generate_content(
    model="gemini-3.1-flash-tts-preview",
    contents="Say warmly: Welcome back. Today we compare three voices.",
    config=types.GenerateContentConfig(
        response_modalities=["AUDIO"],
        speech_config=types.SpeechConfig(
            voice_config=types.VoiceConfig(
                prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
            )
        ),
    ),
)

pcm = response.candidates[0].content.parts[0].inline_data.data

with wave.open("welcome.wav", "wb") as f:
    f.setnchannels(1)
    f.setsampwidth(2)
    f.setframerate(24000)
    f.writeframes(pcm)

Alguns detalhes economizam tempo de depuração:

  • As credenciais ficam fora do arquivo. O cliente as lê de uma variável de ambiente, então nada secreto fica no seu repositório.
  • A instrução de estilo faz parte do texto do prompt. "Say warmly:" antes do roteiro faz o mesmo papel que o campo prompt do PicassoIA.
  • A saída é PCM bruto. Ela chega como áudio de 24 kHz, mono, 16 bits. O módulo wave envolve esse conteúdo em um arquivo WAV reproduzível, e o ffmpeg converte para MP3 se você precisar de arquivos menores.
  • Os nomes dos campos mudam nos modelos de prévia. Consulte a referência atual do Google se uma chamada falhar depois de uma atualização do SDK.

Dois falantes em uma chamada

A API aceita até dois falantes em uma única solicitação. Identifique as falas no roteiro, por exemplo "Host:" e "Guest:", e depois associe cada rótulo a uma voz na configuração de fala. É um caminho rápido para diálogos em estilo podcast ou para um FAQ com duas vozes. Combine uma voz firme com uma animada para que o ouvinte distinga as trocas de fala sem precisar de imagem. Para três ou mais vozes, gere as falas de cada locutor separadamente e una-as em um editor de áudio.

Para roteiros longos, divida por parágrafo, envie os blocos um de cada vez e guarde em cache todos os resultados. Assim, uma solicitação que falha custa um parágrafo, e não o capítulo inteiro. Modelos de prévia costumam ter limites de uso mais apertados do que os estáveis, então envolva as chamadas em uma nova tentativa com recuo exponencial. Registre a voz, o código do idioma e um hash do roteiro junto de cada arquivo, e você poderá gerar qualquer trecho depois com as mesmas configurações.

Experimente o Gemini TTS no seu navegador

Se você precisa de apenas alguns trechos, dispense o código. A página do modelo no PicassoIA apresenta o Gemini 3.1 Flash TTS como gratuito para testar online, sem configuração, e cada campo corresponde às opções da API acima.

Um criador de conteúdo digitando um roteiro em um notebook em um espaço de trabalho iluminado, com fones de ouvido pendurados no pescoço

Passo a passo no navegador

  1. Abra a página do Gemini 3.1 Flash TTS no PicassoIA.
  2. Cole seu roteiro em Text. O limite é de 4.000 bytes, o bastante para uma explicação curta. Ele conta bytes, não caracteres, então roteiros em japonês ou árabe cabem menos caracteres do que em inglês.
  3. Escolha uma Voice. Comece com a Kore e depois teste outras duas.
  4. Defina o Language code que corresponde ao seu roteiro, como es-MX para espanhol mexicano.
  5. Escreva um Prompt descrevendo tom e ritmo, ou deixe o padrão "Say the following." para uma leitura neutra.
  6. Adicione tags como [whispering] onde quiser emoção, clique em gerar e baixe o áudio.
  7. Para peças mais longas, divida o roteiro por seção e una os arquivos depois.

Configurações que valem a pena mudar

CampoPadrãoDica
TextNenhumAté 4.000 bytes. Use tags com moderação
VoiceKore30 opções. Teste três antes de escolher
PromptSay the following.Até 4.000 bytes. Defina tom, ritmo e sotaque
Language codeen-USCorresponda ao idioma em que o roteiro está escrito

💡 Uma gravação sem vida geralmente significa um prompt curto. Aumente o prompt, não o roteiro. Diga quem está falando, para quem e por quê, e o ritmo e a ênfase tendem a acompanhar.

Combine com música e transcrições

A fala raramente é o projeto inteiro. Para uma trilha de fundo, experimente o Lyria 3 ou o Music 2.6 e misture-a discretamente por baixo da narração. Para legendas, rode o áudio no Gemini 3 Pro ou no GPT 4o Transcribe.

Uma jornalista de óculos redondos transcrevendo uma entrevista em uma mesa de café, com notebook e gravador

A transcrição também funciona como controle de qualidade. Transcreva a narração gerada e compare com o roteiro. Nomes de produtos pronunciados errado e palavras puladas aparecem como diferenças no texto muito antes de um ouvinte reclamar.

Faça sua primeira narração

O Gemini TTS se destaca em alguns trabalhos: narração de demonstrações de produto, aberturas de podcast e leituras de anúncios, versões em áudio de artigos e newsletters, vídeos de treinamento com tom consistente e trilhas multilíngues criadas a partir de um só roteiro. Se o seu projeto precisa de outro som, três outros modelos da mesma categoria valem um teste: o MiniMax Speech 2.8 HD para narrações com qualidade de estúdio, o ElevenLabs V3 para narração natural e o Inworld Realtime TTS 2 quando a velocidade de resposta é o que mais importa. Uma limitação a mais que vale conhecer: tanto a API quanto a página do PicassoIA trabalham com as 30 vozes predefinidas. Se você precisa de uma voz que soe como você ou como a sua marca, teste o MiniMax Voice Cloning ou o Qwen3 TTS.

Uma mulher de cardigã mostarda ouvindo um audiolivro em um canto de leitura junto a uma janela com chuva

A forma mais rápida de resolver a questão da voz é ouvi-la. Pegue um parágrafo do seu próprio projeto, abra o Gemini 3.1 Flash TTS no PicassoIA e gere-o com três vozes. Adicione uma tag [whispering], troque o código do idioma para ver como seu roteiro soa em um segundo mercado e compare os trechos lado a lado. Em dez minutos você vai saber qual voz é a sua, e pode testar o mesmo fluxo com modelos de música e transcrição no PicassoIA sempre que o projeto crescer.

Compartilhe este artigo

Escolha seu idioma