Vozes TTS da OpenAI: amostras, opções e qual escolher

Treze vozes TTS da OpenAI, três modelos e nenhuma prévia de áudio. Este artigo compara cada voz, mostra qual modelo a suporta, traz um roteiro de teste para você ouvir todas por conta própria, detalha os custos reais e recomenda escolhas iniciais para narração, bots de suporte e vídeos curtos.

Vozes TTS da OpenAI: amostras, opções e qual escolher
Cristian Da Conceicao
Fundador do Picasso IA

Treze nomes de voz, três modelos e nenhuma prévia de áudio na página onde você precisa escolher uma. Esse é o primeiro obstáculo que a maioria dos desenvolvedores enfrenta com o endpoint de fala da OpenAI. Alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin e cedar parecem igualmente razoáveis em uma lista suspensa, mas não se comportam da mesma forma em todos os modelos e não vão soar igual no seu roteiro. Este artigo explica o que é cada uma das vozes TTS da OpenAI, qual modelo a suporta, como testar as treze em menos de dez minutos, como fica a conta e com qual voz começar para narração, bots de suporte e vídeos curtos. Ele também indica as ferramentas de fala do PicassoIA que ficam ao lado da oferta da OpenAI, incluindo uma com tutorial que você pode executar hoje.

O que a OpenAI TTS oferece de fato

A API de texto para fala da OpenAI transforma texto escrito em áudio falado por meio de um único endpoint. Você envia o nome de um modelo, o nome de uma voz e o seu texto, e recebe um arquivo de áudio de volta. O ponto que costuma confundir é que o modelo escolhido define quantas vozes você pode usar e quanto controle terá sobre a entrega.

Três modelos, três preços

ModeloVozesPreçoIdeal para
tts-19US$ 15 por 1 milhão de caracteresRascunhos rápidos e de baixo custo e reprodução ao vivo
tts-1-hd9US$ 30 por 1 milhão de caracteresÁudio de maior fidelidade, renderizado com antecedência
gpt-4o-mini-tts13US$ 0,60 por 1 milhão de tokens de texto de entrada, US$ 12 por 1 milhão de tokens de áudio de saídaTom, ritmo e sotaque controláveis por instruções

Os dois modelos mais antigos são cobrados pela contagem de caracteres. O gpt-4o-mini-tts é cobrado por tokens, o que significa que o seu custo acompanha a duração do áudio, e não o tamanho do roteiro.

Close de uma grade de microfone de estúdio prateado sobre uma mesa de madeira

Formatos de saída e streaming

O áudio volta em MP3 por padrão, com Opus, AAC, FLAC, WAV e PCM como alternativas. Cada um tem sua função:

  • MP3 é o padrão seguro para sites e podcasts.
  • Opus é adequado para streaming pela internet, porque o arquivo fica pequeno.
  • AAC funciona bem em celulares e editores de vídeo.
  • FLAC preserva tudo, o que importa se você pretende editar o arquivo depois.
  • WAV e PCM não são comprimidos, então são a escolha quando a latência importa mais que o tamanho do arquivo.

O endpoint pode transmitir o áudio enquanto ele é gerado, então a reprodução pode começar antes de o clipe inteiro ficar pronto. Isso faz diferença real em assistentes de voz, onde uma pausa de dois segundos parece uma ligação caindo.

As 13 vozes num relance

Vista de cima de uma mesa com treze canecas pequenas, fones de ouvido e um caderno

Nove vozes funcionam em todos os modelos. Outras quatro funcionam apenas no gpt-4o-mini-tts. Aqui está a lista completa, com uma nota sobre como ouvintes costumam descrever cada uma.

💡 Leia isto primeiro: a OpenAI não publica rótulos de personalidade para suas vozes, então a coluna "costuma ser descrita como" reflete o que desenvolvedores e ouvintes tendem a dizer, não uma especificação oficial. Trate-a como uma lista de candidatas e deixe que seus próprios ouvidos façam a escolha final.

As nove originais

VozCostuma ser descrita comoFunciona em
alloyNeutra, equilibrada, de uso geralOs três modelos
ashMais suave, levemente rouca, conversacionalOs três modelos
coralCalorosa, amigável, acessívelOs três modelos
echoClara, constante, objetivaOs três modelos
fableCom jeito de contadora de histórias, expressiva, frequentemente percebida como britânicaOs três modelos
novaBrilhante, enérgica, animadaOs três modelos
onyxGrave, autoritária, calmaOs três modelos
sageMedida, reflexiva, de ritmo uniformeOs três modelos
shimmerLeve, clara, suaveOs três modelos

Essas nove estão no mercado há mais tempo, por isso são as mais usadas e as que têm mais opiniões disponíveis. Se o seu produto já usa alloy ou nova, raramente há motivo para trocar, a menos que as novas vozes resolvam um problema específico.

As quatro vozes mais novas

VozCostuma ser descrita comoFunciona em
balladSuave, melódica, gentilSomente gpt-4o-mini-tts
verseExpressiva, dinâmica, animadaSomente gpt-4o-mini-tts
marinNatural, refinada, qualidade de pontaSomente gpt-4o-mini-tts
cedarNatural, firme, calorosaSomente gpt-4o-mini-tts

A própria documentação da OpenAI recomenda marin ou cedar para a melhor qualidade, o que as torna o primeiro teste natural de qualquer projeto novo. Como só funcionam no gpt-4o-mini-tts, escolhê-las também significa ter acesso ao campo de instruções, que é onde está a flexibilidade real.

Teste as vozes e ajuste a entrega

Uma mulher de fones de ouvido compara arquivos de áudio num notebook, com um roteiro impresso ao lado

Áudio não cabe dentro de uma página de texto, então o caminho mais rápido para amostras reais é gerá-las você mesmo. Treze clipes do mesmo roteiro levam alguns minutos e custam alguns centavos.

Um roteiro que expõe vozes fracas

Um bom roteiro de teste não é um parágrafo bonito. É um teste de estresse. Use algo assim:

Pedido 4.817 sai para entrega em 3 de março para o(a) Dr(a). Okonkwo, na Birchwood Lane, 22. Espera, você disse quinta-feira? Sinceramente, eu não esperava que a entrega chegasse antes, mas aqui estamos. Três coisas para lembrar: traga o recibo, confira o lacre e nos ligue se algo parecer estranho.

Ele reúne um número longo, uma data, um sobrenome difícil, uma pergunta, um leve momento emocional e uma lista. Vozes que soam ótimas numa frase isolada costumam tropeçar em pelo menos um desses pontos. Depois, rode este laço:

from openai import OpenAI
from pathlib import Path

client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
          "onyx", "sage", "shimmer", "verse", "marin", "cedar"]

for voice in voices:
    out = Path(f"sample_{voice}.mp3")
    with client.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice=voice,
        input=script,
        instructions="Speak clearly in a warm, even tone.",
    ) as response:
        response.stream_to_file(out)

Ouça com bons fones de ouvido e avalie cada clipe em quatro aspectos:

  1. Números e nomes: "4.817" sai como uma frase natural?
  2. A pergunta: a entonação sobe em "você disse quinta-feira?"
  3. Ritmo: as vírgulas soam como respiros ou como paradas?
  4. Cansaço: você aguentaria essa voz por dez minutos seguidos?

Instruções que mudam a leitura

No gpt-4o-mini-tts, um campo de instruções permite descrever em linguagem simples como a voz deve soar. A OpenAI observa que o modelo pode receber instruções sobre sotaque, variação emocional, entonação, imitações, velocidade, tom e sussurro. Os modelos mais antigos tts-1 e tts-1-hd não oferecem suporte a isso.

InstruçãoO que esperar
"Fale com um tom alegre e positivo."Uma leitura animada e amigável, boa para onboarding
"Calma, devagar, como uma história para dormir."Entrega mais suave, com pausas mais longas
"Profissional e conciso, como um apresentador de telejornal."Ritmo mais firme, emoção mais contida
"Sussurre a última frase."Um final em voz baixa para efeito dramático
"Soe pedindo desculpas, mas confiante."Útil para roteiros de suporte sobre atrasos

💡 Dica: mantenha as instruções curtas e concretas. Uma frase clara costuma vencer um parágrafo cheio de adjetivos, e alterar uma instrução por vez deixa evidente o que mudou o resultado.

Qual voz serve para cada tarefa

A tabela abaixo é um conjunto de pontos de partida para testar, não regras. As vozes são subjetivas, e o seu roteiro importa mais do que qualquer rótulo.

TarefaPrimeira escolhaAlternativa
Audiolivros e leituras longascedarsage
Suporte e bots de telefonemarincoral
Demonstrações de produtoalloyecho
Anúncios e clipes curtosnovaverse
Meditação e conteúdo calmoballadshimmer

Narração e leituras longas

Um senhor mais velho ouve um audiolivro numa poltrona ao lado de um abajur

Ouvir por muito tempo penaliza vozes com personalidade forte. Uma voz brilhante que encanta por quinze segundos pode cansar no décimo minuto. Para narração, escolha algo uniforme e sem pressa e use instruções para acrescentar calor. Divida o manuscrito nas quebras de parágrafo, porque cada requisição tem um limite de tamanho de entrada e trechos menores dão à voz um novo começo. Consulte a referência atual da API para saber o limite exato.

Assistentes e bots de suporte

Um atendente de suporte de headset fala diante de uma configuração com dois monitores em um escritório iluminado

Para um bot, as características decisivas são clareza e um tom crível sob leve pressão. Teste sua voz com as piores mensagens que você envia: reembolsos, atrasos, interrupções. Uma voz que soa animada ao dar más notícias parece insensível, então inclua instruções como "calma e sincera" em cada requisição. Combine isso com streaming para que as respostas comecem rápido.

Anúncios e clipes curtos

Um jovem grava um vídeo vertical numa cozinha, com o celular num tripé

Clipes curtos recompensam energia. Aposte em nova ou verse, acrescente uma instrução como "animado, rápido, conversacional" e mantenha as frases curtas para que a entrega nunca precise correr. Renderize duas ou três versões e escolha pelo ouvido, já que a diferença entre uma boa e uma ótima take costuma ser um único adjetivo trocado.

Custos e limites em números reais

Vista de cima de um livro-caixa, uma calculadora e faturas sobre uma mesa de madeira

Por caractere ou por token

Um manuscrito de 10.000 palavras tem cerca de 60.000 caracteres e aproximadamente 67 minutos de fala em ritmo natural. Para o gpt-4o-mini-tts, a estimativa de lançamento da OpenAI foi de cerca de 1,5 centavo de dólar por minuto de áudio, e é assim que a última linha da tabela abaixo é calculada.

ModeloCusto aproximado para 10.000 palavras
tts-1Cerca de US$ 0,90
tts-1-hdCerca de US$ 1,80
gpt-4o-mini-ttsCerca de US$ 1,00

Esses valores são pequenos o suficiente para que a qualidade da voz, e não o preço, decida o modelo. O custo maior é o seu tempo refazendo renderizações que erraram o tom, e isso é mais um argumento a favor do campo de instruções.

Suporte a idiomas

A OpenAI lista suporte a mais de 50 idiomas, do africâner e árabe ao tcheco, dinamarquês e holandês, com a observação de que as vozes estão atualmente otimizadas para o inglês. Na prática, um roteiro em outro idioma funciona, mas o sotaque pode se afastar da fonética inglesa. Teste cada idioma que você publicar e peça a um falante nativo que ouça antes do lançamento.

Divulgação e vozes personalizadas

As políticas de uso da OpenAI exigem que os usuários finais sejam informados com clareza de que a voz que estão ouvindo é gerada por IA e não é humana. Coloque essa informação no próprio produto, não nas letras miúdas. Vozes personalizadas existem, mas dependem de um processo separado, que exige gravações de consentimento do locutor e amostras de áudio. Por isso, planeje um prazo de antecedência se quiser uma voz de marca.

Alternativas no PicassoIA

O PicassoIA não lista os modelos de fala da OpenAI. O que ele oferece é um conjunto amplo de outros motores na categoria Generate speech, além de ferramentas para as duas tarefas que cercam o trabalho com voz: conferir o resultado e acrescentar som por baixo dele.

Outros motores de fala

ModeloDestaque
Gemini 3.1 Flash TTS30 vozes, mais de 70 códigos de idioma, prompts de estilo e marcações expressivas
MiniMax Speech 2.8 HDLocuções com qualidade de estúdio
ElevenLabs V3Narrações de IA naturais e expressivas
Inworld TTS 1.5 MaxLocuções rápidas em 15 idiomas
ChatterboxClonagem de voz com controle de emoção
Qwen3 TTSClone uma voz ou crie a sua

Conferir o resultado com transcrição

Uma forma rápida de pegar nomes pronunciados errado é passar o áudio gerado de volta por fala para texto e comparar com o roteiro. GPT-4o Transcribe e GPT-4o Mini Transcribe fazem isso bem, e o Gemini 3 Pro é uma terceira opinião sólida. Se a transcrição deixar de fora ou trocar uma palavra, provavelmente um ouvinte ouviu a mesma coisa.

Adicione música por baixo da voz

Um produtor musical ajusta um fader numa grande mesa de mixagem em um estúdio caseiro com pouca luz

Uma locução sem base por baixo pode soar seca. Gere uma faixa na categoria Generate music e mixe-a em volume baixo atrás da narração. ElevenLabs Music, MiniMax Music 2.6, Lyria 3 Pro e Stable Audio 2.5 transformam um prompt de texto em faixa. Peça algo como "instrumental suave, sem vocais, andamento constante" para que nada concorra com as palavras.

Use o Gemini 3.1 Flash TTS no PicassoIA

Um notebook, um pequeno microfone condensador e um caderno com uma lista de vozes escrita à mão sobre uma mesa clara

Como as vozes da OpenAI não são hospedadas ali, o equivalente mais próximo é o Gemini 3.1 Flash TTS, que oferece um fluxo de trabalho parecido com uma lista de vozes maior. Veja como executá-lo:

  1. Abra a página do modelo e encontre o formulário de entrada.
  2. Cole seu roteiro no campo Text. O limite é de 4.000 bytes, então divida roteiros mais longos.
  3. Escolha uma voz entre as 30 opções. A padrão é Kore, e nomes como Puck, Charon, Fenrir, Aoede e Zephyr são bons pontos de partida.
  4. Escreva um prompt de estilo no campo Prompt. O padrão é "Say the following." Substitua por algo como "Fale devagar, com confiança" ou "Use um tom calmo e amigável".
  5. Defina o código de idioma. O padrão é en-US, e há mais de 70 códigos disponíveis.
  6. Gere, ouça e ajuste. Mude uma coisa por execução para saber o que causou a diferença.
ConfiguraçãoDica
Marcações de textoAdicione [whispering], [laughing], [shouting], [sigh] ou [extremely fast] logo antes da frase que deve afetar
PromptDescreva ritmo, tom e sotaque em uma frase
VozTeste três vozes no mesmo parágrafo antes de se decidir
Código de idiomaCombine com o idioma do roteiro, não com o seu

💡 Dica: passe o clipe final pelo GPT-4o Transcribe para confirmar que cada nome e número saiu como escrito.

Experimente você mesmo no Picasso IA

Escolher entre as vozes TTS da OpenAI é um trabalho de escuta, e a forma mais rápida de ficar melhor nisso é gerar clipes e compará-los. Pegue o roteiro de teste acima, rode-o pelas treze vozes e depois rode o mesmo roteiro no Gemini 3.1 Flash TTS e no MiniMax Speech 2.8 HD no Picasso IA. Adicione uma base musical suave, confira a transcrição e fique com a voz que ainda soa certa na décima audição. Abra o Picasso IA, cole seu próprio roteiro e comece com uma voz e uma instrução. Sua primeira locução utilizável está mais perto do que o menu suspenso faz parecer.

Compartilhe este artigo

Escolha seu idioma