Vozes TTS da OpenAI: amostras, opções e qual escolher
Treze vozes TTS da OpenAI, três modelos e nenhuma prévia de áudio. Este artigo compara cada voz, mostra qual modelo a suporta, traz um roteiro de teste para você ouvir todas por conta própria, detalha os custos reais e recomenda escolhas iniciais para narração, bots de suporte e vídeos curtos.
Treze nomes de voz, três modelos e nenhuma prévia de áudio na página onde você precisa escolher uma. Esse é o primeiro obstáculo que a maioria dos desenvolvedores enfrenta com o endpoint de fala da OpenAI. Alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin e cedar parecem igualmente razoáveis em uma lista suspensa, mas não se comportam da mesma forma em todos os modelos e não vão soar igual no seu roteiro. Este artigo explica o que é cada uma das vozes TTS da OpenAI, qual modelo a suporta, como testar as treze em menos de dez minutos, como fica a conta e com qual voz começar para narração, bots de suporte e vídeos curtos. Ele também indica as ferramentas de fala do PicassoIA que ficam ao lado da oferta da OpenAI, incluindo uma com tutorial que você pode executar hoje.
O que a OpenAI TTS oferece de fato
A API de texto para fala da OpenAI transforma texto escrito em áudio falado por meio de um único endpoint. Você envia o nome de um modelo, o nome de uma voz e o seu texto, e recebe um arquivo de áudio de volta. O ponto que costuma confundir é que o modelo escolhido define quantas vozes você pode usar e quanto controle terá sobre a entrega.
Três modelos, três preços
Modelo
Vozes
Preço
Ideal para
tts-1
9
US$ 15 por 1 milhão de caracteres
Rascunhos rápidos e de baixo custo e reprodução ao vivo
tts-1-hd
9
US$ 30 por 1 milhão de caracteres
Áudio de maior fidelidade, renderizado com antecedência
gpt-4o-mini-tts
13
US$ 0,60 por 1 milhão de tokens de texto de entrada, US$ 12 por 1 milhão de tokens de áudio de saída
Tom, ritmo e sotaque controláveis por instruções
Os dois modelos mais antigos são cobrados pela contagem de caracteres. O gpt-4o-mini-tts é cobrado por tokens, o que significa que o seu custo acompanha a duração do áudio, e não o tamanho do roteiro.
Formatos de saída e streaming
O áudio volta em MP3 por padrão, com Opus, AAC, FLAC, WAV e PCM como alternativas. Cada um tem sua função:
MP3 é o padrão seguro para sites e podcasts.
Opus é adequado para streaming pela internet, porque o arquivo fica pequeno.
AAC funciona bem em celulares e editores de vídeo.
FLAC preserva tudo, o que importa se você pretende editar o arquivo depois.
WAV e PCM não são comprimidos, então são a escolha quando a latência importa mais que o tamanho do arquivo.
O endpoint pode transmitir o áudio enquanto ele é gerado, então a reprodução pode começar antes de o clipe inteiro ficar pronto. Isso faz diferença real em assistentes de voz, onde uma pausa de dois segundos parece uma ligação caindo.
As 13 vozes num relance
Nove vozes funcionam em todos os modelos. Outras quatro funcionam apenas no gpt-4o-mini-tts. Aqui está a lista completa, com uma nota sobre como ouvintes costumam descrever cada uma.
💡 Leia isto primeiro: a OpenAI não publica rótulos de personalidade para suas vozes, então a coluna "costuma ser descrita como" reflete o que desenvolvedores e ouvintes tendem a dizer, não uma especificação oficial. Trate-a como uma lista de candidatas e deixe que seus próprios ouvidos façam a escolha final.
As nove originais
Voz
Costuma ser descrita como
Funciona em
alloy
Neutra, equilibrada, de uso geral
Os três modelos
ash
Mais suave, levemente rouca, conversacional
Os três modelos
coral
Calorosa, amigável, acessível
Os três modelos
echo
Clara, constante, objetiva
Os três modelos
fable
Com jeito de contadora de histórias, expressiva, frequentemente percebida como britânica
Os três modelos
nova
Brilhante, enérgica, animada
Os três modelos
onyx
Grave, autoritária, calma
Os três modelos
sage
Medida, reflexiva, de ritmo uniforme
Os três modelos
shimmer
Leve, clara, suave
Os três modelos
Essas nove estão no mercado há mais tempo, por isso são as mais usadas e as que têm mais opiniões disponíveis. Se o seu produto já usa alloy ou nova, raramente há motivo para trocar, a menos que as novas vozes resolvam um problema específico.
As quatro vozes mais novas
Voz
Costuma ser descrita como
Funciona em
ballad
Suave, melódica, gentil
Somente gpt-4o-mini-tts
verse
Expressiva, dinâmica, animada
Somente gpt-4o-mini-tts
marin
Natural, refinada, qualidade de ponta
Somente gpt-4o-mini-tts
cedar
Natural, firme, calorosa
Somente gpt-4o-mini-tts
A própria documentação da OpenAI recomenda marin ou cedar para a melhor qualidade, o que as torna o primeiro teste natural de qualquer projeto novo. Como só funcionam no gpt-4o-mini-tts, escolhê-las também significa ter acesso ao campo de instruções, que é onde está a flexibilidade real.
Teste as vozes e ajuste a entrega
Áudio não cabe dentro de uma página de texto, então o caminho mais rápido para amostras reais é gerá-las você mesmo. Treze clipes do mesmo roteiro levam alguns minutos e custam alguns centavos.
Um roteiro que expõe vozes fracas
Um bom roteiro de teste não é um parágrafo bonito. É um teste de estresse. Use algo assim:
Pedido 4.817 sai para entrega em 3 de março para o(a) Dr(a). Okonkwo, na Birchwood Lane, 22. Espera, você disse quinta-feira? Sinceramente, eu não esperava que a entrega chegasse antes, mas aqui estamos. Três coisas para lembrar: traga o recibo, confira o lacre e nos ligue se algo parecer estranho.
Ele reúne um número longo, uma data, um sobrenome difícil, uma pergunta, um leve momento emocional e uma lista. Vozes que soam ótimas numa frase isolada costumam tropeçar em pelo menos um desses pontos. Depois, rode este laço:
from openai import OpenAI
from pathlib import Path
client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
"onyx", "sage", "shimmer", "verse", "marin", "cedar"]
for voice in voices:
out = Path(f"sample_{voice}.mp3")
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice=voice,
input=script,
instructions="Speak clearly in a warm, even tone.",
) as response:
response.stream_to_file(out)
Ouça com bons fones de ouvido e avalie cada clipe em quatro aspectos:
Números e nomes: "4.817" sai como uma frase natural?
A pergunta: a entonação sobe em "você disse quinta-feira?"
Ritmo: as vírgulas soam como respiros ou como paradas?
Cansaço: você aguentaria essa voz por dez minutos seguidos?
Instruções que mudam a leitura
No gpt-4o-mini-tts, um campo de instruções permite descrever em linguagem simples como a voz deve soar. A OpenAI observa que o modelo pode receber instruções sobre sotaque, variação emocional, entonação, imitações, velocidade, tom e sussurro. Os modelos mais antigos tts-1 e tts-1-hd não oferecem suporte a isso.
Instrução
O que esperar
"Fale com um tom alegre e positivo."
Uma leitura animada e amigável, boa para onboarding
"Calma, devagar, como uma história para dormir."
Entrega mais suave, com pausas mais longas
"Profissional e conciso, como um apresentador de telejornal."
Ritmo mais firme, emoção mais contida
"Sussurre a última frase."
Um final em voz baixa para efeito dramático
"Soe pedindo desculpas, mas confiante."
Útil para roteiros de suporte sobre atrasos
💡 Dica: mantenha as instruções curtas e concretas. Uma frase clara costuma vencer um parágrafo cheio de adjetivos, e alterar uma instrução por vez deixa evidente o que mudou o resultado.
Qual voz serve para cada tarefa
A tabela abaixo é um conjunto de pontos de partida para testar, não regras. As vozes são subjetivas, e o seu roteiro importa mais do que qualquer rótulo.
Tarefa
Primeira escolha
Alternativa
Audiolivros e leituras longas
cedar
sage
Suporte e bots de telefone
marin
coral
Demonstrações de produto
alloy
echo
Anúncios e clipes curtos
nova
verse
Meditação e conteúdo calmo
ballad
shimmer
Narração e leituras longas
Ouvir por muito tempo penaliza vozes com personalidade forte. Uma voz brilhante que encanta por quinze segundos pode cansar no décimo minuto. Para narração, escolha algo uniforme e sem pressa e use instruções para acrescentar calor. Divida o manuscrito nas quebras de parágrafo, porque cada requisição tem um limite de tamanho de entrada e trechos menores dão à voz um novo começo. Consulte a referência atual da API para saber o limite exato.
Assistentes e bots de suporte
Para um bot, as características decisivas são clareza e um tom crível sob leve pressão. Teste sua voz com as piores mensagens que você envia: reembolsos, atrasos, interrupções. Uma voz que soa animada ao dar más notícias parece insensível, então inclua instruções como "calma e sincera" em cada requisição. Combine isso com streaming para que as respostas comecem rápido.
Anúncios e clipes curtos
Clipes curtos recompensam energia. Aposte em nova ou verse, acrescente uma instrução como "animado, rápido, conversacional" e mantenha as frases curtas para que a entrega nunca precise correr. Renderize duas ou três versões e escolha pelo ouvido, já que a diferença entre uma boa e uma ótima take costuma ser um único adjetivo trocado.
Custos e limites em números reais
Por caractere ou por token
Um manuscrito de 10.000 palavras tem cerca de 60.000 caracteres e aproximadamente 67 minutos de fala em ritmo natural. Para o gpt-4o-mini-tts, a estimativa de lançamento da OpenAI foi de cerca de 1,5 centavo de dólar por minuto de áudio, e é assim que a última linha da tabela abaixo é calculada.
Modelo
Custo aproximado para 10.000 palavras
tts-1
Cerca de US$ 0,90
tts-1-hd
Cerca de US$ 1,80
gpt-4o-mini-tts
Cerca de US$ 1,00
Esses valores são pequenos o suficiente para que a qualidade da voz, e não o preço, decida o modelo. O custo maior é o seu tempo refazendo renderizações que erraram o tom, e isso é mais um argumento a favor do campo de instruções.
Suporte a idiomas
A OpenAI lista suporte a mais de 50 idiomas, do africâner e árabe ao tcheco, dinamarquês e holandês, com a observação de que as vozes estão atualmente otimizadas para o inglês. Na prática, um roteiro em outro idioma funciona, mas o sotaque pode se afastar da fonética inglesa. Teste cada idioma que você publicar e peça a um falante nativo que ouça antes do lançamento.
Divulgação e vozes personalizadas
As políticas de uso da OpenAI exigem que os usuários finais sejam informados com clareza de que a voz que estão ouvindo é gerada por IA e não é humana. Coloque essa informação no próprio produto, não nas letras miúdas. Vozes personalizadas existem, mas dependem de um processo separado, que exige gravações de consentimento do locutor e amostras de áudio. Por isso, planeje um prazo de antecedência se quiser uma voz de marca.
Alternativas no PicassoIA
O PicassoIA não lista os modelos de fala da OpenAI. O que ele oferece é um conjunto amplo de outros motores na categoria Generate speech, além de ferramentas para as duas tarefas que cercam o trabalho com voz: conferir o resultado e acrescentar som por baixo dele.
Uma forma rápida de pegar nomes pronunciados errado é passar o áudio gerado de volta por fala para texto e comparar com o roteiro. GPT-4o Transcribe e GPT-4o Mini Transcribe fazem isso bem, e o Gemini 3 Pro é uma terceira opinião sólida. Se a transcrição deixar de fora ou trocar uma palavra, provavelmente um ouvinte ouviu a mesma coisa.
Adicione música por baixo da voz
Uma locução sem base por baixo pode soar seca. Gere uma faixa na categoria Generate music e mixe-a em volume baixo atrás da narração. ElevenLabs Music, MiniMax Music 2.6, Lyria 3 Pro e Stable Audio 2.5 transformam um prompt de texto em faixa. Peça algo como "instrumental suave, sem vocais, andamento constante" para que nada concorra com as palavras.
Use o Gemini 3.1 Flash TTS no PicassoIA
Como as vozes da OpenAI não são hospedadas ali, o equivalente mais próximo é o Gemini 3.1 Flash TTS, que oferece um fluxo de trabalho parecido com uma lista de vozes maior. Veja como executá-lo:
Abra a página do modelo e encontre o formulário de entrada.
Cole seu roteiro no campo Text. O limite é de 4.000 bytes, então divida roteiros mais longos.
Escolha uma voz entre as 30 opções. A padrão é Kore, e nomes como Puck, Charon, Fenrir, Aoede e Zephyr são bons pontos de partida.
Escreva um prompt de estilo no campo Prompt. O padrão é "Say the following." Substitua por algo como "Fale devagar, com confiança" ou "Use um tom calmo e amigável".
Defina o código de idioma. O padrão é en-US, e há mais de 70 códigos disponíveis.
Gere, ouça e ajuste. Mude uma coisa por execução para saber o que causou a diferença.
Configuração
Dica
Marcações de texto
Adicione [whispering], [laughing], [shouting], [sigh] ou [extremely fast] logo antes da frase que deve afetar
Prompt
Descreva ritmo, tom e sotaque em uma frase
Voz
Teste três vozes no mesmo parágrafo antes de se decidir
Código de idioma
Combine com o idioma do roteiro, não com o seu
💡 Dica: passe o clipe final pelo GPT-4o Transcribe para confirmar que cada nome e número saiu como escrito.
Experimente você mesmo no Picasso IA
Escolher entre as vozes TTS da OpenAI é um trabalho de escuta, e a forma mais rápida de ficar melhor nisso é gerar clipes e compará-los. Pegue o roteiro de teste acima, rode-o pelas treze vozes e depois rode o mesmo roteiro no Gemini 3.1 Flash TTS e no MiniMax Speech 2.8 HD no Picasso IA. Adicione uma base musical suave, confira a transcrição e fique com a voz que ainda soa certa na décima audição. Abra o Picasso IA, cole seu próprio roteiro e comece com uma voz e uma instrução. Sua primeira locução utilizável está mais perto do que o menu suspenso faz parecer.