Preços da API TTS da OpenAI: vozes, tts-1-hd e comparação com ElevenLabs
A OpenAI cobra US$ 15 por milhão de caracteres no tts-1, US$ 30 no tts-1-hd e cerca de US$ 0,015 por minuto no gpt-4o-mini-tts. Este detalhamento lista todas as vozes, calcula custos reais para um artigo e um audiolivro e compara os números com a ElevenLabs.
A API de texto para fala da OpenAI é uma das formas mais baratas de colocar uma voz em um app, um curso ou um podcast, e a tabela de preços cabe em uma frase: US$ 15 por milhão de caracteres para o tts-1, US$ 30 por milhão para o tts-1-hd, e cerca de US$ 0,015 por minuto de áudio para o gpt-4o-mini-tts, o modelo mais novo. A ElevenLabs cobra US$ 0,10 por 1.000 caracteres nos seus modelos de ponta, mais de três vezes a tarifa do tts-1-hd. Se essa diferença vale a pena depende das vozes, dos idiomas e do quão humana a entrega precisa soar. Esta página apresenta todas as tarifas da OpenAI, lista as vozes modelo por modelo, faz exemplos reais de custo e coloca os números lado a lado com a ElevenLabs para que você possa escolher antes de escrever uma linha de código.
💡 Conta rápida: um minuto de narração tem cerca de 900 caracteres. Isso custa cerca de US$ 0,014 no tts-1, US$ 0,027 no tts-1-hd e US$ 0,09 na ElevenLabs v3 ou Multilingual v2.
Quanto a OpenAI cobra por caractere
A OpenAI cobra seus dois modelos clássicos de fala por caracteres de entrada, e não por segundos de áudio. Você paga pelo texto que envia, então uma leitura lenta e dramática custa o mesmo que uma leitura rápida. A página do modelo tts-1-hd indica o endpoint de fala (v1/audio/speech) como a única rota suportada, e o mesmo endpoint atende o tts-1 e o gpt-4o-mini-tts.
Tarifas do tts-1 e do tts-1-hd
A tabela pública de preços é curta. Não há taxa por assento nem gasto mínimo: você adiciona crédito à sua conta e cada requisição o desconta.
Modelo
Preço
Por 1.000 caracteres
Ideal para
tts-1
US$ 15 por 1 milhão de caracteres
US$ 0,015
Apps e assistentes de baixa latência
tts-1-hd
US$ 30 por 1 milhão de caracteres
US$ 0,030
Áudio finalizado e reproduzido várias vezes
gpt-4o-mini-tts
US$ 0,60 por 1 milhão de tokens de texto mais US$ 12 por 1 milhão de tokens de áudio
Baseado em tokens, cerca de US$ 0,015 por minuto
Entrega dirigível e expressiva
O modelo HD custa exatamente o dobro. Para um roteiro típico, isso ainda é trocado miúdo, e é por isso que a decisão real raramente é sobre dinheiro. A página do modelo tts-1-hd indica limites de requisições entre 2.500 e 10.000 por minuto, dependendo do seu nível de uso, muito acima do que a maioria dos apps chega a enviar.
O gpt-4o-mini-tts cobra por token
O modelo mais novo quebra o padrão por caractere. Ele cobra US$ 0,60 por milhão de tokens de texto na entrada e US$ 12 por milhão de tokens de áudio na saída, o que dá cerca de US$ 0,015 por minuto de áudio gerado. Isso fica quase no mesmo nível do tts-1, mas traz um campo instructions em que você descreve a entrega em linguagem simples, como "fale devagar, como um professor paciente". Os modelos tts-1 não têm esse controle.
Uma chamada mínima com o SDK oficial de Python fica assim:
from openai import OpenAI
client = OpenAI()
with client.audio.speech.with_streaming_response.create(
model="tts-1-hd",
voice="coral",
input="Your order shipped this morning and should arrive on Friday.",
response_format="mp3",
) as response:
response.stream_to_file("order-update.mp3")
Troque o nome do modelo para gpt-4o-mini-tts e adicione uma string instructions para direcionar a entrega. Cada requisição aceita até 4.096 caracteres de entrada, então roteiros longos precisam ser divididos em partes e unidos depois.
As vozes que você realmente recebe
A quantidade de vozes é o que mais diferencia os três modelos da OpenAI, e importa mais do que a maioria das páginas de preço admite. Um modelo barato com uma voz de que você não gosta não é barato.
Nove vozes no tts-1 e no tts-1-hd
Os dois modelos clássicos compartilham as mesmas nove vozes: alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer. É uma variedade suficiente para um narrador, um assistente amigável e um locutor mais grave, mas não para um elenco de personagens distintos.
Quatro vozes extras no modelo mais novo
O gpt-4o-mini-tts oferece 13 vozes. Ele mantém as nove originais e acrescenta ballad, verse, marin e cedar. A OpenAI recomenda marin ou cedar quando você quer a melhor qualidade.
Formatos de saída: MP3 por padrão, além de Opus, AAC, FLAC, WAV e PCM. WAV e PCM são os que retornam mais rápido.
Streaming: a API suporta streaming em partes, então a reprodução pode começar antes que o arquivo completo seja gerado.
Idiomas: cerca de 99, seguindo o suporte a idiomas do Whisper. A OpenAI observa que as vozes são otimizadas para o inglês, então teste seu idioma-alvo antes de se comprometer.
Aviso: as políticas de uso exigem um aviso claro aos usuários finais de que a voz é gerada por IA e não é humana.
tts-1 ou tts-1-hd?
Os dois modelos usam as mesmas nove vozes e a mesma entrada, então trocar de um para outro é uma mudança de uma palavra no seu código. Isso torna a escolha fácil de testar: renderize um parágrafo em cada um e ouça no aparelho que seu público realmente usa.
O que os US$ 15 extras compram
A OpenAI posiciona o tts-1 como a opção de menor latência e o tts-1-hd como a de maior qualidade. Espere uma entrega mais suave e estável em trechos longos do modelo HD, e espere que a diferença seja mais fácil de perceber em fones de ouvido. Em um alto-falante de celular dentro de um app barulhento, muitos ouvintes não vão notar.
Como escolher entre eles
Escolha o tts-1 para respostas de chat, assistentes de voz, notificações e tudo em que o primeiro som precisa chegar rápido.
Escolha o tts-1-hd para audiolivros, aulas de curso, podcasts e anúncios, áudio que as pessoas reproduzem de novo e avaliam com atenção.
Escolha o gpt-4o-mini-tts quando a voz precisa de um tom emocional: um atendente calmo de suporte, um apresentador animado de produto, um sussurro.
💡 Regra prática: para conteúdo finalizado, a conta é simples. Renderizar um audiolivro de 80.000 palavras em HD em vez de padrão acrescenta cerca de US$ 7,20 à conta, então prefira HD sempre que os ouvintes forem ouvir o áudio mais de uma vez.
Exemplos reais de custo
Todos os números abaixo assumem um ritmo de narração de 150 palavras por minuto e cerca de 6 caracteres por palavra, contando os espaços, o que dá 900 caracteres por minuto. Seus próprios roteiros vão variar, então trate estes valores como estimativas de orçamento, não como faturas.
Trabalho
tts-1
tts-1-hd
gpt-4o-mini-tts
ElevenLabs Flash
ElevenLabs v3 ou Multilingual v2
Artigo de 1.000 palavras (6.000 caracteres)
US$ 0,09
US$ 0,18
cerca de US$ 0,10
US$ 0,30
US$ 0,60
Audiolivro de 80.000 palavras (480.000 caracteres)
US$ 7,20
US$ 14,40
cerca de US$ 8,00
US$ 24,00
US$ 48,00
1 milhão de caracteres por mês
US$ 15
US$ 30
cerca de US$ 16,70
US$ 50
US$ 100
Um artigo de 1.000 palavras
Transformar um post de blog em uma versão para ouvir custa menos de dez centavos no tts-1 e menos de vinte e cinco centavos no HD. Mesmo na tarifa de ponta da ElevenLabs, são 60 centavos, então, para narrações ocasionais, a diferença de preço é quase irrelevante. Escolha pelo som, não pelo custo.
Um audiolivro de 80.000 palavras
Um livro completo é onde a diferença fica visível: US$ 14,40 no tts-1-hd contra US$ 48 nos modelos de ponta da ElevenLabs, para cerca de nove horas de áudio. Um narrador humano custa muito mais por hora finalizada do que qualquer coluna dessa tabela, então todas as opções aqui são uma fração do custo de reservar um estúdio.
Um milhão de caracteres por mês
Em escala de app, as faixas se separam. Um produto que narra um milhão de caracteres por mês paga de US$ 15 a US$ 100, dependendo do provedor e do modelo. Fique de olho nas repetições: se você regenera um de cada três clipes, some um terço a cada valor. Guarde em cache o áudio de frases repetidas, como saudações e mensagens de erro, porque o mesmo texto nunca precisa ser pago duas vezes.
TTS da OpenAI comparado com ElevenLabs
A tabela de custos mostra quem é mais barato. Ela não mostra quem soa melhor para o seu caso de uso, nem o que acontece quando seu roteiro é mais longo do que uma única requisição permite.
Fator
OpenAI tts-1-hd
ElevenLabs Flash v2.5
ElevenLabs Multilingual v2 e v3
Preço da API por 1.000 caracteres
US$ 0,030
US$ 0,05
US$ 0,10
Idiomas
Cerca de 99
32
29 (v2), mais de 70 (v3)
Máximo de caracteres por requisição
4.096
40.000
10.000 (v2), 5.000 (v3)
Vozes integradas
9
Grande biblioteca mais clonagem de voz
Grande biblioteca mais clonagem de voz
Foco em velocidade
Menor latência no tts-1
Cerca de 75 ms, segundo o fornecedor
Maior qualidade, mais lento
Os números da ElevenLabs vêm de análises de preços de meados de 2026. A empresa atualiza seus planos com frequência, então confirme os valores atuais na página de preços dela antes de definir um orçamento.
Preço por 1.000 caracteres
Na API, o tts-1 fica em US$ 0,015, o tts-1-hd em US$ 0,030, a ElevenLabs Flash e Turbo em US$ 0,05, e Multilingual v2 e v3 em US$ 0,10. Isso faz a ElevenLabs Flash custar cerca de 1,7 vez o preço do tts-1-hd, e os modelos de ponta cerca de 3,3 vezes. As assinaturas agrupam créditos: o plano gratuito inclui 10.000 créditos por mês, com um crédito por caractere nos modelos padrão e meio crédito na Flash e na Turbo.
Qualidade de voz e expressão
O preço é só metade da história. A ElevenLabs construiu sua reputação com uma entrega expressiva e natural, e o Eleven v3 acrescenta amplitude emocional e diálogo com vários falantes em mais de 70 idiomas. A resposta da OpenAI é a dirigibilidade: o gpt-4o-mini-tts aceita instruções em linguagem simples sobre sotaque, tom, velocidade e emoção, algo que nenhum dos dois modelos tts-1 consegue fazer.
Se você precisa de um elenco de personagens que soem diferentes em cada cena, a biblioteca de vozes e a clonagem da ElevenLabs dão mais margem. Se você precisa de uma voz confiável e barata, a OpenAI leva vantagem no custo. O único teste honesto é passar o mesmo parágrafo pelos dois e ouvir.
Limites, idiomas e licenciamento
Os limites de requisição moldam o seu código. A OpenAI limita a entrada a 4.096 caracteres e o Eleven v3 a 5.000, então um roteiro longo precisa de divisão em partes e de uma forma de manter a voz consistente entre os trechos. O Flash v2.5 aceita 40.000 caracteres, o que significa menos uniões em leituras longas.
O licenciamento também difere. O plano gratuito da ElevenLabs não tem licença comercial, e os direitos comerciais começam no primeiro plano pago. A OpenAI exige que você informe aos usuários finais que a voz é gerada por IA. Leia os dois conjuntos de termos antes de enviar áudio a clientes.
Como usar o ElevenLabs v3 no PicassoIA
Antes de pagar por caractere, você pode ouvir o lado ElevenLabs desta comparação no navegador. A coleção de texto para fala do PicassoIA lista 24 modelos, incluindo ElevenLabs v3, Flash v2.5, Turbo v2.5 e Multilingual v2, além de opções da MiniMax, Google, Inworld e Resemble AI. Cole um roteiro, escolha uma voz e o áudio volta em segundos.
Passos no navegador
Abra a página do ElevenLabs v3 na coleção de texto para fala.
Cole seu roteiro no campo Prompt.
Escolha uma voz no menu suspenso. A padrão é Rachel, e a lista tem mais de 25 personas.
Defina o código de idioma. O padrão é en; use es ou fr para espanhol ou francês.
Deixe a estabilidade em 0,5, o reforço de similaridade em 0,75, o estilo em 0 e a velocidade em 1 na primeira execução.
Execute o modelo, ouça, ajuste uma configuração de cada vez e baixe o arquivo que você preferir.
Configurações que mudam o resultado
Estabilidade: valores mais altos mantêm a voz firme ao longo de um roteiro longo; valores mais baixos permitem mais variação.
Estilo: um controle deslizante de 0 a 1 que leva a entrega de uma narração neutra para uma leitura mais teatral.
Velocidade: de 0,25x a 4x, útil para desacelerar narrações de tutoriais.
Texto anterior e seguinte: cole as frases antes e depois de um trecho para que a entonação continue natural na união. Esta é a solução para os limites de caracteres por requisição mencionados acima.
Para um teste A/B rápido, passe o mesmo parágrafo pelo Flash v2.5 por velocidade, pelo MiniMax Speech 2.8 HD para uma qualidade de estúdio, pelo Gemini 3.1 Flash TTS por suas 30 vozes e mais de 70 idiomas, e pelo Inworld TTS 1.5 Max para locuções multilíngues rápidas. Depois, compare os resultados com uma amostra do tts-1-hd da sua própria conta.
Música e transcrição também
A voz raramente é o único trabalho de áudio. Um vídeo de produto precisa de uma base musical, e um podcast precisa de uma transcrição para legendas e busca.
Transcreva áudio. Para transformar uma narração ou uma entrevista finalizada em texto, use o GPT-4o Transcribe, o GPT-4o Mini Transcribe ou o Gemini 3 Pro. Uma transcrição serve como legenda, notas de apoio e revisão: se a transcrição errar uma palavra, o ouvinte provavelmente também vai errar.
Um pipeline simples une tudo: escreva o roteiro, renderize a voz, adicione uma base musical e depois transcreva a mixagem final para conferir o texto.
Experimente você mesmo hoje
Tabelas de preço só levam até certo ponto. A forma mais rápida de decidir entre OpenAI e ElevenLabs é ouvir o seu próprio roteiro em várias vozes e ver quanto cada opção custa no seu volume. Abra o PicassoIA, cole um parágrafo em um modelo de texto para fala e compare com um clipe do tts-1-hd. Depois, adicione uma faixa musical, transcreva o resultado e gere algumas imagens fotorrealistas para a capa do seu episódio ou vídeo. Tudo o que você precisa para testar um fluxo de trabalho completo de áudio e imagem está em um só lugar, então experimente à vontade e fique com a combinação que soar melhor.