Preços da API TTS da OpenAI: vozes, tts-1-hd e comparação com ElevenLabs

A OpenAI cobra US$ 15 por milhão de caracteres no tts-1, US$ 30 no tts-1-hd e cerca de US$ 0,015 por minuto no gpt-4o-mini-tts. Este detalhamento lista todas as vozes, calcula custos reais para um artigo e um audiolivro e compara os números com a ElevenLabs.

Preços da API TTS da OpenAI: vozes, tts-1-hd e comparação com ElevenLabs
Cristian Da Conceicao
Fundador do Picasso IA

A API de texto para fala da OpenAI é uma das formas mais baratas de colocar uma voz em um app, um curso ou um podcast, e a tabela de preços cabe em uma frase: US$ 15 por milhão de caracteres para o tts-1, US$ 30 por milhão para o tts-1-hd, e cerca de US$ 0,015 por minuto de áudio para o gpt-4o-mini-tts, o modelo mais novo. A ElevenLabs cobra US$ 0,10 por 1.000 caracteres nos seus modelos de ponta, mais de três vezes a tarifa do tts-1-hd. Se essa diferença vale a pena depende das vozes, dos idiomas e do quão humana a entrega precisa soar. Esta página apresenta todas as tarifas da OpenAI, lista as vozes modelo por modelo, faz exemplos reais de custo e coloca os números lado a lado com a ElevenLabs para que você possa escolher antes de escrever uma linha de código.

💡 Conta rápida: um minuto de narração tem cerca de 900 caracteres. Isso custa cerca de US$ 0,014 no tts-1, US$ 0,027 no tts-1-hd e US$ 0,09 na ElevenLabs v3 ou Multilingual v2.

Quanto a OpenAI cobra por caractere

A OpenAI cobra seus dois modelos clássicos de fala por caracteres de entrada, e não por segundos de áudio. Você paga pelo texto que envia, então uma leitura lenta e dramática custa o mesmo que uma leitura rápida. A página do modelo tts-1-hd indica o endpoint de fala (v1/audio/speech) como a única rota suportada, e o mesmo endpoint atende o tts-1 e o gpt-4o-mini-tts.

Tarifas do tts-1 e do tts-1-hd

A tabela pública de preços é curta. Não há taxa por assento nem gasto mínimo: você adiciona crédito à sua conta e cada requisição o desconta.

ModeloPreçoPor 1.000 caracteresIdeal para
tts-1US$ 15 por 1 milhão de caracteresUS$ 0,015Apps e assistentes de baixa latência
tts-1-hdUS$ 30 por 1 milhão de caracteresUS$ 0,030Áudio finalizado e reproduzido várias vezes
gpt-4o-mini-ttsUS$ 0,60 por 1 milhão de tokens de texto mais US$ 12 por 1 milhão de tokens de áudioBaseado em tokens, cerca de US$ 0,015 por minutoEntrega dirigível e expressiva

Vista superior de uma mesa de nogueira com uma calculadora, uma fatura em branco, moedas e um microfone de condensador, usada para orçar custos de texto para fala

O modelo HD custa exatamente o dobro. Para um roteiro típico, isso ainda é trocado miúdo, e é por isso que a decisão real raramente é sobre dinheiro. A página do modelo tts-1-hd indica limites de requisições entre 2.500 e 10.000 por minuto, dependendo do seu nível de uso, muito acima do que a maioria dos apps chega a enviar.

O gpt-4o-mini-tts cobra por token

O modelo mais novo quebra o padrão por caractere. Ele cobra US$ 0,60 por milhão de tokens de texto na entrada e US$ 12 por milhão de tokens de áudio na saída, o que dá cerca de US$ 0,015 por minuto de áudio gerado. Isso fica quase no mesmo nível do tts-1, mas traz um campo instructions em que você descreve a entrega em linguagem simples, como "fale devagar, como um professor paciente". Os modelos tts-1 não têm esse controle.

Desenvolvedor de software em uma mesa em pé com dois monitores mostrando editores de código desfocados, integrando uma API de texto para fala a um app

Uma chamada mínima com o SDK oficial de Python fica assim:

from openai import OpenAI

client = OpenAI()

with client.audio.speech.with_streaming_response.create(
    model="tts-1-hd",
    voice="coral",
    input="Your order shipped this morning and should arrive on Friday.",
    response_format="mp3",
) as response:
    response.stream_to_file("order-update.mp3")

Troque o nome do modelo para gpt-4o-mini-tts e adicione uma string instructions para direcionar a entrega. Cada requisição aceita até 4.096 caracteres de entrada, então roteiros longos precisam ser divididos em partes e unidos depois.

As vozes que você realmente recebe

A quantidade de vozes é o que mais diferencia os três modelos da OpenAI, e importa mais do que a maioria das páginas de preço admite. Um modelo barato com uma voz de que você não gosta não é barato.

Vista de baixo para cima de um apresentador de podcast com jaqueta de veludo cotelê falando em um microfone de transmissão em um estúdio com iluminação quente

Nove vozes no tts-1 e no tts-1-hd

Os dois modelos clássicos compartilham as mesmas nove vozes: alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer. É uma variedade suficiente para um narrador, um assistente amigável e um locutor mais grave, mas não para um elenco de personagens distintos.

Quatro vozes extras no modelo mais novo

O gpt-4o-mini-tts oferece 13 vozes. Ele mantém as nove originais e acrescenta ballad, verse, marin e cedar. A OpenAI recomenda marin ou cedar quando você quer a melhor qualidade.

ModeloVozesNomes
tts-19alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer
tts-1-hd9As mesmas nove
gpt-4o-mini-tts13As nove mais ballad, verse, marin, cedar

Alguns detalhes práticos valem para os três:

  • Formatos de saída: MP3 por padrão, além de Opus, AAC, FLAC, WAV e PCM. WAV e PCM são os que retornam mais rápido.
  • Streaming: a API suporta streaming em partes, então a reprodução pode começar antes que o arquivo completo seja gerado.
  • Idiomas: cerca de 99, seguindo o suporte a idiomas do Whisper. A OpenAI observa que as vozes são otimizadas para o inglês, então teste seu idioma-alvo antes de se comprometer.
  • Aviso: as políticas de uso exigem um aviso claro aos usuários finais de que a voz é gerada por IA e não é humana.

tts-1 ou tts-1-hd?

Os dois modelos usam as mesmas nove vozes e a mesma entrada, então trocar de um para outro é uma mudança de uma palavra no seu código. Isso torna a escolha fácil de testar: renderize um parágrafo em cada um e ouça no aparelho que seu público realmente usa.

Close extremo de fones de ouvido de estúdio com almofadas de couro apoiados em uma mesa de madeira sob luz da manhã

O que os US$ 15 extras compram

A OpenAI posiciona o tts-1 como a opção de menor latência e o tts-1-hd como a de maior qualidade. Espere uma entrega mais suave e estável em trechos longos do modelo HD, e espere que a diferença seja mais fácil de perceber em fones de ouvido. Em um alto-falante de celular dentro de um app barulhento, muitos ouvintes não vão notar.

Como escolher entre eles

  • Escolha o tts-1 para respostas de chat, assistentes de voz, notificações e tudo em que o primeiro som precisa chegar rápido.
  • Escolha o tts-1-hd para audiolivros, aulas de curso, podcasts e anúncios, áudio que as pessoas reproduzem de novo e avaliam com atenção.
  • Escolha o gpt-4o-mini-tts quando a voz precisa de um tom emocional: um atendente calmo de suporte, um apresentador animado de produto, um sussurro.

💡 Regra prática: para conteúdo finalizado, a conta é simples. Renderizar um audiolivro de 80.000 palavras em HD em vez de padrão acrescenta cerca de US$ 7,20 à conta, então prefira HD sempre que os ouvintes forem ouvir o áudio mais de uma vez.

Exemplos reais de custo

Todos os números abaixo assumem um ritmo de narração de 150 palavras por minuto e cerca de 6 caracteres por palavra, contando os espaços, o que dá 900 caracteres por minuto. Seus próprios roteiros vão variar, então trate estes valores como estimativas de orçamento, não como faturas.

Trabalhotts-1tts-1-hdgpt-4o-mini-ttsElevenLabs FlashElevenLabs v3 ou Multilingual v2
Artigo de 1.000 palavras (6.000 caracteres)US$ 0,09US$ 0,18cerca de US$ 0,10US$ 0,30US$ 0,60
Audiolivro de 80.000 palavras (480.000 caracteres)US$ 7,20US$ 14,40cerca de US$ 8,00US$ 24,00US$ 48,00
1 milhão de caracteres por mêsUS$ 15US$ 30cerca de US$ 16,70US$ 50US$ 100

Narrador de audiolivro lendo um manuscrito grosso dentro de uma cabine vocal forrada de espuma, visto pelo vidro da sala de controle

Um artigo de 1.000 palavras

Transformar um post de blog em uma versão para ouvir custa menos de dez centavos no tts-1 e menos de vinte e cinco centavos no HD. Mesmo na tarifa de ponta da ElevenLabs, são 60 centavos, então, para narrações ocasionais, a diferença de preço é quase irrelevante. Escolha pelo som, não pelo custo.

Um audiolivro de 80.000 palavras

Um livro completo é onde a diferença fica visível: US$ 14,40 no tts-1-hd contra US$ 48 nos modelos de ponta da ElevenLabs, para cerca de nove horas de áudio. Um narrador humano custa muito mais por hora finalizada do que qualquer coluna dessa tabela, então todas as opções aqui são uma fração do custo de reservar um estúdio.

Um milhão de caracteres por mês

Em escala de app, as faixas se separam. Um produto que narra um milhão de caracteres por mês paga de US$ 15 a US$ 100, dependendo do provedor e do modelo. Fique de olho nas repetições: se você regenera um de cada três clipes, some um terço a cada valor. Guarde em cache o áudio de frases repetidas, como saudações e mensagens de erro, porque o mesmo texto nunca precisa ser pago duas vezes.

TTS da OpenAI comparado com ElevenLabs

A tabela de custos mostra quem é mais barato. Ela não mostra quem soa melhor para o seu caso de uso, nem o que acontece quando seu roteiro é mais longo do que uma única requisição permite.

Dois colegas comparando opções de texto para fala em uma mesa compartilhada, um apontando para o notebook enquanto o outro anota

FatorOpenAI tts-1-hdElevenLabs Flash v2.5ElevenLabs Multilingual v2 e v3
Preço da API por 1.000 caracteresUS$ 0,030US$ 0,05US$ 0,10
IdiomasCerca de 993229 (v2), mais de 70 (v3)
Máximo de caracteres por requisição4.09640.00010.000 (v2), 5.000 (v3)
Vozes integradas9Grande biblioteca mais clonagem de vozGrande biblioteca mais clonagem de voz
Foco em velocidadeMenor latência no tts-1Cerca de 75 ms, segundo o fornecedorMaior qualidade, mais lento

Os números da ElevenLabs vêm de análises de preços de meados de 2026. A empresa atualiza seus planos com frequência, então confirme os valores atuais na página de preços dela antes de definir um orçamento.

Preço por 1.000 caracteres

Na API, o tts-1 fica em US$ 0,015, o tts-1-hd em US$ 0,030, a ElevenLabs Flash e Turbo em US$ 0,05, e Multilingual v2 e v3 em US$ 0,10. Isso faz a ElevenLabs Flash custar cerca de 1,7 vez o preço do tts-1-hd, e os modelos de ponta cerca de 3,3 vezes. As assinaturas agrupam créditos: o plano gratuito inclui 10.000 créditos por mês, com um crédito por caractere nos modelos padrão e meio crédito na Flash e na Turbo.

Qualidade de voz e expressão

O preço é só metade da história. A ElevenLabs construiu sua reputação com uma entrega expressiva e natural, e o Eleven v3 acrescenta amplitude emocional e diálogo com vários falantes em mais de 70 idiomas. A resposta da OpenAI é a dirigibilidade: o gpt-4o-mini-tts aceita instruções em linguagem simples sobre sotaque, tom, velocidade e emoção, algo que nenhum dos dois modelos tts-1 consegue fazer.

Se você precisa de um elenco de personagens que soem diferentes em cada cena, a biblioteca de vozes e a clonagem da ElevenLabs dão mais margem. Se você precisa de uma voz confiável e barata, a OpenAI leva vantagem no custo. O único teste honesto é passar o mesmo parágrafo pelos dois e ouvir.

Limites, idiomas e licenciamento

Os limites de requisição moldam o seu código. A OpenAI limita a entrada a 4.096 caracteres e o Eleven v3 a 5.000, então um roteiro longo precisa de divisão em partes e de uma forma de manter a voz consistente entre os trechos. O Flash v2.5 aceita 40.000 caracteres, o que significa menos uniões em leituras longas.

O licenciamento também difere. O plano gratuito da ElevenLabs não tem licença comercial, e os direitos comerciais começam no primeiro plano pago. A OpenAI exige que você informe aos usuários finais que a voz é gerada por IA. Leia os dois conjuntos de termos antes de enviar áudio a clientes.

Como usar o ElevenLabs v3 no PicassoIA

Antes de pagar por caractere, você pode ouvir o lado ElevenLabs desta comparação no navegador. A coleção de texto para fala do PicassoIA lista 24 modelos, incluindo ElevenLabs v3, Flash v2.5, Turbo v2.5 e Multilingual v2, além de opções da MiniMax, Google, Inworld e Resemble AI. Cole um roteiro, escolha uma voz e o áudio volta em segundos.

Jovem de gorro de lã ouvindo uma amostra de voz de IA com um único fone de ouvido ao lado de uma janela

Passos no navegador

  1. Abra a página do ElevenLabs v3 na coleção de texto para fala.
  2. Cole seu roteiro no campo Prompt.
  3. Escolha uma voz no menu suspenso. A padrão é Rachel, e a lista tem mais de 25 personas.
  4. Defina o código de idioma. O padrão é en; use es ou fr para espanhol ou francês.
  5. Deixe a estabilidade em 0,5, o reforço de similaridade em 0,75, o estilo em 0 e a velocidade em 1 na primeira execução.
  6. Execute o modelo, ouça, ajuste uma configuração de cada vez e baixe o arquivo que você preferir.

Configurações que mudam o resultado

  • Estabilidade: valores mais altos mantêm a voz firme ao longo de um roteiro longo; valores mais baixos permitem mais variação.
  • Estilo: um controle deslizante de 0 a 1 que leva a entrega de uma narração neutra para uma leitura mais teatral.
  • Velocidade: de 0,25x a 4x, útil para desacelerar narrações de tutoriais.
  • Texto anterior e seguinte: cole as frases antes e depois de um trecho para que a entonação continue natural na união. Esta é a solução para os limites de caracteres por requisição mencionados acima.

Para um teste A/B rápido, passe o mesmo parágrafo pelo Flash v2.5 por velocidade, pelo MiniMax Speech 2.8 HD para uma qualidade de estúdio, pelo Gemini 3.1 Flash TTS por suas 30 vozes e mais de 70 idiomas, e pelo Inworld TTS 1.5 Max para locuções multilíngues rápidas. Depois, compare os resultados com uma amostra do tts-1-hd da sua própria conta.

Música e transcrição também

A voz raramente é o único trabalho de áudio. Um vídeo de produto precisa de uma base musical, e um podcast precisa de uma transcrição para legendas e busca.

Músico em uma mesa de madeira com um controlador de pads e um monitor de estúdio sob luz quente de pôr do sol, compondo uma faixa

Gere música. Para uma faixa de fundo, experimente o MiniMax Music 2.6, o Lyria 3 Pro, a ElevenLabs Music ou o Stable Audio 2.5. Descreva o gênero, o clima e o andamento em uma frase e deixe o modelo rascunhar a faixa.

Jornalista em um café digitando em um notebook ao lado de um pequeno gravador de voz e um cappuccino, transformando uma entrevista em texto

Transcreva áudio. Para transformar uma narração ou uma entrevista finalizada em texto, use o GPT-4o Transcribe, o GPT-4o Mini Transcribe ou o Gemini 3 Pro. Uma transcrição serve como legenda, notas de apoio e revisão: se a transcrição errar uma palavra, o ouvinte provavelmente também vai errar.

Um pipeline simples une tudo: escreva o roteiro, renderize a voz, adicione uma base musical e depois transcreva a mixagem final para conferir o texto.

Experimente você mesmo hoje

Tabelas de preço só levam até certo ponto. A forma mais rápida de decidir entre OpenAI e ElevenLabs é ouvir o seu próprio roteiro em várias vozes e ver quanto cada opção custa no seu volume. Abra o PicassoIA, cole um parágrafo em um modelo de texto para fala e compare com um clipe do tts-1-hd. Depois, adicione uma faixa musical, transcreva o resultado e gere algumas imagens fotorrealistas para a capa do seu episódio ou vídeo. Tudo o que você precisa para testar um fluxo de trabalho completo de áudio e imagem está em um só lugar, então experimente à vontade e fique com a combinação que soar melhor.

Compartilhe este artigo

Escolha seu idioma