Melhor API de texto para fala em 2027: ElevenLabs, OpenAI e Gemini
Três APIs lideram o mercado de texto para fala para desenvolvedores. Este artigo compara ElevenLabs, OpenAI e Gemini em latência, expressividade, alcance de idiomas e custo real por hora de áudio, e depois mostra como testar vozes, adicionar música e verificar o resultado com transcrição.
Escolher uma API de texto para fala parece fácil até a fatura chegar, ou até o primeiro usuário dizer que a voz soa como um GPS de dez anos atrás. Três nomes dominam a lista de candidatos para desenvolvedores: ElevenLabs, OpenAI e Google Gemini. Cada um vence uma batalha diferente. Um soa o mais humano, outro é o mais barato para rodar o dia inteiro, e outro fala mais idiomas do que a maioria das equipes precisará.
Este artigo os compara nas coisas que decidem projetos reais: latência, qualidade de voz, preço por hora de áudio, alcance de idiomas e o esforço da integração. Você também verá onde testar vozes no navegador antes de escrever uma linha de código, e como adicionar música e transcrição para que o áudio final esteja pronto para publicar.
O que torna uma API de TTS boa
Todo provedor publica um clipe de demonstração caprichado, e a demonstração diz quase nada. O que importa é como a API se comporta com seus roteiros, no seu volume, dentro do seu orçamento de latência. Três verificações separam uma boa escolha de um erro caro.
Latência que você sente
Para um agente de voz ou um assistente no carro, o número que conta é o tempo até o primeiro áudio, e não o tempo total de geração. Uma resposta que começa em poucas centenas de milissegundos parece uma conversa. Uma resposta que começa depois de dois segundos parece uma linha telefônica ruim. Trabalhos em lote, como audiolivros ou narração de cursos, não se importam, porque ninguém está esperando pelo capítulo nove.
Decida em qual grupo você está antes de comparar qualquer outra coisa. Projetos em tempo real devem considerar os modelos rápidos e mais leves. Projetos em lote devem investir em qualidade e deixar o trabalho rodar durante a noite.
Qualidade de voz sob pressão
Frases curtas de demonstração são fáceis. Testes de estresse não são. Rode cada candidato no mesmo roteiro e inclua algumas armadilhas:
Um número de telefone, um preço e uma data em uma única frase
Um nome de marca que não é uma palavra em inglês
Um parágrafo de dois minutos, para ver se a voz se mantém consistente
Uma linha que pede uma risada, uma pausa ou um sussurro
Salve os arquivos de áudio e compare-os às cegas. Seus ouvidos muitas vezes escolherão um vencedor diferente do que a página de marketing indica.
Confiabilidade e limites de taxa
Uma voz que soa perfeita em testes não serve de nada se a API limitar seu uso durante um lançamento. Verifique os limites de concorrência do seu plano, como o provedor lida com picos de requisições e quais códigos de erro você recebe quando uma requisição falha. Implemente novas tentativas com um recuo curto e armazene em cache qualquer trecho que você gerar mais de uma vez, como uma saudação ou uma mensagem de confirmação. Guarde os arquivos de áudio em vez de regenerá-los a cada requisição. Só o cache pode reduzir a fatura de forma surpreendente em apps que repetem as mesmas frases o dia inteiro.
Preço que escala
Os provedores cobram em três unidades diferentes: por caractere, por token e por minuto de áudio. Isso torna as páginas de preço difíceis de comparar à primeira vista. A solução é converter tudo para custo por hora de áudio final, que é o que você realmente compra. A seção de comparação abaixo faz exatamente isso.
💡 Dica: As tarifas mudam com frequência. Os valores deste artigo vêm das tabelas de preço publicadas no momento da redação, então confirme cada número na página de preços do próprio provedor antes de definir um orçamento.
ElevenLabs: a opção expressiva
A ElevenLabs construiu sua reputação com vozes que soam interpretadas, e não apenas lidas. Para narração, trabalho de personagens e qualquer situação em que a emoção carrega a mensagem, ela ainda é o nome com que as outras APIs são comparadas.
Onde o V3 vence
O ElevenLabs V3 é o modelo expressivo principal. As tarifas publicadas ficam em torno de US$ 0,10 por 1.000 caracteres, com suporte a mais de 70 idiomas e até 5.000 caracteres por requisição. Os controles são o que o torna bom para projetos longos:
Stability mantém a voz consistente ao longo de um roteiro extenso.
Similarity boost aproxima a saída do perfil de voz escolhido.
Style leva a entrega de uma narração neutra para algo teatral.
Previous and next text permite que o modelo molde a entonação nas fronteiras das frases.
Speed pode ser definida entre 0,25x e 4x.
Os campos de texto anterior e seguinte são subestimados. Quando você gera um roteiro longo em blocos, passar as frases vizinhas impede que a voz reinicie o tom a cada bloco, que é o sinal mais comum de narração sintética.
A clonagem de voz também merece menção. A ElevenLabs permite criar uma voz a partir de uma gravação, o que é útil para um narrador de marca que deve soar igual em centenas de vídeos. Clone apenas vozes para as quais você tem permissão por escrito e guarde essa permissão em arquivo. Clientes e plataformas costumam pedi-la, e ela protege você caso uma voz seja contestada.
Flash v2.5 para apps em tempo real
O Flash v2.5 troca um pouco de riqueza por velocidade. As listagens indicam cerca de 75 ms de latência do modelo, 32 idiomas e aproximadamente US$ 0,05 por 1.000 caracteres, que é metade do preço do V3. Ele também aceita até 40.000 caracteres por requisição, então documentos longos precisam de menos chamadas.
Use o Flash para bots de suporte, respostas ao vivo e assistentes no carro. Use o V3 quando uma pessoa vai ouvir com atenção. Um padrão comum é usar os dois: o Flash para a resposta ao vivo, e o V3 para a versão caprichada da mesma linha que vai no vídeo de marketing. Se você precisa de um modelo multilíngue estável entre os dois, vale testar o v2 Multilingual.
OpenAI: barata e previsível
A oferta de fala da OpenAI, construída em torno do gpt-4o-mini-tts, é a escolha econômica que raramente surpreende. O preço é listado em US$ 0,60 por milhão de tokens de entrada de texto e US$ 12 por milhão de tokens de saída de áudio, o que a própria OpenAI estima em cerca de 1,5 centavo por minuto de áudio.
Vozes ajustáveis
O modelo traz 13 vozes integradas e aceita uma instrução em linguagem simples sobre como falar, por exemplo "calorosa, sem pressa, como um apresentador de rádio da madrugada". Isso o torna uma ótima opção quando você precisa de algumas personas consistentes rapidamente, sem nenhuma configuração de voz. A integração também é a mais simples das três se seu conjunto de ferramentas já usa a OpenAI para texto ou transcrição, porque você reaproveita a mesma conta, o mesmo SDK e a mesma cobrança.
Limites com que você deve contar
A entrada é limitada a 2.000 tokens, então roteiros longos precisam ser divididos em blocos.
A lista de vozes integradas é pequena se comparada a uma plataforma dedicada de vozes.
O inglês é o idioma mais forte para a maioria das equipes, então teste outros idiomas com seus próprios roteiros.
Os limites entre blocos podem alterar o tom, então divida nas quebras de parágrafo e nunca no meio de uma frase.
O modelo de texto para fala da OpenAI não faz parte do catálogo do PicassoIA hoje, mas os modelos de reconhecimento de fala fazem. Mais sobre isso na seção de transcrição.
Gemini: o gigante dos idiomas
O Gemini 3.1 Flash TTS é o modelo de fala expressivo do Google. O plano pago é listado em US$ 1,00 por milhão de tokens de entrada de texto e US$ 20,00 por milhão de tokens de saída de áudio. O áudio é cobrado a 25 tokens por segundo, então um clipe de 60 segundos equivale a 1.500 tokens de saída, cerca de três centavos. O modo em lote reduz as duas tarifas pela metade.
Marcações de expressão e prompts de estilo
O modelo oferece 30 vozes e mais de 70 códigos de idioma. Dois controles moldam a entrega. Um prompt de estilo em linguagem simples define ritmo, sotaque e clima, como "fale devagar, com confiança". As marcações inline mudam frases específicas:
[sigh] Another Monday. [whispering] But the launch is today.
Marcações como [whispering], [laughing], [shouting] e [extremely fast] permitem que um mesmo roteiro carregue vários climas sem ser dividido em requisições separadas. Para diálogos de jogos, anúncios e vídeos explicativos, isso economiza tempo real de edição.
A localização é onde esse modelo brilha. Um roteiro de anúncio em inglês pode ser adaptado para espanhol, francês e japonês, e então narrado trocando o código de idioma em cada requisição, enquanto o mesmo prompt de estilo mantém a energia consistente entre os mercados. A revisão nativa continua importante para expressões idiomáticas e nomes de marca, mas o primeiro rascunho audível fica pronto em minutos, e não em dias.
O status de prévia importa
No momento da redação, o Google oferece este modelo como prévia na API do Gemini. Prévias podem mudar o comportamento ou o preço sem muito aviso. Fixe o nome do modelo na sua configuração, mantenha um provedor de contingência conectado e rode novamente seu roteiro de teste após cada atualização.
Comparação lado a lado
Números valem mais que adjetivos na hora de escolher um provedor. Esta tabela reúne os limites e tarifas publicados usados neste artigo.
Recurso
ElevenLabs V3
ElevenLabs Flash v2.5
OpenAI gpt-4o-mini-tts
Gemini 3.1 Flash TTS
Melhor para
Narração expressiva
Respostas em tempo real
Áudio em massa de baixo custo
Multilíngue e entrega com marcações
Idiomas
70+
32
Mais forte em inglês
70+ códigos de idioma
Vozes
Biblioteca ampla, clonagem
Biblioteca ampla, clonagem
13 integradas
30 pré-definidas
Entrada máxima por requisição
5.000 caracteres
40.000 caracteres
2.000 tokens
4.000 bytes
Preço listado
~US$ 0,10 por 1.000 caracteres
~US$ 0,05 por 1.000 caracteres
~US$ 0,015 por minuto
~US$ 0,03 por minuto
Controle de entrega
Stability, style, speed
Stability, speed
Instruções em linguagem simples
Prompt de estilo e marcações inline
Custo por hora de áudio
Para tornar os preços comparáveis, considere que 1.000 caracteres equivalem a cerca de um minuto de fala. Essa é uma regra prática comum para um ritmo de leitura normal.
Provedor e modelo
Uma hora de áudio
100 horas de áudio
OpenAI gpt-4o-mini-tts
cerca de US$ 0,90
cerca de US$ 90
Gemini 3.1 Flash TTS
cerca de US$ 1,80
cerca de US$ 180
ElevenLabs Flash v2.5
cerca de US$ 3,00
cerca de US$ 300
ElevenLabs V3
cerca de US$ 6,00
cerca de US$ 600
A diferença é grande. O V3 custa cerca de sete vezes mais que a OpenAI para o mesmo tempo de áudio. Se vale a pena pagar essa diferença, isso depende de quem ouve. Para um vídeo de treinamento interno, provavelmente não. Para um filme de marca ou um audiolivro com público fiel, com certeza.
Qual se encaixa no seu projeto
Agente de voz ou assistente ao vivo:Flash v2.5 pela velocidade.
Audiolivro, documentário ou leitura de anúncio:ElevenLabs V3 pela emoção e consistência.
Notificações em alto volume e narração em massa: OpenAI pela conta mais baixa.
Apps com muitos idiomas-alvo:Gemini 3.1 Flash TTS pela amplitude e pelas marcações de expressão inline.
Se você não tem certeza, comece pelo modelo mais barato que passar no seu teste às cegas e atualize apenas as falas em que os ouvintes percebem a diferença. A maioria dos produtos acaba usando dois modelos: um para respostas ao vivo e outro para conteúdo caprichado e pré-renderizado.
Antes de conectar qualquer API ao seu produto, ouça as vozes primeiro. O PicassoIA permite rodar o Gemini 3.1 Flash TTS no navegador, para que você teste tom, idioma e marcações em minutos. Observe que a API de desenvolvedor própria do PicassoIA atualmente atende modelos de imagem e vídeo, então use o navegador para escolher uma voz e a API de cada fornecedor para chamadas de produção.
Cole seu roteiro. O campo de texto aceita até 4.000 bytes. Comece com um trecho de 3 a 4 frases, e não com o roteiro inteiro.
Escolha uma voz. Há 30 opções. A padrão é Kore, e Charon, Puck e Fenrir são bons contrastes para testar em seguida.
Escreva um prompt de estilo. Substitua "Say the following." por uma orientação como "Say this in a calm, professional tone".
Defina o código de idioma. O padrão é en-US. Troque para es-ES, fr-FR ou ja-JP para ouvir o mesmo roteiro em outro idioma.
Adicione marcações. Insira [whispering], [laughing] ou [sigh] dentro do texto onde a entrega deve mudar.
Gere e compare. Rode o mesmo trecho com duas ou três vozes e mantenha os clipes lado a lado.
💡 Dica: Mude uma configuração por vez. Se você alterar a voz, o prompt de estilo e as marcações ao mesmo tempo, não saberá qual mudança fez a diferença.
Duas notas práticas antes de escalar. Primeiro, mantenha cada bloco bem abaixo do limite de 4.000 bytes, porque textos em outros idiomas usam mais bytes por caractere do que o inglês, então um parágrafo em espanhol ou japonês atinge o limite mais cedo do que você imagina. Segundo, reutilize o mesmo prompt de estilo em todos os blocos de um roteiro, ou o ritmo vai oscilar entre os clipes.
Para comparar com a outra principal opção, rode o mesmo trecho pelo ElevenLabs V3 com a stability em 0,5 e o style baixo. Uma escuta às cegas dos dois clipes vai dizer mais do que qualquer benchmark.
Adicione música e transcrições
Uma narração sozinha raramente é publicada. A maioria das peças finais precisa de uma base musical, e todas precisam de uma verificação final de que a fala diz o que o roteiro diz. As duas etapas cabem no mesmo fluxo de trabalho.
Coloque uma base musical
Um instrumental discreto sob a narração dá acabamento e esconde pequenas falhas entre os clipes. O PicassoIA oferece vários modelos de música para gerar uma faixa a partir de um prompt de texto:
Peça um instrumental sem vocais, em andamento lento e com pouca energia. Mixe-o de 15 a 20 decibéis abaixo da voz para que as palavras continuem claras.
Verifique o resultado com transcrição
Aqui vai um ciclo de qualidade simples. Gere a fala, transcreva-a de volta para texto e compare o resultado com seu roteiro original. Nomes pronunciados errado, números omitidos e palavras perdidas aparecem como diferenças. O GPT-4o Transcribe e o Gemini 3 Pro fazem isso bem no PicassoIA, e o GPT-4o Mini Transcribe é a opção mais leve para verificações rápidas.
O mesmo ciclo funciona em produção. Amostre uma pequena parte do áudio gerado, transcreva-a e sinalize os clipes que se afastam do texto original. Custa pouco e pega problemas antes que os clientes os percebam.
Teste suas próprias vozes no Picasso IA
A melhor forma de escolher uma API de texto para fala é ouvir. Pegue um parágrafo real do seu projeto e rode-o pelo Gemini 3.1 Flash TTS, pelo ElevenLabs V3 e pelo Flash v2.5 no Picasso IA. Adicione uma base musical com o Lyria 3 Pro e depois transcreva o resultado com o GPT-4o Transcribe para confirmar que cada palavra foi preservada.
O Picasso IA também gera imagens e vídeos, então a mesma conta pode produzir a miniatura, a narração e a trilha do seu próximo lançamento. Abra a plataforma, cole um roteiro e clique em gerar. Dez minutos de teste vão responder à pergunta que uma dúzia de artigos comparativos não consegue.