Alternativa ao ElevenLabs: opções gratuitas, de código aberto e clonagem de voz

Os créditos acabam rápido e os termos de licença atrapalham, então muitos criadores querem uma alternativa ao ElevenLabs. Este artigo compara ferramentas online gratuitas, motores de código aberto e opções de clonagem de voz, com configurações, notas sobre licença e sugestões para podcasts, anúncios e audiolivros.

Alternativa ao ElevenLabs: opções gratuitas, de código aberto e clonagem de voz
Cristian Da Conceicao
Fundador do Picasso IA

Pagar por um gerador de voz fica doloroso no momento em que um único capítulo de audiolivro consome todos os seus créditos do mês. É essa a história por trás da maioria das buscas por uma alternativa ao ElevenLabs: as vozes soam ótimas, mas os limites, os termos de licença e a cobrança por caractere levam as pessoas a procurar em outro lugar. A boa notícia é que o mercado já oferece opções reais. Algumas podem ser testadas gratuitamente no navegador, algumas são de código aberto e rodam na sua própria máquina, e algumas clonam uma voz a partir de um trecho de apenas dez segundos.

Este artigo organiza essas opções de acordo com o que você realmente precisa. Você verá onde os planos gratuitos deixam de ser gratuitos, quais motores de código aberto valem a pena instalar, como a clonagem de voz funciona na prática e um passo a passo com o Chatterbox no PicassoIA. Música e transcrição ficam por último, porque quase todo projeto de voz precisa dos dois, mais cedo ou mais tarde.

Por que as pessoas procuram alternativas ao ElevenLabs

O ElevenLabs construiu sua reputação. Suas vozes transmitem emoção, sua saída multilíngue é forte e seu editor é refinado. Ninguém sério contesta isso. O atrito aparece depois, quando um projeto real já está em andamento e o contador não para de correr.

Mão girando um botão de alumínio escovado em uma interface de áudio compacta

O problema dos créditos

A cobrança é baseada em créditos, e os créditos se esgotam rápido. O plano gratuito historicamente ofereceu cerca de 10.000 créditos por mês, o que equivale a aproximadamente dez minutos de fala. Um artigo de 3.000 palavras lido em voz alta leva cerca de 20 minutos em um ritmo normal de fala, então uma narração mais duas regravações esvazia a conta.

💡 Conta rápida: 150 palavras por minuto é um ritmo confortável de narração. Um roteiro de 3.000 palavras equivale a 20 minutos de áudio antes de você contar uma única regravação.

Os limites dos planos mudam com frequência, então trate qualquer número que você leia, inclusive este, como uma foto do momento e confira a página de preços atual antes de decidir.

Preocupações com licença e privacidade

Três outras queixas aparecem sempre:

  • Direitos comerciais. Os planos gratuitos costumam exigir atribuição ou bloquear o uso comercial, então um canal monetizado do YouTube acaba em um plano pago de qualquer forma.
  • Dados de voz. Enviar uma gravação sua, de um cliente ou do CEO de um cliente significa confiar na política de retenção de outra empresa.
  • Dependência. Uma voz clonada que vive dentro da conta de um fornecedor não pode ser levada para outra ferramenta.

Esses três pontos de dor explicam por que as alternativas se dividem em dois grupos: ferramentas online com limites generosos e modelos de código aberto que você controla.

Opções gratuitas que realmente funcionam

Gratuito é uma palavra escorregadia nesse mercado. Antes de investir uma tarde inteira, decida que tipo de gratuito você está escolhendo.

Apresentador de podcast rindo em um microfone dinâmico preto em uma sala cheia de estantes de livros

Planos gratuitos em ferramentas online

Um plano gratuito online oferece um começo rápido, sem nenhuma configuração. Você digita, aperta gerar e baixa. No PicassoIA você pode usar vários modelos de fala direto no navegador, incluindo o Chatterbox Turbo, o Speech 2.8 Turbo e o Gemini 3.1 Flash TTS, que oferece 30 vozes em mais de 70 idiomas. Para testes de narração, anúncios curtos e clipes para redes sociais, isso é mais que suficiente.

Os planos gratuitos online servem melhor a estes trabalhos:

  • Teste de roteiro. Ouça como um parágrafo soa antes de se comprometer com uma voz.
  • Anúncios curtos e reels. Trinta segundos de áudio raramente atingem um limite mensal.
  • Checagem de idiomas. Rode a mesma frase em três idiomas e compare.

Um fluxo de trabalho sensato combina os dois mundos. Rascunhe e teste vozes em uma ferramenta online, onde não há nada para instalar, e depois leve os trabalhos longos, como capítulos de audiolivro ou um curso completo, para um modelo de código aberto, quando já souber qual voz e quais configurações você prefere. Você gasta créditos nas decisões e não gasta nada no volume.

O que o "gratuito" costuma custar

Toda rota gratuita tem uma contrapartida. Esta tabela mostra o que você abre mão:

Rota gratuitaO que você abre mãoIdeal para
Plano gratuito onlineLimites mensais, filas mais lentas em horários de picoAnúncios curtos, testes rápidos
Código aberto na sua máquinaTempo de configuração e uma GPU capazNarração longa, áudio privado
Pesos abertos com licença não comercialO direito de monetizar a saídaProjetos de hobby, pesquisa
Vozes de sistema embutidasSom naturalAcessibilidade, rascunhos

Vozes de código aberto que você pode rodar

O código aberto inverte o modelo de custo. Você paga com tempo de configuração em vez de créditos e, depois que a instalação funciona, o milésimo minuto de áudio custa a mesma eletricidade que o primeiro.

Vista de cima de uma mesa de madeira com fones de ouvido, um caderno, um notebook e uma interface de áudio

Chatterbox e Qwen3 TTS

Dois modelos merecem um primeiro olhar, porque ambos clonam vozes e ambos podem ser testados no PicassoIA sem instalar nada.

O Chatterbox, da Resemble AI, foi lançado com licença MIT, e seus criadores o descrevem como o primeiro modelo TTS de código aberto com um controle de exagero de emoção. O Chatterbox clona uma voz a partir de alguns segundos de áudio de referência, ajusta a expressividade com um único controle deslizante e permite fixar um seed para takes repetíveis. Cada saída traz uma marca d’água inaudível, então o áudio gerado continua rastreável. Existem duas variantes para outras necessidades: o Chatterbox Turbo, para velocidade, e o Chatterbox Pro, para trabalhos de locução.

O Qwen3 TTS, da Qwen, funciona em três modos. O Qwen3 TTS oferece nove locutores predefinidos, clonagem de voz a partir de um trecho de referência mais sua transcrição, e design de voz, em que você descreve uma voz em linguagem simples, por exemplo um narrador masculino calmo com leve sotaque francês, e o modelo a constrói. Ele fala 10 idiomas, incluindo inglês, espanhol, francês, alemão, japonês e coreano, e um campo de instrução de estilo permite adicionar comandos como "fale devagar" ou "tom animado".

Motores locais que valem o teste

Se você quer tudo na sua própria máquina, estes projetos têm comunidades ativas:

  • Kokoro: um modelo pequeno, com cerca de 82 milhões de parâmetros, sob licença Apache. Ele roda rápido em um notebook modesto e soa limpo para narração, mas não clona vozes.
  • Piper: feito para uso offline e leve o bastante para um Raspberry Pi. As vozes são funcionais, não expressivas, o que combina com projetos de casa inteligente e leitores de tela.
  • XTTS-v2, da Coqui: clona uma voz a partir de cerca de seis segundos de áudio em 17 idiomas. Sua licença restringe o uso comercial, e a empresa por trás dele encerrou as atividades no início de 2024.
  • Bark: licença MIT e capaz de produzir risadas e suspiros, embora os resultados variem muito de uma execução para outra.

💡 Leia o arquivo de licença. "Aberto" às vezes significa código aberto com pesos de modelo restritos. Verifique o repositório antes de colocar áudio clonado em um canal monetizado.

Clonagem de voz sem o paywall

A clonagem de voz é o recurso pelo qual as pessoas mais pagam. O ElevenLabs costuma colocá-lo em planos pagos, e é exatamente por isso que esta seção importa para quem está de olho no orçamento.

Jovem editando uma forma de onda de áudio em um monitor largo em um home office com pouca luz

Quanto áudio você precisa

Menos do que a maioria imagina, desde que seja limpo:

  • Alguns segundos: suficiente para o Chatterbox produzir um clone reconhecível.
  • De 10 segundos a 5 minutos: a faixa aceita pelo MiniMax Voice Cloning, em arquivos MP3, M4A ou WAV de até 20 MB.
  • Trecho curto mais transcrição: o que o Qwen3 TTS pede no modo de clonagem. Digitar o que o locutor diz melhora a correspondência.

O MiniMax Voice Cloning funciona de forma diferente das outras. Você envia uma amostra uma vez, recebe um perfil de voz reutilizável e depois aplica essa voz em modelos de fala como o Speech 2.6 HD, o Speech 2.6 Turbo, o Speech 02 HD e o Speech 02 Turbo. A redução de ruído e a normalização de volume opcionais salvam gravações feitas fora de um ambiente silencioso.

Um bom trecho de referência segue cinco regras simples:

  1. Grave em um cômodo silencioso, com estofados macios.
  2. Mantenha o microfone sempre na mesma distância.
  3. Fale no seu ritmo natural, sem música por baixo.
  4. Inclua apenas um falante.
  5. Exporte um WAV limpo ou um MP3 de alta taxa de bits.

O Qwen3 TTS lida com a clonagem de um jeito um pouco diferente. Mude o modo para clonagem de voz, envie seu áudio de referência, cole o que o locutor diz em Reference Text e depois digite a nova frase que você quer ouvir. Pular a transcrição ainda funciona, mas a correspondência fica mais frouxa, especialmente em nomes e palavras incomuns. Se você não tem nenhuma amostra, o modo de design de voz permite descrever um locutor, e instruções de estilo como lento e caloroso ajustam a entrega.

Consentimento e marcas d’água

Clone apenas vozes que você possui ou para as quais tem permissão por escrito. Guarde essa permissão em arquivo e identifique o áudio sintético sempre que uma plataforma pedir. O Chatterbox ajuda nisso, porque sua marca d’água integrada mantém os clipes gerados rastreáveis sem alterar como eles soam.

Como usar o Chatterbox no PicassoIA

O Chatterbox é a resposta mais próxima de uma opção gratuita e de código aberto para clonagem de voz expressiva, então aqui está uma execução completa na sua página do modelo.

Dubladora de perfil falando em um filtro pop dentro de uma cabine acolchoada

Prepare o trecho de referência

Escolha uma gravação de 10 a 30 segundos da voz que você quer, corte o silêncio do começo e remova música ou conversas de fundo. Envie-a no campo Audio Prompt. Se deixar o campo vazio, o Chatterbox usa a voz padrão, o que é útil para um primeiro teste do seu roteiro.

Ajuste os controles deslizantes

Cole seu roteiro em Prompt e depois ajuste os controles. Os valores padrão são um ponto de partida seguro:

ConfiguraçãoPadrãoO que fazDica
Exaggeration0,5Define o quanto a entrega é expressivaExperimente 0,3 para narração calma e 0,6 a 0,7 para leituras enérgicas. Valores extremos podem soar instáveis.
CFG Weight0,5Controla o ritmoReduza para perto de 0,3 se o locutor de referência fala rápido.
Temperature0,8Define a variação entre os takesMais baixo para uma saída previsível, mais alto para mais personalidade.
Seed0Fixa o takeZero é aleatório. Quando um take soar bem, anote o seed e reutilize-o.

Mude uma configuração de cada vez, senão você nunca vai saber qual controle resolveu o problema.

Verifique o resultado

Rode a geração, ouça com fones de ouvido e compare a saída com o roteiro. Roteiros longos se comportam melhor quando você os divide em parágrafos de algumas frases cada e gera um por um. Para pegar rapidamente palavras puladas ou mal pronunciadas, passe o áudio final pelo GPT-4o Transcribe e compare o texto com o seu original.

💡 Truque para regravar: mantenha o seed, altere só o valor de exaggeration em 0,1 e gere de novo. Você obtém a mesma voz com uma interpretação levemente diferente.

Comparação lado a lado

Veja como as principais rotas se comparam, com base no que cada ferramenta documenta sobre si mesma:

OpçãoTipoClonagem de vozModelo de custoIdeal para
ElevenLabsOnlinePlanos pagosCréditos mensaisLocução multilíngue refinada
ChatterboxCódigo aberto, MITSim, a partir de alguns segundosGratuito para rodar localmenteNarração expressiva
Qwen3 TTSPesos abertosSim, mais design de vozGratuito para rodar localmenteProjetos multilíngues
MiniMax Voice CloningOnlineSim, de 10 segundos a 5 minutosServiço onlinePerfis de voz reutilizáveis
KokoroCódigo abertoNãoGratuito para rodar localmenteNarração offline rápida
PiperCódigo abertoNãoGratuito para rodar localmenteDispositivos offline
XTTS-v2Pesos abertos, não comercialSimGratuito para uso pessoalProjetos pessoais

O veredito honesto: o ElevenLabs ainda define o padrão em refinamento e cobertura de idiomas, e ninguém deveria fingir o contrário. O que mudou é a diferença. Para intros de podcast, vídeos de produto, explicações e vozes de personagens, as opções acima soam boas o suficiente para que o fator decisivo passe a ser custo, licença e controle, e não a qualidade bruta. Teste o seu próprio roteiro em duas ou três delas antes de pagar por qualquer coisa.

Monitor de estúdio com grade de tecido trançado ao lado de uma pequena suculenta

Escolha pelo caso de uso

  • Intros e outros de podcast: Chatterbox com um seed fixo mantém todos os episódios coerentes.
  • Vídeos de produto e anúncios: o Speech 2.8 HD visa locuções com qualidade de estúdio.
  • Conteúdo multilíngue: o Qwen3 TTS e o Gemini 3.1 Flash TTS lidam bem com muitos idiomas.
  • Diálogo com duas vozes: o Play Dialog foi feito para áudio conversacional.
  • Aplicativos de baixa latência: o Realtime TTS 1.5 Max visa respostas abaixo de 200 ms.
  • Continuar com as vozes do ElevenLabs: o ElevenLabs v3 e o Flash v2.5 também estão disponíveis no PicassoIA, então você pode compará-los com as alternativas em um só lugar.

Pequeno empresário gravando uma narração de produto em uma mesa de escritório bem iluminada

Além da fala: música e transcrições

O ElevenLabs também vende geração de música e transcrição, então uma alternativa justa precisa dar conta desses trabalhos também. Os dois estão disponíveis no PicassoIA.

Música sem dores de cabeça de licenciamento

Uma locução muitas vezes precisa de uma base musical por baixo. Estes modelos geram a música a partir de um prompt de texto:

  • O Music 2.6, da MiniMax, escreve músicas completas, com vocais.
  • O Lyria 3 Pro, do Google, cria músicas de duração completa.
  • O Stable Audio 2.5 compõe música a partir de uma descrição em texto, o que combina com fundos instrumentais.
  • O ElevenLabs Music está aí se você quiser ficar nesse ecossistema.

Musicista mulher tocando um violão acústico ao lado de um microfone condensador em um estúdio caseiro

Transcreva o áudio de volta para texto

A transcrição fecha o ciclo. O GPT-4o Transcribe aceita arquivos MP3, MP4, WAV, M4A, OGG e WebM, recebe um código de idioma ISO para maior precisão e aceita um prompt curto de estilo. O GPT-4o Mini Transcribe é a opção mais leve, e o Gemini 3 Pro também gera transcrições precisas.

Homem idoso de cabelos grisalhos ouvindo um audiolivro com fones de ouvido em uma biblioteca

Os usos práticos incluem:

  • Verificar se uma voz clonada leu seu roteiro palavra por palavra.
  • Adicionar legendas a um vídeo narrado.
  • Transformar episódios de podcast em artigos escritos.
  • Registrar entrevistas gravadas em um celular.

Crie sua primeira locução hoje

Você não precisa de uma assinatura mensal para obter uma voz sintética convincente. Escolha um roteiro curto, clone uma voz com o Chatterbox ou o MiniMax Voice Cloning, coloque por baixo uma faixa do Stable Audio 2.5 e confira o resultado com o GPT-4o Transcribe. Esse fluxo leva minutos, não uma tarde inteira.

O Picasso IA reúne modelos de fala, música e transcrição em um só lugar, para que você possa compará-los com o seu próprio roteiro em vez de confiar em uma ficha técnica. Abra a lista completa de modelos, grave uma amostra de dez segundos e ouça o que a sua voz faz com um parágrafo novo. Experimente os controles deslizantes, teste uma segunda voz e fique com o take que mais parecer com você.

Compartilhe este artigo

Escolha seu idioma