Como usar o ElevenLabs para geração de voz gratuita sem gastar nada

Um passo a passo completo das ferramentas gratuitas de geração de voz do ElevenLabs: criação de conta, limites mensais de caracteres, clonagem de voz instantânea, integração com a API e as melhores alternativas gratuitas quando 10.000 caracteres por mês não são suficientes.

Como usar o ElevenLabs para geração de voz gratuita sem gastar nada
Cristian Da Conceicao
Fundador do Picasso IA

A diferença entre a síntese de voz robótica e vozes que realmente enganam as pessoas desapareceu há alguns anos. O ElevenLabs fez mais do que fechar essa diferença: alargou o caminho do outro lado. O problema é que a maioria das pessoas esbarra no teto do plano gratuito antes de descobrir o que essa tecnologia realmente faz. Este artigo mostra exatamente como usar o ElevenLabs para geração de voz gratuita, o que os limites significam na prática e para onde ir quando 10.000 caracteres por mês não são suficientes.

O que o plano gratuito do ElevenLabs realmente inclui

O ElevenLabs oferece um plano gratuito que é realmente útil, não apenas uma demonstração. Veja o que você recebe sem informar um cartão de crédito:

A cota de caracteres

O plano gratuito inclui 10.000 caracteres por mês. Parece muito. Na prática, 10.000 caracteres equivalem aproximadamente a:

  • 1.500 a 1.700 palavras de conteúdo narrado
  • Um episódio de podcast de 7 a 10 minutos
  • Cerca de 12 a 15 narrações curtas para redes sociais (60 a 80 palavras cada)

Quando você esgota os caracteres, a geração para até a renovação mensal. O contador é renovado no mesmo dia do calendário em que você criou sua conta, e não no dia 1º do mês.

Opções de voz sem custo

O plano gratuito dá acesso a:

  • Mais de 30 vozes prontas de diferentes idades, gêneros e sotaques
  • Clonagem de voz instantânea: até 3 vozes personalizadas
  • 10 idiomas para geração padrão
  • Áudio de qualidade padrão (MP3 a 128 kbps)

O que o plano gratuito NÃO inclui: clonagem de voz profissional (modelo de alta fidelidade), direitos de licença comercial, Projects (ferramenta de audiolivros em formato longo), Dubbing e formatos de áudio de qualidade superior, como PCM ou FLAC.

O que você não pode fazer de graça

RecursoGratuitoStarter (US$ 5/mês)Creator (US$ 22/mês)
Caracteres/mês10.00030.000100.000
Licença comercialNãoSimSim
Clonagem de voz profissionalNãoNãoSim
Qualidade de áudio128 kbps192 kbps192 kbps
Ferramenta ProjectsNãoNãoSim

A diferença na licença comercial é a que mais pesa. Tudo o que você gera no plano gratuito tecnicamente não pode ser usado em produtos pagos, trabalhos para clientes ou conteúdo monetizado.

Como configurar sua conta gratuita do ElevenLabs

A configuração leva cerca de dois minutos.

Mulher criando uma conta em um laptop sobre uma mesa de madeira creme

Criação de conta passo a passo

  1. Acesse elevenlabs.io e clique em Sign Up
  2. Informe seu e-mail ou use o login com Google/GitHub (OAuth)
  3. Confirme seu e-mail pelo link de verificação
  4. Faça login e você vai direto para a página Speech Synthesis

Nenhum cartão de crédito é exigido nesta etapa. A plataforma não pede dados de pagamento até que você escolha fazer upgrade.

Escolhendo sua primeira voz

A biblioteca de vozes no painel da esquerda organiza por:

  • Gênero: Masculino, Feminino, Não binário
  • Idade: Jovem, Meia-idade, Idoso
  • Sotaque: Americano, Britânico, Australiano, Indiano e outros
  • Uso: Narração, Notícias, Conversacional, Personagens

💡 Filtre por "Conversational" para conteúdo de redes sociais e por "Narration" para roteiros longos. A categoria "News" tende a soar mais neutra e autoritativa para conteúdo informativo.

Gerando sua primeira voz gratuita

Painel de cota de áudio em uma tela de MacBook sobre uma mesa creme

A interface de texto para fala

A interface principal é simples. Cole seu roteiro na grande área de texto, selecione uma voz na barra lateral e clique em Generate. A verdadeira sutileza está no painel de configurações abaixo da caixa de texto:

  • Stability: Controla o quanto a voz soa consistente entre as frases. Valores mais baixos deixam a voz mais expressiva, valores mais altos a deixam mais monótona. Um ajuste entre 0,5 e 0,65 é um bom ponto de partida.
  • Similarity Enhancement: O quanto a saída se parece com a amostra de voz original. Mantenha acima de 0,75 para melhores resultados.
  • Style Exaggeration: Amplifica o estilo natural da voz. Útil para narrações dramáticas, arriscado para conteúdo empresarial.

Ajustando as configurações de voz

A maioria dos iniciantes ignora esses controles e se pergunta por que a saída soa sem vida. Stability é o que tem o maior impacto. Se sua voz soar robótica e uniforme, reduza para perto de 0,4. Se soar irregular e imprevisível, suba para perto de 0,8.

💡 Adicione pausas naturais ao seu roteiro usando reticências ... ou um ponto seguido de espaço. Nos planos pagos, a sintaxe SSML como <break time="1.0s" /> funciona, mas esses truques simples de pontuação também são eficazes no plano gratuito.

Baixando seu arquivo de áudio

Depois da geração, um player de áudio verde aparece abaixo da caixa de texto. Clique no ícone Download (seta apontando para baixo) para salvar o arquivo em MP3. O arquivo recebe um nome com data e hora. Não há download em lote, então, se você gerar 10 clipes, precisará baixá-los um por vez.

Clonagem de voz gratuita no ElevenLabs

Homem falando em um microfone condensador de grande diafragma em um estúdio de gravação

A clonagem de voz é onde o ElevenLabs constrói sua reputação. Até o plano gratuito oferece a Clonagem de Voz Instantânea, que é mais impressionante do que a maioria das pessoas imagina.

Noções básicas da clonagem de voz instantânea

A Clonagem de Voz Instantânea (IVC) cria um modelo de voz a partir de uma amostra de áudio enviada por você. Ela não é tão precisa quanto o modelo de Clonagem de Voz Profissional (que exige mais de 30 minutos de áudio limpo e é um recurso pago), mas para a maioria dos casos é mais do que suficiente.

Acesse Voices > Add Voice > Instant Voice Clone e, em seguida, envie:

  • Um arquivo WAV ou MP3
  • Entre 30 segundos e 5 minutos de áudio limpo
  • Um único falante com o mínimo possível de ruído de fundo
  • Ritmo de leitura natural funciona melhor do que fala conversacional

O que você precisa

A qualidade do clone depende totalmente da qualidade do áudio de origem. Um clipe gravado em um smartphone em um cômodo silencioso supera uma gravação profissional em um espaço com eco. Música de fundo é o maior vilão da precisão do clone.

💡 Grave dentro de um armário cercado por roupas penduradas. O tecido elimina reflexões acústicas melhor do que a maioria das placas de espuma e não custa nada.

Limites do plano gratuito

No plano gratuito, você pode criar até 3 vozes clonadas. Para criar a 4ª, você precisa excluir uma das três existentes. Os clones ficam armazenados apenas na sua conta e não podem ser compartilhados publicamente. O áudio gerado a partir de uma voz clonada conta no seu limite mensal de 10.000 caracteres, da mesma forma que as vozes prontas.

Usando a API do ElevenLabs de graça

Desenvolvedor em uma estação de trabalho com dois monitores exibindo código de API

O plano gratuito inclui acesso à API. Isso surpreende muitos desenvolvedores, que presumem que APIs sempre ficam atrás de um paywall.

Limites da API gratuita

Sua chave de API gratuita compartilha a mesma cota mensal de 10.000 caracteres da interface web. Não há uma cota separada para a API. Cada caractere gerado pela API reduz o que você pode gerar no navegador, e vice-versa.

O endpoint da API para texto para fala é:

POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}

A autenticação usa o cabeçalho xi-api-key com sua chave, que você encontra na página Profile Settings.

Configuração em Python e JavaScript

Python:

import requests

url = "https://api.elevenlabs.io/v1/text-to-speech/YOUR_VOICE_ID"
headers = {
    "xi-api-key": "YOUR_API_KEY",
    "Content-Type": "application/json"
}
payload = {
    "text": "Your script here",
    "model_id": "eleven_multilingual_v2",
    "voice_settings": {"stability": 0.6, "similarity_boost": 0.8}
}
response = requests.post(url, json=payload, headers=headers)
with open("output.mp3", "wb") as f:
    f.write(response.content)

JavaScript (Node.js):

const response = await fetch(
  `https://api.elevenlabs.io/v1/text-to-speech/${voiceId}`,
  {
    method: 'POST',
    headers: { 'xi-api-key': apiKey, 'Content-Type': 'application/json' },
    body: JSON.stringify({ text: script, model_id: 'eleven_multilingual_v2' })
  }
);
const buffer = await response.arrayBuffer();

Melhores usos dentro do limite gratuito

A API sem custo é prática para:

  • Prototipagem: teste a integração de voz no seu app antes de assumir um plano pago
  • Automação de baixo volume: um script que gera uma narração diária para uma ferramenta interna
  • Projetos pessoais: clipes de introdução de podcast, sons de notificação, apps de assistente pessoal

Não construa um produto voltado ao cliente final em produção com a API gratuita. O teto de 10.000 caracteres é um bloqueio imediato, sem período de tolerância.

Quando 10.000 caracteres não são suficientes

Dois amigos ouvindo áudio juntos em um café com um MacBook

A maioria das pessoas atinge o limite gratuito mais rápido do que espera. Veja como calcular suas necessidades mensais reais e três formas de fazer sua cota durar mais.

Calculando suas necessidades mensais

Conte os caracteres dos seus roteiros, e não as palavras. Uma palavra média em inglês tem cerca de 5 caracteres, contando o espaço que vem depois dela.

Tipo de conteúdoTamanho médioCaracteres usados
Clipe social de 60 segundos~130 palavras~780 caracteres
Narração de YouTube de 5 minutos~700 palavras~4.200 caracteres
Episódio de podcast de 10 minutos~1.400 palavras~8.400 caracteres
Capítulo completo de audiolivro~3.500 palavras~21.000 caracteres

Um único episódio de podcast de 10 minutos consome 84% da sua cota mensal gratuita. Dois episódios, e você fica sem nada antes que a segunda semana do mês acabe.

Três formas de fazer o plano gratuito render mais

1. Escreva roteiros mais enxutos. Corte palavras de preenchimento antes de gerar. Cada oração desnecessária consome caracteres. Edite primeiro, gere depois.

2. Crie várias contas gratuitas. Cada novo endereço de e-mail recebe 10.000 caracteres novos. Não é elegante, mas tecnicamente está dentro dos termos de serviço para projetos pessoais. Evite essa abordagem para trabalhos comerciais.

3. Gere em lotes no início do mês. Sua cota é renovada na data de aniversário da conta. Se você gerar no dia 1, terá o mês inteiro do calendário antes da próxima renovação.

PicassoIA: vozes do ElevenLabs sem o limite mensal

Jovem mulher ouvindo com fones de ouvido em um sofá creme com um laptop

Esta é a parte que a maioria dos usuários do ElevenLabs não conhece. A PicassoIA executa os próprios modelos do ElevenLabs diretamente em sua plataforma, ao lado de uma biblioteca de mecanismos concorrentes de TTS. Em vez de atingir um teto mensal de caracteres, você paga por geração, o que sai bem mais barato para uso esporádico ou de alto volume.

ElevenLabs v3 na PicassoIA

O ElevenLabs v3 é o modelo mais expressivo do ElevenLabs, com ampla gama emocional e a prosódia mais natural de todas as versões. Na PicassoIA você o acessa diretamente, sem precisar de uma conta no ElevenLabs nem acompanhar seu contador mensal. É a melhor opção para narração em formato longo, diálogos de personagens ou qualquer conteúdo em que a emoção da voz carrega a mensagem.

ElevenLabs v2 Multilingual

O ElevenLabs v2 Multilingual oferece suporte a mais de 30 idiomas com qualidade de sotaque consistente. Se o seu conteúdo é voltado a públicos não falantes de inglês, este modelo lida com espanhol, francês, alemão, português, japonês, coreano e outros sem o sotaque de um idioma invadindo o outro, um problema que atrapalha muitos sistemas de TTS multilíngues.

Vista aérea de uma mesa mostrando a interface de seleção de modelos de voz em um laptop

ElevenLabs Flash v2.5 para velocidade

Quando o tempo de resposta importa mais do que a qualidade emocional máxima, o ElevenLabs Flash v2.5 entrega síntese quase instantânea com latência muito baixa. Ele foi feito para aplicações em tempo real: tradução ao vivo, apps interativos e cenários de streaming. A qualidade de saída continua excelente, só que não chega à profundidade emocional total do v3.

O ElevenLabs Turbo v2.5 fica entre o Flash e o v3 completo na contrapartida entre velocidade e qualidade, com suporte a 32 idiomas e geração mais rápida do que o modelo padrão.

Outros dos melhores modelos de TTS na PicassoIA

O ElevenLabs não é a única opção forte da coleção. Vários modelos superam ele em áreas específicas:

  • Minimax Speech 2.8 HD: saída de qualidade de estúdio, com um ritmo de respiração particularmente natural. Excelente para audiolivros e narrações em formato longo.
  • Gemini 3.1 Flash TTS: 30 vozes integradas em mais de 70 idiomas. O modelo do Google com a maior cobertura de idiomas entre todos os modelos.
  • Inworld Realtime TTS 2: latência abaixo de 100 ms para aplicações ao vivo. O modelo mais rápido da coleção para casos de uso em tempo real.
  • Qwen3 TTS: clonagem de voz forte, com emoção controlável, desenvolvido pela equipe de pesquisa em IA da Alibaba.
  • Chatterbox: síntese de voz com controle emocional da Resemble AI, com controle refinado sobre os parâmetros de felicidade, tristeza, raiva e entusiasmo.
  • Play Dialog: otimizado para diálogos naturais com vários falantes, ideal para conversas roteirizadas e conteúdo no estilo podcast.
  • Minimax Voice Cloning: crie uma voz de IA personalizada a partir de uma amostra curta, sem limite mensal de áudio gerado.

💡 Quando usar cada um: ElevenLabs v3 para narração emocional em inglês. Gemini 3.1 Flash TTS para escala multilíngue. Inworld Realtime TTS 2 para apps ao vivo e em tempo real. Minimax Speech 2.8 HD para resultado com qualidade de audiolivro.

Transcrevendo áudio também de graça

Smartphone exibindo uma visualização de forma de onda de áudio segurado na mão ao ar livre

A geração de voz é só metade da equação. Se você produz conteúdo em áudio, também precisa extrair texto dele, seja para legendas, reaproveitamento ou edição pela transcrição. Os modelos de fala para texto da PicassoIA também cobrem essa parte do fluxo de trabalho.

GPT-4o Transcribe na PicassoIA

O GPT-4o Transcribe é o melhor modelo de transcrição da OpenAI, com taxas de erro de palavras de última geração em diferentes sotaques e níveis variados de qualidade de áudio. Ele lida melhor com ruído de fundo, vários falantes e vocabulário técnico do que os modelos mais antigos baseados em Whisper. Para clipes de áudio curtos e médios, com menos de 30 minutos, esta é a escolha padrão.

O GPT-4o Mini Transcribe oferece precisão comparável por um custo menor, adequado para cargas de transcrição de alto volume em que você processa muitos arquivos em uma mesma sessão.

Gemini 3 Pro para gravações longas

O Gemini 3 Pro processa arquivos de áudio longos com uma janela de contexto enorme, o que o torna a escolha certa para entrevistas completas, reuniões gravadas ou episódios de podcast de uma hora. Ele também gera transcrições estruturadas, com identificação de falantes e marcações de tempo.

💡 Fluxo de trabalho: gere seu roteiro com o ElevenLabs v3 ou o Minimax Speech 2.8 HD, produza seu conteúdo e depois rode o Gemini 3 Pro sobre o áudio final para criar uma transcrição com legendas para acessibilidade e SEO.

Comece a gerar vozes reais agora mesmo

Homem profissional confiante com fones de ouvido no pescoço, perto de uma janela de escritório, segurando um café

O plano gratuito do ElevenLabs é uma ferramenta real, com qualidade de saída real. O limite de 10.000 caracteres é o teto honesto, não uma prévia limitada de propósito. Para projetos pessoais, narrações ocasionais e prototipagem com a API, ele se sustenta. Quando esse teto virar um problema, os mesmos modelos do ElevenLabs estão disponíveis na PicassoIA sem precisar fazer as contas do limite mensal, ao lado de mais de 20 outros mecanismos de TTS para todo tipo de uso.

O ponto mais amplo é que a qualidade das vozes de IA superou a imagem mental que a maioria das pessoas tem do que é a síntese de voz. A barreira para narração profissional, conteúdo multilíngue e vozes realistas de personagens agora é uma questão de saber qual modelo escolher e onde acessá-lo.

A PicassoIA reúne mais de 23 modelos de texto para fala, do ElevenLabs v3 e do Flash v2.5 ao Minimax Speech 2.8 HD, Inworld Realtime TTS 2, Gemini 3.1 Flash TTS e Chatterbox, além de três modelos de fala para texto para transcrição. Explore a coleção completa em picassoia.com/en/all-models e gere um clipe de voz que antes exigiria um estúdio profissional para ser produzido.

Compartilhe este artigo

Escolha seu idioma