Como usar o ElevenLabs para geração de voz gratuita sem gastar nada
Um passo a passo completo das ferramentas gratuitas de geração de voz do ElevenLabs: criação de conta, limites mensais de caracteres, clonagem de voz instantânea, integração com a API e as melhores alternativas gratuitas quando 10.000 caracteres por mês não são suficientes.
A diferença entre a síntese de voz robótica e vozes que realmente enganam as pessoas desapareceu há alguns anos. O ElevenLabs fez mais do que fechar essa diferença: alargou o caminho do outro lado. O problema é que a maioria das pessoas esbarra no teto do plano gratuito antes de descobrir o que essa tecnologia realmente faz. Este artigo mostra exatamente como usar o ElevenLabs para geração de voz gratuita, o que os limites significam na prática e para onde ir quando 10.000 caracteres por mês não são suficientes.
O que o plano gratuito do ElevenLabs realmente inclui
O ElevenLabs oferece um plano gratuito que é realmente útil, não apenas uma demonstração. Veja o que você recebe sem informar um cartão de crédito:
A cota de caracteres
O plano gratuito inclui 10.000 caracteres por mês. Parece muito. Na prática, 10.000 caracteres equivalem aproximadamente a:
1.500 a 1.700 palavras de conteúdo narrado
Um episódio de podcast de 7 a 10 minutos
Cerca de 12 a 15 narrações curtas para redes sociais (60 a 80 palavras cada)
Quando você esgota os caracteres, a geração para até a renovação mensal. O contador é renovado no mesmo dia do calendário em que você criou sua conta, e não no dia 1º do mês.
Opções de voz sem custo
O plano gratuito dá acesso a:
Mais de 30 vozes prontas de diferentes idades, gêneros e sotaques
Clonagem de voz instantânea: até 3 vozes personalizadas
10 idiomas para geração padrão
Áudio de qualidade padrão (MP3 a 128 kbps)
O que o plano gratuito NÃO inclui: clonagem de voz profissional (modelo de alta fidelidade), direitos de licença comercial, Projects (ferramenta de audiolivros em formato longo), Dubbing e formatos de áudio de qualidade superior, como PCM ou FLAC.
O que você não pode fazer de graça
Recurso
Gratuito
Starter (US$ 5/mês)
Creator (US$ 22/mês)
Caracteres/mês
10.000
30.000
100.000
Licença comercial
Não
Sim
Sim
Clonagem de voz profissional
Não
Não
Sim
Qualidade de áudio
128 kbps
192 kbps
192 kbps
Ferramenta Projects
Não
Não
Sim
A diferença na licença comercial é a que mais pesa. Tudo o que você gera no plano gratuito tecnicamente não pode ser usado em produtos pagos, trabalhos para clientes ou conteúdo monetizado.
Como configurar sua conta gratuita do ElevenLabs
A configuração leva cerca de dois minutos.
Criação de conta passo a passo
Acesse elevenlabs.io e clique em Sign Up
Informe seu e-mail ou use o login com Google/GitHub (OAuth)
Confirme seu e-mail pelo link de verificação
Faça login e você vai direto para a página Speech Synthesis
Nenhum cartão de crédito é exigido nesta etapa. A plataforma não pede dados de pagamento até que você escolha fazer upgrade.
Escolhendo sua primeira voz
A biblioteca de vozes no painel da esquerda organiza por:
Gênero: Masculino, Feminino, Não binário
Idade: Jovem, Meia-idade, Idoso
Sotaque: Americano, Britânico, Australiano, Indiano e outros
💡 Filtre por "Conversational" para conteúdo de redes sociais e por "Narration" para roteiros longos. A categoria "News" tende a soar mais neutra e autoritativa para conteúdo informativo.
Gerando sua primeira voz gratuita
A interface de texto para fala
A interface principal é simples. Cole seu roteiro na grande área de texto, selecione uma voz na barra lateral e clique em Generate. A verdadeira sutileza está no painel de configurações abaixo da caixa de texto:
Stability: Controla o quanto a voz soa consistente entre as frases. Valores mais baixos deixam a voz mais expressiva, valores mais altos a deixam mais monótona. Um ajuste entre 0,5 e 0,65 é um bom ponto de partida.
Similarity Enhancement: O quanto a saída se parece com a amostra de voz original. Mantenha acima de 0,75 para melhores resultados.
Style Exaggeration: Amplifica o estilo natural da voz. Útil para narrações dramáticas, arriscado para conteúdo empresarial.
Ajustando as configurações de voz
A maioria dos iniciantes ignora esses controles e se pergunta por que a saída soa sem vida. Stability é o que tem o maior impacto. Se sua voz soar robótica e uniforme, reduza para perto de 0,4. Se soar irregular e imprevisível, suba para perto de 0,8.
💡 Adicione pausas naturais ao seu roteiro usando reticências ... ou um ponto seguido de espaço. Nos planos pagos, a sintaxe SSML como <break time="1.0s" /> funciona, mas esses truques simples de pontuação também são eficazes no plano gratuito.
Baixando seu arquivo de áudio
Depois da geração, um player de áudio verde aparece abaixo da caixa de texto. Clique no ícone Download (seta apontando para baixo) para salvar o arquivo em MP3. O arquivo recebe um nome com data e hora. Não há download em lote, então, se você gerar 10 clipes, precisará baixá-los um por vez.
Clonagem de voz gratuita no ElevenLabs
A clonagem de voz é onde o ElevenLabs constrói sua reputação. Até o plano gratuito oferece a Clonagem de Voz Instantânea, que é mais impressionante do que a maioria das pessoas imagina.
Noções básicas da clonagem de voz instantânea
A Clonagem de Voz Instantânea (IVC) cria um modelo de voz a partir de uma amostra de áudio enviada por você. Ela não é tão precisa quanto o modelo de Clonagem de Voz Profissional (que exige mais de 30 minutos de áudio limpo e é um recurso pago), mas para a maioria dos casos é mais do que suficiente.
Acesse Voices > Add Voice > Instant Voice Clone e, em seguida, envie:
Um arquivo WAV ou MP3
Entre 30 segundos e 5 minutos de áudio limpo
Um único falante com o mínimo possível de ruído de fundo
Ritmo de leitura natural funciona melhor do que fala conversacional
O que você precisa
A qualidade do clone depende totalmente da qualidade do áudio de origem. Um clipe gravado em um smartphone em um cômodo silencioso supera uma gravação profissional em um espaço com eco. Música de fundo é o maior vilão da precisão do clone.
💡 Grave dentro de um armário cercado por roupas penduradas. O tecido elimina reflexões acústicas melhor do que a maioria das placas de espuma e não custa nada.
Limites do plano gratuito
No plano gratuito, você pode criar até 3 vozes clonadas. Para criar a 4ª, você precisa excluir uma das três existentes. Os clones ficam armazenados apenas na sua conta e não podem ser compartilhados publicamente. O áudio gerado a partir de uma voz clonada conta no seu limite mensal de 10.000 caracteres, da mesma forma que as vozes prontas.
Usando a API do ElevenLabs de graça
O plano gratuito inclui acesso à API. Isso surpreende muitos desenvolvedores, que presumem que APIs sempre ficam atrás de um paywall.
Limites da API gratuita
Sua chave de API gratuita compartilha a mesma cota mensal de 10.000 caracteres da interface web. Não há uma cota separada para a API. Cada caractere gerado pela API reduz o que você pode gerar no navegador, e vice-versa.
O endpoint da API para texto para fala é:
POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}
A autenticação usa o cabeçalho xi-api-key com sua chave, que você encontra na página Profile Settings.
Prototipagem: teste a integração de voz no seu app antes de assumir um plano pago
Automação de baixo volume: um script que gera uma narração diária para uma ferramenta interna
Projetos pessoais: clipes de introdução de podcast, sons de notificação, apps de assistente pessoal
Não construa um produto voltado ao cliente final em produção com a API gratuita. O teto de 10.000 caracteres é um bloqueio imediato, sem período de tolerância.
Quando 10.000 caracteres não são suficientes
A maioria das pessoas atinge o limite gratuito mais rápido do que espera. Veja como calcular suas necessidades mensais reais e três formas de fazer sua cota durar mais.
Calculando suas necessidades mensais
Conte os caracteres dos seus roteiros, e não as palavras. Uma palavra média em inglês tem cerca de 5 caracteres, contando o espaço que vem depois dela.
Tipo de conteúdo
Tamanho médio
Caracteres usados
Clipe social de 60 segundos
~130 palavras
~780 caracteres
Narração de YouTube de 5 minutos
~700 palavras
~4.200 caracteres
Episódio de podcast de 10 minutos
~1.400 palavras
~8.400 caracteres
Capítulo completo de audiolivro
~3.500 palavras
~21.000 caracteres
Um único episódio de podcast de 10 minutos consome 84% da sua cota mensal gratuita. Dois episódios, e você fica sem nada antes que a segunda semana do mês acabe.
Três formas de fazer o plano gratuito render mais
1. Escreva roteiros mais enxutos. Corte palavras de preenchimento antes de gerar. Cada oração desnecessária consome caracteres. Edite primeiro, gere depois.
2. Crie várias contas gratuitas. Cada novo endereço de e-mail recebe 10.000 caracteres novos. Não é elegante, mas tecnicamente está dentro dos termos de serviço para projetos pessoais. Evite essa abordagem para trabalhos comerciais.
3. Gere em lotes no início do mês. Sua cota é renovada na data de aniversário da conta. Se você gerar no dia 1, terá o mês inteiro do calendário antes da próxima renovação.
PicassoIA: vozes do ElevenLabs sem o limite mensal
Esta é a parte que a maioria dos usuários do ElevenLabs não conhece. A PicassoIA executa os próprios modelos do ElevenLabs diretamente em sua plataforma, ao lado de uma biblioteca de mecanismos concorrentes de TTS. Em vez de atingir um teto mensal de caracteres, você paga por geração, o que sai bem mais barato para uso esporádico ou de alto volume.
ElevenLabs v3 na PicassoIA
O ElevenLabs v3 é o modelo mais expressivo do ElevenLabs, com ampla gama emocional e a prosódia mais natural de todas as versões. Na PicassoIA você o acessa diretamente, sem precisar de uma conta no ElevenLabs nem acompanhar seu contador mensal. É a melhor opção para narração em formato longo, diálogos de personagens ou qualquer conteúdo em que a emoção da voz carrega a mensagem.
ElevenLabs v2 Multilingual
O ElevenLabs v2 Multilingual oferece suporte a mais de 30 idiomas com qualidade de sotaque consistente. Se o seu conteúdo é voltado a públicos não falantes de inglês, este modelo lida com espanhol, francês, alemão, português, japonês, coreano e outros sem o sotaque de um idioma invadindo o outro, um problema que atrapalha muitos sistemas de TTS multilíngues.
ElevenLabs Flash v2.5 para velocidade
Quando o tempo de resposta importa mais do que a qualidade emocional máxima, o ElevenLabs Flash v2.5 entrega síntese quase instantânea com latência muito baixa. Ele foi feito para aplicações em tempo real: tradução ao vivo, apps interativos e cenários de streaming. A qualidade de saída continua excelente, só que não chega à profundidade emocional total do v3.
O ElevenLabs Turbo v2.5 fica entre o Flash e o v3 completo na contrapartida entre velocidade e qualidade, com suporte a 32 idiomas e geração mais rápida do que o modelo padrão.
Outros dos melhores modelos de TTS na PicassoIA
O ElevenLabs não é a única opção forte da coleção. Vários modelos superam ele em áreas específicas:
Minimax Speech 2.8 HD: saída de qualidade de estúdio, com um ritmo de respiração particularmente natural. Excelente para audiolivros e narrações em formato longo.
Gemini 3.1 Flash TTS: 30 vozes integradas em mais de 70 idiomas. O modelo do Google com a maior cobertura de idiomas entre todos os modelos.
Inworld Realtime TTS 2: latência abaixo de 100 ms para aplicações ao vivo. O modelo mais rápido da coleção para casos de uso em tempo real.
Qwen3 TTS: clonagem de voz forte, com emoção controlável, desenvolvido pela equipe de pesquisa em IA da Alibaba.
Chatterbox: síntese de voz com controle emocional da Resemble AI, com controle refinado sobre os parâmetros de felicidade, tristeza, raiva e entusiasmo.
Play Dialog: otimizado para diálogos naturais com vários falantes, ideal para conversas roteirizadas e conteúdo no estilo podcast.
Minimax Voice Cloning: crie uma voz de IA personalizada a partir de uma amostra curta, sem limite mensal de áudio gerado.
A geração de voz é só metade da equação. Se você produz conteúdo em áudio, também precisa extrair texto dele, seja para legendas, reaproveitamento ou edição pela transcrição. Os modelos de fala para texto da PicassoIA também cobrem essa parte do fluxo de trabalho.
GPT-4o Transcribe na PicassoIA
O GPT-4o Transcribe é o melhor modelo de transcrição da OpenAI, com taxas de erro de palavras de última geração em diferentes sotaques e níveis variados de qualidade de áudio. Ele lida melhor com ruído de fundo, vários falantes e vocabulário técnico do que os modelos mais antigos baseados em Whisper. Para clipes de áudio curtos e médios, com menos de 30 minutos, esta é a escolha padrão.
O GPT-4o Mini Transcribe oferece precisão comparável por um custo menor, adequado para cargas de transcrição de alto volume em que você processa muitos arquivos em uma mesma sessão.
Gemini 3 Pro para gravações longas
O Gemini 3 Pro processa arquivos de áudio longos com uma janela de contexto enorme, o que o torna a escolha certa para entrevistas completas, reuniões gravadas ou episódios de podcast de uma hora. Ele também gera transcrições estruturadas, com identificação de falantes e marcações de tempo.
💡 Fluxo de trabalho: gere seu roteiro com o ElevenLabs v3 ou o Minimax Speech 2.8 HD, produza seu conteúdo e depois rode o Gemini 3 Pro sobre o áudio final para criar uma transcrição com legendas para acessibilidade e SEO.
Comece a gerar vozes reais agora mesmo
O plano gratuito do ElevenLabs é uma ferramenta real, com qualidade de saída real. O limite de 10.000 caracteres é o teto honesto, não uma prévia limitada de propósito. Para projetos pessoais, narrações ocasionais e prototipagem com a API, ele se sustenta. Quando esse teto virar um problema, os mesmos modelos do ElevenLabs estão disponíveis na PicassoIA sem precisar fazer as contas do limite mensal, ao lado de mais de 20 outros mecanismos de TTS para todo tipo de uso.
O ponto mais amplo é que a qualidade das vozes de IA superou a imagem mental que a maioria das pessoas tem do que é a síntese de voz. A barreira para narração profissional, conteúdo multilíngue e vozes realistas de personagens agora é uma questão de saber qual modelo escolher e onde acessá-lo.