Gerador de voz com IA grátis: texto para fala e vozes de personagens

Compare os geradores de voz com IA gratuitos que valem a pena para texto para fala e vozes de personagens. Veja como Speech 2.8 HD, ElevenLabs V3, Gemini 3.1 Flash TTS, Qwen3 TTS e Chatterbox lidam com narração, emoção, criação de voz e clonagem, com configurações para copiar.

Gerador de voz com IA grátis: texto para fala e vozes de personagens
Cristian Da Conceicao
Fundador do Picasso IA

Você tem um roteiro, um prazo e nenhum microfone em que confie. Talvez também tenha um personagem raposa que precisa de uma voz rouca, ou uma demonstração de produto que soa melhor falada do que escrita. Um gerador de voz com IA resolve isso: você cola o texto, escolhe uma voz e um arquivo de áudio pronto volta em segundos. As ferramentas gratuitas melhoraram de forma surpreendente no último ano, e a diferença entre uma leitura robótica e uma interpretação convincente agora depende de qual modelo você escolhe e de quais configurações você ajusta. Este artigo compara os modelos de texto para fala que valem a pena testar, mostra como as vozes de personagens são realmente criadas e percorre um modelo passo a passo para que você grave sua primeira versão hoje.

💡 Resposta rápida: Para narração simples, use o Speech 2.8 HD. Para atuação expressiva, experimente o ElevenLabs V3. Para uma voz que você inventa a partir de uma descrição escrita, use o Qwen3 TTS.

Como funcionam os geradores de voz com IA

Do roteiro ao som

Um modelo de texto para fala transforma suas palavras em áudio em três etapas gerais. Primeiro, ele converte o texto em fonemas, as pequenas unidades sonoras de um idioma. Depois, prevê como uma pessoa falaria: onde fazer pausas, qual sílaba enfatizar, como o tom sobe no fim de uma pergunta. Por fim, renderiza uma forma de onda que você pode reproduzir, baixar e levar para um editor.

Os sistemas mais antigos juntavam pequenos fragmentos gravados, e por isso soavam picotados e robóticos. Os modelos neurais modernos geram a interpretação inteira de uma vez, então a respiração, o ritmo e a emoção percorrem a frase toda, em vez de recomeçar a cada palavra.

Um jovem de moletom cinza digitando um roteiro de narração em um notebook sobre uma mesa de madeira, com luz suave da manhã

O formato de saída depende do modelo. O Speech 2.8 HD, por exemplo, exporta MP3, WAV, FLAC ou PCM bruto, então a mesma geração serve para um clipe rápido nas redes sociais ou para uma edição sem perdas.

Por que as ferramentas gratuitas são diferentes

Gratuito não significa idêntico. Quatro coisas diferenciam um gerador do outro:

  • Biblioteca de vozes: o Gemini 3.1 Flash TTS traz 30 vozes, enquanto o ElevenLabs V3 lista mais de 25 personas.
  • Alcance de idiomas: um modelo pode lidar com 10 idiomas, outro com mais de 70.
  • Controles de interpretação: predefinições de emoção, instruções de estilo em linguagem simples ou tags inseridas que marcam um sussurro ou uma risada.
  • Clonagem de voz: se você pode trazer sua própria amostra em vez de escolher em um menu.

A PicassoIA descreve a maioria dos modelos abaixo como gratuitos para testar online, então você pode passar o mesmo parágrafo por vários deles e manter aquele que se encaixa melhor.

Os melhores modelos gratuitos de texto para fala

Aqui está a comparação resumida antes dos detalhes. Cada modelo da tabela tem sua própria página com exemplos de saída.

ModeloMelhor paraControles de destaqueIdiomas
Speech 2.8 HDNarração longa10 emoções, tom, velocidade, marcadores de pausa40+ dicas de idioma
ElevenLabs V3Leituras expressivasControle deslizante de estilo, estabilidade, aumento de similaridadeDefinidos pelo código do idioma
Gemini 3.1 Flash TTSAlcance de idiomas30 vozes, tags inseridas, instrução de estilo70+ códigos de idioma
Play DialogCenas com duas pessoas15 vozes, modo de voz duplaQuase 40
Qwen3 TTSVozes inventadas e clonadas3 modos, 9 locutores predefinidos10

A melhor escolha depende do trabalho. Se o áudio é o produto, como um capítulo de audiobook ou uma aula de curso, priorize estabilidade e limites longos de entrada. Se o áudio é um momento de personagem, priorize controles de emoção e clonagem. Se você publica em vários mercados, comece pelo modelo que lista mais idiomas e verifique como ele pronuncia o nome da sua própria marca antes de se comprometer com um roteiro completo.

Speech 2.8 HD para narração

O Speech 2.8 HD é a escolha mais segura para qualquer coisa longa: vídeos explicativos, módulos de curso, capítulos de audiobook. Uma única execução aceita até 10.000 caracteres, cerca de 1.600 palavras, então um artigo completo cabe em uma só gravação.

As predefinições de emoção importam mais do que a maioria das pessoas espera. A mesma frase configurada como calma e depois como surpresa soa como dois locutores diferentes. Os estados disponíveis são auto, feliz, triste, raiva, medo, nojo, surpresa, calma, fluente e neutro.

O suporte a idiomas é o outro ponto forte. O campo language_boost lista mais de 40 opções, do inglês e do espanhol ao japonês, árabe e hindi, e melhora a pronúncia quando o roteiro usa vocabulário incomum. Defina como Automatic quando não tiver certeza, e o modelo detecta o idioma sozinho.

Um podcaster sorridente de camisa jeans falando em um microfone em um braço articulado, em uma sala com painéis acústicos verde-escuros

ElevenLabs V3 para expressão

O ElevenLabs V3 tende para a interpretação. Um controle deslizante de estilo vai de 0 a 1, da narração simples a algo mais próximo de atuação, enquanto a configuração de estabilidade faz a frase 40 soar como a frase 1.

Dois campos opcionais, texto anterior e texto seguinte, permitem que o modelo ajuste a entonação nas fronteiras entre frases. Isso ajuda quando você gera um roteiro longo em partes e quer que as emendas desapareçam. A lista de vozes até inclui uma persona de contadora de histórias chamada Grimblewood, usada no exemplo da história do dragão do próprio modelo.

Gemini 3.1 Flash para idiomas

O Gemini 3.1 Flash TTS oferece 30 vozes e mais de 70 códigos de idioma. Seu melhor recurso é a marcação inserida: escreva [whispering], [laughing], [shouting] ou [sigh] diretamente na frase e a interpretação muda naquela expressão exata.

Uma instrução de estilo separada, como "fale devagar e com confiança", define o tom geral. A entrada é limitada a 4.000 bytes, então divida um roteiro longo em seções.

💡 Teste justo: Escreva três frases, uma calma, uma animada e uma com um nome difícil de pronunciar. Passe essas mesmas linhas por todos os modelos que você considera. As diferenças aparecem em segundos.

Vozes de personagens que parecem vivas

Uma voz de personagem é uma voz com personalidade: idade, sotaque, atitude e um jeito reconhecível de reagir. Há três maneiras práticas de criar uma.

Crie uma voz com palavras

O Qwen3 TTS tem um modo de criação de voz em que você descreve o locutor em linguagem simples e o modelo gera a voz do zero. Uma descrição como "uma voz feminina calorosa e amigável, com leve sotaque britânico" basta para começar. Acrescente uma instrução de estilo, como "tom animado" ou "fale devagar e com calma", para direcionar a interpretação.

Uma receita confiável para descrições: idade, tom, sotaque, ritmo e humor, nessa ordem. "Um detetive de meia-idade cansado, grave e rouco, ritmo lento, humor seco" dá ao modelo cinco instruções claras em vez de um adjetivo vago. Execute a mesma descrição em duas falas diferentes do diálogo para confirmar que a voz se sustenta.

Prefere uma opção pronta? O mesmo modelo inclui nove locutores predefinidos: Aiden, Dylan, Eric, Ono_anna, Ryan, Serena, Sohee, Uncle_fu e Vivian.

Vista de baixo para cima de uma atriz de voz no meio da interpretação, em uma cabine acolchoada, com microfone e filtro antipop em primeiro plano

Clone uma voz a partir de um clipe

A clonagem copia o som de um locutor real para um novo texto. Dois modelos lidam bem com isso:

  • Chatterbox: clona uma voz a partir de alguns segundos de áudio de referência e acrescenta um controle deslizante de exagero (0,5 é neutro). Cada saída carrega uma marca d’água inaudível, para que o áudio continue rastreável.
  • MiniMax Voice Cloning: aceita arquivos MP3, M4A ou WAV de 10 segundos a 5 minutos, com redução de ruído opcional, e devolve um ID de voz reutilizável.

Esse ID de voz não fica preso a uma única ferramenta. O campo de voz do Speech 2.8 HD aceita um ID devolvido pelo modelo de clonagem, então uma amostra limpa pode narrar todos os roteiros que você escrever depois. Uma boa amostra tem estas características:

  • Apenas um locutor, sem música nem conversa de fundo por baixo.
  • Um ambiente silencioso e macio. Um quarto com cortinas e cama sempre vence um banheiro de azulejos.
  • Ritmo natural com frases variadas, não uma leitura monótona de uma lista.
  • Distância constante do microfone, cerca da largura de uma mão, durante toda a gravação.

Mão de uma mulher segurando um smartphone perto da boca para gravar uma amostra curta de voz, sentada em uma cama com lençóis brancos

💡 Permissão antes de tudo: Clone apenas a sua própria voz ou uma voz para a qual você tenha permissão por escrito para usar. Uma gravação curta e limpa de você mesmo também é a melhor amostra, porque você controla o ambiente e o microfone.

Dois personagens em uma cena

O Play Dialog foi feito para conversas, e não para narração. Escolha duas de suas 15 vozes, identifique as falas com Voice 1: e Voice 2:, e o modelo entrega um vaivém em uma única execução. Cada voz também recebe sua própria instrução de estilo. A cena de exemplo do modelo combina um locutor com raiva com outro culpado, e a tensão é audível.

Quer um rosto que combine com o som? Crie um retrato com o P Image e depois anime-o com um modelo de sincronização labial, como o Omni Human 1.5 ou o Fabric 1.0, que transformam uma foto e um arquivo de áudio em um vídeo falante.

Use o Speech 2.8 HD na PicassoIA

O Speech 2.8 HD é o melhor modelo para começar porque suas configurações são explícitas e cada uma faz uma única coisa. Aqui está o fluxo exato.

Passo a passo

  1. Abra a página do Speech 2.8 HD na PicassoIA.
  2. Cole seu roteiro no campo text. O limite é de 10.000 caracteres.
  3. Mantenha o voice_id no padrão Wise_Woman para um primeiro teste, ou cole um ID de voz clonada.
  4. Defina a emotion. Mantenha auto na primeira execução e compare depois com calm ou happy.
  5. Ajuste a speed (de 0,5 a 2,0) e o pitch (de menos 12 a mais 12 semitons). Os valores neutros são 1,0 e 0.
  6. Escolha um language_boost, um idioma específico ou Automatic.
  7. Escolha o audio_format: MP3 para a web, WAV ou FLAC para edição. A taxa de bits do MP3 chega a 256 kbps.
  8. Gere, ouça, mude uma configuração e execute de novo.

Vista de cima de uma mesa de madeira com um notebook, fones de estúdio, um caderno e uma xícara de café, com mãos sobre o notebook

💡 Uma mudança por execução. Se você alterar velocidade, tom e emoção ao mesmo tempo, não vai saber qual delas resolveu o problema.

Marcadores de pausa e emoção

O silêncio faz tanto trabalho quanto a fala. Insira um marcador como <#0.5#> em qualquer ponto do texto para adicionar uma pausa de meio segundo:

Welcome back.<#0.8#> Today we are testing three voices.<#0.4#> Ready?

Para uma leitura mais animada, no estilo do YouTube, a página do modelo sugere velocidade 1,2 com tom +2. Para números e datas em textos em inglês, ative o english_normalization para que "2027" e "3/4" sejam lidos como uma pessoa os diria. Isso adiciona uma pequena latência. Ative o subtitle_enable se também precisar de marcas de tempo por frase para legendas.

Configurações que mudam o som

Close extremo de uma mão deslizando um fader em uma mesa de mixagem analógica com botões cinza e marcas brancas

Velocidade e tom

A velocidade muda o quanto uma voz soa apressada ou relaxada. O tom muda a idade e o porte: valores baixos soam mais velhos e pesados, valores altos soam mais jovens e leves. Use estes como valores iniciais e depois ajuste pelo ouvido:

ObjetivoVelocidadeTomEmoção
Audiobook calmo0,90calm
Narração de vídeo mais animada1,2+2auto
Personagem tenso1,0-3fearful
Anúncio rápido de produto1,3+1fluent
Contador de histórias idoso0,85-4calm

O volume tem sua própria configuração, volume, em que 1,0 é o ganho padrão. Aumente-o apenas se a voz ficar baixa demais sob uma trilha musical, e prefira normalizar no editor quando possível. Para projetos com música, escolha WAV e uma taxa de amostragem de 44.100 Hz para que nada seja comprimido antes da mixagem final.

Prompts de emoção e estilo

Cada modelo pede a emoção de um jeito diferente, e conhecer a diferença economiza muitas tentativas:

ModeloComo você direciona a interpretação
Speech 2.8 HDLista suspensa de emoção com 10 predefinições
Gemini 3.1 Flash TTSPrompt em linguagem simples mais tags inseridas
Qwen3 TTSInstrução de estilo em texto livre
ChatterboxControle deslizante de exagero
ElevenLabs V3Controle deslizante de estilo de 0 a 1

Projetos que valem a pena

Narração e podcasts

A vitória mais rápida é transformar textos que você já tem em áudio. Cole um post de blog no Speech 2.8 HD, baixe o MP3 e publique-o como uma versão para ouvir da página. Aberturas de podcast, módulos de curso e capítulos de audiobook seguem o mesmo padrão. Troque a dica de idioma e o mesmo roteiro vira uma versão em espanhol ou japonês, sem uma nova sessão de gravação.

Uma jovem perto da janela de um trem ouvindo um audiobook com fones de ouvido, com um livro de bolso e um cachecol de lã no colo

Antes de publicar, passe o áudio por um modelo de transcrição, como o GPT 4o Transcribe ou o Gemini 3 Pro. Ler a transcrição é a forma mais rápida de identificar um nome de marca pronunciado errado.

Jogos e animação

Desenvolvedores independentes e animadores usam vozes geradas para diálogos provisórios, animatics e falas completas de personagens. Uma rotina prática: escreva uma fala e renderize-a de cinco formas com a criação de voz do Qwen3 TTS, como um garoto nervoso, um detetive cansado, um robô vendedor alegre, um ancião calmo e um rival sarcástico. Escolha a vencedora, salve a descrição e reutilize-a para cada fala daquele personagem.

Vista aérea da mesa de um ilustrador com esboços a lápis de um personagem raposa presos em fileira e um microfone no canto

Cursos e vídeos de treinamento

Conteúdos de treinamento mudam com frequência, e regravar um narrador humano sempre que um menu muda fica caro. Com uma voz gerada, você edita a frase e renderiza novamente apenas aquele parágrafo. Mantenha a mesma voz, velocidade e tom em todas as aulas para que a série soe como um só instrutor, e anote as configurações em uma folha de estilo curta.

Precisa de legendas? Ative o subtitle_enable no Speech 2.8 HD para receber marcas de tempo por frase junto com o áudio, e depois leve-as ao seu editor de vídeo. Para aulas longas, divida o roteiro por slide e use os campos de texto anterior e texto seguinte no ElevenLabs V3 para que a entonação flua de um trecho para o seguinte.

Erros que soam falsos

A maioria dos resultados robóticos vem do roteiro e das configurações, não do modelo. Fique atento a estes:

  1. Escrever para os olhos. Frases longas com três orações são difíceis de falar em voz alta. Leia o roteiro em voz alta primeiro e corte cada trecho em que você não consegue respirar.
  2. Pular a gravação de teste. Gere duas frases antes de se comprometer com 10.000 caracteres.
  3. Levar a emoção ao máximo. O Chatterbox observa que valores extremos de exagero podem ser instáveis. Comece no meio e avance em pequenos passos.
  4. Ignorar nomes e números. Reescreva nomes complicados foneticamente e ative a normalização em inglês para datas.
  5. Clonar a partir de uma amostra com ruído. Use pelo menos 10 segundos de fala limpa e ative a redução de ruído quando o ambiente tiver eco.
  6. Deixar o idioma sem definição. Um nome francês dentro de um roteiro em inglês fica melhor quando você dá ao modelo uma dica de idioma.

Um engenheiro de som de barba grisalha ouvindo com atenção em uma mesa de controle entre dois monitores de estúdio

Grave sua primeira voz hoje

Escolha um parágrafo que você já escreveu. Abra o Speech 2.8 HD, execute-o com a voz padrão e depois execute de novo com outra emoção. Quando ouvir a diferença, crie um personagem no Qwen3 TTS escrevendo uma frase que descreva quem está falando.

Tudo fica em um só lugar na PicassoIA: vozes, retratos de modelos de imagem como o P Image e vídeos de fotos falantes. Comece com uma única frase, mude uma configuração, clique em gerar e continue experimentando até que a voz soe como a pessoa que você imaginou. Seu primeiro personagem está a uma descrição de distância.

Salve as configurações que funcionaram, compartilhe o áudio com um amigo que nunca ouviu o roteiro e pergunte o que ele nota primeiro. Se ele mencionar a voz em vez das palavras, ajuste o ritmo e as pausas e execute mais uma vez.

Compartilhe este artigo

Escolha seu idioma