ElevenLabs v4: novidades para vozes e para a API

A ElevenLabs lançou o Eleven v4 e o v4 Turbo em 28 de setembro de 2026. Este artigo detalha os mais de 90 idiomas, as tags de áudio empilháveis, a clonagem de voz a partir de 10 segundos, os novos IDs de modelo, a latência e os preços, e depois mostra como rascunhar roteiros com o ElevenLabs v3 no PicassoIA hoje.

ElevenLabs v4: novidades para vozes e para a API
Cristian Da Conceicao
Fundador do Picasso IA

Em 28 de setembro de 2026, a ElevenLabs lançou dois modelos de fala ao mesmo tempo: Eleven v4 e Eleven v4 Turbo. Se você desenvolve recursos de voz, narra vídeos ou apresenta um podcast, a versão curta é esta: mais idiomas, tags de áudio que você pode empilhar, um limite de requisição maior e um modelo rápido voltado para agentes de voz em tempo real. A versão longa vem a seguir, com os números, as mudanças na API e uma forma prática de ensaiar seus roteiros hoje.

💡 Atenção: A ElevenLabs está com um desconto de lançamento de duas semanas na API, que termina em 12 de outubro de 2026. Se você pretende testar o v4 em grande volume, essa data importa mais do que qualquer recurso desta página.

O que é de fato o Eleven v4

A ElevenLabs anunciou os dois modelos no mesmo dia, e ambos estão disponíveis na sua plataforma de agentes, no seu estúdio criativo e na API pública. A proposta é simples: vozes que soam como uma pessoa atuando, e não como uma pessoa lendo.

O Eleven v4 é o modelo expressivo. É o que você escolhe quando a interpretação importa: audiolivros, trailers, diálogos de personagens, anúncios. O Eleven v4 Turbo abre mão de um pouco de amplitude em troca de velocidade. Ele foi feito para agentes de voz, o tipo de produto em que uma pausa de meio segundo faz quem está ligando se perguntar se a linha caiu.

Os dois seguem o Eleven v3, que já aceitava tags de áudio inline. O v4 mantém essa ideia e ataca os pontos fracos: vozes que perdem consistência em leituras longas, uma lista de idiomas que parava em cerca de 70 e a falta de suporte para Professional Voice Clones.

Uma mesa vista de cima com notebook, roteiro impresso, fones de ouvido e café

Os números em resumo

EspecificaçãoEleven v3Eleven v4Eleven v4 Turbo
ID do modelo na APIeleven_v3eleven_v4eleven_v4_turbo
Idiomas70+90+90+
Caracteres por requisição5.00010.000Não divulgado
VelocidadePadrãoPadrãoCerca de 150 ms até a primeira fala
Feito paraNarração expressivaNarração expressiva, leituras longasAgentes de voz em tempo real

Esses dados vêm do anúncio de lançamento da ElevenLabs, da documentação dos modelos e de reportagens da primeira semana. Quando um número não aparece, é porque a empresa não o divulgou, e eu marquei como não divulgado em vez de chutar.

Vozes que se mantêm coerentes

Tags de áudio que você pode empilhar

O destaque é a direção. Você escreve as tags inline, entre colchetes, e o modelo age de acordo com elas. A ElevenLabs dá exemplos como [laughs], [said angrily in French accent], [light rain] e [phone buzzing]. Repare que a lista mistura emoção, sotaque e efeitos sonoros em uma única sintaxe.

A novidade é o empilhamento. Segundo a TechCrunch, agora você pode colocar várias tags em sequência e o modelo segue a ordem, em vez de descartar todas menos uma. Uma linha pode ficar assim:

[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.

Isso é uma ilustração do estilo, não uma cópia da documentação, então teste com as suas próprias palavras. Tags curtas e concretas tendem a ser mais seguras do que as poéticas.

Consistência em roteiros longos

Se você já gerou um capítulo em partes, conhece o problema. A linha 40 soa como um narrador diferente da linha 3. A ElevenLabs afirma que o v4 lê o tom, o ritmo e o contexto do roteiro inteiro e mantém a voz estável, mesmo quando você regenera uma única linha depois.

Há um número associado. O The Decoder informa uma pontuação de pronúncia de 91,7 por cento para o v4, contra 85,6 por cento para o v3. É um dado do fornecedor, então trate-o como uma indicação de direção, não como promessa sobre o seu roteiro.

💡 Dica: Produções longas precisam de um plano para regravações. Gere parágrafo por parágrafo, mantenha cada parágrafo abaixo do limite de caracteres e renderize de novo apenas as linhas de que você não gostou. A consistência do v4 foi pensada para tornar esse fluxo de trabalho seguro.

Um narrador masculino mais velho lendo um livro impresso em um microfone dentro de uma pequena cabine de gravação

Mais de 90 idiomas e sotaques

A lista de idiomas cresce de cerca de 70 para mais de 90. A TechCrunch observa ganhos visíveis de qualidade em japonês, português do Brasil, mandarim e cantonês, e reportagens citam idiomas recém-incluídos, como mongol e odia.

Um detalhe passa despercebido com facilidade. Vozes clonadas que falam outro idioma mantêm um sotaque nativo nesse idioma e não voltam, à medida que o texto avança, para o sotaque do falante original. Para quem faz a localização da voz de uma marca, essa é a diferença entre uma narração em espanhol convincente e uma narração americana com palavras em espanhol.

Nos rankings externos, a ElevenLabs diz que o v4 está em primeiro lugar em um leaderboard independente de fala, com pontuação Elo de 1319 relatada nos artigos de lançamento. Em testes cegos, a empresa cita cerca de 75 por cento de ouvintes que preferem o v4 a modelos concorrentes, enquanto o The Decoder coloca a faixa entre 65 e 81 por cento, dependendo do concorrente.

💡 Choque de realidade: Leaderboards usam frases de teste curtas. Rode o seu próprio roteiro, no seu idioma, antes de comprometer um projeto com qualquer modelo.

A clonagem de voz melhorou

Clones instantâneos a partir de 10 segundos

Os Instant Voice Clones precisam de apenas 10 segundos de áudio. A ElevenLabs diz que a nova arquitetura torna a clonagem mais rápida e preserva melhor a identidade da voz em um trecho mais longo. Uma biblioteca de vozes maior também ajuda: os relatos de lançamento mencionam mais de 17.500 vozes para escolher.

A qualidade desse trecho de 10 segundos define a maior parte do resultado. Grave em um cômodo silencioso, sem música nem ruído de ventilador, mantenha a mesma distância do microfone do começo ao fim e fale no seu ritmo natural, sem interpretar. Uma amostra limpa e sem graça vence uma amostra cheia de energia e ruído, sempre.

Close em ângulo baixo de um microfone de condensador com filtro pop em um estúdio revestido de madeira

Os clones profissionais voltam

O v3 não suportava Professional Voice Clones. O v4 suporta, e isso é voltado para os trabalhos de maior fidelidade: um narrador cuja voz clonada vai ler centenas de horas de áudio.

Todo clone exige consentimento verificado do dono da voz. Isso não é uma nota de rodapé. Se você clonar uma voz para um cliente, obtenha a permissão por escrito antes de enviar um único segundo de áudio.

O que muda para desenvolvedores de API

IDs de modelo e limites

Trocar de modelo é uma mudança de um único campo. Segundo a documentação da ElevenLabs, o corpo da requisição mantém a estrutura e só model_id muda:

{
  "text": "[laughs] That is not what the invoice said.",
  "model_id": "eleven_v4"
}

Use eleven_v4_turbo para a versão de baixa latência. O limite por requisição é de 10.000 caracteres, que a ElevenLabs equipara a cerca de dez minutos de áudio, o dobro dos 5.000 caracteres permitidos para eleven_v3. A saída vem em MP3, WAV/PCM ou µ-law, e o streaming bidirecional por WebSocket é suportado, o que importa se o seu texto chega token por token de um modelo de linguagem.

Os modelos mais antigos continuam disponíveis. Segundo a documentação, eleven_flash_v2_5 aceita 40.000 caracteres por requisição em 32 idiomas, com cerca de 75 ms, e eleven_multilingual_v2 suporta 29 idiomas. Você ainda pode acessar os dois no PicassoIA pelo Flash v2.5 e pelo v2 Multilingual.

Um desenvolvedor de software digitando em uma mesa com dois monitores e código desfocado nas telas

Latência e streaming

O Turbo é o destaque aqui. A ElevenLabs informa uma mediana de cerca de 150 ms até a primeira fala e uma latência mediana de inferência de cerca de 100 ms. O The Decoder compara esse valor com 262 ms do Cartesia Sonic 3.6.

Para agentes de voz, a afirmação mais interessante é sobre o momento em que o áudio começa. O modelo pode começar a produzir áudio assim que o modelo de linguagem por trás dele começa a produzir a resposta, então quem está ligando ouve a resposta enquanto o restante ainda está sendo escrito.

Duas ressalvas. A ElevenLabs não publicou um número de latência para o v4 padrão, e ainda não apareceram testes independentes de latência. Meça a partir da sua região, com o overhead da sua própria rede, porque todo número do fornecedor deixa isso de fora.

Preços e o prazo de 12 de outubro

O preço de tabela por milhão de caracteres é US$ 80 para o v4 e US$ 40 para o v4 Turbo. Até 12 de outubro de 2026, a oferta de lançamento reduz esses valores para US$ 22 e US$ 11. Veja quanto custam 100.000 caracteres, cerca de 100 minutos de fala, em cada caso:

ModeloPreço de tabelaPreço de lançamento100.000 caracteres no preço de tabela100.000 caracteres no preço de lançamento
Eleven v4US$ 80 por milhãoUS$ 22 por milhãoUS$ 8,00US$ 2,20
Eleven v4 TurboUS$ 40 por milhãoUS$ 11 por milhãoUS$ 4,00US$ 1,10

Se você está avaliando, o desconto permite fazer um teste comparativo real sem gastar muito. Se você está orçando um produto, planeje com base no preço de tabela, porque é isso que você vai pagar quando a oferta acabar.

Qual modelo para cada tarefa

Uma atendente sorridente de suporte ao cliente com fone de headset em um escritório amplo e iluminado

A melhor escolha depende da finalidade do áudio, não de qual modelo é o mais novo.

TarefaMelhor opçãoPor quê
Audiolivro ou narração longaEleven v4Consistência de voz e limite de 10.000 caracteres
Agente de voz ou bot de telefoneEleven v4 TurboCerca de 150 ms até a primeira fala
Lotes em volume, baratos e multilínguesFlash v2.540.000 caracteres por requisição e preço menor
Rascunhos expressivos que você pode rodar hojeEleven v3Disponível no PicassoIA agora
Leituras multilíngues estáveis e consolidadasv2 MultilingualUm modelo maduro com 29 idiomas

Uma divisão prática para equipes pequenas: faça o rascunho em um modelo mais rápido e barato enquanto o roteiro ainda muda, e depois gere o áudio final no modelo expressivo. O trabalho com voz fica caro quando você regenera um capítulo inteiro a cada edição, então feche as palavras primeiro e gaste os caracteres premium por último. Se o seu produto mistura as duas necessidades, como um curso narrado com um assistente de perguntas e respostas ao vivo, você pode usar o v4 nas aulas e o Turbo no assistente, já que os dois compartilham o mesmo formato de requisição.

3 erros comuns

  1. Julgar por uma frase só. Uma linha de demonstração não prova nada sobre um capítulo de 40 parágrafos. Teste o roteiro mais longo e mais complicado que você tiver.
  2. Usar o modelo expressivo para um agente em tempo real. Se quem liga está esperando, o Turbo é a ferramenta certa, mesmo que o v4 soe um pouco mais rico.
  3. Orçar pelo preço de lançamento. O desconto termina em 12 de outubro de 2026. Precifique seu projeto em US$ 80 e US$ 40 por milhão de caracteres.

Como usar o ElevenLabs v3 no PicassoIA

No momento em que escrevo, o v4 não está no catálogo do PicassoIA. O ElevenLabs v3 está, e é o parente mais próximo: mesma família, mesmo hábito de ler direções inline. Isso o torna um bom lugar para rascunhar roteiros e testar vozes enquanto o v4 chega a mais plataformas.

Passo a passo

  1. Abra a página do ElevenLabs v3 na coleção de texto para fala.
  2. Cole seu roteiro no campo Prompt.
  3. Escolha uma voz entre as 26 opções. A padrão é Rachel; entre as outras estão Aria, Roger, Sarah e James.
  4. Defina o código de idioma, por exemplo en, es ou fr.
  5. Deixe os controles deslizantes nos valores padrão na primeira execução, depois clique em gerar e ouça.
  6. Ajuste uma configuração por vez e gere de novo. Mudar três coisas de uma vez não ensina nada.

Duas mãos ajustando faders em uma mesa de mixagem analógica

Configurações que importam

ConfiguraçãoIntervaloPadrãoO que faz
Velocidade0,25 a 4,01Ritmo de toda a leitura
Estilo0,0 a 1,00Leva a entrega de neutra para teatral
Estabilidade0,0 a 1,00,5Valores mais altos mantêm a voz mais estável em um roteiro longo
Reforço de similaridade0,0 a 1,00,75Quão de perto a saída segue a voz escolhida
Texto anterior / Texto seguinteTextoVazioDá contexto ao modelo para que a entonação combine nas bordas das frases

Dois hábitos vão economizar seu tempo. Primeiro, cole o parágrafo anterior e o seguinte nos campos de contexto, para que cada trecho gerado se encaixe bem nos vizinhos. Segundo, teste tags entre colchetes, como [whispers], no prompt e ouça como o modelo as processa. É o mesmo estilo de direção em que o v4 se baseia, então a prática serve para ele também.

Para outras vozes para comparar, a mesma coleção inclui o MiniMax Speech 2.8 HD, o Gemini 3.1 Flash TTS e o Inworld Realtime TTS 2.

Além da fala: música e transcrições

Um modelo de voz raramente trabalha sozinho. A maioria dos projetos que precisam de narração também precisa de uma trilha musical, de uma transcrição ou de uma versão traduzida. As três opções estão no PicassoIA.

Compor com o ElevenLabs Music

O ElevenLabs Music transforma um prompt de texto em uma música. Para trabalhos de narração, peça algo instrumental, constante e com pouca presença no mix. Descreva o clima, o andamento e os instrumentos em palavras simples, como "violão acústico lento, sala acolhedora, sem vocais, 70 BPM". Se quiser comparar, o Lyria 3 Pro e o Music 2.6 aceitam o mesmo tipo de prompt.

Um músico ao lado de um violão acústico ajustando um sintetizador em um pequeno estúdio caseiro

Transcrever com GPT-4o ou Gemini

Depois que a narração existe, você precisa de legendas e de um registro em texto. O GPT-4o Transcribe transforma áudio em texto, e o GPT-4o Mini Transcribe é a opção mais leve para rascunhos rápidos. O Gemini 3 Pro é um terceiro caminho, útil quando você quer comparar como cada modelo lida com nomes e números.

Um truque útil: transcreva a narração gerada e compare com o roteiro original. Qualquer diferença aponta para uma palavra em que a voz tropeçou, e você pode corrigi-la com um ajuste na grafia ou uma dica de pronúncia.

Dublar vídeos em mais de 90 idiomas

O ElevenLabs Dubbing pega um vídeo pronto e produz versões em outros idiomas. Ele combina naturalmente com a lista maior de idiomas do v4, já que a localização é onde a consistência de voz rende mais.

Uma jovem falando em um microfone enquanto assiste a uma cena de filme em um estúdio de dublagem

Sua vez de experimentar

A melhor forma de avaliar um modelo de voz é dar a ele o seu roteiro e ouvir. Você não precisa de um estúdio, de uma verba nem de uma semana de configuração para começar.

Aqui vai um plano para uma tarde:

  • Escreva um roteiro de 150 palavras com uma virada emocional no meio.
  • Renderize no ElevenLabs v3 com três vozes diferentes e uma mudança no controle deslizante de estilo.
  • Adicione uma trilha musical do ElevenLabs Music.
  • Transcreva o resultado com o GPT-4o Transcribe e confira as palavras com o seu roteiro.

Quando o v4 chegar à plataforma que você escolheu, você já vai saber quais tags, vozes e configurações combinam com o seu material, e poderá orçar com segurança a partir dos preços de tabela.

Abra o Picasso IA e teste seu primeiro roteiro hoje. Escolha uma voz, adicione uma tag empilhada e ouça a diferença que a direção faz.

Dois amigos rindo enquanto gravam um podcast em uma mesa redonda de madeira

Compartilhe este artigo

Escolha seu idioma