A ElevenLabs lançou o Eleven v4 e o v4 Turbo em 28 de setembro de 2026. Este artigo detalha os mais de 90 idiomas, as tags de áudio empilháveis, a clonagem de voz a partir de 10 segundos, os novos IDs de modelo, a latência e os preços, e depois mostra como rascunhar roteiros com o ElevenLabs v3 no PicassoIA hoje.
Em 28 de setembro de 2026, a ElevenLabs lançou dois modelos de fala ao mesmo tempo: Eleven v4 e Eleven v4 Turbo. Se você desenvolve recursos de voz, narra vídeos ou apresenta um podcast, a versão curta é esta: mais idiomas, tags de áudio que você pode empilhar, um limite de requisição maior e um modelo rápido voltado para agentes de voz em tempo real. A versão longa vem a seguir, com os números, as mudanças na API e uma forma prática de ensaiar seus roteiros hoje.
💡 Atenção: A ElevenLabs está com um desconto de lançamento de duas semanas na API, que termina em 12 de outubro de 2026. Se você pretende testar o v4 em grande volume, essa data importa mais do que qualquer recurso desta página.
O que é de fato o Eleven v4
A ElevenLabs anunciou os dois modelos no mesmo dia, e ambos estão disponíveis na sua plataforma de agentes, no seu estúdio criativo e na API pública. A proposta é simples: vozes que soam como uma pessoa atuando, e não como uma pessoa lendo.
O Eleven v4 é o modelo expressivo. É o que você escolhe quando a interpretação importa: audiolivros, trailers, diálogos de personagens, anúncios. O Eleven v4 Turbo abre mão de um pouco de amplitude em troca de velocidade. Ele foi feito para agentes de voz, o tipo de produto em que uma pausa de meio segundo faz quem está ligando se perguntar se a linha caiu.
Os dois seguem o Eleven v3, que já aceitava tags de áudio inline. O v4 mantém essa ideia e ataca os pontos fracos: vozes que perdem consistência em leituras longas, uma lista de idiomas que parava em cerca de 70 e a falta de suporte para Professional Voice Clones.
Esses dados vêm do anúncio de lançamento da ElevenLabs, da documentação dos modelos e de reportagens da primeira semana. Quando um número não aparece, é porque a empresa não o divulgou, e eu marquei como não divulgado em vez de chutar.
Vozes que se mantêm coerentes
Tags de áudio que você pode empilhar
O destaque é a direção. Você escreve as tags inline, entre colchetes, e o modelo age de acordo com elas. A ElevenLabs dá exemplos como [laughs], [said angrily in French accent], [light rain] e [phone buzzing]. Repare que a lista mistura emoção, sotaque e efeitos sonoros em uma única sintaxe.
A novidade é o empilhamento. Segundo a TechCrunch, agora você pode colocar várias tags em sequência e o modelo segue a ordem, em vez de descartar todas menos uma. Uma linha pode ficar assim:
[whispers] The door was already open. [footsteps] [light rain] Somebody had been here.
Isso é uma ilustração do estilo, não uma cópia da documentação, então teste com as suas próprias palavras. Tags curtas e concretas tendem a ser mais seguras do que as poéticas.
Consistência em roteiros longos
Se você já gerou um capítulo em partes, conhece o problema. A linha 40 soa como um narrador diferente da linha 3. A ElevenLabs afirma que o v4 lê o tom, o ritmo e o contexto do roteiro inteiro e mantém a voz estável, mesmo quando você regenera uma única linha depois.
Há um número associado. O The Decoder informa uma pontuação de pronúncia de 91,7 por cento para o v4, contra 85,6 por cento para o v3. É um dado do fornecedor, então trate-o como uma indicação de direção, não como promessa sobre o seu roteiro.
💡 Dica: Produções longas precisam de um plano para regravações. Gere parágrafo por parágrafo, mantenha cada parágrafo abaixo do limite de caracteres e renderize de novo apenas as linhas de que você não gostou. A consistência do v4 foi pensada para tornar esse fluxo de trabalho seguro.
Mais de 90 idiomas e sotaques
A lista de idiomas cresce de cerca de 70 para mais de 90. A TechCrunch observa ganhos visíveis de qualidade em japonês, português do Brasil, mandarim e cantonês, e reportagens citam idiomas recém-incluídos, como mongol e odia.
Um detalhe passa despercebido com facilidade. Vozes clonadas que falam outro idioma mantêm um sotaque nativo nesse idioma e não voltam, à medida que o texto avança, para o sotaque do falante original. Para quem faz a localização da voz de uma marca, essa é a diferença entre uma narração em espanhol convincente e uma narração americana com palavras em espanhol.
Nos rankings externos, a ElevenLabs diz que o v4 está em primeiro lugar em um leaderboard independente de fala, com pontuação Elo de 1319 relatada nos artigos de lançamento. Em testes cegos, a empresa cita cerca de 75 por cento de ouvintes que preferem o v4 a modelos concorrentes, enquanto o The Decoder coloca a faixa entre 65 e 81 por cento, dependendo do concorrente.
💡 Choque de realidade: Leaderboards usam frases de teste curtas. Rode o seu próprio roteiro, no seu idioma, antes de comprometer um projeto com qualquer modelo.
A clonagem de voz melhorou
Clones instantâneos a partir de 10 segundos
Os Instant Voice Clones precisam de apenas 10 segundos de áudio. A ElevenLabs diz que a nova arquitetura torna a clonagem mais rápida e preserva melhor a identidade da voz em um trecho mais longo. Uma biblioteca de vozes maior também ajuda: os relatos de lançamento mencionam mais de 17.500 vozes para escolher.
A qualidade desse trecho de 10 segundos define a maior parte do resultado. Grave em um cômodo silencioso, sem música nem ruído de ventilador, mantenha a mesma distância do microfone do começo ao fim e fale no seu ritmo natural, sem interpretar. Uma amostra limpa e sem graça vence uma amostra cheia de energia e ruído, sempre.
Os clones profissionais voltam
O v3 não suportava Professional Voice Clones. O v4 suporta, e isso é voltado para os trabalhos de maior fidelidade: um narrador cuja voz clonada vai ler centenas de horas de áudio.
Todo clone exige consentimento verificado do dono da voz. Isso não é uma nota de rodapé. Se você clonar uma voz para um cliente, obtenha a permissão por escrito antes de enviar um único segundo de áudio.
O que muda para desenvolvedores de API
IDs de modelo e limites
Trocar de modelo é uma mudança de um único campo. Segundo a documentação da ElevenLabs, o corpo da requisição mantém a estrutura e só model_id muda:
{
"text": "[laughs] That is not what the invoice said.",
"model_id": "eleven_v4"
}
Use eleven_v4_turbo para a versão de baixa latência. O limite por requisição é de 10.000 caracteres, que a ElevenLabs equipara a cerca de dez minutos de áudio, o dobro dos 5.000 caracteres permitidos para eleven_v3. A saída vem em MP3, WAV/PCM ou µ-law, e o streaming bidirecional por WebSocket é suportado, o que importa se o seu texto chega token por token de um modelo de linguagem.
Os modelos mais antigos continuam disponíveis. Segundo a documentação, eleven_flash_v2_5 aceita 40.000 caracteres por requisição em 32 idiomas, com cerca de 75 ms, e eleven_multilingual_v2 suporta 29 idiomas. Você ainda pode acessar os dois no PicassoIA pelo Flash v2.5 e pelo v2 Multilingual.
Latência e streaming
O Turbo é o destaque aqui. A ElevenLabs informa uma mediana de cerca de 150 ms até a primeira fala e uma latência mediana de inferência de cerca de 100 ms. O The Decoder compara esse valor com 262 ms do Cartesia Sonic 3.6.
Para agentes de voz, a afirmação mais interessante é sobre o momento em que o áudio começa. O modelo pode começar a produzir áudio assim que o modelo de linguagem por trás dele começa a produzir a resposta, então quem está ligando ouve a resposta enquanto o restante ainda está sendo escrito.
Duas ressalvas. A ElevenLabs não publicou um número de latência para o v4 padrão, e ainda não apareceram testes independentes de latência. Meça a partir da sua região, com o overhead da sua própria rede, porque todo número do fornecedor deixa isso de fora.
Preços e o prazo de 12 de outubro
O preço de tabela por milhão de caracteres é US$ 80 para o v4 e US$ 40 para o v4 Turbo. Até 12 de outubro de 2026, a oferta de lançamento reduz esses valores para US$ 22 e US$ 11. Veja quanto custam 100.000 caracteres, cerca de 100 minutos de fala, em cada caso:
Modelo
Preço de tabela
Preço de lançamento
100.000 caracteres no preço de tabela
100.000 caracteres no preço de lançamento
Eleven v4
US$ 80 por milhão
US$ 22 por milhão
US$ 8,00
US$ 2,20
Eleven v4 Turbo
US$ 40 por milhão
US$ 11 por milhão
US$ 4,00
US$ 1,10
Se você está avaliando, o desconto permite fazer um teste comparativo real sem gastar muito. Se você está orçando um produto, planeje com base no preço de tabela, porque é isso que você vai pagar quando a oferta acabar.
Qual modelo para cada tarefa
A melhor escolha depende da finalidade do áudio, não de qual modelo é o mais novo.
Uma divisão prática para equipes pequenas: faça o rascunho em um modelo mais rápido e barato enquanto o roteiro ainda muda, e depois gere o áudio final no modelo expressivo. O trabalho com voz fica caro quando você regenera um capítulo inteiro a cada edição, então feche as palavras primeiro e gaste os caracteres premium por último. Se o seu produto mistura as duas necessidades, como um curso narrado com um assistente de perguntas e respostas ao vivo, você pode usar o v4 nas aulas e o Turbo no assistente, já que os dois compartilham o mesmo formato de requisição.
3 erros comuns
Julgar por uma frase só. Uma linha de demonstração não prova nada sobre um capítulo de 40 parágrafos. Teste o roteiro mais longo e mais complicado que você tiver.
Usar o modelo expressivo para um agente em tempo real. Se quem liga está esperando, o Turbo é a ferramenta certa, mesmo que o v4 soe um pouco mais rico.
Orçar pelo preço de lançamento. O desconto termina em 12 de outubro de 2026. Precifique seu projeto em US$ 80 e US$ 40 por milhão de caracteres.
Como usar o ElevenLabs v3 no PicassoIA
No momento em que escrevo, o v4 não está no catálogo do PicassoIA. O ElevenLabs v3 está, e é o parente mais próximo: mesma família, mesmo hábito de ler direções inline. Isso o torna um bom lugar para rascunhar roteiros e testar vozes enquanto o v4 chega a mais plataformas.
Escolha uma voz entre as 26 opções. A padrão é Rachel; entre as outras estão Aria, Roger, Sarah e James.
Defina o código de idioma, por exemplo en, es ou fr.
Deixe os controles deslizantes nos valores padrão na primeira execução, depois clique em gerar e ouça.
Ajuste uma configuração por vez e gere de novo. Mudar três coisas de uma vez não ensina nada.
Configurações que importam
Configuração
Intervalo
Padrão
O que faz
Velocidade
0,25 a 4,0
1
Ritmo de toda a leitura
Estilo
0,0 a 1,0
0
Leva a entrega de neutra para teatral
Estabilidade
0,0 a 1,0
0,5
Valores mais altos mantêm a voz mais estável em um roteiro longo
Reforço de similaridade
0,0 a 1,0
0,75
Quão de perto a saída segue a voz escolhida
Texto anterior / Texto seguinte
Texto
Vazio
Dá contexto ao modelo para que a entonação combine nas bordas das frases
Dois hábitos vão economizar seu tempo. Primeiro, cole o parágrafo anterior e o seguinte nos campos de contexto, para que cada trecho gerado se encaixe bem nos vizinhos. Segundo, teste tags entre colchetes, como [whispers], no prompt e ouça como o modelo as processa. É o mesmo estilo de direção em que o v4 se baseia, então a prática serve para ele também.
Um modelo de voz raramente trabalha sozinho. A maioria dos projetos que precisam de narração também precisa de uma trilha musical, de uma transcrição ou de uma versão traduzida. As três opções estão no PicassoIA.
Compor com o ElevenLabs Music
O ElevenLabs Music transforma um prompt de texto em uma música. Para trabalhos de narração, peça algo instrumental, constante e com pouca presença no mix. Descreva o clima, o andamento e os instrumentos em palavras simples, como "violão acústico lento, sala acolhedora, sem vocais, 70 BPM". Se quiser comparar, o Lyria 3 Pro e o Music 2.6 aceitam o mesmo tipo de prompt.
Transcrever com GPT-4o ou Gemini
Depois que a narração existe, você precisa de legendas e de um registro em texto. O GPT-4o Transcribe transforma áudio em texto, e o GPT-4o Mini Transcribe é a opção mais leve para rascunhos rápidos. O Gemini 3 Pro é um terceiro caminho, útil quando você quer comparar como cada modelo lida com nomes e números.
Um truque útil: transcreva a narração gerada e compare com o roteiro original. Qualquer diferença aponta para uma palavra em que a voz tropeçou, e você pode corrigi-la com um ajuste na grafia ou uma dica de pronúncia.
Dublar vídeos em mais de 90 idiomas
O ElevenLabs Dubbing pega um vídeo pronto e produz versões em outros idiomas. Ele combina naturalmente com a lista maior de idiomas do v4, já que a localização é onde a consistência de voz rende mais.
Sua vez de experimentar
A melhor forma de avaliar um modelo de voz é dar a ele o seu roteiro e ouvir. Você não precisa de um estúdio, de uma verba nem de uma semana de configuração para começar.
Aqui vai um plano para uma tarde:
Escreva um roteiro de 150 palavras com uma virada emocional no meio.
Renderize no ElevenLabs v3 com três vozes diferentes e uma mudança no controle deslizante de estilo.
Transcreva o resultado com o GPT-4o Transcribe e confira as palavras com o seu roteiro.
Quando o v4 chegar à plataforma que você escolheu, você já vai saber quais tags, vozes e configurações combinam com o seu material, e poderá orçar com segurança a partir dos preços de tabela.
Abra o Picasso IA e teste seu primeiro roteiro hoje. Escolha uma voz, adicione uma tag empilhada e ouça a diferença que a direção faz.