Você tem um roteiro, um prazo e dois modelos de voz da MiniMax que parecem quase idênticos no papel. Speech 2.8 HD e Speech 2.8 Turbo aceitam o mesmo texto, as mesmas vozes e as mesmas configurações, mas o HD custa 67% a mais por caractere, enquanto o Turbo concluiu suas execuções de amostra publicadas em menos da metade do tempo. Então, qual deles pertence ao seu fluxo de narração, e uma voz clonada muda a resposta?
Este artigo coloca os dois lado a lado em qualidade de voz, velocidade, clonagem de voz e preços reais, com exemplos de custo detalhados que você pode adaptar aos seus próprios roteiros. Ele também mostra como executar os dois no PicassoIA, para que você possa ouvir a diferença antes de gastar qualquer coisa em um projeto grande.
💡 Resposta rápida: Escolha HD para narração finalizada, audiolivros e tudo o que o ouvinte escuta no fone de ouvido. Escolha Turbo para rascunhos, alto volume e qualquer trabalho em que a diferença entre US$ 60 e US$ 100 por milhão de caracteres se acumule.
Dois modelos, uma diferença real
Os dois modelos vêm da MiniMax e pertencem a uma família de texto para fala que também inclui Speech 2.6 HD e Speech 2.6 Turbo. Os nomes contam quase toda a história. O HD troca velocidade por fidelidade. O Turbo troca um pouco de acabamento por velocidade e uma conta menor.
Para o que o HD foi feito
As descrições publicadas do Speech 2.8 HD destacam detalhes tonais, emoção sutil e respiração natural, com os maiores ganhos na entrega de baixa energia: uma leitura suave, cansada ou reflexiva. A página do modelo HD na Replicate também diz que ele ficou em primeiro lugar em duas arenas públicas de texto para fala, uma delas hospedada no Hugging Face. Os rankings mudam, então confira a classificação atual antes de repetir essa afirmação. Pense em audiolivros, narração de documentários e vídeos de marca em que uma frase sem emoção chama a atenção.
Para o que o Turbo foi feito
O Speech 2.8 Turbo é ajustado para velocidade, baixa latência e volume. A listagem dele na Replicate afirma latência abaixo de 250 milissegundos, e as descrições publicadas apontam seus melhores resultados em registros de alta energia, como anúncios animados, lançamentos de produtos e respostas rápidas a clientes. Ele compartilha a mesma biblioteca de vozes, as mesmas dicas de idioma e a mesma lista de emoções, então trocar um pelo outro raramente exige reescrever um roteiro.

| Recurso | Speech 2.8 HD | Speech 2.8 Turbo |
|---|
| Feito para | Fidelidade, detalhe tonal, emoção sutil | Velocidade, baixa latência, volume |
| Preço de lista | US$ 100 por 1M de caracteres | US$ 60 por 1M de caracteres |
| Execução de amostra publicada | Cerca de 5,8 segundos | Cerca de 2,0 e 2,5 segundos |
| Limite de entrada | 10.000 caracteres por requisição | 10.000 caracteres por requisição |
| voice_id clonado | Aceito no campo voice_id | Aceito no campo voice_id |
| Formatos de saída | MP3, WAV, FLAC, PCM | MP3, WAV, FLAC, PCM |
| Emoções | auto mais nove estilos | auto mais nove estilos |
Controles, qualidade e velocidade comparados
No PicassoIA, os dois modelos expõem exatamente as mesmas entradas, o que torna a comparação justa: altere só o modelo e todas as outras configurações permanecem iguais.
Configurações que os dois modelos compartilham
- voice_id: vem por padrão como Wise_Woman. As listagens da Replicate citam 17 ou mais predefinições, incluindo Deep_Voice_Man, Imposing_Manner, Casual_Guy, Lively_Girl, Young_Knight e Abbess.
- emotion: auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent ou neutral.
- language_boost: None, Automatic ou um de cerca de 40 idiomas nomeados. A lista é idêntica nos dois modelos, então a quantidade de idiomas não deve decidir sua escolha.
- speed, pitch, volume: speed de 0,5 a 2,0, pitch de -12 a +12 semitons, volume de 0 a 10.
- Marcadores de pausa: digite um marcador como
<#0.5#> dentro do texto para inserir uma pausa de meio segundo.
- english_normalization: melhora a leitura de números e datas em inglês, ao custo de um pouco de latência.
- Opções de saída: MP3, WAV, FLAC ou PCM; bitrate de MP3 de 32 a 256 kbps; taxa de amostragem de 8.000 a 44.100 Hz; mono ou estéreo; marcações de tempo opcionais de legendas por frase.

O que você ouve e quanto espera
Primeiro a qualidade. Os dois modelos produzem fala limpa e natural, e a diferença aparece nos detalhes: a respiração antes de uma frase, a forma como uma linha triste se apaga, as micropausas dentro de uma oração longa. Esses detalhes são onde o HD foi projetado para vencer. Em uma leitura rápida e animada, a diferença diminui, e é por isso que o Turbo se sai bem em anúncios e comunicados.
Depois a velocidade. A execução de exemplo publicada na página do HD levou cerca de 5,8 segundos para uma única frase. Os dois exemplos do Turbo levaram cerca de 2,0 e 2,5 segundos para frases de tamanho semelhante. Três execuções são uma anedota, não um benchmark, e os tempos de fila variam, mas a direção combina com os nomes dos produtos.
Um teste de escuta justo leva dez minutos:
- Escolha um parágrafo de 150 palavras que contenha um número, uma data, um nome, uma pergunta e uma linha tranquila.
- Execute-o nos dois modelos com o mesmo voice_id, emotion e speed.
- Reproduza os clipes no fone de ouvido e de novo no alto-falante do celular.
- Anote qual clipe você publicaria sem editar.

💡 Dica: Mude uma variável por teste. Se você trocar o modelo e a emoção ao mesmo tempo, nunca saberá qual mudança deixou o clipe melhor.
Como a clonagem de voz funciona aqui
A clonagem de voz transforma uma gravação curta em um voice_id reutilizável. No PicassoIA, essa tarefa cabe ao Voice Cloning, um modelo separado cuja saída você cola no campo voice_id de um modelo de fala. Os dois modelos 2.8 oferecem suporte a isso: o campo voice_id deles diz para escolher uma voz de sistema da MiniMax ou um ID retornado pelo clonador.
Gravando uma amostra limpa
O modelo de clonagem aceita arquivos MP3, M4A ou WAV de 10 segundos a 5 minutos, com menos de 20 MB. Ele também oferece redução de ruído, normalização de volume e um limite de precisão de 0 a 1 que vem por padrão em 0,7. A listagem da Replicate diz que uma referência de apenas 5 segundos pode funcionar, mas observa que amostras mais longas melhoram a precisão, então busque de 30 a 60 segundos de fala limpa.
- Grave em um cômodo pequeno e macio. Um armário cheio de casacos vale mais do que uma cozinha vazia.
- Mantenha sempre a mesma distância do microfone e leia no tom que você quer que a voz tenha.
- Evite música, eco e uma segunda pessoa falando.
- Ligue a redução de ruído só quando o arquivo tiver chiado de fundo, já que uma entrada limpa vale mais do que a limpeza posterior.

💡 Permissão importa: Clone apenas uma voz que você possua ou para a qual tenha autorização por escrito para usá-la. Uma cessão assinada de um dublador ou cliente leva dois minutos e elimina qualquer dúvida depois.
A questão 2.6 ou 2.8
Aqui está a pegadinha que vale conhecer. A configuração de modelo dentro do Voice Cloning lista Speech 2.6 Turbo, Speech 2.6 HD, Speech 02 Turbo e Speech 02 HD, com o 2.6 HD como padrão. O Speech 2.8 não está nessa lista, embora o campo voice_id do 2.8 aceite IDs do clonador. O esquema, por si só, não diz o quanto uma voz treinada em uma versão 2.6 se mantém no 2.8.
Então teste. Clone uma vez com a versão padrão e depois fale a mesma linha com o 2.8 HD, o 2.8 Turbo e o 2.6 HD. Compare cada resultado com sua gravação original. Se o 2.8 se afastar do falante, rode a voz clonada no 2.6 HD e mantenha o 2.8 para as vozes de catálogo.
Usando seu voice_id clonado
Depois de clonar, copie o voice_id retornado para o campo voice_id de qualquer um dos modelos 2.8 e escreva o roteiro que quiser. A clonagem é cobrada a US$ 1,50 por voz, no primeiro uso de síntese, e uma voz pode ser reutilizada em todas as execuções seguintes. Teste emotion e language_boost na voz clonada com uma frase curta antes de comprometer um roteiro longo.
Se a clonagem da MiniMax não combinar com seu falante, vale testar outros dois modelos: Qwen3 TTS, indicado para clonar qualquer voz ou criar a sua própria, e Chatterbox, que combina clonagem com controle de emoção.
Quanto custa de verdade
Os números abaixo são os preços de lista da MiniMax para os modelos 2.8, como repetidos em páginas de preços de terceiros. São a forma mais limpa de comparar os dois. O que você paga em uma plataforma específica depende do plano dessa plataforma, então leia esses valores como uma base para escolher entre HD e Turbo, não como uma fatura do PicassoIA. Os preços mudam, então confirme-os na página de preços da MiniMax antes de orçar um projeto grande.
Preço por milhão de caracteres
| Item | HD | Turbo |
|---|
| Por 1.000.000 de caracteres | US$ 100 | US$ 60 |
| Por 1.000 caracteres | US$ 0,10 | US$ 0,06 |
| Por requisição de 10.000 caracteres | US$ 1,00 | US$ 0,60 |
O Turbo é 40% mais barato que o HD, e o HD é 67% mais caro que o Turbo. As duas afirmações são verdadeiras; descrevem a mesma diferença a partir de extremos opostos. A clonagem de voz é um extra fixo: US$ 1,50 por voz, cobrado no primeiro uso de síntese.

Roteiros reais, totais reais
Estes totais consideram cerca de 6 caracteres por palavra, incluindo espaços, e um ritmo de narração de 150 palavras por minuto.
| Projeto | Caracteres | HD | Turbo | Economia com o Turbo |
|---|
| Leitura de anúncio de 60 segundos (150 palavras) | 900 | US$ 0,09 | US$ 0,054 | US$ 0,036 |
| Narração de artigo de 2.500 palavras | 15.000 | US$ 1,50 | US$ 0,90 | US$ 0,60 |
| 200 episódios de podcast de 8.000 caracteres | 1.600.000 | US$ 160,00 | US$ 96,00 | US$ 64,00 |
| Audiolivro de 10 horas (90.000 palavras) | 540.000 | US$ 54,00 | US$ 32,40 | US$ 21,60 |
Uma voz clonada personalizada adiciona US$ 1,50 uma única vez. Narrar esses 15.000 caracteres com uma voz clonada custa, portanto, US$ 3,00 no total no HD ou US$ 2,40 no Turbo.
As regravações são o multiplicador escondido. Gere um roteiro de 15.000 caracteres quatro vezes para ajustar a entrega e o HD custa US$ 6,00. Faça três rascunhos no Turbo (US$ 2,70) e finalize uma vez no HD (US$ 1,50), e o total fica em US$ 4,20, uma economia de 30% com a versão final ainda renderizada no HD.
💡 Dica: Cada parágrafo regenerado é cobrado de novo. Corrija pontuação, números e marcadores de pausa no roteiro antes de clicar em gerar, não depois da terceira regravação.
Qual escolher
Escolha pelo que o áudio é para, não pelo modelo que soa mais impressionante isoladamente.
Escolha o HD quando
- O áudio é o produto: audiolivros, cursos, narração de documentários e filmes de marca.
- O roteiro tem trechos tranquilos, tristes ou reflexivos que não podem soar sem emoção.
- Os ouvintes vão passar mais de alguns minutos com a voz no fone de ouvido.
- O arquivo será publicado sem uma etapa de edição humana.
Escolha o Turbo quando
- Você está fazendo rascunhos, iterando ou verificando o ritmo.
- O volume importa: centenas de clipes curtos, descrições de produtos ou vozes de notificação.
- A leitura é animada e cheia de energia, como anúncios, comunicados e clipes para redes sociais.
- Você está prototipando um assistente de voz em que o tempo de resposta conta.
Rascunhe no Turbo, finalize no HD
O fluxo mais barato usa os dois. Trave o roteiro, a voz e a emoção no Turbo, onde cada passagem custa 40% menos e retorna mais rápido. Quando o texto estiver final, renderize a versão escolhida no HD. Como os dois modelos compartilham todas as configurações, as mesmas entradas passam de um para o outro sem alteração.

Projetos multilíngues são os que mais se beneficiam. Troque o language_boost, teste cada idioma no Turbo e depois finalize os aprovados no HD. Peça para um falante nativo ouvir dez segundos de cada um antes de publicar, já que deslizes de sotaque passam despercebidos para quem tem o idioma como segunda língua.

Como usar o Speech 2.8 no PicassoIA
O fluxo é o mesmo nos dois modelos. Abra a página do Speech 2.8 HD ou a do Speech 2.8 Turbo e siga os campos abaixo.
Configuração passo a passo
- Cole seu roteiro no campo de texto (até 10.000 caracteres). Adicione pausas com marcadores como
<#0.8#>.
- Escolha um voice_id. Mantenha Wise_Woman ou cole um voice_id clonado.
- Defina a emoção. Comece com auto e depois fixe um estilo quando souber o tom que quer.
- Defina o language_boost. Escolha Automatic para textos mistos ou um idioma específico para um roteiro em um só idioma.
- Ajuste speed, pitch e volume. Pequenos ajustes fazem muita diferença. Teste um speed entre 0,95 e 1,15.
- Escolha a saída. MP3 em 128 kbps para rascunhos, MP3 em 256 kbps ou WAV para versões finais, e estéreo só se o seu editor precisar.
- Gere, ouça, baixe. Execute de novo até a tomada ficar certa e depois salve o arquivo.
💡 Dica: Ative english_normalization quando o roteiro estiver cheio de números, datas ou preços. Ele acrescenta um pouco de latência, mas lê esses trechos de forma mais natural.

Configurações iniciais que vale copiar
| Projeto | emotion | speed | pitch | Saída |
|---|
| Narração para YouTube | auto | 1,2 | +2 | MP3, 128 kbps |
| Demonstração de produto | fluent | 1,0 | 0 | MP3 estéreo |
| Capítulo de audiolivro | calm | 0,95 | 0 | WAV com pausas cronometradas |
| Leitura de anúncio no Turbo | happy | 1,1 | 0 | MP3, 256 kbps |
Trate essas configurações como pontos de partida e ajuste pelo ouvido. As duas primeiras linhas seguem os casos de uso listados na página do modelo HD.
Adicione música e confira transcrições
Uma voz raramente funciona sozinha. Para uma base musical, peça à Music 2.6, à Lyria 3 Pro ou à ElevenLabs Music um instrumental de baixa energia com um tempo constante, e depois deixe-o bem abaixo da narração no seu editor para que cada palavra continue clara.
Para controle de qualidade, passe cada clipe finalizado por um modelo de fala para texto, como o GPT-4o Transcribe ou o Gemini 3 Pro, e compare a transcrição com seu roteiro. Uma palavra diferente geralmente aponta para um nome ou número pronunciado de forma errada. O GPT-4o Mini Transcribe é outra opção para lotes grandes. O mesmo truque funciona com uma amostra de clonagem: transcreva sua gravação primeiro para confirmar que o áudio está claro antes de gastar US$ 1,50 em uma voz.

Teste as duas vozes você mesmo
A forma mais rápida de decidir entre HD e Turbo é ouvir os dois lerem as suas próprias palavras. Abra o PicassoIA, cole um parágrafo do seu próximo vídeo, podcast ou aula e rode-o no Speech 2.8 HD e no Speech 2.8 Turbo com as mesmas configurações. Clone a sua própria voz se quiser um narrador pessoal, adicione uma base musical, confira a transcrição e escolha a tomada que o seu público não vai pular. Rascunhe barato, finalize com acabamento e construa o projeto inteiro em um só lugar.