MiniMax Speech 2.8 HD ou Turbo: clonagem de voz e preços

MiniMax Speech 2.8 HD e Turbo compartilham as mesmas vozes, dicas de idioma e controles, mas diferem em preço, velocidade e acabamento. Este artigo coloca os dois lado a lado, mostra o que a clonagem de voz pode e não pode fazer hoje e apresenta exemplos reais de custo por tamanho de roteiro.

MiniMax Speech 2.8 HD ou Turbo: clonagem de voz e preços
Cristian Da Conceicao
Fundador do Picasso IA

Você tem um roteiro, um prazo e dois modelos de voz da MiniMax que parecem quase idênticos no papel. Speech 2.8 HD e Speech 2.8 Turbo aceitam o mesmo texto, as mesmas vozes e as mesmas configurações, mas o HD custa 67% a mais por caractere, enquanto o Turbo concluiu suas execuções de amostra publicadas em menos da metade do tempo. Então, qual deles pertence ao seu fluxo de narração, e uma voz clonada muda a resposta?

Este artigo coloca os dois lado a lado em qualidade de voz, velocidade, clonagem de voz e preços reais, com exemplos de custo detalhados que você pode adaptar aos seus próprios roteiros. Ele também mostra como executar os dois no PicassoIA, para que você possa ouvir a diferença antes de gastar qualquer coisa em um projeto grande.

💡 Resposta rápida: Escolha HD para narração finalizada, audiolivros e tudo o que o ouvinte escuta no fone de ouvido. Escolha Turbo para rascunhos, alto volume e qualquer trabalho em que a diferença entre US$ 60 e US$ 100 por milhão de caracteres se acumule.

Dois modelos, uma diferença real

Os dois modelos vêm da MiniMax e pertencem a uma família de texto para fala que também inclui Speech 2.6 HD e Speech 2.6 Turbo. Os nomes contam quase toda a história. O HD troca velocidade por fidelidade. O Turbo troca um pouco de acabamento por velocidade e uma conta menor.

Para o que o HD foi feito

As descrições publicadas do Speech 2.8 HD destacam detalhes tonais, emoção sutil e respiração natural, com os maiores ganhos na entrega de baixa energia: uma leitura suave, cansada ou reflexiva. A página do modelo HD na Replicate também diz que ele ficou em primeiro lugar em duas arenas públicas de texto para fala, uma delas hospedada no Hugging Face. Os rankings mudam, então confira a classificação atual antes de repetir essa afirmação. Pense em audiolivros, narração de documentários e vídeos de marca em que uma frase sem emoção chama a atenção.

Para o que o Turbo foi feito

O Speech 2.8 Turbo é ajustado para velocidade, baixa latência e volume. A listagem dele na Replicate afirma latência abaixo de 250 milissegundos, e as descrições publicadas apontam seus melhores resultados em registros de alta energia, como anúncios animados, lançamentos de produtos e respostas rápidas a clientes. Ele compartilha a mesma biblioteca de vozes, as mesmas dicas de idioma e a mesma lista de emoções, então trocar um pelo outro raramente exige reescrever um roteiro.

Dois microfones de estúdio lado a lado sobre uma mesa de nogueira, um condensador de grade dourada e um dinâmico preto e fino

RecursoSpeech 2.8 HDSpeech 2.8 Turbo
Feito paraFidelidade, detalhe tonal, emoção sutilVelocidade, baixa latência, volume
Preço de listaUS$ 100 por 1M de caracteresUS$ 60 por 1M de caracteres
Execução de amostra publicadaCerca de 5,8 segundosCerca de 2,0 e 2,5 segundos
Limite de entrada10.000 caracteres por requisição10.000 caracteres por requisição
voice_id clonadoAceito no campo voice_idAceito no campo voice_id
Formatos de saídaMP3, WAV, FLAC, PCMMP3, WAV, FLAC, PCM
Emoçõesauto mais nove estilosauto mais nove estilos

Controles, qualidade e velocidade comparados

No PicassoIA, os dois modelos expõem exatamente as mesmas entradas, o que torna a comparação justa: altere só o modelo e todas as outras configurações permanecem iguais.

Configurações que os dois modelos compartilham

  • voice_id: vem por padrão como Wise_Woman. As listagens da Replicate citam 17 ou mais predefinições, incluindo Deep_Voice_Man, Imposing_Manner, Casual_Guy, Lively_Girl, Young_Knight e Abbess.
  • emotion: auto, happy, sad, angry, fearful, disgusted, surprised, calm, fluent ou neutral.
  • language_boost: None, Automatic ou um de cerca de 40 idiomas nomeados. A lista é idêntica nos dois modelos, então a quantidade de idiomas não deve decidir sua escolha.
  • speed, pitch, volume: speed de 0,5 a 2,0, pitch de -12 a +12 semitons, volume de 0 a 10.
  • Marcadores de pausa: digite um marcador como <#0.5#> dentro do texto para inserir uma pausa de meio segundo.
  • english_normalization: melhora a leitura de números e datas em inglês, ao custo de um pouco de latência.
  • Opções de saída: MP3, WAV, FLAC ou PCM; bitrate de MP3 de 32 a 256 kbps; taxa de amostragem de 8.000 a 44.100 Hz; mono ou estéreo; marcações de tempo opcionais de legendas por frase.

Close de uma dubladora rindo no meio de uma gravação diante de um microfone com um filtro pop em primeiro plano

O que você ouve e quanto espera

Primeiro a qualidade. Os dois modelos produzem fala limpa e natural, e a diferença aparece nos detalhes: a respiração antes de uma frase, a forma como uma linha triste se apaga, as micropausas dentro de uma oração longa. Esses detalhes são onde o HD foi projetado para vencer. Em uma leitura rápida e animada, a diferença diminui, e é por isso que o Turbo se sai bem em anúncios e comunicados.

Depois a velocidade. A execução de exemplo publicada na página do HD levou cerca de 5,8 segundos para uma única frase. Os dois exemplos do Turbo levaram cerca de 2,0 e 2,5 segundos para frases de tamanho semelhante. Três execuções são uma anedota, não um benchmark, e os tempos de fila variam, mas a direção combina com os nomes dos produtos.

Um teste de escuta justo leva dez minutos:

  1. Escolha um parágrafo de 150 palavras que contenha um número, uma data, um nome, uma pergunta e uma linha tranquila.
  2. Execute-o nos dois modelos com o mesmo voice_id, emotion e speed.
  3. Reproduza os clipes no fone de ouvido e de novo no alto-falante do celular.
  4. Anote qual clipe você publicaria sem editar.

Engenheiro de som de camiseta cinza e fones de ouvido ouvindo em uma mesa de monitoração de estúdio iluminada por uma lâmpada âmbar

💡 Dica: Mude uma variável por teste. Se você trocar o modelo e a emoção ao mesmo tempo, nunca saberá qual mudança deixou o clipe melhor.

Como a clonagem de voz funciona aqui

A clonagem de voz transforma uma gravação curta em um voice_id reutilizável. No PicassoIA, essa tarefa cabe ao Voice Cloning, um modelo separado cuja saída você cola no campo voice_id de um modelo de fala. Os dois modelos 2.8 oferecem suporte a isso: o campo voice_id deles diz para escolher uma voz de sistema da MiniMax ou um ID retornado pelo clonador.

Gravando uma amostra limpa

O modelo de clonagem aceita arquivos MP3, M4A ou WAV de 10 segundos a 5 minutos, com menos de 20 MB. Ele também oferece redução de ruído, normalização de volume e um limite de precisão de 0 a 1 que vem por padrão em 0,7. A listagem da Replicate diz que uma referência de apenas 5 segundos pode funcionar, mas observa que amostras mais longas melhoram a precisão, então busque de 30 a 60 segundos de fala limpa.

  • Grave em um cômodo pequeno e macio. Um armário cheio de casacos vale mais do que uma cozinha vazia.
  • Mantenha sempre a mesma distância do microfone e leia no tom que você quer que a voz tenha.
  • Evite música, eco e uma segunda pessoa falando.
  • Ligue a redução de ruído só quando o arquivo tiver chiado de fundo, já que uma entrada limpa vale mais do que a limpeza posterior.

Jovem falando em um microfone de lapela dentro de um armário forrado de casacos de inverno pendurados

💡 Permissão importa: Clone apenas uma voz que você possua ou para a qual tenha autorização por escrito para usá-la. Uma cessão assinada de um dublador ou cliente leva dois minutos e elimina qualquer dúvida depois.

A questão 2.6 ou 2.8

Aqui está a pegadinha que vale conhecer. A configuração de modelo dentro do Voice Cloning lista Speech 2.6 Turbo, Speech 2.6 HD, Speech 02 Turbo e Speech 02 HD, com o 2.6 HD como padrão. O Speech 2.8 não está nessa lista, embora o campo voice_id do 2.8 aceite IDs do clonador. O esquema, por si só, não diz o quanto uma voz treinada em uma versão 2.6 se mantém no 2.8.

Então teste. Clone uma vez com a versão padrão e depois fale a mesma linha com o 2.8 HD, o 2.8 Turbo e o 2.6 HD. Compare cada resultado com sua gravação original. Se o 2.8 se afastar do falante, rode a voz clonada no 2.6 HD e mantenha o 2.8 para as vozes de catálogo.

Usando seu voice_id clonado

Depois de clonar, copie o voice_id retornado para o campo voice_id de qualquer um dos modelos 2.8 e escreva o roteiro que quiser. A clonagem é cobrada a US$ 1,50 por voz, no primeiro uso de síntese, e uma voz pode ser reutilizada em todas as execuções seguintes. Teste emotion e language_boost na voz clonada com uma frase curta antes de comprometer um roteiro longo.

Se a clonagem da MiniMax não combinar com seu falante, vale testar outros dois modelos: Qwen3 TTS, indicado para clonar qualquer voz ou criar a sua própria, e Chatterbox, que combina clonagem com controle de emoção.

Quanto custa de verdade

Os números abaixo são os preços de lista da MiniMax para os modelos 2.8, como repetidos em páginas de preços de terceiros. São a forma mais limpa de comparar os dois. O que você paga em uma plataforma específica depende do plano dessa plataforma, então leia esses valores como uma base para escolher entre HD e Turbo, não como uma fatura do PicassoIA. Os preços mudam, então confirme-os na página de preços da MiniMax antes de orçar um projeto grande.

Preço por milhão de caracteres

ItemHDTurbo
Por 1.000.000 de caracteresUS$ 100US$ 60
Por 1.000 caracteresUS$ 0,10US$ 0,06
Por requisição de 10.000 caracteresUS$ 1,00US$ 0,60

O Turbo é 40% mais barato que o HD, e o HD é 67% mais caro que o Turbo. As duas afirmações são verdadeiras; descrevem a mesma diferença a partir de extremos opostos. A clonagem de voz é um extra fixo: US$ 1,50 por voz, cobrado no primeiro uso de síntese.

Vista de cima de uma mesa de madeira com uma calculadora, um caderno de números escritos à mão, moedas e uma caneca de chá

Roteiros reais, totais reais

Estes totais consideram cerca de 6 caracteres por palavra, incluindo espaços, e um ritmo de narração de 150 palavras por minuto.

ProjetoCaracteresHDTurboEconomia com o Turbo
Leitura de anúncio de 60 segundos (150 palavras)900US$ 0,09US$ 0,054US$ 0,036
Narração de artigo de 2.500 palavras15.000US$ 1,50US$ 0,90US$ 0,60
200 episódios de podcast de 8.000 caracteres1.600.000US$ 160,00US$ 96,00US$ 64,00
Audiolivro de 10 horas (90.000 palavras)540.000US$ 54,00US$ 32,40US$ 21,60

Uma voz clonada personalizada adiciona US$ 1,50 uma única vez. Narrar esses 15.000 caracteres com uma voz clonada custa, portanto, US$ 3,00 no total no HD ou US$ 2,40 no Turbo.

As regravações são o multiplicador escondido. Gere um roteiro de 15.000 caracteres quatro vezes para ajustar a entrega e o HD custa US$ 6,00. Faça três rascunhos no Turbo (US$ 2,70) e finalize uma vez no HD (US$ 1,50), e o total fica em US$ 4,20, uma economia de 30% com a versão final ainda renderizada no HD.

💡 Dica: Cada parágrafo regenerado é cobrado de novo. Corrija pontuação, números e marcadores de pausa no roteiro antes de clicar em gerar, não depois da terceira regravação.

Qual escolher

Escolha pelo que o áudio é para, não pelo modelo que soa mais impressionante isoladamente.

Escolha o HD quando

  • O áudio é o produto: audiolivros, cursos, narração de documentários e filmes de marca.
  • O roteiro tem trechos tranquilos, tristes ou reflexivos que não podem soar sem emoção.
  • Os ouvintes vão passar mais de alguns minutos com a voz no fone de ouvido.
  • O arquivo será publicado sem uma etapa de edição humana.

Escolha o Turbo quando

  • Você está fazendo rascunhos, iterando ou verificando o ritmo.
  • O volume importa: centenas de clipes curtos, descrições de produtos ou vozes de notificação.
  • A leitura é animada e cheia de energia, como anúncios, comunicados e clipes para redes sociais.
  • Você está prototipando um assistente de voz em que o tempo de resposta conta.

Rascunhe no Turbo, finalize no HD

O fluxo mais barato usa os dois. Trave o roteiro, a voz e a emoção no Turbo, onde cada passagem custa 40% menos e retorna mais rápido. Quando o texto estiver final, renderize a versão escolhida no HD. Como os dois modelos compartilham todas as configurações, as mesmas entradas passam de um para o outro sem alteração.

Vista de cima das mãos de um produtor pressionando o botão vermelho de gravação de uma interface de áudio compacta, ao lado de um cronômetro e um caderno

Projetos multilíngues são os que mais se beneficiam. Troque o language_boost, teste cada idioma no Turbo e depois finalize os aprovados no HD. Peça para um falante nativo ouvir dez segundos de cada um antes de publicar, já que deslizes de sotaque passam despercebidos para quem tem o idioma como segunda língua.

Mulher em uma cabine de intérprete de paredes de vidro falando em um microfone de pescoço de ganso com um salão de conferências atrás dela

Como usar o Speech 2.8 no PicassoIA

O fluxo é o mesmo nos dois modelos. Abra a página do Speech 2.8 HD ou a do Speech 2.8 Turbo e siga os campos abaixo.

Configuração passo a passo

  1. Cole seu roteiro no campo de texto (até 10.000 caracteres). Adicione pausas com marcadores como <#0.8#>.
  2. Escolha um voice_id. Mantenha Wise_Woman ou cole um voice_id clonado.
  3. Defina a emoção. Comece com auto e depois fixe um estilo quando souber o tom que quer.
  4. Defina o language_boost. Escolha Automatic para textos mistos ou um idioma específico para um roteiro em um só idioma.
  5. Ajuste speed, pitch e volume. Pequenos ajustes fazem muita diferença. Teste um speed entre 0,95 e 1,15.
  6. Escolha a saída. MP3 em 128 kbps para rascunhos, MP3 em 256 kbps ou WAV para versões finais, e estéreo só se o seu editor precisar.
  7. Gere, ouça, baixe. Execute de novo até a tomada ficar certa e depois salve o arquivo.

💡 Dica: Ative english_normalization quando o roteiro estiver cheio de números, datas ou preços. Ele acrescenta um pouco de latência, mas lê esses trechos de forma mais natural.

Mulher de cabelo preto em corte bob em uma mesa de home office iluminada, com fones de ouvido no pescoço e um notebook mostrando formas de onda de áudio

Configurações iniciais que vale copiar

ProjetoemotionspeedpitchSaída
Narração para YouTubeauto1,2+2MP3, 128 kbps
Demonstração de produtofluent1,00MP3 estéreo
Capítulo de audiolivrocalm0,950WAV com pausas cronometradas
Leitura de anúncio no Turbohappy1,10MP3, 256 kbps

Trate essas configurações como pontos de partida e ajuste pelo ouvido. As duas primeiras linhas seguem os casos de uso listados na página do modelo HD.

Adicione música e confira transcrições

Uma voz raramente funciona sozinha. Para uma base musical, peça à Music 2.6, à Lyria 3 Pro ou à ElevenLabs Music um instrumental de baixa energia com um tempo constante, e depois deixe-o bem abaixo da narração no seu editor para que cada palavra continue clara.

Para controle de qualidade, passe cada clipe finalizado por um modelo de fala para texto, como o GPT-4o Transcribe ou o Gemini 3 Pro, e compare a transcrição com seu roteiro. Uma palavra diferente geralmente aponta para um nome ou número pronunciado de forma errada. O GPT-4o Mini Transcribe é outra opção para lotes grandes. O mesmo truque funciona com uma amostra de clonagem: transcreva sua gravação primeiro para confirmar que o áudio está claro antes de gastar US$ 1,50 em uma voz.

Estúdio caseiro de música em hora dourada, com violão acústico, poltrona de couro e um microfone em braço articulado

Teste as duas vozes você mesmo

A forma mais rápida de decidir entre HD e Turbo é ouvir os dois lerem as suas próprias palavras. Abra o PicassoIA, cole um parágrafo do seu próximo vídeo, podcast ou aula e rode-o no Speech 2.8 HD e no Speech 2.8 Turbo com as mesmas configurações. Clone a sua própria voz se quiser um narrador pessoal, adicione uma base musical, confira a transcrição e escolha a tomada que o seu público não vai pular. Rascunhe barato, finalize com acabamento e construa o projeto inteiro em um só lugar.

Compartilhe este artigo

Escolha seu idioma