Remover de vocais com IA grátis online: separe a voz de qualquer música

Um remover de vocais com IA grátis pode separar qualquer música em voz e instrumental em minutos, direto no seu navegador. Veja como funciona a separação por stems, quais configurações protegem a qualidade, como corrigir vozes fantasmas e artefatos aquosos e o que fazer com os arquivos depois, de letras a vídeos com letra e faixas de acompanhamento totalmente novas.

Remover de vocais com IA grátis online: separe a voz de qualquer música
Cristian Da Conceicao
Fundador do Picasso IA

Você tem uma música que não sai da cabeça, mas só quer metade dela: o cantor, ou a banda. Há alguns anos, isso significava uma sessão de estúdio e muita sorte. Hoje, um remover de vocais com IA grátis online consegue separar uma faixa em cerca do tempo que leva para passar um café, e o resultado costuma ser limpo o suficiente para cantar por cima, remixar ou estudar nota por nota.

Este artigo mostra como a tecnologia realmente funciona, o que as ferramentas gratuitas oferecem e o que não oferecem, como conseguir uma separação decente de uma música teimosa e o que fazer com os arquivos depois. Uma observação honesta logo de início: a PicassoIA não tem um separador de stems próprio. Você faz a separação com qualquer separador gratuito e depois traz os stems para cá, para letras, vídeos com letra e músicas inéditas. A separação é o primeiro passo, não a linha de chegada.

Fones de ouvido de estúdio sobre uma mesa de carvalho, ao lado de um notebook exibindo formas de onda de áudio

💡 Resposta rápida: envie um WAV (ou um MP3 de alto bitrate) para um separador de stems com IA, escolha a opção vocais e instrumental, baixe os dois arquivos e ouça com fones de ouvido antes de usar. Tudo o que vem a seguir trata de fazer isso funcionar em músicas que não colaboram.

O que um remover de vocais realmente faz

O velho truque da fase ou a separação por IA

Antes das redes neurais, o truque padrão era o cancelamento de fase. Os vocais principais costumam ser mixados exatamente no centro, então os canais esquerdo e direito carregam um canto quase idêntico. Inverta um dos canais e some os dois: tudo o que é idêntico nos dois canais se cancela. Na teoria, a voz desaparece.

Na prática, o bumbo, o baixo e muitas vezes a caixa também ficam no centro, então desaparecem junto com a voz. O que sobra soa fino, oco e coberto por reverb residual, porque a reverb é ampla e não se cancela.

Vista de cima das mãos de um engenheiro deslizando os faders de uma mesa de mixagem analógica

A separação por IA funciona de outro jeito. Uma rede neural é treinada com um grande volume de gravações em que cada parte é conhecida de antemão, então ela aprende como uma voz humana aparece em um espectrograma: os harmônicos empilhados, as consoantes sopradas, a oscilação do vibrato. Diante de uma mixagem estéreo finalizada, ela estima quais partes do som pertencem à voz e reconstrói esse sinal como um arquivo próprio. Todo o resto vai para um segundo arquivo. Nada é subtraído às cegas, e é por isso que o baixo e o bumbo sobrevivem.

Modelos de código aberto como o Demucs (da equipe de pesquisa da Meta) e o Spleeter (da Deezer) são os exemplos mais conhecidos, e muitas ferramentas gratuitas na web são construídas sobre a mesma família de ideias.

Stems em linguagem simples

Um stem é um grupo de sons relacionados reunidos em um único arquivo de áudio: todos os vocais, toda a bateria, todo o baixo. A maioria das ferramentas deixa você escolher em quantos stems dividir.

Tipo de separaçãoArquivos que você recebeMelhor para
2 stemsVocais, instrumentalFaixas de karaokê, acapellas, edições rápidas
4 stemsVocais, bateria, baixo, outrosRemixes, prática de bateria ou baixo
5 a 6 stemsAcrescenta piano e/ou guitarraIsolar um único instrumento para estudar

As opções exatas dependem da ferramenta. Dois stems é o mais rápido e geralmente o mais limpo, porque o modelo tem a tarefa mais simples: voz ou não voz. Cada stem extra acrescenta mais uma chance de um som cair no lugar errado.

Perfil lateral de um cantor gravando em uma cabine de vocais com um filtro antipop

Uma forma útil de pensar: o stem vocal é o que um microfone naquela cabine teria captado, e o instrumental é tudo o que o resto da banda tocou. O modelo está adivinhando aquela sessão de gravação original, trabalhando de trás para frente a partir da mixagem final.

Escolha bem uma ferramenta gratuita

O que os planos gratuitos costumam limitar

"Grátis" significa coisas diferentes de um site para outro. Antes de enviar qualquer arquivo, verifique estes limites comuns:

  • Duração da faixa: muitos planos gratuitos limitam cada envio a alguns minutos.
  • Envios diários: um número fixo de músicas por dia, depois uma fila de espera ou um paywall.
  • Qualidade da exportação: prévias ou downloads apenas em MP3, com WAV reservado para usuários pagantes.
  • Quantidade de stems: dois stems grátis, quatro ou mais atrás de uma assinatura.
  • Armazenamento de arquivos: seu envio fica no servidor de outra pessoa por um tempo. Se a música for inédita, leia primeiro os termos de privacidade.

Navegador, desktop ou integrado?

MétodoCustoQualidadeVelocidadePrincipal desvantagem
Cancelamento de faseGrátisBaixaInstantâneaRemove baixo e bumbo, mantém a reverb
Ferramenta de IA no navegadorPlano gratuitoBoa a muito boaAlguns minutosLimites de envio, filas, limites de exportação
Modelo de código aberto no seu PCGrátisMuito boaDepende do seu hardwareExige configuração, uma GPU ajuda
Separador de stems dentro de uma DAWIncluído no softwareBoaRápidaPreso a um programa

Uma ferramenta de navegador é a escolha certa para um uso pontual. Se você separa com frequência, ou trabalha com material inédito, rodar um modelo de código aberto na sua própria máquina mantém os arquivos longe dos servidores de outras pessoas e elimina os limites diários. Vários aplicativos grandes de produção musical também já trazem seu próprio separador de stems, o que vale conferir antes de instalar qualquer coisa nova.

💡 Antes de enviar: use o arquivo de maior qualidade que você tiver, mantenha a música com a duração completa e anote as configurações escolhidas. Comparar duas execuções depois fica bem mais fácil quando você sabe exatamente o que mudou.

Separe uma música passo a passo

Prepare o arquivo de origem

Qualidade entra, qualidade sai. Um WAV ou FLAC sem perdas dá ao modelo o máximo de informação para trabalhar. Um MP3 serve bem a 256 kbps ou mais. A pior origem é um arquivo extraído de um vídeo de streaming ou gravado de uma caixa de som, porque a compressão já borrou os detalhes de que o modelo precisa para distinguir uma voz de uma guitarra.

Deixe a música sem cortes. Os modelos usam a faixa inteira como contexto, e cortar a introdução ou o final raramente economiza tempo relevante. Também evite qualquer truque de volume antes: uma música que foi comprimida com limitação extra deixa menos espaço entre a voz e os instrumentos.

Execute a separação

Jovem olhando quatro faixas de áudio separadas na tela de um notebook, sentado a uma mesa

O fluxo é quase idêntico em todos os serviços:

  1. Envie seu arquivo ou cole um link, se a ferramenta aceitar.
  2. Escolha a quantidade de stems. Dois stems para karaokê, quatro para remixar.
  3. Escolha o melhor modelo se a ferramenta oferecer a opção. Os modos lentos de "alta qualidade" costumam soar bem mais limpos.
  4. Inicie o processamento e aguarde. A maioria das músicas termina em alguns minutos.
  5. Baixe em WAV se houver essa opção, para que os stems não sejam comprimidos uma segunda vez.

Confira o resultado com os ouvidos

Coloque os fones de ouvido e ouça cada stem isoladamente. Ouça um verso e um refrão, porque os refrões são mais densos e revelam os problemas primeiro. Você está verificando três coisas: "fantasmas" vocais fracos no instrumental, textura chiada ou aquosa nos pratos e terminações de palavras cortadas no stem vocal.

Para um teste mais rigoroso, carregue o original e o instrumental em qualquer editor de áudio, inverta a polaridade do instrumental e toque os dois juntos. O que você ouve é, mais ou menos, a voz mais o que o modelo errou. Se bateria ou acordes aparecerem, o modelo os tirou do instrumental por engano.

💡 Dica: avalie os stems no volume em que você vai realmente usá-los. Um fantasma vocal que some em volume de festa pode ser óbvio em um quarto silencioso com fones de ouvido.

Por que algumas músicas se separam mal

Reverb, harmonias e mixagens mono

Vista de perto de um antigo gravador de rolo com fita magnética marrom

Algumas músicas reagem, e raramente a culpa é da ferramenta. Os suspeitos habituais:

  • Reverb pesada. A cauda de eco de uma voz se espalha pelo campo estéreo e muitas vezes fica no instrumental como um coro fraco e fantasmagórico.
  • Harmonias empilhadas. Os vocais de apoio podem cair no instrumental enquanto a voz principal vai para o arquivo vocal, ou o contrário.
  • Vocais distorcidos. Cantos gritados ou muito saturados dividem muito espaço de frequência com as guitarras.
  • Gravações antigas em mono. Truques de fase precisam de uma imagem estéreo, então falham por completo em fitas mono. Modelos de IA ainda funcionam, mas a origem costuma ter chiado e banda limitada, o que reduz o teto de qualidade.
  • Vocais picotados por amostragem. Um vocal picotado usado como instrumento é difícil de classificar como um ou outro.

Corrigindo artefatos

Você não precisa aceitar o primeiro resultado. Associe o sintoma a uma correção:

O que você ouveCausa provávelO que tentar
Canto fraco no instrumentalCauda de reverb ou vocais de apoioPasse o instrumental pelo separador uma segunda vez
Pratos aquosos e com redemoinhosModelo com dificuldade com detalhes rápidos de altas frequênciasTroque para um modelo de maior qualidade ou outra ferramenta
Voz fina ou robóticaArquivo de origem com baixo bitrateRecomece a partir de um WAV, FLAC ou MP3 de 256 kbps
Bateria vazando para o vocalCaixa ou chimbal dividindo frequências com a vozUse uma separação em quatro stems e descarte o stem de bateria
Palavras cortadas no fimModelo confundindo fade-outs com ruídoTeste outro modelo ou misture um pouco da mixagem original

Mais duas correções ficam no seu editor de áudio. Um gate ou quedas manuais de volume no instrumental removem fantasmas vocais entre as frases, quando nada mais está tocando para escondê-los. Um corte suave de EQ na média-alta, aproximadamente onde a voz se situa, pode esconder restos sem estragar a música.

Em uma festa, ninguém percebe um fantasma fraco. Para um lançamento, refaça a seção fraca à mão ou substitua a faixa por completo, o que volta a aparecer mais adiante.

Usos reais para vocais isolados

Karaokê sem procurar faixas

Mulher de jaqueta jeans cantando em um microfone numa noite de karaokê em um pequeno bar

Versões oficiais de karaokê não existem para a maioria das músicas, principalmente as mais novas ou de nicho. Uma separação em dois stems lhe dá um instrumental em minutos. Carregue-o em qualquer player, coloque a letra em uma segunda tela e você tem uma noite de karaokê particular.

Se o tom original estiver alto ou baixo demais para você, a maioria dos players consegue mudar a altura em alguns semitons sem alterar a velocidade. Desça o cantor dois ou três tons e uma música que parecia fora de alcance passa a ficar confortável.

Acapellas para DJs e remixers

Close das mãos de um DJ colocando um disco de vinil em uma vitrola

Um vocal isolado é a matéria-prima de um remix. Coloque-o sobre uma nova batida, ajuste o andamento para combinar e recorte frases para criar um gancho. Separações em quatro stems ajudam aqui: o stem de bateria permite recriar o groove, e descartar o stem de baixo permite substituir um grave que conflita com sua nova faixa.

Alguns hábitos fazem os acapellas se comportarem bem. Primeiro, ajuste o andamento, depois confira a afinação em relação à sua nova faixa para que as duas não briguem. Acrescente um pouco de reverb por cima, em vez de depender do que o separador deixou para trás. Se você pretende publicar o resultado, leia a seção sobre direitos abaixo antes de fazer qualquer outra coisa.

Pratique junto com a banda

Guitarrista adolescente tocando um violão deitado na cama enquanto um celular toca uma faixa de acompanhamento

Músicos usam a separação como uma sala de ensaio. Um baixista silencia o stem de baixo e toca a linha ao vivo. Um guitarrista usa uma separação em seis stems para silenciar a guitarra. Um cantor ensaiando harmonias pode tirar a voz principal e ouvir os vocais de apoio sozinhos. Reduza a reprodução para metade da velocidade e os stems costumam continuar limpos o bastante para acompanhar uma passagem difícil.

As mesmas ferramentas funcionam com áudio falado. Podcasters e editores de vídeo as usam para tirar a música de fundo de uma voz gravada, ou para manter a música e remover o diálogo para outra edição.

O que fazer com seus stems

Depois de ter um vocal ou um instrumental limpo, ele se torna material de partida para outros projetos. A PicassoIA tem modelos para transcrição, geração de vídeo e geração de música, e três trabalhos mostram como as peças se encaixam.

Extraia a letra do stem vocal

Um vocal sem a banda é muito mais fácil de entender para um modelo de fala. Envie o stem vocal para o GPT 4o Transcribe e defina o idioma com o código de duas letras, como en, para melhorar a precisão e a velocidade. O modelo aceita arquivos MP3, WAV, M4A, OGG e WebM. O Gemini 3 Pro é uma segunda opção se a primeira transcrição tiver dificuldade com um verso rápido.

Palavras cantadas são mais difíceis que a fala, então revise o resultado comparando com a música. Mesmo assim, corrigir um rascunho leva muito menos tempo do que digitar cada linha de ouvido.

Transforme o vocal em um vídeo com letra

Criadora de vídeos no escritório de casa editando um clipe com fones de ouvido e um microfone boom

O Audio To Video recebe um arquivo de áudio e uma imagem ou um prompt de texto, depois gera um vídeo curto cujas imagens respondem ao som. Um stem vocal é uma boa entrada, porque o movimento acompanha o canto em vez da bateria.

Como usar na PicassoIA:

  1. Abra a página do modelo e envie o stem vocal (WAV, MP3, FLAC, OGG ou M4A).
  2. Adicione uma imagem para servir como primeiro quadro, ou descreva a cena no prompt se não tiver uma. Se adicionar as duas coisas, o prompt descreve como a imagem deve se mover.
  3. Ajuste o guidance scale. Valores mais altos seguem o seu prompt com mais fidelidade, mas podem reduzir a qualidade, então aumente aos poucos.
  4. Gere, revise o clipe e ajuste o prompt até que o movimento combine com o clima da música.
  5. Monte os clipes no seu editor de vídeo e adicione a letra transcrita como legendas.

O modelo cria clipes curtos, então trabalhe um verso ou um refrão por vez.

Crie uma nova faixa de acompanhamento

Se o seu instrumental tiver fantasmas que você não consegue corrigir, ou se você não pode publicar o original, gere um novo. Descreva o andamento, o clima e os instrumentos da música que está substituindo, e deixe um modelo de texto para música compor algo novo:

Escreva prompts como faria ao passar um briefing para uma banda de estúdio: "pop indie de andamento médio, 100 BPM, guitarra elétrica limpa, bateria suave com vassouras, baixo quente e bastante espaço para um vocal feminino principal." Gere várias versões e escolha a que melhor se encaixa por baixo do seu vocal.

Separar um arquivo não muda quem é o dono dele. Em muitos lugares, criar uma faixa de karaokê particular ou um loop de prática para uso próprio fica em uma zona cinzenta que os detentores de direitos raramente perseguem. Publicar, transmitir ou vender algo construído a partir de uma gravação comercial é diferente: exige permissão ou licença de quem é dono da música. Isso se aplica ao vocal, ao instrumental e a qualquer remix dos dois. Não é aconselhamento jurídico, e as regras variam de país para país.

Os caminhos seguros são simples. Separe as suas próprias gravações, faixas para as quais você recebeu licença de remix e músicas lançadas com stems especificamente para remixar.

Experimente na Picasso IA

Separar é a parte fácil. A diversão começa quando você constrói em cima disso. Escreva um novo instrumental com um modelo de texto para música, crie a arte do álbum com o Seedream 4.5 ou transforme um refrão em um clipe curto com o Audio To Video. Abra a PicassoIA, digite um prompt e veja o que uma tarde de experimentos pode produzir.

Escolha uma música que você adora, separe-a e crie algo novo com as peças. Sua próxima faixa, arte ou vídeo começa com um único prompt.

Compartilhe este artigo

Escolha seu idioma