Vous avez une chanson qui tourne en boucle dans votre tête, mais vous n’en voulez que la moitié : le chanteur, ou le groupe. Il y a quelques années, cela supposait une session en studio et beaucoup de chance. Aujourd’hui, un suppresseur de voix IA gratuit en ligne peut dissocier un morceau en quelques minutes, le temps de préparer un café, et le résultat est souvent assez propre pour chanter par-dessus, remixer ou étudier note par note.
Cet article explique comment fonctionne réellement la technologie, ce que les outils gratuits vous offrent et ce qu’ils ne vous offrent pas, comment obtenir une séparation correcte sur un morceau récalcitrant, et que faire des fichiers ensuite. Une précision honnête d’entrée de jeu : PicassoIA ne dispose pas de son propre séparateur de pistes. Vous effectuez la séparation avec n’importe quel séparateur gratuit, puis vous importez les stems ici pour les paroles, les clips vidéo sur paroles et de toutes nouvelles musiques. La séparation est la première étape, pas la ligne d’arrivée.

💡 Réponse rapide : importez un WAV (ou un MP3 à haut débit) dans un séparateur de stems IA, choisissez l’option voix et instrumental, téléchargez les deux fichiers et écoutez-les au casque avant de les utiliser. Tout ce qui suit explique comment y parvenir avec des morceaux récalcitrants.
Ce que fait réellement un suppresseur de voix
L’ancienne astuce de phase face à la séparation par IA
Avant les réseaux de neurones, la technique standard était l’annulation de phase. Les voix principales sont généralement mixées en plein centre, si bien que les canaux gauche et droit transportent un chant presque identique. Inversez la phase d’un canal et additionnez les deux : tout ce qui est identique dans les deux canaux s’annule. En théorie, la voix disparaît.
En pratique, la grosse caisse, la basse et souvent la caisse claire sont aussi au centre, elles disparaissent donc avec la voix. Ce qui reste sonne fin, creux et baigne dans une réverbération résiduelle, car la réverbération est large et ne s’annule pas.

La séparation par IA fonctionne différemment. Un réseau de neurones est entraîné sur d’énormes quantités d’enregistrements dont chaque partie est connue à l’avance. Il apprend donc à reconnaître à quoi ressemble une voix humaine dans un spectrogramme : les harmoniques superposées, les consonnes soufflées, le tremblement du vibrato. À partir d’un mixage stéréo fini, il estime quelles parties du son appartiennent à la voix et reconstruit ce signal dans son propre fichier. Le reste va dans un second fichier. Rien n’est soustrait à l’aveugle, c’est pourquoi la basse et la grosse caisse survivent.
Des modèles open source comme Demucs (développé par l’équipe de recherche de Meta) et Spleeter (développé par Deezer) sont les exemples les plus connus, et de nombreux outils web gratuits reposent sur la même famille d’idées.
Les stems expliqués simplement
Un stem est un groupe de sons liés, regroupés dans un seul fichier audio : toutes les voix, toute la batterie, toute la basse. La plupart des outils vous permettent de choisir en combien de stems séparer le morceau.
| Type de séparation | Fichiers obtenus | Idéal pour |
|---|
| 2 stems | Voix, instrumental | Pistes karaoké, a cappella, retouches rapides |
| 4 stems | Voix, batterie, basse, autres | Remixes, entraînement à la batterie ou à la basse |
| 5 à 6 stems | Ajoute piano et/ou guitare | Isoler un seul instrument pour l’étudier |
Les options exactes dépendent de l’outil. Deux stems est la méthode la plus rapide et généralement la plus propre, car le modèle a la tâche la plus simple : voix ou pas voix. Chaque stem supplémentaire ajoute une chance qu’un son finisse dans le mauvais fichier.

Une façon utile de voir les choses : le stem vocal est ce qu’un micro placé dans cette cabine aurait capté, et l’instrumental correspond à tout ce que le reste du groupe a joué. Le modèle devine cette session d’enregistrement d’origine en remontant à partir du mixage fini.
Bien choisir un outil gratuit
Ce que les offres gratuites limitent généralement
« Gratuit » n’a pas la même signification d’un site à l’autre. Avant d’importer quoi que ce soit, vérifiez ces limites courantes :
- Durée du morceau : de nombreuses offres gratuites plafonnent chaque import à quelques minutes.
- Imports quotidiens : un nombre fixe de chansons par jour, puis une file d’attente ou un paywall.
- Qualité d’export : aperçus ou téléchargements en MP3 uniquement, le WAV étant réservé aux utilisateurs payants.
- Nombre de stems : deux stems gratuits, quatre ou plus réservés à un abonnement.
- Stockage des fichiers : votre import reste pendant un certain temps sur le serveur de quelqu’un d’autre. Si le morceau est inédit, lisez d’abord les conditions de confidentialité.
Navigateur, logiciel ou intégré ?
| Méthode | Coût | Qualité | Vitesse | Principal inconvénient |
|---|
| Annulation de phase | Gratuite | Faible | Instantanée | Supprime la basse et la grosse caisse, garde la réverbération |
| Outil IA en ligne | Offre gratuite | Bonne à très bonne | Quelques minutes | Plafonds d’import, files d’attente, limites d’export |
| Modèle open source sur votre PC | Gratuit | Très bonne | Dépend de votre matériel | Nécessite une installation, un GPU aide |
| Séparateur de stems intégré à une DAW | Inclus dans le logiciel | Bonne | Rapide | Lié à un seul programme |
Un outil en ligne est le bon choix pour un usage ponctuel. Si vous séparez souvent des morceaux, ou si vous travaillez sur du matériel inédit, faire tourner un modèle open source sur votre propre machine évite de confier vos fichiers à des serveurs tiers et supprime les limites quotidiennes. Plusieurs grandes applications de production musicale proposent désormais leur propre séparateur de stems, ce qui vaut la peine d’être vérifié avant d’installer quoi que ce soit de neuf.
💡 Avant d’importer : utilisez le fichier de meilleure qualité dont vous disposez, gardez le morceau dans sa longueur complète et notez les réglages choisis. Comparer deux essais plus tard est bien plus simple quand vous savez exactement ce qui a changé.
Séparer une chanson étape par étape
Préparer le fichier source
La qualité d’entrée détermine la qualité de sortie. Un WAV ou un FLAC sans perte donne au modèle le plus d’informations à exploiter. Un MP3 convient à partir de 256 kbit/s. La pire source est un fichier extrait d’une vidéo en streaming ou enregistré à partir d’une enceinte, car la compression a déjà brouillé les détails dont le modèle a besoin pour distinguer une voix d’une guitare.
Ne découpez pas le morceau. Les modèles utilisent la piste entière comme contexte, et couper une intro ou un outro fait rarement gagner un temps significatif. Évitez aussi les astuces de compression de volume en amont : un morceau écrasé par un limiteur supplémentaire laisse moins de place entre la voix et les instruments.
Lancer la séparation

Le déroulé est presque identique sur tous les services :
- Importez votre fichier, ou collez un lien si l’outil le permet.
- Choisissez le nombre de stems. Deux stems pour le karaoké, quatre pour le remix.
- Sélectionnez le meilleur modèle si l’outil propose un choix. Les modes « haute qualité », plus lents, sonnent généralement nettement plus propres.
- Lancez le traitement et patientez. La plupart des chansons sont prêtes en quelques minutes.
- Téléchargez en WAV si l’option est disponible, pour que les stems ne soient pas compressés une seconde fois.
Vérifier le résultat à l’oreille
Mettez un casque et écoutez chaque stem isolément. Écoutez un couplet et un refrain, car les refrains sont plus denses et révèlent les problèmes en premier. Vérifiez trois choses : des « fantômes » vocaux discrets dans l’instrumental, une texture sifflante ou aqueuse sur les cymbales, et des fins de mots coupées dans le stem vocal.
Pour un test plus rigoureux, chargez l’original et l’instrumental dans n’importe quel éditeur audio, inversez la polarité de l’instrumental et lisez-les ensemble. Ce que vous entendez correspond à peu près à la voix, plus ce que le modèle a mal traité. Si la batterie ou les accords ressortent, le modèle les a retirés par erreur de l’instrumental.
💡 Astuce : jugez les stems au volume où vous les utiliserez réellement. Un fantôme vocal qui disparaît à volume de fête peut être évident dans une pièce calme, au casque.
Pourquoi certaines chansons se séparent mal
Réverbération, harmonies et mixages mono

Certaines chansons résistent, et la faute vient rarement de l’outil. Les coupables habituels :
- Réverbération forte. La queue d’écho d’une voix s’étale dans le champ stéréo et reste souvent dans l’instrumental sous la forme d’un chœur fantomatique et discret.
- Harmonies superposées. Les voix d’accompagnement peuvent atterrir dans l’instrumental pendant que la voix principale part dans le fichier vocal, ou l’inverse.
- Voix distordues. Le chant crié ou fortement saturé partage beaucoup d’espace de fréquences avec les guitares.
- Anciens enregistrements mono. Les astuces de phase ont besoin d’une image stéréo, elles échouent donc complètement sur les bandes mono. Les modèles d’IA fonctionnent encore, mais la source présente souvent du souffle et une bande passante limitée, ce qui abaisse le plafond de qualité.
- Extraits vocaux échantillonnés. Un extrait vocal découpé et utilisé comme un instrument est difficile à classer dans l’une ou l’autre catégorie.
Corriger les artefacts
Vous n’êtes pas obligé d’accepter le premier résultat. Associez le symptôme à une solution :
| Ce que vous entendez | Cause probable | Ce qu’il faut essayer |
|---|
| Chant discret dans l’instrumental | Queue de réverbération ou voix d’accompagnement | Repassez l’instrumental dans le séparateur une seconde fois |
| Cymbales aqueuses et tourbillonnantes | Modèle en difficulté avec les détails haute fréquence rapides | Passez à un modèle de meilleure qualité ou à un autre outil |
| Voix fine ou robotique | Fichier source à faible débit | Recommencez à partir d’un WAV, d’un FLAC ou d’un MP3 à 256 kbit/s |
| Batterie qui fuit dans la voix | Caisse claire ou charleston partageant les fréquences de la voix | Utilisez une séparation à quatre stems, puis supprimez le stem batterie |
| Fins de mots coupées | Modèle qui confond les fondus de sortie avec du bruit | Essayez un autre modèle, ou mélangez un peu du mixage original |
Deux autres corrections se font dans votre éditeur audio. Une porte de bruit ou des baisses de volume manuelles sur l’instrumental suppriment les fantômes vocaux entre les phrases, quand rien d’autre ne joue pour les masquer. Une légère coupure d’égaliseur dans le haut-médium, à peu près là où se situe une voix, peut faire disparaître les restes sans abîmer la musique.
Pour une soirée, personne n’entend un fantôme discret. Pour une sortie officielle, recréez la section faible à la main ou remplacez entièrement le morceau, ce qui est abordé plus loin.
Usages concrets des voix isolées
Du karaoké sans chercher de pistes

Il n’existe pas de versions karaoké officielles pour la plupart des chansons, surtout les plus récentes ou les plus confidentielles. Une séparation en deux stems vous donne un instrumental en quelques minutes. Chargez-le dans n’importe quel lecteur, affichez les paroles sur un second écran, et vous obtenez une soirée karaoké privée.
Si la tessiture originale est trop haute ou trop basse pour vous, la plupart des lecteurs permettent de décaler la hauteur de quelques demi-tons sans changer la vitesse. Baissez la tonalité de deux ou trois crans et une chanson qui semblait hors de portée devient soudain confortable.
Des a cappella pour les DJ et les remixeurs

Une voix isolée est la matière première d’un remix. Posez-la sur un nouveau beat, étirez le tempo pour l’aligner, découpez des phrases pour en faire un refrain accrocheur. Les séparations à quatre stems sont utiles ici : le stem batterie permet de reconstruire le groove, et supprimer le stem basse permet de remplacer des graves qui jurent avec votre nouveau morceau.
Quelques habitudes aident les a cappella à bien se comporter. Alignez d’abord le tempo, puis vérifiez la hauteur par rapport à votre nouveau morceau pour que les deux ne se battent pas. Ajoutez un peu de réverbération plutôt que de compter sur ce que le séparateur a laissé derrière. Si vous comptez publier le résultat, lisez d’abord la section sur les droits ci-dessous.
S’entraîner avec le groupe

Les musiciens utilisent la séparation comme une salle de répétition. Un bassiste coupe le stem basse et joue la ligne en direct. Un guitariste utilise une séparation à six stems pour couper la guitare. Un chanteur qui répète des harmonies peut baisser la voix principale et écouter les voix d’accompagnement seules. Ralentissez la lecture à la moitié de la vitesse et les stems restent généralement assez propres pour suivre un passage délicat.
Les mêmes outils fonctionnent sur de l’audio parlé. Les podcasteurs et les monteurs vidéo s’en servent pour extraire la musique de fond d’un enregistrement de voix, ou pour garder la musique et supprimer le dialogue pour un autre montage.
Que faire de vos stems
Une fois que vous disposez d’une voix ou d’un instrumental propre, il devient la matière de départ d’autres projets. PicassoIA propose des modèles de transcription, de génération de vidéos et de musique, et trois exemples montrent comment ces pièces s’assemblent.
Extraire les paroles du stem vocal
Une voix sans le groupe est bien plus facile à comprendre pour un modèle de reconnaissance vocale. Importez le stem vocal dans GPT 4o Transcribe et indiquez la langue avec son code à deux lettres, par exemple en, pour améliorer la précision et la vitesse. Le modèle accepte les fichiers MP3, WAV, M4A, OGG et WebM. Gemini 3 Pro est une deuxième option si la première transcription peine sur un couplet rapide.
Les paroles chantées sont plus difficiles que la parole, relisez donc le résultat en le comparant à la chanson. Même ainsi, corriger un brouillon prend beaucoup moins de temps que de retranscrire chaque ligne à l’oreille.
Transformer la voix en clip vidéo sur paroles

Audio To Video prend un fichier audio et soit une image, soit un prompt texte, puis génère une courte vidéo dont les visuels réagissent au son. Un stem vocal est une bonne entrée, car le mouvement suit le chant plutôt que la batterie.
Comment l’utiliser sur PicassoIA :
- Ouvrez la page du modèle et importez le stem vocal (WAV, MP3, FLAC, OGG ou M4A).
- Ajoutez une image qui servira de première image, ou décrivez la scène dans le prompt si vous n’en avez pas. Si vous ajoutez les deux, le prompt décrit la manière dont l’image doit bouger.
- Ajustez le guidance scale. Des valeurs élevées suivent mieux votre prompt, mais peuvent réduire la qualité, augmentez-le donc par petits paliers.
- Générez, examinez le clip et ajustez le prompt jusqu’à ce que le mouvement corresponde à l’ambiance.
- Assemblez les clips dans votre éditeur vidéo et ajoutez les paroles transcrites en sous-titres.
Le modèle crée de courts clips, travaillez donc un couplet ou un refrain à la fois.
Créer une nouvelle piste d’accompagnement
Si votre instrumental présente des fantômes que vous ne pouvez pas corriger, ou si vous n’avez pas le droit de publier l’original, générez-en un nouveau. Décrivez le tempo, l’ambiance et les instruments du morceau à remplacer, et laissez un modèle de génération de musique à partir de texte en écrire un inédit :
Rédigez vos prompts comme si vous briefiez un groupe de session : « pop indie au tempo modéré, 100 BPM, guitare électrique claire, batterie aux balais douce, basse chaleureuse, beaucoup d’espace pour une voix principale féminine. » Générez plusieurs versions et gardez celle qui s’intègre le mieux sous votre voix.
Est-il légal de séparer des chansons ?
Séparer un fichier ne change pas son propriétaire. Dans de nombreux pays, créer une piste karaoké privée ou une boucle d’entraînement pour soi-même se situe dans une zone grise que les ayants droit poursuivent rarement. Publier, diffuser ou vendre quelque chose construit à partir d’un enregistrement commercial est différent : cela nécessite une autorisation ou une licence de la part du titulaire des droits sur la chanson. Cela s’applique à la voix, à l’instrumental et à tout remix des deux. Ceci n’est pas un conseil juridique, et les règles varient selon les pays.
Les voies sûres sont simples. Séparez vos propres enregistrements, les morceaux pour lesquels vous avez obtenu une licence de remix, et la musique publiée avec des stems spécialement destinés au remix.
Essayez-le sur Picasso IA
La séparation est la partie facile. L’amusement commence quand vous construisez à partir d’elle. Écrivez un nouvel instrumental avec un modèle de génération de musique à partir de texte, concevez la pochette de votre album avec Seedream 4.5, ou transformez un refrain en courte vidéo avec Audio To Video. Ouvrez PicassoIA, tapez un prompt et voyez ce qu’une après-midi d’expérimentation peut produire.
Choisissez une chanson que vous aimez, séparez-la et créez quelque chose de nouveau avec les morceaux. Votre prochain titre, votre prochaine pochette ou votre prochaine vidéo commence par un seul prompt.