Alternative à ElevenLabs : options gratuites, open source et clonage vocal

Les crédits s’épuisent vite et les conditions de licence gênent souvent, alors beaucoup de créateurs cherchent une alternative à ElevenLabs. Cet article compare les outils gratuits en ligne, les moteurs open source et les options de clonage vocal, avec les réglages, les notes sur les licences et des choix pour les podcasts, les publicités et les livres audio.

Alternative à ElevenLabs : options gratuites, open source et clonage vocal
Cristian Da Conceicao
Fondateur de Picasso IA

Payer un générateur de voix devient pénible dès qu’un seul chapitre de livre audio consomme tous vos crédits du mois. C’est le point de départ de la plupart des recherches pour une alternative à ElevenLabs : les voix sont excellentes, mais les limites, les conditions de licence et la tarification au caractère poussent les utilisateurs à chercher ailleurs. Bonne nouvelle, le marché offre désormais de vraies options. Certaines sont gratuites à tester dans le navigateur, d’autres sont open source et tournent sur votre propre machine, et quelques-unes clonent une voix à partir d’un extrait de dix secondes seulement.

Cet article classe ces options selon vos besoins réels. Vous verrez à partir de quel moment les offres gratuites cessent de l’être, quels moteurs open source valent la peine d’être installés, comment fonctionne le clonage vocal en pratique, et un pas-à-pas avec Chatterbox sur PicassoIA. La musique et la transcription arrivent en dernier, car presque tout projet vocal finit par en avoir besoin tôt ou tard.

Pourquoi les utilisateurs quittent ElevenLabs

ElevenLabs a bâti sa réputation. Ses voix transmettent de l’émotion, son rendu multilingue est solide et son éditeur est soigné. Personne de sérieux ne le conteste. Les frictions apparaissent plus tard, une fois le projet lancé et que le compteur tourne.

Main tournant un bouton en aluminium brossé sur une interface audio compacte

Le problème des crédits

La tarification repose sur des crédits, et ils fondent vite. L’offre gratuite a historiquement proposé environ 10 000 crédits par mois, soit à peu près dix minutes de parole. Un article de 3 000 mots lu à voix haute dure environ 20 minutes à un rythme normal, donc une narration et quelques reprises suffisent à vider le compte.

💡 Calcul rapide : 150 mots par minute est un rythme de narration confortable. Un script de 3 000 mots représente 20 minutes d’audio, avant même de compter la moindre reprise.

Les limites des offres changent souvent. Considérez donc tout chiffre que vous lisez, y compris celui-ci, comme une photographie du moment, et vérifiez la page tarifaire actuelle avant de décider.

Inquiétudes sur les licences et la confidentialité

Trois autres reproches reviennent sans cesse :

  • Droits commerciaux. Les offres gratuites exigent généralement une mention d’attribution ou interdisent l’usage commercial, si bien qu’une chaîne YouTube monétisée finit par passer sur une offre payante de toute façon.
  • Données vocales. Importer un enregistrement de vous-même, d’un client ou du PDG d’un client, c’est faire confiance à la politique de conservation d’un tiers.
  • Enfermement. Une voix clonée qui vit dans le compte d’un seul fournisseur ne peut pas être transférée vers un autre outil.

Ces trois points expliquent pourquoi les alternatives se répartissent en deux camps : les outils en ligne aux limites généreuses, et les modèles open source que vous contrôlez.

Des options gratuites qui fonctionnent vraiment

Le mot « gratuit » est trompeur sur ce marché. Avant d’y consacrer un après-midi, décidez de la forme de gratuité que vous choisissez.

Animateur de podcast riant dans un micro dynamique noir, dans une pièce pleine de bibliothèques

Les offres gratuites des outils en ligne

Une offre gratuite en ligne permet de démarrer vite, sans aucune installation. Vous tapez, lancez la génération et téléchargez. Sur PicassoIA, vous pouvez faire tourner plusieurs modèles vocaux directement dans le navigateur, dont Chatterbox Turbo, Speech 2.8 Turbo et Gemini 3.1 Flash TTS, qui propose 30 voix en plus de 70 langues. Pour des tests de narration, des publicités courtes et des clips pour les réseaux sociaux, cela suffit largement.

Les offres gratuites en ligne conviennent surtout à ces usages :

  • Test de script. Écoutez un paragraphe avant de choisir une voix.
  • Publicités courtes et reels. Trente secondes d’audio atteignent rarement un plafond mensuel.
  • Vérifications linguistiques. Passez la même phrase dans trois langues et comparez.

Un flux de travail raisonnable combine les deux univers. Rédigez et testez les voix sur un outil en ligne, où rien n’est à installer, puis transférez les longs travaux, comme les chapitres de livre audio ou un cours complet, vers un modèle open source, une fois la voix et les réglages choisis. Vous dépensez des crédits pour vos décisions et rien pour le volume.

Ce que « gratuit » coûte en général

Chaque voie gratuite implique un compromis. Ce tableau montre ce que vous abandonnez :

Voie gratuiteCe que vous abandonnezIdéal pour
Offre gratuite en lignePlafonds mensuels, files d’attente plus lentes aux heures de pointePublicités courtes, tests rapides
Open source sur votre machineTemps d’installation et un GPU performantLongue narration, audio privé
Poids ouverts sous licence non commercialeLe droit de monétiser le résultatProjets personnels, recherche
Voix système intégréesUn rendu naturelAccessibilité, premiers brouillons

Des voix open source que vous pouvez faire tourner

L’open source inverse le modèle de coût. Vous payez en temps d’installation au lieu de crédits, et une fois l’installation fonctionnelle, la millième minute d’audio coûte autant d’électricité que la première.

Vue de dessus d’un bureau en bois avec un casque, un carnet, un ordinateur portable et une interface audio

Chatterbox et Qwen3 TTS

Deux modèles méritent un premier coup d’œil, car tous deux clonent des voix et peuvent être testés sur PicassoIA sans rien installer.

Chatterbox, de Resemble AI, a été publié sous licence MIT, et ses créateurs le décrivent comme le premier modèle TTS open source doté d’un contrôle d’exagération émotionnelle. Chatterbox clone une voix à partir de quelques secondes d’audio de référence, règle l’expressivité avec un seul curseur et vous permet de figer un seed pour des prises reproductibles. Chaque sortie porte un filigrane inaudible, ce qui permet de retracer l’audio généré. Deux variantes existent pour d’autres besoins : Chatterbox Turbo pour la vitesse et Chatterbox Pro pour les voix off.

Qwen3 TTS, de Qwen, fonctionne selon trois modes. Qwen3 TTS propose neuf voix prédéfinies, le clonage vocal à partir d’un extrait de référence accompagné de sa transcription, et la conception vocale, où vous décrivez une voix en langage courant, par exemple un narrateur masculin calme avec un léger accent français, et le modèle la construit. Il parle 10 langues, dont l’anglais, l’espagnol, le français, l’allemand, le japonais et le coréen, et un champ d’instructions de style vous permet d’ajouter des indications comme « parle lentement » ou « ton enthousiaste ».

Moteurs locaux qui valent le test

Si vous voulez tout faire sur votre propre matériel, ces projets disposent de communautés actives :

  • Kokoro : un petit modèle d’environ 82 millions de paramètres sous licence Apache. Il tourne vite sur un ordinateur portable modeste et sonne net pour la narration, mais il ne clone pas les voix.
  • Piper : conçu pour un usage hors ligne et assez léger pour un Raspberry Pi. Les voix sont fonctionnelles plutôt qu’expressives, ce qui convient aux projets domotiques et aux lecteurs d’écran.
  • XTTS-v2 de Coqui : clone une voix à partir d’environ six secondes d’audio dans 17 langues. Sa licence restreint l’usage commercial, et l’entreprise qui le développait a fermé début 2024.
  • Bark : sous licence MIT, capable de produire rires et soupirs, même si les résultats varient beaucoup d’un essai à l’autre.

💡 Lisez le fichier de licence. « Open » signifie parfois code ouvert avec poids de modèle restreints. Vérifiez le dépôt avant de publier un audio cloné sur une chaîne monétisée.

Le clonage vocal sans barrière payante

Le clonage vocal est la fonctionnalité pour laquelle les utilisateurs paient le plus souvent. ElevenLabs la réserve généralement aux offres payantes, ce qui rend cette section utile à quiconque surveille son budget.

Jeune homme retouchant une forme d’onde audio sur un grand écran dans un bureau à domicile faiblement éclairé

De combien d’audio avez-vous besoin

Moins que ce que l’on imagine, à condition qu’il soit propre :

  • Quelques secondes : suffisant pour que Chatterbox produise un clone reconnaissable.
  • De 10 secondes à 5 minutes : la plage acceptée par MiniMax Voice Cloning, avec des fichiers MP3, M4A ou WAV de moins de 20 Mo.
  • Court extrait plus transcription : ce que Qwen3 TTS attend en mode clonage. Taper ce que dit le locuteur améliore la correspondance.

MiniMax Voice Cloning fonctionne différemment des autres. Vous importez un échantillon une seule fois, vous recevez un profil vocal réutilisable, puis vous appliquez cette voix à travers des modèles de synthèse comme Speech 2.6 HD, Speech 2.6 Turbo, Speech 02 HD et Speech 02 Turbo. La réduction de bruit facultative et la normalisation du volume rattrapent les enregistrements réalisés hors d’une pièce silencieuse.

Un bon extrait de référence respecte cinq règles simples :

  1. Enregistrez dans une pièce calme, avec un mobilier qui absorbe le son.
  2. Gardez le microphone à une distance constante.
  3. Parlez à votre rythme naturel, sans musique de fond.
  4. Ne faites figurer qu’un seul locuteur.
  5. Exportez un WAV propre ou un MP3 à haut débit.

Qwen3 TTS gère le clonage un peu différemment. Passez en mode clonage vocal, importez votre audio de référence, collez ce que dit le locuteur dans Reference Text, puis tapez la nouvelle phrase à prononcer. Se passer de transcription fonctionne, mais la correspondance devient moins fidèle, surtout sur les noms propres et les mots inhabituels. Si vous n’avez aucun échantillon, le mode conception vocale permet de décrire un locuteur, et des instructions de style comme lent et chaleureux ajustent l’interprétation.

Consentement et filigranes

Ne clonez que les voix qui vous appartiennent ou pour lesquelles vous avez une autorisation écrite. Conservez cette autorisation au dossier et signalez l’audio synthétique partout où une plateforme le demande. Chatterbox aide sur ce point, car son filigrane intégré permet de retracer les clips générés sans en modifier le son.

Utiliser Chatterbox sur PicassoIA

Chatterbox est ce qui se rapproche le plus d’une réponse gratuite et open source au clonage vocal expressif. Voici donc un parcours complet sur sa page du modèle.

Comédienne de voix de profil, parlant devant un filtre anti-pop dans une cabine insonorisée

Préparer l’extrait de référence

Choisissez un enregistrement de 10 à 30 secondes de la voix souhaitée, coupez le silence du début et retirez la musique ou les bruits de fond. Importez-le dans le champ Audio Prompt. Si vous laissez ce champ vide, Chatterbox utilise sa voix par défaut, ce qui est pratique pour un premier test de votre script.

Régler les curseurs

Collez votre script dans Prompt, puis ajustez les commandes. Les valeurs par défaut constituent un point de départ sûr :

RéglageValeur par défautCe qu’il faitConseil
Exaggeration0.5Définit le degré d’expressivité du renduEssayez 0.3 pour une narration calme et 0.6 à 0.7 pour des lectures dynamiques. Les valeurs extrêmes peuvent paraître instables.
CFG Weight0.5Contrôle le rythmeBaissez-le vers 0.3 si le locuteur de référence parle vite.
Temperature0.8Définit la variation entre les prisesPlus bas pour un résultat prévisible, plus haut pour plus de caractère.
Seed0Fige la priseZéro signifie aléatoire. Dès qu’une prise vous convient, notez le seed et réutilisez-le.

Modifiez un seul réglage à la fois, sinon vous ne saurez jamais quel curseur a corrigé le problème.

Vérifier le résultat

Lancez la génération, écoutez au casque et comparez le résultat avec le script. Les longs scripts se comportent mieux lorsque vous les découpez en paragraphes de quelques phrases et que vous les générez un à un. Pour repérer rapidement les mots sautés ou mal prononcés, passez l’audio final dans GPT-4o Transcribe et comparez le texte avec votre original.

💡 Astuce de reprise : conservez le seed, modifiez seulement la valeur d’exaggeration de 0.1, puis générez à nouveau. Vous obtenez la même voix avec une interprétation légèrement différente.

Comparaison côte à côte

Voici comment se positionnent les principales voies, d’après ce que chaque outil documente sur lui-même :

OptionTypeClonage vocalModèle de coûtIdéal pour
ElevenLabsEn ligneOffres payantesCrédits mensuelsVoix off multilingue soignée
ChatterboxOpen source, MITOui, à partir de quelques secondesGratuit en localNarration expressive
Qwen3 TTSPoids ouvertsOui, plus conception vocaleGratuit en localProjets multilingues
MiniMax Voice CloningEn ligneOui, de 10 secondes à 5 minutesService en ligneProfils vocaux réutilisables
KokoroOpen sourceNonGratuit en localNarration rapide hors ligne
PiperOpen sourceNonGratuit en localAppareils hors ligne
XTTS-v2Poids ouverts, non commercialOuiGratuit pour un usage personnelProjets personnels

Le verdict honnête : ElevenLabs reste la référence en matière de finition et de couverture linguistique, et personne ne doit prétendre le contraire. Ce qui a changé, c’est que l’écart se réduit. Pour les intros de podcast, les vidéos produit, les explications et les voix de personnages, les options ci-dessus sonnent suffisamment bien pour que le critère décisif devienne le coût, la licence et le contrôle plutôt que la qualité brute. Testez votre propre script sur deux ou trois d’entre elles avant de payer quoi que ce soit.

Enceinte de monitoring de studio à calandre en tissu tressé, à côté d’une petite plante grasse

Choisir selon l’usage

  • Intros et outros de podcast : Chatterbox avec un seed fixe garde chaque épisode cohérent.
  • Vidéos produit et publicités : Speech 2.8 HD vise des voix off de qualité studio.
  • Contenus multilingues : Qwen3 TTS et Gemini 3.1 Flash TTS gèrent tous deux de nombreuses langues.
  • Dialogues à deux voix : Play Dialog est conçu pour les contenus audio conversationnels.
  • Applications à faible latence : Realtime TTS 1.5 Max vise des réponses inférieures à 200 ms.
  • Rester sur les voix d’ElevenLabs : ElevenLabs v3 et Flash v2.5 sont aussi disponibles sur PicassoIA, vous pouvez donc les comparer aux alternatives au même endroit.

Petit entrepreneur enregistrant une narration de produit à un bureau lumineux

Au-delà de la voix : musique et transcriptions

ElevenLabs vend aussi la génération de musique et la transcription, une alternative sérieuse doit donc couvrir ces usages également. Les deux sont disponibles sur PicassoIA.

Musique sans casse-tête de licence

Une voix off a souvent besoin d’un fond musical. Ces modèles le génèrent à partir d’un prompt textuel :

  • Music 2.6 de MiniMax écrit des chansons complètes, voix comprises.
  • Lyria 3 Pro de Google crée des chansons de pleine durée.
  • Stable Audio 2.5 compose de la musique à partir d’une description textuelle, ce qui convient aux fonds instrumentaux.
  • ElevenLabs Music est là si vous voulez rester dans cet écosystème.

Musicienne jouant de la guitare acoustique à côté d’un microphone à condensateur dans un studio maison

Transcrire l’audio en texte

La transcription boucle le processus. GPT-4o Transcribe accepte les fichiers MP3, MP4, WAV, M4A, OGG et WebM, accepte un code de langue ISO pour une meilleure précision et un court prompt de style. GPT-4o Mini Transcribe est l’option plus légère, et Gemini 3 Pro produit lui aussi des transcriptions fiables.

Homme âgé aux cheveux argentés écoutant un livre audio au casque dans une bibliothèque

Les usages concrets comprennent :

  • Vérifier qu’une voix clonée a lu votre script mot pour mot.
  • Ajouter des sous-titres à une vidéo narrée.
  • Transformer des épisodes de podcast en articles écrits.
  • Retranscrire des entretiens enregistrés sur téléphone.

Créez votre première voix off dès aujourd’hui

Vous n’avez pas besoin d’abonnement mensuel pour obtenir une voix de synthèse convaincante. Choisissez un script court, clonez une voix avec Chatterbox ou MiniMax Voice Cloning, posez une piste de Stable Audio 2.5 en fond, puis vérifiez le résultat avec GPT-4o Transcribe. Ce flux de travail prend quelques minutes, pas un après-midi.

Picasso IA réunit des modèles de voix, de musique et de transcription au même endroit, pour que vous puissiez les comparer sur votre propre script au lieu de vous fier à une fiche technique. Ouvrez la liste complète des modèles, enregistrez un échantillon de dix secondes et écoutez ce que votre voix donne avec un nouveau paragraphe. Expérimentez avec les curseurs, essayez une deuxième voix et gardez la prise qui vous ressemble le plus.

Partager cet article

Choisissez votre langue