API de clonage vocal : gratuit, ElevenLabs, Cartesia et MiniMax comparés

Trois API de clonage vocal côte à côte. Découvrez ce que chacune de ces API, ElevenLabs, Cartesia et MiniMax, offre gratuitement, combien d’audio il faut pour cloner une voix, ce que coûte un million de caractères, et quand un outil dans le navigateur vaut mieux que du code d’intégration.

API de clonage vocal : gratuit, ElevenLabs, Cartesia et MiniMax comparés
Cristian Da Conceicao
Fondateur de Picasso IA

Chaque promesse d’API de clonage vocal commence par le mot gratuit, et presque aucune ne l’entend comme vous l’espérez. Un compte ElevenLabs gratuit ne permet pas du tout de cloner une voix. L’offre gratuite de Cartesia se limite à un usage non commercial. Dans les comparatifs consultés pour cette analyse, MiniMax ne propose aucune offre gratuite et facture 1,50 $ par voix clonée. Si vous choisissez une API pour un produit, un pipeline de podcast ou un flux de travail pour livres audio, le prix mis en avant dit très peu de choses.

Ce comparatif met les trois fournisseurs côte à côte sur les points qui tranchent un projet : la quantité d’audio nécessaire pour chacun, ce que vous payez avant la première phrase finie, ce qui arrive à la voix clonée ensuite, et le moment où un outil dans le navigateur bat l’écriture d’un code d’intégration. Les chiffres proviennent des comparatifs de tarifs 2026 en date d’octobre 2026. Les fournisseurs modifient souvent leurs offres : vérifiez les montants sur la page tarifaire en ligne avant de vous engager sur un budget.

Ce que fait une API de clonage vocal

Une API de clonage vocal transforme un court enregistrement en identifiant de voix réutilisable. Vous importez l’échantillon une seule fois, le fournisseur renvoie un identifiant, et chaque requête de synthèse vocale suivante transmet cet identifiant pour que le nouveau texte sorte avec la même voix. Pas de réentraînement par script, pas de nouvel import de l’enregistrement.

Clones instantanés ou professionnels

Les fournisseurs proposent deux niveaux de clone, et le niveau détermine à la fois la qualité et le prix :

  • Clone instantané : nécessite de 10 secondes à quelques minutes d’audio et il est prêt en quelques secondes. Il capte le timbre et le style général de diction, mais il peut aplatir l’émotion sur les longues lectures.
  • Clone professionnel : nécessite de 30 minutes à plusieurs heures d’audio et s’entraîne pendant des heures. Il suit beaucoup plus fidèlement l’accent, le rythme et les habitudes de respiration. La plupart des fournisseurs le réservent aux offres supérieures et à une vérification du consentement.

Le déroulement des requêtes

L’intégration suit partout le même schéma :

  1. Envoyez le fichier d’échantillon au point de terminaison de clonage.
  2. Stockez l’identifiant de voix renvoyé par la réponse.
  3. Envoyez le texte accompagné de l’identifiant de voix au point de terminaison de synthèse vocale.
  4. Recevez un fichier audio ou un flux, facturé par caractère ou par crédit.

Deux détails modifient un budget davantage que le tarif affiché. Le premier concerne l’emplacement du clone : MiniMax supprime un clone inutilisé au bout d’une semaine, le projet doit donc anticiper cela. Le second concerne le coût d’un test : MiniMax facture les aperçus séparément, et sur une offre à crédits, chaque rendu de test consomme aussi des crédits. Un projet qui régénère le même paragraphe vingt fois en ajustant la façon de lire paie les vingt.

Vue de dessus d’un bureau de développeur avec un ordinateur portable, un microphone USB, un casque et un carnet de croquis au crayon

Trois API côte à côte

Voici la version courte avant le détail. Tous les montants sont des prix publics en USD.

ElevenLabsCartesiaMiniMax
Offre gratuite10 000 crédits par mois, pas de licence commerciale, pas de clonage instantané20 000 crédits par mois, usage non commercial uniquementAucune offre gratuite listée, 1,50 $ par voix clonée
Clonage instantané le moins cherOffre Starter, environ 5 à 6 $ par moisOffre Pro, environ 5 $ par moisPaiement à l’usage
Audio pour un clone instantané1 à 2 minutesEnviron 10 secondes10 secondes à 5 minutes
Clone professionnelOffre Creator (22 $) et au-delà, plus de 30 minutes d’audio, vérification de la voixOffre Startup (49 $ par mois) et au-delàNon listé
Unité de facturationCaractères, via des crédits mensuelsCréditsCaractères
Prix public pour 1 M de caractères50 $ (Flash) à 100 $ (Multilingual v2, v3)Variable selon l’offre60 $ (Turbo) à 100 $ (HD)

💡 Comparez le coût par minute finie, pas par offre. Un million de caractères représente environ 18 à 20 heures de narration, donc même un tarif de 100 $ par million revient à moins de 9 centimes par minute d’audio.

Les crédits et les quotas mensuels de Cartesia rendent une comparaison directe des prix impossible sans test, c’est pourquoi cette API a sa propre section plus bas.

Une équipe de collègues écoutant un échantillon de voix sur une enceinte portable, autour d’une table en chêne dans un bureau lumineux

ElevenLabs : soigné et cher

ElevenLabs est le nom que la plupart des gens choisissent en premier, et les voix le justifient. Le compromis porte sur le prix, auquel s’ajoute une gamme de clonage qui commence au-dessus de l’offre gratuite.

Ce que vous offre l’offre gratuite

L’offre gratuite inclut 10 000 crédits par mois et aucune licence commerciale, donc l’audio qui en est issu ne peut pas servir dans un contenu monétisé ou un travail pour client. Le clonage vocal instantané n’en fait pas partie non plus : le seul outil de création de voix disponible dans l’offre gratuite est Voice Design. Considérez-la comme un moyen d’auditionner des voix de la bibliothèque et de tester la forme de l’API, rien de plus.

Instantané, professionnel et prix

L’offre Starter (environ 5 à 6 $ par mois, 30 000 crédits) ajoute une licence commerciale et le clonage vocal instantané à partir de 1 à 2 minutes d’audio. Pour quelque chose de plus proche de la voix réelle du locuteur, vous passez au Professional Voice Cloning avec l’offre Creator (22 $ par mois, 121 000 crédits) et au-delà. Il demande un minimum de 30 minutes d’audio, en recommande 2 à 3 heures, s’entraîne pendant plusieurs heures et exige une vérification de la voix, ce qui empêche de cloner quelqu’un qui n’a pas donné son accord.

Côté API, les comparatifs de tarifs indiquent 0,10 $ pour 1 000 caractères sur Multilingual v2 et V3, et 0,05 $ sur Flash v2.5. Si vous voulez entendre la qualité du modèle avant de payer une offre quelle qu’elle soit, les trois fonctionnent sur PicassoIA.

Comédien aux cheveux argentés enregistrant dans une cabine vocale capitonnée devant un microphone ruban vintage

Cartesia : conçu pour le temps réel

Cartesia est construit autour de la rapidité, et ses offres le montrent : même le niveau gratuit inclut 1 $ d’usage d’agent vocal à côté des crédits, ce qui indique à qui le produit est destiné.

Le niveau gratuit et le palier à 5 $

L’offre gratuite donne 20 000 crédits de modèle par mois pour un usage personnel non commercial. Le clonage se trouve un cran au-dessus. L’offre Pro, environ 5 $ par mois ou 48 $ par an, inclut le clonage instantané à partir d’un extrait de 10 secondes, la condition la plus courte des trois fournisseurs. Le clonage vocal Pro arrive avec l’offre Startup (49 $ par mois, ou 468 $ facturés annuellement) avec 1 250 000 crédits par mois, et le palier Scale les porte à 8 000 000.

Des crédits au lieu de caractères

Les crédits rendent les devis difficiles à comparer. ElevenLabs et MiniMax facturent au caractère, tandis que Cartesia facture en crédits dont le coût par minute parlée dépend de l’offre. Passez votre script réel dans un essai, divisez les crédits dépensés par le nombre de caractères envoyés, et seulement ensuite placez ce chiffre à côté des deux autres.

Cartesia n’est pas sur PicassoIA. Si ce que vous testez est la faible latence, Inworld Realtime TTS 1.5 Mini (annoncé à 120 ms) et Inworld Realtime TTS 1.5 Max (moins de 200 ms) sont les options les plus proches axées sur la vitesse.

Gros plan des mains d’un ingénieur du son faisant glisser les potentiomètres d’une console de mixage analogique

MiniMax : le prix par caractère le plus bas

MiniMax fait figure d’exception : pas d’échelle d’abonnement pour le clonage, des frais par voix, et le prix par caractère le plus bas des trois au niveau Turbo.

Dix secondes et la règle des 168 heures

MiniMax Speech 2.8 clone une voix à partir d’une référence de 10 secondes. Le fichier peut être au format MP3, M4A ou WAV, de 10 secondes à 5 minutes et d’un poids inférieur à 20 Mo. Les identifiants de modèle sont speech-2.8-hd et speech-2.8-turbo.

Le piège est qu’une voix clonée est temporaire. Si vous ne lancez pas au moins une synthèse réelle avec l’identifiant de voix dans les 168 heures (7 jours), elle est supprimée, et l’audio d’aperçu généré au moment du clonage ne compte pas. Enregistrez l’identifiant de voix dès qu’il revient et envoyez tout de suite une courte requête réelle.

Le coût d’une voix

Le clonage coûte 1,50 $ par voix, facturé à la première synthèse, et les aperçus sont facturés séparément. La synthèse coûte 100 $ par million de caractères en HD et 60 $ en Turbo. Les deux niveaux sont sur PicassoIA : Speech 2.8 HD et Speech 2.8 Turbo.

Voici ce que coûtent 100 000 caractères de narration (environ 17 000 mots) avec une voix clonée, aux prix publics :

Fournisseur et modèleCoût de la synthèseCoût du clonageTotal
ElevenLabs Flash5 $Frais de l’offre5 $ plus l’offre
ElevenLabs Multilingual v2 ou v310 $Frais de l’offre10 $ plus l’offre
MiniMax Speech 2.8 Turbo6 $1,50 $7,50 $
MiniMax Speech 2.8 HD10 $1,50 $11,50 $
Cartesia SonicCréditsFrais de l’offreFaites un essai

ElevenLabs et Cartesia exigent une offre payante avant de pouvoir cloner, donc votre facture mensuelle réelle est plus élevée que la seule ligne de synthèse.

Gros plan extrême d’un microphone à condensateur et d’un filtre anti-pop en nylon éclairés par un faisceau de lumière matinale douce

Des options gratuites qui fonctionnent vraiment

Les offres gratuites sont des bancs d’essai. L’offre gratuite d’ElevenLabs ne permet pas de cloner et celle de Cartesia est non commerciale : servez-vous-en pour auditionner des voix et vérifier le fonctionnement de l’API, puis prévoyez une offre payante si le résultat part en production.

Cloner dans le navigateur

Si votre objectif est un fichier vocal fini plutôt qu’une intégration, PicassoIA réalise le clonage sans code :

  • Voice Cloning (MiniMax) : un profil de voix réutilisable à partir d’un échantillon de 10 secondes à 5 minutes, indiqué comme gratuit à essayer en ligne.
  • Chatterbox de Resemble AI : clonage vocal avec contrôle des émotions.
  • Qwen3 TTS : clonez une voix ou concevez-en une nouvelle de zéro.

💡 Au moment de la rédaction, l’API pour développeurs de PicassoIA liste des modèles d’image et de vidéo, donc le clonage vocal s’y fait depuis le navigateur. Consultez la page de l’API pour la liste actuelle des modèles avant de planifier une intégration.

Narrateur de livre audio de profil, lisant dans un livre relié au sein d’une cabine d’enregistrement à façade en verre

Utiliser le clonage vocal sur PicassoIA

  1. Ouvrez la page Voice Cloning.
  2. Importez votre échantillon au format MP3, M4A ou WAV, de 10 secondes à 5 minutes et de moins de 20 Mo.
  3. Activez la réduction de bruit si la pièce n’était pas silencieuse, et la normalisation du volume si les niveaux fluctuent.
  4. Choisissez le niveau de synthèse que vous comptez utiliser : Speech 2.6 HD (par défaut), Speech 2.6 Turbo, Speech 02 HD ou Speech 02 Turbo.
  5. Laissez la précision à sa valeur par défaut de 0,7 et ne l’ajustez que si les résultats s’éloignent de votre façon de prononcer les mots.
  6. Lancez le traitement et conservez l’identifiant de voix pour vos synthèses.

💡 Utilisez un niveau HD pour une narration finale et un niveau Turbo pour des brouillons rapides. Faire les brouillons sur Turbo puis générer le rendu final en HD garde les itérations peu coûteuses.

Enregistrer un échantillon propre

Le clone de chaque fournisseur ne vaut jamais plus que l’enregistrement. L’échantillon compte davantage que l’offre que vous payez.

Jeune femme enregistrant un échantillon de voix sur un smartphone à l’intérieur d’un placard garni de manteaux en laine et de couvertures

  • Choisissez une petite pièce douce. Un placard rempli de manteaux vaut mieux qu’une cuisine nue. Les murs durs ajoutent un écho que le clone reproduira.
  • Restez à la largeur d’une main du microphone. Plus près, cela provoque des plosives ; plus loin, cela capte la pièce.
  • Enregistrez 30 à 60 secondes même quand le minimum est de 10. Lisez des phrases variées avec une question, un nombre et une pause.
  • Gardez un son propre. Un seul locuteur, pas de musique, pas de bruit de ventilateur.

Une fois le clone créé, vérifiez-le par un aller-retour. Passez l’audio généré dans GPT-4o Transcribe et comparez le texte à votre script. Tout mot qui ressort différent marque un endroit où la voix bafouille. Pour une introduction de podcast ou de vidéo, vous pouvez aussi superposer la narration clonée à une piste de Music 2.6 ou de Stable Audio 2.5.

Lequel convient à votre projet

Interface audio de studio avec des potentiomètres de gain métalliques à côté d’une paire d’enceintes de monitoring et de lunettes de lecture pliées

Votre projetMeilleur choixPourquoi
Agent vocal en directCartesiaOffres axées sur la vitesse, clone de 10 secondes
Long livre audioMiniMax Turbo ou HDCoût par caractère le plus bas
Vidéo multilingue soignéeElevenLabsGamme de modèles et clones professionnels
Voix off ponctuelleOutil navigateurSans code, sans frais d’offre

Agents vocaux et appels en direct

Un agent téléphonique se joue sur le délai avant le premier mot. Les offres de Cartesia incluent l’usage d’agent vocal, et son clone de 10 secondes est le plus rapide à mettre en place. Testez le coût en crédits par appel avant de passer à l’échelle.

Livres audio et narrations longues

La narration est un jeu de volume, donc le coût par caractère prime. MiniMax Turbo à 60 $ par million de caractères, ou HD à 100 $, rend un long livre abordable. Découpez le texte en chapitres, réutilisez un même identifiant de voix, et gardez en tête la règle des 168 heures : continuez à générer dans la fenêtre.

Applications avec beaucoup de voix

Si chaque utilisateur enregistre sa propre voix, la facturation par voix s’additionne vite. Au tarif de 1,50 $ de MiniMax, 10 000 utilisateurs clonant chacun une voix représentent 15 000 $ de frais de clonage avant même la génération du moindre audio. Conservez aussi chaque échantillon d’origine, car une voix qui expire après sept jours d’inactivité doit être recréée.

Questions à trancher d’abord

Avant de choisir un fournisseur, répondez à ces cinq questions :

  • Avez-vous besoin de droits commerciaux ? Les offres gratuites d’ElevenLabs et de Cartesia ne les incluent pas.
  • Combien d’audio avez-vous du locuteur ? Avec seulement 10 secondes, Cartesia et MiniMax fonctionnent, alors que le clonage instantané d’ElevenLabs demande 1 à 2 minutes.
  • La voix doit-elle rester permanente ? MiniMax exige une synthèse réelle dans les sept jours.
  • Facturez-vous au caractère ou au crédit ? Choisissez l’unité qui correspond à la façon dont votre propre produit facture ses utilisateurs.
  • Quelles langues proposez-vous ? Comparez la liste de langues de chaque fournisseur à la vôtre avant de cloner, car une voix peut ne pas parler toutes les langues aussi bien.

Le consentement passe avant tout, quelle que soit l’API que vous choisissez. Ne clonez que des voix qui vous appartiennent ou dont vous avez l’autorisation écrite d’utilisation. ElevenLabs exige une vérification pour les clones professionnels, et l’audio d’une offre gratuite ne comporte aucun droit commercial.

Homme âgé aux cheveux blancs parlant dans un petit microphone à une table de cuisine ensoleillée, à côté d’une vieille photo de famille

Un bon usage du clonage est celui de la famille : un grand-parent qui accepte d’enregistrer vingt minutes de récits, conservés dans une voix que ses petits-enfants pourront toujours entendre.

Essayez sur PicassoIA

Le moyen le plus rapide de comparer ces fournisseurs est d’entendre revenir votre propre voix. Enregistrez 30 secondes dans un placard silencieux, importez-le dans Voice Cloning sur PicassoIA, et lisez un paragraphe de votre propre script dans la voix clonée. Passez ensuite du niveau Turbo au niveau HD et écoutez la différence, ou essayez Chatterbox pour le contrôle des émotions. Dix minutes de test vous en apprendront plus sur vos besoins que n’importe quel tableau de prix, et l’essai ne coûte rien.

Partager cet article

Choisissez votre langue