API Fish Audio : tarifs de la synthèse vocale et du clonage de voix, ligne par ligne

Fish Audio facture la synthèse vocale 15 $ par million d’octets UTF-8, la transcription 0,36 $ par heure audio et la conception de voix un centime par requête. Cette analyse transforme ces tarifs en budgets de projet réels, compare les forfaits web avec l’API et montre où se place le clonage de voix.

API Fish Audio : tarifs de la synthèse vocale et du clonage de voix, ligne par ligne
Cristian Da Conceicao
Fondateur de Picasso IA

Fish Audio vend la parole à l’octet, et ce seul détail explique presque toutes les surprises sur la facture. L’API Fish Audio facture 15 $ par million d’octets UTF-8 de texte pour la synthèse vocale, 0,36 $ par heure audio pour la transcription, et 0,01 $ par requête pour la conception de voix. Le clonage de voix n’apparaît pas comme ligne distincte dans ce tableau de tarifs, ce qui rend le budget plus simple qu’il n’y paraît.

Cette analyse transforme ces tarifs en budgets de projet réels : un article de blog, un livre audio, un bot de support, un mois d’intros de podcast. Vous verrez aussi comment les forfaits web se comparent à l’API, où les limites de débit deviennent gênantes, et comment le prix se situe par rapport à d’autres moteurs de synthèse vocale. Les chiffres proviennent de la grille tarifaire publiée par Fish Audio et de sa documentation développeur ; ils peuvent évoluer, vérifiez-les donc avant d’engager de l’argent.

💡 Réponse rapide : une heure de parole en anglais coûte environ 1,25 $ via l’API. Un article de 1 000 mots, lu du début à la fin, coûte environ 8 centimes.

Ce que Fish Audio facture par octet

Microphone à condensateur avec filtre anti-pop dans un studio d’enregistrement aux murs lambrissés

La grille tarifaire

Tous les prix côté développeur tiennent dans un seul tableau.

ServiceModèle ou fonctionnalitéPrix
Synthèse vocales2.1-pro15,00 $ par million d’octets UTF-8
Synthèse vocales2-pro15,00 $ par million d’octets UTF-8
Synthèse vocales115,00 $ par million d’octets UTF-8
Synthèse vocales2.1-pro-free0,00 $ par million d’octets UTF-8
Transcriptionles deux modèles disponibles0,36 $ par heure audio
Conception de voixchaque requête réussie0,01 $

La documentation recommande s2.1-pro pour les nouveaux projets, et les trois modèles payants ont le même prix : choisir entre eux relève donc de la qualité, pas de l’argent. La version gratuite s2.1-pro est affichée à zéro, ce qui convient pour prototyper pendant que vous testez un script.

Le repère de Fish Audio : un million d’octets représente environ 180 000 mots anglais, soit environ 12 heures de parole. En divisant 15 $ par 12, vous obtenez le chiffre à retenir, 1,25 $ par heure d’audio finalisé.

Pourquoi l’octet et non le caractère

Un octet est la taille de votre texte une fois encodé en UTF-8. Pour l’anglais courant, un caractère équivaut à un octet, donc 15 $ par million d’octets correspondent aussi à 15 $ par million de caractères. D’autres écritures modifient ce calcul :

  • Les lettres latines accentuées et le cyrillique occupent environ 2 octets chacune.
  • Les caractères chinois, japonais et coréens occupent environ 3 octets chacun.
  • Les emojis occupent 4 octets.
  • Les espaces et la ponctuation comptent aussi en octets : un script chargé d’indications scéniques coûte donc plus cher qu’un script épuré.

Vue de dessus d’un bureau avec un carnet de calculs de coûts manuscrits et des pages de manuscrit imprimées

💡 Mesurez avant d’envoyer : en Python, len(text.encode("utf-8")) renvoie le nombre exact d’octets d’un script. Multipliez-le par 0,000015 et vous obtenez le prix en dollars.

Coûts réels pour des projets réels

Les chiffres d’une grille tarifaire restent abstraits tant qu’on ne les rattache pas à un travail concret. Ces exemples utilisent le ratio de Fish Audio, soit 180 000 mots par million d’octets.

TravailDurée audioOctets envoyésCoût
Un article de 1 000 motsenviron 4 minutesenviron 5 600environ 0,08 $
30 bulletins quotidiens de cinq minutes2,5 heuresenviron 208 000environ 3,13 $
Un livre audio de 80 000 motsenviron 5,3 heuresenviron 444 000environ 6,67 $
10 000 réponses de support de 300 caractèresenviron 36 heures3 000 00045,00 $
Un million de caractères japonaisvariableenviron 3 000 000environ 45,00 $

Narration et livres audio

Un livre audio entier pour moins que le prix d’un sandwich, voilà le message phare de cette section. Même une production généreuse, avec cinq générations complètes d’un titre de 80 000 mots, reste proche de 33 $. La facture suit le texte que vous envoyez, et non les secondes restituées : ralentir la voix avec le réglage de vitesse (la documentation autorise de 0,5 à 2,0) n’augmente donc pas le prix.

Femme en pull gris lisant un manuscrit imprimé devant un micro de studio

Bots et gros volumes

Les messages courts finissent par peser lourd. Un bot de support répondant à 10 000 questions avec des réponses de 300 caractères consomme trois millions d’octets, soit 45 $. Mettez en cache toute réponse qui se répète. Une formule d’accueil prononcée 50 000 fois doit être générée une seule fois, puis stockée.

Écritures non latines

Budgétez en octets et non en caractères dès que le script n’est pas en anglais. Un million de caractères japonais ou chinois coûte environ 45 $, soit trois fois le chiffre anglais, et le cyrillique tourne autour de 30 $. L’audio n’est pas plus long, mais le compteur tourne sur la taille encodée.

Quatre façons de réduire la facture

De petites habitudes comptent dès que le volume augmente :

  1. Prototypez avec la version gratuite. Réglez le rythme et la ponctuation avec s2.1-pro-free, vérifiez ses limites dans la documentation, puis générez les versions finales avec un modèle payant.
  2. Supprimez le superflu. Retirez les indications scéniques, les espaces répétés et les balises restantes avant l’envoi du texte.
  3. Mettez en cache les répliques récurrentes. Les formules d’accueil, les invites de menu et les mentions légales doivent être générées une fois et stockées.
  4. Générez par paragraphe. Une coquille ne vous coûte alors qu’un paragraphe, et non un chapitre entier.

Clonage de voix et son coût

La grille tarifaire ne prévoit aucuns frais de clonage. Selon la page tarifaire, la génération de parole avec une voix clonée est facturée comme une synthèse vocale ordinaire, à l’octet. Ce qui change, c’est le flux de travail.

Clonage instantané ou voix enregistrées

La documentation décrit deux voies :

  • Clonage instantané : vous transmettez l’audio de référence directement avec la requête de parole. Rien n’est stocké, ce qui convient aux travaux ponctuels.
  • Voix persistantes : vous créez une voix une seule fois, recevez un identifiant de voix réutilisable et l’appelez depuis n’importe quelle requête ultérieure. Le mode d’entraînement rapide par défaut rend la voix utilisable presque immédiatement.

Les voix enregistrées sont privées par défaut. Vous pouvez passer l’une d’elles en mode non répertorié, ce qui génère un lien partageable, ou en mode public, ce qui la place dans la Voice Library communautaire.

Mains d’un ingénieur du son posées sur les potentiomètres d’une console de mixage analogique

Une requête vers le point de terminaison TTS ressemble à ceci :

POST /v1/tts
Authorization: Bearer <your token>
model: s2.1-pro

{
  "text": "Your script goes here.",
  "reference_id": "<voice id>",
  "format": "mp3",
  "latency": "balanced"
}

Le champ latency accepte balanced, que Fish Audio décrit comme environ 300 ms avant le premier son, ou normal, qui privilégie la stabilité. Les formats de sortie sont mp3, wav, opus et pcm. Les supports de Fish Audio mentionnent aussi des balises d’émotion intégrées pour contrôler le ton, mais vérifiez la syntaxe exacte dans la référence de l’API avant de vous y fier.

Échantillons, consentement et droits

Un bon clone commence par un bon enregistrement. La documentation demande un audio propre, mono et à locuteur unique, d’au moins 10 secondes par extrait, et précise qu’une à deux minutes de parole claire améliorent la fidélité. Les fichiers acceptés sont wav, mp3, m4a et opus, et la suppression du bruit de fond est activée par défaut. Les pages marketing citent un échantillon de 15 secondes dans plus de 30 langues ; considérez donc 10 à 15 secondes comme un minimum, et non comme une cible.

Mains tenant un smartphone pour enregistrer un échantillon de voix dans un salon calme

Les droits comptent plus que le prix. Les abonnés payants peuvent utiliser des voix vérifiées qui leur appartiennent pour un usage commercial, tandis que les contenus générés avec le forfait gratuit sont limités à des projets personnels et non commerciaux. Vérifiez les conditions de licence de votre forfait avant de publier quoi que ce soit à vocation commerciale, et si vous clonez la voix d’un client ou d’un prestataire, obtenez d’abord une autorisation écrite.

💡 Règle de base : clonez votre propre voix, une voix de comédien que vous avez engagé à cette fin, ou une voix couverte par une autorisation signée. Rien d’autre.

Forfaits web face à l’API

Fish Audio vend aussi des forfaits mensuels pour ceux qui travaillent dans le studio web plutôt que de programmer.

ForfaitPrix mensuelCréditsDurée de génération annoncéeOptions
Free0 $8 000environ 7 minutes500 caractères par génération, 3 emplacements de voix publics
Plus11 $250 000jusqu’à 200 minutes15 000 caractères par génération, 10 voix privées, 1 voix professionnelle
Pro75 $2 000 000jusqu’à 1 620 minutes30 000 caractères par génération, 5 voix professionnelles, 3 sièges d’équipe
Max749 $25 000 000jusqu’à 6 250 minutes15 voix professionnelles, 10 sièges d’équipe
EnterpriseSur devis, facturé annuellementSur mesureSur mesureAucune conservation des données, déploiement sur site, SOC2

La facturation annuelle réduit le tarif mensuel : Plus coûte 132 $ par an, Pro 900 $ et Max 8 988 $.

Trois collègues comparant des grilles tarifaires imprimées autour d’une table en bois

Là où l’API l’emporte

Convertissez les minutes annoncées de chaque forfait en dépense API à 1,25 $ de l’heure, et l’écart est considérable.

ForfaitMinutes annoncéesMême audio via l’APIPrix du forfait
Plus200environ 4,17 $11 $
Pro1 620environ 33,75 $75 $
Max6 250environ 130,21 $749 $

Ces durées proviennent de la page des forfaits, la comparaison reste donc approximative. Mais la tendance est claire : un forfait achète le studio web, les emplacements de voix et les sièges d’équipe, tandis que l’audio brut coûte moins cher à l’octet. Les développeurs, les travaux par lots et les chaînes automatisées relèvent de l’API. Les éditeurs et les responsables marketing qui n’ouvrent jamais de terminal peuvent sans problème payer pour l’interface.

Voici un mois type pour une petite équipe de podcast. Elle génère 40 heures de parole (50,00 $), transcrit 40 heures de bandes brutes d’invités (14,40 $) et teste 20 nouvelles conceptions de voix (0,20 $). Le total atteint 64,60 $. C’est moins que le forfait Pro à 75 $, qui n’annonce que 27 heures de génération, et l’équipe garde un contrôle total sur l’automatisation et le stockage.

Transcription, conception de voix et limites

Transcription à 0,36 $ de l’heure

La reconnaissance vocale de Fish Audio coûte 0,36 $ par heure audio, facturée sur la durée traitée arrondie à la seconde près. Dix heures d’entretiens coûtent 3,60 $, et cent heures coûtent 36 $. Associée à la synthèse vocale, elle permet de construire une boucle qui transcrit un enregistrement, modifie le texte et restitue le résultat avec une voix clonée.

Casque de studio posé sur une pile de transcriptions surlignées

Conception de voix à un centime

La conception de voix crée de nouvelles voix à partir d’une description écrite plutôt que d’un enregistrement, et une seule requête peut renvoyer plusieurs candidates. Le tarif est de 0,01 $ par requête POST réussie, et il s’applique une seule fois, quel que soit le nombre de voix candidates renvoyées. Cent essais de conception coûtent un dollar : n’hésitez donc pas à expérimenter.

Paliers de simultanéité

Les limites de vitesse dépendent de votre dépense prépayée :

PalierDépense prépayéeRequêtes simultanées
Startermoins de 100 $5
Elevated100 $ ou plus15
High Volume1 000 $ ou plus50
EnterpriseSur mesureSur mesure

Un palier s’active dès que vous atteignez son seuil prépayé, et le solde n’a pas besoin d’être consommé au préalable. Si vous prévoyez de narrer environ 80 heures par mois (100 $ de parole), une recharge de 100 $ couvre à la fois l’audio et un parallélisme trois fois supérieur.

Allée étroite entre des baies de serveurs noires dans un centre de données

Comment le prix se compare

Les prix ci-dessous proviennent du comparatif développeur de Fish Audio et d’une analyse tarifaire indépendante. Considérez-les comme un point de départ et vérifiez-les sur la page de chaque fournisseur.

MoteurPrix annoncé par million de caractères
Fish Audio15 $ (par million d’octets)
Google Cloud TTS, voix standard4 $
Amazon Polly, standard / neuronal4 $ / 16 $
Azure TTS, voix neuronales15 $
ElevenLabs Flash v2.5environ 60 $
ElevenLabs v2 Multilingualenviron 120 $ à 165 $

Ce que le tableau ne dit pas

Le prix n’est pas la qualité. Des analyses tarifaires indépendantes indiquent que S2 Pro de Fish Audio obtient de bons résultats lors d’écoutes à l’aveugle, tandis qu’ElevenLabs offre un ensemble de fonctionnalités plus mature. Un moteur bon marché qui exige trois générations par paragraphe n’est plus bon marché. Les écritures non latines faussent aussi le calcul, car les octets triplent le coût pour le japonais et le chinois.

La solution consiste à organiser un test comparatif : faites lire le même script de 200 mots par plusieurs moteurs et jugez à l’oreille. Sur Picasso IA, vous pouvez le faire au même endroit avec ElevenLabs v3, MiniMax Speech 2.8 HD, Qwen3 TTS, Chatterbox et Gemini 3.1 Flash TTS.

Lancer le clonage de voix sur PicassoIA

Si vous voulez entendre un clone avant d’écrire du code d’intégration, MiniMax Voice Cloning transforme un court enregistrement en profil de voix réutilisable. PicassoIA le propose en essai gratuit en ligne, sans aucune programmation requise.

Choisir le modèle et l’échantillon

  1. Ouvrez la page MiniMax Voice Cloning et importez votre fichier vocal : MP3, M4A ou WAV, de 10 secondes à 5 minutes, de moins de 20 Mo.
  2. Activez la réduction de bruit si l’enregistrement contient du souffle ou une ambiance de pièce, et la normalisation du volume si le niveau fluctue.
  3. Laissez la précision à sa valeur par défaut de 0,7 pour commencer. Elle définit le seuil de validation du texte, entre 0 et 1.
  4. Choisissez le palier de parole sur lequel entraîner la voix. Le palier par défaut est Speech 2.6 HD, et Speech 2.6 Turbo est l’option la plus rapide.

Générer de la parole avec le clone

Lancez le modèle et vous obtenez un profil de voix que vous pouvez réutiliser pour autant de synthèses vocales que le projet en demande. Faites passer votre script par le palier de parole sur lequel vous avez entraîné la voix, puis comparez le résultat à ce que vous obtenez avec l’API Fish Audio.

Podcasteur casque sur les oreilles regardant un ordinateur portable dans un studio chaleureux à domicile

💡 Un meilleur échantillon, un meilleur clone : enregistrez 30 secondes à votre rythme naturel, dans une pièce moquettée et avec des rideaux, sans musique en fond.

Le même espace de travail couvre le reste d’une chaîne audio. Ajoutez une piste d’accompagnement avec Stable Audio 2.5, MiniMax Music 2.6 ou ElevenLabs Music, puis relisez la narration en la faisant passer par GPT-4o Transcribe ou Gemini 3 Pro.

Construisez votre chaîne vocale sur Picasso IA

Les tableaux de prix indiquent ce que coûte une voix. Seules vos propres oreilles indiquent si elle en vaut la peine. Ouvrez Picasso IA, importez un court échantillon dans MiniMax Voice Cloning, lisez le même paragraphe avec deux ou trois modèles de parole, et notez celui auquel vous confieriez votre image de marque.

Ajoutez ensuite de la musique et une vérification de la transcription, et vous obtenez l’ébauche d’un flux de travail audio complet, avant d’avoir dépensé le moindre centime pour un contrat d’API. Un plan de test simple fonctionne bien :

  • Clonez un échantillon de 30 secondes de votre propre voix.
  • Narrez les mêmes 200 mots avec trois modèles de parole différents.
  • Transcrivez chaque résultat et comptez les mots que le moteur a mal reconnus.
  • Chiffrez le gagnant avec le calcul à l’octet présenté plus haut.

Commencez aujourd’hui par un court script, comparez les résultats côte à côte, et laissez les clips que vous appréciez vraiment décider quel moteur recevra votre budget.

Partager cet article

Choisissez votre langue