API Fish Audio : tarifs de la synthèse vocale et du clonage de voix, ligne par ligne
Fish Audio facture la synthèse vocale 15 $ par million d’octets UTF-8, la transcription 0,36 $ par heure audio et la conception de voix un centime par requête. Cette analyse transforme ces tarifs en budgets de projet réels, compare les forfaits web avec l’API et montre où se place le clonage de voix.
Fish Audio vend la parole à l’octet, et ce seul détail explique presque toutes les surprises sur la facture. L’API Fish Audio facture 15 $ par million d’octets UTF-8 de texte pour la synthèse vocale, 0,36 $ par heure audio pour la transcription, et 0,01 $ par requête pour la conception de voix. Le clonage de voix n’apparaît pas comme ligne distincte dans ce tableau de tarifs, ce qui rend le budget plus simple qu’il n’y paraît.
Cette analyse transforme ces tarifs en budgets de projet réels : un article de blog, un livre audio, un bot de support, un mois d’intros de podcast. Vous verrez aussi comment les forfaits web se comparent à l’API, où les limites de débit deviennent gênantes, et comment le prix se situe par rapport à d’autres moteurs de synthèse vocale. Les chiffres proviennent de la grille tarifaire publiée par Fish Audio et de sa documentation développeur ; ils peuvent évoluer, vérifiez-les donc avant d’engager de l’argent.
💡 Réponse rapide : une heure de parole en anglais coûte environ 1,25 $ via l’API. Un article de 1 000 mots, lu du début à la fin, coûte environ 8 centimes.
Ce que Fish Audio facture par octet
La grille tarifaire
Tous les prix côté développeur tiennent dans un seul tableau.
Service
Modèle ou fonctionnalité
Prix
Synthèse vocale
s2.1-pro
15,00 $ par million d’octets UTF-8
Synthèse vocale
s2-pro
15,00 $ par million d’octets UTF-8
Synthèse vocale
s1
15,00 $ par million d’octets UTF-8
Synthèse vocale
s2.1-pro-free
0,00 $ par million d’octets UTF-8
Transcription
les deux modèles disponibles
0,36 $ par heure audio
Conception de voix
chaque requête réussie
0,01 $
La documentation recommande s2.1-pro pour les nouveaux projets, et les trois modèles payants ont le même prix : choisir entre eux relève donc de la qualité, pas de l’argent. La version gratuite s2.1-pro est affichée à zéro, ce qui convient pour prototyper pendant que vous testez un script.
Le repère de Fish Audio : un million d’octets représente environ 180 000 mots anglais, soit environ 12 heures de parole. En divisant 15 $ par 12, vous obtenez le chiffre à retenir, 1,25 $ par heure d’audio finalisé.
Pourquoi l’octet et non le caractère
Un octet est la taille de votre texte une fois encodé en UTF-8. Pour l’anglais courant, un caractère équivaut à un octet, donc 15 $ par million d’octets correspondent aussi à 15 $ par million de caractères. D’autres écritures modifient ce calcul :
Les lettres latines accentuées et le cyrillique occupent environ 2 octets chacune.
Les caractères chinois, japonais et coréens occupent environ 3 octets chacun.
Les emojis occupent 4 octets.
Les espaces et la ponctuation comptent aussi en octets : un script chargé d’indications scéniques coûte donc plus cher qu’un script épuré.
💡 Mesurez avant d’envoyer : en Python, len(text.encode("utf-8")) renvoie le nombre exact d’octets d’un script. Multipliez-le par 0,000015 et vous obtenez le prix en dollars.
Coûts réels pour des projets réels
Les chiffres d’une grille tarifaire restent abstraits tant qu’on ne les rattache pas à un travail concret. Ces exemples utilisent le ratio de Fish Audio, soit 180 000 mots par million d’octets.
Travail
Durée audio
Octets envoyés
Coût
Un article de 1 000 mots
environ 4 minutes
environ 5 600
environ 0,08 $
30 bulletins quotidiens de cinq minutes
2,5 heures
environ 208 000
environ 3,13 $
Un livre audio de 80 000 mots
environ 5,3 heures
environ 444 000
environ 6,67 $
10 000 réponses de support de 300 caractères
environ 36 heures
3 000 000
45,00 $
Un million de caractères japonais
variable
environ 3 000 000
environ 45,00 $
Narration et livres audio
Un livre audio entier pour moins que le prix d’un sandwich, voilà le message phare de cette section. Même une production généreuse, avec cinq générations complètes d’un titre de 80 000 mots, reste proche de 33 $. La facture suit le texte que vous envoyez, et non les secondes restituées : ralentir la voix avec le réglage de vitesse (la documentation autorise de 0,5 à 2,0) n’augmente donc pas le prix.
Bots et gros volumes
Les messages courts finissent par peser lourd. Un bot de support répondant à 10 000 questions avec des réponses de 300 caractères consomme trois millions d’octets, soit 45 $. Mettez en cache toute réponse qui se répète. Une formule d’accueil prononcée 50 000 fois doit être générée une seule fois, puis stockée.
Écritures non latines
Budgétez en octets et non en caractères dès que le script n’est pas en anglais. Un million de caractères japonais ou chinois coûte environ 45 $, soit trois fois le chiffre anglais, et le cyrillique tourne autour de 30 $. L’audio n’est pas plus long, mais le compteur tourne sur la taille encodée.
Quatre façons de réduire la facture
De petites habitudes comptent dès que le volume augmente :
Prototypez avec la version gratuite. Réglez le rythme et la ponctuation avec s2.1-pro-free, vérifiez ses limites dans la documentation, puis générez les versions finales avec un modèle payant.
Supprimez le superflu. Retirez les indications scéniques, les espaces répétés et les balises restantes avant l’envoi du texte.
Mettez en cache les répliques récurrentes. Les formules d’accueil, les invites de menu et les mentions légales doivent être générées une fois et stockées.
Générez par paragraphe. Une coquille ne vous coûte alors qu’un paragraphe, et non un chapitre entier.
Clonage de voix et son coût
La grille tarifaire ne prévoit aucuns frais de clonage. Selon la page tarifaire, la génération de parole avec une voix clonée est facturée comme une synthèse vocale ordinaire, à l’octet. Ce qui change, c’est le flux de travail.
Clonage instantané ou voix enregistrées
La documentation décrit deux voies :
Clonage instantané : vous transmettez l’audio de référence directement avec la requête de parole. Rien n’est stocké, ce qui convient aux travaux ponctuels.
Voix persistantes : vous créez une voix une seule fois, recevez un identifiant de voix réutilisable et l’appelez depuis n’importe quelle requête ultérieure. Le mode d’entraînement rapide par défaut rend la voix utilisable presque immédiatement.
Les voix enregistrées sont privées par défaut. Vous pouvez passer l’une d’elles en mode non répertorié, ce qui génère un lien partageable, ou en mode public, ce qui la place dans la Voice Library communautaire.
Une requête vers le point de terminaison TTS ressemble à ceci :
Le champ latency accepte balanced, que Fish Audio décrit comme environ 300 ms avant le premier son, ou normal, qui privilégie la stabilité. Les formats de sortie sont mp3, wav, opus et pcm. Les supports de Fish Audio mentionnent aussi des balises d’émotion intégrées pour contrôler le ton, mais vérifiez la syntaxe exacte dans la référence de l’API avant de vous y fier.
Échantillons, consentement et droits
Un bon clone commence par un bon enregistrement. La documentation demande un audio propre, mono et à locuteur unique, d’au moins 10 secondes par extrait, et précise qu’une à deux minutes de parole claire améliorent la fidélité. Les fichiers acceptés sont wav, mp3, m4a et opus, et la suppression du bruit de fond est activée par défaut. Les pages marketing citent un échantillon de 15 secondes dans plus de 30 langues ; considérez donc 10 à 15 secondes comme un minimum, et non comme une cible.
Les droits comptent plus que le prix. Les abonnés payants peuvent utiliser des voix vérifiées qui leur appartiennent pour un usage commercial, tandis que les contenus générés avec le forfait gratuit sont limités à des projets personnels et non commerciaux. Vérifiez les conditions de licence de votre forfait avant de publier quoi que ce soit à vocation commerciale, et si vous clonez la voix d’un client ou d’un prestataire, obtenez d’abord une autorisation écrite.
💡 Règle de base : clonez votre propre voix, une voix de comédien que vous avez engagé à cette fin, ou une voix couverte par une autorisation signée. Rien d’autre.
Forfaits web face à l’API
Fish Audio vend aussi des forfaits mensuels pour ceux qui travaillent dans le studio web plutôt que de programmer.
Forfait
Prix mensuel
Crédits
Durée de génération annoncée
Options
Free
0 $
8 000
environ 7 minutes
500 caractères par génération, 3 emplacements de voix publics
Aucune conservation des données, déploiement sur site, SOC2
La facturation annuelle réduit le tarif mensuel : Plus coûte 132 $ par an, Pro 900 $ et Max 8 988 $.
Là où l’API l’emporte
Convertissez les minutes annoncées de chaque forfait en dépense API à 1,25 $ de l’heure, et l’écart est considérable.
Forfait
Minutes annoncées
Même audio via l’API
Prix du forfait
Plus
200
environ 4,17 $
11 $
Pro
1 620
environ 33,75 $
75 $
Max
6 250
environ 130,21 $
749 $
Ces durées proviennent de la page des forfaits, la comparaison reste donc approximative. Mais la tendance est claire : un forfait achète le studio web, les emplacements de voix et les sièges d’équipe, tandis que l’audio brut coûte moins cher à l’octet. Les développeurs, les travaux par lots et les chaînes automatisées relèvent de l’API. Les éditeurs et les responsables marketing qui n’ouvrent jamais de terminal peuvent sans problème payer pour l’interface.
Voici un mois type pour une petite équipe de podcast. Elle génère 40 heures de parole (50,00 $), transcrit 40 heures de bandes brutes d’invités (14,40 $) et teste 20 nouvelles conceptions de voix (0,20 $). Le total atteint 64,60 $. C’est moins que le forfait Pro à 75 $, qui n’annonce que 27 heures de génération, et l’équipe garde un contrôle total sur l’automatisation et le stockage.
Transcription, conception de voix et limites
Transcription à 0,36 $ de l’heure
La reconnaissance vocale de Fish Audio coûte 0,36 $ par heure audio, facturée sur la durée traitée arrondie à la seconde près. Dix heures d’entretiens coûtent 3,60 $, et cent heures coûtent 36 $. Associée à la synthèse vocale, elle permet de construire une boucle qui transcrit un enregistrement, modifie le texte et restitue le résultat avec une voix clonée.
Conception de voix à un centime
La conception de voix crée de nouvelles voix à partir d’une description écrite plutôt que d’un enregistrement, et une seule requête peut renvoyer plusieurs candidates. Le tarif est de 0,01 $ par requête POST réussie, et il s’applique une seule fois, quel que soit le nombre de voix candidates renvoyées. Cent essais de conception coûtent un dollar : n’hésitez donc pas à expérimenter.
Paliers de simultanéité
Les limites de vitesse dépendent de votre dépense prépayée :
Palier
Dépense prépayée
Requêtes simultanées
Starter
moins de 100 $
5
Elevated
100 $ ou plus
15
High Volume
1 000 $ ou plus
50
Enterprise
Sur mesure
Sur mesure
Un palier s’active dès que vous atteignez son seuil prépayé, et le solde n’a pas besoin d’être consommé au préalable. Si vous prévoyez de narrer environ 80 heures par mois (100 $ de parole), une recharge de 100 $ couvre à la fois l’audio et un parallélisme trois fois supérieur.
Comment le prix se compare
Les prix ci-dessous proviennent du comparatif développeur de Fish Audio et d’une analyse tarifaire indépendante. Considérez-les comme un point de départ et vérifiez-les sur la page de chaque fournisseur.
Le prix n’est pas la qualité. Des analyses tarifaires indépendantes indiquent que S2 Pro de Fish Audio obtient de bons résultats lors d’écoutes à l’aveugle, tandis qu’ElevenLabs offre un ensemble de fonctionnalités plus mature. Un moteur bon marché qui exige trois générations par paragraphe n’est plus bon marché. Les écritures non latines faussent aussi le calcul, car les octets triplent le coût pour le japonais et le chinois.
Si vous voulez entendre un clone avant d’écrire du code d’intégration, MiniMax Voice Cloning transforme un court enregistrement en profil de voix réutilisable. PicassoIA le propose en essai gratuit en ligne, sans aucune programmation requise.
Choisir le modèle et l’échantillon
Ouvrez la page MiniMax Voice Cloning et importez votre fichier vocal : MP3, M4A ou WAV, de 10 secondes à 5 minutes, de moins de 20 Mo.
Activez la réduction de bruit si l’enregistrement contient du souffle ou une ambiance de pièce, et la normalisation du volume si le niveau fluctue.
Laissez la précision à sa valeur par défaut de 0,7 pour commencer. Elle définit le seuil de validation du texte, entre 0 et 1.
Choisissez le palier de parole sur lequel entraîner la voix. Le palier par défaut est Speech 2.6 HD, et Speech 2.6 Turbo est l’option la plus rapide.
Générer de la parole avec le clone
Lancez le modèle et vous obtenez un profil de voix que vous pouvez réutiliser pour autant de synthèses vocales que le projet en demande. Faites passer votre script par le palier de parole sur lequel vous avez entraîné la voix, puis comparez le résultat à ce que vous obtenez avec l’API Fish Audio.
💡 Un meilleur échantillon, un meilleur clone : enregistrez 30 secondes à votre rythme naturel, dans une pièce moquettée et avec des rideaux, sans musique en fond.
Les tableaux de prix indiquent ce que coûte une voix. Seules vos propres oreilles indiquent si elle en vaut la peine. Ouvrez Picasso IA, importez un court échantillon dans MiniMax Voice Cloning, lisez le même paragraphe avec deux ou trois modèles de parole, et notez celui auquel vous confieriez votre image de marque.
Ajoutez ensuite de la musique et une vérification de la transcription, et vous obtenez l’ébauche d’un flux de travail audio complet, avant d’avoir dépensé le moindre centime pour un contrat d’API. Un plan de test simple fonctionne bien :
Clonez un échantillon de 30 secondes de votre propre voix.
Narrez les mêmes 200 mots avec trois modèles de parole différents.
Transcrivez chaque résultat et comptez les mots que le moteur a mal reconnus.
Chiffrez le gagnant avec le calcul à l’octet présenté plus haut.
Commencez aujourd’hui par un court script, comparez les résultats côte à côte, et laissez les clips que vous appréciez vraiment décider quel moteur recevra votre budget.