Google Cloud Text to Speech paraît bon marché jusqu’à l’arrivée de la première facture. Le chiffre affiché, 4 $ par million de caractères pour les voix de base, est trompeur : les voix que les gens veulent réellement entendre coûtent entre quatre et quarante fois plus cher, et l’enveloppe gratuite fond vite dès qu’on monte en gamme. Cet article détaille chaque niveau de voix, ce que l’offre gratuite mensuelle inclut réellement, comment estimer une facture avant d’écrire la moindre ligne de code, et quand un autre modèle de voix IA est le meilleur choix.
Les prix ci-dessous reflètent les tarifs publiés par Google en octobre 2026. Google remanie souvent sa gamme de voix : considérez ces chiffres comme une base de planification et vérifiez-les dans votre console de facturation avant de fixer un budget.
Ce que fait réellement l’API
La Cloud Text-to-Speech API prend du texte brut ou un document SSML et renvoie de l’audio. Vous l’appelez en REST ou en gRPC, ou via les bibliothèques clientes pour Python, Node.js, Java, Go et C#. L’authentification passe par un compte de service : un backend peut demander de l’audio sans aucune étape de connexion humaine.

Formats et limites de requête
Chaque réponse arrive au format MP3, LINEAR16 (WAV non compressé), OGG_OPUS, MULAW ou ALAW. Le MP3 convient à la lecture sur le web, le LINEAR16 à l’édition, et le MULAW ou l’ALAW aux systèmes téléphoniques qui attendent des codecs de téléphonie. Un seul appel accepte environ 5 000 octets d’entrée : un script long doit donc être découpé en morceaux, puis réassemblé de votre côté.
💡 Astuce : Découpez les scripts aux limites de phrases, jamais à un nombre fixe d’octets. Une coupure au milieu d’une phrase provoque un saut de hauteur audible à la jonction.
SSML et contrôles de la voix
Le SSML est le langage de balisage qui façonne la diction. Avec lui, vous ajoutez des pauses avec <break>, accentuez un mot avec <emphasis> et épelez dates, nombres et abréviations avec <say-as>. Hors SSML, la requête expose la vitesse d’élocution (de 0,25x à 4x) et la hauteur (de −20 à +20 demi-tons) comme paramètres simples. Google propose des centaines de voix dans plus de 50 langues et variantes, mais tous les contrôles ne fonctionnent pas sur chaque niveau de voix.
Types de voix et leurs prix
Google vend la parole par niveaux. Le prix suit la technologie vocale sous-jacente, et non la durée de l’audio : choisir le mauvais niveau est donc l’erreur budgétaire la plus courante.
| Niveau de voix | Prix par million de caractères | Gratuit par mois | Idéal pour |
|---|
| Standard | $4 | 4M de caractères | Alertes, prototypes, narration simple |
| WaveNet | $4 | Partagé avec Standard | Une tonalité plus chaleureuse au même prix |
| Neural2 | $16 | 1M de caractères | Lecture naturelle dans la plupart des applications |
| Polyglot | $16 | Partagé avec Neural2 | Une seule voix qui parle plusieurs langues |
| Chirp 3 HD | $30 | 1M de caractères | Narration vivante et expressive |
| Voix personnalisée instantanée | $60 | Aucun | Une voix de marque clonée |
| Studio | $160 | Petite enveloppe | Audio premium de longue durée |
💡 À savoir : Les pages de prix tierces ne sont pas d’accord sur le quota gratuit de WaveNet : certaines indiquent 1M, d’autres 4M, car les gammes Standard et WaveNet ont évolué au fil des ans. Vérifiez les chiffres en vigueur dans votre console avant de vous fier au plus gros.
Une règle rapide pour choisir : utilisez Standard lorsque l’audio est court et fonctionnel, Neural2 lorsque les gens l’entendront tous les jours, Chirp 3 HD lorsque la voix fait partie de l’expérience produit, et Studio seulement après avoir écouté Chirp 3 HD et l’avoir jugé insuffisant. Commencer un niveau plus bas, puis monter après les retours réels des auditeurs, permet de garder les premières factures modestes.
Standard et WaveNet
Les voix Standard sont les plus anciennes et les moins chères. Elles sonnent clairement synthétiques, avec un rythme régulier et une émotion plate. C’est acceptable pour une notification de livraison ou un relevé d’état, et les 4 millions de caractères gratuits par mois absorbent une part étonnante de ce trafic. Les voix WaveNet utilisent un vocodeur neuronal qui atténue l’aspect robotique. Aux tarifs actuels, elles coûtent le même prix que Standard, ce qui rend Standard difficile à justifier pour tout contenu qu’une personne écoutera plus de quelques secondes.
Neural2 et Polyglot
Neural2 est le niveau de travail courant. La prononciation est propre, le rythme des phrases sonne naturel, et 16 $ par million de caractères constituent un juste milieu. Les voix Polyglot, encore signalées en préversion dans le tableau des prix, permettent à une seule voix de passer d’une langue à l’autre, ce qui aide une ligne d’assistance qui doit prononcer un nom espagnol au milieu d’une phrase en anglais. Les deux niveaux partagent une enveloppe mensuelle de 1 million de caractères.
Chirp 3 HD et Studio
Chirp 3 HD est la nouvelle famille premium de Google, construite autour de 30 styles de voix portant des noms comme Aoede, Puck, Charon et Kore. À 30 $ par million de caractères, elle coûte près du double de Neural2, mais elle se rapproche bien davantage d’un lecteur humain, avec des souffles et une intonation crédibles. Les voix Studio sont à 160 $ par million de caractères, soit quarante fois le tarif Standard. Chirp 3 HD arrive généralement assez près pour que Studio soit difficile à justifier en dehors d’un petit nombre de projets premium de longue durée.
Fonctionnement de l’offre gratuite
Ce qui compte comme un caractère
La facturation compte les caractères du texte envoyé, espaces et ponctuation compris. Un mot anglais moyen compte cinq lettres plus un espace : un mot coûte donc environ six caractères. Avec ce calcul, 1 million de caractères équivaut à environ 166 000 mots, soit environ 18,5 heures de parole à un rythme tranquille de 150 mots par minute.
Les enveloppes se réinitialisent chaque mois civil et ne se reportent jamais. Les caractères non utilisés en mars disparaissent en avril. Elles sont aussi suivies par niveau : 900 000 caractères Neural2 inutilisés ne compenseront jamais une facture Chirp 3 HD.

La facturation doit rester activée
L’offre gratuite n’est pas un essai sans carte. Un compte de facturation doit être rattaché au projet avant que l’API ne réponde, même si vous ne sortez jamais de l’enveloppe gratuite. Définissez une alerte budgétaire de 5 $ ou 10 $ dès le premier jour, et envisagez de réduire le quota de l’API dans la console afin qu’une boucle incontrôlée ne produise pas une surprise à quatre chiffres pendant la nuit.
💡 Astuce pro : Mettez en cache chaque fichier généré. Un message d’accueil diffusé 10 000 fois par jour doit être synthétisé une seule fois puis stocké, et non facturé 10 000 fois.
Ce que coûte réellement 1 million de caractères
Les prix par caractère semblent minuscules : voici donc les mêmes niveaux appliqués à des charges de travail réelles. Chaque chiffre applique d’abord l’enveloppe gratuite du niveau concerné.
Trois exemples de factures mensuelles
| Charge de travail | Caractères | Standard | Neural2 | Chirp 3 HD |
|---|
| 200 articles de blog de 1 500 mots | 1,8M | $0 | $12,80 | $24,00 |
| Menu téléphonique, 50 000 invites vocales de 120 caractères | 6M | $8,00 | $80,00 | $150,00 |
| Un roman de 80 000 mots | 0,48M | $0 | $0 | $0 |
Le roman reste dans l’enveloppe gratuite sur Neural2 ou Chirp 3 HD, alors que le même livre sur Studio coûterait 76,80 $ avant toute enveloppe. La ligne du menu téléphonique montre pourquoi le choix du niveau compte : un trafic identique coûte 8 $ sur Standard et 150 $ sur Chirp 3 HD. La mise en cache des messages répétés efface en général l’essentiel de cet écart, car un menu fixe ne compte que quelques centaines de phrases uniques.
Coût par heure d’audio
À 150 mots par minute et six caractères par mot, une heure de parole représente environ 54 000 caractères. Prix avant toute enveloppe gratuite :
| Niveau | Coût par heure d’audio |
|---|
| Standard et WaveNet | $0,22 |
| Neural2 et Polyglot | $0,86 |
| Chirp 3 HD | $1,62 |
| Voix personnalisée instantanée | $3,24 |
| Studio | $8,64 |
| Gemini 3.1 Flash TTS (facturé au token) | Environ 1,81 $, estimation indépendante |
Lisez ces chiffres comme le prix de la centième heure, et non de la première. Les modèles vocaux Gemini de Google se facturent différemment, au token plutôt qu’au caractère : environ 1 $ par million de tokens de texte plus 20 $ par million de tokens audio pour Gemini 3.1 Flash TTS. Le coût suit alors la durée de l’audio que vous générez, ce qui est plus facile à prévoir pour une narration et plus difficile pour des assistants bavards.
Où l’API s’intègre le mieux
Livres audio et narration
La narration longue est le cas où la facturation au caractère est la plus prévisible. Un livre de dix heures représente environ 540 000 caractères : même sans aucune enveloppe gratuite, Chirp 3 HD coûterait 16,20 $ pour l’ensemble. Le revers de la médaille tient au pilotage. Les voix de Google lisent ce qu’on leur donne, avec une marge de contrôle émotionnel limitée au-delà du SSML ; une fiction avec dialogues implique donc généralement de tester plusieurs voix pour plusieurs personnages.

Menus téléphoniques et assistance
La téléphonie correspond le mieux à la liste de formats de l’API. Demandez une sortie MULAW ou ALAW pour que l’audio s’intègre directement à un réseau téléphonique sans conversion, générez une fois les messages fixes et stockez les fichiers, et réservez la synthèse en direct aux parties variables, comme les noms et les numéros de commande. Seule la partie dynamique doit apparaître sur votre facture.

Assistants et accessibilité
Les enceintes intelligentes, les applications de lecture et les assistants embarqués dans les voitures suivent tous le même schéma : des réponses courtes et un volume élevé. Les voix Standard et Neural2 absorbent ce trafic à moindre coût, et une généreuse enveloppe gratuite signifie souvent qu’un petit produit ne paie rien pendant des mois. La latence compte aussi : testez le temps de réponse depuis votre propre région avant de vous engager. Une voix parfaite qui met deux secondes à démarrer paraît cassée dans une conversation.

L’accessibilité est un cas différent. Une personne qui s’appuie sur l’audio pour lire de longs articles entend la voix pendant des heures chaque jour, et une tonalité de synthèse plate devient vite fatigante. Prévoyez du Neural2 ou du Chirp 3 HD pour ce cas, et laissez l’auditeur contrôler la vitesse.

Options de voix au-delà de Google Cloud
L’API est conçue pour les développeurs qui gèrent un projet cloud, un compte de service et une console de facturation. Si vous avez besoin d’une voix off pour une vidéo, d’un prototype rapide ou d’une narration ponctuelle, cette configuration représente une charge inutile. PicassoIA héberge 24 modèles de synthèse vocale que vous pouvez essayer directement depuis le navigateur, sans projet cloud à configurer.
Alternatives qui valent le détour
| Modèle | Point fort | Usage idéal |
|---|
| Gemini 3.1 Flash TTS | 30 voix, plus de 70 codes de langue, balises d’émotion | Narration expressive et scripts multilingues |
| ElevenLabs v3 | Voix off naturelles, à la sonorité humaine | Récits et lectures de personnages |
| MiniMax Speech 2.8 HD | Rendu de qualité studio | Narration soignée pour la vidéo |
| Inworld Realtime TTS 2 | Direction vocale en langage naturel | Agents conversationnels |
| Qwen3 TTS | Cloner une voix ou en concevoir une nouvelle | Voix de marque personnalisées |
| ElevenLabs Dubbing | Traduire des vidéos en plus de 90 langues | Localiser des rushes existants |

Si votre projet a besoin d’une voix signature plutôt que d’une voix générique, MiniMax Voice Cloning crée une voix personnalisée à partir d’un court échantillon, et contourne les 60 $ par million de caractères que Google facture pour une voix personnalisée instantanée.
Utiliser Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS constitue un bon premier test, car ses noms de voix recoupent la gamme Chirp 3 HD de Google. Aoede, Puck, Charon et Kore figurent dans les deux, ce qui facilite les comparaisons côte à côte.
- Ouvrez la page du modèle et collez votre script dans le champ de texte. La limite est de 4 000 octets par génération, alors découpez les scripts plus longs.
- Choisissez une voix parmi les 30 options. La voix par défaut est Kore, et Puck, Charon, Fenrir et Aoede sont de bons choix pour commencer les essais.
- Définissez le code de langue. La valeur par défaut est en-US, et la liste dépasse les 70 codes, dont es-MX, fr-CA, pt-BR et ja-JP.
- Rédigez un prompt de style en anglais simple, par exemple « Say this in a calm, professional tone » ou « Speak with excitement and energy ».
- Ajoutez des balises d’expression dans le script : [whispering], [laughing], [shouting], [sigh] ou [extremely fast].
- Générez, écoutez et téléchargez le fichier audio. Modifiez un réglage à la fois pour entendre ce que chacun produit.
| Paramètre | Ce qu’il contrôle | Point de départ |
|---|
| Voix | Personnage, âge et ton | Kore pour une narration neutre |
| Code de langue | Accent et prononciation | Correspond à la région de votre audience |
| Prompt de style | Rythme, émotion, diction | Une courte phrase |
| Balises de texte | Expression au niveau de la phrase | Deux ou trois par paragraphe |
💡 Astuce : Utilisez les balises avec parcimonie. Un script où chaque réplique est [whispering] ou [shouting] sonne épuisant. Réservez-les au contraste, pas à la décoration.
Musique et transcription autour de la parole
La parole est rarement livrée seule. Une vidéo a besoin d’un fond musical sous la narration, et un contenu parlé a besoin d’une transcription pour les sous-titres, la recherche et l’accessibilité. Google vend la transcription comme un produit distinct, avec son propre compteur : un projet vocal peut donc générer deux lignes de facturation avant même d’ajouter la musique.
Pour la musique, Lyria 3 Pro crée des chansons complètes à partir d’un prompt textuel, MiniMax Music 2.6 ajoute voix et paroles, et Stable Audio 2.5 convient aux fonds instrumentaux qui restent discrets sous une voix. Rédigez votre prompt musical comme un brief à un compositeur : genre, tempo, instruments et ambiance. « Warm acoustic guitar, 90 BPM, unhurried, no vocals » donne un fond qui ne fera pas concurrence à la narration.

Pour les transcriptions, GPT-4o Transcribe et Gemini 3 Pro transforment les enregistrements en texte, ce qui est pratique pour les comptes rendus de réunion, les interviews et les sous-titres de la narration que vous venez de générer.

Un enchaînement simple fonctionne bien : rédigez le script, générez la voix, ajoutez un fond musical, puis transcrivez le mixage final pour produire les sous-titres et vérifier la prononciation des noms délicats.
Créez votre première voix off dès aujourd’hui
Les tableaux de prix ne disent que peu de choses. La façon la plus rapide de choisir entre une API cloud et un outil de navigateur consiste à faire lire le même paragraphe par les deux. Prenez 100 mots de votre propre projet, passez-les dans la console de Google, puis collez-les dans Gemini 3.1 Flash TTS ou MiniMax Speech 2.8 HD et comparez côte à côte le rythme, la chaleur et la prononciation.
Pendant que vous y êtes, explorez le reste de la plateforme. Ajoutez un fond musical avec Lyria 3 Pro, sous-titrez le résultat avec GPT-4o Transcribe et créez vos propres images photoréalistes pour les miniatures et les visuels d’article avec PicassoIA. Expérimentez librement, modifiez une variable à la fois et conservez la combinaison qui sonne juste. Parcourez tous les modèles sur picassoia.com/en/all-models.