Google Cloud Text to Speech API : tarifs, voix et offre gratuite

Les tarifs de Google Cloud Text to Speech API en chiffres clairs : ce que coûtent les voix Standard, WaveNet, Neural2, Chirp 3 HD et Studio par million de caractères, l’ampleur réelle de l’offre gratuite, comment estimer une facture mensuelle avant la mise en production, et des alternatives utilisables dans le navigateur.

Google Cloud Text to Speech API : tarifs, voix et offre gratuite
Cristian Da Conceicao
Fondateur de Picasso IA

Google Cloud Text to Speech paraît bon marché jusqu’à l’arrivée de la première facture. Le chiffre affiché, 4 $ par million de caractères pour les voix de base, est trompeur : les voix que les gens veulent réellement entendre coûtent entre quatre et quarante fois plus cher, et l’enveloppe gratuite fond vite dès qu’on monte en gamme. Cet article détaille chaque niveau de voix, ce que l’offre gratuite mensuelle inclut réellement, comment estimer une facture avant d’écrire la moindre ligne de code, et quand un autre modèle de voix IA est le meilleur choix.

Les prix ci-dessous reflètent les tarifs publiés par Google en octobre 2026. Google remanie souvent sa gamme de voix : considérez ces chiffres comme une base de planification et vérifiez-les dans votre console de facturation avant de fixer un budget.

Ce que fait réellement l’API

La Cloud Text-to-Speech API prend du texte brut ou un document SSML et renvoie de l’audio. Vous l’appelez en REST ou en gRPC, ou via les bibliothèques clientes pour Python, Node.js, Java, Go et C#. L’authentification passe par un compte de service : un backend peut demander de l’audio sans aucune étape de connexion humaine.

Un développeur indépendant travaillant sur un ordinateur portable à côté d’un casque et d’une tasse, dans la lumière douce d’une fenêtre le matin

Formats et limites de requête

Chaque réponse arrive au format MP3, LINEAR16 (WAV non compressé), OGG_OPUS, MULAW ou ALAW. Le MP3 convient à la lecture sur le web, le LINEAR16 à l’édition, et le MULAW ou l’ALAW aux systèmes téléphoniques qui attendent des codecs de téléphonie. Un seul appel accepte environ 5 000 octets d’entrée : un script long doit donc être découpé en morceaux, puis réassemblé de votre côté.

💡 Astuce : Découpez les scripts aux limites de phrases, jamais à un nombre fixe d’octets. Une coupure au milieu d’une phrase provoque un saut de hauteur audible à la jonction.

SSML et contrôles de la voix

Le SSML est le langage de balisage qui façonne la diction. Avec lui, vous ajoutez des pauses avec <break>, accentuez un mot avec <emphasis> et épelez dates, nombres et abréviations avec <say-as>. Hors SSML, la requête expose la vitesse d’élocution (de 0,25x à 4x) et la hauteur (de −20 à +20 demi-tons) comme paramètres simples. Google propose des centaines de voix dans plus de 50 langues et variantes, mais tous les contrôles ne fonctionnent pas sur chaque niveau de voix.

Types de voix et leurs prix

Google vend la parole par niveaux. Le prix suit la technologie vocale sous-jacente, et non la durée de l’audio : choisir le mauvais niveau est donc l’erreur budgétaire la plus courante.

Niveau de voixPrix par million de caractèresGratuit par moisIdéal pour
Standard$44M de caractèresAlertes, prototypes, narration simple
WaveNet$4Partagé avec StandardUne tonalité plus chaleureuse au même prix
Neural2$161M de caractèresLecture naturelle dans la plupart des applications
Polyglot$16Partagé avec Neural2Une seule voix qui parle plusieurs langues
Chirp 3 HD$301M de caractèresNarration vivante et expressive
Voix personnalisée instantanée$60AucunUne voix de marque clonée
Studio$160Petite enveloppeAudio premium de longue durée

💡 À savoir : Les pages de prix tierces ne sont pas d’accord sur le quota gratuit de WaveNet : certaines indiquent 1M, d’autres 4M, car les gammes Standard et WaveNet ont évolué au fil des ans. Vérifiez les chiffres en vigueur dans votre console avant de vous fier au plus gros.

Une règle rapide pour choisir : utilisez Standard lorsque l’audio est court et fonctionnel, Neural2 lorsque les gens l’entendront tous les jours, Chirp 3 HD lorsque la voix fait partie de l’expérience produit, et Studio seulement après avoir écouté Chirp 3 HD et l’avoir jugé insuffisant. Commencer un niveau plus bas, puis monter après les retours réels des auditeurs, permet de garder les premières factures modestes.

Standard et WaveNet

Les voix Standard sont les plus anciennes et les moins chères. Elles sonnent clairement synthétiques, avec un rythme régulier et une émotion plate. C’est acceptable pour une notification de livraison ou un relevé d’état, et les 4 millions de caractères gratuits par mois absorbent une part étonnante de ce trafic. Les voix WaveNet utilisent un vocodeur neuronal qui atténue l’aspect robotique. Aux tarifs actuels, elles coûtent le même prix que Standard, ce qui rend Standard difficile à justifier pour tout contenu qu’une personne écoutera plus de quelques secondes.

Neural2 et Polyglot

Neural2 est le niveau de travail courant. La prononciation est propre, le rythme des phrases sonne naturel, et 16 $ par million de caractères constituent un juste milieu. Les voix Polyglot, encore signalées en préversion dans le tableau des prix, permettent à une seule voix de passer d’une langue à l’autre, ce qui aide une ligne d’assistance qui doit prononcer un nom espagnol au milieu d’une phrase en anglais. Les deux niveaux partagent une enveloppe mensuelle de 1 million de caractères.

Chirp 3 HD et Studio

Chirp 3 HD est la nouvelle famille premium de Google, construite autour de 30 styles de voix portant des noms comme Aoede, Puck, Charon et Kore. À 30 $ par million de caractères, elle coûte près du double de Neural2, mais elle se rapproche bien davantage d’un lecteur humain, avec des souffles et une intonation crédibles. Les voix Studio sont à 160 $ par million de caractères, soit quarante fois le tarif Standard. Chirp 3 HD arrive généralement assez près pour que Studio soit difficile à justifier en dehors d’un petit nombre de projets premium de longue durée.

Fonctionnement de l’offre gratuite

Ce qui compte comme un caractère

La facturation compte les caractères du texte envoyé, espaces et ponctuation compris. Un mot anglais moyen compte cinq lettres plus un espace : un mot coûte donc environ six caractères. Avec ce calcul, 1 million de caractères équivaut à environ 166 000 mots, soit environ 18,5 heures de parole à un rythme tranquille de 150 mots par minute.

Les enveloppes se réinitialisent chaque mois civil et ne se reportent jamais. Les caractères non utilisés en mars disparaissent en avril. Elles sont aussi suivies par niveau : 900 000 caractères Neural2 inutilisés ne compenseront jamais une facture Chirp 3 HD.

Vue de dessus d’un bureau avec une calculatrice, des factures imprimées et des calculs manuscrits pour estimer le coût de la parole

La facturation doit rester activée

L’offre gratuite n’est pas un essai sans carte. Un compte de facturation doit être rattaché au projet avant que l’API ne réponde, même si vous ne sortez jamais de l’enveloppe gratuite. Définissez une alerte budgétaire de 5 $ ou 10 $ dès le premier jour, et envisagez de réduire le quota de l’API dans la console afin qu’une boucle incontrôlée ne produise pas une surprise à quatre chiffres pendant la nuit.

💡 Astuce pro : Mettez en cache chaque fichier généré. Un message d’accueil diffusé 10 000 fois par jour doit être synthétisé une seule fois puis stocké, et non facturé 10 000 fois.

Ce que coûte réellement 1 million de caractères

Les prix par caractère semblent minuscules : voici donc les mêmes niveaux appliqués à des charges de travail réelles. Chaque chiffre applique d’abord l’enveloppe gratuite du niveau concerné.

Trois exemples de factures mensuelles

Charge de travailCaractèresStandardNeural2Chirp 3 HD
200 articles de blog de 1 500 mots1,8M$0$12,80$24,00
Menu téléphonique, 50 000 invites vocales de 120 caractères6M$8,00$80,00$150,00
Un roman de 80 000 mots0,48M$0$0$0

Le roman reste dans l’enveloppe gratuite sur Neural2 ou Chirp 3 HD, alors que le même livre sur Studio coûterait 76,80 $ avant toute enveloppe. La ligne du menu téléphonique montre pourquoi le choix du niveau compte : un trafic identique coûte 8 $ sur Standard et 150 $ sur Chirp 3 HD. La mise en cache des messages répétés efface en général l’essentiel de cet écart, car un menu fixe ne compte que quelques centaines de phrases uniques.

Coût par heure d’audio

À 150 mots par minute et six caractères par mot, une heure de parole représente environ 54 000 caractères. Prix avant toute enveloppe gratuite :

NiveauCoût par heure d’audio
Standard et WaveNet$0,22
Neural2 et Polyglot$0,86
Chirp 3 HD$1,62
Voix personnalisée instantanée$3,24
Studio$8,64
Gemini 3.1 Flash TTS (facturé au token)Environ 1,81 $, estimation indépendante

Lisez ces chiffres comme le prix de la centième heure, et non de la première. Les modèles vocaux Gemini de Google se facturent différemment, au token plutôt qu’au caractère : environ 1 $ par million de tokens de texte plus 20 $ par million de tokens audio pour Gemini 3.1 Flash TTS. Le coût suit alors la durée de l’audio que vous générez, ce qui est plus facile à prévoir pour une narration et plus difficile pour des assistants bavards.

Où l’API s’intègre le mieux

Livres audio et narration

La narration longue est le cas où la facturation au caractère est la plus prévisible. Un livre de dix heures représente environ 540 000 caractères : même sans aucune enveloppe gratuite, Chirp 3 HD coûterait 16,20 $ pour l’ensemble. Le revers de la médaille tient au pilotage. Les voix de Google lisent ce qu’on leur donne, avec une marge de contrôle émotionnel limitée au-delà du SSML ; une fiction avec dialogues implique donc généralement de tester plusieurs voix pour plusieurs personnages.

Un narrateur lisant un épais livre de poche dans une cabine d’enregistrement capitonnée

Menus téléphoniques et assistance

La téléphonie correspond le mieux à la liste de formats de l’API. Demandez une sortie MULAW ou ALAW pour que l’audio s’intègre directement à un réseau téléphonique sans conversion, générez une fois les messages fixes et stockez les fichiers, et réservez la synthèse en direct aux parties variables, comme les noms et les numéros de commande. Seule la partie dynamique doit apparaître sur votre facture.

Un plateau d’assistance clientèle lumineux, avec des agents portant des casques devant des bureaux blancs

Assistants et accessibilité

Les enceintes intelligentes, les applications de lecture et les assistants embarqués dans les voitures suivent tous le même schéma : des réponses courtes et un volume élevé. Les voix Standard et Neural2 absorbent ce trafic à moindre coût, et une généreuse enveloppe gratuite signifie souvent qu’un petit produit ne paie rien pendant des mois. La latence compte aussi : testez le temps de réponse depuis votre propre région avant de vous engager. Une voix parfaite qui met deux secondes à démarrer paraît cassée dans une conversation.

Une enceinte intelligente anthracite mate sur un plan de cuisine, à côté de citrons et d’une tasse de café fumante

L’accessibilité est un cas différent. Une personne qui s’appuie sur l’audio pour lire de longs articles entend la voix pendant des heures chaque jour, et une tonalité de synthèse plate devient vite fatigante. Prévoyez du Neural2 ou du Chirp 3 HD pour ce cas, et laissez l’auditeur contrôler la vitesse.

Un homme avec une canne blanche à un arrêt de bus, écoutant son smartphone avec des écouteurs

Options de voix au-delà de Google Cloud

L’API est conçue pour les développeurs qui gèrent un projet cloud, un compte de service et une console de facturation. Si vous avez besoin d’une voix off pour une vidéo, d’un prototype rapide ou d’une narration ponctuelle, cette configuration représente une charge inutile. PicassoIA héberge 24 modèles de synthèse vocale que vous pouvez essayer directement depuis le navigateur, sans projet cloud à configurer.

Alternatives qui valent le détour

ModèlePoint fortUsage idéal
Gemini 3.1 Flash TTS30 voix, plus de 70 codes de langue, balises d’émotionNarration expressive et scripts multilingues
ElevenLabs v3Voix off naturelles, à la sonorité humaineRécits et lectures de personnages
MiniMax Speech 2.8 HDRendu de qualité studioNarration soignée pour la vidéo
Inworld Realtime TTS 2Direction vocale en langage naturelAgents conversationnels
Qwen3 TTSCloner une voix ou en concevoir une nouvelleVoix de marque personnalisées
ElevenLabs DubbingTraduire des vidéos en plus de 90 languesLocaliser des rushes existants

Un animateur de podcast parlant dans un micro à condensateur équipé d’un filtre anti-pop, dans un studio chaleureux

Si votre projet a besoin d’une voix signature plutôt que d’une voix générique, MiniMax Voice Cloning crée une voix personnalisée à partir d’un court échantillon, et contourne les 60 $ par million de caractères que Google facture pour une voix personnalisée instantanée.

Utiliser Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS constitue un bon premier test, car ses noms de voix recoupent la gamme Chirp 3 HD de Google. Aoede, Puck, Charon et Kore figurent dans les deux, ce qui facilite les comparaisons côte à côte.

  1. Ouvrez la page du modèle et collez votre script dans le champ de texte. La limite est de 4 000 octets par génération, alors découpez les scripts plus longs.
  2. Choisissez une voix parmi les 30 options. La voix par défaut est Kore, et Puck, Charon, Fenrir et Aoede sont de bons choix pour commencer les essais.
  3. Définissez le code de langue. La valeur par défaut est en-US, et la liste dépasse les 70 codes, dont es-MX, fr-CA, pt-BR et ja-JP.
  4. Rédigez un prompt de style en anglais simple, par exemple « Say this in a calm, professional tone » ou « Speak with excitement and energy ».
  5. Ajoutez des balises d’expression dans le script : [whispering], [laughing], [shouting], [sigh] ou [extremely fast].
  6. Générez, écoutez et téléchargez le fichier audio. Modifiez un réglage à la fois pour entendre ce que chacun produit.
ParamètreCe qu’il contrôlePoint de départ
VoixPersonnage, âge et tonKore pour une narration neutre
Code de langueAccent et prononciationCorrespond à la région de votre audience
Prompt de styleRythme, émotion, dictionUne courte phrase
Balises de texteExpression au niveau de la phraseDeux ou trois par paragraphe

💡 Astuce : Utilisez les balises avec parcimonie. Un script où chaque réplique est [whispering] ou [shouting] sonne épuisant. Réservez-les au contraste, pas à la décoration.

Musique et transcription autour de la parole

La parole est rarement livrée seule. Une vidéo a besoin d’un fond musical sous la narration, et un contenu parlé a besoin d’une transcription pour les sous-titres, la recherche et l’accessibilité. Google vend la transcription comme un produit distinct, avec son propre compteur : un projet vocal peut donc générer deux lignes de facturation avant même d’ajouter la musique.

Pour la musique, Lyria 3 Pro crée des chansons complètes à partir d’un prompt textuel, MiniMax Music 2.6 ajoute voix et paroles, et Stable Audio 2.5 convient aux fonds instrumentaux qui restent discrets sous une voix. Rédigez votre prompt musical comme un brief à un compositeur : genre, tempo, instruments et ambiance. « Warm acoustic guitar, 90 BPM, unhurried, no vocals » donne un fond qui ne fera pas concurrence à la narration.

Un producteur musical à son bureau, entre des enceintes de contrôle et un petit contrôleur MIDI

Pour les transcriptions, GPT-4o Transcribe et Gemini 3 Pro transforment les enregistrements en texte, ce qui est pratique pour les comptes rendus de réunion, les interviews et les sous-titres de la narration que vous venez de générer.

Vue aérienne de collègues autour d’une table de conférence en verre avec un petit enregistreur vocal au centre

Un enchaînement simple fonctionne bien : rédigez le script, générez la voix, ajoutez un fond musical, puis transcrivez le mixage final pour produire les sous-titres et vérifier la prononciation des noms délicats.

Créez votre première voix off dès aujourd’hui

Les tableaux de prix ne disent que peu de choses. La façon la plus rapide de choisir entre une API cloud et un outil de navigateur consiste à faire lire le même paragraphe par les deux. Prenez 100 mots de votre propre projet, passez-les dans la console de Google, puis collez-les dans Gemini 3.1 Flash TTS ou MiniMax Speech 2.8 HD et comparez côte à côte le rythme, la chaleur et la prononciation.

Pendant que vous y êtes, explorez le reste de la plateforme. Ajoutez un fond musical avec Lyria 3 Pro, sous-titrez le résultat avec GPT-4o Transcribe et créez vos propres images photoréalistes pour les miniatures et les visuels d’article avec PicassoIA. Expérimentez librement, modifiez une variable à la fois et conservez la combinaison qui sonne juste. Parcourez tous les modèles sur picassoia.com/en/all-models.

Partager cet article

Choisissez votre langue