Gemini TTS : voix, tarifs, API et langues expliqués
Gemini TTS transforme un script en parole avec 30 voix prédéfinies, plus de 70 langues et des balises expressives comme chuchoter ou rire. Cet article détaille chaque voix selon son ton, le calcul réel des tokens derrière le prix, un appel API Python fonctionnel et une méthode dans le navigateur qui ne demande aucune installation.
Une voix off d’une minute avec Gemini TTS coûte environ trois centimes au tarif standard. Ce seul chiffre explique pourquoi les développeurs, les podcasteurs et les créateurs de formations continuent de poser la question. Les modèles vocaux de Google transforment un script en audio avec 30 voix nommées, plusieurs dizaines de langues et une façon simple, en langage courant, de diriger l’interprétation. Ce que les démonstrations ne montrent pas, c’est tout ce qui détermine si l’outil convient à votre projet : quelle voix correspond à quel usage, comment se calcule la facture en tokens, à quoi ressemble l’appel API et où se situent les limites. Vous trouverez ci-dessous chacun de ces points avec des chiffres réels, un exemple Python fonctionnel et une méthode sans code à essayer dans votre navigateur en moins d’une minute.
Ce que fait réellement Gemini TTS
Gemini TTS est la partie sortie audio des modèles Gemini de Google. Vous envoyez un texte accompagné d’une instruction facultative, et le modèle renvoie de l’audio au lieu d’un texte. Les moteurs de synthèse vocale classiques appliquent la même diction à chaque phrase. Un modèle Gemini TTS lit l’instruction et le script ensemble, si bien que « dites ceci comme une infirmière épuisée en fin de garde » modifie le rythme, le souffle et le ton, et pas seulement la hauteur.
Du texte à l’audio parlé
Chaque requête repose sur les mêmes trois éléments : un script, une voix et une instruction de style. La page Gemini 3.1 Flash TTS sur Picasso IA les présente sous forme de quatre champs : text, voice, prompt et language_code. Les valeurs par défaut sont la voix Kore, la langue en-US et le prompt « Say the following. ». Cliquez sur générer et un fichier audio finalisé arrive en quelques secondes. Les deux exemples publiés sur la page du modèle ont pris environ 6,5 et 4,0 secondes. Une boucle aussi courte change votre façon de travailler : vous réécrivez une phrase, vous la régénérez et vous comparez les prises comme avec un narrateur humain, sans frais de réservation ni heures de studio.
Versions du modèle utilisées
Google propose plusieurs modèles TTS, et le choix influe sur votre facture :
Gemini 3.1 Flash TTS (préversion) : facturé 1,00 $ par million de tokens de texte en entrée et 20,00 $ par million de tokens audio en sortie.
Gemini 2.5 Flash Preview TTS : exactement la moitié du prix de 3.1 Flash, sur les deux postes.
Gemini 2.5 Pro Preview TTS : mêmes tarifs que 3.1 Flash, sans offre gratuite.
Lequel choisir ? Prenez 3.1 Flash si vous voulez le contrôle de diction le plus récent. Prenez 2.5 Flash si vous sonorisez des milliers de courtes phrases, comme des notifications d’application, où la moitié du prix s’accumule vite. Choisissez 2.5 Pro uniquement si vous préférez son rendu, car il coûte autant que 3.1 Flash et n’a pas d’offre gratuite.
La documentation de Google sur la synthèse vocale mentionne aussi des modèles TTS Flash et Flash Lite plus récents. Leurs tarifs ne figuraient pas dans le tableau au moment de la rédaction de cet article : vérifiez le tableau avant de budgétiser autour d’eux.
Les 30 voix, classées par ton
Gemini TTS propose 30 voix prédéfinies portant des noms empruntés à l’astronomie et à la mythologie. Google associe à chacune un libellé d’un seul mot, comme « Bright » ou « Firm », et ces libellés sont le raccourci le plus rapide pour choisir. Considérez-les comme un point de départ, car une instruction de style peut rendre n’importe quelle voix plus chaleureuse, plus rapide ou plus neutre.
Vives et enjouées
Sept voix penchent vers l’énergie : Zephyr (Bright), Puck (Upbeat), Autonoe (Bright), Laomedeia (Upbeat), Sadachbia (Lively), Fenrir (Excitable) et Leda (Youthful). Utilisez-les dans les publicités, les vidéos courtes, les parcours d’accueil et les contenus pour enfants, partout où l’auditeur doit ressentir de l’élan dès la première seconde.
Chaleureuses et douces
Six voix sont plus douces : Sulafat (Warm), Achird (Friendly), Vindemiatrix (Gentle), Achernar (Soft), Enceladus (Breathy) et Aoede (Breezy). Elles conviennent aux scripts de méditation, aux histoires du soir, aux applications bien-être et aux messages du service client.
Fermes et claires
Dix voix dégagent une autorité naturelle : Kore (Firm), Orus (Firm), Alnilam (Firm), Iapetus (Clear), Erinome (Clear), Charon (Informative), Rasalgethi (Informative), Sadaltager (Knowledgeable), Schedar (Even) et Pulcherrima (Forward). Kore est la valeur par défaut pour une bonne raison : elle fonctionne pour les tutoriels, les explications et les démonstrations de produits sans paraître raide.
Les sept restantes comblent les vides. Algieba, Despina, Callirrhoe, Umbriel et Zubenelgenubi sont lisses, détendues ou décontractées, ce qui convient à la conversation. Algenib (Gravelly) et Gacrux (Mature) apportent du relief pour les personnages et la narration.
Usage
Voix à tester en premier
Démonstration de produit
Kore, Charon, Sadaltager
Introduction de podcast
Puck, Fenrir, Algenib
Méditation
Vindemiatrix, Achernar, Enceladus
Publicité sociale
Zephyr, Sadachbia, Leda
Narration de livre audio
Gacrux, Schedar, Sulafat
💡 Testez avant de vous engager. Collez un paragraphe de 30 mots, générez-le avec trois voix et écoutez-le sur les enceintes qu’utilisera votre public. Les libellés sont la description de Google. Vos oreilles ont le dernier mot.
Plus de 70 langues et accents
Le champ de langue accepte plus de 70 langues, et beaucoup existent en variantes régionales. Cela compte plus qu’on ne le pense : l’espagnol mexicain et l’espagnol de Castille diffèrent par le vocabulaire et le rythme, et les auditeurs le remarquent dès la première phrase.
Langue
Codes disponibles
Anglais
en-US, en-GB, en-AU, en-IN
Espagnol
es-ES, es-MX, es-419
Français
fr-FR, fr-CA
Portugais
pt-BR, pt-PT
Chinois
cmn-CN, cmn-tw
Arabe
ar-001, ar-EG
La démarche est simple. Rédigez le script dans la langue cible, indiquez le code correspondant et gardez la même voix. Dans la plupart des cas, une seule voix peut lire toutes les langues de la liste, ce qui vous permet de conserver une même signature sonore sur tous les marchés. Parmi les autres codes courants figurent de-DE, it-IT, ja-JP, ko-KR, hi-IN, tr-TR, pl-PL, nl-NL, sv-SE et vi-VN.
Les langues plus rares de la liste
Au-delà des grands marchés, la liste comprend le cebuano (ceb-PH), le créole haïtien (ht-HT), le javanais (jv-JV), le malgache (mg-MG), le maithili (mai-IN), le konkani (kok-IN), le sindhi (sd-IN), le basque (eu-ES), le galicien (gl-ES) et même le latin (la-VA). La qualité n’est pas identique pour toutes, donc faites relire par un locuteur natif tout contenu destiné à vos clients. Avant de localiser un cours complet, générez un extrait de 20 secondes dans la langue cible avec deux voix et envoyez-le à un locuteur natif avec trois questions : les noms sonnent-ils juste, le rythme paraît-il naturel, et l’accent correspond-il à la région visée ? Si des sigles posent problème au modèle, écrivez-les phonétiquement dans le script. Si votre source est une vidéo finie plutôt qu’un script, ElevenLabs Dubbing la traduit en plus de 90 langues sur la même plateforme.
Balises et prompts de style
Deux leviers façonnent l’interprétation. Les balises agissent sur des phrases isolées, et le prompt de style fixe l’ambiance de toute la prise.
Balises intégrées pour les lignes isolées
Les balises se placent entre crochets dans le script. La page du modèle répertorie [sigh], [laughing], [whispering], [shouting] et [extremely fast], et les exemples publiés montrent que des balises descriptives fonctionnent aussi. Un exemple commence par [like dracula] sur la voix Algenib. Un autre utilise [laughs] I did NOT expect that. [sigh] Can you believe it! avec Callirrhoe.
Balise
Ce à quoi s’attendre
[whispering]
Voix basse, proche du micro
[laughing]
Un rire audible avant ou au sein de la phrase
[shouting]
Volume élevé et urgence
[sigh]
Une expiration fatiguée ou soulagée
[extremely fast]
Un rythme rapide et resserré
Prompts de style pour les prises complètes
Le champ prompt accepte un langage courant jusqu’à 4 000 octets. Des instructions courtes comme « Dites ceci sur un ton calme et professionnel » ou « Parlez avec enthousiasme et énergie » modifient déjà le résultat. Les plus longues construisent une scène : « Vous êtes en train de discuter de façon décontractée avec un ami. Dites ce qui suit d’une manière amicale et amusée. » C’est cette seconde forme qu’utilise l’exemple publié avec Callirrhoe.
Voici comment les deux leviers se combinent pour l’annonce d’un produit, interprétée avec Puck. Le prompt dit « Parlez comme un présentateur sympathique d’une émission du matin, enjoué mais sans précipitation. » Le script dit Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! Le prompt fixe le plafond d’énergie, le chuchotement crée un moment d’intimité, et le cri frappe plus fort parce qu’il suit une phrase calme. Le contraste est ce qui rend les balises audibles.
💡 Une émotion par phrase. Empiler trois balises dans une même ligne produit un résultat confus. Placez une balise, écoutez, puis décidez si la ligne en a besoin d’une autre.
Ce que coûte réellement Gemini TTS
L’audio est facturé en tokens, et la page de tarification de Google précise la conversion : 25 tokens audio par seconde. Tout le reste découle de ce seul chiffre.
Une minute de parole représente 60 secondes multipliées par 25 tokens, soit 1 500 tokens en sortie. À 20,00 $ par million, cela fait 1 500 × 20 ÷ 1 000 000, soit 0,03 $ par minute. Le texte envoyé est négligeable : 150 mots parlés représentent environ 200 tokens en entrée, soit environ 0,0002 $.
Durée audio
3.1 Flash standard
3.1 Flash batch
2.5 Flash standard
1 minute
0,03 $
0,015 $
0,015 $
10 minutes
0,30 $
0,15 $
0,15 $
1 heure
1,80 $
0,90 $
0,90 $
10 heures
18,00 $
9,00 $
9,00 $
Offre gratuite et remises batch
Google propose une offre gratuite pour les deux modèles Flash, tandis que Pro est uniquement payant. Les limites de débit des offres gratuites évoluent, donc confirmez-les sur la page de tarification avant de bâtir un plan de lancement. Le mode batch, c’est-à-dire des tâches asynchrones qui se terminent plus tard, divise les deux tarifs par deux. C’est donc le choix évident pour les livres audio, les bibliothèques de cours ou tout catalogue que vous pouvez générer pendant la nuit.
Un exemple chiffré rend la chose concrète. Supposons que vous sonorisiez un cours de 20 leçons de 8 minutes chacune. Cela fait 160 minutes d’audio, qui coûtent 160 × 0,03 $, soit 4,80 $, au tarif standard de 3.1 Flash, et 2,40 $ en batch. Passez à 100 leçons et vous arrivez à 24,00 $ en standard ou 12,00 $ en batch. Refaire l’enregistrement d’une leçon après une modification du script coûte environ 24 centimes, et c’est là le véritable avantage : modifier l’audio cesse d’être un problème de planning.
💡 Règle budgétaire empirique. Multipliez vos minutes d’audio finalisé par 0,03 $ pour le tarif standard de 3.1 Flash, puis divisez par deux pour le batch. Ces tarifs proviennent de modèles en préversion, donc revérifiez-les lorsque vous passez à plus grande échelle.
Appeler l’API Gemini TTS
Avec le SDK Python, une requête TTS est un appel generate_content classique avec deux changements : une modalité de réponse audio et une configuration vocale qui nomme la voix.
Un exemple Python minimal
from google import genai
from google.genai import types
import wave
client = genai.Client() # reads your credentials from the environment
response = client.models.generate_content(
model="gemini-3.1-flash-tts-preview",
contents="Say warmly: Welcome back. Today we compare three voices.",
config=types.GenerateContentConfig(
response_modalities=["AUDIO"],
speech_config=types.SpeechConfig(
voice_config=types.VoiceConfig(
prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
)
),
),
)
pcm = response.candidates[0].content.parts[0].inline_data.data
with wave.open("welcome.wav", "wb") as f:
f.setnchannels(1)
f.setsampwidth(2)
f.setframerate(24000)
f.writeframes(pcm)
Quelques détails vous feront gagner du temps de débogage :
Les identifiants restent hors du fichier. Le client les récupère depuis une variable d’environnement, si bien qu’aucun secret ne se trouve dans votre dépôt.
L’instruction de style fait partie du texte du prompt. « Dites chaleureusement : » placé avant le script remplit le même rôle que le champ prompt de Picasso IA.
La sortie est du PCM brut. Elle arrive en audio 24 kHz, mono, 16 bits. Le module wave l’encapsule dans un fichier WAV lisible, et ffmpeg le convertit en MP3 si vous avez besoin de fichiers plus légers.
Les noms de champs évoluent sur les modèles en préversion. Consultez la référence actuelle de Google si un appel échoue après une mise à jour du SDK.
Deux locuteurs dans un seul appel
L’API accepte jusqu’à deux locuteurs dans une même requête. Étiquetez les répliques de votre script, par exemple « Animateur : » et « Invité : », puis associez chaque étiquette à une voix dans la configuration vocale. C’est un moyen rapide d’obtenir un dialogue de podcast ou une FAQ à deux voix. Associez une voix ferme à une voix vive pour que les auditeurs distinguent les tours de parole sans support visuel. Pour trois voix ou plus, générez les répliques de chaque locuteur séparément, puis assemblez-les dans un éditeur audio.
Pour les longs scripts, découpez par paragraphe, envoyez les morceaux un à un et mettez en cache chaque résultat. Une requête échouée ne vous coûte alors qu’un paragraphe, et non le chapitre entier. Les modèles en préversion ont généralement des limites de débit plus strictes que les versions stables, donc encadrez vos appels d’une nouvelle tentative avec un délai exponentiel. Consignez la voix, le code de langue et un hachage du script à côté de chaque fichier, et vous pourrez régénérer n’importe quel extrait plus tard avec les mêmes réglages.
Essayer Gemini TTS dans votre navigateur
Si vous n’avez besoin que de quelques extraits, passez le code. La page du modèle sur Picasso IA présente Gemini 3.1 Flash TTS comme accessible gratuitement en ligne, sans installation, et chaque champ correspond aux options de l’API décrites plus haut.
Collez votre script dans Text. La limite est de 4 000 octets, suffisante pour une courte explication. Elle compte des octets, et non des caractères, donc un script en japonais ou en arabe tient sur moins de caractères qu’en anglais.
Choisissez une Voice. Commencez par Kore, puis testez deux autres voix.
Réglez le Language code qui correspond à votre script, par exemple es-MX pour l’espagnol mexicain.
Rédigez un Prompt décrivant le ton et le rythme, ou laissez la valeur par défaut « Say the following. » pour une lecture neutre.
Ajoutez des balises comme [whispering] là où vous voulez de l’émotion, cliquez sur générer et téléchargez l’audio.
Pour les contenus plus longs, découpez le script par section et assemblez les fichiers ensuite.
Réglages qui valent la peine d’être modifiés
Champ
Valeur par défaut
Conseil
Text
Aucune
Jusqu’à 4 000 octets. Utilisez les balises avec parcimonie
Voice
Kore
30 options. Testez-en trois avant de choisir
Prompt
Say the following.
Jusqu’à 4 000 octets. Définissez le ton, le rythme et l’accent
Language code
en-US
Faites correspondre la langue dans laquelle le script est écrit
💡 Une prise plate vient généralement d’un prompt trop court. Allongez le prompt, pas le script. Précisez qui parle, à qui et pourquoi, et le rythme comme l’insistance suivront souvent.
Associer à la musique et aux transcriptions
La parole n’est que rarement l’ensemble du projet. Pour une bande sonore de fond, essayez Lyria 3 ou Music 2.6 et mixez-la discrètement sous la narration. Pour les sous-titres, passez l’audio dans Gemini 3 Pro ou GPT 4o Transcribe.
La transcription sert aussi de contrôle qualité. Transcrivez la narration générée et comparez-la au script. Les noms de produits mal prononcés et les mots sautés apparaissent sous forme d’écarts de texte bien avant qu’un auditeur ne se plaigne.
Réaliser votre première voix off
Gemini TTS fait ses preuves dans quelques usages : narration de démonstrations de produits, introductions de podcasts et lectures publicitaires, versions audio d’articles et de lettres d’information, vidéos de formation au ton constant et pistes multilingues construites à partir d’un seul script. Si votre projet demande une autre sonorité, trois autres modèles de la même catégorie valent un essai : MiniMax Speech 2.8 HD pour des voix off de qualité studio, ElevenLabs V3 pour une narration naturelle et Inworld Realtime TTS 2 lorsque la rapidité de réponse compte avant tout. Une autre limite à connaître : l’API comme la page Picasso IA fonctionnent avec les 30 voix prédéfinies. Si vous avez besoin d’une voix qui ressemble à la vôtre ou à celle de votre marque, testez plutôt MiniMax Voice Cloning ou Qwen3 TTS.
La façon la plus rapide de trancher la question de la voix, c’est de l’entendre. Prenez un paragraphe de votre propre projet, ouvrez Gemini 3.1 Flash TTS sur Picasso IA et générez-le avec trois voix. Ajoutez une balise [whispering], changez le code de langue pour entendre votre script dans un second marché, puis comparez les extraits côte à côte. En dix minutes, vous saurez quelle voix est la bonne pour vous, et vous pourrez reprendre le même flux de travail avec les modèles de musique et de transcription de Picasso IA dès que votre projet grandira.