Voix TTS d’OpenAI : extraits audio, options et lesquelles choisir
Treize voix TTS d’OpenAI, trois modèles et aucun aperçu audio. Cet article compare chaque voix, indique le modèle qui la prend en charge, propose un script de test pour les écouter vous-même, détaille les coûts réels et recommande des choix de départ pour la narration, les robots de support et les courtes vidéos.
Treize noms de voix, trois modèles et aucun aperçu audio sur la page où vous devez en choisir une. C’est le premier obstacle que rencontrent la plupart des développeurs avec l’endpoint de synthèse vocale d’OpenAI. Alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin et cedar semblent tous aussi raisonnables dans une liste déroulante, pourtant ils ne se comportent pas de la même façon sur chaque modèle, et ils ne sonneront pas de la même manière avec votre script. Cet article présente chacune des voix TTS d’OpenAI, indique le modèle qui la prend en charge, explique comment les tester toutes les treize en moins de dix minutes, détaille la facture et précise par quelle voix commencer pour la narration, les robots de support et les courtes vidéos. Il renvoie aussi vers les outils de synthèse vocale de PicassoIA qui complètent l’offre d’OpenAI, dont un avec un tutoriel que vous pouvez lancer dès aujourd’hui.
Ce que propose vraiment l’API TTS d’OpenAI
L’API de synthèse vocale d’OpenAI transforme un texte écrit en audio parlé via un seul endpoint. Vous envoyez un nom de modèle, un nom de voix et votre texte, et vous récupérez un fichier audio. Ce qui déroute souvent, c’est que le modèle choisi détermine le nombre de voix utilisables et le degré de contrôle sur la façon dont le texte est dit.
Trois modèles, trois tarifs
Modèle
Voix
Prix
Idéal pour
tts-1
9
$15 par million de caractères
Brouillons rapides et peu coûteux, et lecture en direct
tts-1-hd
9
$30 par million de caractères
Audio de meilleure fidélité généré à l’avance
gpt-4o-mini-tts
13
$0,60 par million de tokens de texte en entrée, $12 par million de tokens audio en sortie
Ton, rythme et accent pilotables par des instructions
Les deux anciens modèles sont facturés au nombre de caractères. gpt-4o-mini-tts est facturé en tokens, ce qui signifie que votre coût suit la durée de l’audio plutôt que la longueur du script.
Formats de sortie et streaming
L’audio est renvoyé par défaut en MP3, avec Opus, AAC, FLAC, WAV et PCM comme alternatives. Chacun a son usage :
MP3 est le choix sûr pour les sites web et les podcasts.
Opus convient au streaming sur internet, car il reste léger.
AAC fonctionne bien sur les téléphones et dans les logiciels de montage vidéo.
FLAC conserve tout, ce qui compte si vous prévoyez de retoucher le fichier.
WAV et PCM ne sont pas compressés : ils s’imposent lorsque la latence compte plus que la taille du fichier.
L’endpoint peut diffuser l’audio au fur et à mesure de sa génération, si bien que la lecture peut commencer avant la fin du clip. Cela fait une vraie différence pour les assistants vocaux, où une pause de deux secondes donne l’impression d’un appel coupé.
Les 13 voix en un coup d’œil
Neuf voix fonctionnent sur tous les modèles. Quatre autres ne fonctionnent que sur gpt-4o-mini-tts. Voici la liste complète, avec une indication sur la manière dont les auditeurs décrivent habituellement chacune d’elles.
💡 À lire d’abord : OpenAI ne publie pas de descriptions de personnalité pour ses voix. La colonne « Souvent décrite comme » reflète donc ce que disent en général les développeurs et les auditeurs, et non une spécification officielle. Considérez-la comme une présélection et laissez vos propres oreilles trancher.
Les neuf voix d’origine
Voix
Souvent décrite comme
Fonctionne sur
alloy
Neutre, équilibrée, polyvalente
Les trois modèles
ash
Plus douce, légèrement rocailleuse, conversationnelle
Les trois modèles
coral
Chaleureuse, amicale, accessible
Les trois modèles
echo
Claire, stable, factuelle
Les trois modèles
fable
Impression de conteur, expressive, souvent perçue comme britannique
Les trois modèles
nova
Lumineuse, énergique, enjouée
Les trois modèles
onyx
Grave, autoritaire, calme
Les trois modèles
sage
Mesurée, réfléchie, au rythme régulier
Les trois modèles
shimmer
Légère, claire, douce
Les trois modèles
Ces neuf voix existent depuis le plus longtemps : elles sont donc les plus utilisées et les plus faciles à trouver des avis à leur sujet. Si votre produit utilise déjà alloy ou nova, il y a rarement une raison de changer, sauf si les nouvelles voix résolvent un problème précis.
Les quatre voix récentes
Voix
Souvent décrite comme
Fonctionne sur
ballad
Douce, mélodique, tendre
gpt-4o-mini-tts uniquement
verse
Expressive, dynamique, vivante
gpt-4o-mini-tts uniquement
marin
Naturelle, soignée, de qualité phare
gpt-4o-mini-tts uniquement
cedar
Naturelle, ancrée, chaleureuse
gpt-4o-mini-tts uniquement
La documentation d’OpenAI recommande marin ou cedar pour la meilleure qualité, ce qui en fait le premier test naturel pour tout nouveau projet. Comme elles ne fonctionnent que sur gpt-4o-mini-tts, les choisir vous donne aussi accès au champ d’instructions, qui offre la vraie souplesse.
Tester les voix et orienter le rendu
Le texte ne peut pas contenir d’audio : le moyen le plus rapide d’obtenir de vrais extraits est donc de les générer vous-même. Treize clips du même script prennent quelques minutes et coûtent quelques centimes.
Un script qui révèle les voix faibles
Un bon script de test n’est pas un beau paragraphe. C’est un test de résistance. Utilisez quelque chose comme ceci :
Commande 4 817 expédiée le 3 mars au Dr Okonkwo, 22 Birchwood Lane. Attendez, vous avez bien dit jeudi ? Franchement, je ne m’attendais pas à ce que la livraison arrive en avance, mais nous y voilà. Trois choses à retenir : gardez le ticket, vérifiez le scellé et appelez-nous si quelque chose vous paraît anormal.
Il réunit un long nombre, une date, un nom de famille difficile, une question, un léger moment d’émotion et une liste. Les voix qui sonnent très bien sur une seule phrase trébuchent souvent sur l’un de ces éléments. Lancez ensuite cette boucle :
from openai import OpenAI
from pathlib import Path
client = OpenAI()
script = "Order 4,817 ships on March 3rd to Dr. Okonkwo at 22 Birchwood Lane. ..."
voices = ["alloy", "ash", "ballad", "coral", "echo", "fable", "nova",
"onyx", "sage", "shimmer", "verse", "marin", "cedar"]
for voice in voices:
out = Path(f"sample_{voice}.mp3")
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice=voice,
input=script,
instructions="Speak clearly in a warm, even tone.",
) as response:
response.stream_to_file(out)
Écoutez avec un bon casque et notez chaque clip sur quatre critères :
Nombres et noms : « 4 817 » sort-il comme une seule expression naturelle ?
La question : la voix monte-t-elle sur « vous avez bien dit jeudi ? » ?
Rythme : les virgules sonnent-elles comme des respirations ou comme des arrêts ?
Fatigue : supporteriez-vous cette voix pendant dix minutes d’affilée ?
Des instructions qui changent la lecture
Avec gpt-4o-mini-tts, un champ d’instructions vous permet de décrire en langage courant la façon dont la voix doit sonner. OpenAI indique que le modèle peut recevoir des consignes sur l’accent, la plage émotionnelle, l’intonation, les imitations, la vitesse, le ton et le chuchotement. Les anciens modèles tts-1 et tts-1-hd ne le prennent pas en charge.
Instruction
Ce à quoi s’attendre
« Parlez d’un ton joyeux et positif. »
Une lecture enjouée et amicale, adaptée à l’accueil
« Calme, lent, comme une histoire du soir. »
Un débit plus doux avec des pauses plus longues
« Professionnel et concis, comme un présentateur de journal. »
Un rythme plus serré, une émotion plus neutre
« Chuchotez la dernière phrase. »
Une fin feutrée pour l’effet dramatique
« Adoptez un ton désolé mais confiant. »
Utile pour les scripts de support concernant les retards
💡 Astuce : Gardez des instructions courtes et concrètes. Une seule phrase claire vaut en général mieux qu’un paragraphe d’adjectifs, et modifier une seule instruction à la fois permet de voir clairement ce qui a changé le résultat.
Quelle voix pour quel usage
Le tableau ci-dessous présente des points de départ à tester, et non des règles. Les voix sont subjectives, et votre script compte davantage que n’importe quelle étiquette.
Usage
Premier choix
Solution de repli
Livres audio et longues lectures
cedar
sage
Support et robots téléphoniques
marin
coral
Démonstrations de produits
alloy
echo
Publicités et courts clips
nova
verse
Méditation et contenus apaisants
ballad
shimmer
Narration et longues lectures
Une longue écoute met à l’épreuve les voix à forte personnalité. Une voix pétillante qui vous charme pendant quinze secondes peut vous épuiser au bout de dix minutes. Pour la narration, choisissez une voix égale et posée, puis utilisez les instructions pour ajouter de la chaleur. Découpez le manuscrit aux sauts de paragraphe, car chaque requête a une limite de longueur d’entrée et des segments plus courts donnent un nouveau départ à la voix. Consultez la référence API actuelle pour connaître la limite exacte.
Assistants et robots de support
Pour un robot, les qualités qui comptent sont la clarté et un ton crédible sous une légère pression. Testez votre voix sur les pires messages que vous envoyez : remboursements, retards, pannes. Une voix qui reste joyeuse en annonçant une mauvaise nouvelle paraît déplacée, alors ajoutez à chaque requête des instructions du type « calme et sincère ». Associez-le au streaming pour que les réponses démarrent vite.
Publicités et courts clips
Les courts clips récompensent l’énergie. Misez sur nova ou verse, ajoutez une instruction comme « enjoué, rapide, conversationnel », et gardez des phrases courtes pour que le débit n’ait jamais à se précipiter. Générez deux ou trois rendus et choisissez à l’oreille, car la différence entre une bonne et une excellente prise tient souvent à un seul adjectif modifié.
Coûts et limites en chiffres réels
Par caractère ou par token
Un manuscrit de 10 000 mots représente environ 60 000 caractères et environ 67 minutes de parole à un rythme naturel. Pour gpt-4o-mini-tts, l’estimation de lancement d’OpenAI était d’environ 1,5 cent par minute d’audio, c’est ainsi que la dernière ligne ci-dessous est calculée.
Modèle
Coût approximatif pour 10 000 mots
tts-1
Environ $0,90
tts-1-hd
Environ $1,80
gpt-4o-mini-tts
Environ $1,00
Ces montants sont assez faibles pour que la qualité de la voix, et non le prix, guide le choix du modèle. Le coût le plus élevé est votre temps passé à relancer les rendus qui ont manqué le ton, ce qui est un argument de plus pour le champ d’instructions.
Prise en charge des langues
OpenAI annonce la prise en charge de plus de 50 langues, de l’afrikaans à l’arabe, en passant par le tchèque, le danois et le néerlandais, avec la précision que les voix sont actuellement optimisées pour l’anglais. Concrètement, un script non anglais fonctionne, mais l’accent peut dériver vers la phonétique anglaise. Testez chaque langue que vous livrez, et faites écouter le résultat à un locuteur natif avant le lancement.
Mention de l’IA et voix personnalisées
Les politiques d’utilisation d’OpenAI exigent d’indiquer clairement aux utilisateurs finaux que la voix qu’ils entendent est générée par une IA et n’est pas celle d’un humain. Intégrez cette mention dans votre produit, pas dans les petits caractères. Des voix personnalisées existent, mais elles passent par un processus distinct qui exige des enregistrements de consentement du locuteur et des échantillons audio. Prévoyez donc des délais si vous voulez une voix de marque.
Alternatives sur PicassoIA
PicassoIA ne propose pas les modèles de synthèse vocale d’OpenAI. Il offre en revanche un large choix d’autres moteurs dans la catégorie Générer de la parole, ainsi que des outils pour les deux tâches qui entourent le travail vocal : vérifier le résultat et ajouter du son en dessous.
Pour repérer rapidement les noms mal prononcés, faites repasser l’audio généré dans une reconnaissance vocale et comparez-le à votre script. GPT-4o Transcribe et GPT-4o Mini Transcribe permettent tous deux de le faire, et Gemini 3 Pro constitue un troisième avis solide. Si la transcription omet ou modifie un mot, un auditeur a probablement entendu la même chose.
Ajouter de la musique sous la voix
Une voix off sans fond sonore peut paraître nue. Générez une piste dans la catégorie Générer de la musique et mixez-la en retrait derrière la narration. ElevenLabs Music, MiniMax Music 2.6, Lyria 3 Pro et Stable Audio 2.5 transforment tous un prompt texte en piste. Demandez « instrumental doux, sans voix, tempo régulier » pour que rien ne fasse concurrence aux mots.
Utiliser Gemini 3.1 Flash TTS sur PicassoIA
Comme les voix d’OpenAI n’y sont pas hébergées, l’équivalent le plus proche est Gemini 3.1 Flash TTS, qui offre un flux de travail similaire avec une liste de voix plus étendue. Voici comment le lancer :
Ouvrez la page du modèle et repérez le formulaire de saisie.
Collez votre script dans le champ Text. La limite est de 4 000 octets, découpez donc les scripts plus longs.
Choisissez une voix parmi les 30 options. La valeur par défaut est Kore, et des noms comme Puck, Charon, Fenrir, Aoede et Zephyr sont de bons points de départ.
Rédigez un prompt de style dans le champ Prompt. La valeur par défaut est « Say the following. ». Remplacez-la par quelque chose comme « Parlez lentement avec assurance » ou « Adoptez un ton calme et amical ».
Réglez le code de langue. La valeur par défaut est en-US, et plus de 70 codes sont disponibles.
Générez, écoutez et ajustez. Modifiez une seule chose à chaque essai pour savoir ce qui a causé la différence.
Réglage
Conseil
Balises de texte
Ajoutez [whispering], [laughing], [shouting], [sigh] ou [extremely fast] juste avant la phrase qu’elles doivent affecter
Prompt
Décrivez le rythme, le ton et l’accent en une seule phrase
Voix
Testez trois voix sur le même paragraphe avant de vous engager
Code de langue
Adaptez-le à la langue du script, et non à la vôtre
💡 Astuce : Faites passer le clip final dans GPT-4o Transcribe pour vérifier que chaque nom et chaque nombre sont sortis tels qu’écrits.
Essayez par vous-même sur Picasso IA
Choisir parmi les voix TTS d’OpenAI est un travail d’écoute, et le moyen le plus rapide de progresser est de générer des clips et de les comparer. Prenez le script de test ci-dessus, faites-le passer dans les treize voix, puis faites passer le même script dans Gemini 3.1 Flash TTS et MiniMax Speech 2.8 HD sur Picasso IA. Ajoutez un fond musical doux, vérifiez la transcription, et gardez la voix qui sonne toujours juste à la dixième écoute. Ouvrez Picasso IA, collez votre propre script, et commencez avec une voix et une instruction. Votre première voix off utilisable est plus proche qu’il n’y paraît dans la liste déroulante.