Tarifs de l’API TTS d’OpenAI : voix, tts-1-hd et comparaison avec ElevenLabs

OpenAI facture 15 $ par million de caractères pour tts-1, 30 $ pour tts-1-hd et environ 0,015 $ la minute pour gpt-4o-mini-tts. Ce détail présente chaque voix, calcule les coûts réels pour un article et un livre audio, et met ces chiffres en regard d’ElevenLabs.

Tarifs de l’API TTS d’OpenAI : voix, tts-1-hd et comparaison avec ElevenLabs
Cristian Da Conceicao
Fondateur de Picasso IA

L’API de synthèse vocale d’OpenAI fait partie des solutions les moins chères pour donner une voix à une application, à un cours ou à un podcast, et sa grille tarifaire tient en une phrase : 15 $ par million de caractères pour tts-1, 30 $ par million pour tts-1-hd, et environ 0,015 $ par minute d’audio pour le plus récent gpt-4o-mini-tts. ElevenLabs facture 0,10 $ pour 1 000 caractères sur ses modèles haut de gamme, soit plus de trois fois le tarif de tts-1-hd. Que cet écart en vaille la peine dépend des voix, des langues et du degré de naturel recherché dans la diction. Cette page détaille chaque tarif OpenAI, présente les voix modèle par modèle, passe en revue des exemples de coûts réels et met les chiffres côte à côte avec ElevenLabs, pour que vous puissiez choisir avant d’écrire la moindre ligne de code.

💡 Calcul rapide : une minute de narration représente environ 900 caractères. Cela coûte environ 0,014 $ sur tts-1, 0,027 $ sur tts-1-hd et 0,09 $ sur ElevenLabs v3 ou Multilingual v2.

Ce qu’OpenAI facture par caractère

OpenAI facture ses deux modèles de synthèse vocale classiques au nombre de caractères en entrée, et non à la seconde d’audio. Vous payez le texte que vous envoyez, donc une lecture lente et dramatique coûte le même prix qu’une lecture rapide. La page du modèle tts-1-hd indique que le point de terminaison de synthèse vocale (v1/audio/speech) est son seul point d’accès pris en charge, et ce même point de terminaison sert tts-1 et gpt-4o-mini-tts.

Tarifs de tts-1 et tts-1-hd

La grille tarifaire publique est courte. Il n’existe ni frais d’abonnement ni dépense minimale : vous ajoutez du crédit à votre compte, et chaque requête le débite.

ModèlePrixPour 1 000 caractèresIdéal pour
tts-115 $ pour 1 M de caractères0,015 $Applications et assistants à faible latence
tts-1-hd30 $ pour 1 M de caractères0,030 $Audio finalisé, écouté plusieurs fois
gpt-4o-mini-tts0,60 $ pour 1 M de tokens de texte plus 12 $ pour 1 M de tokens audioAu token, environ 0,015 $ la minuteDiction pilotable et expressive

Vue de dessus d’un bureau en noyer avec une calculatrice, une facture vierge, des pièces et un microphone à condensateur, utilisé pour budgéter les coûts de synthèse vocale

Le modèle HD coûte exactement le double. Pour un script classique, cela reste de la petite monnaie, et c’est pourquoi la vraie décision porte rarement sur l’argent. La page du modèle tts-1-hd indique des limites de requêtes comprises entre 2 500 et 10 000 par minute selon votre palier d’utilisation, bien au-delà de ce que la plupart des applications envoient.

gpt-4o-mini-tts se facture au token

Le modèle le plus récent sort du schéma par caractère. Il facture 0,60 $ par million de tokens de texte en entrée et 12 $ par million de tokens audio en sortie, ce qui revient à environ 0,015 $ la minute d’audio généré. On arrive presque au même niveau que tts-1, mais il ajoute un champ instructions dans lequel vous décrivez la diction en langage courant, par exemple « parlez lentement, comme un professeur patient ». Les modèles tts-1 n’offrent aucun contrôle de ce type.

Développeur logiciel debout devant un bureau réglable avec deux écrans affichant des éditeurs de code flous, en train d’intégrer une API de synthèse vocale dans une application

Un appel minimal avec le SDK Python officiel ressemble à ceci :

from openai import OpenAI

client = OpenAI()

with client.audio.speech.with_streaming_response.create(
    model="tts-1-hd",
    voice="coral",
    input="Your order shipped this morning and should arrive on Friday.",
    response_format="mp3",
) as response:
    response.stream_to_file("order-update.mp3")

Remplacez le nom du modèle par gpt-4o-mini-tts et ajoutez une chaîne instructions pour piloter la diction. Chaque requête accepte jusqu’à 4 096 caractères en entrée, donc les longs scripts doivent être découpés en morceaux, puis réassemblés.

Les voix auxquelles vous avez réellement accès

Le nombre de voix est le point sur lequel les trois modèles d’OpenAI diffèrent le plus, et il compte davantage que ce que la plupart des pages tarifaires laissent entendre. Un modèle bon marché avec une seule voix qui ne vous plaît pas n’est pas une bonne affaire.

Vue en contre-plongée d’un animateur de podcast en veste en velours côtelé parlant dans un micro de radiodiffusion, dans un studio à la lumière chaleureuse

Neuf voix sur tts-1 et tts-1-hd

Les deux modèles classiques partagent les mêmes neuf voix : alloy, ash, coral, echo, fable, onyx, nova, sage et shimmer. C’est une palette suffisante pour un narrateur, un assistant chaleureux ou un annonceur à la voix plus grave, mais pas pour une distribution de personnages bien distincts.

Quatre voix supplémentaires sur le modèle le plus récent

gpt-4o-mini-tts propose 13 voix. Il conserve les neuf d’origine et ajoute ballad, verse, marin et cedar. OpenAI recommande marin ou cedar lorsque vous recherchez la meilleure qualité.

ModèleVoixNoms
tts-19alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer
tts-1-hd9Les mêmes neuf
gpt-4o-mini-tts13Les neuf plus ballad, verse, marin, cedar

Quelques détails pratiques s’appliquent aux trois modèles :

  • Formats de sortie : MP3 par défaut, ainsi que Opus, AAC, FLAC, WAV et PCM. WAV et PCM sont les plus rapides à renvoyer.
  • Streaming : l’API prend en charge le streaming par morceaux, de sorte que la lecture peut commencer avant la fin de la génération du fichier.
  • Langues : environ 99, selon la prise en charge linguistique de Whisper. OpenAI indique que les voix sont optimisées pour l’anglais, donc testez votre langue cible avant de vous engager.
  • Mention : les règles d’utilisation exigent d’informer clairement les utilisateurs finaux que la voix est générée par une IA et qu’elle n’est pas humaine.

tts-1 ou tts-1-hd ?

Les deux modèles utilisent les mêmes neuf voix et la même entrée, donc changer de modèle revient à modifier un seul mot dans votre code. Le choix est donc facile à tester : générez un paragraphe avec chacun et écoutez-le sur l’appareil que votre public utilise réellement.

Gros plan extrême d’un casque de studio aux coussinets en cuir posé sur une table en bois, sous une lumière matinale

Ce qu’apportent les 15 $ de plus

OpenAI présente tts-1 comme l’option à plus faible latence et tts-1-hd comme l’option de meilleure qualité. Attendez-vous à une diction plus fluide et plus stable sur les longs passages avec le modèle HD, et à ce que l’écart soit le plus facile à entendre au casque. Sur le haut-parleur d’un téléphone, dans une application bruyante, beaucoup d’auditeurs ne le remarqueront pas.

Comment choisir entre les deux

  • Choisissez tts-1 pour les réponses de chat, les assistants vocaux, les notifications et tout ce pour quoi le premier son doit arriver vite.
  • Choisissez tts-1-hd pour les livres audio, les leçons de cours, les podcasts et les publicités, c’est-à-dire les contenus que les gens réécoutent et jugent de près.
  • Choisissez gpt-4o-mini-tts lorsque la voix doit exprimer une humeur : un agent de support calme, un annonceur de produit enthousiaste, un murmure.

💡 Règle empirique : pour les contenus finalisés, le calcul est simple. Générer un livre audio de 80 000 mots en HD plutôt qu’en version standard ajoute environ 7,20 $ à la facture. Optez donc par défaut pour le HD dès que les auditeurs écouteront l’audio plus d’une fois.

Exemples de coûts réels

Tous les chiffres ci-dessous supposent un débit de narration de 150 mots par minute et environ 6 caractères par mot, espaces compris, soit 900 caractères par minute. Vos propres scripts varieront, donc considérez ces valeurs comme des estimations budgétaires, et non comme des factures.

Tâchetts-1tts-1-hdgpt-4o-mini-ttsElevenLabs FlashElevenLabs v3 ou Multilingual v2
Article de 1 000 mots (6 000 caractères)0,09 $0,18 $environ 0,10 $0,30 $0,60 $
Livre audio de 80 000 mots (480 000 caractères)7,20 $14,40 $environ 8,00 $24,00 $48,00 $
1 million de caractères par mois15 $30 $environ 16,70 $50 $100 $

Narrateur de livre audio lisant un épais manuscrit dans une cabine de voix tapissée de mousse, vu à travers la vitre de la régie

Un article de 1 000 mots

Transformer un article de blog en version audio coûte moins de 10 centimes sur tts-1 et moins de 25 centimes sur HD. Même au tarif haut de gamme d’ElevenLabs, cela fait 60 centimes : pour une narration occasionnelle, l’écart de prix est presque sans importance. Choisissez selon le son, pas selon le coût.

Un livre audio de 80 000 mots

Un livre complet est l’exemple où l’écart devient visible : 14,40 $ sur tts-1-hd contre 48 $ sur les modèles haut de gamme d’ElevenLabs, pour environ neuf heures d’audio. Un narrateur humain coûte bien plus cher par heure finalisée que n’importe quelle case de ce tableau, donc chaque option présentée ici ne représente qu’une fraction du prix d’une réservation de studio.

Un million de caractères par mois

À l’échelle d’une application, les paliers se distinguent. Un produit qui fait lire un million de caractères par mois paie de 15 $ à 100 $ selon le fournisseur et le modèle. Surveillez les relances : si vous régénérez un clip sur trois, ajoutez un tiers à chaque montant. Mettez en cache l’audio des phrases récurrentes, comme les salutations et les messages d’erreur, car un même texte n’a jamais besoin d’être payé deux fois.

Synthèse vocale OpenAI ou ElevenLabs

Le tableau des coûts indique qui est le moins cher. Il ne dit pas qui sonne le mieux pour votre usage, ni ce qui se passe lorsque votre script dépasse ce qu’une seule requête permet.

Deux collègues comparant des options de synthèse vocale à un bureau partagé, l’un pointant un ordinateur portable pendant que l’autre prend des notes

CritèreOpenAI tts-1-hdElevenLabs Flash v2.5ElevenLabs Multilingual v2 et v3
Prix API pour 1 000 caractères0,030 $0,05 $0,10 $
LanguesEnviron 993229 (v2), plus de 70 (v3)
Caractères max par requête4 09640 00010 000 (v2), 5 000 (v3)
Voix intégrées9Grande bibliothèque et clonage vocalGrande bibliothèque et clonage vocal
Accent sur la vitesseLatence plus faible sur tts-1Environ 75 ms annoncées par le fournisseurQualité supérieure, plus lent

Les chiffres d’ElevenLabs proviennent de comparatifs tarifaires de la mi-2026. L’entreprise met souvent à jour ses offres, donc vérifiez les montants actuels sur sa page tarifaire avant de fixer un budget.

Prix pour 1 000 caractères

Sur l’API, tts-1 se situe à 0,015 $, tts-1-hd à 0,030 $, ElevenLabs Flash et Turbo à 0,05 $, et Multilingual v2 et v3 à 0,10 $. ElevenLabs Flash coûte donc environ 1,7 fois plus cher que tts-1-hd, et ses modèles haut de gamme environ 3,3 fois plus. Les abonnements regroupent en revanche des crédits : le plan gratuit inclut 10 000 crédits par mois, avec un crédit par caractère sur les modèles standard et un demi-crédit sur Flash et Turbo.

Qualité vocale et expressivité

Le prix ne fait pas tout. ElevenLabs a bâti sa réputation sur une diction expressive et naturelle, et Eleven v3 ajoute une palette émotionnelle élargie ainsi que des dialogues à plusieurs locuteurs dans plus de 70 langues. La réponse d’OpenAI passe par la pilotabilité : gpt-4o-mini-tts accepte des instructions en langage courant sur l’accent, le ton, la vitesse et l’émotion, ce qu’aucun des deux modèles tts-1 ne permet.

Si vous avez besoin de personnages qui sonnent différemment d’une scène à l’autre, la bibliothèque de voix d’ElevenLabs et le clonage vous laissent plus de marge. Si vous voulez une seule voix fiable et bon marché, OpenAI l’emporte en matière de coût. Le seul test honnête consiste à faire lire le même paragraphe par les deux modèles et à l’écouter.

Limites, langues et licences

Les limites de requêtes façonnent votre code. OpenAI plafonne l’entrée à 4 096 caractères et Eleven v3 à 5 000, donc un long script nécessite un découpage et un moyen de garder la voix cohérente entre les morceaux. Flash v2.5 accepte 40 000 caractères, ce qui réduit le nombre de raccords pour les longues lectures.

Les licences diffèrent aussi. Le plan gratuit d’ElevenLabs n’inclut pas de licence commerciale, et les droits commerciaux commencent avec le premier plan payant. OpenAI exige que vous indiquiez aux utilisateurs finaux que la voix est générée par une IA. Lisez les deux ensembles de conditions avant de livrer de l’audio à vos clients.

Utiliser ElevenLabs v3 sur PicassoIA

Avant de payer au caractère, vous pouvez écouter le versant ElevenLabs de cette comparaison dans votre navigateur. La collection de synthèse vocale de PicassoIA répertorie 24 modèles, dont ElevenLabs v3, Flash v2.5, Turbo v2.5 et Multilingual v2, ainsi que des options de MiniMax, Google, Inworld et Resemble AI. Collez un script, choisissez une voix, et l’audio revient en quelques secondes.

Jeune homme en bonnet en maille écoutant un échantillon de voix IA avec un seul écouteur, à côté d’une fenêtre

Étapes dans le navigateur

  1. Ouvrez la page ElevenLabs v3 dans la collection de synthèse vocale.
  2. Collez votre script dans le champ Prompt.
  3. Choisissez une voix dans la liste déroulante. La voix par défaut est Rachel, et la liste compte plus de 25 profils vocaux.
  4. Définissez le code de langue. La valeur par défaut est en ; utilisez es ou fr pour l’espagnol ou le français.
  5. Laissez stability à 0,5, similarity boost à 0,75, style à 0 et speed à 1 pour le premier essai.
  6. Lancez le modèle, écoutez, ajustez un réglage à la fois, puis téléchargez le fichier qui vous plaît.

Réglages qui modifient le résultat

  • Stability : des valeurs élevées maintiennent une voix stable sur un long script, des valeurs basses autorisent davantage de variations.
  • Style : un curseur de 0 à 1 qui fait passer la diction d’une narration neutre à une lecture plus théâtrale.
  • Speed : de 0,25x à 4x, pratique pour ralentir la narration d’un tutoriel.
  • Previous and next text : collez les phrases qui précèdent et suivent un morceau pour que l’intonation reste naturelle à la jonction. C’est la solution aux limites de caractères par requête évoquées plus haut.

Pour un test A/B rapide, faites passer le même paragraphe dans Flash v2.5 pour la vitesse, MiniMax Speech 2.8 HD pour une qualité de studio, Gemini 3.1 Flash TTS pour ses 30 voix et ses plus de 70 langues, et Inworld TTS 1.5 Max pour des voix off multilingues rapides. Comparez ensuite les résultats à un échantillon tts-1-hd généré depuis votre propre compte.

Aussi la musique et la transcription

La voix n’est pas souvent le seul élément audio. Une vidéo de produit a besoin d’une piste musicale, et un podcast a besoin d’une transcription pour les sous-titres et la recherche.

Musicien à un bureau en bois avec un contrôleur à pads et un moniteur de studio dans la lumière chaude du coucher de soleil, en train de composer un morceau

Générer de la musique. Pour une piste d’ambiance, essayez MiniMax Music 2.6, Lyria 3 Pro, ElevenLabs Music ou Stable Audio 2.5. Décrivez le genre, l’ambiance et le tempo en une phrase, puis laissez le modèle esquisser le morceau.

Journaliste dans un café tapant sur un ordinateur portable à côté d’un petit enregistreur vocal et d’un cappuccino, transformant un entretien en texte

Transcrire l’audio. Pour transformer une narration finalisée ou un entretien en texte, utilisez GPT-4o Transcribe, GPT-4o Mini Transcribe ou Gemini 3 Pro. Une transcription sert à la fois de sous-titres, de notes d’émission et de relecture : si la transcription déforme un mot, un auditeur le fera probablement aussi.

Un enchaînement simple relie le tout : écrivez le script, générez la voix, ajoutez une piste musicale, puis transcrivez le mixage final pour vérifier le texte.

Essayez dès aujourd’hui

Les tableaux tarifaires ne vont que jusqu’à un certain point. La façon la plus rapide de trancher entre OpenAI et ElevenLabs consiste à entendre votre propre script dans plusieurs voix et à observer ce que coûte chaque option à votre volume. Ouvrez PicassoIA, collez un paragraphe dans un modèle de synthèse vocale, puis comparez-le à un extrait tts-1-hd. Ajoutez ensuite une piste musicale, transcrivez le résultat et générez quelques images photoréalistes pour la couverture de votre épisode ou de votre vidéo. Tout ce qu’il faut pour tester un flux de travail audio et visuel complet se trouve au même endroit : expérimentez librement et gardez la combinaison qui sonne le mieux.

Partager cet article

Choisissez votre langue