API vocales en temps réel comparées : tarifs OpenAI, Gemini et Grok

Les API vocales en temps réel se facturent au token ou à la minute, et l’écart est important. Cette analyse chiffre côte à côte gpt-realtime-2.1 d’OpenAI, Gemini 3.8 Live de Google et Grok Voice de xAI, avec un exemple sur une minute, des budgets pour 10 000 et 100 000 minutes, et les coûts cachés qui gonflent les factures.

API vocales en temps réel comparées : tarifs OpenAI, Gemini et Grok
Cristian Da Conceicao
Fondateur de Picasso IA

Trois éditeurs vendent désormais des modèles speech-to-speech via une connexion persistante, et ils facturent de trois façons différentes. OpenAI facture les tokens audio. Google facture aussi les tokens audio, mais publie en plus un équivalent par minute. xAI ne compte pas de tokens et applique un tarif forfaitaire pour chaque minute où la connexion reste ouverte. Cette seule différence rend une comparaison des prix affichés trompeuse. Un assistant vocal qui coûte un centime par minute sur un tableur peut coûter dix fois plus dès que s’ajoutent les vraies conversations, un contexte qui grandit et les appels d’outils.

Cette analyse place les trois API vocales temps réel sur un pied d’égalité. Vous obtenez les tarifs publiés vérifiés le 8 octobre 2026, un exemple de calcul sur une minute, un budget mensuel pour 10 000 et 100 000 minutes, et les coûts cachés qui modifient une facture après le lancement. En fin d’article, une façon économique de prototyper voix, musique et transcriptions sur PicassoIA avant de vous engager auprès de l’un des trois.

Mains d’un développeur posées à côté d’une calculatrice et d’un ticket de caisse imprimé sur un bureau en bois

Tarifs OpenAI Realtime

La gamme actuelle d’OpenAI, sortie le 6 juillet 2026, comprend gpt-realtime-2.1 et gpt-realtime-2.1-mini. Les deux ajoutent un effort de raisonnement configurable en plus du speech-to-speech, ainsi qu’une meilleure gestion des chaînes alphanumériques, des silences, des bruits de fond et des interruptions. OpenAI a aussi annoncé une baisse d’au moins 25 % de la latence p95 sur l’ensemble de ses modèles Realtime, grâce à un meilleur cache.

Tarifs de gpt-realtime-2.1

Tous les prix sont donnés par million de tokens.

Type de tokenEntréeEntrée en cacheSortie
Texte4,00 $0,40 $24,00 $
Audio32,00 $0,40 $64,00 $

L’entrée image est facturée 5,00 $ le million de tokens. La version précédente, gpt-realtime-2, a les mêmes prix, tandis que gpt-realtime-1.5 et le gpt-realtime d’origine gardent les mêmes tarifs audio mais facturent 16,00 $ le million de tokens de sortie texte. La hausse à 24,00 $ est arrivée avec la gamme 2.x capable de raisonnement.

L’alternative mini

gpt-realtime-2.1-mini coûte environ un tiers du modèle phare sur l’audio.

Type de tokenEntréeEntrée en cacheSortie
Texte0,60 $0,06 $2,40 $
Audio10,00 $0,30 $20,00 $

L’entrée image descend à 0,80 $ le million de tokens. Une mesure publiée portant sur environ 4 000 sessions réelles avec le modèle mini indique qu’un assistant type se situe entre 0,05 $ et 0,08 $ la minute, tandis que les appels intensifs de questions-réponses atteignaient de 0,12 $ à 0,15 $.

Remise sur l’audio en cache

La ligne la moins chère de la grille tarifaire d’OpenAI est l’entrée audio en cache : 0,40 $ au lieu de 32,00 $ sur le modèle phare, soit une baisse d’environ 99 %. Le cache récompense un préfixe stable, c’est-à-dire votre prompt système et les échanges précédents de la conversation. Tout ce qui modifie le début du contexte fait perdre la remise. La même mesure montre qu’injecter de nouveaux résultats de recherche en cours d’appel réinitialise le cache et coûte environ 0,007 $ à 0,009 $ par événement.

Un agent du service client dans un centre d’appels parlant à un correspondant via un casque

Tarifs de Gemini Live

Google vend ses modèles vocaux temps réel via l’API Live, et sa grille tarifaire est la plus simple à lire, car elle affiche à la fois un tarif au token et un chiffre par minute.

Tarifs de Gemini 3.8 Live

gemini-3.8-live et gemini-3.8-live-extended-thinking partagent une même grille tarifaire sur l’offre payante.

TypePar million de tokensPar minute
Entrée texte0,75 $n.d.
Entrée audio3,00 $0,005 $
Entrée image ou vidéo1,00 $0,002 $
Sortie texte4,50 $n.d.
Sortie audio12,00 $0,018 $

Les deux colonnes concordent à 25 tokens audio par seconde : vous pouvez donc budgéter au temps ou au token et obtenir le même chiffre. Une minute de parole de l’assistant coûte 0,018 $, et une minute de parole de l’appelant coûte un demi-centime.

💡 Astuce : Google est le seul des trois à publier un équivalent par minute pour la facturation au token. Si votre équipe financière veut un tarif par minute d’appel, Gemini vous en fournit un sans conversion.

Deux collègues partageant un ordinateur portable et un téléphone autour d’une table lumineuse d’espace de travail

Offre gratuite et modèles de traduction

Une offre gratuite existe pour les modèles Live, ce qui fait de Gemini le lieu naturel pour prototyper sans frais avant de passer à l’offre payante. Deux modèles apparentés sur la même page méritent d’être connus :

  • Gemini 3.5 Live Translate (aperçu) : traduction speech-to-speech dans plus de 70 langues, à 3,50 $ le million de tokens d’entrée (0,0053 $ la minute) et 21,00 $ le million de tokens de sortie (0,0315 $ la minute).
  • Gemini 3.5 Transcribe Live : transcription vocale en streaming, à 3,50 $ le million de tokens d’entrée (0,005 $ la minute) et 21,00 $ le million de tokens de sortie texte (0,004 $ la minute).

L’aperçu Gemini 2.5 Flash Native Audio, plus ancien, figure toujours dans la liste, à 3,00 $ le million de tokens audio en entrée et 12,00 $ le million de tokens audio en sortie.

Tarifs de Grok Voice

xAI a choisi l’approche inverse. Il n’y a pas de tokens audio à compter, seulement des minutes.

Forfait à la minute

La Voice Agent API fait fonctionner grok-voice-think-fast-2.0, également accessible via l’alias grok-voice-latest. La page tarifaire de xAI l’affiche à 0,08 $ la minute, soit 4,80 $ l’heure. Les premiers retours au lancement annonçaient 0,05 $ la minute ; vérifiez donc la page officielle avant de bâtir une prévision sur l’un ou l’autre chiffre.

La facturation suit le temps de connexion. Une minute de silence coûte autant qu’une minute de bavardage, et il n’y a pas de contexte à refacturer à chaque échange. Pour une équipe qui redoute les factures surprises, cette prévisibilité est le produit. Autres lignes tarifaires liées sur la même page :

  • Transcription vocale : 0,10 $ l’heure en REST, 0,20 $ l’heure en streaming.
  • Synthèse vocale : 15,00 $ le million de caractères.

Voix, langues, routage téléphonique

L’API prend en charge plus de 20 langues avec des accents de qualité native, et les produits speech-to-speech et synthèse vocale partagent une même liste de voix. Vous pouvez aussi créer des voix personnalisées à partir d’un extrait audio de référence. Les outils pris en charge incluent les appels de fonctions, la recherche de fichiers, la recherche web, la recherche sur X et les serveurs MCP distants.

Pour la téléphonie, xAI documente une intégration SIP avec G.711 natif, destinée au trafic RTC, aux centres de contact et aux PBX. Des articles tiers ajoutent quelques chiffres que la page tarifaire ne confirmait pas lors de ma vérification : sessions limitées à 30 minutes, 100 sessions simultanées par équipe, des frais de 5 $ pour 1 000 appels de recherche web et sur X, et 0,01 $ supplémentaire par minute pour un numéro de téléphone provisionné. Considérez-les comme des données rapportées, non garanties.

Une femme en veste imperméable parlant dans son smartphone en marchant dans une rue de ville

Tableau comparatif des coûts

Des unités de facturation différentes exigent un scénario commun. Celui ci-dessous est volontairement simple.

Une minute de conversation

Hypothèses : sur une fenêtre de 60 secondes, l’appelant parle 25 secondes et l’assistant parle 25 secondes. L’audio d’OpenAI est compté à environ 100 tokens par seconde, le rythme observé dans la mesure sur sessions réelles évoquée plus haut. L’audio de Gemini est compté à son rythme publié de 25 tokens par seconde. Grok est facturé au temps de connexion. Le texte, les outils et le contexte croissant sont volontairement exclus.

API et modèleUnité de facturationCoût par minute
OpenAI gpt-realtime-2.1Tokens audioenviron 0,240 $
OpenAI gpt-realtime-2.1-miniTokens audioenviron 0,075 $
Gemini 3.8 LiveTokens audioenviron 0,010 $
Grok grok-voice-think-fast-2.0Temps de connexion0,080 $

Le calcul pour le modèle phare donne 2 500 tokens en entrée à 32,00 $ le million (0,080 $), plus 2 500 tokens en sortie à 64,00 $ le million (0,160 $). Le modèle mini suit la même somme, à 10,00 $ et 20,00 $. Pour Gemini, cela représente 0,4167 minute de parole de l’appelant à 0,005 $, plus 0,4167 minute de parole de l’assistant à 0,018 $.

En audio seul, Gemini est environ 25 fois moins cher que gpt-realtime-2.1 et environ 8 fois moins cher que le modèle mini et que Grok.

💡 Lisez ce tableau comme un plancher. Il ne chiffre que l’audio. Les sessions réelles ajoutent des tokens de texte, du raisonnement, des appels d’outils et l’historique de conversation, que la section suivante détaille.

10 000 minutes par mois

Passer de ce plancher à une charge réelle montre où la discussion budgétaire change de nature.

API et modèle10 000 minutes100 000 minutes
OpenAI gpt-realtime-2.12 400 $24 000 $
OpenAI gpt-realtime-2.1-mini750 $7 500 $
Gemini 3.8 Liveenviron 96 $environ 960 $
Grok grok-voice-think-fast-2.0800 $8 000 $

À 10 000 minutes, l’écart entre l’option la moins chère et la plus chère dépasse 2 300 $ par mois. À 100 000 minutes, il dépasse 23 000 $. Au volume le plus bas, la plupart des équipes choisiront selon la qualité et les fonctionnalités plutôt que selon le prix.

Trois tasses en céramique blanche à côté de piles de pièces de hauteurs différentes sur un plan de cuisine

Les coûts cachés qui gonflent la facture

Le plancher du tableau marque la fin des bonnes nouvelles. Quatre éléments font grimper les factures réelles au-dessus de ce plancher.

Le contexte s’accumule

Avec la facturation au token, chaque échange peut renvoyer toute la conversation jusque-là. Au 20e échange, vous payez à nouveau pour les 19 échanges précédents, sauf si le cache ou l’élagage de l’historique les absorbe. Dans la mesure portant sur 4 000 sessions, un appel sans élagage a atteint 480 000 tokens et coûté 2,05 $ pour une seule session. La sortie audio domine aussi la facture, avec environ 80 % des dépenses sur le modèle mini.

Trois habitudes permettent de garder cela sous contrôle :

  1. Limitez la longueur des réponses. Des réponses plus courtes réduisent les dépenses de 20 % à 40 %.
  2. Élaguez l’historique. Résumez les anciens échanges au lieu de les rejouer.
  3. Gardez le préfixe stable. Chez OpenAI, c’est la différence entre 32,00 $ et 0,40 $ le million de tokens audio en entrée.

Le forfait de Grok contourne entièrement les deux premiers, ce qui en fait l’argument le plus fort pour les appels longs.

Outils et tokens de raisonnement

Les modèles 2.1 d’OpenAI vous permettent de régler l’effort de raisonnement. Un effort plus élevé améliore les échanges complexes avec outils, mais ajoute des tokens de sortie et de la latence, et la sortie texte coûte désormais 24,00 $ le million. Réglez un effort faible pour les appels de type FAQ et ne consommez du raisonnement que là où une mauvaise réponse coûte plus que quelques centimes.

Les appels d’outils ajoutent leurs propres lignes. Une récupération de données injectée en cours d’appel peut réinitialiser le cache, les appels de recherche sont facturés séparément sur Grok, et un numéro de téléphone ajoute des frais à la minute dans les configurations de téléphonie. Si vous devez chiffrer un agent vocal pour un client, la mesure ci-dessus suggère de 0,15 $ à 0,20 $ la minute pour le modèle mini afin de tenir les sessions les plus défavorables.

Une main tenant un long ticket de caisse en papier qui se recourbe au bord d’une table en bois

Quelle API convient à votre produit

Le prix n’est qu’un critère. Le bon choix dépend de la durée des appels, de leur nombre et du coût d’une erreur.

Agents téléphoniques

Le trafic des centres de contact signifie des appels longs, un routage SIP et une équipe financière qui déteste la variabilité. La facturation au temps de connexion de Grok et le support SIP documenté rendent la facture facile à prévoir. Si les appels exigent un raisonnement poussé et l’usage d’outils, par exemple pour replanifier, modifier une commande ou vérifier un compte, gpt-realtime-2.1 est celui qui repose sur un raisonnement configurable, et une minute à 0,24 $ peut encore valoir mieux qu’un appel raté.

Assistants intégrés aux applications

Pour les applications grand public à très gros volume et à échanges courts, Gemini 3.8 Live l’emporte nettement en matière de coût, et son offre gratuite fluidifie la phase de prototype. gpt-realtime-2.1-mini se place au milieu : trois fois moins cher que le modèle phare, avec la même structure d’API.

SituationMeilleur choixRaison
Des millions d’échanges vocaux courtsGemini 3.8 LiveTarifs audio les plus bas, chiffres par minute publiés
Longs appels de support via SIPGrok Voice AgentForfait de 0,08 $ la minute, pas de refacturation du contexte
Appels complexes et riches en outilsgpt-realtime-2.1Effort de raisonnement configurable
Équilibre entre coût et qualitégpt-realtime-2.1-miniUn tiers du tarif audio du modèle phare
Prototype sans budgetOffre gratuite GeminiAucun frais pendant vos tests

Un boulanger répondant à un téléphone fixe tout en emballant des pâtisseries au comptoir de sa boutique

Prototyper les voix avant de payer

Une API temps réel commence à facturer dès la première seconde d’audio : fixez donc d’abord la voix, le script et le ton ailleurs, à moindre coût. PicassoIA propose 24 modèles de synthèse vocale, dont des voix des mêmes éditeurs que ceux comparés ici : Gemini 3.1 Flash TTS et Grok Text To Speech. Pour les tests attentifs à la latence, il y a aussi Inworld Realtime TTS 2, Realtime TTS 1.5 Mini avec une synthèse en 120 ms et Realtime TTS 1.5 Max avec une sortie inférieure à 200 ms.

Comment utiliser Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS propose 30 voix dans plus de 70 langues, de quoi tester une voix de marque en quelques minutes.

  1. Ouvrez la page du modèle et connectez-vous à PicassoIA.
  2. Collez votre script. Écrivez comme on parle : phrases courtes, contractions, une idée par ligne.
  3. Choisissez une voix dans la liste des 30 et réglez la langue de votre script.
  4. Générez et écoutez. Vérifiez les chiffres, les noms et les adresses e-mail, les chaînes qui piègent justement les agents en direct.
  5. Refaites la même chose avec le même script dans Grok Text To Speech et comparez le ton côte à côte.
  6. Téléchargez l’audio que vous préférez et partagez-le avec votre équipe avant d’écrire la moindre ligne de code.

💡 Astuce : Gardez un script de test fixe de 5 à 6 lignes incluant un numéro de téléphone, un prix et un nom propre. Utiliser les mêmes lignes à chaque fois rend les comparaisons de voix équitables.

Un podcasteur avec un casque de studio assis à un bureau devant un micro à condensateur

Compléter avec la musique et les transcriptions

Un produit vocal a rarement besoin de la seule parole. Pour la musique d’attente, un jingle d’introduction ou une nappe sonore de marque, Lyria 3 et Music 2.6 génèrent des morceaux originaux à partir d’un prompt textuel. Dans l’autre sens, GPT 4o Transcribe, GPT 4o Mini Transcribe et Gemini 3 Pro transforment les enregistrements de vos appels de test en texte, pour lire ce que l’agent a réellement dit au lieu de réécouter.

Un jeune musicien jouant sur un petit contrôleur musical dans un petit studio à domicile

Créez votre propre démo vocale

Les chiffres ci-dessus vont évoluer : refaites donc le calcul sur une minute avec votre propre durée d’appel et votre propre répartition de parole avant de valider un fournisseur. Commencez dès aujourd’hui par la partie créative : rédigez un script, générez une voix, ajoutez une nappe musicale, puis transcrivez le résultat et relisez-le. Tout cela fonctionne sur PicassoIA sans écrire une seule ligne de code d’intégration.

Choisissez un modèle vocal, collez un script et écoutez le rendu de chaque option avant l’arrivée de la première facture. Quand vous serez prêt à aller plus loin, parcourez tous les modèles sur PicassoIA et continuez d’expérimenter voix, musique, transcriptions et images jusqu’à ce que la démo sonne comme vous voulez que votre produit sonne.

Partager cet article

Choisissez votre langue