Trois éditeurs vendent désormais des modèles speech-to-speech via une connexion persistante, et ils facturent de trois façons différentes. OpenAI facture les tokens audio. Google facture aussi les tokens audio, mais publie en plus un équivalent par minute. xAI ne compte pas de tokens et applique un tarif forfaitaire pour chaque minute où la connexion reste ouverte. Cette seule différence rend une comparaison des prix affichés trompeuse. Un assistant vocal qui coûte un centime par minute sur un tableur peut coûter dix fois plus dès que s’ajoutent les vraies conversations, un contexte qui grandit et les appels d’outils.
Cette analyse place les trois API vocales temps réel sur un pied d’égalité. Vous obtenez les tarifs publiés vérifiés le 8 octobre 2026, un exemple de calcul sur une minute, un budget mensuel pour 10 000 et 100 000 minutes, et les coûts cachés qui modifient une facture après le lancement. En fin d’article, une façon économique de prototyper voix, musique et transcriptions sur PicassoIA avant de vous engager auprès de l’un des trois.

Tarifs OpenAI Realtime
La gamme actuelle d’OpenAI, sortie le 6 juillet 2026, comprend gpt-realtime-2.1 et gpt-realtime-2.1-mini. Les deux ajoutent un effort de raisonnement configurable en plus du speech-to-speech, ainsi qu’une meilleure gestion des chaînes alphanumériques, des silences, des bruits de fond et des interruptions. OpenAI a aussi annoncé une baisse d’au moins 25 % de la latence p95 sur l’ensemble de ses modèles Realtime, grâce à un meilleur cache.
Tarifs de gpt-realtime-2.1
Tous les prix sont donnés par million de tokens.
| Type de token | Entrée | Entrée en cache | Sortie |
|---|
| Texte | 4,00 $ | 0,40 $ | 24,00 $ |
| Audio | 32,00 $ | 0,40 $ | 64,00 $ |
L’entrée image est facturée 5,00 $ le million de tokens. La version précédente, gpt-realtime-2, a les mêmes prix, tandis que gpt-realtime-1.5 et le gpt-realtime d’origine gardent les mêmes tarifs audio mais facturent 16,00 $ le million de tokens de sortie texte. La hausse à 24,00 $ est arrivée avec la gamme 2.x capable de raisonnement.
L’alternative mini
gpt-realtime-2.1-mini coûte environ un tiers du modèle phare sur l’audio.
| Type de token | Entrée | Entrée en cache | Sortie |
|---|
| Texte | 0,60 $ | 0,06 $ | 2,40 $ |
| Audio | 10,00 $ | 0,30 $ | 20,00 $ |
L’entrée image descend à 0,80 $ le million de tokens. Une mesure publiée portant sur environ 4 000 sessions réelles avec le modèle mini indique qu’un assistant type se situe entre 0,05 $ et 0,08 $ la minute, tandis que les appels intensifs de questions-réponses atteignaient de 0,12 $ à 0,15 $.
Remise sur l’audio en cache
La ligne la moins chère de la grille tarifaire d’OpenAI est l’entrée audio en cache : 0,40 $ au lieu de 32,00 $ sur le modèle phare, soit une baisse d’environ 99 %. Le cache récompense un préfixe stable, c’est-à-dire votre prompt système et les échanges précédents de la conversation. Tout ce qui modifie le début du contexte fait perdre la remise. La même mesure montre qu’injecter de nouveaux résultats de recherche en cours d’appel réinitialise le cache et coûte environ 0,007 $ à 0,009 $ par événement.

Tarifs de Gemini Live
Google vend ses modèles vocaux temps réel via l’API Live, et sa grille tarifaire est la plus simple à lire, car elle affiche à la fois un tarif au token et un chiffre par minute.
Tarifs de Gemini 3.8 Live
gemini-3.8-live et gemini-3.8-live-extended-thinking partagent une même grille tarifaire sur l’offre payante.
| Type | Par million de tokens | Par minute |
|---|
| Entrée texte | 0,75 $ | n.d. |
| Entrée audio | 3,00 $ | 0,005 $ |
| Entrée image ou vidéo | 1,00 $ | 0,002 $ |
| Sortie texte | 4,50 $ | n.d. |
| Sortie audio | 12,00 $ | 0,018 $ |
Les deux colonnes concordent à 25 tokens audio par seconde : vous pouvez donc budgéter au temps ou au token et obtenir le même chiffre. Une minute de parole de l’assistant coûte 0,018 $, et une minute de parole de l’appelant coûte un demi-centime.
💡 Astuce : Google est le seul des trois à publier un équivalent par minute pour la facturation au token. Si votre équipe financière veut un tarif par minute d’appel, Gemini vous en fournit un sans conversion.

Offre gratuite et modèles de traduction
Une offre gratuite existe pour les modèles Live, ce qui fait de Gemini le lieu naturel pour prototyper sans frais avant de passer à l’offre payante. Deux modèles apparentés sur la même page méritent d’être connus :
- Gemini 3.5 Live Translate (aperçu) : traduction speech-to-speech dans plus de 70 langues, à 3,50 $ le million de tokens d’entrée (0,0053 $ la minute) et 21,00 $ le million de tokens de sortie (0,0315 $ la minute).
- Gemini 3.5 Transcribe Live : transcription vocale en streaming, à 3,50 $ le million de tokens d’entrée (0,005 $ la minute) et 21,00 $ le million de tokens de sortie texte (0,004 $ la minute).
L’aperçu Gemini 2.5 Flash Native Audio, plus ancien, figure toujours dans la liste, à 3,00 $ le million de tokens audio en entrée et 12,00 $ le million de tokens audio en sortie.
Tarifs de Grok Voice
xAI a choisi l’approche inverse. Il n’y a pas de tokens audio à compter, seulement des minutes.
Forfait à la minute
La Voice Agent API fait fonctionner grok-voice-think-fast-2.0, également accessible via l’alias grok-voice-latest. La page tarifaire de xAI l’affiche à 0,08 $ la minute, soit 4,80 $ l’heure. Les premiers retours au lancement annonçaient 0,05 $ la minute ; vérifiez donc la page officielle avant de bâtir une prévision sur l’un ou l’autre chiffre.
La facturation suit le temps de connexion. Une minute de silence coûte autant qu’une minute de bavardage, et il n’y a pas de contexte à refacturer à chaque échange. Pour une équipe qui redoute les factures surprises, cette prévisibilité est le produit. Autres lignes tarifaires liées sur la même page :
- Transcription vocale : 0,10 $ l’heure en REST, 0,20 $ l’heure en streaming.
- Synthèse vocale : 15,00 $ le million de caractères.
Voix, langues, routage téléphonique
L’API prend en charge plus de 20 langues avec des accents de qualité native, et les produits speech-to-speech et synthèse vocale partagent une même liste de voix. Vous pouvez aussi créer des voix personnalisées à partir d’un extrait audio de référence. Les outils pris en charge incluent les appels de fonctions, la recherche de fichiers, la recherche web, la recherche sur X et les serveurs MCP distants.
Pour la téléphonie, xAI documente une intégration SIP avec G.711 natif, destinée au trafic RTC, aux centres de contact et aux PBX. Des articles tiers ajoutent quelques chiffres que la page tarifaire ne confirmait pas lors de ma vérification : sessions limitées à 30 minutes, 100 sessions simultanées par équipe, des frais de 5 $ pour 1 000 appels de recherche web et sur X, et 0,01 $ supplémentaire par minute pour un numéro de téléphone provisionné. Considérez-les comme des données rapportées, non garanties.

Tableau comparatif des coûts
Des unités de facturation différentes exigent un scénario commun. Celui ci-dessous est volontairement simple.
Une minute de conversation
Hypothèses : sur une fenêtre de 60 secondes, l’appelant parle 25 secondes et l’assistant parle 25 secondes. L’audio d’OpenAI est compté à environ 100 tokens par seconde, le rythme observé dans la mesure sur sessions réelles évoquée plus haut. L’audio de Gemini est compté à son rythme publié de 25 tokens par seconde. Grok est facturé au temps de connexion. Le texte, les outils et le contexte croissant sont volontairement exclus.
| API et modèle | Unité de facturation | Coût par minute |
|---|
| OpenAI gpt-realtime-2.1 | Tokens audio | environ 0,240 $ |
| OpenAI gpt-realtime-2.1-mini | Tokens audio | environ 0,075 $ |
| Gemini 3.8 Live | Tokens audio | environ 0,010 $ |
| Grok grok-voice-think-fast-2.0 | Temps de connexion | 0,080 $ |
Le calcul pour le modèle phare donne 2 500 tokens en entrée à 32,00 $ le million (0,080 $), plus 2 500 tokens en sortie à 64,00 $ le million (0,160 $). Le modèle mini suit la même somme, à 10,00 $ et 20,00 $. Pour Gemini, cela représente 0,4167 minute de parole de l’appelant à 0,005 $, plus 0,4167 minute de parole de l’assistant à 0,018 $.
En audio seul, Gemini est environ 25 fois moins cher que gpt-realtime-2.1 et environ 8 fois moins cher que le modèle mini et que Grok.
💡 Lisez ce tableau comme un plancher. Il ne chiffre que l’audio. Les sessions réelles ajoutent des tokens de texte, du raisonnement, des appels d’outils et l’historique de conversation, que la section suivante détaille.
10 000 minutes par mois
Passer de ce plancher à une charge réelle montre où la discussion budgétaire change de nature.
| API et modèle | 10 000 minutes | 100 000 minutes |
|---|
| OpenAI gpt-realtime-2.1 | 2 400 $ | 24 000 $ |
| OpenAI gpt-realtime-2.1-mini | 750 $ | 7 500 $ |
| Gemini 3.8 Live | environ 96 $ | environ 960 $ |
| Grok grok-voice-think-fast-2.0 | 800 $ | 8 000 $ |
À 10 000 minutes, l’écart entre l’option la moins chère et la plus chère dépasse 2 300 $ par mois. À 100 000 minutes, il dépasse 23 000 $. Au volume le plus bas, la plupart des équipes choisiront selon la qualité et les fonctionnalités plutôt que selon le prix.

Les coûts cachés qui gonflent la facture
Le plancher du tableau marque la fin des bonnes nouvelles. Quatre éléments font grimper les factures réelles au-dessus de ce plancher.
Le contexte s’accumule
Avec la facturation au token, chaque échange peut renvoyer toute la conversation jusque-là. Au 20e échange, vous payez à nouveau pour les 19 échanges précédents, sauf si le cache ou l’élagage de l’historique les absorbe. Dans la mesure portant sur 4 000 sessions, un appel sans élagage a atteint 480 000 tokens et coûté 2,05 $ pour une seule session. La sortie audio domine aussi la facture, avec environ 80 % des dépenses sur le modèle mini.
Trois habitudes permettent de garder cela sous contrôle :
- Limitez la longueur des réponses. Des réponses plus courtes réduisent les dépenses de 20 % à 40 %.
- Élaguez l’historique. Résumez les anciens échanges au lieu de les rejouer.
- Gardez le préfixe stable. Chez OpenAI, c’est la différence entre 32,00 $ et 0,40 $ le million de tokens audio en entrée.
Le forfait de Grok contourne entièrement les deux premiers, ce qui en fait l’argument le plus fort pour les appels longs.
Outils et tokens de raisonnement
Les modèles 2.1 d’OpenAI vous permettent de régler l’effort de raisonnement. Un effort plus élevé améliore les échanges complexes avec outils, mais ajoute des tokens de sortie et de la latence, et la sortie texte coûte désormais 24,00 $ le million. Réglez un effort faible pour les appels de type FAQ et ne consommez du raisonnement que là où une mauvaise réponse coûte plus que quelques centimes.
Les appels d’outils ajoutent leurs propres lignes. Une récupération de données injectée en cours d’appel peut réinitialiser le cache, les appels de recherche sont facturés séparément sur Grok, et un numéro de téléphone ajoute des frais à la minute dans les configurations de téléphonie. Si vous devez chiffrer un agent vocal pour un client, la mesure ci-dessus suggère de 0,15 $ à 0,20 $ la minute pour le modèle mini afin de tenir les sessions les plus défavorables.

Quelle API convient à votre produit
Le prix n’est qu’un critère. Le bon choix dépend de la durée des appels, de leur nombre et du coût d’une erreur.
Agents téléphoniques
Le trafic des centres de contact signifie des appels longs, un routage SIP et une équipe financière qui déteste la variabilité. La facturation au temps de connexion de Grok et le support SIP documenté rendent la facture facile à prévoir. Si les appels exigent un raisonnement poussé et l’usage d’outils, par exemple pour replanifier, modifier une commande ou vérifier un compte, gpt-realtime-2.1 est celui qui repose sur un raisonnement configurable, et une minute à 0,24 $ peut encore valoir mieux qu’un appel raté.
Assistants intégrés aux applications
Pour les applications grand public à très gros volume et à échanges courts, Gemini 3.8 Live l’emporte nettement en matière de coût, et son offre gratuite fluidifie la phase de prototype. gpt-realtime-2.1-mini se place au milieu : trois fois moins cher que le modèle phare, avec la même structure d’API.
| Situation | Meilleur choix | Raison |
|---|
| Des millions d’échanges vocaux courts | Gemini 3.8 Live | Tarifs audio les plus bas, chiffres par minute publiés |
| Longs appels de support via SIP | Grok Voice Agent | Forfait de 0,08 $ la minute, pas de refacturation du contexte |
| Appels complexes et riches en outils | gpt-realtime-2.1 | Effort de raisonnement configurable |
| Équilibre entre coût et qualité | gpt-realtime-2.1-mini | Un tiers du tarif audio du modèle phare |
| Prototype sans budget | Offre gratuite Gemini | Aucun frais pendant vos tests |

Prototyper les voix avant de payer
Une API temps réel commence à facturer dès la première seconde d’audio : fixez donc d’abord la voix, le script et le ton ailleurs, à moindre coût. PicassoIA propose 24 modèles de synthèse vocale, dont des voix des mêmes éditeurs que ceux comparés ici : Gemini 3.1 Flash TTS et Grok Text To Speech. Pour les tests attentifs à la latence, il y a aussi Inworld Realtime TTS 2, Realtime TTS 1.5 Mini avec une synthèse en 120 ms et Realtime TTS 1.5 Max avec une sortie inférieure à 200 ms.
Comment utiliser Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS propose 30 voix dans plus de 70 langues, de quoi tester une voix de marque en quelques minutes.
- Ouvrez la page du modèle et connectez-vous à PicassoIA.
- Collez votre script. Écrivez comme on parle : phrases courtes, contractions, une idée par ligne.
- Choisissez une voix dans la liste des 30 et réglez la langue de votre script.
- Générez et écoutez. Vérifiez les chiffres, les noms et les adresses e-mail, les chaînes qui piègent justement les agents en direct.
- Refaites la même chose avec le même script dans Grok Text To Speech et comparez le ton côte à côte.
- Téléchargez l’audio que vous préférez et partagez-le avec votre équipe avant d’écrire la moindre ligne de code.
💡 Astuce : Gardez un script de test fixe de 5 à 6 lignes incluant un numéro de téléphone, un prix et un nom propre. Utiliser les mêmes lignes à chaque fois rend les comparaisons de voix équitables.

Compléter avec la musique et les transcriptions
Un produit vocal a rarement besoin de la seule parole. Pour la musique d’attente, un jingle d’introduction ou une nappe sonore de marque, Lyria 3 et Music 2.6 génèrent des morceaux originaux à partir d’un prompt textuel. Dans l’autre sens, GPT 4o Transcribe, GPT 4o Mini Transcribe et Gemini 3 Pro transforment les enregistrements de vos appels de test en texte, pour lire ce que l’agent a réellement dit au lieu de réécouter.

Créez votre propre démo vocale
Les chiffres ci-dessus vont évoluer : refaites donc le calcul sur une minute avec votre propre durée d’appel et votre propre répartition de parole avant de valider un fournisseur. Commencez dès aujourd’hui par la partie créative : rédigez un script, générez une voix, ajoutez une nappe musicale, puis transcrivez le résultat et relisez-le. Tout cela fonctionne sur PicassoIA sans écrire une seule ligne de code d’intégration.
Choisissez un modèle vocal, collez un script et écoutez le rendu de chaque option avant l’arrivée de la première facture. Quand vous serez prêt à aller plus loin, parcourez tous les modèles sur PicassoIA et continuez d’expérimenter voix, musique, transcriptions et images jusqu’à ce que la démo sonne comme vous voulez que votre produit sonne.