API de voz em tempo real comparada: preços da OpenAI, do Gemini e do Grok

APIs de voz em tempo real cobram por tokens ou por minuto, e a diferença é grande. Esta análise compara lado a lado os preços do gpt-realtime-2.1 da OpenAI, do Gemini 3.8 Live do Google e do Grok Voice da xAI, com um exemplo de um minuto, orçamentos para 10.000 e 100.000 minutos e os custos ocultos que inflam a conta.

API de voz em tempo real comparada: preços da OpenAI, do Gemini e do Grok
Cristian Da Conceicao
Fundador do Picasso IA

Três fornecedores agora vendem modelos de fala para fala por uma conexão ao vivo, e cada um cobra de um jeito diferente. A OpenAI cobra por tokens de áudio. O Google também cobra por tokens de áudio, mas ainda publica um equivalente por minuto. A xAI não usa tokens e cobra uma taxa fixa por cada minuto em que a conexão fica aberta. Só essa diferença já torna uma comparação de preço de tabela enganosa. Um assistente de voz que custa um centavo por minuto numa planilha pode custar dez vezes isso quando entram em cena conversas reais, contexto crescente e chamadas de ferramentas.

Esta análise coloca as três APIs de voz em tempo real em pé de igualdade. Você recebe as tarifas publicadas conferidas em 8 de outubro de 2026, um exemplo de um minuto, um orçamento mensal para 10.000 e 100.000 minutos e os custos ocultos que alteram a conta depois do lançamento. No final, há um jeito barato de testar vozes, músicas e transcrições no PicassoIA antes de se comprometer com qualquer uma das três.

Mãos de um desenvolvedor apoiadas ao lado de uma calculadora e de um recibo impresso sobre uma mesa de madeira

Preços em tempo real da OpenAI

A linha atual da OpenAI, lançada em 6 de julho de 2026, é formada por gpt-realtime-2.1 e gpt-realtime-2.1-mini. Ambos adicionam esforço de raciocínio configurável à fala para fala, além de um tratamento melhor de sequências alfanuméricas, silêncio, ruído de fundo e interrupções. A OpenAI também informou uma redução de pelo menos 25% na latência p95 em todos os seus modelos em tempo real, graças a um cache aprimorado.

Tarifas do gpt-realtime-2.1

Todos os preços são por 1 milhão de tokens.

Tipo de tokenEntradaEntrada em cacheSaída
TextoUS$ 4,00US$ 0,40US$ 24,00
ÁudioUS$ 32,00US$ 0,40US$ 64,00

A entrada de imagem é cobrada a US$ 5,00 por milhão de tokens. O gpt-realtime-2 anterior tem preços idênticos, enquanto o gpt-realtime-1.5 e o gpt-realtime original mantêm as mesmas tarifas de áudio, mas cobram US$ 16,00 por milhão de tokens de saída de texto. O salto para US$ 24,00 veio com a linha 2.x, que tem raciocínio.

A alternativa Mini

O gpt-realtime-2.1-mini custa cerca de um terço do modelo principal no áudio.

Tipo de tokenEntradaEntrada em cacheSaída
TextoUS$ 0,60US$ 0,06US$ 2,40
ÁudioUS$ 10,00US$ 0,30US$ 20,00

A entrada de imagem cai para US$ 0,80 por milhão de tokens. Uma medição publicada com cerca de 4.000 sessões reais no modelo mini constatou que um assistente típico fica entre US$ 0,05 e US$ 0,08 por minuto, enquanto chamadas pesadas de perguntas e respostas chegaram a US$ 0,12 a US$ 0,15.

Desconto do áudio em cache

A linha mais barata da tabela de preços da OpenAI é a entrada de áudio em cache: US$ 0,40 em vez de US$ 32,00 no modelo principal, uma redução de cerca de 99%. O cache recompensa um prefixo estável, ou seja, seu prompt de sistema e as trocas anteriores da conversa. Qualquer coisa que mude o início do contexto quebra o desconto. A mesma medição constatou que injetar resultados de busca novos no meio da chamada reinicia o cache e custa cerca de US$ 0,007 a US$ 0,009 por evento.

Um atendente de suporte em um call center falando com um cliente por um headset

Preços do Gemini Live

O Google vende seus modelos de voz em tempo real pela Live API, e sua tabela de preços é a mais fácil de ler, porque mostra tanto a tarifa por token quanto o valor por minuto.

Tarifas do Gemini 3.8 Live

gemini-3.8-live e gemini-3.8-live-extended-thinking têm a mesma lista de preços no plano pago.

TipoPor 1 milhão de tokensPor minuto
Entrada de textoUS$ 0,75n/d
Entrada de áudioUS$ 3,00US$ 0,005
Entrada de imagem ou vídeoUS$ 1,00US$ 0,002
Saída de textoUS$ 4,50n/d
Saída de áudioUS$ 12,00US$ 0,018

As duas colunas batem em 25 tokens de áudio por segundo, então você pode orçar por tempo ou por tokens e chegar ao mesmo número. Um minuto do assistente falando custa US$ 0,018, e um minuto do cliente falando custa meio centavo de dólar.

💡 Dica: O Google é o único dos três que publica um equivalente por minuto para a cobrança por tokens. Se a sua equipe financeira quer uma tarifa por minuto de chamada, o Gemini entrega isso sem nenhuma conversão.

Dois colegas dividindo um notebook e um celular em uma mesa de trabalho bem iluminada

Plano gratuito e modelos de tradução

Existe um plano gratuito para os modelos Live, o que torna o Gemini o lugar natural para prototipar sem custo antes de passar para o plano pago. Há duas opções relacionadas nesta mesma página que vale conhecer:

  • Gemini 3.5 Live Translate (prévia): tradução de fala para fala em mais de 70 idiomas, a US$ 3,50 por milhão de tokens de entrada (US$ 0,0053 por minuto) e US$ 21,00 por milhão de tokens de saída (US$ 0,0315 por minuto).
  • Gemini 3.5 Transcribe Live: transcrição de fala em texto em streaming, a US$ 3,50 por milhão de tokens de entrada (US$ 0,005 por minuto) e US$ 21,00 por milhão de tokens de saída de texto (US$ 0,004 por minuto).

O Gemini 2.5 Flash Native Audio, versão de prévia mais antiga, ainda aparece na lista, a US$ 3,00 por milhão de tokens de entrada de áudio e US$ 12,00 por milhão de tokens de saída de áudio.

Preços do Grok Voice

A xAI adotou a abordagem oposta. Não há tokens de áudio para contar, apenas minutos.

Taxa fixa por minuto

A Voice Agent API roda o grok-voice-think-fast-2.0, também acessível pelo alias grok-voice-latest. A página de preços da xAI o lista a US$ 0,08 por minuto, ou US$ 4,80 por hora. Relatos iniciais de lançamento citaram US$ 0,05 por minuto, então confirme a página atual antes de montar uma previsão com qualquer um dos dois números.

A cobrança segue o tempo de conexão. Um minuto de silêncio custa o mesmo que um minuto de conversa, e não há contexto para cobrar de novo a cada turno. Para uma equipe que teme cobranças inesperadas, essa previsibilidade é o grande atrativo. Outros itens relacionados da mesma página:

  • Fala para texto: US$ 0,10 por hora na REST, US$ 0,20 por hora em streaming.
  • Texto para fala: US$ 15,00 por milhão de caracteres.

Vozes, idiomas, roteamento telefônico

A API oferece suporte a mais de 20 idiomas com sotaques de qualidade nativa, e os produtos de fala para fala e de texto para fala compartilham a mesma lista de vozes. Você também pode criar vozes personalizadas a partir de um trecho de áudio de referência. O suporte a ferramentas inclui chamadas de função, busca em arquivos, busca na web, busca no X e servidores MCP remotos.

Para telefonia, a xAI documenta a integração SIP com G.711 nativo, voltada ao tráfego de PSTN, central de contato e PBX. Textos de terceiros acrescentam alguns números que a página de preços não confirmou quando conferi: sessões limitadas a 30 minutos, 100 sessões simultâneas por equipe, uma cobrança de US$ 5 por 1.000 chamadas de busca na web e no X, e US$ 0,01 extra por minuto para um número de telefone provisionado. Trate esses dados como relatados, não como garantidos.

Uma mulher de jaqueta de chuva falando no celular enquanto caminha por uma rua da cidade

Tabela comparativa lado a lado

Unidades de cobrança diferentes exigem um cenário comum. O abaixo é deliberadamente simples.

Um minuto de conversa

Premissas: em uma janela de 60 segundos, o cliente fala por 25 segundos e o assistente fala por 25 segundos. O áudio da OpenAI é contado a cerca de 100 tokens por segundo, a taxa observada na medição de sessões reais mencionada antes. O áudio do Gemini é contado às suas 25 tokens por segundo publicadas. O Grok é cobrado pelo tempo de conexão. Texto, ferramentas e contexto crescente ficam de fora de propósito.

API e modeloUnidade de cobrançaCusto por minuto
OpenAI gpt-realtime-2.1Tokens de áudiocerca de US$ 0,240
OpenAI gpt-realtime-2.1-miniTokens de áudiocerca de US$ 0,075
Gemini 3.8 LiveTokens de áudiocerca de US$ 0,010
Grok grok-voice-think-fast-2.0Tempo de conexãoUS$ 0,080

A conta do modelo principal é 2.500 tokens de entrada a US$ 32,00 por milhão (US$ 0,080) mais 2.500 tokens de saída a US$ 64,00 por milhão (US$ 0,160). O modelo mini segue a mesma soma, com US$ 10,00 e US$ 20,00. O Gemini dá 0,4167 de minuto de áudio do cliente a US$ 0,005 mais 0,4167 de minuto de áudio do assistente a US$ 0,018.

Só no áudio, o Gemini é cerca de 25 vezes mais barato que o gpt-realtime-2.1 e cerca de 8 vezes mais barato que o modelo mini e o Grok.

💡 Leia esta tabela como um piso. Ela precifica apenas o áudio. Sessões reais somam tokens de texto, raciocínio, chamadas de ferramentas e histórico da conversa, que a próxima seção detalha.

10.000 minutos por mês

Levar esse piso para uma carga de trabalho real mostra onde a conversa sobre orçamento muda.

API e modelo10.000 minutos100.000 minutos
OpenAI gpt-realtime-2.1US$ 2.400US$ 24.000
OpenAI gpt-realtime-2.1-miniUS$ 750US$ 7.500
Gemini 3.8 Livecerca de US$ 96cerca de US$ 960
Grok grok-voice-think-fast-2.0US$ 800US$ 8.000

Com 10.000 minutos, a diferença entre a opção mais barata e a mais cara passa de US$ 2.300 por mês. Com 100.000 minutos, ultrapassa US$ 23.000. No volume menor, a maioria das equipes escolherá por qualidade e recursos, e não por preço.

Três xícaras de cerâmica brancas ao lado de pilhas de moedas de alturas diferentes em uma bancada de cozinha

Custos ocultos que inflam a conta

O piso da tabela é onde termina a boa notícia. Quatro fatores empurram as faturas reais acima dele.

O contexto se acumula

Com a cobrança por tokens, cada turno pode reenviar a conversa até ali. No turno 20, você está pagando de novo pelas 19 trocas anteriores, a menos que o cache ou a poda do histórico as absorva. Na medição de 4.000 sessões, uma chamada sem poda chegou a 480.000 tokens e custou US$ 2,05 em uma única sessão. A saída de áudio também domina a conta, respondendo por cerca de 80% dos gastos no modelo mini.

Três hábitos mantêm isso sob controle:

  1. Limite o tamanho das respostas. Respostas mais curtas cortam os gastos em 20% a 40%.
  2. Pode o histórico. Resuma os turnos antigos em vez de reproduzi-los.
  3. Mantenha o prefixo estável. Na OpenAI, isso é a diferença entre US$ 32,00 e US$ 0,40 por milhão de tokens de entrada de áudio.

A taxa fixa do Grok evita os dois primeiros por completo, que é o argumento mais forte a favor dele em chamadas longas.

Ferramentas e tokens de raciocínio

Os modelos 2.1 da OpenAI permitem definir o esforço de raciocínio. Um esforço maior melhora os turnos difíceis de uso de ferramentas, mas adiciona tokens de saída e latência, e a saída de texto agora custa US$ 24,00 por milhão. Use esforço baixo em chamadas no estilo FAQ e gaste raciocínio apenas onde uma resposta errada custa mais do que alguns centavos.

As chamadas de ferramentas têm linhas próprias. Recuperação injetada no meio da chamada pode reiniciar o cache, buscas são cobradas à parte no Grok, e um número de telefone adiciona uma taxa por minuto em configurações de telefonia. Se você cotar um preço para um cliente que quer um agente de voz, a medição acima sugere US$ 0,15 a US$ 0,20 por minuto para o modelo mini, para aguentar as sessões de pior caso.

Uma mão segurando um longo recibo de papel que se curva na borda de uma mesa de madeira

Qual API se encaixa no seu produto

O preço é uma entrada. A escolha certa depende de quanto duram as chamadas, de quantas são e do que custa um erro.

Agentes telefônicos

O tráfego de central de contato significa chamadas longas, roteamento SIP e uma equipe financeira que odeia variação. A cobrança por tempo de conexão do Grok e o suporte SIP documentado tornam a fatura fácil de prever. Se as chamadas exigem raciocínio pesado e uso de ferramentas, como remarcações, alterações de pedido ou verificações de conta, o gpt-realtime-2.1 é o modelo construído em torno do raciocínio configurável, e um minuto a US$ 0,24 ainda pode compensar uma chamada que fracassou.

Assistentes dentro de apps

Para apps de consumo com volume enorme e turnos curtos, o Gemini 3.8 Live vence em custo por ampla margem, e seu plano gratuito tira o atrito da fase de protótipo. O gpt-realtime-2.1-mini fica no meio do caminho: três vezes mais barato que o modelo principal, com o mesmo formato de API.

SituaçãoMelhor opçãoMotivo
Milhões de turnos de voz curtosGemini 3.8 LiveMenores tarifas de áudio, valores por minuto publicados
Chamadas longas de suporte por SIPGrok Voice AgentTaxa fixa de US$ 0,08 por minuto, sem recobrança de contexto
Chamadas complexas e cheias de ferramentasgpt-realtime-2.1Esforço de raciocínio configurável
Custo e qualidade equilibradosgpt-realtime-2.1-miniUm terço da tarifa de áudio do modelo principal
Protótipo com orçamento zeroPlano gratuito do GeminiSem cobrança enquanto você testa

Dona de uma padaria atendendo um telefone fixo enquanto embala doces no balcão da loja

Crie protótipos de vozes antes de pagar

Uma API em tempo real começa a cobrar no primeiro segundo de áudio, então defina a voz, o roteiro e o tom em algum lugar mais barato antes. O PicassoIA lista 24 modelos de texto para fala, incluindo vozes dos mesmos fornecedores que você está comparando: Gemini 3.1 Flash TTS e Grok Text To Speech. Para testes focados em latência, também há o Inworld Realtime TTS 2, o Realtime TTS 1.5 Mini, com síntese de 120 ms, e o Realtime TTS 1.5 Max, com saída abaixo de 200 ms.

Como usar o Gemini 3.1 Flash TTS

O Gemini 3.1 Flash TTS oferece 30 vozes em mais de 70 idiomas, o que é variedade suficiente para testar a voz de uma marca em poucos minutos.

  1. Abra a página do modelo e entre na sua conta do PicassoIA.
  2. Cole seu roteiro. Escreva do jeito que as pessoas falam: frases curtas, contrações, uma ideia por linha.
  3. Escolha uma voz na lista de 30 e defina o idioma do seu roteiro.
  4. Gere e ouça. Confira números, nomes e endereços de e-mail, justamente as sequências que costumam dar problema em agentes ao vivo.
  5. Repita com o mesmo roteiro no Grok Text To Speech e compare o tom lado a lado.
  6. Baixe o áudio de sua preferência e compartilhe com sua equipe antes de escrever qualquer código.

💡 Dica: Mantenha um roteiro de teste fixo de 5 a 6 linhas que inclua um número de telefone, um preço e um nome próprio. Usar sempre as mesmas linhas torna as comparações de voz justas.

Um podcaster de fone de ouvido de estúdio sentado a uma mesa com um microfone condensador

Música e transcrições completam o quadro

Um produto de voz raramente precisa só de fala. Para música de espera, uma vinheta de abertura ou uma trilha de marca, o Lyria 3 e o Music 2.6 geram faixas originais a partir de um prompt de texto. No sentido contrário, o GPT 4o Transcribe, o GPT 4o Mini Transcribe e o Gemini 3 Pro transformam gravações de chamadas de teste em texto, para que você leia o que o agente realmente disse em vez de reproduzir tudo de novo.

Um jovem músico tocando um controlador de música compacto em um pequeno estúdio caseiro

Crie sua própria demo de voz

Os números acima vão mudar, então refaça a conta de um minuto com a duração das suas chamadas e a sua proporção de fala antes de aprovar um fornecedor. Comece o trabalho pelo lado criativo hoje: escreva um roteiro, gere uma voz, adicione uma trilha musical, depois transcreva o resultado e leia de volta. Tudo isso roda no PicassoIA sem escrever uma linha de código de integração.

Escolha um modelo de voz, cole um roteiro e ouça como cada opção soa antes que chegue a primeira fatura. Quando estiver pronto para ir além, explore todos os modelos no PicassoIA e continue testando vozes, músicas, transcrições e imagens até que a demo soe como você quer que o seu produto soe.

Compartilhe este artigo

Escolha seu idioma