Custo da API do GPT-6: preços, acesso e opções gratuitas

O GPT-6 Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, enquanto Sol e Luna custam bem menos. Veja todos os sobrepreços, uma conta mensal para 100.000 requisições, quem tem acesso à API e quais opções gratuitas realmente funcionam.

Custo da API do GPT-6: preços, acesso e opções gratuitas
Cristian Da Conceicao
Fundador do Picasso IA

Dez dólares na entrada, cinquenta na saída. É isso que um milhão de tokens do GPT-6 Astra custa pela API, o dobro da tarifa de tabela do modelo topo de linha que veio antes. Se você esperava uma atualização barata, esse número assusta. O detalhe é que o GPT-6 não tem um preço só. É uma família de três níveis, e o menor modelo custa cerca de um por cento do maior.

Este artigo reúne todos os números em um só lugar: as tarifas por token do Astra, do Sol e do Luna, os sobrepreços que inflam a fatura discretamente, quanto custam 100.000 requisições reais, quem pode de fato chamar a API e quais opções gratuitas se sustentam. Os preços vêm de rastreadores públicos de preços no início de outubro, então trate-os como um retrato do momento e confirme na própria página de preços da OpenAI antes de comprometer um orçamento.

Quanto custa o GPT-6 por token

O Astra foi apresentado como uma prévia limitada em 3 de setembro e foi aberto ao público no dia seguinte. O Sol e o Luna chegaram em 22 de setembro. Os três compartilham uma janela de contexto de aproximadamente um milhão de tokens, com até 128K tokens de saída, embora os rastreadores divirjam no número exato (1,05M contra 1,1M).

Astra, o preço do topo de linha

O Astra foi feito para tarefas longas e agênticas: uso de computador, automação de navegador, grandes tarefas de programação. Você paga por essa ambição.

Linha de cobrançaPreço por 1M de tokens
EntradaUS$ 10,00
Entrada em cacheUS$ 1,00
SaídaUS$ 50,00
Entrada acima de 272K tokensUS$ 20,00
Saída acima de 272K tokensUS$ 75,00
Batch ou Flex (entrada / saída)US$ 5,00 / US$ 25,00

A saída é a metade cara. Cada token que o modelo escreve custa cinco vezes o que custa um token que ele lê, e modelos com muito raciocínio escrevem bastante, incluindo tokens de pensamento que você nunca vê na resposta final. Um primeiro teste de terceiros colocou o Astra em cerca de US$ 167 por tarefa concluída em benchmarks agregados, o que mostra a rapidez com que as execuções agênticas se acumulam.

Mãos de uma mulher apertando botões de uma calculadora ao lado de uma pilha de faturas impressas em leque sobre uma mesa de carvalho

Sol e Luna para orçamentos menores

Aqui está a família inteira lado a lado.

ModeloEntradaEntrada em cacheSaídaPara que serve
GPT-6 AstraUS$ 10,00US$ 1,00US$ 50,00Agentes, programação difícil, pesquisas longas
GPT-6 SolUS$ 2,00US$ 0,10US$ 10,00Programação do dia a dia, escrita, respostas de suporte
GPT-6 LunaUS$ 0,10US$ 0,01US$ 0,50Roteamento, marcação, respostas curtas em volume

O Sol custa um quinto do Astra em cada linha. O Luna custa um centésimo. Pense em três xícaras de café: a mesma bebida, contas bem diferentes.

Tarifas por token são abstratas, então aqui vai uma tradução aproximada. Um token equivale a cerca de três quartos de uma palavra em inglês. Um único dólar de saída do Astra compra cerca de 15.000 palavras, perto de um relatório de 30 páginas. O mesmo dólar compra cerca de 75.000 palavras no Sol e aproximadamente 1,5 milhão de palavras no Luna. Ler é mais barato que escrever em todos os níveis, e é por isso que resumir um documento longo custa muito menos do que redigi-lo.

Três xícaras de cerâmica de café em tamanhos pequeno, médio e extra grande sobre o balcão de uma cafeteria

A geração anterior não é automaticamente mais barata. Segundo um rastreador de preços, o GPT 5.6 Sol está em US$ 4 de entrada e US$ 20 de saída durante uma janela promocional que vai até 21 de novembro, o que torna o GPT-6 Sol a linha mais barata sob o mesmo nome de nível. O GPT 5.6 Terra aparece em US$ 2 e US$ 12, e o GPT 5.6 Luna em US$ 0,20 e US$ 1,20, o dobro da tarifa do GPT-6 Luna.

💡 Leitura rápida: se a sua carga de trabalho não precisa de agentes nem de raciocínio profundo, o nível Sol é o novo padrão para começar a precificar. O Astra é a exceção, não a referência.

Então, quando o Astra vale cinco vezes o preço do Sol? Quando uma execução fracassada custa mais do que a diferença de preço: um agente que consome uma hora de trabalho de engenheiro, ou um rascunho jurídico que, de outra forma, precisaria de três rodadas de revisão. O ponto de equilíbrio é simples. Se o Sol precisar de mais de cinco tentativas para igualar um bom resultado do Astra, o Astra vence só pelo preço. Se o Sol chegar lá em duas ou três, você está pagando demais.

Sobrepreços que inflam a conta

Prompts longos dobram a tarifa

Ao ultrapassar 272K tokens de entrada, a requisição inteira é recalculada, não apenas os tokens extras. A entrada sobe de US$ 10 para US$ 20 por milhão, e a saída, de US$ 50 para US$ 75.

Imagine um pacote de contratos de 300K tokens com um resumo de 2K tokens como resposta:

  • Na tarifa de contexto longo: US$ 6,00 de entrada mais US$ 0,15 de saída, então US$ 6,15.
  • Reduzido para 270K tokens na tarifa padrão: US$ 2,70 mais US$ 0,10, então US$ 2,80.

Trinta mil tokens a mais fizeram o preço da mesma requisição mais que dobrar.

Homem segurando uma pilha enormemente grossa de páginas impressas em um corredor silencioso de biblioteca

💡 Dica: mantenha um contador de tokens no seu pipeline e divida documentos grandes logo abaixo do limite, em vez de enviar um único prompt gigante.

Modo rápido e acréscimo regional

Dois outros multiplicadores estão escondidos nas letras miúdas:

  • O modo rápido custa cerca do dobro da tarifa padrão (US$ 20 de entrada e US$ 100 de saída no Astra) em troca de aproximadamente 2,5 vezes a velocidade. Ele não está disponível com residência de dados na UE.
  • Endpoints de residência de dados acrescentam 10% sobre qualquer nível que você escolher.

Some tudo isso e uma chamada aparentemente inofensiva ao Astra pode custar mais que o dobro do preço de tabela. Decida de propósito, não por padrão.

O modo rápido se justifica quando uma pessoa está esperando a resposta, como um assistente de programação interativo ou um chat de suporte ao vivo. Ele é desperdiçado em tarefas noturnas, em que ninguém olha o relógio. Essas devem ir para a fila de lote, com metade do preço.

Custos mensais reais em dólares

Um chamado de suporte, precificado

Considere um bot de suporte em que cada chamado usa 2.000 tokens de entrada e 500 de saída. No Astra, isso dá US$ 0,02 pelo prompt mais US$ 0,025 pela resposta, ou seja, US$ 0,045 por chamado. Número pequeno, até você multiplicá-lo.

Fundador barbudo de jaqueta jeans revisando um extrato mensal impresso junto à janela de um café

A mesma carga de trabalho em três níveis

Aqui está exatamente esse chamado em 100.000 chamados por mês:

ModeloPor chamado100.000 chamadosCom desconto de lote
GPT-6 AstraUS$ 0,045US$ 4.500US$ 2.250
GPT-6 SolUS$ 0,009US$ 900US$ 450
GPT-6 LunaUS$ 0,00045US$ 45US$ 22,50

O cache é outra alavanca. Se 1.500 dos 2.000 tokens de entrada forem sempre o mesmo prompt de sistema e os mesmos exemplos, o Astra cai para US$ 0,0315 por chamado, ou US$ 3.150 por mês. Isso economiza US$ 1.350 sem mexer na qualidade.

💡 Regra prática: no Astra, uma resposta de 500 tokens (US$ 0,025) custa mais que um prompt de 2.000 tokens (US$ 0,02). O tamanho da saída define a fatura.

Chamados de suporte são apenas um tipo de carga de trabalho. Aqui estão três outros, precificados nas tarifas padrão sem descontos, para que você encontre o mais próximo do seu projeto:

Carga de trabalhoTokens por requisiçãoRequisições por mêsLunaSolAstra
App de chat para desenvolvedor solo1.000 de entrada, 400 de saída5.000US$ 1,50US$ 30US$ 150
Rascunhos de equipe de conteúdo3.000 de entrada, 2.500 de saída300US$ 0,47US$ 9,30US$ 46,50
Execuções de agente de programação200.000 de entrada, 30.000 de saída440US$ 15,40US$ 308US$ 1.540

A tabela precifica tokens, não qualidade. Um agente com Luna não vai igualar um agente com Astra, então leia a última linha como um teto e um piso, não como recomendação. Repare como o agente de programação ofusca todo o resto: apenas 440 execuções, mas US$ 1.540 no Astra. Colocar em cache 150K de cada prompt de 200K reduz isso para cerca de US$ 946.

Quem pode chamar a API

Onde a API começa

O Astra não está disponível no plano gratuito da API. Você precisa de pelo menos uma conta de desenvolvedor Tier 1, ou seja, uma conta paga com cobrança configurada. A OpenAI não tinha publicado limites de taxa detalhados nem garantias de vazão para o Astra no lançamento, então confira a página de limites no seu painel assim que o acesso for concedido.

Mão deslizando um cartão de acesso branco sobre uma mesa de recepção de madeira para outra mão

Os planos do ChatGPT são separados

Uma assinatura do ChatGPT não dá créditos de API. As duas coisas são cobradas separadamente, e a escolha certa depende de como você trabalha. Se você usa sobretudo para conversar, um plano Plus de US$ 20 costuma ser mais simples do que pagar por token. Se você está criando um produto, precisa da API seja qual for o plano que tenha, porque os clientes não podem usar a sua assinatura pessoal. Dentro do aplicativo, o acesso ao Astra é assim:

PlanoPreço mensalAcesso ao Astra
FreeUS$ 0Não
GoUS$ 8Não
PlusUS$ 20Sim
ProA partir de US$ 100Sim, com limites ampliados
EnterprisePor assentoSim, desligado por padrão

O Luna ainda não tinha chegado aos usuários gratuitos do ChatGPT quando isto foi escrito, então nem o nível mais barato é um almoço grátis dentro do aplicativo.

Antes da sua primeira chamada à API, percorra esta lista curta:

  1. Adicione um método de pagamento e um pequeno saldo pré-pago.
  2. Defina um limite mensal de gastos no painel antes de escrever qualquer código.
  3. Crie uma credencial de API restrita a um projeto e guarde-a em uma variável de ambiente, nunca no repositório.
  4. Desenvolva com o Luna e troque o nome do modelo depois que o pipeline funcionar.
  5. Registre as contagens de tokens de entrada, de cache e de saída em cada requisição para que a conta nunca seja uma surpresa.

Opções gratuitas que realmente funcionam

Por que o Astra não tem nível gratuito

Nenhuma cota de teste foi publicada para o Astra, e, com US$ 50 por milhão de tokens de saída, isso não surpreende. Uma única execução agêntica longa consumiria qualquer crédito gratuito realista em minutos.

Estudante universitária estudando com um notebook e um caderno em uma longa mesa de biblioteca

Onde o uso gratuito ainda existe

Você ainda tem caminhos reais para testar ideias sem uma conta alta:

  • Luna como porta de entrada barata. Cinco dólares de crédito compram cerca de 50 milhões de tokens de entrada ou 10 milhões de tokens de saída. Isso são milhares de conversas curtas.
  • Modelos de pesos abertos. O GPT OSS 120B e o GPT OSS 20B são os lançamentos de pesos abertos da OpenAI. Se você tem o hardware, executá-los por conta própria não gera nenhuma taxa por token.
  • Modelos rivais no navegador. Teste o Claude Sonnet 5, o Gemini 3.5 Flash ou o GPT 5.4 com os seus prompts reais antes de decidir onde gastar.

Um fluxo gratuito e prático funciona assim. Faça o protótipo do prompt em um navegador até as respostas ficarem boas, trave-o e depois conte os tokens de uma requisição típica. Calcule o custo com uma única fórmula: (tokens de entrada x tarifa de entrada + tokens de saída x tarifa de saída) / 1.000.000. Faça isso para Luna, Sol e Astra, e você saberá a sua faixa mensal real antes de fazer qualquer chamada paga.

Teste o GPT 5.6 Sol no PicassoIA

Uma observação honesta: o próprio GPT-6 ainda não está na lista de modelos do PicassoIA. Os parentes mais próximos são da família GPT 5.6: GPT 5.6 Sol, GPT 5.6 Terra e GPT 5.6 Luna. O Sol pode ser testado online gratuitamente, sem configuração, o que o torna um ensaio barato antes de você comprometer o orçamento da API.

Passo a passo no PicassoIA

  1. Abra a página do GPT 5.6 Sol.
  2. Cole uma tarefa real do seu produto em Prompt, não um "oi".
  3. Adicione um System Prompt para definir o papel e o tom.
  4. Escolha um Reasoning effort entre none e xhigh. Comece em none e aumente só quando as respostas parecerem superficiais.
  5. Defina Verbosity como low, medium ou high.
  6. Aumente Max Completion Tokens se escolher um nível alto de raciocínio, senão o pensamento pode usar todo o orçamento e deixar a resposta vazia.
  7. Envie uma captura de tela ou diagrama em Image Input se a tarefa precisar.
  8. Execute e repita o mesmo prompt no GPT 5.6 Luna para comparar qualidade e preço.

Visão por cima do ombro de um jovem criador navegando em um notebook em um espaço de coworking iluminado

Configurações que mudam seu custo

Os tokens de raciocínio são cobrados como tokens de saída nos modelos de raciocínio, então os controles dessa página se refletem diretamente na fatura:

ConfiguraçãoO que fazEfeito no custo
Reasoning effort: none ou lowRespostas rápidas, pouco pensamentoMais baixo
Reasoning effort: high ou xhighRespostas mais profundas e lentasMais tokens de saída
Verbosity: lowRespostas curtas e diretasMenos tokens de saída
Max Completion TokensLimite rígido do tamanho da respostaTeto por requisição

Formas de reduzir a conta

Mão deixando cair uma moeda de ouro em um pote de vidro meio cheio de moedas sobre uma mesa de cozinha

Roteie pela dificuldade

Envie o trabalho fácil para o Luna, o intermediário para o Sol e só os 5% mais difíceis para o Astra. Com uma divisão hipotética de 80% Luna, 15% Sol e 5% Astra, a carga de 100.000 chamados custa cerca de US$ 396 em vez de US$ 4.500.

Cache e lote

A entrada em cache é 90% mais barata no Astra e no Luna, e 95% mais barata no Sol. O processamento em lote e Flex reduz pela metade a tarifa padrão para tudo que pode esperar.

Trabalhador de logística escaneando fileiras de pacotes de papelão idênticos em um galpão iluminado

Limite a saída

Defina um limite máximo de tokens e peça formatos curtos, como listas com marcadores ou JSON compacto. Com a saída custando cinco vezes a entrada, cada frase que você dispensa é dinheiro economizado.

Três erros que inflam a conta:

  • Reenviar o chat inteiro a cada turno. Uma conversa de 10 turnos que acrescenta 300 tokens por turno envia 16.500 tokens de entrada no total, não 3.000. Resuma os turnos antigos ou coloque em cache o prefixo compartilhado.
  • Deixar o raciocínio em high para tarefas fáceis. Os tokens de pensamento são cobrados como saída, o lado caro da tabela de tarifas.
  • Testar no topo de linha. Construa e depure com o Luna, depois troque o nome do modelo para a execução final.

💡 Checklist: roteie pela dificuldade, coloque em cache o prefixo repetido, agrupe em lote o que pode esperar, limite o tamanho da resposta e reconfira os preços todo mês, porque níveis e promoções mudam.

Sua vez de criar

Texto é só metade do orçamento de um produto. A maioria dos lançamentos também precisa de imagens: fotos de destaque, miniaturas, maquetes de produto. Experimente criar as suas imagens com o PicassoIA e veja até onde um prompt consegue chegar. O Seedream 4.5 é ótimo para detalhes nítidos em 4K, o P-Image é rápido para rascunhos, e o GPT Image 2 segue prompts longos com precisão.

Escolha uma cena do seu próprio projeto, escreva três prompts com ângulos de câmera diferentes e rode-os lado a lado. Explore o catálogo completo em picassoia.com/en/all-models e comece a experimentar hoje.

Compartilhe este artigo

Escolha seu idioma