Grok 4.7 ou Claude Opus 5.5: benchmarks e preço lado a lado

O Grok 4.7 custa US$ 2 de entrada e US$ 6 de saída por milhão de tokens, enquanto o Claude Opus 5.5 custa US$ 4 e US$ 20. Esta análise põe as notas dos fornecedores lado a lado com testes independentes da Vals AI e transforma os números em cálculos de custo reais para programação, raciocínio e trabalhos com contexto longo.

Grok 4.7 ou Claude Opus 5.5: benchmarks e preço lado a lado
Cristian Da Conceicao
Fundador do Picasso IA

O Grok 4.7 foi lançado em 21 de setembro de 2026. O Claude Opus 5.5 veio um dia depois. Um cobra US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. O outro cobra US$ 4 e US$ 20. Uma página de preços mostra essa diferença em dois segundos, mas não consegue dizer se o gasto extra compra um trabalho melhor nas suas tarefas. Esta análise coloca lado a lado os números dos fornecedores, as execuções independentes da Vals AI e um índice público de inteligência, além das duas tabelas de preço, e depois os transforma em cálculos simples de custo que você pode conferir sozinho.

Um desenvolvedor revisando um longo bloco de código em um monitor largo ao amanhecer

A resposta curta

O Claude Opus 5.5 é o modelo mais forte na maioria dos testes, e o Grok 4.7 é bem mais barato. No confronto direto da Vals AI, o Opus 5.5 ficou à frente em 20 dos 22 benchmarks compartilhados, enquanto o Grok 4.7 liderou em 2. No Intelligence Index independente (versão 4.3.2), o Opus 5.5 marca 58 e ocupa o primeiro lugar entre 225 modelos. O Grok 4.7 marca 46 e fica em 29º, ainda bem acima da mediana de 26 para modelos comparáveis.

EspecificaçãoGrok 4.7Claude Opus 5.5
Data de lançamento21 de setembro de 202622 de setembro de 2026
Preço de entrada (por 1M de tokens)US$ 2,00US$ 4,00
Preço de saída (por 1M de tokens)US$ 6,00US$ 20,00
Janela de contexto500K tokens1M tokens
Saída máximaNão divulgada128K tokens
Intelligence Index4658
Velocidade de saída72,6 tokens por segundo95,3 tokens por segundo
Tipos de entradaTexto (nenhuma entrada de imagem relatada)Texto e imagens

O acesso também é diferente. O Grok 4.7 está disponível pela API do Grok, pelo Cursor e por um plano gratuito no Grok Build, mas não há uma camada gratuita de API. O Opus 5.5 roda na API do Claude, no Amazon Bedrock, no Google Cloud e no Microsoft Foundry, com data de corte de conhecimento em junho de 2026. Seu pensamento é adaptativo e sempre ativo, com cinco níveis de esforço: low, medium, high, xhigh e max.

💡 Regra prática: o Grok 4.7 alcança cerca de 82% da nota do Opus 5.5 no Vals Index (54,95 contra 66,97) por algo entre um terço e menos da metade da conta. Se uma resposta errada custa uma hora de retrabalho, o custo extra do Opus geralmente se paga. Se você está resumindo, redigindo ou marcando conteúdo em volume, o Grok é o gasto mais inteligente.

Preço por milhão de tokens

Taxas de entrada e saída

Os dois modelos cobram por token, e as tabelas parecem semelhantes até você ler a linha de saída.

Tipo de preço (por 1M de tokens)Grok 4.7Claude Opus 5.5
EntradaUS$ 2,00US$ 4,00
Leitura de entrada em cacheUS$ 0,50US$ 0,20
SaídaUS$ 6,00US$ 20,00
Entrada / saída em loteNão listadoUS$ 2 / US$ 10
Prompts acima de 200K tokensUS$ 4 de entrada, US$ 1 em cache, US$ 12 de saídaNenhuma faixa de prompt longo listada

A diferença está na saída. A entrada custa 2x mais no Opus 5.5, mas a saída custa 3,3x mais. As leituras em cache vão no sentido oposto: o Opus 5.5 cobra US$ 0,20 contra US$ 0,50 do Grok, o que o torna a escolha mais barata para agentes que releem o mesmo contexto longo o tempo todo.

Uma composição vista de cima com calculadora, nota fiscal impressa, caneta-tinteiro e moedas sobre uma mesa de carvalho branca

Cache e prompts longos

Os preços de destaque do Grok 4.7, US$ 2 e US$ 6, só valem enquanto o prompt ficar em até 200.000 tokens. Acima disso, cada taxa dobra para US$ 4 de entrada, US$ 1 em cache e US$ 12 de saída. Como a janela de contexto é de 500K, a faixa barata cobre apenas os primeiros 40% dela.

O Opus 5.5 custa 20% menos que o Opus 5, com escritas em cache a US$ 5 por cinco minutos ou US$ 8 por uma hora. Existe uma prévia de modo rápido na API do Claude a US$ 8 de entrada e US$ 40 de saída. Uma armadilha: mudar o nível de esforço no meio de uma sessão invalida o cache de prompt, e as leituras baratas em cache viram entrada com preço cheio sem aviso. Escolha um nível de esforço e mantenha.

Quanto custa uma carga de trabalho real

Preços de tabela em três cargas diárias, sem descontos de cache ou de lote aplicados:

Carga de trabalho diáriaGrok 4.7Claude Opus 5.5Sobrecusto do Opus
Resumos de suporte: 10M de entrada, 1M de saídaUS$ 26US$ 602,3x
Agente de programação: 5M de entrada, 5M de saídaUS$ 40US$ 1203,0x
Redação de relatórios: 1M de entrada, 3M de saídaUS$ 20US$ 643,2x

Quanto mais sua carga de trabalho depender da saída, maior fica a diferença. A Vals AI mediu execuções reais em vez de fórmulas. Rodar o Vals Index custou US$ 32,14 no Opus 5.5 e US$ 12,12 no Grok 4.7, cerca de 2,7x. O teste Finance Agent custou US$ 9,22 contra US$ 2,72. O ProofBench ficou quase empatado, com US$ 0,96 contra US$ 0,79.

Um longo corredor de racks de servidores pretos em um data center iluminado

A verbosidade também não salva a conta do Grok. A execução independente do Intelligence Index registrou 240M de tokens de saída do Grok 4.7, contra uma mediana de 81M para modelos comparáveis. O Opus 5.5 produziu 260M. Os dois falam bastante, então a diferença de preço por token passa quase integralmente para a sua fatura.

Benchmarks lado a lado

Leia cada número abaixo junto com a sua fonte. Algumas notas são divulgadas pelo fornecedor, outras vêm de execuções independentes, e o mesmo modelo pode aparecer em posições bem diferentes dependendo de quem fez o teste.

Programação e trabalho no terminal

Programação é onde os dois modelos mais se separam.

BenchmarkGrok 4.7Claude Opus 5.5
Terminal-Bench 4.0 (divulgado pelo fornecedor)38,0%66,4%
Terminal-Bench 4.0 (Vals AI)28,79%65,15%
CursorBench 4.046,3%57,8%
Code Migration (Vals AI)44,82%66,65%
IOI (Vals AI)57,72%95,06%
Vibe Code Bench v1.1 (Vals AI)86,17%90,29%
SRE Bench (Vals AI)3,82%33,59%

Calculando a média dos testes de programação da Vals AI, o Opus 5.5 marca 67,13% e o Grok 4.7 marca 43,60%. O resultado mais próximo é o Vibe Code Bench, com 86,17% contra 90,29%. O Grok 4.7 também registra 71,0% no DeepSWE v1.1 com esforço alto, um teste em que não encontrei um número do Opus 5.5. O Opus 5.5 marca 54,4% no FrontierCode v1.1, 1,1 ponto à frente do GPT-6 Astra.

Um engenheiro de software semicerrando os olhos para o código em um notebook, sentado perto da janela de um café

Raciocínio e trabalho com conhecimento

A diferença no raciocínio é igualmente visível. No Vals Index, o Opus 5.5 marca 66,97% contra 54,95% do Grok. O ProofBench v1.1, que a Vals AI classifica como matemática, é o resultado mais desequilibrado da tabela: 100% contra 26%. Os testes de ciência seguem o mesmo padrão, com o Opus 5.5 em média de 58,65% e o Grok 4.7 em média de 34,83%.

As tabelas de lançamento do Opus 5.5 trazem mais alguns resultados: 67,7% no Humanity's Last Exam com ferramentas, um Elo de 1846 no GDPval-AA v2.1 para trabalho com conhecimento, 81,8% no OSWorld 2.0 para uso de computador e 89,0% no Chartography para leitura de gráficos. As notas de lançamento do Grok 4.7 se apoiam em outros testes: 64,0% no EEBench de engenharia elétrica e 56,7% no HealthBench Professional.

Dois pares de mãos segurando gráficos de barras impressos sobre uma mesa de carvalho

Onde o Grok 4.7 vence

As duas vitórias do Grok no comparativo da Vals AI são específicas:

  • Harvey's Legal Agent: 12,50% para o Grok 4.7 contra 3,75% para o Opus 5.5. As duas notas são baixas, então trate isso como uma vantagem em um teste muito difícil.
  • CyberBench v1.1: 69,46% contra 55,36%, uma diferença de 14 pontos.

O Grok também fica à frente na média da categoria jurídica (29,81% contra 27,12%), embora o Opus 5.5 vença no Legal Research Bench por 50,48% a 47,12%. Saúde está quase empatada, com 70,61% para o Opus e 69,47% para o Grok.

Contexto, velocidade e limites de saída

Uma longa mesa de leitura de carvalho em uma grande biblioteca com estantes altíssimas

500K contra 1M de tokens

A listagem independente do Intelligence Index coloca a janela do Grok 4.7 em 500.000 tokens, algo como 750 páginas de texto. A documentação de lançamento do próprio Grok deixa esse número de fora, então confirme com seu provedor antes de construir algo em cima dele. O Opus 5.5 oferece 1 milhão de tokens, cerca de 1.500 páginas, com até 128K tokens de saída por resposta. Tarefas em lote podem chegar a 300K tokens de saída com um cabeçalho beta.

Lembre-se da duplicação de preço do Grok acima de 200K. Uma tarefa que envia 400K tokens de contratos para o Grok cai na faixa mais alta, enquanto nenhuma faixa de prompt longo está listada para o Opus 5.5.

Um cronômetro de latão ao lado de um notebook fechado sobre uma mesa fosca

Velocidade e verbosidade

Na velocidade bruta de saída, o Opus 5.5 transmite 95,3 tokens por segundo e o Grok 4.7 72,6, abaixo da mediana de 78,5 para modelos comparáveis. O tempo até o primeiro token é uma história mais confusa. O mesmo índice mostra o Grok 4.7 com 73,9 segundos no seu ajuste de raciocínio xhigh. O número do Opus 5.5 em esforço max é de 731 segundos, o que parece um valor atípico, então eu não me apoiaria nele.

O tempo de relógio em tarefas inteiras foi para os dois lados nas execuções da Vals AI. O Grok 4.7 concluiu o Vals Index em 35 minutos contra 1 hora e 19 minutos do Opus, e o teste Finance Agent em 15 minutos contra 33. O Opus venceu o ProofBench, com 5 minutos e 51 segundos contra 12 minutos e 47 segundos do Grok. Qual modelo termina primeiro depende da tarefa.

Qual deles serve para o seu trabalho

Três colegas comparando uma tabela impressa em volta de uma mesa de vidro de sala de reunião

Escolha o Grok 4.7 quando

  • Você processa grandes volumes de texto e a conta é a principal restrição.
  • Seus prompts ficam abaixo de 200K tokens, onde valem as taxas de US$ 2 e US$ 6.
  • São tarefas jurídicas de agente ou testes de segurança, onde ele teve suas duas vitórias.
  • Você aceita um teto mais baixo em execuções longas de programação agêntica.

Escolha o Opus 5.5 quando

  • Você roda agentes, tarefas de terminal ou migrações de código em que uma etapa falha custa caro.
  • Você alimenta documentos longos acima de 500K tokens, ou precisa de entrada de imagem.
  • Você depende de cache de prompt, já que as leituras em cache custam US$ 0,20 por milhão.
  • Você quer a melhor nota do Intelligence Index e pode orçar para isso.

Muitas equipes vão acabar usando os dois. Mande o trabalho em massa, como marcação, rascunhos de resumo e extração de rotina, para o Grok 4.7, e depois escale os casos difíceis para o Opus 5.5: execuções longas de agentes, demonstrações e migrações. Um teste falho ou uma nota de baixa confiança pode disparar a passagem. Num cálculo rápido de guardanapo, enviar 75% do trabalho do Vals Index para o Grok e 25% para o Opus custaria cerca de US$ 17 em vez de US$ 32,14.

💡 Confira antes de trocar: o Opus 5.5 rejeita várias configurações que integrações mais antigas do Claude usavam. Desativar o raciocínio retorna um erro 400, o uso forçado de ferramentas (tool_choice definido como any ou uma ferramenta nomeada) retorna erros, e a ferramenta computer_20251124 mais antiga é rejeitada. A Anthropic também redireciona a maioria das solicitações de cibersegurança para o Opus 4.8, então teste o trabalho de segurança diretamente em vez de presumir.

Por que os benchmarks enganam

Veja a nota do Grok 4.7 no Terminal-Bench 4.0. O fornecedor divulga 38,0%. A Vals AI mediu 28,79%. A execução independente do Intelligence Index mediu 26%. Mesmo modelo, mesmo nome de benchmark, uma diferença de 12 pontos, dependendo do harness, do ajuste de esforço e de quem rodou o teste.

O Opus 5.5 também tem suas ressalvas. Seu esforço padrão é medium, mas as notas de destaque vêm dos níveis xhigh ou max, que custam mais e demoram mais. O índice independente também compara o Opus em max com o Grok em xhigh, então os dois estão em configurações diferentes. A própria Anthropic alerta que as margens dos benchmarks se tornaram um preditor menos confiável de diferenças no mundo real nesse nível de capacidade.

Então faça seu próprio teste. Leva uma tarde:

  1. Escolha 20 prompts reais da sua carga de trabalho, não exemplos de brinquedo.
  2. Rode cada um nos dois modelos com o nível de esforço que você usaria em produção.
  3. Registre o custo por tarefa, as tentativas refeitas e o tempo de relógio.
  4. Avalie as saídas às cegas, sem saber qual modelo escreveu qual.
  5. Calcule o custo por resposta aceita, não o custo por token.

Experimente modelos semelhantes no Picasso IA

Nem o Grok 4.7 nem o Claude Opus 5.5 aparecem no catálogo do Picasso IA até a data deste texto. As opções mais próximas estão disponíveis hoje, e você pode usá-las sem credenciais de API nem configuração.

Modelos disponíveis agora

ModeloPonto forteLink
Grok 4Raciocínio passo a passo em perguntas com várias partesGrok 4
Claude Opus 4.7Código, leitura de imagens, conversas longasClaude Opus 4.7
Claude Fable 5Tarefas complexas de programaçãoClaude Fable 5
Claude Sonnet 5Trabalho automatizado de programaçãoClaude Sonnet 5

Outras opções para um teste com três modelos incluem o GPT 5.6 Sol, o Gemini 3.1 Pro e o Kimi K2.6.

Use o Claude Opus 4.7 no Picasso IA

  1. Abra a página do Claude Opus 4.7.
  2. Digite sua pergunta ou cole seu código no campo Prompt. É a única entrada obrigatória.
  3. Adicione um System Prompt se quiser um papel fixo, como "Você é um revisor de código".
  4. Deixe Max Tokens em 8.192 para respostas longas, ou reduza para respostas curtas.
  5. Envie uma captura de tela ou diagrama se sua pergunta depender disso. As imagens são redimensionadas para 0,5 megapixel por padrão para economizar tempo.
  6. Execute e continue refinando em prompts de acompanhamento.

Use o Grok 4 no Picasso IA

  1. Abra a página do Grok 4.
  2. Escreva sua pergunta em Prompt. Problemas com várias etapas são onde o Grok 4 se sai melhor.
  3. Mantenha Temperature no padrão 0,1 para respostas focadas, ou aumente para brainstorming.
  4. Aumente Max Tokens acima do padrão de 2.048 se as respostas forem cortadas.
  5. Ajuste Presence Penalty e Frequency Penalty apenas quando a saída começar a se repetir.

💡 Dica: envie o mesmo prompt aos dois modelos e cole as respostas lado a lado. Dez minutos disso dizem mais do que outra tabela de benchmark.

Crie suas próprias imagens no Picasso IA

Um fotógrafo e designer editando um retrato em um monitor grande em um estúdio iluminado pelo sol

Deixe o modelo escrever seus prompts

Um modelo de linguagem forte também é um bom escritor de prompts. Peça ao Claude Opus 4.7 ou ao Grok 4 para rascunhar seus prompts de imagem e vídeo, depois cole os resultados em um gerador:

Escreva cinco prompts de imagem fotorrealistas para um post de blog que compara dois modelos de IA. Cada prompt precisa de um assunto, um local, a direção da luz, um ângulo de câmera e uma lente. Mantenha cada prompt com menos de 70 palavras.

A estrutura importa: assunto, cenário, luz, câmera, lente. Essa ordem dá aos modelos de imagem os detalhes de que precisam para produzir resultados nítidos e naturais.

Modelos de imagem e vídeo para testar

Para imagens, experimente o Seedream 4.5, o GPT Image 2, o Flux 2 Pro ou o Nano Banana Pro. Para clipes curtos, o Seedance 2.0, o Veo 3.1 e o Kling v3 Video transformam um prompt ou uma imagem estática em movimento.

Agora é a sua vez. Abra o Picasso IA, peça a um modelo de linguagem três prompts e rode-os em um modelo de imagem. Escolha seu resultado favorito, anime-o com um modelo de vídeo e compare como cada modelo interpreta suas instruções. A forma mais rápida de saber qual modelo combina com você é colocar o seu próprio prompt diante deles.

Compartilhe este artigo

Escolha seu idioma