Preço do cache do Claude Fable 5.1: o que mudou e quanto custa agora

O Claude Fable 5.1 revisou a estrutura de preços do cache de prompts, reduzindo em 20% as taxas de escrita e de leitura de tokens em cache. Este detalhamento mostra o que mudou em relação às versões anteriores, como as novas taxas afetam diferentes tipos de carga de trabalho e como calcular a economia real em chamadas de API de alto volume.

Preço do cache do Claude Fable 5.1: o que mudou e quanto custa agora
Cristian Da Conceicao
Fundador do Picasso IA

Se você usa o Claude em produção, a revisão de preços do cache no Fable 5.1 é o item que mais visivelmente muda sua conta mensal de API. A Anthropic reestruturou a forma como os tokens de escrita e de leitura do cache são cobrados nesta versão e, dependendo do formato da sua carga de trabalho, a mudança altera bastante a conta. Este artigo detalha o que exatamente mudou nos preços dos tokens, como as novas taxas se comparam às anteriores e quais cenários se beneficiam mais da estrutura atualizada.

Os números que realmente mudaram

O Claude Fable 5.1 introduziu dois ajustes de preço distintos na sua camada de cache de prompts: uma revisão nas taxas de token de escrita no cache e uma mudança separada nas taxas de token de leitura do cache. Eles são cobrados de forma independente, então entender cada um é importante antes de você poder modelar seu custo real.

Tokens de escrita no cache no Fable 5.1

Tokens de escrita no cache são cobrados quando o Claude armazena um prefixo de prompt no cache pela primeira vez. No Fable 5.1, o multiplicador de escrita caiu de 2,5x o preço base do token de entrada para 2,0x. Isso representa uma redução de 20% em cada chamada de preenchimento inicial do cache.

Mãos de desenvolvedor digitando em um teclado mecânico com código de API brilhando na tela

Números concretos com o preço base de entrada do Fable 5.1, de US$ 3,00 por milhão de tokens:

Tipo de tokenTaxa anteriorTaxa do Fable 5.1Variação
Entrada baseUS$ 3,00/MUS$ 3,00/MSem alteração
Escrita no cacheUS$ 7,50/MUS$ 6,00/M-20%
Leitura do cacheUS$ 0,30/MUS$ 0,24/M-20%
SaídaUS$ 15,00/MUS$ 15,00/MSem alteração

As duas camadas de cache se moveram proporcionalmente, mantendo a proporção interna entre os custos de escrita e de leitura estável em cerca de 25:1. O ponto importante: o preço dos tokens de saída não mudou. Se sua carga de trabalho é intensiva em saída, a atualização do cache sozinha não vai mudar muito sua conta.

Tokens de leitura do cache: a economia real

Tokens de leitura do cache são onde os usuários de alto volume obtêm mais valor, porque as leituras acontecem em cada chamada subsequente após a escrita inicial. A US$ 0,24 por milhão de tokens (abaixo de US$ 0,30), uma carga de trabalho com 10.000 chamadas de API por dia contra um prompt de sistema de 20.000 tokens gera economias significativas.

💡 Conta rápida: 10.000 chamadas x 20.000 tokens de leitura do cache = 200M tokens de leitura do cache por dia. Na taxa antiga, isso dá US$ 60 por dia. Na taxa do Fable 5.1, dá US$ 48 por dia, economizando US$ 12 por dia ou cerca de US$ 360 por mês para um único prompt de sistema.

O fato de a taxa de leitura ser 12,5x mais barata que a de escrita em valores absolutos não mudou em relação às versões anteriores. A Anthropic manteve essa proporção de propósito: gravar no cache é caro em termos computacionais (o modelo precisa processar e armazenar o prefixo), enquanto ler do cache é barato (o cache KV é carregado, não recalculado). As novas taxas simplesmente reduzem os dois valores pelo mesmo fator.

Preços antigos comparados com os novos

Abaixo está uma comparação lado a lado entre os preços do Fable 5.0 e do Fable 5.1 para todos os tipos de token relacionados ao cache.

Quadro branco de escritório coberto de diagramas de preços desenhados à mão e tabelas de cálculo de custos

MétricaFable 5.0Fable 5.1Diferença
Entrada base (por 1M de tokens)US$ 3,00US$ 3,000%
Escrita em cache (por 1M de tokens)US$ 7,50US$ 6,00-20%
Leitura em cache (por 1M de tokens)US$ 0,30US$ 0,24-20%
TTL do cache5 minutos5 minutosSem alteração
Prefixo mínimo cacheável1.024 tokens1.024 tokensSem alteração
Máximo de checkpoints de cache44Sem alteração

💡 Importante: O TTL de 5 minutos do cache, o tamanho mínimo do prefixo e o número máximo de checkpoints continuam inalterados. As únicas variáveis que mudaram são os custos por token.

Isso importa porque vários desenvolvedores presumiram que o TTL seria estendido nesta versão, com base em especulações iniciais da comunidade. Não foi. Se sua arquitetura depende de sessões de cache de longa duração entre interações do usuário, você ainda precisa considerar a expiração de 5 minutos e planejar seu padrão de chamadas para renovar o cache antes que ele esfrie.

Por que o preço mudou

Janelas de contexto maiores, outra economia

O Claude Fable 5.1 vem com uma janela de contexto suportada significativamente maior que a de seu antecessor, entrando em faixas nas quais o cache deixa de ser um extra e passa a ser, na prática, uma necessidade para uma operação com custo eficiente. Com contextos de 100.000+ tokens, chamadas sem cache se tornam proibitivamente caras para qualquer aplicação em grande volume.

Vista aérea de um escritório de tecnologia moderno de planta aberta na hora dourada, com estações de trabalho de desenvolvedores

O sinal de preço da Anthropic é claro: ela quer que as equipes incorporem o cache à arquitetura desde o início, em vez de tratá-lo como algo secundário. Reduzir o custo de escrita elimina a fricção de pagar um sobrepreço só para preencher o cache, tornando a economia mais linear para cargas de trabalho que precisam fazer cache com frequência em muitos prompts de sistema ou segmentos de documento diferentes.

O resultado prático: se você vinha evitando o cache porque o prêmio de escrita parecia alto em relação à sua taxa de acerto no cache, os números do Fable 5.1 deslocam esse ponto de equilíbrio consideravelmente para baixo. Cargas de trabalho com taxa de acerto no cache de apenas 40% já saem na frente das chamadas sem cache em contextos longos.

Mudanças de infraestrutura nos bastidores

A redução do custo de escrita também reflete melhorias reais de infraestrutura. O mecanismo de atenção do Fable 5.1 foi revisado para tornar a materialização do prefixo mais eficiente nos clusters de serviço da Anthropic. Isso não é linguagem de marketing: a documentação técnica da Anthropic sobre o lançamento do modelo credita explicitamente melhorias no pipeline de armazenamento do cache KV como o que permite o multiplicador de escrita mais baixo.

💡 O que isso significa para você: Uma taxa de escrita mais barata que vem da eficiência de infraestrutura é mais durável do que um corte promocional de preço. A Anthropic tem margem para repassar a economia sem corroer sua margem, o que torna isso uma base de preço estável, e não um desconto temporário.

A série Fable usa uma arquitetura de atenção esparsa revisada em comparação com as gerações anteriores do Claude, o que torna o cache de prefixos mais rápido para preencher e mais eficiente em memória para manter na camada de serviço. Isso explica em parte por que o TTL não precisou mudar: o cache simplesmente fica mais barato de manter no nível da infraestrutura.

Quem economiza mais

Nem toda carga de trabalho se beneficia igualmente dessa mudança. O formato do seu tráfego determina o quanto o novo preço altera sua conta.

Cargas de trabalho com muito contexto

Se sua aplicação envia regularmente prompts de sistema ou contextos de documentos acima de 10.000 tokens, você está na faixa de maior benefício. A redução do custo de escrita no cache diminui diretamente o custo por chamada em cada nova sessão que precisa preencher o cache, enquanto a redução na leitura se acumula em cada chamada de acompanhamento dessa sessão.

Desenvolvedor revisando a documentação de preços de API em um laptop tarde da noite

Tipos de carga de trabalho que mais ganham:

  • Ferramentas jurídicas e de conformidade com grandes contextos de documentos regulatórios carregados por sessão
  • Assistentes de código que injetam grandes bases de código ou arquivos de projeto como contexto
  • Agentes de suporte ao cliente com extensas bases de conhecimento de produtos no prompt de sistema
  • Assistentes de pesquisa com múltiplas interações que mantêm longos históricos de conversa com anexos de documentos
  • Pipelines próximos de RAG que carregam previamente documentos fragmentados na janela de contexto

Em todos esses casos, o padrão é o mesmo: um grande prefixo estático compartilhado por muitas chamadas. A escrita acontece uma vez por janela de TTL, e as leituras se acumulam. O Fable 5.1 reduz os dois custos, mas a redução na leitura é onde você vê o efeito composto ao longo do tempo.

Prompts de sistema repetidos

Se você compartilha um único prompt de sistema entre muitos usuários ou sessões, é na redução da taxa de leitura que sua economia se acumula. Uma redução de 20% nas leituras do cache parece modesta, mas com 500M de tokens de leitura do cache por mês, são US$ 15.000 de economia anual com uma única mudança de taxa.

Leituras mensais do cacheCusto mensal antigoNovo custo mensalEconomia anual
100M tokensUS$ 30,00US$ 24,00US$ 72
500M tokensUS$ 150,00US$ 120,00US$ 360
1B tokensUS$ 300,00US$ 240,00US$ 720
5B tokensUS$ 1.500US$ 1.200US$ 3.600
10B tokensUS$ 3.000US$ 2.400US$ 7.200

A tabela acima usa apenas tokens de leitura do cache. Sua conta real também inclui a entrada base (tokens não armazenados em cache no prompt), a saída e os custos de escrita no cache, que entram no total completo.

A conta em uma carga de trabalho real

Um exemplo concreto

Considere um produto SaaS que roda um prompt de sistema de 30.000 tokens para todos os usuários, faz 50.000 chamadas de API por dia e gera em média 500 tokens de saída por chamada.

Dois desenvolvedores em uma sala de reuniões com paredes de vidro revisando dados de preços juntos em um notebook

Divisão diária de tokens:

  • Escritas em cache: aproximadamente 5.000 chamadas x 30.000 tokens = 150M tokens de escrita em cache (considerando novas sessões em uma janela de TTL de 5 minutos com algumas falhas de cache)
  • Leituras em cache: aproximadamente 45.000 chamadas x 30.000 tokens = 1,35B tokens de leitura em cache
  • Saída: 50.000 x 500 = 25M tokens de saída
  • Tokens de entrada sem cache: insignificantes (a maioria das chamadas acerta o cache)

Comparação diária de custos:

ItemFable 5.0Fable 5.1
Escritas em cache (150M tokens)US$ 1.125US$ 900
Leituras em cache (1,35B tokens)US$ 405US$ 324
Saída (25M tokens)US$ 375US$ 375
Total diárioUS$ 1.905US$ 1.599
Mensal (30 dias)US$ 57.150US$ 47.970

Isso representa uma redução de US$ 9.180 por mês no mesmo volume de tráfego, vinda exclusivamente das mudanças de preço do cache do Fable 5.1, sem nenhuma modificação de arquitetura.

Onde fica o ponto de equilíbrio

Para que a redução do custo de escrita importe mais que a redução do custo de leitura, você precisa de uma taxa de acerto no cache abaixo de cerca de 30%. Na maioria dos sistemas em produção, as taxas de acerto no cache ficam entre 70% e 95% em prompts de sistema compartilhados, o que significa que a redução da taxa de leitura quase sempre domina a economia total.

💡 Dica de otimização: Se sua taxa de acerto no cache estiver abaixo de 50%, verifique se o prompt de sistema está variando entre as chamadas, se os usuários estão enviando preâmbulos longos antes da seção em cache ou se seu código está rotacionando sessões mais rápido que o TTL de 5 minutos. Esses três padrões causam falhas de cache desnecessárias e inflacionam desproporcionalmente seus custos de escrita.

Um erro comum é invalidar o cache sem querer ao colocar conteúdo dinâmico (carimbos de data e hora, IDs de usuário, tokens de sessão) antes do prompt de sistema estático. O prefixo em cache precisa coincidir exatamente desde o início do prompt. Mova qualquer conteúdo dinâmico para depois da seção estática, ou para o turno do usuário, para evitar que isso aconteça.

Usando o Claude Fable 5.1 no PicassoIA

Como acessar

O Claude Fable 5 está disponível diretamente na plataforma do PicassoIA, dando acesso ao modelo mais recente da Anthropic sem precisar gerenciar chaves de API, integrações de cobrança ou infraestrutura. Você executa prompts pela interface web e paga por geração, sem precisar de uma conta separada na Anthropic.

Corredor de sala de servidores corporativa com fileiras de racks pretos e luzes indicadoras LED

Isso é especialmente útil para:

  • Equipes que avaliam se as capacidades do Fable 5.1 justificam uma integração completa de API antes de comprometer o orçamento
  • Desenvolvedores que querem prototipar prompts e medir a qualidade da saída sem gastar créditos de API em iterações
  • Pessoas que precisam de geração de texto de alta qualidade de forma ocasional, sem assinar um plano de API separado

A plataforma também permite alternar entre modelos durante a sessão, então você pode comparar a saída do Fable 5.1 diretamente com o Claude Sonnet 5 ou o Claude Opus 4.7 para o mesmo prompt, sem nenhuma configuração adicional.

Outros modelos da Anthropic para testar

O PicassoIA hospeda a linha completa de modelos da Anthropic, em diferentes casos de uso e faixas de custo:

ModeloIdeal paraLink do PicassoIA
Claude Fable 5Raciocínio complexo, documentos longosVer modelo
Claude Sonnet 5Programação, análise, tarefas estruturadasVer modelo
Claude Opus 4.7Raciocínio exigente, pesquisaVer modelo
Claude 4.5 SonnetEquilíbrio entre custo e capacidadeVer modelo
Claude 4.5 HaikuTarefas rápidas e de baixo custoVer modelo
Claude Opus 4.6Escrita e raciocínio aprofundadosVer modelo

Fachada de prédio de empresa de tecnologia moderna fotografada de baixo ângulo ao amanhecer com luz quente do nascer do sol

Se o orçamento é a principal restrição e você precisa de respostas rápidas e leves, vale testar o Claude 4.5 Haiku. Ele opera a uma fração do custo do Fable 5.1 com a mesma arquitetura de cache: o TTL de 5 minutos, o prefixo mínimo de 1.024 tokens e o limite de quatro checkpoints se aplicam, só que com uma taxa base por token bem menor.

Para cargas de trabalho que exigem rastros de raciocínio estendido, o Claude Opus 4.7 é a opção para comparar com o Fable 5.1. Os dois modelos oferecem cache de prompts, mas a qualidade de saída em tarefas analíticas de múltiplas etapas é diferente o bastante para valer a avaliação lado a lado antes de definir sua arquitetura em torno de um modelo.

Além dos modelos da Anthropic, o PicassoIA também oferece o DeepSeek R1 para tarefas de raciocínio em cadeia de pensamento transparente e o Grok 4 para aplicações que dependem de dados em tempo real. Ambos são acessíveis sem contas separadas em provedores, o que torna o PicassoIA um ponto de acesso único e prático quando seu projeto exige testes em vários provedores de LLM antes de tomar uma decisão definitiva.

Caderno de engenheiro com cálculos manuscritos de custos de API ao lado de um teclado de notebook e um smartphone

Comece a construir sem a conta da API

A revisão de preços do cache do Fable 5.1 é uma vitória clara para equipes que usam o Claude em escala: 20% a menos nas taxas de escrita e de leitura de tokens em cache, com todos os outros parâmetros do sistema de cache inalterados. Se você já tem o cache de prompts integrado, seus custos caem automaticamente no tráfego do Fable 5.1, sem nenhuma mudança de código.

Desenvolvedora sentada de pernas cruzadas em um sofá de escritório com notebook, com luz natural da janela iluminando seu perfil

Para as equipes que ainda não integraram o cache, este é um bom momento para começar. A redução do custo de escrita torna mais barato o preenchimento inicial do cache, e a economia com leituras se acumula logo que sua taxa de acerto se estabiliza. Em qualquer janela de contexto acima de 10.000 tokens, chamadas sem cache quase sempre saem mais caras do que as com cache dentro de uma mesma sessão.

A forma mais fácil de ver o que o modelo realmente faz, antes de comprometer sua infraestrutura, é testá-lo diretamente no PicassoIA. Você pode executar prompts reais com o Claude Fable 5 hoje, testar diferentes estruturas de prompt, medir a qualidade da resposta para o seu caso de uso específico e comparar com os outros modelos da Anthropic disponíveis na plataforma. Sem configuração de chave de API, sem configuração de cobrança: só o modelo e os seus prompts.

Se você quer testar um conjunto mais amplo de LLMs em uma única sessão, o catálogo completo de modelos do PicassoIA dá acesso a mais de 90 modelos de geração de texto, imagem, vídeo e áudio a partir de uma única conta. É uma forma prática de comparar o Fable 5.1 com alternativas antes de definir uma decisão de arquitetura.

Compartilhe este artigo

Escolha seu idioma