O mundo dos benchmarks de IA tem um número de destaque difícil de ignorar: o Claude Fable 5.1 acaba de alcançar uma taxa geral de conclusão de tarefas de 94,3% no Terminal-Bench 4.0, a avaliação agêntica mais exigente já publicada. Não é um erro de arredondamento nem uma condição de teste escolhida a dedo. Todos os outros modelos de fronteira ainda lutam para ultrapassar 80% na mesma avaliação, e a diferença continua aumentando a cada revisão da Anthropic.

Se você acompanha a corrida dos rankings de modelos de linguagem (LLMs), já sabe que o Terminal-Bench 4.0 é radicalmente diferente das avaliações anteriores. Não se trata de um quiz de múltipla escolha nem de uma pesquisa de preferência humana. O benchmark executa sessões reais de shell, dispara comandos reais dentro de contêineres Docker ativos e pontua os modelos exclusivamente pela capacidade de levar as tarefas ao estado final desejado sem nenhuma ajuda manual. A diferença entre 78% e 94% nessa estrutura não é cosmética. Em um lote de 300 tarefas, essa diferença de 16 pontos se traduz em cerca de 48 intervenções humanas a menos por execução.
O que o Terminal-Bench 4.0 realmente testa
O Terminal-Bench 4.0 responde a uma pergunta central: o modelo consegue fazer o trabalho do início ao fim, em um ambiente UNIX real e sem rede de segurança?

As 4 categorias principais de tarefas
O benchmark divide mais de 300 tarefas em quatro categorias ponderadas:
| Categoria | Tarefas representativas | Peso |
|---|
| Operações de shell | Manipulação de arquivos, pipelines com grep, configuração de cron | 30% |
| Execução de código | Executar, depurar e refatorar Python/Bash/TypeScript | 30% |
| Recuperação de erros | Lidar com saídas inesperadas, tentar de novo após falha, adaptar o plano | 25% |
| Planejamento em várias etapas | Encadear de 8 a 12 comandos até chegar a um estado final definido | 15% |
Cada tarefa começa em um contêiner Docker limpo, com um objetivo específico e um limite de tempo rígido. Sem dicas. Sem perguntas de esclarecimento. O modelo chega ao estado-alvo ou não chega.
Por que a maioria dos modelos tem dificuldades
O motivo de os principais modelos se concentrarem entre 75% e 82% se resume a dois modos de falha recorrentes. Primeiro, modelos fortes em raciocínio, mas imprecisos na sintaxe exata do shell, produzem comandos com aparência plausível que falham em casos extremos. Essa falha se agrava muito em sequências de várias etapas, nas quais um único comando intermediário quebrado invalida tudo o que vem depois. Segundo, modelos capazes de executar comandos individuais costumam entrar em colapso em cenários de recuperação de erros, porque repetem literalmente o mesmo comando que falhou ou abandonam a tarefa por completo quando o caminho fica incerto.

💡 Vale notar: O Terminal-Bench 4.0 concede crédito parcial. Um modelo que se recupera de três falhas e ainda termina a tarefa pontua mais do que um que para logo após o primeiro erro.
Claude Fable 5.1 em resumo
O Claude Fable 5 é o avanço mais deliberado da Anthropic rumo ao trabalho prático e agêntico. A revisão 5.1 refina especificamente duas coisas: a precisão dos comandos de shell e o que as pesquisas da Anthropic descrevem como "rastreamento persistente de intenção", a capacidade de manter o objetivo original estável ao longo de muitas etapas intermediárias, mesmo quando mensagens de erro e saídas inesperadas lotam a janela de contexto.

O que o diferencia
Três decisões de arquitetura explicam a maior parte da vantagem nos benchmarks:
-
Rastreamento persistente de intenção: O modelo mantém uma representação de trabalho do objetivo original ao longo de longas cadeias de etapas intermediárias. A maioria dos modelos concorrentes perde o alvo de vista quando mensagens de erro e saídas de depuração tomam a janela de contexto. O Fable 5.1 não perde.
-
Dados de treinamento centrados em shell: A Anthropic treinou extensivamente com sessões reais de terminal, e não com documentação sobre sessões de terminal. A diferença aparece com mais clareza nos casos extremos: padrões glob em shells diferentes, comportamentos de buffer de pipes e semântica de códigos de saída em diferentes ambientes.
-
Lógica de nova tentativa diagnóstica: Quando um comando falha, o modelo categoriza o tipo de falha antes de escolher a próxima ação. Repetir o mesmo comando é tratado como último recurso, e não como resposta padrão. Esse único comportamento responde pela maior parte da vantagem na categoria de recuperação de erros.
Os números que importam
| Métrica | Claude Fable 5.1 | GPT 5 | Gemini 3 Pro | DeepSeek R1 |
|---|
| Conclusão geral de tarefas | 94,3% | 81,7% | 79,4% | 77,8% |
| Pontuação em operações de shell | 96,1% | 83,2% | 78,9% | 75,3% |
| Taxa de recuperação de erros | 91,8% | 74,1% | 71,2% | 68,4% |
| Planejamento em várias etapas | 93,4% | 80,9% | 76,7% | 74,1% |
| Eficiência de tokens em relação à linha de base | +22% | linha de base | -4% | -11% |
As pontuações do GPT 5, do Gemini 3 Pro e do DeepSeek R1 são resultados genuinamente fortes. Mas a coluna de recuperação de erros é onde está a diferença prática. Uma diferença de 18 pontos em recuperação de erros significa que, em automação de produção real, um modelo roda a noite inteira enquanto o outro envia alertas para você repetidamente.
As operações de shell são onde o Claude Fable 5.1 mais claramente supera os concorrentes, e a margem é altamente reproduzível em várias execuções independentes de benchmark.

Execução real de comandos
O modelo prefere comandos de shell explícitos e legíveis a one-liners engenhosos que são frágeis em casos extremos. Ele redireciona o stderr junto com o stdout quando há qualquer chance de o fluxo de erro conter dados de diagnóstico úteis, e usa flags de simulação (dry-run) antes de operações destrutivas, mesmo sem ser instruído explicitamente a fazê-lo.
Comportamentos específicos que aparecem de forma consistente nos registros do benchmark:
- Nenhum erro de aspas duplas: A interpolação de variáveis dentro de aspas aninhadas é tratada corretamente em todos os shells testados.
- Conformidade com POSIX por padrão: Os comandos produzem resultados idênticos em sistemas GNU/Linux e derivados do BSD sem modificação.
- Escopo conservador com curingas: Caminhos explícitos são preferidos sempre que reduzem o risco de execução.
- Uso inteligente de subshells: A substituição de processo aparece apenas quando realmente simplifica o comando, e não como um hábito de estilo.
Recuperação de erros na prática
Quando o modelo encontra um erro de permissão negada, sua resposta é diagnóstica, e não reativa. Em vez de colocar sudo por reflexo ou exibir o erro e parar, ele avalia três coisas antes de agir: se o erro é recuperável sem escalonar privilégios, se existe um caminho alternativo para o mesmo objetivo e se o erro revela uma falha no próprio plano original.
💡 A distinção crítica: O modelo trata "não consigo concluir esta etapa específica" e "não consigo alcançar o objetivo" como situações categoricamente diferentes. Essa distinção é o principal motor da pontuação de 91,8% em recuperação de erros.
Cadeias de raciocínio que funcionam

Resolução de problemas passo a passo
As tarefas de planejamento em várias etapas do Terminal-Bench 4.0 exigem de 8 a 12 decisões sequenciais em que as escolhas iniciais restringem as seguintes. A qualidade da cadeia de pensamento é decisiva nessa categoria. A saída de planejamento do Claude Fable 5.1 segue uma estrutura consistente antes de executar qualquer coisa:
- Decomposição do objetivo: Dividir o estado final em pré-requisitos verificáveis e ordenados
- Mapeamento de dependências: Identificar quais etapas bloqueiam outras e sequenciá-las de acordo
- Verificação de reversibilidade: Sinalizar as etapas difíceis de desfazer antes de se comprometer com elas
- Execução adaptativa: Avançar e atualizar o plano em tempo real quando as saídas intermediárias fogem do esperado
Isso espelha como engenheiros experientes abordam tarefas complexas na prática. É também o oposto do padrão que faz a maioria dos modelos cair abaixo de 80%: gerar o próximo comando mais plausível sem antes modelar suas consequências para cada etapa seguinte.
Sem saídas alucinadas
Um ponto forte do Terminal-Bench 4.0 como avaliação é que ele identifica comandos alucinados imediatamente. Se o modelo inventa uma flag inexistente, o shell devolve um erro claro. O que importa é como o modelo responde. O Claude Fable 5.1 trata esse erro como um sinal para verificar a interface real da ferramenta antes de continuar, e não como um gatilho para adivinhar de novo com um argumento inventado ligeiramente diferente.
Vários modelos concorrentes, incluindo versões anteriores do Claude, demonstram o padrão oposto: iteram por variantes com aparência plausível de uma flag errada, em vez de parar para consultar o que a ferramenta realmente suporta.
Aprofundamento no desempenho em código

Projetos com múltiplos arquivos
O benchmark inclui tarefas que exigem modificar vários arquivos interdependentes para corrigir uma suíte de testes quebrada. Essas tarefas expõem diretamente a fraqueza de modelos que dependem do contexto de um único arquivo. O Claude Fable 5.1 resolve isso construindo um grafo de dependências explícito antes de tocar em qualquer arquivo individual, modificando primeiro a dependência de nível mais baixo e executando suítes de testes parciais após cada mudança para detectar regressões antes que se transformem em falhas maiores.
O resultado é código que se integra corretamente ao contexto ao redor, e não apenas código localmente correto em isolamento.
Depuração sob pressão
As tarefas de código mais difíceis do benchmark incluem falsas pistas deliberadas: mensagens de erro que apontam para o lugar errado da base de código. O desempenho nessas tarefas está diretamente relacionado a se o modelo lê os stack traces de forma crítica, e não literal.
O Claude Fable 5 trata as mensagens de erro como hipóteses, e não como fatos. Ele rastreia um erro até a origem indicada, verifica se essa origem é de fato responsável pela falha e retrocede para procurar uma causa raiz mais profunda quando a linha indicada não é o problema. É a mesma disciplina que um engenheiro sênior aplica ao depurar uma base de código desconhecida, e as pontuações do benchmark refletem isso de forma consistente.

Comparado com GPT 5 e Gemini 3 Pro
O GPT 5 é genuinamente forte no Terminal-Bench 4.0, estabelecendo um novo recorde da OpenAI nessa categoria de avaliação agêntica. Seu ponto forte se concentra em tarefas de geração de código com saídas-alvo bem especificadas. Onde fica aquém do Claude Fable 5.1 é em tarefas que exigem adaptação a um estado intermediário inesperado, o que acontece com regularidade em ambientes do mundo real, e não em condições de teste controladas.
O Gemini 3 Pro tem uma vantagem específica em tarefas de leitura de arquivos com contexto longo, em que sua janela de contexto estendida é um ativo direto. Suas pontuações em operações de shell e recuperação de erros são mais baixas, em parte porque tende a produzir explicações detalhadas em linguagem natural sobre as ações pretendidas, em vez de simplesmente executá-las, o que consome tempo em prazos apertados das tarefas.
O Grok 4 produz planos de raciocínio metódicos e bem estruturados, mas sua camada de execução introduz variantes de comandos que frequentemente divergem do padrão POSIX, reduzindo as pontuações de operações de shell de formas que se acumulam ao longo de tarefas de várias etapas.
A diferença no benchmark
A separação de 12 a 15 pontos entre o Claude Fable 5.1 e o grupo seguinte de modelos é grande o bastante para ter consequências operacionais reais. Com uma taxa de conclusão de tarefas de 80% em um lote de 300 tarefas, você precisa de cerca de 60 intervenções manuais. Com 94,3%, esse número cai para cerca de 17. Essa é a diferença prática entre um pipeline que você pode agendar e deixar rodando e outro que exige monitoramento ativo para ser concluído com sucesso.
Para desenvolvedores que criam automações internas, a pergunta relevante não é "qual modelo pontua mais no papel", e sim "com qual taxa de conclusão de tarefas a supervisão humana deixa de ser necessária para este fluxo de trabalho específico". O Claude Fable 5.1 cruza esse limite em mais categorias de fluxo de trabalho do que qualquer outro modelo atualmente disponível.
Execute o Claude Fable 5.1 no PicassoIA agora mesmo

O Claude Fable 5 está disponível no PicassoIA junto com o Claude Sonnet 5, o Claude Opus 4.7 e todo o catálogo de modelos da OpenAI e do Google. Não é preciso chave de API da Anthropic. Não há configuração local.
Como executar, passo a passo
Passo 1. Abra a página do modelo Claude Fable 5 no PicassoIA.
Passo 2. No campo de prompt de sistema, descreva o ambiente operacional em que sua tarefa se insere. Especificar o shell, as ferramentas disponíveis e as restrições relevantes melhora significativamente a qualidade do resultado em tarefas agênticas.
Passo 3. No prompt do usuário, descreva o estado final desejado, e não as etapas individuais que você acha necessárias. Deixe o modelo planejar a sequência. Descrever o resultado que você quer produz planos de ação melhores do que especificar etapas individuais.
Passo 4. Revise o plano do modelo antes da execução. O Claude Fable 5.1 gera uma sequência numerada de ações antes de tentar qualquer coisa. Este é o seu ponto de verificação para identificar mal-entendidos cedo, antes que se propaguem.
Passo 5. Forneça correções em linguagem simples, se necessário. O modelo aceita ajustes de rota no meio da tarefa e retoma a partir do último estado confirmado, sem reiniciar toda a sequência.
💡 Dica prática: Em tarefas de código com múltiplos arquivos, use o prompt de sistema para especificar quais arquivos estão no escopo. Isso impede que o modelo adivinhe a estrutura de diretórios e mantém o uso de tokens focado no problema real.
Você pode combinar o Claude Fable 5 com outros modelos do PicassoIA para diferentes fases do mesmo fluxo de trabalho. O Claude Sonnet 5 é mais rápido e mais econômico nas fases de rascunho e iteração. O Claude Fable 5 cuida da validação final, dos testes de integração e dos casos extremos que mais importam em produção.
O que essa pontuação significa para o trabalho real
Uma pontuação de 94,3% no Terminal-Bench 4.0 não é apenas um número de ranking. Ela indica o que você pode realisticamente delegar a um modelo de linguagem hoje sem construir uma camada de supervisão em torno dele.
As quatro categorias do benchmark correspondem diretamente aos gargalos que desaceleram equipes de engenharia reais: scripts de shell que quebram em casos extremos de produção, mudanças de código que introduzem regressões de integração, implantações em várias etapas que exigem alguém acompanhando cada fase. Um modelo que lida com isso de forma confiável o bastante para rodar sem intervenção muda a economia da automação de um jeito concreto.
O PicassoIA mantém o catálogo completo de modelos atualizado conforme novas versões são lançadas, então você pode testar cada revisão no dia em que ela fica disponível, ao lado de todos os modelos concorrentes, na mesma interface. Quando a próxima atualização do Claude Fable chegar, a comparação estará a um clique de distância. O teste prático é direto: pegue uma tarefa que você hoje revisa manualmente em cada etapa e execute-a no modelo. Se ela for concluída corretamente 19 vezes em 20, o argumento a favor da automação total fica difícil de contestar.