API Claude: o que muda com o Fable 5.1
O Fable 5.1 chega à API Claude com cache a $0.25 por milhão de tokens, mas regras novas podem quebrar chamadas forçadas de ferramentas e históricos editados.

Vale a pena testar o Claude Fable 5.1 em execuções longas de agentes, mas ele não substitui automaticamente toda integração com a API Claude. A Anthropic lançou o modelo em 1 de setembro de 2026, com leituras de cache a $0.25 por milhão de tokens e regras de API capazes de quebrar chamadas obrigatórias de ferramentas e históricos de conversa editados.
O que é o Fable 5.1 na API Claude
O Fable 5.1 é o modelo da Anthropic para trabalhos que se estendem por muitas etapas: um agente de programação que rastreia uma falha entre serviços, um agente de pesquisa que acompanha evidências em várias fontes ou um agente de documentos que transforma um grande conjunto de arquivos em uma entrega pronta. O ID do modelo na API é claude-fable-5-1, e ele está disponível para todos os clientes da Claude API, além de Amazon Bedrock, Claude Platform on AWS, Google Cloud e Microsoft Foundry.
A palavra-chave aqui é modelo. Não se trata de um aplicativo novo nem de um substituto para todo o produto Claude. A recomendação da Anthropic para a maioria de quem desenvolve com a API ainda é começar pelo Claude Opus 5. O Fable 5.1 entra em cena quando tarefas de raciocínio exigente ou de longo prazo continuam reprovando nas suas próprias avaliações com o Opus. O Claude Mythos 5.1 usa o mesmo modelo-base, com salvaguardas diferentes, mas está restrito a clientes aprovados do Project Glasswing. O guia atual de modelos da Anthropic deixa essa divisão explícita.
Por padrão, a janela de contexto tem 1M tokens, e a saída pode chegar a 128k tokens. A janela de contexto funciona como a memória de trabalho do modelo para a solicitação atual: ela reúne instruções, mensagens, arquivos, ferramentas, resultados, raciocínio e a resposta em produção. Um milhão de tokens comporta muita coisa, mas isso não torna cada token útil. O próprio guia de contexto da Anthropic alerta para a degradação do contexto: a capacidade de recuperar informações e a precisão podem cair à medida que conteúdo irrelevante se acumula.
O raciocínio adaptativo fica sempre ativado. É possível controlar o esforço do modelo em cinco níveis: low, medium, high, xhigh e max. Comece em high, o padrão da API. Só reduza quando suas avaliações mostrarem que a qualidade se mantém, porque os tokens de raciocínio são cobrados como saída mesmo quando o texto desse raciocínio não aparece.
Este guia foi escrito para quem desenvolve com a API. Se você usa Claude apenas no chat, o modelo pode melhorar uma tarefa que receber, mas não há nenhuma migração a fazer.
A mudança de preço é menor — e maior — do que parece
O Fable 5.1 não ficou mais barato em tudo. As tarifas-base de entrada e saída continuam iguais às do Fable 5, e ambas custam o dobro das tarifas do Opus 5. A grande mudança está no contexto reutilizado.
Um cache de prompt armazena um prefixo já processado, como instruções de sistema, definições de ferramentas, o mapa de um repositório ou um conjunto de documentos. Quando a solicitação seguinte começa com exatamente o mesmo prefixo, Claude pode ler esse trabalho do cache em vez de processá-lo outra vez pela tarifa integral de entrada.
Considere um prefixo de 1M tokens lido dez vezes. O Fable 5 cobra $10 por essas leituras em cache. O Fable 5.1 cobra $2.50. O mesmo contexto repetido economiza $7.50, ou 75%, antes de contabilizar novas entradas ou saídas. A Anthropic estima uma economia total de cerca de 25% em cargas típicas cobradas por token e de até cerca de 45% nas altamente agênticas, com base em quatro semanas de uso em agosto de 2026. São estimativas do fornecedor, mas o preço unitário que as sustenta é objetivo. A tabela de preços atual detalha cada operação de cache.

Há uma ressalva. Gravar um cache de cinco minutos custa $12.50 por milhão de tokens, enquanto a gravação de uma hora custa $20. O cache padrão dura cinco minutos. O prefixo precisa ter ao menos 512 tokens e corresponder exatamente, e a primeira resposta precisa começar antes que solicitações paralelas posteriores consigam aproveitar o cache. Segundo a Anthropic, a opção de cinco minutos se paga depois de uma leitura, e a de uma hora, depois de duas. Confira cache_creation_input_tokens, cache_read_input_tokens e input_tokens em vez de presumir que o cache funcionou.
Essa mudança quase não faz diferença para prompts curtos e isolados, prefixos que mudam o tempo todo ou agentes cujo custo se concentra na saída. A $50 por milhão de tokens de saída, raciocínio desnecessário e respostas longas ainda podem dominar a conta.
Os benchmarks de lançamento apontam na direção certa, mas não bastam para decidir uma compra. A Anthropic informa 55.8% para o Fable 5.1, contra 42.0% para o Fable 5, no Terminal-Bench 4.0; no AutomationBench, são 31.4% contra 17.1%. Os testes usaram as salvaguardas de produção da Anthropic e foram realizados pelo próprio fornecedor. Encare os resultados como um motivo para executar uma avaliação das suas tarefas, não como prova de que toda carga de trabalho melhora. O relatório de lançamento publica as observações dos testes e as comparações.
Quem deve usar o modelo — e como
Fundador solo diante de uma tarefa difícil no repositório
Não transfira toda tarefa de programação para o Fable 5.1. Mantenha as alterações rotineiras no modelo que já entrega o nível de qualidade necessário e encaminhe ao Fable os trabalhos realmente difíceis: uma migração entre serviços, uma investigação de causa-raiz ou uma revisão que precise relacionar decisões em uma base de código extensa. Coloque em cache as instruções estáveis do repositório e as definições de ferramentas. Assim, você melhora as chances de resolver a tarefa cara sem pagar as tarifas do Fable em cada ajuste pequeno.
Engenheiro de plataforma de agentes colocando um loop de ferramentas em produção
Trocar o modelo resolve apenas metade do trabalho. Verifique se o executor do agente obriga o uso de uma ferramenta, reescreve o prompt de sistema de nível superior, altera o array de ferramentas, apaga mensagens antigas ou insere um resumo gerado no cliente enquanto preserva blocos de raciocínio posteriores. Qualquer um desses padrões pode transformar uma sessão normal em um erro 400. O benefício não é uma demonstração mais bonita, mas uma implantação que continua funcionando nos turnos seguintes.
Líder de pesquisa trabalhando com um grande conjunto de arquivos
Use o Fable 5.1 quando a tarefa realmente exigir conexões ao longo de um histórico extenso, não apenas porque o número 1M está disponível. Comece com esforço high, avalie a resposta com base em conclusões conhecidas e depois teste medium. A Anthropic afirma que medium se aproxima do Fable 5 por um custo menor, mas são suas próprias verificações de recuperação e citações que dirão se essa troca funciona.
Líder corporativo de segurança ou dados
Confira a política antes da capacidade. O Fable 5.1 é um Covered Model com exigência de retenção de dados por 30 dias e não está disponível com zero data retention, salvo autorização expressa da Anthropic. Ele também não oferece suporte ao Priority Tier. Se qualquer uma dessas condições for inegociável, encerre a avaliação ali e mantenha um modelo qualificado na rota.
Migração segura para o Fable 5.1
A chamada mínima é simples. A migração para produção exige quatro verificações.
Crie uma linha de base com uma tarefa real
Execute a mesma tarefa representativa no modelo atual e registre sucesso da tarefa, tempo total, entrada, criação de cache, leituras de cache, saída e qualquer recusa. Use o trabalho que justifica a tarifa mais alta do Fable, não um prompt de brinquedo.
Chame o modelo fixado com esforço high
Configure a chave da API, instale a versão atual do SDK para Python e salve o bloco Python como
test_fable.py.Bashpython3 -m venv .venv source .venv/bin/activate pip install anthropic export ANTHROPIC_API_KEY="your-api-key-here"Pythonimport anthropic client = anthropic.Anthropic() message = client.messages.create( model="claude-fable-5-1", max_tokens=4096, output_config={"effort": "high"}, messages=[ { "role": "user", "content": "Map the risks in moving this service from SQLite to PostgreSQL.", } ], ) for block in message.content: if block.type == "text": print(block.text) print(message.usage.model_dump_json())Execute com
python test_fable.py. O exemplo segue a sintaxe atual do SDK e de esforço da Anthropic. Na produção, substitua o prompt pela tarefa usada na sua avaliação.Remova os dois padrões que causam falhas
Procure nas solicitações por
tool_choiceconfigurado comoanyou com o nome de umatool. As duas opções agora retornam HTTP 400. Mantenha o valor emauto, definastrict: trueno esquema da ferramenta quando precisar de argumentos válidos e informe ao modelo qual ferramenta o turno exige.Depois, torne o histórico somente anexável. Reenvie cada turno do assistente exatamente como foi retornado, incluindo os blocos de raciocínio. Acrescente novas instruções como mensagens de sistema no meio da conversa. Use compactação no servidor ou edição de contexto em vez de reescrever turnos anteriores.
Ative o diagnóstico antes de receber tráfego
Execute uma sessão normal com vários turnos usando o cabeçalho beta
thinking-binding-controls-2026-08-01eprefix_mismatch_behavior: "drop_block". Registreinput_transformations. Umprefix_binding_mismatchindica que sua integração alterou o histórico. Ummodel_binding_mismatchdepois de rotear para um modelo mais antigo é esperado.Quando o histórico estiver estável, adicione
cache_control: {"type": "ephemeral"}no nível superior de uma solicitação que tenha um prefixo reutilizável de pelo menos 512 tokens. Confirme que uma solicitação posterior informacache_read_input_tokensacima de zero.
A realidade: contexto mais barato exige estado mais rígido
O Fable 5.1 vincula cada bloco de raciocínio ao prompt de sistema, às ferramentas e às mensagens que vieram antes dele. Em contas criadas a partir de 31 de agosto de 2026, alterar esse prefixo e reproduzir o bloco resulta em The block is bound to a different conversation. Contas mais antigas já podem aderir à mesma verificação, e a Anthropic afirma que modelos futuros vão aplicá-la de forma mais ampla.

O comportamento do modelo também muda sem gerar erro. Em loops de agentes implícitos, ele pode fazer uma chamada de ferramenta onde o Fable 5 faria várias em lote. Ele envia menos atualizações de progresso, pesquisa com menor frequência no esforço low, pode produzir uma prosa mais densa e talvez reescreva um arquivo inteiro para uma alteração pequena. Essas mudanças podem acrescentar turnos, latência e saída mesmo com a queda da tarifa de cache. A Anthropic publica ajustes de prompt para cada comportamento, mas você ainda precisa de uma avaliação que meça o comportamento importante para o seu caso.
Há ainda outro limite escondido na promessa de saída de 128k. Os SDKs exigem streaming quando max_tokens ultrapassa 21,333. O raciocínio divide esse orçamento de saída, portanto uma solicitação com esforço alto pode consumir grande parte dele antes de a resposta visível começar. Defina um limite folgado para trabalhos realmente difíceis, mas não trate um teto alto como meta.
Quem usa Claude Code terá menos trabalho de integração. A versão 2.1.257 tornou o Fable 5.1 o modelo Fable padrão em 1 de setembro de 2026. Ainda assim, é preciso acompanhar o uso, revisar o diff e reservar o modelo para trabalhos cujo resultado compense a tarifa. O changelog do Claude Code registra a troca de modelo.
O que fazer agora
Aja ainda esta semana se você já opera agentes Fable 5 de longa duração, envia repetidamente um contexto estável e pode aceitar as condições de retenção. Direcione uma pequena parcela do tráfego ao Fable 5.1, execute o diagnóstico de histórico, substitua ferramentas forçadas e compare o custo por tarefa concluída com sucesso nos esforços medium e high.
Espere se o Opus 5 ou o modelo atual já passa na carga de trabalho, se a maioria das chamadas acontece uma única vez ou se você ainda não tem uma avaliação representativa. A entrada e a saída básicas do Fable continuam custando o dobro das do Opus 5. Uma linha de cache mais barata não corrige uma decisão de roteamento ruim.
Se você usa apenas o chat do Claude e não controla a integração da API, nada muda. Deixe o produto escolher o modelo e avalie o resultado. Equipes corporativas que exigem zero data retention convencional ou Priority Tier também devem permanecer em uma rota qualificada, a menos que a Anthropic conceda autorização por escrito.
Se você quiser transformar o próximo lançamento em uma decisão prática de desenvolvimento, assine a newsletter.
2 de set. de 2026



