Um desconto de cache só entra na minha conta quando a tarefa realmente reaproveita contexto. Ler o maior percentual do anúncio e aplicar ao consumo inteiro produz uma economia excelente no papel. Depois a fatura aparece com uma interpretação menos generosa da matemática.
Em 1º de setembro de 2026, a Anthropic anunciou Fable 5.1 e Mythos 5.1. Fable manteve entrada a US$10 e saída a US$50 por milhão de tokens. Leituras de cache passaram a US$0,25, redução de 75%. A empresa estimou economia de 25% a 45% nas suas cargas. A entrada comum continua com outro preço, e a composição de cada execução decide quanto o desconto pesa.
Em 3 de setembro, perguntei se tarefas simples estavam indo pro modelo mais barato. Era uma cobrança sobre o encaminhamento do trabalho: queria saber se estávamos pagando capacidade onde ela fazia diferença. O anúncio do Fable acrescenta uma variável concreta. Duas tarefas com tamanhos parecidos podem custar diferente se uma retorna várias vezes aos mesmos documentos e a outra recebe material novo.
Pra estimar isso, quero separar as leituras reaproveitadas do conteúdo novo e das respostas produzidas. Uma investigação longa pode carregar instruções estáveis por várias chamadas. Um pedido curto pode ter pouca repetição. Usar o mesmo percentual nas duas situações esconde a pergunta que deveria orientar o roteamento: qual é o consumo necessário pra chegar ao resultado esperado?
Em junho, eu já tinha considerado ruim repassar o contexto de todos os trabalhos entre agentes. Cache barato não mudou minha opinião. Uma discussão irrelevante continua ocupando espaço e confundindo responsabilidades mesmo quando a leitura custa menos. Vou manter as instruções comuns separadas do material específico do pedido; isso também deixa mais fácil conferir o que chegou ao agente quando algo sai errado.
Outra execução necessária pra corrigir o resultado entra na conta. Se uma escolha barata obriga outro modelo a refazer a investigação, preciso somar esse trabalho. Da mesma forma, uma opção mais cara merece crédito quando termina com menos intervenção. O anúncio não decide qual dessas situações vai acontecer.
Fable 5.1 entra na minha lista pra comparar tarefas com contexto repetido. Minha decisão de encaminhamento vai exigir custo até a entrega aceita, com as categorias de token separadas. Os 25% a 45% continuam sendo a estimativa da Anthropic. Pra virar economia no meu trabalho, o desconto precisa aparecer na execução que eu consigo revisar.