Uma taxa bonita de cache pode esconder uma divisão de trabalho preguiçosa. Se todo agente recebe material que não precisa, pagar menos pela leitura repetida melhora a conta e preserva a bagunça. Eu quero enxergar as duas coisas antes de comemorar qualquer percentual.
A OpenAI lançou em 20 de agosto de 2026 um painel de prompt caching com taxa de acerto e composição do consumo: tokens lidos do cache, escritos e não armazenados. Esse tipo de visibilidade me interessa porque permite investigar onde o contexto se repete. O painel fornece dados pra uma decisão; a relevância do material enviado ainda precisa de julgamento.
Em junho, eu tinha considerado ruim repassar o contexto de todos os trabalhos entre agentes. Na mesma época, suspeitei que havia agentes demais e sugeri reduzir a quantidade. Minha reação era olhar pra organização da execução e perguntar se aquela distribuição fazia sentido. Um gráfico de consumo poderia ajudar a localizar o problema, sem resolver a divisão de responsabilidades por mim.
Instruções estáveis de um repositório podem ser necessárias em várias chamadas. O histórico completo de uma discussão sobre outra tarefa tem uma justificativa bem mais fraca. Colocar tudo no mesmo pacote porque é fácil deixa o agente separar o que importa, e depois alguém ainda precisa descobrir por que a conta cresceu. Prefiro examinar um bloco concreto de contexto a mandar encurtar todos os prompts.
Também preciso comparar execuções parecidas. Uma mudança nas instruções ou nos documentos recebidos pode alterar o consumo sem nenhuma mudança no modelo. Se o registro não mostra isso, a investigação começa atribuindo causa ao lugar errado. Um dia barato e outro caro dizem pouco sem saber qual trabalho estava acontecendo.
O isolamento continua valendo mesmo quando custa alguma repetição. Vários agentes precisam compartilhar regras comuns; decisões de tarefas sem relação podem confundir quem deve agir sobre o quê. Aceito pagar pela informação necessária pra manter essa responsabilidade clara. O desconto do cache não me convence a espalhar contexto só pra aumentar reaproveitamento.
Vou usar o painel pra investigar um bloco de contexto que parece irrelevante. Depois de entender sua função, quero comparar execuções com e sem ele, conferindo o custo junto da entrega. Se a conta cai e o resultado piora, os dois entram no registro. Quero usar a taxa de cache pra escolher o que enviar na próxima execução. Quando ela vira a meta, fica fácil otimizar leitura e esquecer o trabalho que motivou a chamada.