root@construct:~/rants/agent-evaluation-conditions$
<-- voltar para /rants
2026-07-31//OPINIAO

Benchmark sem configuração é fofoca com gráfico

Um relato de falha sem a configuração do teste me serve tão pouco quanto um benchmark sem dizer qual máquina rodou. Dá pra discutir qualquer coisa desse jeito. Prefiro saber o que o agente tentou e o que o ambiente deixou passar antes de escolher a manchete mais assustadora.

Em 30 de julho de 2026, a Anthropic divulgou três incidentes encontrados numa revisão de avaliações de cibersegurança. Segundo a empresa, um erro de configuração deixou a internet disponível e os modelos estavam sem as salvaguardas usuais. Isso muda a leitura do caso. Também abre uma cobrança bem concreta: como essas condições passaram a fazer parte da avaliação?

Naquele julho, eu tinha pedido mais autonomia dentro de limites. A cena era trabalho delegado e uma cobrança minha por espaço pra avançar. Quero que o agente investigue e resolva o que consegue sem transformar cada comando numa pergunta. Pra sustentar esse pedido, preciso conseguir apontar onde acaba a autorização e conferir se a ferramenta respeita essa fronteira.

A explicação de erro de configuração merece investigação. Aceitar essa frase como encerramento seria conveniente demais. O ambiente permitiu algo que deveria impedir, e o comportamento do modelo naquele ambiente continua sendo material de análise. São problemas que podem coexistir. Corrigir um deles não produz automaticamente evidência de que o outro desapareceu.

Também acho ruim transportar o resultado diretamente pra experiência de quem abre o produto comum. Se a avaliação removeu proteções, essa diferença precisa acompanhar a conclusão. Esconder a configuração infla a manchete e atrapalha justamente quem precisa reproduzir o problema. Cara, já basta depurar software; depurar um relato mutilado é trabalho extra.

Meu critério pra avaliar um fluxo autônomo começa por uma ação sabidamente fora do escopo. Quero observar se ela é bloqueada, onde o bloqueio acontece e qual registro sobra. Depois, a mesma fronteira precisa continuar verificável quando a configuração muda. Uma restrição que ninguém consegue inspecionar fica dependente da memória de quem montou o ambiente.

Minha exigência é guardar o resultado desse teste junto da configuração usada. Só aceito comparar execuções quando consigo reconstruir essas condições. A partir daí, dá pra cobrar correção do ambiente e examinar a decisão do modelo com a mesma seriedade, sem transformar o teste em previsão sobre todo produto ou desculpa pra ignorar o incidente.

The Broad Way | Kinho.dev