A marcação «estou certo» na resposta do modelo não é uma medição, mas sim mais uma afirmação que exige verificação separada. Enquanto tais avaliações forem incorporadas à lógica dos agentes, vale entender o quanto se pode confiar nelas.
Por que surgiram dúvidas sobre a confiança
Sistemas agênticos são cada vez mais estruturados de modo que o próximo passo é escolhido com base na autoavaliação do modelo: se ele declara alta confiança, a ação é executada; se baixa, recorre-se a um humano ou a outra ferramenta. Esse esquema só funciona sob uma condição: no momento da ação, a confiança declarada deve corresponder aproximadamente à frequência real de acertos.
O trabalho de Bhushan Kashinath Joshi (arXiv:2608.24691, submetido em 25 de agosto de 2026) verifica exatamente essa premissa — e o faz em um cenário onde o erro é visível de imediato e não pode ser atribuído ao azar.
Campo de testes: xadrez com rei oculto
O xadrez clássico é pouco adequado para essa verificação: nele tudo é aberto, e a «confiança» inevitavelmente se confunde com a força de jogo. Por isso, adotou-se uma variante com informação oculta, na qual o status de rei pode passar secreta e repetidamente de uma peça para outra. O jogador não sabe onde está o alvo principal no momento e é forçado a agir por suposição.
Detalhe-chave da metodologia: a cada lance, perguntava-se separadamente ao agente a distribuição de probabilidades sobre qual peça do adversário carrega secretamente o status de rei. Isso era solicitado independentemente do lance em si — para não misturar «para onde fui» e «no que acredito». A posição verdadeira era reconstruída após a partida e comparada com os números declarados.

Uma resposta correta em sessenta e duas
O resultado principal parece um desastre. Em duas séries independentes de partidas, as capturas realizadas com confiança declarada não inferior a 0,5 quanto à localização da peça oculta revelaram-se corretas em 1 caso de 62. Em termos percentuais, a probabilidade declarada de «mais provável que sim do que não» resultou em acerto em cerca de um vírgula cinco por cento das situações — uma discrepância de ordens de grandeza, não de percentuais.
Além disso, o déficit de calibração está quase inteiramente concentrado nesses eventos: 99,3% na série original e 98,7% na repetição. Em outras palavras, o problema não está espalhado uniformemente por todo o jogo — ele se concentra nos momentos em que o modelo declara com especial veemência estar certo e justamente quando uma ação arriscada depende dele.
O mesmo padrão em outras configurações
O autor não se limitou a um único modelo. A verificação abrangeu mais quatro configurações, incluindo um segundo provedor. O quadro se repete de forma mais fraca e se organiza em uma ordem consistente — mas aqui é preciso cautela: apenas as estimativas pontuais permanecem comparáveis, e a maioria das diferenças par a par, com esse tamanho de amostra, é estatisticamente indistinguível.
O próprio autor descreve isso como o alcance da descoberta (scope), e não como prova de que o nível de capacidade do modelo prediz sua calibração. Ou seja, não se trata de «quanto mais inteligente o modelo, melhor ele se avalia» nem da afirmação inversa — apenas que o fenômeno ocorre de forma mais ampla do que em uma única sistema específico.

O orçamento de raciocínio desloca a métrica mais do que parece
Um enredo desagradável à parte é a comparação de um mesmo modelo com uma classificação externa inalterada na tabela de líderes. Muda apenas o orçamento de raciocínio (deliberation budget), isto é, quanto «tempo para pensar» o modelo gasta. Pois bem, esse deslocamento altera a métrica de calibração quase tanto quanto uma grande diferença entre modelos distintos.
A conclusão prática é simples e incômoda: não se pode orientar pela posição no leaderboard ao escolher um sistema para tarefas com avaliação de risco. Dentro de um mesmo modelo, a variação causada pela configuração é comparável ao que costumamos considerar uma vantagem séria de um modelo sobre outro.
Métricas tradicionais podem mostrar o oposto
Outro resultado atinge os modos habituais de medição. Em um assento (seat) separado, os eixos padrão de avaliação — legalidade dos lances, custo, latência, proporção de partidas concluídas — podem divergir completamente da qualidade das crenças do modelo. A configuração que vencia em todos os indicadores tradicionais ao mesmo tempo demonstrou a pior qualidade de crenças entre todas as testadas.
Aqui é fácil errar na interpretação: não se trata de que a acurácia e o baixo custo sejam prejudiciais em si. Trata-se de que o conjunto de métricas que costumamos considerar exaustivo simplesmente não mede a propriedade que nos interessa — ele mede outra coisa.
Por que a avaliação «pelo resultado» não captura nada
A consequência mais desagradável é o mascaramento. O modelo com o padrão descrito ainda pode vencer justamente a partida sobre a qual construiu crenças equivocadas. O resultado é bom, mas o quadro interno do mundo era incorreto.
Daí segue que a verificação exclusivamente pelo resultado (outcome-only) não detecta tais falhas em princípio: a vitória encerra a questão, e o ponto fraco permanece no sistema até a próxima vez — só que já em uma tarefa onde o desfecho correto pode não acontecer.

O que fazer com isso na prática
Algumas conclusões práticas que decorrem diretamente dos resultados.
- Solicitar ao modelo sua própria distribuição de probabilidades sobre a incógnita-chave — e armazená-la separadamente da ação escolhida. Sem separar essas duas coisas, não será possível avaliar a calibração.
- Comparar a confiança declarada com a frequência factual de acertos nos seus próprios dados, em vez de confiar nos números da ficha do modelo. No jogo com a peça oculta, a discrepância revelou-se enorme, e nada garante que em uma tarefa aplicada ela seja menor.
- Verificar o limiar em que o sistema transfere a decisão para um humano separadamente da acurácia geral. Os erros se aglomeram justamente na zona de alta confiança declarada.
- Fixar o orçamento de raciocínio em quaisquer comparações. Caso contrário, você mede a configuração, não o modelo.
- Não considerar a vitória ou o desfecho bem-sucedido como prova da correção das crenças internas do sistema.
O sentido geral da descoberta não é que os modelos sejam «ruins». É mais que a confiança e a razão são dois indicadores distintos, e o primeiro ainda não serve como substituto do segundo. Enquanto as arquiteturas agênticas forem construídas em torno da autoavaliação, essa diferença terá de ser medida explicitamente.



