Confiança não é o mesmo que estar certo: como os LLMs falham na calibração em um jogo com figura oculta

18 setembro 202611 visualizações

Novo preprint do arXiv verifica se é possível confiar na autoavaliação de um modelo de linguagem no momento de escolher um lance. Numa variante de xadrez com um status "real" oculto, a probabilidade declarada ≥0,5 coincidiu com a posição real da peça apenas uma vez em 62 tentativas, e quase todo o déficit de calibração recaiu justamente sobre esses episódios.

Confiança não é o mesmo que estar certo: como os LLMs falham na calibração em um jogo com figura oculta

A marcação «estou certo» na resposta do modelo não é uma medição, mas sim mais uma afirmação que exige verificação separada. Enquanto tais avaliações forem incorporadas à lógica dos agentes, vale entender o quanto se pode confiar nelas.

Por que surgiram dúvidas sobre a confiança

Sistemas agênticos são cada vez mais estruturados de modo que o próximo passo é escolhido com base na autoavaliação do modelo: se ele declara alta confiança, a ação é executada; se baixa, recorre-se a um humano ou a outra ferramenta. Esse esquema só funciona sob uma condição: no momento da ação, a confiança declarada deve corresponder aproximadamente à frequência real de acertos.

O trabalho de Bhushan Kashinath Joshi (arXiv:2608.24691, submetido em 25 de agosto de 2026) verifica exatamente essa premissa — e o faz em um cenário onde o erro é visível de imediato e não pode ser atribuído ao azar.

Campo de testes: xadrez com rei oculto

O xadrez clássico é pouco adequado para essa verificação: nele tudo é aberto, e a «confiança» inevitavelmente se confunde com a força de jogo. Por isso, adotou-se uma variante com informação oculta, na qual o status de rei pode passar secreta e repetidamente de uma peça para outra. O jogador não sabe onde está o alvo principal no momento e é forçado a agir por suposição.

Detalhe-chave da metodologia: a cada lance, perguntava-se separadamente ao agente a distribuição de probabilidades sobre qual peça do adversário carrega secretamente o status de rei. Isso era solicitado independentemente do lance em si — para não misturar «para onde fui» e «no que acredito». A posição verdadeira era reconstruída após a partida e comparada com os números declarados.

Uma resposta correta em sessenta e duas

O resultado principal parece um desastre. Em duas séries independentes de partidas, as capturas realizadas com confiança declarada não inferior a 0,5 quanto à localização da peça oculta revelaram-se corretas em 1 caso de 62. Em termos percentuais, a probabilidade declarada de «mais provável que sim do que não» resultou em acerto em cerca de um vírgula cinco por cento das situações — uma discrepância de ordens de grandeza, não de percentuais.

Além disso, o déficit de calibração está quase inteiramente concentrado nesses eventos: 99,3% na série original e 98,7% na repetição. Em outras palavras, o problema não está espalhado uniformemente por todo o jogo — ele se concentra nos momentos em que o modelo declara com especial veemência estar certo e justamente quando uma ação arriscada depende dele.

O mesmo padrão em outras configurações

O autor não se limitou a um único modelo. A verificação abrangeu mais quatro configurações, incluindo um segundo provedor. O quadro se repete de forma mais fraca e se organiza em uma ordem consistente — mas aqui é preciso cautela: apenas as estimativas pontuais permanecem comparáveis, e a maioria das diferenças par a par, com esse tamanho de amostra, é estatisticamente indistinguível.

O próprio autor descreve isso como o alcance da descoberta (scope), e não como prova de que o nível de capacidade do modelo prediz sua calibração. Ou seja, não se trata de «quanto mais inteligente o modelo, melhor ele se avalia» nem da afirmação inversa — apenas que o fenômeno ocorre de forma mais ampla do que em uma única sistema específico.

O orçamento de raciocínio desloca a métrica mais do que parece

Um enredo desagradável à parte é a comparação de um mesmo modelo com uma classificação externa inalterada na tabela de líderes. Muda apenas o orçamento de raciocínio (deliberation budget), isto é, quanto «tempo para pensar» o modelo gasta. Pois bem, esse deslocamento altera a métrica de calibração quase tanto quanto uma grande diferença entre modelos distintos.

A conclusão prática é simples e incômoda: não se pode orientar pela posição no leaderboard ao escolher um sistema para tarefas com avaliação de risco. Dentro de um mesmo modelo, a variação causada pela configuração é comparável ao que costumamos considerar uma vantagem séria de um modelo sobre outro.

Métricas tradicionais podem mostrar o oposto

Outro resultado atinge os modos habituais de medição. Em um assento (seat) separado, os eixos padrão de avaliação — legalidade dos lances, custo, latência, proporção de partidas concluídas — podem divergir completamente da qualidade das crenças do modelo. A configuração que vencia em todos os indicadores tradicionais ao mesmo tempo demonstrou a pior qualidade de crenças entre todas as testadas.

Aqui é fácil errar na interpretação: não se trata de que a acurácia e o baixo custo sejam prejudiciais em si. Trata-se de que o conjunto de métricas que costumamos considerar exaustivo simplesmente não mede a propriedade que nos interessa — ele mede outra coisa.

Por que a avaliação «pelo resultado» não captura nada

A consequência mais desagradável é o mascaramento. O modelo com o padrão descrito ainda pode vencer justamente a partida sobre a qual construiu crenças equivocadas. O resultado é bom, mas o quadro interno do mundo era incorreto.

Daí segue que a verificação exclusivamente pelo resultado (outcome-only) não detecta tais falhas em princípio: a vitória encerra a questão, e o ponto fraco permanece no sistema até a próxima vez — só que já em uma tarefa onde o desfecho correto pode não acontecer.

O que fazer com isso na prática

Algumas conclusões práticas que decorrem diretamente dos resultados.

  • Solicitar ao modelo sua própria distribuição de probabilidades sobre a incógnita-chave — e armazená-la separadamente da ação escolhida. Sem separar essas duas coisas, não será possível avaliar a calibração.
  • Comparar a confiança declarada com a frequência factual de acertos nos seus próprios dados, em vez de confiar nos números da ficha do modelo. No jogo com a peça oculta, a discrepância revelou-se enorme, e nada garante que em uma tarefa aplicada ela seja menor.
  • Verificar o limiar em que o sistema transfere a decisão para um humano separadamente da acurácia geral. Os erros se aglomeram justamente na zona de alta confiança declarada.
  • Fixar o orçamento de raciocínio em quaisquer comparações. Caso contrário, você mede a configuração, não o modelo.
  • Não considerar a vitória ou o desfecho bem-sucedido como prova da correção das crenças internas do sistema.

O sentido geral da descoberta não é que os modelos sejam «ruins». É mais que a confiança e a razão são dois indicadores distintos, e o primeiro ainda não serve como substituto do segundo. Enquanto as arquiteturas agênticas forem construídas em torno da autoavaliação, essa diferença terá de ser medida explicitamente.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Confiança não é o mesmo que estar certo: como os LLMs falham na calibração em um jogo com figura oculta