Exatamente dois números costumam entrar no relatório de qualidade da avaliação automática: o quanto os veredictos do modelo coincidem com os humanos e o quão robustos são a pequenas alterações, como a reordenação de opções ou a reformulação do prompt. Um novo trabalho afirma que isso não é suficiente — e propõe olhar para o juiz de outra forma.
A concordância responde à pergunta errada
Concordância e robustez a perturbações superficiais dizem respeito à confiabilidade (reliability). Um instrumento de medição confiável produz um resultado estável, mas a estabilidade por si só não diz nada sobre se ele mede a grandeza correta. Um termômetro que sempre marca 20 graus é excepcionalmente confiável e completamente inútil.

Os autores do artigo «A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation» (Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong; arXiv:2608.24419, cs.AI, submetido em 25 de agosto de 2026; 39 páginas, 10 figuras, 11 tabelas) deslocam a discussão para o plano da validade de construto: a avaliação corresponde ao conceito que supostamente mede. Para um juiz LLM, isso significa uma coisa simples — o juiz deve reagir ao sentido, não à forma.
Um perfil de duas dimensões
Em vez de uma única métrica, propõe-se um perfil de duas probabilidades.
S — invariância. Com que frequência o veredicto permanece o mesmo quando a edição preserva o sentido: parágrafos foram reordenados, o estilo foi alterado, o excesso foi removido. Um bom juiz aqui não deve se abalar.
R — sensibilidade ao construto. Com que frequência o veredicto muda quando a edição é mínima, mas o sentido é afetado: uma ressalva foi adicionada, uma afirmação foi enfraquecida, o escopo foi restringido. Um bom juiz aqui é obrigado a reagir.
A afirmação central do artigo: S e R são independentes, e nenhum resumo escalar preserva todas as comparações relevantes. Em termos simples, não se pode tirar a média de dois números e obter um único honesto — um juiz com S alto e R baixo e um juiz com S baixo e R alto podem dar a mesma «nota média», permanecendo instrumentos fundamentalmente diferentes.
Como isso foi verificado
O desenho experimental é visivelmente mais rigoroso do que o habitual para trabalhos desse tipo.
- 7 juízes e 4 domínios — ou seja, não se testou uma única modelo nem um único tipo de tarefa.
- 7 tipos de intervenções que alteram o construto contra 5 controles, que mexem apenas no registro e não mudam o sentido.
- A direção da edição — se ela altera o construto ou não — foi determinada por anotadores humanos, e não por rotulagem padrão.
- Geração, verificação e julgamento foram atribuídos a famílias de modelos não sobrepostas. Esse é um detalhe importante: o juiz não avalia texto gerado por ele mesmo nem verifica edições que ele próprio criou.
O último ponto merece atenção especial. Quando gerador, verificador e juiz são a mesma modelo, a alta concordância pode ser um artefato de vieses compartilhados, e não um indício de qualidade.
A invariância é quase ideal, a sensibilidade não
Aqui começa a parte mais interessante. Com o limiar de invariância acordado de S ≥ 0.90, os juízes apresentaram, em média, S = 0.945. Um número ao qual normalmente se aspira na prestação de contas.
A sensibilidade, por sua vez, foi de R = 0.319. Interpretação grosseira: em cerca de dois casos em cada três, o juiz não percebeu uma edição que altera o sentido. Um resultado formalmente impecável em invariância coexiste com uma resposta muito fraca ao conteúdo.

Escala e força não são a mesma coisa
A sensibilidade fraca está distribuída de forma desigual. Quando a edição altera a escala da afirmação, a resposta é maior: R_scope = 0.383. Quando altera a força — é mais fraca: R_strength = 0.262. A diferença é de +0.121, e seu sinal é o mesmo para todos os sete juízes.
Ou seja, não se trata de dispersão aleatória entre modelos, mas de uma característica sistemática. Os juízes captam melhor a ampliação e a restrição do escopo do que o deslocamento na escala de confiança — «provavelmente» contra «certamente», «pode ajudar» contra «ajuda». Para a prática, essa é uma notícia desagradável: são justamente essas gradações que, na maioria das vezes, é preciso distinguir.
As rótulas humanas também merecem verificação
Um enredo à parte são os cinco conjuntos públicos de rótulas usados como referência. Preditores que se baseiam exclusivamente em características superficiais do texto, no modo pareado, reproduzem 55–67% das rótulas. No caso do MT-Bench, a heurística superficial coincidiu com 67.4% dos votos humanos.
A conclusão que se impõe é incômoda. Se uma regra simples, que nada entende de conteúdo, reproduz dois terços das decisões humanas, então essas rótulas separam mal o sentido da forma — e é preciso validar não apenas o juiz, mas também o próprio conjunto com o qual ele é verificado.

O que fazer a respeito
Os autores não propõem substituir os juízes LLM por outra coisa — propõem mudar a forma de relatar e o procedimento de verificação.
Relato conjunto. S e R são publicados lado a lado, e não reduzidos a um único número. Quem lê o relatório vê imediatamente onde está a falha do juiz.
Auditoria do conjunto de validação. Antes de confiar na concordância com as rótulas humanas, vale verificar o quão previsíveis essas rótulas são sem compreender o texto. Se forem bem previsíveis — a confiança nelas está inflada.
Separação de papéis. Geração, verificação e julgamento por famílias de modelos diferentes reduzem o risco de que a alta invariância seja consequência de pontos cegos compartilhados.
A ideia principal
Alta concordância diz respeito à estabilidade, não à correção. Um juiz que emite o veredicto com a mesma confiança antes e depois de uma edição de sentido não é «robusto», mas desatento. Enquanto nos relatórios houver apenas um número, é impossível distinguir esses dois casos — e é exatamente por isso que um perfil de duas dimensões parece não uma complicação, mas o mínimo de honestidade necessário.



