Fita

12 materiais

Ordenação
Notícias6 setembro 2026

Quando o juiz é tendencioso: agentes de autoaprendizagem param de descartar habilidades inúteis

Um novo estudo mostra que um juiz LLM tendencioso quebra silenciosamente o mecanismo de descarte de habilidades malsucedidas: se a proporção de falsos sucessos exceder 0,45, o sistema para de limpar a biblioteca de habilidades, e isso não é visível nas métricas agregadas. Os autores propõem uma auditoria barata com injeção de defeitos para verificar o juiz antes da implantação.

Quando o juiz é tendencioso: agentes de autoaprendizagem param de descartar habilidades inúteis
Ler
Notícias29 agosto 2026

Por que as avaliações de preferência de LLMs não podem ser consideradas confiáveis: um grande teste revelou contradições

Os autores testaram seis modelos de linguagem em perguntas sobre voos, apartamentos e hotéis e descobriram que as respostas numéricas sobre disposição a pagar se contradizem sistematicamente. Por isso, essas estimativas não podem ser descritas por uma única função de utilidade — o que torna arriscado confiar nelas na tomada de decisões.

Por que as avaliações de preferência de LLMs não podem ser consideradas confiáveis: um grande teste revelou contradições
Ler