Porque uma resposta plausível não é suficiente
Um resultado plausível não confirma que o agente de IA seguiu o procedimento. Para isso, é preciso verificar não só a resposta, mas também as evidências da execução.
No trabalho ContractEval, a conformidade processual é tratada como um objeto de verificação independente. Num conjunto controlado, os juízes LLM não detetaram muitas falhas estruturais introduzidas artificialmente. Isso aconteceu tanto quando avaliaram apenas a resposta como quando tiveram em conta o rastreio.
- A resposta mostra o que o sistema comunicou.
- O rastreio da execução contém evidências das ações.
- A verificação processual compara essas evidências com os requisitos.
Critério: não considerar a persuasividade da resposta como prova de conformidade com o procedimento.
Como funciona a verificação processual
ContractEval representa uma instrução como um conjunto de obrigações ativas para um pedido específico. Em seguida, o sistema compara as obrigações com as evidências na resposta ou no rastreio da execução.

A verificação inclui três elementos:
- Pedido determina quais as obrigações ativas.
- Resposta ou rastreio serve como fonte de evidências.
- Comparação identifica a conformidade e as violações.
Critério prático: a verificação deve associar o requisito a uma evidência concreta na resposta ou no rastreio.
Que violações é possível distinguir
ContractEval distingue tipos específicos de falhas processuais. Esta divisão mostra exatamente onde os requisitos e a execução divergem.
- Omissão — falta uma ação ou um requisito obrigatório.
- Ramo incorreto — a execução seguiu um ramo inadequado do procedimento.
- Erro de ordenação — as ações não estão na sequência exigida.
- Ação excedente — a execução contém uma ação não prevista.
- Violação de invariante — uma condição que deveria manter-se não foi respeitada.
- Incumprimento dos requisitos de saída — o resultado não cumpre os requisitos definidos de formato ou conteúdo.
Critério: a classificação deve indicar o tipo de falha, em vez de reduzir todas as violações a uma avaliação geral da resposta.
O que o estudo revelou
Os autores do trabalho ContractEval compararam métodos de verificação num conjunto controlado de contratos processuais. Os grafos de referência da execução esperada e observada permitiram detetar e localizar todas as falhas estruturais introduzidas artificialmente.
| Método de verificação | Resultado |
|---|---|
| Os juízes LLM avaliam a resposta ou têm em conta o rastreio | Não detetaram muitas das falhas introduzidas |
| Comparação dos grafos de referência e observados | Detetou e localizou todas essas falhas |
| Extração de dados com LLM | Preservou uma parte significativa do sinal, mas dependia da calibração |
O trabalho de Praphul Singh, Shanu Kumar, Akshat Agarwal e Ganesh Kumar foi submetido ao arXiv em 8 de setembro de 2026: ContractEval.
Conclusão: os resultados dizem respeito a um conjunto controlado; não podem ser generalizados a todos os cenários.
Onde termina a verificação
ContractEval não garante que o sistema tenha seguido o procedimento. O trabalho torna a conformidade auditável, em vez de a tratar como uma qualidade implícita da resposta final.
Ao escolher um método de verificação, há duas condições importantes:
- Existe uma representação de referência da execução esperada?
- É possível compará-la com as evidências no rastreio ou na resposta reais?
Se for utilizada a extração de dados com LLM, é preciso ter em conta a sensibilidade dos resultados à calibração. A resposta final, por si só, não substitui a verificação das evidências processuais.
Critério prático: considerar a conformidade verificada apenas quando os requisitos forem comparados com a execução observada.



