Vérification des actions de l’agent IA : de la réponse plausible au respect de la procédure

27 septembre 202624 vues

L’article décrit un système qui détermine quelles exigences procédurales s’appliquent à une requête et les vérifie à partir de la réponse ou du journal d’exécution. Lors des tests, il a détecté des défaillances structurelles invisibles lorsqu’on évalue uniquement le résultat ; l’extraction automatique des exigences conservait une partie de cette précision diagnostique, mais dépendait du réglage du modèle.

Vérification des actions de l’agent IA : de la réponse plausible au respect de la procédure

Pourquoi une réponse plausible ne suffit pas

Un résultat plausible ne prouve pas que l’agent IA a respecté la procédure. Pour le vérifier, il faut examiner non seulement la réponse, mais aussi les preuves de son exécution.

Dans l’étude ContractEval, la conformité procédurale est considérée comme un objet de vérification à part entière. Dans un ensemble contrôlé, les juges LLM ont laissé passer de nombreuses défaillances structurelles introduites artificiellement. Cela s’est produit aussi bien lorsqu’ils évaluaient uniquement la réponse que lorsqu’ils prenaient en compte la trace.

  • La réponse montre ce que le système a déclaré.
  • La trace d’exécution contient des preuves des actions effectuées.
  • La vérification procédurale confronte ces preuves aux exigences.

Critère : ne pas considérer le caractère convaincant de la réponse comme une preuve du respect de la procédure.

Comment fonctionne la vérification procédurale

ContractEval représente l’instruction comme un ensemble d’obligations actives pour une requête donnée. Le système confronte ensuite ces obligations aux preuves présentes dans la réponse ou la trace d’exécution.

La vérification comprend trois éléments :

  1. La requête détermine quelles obligations sont actives.
  2. La réponse ou la trace sert de source de preuves.
  3. La mise en correspondance détecte les conformités et les violations.

Critère pratique : la vérification doit relier une exigence à une preuve précise dans la réponse ou la trace.

Quels types de violations peut-on distinguer ?

ContractEval distingue plusieurs types de défaillances procédurales. Cette distinction montre précisément où les exigences et l’exécution divergent.

  • Omission — une action ou une exigence obligatoire est absente.
  • Branche incorrecte — l’exécution a suivi une branche inadaptée de la procédure.
  • Erreur d’ordre — les actions ne sont pas dans l’ordre requis.
  • Action superflue — l’exécution comprend une action qui n’était pas prévue.
  • Violation d’invariant — une condition qui devait être maintenue n’a pas été respectée.
  • Non-respect des exigences de sortie — le résultat ne répond pas aux exigences définies en matière de format ou de contenu.

Critère : la classification doit indiquer le type de défaillance, plutôt que de réduire toutes les violations à une évaluation générale de la réponse.

Ce que l’étude a révélé

Les auteurs de l’étude ContractEval ont comparé différentes méthodes de vérification sur un ensemble contrôlé de contrats procéduraux. Les graphes de référence de l’exécution attendue et observée ont permis de détecter et de localiser toutes les défaillances structurelles introduites artificiellement.

Méthode de vérificationRésultat
Les juges LLM évaluent la réponse ou prennent en compte la traceOnt laissé passer de nombreuses défaillances introduites
Mise en correspondance des graphes de référence et d’exécution observéeA détecté et localisé toutes ces défaillances
Extraction de données à l’aide d’un LLMA conservé une part importante du signal, mais dépendait du calibrage

L’étude de Praphul Singh, Shanu Kumar, Akshat Agarwal et Ganesh Kumar a été soumise à arXiv le 8 septembre 2026 : ContractEval.

Conclusion : les résultats concernent un ensemble contrôlé ; ils ne peuvent pas être généralisés à tous les scénarios.

Où s’arrête la vérification ?

ContractEval ne garantit pas que le système a respecté la procédure. L’étude rend la conformité vérifiable, au lieu de la considérer comme une qualité implicite du résultat final.

Deux conditions sont importantes pour choisir une méthode de vérification :

  • Existe-t-il une représentation de référence de l’exécution attendue ?
  • Peut-on la mettre en correspondance avec les preuves de la trace ou de la réponse réelle ?

Si l’on utilise l’extraction de données à l’aide d’un LLM, il faut tenir compte de la sensibilité du résultat au calibrage. La réponse finale, à elle seule, ne remplace pas la vérification des preuves procédurales.

Critère pratique : ne considérer la conformité comme vérifiée que lorsque les exigences ont été mises en correspondance avec l’exécution observée.

Foire aux questions

Matériaux connexes

Tous matériaux
Vérification des actions de l’agent IA : de la réponse plausible au respect de la procédure