Pemeriksaan tindakan agen AI: dari jawaban yang masuk akal hingga kepatuhan terhadap prosedur

27 September 202624 tampilan

Artikel ini menjelaskan sistem yang menentukan persyaratan prosedural mana yang berlaku untuk suatu permintaan, lalu memeriksanya berdasarkan respons atau log eksekusi. Dalam pengujian, sistem ini mendeteksi kegagalan struktural yang tidak terlihat jika hanya hasil akhirnya yang dinilai; ekstraksi persyaratan secara otomatis mempertahankan sebagian akurasi diagnostik tersebut, tetapi bergantung pada konfigurasi model.

Pemeriksaan tindakan agen AI: dari jawaban yang masuk akal hingga kepatuhan terhadap prosedur

Mengapa jawaban yang masuk akal saja tidak cukup

Hasil yang masuk akal tidak membuktikan bahwa agen AI mengikuti prosedur. Untuk memastikannya, yang perlu diperiksa bukan hanya jawabannya, tetapi juga bukti pelaksanaannya.

Dalam penelitian ContractEval, kepatuhan prosedural diperlakukan sebagai objek pemeriksaan tersendiri. Dalam kumpulan data terkontrol, para penilai LLM melewatkan banyak kegagalan struktural yang sengaja disisipkan. Hal ini terjadi baik saat hanya menilai jawaban maupun saat mempertimbangkan jejak eksekusi.

  • Jawaban menunjukkan apa yang dilaporkan sistem.
  • Jejak eksekusi berisi bukti tindakan.
  • Pemeriksaan prosedural mencocokkan bukti tersebut dengan persyaratan.

Kriteria: jangan menganggap jawaban yang meyakinkan sebagai bukti kepatuhan terhadap prosedur.

Cara kerja pemeriksaan prosedural

ContractEval merepresentasikan instruksi sebagai serangkaian kewajiban yang berlaku untuk permintaan tertentu. Kemudian, sistem mencocokkan kewajiban tersebut dengan bukti dalam jawaban atau jejak eksekusi.

Pemeriksaan ini mencakup tiga elemen:

  1. Permintaan menentukan kewajiban mana yang berlaku.
  2. Jawaban atau jejak menjadi sumber bukti.
  3. Pencocokan mengidentifikasi kepatuhan dan pelanggaran.

Kriteria praktis: pemeriksaan harus mengaitkan persyaratan dengan bukti spesifik dalam jawaban atau jejak.

Jenis pelanggaran yang dapat dibedakan

ContractEval mengidentifikasi jenis-jenis kegagalan prosedural secara terpisah. Pemisahan ini menunjukkan secara tepat di mana persyaratan dan pelaksanaan tidak selaras.

  • Kelalaian — tindakan atau persyaratan wajib tidak ada.
  • Cabang yang salah — pelaksanaan mengikuti cabang prosedur yang tidak sesuai.
  • Kesalahan urutan — tindakan dilakukan tidak dalam urutan yang diwajibkan.
  • Tindakan berlebih — pelaksanaan mencakup tindakan di luar yang ditentukan.
  • Pelanggaran invarian — kondisi yang seharusnya tetap berlaku tidak dipatuhi.
  • Ketidakpatuhan terhadap persyaratan keluaran — hasil tidak memenuhi persyaratan format atau konten yang ditetapkan.

Kriteria: klasifikasi harus menunjukkan jenis kegagalan, bukan merangkum semua pelanggaran menjadi penilaian umum atas jawaban.

Temuan penelitian

Para penulis penelitian ContractEval membandingkan berbagai metode pemeriksaan pada kumpulan kontrak prosedural yang terkontrol. Graf acuan untuk eksekusi yang diharapkan dan yang diamati berhasil mendeteksi dan melokalisasi semua kegagalan struktural yang sengaja disisipkan.

Metode pemeriksaanHasil
Penilai LLM menilai jawaban atau mempertimbangkan jejakMelewatkan banyak kegagalan yang disisipkan
Pencocokan graf acuan dan graf hasil pengamatanMendeteksi dan melokalisasi semua kegagalan tersebut
Ekstraksi data dengan LLMMempertahankan sebagian besar sinyal, tetapi bergantung pada kalibrasi

Penelitian oleh Praphul Singh, Shanu Kumar, Akshat Agarwal, dan Ganesh Kumar dikirimkan ke arXiv pada 8 September 2026: ContractEval.

Kesimpulan: hasil penelitian berlaku untuk kumpulan data terkontrol; hasilnya tidak dapat diterapkan begitu saja pada semua skenario.

Batas pemeriksaan

ContractEval tidak menjamin bahwa sistem telah mengikuti prosedur. Penelitian ini membuat kepatuhan dapat diaudit, bukan menganggapnya sebagai kualitas yang tersirat dari jawaban akhir.

Dua kondisi penting saat memilih metode pemeriksaan:

  • Apakah tersedia representasi acuan untuk pelaksanaan yang diharapkan.
  • Apakah representasi tersebut dapat dicocokkan dengan bukti dalam jejak atau jawaban aktual.

Jika menggunakan ekstraksi data dengan LLM, sensitivitas hasil terhadap kalibrasi perlu diperhitungkan. Jawaban akhir saja tidak dapat menggantikan pemeriksaan bukti prosedural.

Kriteria praktis: anggap kepatuhan telah diverifikasi hanya jika persyaratan dicocokkan dengan pelaksanaan yang diamati.

Pertanyaan yang sering ditanyakan

Pemeriksaan tindakan agen AI: dari jawaban yang masuk akal hingga kepatuhan terhadap prosedur