Evaluasi agen AI tanpa akses ke mekanisme internalnya

28 September 202611 tampilan

Artikel ini menjelaskan metode pengujian sistem otonom berdasarkan tujuh kategori ancaman: generator SAGE-RT membuat 120 skenario serangan untuk setiap kategori. Pengujian CrewAI dan AutoGen menunjukkan tingkat kerentanan perilaku agen yang tinggi, serta risiko terhadap tata kelola dan privasi, terutama dalam konfigurasi multiagen.

Evaluasi agen AI tanpa akses ke mekanisme internalnya

Apa arti evaluasi black-box

Pendekatan black-box mengevaluasi perilaku sistem agen yang dapat diamati. Untuk melakukan pemeriksaan, hanya diperlukan deskripsi dasar sistem; akses istimewa tidak diperlukan.

Pendekatan ini menghubungkan perilaku yang dapat diamati dengan kategori risiko. Pendekatan ini memungkinkan evaluasi tanpa akses ke mekanisme internal.

Kriteria praktis: pilih pemeriksaan black-box jika akses istimewa tidak tersedia, tetapi deskripsi dasar sistem dapat diberikan.

Apa saja yang termasuk dalam pemeriksaan

Kerangka kerja ini menggabungkan taksonomi risiko dan red teaming otomatis. Para penulis mengidentifikasi tujuh domain yang menghubungkan perilaku agen dengan kategori risiko.

SAGE-RT membuat 120 skenario adversarial untuk setiap domain. Evaluasi ini juga mencakup validasi manusia dan penilai LLM.

  • Taksonomi: tujuh domain risiko.
  • Skenario: red teaming otomatis untuk setiap domain.
  • Pemeriksaan hasil: validasi manusia dan penilai LLM.

Kriteria pemilihan: metode ini sesuai dengan tugas jika diperlukan pembuatan skenario otomatis yang kemudian diperiksa oleh manusia dan penilai LLM.

Hasil pemeriksaan

Para penulis menguji dua arsitektur agen — CrewAI dan AutoGen — serta empat model dasar.

MetrikHasil
Rata-rata risiko tata kelola56,25%
Risiko privasi dalam konfigurasi multi-agen65%
Kerentanan perilaku agenhingga 85%

Nilai-nilai ini menggambarkan metrik yang berbeda. Nilai-nilai tersebut tidak seharusnya digabungkan menjadi satu penilaian risiko keseluruhan.

Kriteria praktis: saat membandingkan hasil, penting untuk mempertahankan kategori metrik asli dan konteks konfigurasi.

Mengapa evaluasi satu langkah tidak cukup

Para penulis mencatat bahwa evaluasi standar masih dilakukan dalam satu langkah. Evaluasi tersebut tidak mengungkap kerentanan yang muncul dalam rangkaian tindakan.

Risiko berkaitan dengan cara agen bekerja:

  • membaca masukan yang tidak tepercaya;
  • memanggil alat dengan izin nyata;
  • bertindak secara otonom.

Kombinasi faktor-faktor ini memperluas permukaan keamanan. Kriteria evaluasi: periksa bukan hanya satu jawaban, tetapi juga perilaku agen dalam beberapa langkah.

Kapan memilih pendekatan black-box

Pendekatan ini sesuai untuk mengevaluasi risiko jika akses internal ke agen tidak tersedia. Deskripsi dasar sistem sudah cukup.

Pendekatan ini juga berguna ketika pemeriksaan perlu menghubungkan perilaku yang dapat diamati dengan kategori risiko. Evaluasi satu langkah tidak cukup untuk menemukan kerentanan multi-langkah.

Kriteria praktis: pilih pendekatan ini jika tugasnya mengharuskan pemeriksaan perilaku tanpa akses istimewa dan mempertimbangkan risiko yang muncul dalam beberapa langkah.

Pertanyaan yang sering ditanyakan

Evaluasi agen AI tanpa akses ke mekanisme internalnya