Aegis: pengaman untuk agen AI — saran model melewati lapisan keputusan tepercaya

25 Agustus 202617 tampilan

Sistem Aegis yang baru menangkap permintaan agen ke alat dan menyaringnya melalui mekanisme verifikasi eksternal sebelum benar-benar dieksekusi. Dalam eksperimen pada korpus skenario khusus, sistem ini berhasil mencapai nol efek samping berisiko, sementara batasan prompt biasa tidak memberikan jaminan tersebut.

Aegis: pengaman untuk agen AI — saran model melewati lapisan keputusan tepercaya

Masalah: Dari Teks ke Aksi

Sistem AI modern dapat melakukan lebih dari sekedar menghasilkan tanggapan - mereka dapat melakukan operasi dengan alat-alat eksternal: memodifikasi berkas, mengirim pesan, peluncuran tugas, dan mengubah keadaan arus kerja. Hal ini juga mengubah fokus keamanan: ketika teks berbahaya digunakan untuk menjadi ancaman utama, sekarang berbahaya operasional efek samping. Tindakan tingkat-level tradisional dapat mempengaruhi perilaku model, tapi mereka tidak membuat batas eksekusi yang nyata: model dapat mengusulkan aksi, dan akan dieksekusi secara langsung, tanpa verifikasi tambahan.

Di sinilah Aegis Datang ke dalam bermain, menawarkan pendekatan mendasar yang berbeda untuk manajemen agen. Alih-alih mengandalkan model "perilaku baik", Aegis memperlakukan model keluaran sebagai proposal yang melewati lapisan keputusan terpercaya sebelum alat dipanggil.

Bagaimana Aegis Works: Model Propose, Lingkungan Memutuskan

Prinsip kunci Aegis dapat dirangkum sebentar: model mengusulkan, lingkungan eksekusi terpercaya memutuskanIni pemerintahan waktu-jalan - kontrol pada tahap eksekusi, bukan pada tahap generasi.

Tiga Lapisan Perlindungan

Aegis mengevaluasi setiap proposal dari model di beberapa dimensi:

  • Komplemen dengan kebijakan aktif: sistem memeriksa tindakan yang diusulkan terhadap keadaan kebijakan saat ini untuk menyaring operasi dilarang.
  • Verifikasi Provenance: sisi server terpercaya mengkonfirmasi bahwa tindakan itu benar-benar berasal dari proses yang berwenang dan belum dirusak sepanjang jalan.
  • Perilaku tertutup: jika sistem tidak dapat secara tidak ambigu mengkonfirmasi tindakan aman, itu menolak untuk mengeksekusi itu - berarti prinsip baku adalah "segala sesuatu yang tidak secara eksplisit diperbolehkan dilarang".

Mekanisme resolusi gaya Senate layak mendapat perhatian khusus. Ketika sebuah proposal masuk ke kategori yang diperdebatkan, jalur otorisasi quorum berbasis dipicu bukan keputusan sepihak. Ini berarti tidak ada komponen sistem tunggal dapat membuat keputusan sendiri - konsensus dari beberapa peserta diperlukan. Pendekatan ini mengesampingkan keputusan satu sisi dan mengurangi risiko bahwa kerentanan tunggal atau kesalahan menyebabkan tindakan berbahaya.

Evaluasi Eksperimental: Apa Tes Ditunjukkan

Untuk memverifikasi efektivitas Aegis, penulis menjalankan serangkaian percobaan pada kotak pasir reproduksif corpus. Tes ini digunakan lima menjalankan keluarga, 42 tugas, tiga kondisi, dan sepuluh pengulangan setiap keluarga. Total volume data adalah 6,300 baris log.

Hasil dalam Angka

  • Dalam pendekatan kebijakan, 79 baris dengan kebocoran berisiko terdeteksi sepanjang jalur perbandingan.
  • Di bawah pemerintahan Aegis (2.100 baris), nol aplikasi dari perangkat mock diatur dan nol diatur penyelesaian dengan efek samping berisiko direkam.
  • Semua 1.832 baris dijalankan di bawah pemerintahan Aegis diawetkan terpercaya, sistematis-disetujui provenance.
  • Semua baris 1.019 diselesaikan melalui "senat" telah quorum dan akhir ditandatangani pemilih - menghitung data.

Kesimpulan dan Batas

Penulis studi menekankan nuansa penting: hasil yang diperoleh Jangan membuktikan keselamatan umum agen otonomIni adalah klaim sistemik yang lebih sempit - dalam evaluasi kotak pasir corpus, mengatur batas-batas aksi pada tahap eksekusi mencegah mengamati proposal berisiko dari berubah menjadi efek samping yang diatur.

Ini berarti Aegis bekerja seperti sekering pengaman: itu tidak membuat model "aman oleh alam", tapi menciptakan penghalang yang dapat diandalkan antara niat model dan tindakan yang sebenarnya. Pendekatan ini tampak menjanjikan penggunaan praktis dalam sistem di mana agen bekerja dengan alat-alat kritis - tetapi membutuhkan lebih lanjut penelitian pada skenario lebih luas dan lebih beragam.

Pertanyaan yang sering ditanyakan

Aegis - Sistem Keamanan untuk ulasan AI Agents