Evaluasi penjelasan XAI menggunakan LLM: pengujian kesesuaian dengan manusia

27 September 202641 tampilan

Artikel ini memperkenalkan XAI-Arena — sistem yang membandingkan penjelasan AI berdasarkan beberapa kriteria dengan mempertimbangkan berbagai model dan kepentingan pengguna. Penilaian LLM menunjukkan keselarasan yang signifikan dengan penilaian manusia (ρ Spearman = 0,693), yang menunjukkan bahwa analisis komparatif terhadap penjelasan dapat diskalakan.

Evaluasi penjelasan XAI menggunakan LLM: pengujian kesesuaian dengan manusia

Masalah apa yang ingin dijawab oleh penelitian ini

Para penulis menguji apakah model bahasa besar dapat menjadi cara yang dapat direproduksi dan diskalakan untuk mengevaluasi perbandingan penjelasan XAI.

Artikel “XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?” diterbitkan di arXiv dengan nomor arXiv:2609.09428. Artikel tersebut diajukan pada 8 September 2026.

Para penulisnya adalah Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein, dan Stefan Feuerriegel. Mereka memperkenalkan XAI-Arena — pendekatan berformat LLM-as-a-judge untuk mengevaluasi penjelasan dari berbagai dimensi.

Tujuan utama pendekatan ini adalah membandingkan kualitas penjelasan dengan mempertimbangkan kepentingan berbagai pemangku kepentingan. Panduan praktisnya: menilai bukan hanya satu sifat penjelasan, melainkan beberapa dimensi kualitas.

Kriteria apa saja yang diperhitungkan dalam evaluasi

Evaluasi mencakup delapan dimensi:

  • kesederhanaan yang dirasakan — perceived simplicity;
  • kejelasan — clarity;
  • kesesuaian dengan tugas — task adequacy;
  • kalibrasi kepercayaan — trust calibration;
  • kemampuan untuk ditindaklanjuti — actionability;
  • transparansi — transparency;
  • kesetiaan — faithfulness;
  • interpretabilitas keseluruhan — overall interpretability.

Kumpulan kriteria ini memungkinkan penjelasan ditinjau dari berbagai sisi. Saat memilih skema evaluasi, penting untuk mempertimbangkan dimensi mana yang sesuai dengan tugas perbandingan.

Seberapa selaras penilaian LLM dengan penilaian manusia

Para penulis menguji kesesuaian penilaian LLM dengan penilaian manusia. Pengujian menunjukkan hubungan positif yang kuat: Spearman’s rho = .693, p < .001.

Hasil ini menunjukkan keselarasan penilaian, tetapi bukan kesamaan sepenuhnya. Karena itu, LLM dapat dipandang sebagai dasar untuk evaluasi perbandingan, bukan sebagai pengganti yang sepenuhnya setara dengan penilaian manusia.

Perbandingan apa yang cocok menggunakan pendekatan ini

Para penulis membandingkan metode XAI pada berbagai kumpulan data, model pembelajaran mesin, dan persona pemangku kepentingan. Pengujian ini mencakup beberapa konteks evaluasi, bukan satu rangkaian kondisi yang tetap.

Para penulis menyimpulkan bahwa penilaian berbasis LLM mengungkap perbedaan sistematis dalam kualitas penjelasan XAI dan menyediakan dasar perbandingan yang dapat diskalakan serta direproduksi. Kriteria praktis untuk memilihnya adalah kebutuhan membandingkan penjelasan berdasarkan beberapa dimensi dan dengan mempertimbangkan berbagai pemangku kepentingan.

Pertanyaan yang sering ditanyakan

Evaluasi penjelasan XAI menggunakan LLM: pengujian kesesuaian dengan manusia