Masalah apa yang ingin dijawab oleh penelitian ini
Para penulis menguji apakah model bahasa besar dapat menjadi cara yang dapat direproduksi dan diskalakan untuk mengevaluasi perbandingan penjelasan XAI.
Artikel “XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?” diterbitkan di arXiv dengan nomor arXiv:2609.09428. Artikel tersebut diajukan pada 8 September 2026.
Para penulisnya adalah Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein, dan Stefan Feuerriegel. Mereka memperkenalkan XAI-Arena — pendekatan berformat LLM-as-a-judge untuk mengevaluasi penjelasan dari berbagai dimensi.

Tujuan utama pendekatan ini adalah membandingkan kualitas penjelasan dengan mempertimbangkan kepentingan berbagai pemangku kepentingan. Panduan praktisnya: menilai bukan hanya satu sifat penjelasan, melainkan beberapa dimensi kualitas.
Kriteria apa saja yang diperhitungkan dalam evaluasi
Evaluasi mencakup delapan dimensi:
- kesederhanaan yang dirasakan — perceived simplicity;
- kejelasan — clarity;
- kesesuaian dengan tugas — task adequacy;
- kalibrasi kepercayaan — trust calibration;
- kemampuan untuk ditindaklanjuti — actionability;
- transparansi — transparency;
- kesetiaan — faithfulness;
- interpretabilitas keseluruhan — overall interpretability.
Kumpulan kriteria ini memungkinkan penjelasan ditinjau dari berbagai sisi. Saat memilih skema evaluasi, penting untuk mempertimbangkan dimensi mana yang sesuai dengan tugas perbandingan.
Seberapa selaras penilaian LLM dengan penilaian manusia
Para penulis menguji kesesuaian penilaian LLM dengan penilaian manusia. Pengujian menunjukkan hubungan positif yang kuat: Spearman’s rho = .693, p < .001.
Hasil ini menunjukkan keselarasan penilaian, tetapi bukan kesamaan sepenuhnya. Karena itu, LLM dapat dipandang sebagai dasar untuk evaluasi perbandingan, bukan sebagai pengganti yang sepenuhnya setara dengan penilaian manusia.
Perbandingan apa yang cocok menggunakan pendekatan ini
Para penulis membandingkan metode XAI pada berbagai kumpulan data, model pembelajaran mesin, dan persona pemangku kepentingan. Pengujian ini mencakup beberapa konteks evaluasi, bukan satu rangkaian kondisi yang tetap.
Para penulis menyimpulkan bahwa penilaian berbasis LLM mengungkap perbedaan sistematis dalam kualitas penjelasan XAI dan menyediakan dasar perbandingan yang dapat diskalakan serta direproduksi. Kriteria praktis untuk memilihnya adalah kebutuhan membandingkan penjelasan berdasarkan beberapa dimensi dan dengan mempertimbangkan berbagai pemangku kepentingan.



