Persetujuan tinggi belum berarti validitas: LLM sebagai juri diusulkan diuji terhadap sensitivitas pada perubahan makna

17 September 202615 tampilan

Peneliti dari Universitas Hong Kong mengusulkan untuk menilai LLM-sebagai-hakim tidak hanya berdasarkan stabilitas putusannya, tetapi juga berdasarkan apakah model tersebut menyadari suntingan yang benar-benar mengubah makna teks yang dinilai. Dalam eksperimen dengan 7 hakim dan 4 domain, putusan hampir tidak bergeser akibat perubahan kosmetik (S = 0.945), namun lemah merespons intervensi makna (R = 0.319), dan sebagian kumpulan label publik dapat direproduksi oleh fitur permukaan yang sederhana.

Persetujuan tinggi belum berarti validitas: LLM sebagai juri diusulkan diuji terhadap sensitivitas pada perubahan makna

Tepat dua angka biasanya masuk ke dalam laporan kualitas evaluasi otomatis: seberapa cocok putusan model dengan penilaian manusia dan seberapa stabil putusan itu terhadap perubahan kecil seperti pengacakan urutan opsi atau parafrase prompt. Sebuah karya baru berargumen bahwa itu tidak cukup — dan mengusulkan cara memandang juri secara berbeda.

Kesesuaian menjawab pertanyaan yang salah

Kesesuaian dan ketahanan terhadap gangguan permukaan adalah soal reliabilitas. Alat ukur yang andal menghasilkan hasil yang stabil, tetapi stabilitas itu sendiri tidak mengatakan apa pun tentang apakah alat tersebut mengukur besaran yang tepat. Termometer yang selalu menunjukkan 20 derajat sangat andal dan sama sekali tidak berguna.

Para penulis artikel "A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation" (Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong; arXiv:2608.24419, cs.AI, diajukan 25 Agustus 2026; 39 halaman, 10 gambar, 11 tabel) memindahkan pembahasan ke ranah validitas konstruk: apakah penilaian sesuai dengan konsep yang katanya diukur. Bagi juri LLM, ini berarti hal sederhana — juri harus bereaksi terhadap makna, bukan terhadap bentuk.

Profil dari dua dimensi

Alih-alih satu metrik, diusulkan profil dari dua probabilitas.

S — invariansi. Seberapa sering putusan tetap sama jika penyuntingan mempertahankan makna: paragraf diacak, gaya diubah, basa-basi dihapus. Juri yang baik di sini tidak boleh goyah.

R — sensitivitas konstruk. Seberapa sering putusan berubah jika penyuntingan minimal tetapi makna tersentuh: ditambahkan catatan, pernyataan dilemahkan, cakupan dipersempit. Juri yang baik di sini wajib bereaksi.

Klaim utama artikel ini: S dan R independen, dan tidak ada ringkasan skalar yang mempertahankan semua perbandingan yang relevan. Sederhananya, tidak mungkin merata-ratakan dua angka dan mendapatkan satu angka yang jujur — juri dengan S tinggi dan R rendah serta juri dengan S rendah dan R tinggi bisa menghasilkan "nilai rata-rata" yang sama, namun tetap merupakan instrumen yang secara mendasar berbeda.

Bagaimana ini diuji

Rancangan eksperimennya jauh lebih ketat daripada biasanya untuk karya semacam ini.

  • 7 juri dan 4 domain — jadi bukan hanya satu model dan bukan hanya satu jenis tugas yang diuji.
  • 7 jenis intervensi pengubah konstruk melawan 5 kontrol yang hanya menyentuh register dan tidak mengubah makna.
  • Arah penyuntingan — apakah mengubah konstruk atau tidak — ditentukan oleh anotator manusia, bukan label bawaan.
  • Generasi, verifikasi, dan penjurian dipegang oleh keluarga model yang tidak saling tumpang tindih. Ini detail penting: juri tidak menilai teks yang dihasilkan oleh dirinya sendiri, dan tidak memeriksa penyuntingan yang ia ciptakan sendiri.

Poin terakhir layak mendapat perhatian tersendiri. Ketika generator, verifikator, dan juri adalah model yang sama, kesesuaian yang tinggi bisa jadi artefak dari bias bersama, bukan tanda kualitas.

Invariansi hampir sempurna, sensitivitas — tidak

Di sinilah bagian paling menarik dimulai. Pada ambang invariansi yang disepakati S ≥ 0.90, para juri rata-rata menunjukkan S = 0.945. Angka yang biasanya memang menjadi target dalam pelaporan.

Sensitivitasnya sendiri — R = 0.319. Interpretasi kasarnya: kira-kira dalam dua dari tiga kasus, juri tidak menyadari penyuntingan yang mengubah makna. Hasil yang secara formal sempurna pada invariansi hidup berdampingan dengan respons yang sangat lemah terhadap isi.

Skala dan kekuatan — bukan hal yang sama

Sensitivitas yang lemah terdistribusi secara tidak merata. Ketika penyuntingan mengubah skala pernyataan, responsnya lebih tinggi: R_scope = 0.383. Ketika penyuntingan mengubah kekuatan — lebih lemah: R_strength = 0.262. Selisihnya sebesar +0.121, dan tandanya sama untuk ketujuh juri.

Jadi ini bukan soal variasi acak antar model, melainkan ciri yang sistematis. Juri lebih baik menangkap perluasan dan penyempitan cakupan daripada pergeseran pada skala keyakinan — "mungkin" versus "pasti", "dapat membantu" versus "membantu". Untuk praktik, ini kabar yang tidak menyenangkan: justru gradasi semacam inilah yang paling sering perlu dibedakan.

Label manusia juga perlu diperiksa

Alur terpisah — lima kumpulan label publik yang digunakan sebagai acuan. Prediktor yang bersandar semata-mata pada ciri permukaan teks, dalam mode berpasangan mereproduksi 55–67% label. Dalam kasus MT-Bench, heuristik permukaan cocok dengan 67.4% suara manusia.

Kesimpulannya terasa tidak nyaman. Jika aturan sederhana yang tidak memahami apa pun tentang isi dapat mereplikasi dua pertiga keputusan manusia, maka label semacam itu buruk dalam memisahkan makna dari bentuk — dan yang perlu divalidasi bukan hanya jurinya, tetapi juga kumpulan data yang digunakan untuk mengujinya.

Apa yang harus dilakukan

Para penulis tidak mengusulkan mengganti juri LLM dengan sesuatu yang lain — mereka mengusulkan mengubah pelaporan dan prosedur pengujian.

Pelaporan bersama. S dan R dipublikasikan berdampingan, bukan diringkas menjadi satu angka. Pembaca laporan langsung melihat di mana juri mengalami kegagalan.

Audit kumpulan data validasi. Sebelum mempercayai kesesuaian dengan label manusia, ada baiknya memeriksa seberapa dapat diprediksi label tersebut tanpa memahami teks. Jika sangat dapat diprediksi — kepercayaan terhadapnya terlalu tinggi.

Pemisahan peran. Generasi, verifikasi, dan penjurian pada keluarga model yang berbeda mengurangi risiko bahwa invariansi tinggi ternyata merupakan akibat dari titik buta bersama.

Gagasan utama

Kesesuaian yang tinggi adalah soal stabilitas, bukan soal kebenaran. Juri yang sama yakinnya menjatuhkan putusan baik sebelum maupun sesudah penyuntingan makna bukanlah "stabil", melainkan tidak teliti. Selama dalam laporan hanya ada satu angka, kedua kasus ini tidak dapat dibedakan — dan justru karena itulah profil dari dua dimensi tampak bukan sebagai komplikasi, melainkan sebagai kejujuran yang minimal diperlukan.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
Persetujuan tinggi belum berarti validitas: LLM sebagai juri diusulkan diuji terhadap sensitivitas pada perubahan makna