Keyakinan bukan berarti kebenaran: bagaimana LLM gagal dalam kalibrasi pada permainan dengan bentuk tersembunyi

18 September 202611 tampilan

Preprint baru dari arXiv menguji apakah penilaian diri model bahasa pada saat pemilihan langkah dapat diandalkan. Dalam varian catur dengan status "raja" tersembunyi, probabilitas yang dinyatakan ≥0,5 hanya cocok dengan posisi bidak sebenarnya sekali dari 62 percobaan, dan hampir seluruh defisit kalibrasi justru terjadi pada episode-episode tersebut.

Keyakinan bukan berarti kebenaran: bagaimana LLM gagal dalam kalibrasi pada permainan dengan bentuk tersembunyi

Pemberian label “saya yakin” pada jawaban model bukanlah sebuah pengukuran, melainkan sekadar klaim lain yang memerlukan verifikasi tersendiri. Selama penilaian semacam ini masih diintegrasikan ke dalam logika agen, kita perlu memahami sejauh mana penilaian tersebut dapat dipercaya.

Mengapa keyakinan mulai dipertanyakan

Sistem agen semakin sering dirancang sedemikian rupa sehingga langkah berikutnya dipilih dengan mempertimbangkan penilaian diri model: jika model menyatakan keyakinan tinggi, tindakan dijalankan; jika rendah, manusia atau alat lain dilibatkan. Skema ini hanya berfungsi dengan satu syarat: pada saat tindakan diambil, keyakinan yang dinyatakan harus kurang lebih sesuai dengan frekuensi keberhasilan yang sebenarnya.

Karya Bhushan Kashinath Joshi (arXiv:2608.24691, diajukan 25 Agustus 2026) menguji justru asumsi ini — dan dalam situasi di mana kesalahan langsung terlihat dan tidak bisa diatribusikan pada nasib buruk.

Arena uji: catur dengan raja tersembunyi

Catur klasik kurang cocok untuk pengujian semacam ini: semuanya terbuka, dan “keyakinan” tak terhindarkan tercampur dengan kekuatan permainan. Karena itu, dipilih varian dengan informasi tersembunyi, di mana status raja dapat secara rahasia dan berulang kali berpindah dari satu bidak ke bidak lain. Pemain tidak tahu di mana target utama berada saat ini dan terpaksa bertindak berdasarkan dugaan.

Detail kunci metodologi: pada setiap langkah, agen secara terpisah ditanya tentang distribusi probabilitas mengenai bidak lawan mana yang secara tersembunyi menyandang status raja. Hal ini ditanyakan secara independen dari langkah itu sendiri — agar tidak mencampuradukkan “ke mana saya melangkah” dan “apa yang saya yakini”. Posisi sebenarnya direkonstruksi setelah pertandingan dan dibandingkan dengan angka yang dinyatakan.

Satu jawaban benar dari enam puluh dua

Hasil utamanya tampak seperti kecelakaan. Dalam dua seri pertandingan yang independen, penangkapan yang dilakukan dengan keyakinan yang dinyatakan tidak di bawah 0,5 terhadap posisi bidak tersembunyi ternyata benar hanya dalam 1 dari 62 kasus. Jika dikonversi ke persentase, probabilitas “lebih mungkin ya daripada tidak” yang dinyatakan berujung pada keberhasilan sekitar satu setengah persen situasi — selisihnya mencapai beberapa orde, bukan sekadar beberapa persen.

Pada saat itu, defisit kalibrasi hampir seluruhnya terkonsentrasi pada peristiwa-peristiwa ini: 99,3% pada seri awal dan 98,7% pada seri ulangan. Dengan kata lain, masalahnya tidak tersebar merata di seluruh permainan — masalahnya terkonsentrasi pada momen-momen ketika model paling lantang menyatakan kebenarannya, dan justru ketika tindakan berisiko bergantung padanya.

Pola yang sama pada konfigurasi lain

Penulis tidak berhenti pada satu model. Pengujian mencakup empat konfigurasi lain, termasuk penyedia kedua. Gambarannya terulang dalam bentuk yang lebih lemah dan tersusun dalam urutan yang konsisten — tetapi di sini ketelitian penting: hanya estimasi titik yang tetap dapat dibandingkan, sementara sebagian besar perbedaan antarpasangan pada ukuran sampel seperti ini secara statistik tidak dapat dibedakan.

Penulis sendiri menggambarkan hal ini sebagai cakupan temuan (scope), bukan sebagai bukti bahwa tingkat kemampuan model memprediksi kalibrasinya. Artinya, ini bukan “semakin pintar model, semakin baik ia menilai dirinya sendiri” dan juga bukan pernyataan sebaliknya — fenomena ini sekadar muncul lebih luas daripada satu sistem tertentu.

Anggaran penalaran menggeser metrik lebih dari yang terlihat

Alur terpisah yang kurang menyenangkan adalah perbandingan model yang sama dengan peringkat eksternal yang tidak berubah di papan peringkat. Hanya anggaran penalaran (deliberation budget) yang berubah, yaitu berapa banyak “waktu untuk berpikir” yang dihabiskan model. Nah, pergeseran ini mengubah metrik kalibrasi hampir sebesar kesenjangan besar antara model yang berbeda.

Kesimpulan praktisnya sederhana dan tidak nyaman: berpegang pada posisi di papan peringkat saat memilih sistem untuk tugas dengan penilaian risiko tidak dapat dilakukan. Dalam model yang sama, variasi yang disebabkan oleh pengaturan sebanding dengan apa yang biasa kita anggap sebagai keunggulan serius suatu model atas model lain.

Metrik tradisional bisa menunjukkan hal sebaliknya

Hasil lain menyerang cara pengukuran yang biasa. Pada seat tertentu, sumbu evaluasi standar — legalitas langkah, biaya, latensi, proporsi pertandingan yang diselesaikan — dapat sepenuhnya menyimpang dari kualitas keyakinan model. Konfigurasi yang unggul pada semua indikator tradisional sekaligus justru menunjukkan kualitas keyakinan terburuk di antara semua yang diuji.

Di sini mudah salah dalam menafsirkan: ini bukan soal bahwa akurasi dan murah itu sendiri berbahaya. Ini soal bahwa kumpulan metrik yang biasanya kita anggap menyeluruh sama sekali tidak mengukur sifat yang kita minati — metrik itu mengukur hal lain.

Mengapa penilaian “berdasarkan hasil” tidak akan menangkap apa pun

Konsekuensi yang paling tidak menyenangkan adalah penyamaran. Model dengan pola yang dijelaskan tetap bisa memenangkan pertandingan yang sama, yang tentangnya ia membangun keyakinan yang keliru. Hasilnya baik, tetapi gambaran dunia internalnya salah.

Dari sini dapat disimpulkan bahwa pengujian yang semata-mata berdasarkan hasil (outcome-only) pada prinsipnya tidak mendeteksi kegagalan semacam ini: kemenangan menutup persoalan, dan titik lemah tetap ada dalam sistem sampai kesempatan berikutnya — hanya saja pada tugas di mana hasil yang benar mungkin tidak terjadi.

Apa yang harus dilakukan dalam praktik

Beberapa kesimpulan praktis yang langsung mengikuti dari hasil tersebut.

  • Mintalah model memberikan distribusi probabilitasnya sendiri atas ketidakpastian kunci — dan simpan secara terpisah dari tindakan yang dipilih. Tanpa memisahkan kedua hal ini, kalibrasi tidak dapat dinilai.
  • Bandingkan keyakinan yang dinyatakan dengan frekuensi keberhasilan yang sebenarnya pada data Anda sendiri, jangan percaya angka dari kartu model. Dalam permainan dengan bidak tersembunyi, selisihnya ternyata sangat besar, dan tidak ada yang menjamin bahwa dalam tugas terapan selisihnya akan lebih kecil.
  • Ujilah ambang batas di mana sistem menyerahkan keputusan kepada manusia secara terpisah dari akurasi umum. Kesalahan justru menumpuk di zona keyakinan yang dinyatakan tinggi.
  • Tetapkan anggaran penalaran dalam setiap perbandingan. Jika tidak, Anda mengukur pengaturan, bukan model.
  • Jangan anggap kemenangan atau hasil yang sukses sebagai bukti kebenaran keyakinan internal sistem.

Makna umum dari temuan ini bukanlah bahwa model itu “buruk”. Lebih tepatnya, keyakinan dan kebenaran adalah dua indikator yang berbeda, dan yang pertama belum layak menggantikan yang kedua. Selama arsitektur agen dibangun di sekitar penilaian diri, perbedaan ini harus diukur secara eksplisit.

Pertanyaan yang sering ditanyakan

Keyakinan bukan berarti kebenaran: bagaimana LLM gagal dalam kalibrasi pada permainan dengan bentuk tersembunyi