Lenta

37 bahan

Urutkan menurut
Berita10 September 2026

Benchmark GIM Baru: Menguji LLM pada Perpaduan Berbagai Keterampilan Kognitif

Para peneliti mengusulkan pendekatan yang mengevaluasi model bukan berdasarkan volume pengetahuan atau terlepas dari realitas, melainkan melalui tugas-tugas yang menuntut penalaran, kontrol konteks, dan pengerjaan dengan batasan secara bersamaan. Tolok ukur ini mencakup 820 tugas orisinal, dan para penulisnya juga meneliti bagaimana pengaturan "refleksi" dan parameter model lainnya memengaruhi hasil.

Benchmark GIM Baru: Menguji LLM pada Perpaduan Berbagai Keterampilan Kognitif
Baca
Berita9 September 2026

Filter Keamanan LLM Gagal di Luar Bahasa Inggris: Bagaimana Model Memperkuat Stereotip dalam Bahasa Lain

Para peneliti mengungkap ketimpangan lintas bahasa yang serius dalam keamanan model bahasa besar: penyelarasannya sebagian besar disetel ke bahasa Inggris, sehingga pada bahasa lain model lebih mudah melewati batasan dan mereproduksi prasangka berbahaya. Tolok ukur baru INCLUDE, yang diuji pada sepuluh model dan enam bahasa India, menunjukkan bahwa tingkat bias berbeda secara signifikan tergantung pada bahasa dan jenis model.

Filter Keamanan LLM Gagal di Luar Bahasa Inggris: Bagaimana Model Memperkuat Stereotip dalam Bahasa Lain
Baca