SEATauBench: Menguji agen AI dalam lima bahasa Asia Tenggara

25 September 202615 tampilan

Para penulis menguji tiga model dengan mengubah bahasa dialog, konfigurasi alat, dan bidang tugas secara bertahap. Hasilnya menunjukkan bahwa transfer dari bahasa Inggris tetap bertahan saat bahasa komunikasi berubah, tetapi menurun secara signifikan ketika alat dan konteks dilokalkan. Karena itu, pengujian berbahasa Inggris kurang mencerminkan kinerja agen di kawasan tersebut.

SEATauBench: Menguji agen AI dalam lima bahasa Asia Tenggara

Apa itu SEATauBench

SEATauBench adalah sistem evaluasi pertama yang berorientasi pada agen untuk AI berdaulat di Asia Tenggara. Sistem ini mengadaptasi Tau2-Bench untuk lima bahasa: Mandarin, Vietnam, Thailand, Indonesia, dan Filipina.

Benchmark ini dirancang untuk mengevaluasi agen dalam konteks bahasa dan bidang di kawasan tersebut. Kriteria praktis untuk menggunakannya adalah kesesuaian bahasa yang diuji dengan audiens sasaran.

Kondisi apa saja yang berubah dalam evaluasi

Peneliti secara bertahap melokalkan konteks kerja agen. Mereka mengubah tiga elemen:

  • bahasa interaksi antara pengguna dan agen;
  • spesifikasi alat;
  • bidang tugas.

Desain ini memungkinkan pengujian yang tidak hanya mencakup perubahan bahasa dialog. Desain ini juga mencakup perubahan alat dan topik tugas.

Apa yang ditunjukkan oleh hasil

Penelitian ini mengevaluasi tiga model. Para penulis membandingkan perubahan kemampuan agen pada berbagai tingkat lokalisasi.

Kondisi evaluasiHasil
Hanya bahasa dialog yang berubahKemampuan dalam bahasa Inggris cukup baik ditransfer
Konteks tambahan dilokalkanKualitas dan ketahanan menurun tajam
Bidang tugas diadaptasi sepenuhnyaTerlihat penurunan terbesar

Para penulis mencatat bahwa evaluasi hanya dalam bahasa Inggris memiliki keterbatasan dalam memprediksi kemampuan agen dalam bahasa-bahasa Asia Tenggara. Karena itu, hasil pengujian dalam bahasa Inggris tidak menggantikan pengujian dalam kondisi yang dilokalkan.

Kegunaan benchmark

SEATauBench diperkenalkan sebagai benchmark diagnostik dan alur kerja adaptasi yang dapat digunakan kembali. Tujuannya adalah untuk membuat agen multibahasa yang andal.

Saat memilih evaluasi, cakupan lokalisasi penting untuk diperhatikan: bahasa dialog, spesifikasi alat, dan bidang tugas. Pengujian yang hanya mengubah bahasa tidak mencerminkan hasil adaptasi konteks secara menyeluruh.

Publikasi dan versi

Makalah ini diterbitkan di EMNLP Findings 2026. Versi v1 dikirimkan pada 27 Juni 2026, sedangkan revisi terakhir v2 dirilis pada 5 September 2026.

ID makalah: arXiv:2606.28715.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
SEATauBench: Menguji agen AI dalam lima bahasa Asia Tenggara