SEATauBench: اختبار وكلاء الذكاء الاصطناعي بخمس لغات في جنوب شرق آسيا

25 سبتمبر 202615 الآراء

اختبر المؤلفون ثلاثة نماذج، مع تغيير لغة الحوار وتصميم الأدوات ومجال المهام تباعًا. وتُظهر النتائج أن الانتقال من الإنجليزية يظل قائمًا عند تغيير لغة التواصل، لكنه يتراجع بوضوح عند توطين الأدوات والسياق، لذا لا تعكس الاختبارات الإنجليزية أداء الوكلاء في المنطقة إلا بشكل محدود.

SEATauBench: اختبار وكلاء الذكاء الاصطناعي بخمس لغات في جنوب شرق آسيا

ما هو SEATauBench

SEATauBench هو أول نظام تقييم موجّه للوكلاء للذكاء الاصطناعي السيادي في جنوب شرق آسيا. وهو يكيّف Tau2-Bench لخمسة لغات: الصينية (الماندرين)، والفيتنامية، والتايلاندية، والإندونيسية، والفلبينية.

صُمّم المعيار لتقييم الوكلاء ضمن السياقات اللغوية والتخصصية في المنطقة. والمعيار العملي لتطبيقه هو مدى توافق اللغات التي يجري اختبارها مع الجمهور المستهدف.

ما الظروف التي تتغير أثناء التقييم

يعمل الباحثون على توطين سياق عمل الوكيل بصورة متدرجة. ويغيّرون ثلاثة عناصر:

  • لغة التفاعل بين المستخدم والوكيل؛
  • مواصفات الأدوات؛
  • المجالات التخصصية للمهام.

يتيح هذا التصميم اختبار ما هو أبعد من مجرد تغيير لغة الحوار. فهو يشمل أيضًا التغييرات في الأدوات وموضوعات المهام.

ما الذي أظهرته النتائج

قيّمت الدراسة ثلاثة نماذج. وقارن المؤلفون كيفية تغير قدرات الوكلاء باختلاف مستويات التوطين.

ظروف التقييمالنتيجة
تتغير لغة الحوار فقطتنتقل القدرات باللغة الإنجليزية بصورة جيدة إلى حدٍّ معقول
يُوطَّن سياق إضافيتنخفض الجودة والموثوقية بشكل حاد
يُكيَّف المجال التخصصي بالكاملتُلاحظ أكبر الخسائر

يشير المؤلفون إلى أن التقييم باللغة الإنجليزية فقط لا يتنبأ إلا بقدر محدود بقدرات الوكلاء بلغات جنوب شرق آسيا. لذلك، لا تحل نتائج الاختبار باللغة الإنجليزية محل الاختبار في ظروف موطَّنة.

ما الغرض من المعيار

يُقدَّم SEATauBench بوصفه معيارًا تشخيصيًا وخط أنابيب قابلًا لإعادة الاستخدام للتكييف. وهو مصمم لإنشاء وكلاء متعددي اللغات وموثوقين.

عند اختيار التقييم، من المهم مراعاة نطاق التوطين: لغة الحوار، ومواصفات الأدوات، والمجالات التخصصية. فاختبار تغيير اللغة وحده لا يعكس نتائج التكييف الكامل للسياق.

النشر والإصدارات

نُشرت الورقة في EMNLP Findings 2026. أُرسلت النسخة v1 في 27 يونيو 2026، وصدر آخر إصدار، v2، في 5 سبتمبر 2026.

معرّف الورقة: arXiv:2606.28715.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
SEATauBench: اختبار وكلاء الذكاء الاصطناعي بخمس لغات في جنوب شرق آسيا