SEATauBench: দক্ষিণ-পূর্ব এশিয়ার পাঁচটি ভাষায় AI এজেন্টদের পরীক্ষা

25 সেপ্টেম্বর 2026১৫ প্রদর্শন

লেখকেরা তিনটি মডেল যাচাই করেছেন; এ সময় ধারাবাহিকভাবে সংলাপের ভাষা, টুলের বিন্যাস এবং কাজের বিষয়বস্তু বদলেছেন। ফলাফল দেখায়: ইংরেজি থেকে স্থানান্তর যোগাযোগের ভাষা বদলালেও বজায় থাকে, তবে টুল ও প্রেক্ষাপট স্থানীয়করণ করলে তা উল্লেখযোগ্যভাবে খারাপ হয়। তাই ইংরেজি পরীক্ষা কোনো অঞ্চলে এজেন্টদের কার্যকারিতা যথাযথভাবে তুলে ধরে না।

SEATauBench: দক্ষিণ-পূর্ব এশিয়ার পাঁচটি ভাষায় AI এজেন্টদের পরীক্ষা

SEATauBench কী

SEATauBench হলো দক্ষিণ-পূর্ব এশিয়ায় সার্বভৌম AI-এর জন্য এজেন্ট-কেন্দ্রিক প্রথম মূল্যায়ন ব্যবস্থা। এটি পাঁচটি ভাষার জন্য Tau2-Bench-কে অভিযোজিত করে: চীনা (ম্যান্ডারিন), ভিয়েতনামি, থাই, ইন্দোনেশীয় এবং ফিলিপিনো।

এই বেঞ্চমার্কটি অঞ্চলের ভাষাগত ও বিষয়ভিত্তিক প্রেক্ষাপটে এজেন্টদের মূল্যায়নের জন্য তৈরি। এটি প্রয়োগের একটি ব্যবহারিক মানদণ্ড হলো, যাচাই করা ভাষাগুলো লক্ষ্য শ্রোতাদের সঙ্গে সামঞ্জস্যপূর্ণ কি না।

মূল্যায়নে কোন শর্তগুলো পরিবর্তিত হয়

গবেষকেরা ধারাবাহিকভাবে এজেন্টের কাজের প্রেক্ষাপট স্থানীয়করণ করেন। তাঁরা তিনটি উপাদান পরিবর্তন করেন:

  • ব্যবহারকারী ও এজেন্টের মধ্যে যোগাযোগের ভাষা;
  • টুলের স্পেসিফিকেশন;
  • কাজের বিষয়ভিত্তিক ক্ষেত্র।

এই নকশার মাধ্যমে শুধু কথোপকথনের ভাষা পরিবর্তনের বিষয়টিই যাচাই করা হয় না। এতে টুল ও কাজের বিষয়বস্তুর পরিবর্তনও অন্তর্ভুক্ত রয়েছে।

ফলাফলে কী দেখা গেছে

গবেষণায় তিনটি মডেলের মূল্যায়ন করা হয়েছে। স্থানীয়করণের বিভিন্ন স্তরে এজেন্টদের সক্ষমতা কীভাবে পরিবর্তিত হয়, তা লেখকেরা তুলনা করেছেন।

মূল্যায়নের শর্তফলাফল
শুধু কথোপকথনের ভাষা পরিবর্তন করা হয়ইংরেজিতে অর্জিত সক্ষমতা বেশ ভালোভাবে স্থানান্তরিত হয়
অতিরিক্ত প্রেক্ষাপট স্থানীয়করণ করা হয়গুণমান ও স্থিতিশীলতা দ্রুত কমে যায়
বিষয়ভিত্তিক ক্ষেত্র পুরোপুরি অভিযোজিত হয়সবচেয়ে বড় ক্ষতি দেখা যায়

লেখকেরা উল্লেখ করেছেন, শুধু ইংরেজিতে মূল্যায়ন করলে দক্ষিণ-পূর্ব এশিয়ার ভাষাগুলোতে এজেন্টদের সক্ষমতা সীমিতভাবে অনুমান করা যায়। তাই ইংরেজি পরীক্ষার ফল স্থানীয়কৃত পরিস্থিতিতে যাচাইয়ের বিকল্প নয়।

বেঞ্চমার্কটি কেন প্রয়োজন

SEATauBench-কে একটি ডায়াগনস্টিক বেঞ্চমার্ক এবং পুনর্ব্যবহারযোগ্য অভিযোজন পাইপলাইন হিসেবে উপস্থাপন করা হয়েছে। এটি নির্ভরযোগ্য বহুভাষিক এজেন্ট তৈরির জন্য তৈরি।

মূল্যায়ন বেছে নেওয়ার সময় স্থানীয়করণের পরিধি গুরুত্বপূর্ণ: কথোপকথনের ভাষা, টুলের স্পেসিফিকেশন এবং বিষয়ভিত্তিক ক্ষেত্র। শুধু ভাষা পরিবর্তন যাচাই করলে প্রেক্ষাপটের পূর্ণ অভিযোজনের ফলাফল প্রতিফলিত হয় না।

প্রকাশনা ও সংস্করণ

প্রবন্ধটি EMNLP Findings 2026-এ প্রকাশিত হয়েছে। v1 সংস্করণটি 27 জুন 2026-এ জমা দেওয়া হয়েছিল, আর সর্বশেষ v2 সংস্করণটি প্রকাশিত হয়েছিল 5 সেপ্টেম্বর 2026-এ।

প্রবন্ধের শনাক্তকারী: arXiv:2606.28715.

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
SEATauBench: দক্ষিণ-পূর্ব এশিয়ার পাঁচটি ভাষায় AI এজেন্টদের পরীক্ষা