SEATauBench क्या है
SEATauBench दक्षिण-पूर्व एशिया में संप्रभु AI के लिए एजेंट-केंद्रित पहली मूल्यांकन प्रणाली है। यह Tau2-Bench को पाँच भाषाओं के लिए अनुकूलित करती है: चीनी (मंदारिन), वियतनामी, थाई, इंडोनेशियाई और फ़िलिपीनो।

यह बेंचमार्क क्षेत्र के भाषाई और विषयगत संदर्भों में एजेंटों का मूल्यांकन करने के लिए बनाया गया है। इसके उपयोग का व्यावहारिक मानदंड यह है कि जाँची जा रही भाषाएँ लक्षित दर्शकों के अनुरूप हों।
मूल्यांकन में कौन-सी परिस्थितियाँ बदलती हैं
शोधकर्ता एजेंट के कामकाजी संदर्भ को क्रमिक रूप से स्थानीयकृत करते हैं। वे तीन तत्व बदलते हैं:
- उपयोगकर्ता और एजेंट के बीच संवाद की भाषा;
- टूल के विनिर्देश;
- कार्यों के विषय-क्षेत्र।
इस डिज़ाइन से केवल संवाद की भाषा बदलने के प्रभाव की जाँच नहीं होती। इसमें टूल और कार्यों के विषयों में बदलाव भी शामिल हैं।
नतीजों से क्या पता चला
अध्ययन में तीन मॉडलों का मूल्यांकन किया गया। लेखकों ने तुलना की कि स्थानीयकरण के विभिन्न स्तरों पर एजेंटों की क्षमताएँ कैसे बदलती हैं।
| मूल्यांकन की परिस्थितियाँ | परिणाम |
|---|---|
| केवल संवाद की भाषा बदलती है | अंग्रेज़ी में विकसित क्षमताएँ काफ़ी हद तक स्थानांतरित होती हैं |
| अतिरिक्त संदर्भ का स्थानीयकरण किया जाता है | गुणवत्ता और मज़बूती में तेज़ गिरावट आती है |
| विषय-क्षेत्र को पूरी तरह अनुकूलित किया जाता है | सबसे बड़े नुकसान देखे जाते हैं |
लेखक बताते हैं कि केवल अंग्रेज़ी में किया गया मूल्यांकन दक्षिण-पूर्व एशिया की भाषाओं में एजेंटों की क्षमताओं का सीमित अनुमान देता है। इसलिए अंग्रेज़ी परीक्षण के नतीजे स्थानीयकृत परिस्थितियों में जाँच का विकल्प नहीं हैं।
बेंचमार्क का उद्देश्य
SEATauBench को एक निदानात्मक बेंचमार्क और पुनः उपयोग किए जा सकने वाले अनुकूलन पाइपलाइन के रूप में प्रस्तुत किया गया है। इसका उद्देश्य विश्वसनीय बहुभाषी एजेंट बनाना है।
मूल्यांकन चुनते समय स्थानीयकरण का दायरा महत्त्वपूर्ण है: संवाद की भाषा, टूल के विनिर्देश और विषय-क्षेत्र। केवल भाषा बदलने की जाँच से संदर्भ के पूर्ण अनुकूलन के नतीजे सामने नहीं आते।
प्रकाशन और संस्करण
यह लेख EMNLP Findings 2026 में प्रकाशित हुआ। संस्करण v1 27 जून 2026 को सबमिट किया गया था और नवीनतम संशोधन v2 5 सितंबर 2026 को जारी किया गया।
लेख का पहचानकर्ता: arXiv:2606.28715.



