SEATauBench: दक्षिण-पूर्व एशिया की पाँच भाषाओं में AI एजेंटों का परीक्षण

25 सितम्बर 202615 बार देखा गया

लेखक तीन मॉडलों की जाँच करते हैं और संवाद की भाषा, टूल्स की संरचना तथा कार्यों के विषय-क्षेत्र को क्रमशः बदलते हैं। परिणाम दिखाते हैं कि अंग्रेज़ी से प्राप्त क्षमता संवाद की भाषा बदलने पर भी बनी रहती है, लेकिन टूल्स और संदर्भ के स्थानीयकरण पर काफी घट जाती है; इसलिए अंग्रेज़ी में किए गए परीक्षण क्षेत्र में एजेंटों के प्रदर्शन को सही ढंग से नहीं दर्शाते।

SEATauBench: दक्षिण-पूर्व एशिया की पाँच भाषाओं में AI एजेंटों का परीक्षण

SEATauBench क्या है

SEATauBench दक्षिण-पूर्व एशिया में संप्रभु AI के लिए एजेंट-केंद्रित पहली मूल्यांकन प्रणाली है। यह Tau2-Bench को पाँच भाषाओं के लिए अनुकूलित करती है: चीनी (मंदारिन), वियतनामी, थाई, इंडोनेशियाई और फ़िलिपीनो।

यह बेंचमार्क क्षेत्र के भाषाई और विषयगत संदर्भों में एजेंटों का मूल्यांकन करने के लिए बनाया गया है। इसके उपयोग का व्यावहारिक मानदंड यह है कि जाँची जा रही भाषाएँ लक्षित दर्शकों के अनुरूप हों।

मूल्यांकन में कौन-सी परिस्थितियाँ बदलती हैं

शोधकर्ता एजेंट के कामकाजी संदर्भ को क्रमिक रूप से स्थानीयकृत करते हैं। वे तीन तत्व बदलते हैं:

  • उपयोगकर्ता और एजेंट के बीच संवाद की भाषा;
  • टूल के विनिर्देश;
  • कार्यों के विषय-क्षेत्र।

इस डिज़ाइन से केवल संवाद की भाषा बदलने के प्रभाव की जाँच नहीं होती। इसमें टूल और कार्यों के विषयों में बदलाव भी शामिल हैं।

नतीजों से क्या पता चला

अध्ययन में तीन मॉडलों का मूल्यांकन किया गया। लेखकों ने तुलना की कि स्थानीयकरण के विभिन्न स्तरों पर एजेंटों की क्षमताएँ कैसे बदलती हैं।

मूल्यांकन की परिस्थितियाँपरिणाम
केवल संवाद की भाषा बदलती हैअंग्रेज़ी में विकसित क्षमताएँ काफ़ी हद तक स्थानांतरित होती हैं
अतिरिक्त संदर्भ का स्थानीयकरण किया जाता हैगुणवत्ता और मज़बूती में तेज़ गिरावट आती है
विषय-क्षेत्र को पूरी तरह अनुकूलित किया जाता हैसबसे बड़े नुकसान देखे जाते हैं

लेखक बताते हैं कि केवल अंग्रेज़ी में किया गया मूल्यांकन दक्षिण-पूर्व एशिया की भाषाओं में एजेंटों की क्षमताओं का सीमित अनुमान देता है। इसलिए अंग्रेज़ी परीक्षण के नतीजे स्थानीयकृत परिस्थितियों में जाँच का विकल्प नहीं हैं।

बेंचमार्क का उद्देश्य

SEATauBench को एक निदानात्मक बेंचमार्क और पुनः उपयोग किए जा सकने वाले अनुकूलन पाइपलाइन के रूप में प्रस्तुत किया गया है। इसका उद्देश्य विश्वसनीय बहुभाषी एजेंट बनाना है।

मूल्यांकन चुनते समय स्थानीयकरण का दायरा महत्त्वपूर्ण है: संवाद की भाषा, टूल के विनिर्देश और विषय-क्षेत्र। केवल भाषा बदलने की जाँच से संदर्भ के पूर्ण अनुकूलन के नतीजे सामने नहीं आते।

प्रकाशन और संस्करण

यह लेख EMNLP Findings 2026 में प्रकाशित हुआ। संस्करण v1 27 जून 2026 को सबमिट किया गया था और नवीनतम संशोधन v2 5 सितंबर 2026 को जारी किया गया।

लेख का पहचानकर्ता: arXiv:2606.28715.

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
SEATauBench: दक्षिण-पूर्व एशिया की पाँच भाषाओं में AI एजेंटों का परीक्षण