Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें

10 सितम्बर 20264 बार देखा गया

एक नया बेंचमार्क अंग्रेजी और अरबी में 100 प्रश्न-उत्तर परिदृश्य पेश करता है, जो ऑपरेटर के वास्तविक डेटा—वेबसाइट, SQL डेटाबेस और वेब आर्काइव—के आसपास बनाए गए हैं। 12 मॉडलों पर परीक्षण से पता चला कि सबसे अच्छा मॉडल भी केवल 71% कार्यों को हल करता है, और दृश्य श्रेणियों में परिणाम 30% से नीचे गिर जाता है।

Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें

आधुनिक AI एजेंट सामान्य कार्यालयीन कार्यों को अच्छी तरह से संभाल लेते हैं, लेकिन यह कैसे जांचा जाए कि वे जटिल कॉर्पोरेट वातावरण में काम करने के लिए तैयार हैं या नहीं — उदाहरण के लिए, दूरसंचार क्षेत्र में? यहाँ सामान्य परीक्षण पर्याप्त नहीं हैं: वास्तविक दस्तावेज़ों, डेटाबेस और असामान्य उपयोगकर्ता प्रश्नों वाले यथार्थवादी परिदृश्यों की आवश्यकता होती है। इसी उद्देश्य से Telco-GAIA बनाया गया है — एक द्विभाषी मल्टीमॉडल बेंचमार्क, जो एक वास्तविक दूरसंचार ऑपरेटर के डेटा के आसपास निर्मित है। यह मूल्यांकन करने में सक्षम बनाता है कि AI एजेंट कितनी अच्छी तरह तर्क कर सकता है, टूल का उपयोग कर सकता है और विभिन्न स्रोतों से जानकारी निकाल सकता है।

ऐसे बेंचमार्क की आवश्यकता क्यों है

AI एजेंटों के लिए अधिकांश ओपन-सोर्स परीक्षण पहेलियों की तरह होते हैं: वे या तो बहुत सिंथेटिक होते हैं, या उन्हें कॉर्पोरेट डेटा के साथ वास्तविक काम की आवश्यकता नहीं होती। Telco-GAIA इस अंतर को भरता है। इसके प्रश्न इस तरह से तैयार किए गए हैं कि एजेंट को दूरसंचार ऑपरेटरों के कर्मचारियों से परिचित कार्यों का सामना करना पड़ता है: वेबसाइट पर जानकारी ढूंढना, उसे डेटाबेस में रिकॉर्ड के साथ मिलाना, संग्रहीत दस्तावेज़ों में विवरण स्पष्ट करना। यह मॉडल की स्मृति की जांच नहीं है, बल्कि कई स्रोतों के साथ काम करने और निष्कर्ष निकालने की क्षमता की जांच है।

बेंचमार्क द्विभाषी है: सभी कार्य अंग्रेजी और अरबी में तैयार किए गए हैं। यह विकल्प आकस्मिक नहीं है — यह उस क्षेत्र में ऑपरेटरों की वास्तविक आवश्यकताओं को दर्शाता है जहाँ अरबी कामकाजी भाषा है, लेकिन आंतरिक दस्तावेज़ीकरण का एक महत्वपूर्ण हिस्सा अंग्रेजी में रहता है।

Telco-GAIA के अंदर क्या है

बेंचमार्क में 100 प्रश्न-उत्तर कार्य शामिल हैं, जिनमें से प्रत्येक की मानव द्वारा जाँच की गई है। महत्वपूर्ण बात यह है कि कार्यों के लिए एक-शब्दीय उत्तर की नहीं, बल्कि तार्किक चरणों की एक श्रृंखला की आवश्यकता होती है — औसतन 4.2 चरण। सभी प्रश्न मोडैलिटी प्रकारों के अनुसार विभाजित हैं: टेक्स्ट, टेबल और ग्राफिक्स। इसका मतलब है कि मॉडल को PDF दस्तावेज़, छवि और SQL क्वेरी संरचना के साथ समान रूप से आत्मविश्वास से काम करना चाहिए।

कार्य को हल करने के लिए, एजेंट को तीन विषम स्रोतों की ओर रुख करना होगा:

  • ऑपरेटर की वेबसाइट का स्थिर स्नैपशॉट — HTML पेज, चित्र और संबंधित PDF फ़ाइलें।
  • सिंथेटिक रिलेशनल डेटाबेस — इसकी संरचना ऑपरेटर की आंतरिक प्रणाली की नकल करती है, लेकिन इसमें डेटा प्रकाशन के लिए सुरक्षित है।
  • बाहरी वेब आर्काइव — अतिरिक्त सामग्री जो तथ्यों की जाँच या संदर्भ स्पष्ट करने के लिए आवश्यक हो सकती है।

मूल्यांकन कैसे काम करता है

Telco-GAIA के मुख्य सिद्धांतों में से एक निष्पक्षता है। लेखकों ने फैशनेबल LLM-जजों को छोड़ दिया है, जहाँ एक मॉडल दूसरे के उत्तरों का मूल्यांकन करता है। इसके बजाय, सामान्यीकृत सटीक स्ट्रिंग तुलना का उपयोग किया जाता है, और पूरा बेंचमार्क एक पृथक Docker वातावरण में पैक किया गया है। इसका मतलब है कि परिणाम किसी विशिष्ट मशीन या लाइब्रेरी संस्करण पर निर्भर नहीं करता: कंटेनर चलाया — समान संख्याएँ मिलीं। यह दृष्टिकोण मूल्यांकन को निर्धारणात्मक और पुनरुत्पादनीय बनाता है, जो अनुसंधान और विभिन्न मॉडलों की तुलना के लिए महत्वपूर्ण है।

परीक्षणों ने क्या दिखाया

डेवलपर्स ने बेंचमार्क के माध्यम से बारह विभिन्न मॉडलों के साथ एक संदर्भ एजेंट चलाया — वाणिज्यिक और ओपन-सोर्स दोनों। परिणाम संयमित रहे: यहाँ तक कि सबसे मजबूत मॉडल भी केवल 71% कार्यों को ही पूरा कर सका। यदि टूल कॉल के बजट को मध्यम स्तर तक सीमित कर दिया जाए, तो परिणाम लगभग 40% तक गिर जाता है। दूसरे शब्दों में, एजेंट स्पष्ट रूप से "शॉर्टकट" लेने लगता है: अतिरिक्त कदम नहीं उठाता, विवरणों की जाँच नहीं करता और असामान्य मामलों में अधिक बार गलती करता है।

मॉडल विशेष रूप से उन श्रेणियों में कमजोर प्रदर्शन करते हैं जहाँ दृश्य जानकारी — चित्र और ग्राफिक्स — का उपयोग करना आवश्यक होता है। वहाँ औसत परिणाम 30% से कम है। यह दर्शाता है कि चित्रों वाले दस्तावेज़ों की समझ अभी भी AI एजेंटों के लिए एक गंभीर विकास बिंदु है। कुल मिलाकर, Telco-GAIA कॉर्पोरेट एजेंट की अपेक्षाओं और आधुनिक LLM की वास्तविक क्षमताओं के बीच एक महत्वपूर्ण अंतर को दर्ज करता है।

निष्कर्ष

Telco-GAIA केवल अनुसंधान के लिए एक और बेंचमार्क नहीं है। यह उन कंपनियों के लिए एक व्यावहारिक उपकरण है जो अपने स्वयं के AI एजेंट बना रही हैं और उनकी सीमाओं को पहले से समझना चाहती हैं। पुनरुत्पादनीय वातावरण और सत्यापित कार्यों के कारण, इसे आंतरिक गुणवत्ता मानक के रूप में उपयोग किया जा सकता है।

इसके अलावा, Telco-GAIA में निहित दृष्टिकोण को अन्य बंद डोमेन — बैंकिंग से लेकर लॉजिस्टिक्स तक — के लिए आसानी से अनुकूलित किया जा सकता है। यह प्रारूप एक तैयार टेम्पलेट प्रदान करता है: वास्तविक डेटा लेना, उसे सावधानीपूर्वक अनामीकृत करना, स्वतंत्र स्रोतों में विभाजित करना और एक ऐसा वातावरण तैयार करना जिसमें एजेंट को अपने तर्क कौशल का प्रदर्शन करना हो। यह वही बदलाव है जिसकी बाजार को आवश्यकता है: सामान्य ज्ञान परीक्षणों से यथार्थवादी कॉर्पोरेट डेटा पर व्यावहारिक दक्षताओं की जाँच की ओर।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
Telco-GAIA: वास्तविक दूरसंचार ऑपरेटर के डेटा पर AI एजेंट का परीक्षण कैसे करें