AgentBench

मुफ़्त

खुले बेंचमार्क विभिन्न वातावरणों में भाषा मॉडलों का स्वायत्त एजेंटों के रूप में मूल्यांकन करने के लिए।

अवलोकन

एजेंटबेंच स्वायत्त एजेंटों की भूमिका में बड़े भाषा मॉडल (एलएलएम) के परीक्षण के लिए एक खुला स्रोत उपकरण है। Tsinghua विश्वविद्यालय के डेवलपर्स ने यह आकलन करने के लिए बनाया कि कैसे प्रभावी ढंग से मॉडल व्यावहारिक कार्यों को संभालते हैं जो वास्तविक दुनिया के परिदृश्यों को अनुमानित करते हैं।

इतिहास और उत्पत्ति

इस परियोजना को Tsinghua विश्वविद्यालय में एक शोध समूह द्वारा शुरू किया गया था। मुख्य लक्ष्य रचनाकार खुद के लिए सेट किया गया था मानक पाठ पीढ़ी परीक्षण से परे जाने और इंटरैक्टिव वातावरण में मॉडल व्यवहार का मूल्यांकन करने के लिए। यह महत्वपूर्ण है क्योंकि आधुनिक भाषा मॉडलों का प्रयोग न केवल सरल उत्तर जनरेटर बल्कि बहु-चरण कार्यों के लिए पूर्ण विकसित उपकरण के रूप में किया जाता है।

कोर पद्धति

एजेंटबेंच आठ अलग-अलग वातावरणों में कार्यों को हल करने के लिए मॉडल पूछता है। इनमें ऑपरेटिंग सिस्टम प्रबंधन शामिल हैं, डेटाबेस के साथ काम करना, ज्ञान ग्राफ के साथ बातचीत करना, डिजिटल कार्ड गेम में भाग लेना, और उन पहेली को हल करना जिनमें अपरंपरागत सोच की आवश्यकता होती है। इसके अतिरिक्त, तीन वातावरण मौजूदा डेटासेट से अनुकूलित किए गए थे: घरेलू काम, वेब शॉपिंग और वेब ब्राउज़िंग। यह दृष्टिकोण एक मॉडल की योजना बनाने, निर्णय लेने और उपकरणों का उपयोग करने की क्षमता का व्यापक आकलन करने की अनुमति देता है।

अक्टूबर 2024 में, एक अद्यतन संस्करण जारी किया गया था - एजेंटबेंच एफसी। इसमें फंक्शन कॉलिंग प्रारूप के लिए समर्थन और पूरी तरह से डोकर रचना के माध्यम से कंटेनरीकृत तैनाती शामिल है। यह सभी परीक्षण वातावरण को शुरू करने की प्रक्रिया को काफी सरल बनाता है - अब शुरू होने के लिए केवल एक ही आदेश की आवश्यकता होती है।

एजेंटबेंच विशेषताएं

फ़ीचरमूल्य
उपकरण प्रकारबेंचमार्क (पर्यावरण के सर्वश्रेष्ठ सूट)
डेवलपरTsinghua विश्वविद्यालय
पर्यावरण की संख्या8 (5 नया + 3 अनुकूलित)
पर्यावरण प्रकारOS, डेटाबेस, ज्ञान ग्राफ, कार्ड गेम, पहेली, घरेलू काम, वेब शॉपिंग, वेब ब्राउज़िंग
वर्तमान संस्करणएजेंटबेंच एफसी (अक्टूबर 2024)
समारोह कॉलिंग समर्थनहाँ
तैनातीDocker Compose (containerization)
मल्टीमॉडल संस्करणदृश्य AgentBench
डेटासेटप्रत्येक कार्य के लिए देव और टेस्ट
लीडरबोर्डखुला, सार्वजनिक
स्रोत कोड उपलब्धताGitHub, खुला लाइसेंस
वितरण मॉडलफ्री

कौन है एजेंटबेंच?

एजेंटबेंच एक पेशेवर उपकरण है जो उपयोगकर्ताओं की विशिष्ट श्रेणियों के लिए उपयोगी होगा।

एआई एजेंट शोधकर्ता और डेवलपर्स

सबसे पहले, बेंचमार्क का उद्देश्य स्वायत्त एआई एजेंटों के निर्माण पर काम करने वाले विशेषज्ञों पर है। वे मानकीकृत स्थितियों के तहत अपने मॉडल का परीक्षण करने के लिए एजेंटबेंच का उपयोग कर सकते हैं और अन्य विकास के साथ परिणामों की तुलना कर सकते हैं। एक permissive लाइसेंस के तहत ओपन सोर्स कोड परीक्षण वातावरण को विशिष्ट अनुसंधान कार्यों के लिए अनुकूलित करने की अनुमति देता है।

LLM गुणवत्ता आकलन विशेषज्ञ

उन लोगों के लिए जो पेशेवर रूप से भाषा मॉडल की गुणवत्ता का मूल्यांकन करते हैं, एजेंटबेंच परिदृश्यों का एक तैयार सेट प्रदान करता है। उपलब्धता दो डेटासेट - देव और टेस्ट - अलग मॉडल ट्यूनिंग और अंतिम सत्यापन के लिए अनुमति देता है। यह विशेष रूप से उचित और प्रतिलिपि परीक्षण के निर्माण के लिए महत्वपूर्ण है।

कंपनी LLM को वर्कफ़्लो में एकीकृत करती है

प्रक्रिया स्वचालन के लिए नींव के रूप में भाषा मॉडल पर विचार करने वाले संगठन (डेटाबेस, ब्राउज़र या ऑपरेटिंग सिस्टम के साथ काम करना) उद्देश्य उम्मीदवार मूल्यांकन के लिए बेंचमार्क का उपयोग कर सकते हैं। यह उत्पादन में इसे एकीकृत करने से पहले विशिष्ट व्यवसाय कार्यों के लिए सबसे उपयुक्त मॉडल चुनने में मदद करता है।

एजेंटबेंच का उपयोग कैसे करें?

एजेंटबेंच के साथ काम करने की प्रक्रिया आपके द्वारा उपयोग किए जाने वाले उपकरण के संस्करण पर निर्भर करती है।

क्लासिक संस्करण

एजेंटबेंच के मूल संस्करण के साथ काम करने के लिए, आपको प्रत्येक आठ वातावरण को मैन्युअल रूप से कॉन्फ़िगर करने की आवश्यकता है। उपयोगकर्ता एक विशिष्ट कार्य का चयन करता है, संबंधित डेटासेट लोड करता है और मॉडल मूल्यांकन चलाता है। तब परिणामों की तुलना सार्वजनिक लीडरबोर्ड पर डेटा के साथ की जा सकती है। इस प्रक्रिया में कुछ तकनीकी कौशल की आवश्यकता होती है, क्योंकि प्रत्येक वातावरण में अपनी खुद की कॉन्फ़िगरेशन विशिष्ट होती है।

एजेंटबेंच FC और Docker Compose

अद्यतन एजेंटबेंच एफसी संस्करण तैनाती को काफी सरल बनाता है। Docker Compose के माध्यम से कंटेनरीकरण के लिए धन्यवाद, सभी परीक्षण वातावरण को एक ही आदेश के साथ लॉन्च किया जा सकता है। यह समय बचाता है और मैनुअल पर्यावरण सेटअप से जुड़े अधिकांश त्रुटियों को समाप्त करता है। उपयोगकर्ता को केवल डोकर स्थापित करने की आवश्यकता होती है, जो भंडार को बंद कर देता है और मानक लॉन्च कमांड चला जाता है। उसके बाद, मॉडल स्वचालित रूप से सभी वातावरण में परीक्षण किया जाएगा।

इसके अतिरिक्त, एक विस्तारित संस्करण — VisualAgentBench — multimodal मॉडल के लिए उपलब्ध है। यह दृश्य वातावरण में परीक्षण के लिए डिज़ाइन किया गया है: रोबोट नियंत्रण से लेकर चित्रमय इंटरफेस और वेब डिज़ाइन के साथ काम करने के लिए।

एजेंटबेंच की मुख्य विशेषताएं

मॉडल स्वायत्तता आकलन

एजेंटबेंच का मुख्य कार्य मानव हस्तक्षेप के बिना कार्य करने की मॉडल की क्षमता को माप रहा है। बेंचमार्क जांच करता है कि क्या मॉडल स्वतंत्र रूप से अपने पर्यावरण का विश्लेषण कर सकता है, निर्णय ले सकता है और अंतिम लक्ष्य तक पहुंचने तक बहु-चरण संचालन कर सकता है।

बहुपरत परीक्षण

आठ विभिन्न वातावरण मॉडल को विभिन्न कोणों से मूल्यांकन करने की अनुमति देते हैं। एक ऑपरेटिंग सिस्टम परीक्षण तकनीकी कौशल, पहेली परीक्षण रचनात्मकता और तर्क, और वेब शॉपिंग परीक्षण योजना की क्षमता और इंटरफेस के साथ बातचीत के साथ काम करना। यह दृष्टिकोण मॉडल की क्षमताओं की एक व्यापक तस्वीर प्रदान करता है।

समारोह कॉलिंग समर्थन

एजेंटबेंच एफसी संस्करण फंक्शन कॉलिंग प्रारूप का समर्थन करता है। इसका मतलब यह है कि मॉडल एक संरचित तरीके से बाहरी कार्यों को कॉल कर सकता है, जो स्वचालन उपकरण के रूप में LLM का उपयोग करने के वास्तविक दुनिया के परिदृश्यों के करीब परीक्षण कर सकता है।

मल्टीमोडल परीक्षण

उन मॉडलों के लिए जो न केवल पाठ बल्कि छवियों को संसाधित करते हैं, VisualAgentBench संस्करण को डिज़ाइन किया गया है। इसमें दृश्य धारणा वाले वातावरण शामिल हैं - GUI से रोबोटिक्स तक - यह आकलन करने की अनुमति देता है कि मल्टीमोडल मॉडल एक दृश्य संदर्भ के भीतर कितनी अच्छी तरह से समझता है और कार्य करता है।

एजेंटबेंच के लाभ

उपलब्धता

एजेंटबेंच से संबंधित सब कुछ - कोड, डेटासेट, परिणाम - सार्वजनिक रूप से उपलब्ध है। पूर्ण पारदर्शिता अन्य शोधकर्ताओं को परिणाम और विश्वास प्रकाशित डेटा को पुन: उत्पन्न करने की अनुमति देती है। नि: शुल्क वितरण मॉडल इसे चलाने के लिए तकनीकी क्षमता वाले किसी के लिए सुलभ उपकरण बनाता है।

यथार्थवादी परिदृश्य

कई अमूर्त परीक्षणों के विपरीत, एजेंटबेंच में वास्तविक दुनिया के कार्यों के करीब वातावरण शामिल हैं: सिस्टम प्रबंधन, खरीदारी, ब्राउज़िंग। यह एक अधिक उद्देश्यपूर्ण चित्र प्रदान करता है कि आदर्श प्रयोगशाला स्थितियों के बजाय मॉडल वास्तविक तैनाती में कैसे व्यवहार करेगा।

लचीलापन और तैनाती की आसानी

Docker Compose Containerization के साथ AgentBench FC की रिहाई ने बेंचमार्क - सेटअप जटिलता की मुख्य समस्याओं में से एक को हल किया। अब, परीक्षण चलाने के लिए न्यूनतम तकनीकी ज्ञान पर्याप्त है। इसके अलावा, टेक्स्ट-आधारित और मल्टीमॉडल मॉडल (विज़ुअल एजेंटबेंच के माध्यम से) दोनों का परीक्षण करने की क्षमता टूल को बहुमुखी बनाती है।

एजेंटबेंच के नुकसान

शुरुआती के लिए उच्च प्रवेश बाधा

एफसी संस्करण में सरलीकरण के बावजूद, एजेंटबेंच का उपयोग करने के लिए डॉकर, कमांड लाइन और भाषा मॉडल के साथ काम करने के बुनियादी सिद्धांतों जैसे तकनीकों को समझने की आवश्यकता होती है। एक तकनीकी पृष्ठभूमि के बिना लोगों के लिए, उपकरण मास्टर करने के लिए मुश्किल हो जाएगा।

ओपन सोर्स में सीमित जानकारी

वर्तमान में, सेटअप और परीक्षण के प्रत्येक चरण का वर्णन करने वाले अपेक्षाकृत कम विस्तृत प्रलेखन और निर्देश हैं। उपयोगकर्ताओं को अक्सर कोड को खुद को बाहर करना पड़ता है या इसी तरह के उपकरणों के साथ काम करने के सामान्य सिद्धांतों पर भरोसा करना पड़ता है।

विशिष्ट अनुप्रयोग क्षेत्र

चूंकि एजेंटबेंच एक मूल्यांकन उपकरण है, इसलिए इसका मूल्य केवल तभी महसूस किया जाता है जब आपके पास परीक्षण के लिए अपना खुद का मॉडल हो। अंत उपयोगकर्ताओं के लिए जो केवल एपीआई के माध्यम से तैयार एलएलएम का उपयोग करते हैं, बेंचमार्क कोई व्यावहारिक लाभ प्रदान नहीं करता है।

क्या समस्या है एजेंटबेंच हल?

इष्टतम मॉडल चयन

मुख्य कार्यों में से एक एजेंटबेंच पते एक विशिष्ट उपयोग मामले के लिए सबसे उपयुक्त मॉडल चुनने में मदद कर रहा है। लीडरबोर्ड पर मॉडल परिणामों की तुलना करके, एक डेवलपर यह तय कर सकता है कि कौन से मॉडल बेहतर प्रदर्शन करेगा, उदाहरण के लिए, डेटाबेस या वेब इंटरफेस के साथ।

ट्रैकिंग विकास प्रगति

अनुसंधान समूहों के लिए, बेंचमार्क एक समन्वय प्रणाली के रूप में कार्य करता है: यह ट्रैकिंग की अनुमति देता है कि कैसे एक मॉडल प्रत्येक नए पुनरावृत्ति के साथ सुधार करता है और उन क्षेत्रों की पहचान करता है जिनकी अभी भी कमजोरियों को शोधन की आवश्यकता होती है।

मानकीकरण परीक्षण

एजेंटबेंच अपने तरीके से "हर किसी भी परीक्षण" की समस्या को हल करता है। वातावरण और डेटासेट का एक एकीकृत सेट एक सामान्य आधार पर विभिन्न टीमों और मॉडल से परिणामों की तुलना करने की अनुमति देता है। अलग देव और टेस्ट सेट की उपलब्धता डेटा का परीक्षण करने के लिए मॉडल को "ओवरफिटिंग" से बचने में मदद करती है।

एजेंटबेंच मूल्य निर्धारण

एजेंटबेंच को एक नि: शुल्क मॉडल के तहत वितरित किया जाता है, जिसका अर्थ है कि यह पूरी तरह से नि: शुल्क है। यह गिटहब पर कोड तक पहुंच के लिए दोनों लागू होता है और परिणाम के साथ सार्वजनिक लीडरबोर्ड में। उपयोगकर्ता को बेंचमार्क का उपयोग करने के लिए भुगतान करने की आवश्यकता नहीं है।

हालांकि, संभावित अप्रत्यक्ष लागत पर विचार किया जाना चाहिए। कंटेनर प्रारूप (डॉकर कम्पास) में सभी वातावरण चलाने के लिए पर्याप्त संसाधनों के साथ सर्वर या स्थानीय हार्डवेयर की आवश्यकता होती है - सीपीयू, मेमोरी और डिस्क स्थान। इसके अतिरिक्त, यदि आप भुगतान किए गए व्यावसायिक मॉडलों का परीक्षण करने की योजना बना रहे हैं, तो, उनके एपीआई अनुरोधों की लागत एजेंटबेंच द्वारा कवर नहीं की जाती है। लेकिन मूल्यांकन उपकरण ही पूरी तरह से मुक्त रहता है।

एजेंटबेंच के लिए उपयोग की शर्तें

कोड लाइसेंस

एजेंटबेंच स्रोत कोड को एक ओपन लाइसेंस के तहत गिटहब पर प्रकाशित किया गया है। इसका मतलब यह है कि डेवलपर्स अपने उद्देश्यों के लिए कोड का स्वतंत्र रूप से उपयोग, संशोधित और अनुकूलन कर सकते हैं। प्रस्तावना में निर्दिष्ट विशिष्ट लाइसेंस की शर्तों का पालन करना महत्वपूर्ण है।

परिणाम का उपयोग

मॉडल मूल्यांकन परिणाम सार्वजनिक लीडरबोर्ड पर प्रकाशित किए जाते हैं। कोई भी उपयोगकर्ता डेटा की समीक्षा कर सकता है और इसे उनके उद्देश्यों के लिए उपयोग कर सकता है - अनुसंधान, लेख, या मॉडल चयन में। आमतौर पर कोई अनिवार्य विशेषता नहीं है, लेकिन प्रकाशन में लीडरबोर्ड डेटा का उपयोग करते समय स्रोत को उद्धृत करना अच्छा अभ्यास माना जाता है।

प्रैक्टिकल सीमा

चूंकि एजेंटबेंच एक परीक्षण उपकरण है, इसलिए इसका उपयोग आपको पहले से ही अपना खुद का भाषा मॉडल या व्यावसायिक मॉडल एपीआई तक पहुंच मानता है। बेंचमार्क स्वयं मॉडल तक पहुंच प्रदान नहीं करता है - यह केवल उनका मूल्यांकन करता है। इसके अतिरिक्त, चलने वाले परीक्षणों को डॉकर के साथ एक तकनीकी वातावरण की आवश्यकता होती है और पर्याप्त कंप्यूटिंग संसाधनों की आवश्यकता होती है।

एजेंटबेंच उपलब्धता

कोड तक पहुंच

एजेंटबेंच कोड भंडार सार्वजनिक रूप से गिटहब पर उपलब्ध है। कोई भी परियोजना को क्लोन कर सकता है, कोड का अध्ययन कर सकता है और इसका उपयोग कर सकता है। अपने स्वयं के विकास में। यह अपने भौगोलिक स्थान या वित्तीय क्षमताओं के बावजूद दुनिया भर में शोधकर्ताओं के लिए सुलभ उपकरण बनाता है।

सार्वजनिक लीडरबोर्ड

मॉडल मूल्यांकन परिणाम सार्वजनिक लीडरबोर्ड पर प्रकाशित किए जाते हैं। उपयोगकर्ता वास्तविक समय में ट्रैक कर सकते हैं जो मॉडल विभिन्न वातावरणों में सर्वोत्तम परिणाम दिखाते हैं। लीडरबोर्ड पंजीकरण या भुगतान के बिना किसी को देखने के लिए उपलब्ध है।

अद्यतन और विकास

परियोजना सक्रिय रूप से विकसित हो रही है: अक्टूबर 2024 में, एजेंटबेंच एफसी संस्करण को मल्टीमोडल मॉडल के लिए विजुअलएजेंटबेंच संस्करण के साथ जारी किया गया था। यह इंगित करता है कि उपकरण डेवलपर्स द्वारा बनाए रखा गया है और समुदाय की बदलती जरूरतों को अनुकूलित करता है।

कैसे विकल्प से एजेंटबेंच डिफर्स

व्यापक वातावरण

भाषा मॉडल का मूल्यांकन करने के लिए कई मौजूदा बेंचमार्क एकल प्रकार के कार्य पर ध्यान केंद्रित करते हैं - उदाहरण के लिए, केवल पाठ पीढ़ी या प्रश्न का उत्तर देना। एजेंटबेंच में आठ विविध वातावरण शामिल हैं, जिनमें ऑपरेटिंग सिस्टम, डेटाबेस और वेब ब्राउज़र के साथ काम करना शामिल है। यह व्यापक कवरेज संकीर्ण विशिष्ट परीक्षणों की तुलना में मॉडल की क्षमताओं की एक पूरी तस्वीर प्रदान करता है।

स्वायत्तता पर ध्यान केंद्रित करें

अधिकांश क्लासिक बेंचमार्क में, मॉडल एक सवाल का जवाब देता है या एक कदम कार्रवाई करता है। हालांकि, एजेंटबेंच विशेष रूप से एक स्वायत्त एजेंट के रूप में मॉडल का मूल्यांकन करता है: योजना बनाने, मध्यवर्ती निर्णय लेने और पर्यावरण से प्रतिक्रिया के आधार पर कार्रवाई को समायोजित करने की क्षमता। यह मौलिक रूप से जटिलता का एक अलग स्तर है।

खुलापन और अवसंरचना

जबकि अन्य खुले बेंचमार्क मौजूद हैं, एजेंटबेंच अपने अच्छी तरह से संपन्न बुनियादी ढांचे के साथ बाहर खड़ा है। Docker Compose Containerization और समारोह कॉल समर्थन के साथ एफसी संस्करण कई विकल्प है कि जटिल मैनुअल सेटअप की आवश्यकता की तुलना में एक कदम आगे है। मल्टीमॉडल मॉडल के लिए अलग-अलग विजुअल एजेंटबेंच संस्करण भी प्रतियोगियों से इस उपकरण को अलग करता है।

निष्कर्ष

एजेंटबेंच स्वायत्त एजेंटों की भूमिका में बड़े भाषा मॉडल का मूल्यांकन करने के लिए एक पेशेवर ओपन-सोर्स बेंचमार्क है। आठ विविध वातावरणों के लिए धन्यवाद, एफसी संस्करण में फ़ंक्शन कॉल समर्थन, और डोकर कॉम्पोज़ के माध्यम से कंटेनरीकृत तैनाती, उपकरण शोधकर्ताओं और डेवलपर्स को सुविधाजनक और मानकीकृत परीक्षण मंच प्रदान करता है। सार्वजनिक लीडरबोर्ड, कोड तक मुफ्त पहुंच और मल्टीमोडल मॉडल के लिए एक अलग संस्करण की उपलब्धता एजेंटबेंच को आधुनिक एआई एजेंट विकास पारिस्थितिकी तंत्र में एक महत्वपूर्ण उपकरण बनाती है। शुरुआती के लिए इसे मास्टर करने में कुछ कठिनाइयों के बावजूद, बेंचमार्क वास्तविक दुनिया के कार्यों को हल करने के लिए मॉडल की व्यावहारिक उपयुक्तता का आकलन करने का एक विश्वसनीय तरीका है।

स्वायत्त कार्यों पर भाषा मॉडलों का परीक्षण
बल्कि, वास्तविक परिदृश्यों में LLM प्रदर्शन तुलना
बहु-मोडल मॉडलों का मूल्यांकन दृश्य वातावरण के लिए

अक्सर पूछे जाने वाले प्रश्न

यह भी देखें

A2E

A2E

5.0
मुफ़्त

एआई-आधारित वीडियो निर्माण और संपादन टूलकिट, जिसमें अवतार, लिप-सिंक और आवाज़ क्लोनिंग शामिल हैं।

AIPex

AIPex

5.0
मुफ़्त

क्रोम एक्सटेंशन जो AI सहायक की मदद से टैब, इतिहास और बुकमार्क प्रबंधित करने में मदद करता है।

AskNews

AskNews

5.0
मुफ़्त

विश्व समाचार एकत्र करने का मंच, जो विश्लेषण और पूर्वाग्रह कम करने के लिए AI का उपयोग करता है।

Cabina AI

Cabina AI

5.0
मुफ़्तकृपया अनुवाद के लिए मूल पाठ प्रदान करें।

कैबिना AI एक एकीकृत प्लेटफ़ॉर्म है जो विभिन्न जनरेटिव न्यूरल नेटवर्क के साथ काम करने के लिए है, जिससे टेक्स्ट, चित्र और वीडियो बनाना संभव होता है।

AgentX

AgentX

5.0
मुफ़्त

ग्राहक सहायता और लीड जनरेशन को स्वचालित करने के लिए मल्टी-एजेंट एआई सिस्टम और चैटबॉट बनाने का मंच।.

Alian Hub

Alian Hub

5.0

परियोजना प्रबंधन मंच जिसमें कार्य निर्धारण, समय ट्रैकिंग और कर्मचारी कार्यभार नियंत्रण की सुविधाएँ शामिल हैं।

TripoSR

TripoSR

5.0
मुफ़्त

ओपन-सोर्स टूल जो एक छवि को तेज़ी से 3D मॉडल में बदल देता है।

Docky.AI

Docky.AI

5.0

साइड AI पैनल जो सवालों के जवाब देने, दस्तावेज़ों के साथ काम करने और छवियाँ बनाने में मदद करता है।

एजेंटबेंच - एलएलएम एजेंटों का मूल्यांकन करने के लिए बेंचमार्क समीक्षा