AgentBench
खुले बेंचमार्क विभिन्न वातावरणों में भाषा मॉडलों का स्वायत्त एजेंटों के रूप में मूल्यांकन करने के लिए।
अवलोकन
एजेंटबेंच स्वायत्त एजेंटों की भूमिका में बड़े भाषा मॉडल (एलएलएम) के परीक्षण के लिए एक खुला स्रोत उपकरण है। Tsinghua विश्वविद्यालय के डेवलपर्स ने यह आकलन करने के लिए बनाया कि कैसे प्रभावी ढंग से मॉडल व्यावहारिक कार्यों को संभालते हैं जो वास्तविक दुनिया के परिदृश्यों को अनुमानित करते हैं।
इतिहास और उत्पत्ति
इस परियोजना को Tsinghua विश्वविद्यालय में एक शोध समूह द्वारा शुरू किया गया था। मुख्य लक्ष्य रचनाकार खुद के लिए सेट किया गया था मानक पाठ पीढ़ी परीक्षण से परे जाने और इंटरैक्टिव वातावरण में मॉडल व्यवहार का मूल्यांकन करने के लिए। यह महत्वपूर्ण है क्योंकि आधुनिक भाषा मॉडलों का प्रयोग न केवल सरल उत्तर जनरेटर बल्कि बहु-चरण कार्यों के लिए पूर्ण विकसित उपकरण के रूप में किया जाता है।
कोर पद्धति
एजेंटबेंच आठ अलग-अलग वातावरणों में कार्यों को हल करने के लिए मॉडल पूछता है। इनमें ऑपरेटिंग सिस्टम प्रबंधन शामिल हैं, डेटाबेस के साथ काम करना, ज्ञान ग्राफ के साथ बातचीत करना, डिजिटल कार्ड गेम में भाग लेना, और उन पहेली को हल करना जिनमें अपरंपरागत सोच की आवश्यकता होती है। इसके अतिरिक्त, तीन वातावरण मौजूदा डेटासेट से अनुकूलित किए गए थे: घरेलू काम, वेब शॉपिंग और वेब ब्राउज़िंग। यह दृष्टिकोण एक मॉडल की योजना बनाने, निर्णय लेने और उपकरणों का उपयोग करने की क्षमता का व्यापक आकलन करने की अनुमति देता है।
अक्टूबर 2024 में, एक अद्यतन संस्करण जारी किया गया था - एजेंटबेंच एफसी। इसमें फंक्शन कॉलिंग प्रारूप के लिए समर्थन और पूरी तरह से डोकर रचना के माध्यम से कंटेनरीकृत तैनाती शामिल है। यह सभी परीक्षण वातावरण को शुरू करने की प्रक्रिया को काफी सरल बनाता है - अब शुरू होने के लिए केवल एक ही आदेश की आवश्यकता होती है।
एजेंटबेंच विशेषताएं
| फ़ीचर | मूल्य |
|---|---|
| उपकरण प्रकार | बेंचमार्क (पर्यावरण के सर्वश्रेष्ठ सूट) |
| डेवलपर | Tsinghua विश्वविद्यालय |
| पर्यावरण की संख्या | 8 (5 नया + 3 अनुकूलित) |
| पर्यावरण प्रकार | OS, डेटाबेस, ज्ञान ग्राफ, कार्ड गेम, पहेली, घरेलू काम, वेब शॉपिंग, वेब ब्राउज़िंग |
| वर्तमान संस्करण | एजेंटबेंच एफसी (अक्टूबर 2024) |
| समारोह कॉलिंग समर्थन | हाँ |
| तैनाती | Docker Compose (containerization) |
| मल्टीमॉडल संस्करण | दृश्य AgentBench |
| डेटासेट | प्रत्येक कार्य के लिए देव और टेस्ट |
| लीडरबोर्ड | खुला, सार्वजनिक |
| स्रोत कोड उपलब्धता | GitHub, खुला लाइसेंस |
| वितरण मॉडल | फ्री |
कौन है एजेंटबेंच?
एजेंटबेंच एक पेशेवर उपकरण है जो उपयोगकर्ताओं की विशिष्ट श्रेणियों के लिए उपयोगी होगा।
एआई एजेंट शोधकर्ता और डेवलपर्स
सबसे पहले, बेंचमार्क का उद्देश्य स्वायत्त एआई एजेंटों के निर्माण पर काम करने वाले विशेषज्ञों पर है। वे मानकीकृत स्थितियों के तहत अपने मॉडल का परीक्षण करने के लिए एजेंटबेंच का उपयोग कर सकते हैं और अन्य विकास के साथ परिणामों की तुलना कर सकते हैं। एक permissive लाइसेंस के तहत ओपन सोर्स कोड परीक्षण वातावरण को विशिष्ट अनुसंधान कार्यों के लिए अनुकूलित करने की अनुमति देता है।
LLM गुणवत्ता आकलन विशेषज्ञ
उन लोगों के लिए जो पेशेवर रूप से भाषा मॉडल की गुणवत्ता का मूल्यांकन करते हैं, एजेंटबेंच परिदृश्यों का एक तैयार सेट प्रदान करता है। उपलब्धता दो डेटासेट - देव और टेस्ट - अलग मॉडल ट्यूनिंग और अंतिम सत्यापन के लिए अनुमति देता है। यह विशेष रूप से उचित और प्रतिलिपि परीक्षण के निर्माण के लिए महत्वपूर्ण है।
कंपनी LLM को वर्कफ़्लो में एकीकृत करती है
प्रक्रिया स्वचालन के लिए नींव के रूप में भाषा मॉडल पर विचार करने वाले संगठन (डेटाबेस, ब्राउज़र या ऑपरेटिंग सिस्टम के साथ काम करना) उद्देश्य उम्मीदवार मूल्यांकन के लिए बेंचमार्क का उपयोग कर सकते हैं। यह उत्पादन में इसे एकीकृत करने से पहले विशिष्ट व्यवसाय कार्यों के लिए सबसे उपयुक्त मॉडल चुनने में मदद करता है।
एजेंटबेंच का उपयोग कैसे करें?
एजेंटबेंच के साथ काम करने की प्रक्रिया आपके द्वारा उपयोग किए जाने वाले उपकरण के संस्करण पर निर्भर करती है।
क्लासिक संस्करण
एजेंटबेंच के मूल संस्करण के साथ काम करने के लिए, आपको प्रत्येक आठ वातावरण को मैन्युअल रूप से कॉन्फ़िगर करने की आवश्यकता है। उपयोगकर्ता एक विशिष्ट कार्य का चयन करता है, संबंधित डेटासेट लोड करता है और मॉडल मूल्यांकन चलाता है। तब परिणामों की तुलना सार्वजनिक लीडरबोर्ड पर डेटा के साथ की जा सकती है। इस प्रक्रिया में कुछ तकनीकी कौशल की आवश्यकता होती है, क्योंकि प्रत्येक वातावरण में अपनी खुद की कॉन्फ़िगरेशन विशिष्ट होती है।
एजेंटबेंच FC और Docker Compose
अद्यतन एजेंटबेंच एफसी संस्करण तैनाती को काफी सरल बनाता है। Docker Compose के माध्यम से कंटेनरीकरण के लिए धन्यवाद, सभी परीक्षण वातावरण को एक ही आदेश के साथ लॉन्च किया जा सकता है। यह समय बचाता है और मैनुअल पर्यावरण सेटअप से जुड़े अधिकांश त्रुटियों को समाप्त करता है। उपयोगकर्ता को केवल डोकर स्थापित करने की आवश्यकता होती है, जो भंडार को बंद कर देता है और मानक लॉन्च कमांड चला जाता है। उसके बाद, मॉडल स्वचालित रूप से सभी वातावरण में परीक्षण किया जाएगा।
इसके अतिरिक्त, एक विस्तारित संस्करण — VisualAgentBench — multimodal मॉडल के लिए उपलब्ध है। यह दृश्य वातावरण में परीक्षण के लिए डिज़ाइन किया गया है: रोबोट नियंत्रण से लेकर चित्रमय इंटरफेस और वेब डिज़ाइन के साथ काम करने के लिए।
एजेंटबेंच की मुख्य विशेषताएं
मॉडल स्वायत्तता आकलन
एजेंटबेंच का मुख्य कार्य मानव हस्तक्षेप के बिना कार्य करने की मॉडल की क्षमता को माप रहा है। बेंचमार्क जांच करता है कि क्या मॉडल स्वतंत्र रूप से अपने पर्यावरण का विश्लेषण कर सकता है, निर्णय ले सकता है और अंतिम लक्ष्य तक पहुंचने तक बहु-चरण संचालन कर सकता है।
बहुपरत परीक्षण
आठ विभिन्न वातावरण मॉडल को विभिन्न कोणों से मूल्यांकन करने की अनुमति देते हैं। एक ऑपरेटिंग सिस्टम परीक्षण तकनीकी कौशल, पहेली परीक्षण रचनात्मकता और तर्क, और वेब शॉपिंग परीक्षण योजना की क्षमता और इंटरफेस के साथ बातचीत के साथ काम करना। यह दृष्टिकोण मॉडल की क्षमताओं की एक व्यापक तस्वीर प्रदान करता है।
समारोह कॉलिंग समर्थन
एजेंटबेंच एफसी संस्करण फंक्शन कॉलिंग प्रारूप का समर्थन करता है। इसका मतलब यह है कि मॉडल एक संरचित तरीके से बाहरी कार्यों को कॉल कर सकता है, जो स्वचालन उपकरण के रूप में LLM का उपयोग करने के वास्तविक दुनिया के परिदृश्यों के करीब परीक्षण कर सकता है।
मल्टीमोडल परीक्षण
उन मॉडलों के लिए जो न केवल पाठ बल्कि छवियों को संसाधित करते हैं, VisualAgentBench संस्करण को डिज़ाइन किया गया है। इसमें दृश्य धारणा वाले वातावरण शामिल हैं - GUI से रोबोटिक्स तक - यह आकलन करने की अनुमति देता है कि मल्टीमोडल मॉडल एक दृश्य संदर्भ के भीतर कितनी अच्छी तरह से समझता है और कार्य करता है।
एजेंटबेंच के लाभ
उपलब्धता
एजेंटबेंच से संबंधित सब कुछ - कोड, डेटासेट, परिणाम - सार्वजनिक रूप से उपलब्ध है। पूर्ण पारदर्शिता अन्य शोधकर्ताओं को परिणाम और विश्वास प्रकाशित डेटा को पुन: उत्पन्न करने की अनुमति देती है। नि: शुल्क वितरण मॉडल इसे चलाने के लिए तकनीकी क्षमता वाले किसी के लिए सुलभ उपकरण बनाता है।
यथार्थवादी परिदृश्य
कई अमूर्त परीक्षणों के विपरीत, एजेंटबेंच में वास्तविक दुनिया के कार्यों के करीब वातावरण शामिल हैं: सिस्टम प्रबंधन, खरीदारी, ब्राउज़िंग। यह एक अधिक उद्देश्यपूर्ण चित्र प्रदान करता है कि आदर्श प्रयोगशाला स्थितियों के बजाय मॉडल वास्तविक तैनाती में कैसे व्यवहार करेगा।
लचीलापन और तैनाती की आसानी
Docker Compose Containerization के साथ AgentBench FC की रिहाई ने बेंचमार्क - सेटअप जटिलता की मुख्य समस्याओं में से एक को हल किया। अब, परीक्षण चलाने के लिए न्यूनतम तकनीकी ज्ञान पर्याप्त है। इसके अलावा, टेक्स्ट-आधारित और मल्टीमॉडल मॉडल (विज़ुअल एजेंटबेंच के माध्यम से) दोनों का परीक्षण करने की क्षमता टूल को बहुमुखी बनाती है।
एजेंटबेंच के नुकसान
शुरुआती के लिए उच्च प्रवेश बाधा
एफसी संस्करण में सरलीकरण के बावजूद, एजेंटबेंच का उपयोग करने के लिए डॉकर, कमांड लाइन और भाषा मॉडल के साथ काम करने के बुनियादी सिद्धांतों जैसे तकनीकों को समझने की आवश्यकता होती है। एक तकनीकी पृष्ठभूमि के बिना लोगों के लिए, उपकरण मास्टर करने के लिए मुश्किल हो जाएगा।
ओपन सोर्स में सीमित जानकारी
वर्तमान में, सेटअप और परीक्षण के प्रत्येक चरण का वर्णन करने वाले अपेक्षाकृत कम विस्तृत प्रलेखन और निर्देश हैं। उपयोगकर्ताओं को अक्सर कोड को खुद को बाहर करना पड़ता है या इसी तरह के उपकरणों के साथ काम करने के सामान्य सिद्धांतों पर भरोसा करना पड़ता है।
विशिष्ट अनुप्रयोग क्षेत्र
चूंकि एजेंटबेंच एक मूल्यांकन उपकरण है, इसलिए इसका मूल्य केवल तभी महसूस किया जाता है जब आपके पास परीक्षण के लिए अपना खुद का मॉडल हो। अंत उपयोगकर्ताओं के लिए जो केवल एपीआई के माध्यम से तैयार एलएलएम का उपयोग करते हैं, बेंचमार्क कोई व्यावहारिक लाभ प्रदान नहीं करता है।
क्या समस्या है एजेंटबेंच हल?
इष्टतम मॉडल चयन
मुख्य कार्यों में से एक एजेंटबेंच पते एक विशिष्ट उपयोग मामले के लिए सबसे उपयुक्त मॉडल चुनने में मदद कर रहा है। लीडरबोर्ड पर मॉडल परिणामों की तुलना करके, एक डेवलपर यह तय कर सकता है कि कौन से मॉडल बेहतर प्रदर्शन करेगा, उदाहरण के लिए, डेटाबेस या वेब इंटरफेस के साथ।
ट्रैकिंग विकास प्रगति
अनुसंधान समूहों के लिए, बेंचमार्क एक समन्वय प्रणाली के रूप में कार्य करता है: यह ट्रैकिंग की अनुमति देता है कि कैसे एक मॉडल प्रत्येक नए पुनरावृत्ति के साथ सुधार करता है और उन क्षेत्रों की पहचान करता है जिनकी अभी भी कमजोरियों को शोधन की आवश्यकता होती है।
मानकीकरण परीक्षण
एजेंटबेंच अपने तरीके से "हर किसी भी परीक्षण" की समस्या को हल करता है। वातावरण और डेटासेट का एक एकीकृत सेट एक सामान्य आधार पर विभिन्न टीमों और मॉडल से परिणामों की तुलना करने की अनुमति देता है। अलग देव और टेस्ट सेट की उपलब्धता डेटा का परीक्षण करने के लिए मॉडल को "ओवरफिटिंग" से बचने में मदद करती है।
एजेंटबेंच मूल्य निर्धारण
एजेंटबेंच को एक नि: शुल्क मॉडल के तहत वितरित किया जाता है, जिसका अर्थ है कि यह पूरी तरह से नि: शुल्क है। यह गिटहब पर कोड तक पहुंच के लिए दोनों लागू होता है और परिणाम के साथ सार्वजनिक लीडरबोर्ड में। उपयोगकर्ता को बेंचमार्क का उपयोग करने के लिए भुगतान करने की आवश्यकता नहीं है।
हालांकि, संभावित अप्रत्यक्ष लागत पर विचार किया जाना चाहिए। कंटेनर प्रारूप (डॉकर कम्पास) में सभी वातावरण चलाने के लिए पर्याप्त संसाधनों के साथ सर्वर या स्थानीय हार्डवेयर की आवश्यकता होती है - सीपीयू, मेमोरी और डिस्क स्थान। इसके अतिरिक्त, यदि आप भुगतान किए गए व्यावसायिक मॉडलों का परीक्षण करने की योजना बना रहे हैं, तो, उनके एपीआई अनुरोधों की लागत एजेंटबेंच द्वारा कवर नहीं की जाती है। लेकिन मूल्यांकन उपकरण ही पूरी तरह से मुक्त रहता है।
एजेंटबेंच के लिए उपयोग की शर्तें
कोड लाइसेंस
एजेंटबेंच स्रोत कोड को एक ओपन लाइसेंस के तहत गिटहब पर प्रकाशित किया गया है। इसका मतलब यह है कि डेवलपर्स अपने उद्देश्यों के लिए कोड का स्वतंत्र रूप से उपयोग, संशोधित और अनुकूलन कर सकते हैं। प्रस्तावना में निर्दिष्ट विशिष्ट लाइसेंस की शर्तों का पालन करना महत्वपूर्ण है।
परिणाम का उपयोग
मॉडल मूल्यांकन परिणाम सार्वजनिक लीडरबोर्ड पर प्रकाशित किए जाते हैं। कोई भी उपयोगकर्ता डेटा की समीक्षा कर सकता है और इसे उनके उद्देश्यों के लिए उपयोग कर सकता है - अनुसंधान, लेख, या मॉडल चयन में। आमतौर पर कोई अनिवार्य विशेषता नहीं है, लेकिन प्रकाशन में लीडरबोर्ड डेटा का उपयोग करते समय स्रोत को उद्धृत करना अच्छा अभ्यास माना जाता है।
प्रैक्टिकल सीमा
चूंकि एजेंटबेंच एक परीक्षण उपकरण है, इसलिए इसका उपयोग आपको पहले से ही अपना खुद का भाषा मॉडल या व्यावसायिक मॉडल एपीआई तक पहुंच मानता है। बेंचमार्क स्वयं मॉडल तक पहुंच प्रदान नहीं करता है - यह केवल उनका मूल्यांकन करता है। इसके अतिरिक्त, चलने वाले परीक्षणों को डॉकर के साथ एक तकनीकी वातावरण की आवश्यकता होती है और पर्याप्त कंप्यूटिंग संसाधनों की आवश्यकता होती है।
एजेंटबेंच उपलब्धता
कोड तक पहुंच
एजेंटबेंच कोड भंडार सार्वजनिक रूप से गिटहब पर उपलब्ध है। कोई भी परियोजना को क्लोन कर सकता है, कोड का अध्ययन कर सकता है और इसका उपयोग कर सकता है। अपने स्वयं के विकास में। यह अपने भौगोलिक स्थान या वित्तीय क्षमताओं के बावजूद दुनिया भर में शोधकर्ताओं के लिए सुलभ उपकरण बनाता है।
सार्वजनिक लीडरबोर्ड
मॉडल मूल्यांकन परिणाम सार्वजनिक लीडरबोर्ड पर प्रकाशित किए जाते हैं। उपयोगकर्ता वास्तविक समय में ट्रैक कर सकते हैं जो मॉडल विभिन्न वातावरणों में सर्वोत्तम परिणाम दिखाते हैं। लीडरबोर्ड पंजीकरण या भुगतान के बिना किसी को देखने के लिए उपलब्ध है।
अद्यतन और विकास
परियोजना सक्रिय रूप से विकसित हो रही है: अक्टूबर 2024 में, एजेंटबेंच एफसी संस्करण को मल्टीमोडल मॉडल के लिए विजुअलएजेंटबेंच संस्करण के साथ जारी किया गया था। यह इंगित करता है कि उपकरण डेवलपर्स द्वारा बनाए रखा गया है और समुदाय की बदलती जरूरतों को अनुकूलित करता है।
कैसे विकल्प से एजेंटबेंच डिफर्स
व्यापक वातावरण
भाषा मॉडल का मूल्यांकन करने के लिए कई मौजूदा बेंचमार्क एकल प्रकार के कार्य पर ध्यान केंद्रित करते हैं - उदाहरण के लिए, केवल पाठ पीढ़ी या प्रश्न का उत्तर देना। एजेंटबेंच में आठ विविध वातावरण शामिल हैं, जिनमें ऑपरेटिंग सिस्टम, डेटाबेस और वेब ब्राउज़र के साथ काम करना शामिल है। यह व्यापक कवरेज संकीर्ण विशिष्ट परीक्षणों की तुलना में मॉडल की क्षमताओं की एक पूरी तस्वीर प्रदान करता है।
स्वायत्तता पर ध्यान केंद्रित करें
अधिकांश क्लासिक बेंचमार्क में, मॉडल एक सवाल का जवाब देता है या एक कदम कार्रवाई करता है। हालांकि, एजेंटबेंच विशेष रूप से एक स्वायत्त एजेंट के रूप में मॉडल का मूल्यांकन करता है: योजना बनाने, मध्यवर्ती निर्णय लेने और पर्यावरण से प्रतिक्रिया के आधार पर कार्रवाई को समायोजित करने की क्षमता। यह मौलिक रूप से जटिलता का एक अलग स्तर है।
खुलापन और अवसंरचना
जबकि अन्य खुले बेंचमार्क मौजूद हैं, एजेंटबेंच अपने अच्छी तरह से संपन्न बुनियादी ढांचे के साथ बाहर खड़ा है। Docker Compose Containerization और समारोह कॉल समर्थन के साथ एफसी संस्करण कई विकल्प है कि जटिल मैनुअल सेटअप की आवश्यकता की तुलना में एक कदम आगे है। मल्टीमॉडल मॉडल के लिए अलग-अलग विजुअल एजेंटबेंच संस्करण भी प्रतियोगियों से इस उपकरण को अलग करता है।
निष्कर्ष
एजेंटबेंच स्वायत्त एजेंटों की भूमिका में बड़े भाषा मॉडल का मूल्यांकन करने के लिए एक पेशेवर ओपन-सोर्स बेंचमार्क है। आठ विविध वातावरणों के लिए धन्यवाद, एफसी संस्करण में फ़ंक्शन कॉल समर्थन, और डोकर कॉम्पोज़ के माध्यम से कंटेनरीकृत तैनाती, उपकरण शोधकर्ताओं और डेवलपर्स को सुविधाजनक और मानकीकृत परीक्षण मंच प्रदान करता है। सार्वजनिक लीडरबोर्ड, कोड तक मुफ्त पहुंच और मल्टीमोडल मॉडल के लिए एक अलग संस्करण की उपलब्धता एजेंटबेंच को आधुनिक एआई एजेंट विकास पारिस्थितिकी तंत्र में एक महत्वपूर्ण उपकरण बनाती है। शुरुआती के लिए इसे मास्टर करने में कुछ कठिनाइयों के बावजूद, बेंचमार्क वास्तविक दुनिया के कार्यों को हल करने के लिए मॉडल की व्यावहारिक उपयुक्तता का आकलन करने का एक विश्वसनीय तरीका है।
अक्सर पूछे जाने वाले प्रश्न
यह भी देखें

एआई-आधारित वीडियो निर्माण और संपादन टूलकिट, जिसमें अवतार, लिप-सिंक और आवाज़ क्लोनिंग शामिल हैं।

क्रोम एक्सटेंशन जो AI सहायक की मदद से टैब, इतिहास और बुकमार्क प्रबंधित करने में मदद करता है।

विश्व समाचार एकत्र करने का मंच, जो विश्लेषण और पूर्वाग्रह कम करने के लिए AI का उपयोग करता है।

कैबिना AI एक एकीकृत प्लेटफ़ॉर्म है जो विभिन्न जनरेटिव न्यूरल नेटवर्क के साथ काम करने के लिए है, जिससे टेक्स्ट, चित्र और वीडियो बनाना संभव होता है।

ग्राहक सहायता और लीड जनरेशन को स्वचालित करने के लिए मल्टी-एजेंट एआई सिस्टम और चैटबॉट बनाने का मंच।.

परियोजना प्रबंधन मंच जिसमें कार्य निर्धारण, समय ट्रैकिंग और कर्मचारी कार्यभार नियंत्रण की सुविधाएँ शामिल हैं।

ओपन-सोर्स टूल जो एक छवि को तेज़ी से 3D मॉडल में बदल देता है।

साइड AI पैनल जो सवालों के जवाब देने, दस्तावेज़ों के साथ काम करने और छवियाँ बनाने में मदद करता है।