FinSkillBench किसका और क्यों मूल्यांकन करता है
निवेश प्रबंधन के लिए AI एजेंटों की तुलना करते समय, भाषा मॉडल चुनने में बहकना आसान है: अधिक पैरामीटर, नया आर्किटेक्चर, सामान्य परीक्षणों पर बेहतर परिणाम। लेकिन FinSkillBench समस्या को दूसरे नज़रिए से देखने का सुझाव देता है: एजेंट वित्तीय प्रक्रियात्मक कौशल — चरण-दर-चरण निर्देश और निष्पादन योग्य घटक जो ज्ञान को क्रिया में बदलते हैं — का उपयोग करना कितना जानता है।
बेंचमार्क निवेश कार्य के तीन प्रमुख क्षेत्रों को कवर करता है:
- पोर्टफोलियो निर्माण
- जोखिम प्रबंधन
- मौलिक विश्लेषण
इन क्षेत्रों के भीतर, लेखकों ने 12 उप-कार्य और 2603 एपिसोड एकत्र किए हैं। प्रत्येक एपिसोड एक विशिष्ट समय बिंदु पर डेटा वाला एक कार्य है, जिसमें छिपा हुआ सही उत्तर और एक अभिव्यक्ति होती है जिसे एजेंट को क्रिया में बदलना होता है। यानी, मॉडल की स्मृति की जाँच नहीं की जाती, बल्कि सही समय पर सही प्रक्रिया लागू करने की उसकी क्षमता की जाँच की जाती है।

एजेंट के काम करने के तीन तरीके
यह समझने के लिए कि कौशल वास्तव में क्या देता है, लेखकों ने एजेंट के व्यवहार के तीन प्रकारों की तुलना की।
- बिना कौशल के। मॉडल कार्य को "नंगे" ज्ञान से हल करता है, बिना किसी बाहरी संकेत के कि कैसे कार्य करना है।
- क्यूरेटेड कौशल के साथ। एजेंट को विशेषज्ञों द्वारा चुने गए प्रक्रियात्मक दस्तावेज़ों और निष्पादन योग्य घटकों का एक सेट मिलता है। यह वास्तव में क्रियाओं की एक तैयार लाइब्रेरी है: नियम, सूत्र, एल्गोरिदम।
- स्व-जनित कौशल के साथ। एजेंट समाधान के दौरान अपनी स्वयं की प्रक्रियाएँ लिखता है और उसी एपिसोड के भीतर उन्हें आगे उपयोग करने का प्रयास करता है।
मुख्य प्रश्न यह था कि क्या अच्छी तरह से तैयार की गई प्रक्रियाएँ मॉडल की सीमाओं की भरपाई करती हैं — या एक स्मार्ट मॉडल स्वयं ही सामना करने में सक्षम है।
परिणाम काफी संकेतक निकले। नौ मॉडलों पर, क्यूरेटेड कौशल जोड़ने से अंतिम स्कोर में लगातार सुधार हुआ: औसत परिणाम 0.366 से बढ़कर 0.528 हो गया। प्रभाव पोर्टफोलियो निर्माण और जोखिम प्रबंधन में सबसे अधिक स्पष्ट था — जहाँ क्रियाओं का क्रम और स्पष्ट नियम महत्वपूर्ण हैं।
स्व-जनन लगभग मदद नहीं करता
अंतर्ज्ञान कहता है: मॉडल को अपनी प्रक्रियाएँ बनाने की क्षमता दें — और यह दूसरों के टेम्पलेट्स की तुलना में कार्य के लिए बेहतर अनुकूल होगा। प्रयोग में इसकी पुष्टि नहीं हुई। स्व-जनित कौशल ने केवल मामूली सुधार दिया, लेकिन काफी अधिक कंप्यूटेशनल संसाधनों की माँग की। एजेंट ने प्रक्रियाओं को बनाने और फिर से लिखने में समय बिताया, लेकिन परिणाम लगभग नहीं बदला।
भोला स्व-जनन हर कार्य में पहिये का पुनः आविष्कार करने जैसा है: महंगा और गुणवत्ता की कोई गारंटी नहीं। एक तैयार, सिद्ध प्रक्रियात्मक कौशल मॉडल द्वारा हर बार शून्य से विधि निकालने के प्रयास की तुलना में अधिक विश्वसनीय साबित होता है।
दूसरे फ्रेमवर्क पर पुनरुत्पादन क्षमता
किसी भी बेंचमार्क को किसी विशिष्ट वातावरण के अनुरूप "समायोजित" किया जा सकता है। इसलिए, लेखकों ने एक स्वतंत्र एजेंट फ्रेमवर्क Hermes Agent पर अतिरिक्त रूप से मूल्यांकन चलाया: 8 मॉडल, 5280 एपिसोड, वही तीन क्षेत्र। सामान्य प्रवृत्ति की पुष्टि हुई — तैयार कौशल सभी दिशाओं में एजेंटों के काम में सुधार करते हैं।
हालाँकि, प्रभाव का परिमाण असमान निकला: यह उप-कार्य और एजेंट "पाइपलाइन" की संरचना दोनों पर निर्भर करता था। यह एक महत्वपूर्ण टिप्पणी है: कौशल कोई जादुई बटन नहीं हैं, लेकिन वे एक व्यवस्थित लाभ देते हैं।

निवेश एजेंट बनाने वालों के लिए निष्कर्ष
अध्ययन का मुख्य व्यावहारिक सबक: निवेश प्रबंधन में, विश्वसनीय प्रक्रियात्मक कौशल तक पहुँच आधार मॉडल के चयन से कम महत्वपूर्ण नहीं हो सकती है। यदि एजेंट के पास एक स्पष्ट प्रक्रिया है और वह उसका पालन करना जानता है, तो वह अक्सर एक मजबूत मॉडल से बेहतर प्रदर्शन करता है जो आँख मूंदकर कार्य करता है।
उत्पाद टीमों के लिए, इसका मतलब है कि सभी प्रयास केवल मॉडल चुनने में नहीं लगाने चाहिए। सिद्ध वित्तीय प्रक्रियाओं की लाइब्रेरी बनाने पर ध्यान देना उचित है: पोर्टफोलियो शेयरों की पुनर्गणना कैसे करें, जोखिम कारक को कैसे ध्यान में रखें, रिपोर्टिंग का विश्लेषण कैसे करें। लेखक अलग से जोर देते हैं: प्रक्रियाएँ क्यूरेटेड होनी चाहिए, न कि एजेंट द्वारा मौके पर बनाई गई।
अंतिम विवरण: लेखकों ने स्वयं बेंचमार्क, मूल्यांकन उपकरण, क्यूरेटेड कौशल के पैकेज और एजेंटों के कार्यों के पूर्ण प्रक्षेप पथ खोले हैं। यह परिणामों को पुन: पेश करने और सब कुछ शून्य से इकट्ठा किए बिना अपनी स्वयं की एजेंट प्रणाली विकसित करने की अनुमति देता है।



