FinSkillBench: বিনিয়োগ AI-এজেন্টে প্রস্তুত পদ্ধতিগত দক্ষতা কখনো কখনো মডেল নির্বাচনের চেয়ে বেশি গুরুত্বপূর্ণ

9 সেপ্টেম্বর 2026২ প্রদর্শন

নতুন বেঞ্চমার্ক পোর্টফোলিও অপ্টিমাইজেশন, রিস্ক-ম্যানেজমেন্ট এবং ফান্ডামেন্টাল অ্যানালিসিসে ভাষা এজেন্টদের পরীক্ষা করে। নয়টি মডেলে পূর্ব-সংগৃহীত স্কিল প্যাকেজ গড় ফলাফল উল্লেখযোগ্যভাবে উন্নত করে, আর এজেন্টের নিজে থেকে স্কিল তৈরি করা প্রায় কোনো লাভ দেয় না।

FinSkillBench: বিনিয়োগ AI-এজেন্টে প্রস্তুত পদ্ধতিগত দক্ষতা কখনো কখনো মডেল নির্বাচনের চেয়ে বেশি গুরুত্বপূর্ণ

FinSkillBench কী মূল্যায়ন করে এবং কেন

ইনভেস্টমেন্ট ম্যানেজমেন্টের জন্য AI এজেন্ট তুলনা করার সময়, ভাষা মডেল বেছে নেওয়ার দিকে মনোযোগ দেওয়া সহজ: বেশি প্যারামিটার, নতুন আর্কিটেকচার, সাধারণ পরীক্ষায় ভালো ফলাফল। কিন্তু FinSkillBench সমস্যাটিকে অন্য দৃষ্টিকোণ থেকে দেখার প্রস্তাব দেয়: এজেন্ট আসলে কতটা আর্থিক প্রক্রিয়াগত দক্ষতা ব্যবহার করতে পারে — ধাপে ধাপে নির্দেশনা এবং এক্সিকিউটেবল উপাদান, যা জ্ঞানকে কর্মে রূপান্তরিত করে।

বেনচমার্কটি ইনভেস্টমেন্ট কাজের তিনটি মূল ক্ষেত্র কভার করে:

  • পোর্টফোলিও নির্মাণ
  • ঝুঁকি ব্যবস্থাপনা
  • মৌলিক বিশ্লেষণ

এই ক্ষেত্রগুলির মধ্যে, লেখকরা ১২টি উপ-কাজ এবং ২৬০৩টি এপিসোড সংগ্রহ করেছেন। প্রতিটি এপিসোড হলো একটি নির্দিষ্ট সময়ের ডেটা, লুকানো সঠিক উত্তর এবং এমন একটি বিবৃতি সহ একটি কাজ, যা এজেন্টকে কর্মে রূপান্তর করতে হবে। অর্থাৎ, মডেলের স্মৃতি পরীক্ষা করা হয় না, বরং সঠিক সময়ে সঠিক প্রক্রিয়া প্রয়োগ করার ক্ষমতা পরীক্ষা করা হয়।

এজেন্টের কাজের তিনটি মোড

ঠিক কী দক্ষতা দেয় তা বোঝার জন্য, লেখকরা এজেন্টের আচরণের তিনটি ভিন্নতা তুলনা করেছেন।

  1. দক্ষতা ছাড়া। মডেলটি কাজটি "খালি" জ্ঞান দিয়ে সমাধান করে, কীভাবে কাজ করতে হবে সে সম্পর্কে বাহ্যিক কোনো ইঙ্গিত ছাড়াই।
  2. কিউরেটেড দক্ষতা সহ। এজেন্ট বিশেষজ্ঞদের দ্বারা নির্বাচিত প্রক্রিয়াগত নথি এবং এক্সিকিউটেবল উপাদানগুলির একটি সেট পায়। এটি কার্যত একটি প্রস্তুত অ্যাকশন লাইব্রেরি: নিয়ম, সূত্র, অ্যালগরিদম।
  3. স্ব-উত্পন্ন দক্ষতা সহ। এজেন্ট সমাধানের সময় নিজস্ব প্রক্রিয়া লেখে এবং একই এপিসোডের মধ্যে সেগুলি ব্যবহার করার চেষ্টা করে।

মূল প্রশ্ন ছিল, ভালোভাবে প্রস্তুত প্রক্রিয়াগুলি মডেলের সীমাবদ্ধতাগুলি পূরণ করে কিনা — নাকি একটি বুদ্ধিমান মডেল নিজেই মোকাবেলা করতে সক্ষম।

ফলাফলগুলি তাৎপর্যপূর্ণ ছিল। নয়টি মডেলে, কিউরেটেড দক্ষতা যোগ করা ধারাবাহিকভাবে চূড়ান্ত স্কোর উন্নত করেছে: গড় ফলাফল ০.৩৬৬ থেকে ০.৫২৮ এ বেড়েছে। প্রভাবটি পোর্টফোলিও নির্মাণ এবং ঝুঁকি ব্যবস্থাপনায় সবচেয়ে শক্তিশালী ছিল — যেখানে কর্মের ক্রম এবং স্পষ্ট নিয়ম গুরুত্বপূর্ণ।

স্ব-উত্পাদন প্রায় সাহায্য করে না

স্বজ্ঞা পরামর্শ দেয়: মডেলটিকে নিজস্ব প্রক্রিয়া তৈরি করার সুযোগ দিন — এবং এটি অন্যদের টেমপ্লেটের চেয়ে কাজের সাথে ভালো খাপ খাইয়ে নেবে। পরীক্ষায় এটি নিশ্চিত হয়নি। স্ব-উত্পন্ন দক্ষতা কেবল সামান্য উন্নতি দিয়েছে, তবে উল্লেখযোগ্যভাবে বেশি গণনামূলক সংস্থান প্রয়োজন। এজেন্ট প্রক্রিয়া তৈরি এবং পুনর্লিখনে সময় ব্যয় করেছে, কিন্তু ফলাফল প্রায় অপরিবর্তিত ছিল।

নিষ্পাপ স্ব-উত্পাদন প্রতিটি কাজে চাকা পুনরায় আবিষ্কারের মতো: ব্যয়বহুল এবং মানের কোনো নিশ্চয়তা ছাড়া। একটি প্রস্তুত, পরীক্ষিত প্রক্রিয়াগত দক্ষতা মডেলের প্রতিবার স্ক্র্যাচ থেকে পদ্ধতি বের করার চেষ্টার চেয়ে বেশি নির্ভরযোগ্য।

অন্য ফ্রেমওয়ার্কে পুনরুত্পাদনযোগ্যতা

যেকোনো বেনচমার্ককে নির্দিষ্ট পরিবেশের সাথে "সাজানো" যেতে পারে। তাই লেখকরা অতিরিক্তভাবে একটি স্বাধীন এজেন্ট ফ্রেমওয়ার্ক Hermes Agent-এ মূল্যায়ন চালিয়েছেন: ৮টি মডেল, ৫২৮০টি এপিসোড, একই তিনটি ক্ষেত্র। সাধারণ প্যাটার্নটি নিশ্চিত হয়েছে — প্রস্তুত দক্ষতা সব দিক থেকে এজেন্টের কাজ উন্নত করে।

তবে, প্রভাবের মাত্রা অসম ছিল: এটি উপ-কাজ এবং এজেন্ট "পাইপলাইন" কীভাবে গঠিত তার উপর নির্ভর করে। এটি একটি গুরুত্বপূর্ণ সতর্কতা: দক্ষতা একটি জাদুর বোতাম নয়, তবে তারা একটি পদ্ধতিগত সুবিধা দেয়।

যারা ইনভেস্টমেন্ট এজেন্ট তৈরি করেন তাদের জন্য উপসংহার

গবেষণার প্রধান ব্যবহারিক পাঠ: ইনভেস্টমেন্ট ম্যানেজমেন্টে, নির্ভরযোগ্য প্রক্রিয়াগত দক্ষতার অ্যাক্সেস বেস মডেল নির্বাচনের মতোই গুরুত্বপূর্ণ হতে পারে। যদি এজেন্টের কাছে একটি স্পষ্ট প্রক্রিয়া থাকে এবং সে তা অনুসরণ করতে জানে, তবে সে প্রায়শই একটি শক্তিশালী মডেলের চেয়ে ভালো করে, যা অন্ধভাবে কাজ করে।

প্রোডাক্ট টিমের জন্য এর অর্থ হলো, শুধুমাত্র মডেল নির্বাচনে সমস্ত প্রচেষ্টা বিনিয়োগ করা উচিত নয়। পরীক্ষিত আর্থিক প্রক্রিয়াগুলির একটি লাইব্রেরি গঠনে মনোযোগ দেওয়া উচিত: পোর্টফোলিও শেয়ার কীভাবে পুনঃগণনা করা যায়, ঝুঁকির কারণ কীভাবে বিবেচনা করা যায়, রিপোর্টিং কীভাবে বিশ্লেষণ করা যায়। লেখকরা আলাদাভাবে জোর দিয়েছেন: প্রক্রিয়াগুলি কিউরেটেড হওয়া উচিত, এজেন্ট দ্বারা চলতে চলতে তৈরি নয়।

চূড়ান্ত বিবরণ: লেখকরা বেনচমার্ক, মূল্যায়ন সরঞ্জাম, কিউরেটেড দক্ষতার প্যাকেজ এবং এজেন্টদের সম্পূর্ণ কর্মের ট্র্যাজেক্টোরি উন্মুক্ত করেছেন। এটি ফলাফল পুনরুত্পাদন এবং নিজস্ব এজেন্ট সিস্টেম বিকাশের অনুমতি দেয়, সবকিছু স্ক্র্যাচ থেকে তৈরি না করেই।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
FinSkillBench: বিনিয়োগ AI-এজেন্টে প্রস্তুত পদ্ধতিগত দক্ষতা কখনো কখনো মডেল নির্বাচনের চেয়ে বেশি গুরুত্বপূর্ণ