নতুন ব্যক্তিত্ব প্রশ্নাবলী CSI BFI-এর বিকল্প হিসেবে মূল্যায়নকে আরও স্থিতিশীল ও ভবিষ্যদ্বাণীমূলক করে তোলে

7 সেপ্টেম্বর 2026১৯ প্রদর্শন

গবেষকরা Core Sentiment Inventory (CSI) তৈরি করেছেন — একটি টুল যা LLM-এর ব্যক্তিত্বের বৈশিষ্ট্য মূল্যায়ন করে, তাদের গণনামূলক প্রকৃতিকে বিবেচনায় নিয়ে। এটি শব্দচয়নের পরিবর্তনের প্রতি আরও স্থিতিশীল সাড়া দেয়, ইংরেজি এবং চীনা ভাষায় কাজ করে এবং ০.৮৫-এর বেশি পারস্পরিক সম্পর্কসহ মডেলের বাস্তব আচরণ পূর্বাভাস দেয়।

নতুন ব্যক্তিত্ব প্রশ্নাবলী CSI BFI-এর বিকল্প হিসেবে মূল্যায়নকে আরও স্থিতিশীল ও ভবিষ্যদ্বাণীমূলক করে তোলে

বড় ভাষার মডেলগুলো ক্রমশ কথোপকথনকারী, সহকারী এবং স্বয়ংক্রিয় «নির্বাহক»-এর ভূমিকা নিচ্ছে। আমরা তাদের যত বেশি দায়িত্ব দিই, মডেলটি কোন শৈলীতে কাজ করে তা আগে থেকে বোঝা তত বেশি গুরুত্বপূর্ণ: কোথায় এটি ছাড় দিতে ঝোঁক, কোথায় নিজের মতামতে অনড় থাকে, আর কোথায় কেবল বিশ্বাসযোগ্য উত্তর দেয়। অনুশীলনে, LLM-এর «ব্যক্তিত্ব» প্রায়শই ক্লাসিক্যাল মনস্তাত্ত্বিক প্রশ্নাবলী, যেমন Big Five Inventory (BFI), দিয়ে মাপার চেষ্টা করা হয়। কিন্তু মানুষের জন্য তৈরি এই পদ্ধতিকে নিউরাল নেটওয়ার্কে প্রয়োগ করলে তা ব্যর্থ হয়।

কেন BFI LLM মূল্যায়নের জন্য উপযুক্ত নয়

BFI-র পদ্ধতিটি যুক্তিসঙ্গত মনে হয়: মানুষের মধ্যে অভিজ্ঞতার প্রতি উন্মুক্ততা, বিবেকবোধ, বহির্মুখিতা, সহানুভূতি এবং নিউরোটিসিজম মাপা হয় — কেন একই স্কেলে মডেলটিকে পরীক্ষা করা যাবে না? সমস্যা হলো, BFI এবং অনুরূপ প্রশ্নাবলী মানুষের জন্য তৈরি এবং আত্ম-প্রতিবেদনের ক্ষমতা ধরে নেয়। নিউরাল নেটওয়ার্ক মানুষের মতো নিজের সম্পর্কে চিন্তা করে না: এটি প্রশিক্ষণ ডেটার ভিত্তিতে সবচেয়ে বিশ্বাসযোগ্য পাঠ্য নির্বাচন করে। তাই ফলাফল «এলোমেলো» বিবরণের উপর heavily নির্ভর করে: প্রশ্নের শব্দচয়ন, বিবৃতির ক্রম, সিস্টেম প্রম্পটে সামান্য পরিবর্তন।

এ থেকে প্রথম সীমাবদ্ধতা আসে — কম নির্ভরযোগ্যতা। একই মডেলকে ন্যূনতম পরিবর্তনসহ একই পরীক্ষায় চালান — এবং ভিন্ন «ব্যক্তিত্ব» পাওয়া যেতে পারে। এই ধরনের মূল্যায়ন ইঞ্জিনিয়ারিং সিদ্ধান্ত নেওয়ার জন্য প্রায় অনুপযোগী: এমন একটি বৈশিষ্ট্যের উপর seriously নির্ভর করা যায় না যা কয়েকটি সমার্থক শব্দে বদলে যায়।

দ্বিতীয় সমস্যাটি আরও গভীর। BFI-র মনস্তাত্ত্বিক ধারণাগুলো মানুষকে বর্ণনা করে, কোনো গণনামূলক ব্যবস্থাকে নয়। মডেলের মানবিক অর্থে কোনো ব্যক্তিত্ব নেই, যদিও তার আচরণে স্থিতিশীল প্যাটার্ন লক্ষ্য করা যেতে পারে। ক্লাসিক্যাল প্রশ্নাবলী মানুষের জন্য তৈরি জিনিস ধারণ করার চেষ্টা করে, এবং সেজন্যই এটি ভবিষ্যদ্বাণী করতে ব্যর্থ হয় যে LLM বাস্তব অনুরোধে কীভাবে আচরণ করবে: এই ধরনের সরঞ্জামের বৈধতা ভবিষ্যদ্বাণীর জন্য সীমিত।

CSI: মানুষের জন্য নয়, মডেলের জন্য ডিজাইন করা প্রশ্নাবলী

মানুষের প্রশ্নাবলীকে অসীমভাবে মানিয়ে নেওয়ার পরিবর্তে, নতুন কাজের লেখকরা শুরু থেকে সরঞ্জামটি পুনর্নির্মাণের প্রস্তাব দেন। Core Sentiment Inventory (CSI) বিশেষভাবে LLM-এর ব্যক্তিত্বের বৈশিষ্ট্য মূল্যায়নের জন্য ডিজাইন করা হয়েছিল। মূল ধারণা — «একমত / অসম্মত» সরাসরি উত্তরের পথ ছেড়ে দেওয়া। CSI পরোক্ষ সংকেতের মাধ্যমে প্রোফাইল পুনর্গঠন করে, অর্থাৎ কার্যত মডেলটি প্রদত্ত পরিস্থিতিতে কীভাবে আচরণ বেছে নেয় তার ভিত্তিতে। এই ধরনের অপ্রকাশ্য মূল্যায়ন মডেলকে «কাঙ্ক্ষিত» উত্তর দেওয়ার জন্য কম উস্কে দেয় এবং আরও স্বাভাবিক প্যাটার্ন দেখতে দেয়।

পদ্ধতিটি প্রাথমিকভাবে দুটি ভাষা অন্তর্ভুক্ত করে — ইংরেজি এবং চীনা। এটি মূলনীতি: ভাষাগত ও সাংস্কৃতিক প্রেক্ষাপট মডেলের আচরণ পরিবর্তন করে, এবং দ্বিভাষিক প্রশ্নাবলী এটিকে ট্র্যাক করতে দেয়, গড় চিত্র উপস্থাপন করার পরিবর্তে। আউটপুটে CSI কেবল কয়েকটি স্কোর নয়, মডেলের একটি মনস্তাত্ত্বিক প্রতিকৃতি তৈরি করে: কোন বৈশিষ্ট্যগুলি কোন পরিস্থিতিতে বেশি প্রকাশ পায় তার বর্ণনা।

পরীক্ষাগুলো কী দেখিয়েছে

পরীক্ষায় লেখকরা CSI-কে LLM ব্যক্তিত্ব মূল্যায়নের বিদ্যমান পদ্ধতির সাথে তুলনা করেছেন। তাদের তথ্য অনুসারে, নতুন পদ্ধতিটি তিনটি স্তরে কাজ করে:

  • সূক্ষ্মতার প্রতি সংবেদনশীলতা। CSI মডেলগুলির আচরণে সূক্ষ্ম পার্থক্য ধরে, ভাষা এবং প্রেক্ষাপটের ধরনগুলির মধ্যে পার্থক্য সহ। প্রোফাইলগুলো আচরণকে গড়ে মসৃণ করে না, বরং গুরুত্বপূর্ণ বিবরণ সংরক্ষণ করে।
  • নির্ভরযোগ্যতা। CSI-র ফলাফল বর্তমান সরঞ্জামগুলির তুলনায় উল্লেখযোগ্যভাবে বেশি সামঞ্জস্যপূর্ণ এবং স্থিতিশীল ছিল। শর্তে ছোট পরিবর্তন চূড়ান্ত চিত্রকে কম প্রভাবিত করে।
  • ভবিষ্যদ্বাণী ক্ষমতা। CSI মূল্যায়ন এবং মডেলগুলির প্রকৃত আউটপুটের মধ্যে সম্পর্ক 0.85 ছাড়িয়ে গেছে। এটি একটি শক্তিশালী সম্পর্ক: যদি CSI বলে যে মডেলটি নির্দিষ্টভাবে আচরণ করতে ঝোঁক, বাস্তব আচরণ উচ্চ সম্ভাবনায় পূর্বাভাসের সাথে মিলবে।

এই ধরনের বৈশিষ্ট্যের সেট বিরল: কিছু পদ্ধতি আচরণ ভালোভাবে আলাদা করে, কিন্তু অস্থির; অন্যরা স্থিতিশীল, কিন্তু মডেলের বাস্তব কর্ম সম্পর্কে কম বলে। CSI উভয় গুণ একত্রিত করার চেষ্টা করে।

অনুশীলনে এর প্রয়োজন কেন

LLM-এর স্থিতিশীল ব্যক্তিত্ব প্রোফাইল কেবল গবেষণার বিষয় হিসেবেই নয়, গুণমান নিয়ন্ত্রণের একটি সরঞ্জাম হিসেবেও দরকারী: সহকারীর জন্য কোন যোগাযোগ শৈলী প্রয়োজন তা আগে থেকে নির্ধারণ করা যায় এবং নিশ্চিত হওয়া যায় যে কাজের শব্দচয়ন পরিবর্তনে মডেল «ভেঙে» পড়ে না। CSI জ্ঞান-ভিত্তিক বেঞ্চমার্কের পাশাপাশি আচরণগত বৈশিষ্ট্যের ভিত্তিতে মডেলগুলিকে তুলনা করতেও দেয়।

সবশেষে, «ব্যক্তিত্ব» মূল্যায়নের এই কাঠামো দায়িত্বশীল AI উন্নয়নের জন্য গুরুত্বপূর্ণ। মডেলের মধ্যে কোন আচরণগত প্যাটার্ন স্থির আছে তা যত সঠিকভাবে বুঝি, অবাঞ্ছিত প্রবণতা তত আগে লক্ষ্য করা যায় — সেগুলি বাস্তব পণ্যে প্রকাশ পাওয়ার আগেই। লেখকরা পদ্ধতির কোড প্রকাশ করেছেন, তাই ফলাফল পুনরুত্পাদন এবং নিজস্ব মডেলে যাচাই করা সম্ভব।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
নতুন ব্যক্তিত্ব প্রশ্নাবলী CSI BFI-এর বিকল্প হিসেবে মূল্যায়নকে আরও স্থিতিশীল ও ভবিষ্যদ্বাণীমূলক করে তোলে