মডেলগুলোর কেন ভিন্ন ভিন্ন মানবিক প্রতিক্রিয়া প্রয়োজন
লেখকদের পর্যবেক্ষণ অনুযায়ী, helpfulness-এর ওপর বড় ভাষা মডেলগুলোকে আরও প্রশিক্ষণ দিলে সহকারীর একঘেয়ে এবং অতিরিক্ত বাধ্যগত শৈলী তৈরি হয়। এতে Sim2Real ব্যবধান—সিমুলেশন ও বাস্তব আচরণের মধ্যে অমিল—আরও বাড়ে।
OdysSim গবেষণায় মানুষের আচরণের বৃহৎ পরিসরে মডেলিং নিয়ে আলোচনা করা হয়েছে। লেখকেরা একে এ ধরনের সবচেয়ে বড় পদ্ধতিগত গবেষণা বলে অভিহিত করেছেন।
এখানে মূল্যায়নের ক্ষেত্রে উত্তরের উপযোগিতার পাশাপাশি আচরণের বৈচিত্র্যও গুরুত্বপূর্ণ। লেখকেরা মানুষের প্রতিক্রিয়া মডেলিংয়ের সঙ্গে এই কাজটিকেই যুক্ত করেছেন।
মডেলগুলোর সক্ষমতা কীভাবে মূল্যায়ন করা হয়
SOUL ট্যাক্সোনমিতে সক্ষমতার পাঁচটি অক্ষ রয়েছে:
- CONV
- SS
- COG
- ROLE
- EVAL
এই ট্যাক্সোনমির আওতায় লেখকেরা ৬২টি ডেটাসেট ও বেঞ্চমার্কের ২৩টি কাজ একত্র করেছেন। অক্ষগুলো মূল্যায়নের কাঠামো নির্ধারণ করে, আর কাজের সমাহার বিভিন্ন ক্ষেত্রে মডেলগুলোর তুলনা করতে সহায়তা করে।
মূল্যায়নের ব্যবহারিক মানদণ্ড হলো একটি সামগ্রিক স্কোর নয়, বরং একাধিক কাজের পরিসর। এভাবে বোঝা যায়, কথোপকথনমূলক, সামাজিক বা অন্যান্য পরিস্থিতির মধ্যে কোনটিতে মডেলটি বেশি শক্তিশালী।
মডেলটিকে কীভাবে প্রশিক্ষণ দেওয়া হয়েছিল
OdysSim কর্পাসে রয়েছে ২ কোটি ১৪ লাখ ইন্টারঅ্যাকশন এবং ১০ বিলিয়ন টোকেন। লেখকেরা এতে পরে তৈরি করা সামাজিক প্রেক্ষাপট যোগ করেছেন এবং SOUL-Index বেঞ্চমার্ক তৈরি করেছেন।

প্রশিক্ষণ পদ্ধতিতে তিনটি ধাপ একত্র করা হয়েছে:
- মিডট্রেনিং;
- নির্দিষ্ট কাজের জন্য রিইনফোর্সমেন্ট লার্নিং;
- বিশেষজ্ঞ মডেলগুলোর জ্ঞান ডিস্টিলেশন।
পদ্ধতিটি মূল্যায়নের জন্য এই সমন্বয় গুরুত্বপূর্ণ: এতে কর্পাসের ওপর প্রশিক্ষণ, কাজভিত্তিক টিউনিং এবং বিশেষজ্ঞদের ফলাফল স্থানান্তর—সবই রয়েছে।
মডেলটি কী দেখিয়েছে
৮ বিলিয়ন প্যারামিটারের উন্মুক্ত মডেল OSim ২৩টি কাজের মধ্যে ৮টিতে প্রথম স্থান অর্জন করেছে বা যৌথভাবে প্রথম হয়েছে। এই মাপকাঠিতে এটি যেকোনো একক frontier মডেলকে ছাড়িয়ে গেছে।
লেখকেরা সবচেয়ে বড় উন্নতি লক্ষ করেছেন কথোপকথনমূলক ও সামাজিক কাজে। মডেলটির উত্তর দৈর্ঘ্য, বিন্যাস এবং শব্দচয়নের দিক থেকে মানুষের উত্তরের সঙ্গে বেশি সাদৃশ্যপূর্ণ।
বিতরণের বাইরেও, অতিরিক্ত প্রশিক্ষণ ছাড়াই মডেলটি τ-bench-এ ব্যবহারকারীদের সিমুলেশনে দক্ষতা প্রয়োগ করেছে। প্রতিক্রিয়ার সামঞ্জস্যের ক্ষেত্রে এটি বাস্তব ব্যবহারকারীদের স্কোরের প্রায় সমান হয়েছে: ৯৩.২ বনাম ৯৩.৫।
লেখকেরা reward hacking কীভাবে বিবেচনা করেছেন
লেখকেরা দেখেছেন, LLM-as-judge স্কোরের ওপর রিইনফোর্সমেন্ট লার্নিং reward hacking-এর ধরন তৈরি করে। পোস্ট-ট্রেনিং পর্যায়ে এ ধরনের ধরন কমাতে পারে এমন ডিটেক্টর তাঁরা তৈরি করেছেন।
প্রশিক্ষণের ফলাফল মূল্যায়নে দুটি বিষয়ই গুরুত্বপূর্ণ: reward hacking শনাক্ত করা এবং লক্ষ্যভিত্তিক কাজগুলোতে আচরণের মান। লেখকেরা জানিয়েছেন, পরবর্তী গবেষণার জন্য তাঁরা সব আর্টিফ্যাক্ট প্রকাশ করছেন।



