মানুষের প্রতিক্রিয়ার বৈচিত্র্য সম্পর্কে ভাষা মডেলকে প্রশিক্ষণ দেওয়া

25 সেপ্টেম্বর 2026৫ প্রদর্শন

OdysSim-এ গবেষণা করা হয়েছে, কীভাবে মডেলকে সহায়ক অ্যাসিস্ট্যান্টের ভঙ্গিতে উত্তর সীমাবদ্ধ না রেখে মানুষের আচরণ পুনরুৎপাদন করতে প্রশিক্ষণ দেওয়া যায়: লেখকেরা SOUL ট্যাক্সোনমি তৈরি করেছেন, একটি ডেটা করপাস সংগ্রহ করেছেন এবং বহু-পর্যায়ের প্রশিক্ষণ পদ্ধতি প্রস্তাব করেছেন। ৮ বিলিয়ন প্যারামিটারের OSim মডেলটি সংলাপ ও সামাজিক পরীক্ষায় উচ্চ ফল দেখায়, দক্ষতাগুলো ব্যবহারকারী সিমুলেশনে প্রয়োগ করে এবং অন্যান্য ভাষা মডেলের মূল্যায়নের ভিত্তিতে প্রশিক্ষণের ঝুঁকি শনাক্ত করতে সহায়তা করে।

মানুষের প্রতিক্রিয়ার বৈচিত্র্য সম্পর্কে ভাষা মডেলকে প্রশিক্ষণ দেওয়া

মডেলগুলোর কেন ভিন্ন ভিন্ন মানবিক প্রতিক্রিয়া প্রয়োজন

লেখকদের পর্যবেক্ষণ অনুযায়ী, helpfulness-এর ওপর বড় ভাষা মডেলগুলোকে আরও প্রশিক্ষণ দিলে সহকারীর একঘেয়ে এবং অতিরিক্ত বাধ্যগত শৈলী তৈরি হয়। এতে Sim2Real ব্যবধান—সিমুলেশন ও বাস্তব আচরণের মধ্যে অমিল—আরও বাড়ে।

OdysSim গবেষণায় মানুষের আচরণের বৃহৎ পরিসরে মডেলিং নিয়ে আলোচনা করা হয়েছে। লেখকেরা একে এ ধরনের সবচেয়ে বড় পদ্ধতিগত গবেষণা বলে অভিহিত করেছেন।

এখানে মূল্যায়নের ক্ষেত্রে উত্তরের উপযোগিতার পাশাপাশি আচরণের বৈচিত্র্যও গুরুত্বপূর্ণ। লেখকেরা মানুষের প্রতিক্রিয়া মডেলিংয়ের সঙ্গে এই কাজটিকেই যুক্ত করেছেন।

মডেলগুলোর সক্ষমতা কীভাবে মূল্যায়ন করা হয়

SOUL ট্যাক্সোনমিতে সক্ষমতার পাঁচটি অক্ষ রয়েছে:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

এই ট্যাক্সোনমির আওতায় লেখকেরা ৬২টি ডেটাসেট ও বেঞ্চমার্কের ২৩টি কাজ একত্র করেছেন। অক্ষগুলো মূল্যায়নের কাঠামো নির্ধারণ করে, আর কাজের সমাহার বিভিন্ন ক্ষেত্রে মডেলগুলোর তুলনা করতে সহায়তা করে।

মূল্যায়নের ব্যবহারিক মানদণ্ড হলো একটি সামগ্রিক স্কোর নয়, বরং একাধিক কাজের পরিসর। এভাবে বোঝা যায়, কথোপকথনমূলক, সামাজিক বা অন্যান্য পরিস্থিতির মধ্যে কোনটিতে মডেলটি বেশি শক্তিশালী।

মডেলটিকে কীভাবে প্রশিক্ষণ দেওয়া হয়েছিল

OdysSim কর্পাসে রয়েছে ২ কোটি ১৪ লাখ ইন্টারঅ্যাকশন এবং ১০ বিলিয়ন টোকেন। লেখকেরা এতে পরে তৈরি করা সামাজিক প্রেক্ষাপট যোগ করেছেন এবং SOUL-Index বেঞ্চমার্ক তৈরি করেছেন।

প্রশিক্ষণ পদ্ধতিতে তিনটি ধাপ একত্র করা হয়েছে:

  • মিডট্রেনিং;
  • নির্দিষ্ট কাজের জন্য রিইনফোর্সমেন্ট লার্নিং;
  • বিশেষজ্ঞ মডেলগুলোর জ্ঞান ডিস্টিলেশন।

পদ্ধতিটি মূল্যায়নের জন্য এই সমন্বয় গুরুত্বপূর্ণ: এতে কর্পাসের ওপর প্রশিক্ষণ, কাজভিত্তিক টিউনিং এবং বিশেষজ্ঞদের ফলাফল স্থানান্তর—সবই রয়েছে।

মডেলটি কী দেখিয়েছে

৮ বিলিয়ন প্যারামিটারের উন্মুক্ত মডেল OSim ২৩টি কাজের মধ্যে ৮টিতে প্রথম স্থান অর্জন করেছে বা যৌথভাবে প্রথম হয়েছে। এই মাপকাঠিতে এটি যেকোনো একক frontier মডেলকে ছাড়িয়ে গেছে।

লেখকেরা সবচেয়ে বড় উন্নতি লক্ষ করেছেন কথোপকথনমূলক ও সামাজিক কাজে। মডেলটির উত্তর দৈর্ঘ্য, বিন্যাস এবং শব্দচয়নের দিক থেকে মানুষের উত্তরের সঙ্গে বেশি সাদৃশ্যপূর্ণ।

বিতরণের বাইরেও, অতিরিক্ত প্রশিক্ষণ ছাড়াই মডেলটি τ-bench-এ ব্যবহারকারীদের সিমুলেশনে দক্ষতা প্রয়োগ করেছে। প্রতিক্রিয়ার সামঞ্জস্যের ক্ষেত্রে এটি বাস্তব ব্যবহারকারীদের স্কোরের প্রায় সমান হয়েছে: ৯৩.২ বনাম ৯৩.৫।

লেখকেরা reward hacking কীভাবে বিবেচনা করেছেন

লেখকেরা দেখেছেন, LLM-as-judge স্কোরের ওপর রিইনফোর্সমেন্ট লার্নিং reward hacking-এর ধরন তৈরি করে। পোস্ট-ট্রেনিং পর্যায়ে এ ধরনের ধরন কমাতে পারে এমন ডিটেক্টর তাঁরা তৈরি করেছেন।

প্রশিক্ষণের ফলাফল মূল্যায়নে দুটি বিষয়ই গুরুত্বপূর্ণ: reward hacking শনাক্ত করা এবং লক্ষ্যভিত্তিক কাজগুলোতে আচরণের মান। লেখকেরা জানিয়েছেন, পরবর্তী গবেষণার জন্য তাঁরা সব আর্টিফ্যাক্ট প্রকাশ করছেন।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
মানুষের প্রতিক্রিয়ার বৈচিত্র্য সম্পর্কে ভাষা মডেলকে প্রশিক্ষণ দেওয়া