Co-RL: মাল্টি-এজেন্ট লেবেল-মুক্ত শিক্ষা, যেখানে মডেল একে অপরকে মূল্যায়ন করে যুক্তি প্রদর্শন করে

1 সেপ্টেম্বর 2026৯ প্রদর্শন

গবেষকরা Co-RL পদ্ধতির প্রস্তাব করেছেন, যেখানে একাধিক স্বাধীন মডেলের একটি দল একে অপরের মূল্যায়নের ভিত্তিতে প্রশিক্ষিত হয়, ব্যয়বহুল লেবেলিংয়ের প্রয়োজন ছাড়াই। এই পদ্ধতি টেক্সট এবং মাল্টিমোডাল কাজগুলিতে যুক্তির গুণমান এবং প্রশিক্ষণের স্থিতিশীলতা উন্নত করে এবং কিছু ক্ষেত্রে supervised-পদ্ধতির স্তরে পৌঁছায়।

Co-RL: মাল্টি-এজেন্ট লেবেল-মুক্ত শিক্ষা, যেখানে মডেল একে অপরকে মূল্যায়ন করে যুক্তি প্রদর্শন করে

সমস্যা: কেন RL মেটা-লেবেলের উপর নির্ভর করে

রিইনফোর্সমেন্ট লার্নিং (RL) আজ ভাষা ও ভিজ্যুয়াল-ভাষা মডেলগুলির যুক্তি দক্ষতা উন্নত করার সবচেয়ে প্রতিশ্রুতিশীল পদ্ধতিগুলির মধ্যে একটি হিসেবে বিবেচিত হয়। যুক্তিটি সহজ: মডেলটি বিভিন্ন কৌশল চেষ্টা করে, সঠিক কাজের জন্য পুরস্কার পায় এবং ধীরে ধীরে আরও ভালো যুক্তি দিতে শেখে। কিন্তু একটি সমস্যা আছে — পুরস্কারটি অর্থবহ হওয়ার জন্য সাধারণত বাইরের সঠিক সংকেত প্রয়োজন: যাচাইযোগ্য উত্তর, রেফারেন্স সমাধান, চিহ্নিত যুক্তির ধারা। এগুলো প্রস্তুত করা ব্যয়বহুল, এবং অনেক কাজের জন্য এমন ডেটা ক্রমশ কম হয়ে যাচ্ছে।

আংশিকভাবে এই সমস্যার সমাধান করে self-rewarding পদ্ধতি, যেখানে মডেল নিজেই নিজের উত্তর মূল্যায়ন করে এবং সেই ভিত্তিতে আচরণ সংশোধন করে। তবে এখানে একটি দুষ্টচক্র তৈরি হয়: যদি মডেলটির ইতিমধ্যেই পক্ষপাত থাকে বা সাবঅপ্টিমাল উত্তর দিতে অভ্যস্ত হয়, তবে এটি সেই একই ভুলগুলিকে শক্তিশালী করবে। নিজের প্রতিক্রিয়ার উপর প্রশিক্ষণ দ্রুত একঘেয়েমির দিকে নিয়ে যায়: উত্তরগুলি একে অপরের সাথে মিলে যায়, বৈচিত্র্য কমে যায়, এবং সবচেয়ে খারাপ ক্ষেত্রে কলাপ্স ঘটে — মডেলটি একটি সংকীর্ণ টেমপ্লেটের সেটে আটকে যায় এবং বিকশিত হওয়া বন্ধ করে দেয়।

Co-RL কীভাবে কাজ করে

arXiv:2608.17253 প্রিপ্রিন্টের লেখকরা Co-RL ফ্রেমওয়ার্ক প্রস্তাব করেছেন, যা এই দুষ্টচক্র ভেঙে দেয়। একটি মডেলের পরিবর্তে যা নিজের মূল্যায়নে শেখে, Co-RL একই সাথে বেশ কয়েকটি সম্পূর্ণ স্বাধীন মডেল প্রশিক্ষণ দেয় — তারা সাধারণ প্যারামিটার ভাগ করে না এবং একে অপরের ওজন দেখে না। প্রতিটি মডেল নিজের কাছ থেকে নয়, বরং কোহর্টের অন্যান্য সদস্যদের (peers) কাছ থেকে পুরস্কার পায়। মূলত, মডেলগুলি একে অপরের যুক্তি, সমালোচনা এবং মূল্যায়ন করে এবং এই "বাহ্যিক" মূল্যায়নের ভিত্তিতেই প্রশিক্ষণ নির্মিত হয়।

এই ধরনের প্রতিক্রিয়া বিনিময় গতিশীলতাকে মৌলিকভাবে পরিবর্তন করে। বিভিন্ন মডেলের ভুল খুব কমই সম্পূর্ণভাবে মিলে যায় — প্রতিটির নিজস্ব দুর্বলতা, নিজস্ব চিন্তার ধরণ এবং নিজস্ব পক্ষপাত থাকে। তাই যখন একটি মডেল অন্য মডেলের উত্তর মূল্যায়ন করে, তখন এটি অন্যের পদ্ধতিগত ভুল "নিশ্চিত" করার সম্ভাবনা উল্লেখযোগ্যভাবে কম। এটি স্ব-শক্তিশালী প্রতিক্রিয়া লুপ এড়াতে সাহায্য করে, যার কারণে self-rewarding পদ্ধতি ভেঙে পড়ে।

বৈচিত্র্যই প্রধান উপাদান

Co-RL-এর মূল ধারণা হল সাফল্য সরাসরি কোহর্টের বৈচিত্র্যের উপর নির্ভর করে। যদি সব মডেল একই রকম হয়, তারা কেবল একে অপরের সাথে একমত হবে এবং কোনো সুবিধা পাওয়া যাবে না। তাই লেখকরা তিনটি স্তরের হেটারোজিনিটি প্রস্তাব করেন:

  • বিভিন্ন মডেল পরিবার — উদাহরণস্বরূপ, বিভিন্ন নির্মাতার আর্কিটেকচার একত্রিত করা, যাতে তারা সাধারণ ভুল উত্তরাধিকার সূত্রে না পায়।
  • বিভিন্ন আকার — বড় এবং কমপ্যাক্ট মডেল কাজটি ভিন্নভাবে দেখে এবং তাদের মূল্যায়ন একে অপরের পরিপূরক।
  • প্যারাফ্রেজ করা প্রশিক্ষণ নমুনা — একই উদাহরণ ভিন্ন ভিন্ন শব্দে উপস্থাপন করা হয়, যা একই সমস্যা গঠনের কারণে সৃষ্ট ভুলের সম্পর্ক কমায়।

কোহর্টের এই বৈচিত্র্য সম্পর্কযুক্ত ভুল কমায়, যা বিপজ্জনক কারণ তারা পুনরাবৃত্তি থেকে পুনরাবৃত্তিতে জমা হয়। একই সাথে আচরণগত বৈচিত্র্য বজায় থাকে — মডেলগুলি একক যুক্তির শৈলীতে সঙ্কুচিত হয় না, বরং বিভিন্ন পদ্ধতি অন্বেষণ করতে থাকে।

পরীক্ষাগুলি কী দেখিয়েছে

লেখকরা Co-RL টেক্সট এবং মাল্টিমোডাল কাজে পরীক্ষা করেছেন, এটিকে বেস মডেল এবং ground-truth লেবেল ছাড়া label-free পদ্ধতির সাথে তুলনা করেছেন। LLM-এর জন্য সাতটি টেক্সট বেঞ্চমার্কে গড় বৃদ্ধি ছিল ৩.০–৮.৬%, এবং VLM-এর জন্য চারটি মাল্টিমোডাল বেঞ্চমার্কে২.৩–৭.২%। একই সাথে Co-RL কেবল লেবেল ছাড়া অনুরূপ পদ্ধতিগুলিকে ছাড়িয়ে যায় না, বরং কিছু ক্ষেত্রে সুপারভাইজড লার্নিংয়ের সাথে তুলনীয় বা এমনকি এটিকে ছাড়িয়ে যায় — যদিও এর জন্য চিহ্নিত ডেটার প্রয়োজনই হয় না।

এটি শিল্পের জন্য একটি গুরুত্বপূর্ণ সংকেত: সম্ভবত ভবিষ্যৎ ব্যয়বহুল অ্যানোটেশন সংগ্রহে নয়, বরং মডেলগুলির সঠিকভাবে সংগঠিত মিথস্ক্রিয়ায়। একে অপরের মূল্যায়নে যত বেশি এজেন্ট অংশ নেয় এবং তারা যত বেশি আলাদা হয়, প্রশিক্ষণ তত বেশি স্থিতিশীল এবং মানসম্পন্ন হয়।

ব্যবহারিক সিদ্ধান্ত

Co-RL সত্যিকারের স্ব-শিক্ষণ ব্যবস্থার দিকে একটি বিশ্বাসযোগ্য পদক্ষেপ বলে মনে হয়। এটির জন্য লেবেলিংয়ের প্রয়োজন নেই, নিজের প্রতিক্রিয়ায় পুড়ে যায় না এবং একই সাথে যুক্তির উচ্চ মান বজায় রাখে। ডেভেলপাররা উল্লেখ করেছেন যে ফ্রেমওয়ার্কের কোড সম্প্রদায়ের জন্য উপলব্ধ — অর্থাৎ পদ্ধতিটি পুনরুত্পাদন করা যায় এবং আজই নিজের কাজের সাথে খাপ খাওয়ানো যায়।

অবশ্যই, প্রশ্ন থেকে যায়: উদাহরণস্বরূপ, একটি নির্দিষ্ট কাজের জন্য কোহর্টের গঠন কীভাবে সর্বোত্তমভাবে নির্বাচন করা যায় এবং একসাথে একাধিক মডেল প্রশিক্ষণ দেওয়া কি খুব ব্যয়বহুল নয়। কিন্তু ধারণাটি নিজেই — মডেলগুলিকে একা নয়, বরং একটি সমষ্টিতে প্রশিক্ষণ দেওয়া যেখানে প্রত্যেকে অন্যদের মূল্যায়ন করে — গবেষণার জন্য একটি আকর্ষণীয় দিক খুলে দেয়। সম্ভবত এই ধরনের প্রক্রিয়াই আমাদের এমন সিস্টেমের কাছাকাছি নিয়ে যায় যা মানুষের মতো একে অপরের কাছ থেকে অভিজ্ঞতা গ্রহণের মতো স্বাভাবিকভাবে যুক্তি শেখে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
Co-RL: মাল্টি-এজেন্ট লেবেল-মুক্ত শিক্ষা, যেখানে মডেল একে অপরকে মূল্যায়ন করে যুক্তি প্রদর্শন করে