GRPO-র একটি বিপরীতমুখী দৃষ্টিভঙ্গি: কেন বর্তমান RLVR লক্ষ্য আদর্শ নয় এবং ConSPO কীভাবে তা সমাধান করে

13 সেপ্টেম্বর 2026০ প্রদর্শন

নতুন গবেষণায় GRPO-কে একটি বিভাজক শ্রেণিবিন্যাসকারী হিসেবে ব্যাখ্যা করা হয়েছে: নীতি সফল ও ব্যর্থ নমুনার মধ্যে স্কোরের পার্থক্য বাড়াতে শেখে। এই দৃষ্টিভঙ্গি লক্ষ্য ফাংশনের দুটি ত্রুটি উন্মোচন করে, এবং লেখকদের প্রস্তাবিত ConSPO পদ্ধতি স্বাভাবিকীকৃত লগ-সম্ভাবনা এবং InfoNCE-সদৃশ কনট্রাস্টিভ লার্নিংয়ের মাধ্যমে সেগুলি দূর করে, যা জটিল যুক্তির কাজগুলিতে উন্নতি আনে।

GRPO-র একটি বিপরীতমুখী দৃষ্টিভঙ্গি: কেন বর্তমান RLVR লক্ষ্য আদর্শ নয় এবং ConSPO কীভাবে তা সমাধান করে

আধুনিক ভাষার মডেলগুলোকে ক্রমবর্ধমানভাবে এমন কাজে "অতিরিক্ত প্রশিক্ষণ" দেওয়া হচ্ছে যেখানে উত্তর স্বয়ংক্রিয়ভাবে যাচাই করা যায়: গণিত, প্রোগ্রামিং, যুক্তি। এই পদ্ধতিটিকে RLVR বলা হয় — যাচাইযোগ্য পুরস্কারের উপর ভিত্তি করে শক্তিবর্ধন শিক্ষণ। এই ধরনের টিউনিংয়ের জন্য অ্যালগরিদমগুলোর মধ্যে GRPO বিশেষভাবে আলাদা: এটি সহজ, কোনো আলাদা সমালোচক-মডেলের প্রয়োজন হয় না এবং ভালোভাবে স্কেল করা যায়। তবে, একটি সাম্প্রতিক প্রিপ্রিন্ট (arXiv:2605.12969) GRPO-কে একটি বৈপরীত্য দৃষ্টিকোণ থেকে দেখার প্রস্তাব দেয় এবং দেখায় যে এর লক্ষ্য ফাংশন আদর্শ থেকে অনেক দূরে। লেখক — ফেং ঝাং এবং সহ-লেখকরা — শুধু বিদ্যমান পদ্ধতির সমালোচনাই করেন না, বরং ConSPO নামে একটি বিকল্পও প্রস্তাব করেন।

কেন GRPO RLVR-এর ডি-ফ্যাক্টো স্ট্যান্ডার্ড হয়ে উঠেছে

PPO-এর মতো ক্লাসিক্যাল পদ্ধতিগুলো প্রথমে একটি সমালোচককে প্রশিক্ষণ দেয় প্রতিটি কাজের সুবিধা মূল্যায়ন করার জন্য। RLVR-তে এই ধরনের সমালোচনা প্রায়ই অপ্রয়োজনীয়: আমাদের কাছে ইতিমধ্যেই একটি যাচাইযোগ্য ফলাফল আছে যা উত্তরগুলোকে সঠিক এবং ভুলে ভাগ করে। GRPO এটি সরাসরি ব্যবহার করে। একটি প্রম্পটে, মডেলটি উত্তরের বেশ কয়েকটি ভিন্নতা তৈরি করে — রোলআউট, তারপর প্রতিটি রোলআউট ভেরিফায়ারের কাছ থেকে একটি স্কোর পায় এবং সুবিধাটি সেই গ্রুপের মধ্যে আপেক্ষিক অবস্থান হিসেবে গণনা করা হয়। এই স্কিমটি গণনামূলক খরচ কমায় এবং পোস্ট-ট্রেনিং সহজ করে, তাই এটি অনুশীলনে স্বাচ্ছন্দ্যে প্রয়োগ করা হয়।

কিন্তু, লেখকদের দেখানো হিসাবে, GRPO-এর একটি লুকানো দিকও আছে। যদি অ্যালগরিদমের গণিতের দিকে তাকানো হয়, তাহলে এটি আসলে মডেলটিকে "ভালো" এবং "খারাপ" উত্তর আলাদা করতে শেখায়: যাচাইকৃত ইতিবাচক এবং নেতিবাচক রোলআউটের স্কোরের মধ্যে প্রত্যাশিত ব্যবধান সর্বাধিক করা হয়। এটি একটি ক্লাসিক বৈষম্যমূলক কাজ। এই উচ্চতা থেকেই দেখা যায় কেন GRPO-এর বর্তমান লক্ষ্য আদর্শ নয়।

GRPO-এর দুটি সীমাবদ্ধতা যা শিক্ষণে বাধা দেয়

GRPO-এর বৈপরীত্য পুনর্নির্মাণে, গবেষকরা লক্ষ্য ফাংশনে সেলাই করা দুটি পদ্ধতিগত সীমাবদ্ধতা চিহ্নিত করেন।

সারোগেট স্কোরিং সম্ভাবনার সাথে অসামঞ্জস্যপূর্ণ

মডেলটি টোকেন সিকোয়েন্সের সম্ভাবনার উপর ভিত্তি করে উত্তর তৈরি করে। কিন্তু GRPO নীতি আপডেট করার সময় এই সম্ভাবনাগুলোকে সরাসরি অপ্টিমাইজ করে না, বরং ক্লিপড রেশিও — নতুন এবং পুরানো নীতির সীমাবদ্ধ অনুপাত — এর উপর ভিত্তি করে একটি সারোগেট ফাংশন অপ্টিমাইজ করে। কার্যকরভাবে, ইতিবাচক এবং নেতিবাচক উদাহরণের জন্য "স্কোর" হিসেবে সিকোয়েন্সের প্রকৃত লগ-সম্ভাবনা ব্যবহার করা হয় না, বরং অন্যান্য পরিমাণ ব্যবহার করা হয়। একটি অসামঞ্জস্য দেখা দেয়: অ্যালগরিদম যে লক্ষ্য অপ্টিমাইজ করে তা প্রকৃতপক্ষে যা জেনারেশন নির্ধারণ করে তার সাথে মেলে না। এটি অস্থিরতা বা ডেটার অ-সর্বোত্তম ব্যবহারের দিকে নিয়ে যেতে পারে।

ক্রেডিট বর্তমান বিভাজনের জটিলতার উপর নির্ভর করে না

দ্বিতীয় সীমাবদ্ধতাটি GRPO কীভাবে রোলআউটগুলোর মধ্যে আপডেট বিতরণ করে তা নিয়ে। অ্যালগরিদম এই দিকে মনোযোগ দেয় না যে এই মুহূর্তে ইতিবাচক এবং নেতিবাচক উদাহরণগুলো স্কোরের দিক থেকে কতটা আলাদা। যদি একটি "নেতিবাচক" ইতিবাচক উদাহরণের খুব কাছাকাছি থাকে এবং অন্যটি দূরে থাকে, GRPO তাদের প্রায় একই রকম দেখে। স্কোরের প্রতি এই সংবেদনশীল ক্রেডিট বরাদ্দের অর্থ হল মডেলটি সবচেয়ে বিভ্রান্তিকর, এখনও খারাপভাবে আলাদা করা জোড়াগুলোর উপর জোর দেয় না। ফলস্বরূপ, শিক্ষণ আক্ষরিক অর্থেই সহজ উদাহরণে "স্থির" থাকতে পারে, প্রকৃত জটিলতাগুলোকে উপেক্ষা করে।

ConSPO: নীতির জন্য একটি বৈপরীত্য লক্ষ্য ফাংশন

উভয় সীমাবদ্ধতা দূর করতে, লেখকরা ConSPO পদ্ধতির প্রস্তাব করেন — সিকোয়েন্স-স্তরে বৈপরীত্য নীতি অপ্টিমাইজেশন। নামটি নিজেই বলছে: GRPO-কে বৈপরীত্য শিক্ষণ হিসেবে পুনর্বিবেচনা করা হয়, তবে বেশ কয়েকটি গুরুত্বপূর্ণ সংশোধন সহ।

প্রথমত, ConSPO স্বাভাবিক স্কোরিংয়ে ফিরে আসে: সারোগেট পরিমাণের পরিবর্তে, দৈর্ঘ্য দ্বারা স্বাভাবিক করা সিকোয়েন্সের লগ-সম্ভাবনা ব্যবহার করা হয়। এটি জেনারেশন প্রক্রিয়ার সাথে আরও ভালোভাবে সামঞ্জস্যপূর্ণ এবং likelihood-misaligned মূল্যায়নের সমস্যা দূর করে।

দ্বিতীয়ত, অ্যালগরিদম একই গ্রুপের মধ্যে যাচাইকৃত ইতিবাচক রোলআউটগুলোকে নেতিবাচক "বিভ্রান্তিকর" এর সাথে স্পষ্টভাবে বৈপরীত্য করে। নীতি আপডেট তখন InfoNCE-এর মতো একটি গ্রুপ ফাংশন দ্বারা পরিচালিত হয় — বৈপরীত্য শিক্ষণের একটি আদর্শ কৌশল। এই ধরনের ফাংশন স্বয়ংক্রিয়ভাবে সেই জোড়াগুলোর জন্য গ্রেডিয়েন্ট বাড়ায় যেখানে ইতিবাচক উত্তর এখনও নেতিবাচক থেকে যথেষ্ট আলাদা নয় এবং উচ্চ-স্কোরিং নেতিবাচকগুলো বেশি মনোযোগ পায়। এর মাধ্যমে সংবেদনশীল ক্রেডিট বিতরণের সমস্যা সমাধান হয়।

তৃতীয়ত, ConSPO-তে একটি curriculum-scheduled margin প্রয়োগ করা হয়। ইতিবাচক এবং নেতিবাচক উদাহরণকে আলাদা করার যে ব্যবধান থাকা উচিত তা প্রশিক্ষণের সাথে সাথে ধীরে ধীরে কঠোর হয়। এটি মডেলটিকে অর্জিত অবস্থানে থেমে যেতে দেয় না: প্রথমে এটি সহজ পার্থক্যগুলো মোকাবেলা করে এবং তারপর ক্রমবর্ধমান সূক্ষ্ম সীমানা পর্যন্ত বিভাজনকে পরিমার্জিত করতে বাধ্য হয়।

ফলাফল এবং সম্ভাবনা

লেখকরা বিভিন্ন পরিস্থিতিতে এবং জটিল যুক্তির বেঞ্চমার্কে ConSPO পরীক্ষা করেছেন। ফলাফল দেখায় যে নতুন পদ্ধতিটি শক্তিশালী বেসলাইন পদ্ধতির চেয়ে ধারাবাহিকভাবে উন্নত। এটি সম্প্রদায়ের জন্য একটি গুরুত্বপূর্ণ সংকেত: GRPO-এর পরিচিত লক্ষ্য উন্নত করা যেতে পারে যদি RLVR-কে বৈপরীত্য শিক্ষণের একটি কাজ হিসেবে দেখা হয়, শুধুমাত্র আপেক্ষিক সুবিধার অপ্টিমাইজেশন হিসেবে নয়।

অবশ্যই, একটি প্রিপ্রিন্ট বিষয়টি বন্ধ করে না। তবে প্রস্তাবিত দৃষ্টিভঙ্গি বিশ্লেষণের জন্য একটি নতুন হাতিয়ার দেয়: GRPO-কে একটি প্রদত্ত জিনিস হিসেবে দেখার পরিবর্তে, গবেষকরা এখন এটিকে বোধগম্য বৈপরীত্য উপাদানে বিভক্ত করতে পারেন এবং প্রতিটি আলাদাভাবে উন্নত করতে পারেন। অনুশীলনকারীদের জন্য, এর অর্থ হল পোস্ট-ট্রেনিং অস্ত্রাগারে আরেকটি শক্তিশালী পদ্ধতি যুক্ত হয়েছে, বিশেষ করে এমন কাজে মূল্যবান যেখানে ভেরিফায়ার একটি স্পষ্ট বাইনারি সংকেত দেয়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
GRPO-র একটি বিপরীতমুখী দৃষ্টিভঙ্গি: কেন বর্তমান RLVR লক্ষ্য আদর্শ নয় এবং ConSPO কীভাবে তা সমাধান করে