GRPO প্রশিক্ষণে মূল্যবান জেনারেশনগুলো কীভাবে পুনরায় ব্যবহার করবেন

25 সেপ্টেম্বর 2026১৫ প্রদর্শন

প্রবন্ধটিতে এমন একটি প্রক্রিয়া উপস্থাপন করা হয়েছে, যা সুবিধার মাত্রার ভিত্তিতে পুনঃপ্রশিক্ষণের জন্য নির্দিষ্ট জেনারেশন বেছে নেয় এবং অতিরিক্ত পুরোনো ডেটা বাদ দিয়ে তার সঙ্গে নতুন উদাহরণ যোগ করে। Qwen3-Base-এর তিনটি আকারে, গণিতের বেঞ্চমার্কে এই পদ্ধতি GRPO এবং সাধারণ রিপ্লের চেয়ে ভালো ফল করেছে; পাশাপাশি নির্ভুলতা ও টোকেন ব্যবহারের ভারসাম্যও উন্নত করেছে।

GRPO প্রশিক্ষণে মূল্যবান জেনারেশনগুলো কীভাবে পুনরায় ব্যবহার করবেন

ঠিক কী পুনর্ব্যবহার করা হয়

সাধারণ GRPO-তে প্রতিটি rollout একটি gradient update-এ অংশ নেয়, তারপর সেটি বাদ দেওয়া হয়। নিবন্ধে বর্ণিত পদ্ধতিটি এই চক্র বদলে দেয়: এটি আলাদা rollout সংরক্ষণ করে এবং বাছাই করা rollout-গুলোকে আবার প্রশিক্ষণে ফিরিয়ে আনে।

বাফারে পুরো গ্রুপ নয়, আলাদা জেনারেশন সংরক্ষণ করা হয়। Replay advantage-এর মান অনুযায়ী সেগুলোকে অগ্রাধিকার দেয়: যেসব rollout-এর মান বেশি, সেগুলো পুনর্ব্যবহার করা হয়।

ব্যবহারিক মানদণ্ড: এখানে আলাদা rollout পুনর্ব্যবহারের কথা বলা হচ্ছে, গ্রুপের নয়।

Replay কীভাবে কাজ করে

প্রতিটি batch দুই ধাপে তৈরি হয়:

  1. এতে নতুন on-policy rollout অন্তর্ভুক্ত করা হয়।
  2. এর সঙ্গে বাফার থেকে আলাদাভাবে বাছাই করা rollout যোগ করা হয়।

Replay উপাদান বাছাইয়ের সময় প্রতিটি rollout-এর advantage-এর মান বিবেচনা করা হয়। বর্ণিত তথ্য অনুযায়ী, batch-এ replay-এর অংশের আকার উল্লেখ করা হয়নি।

পদ্ধতিটির মূল পার্থক্য হলো—নতুন rollout-গুলো batch-এ থাকে, আর বাফার সেগুলোর সঙ্গে বাছাই করা জেনারেশন যোগ করে।

পুরোনো হয়ে যাওয়া কীভাবে সীমিত করা হয়

লেখকেরা naive replay-এর সমস্যা তুলে ধরেছেন: প্রতিটি gradient step-এর সঙ্গে LLM policy দ্রুত বদলে যায়। সংরক্ষিত rollout-গুলো পুরোনো হয়ে যেতে পারে এবং প্রশিক্ষণকে অস্থিতিশীল করে তুলতে পারে।

পদ্ধতিটি বাফার থেকে tau_max training steps-এর চেয়ে পুরোনো যেকোনো rollout মুছে দেয়। এতে সংরক্ষণের একটি সীমা নির্ধারিত হয়, তবে পুনর্ব্যবহারের বিষয়টি বাতিল হয় না।

এখানে নিয়ন্ত্রণের মানদণ্ড হলো training steps-এ একটি আলাদা rollout-এর বয়স, কোনো গ্রুপের অন্তর্ভুক্তি নয়।

মূল্যায়নে কী দেখা গেছে

পদ্ধতিটি Qwen3-Base-এর তিনটি আকারে এবং পাঁচটি গাণিতিক benchmark-এ পরীক্ষা করা হয়েছে। এটি GRPO এবং naive replay baseline-কে ছাড়িয়ে গেছে।

  • প্রতিটি আকারে পাঁচটি benchmark-এর গড়ে উন্নতি ইতিবাচক ছিল।
  • 4B আকারে উন্নতি +1.66 pp-তে পৌঁছেছিল।
  • accuracy এবং token efficiency-এর যৌথ মূল্যায়নকারী মেট্রিক AES-এ, প্রতিটি আকারে GRPO-এর তুলনায় ইতিবাচক ব্যবধান দেখানো একমাত্র পদ্ধতি ছিল এটি।

পদ্ধতি বাছাইয়ের ব্যবহারিক মানদণ্ড লক্ষ্য মূল্যায়নের ওপর নির্ভর করে: ফলাফলগুলোতে accuracy, token efficiency এবং দুটি baseline-এর সঙ্গে তুলনা অন্তর্ভুক্ত রয়েছে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
GRPO প্রশিক্ষণে মূল্যবান জেনারেশনগুলো কীভাবে পুনরায় ব্যবহার করবেন