ঠিক কী পুনর্ব্যবহার করা হয়
সাধারণ GRPO-তে প্রতিটি rollout একটি gradient update-এ অংশ নেয়, তারপর সেটি বাদ দেওয়া হয়। নিবন্ধে বর্ণিত পদ্ধতিটি এই চক্র বদলে দেয়: এটি আলাদা rollout সংরক্ষণ করে এবং বাছাই করা rollout-গুলোকে আবার প্রশিক্ষণে ফিরিয়ে আনে।
বাফারে পুরো গ্রুপ নয়, আলাদা জেনারেশন সংরক্ষণ করা হয়। Replay advantage-এর মান অনুযায়ী সেগুলোকে অগ্রাধিকার দেয়: যেসব rollout-এর মান বেশি, সেগুলো পুনর্ব্যবহার করা হয়।

ব্যবহারিক মানদণ্ড: এখানে আলাদা rollout পুনর্ব্যবহারের কথা বলা হচ্ছে, গ্রুপের নয়।
Replay কীভাবে কাজ করে
প্রতিটি batch দুই ধাপে তৈরি হয়:
- এতে নতুন on-policy rollout অন্তর্ভুক্ত করা হয়।
- এর সঙ্গে বাফার থেকে আলাদাভাবে বাছাই করা rollout যোগ করা হয়।
Replay উপাদান বাছাইয়ের সময় প্রতিটি rollout-এর advantage-এর মান বিবেচনা করা হয়। বর্ণিত তথ্য অনুযায়ী, batch-এ replay-এর অংশের আকার উল্লেখ করা হয়নি।
পদ্ধতিটির মূল পার্থক্য হলো—নতুন rollout-গুলো batch-এ থাকে, আর বাফার সেগুলোর সঙ্গে বাছাই করা জেনারেশন যোগ করে।
পুরোনো হয়ে যাওয়া কীভাবে সীমিত করা হয়
লেখকেরা naive replay-এর সমস্যা তুলে ধরেছেন: প্রতিটি gradient step-এর সঙ্গে LLM policy দ্রুত বদলে যায়। সংরক্ষিত rollout-গুলো পুরোনো হয়ে যেতে পারে এবং প্রশিক্ষণকে অস্থিতিশীল করে তুলতে পারে।
পদ্ধতিটি বাফার থেকে tau_max training steps-এর চেয়ে পুরোনো যেকোনো rollout মুছে দেয়। এতে সংরক্ষণের একটি সীমা নির্ধারিত হয়, তবে পুনর্ব্যবহারের বিষয়টি বাতিল হয় না।
এখানে নিয়ন্ত্রণের মানদণ্ড হলো training steps-এ একটি আলাদা rollout-এর বয়স, কোনো গ্রুপের অন্তর্ভুক্তি নয়।
মূল্যায়নে কী দেখা গেছে
পদ্ধতিটি Qwen3-Base-এর তিনটি আকারে এবং পাঁচটি গাণিতিক benchmark-এ পরীক্ষা করা হয়েছে। এটি GRPO এবং naive replay baseline-কে ছাড়িয়ে গেছে।
- প্রতিটি আকারে পাঁচটি benchmark-এর গড়ে উন্নতি ইতিবাচক ছিল।
- 4B আকারে উন্নতি +1.66 pp-তে পৌঁছেছিল।
- accuracy এবং token efficiency-এর যৌথ মূল্যায়নকারী মেট্রিক AES-এ, প্রতিটি আকারে GRPO-এর তুলনায় ইতিবাচক ব্যবধান দেখানো একমাত্র পদ্ধতি ছিল এটি।
পদ্ধতি বাছাইয়ের ব্যবহারিক মানদণ্ড লক্ষ্য মূল্যায়নের ওপর নির্ভর করে: ফলাফলগুলোতে accuracy, token efficiency এবং দুটি baseline-এর সঙ্গে তুলনা অন্তর্ভুক্ত রয়েছে।



