ما الذي يُعاد استخدامه تحديدًا
في GRPO العادي، تشارك كل عملية rollout في تحديث gradient واحد، ثم تُستبعد. يغيّر الأسلوب الوارد في المقالة هذه الدورة: إذ يحتفظ بعمليات rollout منفردة ويعيد المختارة منها إلى التدريب.
يخزّن المخزن المؤقت عمليات التوليد الفردية، لا مجموعات كاملة. وتمنح آلية replay الأولوية لها بحسب قيمة advantage: إذ يُعاد استخدام عمليات rollout ذات القيم الأكبر.

المعيار العملي: المقصود هو إعادة استخدام عمليات rollout منفردة، لا مجموعات.
كيف تعمل آلية replay
تُشكَّل كل batch على مرحلتين:
- تُدرج فيها عمليات rollout حديثة من on-policy.
- تُضاف إليها عمليات rollout مختارة بشكل منفصل من المخزن المؤقت.
عند اختيار عناصر replay، تُؤخذ قيمة advantage لكل عملية rollout في الحسبان. ولم يُذكر في الحقائق الموصوفة حجم حصة replay في batch.
الفرق الأساسي في الأسلوب هو أن عمليات rollout الحديثة تبقى في batch، بينما يضيف إليها المخزن المؤقت عمليات توليد مختارة.
كيف يُحدّ من التقادم
يشير المؤلفون إلى مشكلة replay الساذج: إذ تتغير سياسات LLM بسرعة مع كل gradient step. وقد تصبح عمليات rollout المحفوظة قديمة وتزعزع استقرار التدريب.
يحذف الأسلوب من المخزن المؤقت أي عملية rollout يتجاوز عمرها tau_max من training steps. وهذا يضع حدًا لمدة الاحتفاظ، لكنه لا يلغي حقيقة إعادة الاستخدام نفسها.
معيار التحكم هنا هو عمر عملية rollout منفردة محسوبًا بوحدات training steps، لا انتماؤها إلى مجموعة.
ما الذي أظهره التقييم
اختُبر الأسلوب على ثلاثة أحجام من Qwen3-Base وخمسة اختبارات معيارية رياضية. وتفوّق على GRPO وخطوط الأساس التي تستخدم replay الساذج.
- في كل حجم، كان التحسن في متوسط الاختبارات المعيارية الخمسة إيجابيًا.
- في حجم 4B، بلغ التحسن +1.66 pp.
- وفقًا لـ AES، مقياس التقييم المشترك للدقة وكفاءة الرموز، كان الأسلوب الخيار الوحيد الذي حقق تفوقًا إيجابيًا على GRPO في كل حجم.
يعتمد المعيار العملي للاختيار على التقييم المستهدف: إذ تشمل النتائج الدقة وكفاءة الرموز والمقارنة مع خطي أساس.



