كيفية إعادة استخدام التوليدات القيّمة في تدريب GRPO

25 سبتمبر 202615 الآراء

تعرض المقالة آلية تختار عمليات توليد فردية لإعادة التدريب بناءً على مقدار الأفضلية، وتستبعد البيانات القديمة جدًا مع إثرائها بأمثلة حديثة. وعلى ثلاثة أحجام من Qwen3-Base، تفوقت الطريقة على GRPO وإعادة التشغيل التقليدية في اختبارات الرياضيات، كما حسّنت التوازن بين الدقة واستهلاك الرموز.

كيفية إعادة استخدام التوليدات القيّمة في تدريب GRPO

ما الذي يُعاد استخدامه تحديدًا

في GRPO العادي، تشارك كل عملية rollout في تحديث gradient واحد، ثم تُستبعد. يغيّر الأسلوب الوارد في المقالة هذه الدورة: إذ يحتفظ بعمليات rollout منفردة ويعيد المختارة منها إلى التدريب.

يخزّن المخزن المؤقت عمليات التوليد الفردية، لا مجموعات كاملة. وتمنح آلية replay الأولوية لها بحسب قيمة advantage: إذ يُعاد استخدام عمليات rollout ذات القيم الأكبر.

المعيار العملي: المقصود هو إعادة استخدام عمليات rollout منفردة، لا مجموعات.

كيف تعمل آلية replay

تُشكَّل كل batch على مرحلتين:

  1. تُدرج فيها عمليات rollout حديثة من on-policy.
  2. تُضاف إليها عمليات rollout مختارة بشكل منفصل من المخزن المؤقت.

عند اختيار عناصر replay، تُؤخذ قيمة advantage لكل عملية rollout في الحسبان. ولم يُذكر في الحقائق الموصوفة حجم حصة replay في batch.

الفرق الأساسي في الأسلوب هو أن عمليات rollout الحديثة تبقى في batch، بينما يضيف إليها المخزن المؤقت عمليات توليد مختارة.

كيف يُحدّ من التقادم

يشير المؤلفون إلى مشكلة replay الساذج: إذ تتغير سياسات LLM بسرعة مع كل gradient step. وقد تصبح عمليات rollout المحفوظة قديمة وتزعزع استقرار التدريب.

يحذف الأسلوب من المخزن المؤقت أي عملية rollout يتجاوز عمرها tau_max من training steps. وهذا يضع حدًا لمدة الاحتفاظ، لكنه لا يلغي حقيقة إعادة الاستخدام نفسها.

معيار التحكم هنا هو عمر عملية rollout منفردة محسوبًا بوحدات training steps، لا انتماؤها إلى مجموعة.

ما الذي أظهره التقييم

اختُبر الأسلوب على ثلاثة أحجام من Qwen3-Base وخمسة اختبارات معيارية رياضية. وتفوّق على GRPO وخطوط الأساس التي تستخدم replay الساذج.

  • في كل حجم، كان التحسن في متوسط الاختبارات المعيارية الخمسة إيجابيًا.
  • في حجم 4B، بلغ التحسن +1.66 pp.
  • وفقًا لـ AES، مقياس التقييم المشترك للدقة وكفاءة الرموز، كان الأسلوب الخيار الوحيد الذي حقق تفوقًا إيجابيًا على GRPO في كل حجم.

يعتمد المعيار العملي للاختيار على التقييم المستهدف: إذ تشمل النتائج الدقة وكفاءة الرموز والمقارنة مع خطي أساس.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
كيفية إعادة استخدام التوليدات القيّمة في تدريب GRPO