تعليم نماذج اللغة الكبيرة عبر التعلم المعزز غالبًا ما يبدو خشنًا: يحصل النظام فقط على «علامة زائد» أو «علامة ناقص» عن الإجابة بأكملها، وعليه أن يخمن بنفسه ما الذي سار بشكل خاطئ. تحاول طريقة SocraticPO، الموصوفة في preprint على arXiv:2606.09887 بواسطة فريق بقيادة Zirui Liu، إصلاح هذا الأمر. بدلاً من مجرد إخبار النموذج بالخطأ، يقوم «المعلم» بتوجيه اتجاه التفكير بصيغة طبيعية — بينما يستمر النموذج نفسه في التعلم ضمن إطار RL القياسي.
لماذا لا تكفي المكافآت الثنائية
في دورة RL النموذجية، يولد نموذج اللغة سلسلة من التفكير ثم يحصل على مكافأة نتيجة عددية: على سبيل المثال، لتطابق الإجابة الصحيحة. هذا التقييم يحدد اتجاه التحسين، لكنه لا يشرح في أي خطوة سار الحل في المسار الخاطئ.
بسبب هذا، غالبًا ما يبحث النموذج عن طريق مختصر: يحفظ أنماطًا تبدو معقولة، لكنها لا تصمد أمام الاختبار في المهام الجديدة. النتيجة — سياسات هشة تعمل بشكل ممتاز على أنواع مألوفة من الأمثلة وتنهار عند أدنى تغيير في الصياغة. الإشارة الثنائية فقيرة جدًا لتعليم التفكير.
كيف يعمل SocraticPO

الفكرة الأساسية هي إضافة توجيه باللغة الطبيعية بأسلوب سقراطي إلى مسار التوليد (rollout). تبدو العملية كما يلي:
- يجيب الطالب بنفسه. يحاول النموذج حل المشكلة دون مساعدة خارجية.
- يتحقق المعلم من التفكير. إذا كانت الإجابة صحيحة، ينتهي مسار التوليد بالطريقة المعتادة.
- عند الخطأ، يشخص المعلم المحاولة. لا يقدم حلاً جاهزًا، بل يشير بإيجاز إلى المشكلة أو يطرح سؤالًا إرشاديًا بروح الحوار السقراطي.
- يواصل الطالب بسياق موسع. يرى النموذج سلسلة تفكيره الأصلية وتوجيه المعلم، ثم يحاول الوصول إلى الإجابة الصحيحة.
هذا النهج يختلف جوهريًا عن مجرد إعطاء تلميحات قبل الإجابة: التدخل يحدث فقط بعد أن يُظهر النموذج بالفعل تفكيره «الساذج». هذا يعني أن المعلم يمكنه الاعتماد على الخطأ الفعلي للطالب، وليس على فكرة مجردة عن «هكذا يجب أن يكون».
لماذا المكافأة «المتناقصة»
إذا تمت مكافأة الإجابة المصححة بمساعدة المعلم بنفس سخاء الإجابة المستقلة تمامًا، فسيجد النموذج إغراءً لارتكاب الأخطاء عمدًا ليحصل دائمًا على تلميح. هذا سيحول المعلم إلى مصدر مجاني للإجابات الصحيحة.
تتغلب SocraticPO على هذه المشكلة بذكاء: الإجابات الصحيحة التي يتم الحصول عليها بعد التدخل تحقق مكافأة مخفضة. يمكن للنموذج الاستفادة من التلميح، لكنه لا يحصل على المكافأة الكاملة مقابل ذلك. هذه الآلية تقلل الاعتماد على المساعدة الخارجية وتجبر على استخدام توجيه المعلم للتعلم، وليس كمنفذ هروب.
التوافق مع الأساليب الحالية
من المزايا المهمة لـ SocraticPO هو التدخل البسيط في خوارزمية التعلم نفسها. يغير الإطار فقط عملية توليد مسارات التوليد، بينما يبقى الهدف القياسي — تعظيم المكافأة المتوقعة — دون تغيير. بفضل هذا، يمكن ربط الطريقة بأساليب policy-gradient الموجودة بالفعل، مثل Reinforce++.
ميزة إضافية — لا يحتاج المعلم إلى الوصول إلى داخل النموذج. نظرًا لأن التوجيه يُنقل فقط عبر النص، يمكن لنموذج أقوى أن يؤدي دور المعلم، ويعمل كـ«صندوق أسود». لا يلزم مواءمة توزيعات الرموز أو استخدام logits النموذج الطالب.
نتائج التجارب
اختبر المؤلفون SocraticPO على مهام علمية بمستوى البكالوريوس من مجموعة SciKnowEval. هنا تفوقت الطريقة على خطوط الأساس القوية في RL والأساليب القائمة على التقطير الذاتي، عندما يتعلم النموذج من إجاباته المصححة.

تُظهر دراسات الإزالة أن مكونين إلزاميين يعملان معًا. التلميح النصي الموجه بحد ذاته يحسن النتائج بشكل ملحوظ، بينما يضيف تناقص المكافأة مانعًا مهمًا من الإفراط في التكيف مع «المساعد». إذا تمت إزالة أي منهما، تنخفض الفعالية.
ماذا يعني هذا عمليًا
SocraticPO مثير للاهتمام لأنه يجعل التغذية الراجعة في RL أشبه بعملية التعلم الطبيعية. لا يتم فقط معاقبة النموذج على إجابة خاطئة — بل يُظهر له الاتجاه الذي يجب أن يفكر فيه.
في الوقت نفسه، هذا «الإنسانية» لا يتطلب إعادة كتابة كاملة لبنية RL: يكفي استبدال عملية توليد المسارات وترك بقية البنية التحتية. إمكانية استخدام صناديق سوداء قوية كمعلم مفيدة بشكل خاص مع تزايد الفجوة بين النماذج المفتوحة والمغلقة المتاحة.
يبقى السؤال حول كيفية تصرف الإطار في المهام متعددة الخطوات الأكثر تعقيدًا، حيث تكون هناك حاجة لعدة جولات من الحوار. لكن حتى الآن، فكرة إضافة تفسير جوهري للخطأ بدلاً من مجرد تقييم في RL تبدو خطوة طبيعية تالية نحو نماذج تفكير أكثر استقرارًا.



