বৃহৎ ভাষা মডেলকে রিইনফোর্সমেন্ট লার্নিং দিয়ে প্রশিক্ষণ দেওয়া প্রায়ই মোটামুটি ভাবে করা হয়: সিস্টেমটি পুরো উত্তরের জন্য শুধুমাত্র একটি «প্লাস» বা «মাইনাস» পায় এবং নিজেই অনুমান করে যে ঠিক কী ভুল হয়েছে। SocraticPO পদ্ধতি, যা arXiv:2606.09887 প্রিপ্রিন্টে Zirui Liu-এর নেতৃত্বাধীন দল বর্ণনা করেছে, এটি সংশোধন করার চেষ্টা করে। মডেলটিকে শুধু ভুল জানানোর পরিবর্তে, «শিক্ষক» প্রাকৃতিক আকারে চিন্তার দিক নির্দেশনা দেয় — এবং মডেলটি নিজে এখনও স্ট্যান্ডার্ড RL-এর কাঠামোর মধ্যেই শেখে।
বাইনারি রিওয়ার্ড কেন যথেষ্ট নয়
সাধারণ RL-চক্রে, ভাষা মডেল একটি যুক্তির ধারা তৈরি করে এবং তারপর একটি স্কেলার আউটকাম-রিওয়ার্ড পায়: উদাহরণস্বরূপ, সঠিক উত্তরের সাথে মিলে যাওয়ার জন্য। এই ধরনের মূল্যায়ন অপ্টিমাইজেশানের দিকনির্দেশনা দেয়, কিন্তু ব্যাখ্যা করে না যে সমাধানটি কোন ধাপে ভুল পথে গেছে।
এর কারণে, মডেলটি প্রায়ই একটি সংক্ষিপ্ত পথ খোঁজে: এটি এমন প্যাটার্ন মুখস্থ করে যা বিশ্বাসযোগ্য দেখায়, কিন্তু নতুন সমস্যায় যাচাইয়ে টেকে না। ফলাফল — ভঙ্গুর পলিসি, যা পরিচিত ধরনের উদাহরণে চমৎকারভাবে কাজ করে এবং ফর্মুলেশনের সামান্য পরিবর্তনেই ভেঙে পড়ে। বাইনারি সংকেত যুক্তি শেখানোর জন্য খুবই দুর্বল।
SocraticPO কীভাবে কাজ করে

মূল ধারণা — রোলআউটে সক্রেটিক শৈলীতে প্রাকৃতিক-ভাষার নির্দেশনা যোগ করা। প্রক্রিয়াটি এই রকম দেখায়:
- শিক্ষার্থী নিজে নিজে উত্তর দেয়। মডেলটি বাইরের সাহায্য ছাড়াই সমস্যা সমাধানের চেষ্টা করে।
- শিক্ষক যুক্তি যাচাই করেন। যদি উত্তর সঠিক হয়, রোলআউটটি স্বাভাবিকভাবে শেষ হয়।
- ভুল হলে, শিক্ষক প্রচেষ্টাটি নির্ণয় করেন। তিনি প্রস্তুত সমাধান দেন না, বরং সংক্ষেপে সমস্যাটি নির্দেশ করেন বা সক্রেটিক সংলাপের ধাঁচে একটি নির্দেশক প্রশ্ন করেন।
- শিক্ষার্থী বর্ধিত প্রসঙ্গ নিয়ে চালিয়ে যায়। মডেলটি তার নিজের মূল যুক্তির ধারা এবং শিক্ষকের নির্দেশনা দেখে, তারপর সঠিক উত্তরে পৌঁছানোর চেষ্টা করে।
এই পদ্ধতি উত্তরের আগে সহজভাবে ইঙ্গিত দেওয়ার থেকে মূলত আলাদা: হস্তক্ষেপ কেবল তখনই ঘটে যখন মডেলটি ইতিমধ্যে তার «সরল» যুক্তি প্রদর্শন করেছে। অর্থাৎ, শিক্ষক শিক্ষার্থীর প্রকৃত ভুলের উপর ভিত্তি করে নির্দেশনা দিতে পারেন, বিমূর্ত «এভাবেই করতে হবে»-এর উপর নয়।
«ক্ষয়প্রাপ্ত» রিওয়ার্ড কেন প্রয়োজন
যদি শিক্ষকের সাহায্যে সংশোধিত উত্তরকে সম্পূর্ণ স্বাধীন উত্তরের মতোই উদারভাবে পুরস্কৃত করা হয়, তাহলে মডেলের মনে প্রলোভন তৈরি হবে ইচ্ছাকৃতভাবে ভুল করার, যাতে সবসময় ইঙ্গিত পাওয়া যায়। এটি শিক্ষককে সঠিক উত্তরের একটি বিনামূল্যের উৎসে পরিণত করবে।
SocraticPO এই সমস্যাটি চতুরতার সাথে এড়িয়ে চলে: হস্তক্ষেপের পরে পাওয়া সঠিক উত্তর হ্রাসকৃত রিওয়ার্ড আনে। মডেলটি ইঙ্গিত ব্যবহার করতে পারে, কিন্তু এর জন্য সম্পূর্ণ পুরস্কার পায় না। এই প্রক্রিয়া বাইরের সাহায্যের উপর নির্ভরতা কমায় এবং শিক্ষকের নির্দেশনাকে ফাঁকি হিসেবে নয়, বরং শেখার জন্য ব্যবহার করতে বাধ্য করে।
বিদ্যমান পদ্ধতির সাথে সামঞ্জস্য
SocraticPO-এর একটি গুরুত্বপূর্ণ সুবিধা — শেখার অ্যালগরিদমে ন্যূনতম হস্তক্ষেপ। ফ্রেমওয়ার্কটি কেবল রোলআউট তৈরির প্রক্রিয়া পরিবর্তন করে, আর স্ট্যান্ডার্ড objective — প্রত্যাশিত রিওয়ার্ড সর্বাধিকীকরণ — অপরিবর্তিত থাকে। এর ফলে, পদ্ধতিটিকে ইতিমধ্যে বিদ্যমান policy-gradient পদ্ধতির সাথে যুক্ত করা যায়, যেমন Reinforce++।
আরেকটি সুবিধা — শিক্ষকের মডেলের ভিতরে প্রবেশাধিকারের প্রয়োজন নেই। যেহেতু নির্দেশনা কেবল টেক্সটের মাধ্যমে传递 হয়, তাই শিক্ষকের ভূমিকা একটি শক্তিশালী মডেল পালন করতে পারে যা «ব্ল্যাক বক্স» হিসেবে কাজ করে। টোকেন ডিস্ট্রিবিউশন সারিবদ্ধ করার বা শিক্ষার্থী-মডেলের লজিট ব্যবহার করার প্রয়োজন নেই।
পরীক্ষার ফলাফল
লেখকরা SciKnowEval সেট থেকে স্নাতক-স্তরের বৈজ্ঞানিক সমস্যায় SocraticPO পরীক্ষা করেছেন। এখানে পদ্ধতিটি শক্তিশালী RL-বেসলাইন এবং self-distillation-ভিত্তিক পদ্ধতিগুলিকে ছাড়িয়ে গেছে, যখন মডেলটি তার নিজের সংশোধিত উত্তরের উপর প্রশিক্ষিত হয়।

অ্যাবলেশন দেখায় যে দুটি বাধ্যতামূলক উপাদান একসাথে কাজ করে। টার্গেটেড টেক্সট ইঙ্গিত নিজে থেকেই ফলাফল উল্লেখযোগ্যভাবে উন্নত করে, আর রিওয়ার্ড ক্ষয় «সহায়কের» উপর অতিমাত্রায় নির্ভরতা থেকে রক্ষা করার জন্য একটি গুরুত্বপূর্ণ সুরক্ষা যোগ করে। যদি একটি উপাদান বাদ দেওয়া হয়, কার্যকারিতা কমে যায়।
অনুশীলনে এর অর্থ কী
SocraticPO আকর্ষণীয় কারণ এটি RL-এ প্রতিক্রিয়াকে প্রাকৃতিক শেখার প্রক্রিয়ার আরও কাছাকাছি নিয়ে আসে। মডেলটিকে কেবল ভুল উত্তরের জন্য শাস্তি দেওয়া হয় না — তাকে দেখানো হয় কোন দিকে চিন্তা করা উচিত।
তবে, এই «মানবিকতা» RL-এর পুরো কাঠামো সম্পূর্ণ নতুন করে লেখার দাবি করে না: রোলআউট প্রক্রিয়া প্রতিস্থাপন করাই যথেষ্ট, বাকি অবকাঠামো অপরিবর্তিত রাখা যায়। শক্তিশালী ব্ল্যাক বক্সকে শিক্ষক হিসেবে ব্যবহার করার সুযোগ বিশেষভাবে উপযোগী যখন উপলব্ধ ওপেন এবং ক্লোজড মডেলের মধ্যে ব্যবধান বাড়তে থাকে।
প্রশ্ন থেকে যায়, ফ্রেমওয়ার্কটি আরও জটিল মাল্টি-স্টেপ সমস্যায় কীভাবে আচরণ করবে, যেখানে সংলাপের একাধিক রাউন্ড প্রয়োজন। কিন্তু ইতিমধ্যেই, RL-এ মূল্যায়ন নয়, বরং ভুলের অর্থপূর্ণ ব্যাখ্যা যোগ করার ধারণাটি আরও স্থিতিশীল যুক্তিবিদ মডেলের দিকে একটি স্বাভাবিক পরবর্তী পদক্ষেপ বলে মনে হয়।



