আধুনিক AI-এজেন্টরা ক্রমবর্ধমানভাবে কথোপকথনমূলক মোডে কাজ করছে: ব্যবহারকারী একটি কাজ সেট করে, এজেন্ট টুলগুলিতে অ্যাক্সেস করে, ফলাফল ফেরত দেয় এবং ব্যক্তি অনুরোধটি স্পষ্ট বা সংশোধন করে। এই ধরনের বহু-পদক্ষেপের মিথস্ক্রিয়া মূল্যায়ন করা কঠিন, কারণ শেষে শুধুমাত্র চূড়ান্ত ফলাফল থাকে। এটি দেখায় না যে এজেন্টের কোন কাজগুলি সত্যিই সাহায্য করেছে এবং কোনটি অপ্রয়োজনীয় ছিল।
কেন একটি একক ফলাফল যথেষ্ট নয়
এই ধরনের এজেন্টদের জন্য রিইনফোর্সমেন্ট লার্নিংয়ে সাধারণত রোলআউট ব্যবহার করা হয়: এজেন্ট কর্মের একটি সিরিজ সম্পাদন করে, তারপর চূড়ান্ত ফলাফলের জন্য একটি পুরস্কার পায়। এই পদ্ধতিটি সুবিধাজনক, তবে বেশ মোটামুটি। একটি সফল অনুরোধ স্পষ্টীকরণ, একটি স্পষ্ট ত্রুটি এবং পরবর্তী সংশোধন একই ক্রেডিট পায়, যদিও চূড়ান্ত ফলাফলে তাদের অবদান সম্পূর্ণ ভিন্ন। এর কারণে, এজেন্ট ধীরে ধীরে শেখে এবং সবসময় বোঝে না কোন কাজটি সাফল্যের দিকে পরিচালিত করেছে।
নতুন গবেষণার লেখকরা একটি মূল্যবান সংকেত উৎসের দিকে মনোযোগ আকর্ষণ করেছেন যা প্রায়ই উপেক্ষা করা হয় — ব্যবহারকারীর পরবর্তী প্রতিক্রিয়া। যখন এজেন্ট একটি পদক্ষেপ নেয়, তখন ব্যক্তি প্রতিক্রিয়া জানায়: কাজটি স্পষ্ট করে, অসন্তোষ প্রকাশ করে, উত্তর নিশ্চিত করে। এই ধরনের প্রতিক্রিয়া শুধুমাত্র পরবর্তী পদক্ষেপগুলির জন্য প্রসঙ্গ নয়, বরং সম্প্রতি সম্পন্ন মিথস্ক্রিয়া অংশ সম্পর্কে একটি স্থানীয় মতামত।

FACA কীভাবে কাজ করে
FACA (Feedback-Aware Credit Assignment) পদ্ধতি ব্যবহারকারীর প্রতিক্রিয়াকে একটি পূর্ণাঙ্গ শিক্ষণ সংকেতে রূপান্তরিত করে। ধারণাটি হল প্রতিটি প্রতিক্রিয়াকে এজেন্টের কর্মের একটি নির্দিষ্ট অংশের সাথে মেলানো, এবং তারপর এই প্রতিক্রিয়ার স্থানীয় সুবিধা গণনা করা — এটি প্রদত্ত প্রসঙ্গের জন্য প্রত্যাশিত থেকে কতটা ভাল। এই সুবিধাটি স্বাভাবিক করা হয় এবং ফলাফলের মানক টার্মিনাল সুবিধার সাথে যোগ করা হয়। এর জন্য কোনো অতিরিক্ত সমালোচক বা নতুন রোলআউটের প্রয়োজন হয় না — সবকিছু ইতিমধ্যে সংগ্রহ করা ডেটার উপর গণনা করা হয়।
এই সংমিশ্রণ এজেন্টকে ফলাফলের একটি মোটামুটি মূল্যায়ন এবং আরও সঠিক মধ্যবর্তী সংকেত উভয়ই দেয়। অতিরিক্ত বোনাস হল যে পদ্ধতিটি ইনফারেন্সকে জটিল করে না: সমস্ত অতিরিক্ত সংকেত ইতিমধ্যে বিদ্যমান কথোপকথন থেকে বের করা হয়, তাই এটি বাস্তব সিস্টেমে প্রয়োগ করা সহজ।
পরীক্ষার ফলাফল
গবেষকরা FACA-কে Interactive GRPO পদ্ধতির সাথে তুলনা করেছেন, যা শুধুমাত্র ফলাফল বিবেচনা করে। প্রশিক্ষণ একই অবস্থার অধীনে পরিচালিত হয়েছিল: একই সিমুলেটর, একই দৃশ্যমান কথোপকথন, একই initialization এবং অপ্টিমাইজেশন। τ-পরিবারের নয়টি ডোমেনে FACA 8B মডেলের জন্য গড় ফলাফল 5.91 শতাংশ পয়েন্ট এবং 14B মডেলের জন্য 10.22 শতাংশ পয়েন্ট উন্নত করেছে। প্রতিটি সূচক তিনটি স্বাধীনভাবে প্রশিক্ষিত রানে প্রাপ্ত হয়েছিল।
সবচেয়ে বড় লাভ Telecom ডোমেনে এসেছে। ব্যবহারকারীর প্রতিক্রিয়ার পোলারিটি র্যান্ডমাইজেশন সহ একটি অতিরিক্ত পরীক্ষা দেখিয়েছে যে 8B মডেলের জন্য এই লাভ সম্পূর্ণরূপে অদৃশ্য হয়ে যায়। এটি নিশ্চিত করে: সংকেতটি দরকারী তথ্য বহন করে, শুধু শব্দ যোগ করে না। Pare-Bench এবং Co-Gym বেঞ্চমার্কে zero-shot মোডে ফলাফল একই ক্রম বজায় রাখে।

উপসংহার
কাজটি স্পষ্টভাবে প্রদর্শন করে যে ব্যবহারকারীর পরবর্তী প্রতিক্রিয়া শুধুমাত্র প্রসঙ্গের চেয়ে বেশি। এটি একটি সস্তা স্থানীয় ক্রেডিট প্রদান করে যা মাল্টি-টার্ন মিথস্ক্রিয়ার জন্য এজেন্টদের প্রশিক্ষণ উল্লেখযোগ্যভাবে উন্নত করে। FACA প্রশিক্ষণ প্রক্রিয়ার উল্লেখযোগ্য পুনর্গঠন ছাড়াই এই সংকেতটি বের করার একটি সহজ এবং কার্যকর উপায় প্রস্তাব করে। ফলস্বরূপ, এজেন্টরা আরও ভালভাবে বোঝে কোন কাজগুলি সত্যিই তাদের লক্ষ্যের কাছাকাছি নিয়ে আসে এবং কোনটি পুনর্বিবেচনা করা উচিত।



