এই নিবন্ধটি কী সম্পর্কে
যখন একটি বড় ভাষার মডেল একটি জটিল যৌক্তিক বা গাণিতিক সমস্যা সমাধান করে, তখন জেনারেশন প্রক্রিয়াটি কেবল টোকেনের ক্রমিক আউটপুট নয়। প্রতিটি ধাপ অভ্যন্তরীণ অবস্থার উপর নির্ভর করে, যেখানে মডেলটি শর্ত, মধ্যবর্তী ফলাফল এবং তাদের মধ্যে সম্পর্ক ধরে রাখে। শক্তিশালী যুক্তিবিদ LLM-রা এই স্থানটি কার্যকরভাবে ব্যবহার করে, তবে তাদের ক্ষেত্রেও ব্যর্থতা ঘটে। প্রায়শই সমস্যাটি জ্ঞানের অভাবের সাথে সম্পর্কিত নয়, বরং প্রয়োজনীয় জ্ঞানীয় প্রক্রিয়াগুলি — স্ব-পরীক্ষা, সমস্যার পুনঃসংজ্ঞায়ন, পূর্ববর্তী সিদ্ধান্তে ফিরে যাওয়া — সময়মতো সক্রিয় না হওয়ার সাথে সম্পর্কিত।
একটি নতুন গবেষণা, যার প্রথম সংস্করণ ২০২৬ সালের মে মাসে arXiv-তে প্রকাশিত হয়েছিল এবং চূড়ান্ত সংস্করণ আগস্টে, EMNLP 2026 সম্মেলনে গৃহীত হয়েছিল। লেখকরা Latent Reward Steering (LRS) ফ্রেমওয়ার্ক উপস্থাপন করেছেন। এটি একটি অভিযোজিত ইনফারেন্স-টাইম পদ্ধতি: এটি প্রম্পটের পাঠ্য পরিবর্তন করে না বা এতে নির্দেশনা যোগ করে না, বরং মডেলের অভ্যন্তরীণ উপস্থাপনার উপর প্রভাব ফেলে। মূলত, সিস্টেমটি শেখে যে মুহূর্তে এটি দেখে যে যুক্তি ভুল পথে যাচ্ছে, তখন তা "মেরামত" করতে।
কেন আচরণগত ইঙ্গিত যথেষ্ট নয়
LLM-এর যুক্তি উন্নত করার সবচেয়ে সাধারণ উপায় হল স্পষ্টভাবে এটিকে একটি নির্দিষ্ট উপায়ে আচরণ করতে বলা: "কাজটি ধাপে ভাগ করুন", "নিজেকে পরীক্ষা করুন", "প্রথমে ভাবুন, তারপর উত্তর দিন"। এই ধরনের কৌশল বাহ্যিক, পাঠ্য স্তরে আচরণ নিয়ন্ত্রণ করে। তারা ধরে নেয় যে একটি সার্বজনীন স্ক্রিপ্ট রয়েছে যা সমস্ত ত্রুটির জন্য সমানভাবে কার্যকর। কিন্তু বাস্তবে ব্যর্থতাগুলি সম্পূর্ণ ভিন্ন হতে পারে: মডেলটি শর্তটি ভুল বুঝতে পারে, একটি গুরুত্বপূর্ণ বিবরণ হারাতে পারে, একটি অনুপযুক্ত পদ্ধতি বেছে নিতে পারে বা শেষ ধাপে গণনায় ভুল করতে পারে।
তাছাড়া, বিভিন্ন মডেল — এমনকি বিভিন্ন প্রচেষ্টায় একই মডেল — ভিন্নভাবে ভুল করে। পূর্বনির্ধারিত ইঙ্গিতটি সমস্যার ধরন, যুক্তির বর্তমান অবস্থা বা নির্দিষ্ট LLM-এর বৈশিষ্ট্যগুলি বিবেচনা করে না। কিছু ক্ষেত্রে এটি সাহায্য করে, অন্যগুলিতে এটি অকেজো হয়ে ওঠে এবং কখনও কখনও ক্ষতিকারকও হয়, কারণ এটি মডেলটিকে বাস্তব চিন্তার ধারার সাথে খাপ খাওয়ানোর পরিবর্তে যান্ত্রিকভাবে একটি টেমপ্লেট অনুসরণ করতে বাধ্য করে।

LRS কীভাবে যুক্তির গতিপথ সংশোধন করে
মডেলকে পাঠ্য পরামর্শ দেওয়ার পরিবর্তে, LRS লুকানো অবস্থার স্তরে কাজ করে যা মডেল যুক্তির সময় তৈরি করে। এই অবস্থাগুলি কেবল ধাপগুলির বিষয়বস্তুই বহন করে না, বরং মডেলটি উত্তর দিকে কতটা আত্মবিশ্বাসের সাথে এগিয়ে যাচ্ছে তার সূক্ষ্ম লক্ষণও বহন করে। এই ধরনের লক্ষণগুলিকে নিয়ন্ত্রণের জন্য উপলব্ধ করতে, একটি স্পার্স অটোএনকোডার ব্যবহার করা হয়।
SAE মডেলের ঘন অ্যাক্টিভেশনগুলিকে অল্প সংখ্যক ব্যাখ্যাযোগ্য উপাদানে বিভক্ত করে। এই উপাদানগুলির একটি অংশ দরকারী জ্ঞানীয় আচরণের সাথে মিলে যায়, যেমন মধ্যবর্তী পরীক্ষা বা সিদ্ধান্ত পুনর্বিবেচনা। LRS-এর প্রভাব ঠিক এই উপাদানগুলির উপর লক্ষ্য করা হয়। এই পদ্ধতিটি মৌখিক নির্দেশের মাধ্যমে সম্ভব হওয়ার চেয়ে আরও সুনির্দিষ্টভাবে মডেলের "চিন্তাভাবনা"কে প্রভাবিত করতে দেয়।
ল্যাটেন্ট রিওয়ার্ড মডেল প্রশিক্ষণ
সফল অভ্যন্তরীণ অবস্থাকে অসফল থেকে আলাদা করতে, লেখকরা একটি পৃথক রিওয়ার্ড মডেল প্রশিক্ষণ দেন। এটি ইনপুট হিসেবে চূড়ান্ত উত্তর নয়, বরং মধ্যবর্তী ল্যাটেন্ট অবস্থা গ্রহণ করে এবং মূল্যায়ন করে যে তারা মডেলটিকে সঠিক ফলাফলের কতটা কাছে নিয়ে যায়। প্রশিক্ষণ ডেটা হিসেবে উত্তরগুলির সঠিকতা অনুসারে চিহ্নিত সম্পূর্ণ যুক্তির ট্রেস ব্যবহার করা হয়। এইভাবে রিওয়ার্ড মডেলটি আগে থেকেই ভবিষ্যদ্বাণী করতে শেখে যে পথের বর্তমান অংশটি সাফল্যের দিকে নিয়ে যাবে কিনা।
রিওয়ার্ড গ্রেডিয়েন্ট দ্বারা সংশোধন
যখন জেনারেশনের সময় LRS এমন একটি অবস্থা সনাক্ত করে যা কম আশাব্যঞ্জক দেখায়, তখন এটি সেই অবস্থার উপাদানগুলির উপর রিওয়ার্ড সিগন্যালের গ্রেডিয়েন্ট গণনা করে। গ্রেডিয়েন্টটি সেই দিক নির্দেশ করে যেখানে সঠিক ধারাবাহিকতার সম্ভাবনা বাড়ানোর জন্য ল্যাটেন্ট অবস্থাটিকে সরানো দরকার। LRS-এর মূল বৈশিষ্ট্য হল এই দিকটি আগে থেকে নির্ধারিত নয় এবং স্থির "ভাল যুক্তির নিয়ম" থেকে উদ্ভূত নয়। এটি প্রতিটি নির্দিষ্ট অবস্থার জন্য চলমানভাবে গণনা করা হয়, তাই পদ্ধতিটি মডেল, কাজ এবং বর্তমান ত্রুটির নির্দিষ্টতার সাথে খাপ খায়।
রিওয়ার্ড এবং কনফিডেন্স গেট
প্রতিটি ধাপে হস্তক্ষেপ করা খুব ঝুঁকিপূর্ণ হবে: ধ্রুবক বাহ্যিক প্রভাব স্বাভাবিক জেনারেশনকে ব্যাহত করতে পারে। তাই LRS একটি রিওয়ার্ড এবং কনফিডেন্স গেট ব্যবহার করে। এটি শুধুমাত্র সেই অবস্থাগুলির জন্য সংশোধন পাস করে যা রিওয়ার্ড সিগন্যাল ভঙ্গুর হিসাবে চিহ্নিত করে। যদি বর্তমান অবস্থাটি আত্মবিশ্বাসী হিসাবে মূল্যায়ন করা হয়, তবে কোনও হস্তক্ষেপ ঘটে না। এই নির্বাচনী পদ্ধতি পার্শ্ব প্রতিক্রিয়া হ্রাস করে এবং যুক্তির স্বাভাবিকতা বজায় রাখে যখন মডেলটি নিজেই ভালভাবে মোকাবেলা করে।

পরীক্ষাগুলি কী দেখিয়েছে
লেখকরা LRS-কে ভিত্তি হিসাবে ব্যবহৃত বেশ কয়েকটি যুক্তিবিদ LLM-তে এবং মানক বেঞ্চমার্কের একটি সেটে পরীক্ষা করেছেন। পদ্ধতিটি বিভিন্ন বেসলাইন পদ্ধতির সাথে তুলনা করা হয়েছিল এবং বেশিরভাগ কনফিগারেশনে LRS নির্ভুলতার স্থিতিশীল উন্নতি দিয়েছে। গুরুত্বপূর্ণভাবে, ইতিবাচক প্রভাবটি একটি বিচ্ছিন্ন ঘটনা ছিল না: এটি মডেল এবং কাজের ধরন উভয়ের পরিবর্তনের সাথেই পুনরুত্পাদনযোগ্য ছিল।
ফলাফলের পোস্ট-হক বিশ্লেষণে দেখা গেছে যে উন্নতিগুলি কেবল উত্তরের "দীর্ঘায়িত" করা বা জেনারেশনের শৈলী পরিবর্তনের মধ্যে সীমাবদ্ধ নয়। গবেষকরা আবিষ্কার করেছেন: LRS নিঃশব্দে সেই জ্ঞানীয় আচরণগুলিকে প্রচার করে যা সাধারণত পাঠ্য প্রম্পটের মাধ্যমে প্ররোচিত করার চেষ্টা করা হয়। মডেলটি প্রায়শই ভুল মধ্যবর্তী সিদ্ধান্তে ফিরে আসে, শর্তগুলি আরও যত্ন সহকারে বিশ্লেষণ করে এবং আরও ধারাবাহিক যুক্তির গতিপথ প্রদর্শন করে। অর্থাৎ, পদ্ধতিটি সত্যিই বাহ্যিক টেমপ্লেটের মাধ্যমে নয়, অভ্যন্তরীণ অবস্থার মাধ্যমে কাজ করে।
কেন এটি গুরুত্বপূর্ণ
LRS কেবল নির্দিষ্ট ফলাফলের জন্যই নয়, যুক্তি নিয়ন্ত্রণের মূল নীতির পরিবর্তনের জন্যও আকর্ষণীয়। নিখুঁত প্রম্পট ফর্মুলেশন খোঁজার পরিবর্তে, গবেষকরা মডেলটিকে তার নিজস্ব উপস্থাপনার স্থানে সাবধানে "সংশোধন" করতে শেখার প্রস্তাব দেন। এই পদ্ধতিটি সম্ভাব্যভাবে আরও সার্বজনীন: এটির জন্য আগে থেকে সমস্ত সম্ভাব্য জ্ঞানীয় পরিস্থিতি বর্ণনা করার প্রয়োজন হয় না এবং এটি নিজেই খুঁজে বের করে যে চিন্তার কোন দিকটি এই মুহূর্তে সংশোধনের প্রয়োজন।
আপাতত LRS একটি গবেষণা ফ্রেমওয়ার্ক, একটি প্রস্তুত পণ্য নয়। লেখকরা কোডটি উন্মুক্ত করেছেন যাতে অন্যান্য দল পরীক্ষাগুলি পুনরুত্পাদন করতে পারে এবং পদ্ধতিটিকে তাদের নিজস্ব কাজের সাথে খাপ খাওয়াতে পারে। তবে দিকটি ইতিমধ্যে স্পষ্ট: LLM-এর যুক্তি নিয়ন্ত্রণ ধীরে ধীরে শব্দের স্তর থেকে লুকানো প্রক্রিয়ার স্তরে স্থানান্তরিত হচ্ছে যা নির্ধারণ করে যে মডেলটি ঠিক কীভাবে চিন্তা করে, কেবল এটি কী বলে তা নয়।




