কেন ট্রেসিংয়ের উপর নির্ভর করা বিপজ্জনক
মিশ্র বিশেষজ্ঞ (MoE) আর্কিটেকচারের মডেলগুলিতে, প্রতিটি টোকেন অল্প সংখ্যক "বিশেষজ্ঞের" একটি ছোট উপসেটের মধ্য দিয়ে যায়। প্রক্রিয়াকরণের পরে একটি আনুষ্ঠানিক চিহ্ন থেকে যায় — কোন বিশেষজ্ঞদের ডাকা হয়েছিল এবং কোন ওজনের সাথে। এই ধরনের ট্রেস একটি ব্যাখ্যা হিসাবে ব্যবহার করা সুবিধাজনক, তবে এটি কথোপকথনের বিষয়বস্তু ছাড়া টেলিফোন কলের রেকর্ডিংয়ের মতো: কে কাকে কল করেছে তা দেখা যায়, কিন্তু কী বিষয়ে আলোচনা হয়েছে তা দেখা যায় না।
সাম্প্রতিক একটি প্রিপ্রিন্ট (Chen et al., arXiv:2608.17638) দেখায় যে ট্রেসের উপর ভিত্তি করে ব্যাখ্যা তথ্যের একটি গুরুত্বপূর্ণ স্তর বাদ দেয়। লেখকরা শুধুমাত্র দৃশ্যমান রুট নয়, মডেলের যুক্তির অভ্যন্তরীণ অবস্থাও পড়ার প্রস্তাব করেন। মূল ধারণা — দ্বি-স্তরের রিডআউট: প্রথমে একটি কমপ্যাক্ট সেমান্টিক স্পেস, তারপর একটি সস্তা প্রক্সি, যা রাউটিংয়ের সাধারণ পরিসংখ্যান থেকে পুনর্গঠিত।

দ্বি-স্তরের স্টেট রিডার
J64: সম্পূর্ণ অভিধানের পরিবর্তে 64টি অক্ষ
প্রথম স্তরটি J স্পেস থেকে তৈরি, যার আকার মডেলের অভিধানের সাথে তুলনীয়। এই স্পেসটি একটি কমপ্যাক্ট সেমান্টিক ফ্রেম J64-এ ডিস্টিল করা হয় — মাত্র 64টি অক্ষ। ফলাফলটি একটি নির্বিচারে বিষয়ভিত্তিক প্রজেকশন নয়, বরং মডেলের নিজস্ব যুক্তির অবস্থার উপর প্রশিক্ষিত ইনভেরিয়েন্টের একটি সেট।
J64-এর প্রধান সুবিধা হল এটি এমন অবস্থাগুলি দেখে যা দৃশ্যমান ট্রেসে নেই। দুটি অভিন্ন রাউটিং ট্রেস বিভিন্ন অভ্যন্তরীণ প্রক্রিয়া লুকিয়ে রাখতে পারে, এবং J64 তাদের পার্থক্য করতে সাহায্য করে। উপরন্তু, এটি দুটি ভিন্ন লোড আলাদা করে: মডেল যুক্তিতে কতটা প্রচেষ্টা বিনিয়োগ করে এবং উদাহরণটি নিজেই তার জন্য কতটা জটিল।
ধরে রাখা ডেটাতে যাচাইকরণ দেখায় যে ROC-কার্ভের অধীনে এলাকার বৃদ্ধি বেসলাইন পদ্ধতির তুলনায় 0.096–0.135, যা একই রোলআউটকে টোকেন পূর্ণতা হিসাবে পড়ে এবং একই অ্যাগ্রিগেশন ব্যবহার করে। অর্থাৎ, উন্নতিটি আসে স্টেট রিডিংয়ের পদ্ধতি থেকে, মডেল বা ডেটা ফরম্যাটের পরিবর্তন থেকে নয়।

R64: সস্তা পরিসংখ্যানে একই চিত্র
J64-এর একটি ব্যবহারিক ত্রুটি রয়েছে: এটির জন্য মডেলের অভ্যন্তরীণ উপস্থাপনাগুলিতে অ্যাক্সেস প্রয়োজন। পদ্ধতিটিকে প্রোডাকশনে প্রযোজ্য করতে, লেখকরা নেটিভ এক্সপার্ট রাউটিং পরিসংখ্যান থেকে J64 পুনর্গঠন করেন। এই প্রক্সিটিকে R64 বলা হয় এবং এটি ইনফারেন্সের সময় উল্লেখযোগ্য ওভারহেড তৈরি করে না।
তিনটি মডেল এবং দুটি আর্কিটেকচার পরিবারে R64 এবং J64-এর মধ্যে মধ্যমা অক্ষ-ভিত্তিক সম্পর্ক 0.69–0.86 এ পৌঁছায়। gpt-oss-20b মডেলে, R64 মূল J64-এর ভবিষ্যদ্বাণীমূলক লাভের 95–100% ধরে রাখে। অন্য কথায়, অনেক কাজের জন্য সম্পূর্ণ সেমান্টিক স্পেস গণনা করা প্রয়োজন হয় না: বিদ্যমান রাউটিং প্রক্রিয়া থেকে পরিসংখ্যান নেওয়াই যথেষ্ট।
টেস্ট-টাইম সিদ্ধান্তের জন্য দুটি সময় রেজোলিউশন
স্টেট রিডিং শুধুমাত্র পোস্ট-হক ব্যাখ্যা হিসাবে নয়, সিদ্ধান্ত গ্রহণের সরঞ্জাম হিসাবেও কাজ করে। লেখকরা দুটি পরিস্থিতি বিবেচনা করেন: সম্পন্ন প্রার্থীদের বিশ্লেষণ এবং রিয়েল-টাইমে জেনারেশন পরিচালনা।
প্রস্তুত বিকল্প থেকে নির্বাচন
যখন মডেল ইতিমধ্যে উত্তরের বেশ কয়েকটি ভেরিয়েন্ট তৈরি করেছে, J64 এবং R64 প্রার্থীদের মধ্যে একটি শাখা নির্বাচন উন্নত করে। আলাদাভাবে ওয়েটেড ভোটিং পরীক্ষা করা হয়েছে: যদি সাধারণ সংখ্যাগরিষ্ঠের পরিবর্তে R64-এর ওজন ব্যবহার করা হয়, ফলাফল আটটি সেটিংসের মধ্যে সাতটিতে সাধারণ majority voting-এর চেয়ে ভালো হয়। এর অর্থ হল লুকানো অবস্থা উত্তরগুলির অ্যাগ্রিগেশনের জন্য আরও নির্ভুল সংকেত হিসাবে ব্যবহার করা যেতে পারে।
জেনারেশনের সময় থামানো এবং পুনরায় নমুনা
দ্বিতীয় পরিস্থিতি — জেনারেশন, যেখানে টোকেন আসার সাথে সাথে সিদ্ধান্ত নেওয়া প্রয়োজন। স্লাইডিং রিডিং উইন্ডোগুলি একটি ক্রমবর্ধমান "স্টপ অ্যান্ড রিস্যাম্পল" নীতিতে খাওয়ানো হয়: একটি নির্দিষ্ট মুহূর্তে মডেল বর্তমান শাখা বন্ধ করে আবার জেনারেট করা শুরু করে। এই নীতির কাজের পয়েন্ট শুধুমাত্র প্রশিক্ষণ প্রশ্নে স্থির করা হয়, তাই পরীক্ষায় পদ্ধতিটি পরিচিত উত্তরগুলির সাথে খাপ খায় না।
J64 নিয়ন্ত্রণ পরীক্ষার তুলনায় নির্ভুলতায় 1.1–5.9 পয়েন্ট বৃদ্ধি দেয়, যেখানে মিশ্রিত সিবলিং ব্যবহার করা হয়েছিল। শুধুমাত্র রাউটিংয়ের উপর নির্মিত R64 এই লাভের 0.9–3.2 পয়েন্ট ধরে রাখে। এমনকি সস্তা প্রক্সি জেনারেশন পরিচালনার জন্য যথেষ্ট কার্যকর।

রাউটারের মাধ্যমে কি যুক্তি পরিবর্তন করা সম্ভব
কাজের শেষ অংশটি প্যাসিভ ব্যাখ্যার বাইরে যায়। গবেষকরা রাউটারটি এমনভাবে সম্পাদনা করেন যাতে J64-এর সাথে সম্পর্কিত প্রক্রিয়াটি প্রভাবিত হয়। এর পরে মডেলের আচরণ একটি অনুমানযোগ্য উপায়ে পরিবর্তিত হয় — এমনভাবে যা J64-এর ব্যাখ্যা থেকে অনুসরণ করে। মডেলের নির্ণয়যোগ্য "আটকে যাওয়া" সংখ্যাগত অনুমান থেকে সঠিক সিম্বলিক এক্সিকিউশনে স্থানান্তরিত হয়।
এটি একটি গুরুত্বপূর্ণ সংকেত: J64-এর অক্ষগুলি কেবল একটি সম্পর্ক নয়, যুক্তিতে একটি কার্যকারণ ভূমিকা নির্ধারণ করে। যদি রাউটার সম্পাদনা প্রত্যাশিত পরিবর্তন দেয়, তাহলে পঠিত অবস্থা সত্যিই সিদ্ধান্ত গ্রহণে অংশ নেয়, এবং এটি একটি পার্শ্ব প্রতিক্রিয়া নয়।
MoE ট্রেসিং মডেলের একটি সুবিধাজনক, কিন্তু খুব মোটা ইন্টারফেস হিসাবে রয়ে গেছে। দ্বি-স্তরের রিডআউট — প্রথমে একটি সাশ্রয়ী সেমান্টিক প্রজেকশন, তারপর রাউটিংয়ের উপর ভিত্তি করে একটি প্রক্সি — দৃশ্যমান বিশেষজ্ঞ কলের আগে এবং বাইরে যা ঘটে তা দেখতে দেয়। এই ধরনের অভ্যন্তরীণ "ড্যাশবোর্ড" বড় মডেলগুলির ডিবাগিং এবং পরিচালনার জন্য পরবর্তী মানক সরঞ্জাম হয়ে উঠতে পারে।



