কেন LLM-এর মিথ্যা আত্মবিশ্বাস শুধু একটি বাগ নয়
আধুনিক ভাষার মডেলগুলো মসৃণ ও বিশ্বাসযোগ্যভাবে চিন্তা প্রকাশ করতে শিখেছে। কিন্তু এই বিশ্বাসযোগ্যতার আড়ালে প্রায়ই লুকিয়ে থাকে যা বিশেষজ্ঞরা হ্যালুসিনেশন বলে থাকেন: মডেলটি বিশ্বাসযোগ্য শোনায় এমন, কিন্তু সম্পূর্ণ কাল্পনিক কনটেন্ট তৈরি করে। ব্যবহারকারীর কাছে এটি একটি সমান, আত্মবিশ্বাসী লেখার মতো দেখায় — এবং ঠিক এই কারণেই সমস্যাটি বিপজ্জনক।
বেশিরভাগ পরিচিত হ্যালুসিনেশন ডিটেক্টর মোটামুটিভাবে কাজ করে। তারা পুরো উত্তরটি বা পৃথক বাক্যগুলো মূল্যায়ন করে, এমন কিছু জানিয়ে দেয় যেমন «এখানে, মনে হচ্ছে একটি ভুল আছে»। কিন্তু মডেলটি ঠিক কোন জায়গায় «একটি তথ্য উদ্ভাবন করেছে» তা বোঝার জন্য আরও সূক্ষ্ম পরীক্ষা প্রয়োজন — পৃথক টোকেনের স্তরে। শুধুমাত্র টোকেন-পরবর্তী ডিটেকশনই মিথ্যা অংশটিকে চিহ্নিত করতে এবং বাকি লেখা না ছুঁয়ে নির্দিষ্টভাবে জেনারেশনে হস্তক্ষেপ করতে দেয়।

MoE-মডেলগুলো ঘটনাক্রমে সূত্র দেয়
Mixture-of-Experts (MoE) ধরনের আর্কিটেকচারে একটি কৌতূহলোদ্দীপক নীতি কাজ করে: একটি ফরোয়ার্ড পাসে পুরো নেটওয়ার্ক নয়, শুধুমাত্র «বিশেষজ্ঞদের» একটি বিরল উপসেট সক্রিয় হয়। কাকে ডাকা হবে সেই নির্বাচন করে রাউটিং মেকানিজম। এবং ঠিক এই মুহূর্তেই অভ্যন্তরীণ সংকেত তৈরি হয়, যা ঘন আর্কিটেকচারে একেবারেই থাকে না:
- রাউটারের এনট্রপি — মডেলটি কোন বিশেষজ্ঞের কাছে যেতে হবে তা নিয়ে কতটা «নিশ্চিত নয়»;
- বিশেষজ্ঞদের মতভেদ — তাদের মধ্যবর্তী ফলাফলগুলো কতটা আলাদা;
- বিশেষজ্ঞ ব্যবহারের প্যাটার্ন — কোন বিশেষজ্ঞরা বেশি কাজে যুক্ত হন।
আগে এই সংকেতগুলো হ্যালুসিনেশন খোঁজার জন্য প্রায় ব্যবহার করা হতো না। গবেষক জোয়াও ফনসেকা, রদ্রিগো রদ্রিগেজ এবং পাওলো রোমানো arXiv:2608.17687 নিবন্ধে দেখিয়েছেন যে এটি ছিল ভুল: লুকানো সূচকগুলো সেই মুহূর্তগুলো চিহ্নিত করতে সক্ষম যখন মডেলটি কল্পনা করতে শুরু করে। কাজটি ১৮ আগস্ট ২০২৬ তারিখে arXiv-এ উপস্থাপিত হয়েছিল।

InnerExpert: ডিটেক্টর যা মডেলের ভেতরে দেখে
লেখকদের প্রস্তাবিত পদ্ধতি InnerExpert দুই ধরনের ডেটা একত্রিত করে: MoE-নির্দিষ্ট রাউটিং-স্তরের সংকেত এবং ট্রান্সফরমারের মানক অভ্যন্তরীণ উপস্থাপনা। এই সবকিছু প্রতিটি টোকেনের জন্য কমপ্যাক্ট ফিচার ভেক্টরে সংগ্রহ করা হয়। তারপর একটি হালকা ক্লাসিফায়ার এই ভেক্টরগুলো প্রক্রিয়া করে এবং নির্ধারণ করে টোকেনটি হ্যালুসিনেশন কিনা।
মূল বৈশিষ্ট্য — স্বয়ংক্রিয় প্রশিক্ষণ। ডিটেক্টর প্রশিক্ষণের জন্য লেবেল তৈরি করে LLM-as-a-judge পাইপলাইন, যখন একটি ভাষার মডেল অন্য মডেলের আউটপুট মূল্যায়ন করে। কোনো ম্যানুয়াল অ্যানোটেশন প্রয়োজন হয় না। এর অর্থ হল পাইপলাইনটি আবার চালিয়ে ডিটেক্টরকে দ্রুত নতুন জেনারেটিভ মডেলের সংস্করণের সাথে খাপ খাওয়ানো যায়।

পরীক্ষাগুলো কী দেখিয়েছে
পরীক্ষাগুলো পাঁচটি ডেটাসেট এবং দুটি ভিন্ন MoE-আর্কিটেকচার জুড়ে পরিচালিত হয়েছিল। পরীক্ষায় InnerExpert ধারাবাহিকভাবে বিদ্যমান ডিটেক্টরগুলোর চেয়ে ভালো পারফর্ম করেছে। সেরা ফলাফল পুরো উত্তরের স্তরে 0.91 AUROC এবং পৃথক টোকেনের স্তরে 0.76 AUROC অর্জন করেছে। তাছাড়া এর জন্য একটি মাত্র ফরোয়ার্ড পাস যথেষ্ট — অতিরিক্ত যাচাইকরণ মডেল বা বারবার জেনারেশন চালানোর প্রয়োজন নেই।
উচ্চ answer-level ফলাফল মোটামুটি ফিল্টারিংয়ের জন্য উপযোগী। কিন্তু সত্যিই মূল্যবান সূচক হলো token-level: এটি লেখার মিথ্যা অংশগুলো নির্দিষ্টভাবে খুঁজে বের করতে এবং, উদাহরণস্বরূপ, সেগুলো পুনর্লিখন বা ব্যবহারকারীকে হাইলাইট করতে দেয়। এটি আর «কোথাও একটি ভুল» নয়, বরং উত্তরের একটি নির্দিষ্ট স্থান।
কেন এটি গুরুত্বপূর্ণ
হ্যালুসিনেশন চিকিৎসা, আইন, অর্থ এবং অন্যান্য ভুল-সংবেদনশীল ক্ষেত্রে LLM গ্রহণের অন্যতম প্রধান বাধা হিসেবে রয়ে গেছে। মডেলের অভ্যন্তরীণ সংকেতগুলোতে উঁকি দেওয়ার এবং তার «সন্দেহ» আগে থেকেই দেখার ক্ষমতা — স্বচ্ছ জেনারেশনের দিকে আরেকটি ব্যবহারিক পদক্ষেপ। লুকানো সূচকগুলো সমস্যা থেকে সম্পূর্ণরূপে মুক্তি দেয় না, তবে একটি কার্যকরী হাতিয়ার দেয় যা ইতিমধ্যেই উপলব্ধ।
আলাদাভাবে আকর্ষণীয় যে, হ্যালুসিনেশন নির্ণয়ের জন্ম আর্কিটেকচারের নিজস্ব বৈশিষ্ট্য থেকে হয়েছে। MoE-মডেলগুলো গতি এবং দক্ষতার জন্য তৈরি করা হয়েছিল, এবং তাদের অভ্যন্তরীণ কাঠামো হঠাৎ করে মান নিয়ন্ত্রণের জন্য উপকারী প্রমাণিত হয়েছে। আরও গবেষণা নিশ্চিতভাবে আরও গভীরে যাবে — বিশেষজ্ঞদের ভেতরে এবং রাউটিং মেকানিজমের আরও সূক্ষ্ম সংকেতের দিকে।



