মডেলদের «জানি না» বলতে শেখানো: LLM-এর জ্ঞানস্তর বিবেচনায় নেওয়া ফাইন-টিউনিং পদ্ধতি

13 সেপ্টেম্বর 2026০ প্রদর্শন

লেখকরা একটি পদ্ধতি প্রস্তাব করেন যা ফাইন-টিউনিংয়ের সময় প্রতিটি উদাহরণে মডেলের জ্ঞানের গভীরতা মূল্যায়ন করে এবং সেই মূল্যায়নের সাথে প্রশিক্ষণ সংকেতকে সামঞ্জস্য করে। ফলস্বরূপ, মডেলটি তথ্যের অভাব সম্পর্কে আরও সহজে এবং নির্ভুলভাবে জানায়, যেখানে এটি দক্ষ সেখানে প্রশ্নগুলিতে নির্ভুলতা প্রায় হারায় না।

মডেলদের «জানি না» বলতে শেখানো: LLM-এর জ্ঞানস্তর বিবেচনায় নেওয়া ফাইন-টিউনিং পদ্ধতি

কেন মডেলগুলো আত্মবিশ্বাসের সাথে মিথ্যা বলে

আধুনিক বড় ভাষার মডেলগুলো বিভিন্ন প্রশ্নের উত্তর দেওয়ার দক্ষতায় впечатляет। কিন্তু এই আত্মবিশ্বাসের আড়ালে প্রায়ই একটি গুরুতর ত্রুটি লুকিয়ে থাকে: মডেলটি উদ্ভাবিত তথ্যের ভিত্তিতে একটি সুন্দর এবং সুসংগত উত্তর দিতে পারে। এর একটি প্রধান কারণ — তথাকথিত জ্ঞানের অসামঞ্জস্য: প্রাক-প্রশিক্ষণ পর্যায়ে মডেলটি বিশাল ডেটা সংগ্রহ করে, এবং নির্দিষ্ট কাজের জন্য পরবর্তী প্রশিক্ষণের সময় এটিকে নতুন নির্দেশনা দিয়ে "প্রোথিত" করা হয়। ফলস্বরূপ, মডেলটি সবসময় বুঝতে পারে না যে এটি সত্যিই যা জানে তা কোথায় শেষ হয় এবং অজ্ঞতার ক্ষেত্র কোথায় শুরু হয়।

Joosung Lee এবং সহকর্মীদের দলের গবেষকরা একটি পদ্ধতি প্রস্তাব করেছেন যা মডেলগুলিকে সততার সাথে "আমি জানি না" বলতে সাহায্য করে, যখন উত্তরটি সত্যিই তাদের দক্ষতার সীমার বাইরে চলে যায়। কাজটি EMNLP 2026-এর Findings হিসেবে গৃহীত হয়েছিল এবং arXiv-এ প্রকাশিত হয়েছিল।

নির্দিষ্ট উদাহরণের স্তরে জ্ঞানের মূল্যায়ন

প্রধান চ্যালেঞ্জ — মডেলটি একটি নির্দিষ্ট প্রশ্নের উত্তর জানে কিনা তা বোঝা, সামগ্রিকভাবে "বিষয়" সম্পর্কে নয়। মডেলটি একটি ক্ষেত্রে চমৎকারভাবে পারদর্শী হতে পারে এবং পাশের ক্ষেত্রে সম্পূর্ণ অজ্ঞ থাকতে পারে। তাই লেখকরা প্রতিটি অনুরোধের জন্য পৃথকভাবে জ্ঞান মূল্যায়নের প্রস্তাব করেন।

এর জন্য মাল্টি-স্যাম্পলিং ইনফারেন্স ব্যবহার করা হয়: মডেলটিকে একই প্রশ্ন দিয়ে বেশ কয়েকবার জিজ্ঞাসা করা হয়, এবং তারপর বিশ্লেষণ করা হয় এর উত্তরগুলি কতটা স্থিতিশীল এবং সামঞ্জস্যপূর্ণ। যদি উত্তরগুলি উচ্চ মাত্রার আত্মবিশ্বাসের সাথে পুনরুত্পাদিত হয় এবং একে অপরের সাথে মিলে যায় — তাহলে মডেলটি সম্ভবত সত্যিই বিষয়টি "জানে"। যদি উত্তরগুলি এলোমেলোভাবে পরিবর্তিত হয় বা মডেলটি বিভিন্ন সংস্করণ দেয় — এটি একটি সংকেত যে জ্ঞান নেই।

এই পদ্ধতিটি একটি একক জেনারেশনে মডেলের সাধারণ আত্মবিশ্বাসের চেয়ে আরও নির্ভরযোগ্য এবং সূক্ষ্ম-দানাদার সূচক প্রদান করে। এটি পরবর্তী প্রশিক্ষণের ভিত্তি হয়ে ওঠে।

মডেলটি ইতিমধ্যে যা জানে তা বিবেচনায় রেখে পরবর্তী প্রশিক্ষণ

প্রাপ্ত জ্ঞানের সূচকটি বাহ্যিক মূল্যায়ন হিসাবে নয়, বরং পরবর্তী প্রশিক্ষণের জন্য একটি নিয়ন্ত্রণ সংকেত হিসাবে ব্যবহৃত হয়। ধারণাটি হল যে মডেলটিকে বিভিন্ন উদাহরণে ভিন্নভাবে শেখানো দরকার:

  • যদি মডেলটি উত্তর জানে — প্রশিক্ষণ সংকেত শক্তিশালী করা হয়, যাতে সঠিক আচরণ সুসংহত হয় এবং ইতিমধ্যে থাকা দক্ষতা না হারায়।
  • যদি মডেলটি উত্তর না জানে — সংকেতটি ভিন্নভাবে স্কেল করা হয়, এবং মডেলটিকে এলোমেলো বা আধা-বিশ্বাসযোগ্য পাঠ তৈরি করার পরিবর্তে স্পষ্টভাবে "আমি জানি না" উত্তর দিতে অতিরিক্ত উৎসাহিত করা হয়।

এই পদ্ধতিটি এমন পরিস্থিতি এড়াতে সাহায্য করে যেখানে নতুন ডেটাতে পরবর্তী প্রশিক্ষণ মডেলের জ্ঞানের সীমানা "মুছে ফেলে" এবং এটিকে সবকিছুর উত্তর দিতে বাধ্য করে, যার মধ্যে এটি বোঝে না এমন বিষয়ও অন্তর্ভুক্ত। পরিবর্তে, মডেলটি তার দক্ষতার ক্ষেত্রের বাইরে যাওয়া অনুরোধগুলি চিনতে এবং সততার সাথে তা জানাতে শেখে।

মডেলটি আরও সৎ হয়েছে কিনা তা কীভাবে পরিমাপ করা যায়

শুধু হ্যালুসিনেশনের সংখ্যা কমানো যথেষ্ট নয় — এটি গুরুত্বপূর্ণ যে মডেলটি আসলে জানে এমন প্রশ্নের উত্তর দিতে ব্যাপকভাবে অস্বীকার করা শুরু না করে। তাই গবেষকরা অনিশ্চয়তা মূল্যায়নের জন্য বিশেষ মেট্রিক্স প্রস্তাব করেছেন। তারা শুধুমাত্র "জ্ঞানভান্ডারের" প্রশ্নে নির্ভুলতা মূল্যায়ন করে না, বরং মডেলের পরিচিত উদাহরণগুলিকে অজানা থেকে আলাদা করার ক্ষমতাও মূল্যায়ন করে।

পরীক্ষার মূল ফলাফল: প্রস্তাবিত পদ্ধতিটি মডেলটিকে স্পষ্টভাবে অনিশ্চয়তা প্রকাশ করতে দেয়, যখন জ্ঞানের অভাব থাকে, এবং একই সাথে নির্ভুলতা না হারাতে দেয় যে প্রশ্নগুলির উত্তর এটি দিতে পারে। পরিচিত এবং অজানার সঠিক পার্থক্য স্থিরভাবে চূড়ান্ত কর্মক্ষমতা উন্নত করে — অর্থাৎ মডেলটি আরও সতর্ক এবং নির্ভরযোগ্য হয়ে ওঠে।

উপসংহার

"আমি জানি না" বলার ক্ষমতা — এটি দুর্বলতা নয়, বরং LLM-এর নিরাপদ প্রয়োগের একটি প্রয়োজনীয় অংশ। নলেজ-ওয়েটেড ফাইন-টিউনিং পদ্ধতিটি মনে করিয়ে দেয়: হ্যালুসিনেশনের বিরুদ্ধে লড়াই করার জন্য আরও বেশি তথ্য "মুখস্থ" করার প্রয়োজন নেই। মডেলটিকে তার নিজস্ব সীমানা সততার সাথে মূল্যায়ন করতে এবং সেগুলি অতিক্রম না করতে শেখানোই যথেষ্ট। এই ধরনের পদ্ধতি মডেলগুলিকে বাস্তব পরিস্থিতিতে আরও কার্যকর করে তোলে, যেখানে আত্মবিশ্বাসী ভুল তথ্যের চেয়ে সৎ প্রত্যাখ্যান পাওয়া ভাল।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
মডেলদের «জানি না» বলতে শেখানো: LLM-এর জ্ঞানস্তর বিবেচনায় নেওয়া ফাইন-টিউনিং পদ্ধতি