SAFE: কীভাবে LLM-এর বহু-ধাপ যুক্তির প্রতিটি ধাপ চলার সময় পরীক্ষা করবেন

13 সেপ্টেম্বর 2026০ প্রদর্শন

মাল্টি-স্টেপ QA-বেঞ্চমার্কগুলো প্রায়ই যৌক্তিকভাবে ভুল যুক্তির মাধ্যমে পাওয়া সঠিক উত্তরকে স্বীকৃতি দেয়। SAFE ফ্রেমওয়ার্ক এই ফাঁকটি পূরণ করে: একটি বাহ্যিক LLM-ভেরিফায়ার প্রতিটি ধাপকে রেফারেন্স টেক্সট এবং পূর্ববর্তী ট্র্যাজেক্টোরির সাথে মিলিয়ে দেখে, আর KG-ট্রিপলেটে বিভাজন যাচাইকে সহজ করে। লেখকদের তথ্য অনুযায়ী, তিনটি বেঞ্চমার্কে নির্ভুলতা গড়ে ৮.৮ শতাংশ পয়েন্ট বেড়েছে।

SAFE: কীভাবে LLM-এর বহু-ধাপ যুক্তির প্রতিটি ধাপ চলার সময় পরীক্ষা করবেন

সমস্যা: সঠিক উত্তর মানেই সঠিক যুক্তি নয়

মাল্টি-স্টেপ QA বেঞ্চমার্কগুলো এমনভাবে ডিজাইন করা যে তারা শুধুমাত্র চূড়ান্ত উত্তর মূল্যায়ন করে। এর ফলে LLM প্রায়ই স্কোর পেয়ে যায়, এমনকি যদি মধ্যবর্তী ধাপগুলো ভুল হয় বা বাস্তব তথ্যের সাথে সম্পূর্ণ সম্পর্কহীন হয়। এই আচরণকে 'মিথ্যা' সঠিকতা বলা হয়: উত্তর সঠিক, কিন্তু চিন্তার ধারা সঠিক নয়। ব্যবহারিক প্রয়োগের জন্য এটি বিপজ্জনক: মডেলটি নির্ভরযোগ্য দেখায়, কিন্তু নতুন পরিস্থিতিতে একই আত্মবিশ্বাসের সাথে একটি অবৈধ সিদ্ধান্তে পৌঁছাতে পারে।

Seoul National University-এর গবেষক Daeyong Kwon, Soyoung Yoon এবং Seung-won Hwang SAFE ফ্রেমওয়ার্ক প্রস্তাব করেছেন, যা এই সমস্যার সমাধান করে। কাজটি EMNLP 2026-এ গৃহীত হয়েছে, এবং গবেষণাপত্রের সর্বশেষ সংস্করণটি আগস্ট ২০২৬ সালের। ধারণাটি হলো শুধু ফলাফল নয়, যুক্তির প্রতিটি ধাপ পরীক্ষা করা — সরাসরি সেগুলো তৈরি হওয়ার সময়।

SAFE কী করে

SAFE হলো LLM-হিসাবে-ভেরিফায়ার নীতির উপর ভিত্তি করে একটি ফ্রেমওয়ার্ক। একটি বাহ্যিক ভেরিফায়ার যুক্তির প্রক্রিয়া পর্যবেক্ষণ করে এবং প্রতিটি মধ্যবর্তী ধাপ প্রদত্ত প্যাসেজ এবং মডেল আগে যা অনুমান করেছে তার সাথে মিলিয়ে দেখে। এই পদ্ধতিটি প্রচলিত কাঠামো থেকে ভিন্ন, যেখানে গুণমান মূল্যায়ন শুধুমাত্র একটি চূড়ান্ত উত্তরের ভিত্তিতে, জেনারেশনের পরে ঘটে।

SAFE-এর মূল বৈশিষ্ট্য হলো যুক্তিকে পারমাণবিক এককে বিভক্ত করা। প্রতিটি এমন একক একটি নলেজ গ্রাফ ট্রিপলেট উপস্থাপন করে: বিষয়, সম্পর্ক এবং বস্তু। এটি ধাপগুলোকে আনুষ্ঠানিকভাবে যাচাইযোগ্য করে তোলে: অস্পষ্ট বিবৃতির পরিবর্তে, ভেরিফায়ার সত্তার মধ্যে একটি নির্দিষ্ট সংযোগ দেখে, যা উৎসের সাথে মিলিয়ে দেখা যায়।

ফ্রেমওয়ার্কটি কীভাবে গঠিত

প্রস্তুতি: KG-সীমাবদ্ধতার মাধ্যমে সুপারভিশন পরিষ্কার করা

প্রশিক্ষণ পর্যায়ে, SAFE বেঞ্চমার্ক থেকে ডেটা বিশ্লেষণ করে। তাদের মধ্যে অনেকগুলিতে এমন উদাহরণ থাকে যেখানে 'সঠিক' যুক্তির গতিপথ আসলে তথ্যের উপর ভিত্তি করে নয়। SAFE এই উদাহরণগুলো নলেজ গ্রাফ সীমাবদ্ধতার মাধ্যমে ফিল্টার করে এবং অবৈধ চেইনগুলো বাতিল করে। ফলস্বরূপ, ভেরিফায়ার প্রশিক্ষণের জন্য শুধুমাত্র নির্ভরযোগ্য ডেটা থাকে — যেখানে প্রতিটি ধাপ সত্যিই উৎস দ্বারা নিশ্চিত হয়।

ইনফারেন্স: প্রতিটি ধাপে যাচাইকরণ

জেনারেশনের সময়, বাহ্যিক ভেরিফায়ার অনলাইন মোডে কাজ করে। LLM একটি মধ্যবর্তী সিদ্ধান্ত নেওয়ার সাথে সাথেই এটি পরীক্ষা করা হয়: ট্রিপলেটটি প্যাসেজের তথ্যের সাথে মিলে কিনা, এটি পূর্ববর্তী ধাপগুলোর সাথে সামঞ্জস্যপূর্ণ কিনা। যদি একটি অবৈধ যুক্তি সনাক্ত করা হয়, মডেলটি সংশোধনমূলক প্রতিক্রিয়া পায়, ত্রুটিটি চেইনের মাধ্যমে আরও ছড়িয়ে পড়ার আগেই। এটি দেরিতে 'পূর্ববর্তীভাবে' ব্যাখ্যা করার চেষ্টা না করে, প্রাথমিক পর্যায়ে অবনতি বন্ধ করতে দেয় যে কেন চূড়ান্ত উত্তরটি সঠিক বলে বিবেচিত হওয়া উচিত।

ফলাফল এবং সিদ্ধান্ত

তিনটি মাল্টি-স্টেপ QA বেঞ্চমার্কে, SAFE গড়ে ৮.৮ শতাংশ পয়েন্ট নির্ভুলতা বৃদ্ধি দেখিয়েছে। এই ফলাফলটি নিজেই মূল থিসিসটি নিশ্চিত করে: মডেলগুলির জন্য শুধু 'চিন্তা করে বলা' নয়, বরং যুক্তির প্রতিটি লিংকের উপর নিয়ন্ত্রণ পাওয়া বেশি উপকারী।

কিন্তু আরও গুরুত্বপূর্ণ হলো অন্য কিছু — মূল্যায়নের দৃষ্টান্তের পরিবর্তন। পোস্ট-হক 'উত্তরটি সঠিক কিনা' বিচারের পরিবর্তে, SAFE যুক্তির ধাপে ধাপে যাচাইয়ের প্রস্তাব দেয়। এই পদ্ধতিটি সিস্টেমগুলির বাস্তব চাহিদাগুলিকে আরও ভালভাবে প্রতিফলিত করে, যেখানে সমাধানের ট্রেসেবিলিটি গুরুত্বপূর্ণ।

সারসংক্ষেপ

SAFE হলো আরও নির্ভরযোগ্য LLM-এর দিকে একটি পদক্ষেপ, যা যুক্তিসঙ্গত সিদ্ধান্তের প্রয়োজন এমন কাজে ব্যবহার করা যেতে পারে। জেনারেশন প্রক্রিয়ার সময় যাচাইকরণ, নলেজ গ্রাফের উপর নির্ভরতা এবং পারমাণবিক ধাপ যুক্তিকে স্বচ্ছ এবং নিয়ন্ত্রণযোগ্য করে তোলে। AI-টুল ডেভেলপারদের জন্য এটি একটি সংকেত: ভবিষ্যৎ 'বড় এবং আত্মবিশ্বাসী' মডেলগুলির নয়, বরং এমন সিস্টেমগুলির যারা প্রতিটি ধাপে নিজেদের যাচাই করতে জানে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
SAFE: কীভাবে LLM-এর বহু-ধাপ যুক্তির প্রতিটি ধাপ চলার সময় পরীক্ষা করবেন