অসম্পূর্ণ তথ্যের ক্ষেত্রে LLM পরিকল্পনার জন্য বাহ্যিক বায়েসীয় চক্র

28 সেপ্টেম্বর 2026১৩ প্রদর্শন

এই নিবন্ধে এমন একটি স্থাপত্য নিয়ে গবেষণা করা হয়েছে, যেখানে একটি পৃথক মডিউল পরিবেশের গোপন অবস্থাগুলোর সম্ভাবনা নির্ণয় করে এবং অতীতের ঘটনাগুলোর সম্পূর্ণ ধারাবাহিকতার বদলে সেগুলো ভাষা মডেলকে পাঠায়। লেখকেরা POMDP তত্ত্বের সঙ্গে এর সম্পর্ক ব্যাখ্যা করেন এবং ছয়টি বিকল্পের তুলনায় দুটি পরীক্ষামূলক কাজে আরও নির্ভুল বিশ্বাস ও ভালো ফলাফলের কথা জানান।

অসম্পূর্ণ তথ্যের ক্ষেত্রে LLM পরিকল্পনার জন্য বাহ্যিক বায়েসীয় চক্র

আংশিক পর্যবেক্ষণে LLM কেন ভুল করে

আংশিক পর্যবেক্ষণযোগ্য পরিবেশে LLM এজেন্টদের ভুলের কারণ হিসেবে লেখকেরা গোপন অবস্থার বিশ্বাসের স্পষ্ট বণ্টনের অভাবকে চিহ্নিত করেছেন। সাধারণত এজেন্টটি কাজ ও পর্যবেক্ষণের ইতিহাসের ওপর নির্ভরশীল নীতি হিসেবে কাজ করে।

প্রবন্ধে তিনটি বৈশিষ্ট্যপূর্ণ ভুল বর্ণনা করা হয়েছে:

  • দ্ব্যর্থক প্রতিক্রিয়ার ক্ষেত্রে আগেভাগে সিদ্ধান্ত নেওয়া;
  • তথ্যবহুল পর্যবেক্ষণের পরে ভুল অনুমানের দিকে ঝুঁকে পড়া;
  • ইতিহাস যত বাড়ে, নীতির বিচ্যুতি।

সমস্যাটি শুধু একটি নির্দিষ্ট অনুরোধের উত্তরের মান নিয়ে নয়। এজেন্টের কাছে গোপন অবস্থার কোন কোন সম্ভাবনাকে সে বিশ্বাসযোগ্য মনে করে, তার স্পষ্ট উপস্থাপনা নেই।

বাহ্যিক বায়েজীয় লুপ যেভাবে কাজ করে

Belief-State Engine (BSE) হলো LLM-এর বাইরে থাকা একটি অনুমান মডিউল। এটি একটি নির্দিষ্ট POMDP মডেলের গোপন অবস্থাগুলোর ওপর বায়েজীয় পরবর্তী বণ্টন বজায় রাখে—POMDP হলো আংশিক পর্যবেক্ষণযোগ্য মার্কভ সিদ্ধান্ত-প্রক্রিয়া।

প্রতিটি ধাপে লুপটি এভাবে কাজ করে:

  1. BSE গোপন অবস্থার ওপর বিশ্বাসের বণ্টন হালনাগাদ করে।
  2. LLM শুধু এই বণ্টনটিই পায়।
  3. কাজ ও পর্যবেক্ষণের মূল লগ LLM-এর কাছে অনুপলভ্য থাকে।

এই পদ্ধতিতে অনিশ্চয়তা হিসাব করার কাজকে ভাষা মডেল থেকে আলাদা রাখা হয়। স্থাপত্যের মূল শর্ত হলো—LLM মূল ইতিহাসটি পায় না।

কোন নিশ্চয়তাগুলো স্থাপত্যের ওপর নির্ভরশীল

বিশ্বাস-সামঞ্জস্যপূর্ণ অভ্যন্তরীণ অবস্থার জন্য লেখকেরা চারটি স্বতঃসিদ্ধের একটি ন্যূনতম নির্দিষ্টকরণ দিয়েছেন। এখানে স্বতঃসিদ্ধগুলোর বিষয়বস্তু প্রকাশ করা হয়নি।

লেখকেরা প্রমাণ করেছেন যে LLM ও BSE-এর সমন্বয়ে মূল POMDP দ্বারা নির্ধারিত belief MDP-তে একটি সঠিক মার্কভ নীতি গঠিত হয়। LLM কখনোই মূল ইতিহাসে প্রবেশাধিকার না পেলে, এই সমন্বয়টি ধ্রুপদি POMDP তত্ত্বের বেলম্যান অপ্টিমালিটি নিশ্চয়তা উত্তরাধিকারসূত্রে পায়।

ব্যবহারিক মাপকাঠি: এই নিশ্চয়তাগুলো বর্ণিত সমন্বয়ের ক্ষেত্রে প্রযোজ্য এবং ইতিহাসে প্রবেশাধিকারের সীমাবদ্ধতার ওপর নির্ভরশীল। স্থাপত্যের শর্তগুলো থেকে এগুলোকে আলাদা করা যায় না।

মূল্যায়নে কী দেখা গেছে

Tiger POMDP এবং red-team attack-graph টাস্কে স্থাপত্যটি পরীক্ষা করা হয়েছে। তুলনায় ছয়টি বেসলাইন পদ্ধতি অন্তর্ভুক্ত ছিল।

বেসলাইন পদ্ধতিউভয় ক্ষেত্রেই BSE-এর ফলাফল
Reactive LLMবেশি task return, উন্নত বিশ্বাস-ক্যালিব্রেশন এবং সিদ্ধান্তের মধ্যে বেশি সামঞ্জস্য
Chain-of-Thoughtবেশি task return, উন্নত বিশ্বাস-ক্যালিব্রেশন এবং সিদ্ধান্তের মধ্যে বেশি সামঞ্জস্য
ReActবেশি task return, উন্নত বিশ্বাস-ক্যালিব্রেশন এবং সিদ্ধান্তের মধ্যে বেশি সামঞ্জস্য
Natural-language belief trackerবেশি task return, উন্নত বিশ্বাস-ক্যালিব্রেশন এবং সিদ্ধান্তের মধ্যে বেশি সামঞ্জস্য
QMDPবেশি task return, উন্নত বিশ্বাস-ক্যালিব্রেশন এবং সিদ্ধান্তের মধ্যে বেশি সামঞ্জস্য
POMCPবেশি task return, উন্নত বিশ্বাস-ক্যালিব্রেশন এবং সিদ্ধান্তের মধ্যে বেশি সামঞ্জস্য

সারাংশে আরও দাবি করা হয়েছে যে এই প্রভাব কোনো একটি মডেলের জন্য নির্দিষ্ট নয়। দশটি লক্ষ্যভিত্তিক অ্যাবলেশন পৃথক স্থাপত্যগত সিদ্ধান্তগুলোর অবদান শনাক্ত করার জন্য তৈরি।

কখন এই পদ্ধতি বিবেচনা করা যুক্তিযুক্ত

BSE একটি নির্দিষ্ট POMDP-এর গোপন অবস্থাগুলোর ওপর বণ্টন বজায় রাখে। তাই POMDP-এর কাঠামোয় সমস্যাটির বর্ণনা পদ্ধতিটির প্রযোজ্যতার একটি কেন্দ্রীয় মাপকাঠি।

প্রবন্ধের মূল্যায়নে উল্লিখিত দুটি ক্ষেত্র অন্তর্ভুক্ত রয়েছে। এটি অসম্পূর্ণ তথ্যযুক্ত যেকোনো সমস্যায় ফলাফল প্রয়োগ করা যাবে—এমন দাবি সমর্থন করে না।

যা যাচাই করা যাবে

প্রিপ্রিন্ট Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability-এর সঙ্গে কোড, পরিবেশের নির্দিষ্টকরণ, প্রম্পটের টেমপ্লেট এবং seed-এর লগ সংযুক্ত রয়েছে।

Arnab Chattopadhayay এবং Debdipta Halder-এর প্রবন্ধটি ৯ সেপ্টেম্বর ২০২৬ তারিখে arXiv-এ জমা দেওয়া হয়েছিল। ব্যবহারিক উপসংহারটি বর্ণিত পরিবেশ, তুলনা এবং ইতিহাসে LLM-এর প্রবেশাধিকারের শর্ত বিবেচনা করে মূল্যায়ন করা উচিত।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
অসম্পূর্ণ তথ্যের ক্ষেত্রে LLM পরিকল্পনার জন্য বাহ্যিক বায়েসীয় চক্র