अपूर्ण डेटा के साथ LLM योजना के लिए बाहरी बायज़ियन लूप

28 सितम्बर 202613 बार देखा गया

इस लेख में एक ऐसी संरचना का अध्ययन किया गया है जिसमें एक अलग मॉड्यूल वातावरण की छिपी हुई अवस्थाओं की संभावनाओं का अनुमान लगाता है और पिछली घटनाओं का पूरा क्रम देने के बजाय उन्हें भाषा मॉडल को भेजता है। लेखक POMDP सिद्धांत से इसके संबंध को स्पष्ट करते हैं और छह अन्य विकल्पों की तुलना में दो परीक्षण कार्यों में अधिक सटीक मान्यताओं और बेहतर परिणामों की रिपोर्ट करते हैं।

अपूर्ण डेटा के साथ LLM योजना के लिए बाहरी बायज़ियन लूप

अपूर्ण अवलोकनों में LLM क्यों गलतियाँ करते हैं

लेखक आंशिक रूप से अवलोकनीय परिवेशों में LLM एजेंटों की गलतियों को छिपी हुई अवस्था के बारे में विश्वासों के स्पष्ट वितरण की कमी से जोड़ते हैं। आमतौर पर एजेंट ऐसी नीति के अनुसार काम करता है जो कार्रवाइयों और अवलोकनों के इतिहास पर निर्भर होती है।

लेख में तीन विशिष्ट गलतियों का वर्णन किया गया है:

  • अस्पष्ट प्रतिक्रिया मिलने पर समय से पहले निर्णय लेना;
  • सूचनाप्रद अवलोकन के बाद गलत परिकल्पना की ओर झुकाव;
  • इतिहास बढ़ने के साथ नीति में विचलन।

समस्या केवल किसी एक अनुरोध के उत्तर की गुणवत्ता तक सीमित नहीं है। एजेंट के पास इस बात का स्पष्ट निरूपण नहीं होता कि छिपी हुई अवस्था के बारे में वह किन संभावनाओं को मानता है।

बाहरी बेयसियन लूप कैसे काम करता है

Belief-State Engine (BSE), LLM के बाहर स्थित एक निष्कर्षण मॉड्यूल है। यह POMDP—आंशिक रूप से अवलोकनीय मार्कोव निर्णय प्रक्रिया—के दिए गए मॉडल में छिपी अवस्थाओं पर बेयसियन पश्च वितरण बनाए रखता है।

हर चरण में यह लूप इस तरह काम करता है:

  1. BSE छिपी हुई अवस्था के बारे में विश्वासों के वितरण को अपडेट करता है।
  2. LLM को केवल यही वितरण मिलता है।
  3. कार्रवाइयों और अवलोकनों का मूल लॉग LLM के लिए उपलब्ध नहीं होता।

यह तरीका अनिश्चितता के हिसाब-किताब को भाषा मॉडल से अलग करता है। इस आर्किटेक्चर की मुख्य शर्त यह है कि LLM को मूल इतिहास नहीं मिलता।

आर्किटेक्चर पर निर्भर गारंटियाँ

लेखक विश्वासों के अनुरूप आंतरिक अवस्था के लिए चार अभिगृहीतों वाला एक न्यूनतम विनिर्देश प्रस्तुत करते हैं। यहाँ अभिगृहीतों की विषयवस्तु नहीं बताई गई है।

लेखक सिद्ध करते हैं कि LLM और BSE का संयोजन, मूल POMDP से प्रेरित belief MDP पर एक सही मार्कोव नीति बनाता है। यदि LLM को मूल इतिहास तक कभी पहुँच नहीं मिलती, तो यह संयोजन शास्त्रीय POMDP सिद्धांत की बेलमैन इष्टतमता गारंटियों को बनाए रखता है।

व्यावहारिक कसौटी: ये गारंटियाँ वर्णित संयोजन पर लागू होती हैं और इतिहास तक पहुँच पर लगी पाबंदी पर निर्भर करती हैं। इन्हें आर्किटेक्चर की शर्तों से अलग नहीं किया जा सकता।

मूल्यांकन से क्या पता चला

आर्किटेक्चर को Tiger POMDP और red-team attack-graph कार्य पर परखा गया। तुलना में छह आधारभूत विधियाँ शामिल थीं।

आधारभूत विधिदोनों क्षेत्रों में BSE का परिणाम
Reactive LLMअधिक task return, विश्वासों का बेहतर कैलिब्रेशन और निर्णयों में अधिक संगति
Chain-of-Thoughtअधिक task return, विश्वासों का बेहतर कैलिब्रेशन और निर्णयों में अधिक संगति
ReActअधिक task return, विश्वासों का बेहतर कैलिब्रेशन और निर्णयों में अधिक संगति
Natural-language belief trackerअधिक task return, विश्वासों का बेहतर कैलिब्रेशन और निर्णयों में अधिक संगति
QMDPअधिक task return, विश्वासों का बेहतर कैलिब्रेशन और निर्णयों में अधिक संगति
POMCPअधिक task return, विश्वासों का बेहतर कैलिब्रेशन और निर्णयों में अधिक संगति

सारांश में यह भी दावा किया गया है कि प्रभाव किसी एक मॉडल तक सीमित नहीं है। दस लक्षित एब्लेशन का उद्देश्य अलग-अलग आर्किटेक्चरल निर्णयों के योगदान को स्पष्ट करना है।

इस दृष्टिकोण पर कब विचार करना उचित है

BSE, दी गई POMDP की छिपी अवस्थाओं पर वितरण को बनाए रखता है। इसलिए इस मॉडल के अंतर्गत कार्य का विवरण देना, इस दृष्टिकोण की उपयुक्तता का एक प्रमुख मानदंड है।

लेख का मूल्यांकन बताए गए दो क्षेत्रों तक सीमित है। यह अपूर्ण डेटा वाले हर प्रकार के कार्य पर परिणामों की प्रयोज्यता की पुष्टि नहीं करता।

सत्यापन के लिए क्या उपलब्ध है

प्रीप्रिंट Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability के साथ कोड, परिवेशों के विनिर्देश, प्रॉम्प्ट टेम्पलेट और seed लॉग दिए गए हैं।

Arnab Chattopadhayay और Debdipta Halder का लेख 9 सितंबर 2026 को arXiv पर जमा किया गया था। व्यावहारिक निष्कर्ष का आकलन वर्णित परिवेशों, तुलनाओं और LLM की इतिहास तक पहुँच की शर्तों को ध्यान में रखकर किया जाना चाहिए।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
अपूर्ण डेटा के साथ LLM योजना के लिए बाहरी बायज़ियन लूप