لماذا تخطئ نماذج LLM عند نقص المشاهدات
يربط مؤلفو المقال أخطاء وكلاء LLM في البيئات ذات الرصد الجزئي بغياب توزيع صريح للمعتقدات حول الحالة الخفية. يعمل الوكيل عادةً وفق سياسة تستند إلى سجل الأفعال والمشاهدات.
يصف المقال ثلاثة أخطاء مميزة:
- اتخاذ قرار مبكر عند تلقي تعليقات ملتبسة؛
- الميل إلى فرضية خاطئة بعد مشاهدة غنية بالمعلومات؛
- انحراف السياسة مع ازدياد طول السجل.
لا تقتصر المشكلة على جودة الإجابة عن طلب منفرد. فالوكيل يفتقر إلى تمثيل صريح لما يعدّه حالات خفية ممكنة.
كيف تعمل الحلقة البايزية الخارجية
Belief-State Engine (BSE) هو وحدة استدلال تعمل خارج LLM. وهي تحتفظ بالتوزيع البعدي البايزي على الحالات الخفية لنموذج POMDP محدد — عملية اتخاذ قرار ماركوفية ذات رصد جزئي.
في كل خطوة، تعمل الحلقة على النحو التالي:
- يحدّث BSE توزيع المعتقدات بشأن الحالة الخفية.
- لا يتلقى LLM سوى هذا التوزيع.
- يظل السجل الأصلي للأفعال والمشاهدات غير متاح لـ LLM.

يفصل هذا النهج بين التعامل مع عدم اليقين والنموذج اللغوي. والشرط الأساسي في البنية هو ألا يتلقى LLM السجل الأصلي.
ما الضمانات التي تعتمد على البنية
يضع المؤلفون مواصفات دنيا تتألف من أربع بديهيات للحالة الداخلية المتوافقة مع المعتقدات. ولا يُكشف هنا عن مضمون البديهيات.
يثبت المؤلفون أن اقتران LLM وBSE يشكّل سياسة ماركوفية صحيحة على belief MDP المستحث من POMDP الأصلية. وبشرط ألا يحصل LLM مطلقًا على السجل الأصلي، يرث هذا الاقتران ضمانات أمثلية بيلمان من نظرية POMDP الكلاسيكية.
المعيار العملي: تنطبق هذه الضمانات على الاقتران الموصوف وتعتمد على تقييد الوصول إلى السجل. ولا يمكن فصلها عن شروط البنية.
ما الذي أظهره التقييم
اختُبرت البنية على Tiger POMDP ومهمة red-team attack-graph. وشملت المقارنة ستة أساليب أساسية.
| الأسلوب الأساسي | نتائج BSE في كلا المجالين |
|---|---|
| Reactive LLM | عائد أعلى للمهمة، ومعايرة أفضل للمعتقدات، واتساق أكبر في القرارات |
| Chain-of-Thought | عائد أعلى للمهمة، ومعايرة أفضل للمعتقدات، واتساق أكبر في القرارات |
| ReAct | عائد أعلى للمهمة، ومعايرة أفضل للمعتقدات، واتساق أكبر في القرارات |
| متتبّع معتقدات باللغة الطبيعية | عائد أعلى للمهمة، ومعايرة أفضل للمعتقدات، واتساق أكبر في القرارات |
| QMDP | عائد أعلى للمهمة، ومعايرة أفضل للمعتقدات، واتساق أكبر في القرارات |
| POMCP | عائد أعلى للمهمة، ومعايرة أفضل للمعتقدات، واتساق أكبر في القرارات |
ويذكر الملخص أيضًا أن الأثر لا يقتصر على نموذج واحد. وتهدف عشرة اختبارات استئصال موجّهة إلى عزل مساهمة القرارات المعمارية المنفردة.
متى يجدر النظر في هذا النهج
يدعم BSE توزيعًا على الحالات الخفية في POMDP محددة. لذا فإن صياغة المهمة ضمن هذا النموذج معيار أساسي لتحديد مدى ملاءمة النهج.
يشمل التقييم في المقال المجالين المذكورين. ولا يؤكد انتقال النتائج إلى جميع المهام ذات البيانات الناقصة.
ما المتاح للتحقق منه
أُرفق بالمسودة البحثية Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability كلٌّ من الشيفرة، ومواصفات البيئات، وقوالب المطالبات، وسجلات seed.
قدّم Arnab Chattopadhayay وDebdipta Halder المقال إلى arXiv في 9 سبتمبر 2026. وينبغي تقييم الاستنتاج العملي في ضوء البيئات والمقارنات الموصوفة وشروط وصول LLM إلى السجل.



