SAFE: LLM के बहु-चरणीय तर्क की हर कड़ी की तुरंत जांच कैसे करें

13 सितम्बर 20260 बार देखा गया

बहु-चरणीय QA-बेंचमार्क अक्सर तार्किक रूप से गलत तर्क के माध्यम से प्राप्त सही उत्तर को मान्यता देते हैं। SAFE फ्रेमवर्क इस अंतर को भरता है: एक बाहरी LLM-सत्यापनकर्ता प्रत्येक चरण की तुलना संदर्भ पाठों और पिछले प्रक्षेपवक्र से करता है, और KG-ट्रिपलेट्स में विभाजन जांच को सरल बनाता है। लेखकों के अनुसार, तीन बेंचमार्क पर सटीकता में औसतन 8.8 प्रतिशत अंकों की वृद्धि हुई।

SAFE: LLM के बहु-चरणीय तर्क की हर कड़ी की तुरंत जांच कैसे करें

समस्या: सही उत्तर का मतलब सही तर्क नहीं है

मल्टी-स्टेप QA बेंचमार्क इस तरह से डिज़ाइन किए गए हैं कि वे केवल अंतिम उत्तर का मूल्यांकन करते हैं। इस वजह से, LLM को अक्सर स्कोर मिल जाता है, भले ही मध्यवर्ती चरण गलत हों या वास्तविक तथ्यों से पूरी तरह असंबद्ध हों। इस व्यवहार को "झूठी" शुद्धता कहा जाता है: उत्तर सही है, लेकिन विचार-प्रक्रिया सही नहीं है। व्यावहारिक अनुप्रयोगों के लिए यह खतरनाक है: मॉडल विश्वसनीय दिखता है, लेकिन नई स्थिति में वह उसी आत्मविश्वास के साथ एक अमान्य निष्कर्ष निकाल सकता है।

Seoul National University के शोधकर्ताओं Daeyong Kwon, Soyoung Yoon और Seung-won Hwang ने SAFE फ्रेमवर्क प्रस्तावित किया है, जो इस समस्या का समाधान करता है। यह कार्य EMNLP 2026 में स्वीकार किया गया है, और पेपर का नवीनतम संस्करण अगस्त 2026 का है। विचार यह है कि केवल अंतिम परिणाम की नहीं, बल्कि तर्क के हर चरण की जाँच की जाए — ठीक उनके निर्माण के दौरान।

SAFE क्या करता है

SAFE, LLM-एक-सत्यापनकर्ता सिद्धांत पर आधारित एक फ्रेमवर्क है। एक बाहरी सत्यापनकर्ता तर्क प्रक्रिया पर नज़र रखता है और प्रत्येक मध्यवर्ती चरण को दिए गए पैसेज और मॉडल द्वारा पहले निकाले गए निष्कर्षों से मिलाता है। यह दृष्टिकोण सामान्य प्रणाली से अलग है, जहाँ गुणवत्ता का आकलन जनरेशन के बाद, केवल एक अंतिम उत्तर के आधार पर होता है।

SAFE की प्रमुख विशेषता तर्क का परमाणु इकाइयों में विघटन है। ऐसी प्रत्येक इकाई एक नॉलेज ग्राफ ट्रिपलेट का प्रतिनिधित्व करती है: विषय, संबंध और वस्तु। यह चरणों को औपचारिक रूप से सत्यापन योग्य बनाता है: एक अस्पष्ट कथन के बजाय, सत्यापनकर्ता संस्थाओं के बीच एक ठोस संबंध देखता है, जिसे स्रोत से मिलान किया जा सकता है।

फ्रेमवर्क कैसे काम करता है

तैयारी: KG-बाधाओं के माध्यम से सुपरविज़न की सफाई

प्रशिक्षण चरण के दौरान, SAFE बेंचमार्क से डेटा का विश्लेषण करता है। उनमें से कई में ऐसे उदाहरण होते हैं जहाँ "सही" तर्क प्रक्षेपवक्र वास्तव में तथ्यों पर आधारित नहीं होता है। SAFE ऐसे उदाहरणों को नॉलेज ग्राफ बाधाओं के माध्यम से पास करता है और अमान्य श्रृंखलाओं को हटा देता है। परिणामस्वरूप, सत्यापनकर्ता के प्रशिक्षण के लिए केवल विश्वसनीय डेटा ही बचता है — वह डेटा जहाँ प्रत्येक चरण वास्तव में स्रोतों द्वारा पुष्ट होता है।

इन्फ्रेंस: हर चरण पर जाँच

जनरेशन के दौरान, बाहरी सत्यापनकर्ता ऑनलाइन मोड में काम करता है। जैसे ही LLM एक मध्यवर्ती निष्कर्ष निकालता है, उसकी जाँच की जाती है: क्या ट्रिपलेट पैसेज के तथ्यों से मेल खाता है, क्या यह पिछले चरणों के अनुरूप है। यदि कोई अमान्य तर्क पाया जाता है, तो मॉडल को सुधारात्मक प्रतिक्रिया मिलती है, इससे पहले कि त्रुटि श्रृंखला में आगे फैल जाए। यह गिरावट को शुरुआती चरण में ही रोकने की अनुमति देता है, न कि "पूर्वव्यापी रूप से" यह समझाने की कोशिश करता है कि अंतिम उत्तर को सही क्यों माना जाना चाहिए।

परिणाम और निष्कर्ष

तीन मल्टी-स्टेप QA बेंचमार्क पर, SAFE ने सटीकता में औसतन 8.8 प्रतिशत अंकों की वृद्धि दिखाई। यह परिणाम स्वयं मुख्य थीसिस की पुष्टि करता है: मॉडल के लिए केवल "ज़ोर से सोचना" ही नहीं, बल्कि तर्क की हर कड़ी पर नियंत्रण प्राप्त करना अधिक फायदेमंद है।

लेकिन इससे भी महत्वपूर्ण बात — मूल्यांकन प्रतिमान में बदलाव है। पोस्ट-हॉक निर्णय "क्या उत्तर सही है" के बजाय, SAFE तर्क की चरण-दर-चरण जाँच का प्रस्ताव करता है। यह दृष्टिकोण उन प्रणालियों की वास्तविक आवश्यकताओं को बेहतर ढंग से दर्शाता है जहाँ समाधान की पता-लगाने की क्षमता महत्वपूर्ण है।

निष्कर्ष

SAFE, अधिक विश्वसनीय LLM की दिशा में एक कदम है, जिन्हें उन कार्यों में उपयोग किया जा सकता है जिनमें तर्कसंगत निष्कर्षों की आवश्यकता होती है। जनरेशन प्रक्रिया के दौरान सत्यापन, नॉलेज ग्राफ पर निर्भरता और परमाणु चरण तर्क को पारदर्शी और नियंत्रणीय बनाते हैं। AI-टूल डेवलपर्स के लिए यह एक संकेत है: भविष्य "बड़े और आत्मविश्वासी" मॉडल का नहीं है, बल्कि उन प्रणालियों का है जो हर कदम पर खुद की जाँच करना जानती हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
SAFE: LLM के बहु-चरणीय तर्क की हर कड़ी की तुरंत जांच कैसे करें