LLM की मदद से XAI व्याख्याओं का मूल्यांकन: मानव सहमति के आधार पर सत्यापन

27 सितम्बर 202641 बार देखा गया

इस लेख में XAI-Arena प्रस्तुत किया गया है—एक ऐसी प्रणाली जो अलग-अलग मॉडलों और उपयोगकर्ताओं के हितों को ध्यान में रखते हुए, कई मानदंडों के आधार पर AI की व्याख्याओं की तुलना करती है। LLM के मूल्यांकन मानवीय निर्णयों से काफी हद तक मेल खाते हैं (स्पीयरमैन ρ = 0,693), जो व्याख्याओं के तुलनात्मक विश्लेषण को बड़े पैमाने पर करने की संभावना दर्शाता है।

LLM की मदद से XAI व्याख्याओं का मूल्यांकन: मानव सहमति के आधार पर सत्यापन

यह शोध किस समस्या का समाधान करता है

लेखक जाँचते हैं कि क्या बड़े भाषा मॉडल XAI स्पष्टीकरणों के तुलनात्मक मूल्यांकन का एक पुनरुत्पाद्य और स्केलेबल तरीका बन सकते हैं।

«XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» लेख arXiv पर arXiv:2609.09428 के रूप में प्रकाशित हुआ। इसे 8 सितंबर 2026 को जमा किया गया था।

लेखक Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein और Stefan Feuerriegel हैं। उन्होंने XAI-Arena प्रस्तुत किया—बहुआयामी मूल्यांकन के लिए LLM-as-a-judge प्रारूप वाला एक दृष्टिकोण।

इस दृष्टिकोण का मुख्य उद्देश्य विभिन्न हितधारकों के हितों को ध्यान में रखते हुए स्पष्टीकरणों की गुणवत्ता की तुलना करना है। व्यावहारिक दिशा-निर्देश: स्पष्टीकरण की केवल एक विशेषता का नहीं, बल्कि गुणवत्ता के कई आयामों का मूल्यांकन करना।

मूल्यांकन में किन मानदंडों को ध्यान में रखा जाता है

मूल्यांकन में आठ आयाम शामिल हैं:

  • कथित सरलता;
  • स्पष्टता;
  • कार्य के लिए उपयुक्तता;
  • विश्वास का अंशांकन;
  • कार्रवाई में उपयोगिता;
  • पारदर्शिता;
  • निष्ठा;
  • समग्र व्याख्येयता।

मानदंडों का यह समूह स्पष्टीकरण को अलग-अलग दृष्टिकोणों से देखने की सुविधा देता है। मूल्यांकन योजना चुनते समय यह ध्यान रखना ज़रूरी है कि इनमें से कौन-से आयाम तुलना के कार्य के अनुकूल हैं।

LLM के मूल्यांकन मानवीय मूल्यांकनों से कितने मेल खाते हैं

लेखकों ने जाँचा कि LLM के मूल्यांकन मानवीय मूल्यांकनों से कितने मेल खाते हैं। जाँच में मज़बला धनात्मक संबंध पाया गया: Spearman’s rho = .693, p < .001।

यह नतीजा मूल्यांकनों के बीच संगति दर्शाता है, लेकिन उनके पूरी तरह समान होने का संकेत नहीं देता। इसलिए LLM को तुलनात्मक मूल्यांकन के आधार के रूप में देखा जा सकता है, न कि मानवीय मूल्यांकनों के हूबहू विकल्प के रूप में।

यह दृष्टिकोण किन तुलनाओं के लिए उपयुक्त है

लेखकों ने अलग-अलग डेटासेट, मशीन लर्निंग मॉडल और हितधारक व्यक्तित्वों पर XAI विधियों की तुलना की। इस जाँच में मूल्यांकन के कई संदर्भ शामिल हैं, न कि परिस्थितियों का केवल एक तय समूह।

लेखकों का निष्कर्ष है कि LLM-आधारित मूल्यांकन XAI स्पष्टीकरणों की गुणवत्ता में व्यवस्थित अंतर उजागर करते हैं और तुलना के लिए एक स्केलेबल, पुनरुत्पाद्य आधार प्रदान करते हैं। व्यावहारिक चयन-मानदंड यह है कि क्या विभिन्न हितधारकों को ध्यान में रखते हुए कई आयामों के आधार पर स्पष्टीकरणों की तुलना करना आवश्यक है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
LLM की मदद से XAI व्याख्याओं का मूल्यांकन: मानव सहमति के आधार पर सत्यापन