تقييم تفسيرات XAI باستخدام LLM: اختبار مدى توافقها مع تقييمات البشر

27 سبتمبر 202641 الآراء

تقدّم المقالة XAI-Arena، وهو نظام يقارن تفسيرات الذكاء الاصطناعي وفقًا لعدة معايير، مع مراعاة نماذج واهتمامات المستخدمين المختلفة. وتتوافق تقييمات نماذج اللغة الكبيرة بدرجة ملحوظة مع الأحكام البشرية (معامل ارتباط سبيرمان ρ = 0,693)، ما يشير إلى إمكانية توسيع نطاق التحليل المقارن للتفسيرات.

تقييم تفسيرات XAI باستخدام LLM: اختبار مدى توافقها مع تقييمات البشر

ما المهمة التي يعالجها البحث

يتحقق المؤلفون مما إذا كان بإمكان النماذج اللغوية الكبيرة أن تصبح وسيلة قابلة لإعادة الإنتاج والتوسّع لتقييم تفسيرات XAI تقييماً مقارناً.

نُشرت المقالة «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» على arXiv تحت الرقم arXiv:2609.09428. وقد قُدّمت في 8 سبتمبر 2026.

المؤلفون هم Yanfei Hu Fleischhauer وAlona Zharova وNadja Klein وStefan Feuerriegel. وقدّموا XAI-Arena، وهو نهج بصيغة LLM-as-a-judge لتقييم التفسيرات على أبعاد متعددة.

تتمثل المهمة الأساسية للنهج في مقارنة جودة التفسيرات مع مراعاة اهتمامات مختلف أصحاب المصلحة. والهدف العملي هو تقييم أكثر من خاصية واحدة للتفسير، والنظر بدلاً من ذلك في أبعاد متعددة للجودة.

ما المعايير التي يأخذها التقييم في الحسبان

يشمل التقييم ثمانية أبعاد:

  • البساطة المتصوَّرة — مدى بساطة التفسير كما يدركها المستخدم؛
  • الوضوح — مدى الوضوح؛
  • ملاءمة المهمة — مدى ملاءمته للمهمة؛
  • معايرة الثقة — مدى معايرة الثقة؛
  • قابلية التطبيق — مدى إمكانية الاستفادة منه في اتخاذ الإجراءات؛
  • الشفافية — مدى الشفافية؛
  • الوفاء — مدى وفائه؛
  • قابلية التفسير الإجمالية — قابلية التفسير بوجه عام.

تتيح مجموعة المعايير النظر إلى التفسير من جوانب مختلفة. وعند اختيار إطار التقييم، من المهم مراعاة الأبعاد التي تتوافق مع مهمة المقارنة.

إلى أي مدى تتوافق تقييمات LLM مع تقييمات البشر

تحقق المؤلفون من مدى توافق تقييمات LLM مع التقييمات البشرية. وأظهر التحقق ارتباطاً إيجابياً قوياً: Spearman’s rho = .693, p < .001.

تشير النتيجة إلى اتساق التقييمات، لا إلى تطابقها التام. لذلك يمكن النظر إلى LLM على أنها أساس للتقييم المقارن، لا بديلاً مطابقاً للتقييمات البشرية.

ما المقارنات التي يناسبها هذا النهج

قارن المؤلفون بين أساليب XAI عبر مجموعات بيانات مختلفة ونماذج تعلّم آلي وشخصيات لأصحاب المصلحة. ويشمل هذا التحقق عدة سياقات للتقييم، لا مجموعة واحدة ثابتة من الظروف.

ويخلص المؤلفون إلى أن التقييمات القائمة على LLM تكشف عن اختلافات منهجية في جودة تفسيرات XAI، وتوفر أساساً قابلاً للتوسّع وإعادة الإنتاج للمقارنة. والمعيار العملي للاختيار هو الحاجة إلى مقارنة التفسيرات على أبعاد متعددة مع مراعاة اختلاف أصحاب المصلحة.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
تقييم تفسيرات XAI باستخدام LLM: اختبار مدى توافقها مع تقييمات البشر