المشكلة: يُختبر النموذج حيث لم تعد الحاجة إلى البحث قائمة
الشريحة النسيجية هي صورة بجيجابكسل. لتشخيص المرض، يلقي أخصائي علم الأمراض أولاً نظرة على العينة بتكبير منخفض، ويلتقط المناطق المشبوهة، ثم يفحصها عن قرب، ويقارن الصورة على مقاييس مختلفة، وبعد ذلك فقط يصوغ الاستنتاج. جزء كبير من هذا العمل لا يذهب إلى التدقيق، بل إلى البحث: أين يستحق النظر أصلاً.
معظم المعايير الحالية لتقييم الذكاء الاصطناعي في علم الأمراض تحرم النموذج من هذا الجزء من العمل. فالمدخلات إما رقعة مقتطعة مسبقاً، أو سمات مستخرجة مسبقاً من الشريحة — أي أن شخصاً آخر قرر مسبقاً ما هو المهم هنا. يتلقى النموذج أدلة جاهزة ويُظهر قدرته على الاستدلال بها. أما مدى جودته في استخراج الأدلة بنفسه — فيبقى شبه غير مُختبر.
وهذه الفجوة بالتحديد هي ما يستهدفه عمل EviPathBench. مؤلفوه هم Dankai Liao وTianyi Zhang وYufeng Wu وXinyue Zhang وQiaochu Xue وZeyu Liu وDachun Zhao وLinghan Cai وYueming Jin؛ وقد ظهرت النسخة الأولية على arXiv في 21 يوليو 2026، ووصلت بحلول 25 أغسطس إلى النسخة الرابعة (arXiv:2607.19261، cs.CV / cs.AI). هذا المعدل من التعديلات في حد ذاته يلمّح إلى أن المؤلفين يعتبرون الموضوع حياً وقابلاً للنقاش.

كيف صُمم المعيار
لم يُبنَ EviPathBench كمجموعة أسئلة منفصلة متعددة الخيارات، بل كشجرة تشخيصية. المناطق المتداخلة على تكبيرات مختلفة مرتبطة بموجودات خاصة بمقياس معين، وفي النهاية — بتشخيص على مستوى الاستنتاج المرضي. والمطلوب من النموذج ليس مجرد إصدار تصنيف «سرطان»، بل اجتياز سلسلة: العثور على المنطقة، ووصف الموجود عند هذا التكبير، والصعود إلى مستوى أعلى، والتوفيق بين البيانات عبر المقاييس، وتجميعها في استنتاج عام.
أربع قدرات قابلة للاختبار
فكّك المؤلفون مهارة التعامل مع الشريحة إلى مكونات، ويقيّمون كل واحدة على حدة:
- مطابقة الصورة بالنص — تفسير الدليل، حين يربط النموذج ما يراه بالوصف.
- الاستعلام النصي عن الصورة (retrieval) — التحقق: بناءً على صياغة معينة يجب إيجاد المقطع المقابل في الشريحة.
- تحديد موقع المنطقة التشخيصية — وهو جمع الأدلة نفسه: أين بالتحديد يجب البحث.
- الاستدلال متعدد المستويات — دمج الموجودات المستخلصة من تكبيرات مختلفة في صورة واحدة.
هذا التقسيم قيّم في حد ذاته: فهو يُظهر أن «فهم الشريحة» ليس قدرة واحدة، بل عدة قدرات، وقد تتباين فيما بينها تبايناً شديداً.
البيانات والوسم
تكوّن الأساس من 1,822 شريحة نسيجية كاملة (WSI) من TCGA و17,135 مساراً تشخيصياً موسوماً من قبل عشرة أخصائيين معتمدين في علم الأمراض. ويُستخدم بشكل منفصل مجموعة خاصة من 190 شريحة لسرطان الثدي مع تعليقات توضيحية مفصلة — وهي ضرورية لاختبار الاستكشاف الذاتي للعينة الكاملة تحديداً، دون تلميحات حول موقع المنطقة محل الاهتمام.

النتائج: الاستدلال ينجح، والبحث لا
شارك في التقييم 19 نموذجاً «بصرياً-لغوياً» — عامة وطبية ومتخصصة في علم الأمراض — بالإضافة إلى نموذج نصي مرجعي واحد، ضروري كنقطة انطلاق.
جاءت الصورة متباينة. أفضل النماذج المفتوحة تتجاوز 93% في الدقة في الاستدلال متعدد المستويات، وأكثر من 50% في كلتا مهمتي المطابقة عبر الأنماط. قد يبدو أن كل شيء على ما يرام.
أما تحديد موقع المنطقة التشخيصية — فمصيبة. أفضل نتيجة في text-guided mean IoU لا تصل حتى إلى 0.09. وهذا أسوأ من قاعدة استدلالية بسيطة تضع مستطيلاً في مركز الشريحة دون أي تحليل على الإطلاق. وبعبارة أخرى، النموذج المدرَّب على النظر إلى النسيج يبحث بشكل أسوأ من برنامج لا ينظر إلى أي مكان.
المقياس يُفسد البحث
هناك خط تجريبي منفصل — الاستكشاف الذاتي للشريحة. هنا ينهار معدل الإصابة المطلق مع تزايد التكبير: 0.522 عند التكبير المنخفض، و0.185 عند المتوسط، و0.020 عند العالي. ومنطق هذا الانخفاض واضح: عند التكبير المنخفض يرى النموذج البنية العامة للنسيج ويقع بسهولة «في مكان ما ضمن المنطقة الصحيحة»، لكن كلما زاد التقريب ضاق مجال الرؤية وصار كل خطأ في الخطوة السابقة أكثر تكلفة. تتراكم الأخطاء، وعند التكبير الأقصى يكاد يكون النموذج مضموناً للنظر في المكان الخطأ.
ما الذي يترتب على ذلك
يُصاغ الاستنتاج الرئيسي للعمل ببساطة: بين القدرة على الاستدلال بناءً على أدلة مُعدّة مسبقاً والقدرة على استخراج هذه الأدلة تكمن فجوة عميقة. الأولى تتحقق لدى النماذج الحديثة بشكل جيد بالفعل، والثانية — تكاد لا تتحقق.
عملياً، هذا يعني أن التنقل في الشريحة لا يمكن بعد تركُه للنموذج «ليتدبر أمره» وانتظار نتيجة ذات معنى سريري. لكن المعيار نفسه يوفّر إطاراً عاماً: يمكن من خلاله قياس كلتا القدرتين ومراقبة ما إذا كان تحسين معين — التعلم المعزز، أو الذاكرة بين خطوات التقريب، أو البحث الهرمي — يساعد على التقدم في الجزء الذي يفشل.
يجدر أيضاً إبقاء التحفظات في الاعتبار. المجموعة الخاصة محدودة بسرطان الثدي، والجزء الأكبر من البيانات هو مواد TCGA بأثر رجعي، أي أن التباين السريري الواقعي غير ممثَّل فيها بالكامل. ومقاييس تحديد الموقع حساسة لطريقة وسم حدود المناطق بالتحديد، كما أن أربع نسخ من المسودة الأولية خلال شهر واحد تدل على أن الأرقام قد لا تزال بحاجة إلى تدقيق.




