قصير وإلى نقطة
هل يمكن لنموذج اللغة الحديث أن يحل محل مستعرض حي في مؤتمر للتعلم الآلي؟ وقد قام الباحثون باختبار هذا على المواد الحقيقية للرابطة - وهي واحدة من أكثر الأماكن شيوعا في الميدان. In a paper published on arXiv (number 2608.03659), Abraham Camelo-Guerrero and Jairo Diaz-Rodriguez compared how three well-known models handle the evaluation of scientific submissions against human decisions.
النتيجة مزدوجة: تقوم الخوارزميات بعمل لائق لفصل أوراق "مقبولة" من أوراق مرفوضة، لكنها تفتقد تماماً التمييزات الدقيقة، مثل الفرق بين العرض الشفوي والملصق. وفي الوقت نفسه، يُظهر كل نموذج توقيعه الخاص: إذ يعطي المرء درجات سخية، والآخر صارم للغاية مع أوراق قوية. ويركز خبراء استعراض الآلات أيضاً على نقاط ضعف مختلفة تماماً عن تركيز الخبراء البشريين.
وباختصار، فإن استخدام تدابير الإدارة المستدامة للأراضي كمرشح تقريبي ممكن، ولكن الثقة الكاملة بها بالقرار النهائي أمر سابق لأوانه الآن. وفيما يلي، نكسر تفاصيل التجربة ونتائجها.

كيف تجري التجربة
البيانات والظروف
وقدم صاحبا البلاغ 300 رسالة إلى المركز الدولي للبحيرات الحرة لعام 2026، وتوازنا العينة بين ثلاث فئات هي: العروض الشفوية والملصقات والورقات المرفوضة - أي مائة منها. ويضمن هذا النهج أن النماذج ليست مجرد تخمين ولكنها مجبرة بالفعل على التمييز بين الفصول الثلاثة جميعها.
كل نموذج GPT-5.4" Gemini 3.1 Pro Preview, and Claude Opus 4.6 - received the same set of instructions and rating scale. An important detail: information about the human decision was removed from the submission texts in advance. هذا ضروري لمنع تسرب الجواب ولإختبار قدرة النموذج على إصدار حكم مستقل
منهجية المقارنة
نظر الباحثون إلى النتائج من ثلاث زوايا أولاً، فحصوا مدى تطابق توقعات النماذج بدقة بين القرارات النهائية - سواء بالمعنى الواسع (مقبولة أم لا) وبالتفصيل (أوال ضد الملصق). وثانياً، درسوا كيف تستخدم النماذج جدول التوصية: على سبيل المثال، ما إذا كانت تضخّم النتائج. وثالثاً، يقارنون نقاط الضعف في الأوراق التي يجدها البشر والتي توجد بها الخوارزميات.

ما أظهرته النتائج
تحديد مصير التقارير
The encouraging news: all three LLMs confidencely distinguish accepted papers from rejected ones. وهذا يعني أن الاستعراضات النموذجية تحمل إشارة مفيدة حتى دون التدريب على البيانات الخاصة بالمؤتمرات. غير أن النجاح ينتهي هناك.
ولم يتمكن أي من النماذج من استنساخ التمييز بين الفم والملصقات الواضحة في الأحكام الإنسانية. وفيما يتعلق بالخوارزميات، تبدو الورقات المقبولة كمجموعة متجانسة، على الرغم من وجود ترتيب هرمي ملحوظ بين العرض الشفوي والملصق. وهذه ثغرة هامة: فمعايير الجودة الدقيقة التي تميز البحوث العالقة عن مجرد العمل الجيد لم تستوعبها الآلات بعد.
الاختلافات بين مقدمي النماذج
سلوك العارضات اتضح أنه مرتبط بشدة بالمطور جيميني 3-1 بروبريفيو) تصرفت) كمراجعة كلاسيكية "متساهلة" مثير للاهتمام GPT-5.4 و(كلود أوبوس 4.6) كانا أقرب بكثير إلى البشر عندما رفضا وورقات ملصقات وفي الوقت نفسه، أظهرت زيادة الدقة في البيانات الشفوية.
ويمكن تفسير هذا التحيز بطرق مختلفة. ربما العارضات الورقات القوية بسبب ارتفاع التوقعات من الأسهل إيجاد بقعة ضعيفة في نص جيد أو ربّما بنية الإنتباه ببساطة لا تعرف كيف تُقدّم الثناء، لأنه لا يوجد فرق كبير بين "جيد" و"مُتَفَقّد".
الاختلافات الموضوعية
الجزء الأكثر غرابة هو ما يهتم به المستعرضون الآليون وكثيرا ما تشير النماذج الثلاثة جميعها إلى عدم وجود تجارب مقارنة أساسية - انتقاد كلاسيكي للعمل العلمي. وفي الوقت نفسه، كثيرا ما يثير الخبراء البشريون مسائل تتعلق بالكفاءة الحسابية: كم من الموارد التي تتطلبها الطريقة المقترحة، ومدى طابعها العملي.
هذا ليس مجرد فرق في الأسلوب وهو يعكس اختلافا في الأولويات. ويفكر البشر في تطبيقات العالم الحقيقي، فيما يتعلق بتكلفة التدريب والنشر، بينما تقيّم النماذج النص بقدر أكبر باعتباره وثيقة رسمية. لذا إذا إستخدمتِ "إل إم" لفحص أولي لورقة يجب أن تكوني مستعدة لأن بعض التعليقات المهمة لن تصلك أبداً

الاستنتاجات
الدرس الرئيسي لهذه الدراسة: دقة النموذج على مستوى "المقبوض عليه/المقبول" لا تشير بعد إلى كفاءته في التقييم التفصيلي. ومن الواضح أن القدرة على التمييز بين الورقات الضعيفة والباقية هي مرشحة متقلبة إلى حد ما لا تحل محل الاستعراض الفكري.
The practical application suggests itself: LLMs can be used as primary Assistants that mass-filter clearly unsuitable submissions or flag obvious formal flaws. ولكن القرارات المتعلقة بمصير الورقات الصلبة ينبغي أن تظل مع البشر - إذا كان ذلك فقط لأن النطاق الإنساني للقيم (أولوية الكفاءة، تقييم الرواية، السياق الميداني) لا يزال يختلف اختلافا ملحوظا عن الآلة.
وعلى المدى الطويل، قد يكون من المنطقي معايرة نماذج لمجتمعات معينة بل وحتى لمستعرضين محددين. ولكن حتى يحدث ذلك، الاعتماد على الاستعراض الآلي في الاتصالات العلمية هو على الأقل أمر سابق لأوانه.



