शॉर्ट और पॉइंट
क्या एक आधुनिक भाषा मॉडल मशीन लर्निंग कॉन्फ्रेंस में लाइव समीक्षक की जगह ले सकता है? शोधकर्ताओं ने इसे वास्तविक आईसीएलआर सामग्री पर परीक्षण किया - क्षेत्र में सबसे प्रतिष्ठित स्थानों में से एक। आर्Xiv (number 2608.03659) पर प्रकाशित एक कागज में, अब्राहम कैमलो-Guerrero और Jairo Diaz-Rodriguez की तुलना में कैसे तीन प्रसिद्ध मॉडल मानव निर्णयों के खिलाफ वैज्ञानिक प्रस्तुतियों के मूल्यांकन को संभालते हैं।
निष्कर्ष दो गुना है: एल्गोरिदम अस्वीकार किए गए लोगों से "स्वच्छ" कागजों को अलग करने का एक सभ्य काम करते हैं, लेकिन वे पूरी तरह से बेहतर भेद याद करते हैं, जैसे कि मौखिक प्रस्तुति और पोस्टर के बीच का अंतर। उसी समय, प्रत्येक मॉडल अपने हस्ताक्षर को दर्शाता है: एक उदार स्कोर देता है, दूसरा मजबूत कागज के साथ अत्यधिक सख्त होता है। मशीन समीक्षक भी मानव विशेषज्ञों की तुलना में पूरी तरह से अलग-अलग कमजोरियों पर ध्यान केंद्रित करते हैं।
संक्षेप में, एक मोटे फिल्टर के रूप में LLM का उपयोग संभव है, लेकिन पूरी तरह से उन्हें अंतिम निर्णय के साथ भरोसा करना अब समय से पहले है। नीचे, हम प्रयोग और इसके निष्कर्षों के विवरण को तोड़ते हैं।

कैसे प्रयोग किया जाता है
डेटा और शर्तों
लेखकों ने आईसीएलआर 2026 को 300 प्रस्तुतियां ली और नमूना को तीन श्रेणियों में संतुलित किया: मौखिक प्रस्तुतीकरण, पोस्टर, और खारिज कागज़ - प्रत्येक में से एक सौ। यह दृष्टिकोण यह गारंटी देता है कि मॉडल केवल अनुमान नहीं हैं लेकिन वास्तव में सभी तीन वर्गों को अलग करने के लिए मजबूर हैं।
प्रत्येक मॉडल — GPT-5.4, मिथुन 3.1 प्रो पूर्वावलोकन, और क्लाउड ओपस 4.6 - निर्देश और रेटिंग पैमाने का एक ही सेट प्राप्त किया। एक महत्वपूर्ण विवरण: मानव निर्णय के बारे में जानकारी अग्रिम में प्रस्तुत करने वाले ग्रंथों से हटा दी गई थी। उत्तर रिसाव को रोकने और ईमानदारी से एक स्वतंत्र निर्णय बनाने की मॉडल की क्षमता का परीक्षण करने के लिए यह आवश्यक है।
तुलना पद्धति
शोधकर्ताओं ने तीन कोणों से परिणाम देखा। सबसे पहले, उन्होंने जांच की कि कैसे सही ढंग से मॉडल की भविष्यवाणियां अंतिम निर्णयों से मेल खाती हैं - दोनों एक व्यापक अर्थ में (सित या नहीं) और विस्तार से (मौखिक बनाम पोस्टर)। दूसरा, उन्होंने अध्ययन किया कि कैसे मॉडल सिफारिश पैमाने का उपयोग करते हैं: उदाहरण के लिए, क्या वे स्कोर को बढ़ाते हैं। तीसरा, उनकी तुलना में जो कागजात में कमजोरियों को मनुष्यों और एल्गोरिदम द्वारा पाया जाता है।

क्या परिणाम दिखा
प्रस्तुतियों की वसा को अलग करना
समाचार को प्रोत्साहित करना: सभी तीन एलएलएम आत्मविश्वास से स्वीकार किए गए कागजों को अस्वीकार करने से अलग करते हैं। इसका मतलब यह है कि मॉडल समीक्षा सम्मेलन-विशिष्ट डेटा पर प्रशिक्षण के बिना भी एक उपयोगी संकेत लेती है। हालांकि, सफलता वहाँ समाप्त होती है।
किसी भी मॉडल ने मौखिक और पोस्टर के बीच अंतर को पुन: उत्पन्न करने में कामयाब नहीं किया जो मानव निर्णयों में स्पष्ट था। एल्गोरिथ्म के लिए, स्वीकृत पत्र एक समरूप समूह की तरह देखा गया, भले ही मौखिक प्रस्तुति और पोस्टर के बीच एक उल्लेखनीय पदानुक्रम हो। यह एक महत्वपूर्ण अंतर है: ठीक-ग्रेन गुणवत्ता मानदंड जो केवल अच्छे काम से उत्कृष्ट अनुसंधान को अलग करते हैं, अभी तक मशीनों द्वारा कब्जा नहीं किया जाता है।
मॉडल प्रदाताओं में अंतर
मॉडल का व्यवहार डेवलपर से भारी जुड़ा हुआ है। मिथुन 3.1 प्रो पूर्वावलोकन ने एक क्लासिक "लिएंट" समीक्षक की तरह अभिनय किया: इसके स्कोर औसत से लगातार ऊपर थे। दिलचस्प, GPT-5.4 और क्लाउड ओपस 4.6 मनुष्यों के बहुत करीब थे जब यह अस्वीकार कर दिया गया और पोस्टर पेपर आया, लेकिन एक ही समय में मौखिक प्रस्तुतियों की ओर सख्ती को दिखाया गया।
इस पूर्वाग्रह की व्याख्या विभिन्न तरीकों से की जा सकती है। शायद मॉडल "nitpick" मजबूत कागजात उच्च उम्मीद के कारण: स्पष्ट रूप से कमजोर एक की तुलना में एक अच्छा पाठ में एक कमजोर स्थान ढूंढना आसान है। या शायद ध्यान वास्तुकला केवल यह नहीं जानता कि प्रशंसा कैसे करें: इसके लिए, "अच्छा" और "उत्कृष्ट" के बीच कोई बड़ा अंतर नहीं है।
सामयिक विचलन
सबसे उत्सुक हिस्सा यह है कि मशीन समीक्षाकर्ता किस पर ध्यान देते हैं। सभी तीन मॉडल अक्सर बुनियादी तुलनात्मक प्रयोगों की कमी की ओर इशारा करते हैं - वैज्ञानिक कार्य की एक क्लासिक आलोचना। मानव विशेषज्ञों, इस बीच, अक्सर कम्प्यूटेशनल दक्षता के प्रश्न उठे: प्रस्तावित विधि को कितने संसाधन की आवश्यकता होती है, यह कितना व्यावहारिक है।
यह सिर्फ शैली में अंतर नहीं है। यह प्राथमिकताओं में अंतर को दर्शाता है। मानव वास्तविक दुनिया के आवेदन के बारे में सोचते हैं, प्रशिक्षण और तैनाती की लागत के बारे में, जबकि मॉडल एक औपचारिक दस्तावेज़ के रूप में पाठ का मूल्यांकन करते हैं। यदि आप एक पेपर की प्रारंभिक जांच के लिए LLM का उपयोग करते हैं, तो आपको तैयार किया जाना चाहिए कि कुछ महत्वपूर्ण टिप्पणियां आपको कभी नहीं पहुंचेगी।

निष्कर्ष
इस अध्ययन का मुख्य पाठ: एक मॉडल की सटीकता "स्वर्ण / अस्वीकार" स्तर पर अभी तक विस्तृत मूल्यांकन में अपनी योग्यता को इंगित नहीं करती है। स्पष्ट रूप से कमजोर कागजात को आराम से अलग करने की क्षमता एक काफी मोटे फिल्टर है जो विचारशील समीक्षा को प्रतिस्थापित नहीं करता है।
व्यावहारिक अनुप्रयोग खुद को बताता है: LLM को प्राथमिक सहायकों के रूप में इस्तेमाल किया जा सकता है जो बड़े पैमाने पर फिल्टर स्पष्ट रूप से अनुपयुक्त प्रस्तुतियों या स्पष्ट औपचारिक खामियों को ध्वजांकित करते हैं। लेकिन ठोस कागजात के भाग्य के बारे में निर्णय मनुष्यों के साथ रहना चाहिए - अगर केवल मानों का मानव पैमाने (कुशलता की प्राथमिकता, नवीनता का आकलन, फील्ड संदर्भ) अभी भी मशीन की दृष्टि से अलग है।
लंबे समय में, यह विशिष्ट समुदायों के लिए और यहां तक कि विशिष्ट समीक्षकों के लिए मॉडल को कैलिब्रेट करने के लिए समझ सकता है। लेकिन तब तक, वैज्ञानिक संचार में स्वचालित समीक्षा पर भरोसा कम से कम समय से पहले है।



