149 वास्तविक प्रयोगशालाओं से संशोधन: एक नया बेंचमार्क जाँचता है कि क्या LLM प्रोटोकॉल को फिर से लिख सकते हैं

15 सितम्बर 202614 बार देखा गया

BenchBench-Protocol मॉडलों को अमूर्त प्रश्न नहीं, बल्कि व्यवहार से पुनर्निर्मित प्रसंग प्रस्तुत करता है: एक वैज्ञानिक ने प्रकाशित पद्धति को अपने प्रयोग के अनुरूप ढाला — और मॉडल को उसकी विचार-प्रक्रिया दोहरानी होती है। परखे गए नौ सिस्टमों में सर्वश्रेष्ठ परिणाम रूब्रिक पर 59.2% रहा, जबकि शेष 34–47% की सीमा में रहे।

149 वास्तविक प्रयोगशालाओं से संशोधन: एक नया बेंचमार्क जाँचता है कि क्या LLM प्रोटोकॉल को फिर से लिख सकते हैं

प्रोटोकॉल, जिसे कोई भी शब्दशः नहीं निभाता

प्रयोगशाला प्रोटोकॉल शायद ही कभी शब्दशः निभाया जाता है। प्रकाशन और वास्तविक प्रयोग के बीच लगभग हमेशा अनुकूलन होता है: दूसरी कोशिका पंक्ति, बदला गया अभिकर्मक, कम नमूने, दूसरे का उपकरण, सीमित बजट। वेट-लेब वाले व्यक्ति के लिए यह दिनचर्या है, लेकिन दिनचर्या धोखेबाज़ है — कोई भी बदलाव अपने साथ परिणामों की श्रृंखला लेकर आता है। शुरुआती चरण में अभिकर्मक की मात्रा बदलते हैं, तो यह याद रखना पड़ता है कि धुलाई के चरण में इसका क्या असर होगा और पहले जो किया गया था उससे यह कैसे मेल खाता है। यही क्षमता — पूरे प्रोटोकॉल को एक साथ दिमाग में रखना और उसे अर्थपूर्ण ढंग से बदलना — नए कार्य-समूह द्वारा परखी जाती है।

यह शोध BenchBench-Protocol नाम से arXiv:2608.23898v1 (cs.AI) प्रीप्रिंट में आया, जो 24 अगस्त 2026 को प्रस्तुत किया गया। लेखक हैं Aditya Sivakumar, Ashu Singhal, Nicholas Larus-Stone और Nithin Parsan। यह 21 पृष्ठ और 15 चित्रों का है, यानी सामग्री विज्ञापन से अधिक पद्धतिगत है।

ड्राफ़्ट संशोधनों से 149 कार्य कैसे बनाए गए

BenchBench-Protocol की कार्यप्रणाली असामान्य है। लेखकों ने बैठकर प्रश्न लिखने शुरू नहीं किए — उन्होंने काम का पहले से मौजूद निशान उठाया। हर प्रकाशित प्रोटोकॉल का एक ऐसा संस्करण मिला जिसे वैज्ञानिक ने अपने विशिष्ट प्रयोग के अनुसार संशोधित किया था। इन दो दस्तावेज़ों के बीच का अंतर ही कार्य बन गया: मॉडल को मूल प्रोटोकॉल और नए प्रयोग की शर्तें दिखाई जाती हैं, और उसे सही संशोधन सुझाना होता है।

इस दृष्टिकोण से एक महत्वपूर्ण बात तुरंत निकलती है: कार्य का कोई अमूर्त "सही उत्तर" नहीं है, बल्कि एक भारित रूब्रिक है। क्योंकि जो संशोधन किसी जीवित शोधकर्ता ने किया, वह ज्ञात है — उसे तत्वों में बाँटा जा सकता है और मूल्यांकन किया जा सकता है कि मॉडल का सुझाव वास्तविक समाधान से अर्थ में कितना मेल खाता है, न कि शब्दावली में। यह बायोमेडिकल परीक्षणों की सदाबहार समस्या को दूर करता है, जहाँ मॉडल तर्कसंगत लेकिन मानक से भिन्न उत्तर देकर शून्य पा सकता है।

आधार ठोस निकला: वेट लैब प्रयोग की जीव विज्ञान की नौ शाखाओं से 96 मूल प्रोटोकॉल। अंतिम समूह में केवल वे कार्य शामिल हुए जो उच्च अंकों के साथ विशेषज्ञ समीक्षा से गुज़रे — बाकी हटा दिए गए। परिणाम वही 149 कार्य हैं।

यह विशेषज्ञों के प्रश्नों का एक और समूह क्यों नहीं है

लेखक अलग से संदर्भ स्पष्ट करते हैं। हाल के वर्षों में बायोमेडिकल बेंचमार्क वास्तव में रूब्रिक-आधारित मूल्यांकन वाले खुले कार्यों की ओर झुके हैं — यह प्रगति है। लेकिन कार्य स्वयं अब भी अक्सर विशेषज्ञ ही गढ़ते हैं: बैठकर अपने अनुभव के आधार पर प्रश्न लिखते हैं। इस दृष्टिकोण की सीमा यह है कि विशेषज्ञ उस प्रश्न का उत्तर देता है जो उसने स्वयं तैयार किया, यानी अप्रत्यक्ष रूप से अपनी ही कठिनाई-धारणा के अनुसार ढल जाता है।

यहाँ तर्क उल्टा है। कार्य वहाँ उत्पन्न होता है जहाँ किसी वास्तविक व्यक्ति ने पहले ही किसी वास्तविक समस्या का सामना किया और उसे हल करने में समय लगाया। यह डेटा की पूर्ण शुद्धता की गारंटी नहीं देता, लेकिन यह गारंटी देता है कि समस्या किसी सुंदर शब्दावली के लिए गढ़ी नहीं गई है।

कौन सफल हुआ, कौन नहीं

परीक्षण में नौ मॉडल शामिल थे — बंद और खुले दोनों। अंतर उल्लेखनीय निकला, हालाँकि नाटकीय नहीं।

सर्वश्रेष्ठ परिणाम Claude Opus 5 ने दिखाया — रूब्रिक पर 59.2% सामान्यीकृत अंक। बाकी मॉडल 34.1% से 47.1% के दायरे में रहे। सरल शब्दों में, कोई भी अग्रणी तक नहीं पहुँचा, लेकिन डेढ़ गुना की गिरावट भी नहीं है: सभी मॉडल कुछ न कुछ कर पाते हैं, बस वे इसे अलग-अलग तरीकों से करते हैं और हमेशा पूरी तरह नहीं।

रिपोर्ट की एक अलग पंक्ति — संतृप्ति की जाँच। लेखकों ने मॉडलों को दस-दस प्रयास दिए और उनमें से सर्वश्रेष्ठ चुना (best-of-10)। इतनी उदार योजना के बावजूद बेंचमार्क "सिकुड़ा" नहीं: ऊपरी सीमा तक नहीं पहुँचा गया। मूल्यांकन के लिए यह अच्छी खबर है — इसका मतलब है कि मॉडलों की अगली पीढ़ी आने के बाद भी कार्य-समूह पुराना नहीं पड़ेगा।

व्यवहार में इससे क्या निकलता है

पहला निष्कर्ष व्यावहारिक और थोड़ा होशियार करने वाला है। प्रोटोकॉल के अनुकूलन के लिए भाषा मॉडल पर पूरी तरह भरोसा अभी नहीं किया जा सकता। 59.2% का सर्वश्रेष्ठ परिणाम भी यह दर्शाता है कि लगभग दस में से चार मामलों में सुझाव के लिए मानवीय हस्तक्षेप आवश्यक है। मॉडल एक ड्राफ़्ट के रूप में, विकल्पों के जनरेटर के रूप में, जल्दी से यह जाँचने के तरीके के रूप में उपयोगी है कि आपने शायद क्या छोड़ दिया। लेकिन परखनली की अंतिम ज़िम्मेदारी वह नहीं उठाता।

दूसरा निष्कर्ष पद्धतिगत है, और यह पहले से अधिक रोचक है। लेखक अपने काम को न केवल वेट लैब में तर्क के मूल्यांकन के रूप में देखते हैं, बल्कि एक अधिक सामान्य विचार के प्रमाण के रूप में भी: वास्तविक प्रयोग बेंचमार्क के लिए कार्यों का एक कम आँका गया स्रोत हैं। अगर प्रयोगशाला में संशोधनों का इतिहास पहले से है, तो मॉडलों की जाँच के लिए सामग्री भी है — और वह सामग्री जिसे लिखने की मेज़ पर गढ़ना असंभव है।

तीसरा निष्कर्ष इस बारे में है कि आगे कहाँ बढ़ना है। 59.2% और 47.1% के बीच का अंतर कार्य की कठिनाई के मुकाबले कोई खाई नहीं लगता। यह बल्कि संकेत है कि अड़चन जीव विज्ञान के बारे में मॉडल के ज्ञान की मात्रा में नहीं, बल्कि श्रृंखला बनाने की क्षमता में है: पिछले निर्णयों को ध्यान में रखना और यह अनुमान लगाना कि वे अगले चरणों में कहाँ ले जाएँगे। 149 संशोधनों का यह समूह तथ्यों को याद करने को नहीं, बल्कि इसी गुण को समर्पित है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
149 वास्तविक प्रयोगशालाओं से संशोधन: एक नया बेंचमार्क जाँचता है कि क्या LLM प्रोटोकॉल को फिर से लिख सकते हैं