समस्या: कोड जो चलता है, पर वह करता नहीं जो चाहिए
बड़े भाषा मॉडल पर आधारित एजेंट अब पहले से ही एक शोध पत्र लेकर उसके आधार पर काम करने वाला रिपॉज़िटरी तैयार कर सकते हैं। समस्या यह है कि "काम करने वाला" और "पुनरुत्पादन करने वाला" समानार्थी नहीं हैं। कोई स्क्रिप्ट सफलतापूर्वक सभी परीक्षण पास कर सकती है, मॉडल को प्रशिक्षित कर सकती है और एक सुंदर मेट्रिक प्रिंट कर सकती है, जबकि उसके भीतर चुपचाप चरणों का क्रम बदल दिया गया हो, हानि फ़ंक्शन में कोई गुणक खो गया हो, या किसी गैर-तुच्छ चरण की जगह कोई स्टब रख दिया गया हो।
यही विफलता मोड नए शोध के लेखकों द्वारा सिमेंटिक ड्रिफ्ट (semantic drift) कहा जाता है: उत्पन्न कोड चुपचाप उससे अलग हो जाता है जो पत्र के विनिर्देश में वर्णित है। त्रुटि तुरंत नज़र नहीं आती — वह उन बारीकियों में छिपी रहती है जिन्हें कोई स्वचालित रूप से जाँचता नहीं। परिणाम — एक पुनरुत्पादन जो औपचारिक रूप से हुआ, पर वैज्ञानिक रूप से कुछ भी सिद्ध नहीं करता।

SA-Bench क्या है
ड्रिफ्ट को मापने के लिए पहले उसे देखने योग्य बनाना ज़रूरी है। यही काम SemanticAlign-Bench करता है, संक्षेप में SA-Bench — एक नैदानिक बेंचमार्क, जिसका वर्णन arXiv:2608.24252 पत्र में किया गया है (Findings of EMNLP 2026 में स्वीकृत, लेखक — Xue Hu, Zewei Pan, Zeli Su, Zhou Liu और Wentao Zhang)।
यह सामग्री ICLR, ICML और NeurIPS 2025 सम्मेलनों के 30 शोध पत्रों को समेटती है और मशीन लर्निंग के पाँच क्षेत्रों में वितरित है। मूल्यांकन कोड के "एहसास" का नहीं, बल्कि सत्यापन योग्य दावों के एक समूह का किया जाता है। बेंचमार्क में कुल 1,491 ऐसे दावे संकलित हैं।
Semantic Alignment Units: विनिर्देश के परमाणु
मुख्य पद्धतिगत विचार यह है कि पत्र के विवरण को उन सूक्ष्मतम तत्वों में तोड़ा जाए जिन्हें रिपॉज़िटरी के आधार पर मैन्युअल रूप से सत्यापित किया जा सके। इन तत्वों को Semantic Alignment Units (SAU) कहा जाता है। प्रत्येक इकाई कार्यान्वयन के बारे में एक अलग दावा है: कोई विशिष्ट हाइपरपैरामीटर, सूत्र, संक्रियाओं का क्रम, रुकने की शर्त, डेटा विभाजन की योजना।
यह सूक्ष्म दृष्टिकोण इसलिए महत्वपूर्ण है क्योंकि यह मूल्यांकन से "हुआ / नहीं हुआ" की द्विआधारी प्रकृति को हटा देता है। प्रति पत्र एक टिक की जगह सौ छोटे प्रश्न उभरते हैं, और यह दिखता है कि कार्यान्वयन वास्तव में कहाँ कमज़ोर पड़ा।
ड्रिफ्ट के चार आयाम
प्रत्येक रिपॉज़िटरी का मूल्यांकन चार नैदानिक अक्षों पर किया जाता है:
- संख्यात्मक ड्रिफ्ट — गुणांकों, आयामों, थ्रेसहोल्ड और अन्य मात्राओं के मान विनिर्देश से मेल नहीं खाते;
- पद्धतिगत ड्रिफ्ट — प्रशिक्षण या गणना की प्रक्रिया ही पत्र में सोची गई प्रक्रिया से भिन्न है;
- प्रोटोकॉल ड्रिफ्ट — प्रयोग की योजना का उल्लंघन: नमूना विभाजन, तुलना की शर्तें, मूल्यांकन का नियम;
- क्रम ड्रिफ्ट — चरण गलत क्रम में निष्पादित किए गए, और इससे परिणाम बदल जाता है।
अक्षों का यह विभाजन व्यावहारिक लाभ देता है: डेवलपर को अमूर्त "गुणवत्ता निम्न है" की जगह खराबी का ठोस प्रकार दिखता है।

परिणाम: 0.301 एक ऊपरी सीमा के रूप में
लेखकों ने जनरेटर की 12 कॉन्फ़िगरेशन चलाईं — चार मॉडल तीन स्कैफ़ोल्ड्स के संयोजन में। प्रत्येक मूल्यांकन को इकाई के अंशों में मापा गया।
आँकड़े चौंकाने वाले रहे। सर्वश्रेष्ठ परिणाम Claude और PaperCoder की जोड़ी ने दिखाया — औसतन 1.0 संभावित में से 0.301 SAU-अंक। सभी 360 मूल्यांकनों का समग्र औसत अंक — 0.221।
दूसरे शब्दों में, सबसे मज़बूत कॉन्फ़िगरेशन भी विनिर्देश की जो माँग है उसका एक-तिहाई से भी कम सही ढंग से पूरा करती है। फिर भी मॉडल आवश्यकताओं को अनदेखा नहीं करते: विफलता की वर्गीकरण-प्रणाली दिखाती है कि एजेंट आमतौर पर अधिकांश बिंदुओं को पूरा करने का प्रयास करते हैं, पर उन्हें गलत तरीके से लागू करते हैं। शून्य किए गए दावों का अधिकांश भाग दो परिदृश्यों से आता है — कार्यान्वयन का मंशा से मेल न खाना (implementation mismatch) और स्टब्स, यानी वे जगहें जहाँ असली तर्क की जगह खोखली औपचारिकता छोड़ दी गई है।
त्रुटियों का यह स्वरूप एक महत्वपूर्ण बात कहता है: मामला एजेंट के आलस का नहीं है और न ही इसका कि उसने पत्र "पूरा नहीं पढ़ा"। मामला यह है कि वह आत्मविश्वास के साथ एक विश्वसनीय, पर गलत संस्करण का पुनरुत्पादन करता है।
निष्पादनशीलता वैज्ञानिक निष्ठा के बराबर नहीं है
शोध का एक अलग निष्कर्ष इस बारे में है कि आधुनिक स्कैफ़ोल्ड्स कैसे बने हैं। जो स्कैफ़ोल्ड्स निष्पादनशीलता के लिए अनुकूलित हैं — ताकि कोड बस चले और क्रैश न हो — वे वैज्ञानिक पुनरुत्पादन के लिए सीमित लाभ देते हैं। यह तर्कसंगत है: सफल निष्पादन सिंटैक्स और निर्भरताओं की उपस्थिति की जाँच करता है, पर इस बारे में कुछ नहीं कहता कि तर्क लेखकों के मंशा से मेल खाता है या नहीं।
इस अंतर को कम करने के लिए दूसरे वर्ग के स्कैफ़ोल्ड्स चाहिए — वे जो सिमेंटिक विनिर्देशों के सत्यापन को सर्वोच्च प्राथमिकता देते हैं। सरल शब्दों में, एजेंट को केवल कोड लिखकर चलाना ही नहीं है, बल्कि अपने हर चरण को पत्र के दावे से मिलाना है और यह सिद्ध कर पाना है कि मेल मौजूद है।

व्यवहार में यह क्या बदलता है
SA-Bench मॉडलों की प्रतिस्पर्धा नहीं, बल्कि एक नैदानिक उपकरण है। इसका मूल्य यह है कि यह पुनरुत्पादनशीलता की चर्चा को "काम करता है / नहीं करता" के तल से "कितना सटीकता से मेल खाता है" के तल पर ले जाता है। बेंचमार्क, एनोटेशन और मूल्यांकन पाइपलाइन खुले रूप में उपलब्ध हैं, इसलिए इस पद्धति को अपने स्वयं के कार्यों पर भी लागू किया जा सकता है — उदाहरण के लिए, तकनीकी कार्यों के आधार पर कोड जनरेशन की आंतरिक पाइपलाइनों की जाँच करने के लिए, न कि केवल शोध पत्रों के आधार पर।
उन लोगों के लिए जो एजेंट बनाते हैं, निष्कर्ष यह है: सत्यापन की एक अलग परत के बिना जनरेटर की "बुद्धिमत्ता" बढ़ाना एक ऊपरी सीमा पर जाकर रुक जाता है। सिमेंटिक ड्रिफ्ट किसी विशिष्ट मॉडल का बग नहीं, बल्कि उस दृष्टिकोण का गुण है जिसमें कोई भी अर्थपूर्ण मेल की जाँच नहीं करता। और जब तक ऐसी परत नहीं आती, research-कोड का पुनरुत्पादन एक ऐसा कार्य बना रहेगा जहाँ इंसान को अभी भी हर पंक्ति पढ़नी पड़ती है।



