लेख से रिपॉज़िटरी तक: श्रृंखला कहाँ टूटती है
वैज्ञानिक प्रकाशन कोई असेंबली निर्देश नहीं है। सूत्रों और ग्राफ़ों वाला विस्तृत पाठ भी वह सब कुछ नहीं रखता जो कोड चलाने और वही संख्याएँ पाने के लिए ज़रूरी है। यही खाई ReproAgent: Contract-Guided Paper-to-Code Reproduction शीर्षक वाला काम जाँचता है — यह paper-to-code reproduction के काम को औपचारिक रूप देता है: वैज्ञानिक AI-एजेंट को लेख को एक चलने योग्य रिपॉज़िटरी में बदलना होता है, जिसमें विधि, प्रयोग प्रोटोकॉल और आर्टिफ़ैक्ट सुरक्षित रहें।
लेखकों के अनुसार कठिनाई का कारण मॉडलों की "कमज़ोरी" नहीं, बल्कि विशिष्टता का बिखराव है। स्पष्ट हिस्सा — एल्गोरिदम, मेट्रिक्स, आर्टिफ़ैक्ट की संरचना — लेख में मौजूद रहता है, लेकिन एजेंट के लंबे प्रक्षेपपथों पर ये विवरण धीरे-धीरे खो जाते हैं, कार्य-संदर्भ से बह जाते हैं। अस्पष्ट हिस्सा — फ़्रेमवर्क की डिफ़ॉल्ट सेटिंग्स, संबंधित कामों से विरासत में मिली परंपराएँ — पाठ में कहीं ज़िक्र ही नहीं होता: लेखकों के लिए यह इतना स्पष्ट है कि शब्दों की ज़रूरत ही नहीं। ऐसे विवरण "सामान्य विचार" से बहाल नहीं किए जा सकते, और उनके बिना कोड या तो चलता ही नहीं, या अलग नतीजे देता है।
प्रीप्रिंट के औपचारिक आँकड़े: arXiv:2608.24291, मुख्य श्रेणी — cs.AI, अतिरिक्त रूप से cs.SE दर्शाया गया; 25 अगस्त 2026 को प्रस्तुत। लेखक — Xue Hu, Zewei Pan, Zhongyuan Wang, Zhou Liu, Zeli Su और Wentao Zhang, प्रेषक — Xue Hu। यह काम Findings of EMNLP 2026 में स्वीकृत, DOI: 10.48550/arXiv.2608.24291।

एजेंट के लिए एंकर के रूप में कार्यान्वयन अनुबंध
ReproAgent का मुख्य विचार यह नहीं है कि एजेंट को "बस लेख पढ़कर कोड लिखने" दिया जाए। इसके बजाय एक स्थायी कार्यान्वयन अनुबंध (implementation contract) बनाया जाता है — एक ऐसा आर्टिफ़ैक्ट जो पूरे काम के दौरान जीवित रहता है और लंबे प्रक्षेपपथों को पार कर जाता है, संदर्भ में मौजूद मूल पाठ के विपरीत।
अनुबंध दो स्वतंत्र चैनलों से भरा जाता है:
- आवश्यकता चैनल (implementation-requirement) — लेख के अंशों को कोड से जुड़े ठोस दायित्वों में बदलता है: ठीक क्या लागू होना चाहिए, कौन-से मेट्रिक्स गिने जाने चाहिए, कौन-सा डेटा लोड होना चाहिए;
- साक्ष्य चैनल (reference-evidence) — संबंधित रिपॉज़िटरियों से सारवान और संरचनात्मक संकेत निकालता है, यानी वही अस्पष्ट परंपराएँ सामने लाता है जो पाठ में नहीं हैं।
फिर दोनों धाराएँ मिलती हैं: वे work packages — कार्य-पैकेजों — से बाँधी जाती हैं, और फिर अलग-अलग फ़ाइलों के स्तर के अनुबंधों में प्रक्षेपित की जाती हैं। यह प्रक्षेपण ज़रूरी है, क्योंकि एजेंट को असल में फ़ाइलों के स्तर पर ही काम करना होता है, और वहीं आमतौर पर "लेख के विचार" और "कोड की पंक्ति" के बीच का संबंध खो जाता है।
इस रचना का अर्थ यह है कि दायित्व प्राथमिक है और जनरेशन गौण। एजेंट कोड लिखते समय ज़रूरी विवरण याद करने की कोशिश नहीं करता — वह पहले से दर्ज आवश्यकता से मिलान करता है।

चार चरण और मरम्मत की भूमिका
यह काम चार क्रमिक चरणों की एक पाइपलाइन के रूप में वर्णित है, जो मिलकर संक्षेप Prepare — Plan — Generate — Repair बनाते हैं।
- Prepare — तैयारी: लेख और संबंधित सामग्री का विश्लेषण, अनुबंध का प्रारंभिक भरण।
- Plan — योजना: काम को कार्य-पैकेजों में बाँटना और उनसे दायित्वों व साक्ष्यों को बाँधना।
- Generate — फ़ाइल-स्तरीय अनुबंधों के अनुसार कोड का जनरेशन।
- Repair — मरम्मत: अनुबंध का दोबारा उपयोग यह समझने के लिए कि ठीक क्या आवश्यकता से भटक गया, न कि अंदाज़े से गलतियाँ सुधारना।
असंतुलन पर ध्यान दें: अनुबंध की ज़रूरत न केवल शुरुआत में, बल्कि सबसे अंत में — त्रुटियाँ सुधारते समय भी पड़ती है। यह शायद इस पूरे विचार का सबसे व्यावहारिक हिस्सा है। ज़्यादातर एजेंटिक पाइपलाइनें लिखने के चरण में मज़बूत और डिबगिंग के चरण में कमज़ोर होती हैं, क्योंकि पहली त्रुटि तक आते-आते मूल विशिष्टता धुँधली पड़ चुकी होती है। यहाँ वह हाथ के पास बनी रहती है।
जाँच: PaperBench Code-Dev
लेखकों ने इस दृष्टिकोण को PaperBench Code-Dev पर परखा — एक ऐसा बेंचमार्क जहाँ एजेंट को वैज्ञानिक लेखों के आधार पर कोड पुनरुत्पादित करना होता है। नतीजा: समान backbone वाले स्कैफ़ोल्डों में सर्वोच्च औसत स्कोर। यह महत्वपूर्ण है कि यह प्रभाव दो अलग बेस मॉडलों — Claude Sonnet 4.5 और Gemini 3 Flash — के साथ दिखता है।
इन शब्दों का अर्थ। Backbone — बेस मॉडल, एजेंट का "दिमाग़"। Scaffold — उसके चारों ओर की व्यवस्था: नियम, स्मृति, चरणों का क्रम, उपकरण। समान backbone पर तुलना — यह दिखाने का सही तरीका है कि लाभ असल में आर्किटेक्चर से मिलता है, किसी ज़्यादा मज़बूत मॉडल से नहीं। ReproAgent स्वयं स्कैफ़ोल्डों की श्रेणी में एक योगदान है।
इसके अतिरिक्त लेखकों ने चैनलों पर एब्लेशन किए: अगर आवश्यकता चैनल या साक्ष्य चैनल बंद कर दिया जाए, तो end-to-end गुणवत्ता गिर जाती है। साथ ही अलग-अलग लेखों के विश्लेषण, जिनमें दिखता है कि ठोस उदाहरणों पर प्रत्येक चैनल कौन-सा योगदान देता है। ऐसा दोहरा नियंत्रण — समग्र मापन के साथ गुणात्मक विश्लेषण — निष्कर्षों को तालिका के किसी एक आँकड़े से ज़्यादा विश्वसनीय बनाता है।
लेखकों के अनुसार कोड और प्रायोगिक आर्टिफ़ैक्ट खुले रूप में उपलब्ध हैं।

व्यवहार में यह क्या बदलता है
इस काम का मूल्य केवल बेंचमार्क पर मिले नतीजे में नहीं, बल्कि समस्या के सूत्रीकरण में ही है। "विशिष्टता का बिखराव" — यह एक सटीक व्याख्या है कि एजेंट आत्मविश्वास से ऐसा कोड क्यों लिखते हैं जो सही दिखता है, पर नतीजे पुनरुत्पादित नहीं करता। स्पष्ट विवरण प्रक्षेपपथ लंबा होने के साथ खोते जाते हैं, अस्पष्ट विवरण शुरू से ही अनुपस्थित रहते हैं।
कार्यान्वयन अनुबंध एक बचाव-मार्ग सुझाता है: दायित्वों को नाज़ुक संदर्भ से निकालकर एक अलग टिकाऊ वस्तु में रखना और सभी चरणों में, डिबगिंग सहित, उससे मिलान करना। यह तरीका स्थानांतरणीय लगता है — ऐसी "दर्ज आवश्यकताएँ" अन्य कामों में भी काम आ सकती हैं जहाँ एजेंट को मूल शर्तें लंबे समय तक थामे रखनी होती हैं: माइग्रेशन, इंफ़्रास्ट्रक्चर का पुनरुत्पादन, लंबे इंजीनियरिंग कार्य।
सीमाएँ भी विधि के तर्क से स्पष्ट हैं: अनुबंध की गुणवत्ता सीधे आवश्यकताओं के निष्कर्षण की गुणवत्ता पर और इस पर निर्भर करती है कि कितने उपयुक्त संबंधित रिपॉज़िटरी मिले। अगर विषय पर कोई सार्वजनिक कोड नहीं है, तो साक्ष्य चैनल आँख मूँदकर काम करता है। लेकिन लेखकों का कम से कम एक कथन अभी से विश्वसनीय लगता है: वैज्ञानिक काम की पुनरुत्पादकता एक विशिष्टता की समस्या है, कोड जनरेशन की गति की नहीं।



