ReproAgent: وكيل ذكاء اصطناعي يبني كودًا عمليًا من ورقة بحثية استنادًا إلى «عقد التنفيذ»

17 سبتمبر 20268 الآراء

إعادة بناء المستودع من منشور ما يعوقها مواصفة ممزقة: فبعض المعلومات تضيع خلال سلسلة استدلال الوكيل الطويلة، وبعضها الآخر لا يُذكر ببساطة في نص المقال لأنه يندرج ضمن الإعدادات الافتراضية المتعارف عليها في أطر العمل. يعالج ReproAgent ذلك عبر دورة من أربع مراحل وعقد دائم يربط المتطلبات الواردة في المقال بالأدلة المستمدة من مستودعات مفتوحة ذات صلة؛ وفي معيار PaperBench Code-Dev حقق هذا النهج أفضل نتيجة متوسطة بين هياكل العمل التي تستخدم النموذج الأساسي نفسه.

ReproAgent: وكيل ذكاء اصطناعي يبني كودًا عمليًا من ورقة بحثية استنادًا إلى «عقد التنفيذ»

من المقال إلى المستودع: أين تنقطع السلسلة

النشر العلمي ليس دليل تركيب. فحتى النص المفصّل بالمعادلات والرسوم البيانية لا يحتوي على كل ما يلزم لتشغيل الكود والحصول على الأرقام نفسها. هذه الفجوة تحديدًا هي ما تبحثه ورقة بعنوان ReproAgent: Contract-Guided Paper-to-Code Reproduction — إذ تُضفي طابعًا رسميًا على مهمة إعادة إنتاج الكود من الورقة البحثية: على وكيل الذكاء الاصطناعي العلمي أن يحوّل المقال إلى مستودع قابل للتنفيذ، تُصان فيه المنهجية وبروتوكول التجارب والمخرجات.

سبب الصعوبة، بحسب المؤلفين، ليس «ضعف» النماذج، بل تشظّي المواصفات. الجزء الصريح — الخوارزميات والمقاييس ومكوّنات المخرجات — موجود في المقال، لكنه يضيع تدريجيًا على المسارات الطويلة للوكيل، ويُغسل من سياق العمل. أما الجزء الضمني — الافتراضات المسبقة لأطر العمل، والأعراف الموروثة من أعمال مجاورة — فلا يُذكر في النص أصلًا: فهو بديهي إلى حد لا يحتاج معه المؤلفون إلى كلمات. ولا يمكن استعادة هذه التفاصيل «بالاستنتاج العام»، وبدونها إما لا يعمل الكود، وإما يعطي نتائج مختلفة.

البيانات الرسمية للمسودة الأولية: arXiv:2608.24291، التصنيف الأساسي — cs.AI، مع ذكر cs.SE إضافةً؛ قُدّمت في 25 أغسطس 2026. المؤلفون — Xue Hu وZewei Pan وZhongyuan Wang وZhou Liu وZeli Su وWentao Zhang، والمرسل — Xue Hu. قُبلت الورقة في Findings of EMNLP 2026، DOI: 10.48550/arXiv.2608.24291.

عقد التنفيذ كمرساة للوكيل

الفكرة الرئيسية في ReproAgent ليست أن «يقرأ الوكيل المقال ويكتب الكود» فحسب. بل يُبنى بدلًا من ذلك عقد تنفيذ (implementation contract) دائم — وهو مُخرَج يرافق العمل طوال مدته ويصمد أمام المسارات الطويلة، خلافًا للنص الأصلي في السياق.

يُملأ العقد من قناتين مستقلتين:

  • قناة المتطلبات (implementation-requirement) — تحوّل مقاطع المقال إلى التزامات محددة تجاه الكود: ما الذي يجب تنفيذه بالضبط، وأي المقاييس تُحتسب، وأي البيانات تُحمَّل؛
  • قناة الأدلة المرجعية (reference-evidence) — تستخرج إشارات مضمونية وبنيوية من المستودعات المرتبطة، أي تجلب تلك الأعراف الضمنية نفسها غير الموجودة في النص.

ثم تلتقي القناتان: تُربطان بـ work packages — حزم العمل — ثم تُسقطان على عقود على مستوى الملفات الفردية. هذا الإسقاط مهم، لأن الوكيل يعمل تحديدًا على مستوى الملفات، وهناك عادةً تنقطع الصلة بين «الفكرة في المقال» و«السطر في الكود».

مغزى هذا البناء أن الالتزام أولي والتوليد ثانوي. لا يحاول الوكيل تذكّر التفصيل المطلوب لحظة كتابة الكود — بل يرجع إلى متطلب مُثبَّت سلفًا.

أربع مراحل ودور الإصلاح

وُصفت الورقة كخط أنابيب من أربع مراحل متتالية تشكّل معًا اختصار Prepare — Plan — Generate — Repair.

  1. Prepare — التحضير: تحليل المقال والمواد المرتبطة، والتعبئة الأولية للعقد.
  2. Plan — التخطيط: تقسيم المهمة إلى حزم عمل وربط الالتزامات والأدلة بها.
  3. Generate — توليد الكود وفق عقود مستوى الملفات.
  4. Repair — الإصلاح: يُستخدم العقد مجددًا لفهم ما الذي انحرف عن المتطلب بالضبط، بدل ترقيع الأخطاء عشوائيًا.

لاحظ التباين: العقد مطلوب ليس في المدخل فقط، بل في النهاية أيضًا — عند تصحيح الأخطاء. وهذا على الأرجح أكثر أجزاء الفكرة عمليةً. فمعظم خطوط أنابيب الوكلاء قوية في مرحلة الكتابة وضعيفة في مرحلة التنقيح، لأن المواصفات الأصلية تكون قد ضبابية بحلول الخطأ الأول. وهنا تبقى في متناول اليد.

التحقق: PaperBench Code-Dev

اختبر المؤلفون المنهج على PaperBench Code-Dev — وهو معيار تقييم يُطلب فيه من الوكيل إعادة إنتاج الكود من مقالات علمية. النتيجة: أعلى متوسط درجات بين السقالات ذات النموذج الأساسي نفسه. والمهم أن الأثر يظهر مع نموذجين أساسيين مختلفين — Claude Sonnet 4.5 وGemini 3 Flash.

ما معنى هذه المصطلحات. النموذج الأساسي (backbone) هو النموذج القاعدي، «عقل» الوكيل. والسقالة (scaffold) هي الهيكل المحيط به: القواعد والذاكرة وترتيب الخطوات والأدوات. والمقارنة عند نموذج أساسي واحد هي الطريقة الصحيحة لإظهار أن المكسب يأتي من البنية نفسها، لا من نموذج أقوى. وReproAgent إسهام في فئة السقالات تحديدًا.

إضافةً إلى ذلك أجرى المؤلفون اختبارات استئصال للقنوات: إذا عُطّلت قناة المتطلبات أو قناة الأدلة، انخفضت الجودة من البداية إلى النهاية. فضلًا عن تحليلات لمقالات فردية يظهر فيها ما تسهم به كل قناة على أمثلة محددة. هذا الضبط المزدوج — قياس عام مع تحليل نوعي — يجعل الاستنتاجات أكثر إقناعًا من رقم واحد في جدول.

والكود والمخرجات التجريبية، بحسب المؤلفين، متاحة للعموم.

ما الذي يغيّره هذا عمليًا

قيمة العمل ليست في النتيجة على المعيار فحسب، بل في صياغة المشكلة نفسها. فـ«تشظّي المواصفات» تفسير موفق لسبب كتابة الوكلاء بثقة كودًا يبدو صحيحًا لكنه لا يعيد إنتاج النتائج. التفاصيل الصريحة تضيع بطول المسار، والضمنية غائبة منذ البداية.

يقترح عقد التنفيذ مخرجًا جانبيًا: إخراج الالتزامات من السياق الهش إلى كائن مستقل صامد والرجوع إليه في كل المراحل، بما فيها التنقيح. ويبدو هذا الأسلوب قابلًا للنقل — فقد تفيد «المتطلبات المُثبَّتة» المشابهة في مهام أخرى يحتاج فيها الوكيل إلى الاحتفاظ بالشروط الأصلية طويلًا: الترحيلات، وإعادة إنتاج البنية التحتية، والمهام الهندسية الطويلة.

والقيود واضحة أيضًا من منطق المنهج: جودة العقد تعتمد مباشرةً على جودة استخراج المتطلبات، وعلى مدى ملاءمة المستودعات المرتبطة التي عُثر عليها. فإذا لم يوجد كود عام حول الموضوع، تعمل قناة الأدلة عمياء. لكن أطروحة واحدة على الأقل للمؤلفين تبدو مقنعة الآن: إعادة إنتاج العمل العلمي مسألة تتعلق بالمواصفات، لا بسرعة توليد الكود.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
ReproAgent: وكيل ذكاء اصطناعي يبني كودًا عمليًا من ورقة بحثية استنادًا إلى «عقد التنفيذ»