ReproAgent:AI 智能体依据“实现契约”从科研论文中生成可运行代码

17 九月 20268 视图

根据论文复现仓库受到不完整规格的阻碍:部分信息在智能体漫长的推理链中丢失,另一部分则因属于框架的通用默认设定而未在论文正文中提及。ReproAgent 通过四阶段循环和一份持续生效的契约来解决这一问题,该契约将论文中的需求与来自相关开源仓库的证据关联起来;在 PaperBench Code-Dev 基准测试上,该方法在使用相同基础模型的各类脚手架中取得了最佳平均成绩。

ReproAgent:AI 智能体依据“实现契约”从科研论文中生成可运行代码

从文章到代码仓库:链条在哪里断裂

科学出版物不是一份构建说明。即便是包含公式和图表的详尽文本,也不包含运行代码并获得相同数字所需的一切。ReproAgent: Contract-Guided Paper-to-Code Reproduction 这篇工作研究的正是这道鸿沟——它将 paper-to-code reproduction 这一任务形式化:科学 AI 智能体必须把一篇论文转化为可执行的代码仓库,并在其中保留方法、实验协议和产物。

在作者看来,困难的根源不在于模型的“孱弱”,而在于规范的碎片化。显性部分——算法、指标、产物的构成——在论文中是存在的,但在智能体的长轨迹上,这些细节会逐渐丢失,从工作上下文中被冲刷掉。隐性部分——框架的默认设定、从相邻工作继承而来的约定——在文本中根本没有提及:对论文作者来说,这些显而易见,无需言说。这类细节无法“凭一般常识”还原,而缺少它们,代码要么跑不起来,要么给出不同的结果。

预印本的形式化信息:arXiv:2608.24291,主分类为 cs.AI,另标注 cs.SE;提交于 2026 年 8 月 25 日。作者为 Xue Hu、Zewei Pan、Zhongyuan Wang、Zhou Liu、Zeli Su 和 Wentao Zhang,提交者为 Xue Hu。该工作已被 Findings of EMNLP 2026 接收,DOI: 10.48550/arXiv.2608.24291。

实现契约作为智能体的锚点

ReproAgent 的核心思想不是让智能体“只是读论文然后写代码”。相反,它构建一份持久的实现契约(implementation contract)——一个贯穿整个工作过程、能够跨越长轨迹而存活的产物,这与上下文中的原始文本不同。

契约由两条相互独立的通道填充:

  • 需求通道(implementation-requirement)——将论文片段转化为具体的代码义务:究竟要实现什么、要计算哪些指标、要加载哪些数据;
  • 证据通道(reference-evidence)——从相关代码仓库中提取内容性和结构性的线索,也就是把那些文本中并不存在的隐性约定拉进来。

随后两条流汇合:它们被绑定到 work packages——工作包——之上,再被投射为文件级别的契约。这种投射很重要,因为智能体恰恰是在文件层面行动的,也恰恰是在那里,“论文中的构想”与“代码中的某一行”之间的联系通常会丢失。

这一构造的意义在于:义务是第一位的,生成是第二位的。智能体不会在写代码的那一刻试图回忆所需的细节——它会去对照已经固定下来的要求。

四个阶段与修复的角色

该工作被描述为一条由四个连续阶段组成的流水线,它们合起来构成缩写 Prepare — Plan — Generate — Repair。

  1. Prepare——准备:解析论文及相关材料,初步填充契约。
  2. Plan——规划:将任务拆分为工作包,并把义务和证据绑定到它们之上。
  3. Generate——依据文件级契约生成代码。
  4. Repair——修复:再次使用契约,以弄清究竟是什么与要求发生了偏离,而不是盲目地修补错误。

请注意这种不对称性:契约不仅在入口处需要,在最末端——修正错误时——同样需要。这或许是整个构想中最具实用性的部分。大多数智能体流水线在编写阶段很强,在调试阶段却很弱,因为到第一个错误出现时,原始规范已经被稀释了。而在这里,它始终触手可及。

验证:PaperBench Code-Dev

作者在 PaperBench Code-Dev 上验证了该方法——这是一个要求智能体依据科学论文复现代码的基准。结果:在相同 backbone 的 scaffold 中取得了最高的平均分。重要的是,这一效果在两种不同的基础模型上都观察到了——Claude Sonnet 4.5 和 Gemini 3 Flash。

这些术语是什么意思。 Backbone——基础模型,智能体的“大脑”。Scaffold——围绕它的外包装:规则、记忆、步骤顺序、工具。在相同 backbone 下进行比较,是证明收益恰恰来自架构而非更强模型的正确方式。ReproAgent 正是对 scaffold 这一类别的贡献。

此外,作者还对各通道做了消融实验:如果关闭需求通道或证据通道,端到端质量都会下降。再加上对个别论文的剖析,可以看到每个通道在具体示例中究竟贡献了什么。这种双重检验——总体测量加定性剖析——比表格里的一个数字更能让结论令人信服。

据作者声明,代码和实验产物均已公开。

这在实践中改变了什么

这项工作的价值不仅在于基准上的结果,更在于对问题本身的表述。“规范的碎片化”——这是对以下现象的一个很好的解释:为什么智能体能自信地写出看起来正确、却无法复现结果的代码。显性细节随着轨迹变长而丢失,隐性细节则从一开始就不存在。

实现契约提供了一条迂回之路:把义务从脆弱的上下文中提取出来,放入一个独立的、稳固的对象,并在所有阶段——包括调试——都去参照它。这一手法看起来是可迁移的——类似的“固定下来的要求”在其他需要智能体长时间保持初始条件的任务中也可能派上用场:迁移、基础设施复现、长周期的工程任务。

局限从方法的逻辑中也能看清:契约的质量直接取决于需求提取的质量,以及所找到的相关代码仓库有多合适。如果某个主题没有公开代码,证据通道就只能盲跑。但至少作者的一个论点在当下就已经很有说服力:科学工作的可复现性,是一个关于规范的问题,而不是关于代码生成速度的问题。

常问问题

ReproAgent:AI 智能体依据“实现契约”从科研论文中生成可运行代码