接受审查的机器审查员:在评价科学论文时对伽马--双子和克洛德进行的比较分析

14 八月 202620 视图

研究人员将三种大语言模式的审查与专家对提交国际语言和文学中心会议的300份呈件的判断进行比较。 他们发现,算法自信地将被接受的论文与被否决的论文区分开来,但未能捕捉到口语和海报状态之间更微妙的区别,他们的评论偏向于每个模型特有的主题.

接受审查的机器审查员:在评价科学论文时对伽马--双子和克洛德进行的比较分析

短而切入重点

现代语言模型能否在机器学习会上取代活评论员?. 研究人员用真正的ICLR材料测试了这一点——这是该领域最有名的场所之一. 在关于arXiv(编号为2608.03659)的论文中,亚伯拉罕·卡梅洛-格雷罗和Jairo Diaz-Rodriguez比较了三种著名模型如何对照人类的决定处理科学呈件的评价.

其结论有双重:算法做了一个体面的工作,将"被接受"的论文与被否决的论文区分开来,但它们完全忽略了更细微的区别,如口头陈述和海报的区别. 同时,每个模型都显示自己的签名:一个给出了慷慨的分数,另一个则对强论文过于严格. 机器审查员也注重与人类专家完全不同的弱点.

简而言之,使用LLMs作为粗略过滤器是可能的,但现在完全相信最后的决定还为时过早。 下面我们分解实验的细节及其发现.

如何安排实验

数据和条件

提交人向2026年国际天主教法学研究所提交了300份材料,并平衡了样本的分三类:口头陈述、海报和被拒绝的论文——每分100份。 这种方法保证了模型并非只是猜测,而是实际上被迫区分出所有三类.

每种模式—— GPT-5.4,双子座 3.1 Pro Preview,和克洛德·奥普斯 4.6 – 获得相同的指令和评级等级. 一个重要的细节:关于人类决定的资料事先从提交文件中删除了。 这对于防止答案泄露和诚实地检验模型独立判断的能力是必要的.

比较方法

研究人员从三个角度考察了结果. 首先,他们检查了模型的预测与最终决定——无论是广义的(接受与否)还是细节的(口头的还是海报)——是否准确. 其次,他们研究了模型如何使用推荐尺度:例如,它们是否提高了分数. 第三,他们比较了论文中哪些弱点是人类发现的,哪些弱点是算法发现的。

结果显示

区分划界案的命运

令人鼓舞的消息是:所有三个LLMs都自信地区分了被接受的论文和被否决的论文. 这意味着,即使没有就具体会议数据进行培训,模式审查也发出有用的信号。 然而,成功到此结束。

没有一个模型能够重复在人类判断中显而易见的口头和海报之间的区别。 对于算法来说,接受的论文看起来像一个同质群体,尽管口头陈述和海报之间有明显的分级. 这是一个重要的差距:将杰出研究与仅好工作区分开的精细质量标准尚未被机器所捕捉.

模型提供者之间的差异

模型的行为最终与开发商紧密地联系在一起. 双子座 3.1 Pro Prevent扮演经典"放任"评论员:其分数始终高于平均水平. 有趣的是,我们... GPT-5.4 而克洛德·奥普斯4.6 更接近人类 当它被否决 和海报论文, 但与此同时, 显示出更加严格 对口头提交。

这种偏差可以用不同的方式来解释. 也许因为期望高, 模型“nitpick”强论文:在好文本中找到一个脆弱位置比在明显薄弱的文本中更容易。 或者或许关注架构根本不知道如何去衡量赞美:为此,"好"和"优秀"之间没有很大的区别.

专题差异

最令人好奇的部分是机器审查人员关注的是什么. 所有这三种模型都经常指出缺乏基本的比较实验——这是对科学工作的经典批评. 与此同时,人类专家更经常地提出计算效率问题:拟议方法需要多少资源,它有多实用。

这不仅仅是风格的不同。 它反映了优先事项的不同。 人类思考现实世界的应用,思考培训和部署的成本,而模型则更将文本评价为正式文件. 所以,如果你用一个LLM来初步检查一个文件,你应该准备一些重要的评论,就是永远也不会得到你.

结论

本研究的主要教训:一个模型在"被接受/被拒绝"水平上的准确性还没有表明它在详细评价中的胜任能力. 将明显薄弱的论文与其他论文区分开来的能力是一个相当粗糙的过滤器,不能取代深思熟虑的审查.

实际应用表明:LLMS可以用作主要助手,使质量过滤器明显不适宜提交或标出明显的形式缺陷. 但是,关于固体文件命运的决定应该仍然由人类来决定——如果仅仅是因为人类价值的规模(效率优先,新颖性评估,实地背景)仍然与机器有明显差异的话.

从长远来看,为特定社区甚至为特定审查人员校准模型可能是有意义的。 但在此之前,在科学通信方面依赖自动审查至少还为时过早。

常问问题

GPT、双子座和克劳德——评价科学作品的比较审查