科学论文中的隐形文本:作者如何欺骗AI审稿人
2025年7月,研究人员在arXiv平台上记录了多达18起案例,其中学术手稿中隐藏着针对自动化审稿系统的特殊指令。这些文字以白色字体或仅几个像素大小的符号呈现,普通读者难以察觉,但负责评估论文的大型语言模型却能轻松读取。这种手法被称为间接提示注入:恶意指令被直接嵌入系统处理的文档中,悄无声息地改变其行为。

最简单的操纵形式是“只给出正面评价”这样的指令——在被发现的手稿中正是出现了这类要求。然而,作者的招数远不止于粗暴的指令。一些隐藏提示包含更为详细的脚本:例如,如何构建审稿意见、哪些部分需要称赞、哪些缺陷最好避而不谈。这样不仅能获得正面评价,还能使其显得可信——让日后阅读审稿意见的人不会产生怀疑。
为何这样做
作者们对曝光事件的反应各不相同。其中一人表示打算从arXiv撤回论文,另一人则认为这种做法情有可原。按照他的逻辑,隐藏指令是对滥用神经网络、将全部工作推给AI的审稿人的一种检验:如果系统未能察觉隐藏指令,说明它确实在没有人类参与的情况下评估稿件,需要人工介入。
但研究人员认为这一论点站不住脚。在绝大多数情况下,隐藏指令的目的是获得有利于作者的评审结果,而非诊断算法。如果目的是测试,作者应当公开自己的发现,而不是试图影响评审结果以谋取私利。动机似乎各不相同,从天真地复制现成模板到精于算计的操纵不一而足。因此,这种做法应被视为可疑研究行为(QRP)的又一种形式。
从简历到科学论文:提示注入的演变
这种伎俩本身并不新鲜。隐藏文本指令此前已被用于操纵网络搜索——例如,在网页中嵌入人类不可见的要求,以输出特定结果。类似技术也曾应用于自动简历筛选系统:求职者将能说服算法认定自己完美匹配职位的短语隐藏在文档中。如今,战场已转移到科学审稿领域,而这里的赌注尤其高昂。

这种新型攻击之所以加倍危险,是因为审稿是一个保守且建立在信任之上的过程。如果作者能够悄无声息地影响算法,人类在科学评估中的角色将被削弱。隐形文本不仅可能危及具体稿件,还可能破坏整个学术交流链条:从抄袭检测到引文索引,再到文献综述的自动生成。
出版商的不同标准
值得关注的是,各出版社对AI用于审稿的态度差异巨大。Elsevier持严格立场:完全禁止神经网络参与这一过程。Springer Nature则允许有限使用大型语言模型,但要求审稿人明确披露这一事实。规则的不一致为滥用提供了肥沃土壤:作者可以选择要求更宽松的平台,或者指望某些地方的隐藏指令不会被发现。

如何应对
解决这一问题需要多管齐下。首先,需要技术筛查:能够识别隐形文本、修改过的字体及其他强制提示注入迹象的软件工具。其次,出版商和存储库应制定统一的AI审稿政策,让作者没有“灰色地带”可钻。第三,应考虑将语言模型以受控方式纳入官方评审流程——制定透明规则并监督其执行。只有综合运用这些措施,才能维护对学术评审的信任,防止隐形文字从内部瓦解它。



