Anthropic上周宣布将在Claude的回复中嵌入不可见水印。该公司解释称,这是为了满足欧盟《人工智能法案》的要求:很快,大型模型生成的所有合成内容都必须带有机器可读的标记。然而,程序员们并没有坐等——第一批绕过方法当天就出现了。
什么是不可见标记,为什么难以察觉
文本水印不是图片,也不是隐藏字符。Anthropic使用的是Google开发的SynthID技术。模型选择词语和短语的方式,让人类阅读文本时感觉一切如常,但专门的算法可以判断出这是由神经网络生成的。同时,回复的含义和质量不会受到影响。
本质上,标记被嵌入到文本自身的结构中。手动去除是不可能的——需要改变措辞、句子顺序或整体风格。

程序员如何去除标记
最引人注目的例子是Guillaume Meyer编写的代码。它在Anthropic发布公告四小时后便出现在GitHub上,并迅速传播开来:在X上获得超过20,000次收藏,贡献者超过一百人。其思路是让Claude生成的文本通过另一个没有水印的语言模型。该模型会重写文本,用同义词替换词语并改变结构——之后原始模式就被破坏了。
其他开发者也在使用类似的方法:
- Eric Hughes在15分钟内基于Claude构建了一个工具,可以删除不可见字符、调整句子顺序并替换同义词。
- Leon Hlon提出将回复压缩,翻译成某种阿拉伯语方言,然后再翻译回来——这种“翻译乒乓”同样能扰乱标记。
这些方法之所以有效,是因为水印存在于精确的词语选择中。任何大幅度的重写都会破坏模式。
为什么有人绕过,以及为什么这很难被视为违规
开发者的动机各不相同。有人是原则上不同意每段生成文本都必须带有隐藏标记。有人只是想测试自己的技能。而自由职业者和内容创作者则直接联系绕过方法的作者——他们在处理草稿时不想受到额外限制。同时,从法律角度看,独立工具不在禁令范围内:欧盟新规威胁对销售绕过工具的提供商处以最高相当于营业额3%的罚款,但并不限制爱好者。
来自Haimaker公司的Wayne Pan认为,在Anthropic发布官方检测器之前,还不能完全信任任何一种方法。但他已将Meyer的工具集成到自己的平台中,依据的是对SynthID工作原理的理解。Meyer本人指出,水印并不是一个好方案,因为存在误报风险,而且无法区分轻度AI辅助编辑与完全生成的文本。他承认自己经常使用Claude和Grammarly来处理自己的文本。
Anthropic怎么说,接下来可以期待什么
公司代表确认:标记不会影响含义和可读性,只是为了符合欧盟法律而添加。他们正在开发检测服务,并计划发布API,让开发者能够检查文本。同时,Anthropic也承认,在大量编辑、改写或翻译之后,水印可能会消失。标记系统仍在不断完善,因此可以预期,过一段时间后,绕过方法的效果会越来越差。

目前来看,这就像一场经典的竞赛:Anthropic在加强标记,而程序员社区则用新方法回应。对用户来说,这只意味着一件事——完全隐藏AI的使用痕迹目前比想象中更容易,但官方检测手段也会不断发展。



