Anthropic宣布,所有文本 由它的旗舰模式产生 克劳德 将很快获得无形的水印。 这样做是为了遵守即将到来的监管要求。 公司还首次披露了技术细节:此前只知道水印不会改变内容,也不会在文本中添加隐藏字符.
水印是怎样工作的
该方法基于SynthID-Text,该技术由Google DeepMind开发,于2024年在Nature上发布. 这个想法本身是由斯科特·亚伦森在2022年提出的. 在正常生成过程中,模型使用随机数选择下一个单词. 在水印版中,随机性被定型函数所取代:它使用密钥和前几个单词. 因此,词的顺序看起来是随机的,但带有可以验证的图案.
每个步骤,所有候选词都分为: “绿色” 和 “红色” 列表。 模型从绿色列表中选择的几率略高,但红色的单词并不被禁止——这些单词更不可能. 列表的构成取决于上下文和密钥,因此没有固定的一组可以记住的单词. 持有钥匙的任何人都可以在任何时候确定某一字在某一位置掉进哪个字。 没有钥匙,这是不可能的。

为了理解这个想法,想象一款单曲游戏,将骰子替换为皮的数位图书. 对外界观察者来说,该卷看起来是随机的,但一个拥有该书的玩家事先知道所有的数字. 同样,水印不会改变生成规则;它只会改变随机性的来源.
本质上,这是一种形式 素描学:信息隐藏在词本身的选择中,而不是在明确的标签中. 水印不会给文字增加任何符号,也不会增加生成成本. 读者无法将标有水印的文字与普通文字区分开来,无论是通过视觉还是通过耳朵.
这如何影响质量
Anthropic进行内部测试,没有发现对内容、创造力或可读性的负面影响。 在Google DeepMind与双子座模型的实验中也取得了类似的结果:用户的评级(喜欢和不喜欢)显示在统计学上没有标注水的和普通的响应之间的显著差异. 在一项有控制的研究中,专家们同时比较文本也无异。

水印没有识别信息:它不能显示与模型互动的,在哪个聊天,或何时. 最多可以计算出文本是由这个特定的模型生成的概率. 对于短句(在几十个单词下),检测精度下降到零:文本需要足够长的时间,使统计模式变得明显.
值得注意的是,模型从不被迫选择稀有或非自然的词. 绿色和红色的列表中包含模型在正常模式中考虑的相同词,因此文本仍然是自然的.
接下来是什么?
推出水印是更广泛的趋势的一部分。 从8月开始,监管者将要求所有AI服务提供商对其模型创建的内容进行标签. 人类并非孤立无援:其他大公司也签署了类似的工业承诺, 已在制订自己的水标记计划。 因此,无形标签正在成为一种行业标准,而不是一种独特的特征。 克劳德。 。 。
诚然,该技术有其局限性:使用密钥只能得出文本来源的概率估计,而不是绝对的确定性。 然而,这对监管者来说还是足够的,为用户提供了额外的一层透明度.
底线:标注克劳德的文本是透明度、监管和方便之间的妥协。 它实际上对生成质量没有影响,并且能够在不损害用户隐私的情况下核查文本的来源。



