Anthropic官方披露Claude输出文本水印的实现机制:在token概率分布中引入微小偏移,使输出具有可被检测的统计特征,用于追踪AI生成内容来源。
未来的 Claude 模型生成的文本将包含水印。这是一种判断 Claude 是否参与了该文本写作的可能性评估方法,我们与几家其他主要 AI 提供商一起实施这一变更,以遵守欧盟 AI 法案。
在本文中,我们分享了关于我们所选水印方法如何工作、它是否影响 Claude 的输出、以及我们为何做出这一变更等问题的答案。总结如下:
我们使用的水印方法对 Claude 输出的质量或内容没有任何实际影响;
带水印与不带水印的文本对读者而言无法区分;
文本中没有任何添加内容,也没有隐藏字符;
水印不需要额外 token,也不会增加成本;
水印不携带任何可识别信息,无法追溯到特定个人、组织或对话;
水印并非 Claude 独有。截至 8 月 2 日,欧盟要求为其市场提供服务的 AI 提供商标记 AI 生成的内容。其他主要模型开发者已签署相同的实践守则,并将实施各自的水印。
像 Claude 这样的大型语言模型每次生成一个词来工作。每次模型决定下一个词时,它会从候选列表中选择,最终根据前文选择最合理或最可能的词。以句子"The weather today was cold and…"为例,下一个词几乎不可能是"sugary",但很可能是"overcast"或"grey"。在大多数情况下,读者并不在意模型最终选择这两个词中的哪一个——句子的含义基本相同。在这种情况下,选择由随机数决定。
水印利用生成文本中多次出现的这种低风险选择来在 Claude 的回复中留下模式。这个模式对读者不可见,但任何持有编码它的密钥的人都可以检测到。当使用水印时,选择仍然是随机做出的,但随机性的来源不同。水印不是使用任意随机数生成器来选择下一个词,而是使用密钥和前面的几个词来决定模型应该选择哪个词。也就是说,Claude 选择的词仍然是随机的,但现在人们可以检查词序列,看它是否与 Claude 使用密钥时会做出的选择一致。如果一致,就可以判断该文本由 Claude 生成的概率。
重要的是,这并不意味着模型现在总是偏向选择 overcast 或 grey。与不带水印的文本一样,overcast 可能在一句中被选中,grey 在下一句中被选中,取决于前面的词。而且水印方法并不会促使 Claude 选择它本来不会考虑的词(例如,它不会让 Claude 选择"nubilous"——一个 overcast 或 grey 的生僻同义词,Claude 在正常情况下几乎不会使用)。
水印不影响 Claude 输出的质量。对于读者来说,带水印的回复与不带水印的回复无法区分(在这方面,AI 水印与纸币、其他物理物体和某些数字文档上的同名水印有本质区别,后者肉眼可见)。
在内部测试中,我们没有看到水印对 Claude 文本的内容、创造力水平或可读性产生影响。在介绍我们所使用技术的 SynthID-Text 论文中,Google DeepMind 通过向部分 Gemini 流量提供使用水印的模型并比较 thumbs-up 和 thumbs-down 评分来测试这种影响。他们发现与不带水印的模型没有统计学上的显著差异。在一项对照研究中,人类评估者并排比较带水印和不带水印的答案时,没有发现质量差异。
一个有用的类比是想象你正在玩大富翁这样的游戏。每回合,每个玩家根据骰子掷出的数字在棋盘上随机移动一定步数。假设我们决定使用一本圆周率数字的书来获取这种随机性,而不是掷骰子。我们从随机选择的一个数字开始(比如小数点后第 1,012,845 位,恰好是 6),从那以后每个玩家简单地使用序列中的下一个数字作为他们的下一个"掷骰"。
在所有实际意义上,移动仍然是随机的:无论随机性来自圆周率还是每次掷骰子,对玩家或游戏结果都没有影响。但如果我们能在游戏结束后看到所有移动的序列(并且我们知道圆周率的值),我们就可以推断出这是否是一个可能使用圆周率来确定移动的游戏。使用圆周率的游戏在某种意义上就是"带水印的"。
Claude 生成的文本也是如此。水印不会改变阅读者的含义或体验,但如果你想在事后检查文本是否可能是由 Claude 生成的,水印可以让你做到这一点。
Claude 的文本水印是 Google DeepMind 在 2024 年发表在 Nature 论文上的 SynthID-Text 方法的版本。它属于一系列方法,这些方法可以追溯到 Scott Aaronson 在 2022 年提出的方案,所有这些方法都共享我们上面描述的相同设计原则——水印只改变用于在词之间进行选择的随机性来源。
水印的有效性存在局限性。使用我们的密钥,只能回答"这由 Claude 部分编写的可能性有多大"这个问题。它不能确认文本是否是人类写的,也无法判断文本是否由其他 AI 编写(即使其他 AI 使用水印,它也会有不同的密钥;它也可能使用不同的水印方法)。在少量样本上检测水印也不太有效,因为词选择更少,从而可用的信息也更少。随着段落长度增加,对 Claude 参与的置信度也会增加。
在事实性段落上,水印更为稀疏,因为减少准确性的选择很少。例如,以句子"Isaac Newton's most famous work was called Principia…"为例,下一个词是否是"Mathematica"确实很重要(这是唯一正确的答案),所以水印没有什么可作用的。校对也是如此。如果你给 Claude 一段文字并要求它只编辑语法和标点符号而不做其他修改,水印只能存在于少量的修改中,可能少到无法被检测到。
水印只适用于 Claude 选择的词。当 Claude 校对人类写的文本时,它给出的内容通常只是轻微编辑;因为几乎所有的词都是人类的,水印几乎没有什么可以依附的。根据文本的长度和 Claude 编辑的强度,这些修改可能不足以使 Claude 的参与被检测到。Claude 写得越多,它需要做出的决定就越多,水印的空间就越大。
正如我们上面所注意到的,AI 水印利用了选择任何一个词都同样好的决定。当需要精确输出时——即没有选择余地,如果选择不同的词会在事实上错误或代码会损坏时——水印不会被应用。
例如,一旦模型写了"2 + 2 =",下一个 token 有一个非常明确的最佳选择(如果模型是在完成这个加法,没有哪个答案比"4"同样好;如果是在谈论乔治·奥威尔的《一九八四》,没有哪个答案比"5"同样好)。水印的"轻推"不会在这里被应用。出于同样的原因,代码——在很多情况下必须精确——通常比其他形式的文本有更少的水印。
话虽如此,在代码中有任意选择特定词或术语的地方(如代码中的注释),可以使用水印。但顾名思义,它对实际产生的代码影响微乎其微。
不会。水印对模型速度的影响可以忽略不计,因为它不产生额外 token,所以模型的服务和使用成本相同。
不能。水印适用于 Claude 及其输出。它不识别与个人用户相关的任何信息。水印或其密钥中没有任何东西允许任何人恢复关于用户、其组织或其与 Claude 对话的任何信息。
我们实施水印是为了遵守欧盟 AI 法案。Anthropic 与其他几家主要 AI 模型提供商以及约 190 个总签名方于 2026 年 7 月签署了欧盟 AI 生成内容透明度实践守则。这要求 AI 系统提供商使用"标记"AI 生成文本的方法。我们在发布时在全球范围内应用水印,因为我们还没有一种持久的方法来按区域限制它。不过,我们将继续评估不同的方法,并在有更新时分享。
我们将很快提供水印检测 API。我们正在确定其实现的细节。
当 Claude 生成支持类型的文件(如 .png、.jpg 或 .svg)时,它将附加一个内容凭证,以文件元数据中小的加密签名注释的形式,说明该文件是由 Claude 制作或处理的。这是一个名为 C2PA 的开放行业标准——相机制造商和照片编辑软件也使用相同标准来记录图像来源。任何 C2PA 感知工具都可以读取它;我们将提供自己的工具,你可以上传文件并检查。
这个元数据标签与水印完全不同。文件本身没有任何变化——它不是嵌入式的或隐藏的。与文本一样,凭证只说明 Claude 参与了文件的制作;它不包含任何可识别信息。
在某种程度上可以。轻度编辑可能不会完全移除水印;完全重写(每个词都被替换)会。当然,在后一种情况下,这个文本是否还能被称为 AI 生成的就值得商榷了。
水印只能确定 Claude 可能在某种程度上参与了这个内容。它无法区分"Claude 写了这个"和"Claude 大量编辑了这个"。
是的。由 Claude 产生的翻译带有水印,因为在这种情况下每个词都是由 Claude 选择的。
欧盟法律为 8 月 2 日之前发布的 Anthropic 模型提供了过渡期,我们也在努力为这些模型添加水印。这将在未来几个月内推出。
AI 检测软件使用不同的方法,因为提供这些服务的公司没有我们的密钥。除其他外,这些服务会查看文本的某些方面,如 AI 措辞中经常出现的微妙(不那么微妙)的"破绽"。例如,AI 模型似乎喜欢"this isn't [X], it's [Y]"这样的结构,并且比我们预期的更频繁地使用"quietly"这个词。识别这些模式与检查水印有本质的不同。
不会。水印只能帮助测试 Claude 是否可能生产或处理了该内容。它不说明任何关于所有权或著作权的内容,也不会改变用户在我们的条款下的权利。只有当 Claude 参与了内容或文件的处理时,我们才会应用水印。
或者,你可能会说,nubilous——这也是"obscure"的同义词。
圆周率在技术上是可预测的,但从圆周率中间某处的一串数字与十面骰子掷出的一串数字无法区分。另外,先不考虑大富翁中的骰子是从 1 到 6,而圆周率的数字可以是 0 到 9 这个事实;这个类比并不完美。