Anthropic公布Claude输出内容将嵌入隐蔽水印以识别AI生成文本,说明了技术原理、可被编辑程度及对代码生成的影响。
Anthropic 于周五发布了一篇博文,试图回答一些关于其聊天机器人 Claude 生成文本如何加水印的基本问题。比如:水印实际是如何工作的?编辑能否将其隐藏?这对代码有何影响?
自本周早些时候 Anthropic 透露将采用这种水印技术以遵守欧盟《AI 法案》的透明度准则(要求 AI 公司使用能够识别 AI 生成内容的系统)以来,Claude 用户一直在讨论这一举措。
例如,在 Reddit 上,有用户发帖称这是针对无辜 Claude 用户的阴谋,另一位用户则声称:“你不想用它的唯一原因就是要去骗人。” Business Insider 报道称,X 上“数十名”用户声称因此取消了他们的 Claude 订阅。
Anthropic 的这篇新博文首先概述了水印的概念,解释说在做出“低风险选择”时——比如在用“overcast”和“grey”描述天气之间做选择——Claude 可以在其回复中创建一种模式,“对读者来说是不可察觉的,但任何持有编码密钥的人都可以检测到”。
该公司表示:“水印不会影响 Claude 输出的质量。对读者而言,加水印的回复与未加水印的回复是无法区分的。”
更具体地说,Anthropic 表示将采用 Google DeepMind 团队在 2024 年提出的 SynthID-Text 方法,并计划发布水印检测 API。该公司还指出,水印技术与 Pangram 等公司提供的 AI 检测方法不同——后者通过寻找写作中的“蛛丝马迹”(比如“his isn’t [X], it’s [Y]”这种句式)来揭示 AI 的使用:“识别这些模式与检查水印有着本质的不同。”
有人能否通过重写文本来隐藏水印?Anthropic 表示这是可能的,但“轻度编辑可能无法完全去除水印”,而“完全重写、替换每一个词”则可以。
该公司说:“在后一种情况下,当然可以说这段文本是否还能被称为 AI 生成的还是值得商榷的。”
至于水印是否会在仅由 Claude 校对或编辑的文本中被检测到,Anthropic 表示这取决于“文本的长度以及 Claude 编辑的程度”。如果只是轻度编辑,“几乎所有的词”都是由人类作者撰写的,“水印几乎没有什么(如果有的话)可以依附的东西”。
与此同时,代码的水印应该比其他文本少,因为模型需要生成可运行的代码,不会在多种同样有效的选项之间自由选择。
“不过,话虽如此,在代码中某些特定词汇或术语存在任意选择的地方,水印仍然可以发挥作用,比如代码中的注释,”Anthropic 说。“但根据定义,它对实际生成的代码的影响可以忽略不计。”
Anthropic 还表示,Claude 不会是唯一生成带水印文本的 AI 聊天机器人,因为“其他主要模型开发者已签署相同的实践准则,并将实施自己的水印”。