Anthropic为Claude输出嵌入隐水印,测试显示水印在复制粘贴场景下存活,但开发者正常使用流程(如API调用、代码片段)会被剥离。
Anthropic 宣布将在新 Claude 模型生成的文本中嵌入不可见水印,包括通过其 API、编码工具和云合作伙伴产生的输出。对开发者而言,这个标记提供了一种新的方式来追踪 AI 生成文本或代码的来源,但它的强度还不足以证明其归属。
Anthropic 在一份支持文档中阐述了这一计划,称在欧盟于 2026 年 8 月 2 日或之后发布的 Claude 模型将包含机器可读的标记。该公司也在努力为旧模型添加支持。
这些标记将在全球范围内适用于支持的 Claude 产品,包括 Claude API、Claude Code、Claude Cowork 和 Claude Tag。通过 AWS、Google Cloud 或 Microsoft Foundry 生成的文本,在这些平台使用支持模型时也将携带水印。由于标记是在模型级别添加的,它会跟随输出进入构建在 Claude 之上的应用程序——而这些应用程序正在重塑企业部署 AI 基础设施的方式——不过 Anthropic 提醒说,某些平台和功能可能不支持每种类型的标记。
这一变更发生在欧盟 AI 法案第 50 条透明度要求于 8 月 2 日生效之后,该条款要求生成式 AI 系统的提供商以机器可读格式使其合成输出可被检测。Anthropic 作为生成式 AI 模型和系统的提供商签署了该伴随实践准则。OpenAI、Google、Meta、Microsoft 和 Mistral 等其他模型提供商也已承诺遵守该准则。
然而,Anthropic 对文本和文件采用了不同的处理方式。文本获得隐藏在文字本身中的水印,而支持的文件如 SVG、PNG 和 JPG 则使用 C2PA 标准接收数字签名。文件元数据可以显示 Claude 处理过该资产,以及元数据是否被篡改。
"Anthropic 表示:"因为水印是文本的一部分,当它被复制粘贴到其他地方时,会随文本一起旅行,并且可能经过一些编辑后仍然保留。"
"Anthropic 表示:"因为水印是文本的一部分,当它被复制粘贴到其他地方时,会随文本一起旅行,并且可能经过一些编辑后仍然保留。"
Token 级水印的工作原理
Anthropic 尚未解释其文本水印的工作原理,也没有说明 Claude 是否使用了 KGW、语义版本或其他方法。该公司也没有分享任何数据来说明水印是否会影响延迟或增加推理成本——对于已经在与代理 AI 工作流的隐性成本作斗争的团队来说,这一空白至关重要。
AI 检测公司 GPTZero 首席技术官兼联合创始人 Alex Cui 在 X 上的一篇技术解读中写道,运行在流式前沿模型上的足够快的水印系统通常遵循相同的一般方法。一种称为 KGW 方法的技术,会改变模型选择下一个 token 时使用的概率。
语言模型通常会为每个可能出现的 token 计算一个概率。在一个简化的水印系统中,一个密钥和前面的 token 被用来生成一个哈希值,将候选 token 分为两组,通常被描述为绿色组和红色组。然后模型略微增加选择其中一个绿色 token 的概率。
拥有相同密钥的检测器可以使用前面的文本来重建在每个位置上哪些 token 会被优先选中。包含异常高比例这些选择的段落可能携带水印。
Cui 写道,更先进的方法可以从附近文本的含义而不是精确的 token 序列中导出水印,这可能有助于信号在某些改写后存活下来,因为替换一个词并不总是会改变周围上下文。
"他们的水印需要逐 token 工作,因为他们正在将文本流式传输给用户,"Cui 写道。"许多水印方法一次规划整个句子或段落,或者在文本完全写完后才进行更改,以便使他们的水印对改写工具具有鲁棒性。"
Anthropic 尚未确认 Claude 使用了任何这些方法,但流式传输限制了可用技术,因为模型必须在生成响应的同时添加信号,而不是在完成一篇文章后重写。
代码抗拒不可见标记
代码提出了一个不同的问题,因为模型的有效选择更少。单词通常可以交换或句子可以改写而不改变其含义,但看似微小的更改可能破坏正常工作的代码。随着 AI 编码时代的成熟和更多生产代码流经模型辅助管道,这一挑战变得更加严峻。
"有些文本,比如代码,不能任意更改;否则代码会崩溃,"Cui 写道。"在这些情况下,水印需要选择性地更改文本中能够容忍同义词的部分的词汇,"比如变量名。
代码也可能难以通过正常开发工作流进行追踪。Anthropic 尚未公布展示其水印在这些更改中存活程度的测试,因此团队尚不知道 Claude 生成的补丁在经过 Pull Request 后是否仍可被检测。
"在我的测试中,水印在强烈改写下无法存活,特别是如果你结合词汇选择和句法攻击的话。"
管道会悄然擦除水印
当应用程序在将 Claude 的输出展示给用户或提交到仓库之前对其进行了更改时,会出现同样的问题。用另一个模型进行摘要、翻译、拆分为更小的部分、转换为结构化数据或与数据库内容混合,都可能使水印更难检测。
Anthropic 承认了这一限制。编辑、改写、翻译或将响应与其他文本结合可能会削弱或移除水印,而短篇摘录可能不包含足够强的信号来进行检测。
Cui 写道,坚定的用户可以通过更改段落的词汇和结构来攻击水印。
"在我的测试中,水印在强烈改写下无法存活,特别是如果你结合词汇选择和句法攻击的话,"他写道。Cui 补充说,他测试的免费改写工具能够绕过 Google DeepMind 的 SynthID 文本水印。
研究支持这些担忧。《Watermarks in the Sand》论文发现,在定义的假设下,攻击者可以在不严重损害内容质量的情况下移除水印。没有水印并不能表明 Claude 在创建内容方面没有作用。该响应可能来自旧模型、可能太短以至于无法携带可检测的信号,或者可能在应用程序管道中的某个地方被更改了。它也可能经过了不支持该类型标记的平台或功能。
发现水印也不能证明归属。Claude 可能只是对一个人写的材料进行了校对、翻译或重新格式化。Anthropic 表示,检测到的标记只意味着内容"可能已被 Claude 处理过",而不是说 Claude 创建了底层工作。
"如果 Anthropic 公开发布水印检测器,我认为他们会自我击败自己的水印。人们通过针对 Anthropic 进行测试来找到可靠的水印移除策略。"
检测带来新风险
Anthropic 计划给用户和第三方提供一种检测其标记的方式,但尚未说明这将采取本地工具、检测 API 还是仅限于选定组织的访问权限的形式。公开检测器对开发者来说更容易添加到他们的应用程序中,但它也会允许试图移除水印的人不断编辑和检查文本,直到信号消失。
"如果 Anthropic 公开发布水印检测器,我认为他们会自我击败自己的水印,"Cui 写道。"人们通过针对 Anthropic 进行测试来找到可靠的水印移除策略。"
水印背后的密钥带来了另一个挑战。泄露的密钥可能使移除标记或模仿 Claude 未产生的文本中的标记变得更加容易。这种场景让人想起当出处证明被变成伪装时发生的事情——一个本应增加信任的信任信号反而成为了攻击面。
"为了避免由此造成大规模爆炸性损害,你需要有几个密钥轮换使用,"Cui 写道。
密钥轮换将要求检测器识别使用当前和已停用密钥创建的标记,包括嵌入在数月或数年前生成的内容中的标记。Anthropic 尚未解释他们计划如何处理这些历史记录。
水印不能替代真正的出处追踪
对开发者而言,Claude 的水印最好被视为另一个线索,而不是审计日志或出处追踪的替代品。需要显示人工产物来源的应用程序可以记录模型 ID、提示版本、响应时间和原始输出的哈希值,然后记录在到达用户或提交到仓库之前所做的任何更改。
在水印公告发布之际,Anthropic 正在导航关于其模型在现实世界中做什么的更深层次问题。最近的事件暴露了实验室安全评估与现实世界控制之间的差距,该公司已公开支持要求最强大的 AI 实验室放慢进度的呼吁。水印符合这种姿态——一种透明度机制而不是安全保证——但其实际价值取决于 Anthropic 尚未分享的技术细节。
Anthropic 告诉客户自己判断第 50 条如何适用于他们的产品,并表示更多技术文档即将发布。但直到 Anthropic 分享这些细节,团队不知道他们将如何检测这些标记、密钥轮换如何工作,或者水印在代码和应用程序输出的常见更改中能存活得多好。