深入解析文本水印三代技术(零宽字符→统计水印→混合方案),OpenAI SynthID 与 Claude Watermark 机制对比。
在八月交替的 48 小时内,两大 AI 实验室相继开启了水印功能。7 月 31 日,OpenAI 将 SynthID 标记嵌入到所有 GPT-Live 语音输出中——恰在欧盟《AI 法案》第 50 条生效的前一天。8 月 2 日起,Anthropic 开始将一种难以察觉的水印编织进 Claude 生成的所有内容中。
我最初的想法是,这件事实际上很难做得牢靠。文本没有像素层可以藏东西。所以我阅读了 Anthropic 打算如何实现——并深入研究了文本水印的一般原理。诚实的答案是:它有用,但在很多寻常场景下也会失效。
如何在明文中隐藏标记?
这个技术思路有三代。(一个关于技术细节的优秀分解本周在 ML 工程师 Daria Berezhnaia 的帖子中走红——我借用了她对前两代的框架。)
零宽 Unicode。古老的方式:在词语之间插入不可见字符。把文本粘贴到记事本再复制出来——标记就没了。没有严肃的团队还在用这种方法。
Token 级(统计)水印。当模型生成文本时,许多词汇选择在概率上接近抛硬币:"the cat sits" 与 "the cat lies" 可能都是约 50% 的概率。一把密钥决定模型在同样概率的选项中选择哪一个,在整篇文本中反复如此。在模型高度自信的地方——某个选项有 90% 的概率——选择不受干预,所以质量几乎不受影响。持有密钥的检测器检查词汇选择是否以正确的模式"偏移"。这是学术界经典方法(绿色/红色 token 列表),而 Anthropic "嵌入文本本身" 的措辞指向的正是这种方法。
Embedding 空间水印。更微妙的一种。在模型内部,每一步都会产生隐藏状态——追踪模型"思考"过程的向量。你可以沿一个秘密方向轻微推动这些向量;词汇选择几乎察觉不到地改变,文本层面看不出什么,但统计指纹就在那里。研究正在将其推向语义聚类方向,这样 paraphrasing(转述)就无法洗掉水印。
哪些地方会失效
以下主要摘自 Anthropic 自己的文档,加上由技术原理推导出的结论:
短文本。他们的措辞是:非常短的段落留下的"信号太少,无法可靠检测"。铺开在词汇选择上的水印需要一定体量,所以标题、聊天回复或提交信息都够不着。
编辑。重度编辑、转述、翻译,或将输出混入你自己的文字,都会稀释信号直到消失。
旧模型,在 8 月之前发布的模型有一段过渡期,在此之前不适用。
截图和格式转换,会完全剥离文件元数据。
只有厂商能检测。密钥是保密的,所以没有独立验证途径:Anthropic 告诉你文本是否经过 Claude 处理;但你无法审计这个结论,而对短"看起来有偏移"的文本产生假阳性是一个真实的统计可能性。检测工具及其文档甚至还没有发布。
我没有想到的部分
检测到水印只能说明 Claude 处理过这段文本,不能说明 Claude 写了它。Anthropic 明确陈述了这一点。校对、翻译和摘要留下的水印与从头生成一模一样。我口述帖子然后让模型修正语法,所以思考是我的,水印也会在。
反过来理解也强不了多少。没有发现水印什么也证明不了。
所以真正能被可靠捕获的,是那些粘贴原始输出一个字都不改的人。任何有编辑、转译、或让文本过第二遍模型的人都能全身而退——目前没有第二个 embedding 空间水印来替代第一个,而且即使每家厂商都发布了自己的,每个密钥也仍然锁在各自的保险箱里。
语音那边有同样的漏洞——再加一个
OpenAI 的音频水印重复了这个模式:他们的 Verify 工具只回答一个问题——音频是否"由 OpenAI 制作"——而不是谁创作了文字。而语音还有自己的逃生舱:一旦带水印的音频被转录为文本,音频水印就消失了。语音转文字就是语音溯源中的模拟漏洞。
我却不这么认为。弱的溯源信号比没有信号强,总得有人先迈出第一步,而且 Anthropic 公开了局限性而不是掩盖它们。只是它无法承受人们希望它承载的重量——即证明是谁写了某篇文章的证据。
你会愿意仅仅因为让模型修正了你的逗号,就给自己的文字打上标记吗?
Sources: Anthropic — How Claude marks AI-generated content · thread on watermark mechanics by @dariadsss · OpenAI adds SynthID to GPT-Live voice · token-level watermarking: Kirchenbauer et al., "A Watermark for Large Language Models" · embedding-space: PASA, SimMark
About: I'm Aleksei, a software engineer. I dictate most of what I write.
For further actions, you may consider blocking this person and/or reporting abuse