AREX Feed Article
Anthropic 披露 Claude 水印方案:采用 DeepMind SynthID-Text,检测 API 将上线
8 月 14 日,Anthropic 发布博客《》,说明 Claude 文本水印的实现方案:采用 Google DeepMind 2024 年在 Nature 发表的 所提方法的一个版本,并预告将推出水印检测 API。博客同时划定了水印的留存边界:轻度编辑大概率去不掉,逐词全文重写则可以;代码携带的水印更少,注释却可以。
这一部署源于欧盟《AI 法案》:Anthropic 2026 年 7 月与约 190 个签署方共同签署欧盟《AI 生成内容透明度行为准则》,要求 AI 提供商对生成文本进行「标记」。
水印只改选词的随机数来源
博客先解释了原理。大模型逐词生成文本,每个词都在候选词中挑:写完 "The weather today was cold and…",下一词不太可能是 "sugary","overcast" 和 "grey" 则都说得通。这类对读者无差别的「低风险选词」,平时由随机数决定。
SynthID-Text 正是借这些选择留下模式:模式对读者不可见,却「可被任何持有对应密钥的人检测出来」("detectable to anyone who has a key that encodes it")。加水印后选词依旧随机,只是随机性的来源从普通随机数生成器换成了密钥加前文;用密钥检查词序是否与 Claude 持密钥时的选词一致,就能算出文本由 Claude 生成的概率。该方法也不会把模型推向它本不会选的词。
对输出质量,Anthropic 称内部测试未发现水印对内容、创造力或可读性的影响。
DeepMind 原论文做过对照:给一部分 Gemini 流量接上加水印模型,对比点赞与点踩评分,未见统计学显著差异;一组人类评分者并排比较加水印与未加水印的回答,同样看不出差别。
这类思路可追溯到 Scott Aaronson 2022 年的提议。Anthropic 还强调:文本中没有添加任何东西、没有隐藏字符,不多消耗 token、不涨价,水印不携带任何可追溯到用户、组织或对话的信息。
轻度编辑去不掉,全文重写可以
水印可以被编辑抹掉,但要改得够狠。Anthropic 写道:轻度编辑「大概率不会把水印完全去除」("light editing probably won't remove the watermark completely"),「每个词都被替换的完整重写」则可以;后一种情况下,「这段文本还能否算 AI 生成,本身就有争议」("it's arguable whether the text can any longer be described as AI-generated")。
校对场景同理。水印只落在 Claude 亲自选词之处;用户把自己写的文章交给 Claude 只改语法标点,返回文本里「几乎每个词都是人写的」,水印没有多少附着空间,改动越少越可能测不到。
短文也难检测:可用的选词决策太少,置信度随文本变长而上升。事实性段落的水印更稀疏,例如 "Isaac Newton's most famous work was called Principia…" 的下一词只能是 "Mathematica",水印无处下手。翻译则相反:译文每个词都由 Claude 选择,会携带水印。
代码是另一种情况。模型必须产出可运行的代码,没有「选谁都行」的自由度,因此代码携带的水印总体上少于其他文本;但注释这类有任意选择空间的地方可以用水印,对实际产出的代码影响「可以忽略」。
检测 API 只给概率,不给结论
要检查一段文本是否由 Claude 所写,Anthropic 给出的办法是检测 API:「很快会提供水印检测 API」("We will soon be offering a watermark detection API"),目前「正在敲定实现细节」,博客未给出上线时间。
即使 API 上线,它能回答的问题也有限:密钥只能算出「这段文本有多大可能部分由 Claude 所写」,既不能确认文本是人写的,也认不出其他 AI 的产物,因为别的模型即使加水印,密钥和方法都可能不同。博客写明:水印只能判断 Claude 很可能在某个时点参与过内容,无法区分「Claude 写的」和「Claude 重度编辑过的」。
博客还谈到与 Pangram 这类 AI 检测软件的差异:后者靠写作中的「迹象」推断 AI 使用。 引述博客称,「识别这些模式与检测水印在根本上是两回事」("Picking up on these patterns is fundamentally different from checking for a watermark")。
图片和文件走另一条路:Claude 生成的 .png、.jpg、.svg 会在元数据里附上 C2PA 内容凭证,一段加密签名的说明,记录文件由 Claude 制作或处理。
C2PA 是相机厂商与修图软件使用的开放标准,任何支持 C2PA 的工具都能读取,Anthropic 也会提供自己的查验入口。与文本水印不同,文件本身没有被改动,也没有嵌入任何东西。
退订、阴谋论与「不想骗人」
自 Anthropic 本周早些时候披露水印计划以来,用户争论持续。TechCrunch 报道,Reddit 上有人称这是「针对无辜 Claude 用户的阴谋」,也有人反驳:「你不想要水印的唯一理由,就是骗人」("The only reason you wouldn't want this is to lie to people")。
Business Insider 报道称,X 上有「数十名」用户声称因此取消了 Claude 订阅(TechCrunch 转述)。Anthropic 官方账号 8 月 14 日 19:16(UTC)在 ,重申水印不伤质量、不加 token、不加价、不可追溯,并附上博客链接。
全球上线,因为还没有可靠的地区限流
对全球用户统一加水印而非只限欧盟,博客给出的直接答案是:「我们目前还没有一种可靠的方式按地区限定水印」("we don't yet have a durable way to scope it by region"),并称会继续评估不同方案,有更新再公布。
对 8 月 2 日之前发布的旧模型,欧盟法律设有过渡期,Anthropic 表示正在为这些模型补水印,未来几个月内陆续推出。其他主要模型开发商签署了同一份行为准则,也将各自实现水印,标记不会是 Claude 独有。
按此前的部署,8 月 2 日及之后发布的 Claude 模型在发布时即支持标记;欧盟《AI 法案》第 50 条透明度义务已于 8 月 2 日生效。,不合规最高可处 1500 万欧元或全球年营业额 3% 的罚款,取高者。检测 API 何时上线仍无时间表;旧模型的补水印也要在未来几个月内陆续完成。