跳到正文
Anthropic News·· 2026-08-14精选AI 评分71

Claude 文本水印如何工作

How Claude’s text watermark works

AI 导读

Anthropic 宣布未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 参与写作的可能性,以符合欧盟 AI 法案要求。该水印采用 Google DeepMind 2024 年发表的 SynthID-Text 方法,只改变模型选词时随机性的来源,不增加 token、不影响输出质量与速度,读者无法分辨水印文本与普通文本。

推荐理由

Anthropic 官方解释文本水印的技术原理与检测边界,读者可据此判断水印对输出质量和成本的实际影响。

正文 · AI 翻译

未来的 Claude 模型生成的文本将包含水印。这是一种判断 Claude 是否可能参与文本写作的方式,我们与其他几家主要 AI 提供商一起实施这一变更,以遵守欧盟《人工智能法案》。

在本文中,我们分享了一些关于我们所选水印方法如何运作、是否影响 Claude 的输出以及我们为何做出这一变更的问题的解答。总结如下:

  • 我们使用的水印方法对 Claude 输出的质量或内容没有任何实际影响;
  • 读者无法区分带水印和不带水印的文本;
  • 文本中未添加任何内容,也没有隐藏字符;
  • 水印不需要额外的 token,也不会更昂贵;
  • 水印不包含任何身份识别信息,无法追溯到特定个人、组织或对话;
  • 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求在其市场提供服务的 AI 提供商对 AI 生成的内容进行标记。其他主要模型开发者已签署相同的实践准则,并将实施各自的水印。

什么是水印?

像 Claude 这样的大型语言模型通过一次生成一个词来工作。每次模型决定下一个词时,它会从一系列潜在候选中进行选择,最终根据前文选择最合理或最可能的词。以句子“今天的天气又冷又……”为例。下一个词极不可能是“甜腻的”。但很可能是“阴天”或“灰暗”。在大多数情况下,模型最终选择后两个词中的哪一个对读者来说并不重要——无论哪种选择,句子的含义基本相同。在这种情况下,选择由随机数决定。

水印利用这些低风险的选择——它们在一段生成的文本中会出现多次——在 Claude 的回复中留下一种模式。这种模式读者无法察觉,但是任何拥有编码密钥的人都能检测到的。使用水印时,选择仍然是随机做出的,但随机性的来源不同。水印不是使用任意随机数生成器来选择下一个词,而是使用密钥和前面的几个词来决定模型应该选择哪个词。也就是说,Claude 选择的词仍然是随机的,但现在,人们可以检查词的序列,看看它是否与 Claude 在使用密钥时会做出的选择一致。如果一致,就可以为文本由 Claude 生成赋予一个概率。

重要的是,这并不是说模型现在总是偏向于“阴天”或“灰暗”。与非水印文本一样,根据前面的词,一个句子中可能选择“阴天”,下一个句子中可能选择“灰暗”。而且,水印方法并不会促使 Claude 选择一个它本来不会考虑的词(例如,它不会让 Claude 选择像“nubilous”这样的词——这是“阴天”或“灰暗”的一个生僻1同义词,Claude 在正常情况下几乎肯定不会使用)。

水印如何影响 Claude 的输出?

水印不会影响 Claude 输出的质量。对读者而言,带水印的回复与不带水印的回复无法区分(在这方面,AI 水印与纸币、其他实物以及某些数字文件上的同名水印有本质区别,后者是肉眼可见的)。

在内部测试中,我们未发现水印对 Claude 文本的内容、创造力水平或可读性有任何影响。在介绍我们所使用技术的 SynthID-Text 论文中,Google DeepMind 通过将使用水印的模型服务于其部分 Gemini 流量,并比较点赞和点踩评分来测试这一影响。他们发现与未加水印的模型相比没有统计学上的显著差异。在一项对照研究中,人工评分者对带水印和不带水印的回答进行并排比较,也未发现质量上的差异。

一个有用的类比是想象你在玩类似《大富翁》的游戏。每一回合,每位玩家根据掷骰子的结果在棋盘上随机移动若干格。假设我们不用掷骰子来获得这种随机性,而是决定使用一本圆周率数字表。2 我们从一个随机选择的数字开始(比如小数点后第 1,012,845 位,恰好是 6),从那时起每位玩家只需使用序列中的下一个数字作为他们的下一次“掷骰”。

从各方面来看,这些移动仍然是随机的:无论随机性来自圆周率还是每次掷骰子,对玩家——或对游戏结果——都没有区别。但如果我们能在游戏结束后看到所有移动的序列(并且我们知道圆周率的值),我们就能推断出这场游戏是否可能是用圆周率来决定其移动的。从某种意义上说,使用圆周率的游戏被“加了水印”。

Claude 生成的文本也是如此。水印不会改变阅读者的含义或体验,但如果你想事后检查文本是否可能由 Claude 生成,水印可以让你做到这一点。

你们具体使用哪种水印方法?

Claude 的文本水印是 Google DeepMind 于 2024 年在一篇 Nature 论文中发布的 SynthID-Text 方法的一个版本。它属于可追溯到 Scott Aaronson 在 2022 年提出的一项提案的一系列方法,这些方法都遵循我们上面描述的相同设计原则——水印只改变用于选择词语的随机性来源。

水印的有效性存在局限。使用我们的密钥,只能回答“这段文本有多大可能是部分由 Claude 撰写的?”这一问题。它不能确认文本是否由人类撰写,也无法判断文本是否由另一个 AI 撰写(即使那个 AI 使用了水印,它也会有不同的密钥;它也可能使用完全不同的水印方法)。在样本较小时,水印检测效果也不佳,因为此时词语选择更少,可供依据的信息也更少。随着段落长度增加,对 Claude 参与其中的置信度也会提高。

在事实性段落中,水印更为稀疏,因为在不降低文本准确性的前提下,可做的选择更少。例如,看这句话:“Isaac Newton’s most famous work was called Principia…”。下一个词是不是“Mathematica”至关重要(这是唯一正确答案),因此水印无从作用。校对也是如此。如果你把一篇文章交给 Claude,要求它只修改语法和标点,其他一概不动,那么水印只能存在于少数几处修改中,可能少到无法被识别。

如果 Claude 校对或编辑了人类文本,情况又如何?

水印只作用于 Claude 自己选择的词。当 Claude 校对由人撰写的文本时,它返回的内容通常只经过轻微编辑;因为几乎所有词都是原作者写的,水印几乎没有(甚至完全没有)可以附着的地方。取决于文本长度以及 Claude 编辑的程度,这些改动可能不足以让 Claude 的参与变得可被检测。Claude 写得越多,需要做的选择就越多,水印可发挥的空间也越大。

代码呢? 

正如我们上面提到的,AI 水印利用的是那些无论选哪个词都同样合适的决策点。在需要精确输出的地方——没有选择余地,换一个词就会在事实上出错,或导致代码无法运行——水印不会被应用。

例如,当模型已经写出“2 + 2 =”时,下一个 token 有非常明确的最佳选择(如果模型是在完成这个加法,就没有哪个答案能和“4”一样好;如果它是在谈论 George Orwell 的 Nineteen Eighty-Four,就没有哪个答案能和“5”一样好)。水印的“轻推”在这里不会被应用。出于同样的原因,代码——在很多情况下必须精确——通常比其他一些文本形式带有更少的水印。

话虽如此,在代码中某些词或术语之间确实存在任意选择的地方,水印仍可使用,例如代码中的注释。但顾名思义,它对实际生成的代码影响微乎其微。

这对用户意味着什么?

这会让模型变慢,或变得更贵吗?


不会。水印对模型速度的影响微乎其微,而且由于它不会产生额外的 token,模型的服务和使用价格保持不变。

水印能被追溯到我或我的组织吗?

不能。水印作用于 Claude 及其输出。它不会识别任何与单个用户有关的信息。水印或其密钥中没有任何内容,能让任何人恢复关于用户、其组织或他们与 Claude 对话的任何信息。

你们为什么要给 Claude 的输出加水印?

我们正在实施水印技术,以遵守欧盟《人工智能法案》。Anthropic 与其他几家主要 AI 模型提供商以及约 190 个签署方一起,于 2026 年 7 月签署了《欧盟人工智能生成内容透明度行为准则》。该准则要求 AI 系统提供商使用对 AI 生成文本进行“标记”的方法。我们在发布时会在全球范围内应用水印,因为我们目前还没有一种持久的方式按地区来限定其范围。不过,我们将继续评估不同的方法,并在有进展时分享最新信息。

其他问题

如何判断一段文字是否由 Claude 撰写?

我们正在以私密预览的形式发布一个检测 API。根据欧盟法律的要求,它目前面向符合条件的组织开放(例如监管机构、执法部门、媒体、事实核查机构、独立研究人员、教育组织和欧盟民间社会团体)。对于同样有义务为自身遵守该法案而验证水印的企业,该 API 也可供其使用。我们计划随时间推移扩大检测 API 的访问范围。你可以在此处登记访问意向。

图像和其他文件呢?

当 Claude 生成受支持类型的文件(例如 .png、.jpg 或 .svg)时,它会在文件元数据中附加一份内容凭证,形式是一小段经过加密签名的说明,表明该文件是使用 Claude 制作或处理的。这是一种名为 C2PA 的开放行业标准——相机厂商和照片编辑软件也使用同一标准来记录图像的来源。任何支持 C2PA 的工具都可以读取它;我们将提供自己的工具,你可以把文件拖入其中进行检查。

这种元数据标签与水印非常不同。文件本身没有任何改变——它没有被嵌入或隐藏。与文本一样,该凭证只表明 Claude 参与了该文件的生成;它不包含任何可识别身份的信息。

难道不能通过编辑文本来绕过水印吗?

在某种程度上可以。轻度编辑可能不会完全去除水印;而将每个词都替换掉的彻底重写则会。在后一种情况下,当然可以说这段文本是否还能被描述为 AI 生成的就存在争议了。

水印究竟能证明什么?

水印只能确定 Claude 很可能在某个时候参与了该内容。它无法区分“Claude 写了这个”和“Claude 大量编辑了这个”。

水印适用于翻译吗?

是的。由 Claude 生成的翻译会带有水印,因为在这种情况下,每个词都是由 Claude 选择的。

较旧的 Claude 模型呢?

欧盟法律为 2026 年 8 月 2 日之前推出的 Anthropic 模型规定了过渡期,我们正在努力为这些模型也添加水印。这将在未来几个月内逐步推出。

这与 Pangram 等 AI 检测软件有何不同?

AI 检测软件使用不同的方法,因为提供这类软件的公司没有我们的密钥。除其他事项外,这些服务会考察文本的各个方面,比如 AI 措辞中经常出现的细微(以及不那么细微的)“破绽”。例如,AI 模型似乎很喜欢“这不是 [X],而是 [Y]”这种句式,并且使用“quietly”一词的频率远高于你的预期。识别这些模式与检查水印有着本质区别。

这会改变给定输出的所有权归属,或谁对其承担法律责任吗?

不会。水印仅有助于检测内容是否可能由 Claude 生成或处理。它不涉及所有权或作者身份,也不会改变用户根据我们条款所享有的权利。我们仅在 Claude 参与处理内容或文件时才会应用水印。


2026 年 9 月 1 日更新:提供了有关水印检测 API 的最新信息。

来源:Anthropic News · anthropic.com