Claude 文本水印只是来源信号,不是作者身份判决
面向创始人的 Claude 水印检测指南:如何使用概率性来源信号,又不把它误判为作者身份、内容真假或违规证据。
Anthropic 在 2026 年 8 月 14 日宣布,未来的 Claude 模型将生成带有统计水印的文本。该公司表示,这种标记可以用于判断 Claude 是否参与过一段文字的生成;它不会加入隐藏字符或可识别用户身份的数据,未来还会提供检测 API。这是一项值得关注的基础设施变化,其部分推动力来自 8 月 2 日开始适用的欧盟 AI Act 透明度规则。
对 AI 应用创始人来说,真正重要的并不是“终于有检测器了”。更重要的是,一种机器可读的来源信号,很快可能被轻易接入内容审核、出版、教育、招聘、客服或交易平台。产品可以在几毫秒内把一个概率结果变成标签、人工复核、限制,甚至处罚。绝大多数产品风险,就发生在这个决策层。
本文的核心判断很明确:Claude 水印结果只能说明模型参与的可能性,不能证明谁是作者、谁拥有内容、内容是否真实、当事人有何意图,更不能单独证明违规。合格的产品必须让这个狭窄含义从 API 返回值一直保持到用户可见的动作。本文会解释机制,定义一份证据包,走完一个真实感较强的投稿场景,并给出后果阶梯、测试矩阵,以及不应让水印检测主导决策的边界。
这次发生了什么,还有哪些关键未知项
Anthropic 的官方说明确认了几件事。未来 Claude 模型将采用 Google DeepMind SynthID-Text 的一种变体。它改变的是模型在多个合理候选 token 之间选择随机性的方式,而不是插入可见文字或隐藏字符。Anthropic 表示,这项机制不增加 token,几乎不影响速度,不包含个人、组织或对话标识,并会在上线初期全球启用。较早发布的模型则计划在过渡期内陆续加入水印。
同一份公告也明确写出了限制。短文本、事实性答案、轻度校对和代码里可替换的词更少,所以检测能力会更弱。Claude 完成的翻译可以携带水印,因为译文中的词由 Claude 选择。大幅改写可能削弱或去除可检测性。即使结果为阳性,也无法区分“Claude 写了这段文字”和“Claude 对这段文字做了大量编辑”。Anthropic 说检测 API 即将提供,但目前尚未公布实现细节。
最后这一点足以阻止团队今天直接接入生产环境。当前还没有公开的 endpoint、返回结构、阈值策略、模型覆盖表、数据保留政策、服务等级、争议处理流程,也没有针对 Anthropic 检测器的独立生产误差研究。这次发布是一个很好的理由,让你现在就设计决策政策和测试样本;它不是让你自行编造 API 行为的理由。
更广义的机制已经有扎实研究。Nature 上的 SynthID-Text 同行评审论文描述了生成采样阶段的统计信号和带密钥的评分流程。论文报告称,在接近 2000 万条带水印和不带水印的 Gemini 回复上,真实用户反馈没有显著质量差异,受控实验也得出相近结果。这些证据支持 Google 当时所评估配置的生产可行性,但不能直接证明 Anthropic 未来采用何种阈值,更不能代表你的产品会得到怎样的错误率。
设计功能前,先把五个术语说清楚
很多团队会把几种不同的判断都压缩成“检测到 AI”。在设计徽标或执法规则前,先把它们分开。
水印(watermark),是生成过程中被有意加入的信号。在 SynthID-Text 一类文本系统里,它表现为 token 选择中的统计模式。它不是正文末尾可见的说明,也不一定是附着在文件上的元数据。 检测分数(detection score),是某段文字与特定水印密钥和方法所对应模式之间的证据强度。只有在某个人或机构设定阈值后,分数才会变成分类。它不是一个通用的“这段文字有百分之多少由 AI 写成”。 模型参与(model involvement),表示覆盖范围内的模型生成或实质处理过部分受检文字。它不识别是谁输入了提示词,也不识别后来是谁修改了内容,更不能说明哪个组织应对发布负责。 作者身份(authorship),是人的、编辑流程中的、合同上的或法律上的归属。统计性来源信号无法单独解决这个问题。一个人可能指挥 AI、重写、核验并最终承担责任;另一个人也可能把未经复核的模型输出直接署上自己的名字。两种情况下,水印结果可能完全一样。 来源链(provenance),是关于一份内容如何形成的历史证据。它可以包括生成记录、模型与版本、时间戳、修改轨迹、人工批准、加密凭证和发布历史。C2PA 的解释文档明确指出,来源凭证可以让有关来源与修改的声明具备防篡改能力,但无法判断内容本身是否真实、准确。这五个术语可以导出一条直接的产品规则:当系统真正知道的只是“在这个样本中检测到某种水印”,就绝不能显示“AI 写了这篇内容”。
把水印结果理解为有范围的假设检验
SynthID-Text 会调整 token 的采样方式,让持有对应密钥的检测器能够测量最终序列中的统计模式。Google DeepMind 的机制说明指出,较长、表达空间更大的文本,会提供更多嵌入信号的机会;短文本、约束很强的文本和事实性内容则更少。翻译、大幅改写、截断,以及人类和模型共同写成的混合文本,都会改变检测器能够观察到的证据。
创始人不需要自己实现评分公式,但产品团队必须理解四个后果。
第一,没有检测到,不等于人类原创。文本可能来自没有水印的 Claude 版本、其他模型、本地开放权重模型、经过大幅修改的 Claude 草稿、很短的 Claude 回复,或由受覆盖模型执行但 token 选择空间很小的任务。“未检测到”只表示检测器在当前条件下没有发现足够证据。
第二,检测到水印,不等于内容全部由模型生成。一个带水印的段落可能嵌在整篇人工报告中;人类也可能对 AI 草稿做了大量编辑,但仍保留足够信号。检测器最多支持“覆盖范围内的模型很可能参与过”,不能据此否定所有实质性人工工作。
第三,阈值背后是一项后果取舍。适合添加中性复核提示的阈值,未必适合拒绝学生作业、冻结卖家、指控作者欺诈。API 厂商可以返回证据,但允许这份证据触发什么动作,是你的产品决定。
第四,覆盖范围受模型和时间限制。Claude 的密钥不能检测 Gemini、本地未加水印模型或所有历史 Claude 输出。结果里必须保存当时的覆盖声明和检测器版本。否则,后续复核者无法还原系统当时究竟检测了什么。
欧盟委员会 2026 年发布的《AI 生成文本标记与检测技术方案》,把水印与结构化标记、元数据、日志和通用 AI 文本检测并列评估。报告提出的五个属性很适合作为提醒:有效性、鲁棒性、可靠性、可访问性和互操作性是不同要求。一个检测器可以在某条受控路径里表现很好,却仍然不适合直接生成面向用户的判决。
为每次检测建立“水印证据包”
不要只保存一个 detected: true。你需要保存理解结果、复现结果和提出异议所需的条件。下面这份证据包是一种产品工件;等真实 API 文档发布后,再用实际字段调整。
watermark_check:
check_id: "不可变 ID"
checked_at: "ISO-8601 时间"
purpose: "中性标签 | 人工复核 | 权限决策"
input:
content_hash: "sha256"
token_or_character_count: "如可用,两者都记录"
language: "用户声明与系统识别"
content_type: "文章 | 代码 | 翻译 | 混合 | 其他"
scope: "全文 | 摘录 | 指定片段"
user_edit_claim: "未修改 | 轻度 | 大幅 | 未知"
detector:
provider: "Anthropic"
endpoint_version: "必填"
watermark_family: "文档公布值"
covered_models: ["文档公布的模型 ID"]
threshold_policy_version: "内部政策 ID"
result:
raw_score_or_band: "厂商原始返回"
classification: "检测到 | 可能 | 未检测到 | 无法判断"
limitations: ["样本过短", "低熵", "混合作者"]
corroboration:
generation_receipt_present: false
revision_history_present: false
user_explanation_requested: false
action:
consequence_level: 0
decision: "仅记录"
reviewer: "系统或人工复核者 ID"
appeal_available: true
expires_or_recheck_at: "必填"
如果不需要保留敏感全文,就保存受检输入的哈希,而不是文本本身。如果申诉流程必须保留原文,就明确说明用途和删除期限。产品能够访问私人草稿,不等于可以默默把它提交给第三方检测器。检测是新的处理目的,可能需要新的用户告知、许可、合同审查或区域控制。
“无法判断”必须成为一等状态。即使厂商只返回二元结果,只要文本超出已验证的长度、语言、内容类型或模型覆盖范围,你自己的政策仍然可以把它归为无法判断。强制使用二元字段,并不能把现实也变成二元。
走完一个真实感较强的投稿案例
假设 DraftMarket 是一家小型交易平台,领域专家可以在上面出售可复用的政策模板。它对买家的承诺是:每份模板都有一位具名专家编辑,引用来源经过核验,并保留修改历史。平台并没有承诺“完全没有使用 AI 工具”。
一名卖家上传了一份 3000 词的职场政策模板,并勾选“由我撰写和审核”。DraftMarket 未来接入的检测器,在其中两个章节返回了很强的 Claude 水印信号。最粗暴的流程会自动把商品标签改成“AI 撰写”,冻结付款,并以欺骗为由标记卖家。
这个动作已经远远超出证据。卖家可能先写了大纲,再让 Claude 扩写两个章节,然后逐条核对规则;也可能让 Claude 翻译自己的原文;甚至可能是卖家交稿后,外部编辑又处理了文件。平台的勾选项本身也可能含糊:“由我撰写”究竟指每个 token 都亲手输入、承担编辑责任,还是合同上的内容所有权?检测器无法回答这些问题。
DraftMarket 应该把这个信号用于发起一项有边界的澄清。平台可以告诉卖家:在指定片段中检测到与 Claude 相关的来源信号;该结果不识别具体用户,也不单独证明违规。然后请卖家说明实际流程:生成、翻译、实质编辑、仅校对、本人不知情,或由第三方处理。卖家可以附上修改历史,也可以说明外包编辑环节。
接下来,平台应该核对自己真正做出的承诺。如果规则要求披露 AI 辅助,就更新结构化披露;如果产品承诺的是具名专家审核,就核验来源,并让专家签署编辑责任凭证;如果合同确实禁止某种流程,则由人工结合商品规则、投稿记录、卖家解释和水印结果做决定。买家最终看到的应该是“由 AI 辅助起草,具名专家已复核并承担责任”一类有用说明,而不是没有根据的作者身份判决。
水印在这里确实创造了价值。它提出了现有记录没有回答的问题,但没有替代这个问题本身。
让证据强度匹配动作后果
为产品建立一条后果阶梯,防止同一个分数悄悄从统计分析迁移到处罚系统。
| 级别 | 产品动作 | 最低证据要求 | 水印的角色 |
|---|---|---|---|
| 0. 观察 | 汇总内部覆盖数据 | 有效的检测返回和已记录的样本范围 | 因为不会影响个人,信号可以单独用于统计 |
| 1. 告知 | 显示中性的“Claude 可能参与”提示 | 版本化结果、清晰限制、纠错渠道 | 主要来源信号,但绝不是作者标签 |
| 2. 复核 | 进入人工队列或请求补充披露 | 结果有效,且长度、类型、语言符合条件,并已告知用户 | 只触发流程,不做最终决定 |
| 3. 限制 | 延迟发布、付款、排序或访问 | 另有工作流证据、适用规则、具名复核者和申诉机制 | 只能作为辅助证据 |
| 4. 处罚 | 停用账号、公开指控、解除关系或报告违规 | 独立证据能够证明实际违规,并提供正当程序 | 绝不能单独成立 |
对大多数小型产品来说,自动化动作的上限应该是第 2 级。复核队列是可逆的;公开指控、收入损失、申请被拒或学术处罚,即使后来申诉成功,也可能难以修复。
规则应该围绕真正被禁止或必须履行的行为来写,而不是围绕检测器来写。“卖家必须披露由模型生成的章节,并承担编辑责任”是一条产品规则;“水印分数必须低于 0.2”只是一个假装成政策的实现捷径。前者能适应检测器升级;在 API 尚未公布分数范围前,后者甚至无法被正确评估。
测试真实变换,不要只测干净模型输出
把 Claude 刚生成的完整文章直接送进匹配检测器,只覆盖了最容易的演示路径。上线测试必须代表用户真正会提交的内容。
| 测试样本 | 要验证的问题 | 产品必须表现出的行为 |
|---|---|---|
| 较长、未经修改的受覆盖模型输出 | 基础阳性路径 | 按文档定义的区间检测,并使用有范围的提示语 |
| 很短的事实答案 | 低熵与长度边界 | 返回无法判断,或禁止用于高后果动作 |
| 含注释的源代码 | 约束 token 与混合区域 | 不得因为未检测到就推断为人工编写 |
| 轻度编辑的草稿 | 正常编辑后的信号 | 分开保留结果与编辑限制 |
| 完整翻译输出 | 新语言中的模型选词 | 视为模型参与,不视为原语言作者身份的证明 |
| 人工文档中嵌入一个带水印段落 | 混合作者与信号稀释 | 标明受检片段,不给整篇文档或用户贴标签 |
| 经另一模型改写 | 擦除与链路歧义 | 记录证据退化,不宣称一定没有模型参与 |
| 只由模型修改标点的人工文本 | 辅助编辑边界 | 预期信号很弱,不得反向宣称全部由模型生成 |
| 未加水印模型的输出 | 覆盖边界 | 返回“未检测到受覆盖水印”,而不是“人工原创” |
研究表明,良性改写和对抗性改写都值得测试。原始研究《On the Reliability of Watermarks for Large Language Models》发现,只要保留的 token 足够多,某些水印在改写后仍可被检测;同时,混合文本与修改操作会改变证据曲线。另一项原始研究《Watermark Stealing in Large Language Models》展示了针对部分水印方案的近似逆向方法,可以支持信号擦除和伪造攻击。这两篇论文都没有评估 Anthropic 尚未发布的检测器,所以它们只能作为威胁模型,不能充当 Claude 的误差数据。
运行测试前就写好通过标准。标准必须包含每种结果允许触发的最高后果,而不能只检查 API 是否成功返回。检测服务一直在线,但 UI 错误解释了返回值,仍然是一次产品测试失败。
避免七种可预见的产品失败
把“未检测到”写成“人工原创”。这忽略了未覆盖模型、历史模型、改写程度、样本长度、内容类型和检测误差。安全表达应该是:“本样本中未检测到受覆盖的水印。” 把“检测到”写成“欺诈”。工具不知道用户如何披露、合同如何约定、当事人意图是什么、完成了多少编辑工作,也不知道谁承担责任。必须评估真实政策,并收集其他证据。 用一个片段给整个账号定性。模型参与是针对具体内容和片段的判断。不能把一个带水印段落变成永久用户风险分。 阈值变化后不重新验证。厂商更新可能改变分数或区间。尽可能固定检测器版本,同时为内部政策编号,重新运行测试样本,并让历史决策可以复现。 悄悄把私人内容传给第三方。学生作文、法律备忘录、客服对话、未发表手稿或员工文件都可能包含敏感数据。只提交必要片段,定义保留规则,并明确披露检测子处理方。 用可见标签冒充事实核验。水印存在与否,都不能说明日期、事实、引用和建议是否正确。来源核验和领域专家复核必须保持独立。 产品没有真正的申诉入口。用户需要看到受检范围、中性结果、适用规则和人工决策负责人,也需要能够提供修改历史或背景。“我们的 AI 这样说”不是申诉机制。把水印、日志、来源凭证与公开披露分开
不存在一个万能的“来源开关”。下面四种机制回答的是不同问题。
水印可以在普通复制已经去掉元数据后,继续提示某个受覆盖生成器可能参与过。它会因改写而减弱,并依赖兼容的密钥和检测器。 生成日志可以在你自己的系统里记录提示词、模型 ID、输出、时间和用户。它在内部工作流中可以很精确,但通常不会随复制后的内容传播,同时会带来隐私与安全义务。 来源凭证会以加密方式绑定关于文件来源与修改的声明。Anthropic 表示,PNG、JPG、SVG 等受支持文件将获得 C2PA 元数据;这与文本统计水印是不同机制。来源凭证可以从文件中被删除,而且 C2PA 明确强调,它无法证明图像或文字中的事实主张为真。 面向人的披露,是在用户第一次接触内容时告诉他们真正相关的信息。欧盟委员会最终版《AI 生成内容透明度实践守则》把提供者侧的标记和检测,与部署者侧的公开标签分开处理。第 50 条实际条文也区分机器可读标记和公开披露,并包含范围明确的例外。水印检测不能替代法律角色判断,也不能替代清晰的产品沟通。只有在后果足够重大时,才应该叠加多层机制。例如,涉及公共利益的出版流程,可能同时保存内部生成日志、保留文件的 C2PA 凭证、检测文本水印、要求编辑审核事实,并展示适当披露。普通头脑风暴工具也许只需要互动告知和常规活动记录。实际的第 50 条义务应咨询熟悉当地法律的专业人士;本文框架不是法律结论。
接入前,先向厂商索要“检测器契约”
Anthropic 发布 API 后,不要从 SDK 示例开始。先要求一份可运营的契约。
- 究竟覆盖哪些 Claude 模型版本和日期?
- 验证过哪些输入长度、语言、领域和改写方式?
- 返回的是原始分数、校准概率、置信区间、二元判断,还是可以弃权?
- 由谁选择阈值?在对应阈值下公布了怎样的假阳性和假阴性结果?
- 如何处理人类与模型共同写成的片段?
- 检测服务、密钥服务或覆盖注册表不可用时会发生什么?
- 提交文本是否会被保留、记录、用于滥用审查或模型改进?
- 客户能否限制数据区域、获得数据处理协议并请求删除?
- 版本变化如何通知?历史结果能否复现?
- 是否提供建议的用户提示语和争议处理渠道?
如果 API 不支持弃权状态,就在你的封装层补上。如果厂商不能说明覆盖模型,就把结果限制在低后果观察。如果输入保留政策不清晰,就不要提交敏感客户内容。文档缺失并不意味着你应该写出更强硬的政策,只意味着你应当给这项信号更小的权限。
明确适用场景,也明确不适用场景
当产品接收的是较长文本,来源模型很可能在覆盖范围内,用户理解检测用途,而且立即动作可逆时,水印检测会比较有价值。例如:邀请用户补充披露、决定编辑复核优先级、审计自有生成管线是否正确加水印,或研究汇总后的内容流向。
如果输入是短答案、代码、精确引用、公式、轻度校对、混合模型流程、历史档案或去中心化开放权重模型的输出,它就不适合作为主要控制。它也绝不应该单独决定学术处罚、招聘结果、欺诈指控、账号停用、付款冻结或公开归因。
如果团队还没有定义真正重要的用户行为,就不要部署检测器。如果要求是“所有事实主张都必须有来源”,就检查引用和证据支持;如果要求是“具名专家承担责任”,就收集编辑责任凭证;如果要求是“这份数据不能离开系统”,就控制网络出口和供应商;如果要求是“用户必须知道自己正在和 AI 互动”,就展示清晰告知。水印不会自动解决任何一个问题。
用一份 48 小时准备清单收尾
即使检测 API 还没有上线,小团队也可以先把决策层准备好,同时不假装产品已经可以发布。
前四小时:写下产品对用户的准确承诺;列出检测结果可能影响的所有决定;把自动化上限设为第 2 级;盘点敏感内容;指定产品、信任、隐私和申诉负责人,即使同一个人兼任多个角色也要明确记录。 第一天结束前:分别为“检测到、可能、未检测到、无法判断”写好用户提示语;建立证据包结构;定义保留期限;起草纠错和申诉流程;明确列出“人工原创、欺诈、已核验事实”等禁止推断。 第二天:准备九类变换测试样本;记录预期行为和后果上限;设计检测服务不可用时的产品表现;让真正负责底层政策的人审查完整流程;准备好前面的十个厂商问题。在 API 文档能够回答你的后果级别所需问题,而且完整流程已经用真实返回结构通过测试前,不要上线。最终决策应该属于下面四种状态之一:
- 观察:只做汇总或内部分析,不对个人产生后果。
- 辅助:显示中性提示或触发人工复核,同时提供申诉和证据保留。
- 暂缓:API 覆盖、隐私条款、校准或故障行为仍不充分。
- 拒绝该场景:目标动作需要判断作者身份、事实真伪或违规,而这项信号无法提供相应证据。
参考资料
- Anthropic:Claude 文本水印如何运作
- Nature:Scalable watermarking for identifying large language model outputs
- Google DeepMind:Watermarking AI-generated text and video with SynthID
- Google DeepMind:SynthID 概览
- 欧盟委员会:AI 生成内容透明度实践守则
- EU AI Act Service Desk:第 50 条
- 欧盟出版局:AI 生成文本标记与检测技术方案
- NIST:Reducing Risks Posed by Synthetic Content
- C2PA:Content Credentials 解释文档
- Kirchenbauer 等:On the Reliability of Watermarks for Large Language Models
- Jovanović、Staab 与 Vechev:Watermark Stealing in Large Language Models