AI消息速览

Claude 文本水印的工作原理

事件日期 2026-08-14 · 产业观察 · 已接受

事件日期2026-08-14
信息日期2026-08-14
入库日期2026-08-15
通道产业观察
状态已接受
来源Anthropic 博客

知识卡片:Claude 文本水印的工作原理

英文标题: How Claude's text watermark works
英文关键词: Claude; text watermark; SynthID-Text; EU AI Act; C2PA; AI-generated content transparency
原始来源: Anthropic News, "How Claude's text watermark works", Aug 14, 2026. URL: https://www.anthropic.com/news/claude-text-watermark

一句话结论

未来 Claude 模型生成的文本将包含一种对读者不可见、不影响质量/价格、且不携带用户身份信息的“文本水印”。Anthropic 表示,这是为了遵守欧盟《人工智能法案》(EU AI Act)的要求;检测方只能推断“Claude 参与生成的可能性”,不能证明文本一定由 Claude 或人类单独完成。

事件概述

  • 2026年8月14日,Anthropic 发布文章解释其文本水印技术。
  • 文章称,未来 Claude 模型会在生成文本中加入水印;Anthropic 与多家主要 AI 提供商一起实施这一改变,以符合 EU AI Act。
  • 自2026年8月2日起,欧盟要求服务其市场的 AI 提供商对 AI 生成内容进行标记。
  • Anthropic 于2026年7月签署欧盟《AI 生成内容透明度行为准则》(EU Code of Practice on Transparency of AI-Generated Content);材料称共有约190家签署方。
  • 水印将在全球范围应用,因为目前还没有持久可靠的方法按地区限定水印;日后会持续评估。

方法/产品要点

  • 原理:大模型逐词生成,在多个合理候选词之间做“低风险选择”时(例如 “cold and ...” 后接 overcast 或 grey),水印会改变随机性来源,而不是改变候选词本身。
  • 具体技术:采用 Google DeepMind 发布的 SynthID-Text 方法(Nature, 2024),该思路可追溯到 Scott Aaronson 2022 年的提议。
  • 用户可感知性:读者无法区分水印文本与非水印文本;没有隐藏字符,不向文本添加额外内容。
  • 成本与性能:不增加额外 token,不影响速度,也不会让模型服务更贵。
  • 隐私:水印和密钥不包含用户、组织或聊天记录信息,无法追溯个人或机构。
  • 非 Claude 独有:其他主要模型开发者会实施各自的水印方案;Anthropic 使用密钥检验,但不能凭此判断文本是否由其他 AI 写成。
  • 翻译:由 Claude 完成的翻译会带水印,因为每个词都由 Claude 选择。
  • 检测 API:Anthropic 称“即将”提供水印检测 API,但材料未给出具体上线时间(待核实)。
  • 图片/文件:Claude 生成受支持文件(如 .png, .jpg, .svg)时,会在元数据中加入 C2PA 内容凭证(content credential),说明文件由 Claude 制作或处理;这不等于文本水印,且不包含身份信息。

主要结果与产业意义

  • Anthropic 称内部测试未发现水印对内容、创造力或可读性有影响。
  • 引用 Google DeepMind 的 SynthID-Text 论文:向部分 Gemini 流量提供带水印模型后,用户点赞/点踩没有统计学显著差异;人工对照也未发现质量差异。
  • 产业意义:文本水印将成为大型 AI 提供商在欧盟 AI 法案下的透明度实践之一;约190家签署方参与相关行为准则,覆盖范围超出 Anthropic 一家。

为什么重要

  • 这是 Anthropic 首次以公开技术说明形式解释 Claude 文本水印的机制、边界和合规动因,而不仅是政策声明。
  • 水印提供了一种“事后判断文本是否可能由 Claude 生成”的途径,同时试图不牺牲输出质量、成本和用户体验。
  • 与既有脉络的关系:本卡片不重复“Tino Cuéllar 加入 Anthropic”“艰难问题”或“Claude for Teachers”的事实;其增量信息在于具体技术路线(SynthID-Text)、检测 API 计划、C2PA 内容凭证,以及水印在代码、事实性文本、编辑场景下的局限性。

局限与不确定性

  • 水印只能给出“Claude 可能参与写作”的可能性,不能确认文本是纯人类写作,也不能判断是否由其他 AI 生成。
  • 小样本检测效果不佳;文本越长,判断置信度越高。
  • 事实性句子、需要精确输出的代码、以及只做语法/标点修改的校对场景中,水印几乎没有可附着空间。
  • 轻微编辑大概不会完全移除水印,但逐词完全重写可以移除;此时文本是否还能算“AI 生成”是另一个问题。
  • 水印无法区分“Claude 写了全文”和“Claude 大量编辑了人类文本”。
  • 旧 Claude 模型适用过渡期,Anthropic 正在未来数月内为其加入水印;具体时间表材料未说明(待核实)。
  • 检测 API 的开放范围、密钥保管方及调用条件,材料未提供细节(待核实)。

可用于图书/PPT/简报的角度

  • 用“Monopoly / 圆周率”类比解释水印:用圆周率数字代替骰子,游戏体验不变,但事后可检查是否用了圆周率;文本水印同理。
  • 对比“可见水印”与“AI 文本水印”:后者不是肉眼可见的印记,而是统计模式。
  • 对比“文本水印”与“C2PA 内容凭证”:前者通过词序列模式检测,后者是文件元数据中的加密签名;两者都不改变内容本身。
  • 讨论“AI 内容透明度”的政策命题:如何在合规、质量、隐私和可检测性之间取得平衡。

原始材料

  • 英文标题:How Claude's text watermark works
  • 发布方:Anthropic
  • 日期:Aug 14, 2026
  • URL:https://www.anthropic.com/news/claude-text-watermark
  • 来源摘要:Future Claude models will generate text that contains a watermark. This is a way of determining the likelihood that Claude was involved in writing the text, and we, along with several other major AI providers, are implementing this change to comply with the EU AI Act.