引言
Anthropic 已开始解释其将如何为未来 Claude 模型生成的文本添加标记,以便日后能够检测出 AI 的参与。
该水印有意对读者不可见。它不会在普通文本中添加标签、隐藏 Unicode 字符串、跟踪 ID 或额外元数据。相反,Claude 会在做出原本无关紧要的词汇选择时略微改变方式,从而形成一种可以通过密钥验证的统计模式。
Anthropic 表示,推出该系统是为了遵守欧盟《人工智能法案》的透明度要求,该要求于 2026 年 8 月 2 日起生效。
这一公告立即引发了一些开发者和专业用户的反对。他们担心的不仅仅是完全由 AI 生成的文本,还担心当 Claude 被用于翻译、重写、摘要或编辑人工撰写的材料时会发生什么。
几天之内,多名开发者就发布了以“AI 水印移除器”为卖点的工具。
由此引发的争论不仅仅关乎水印能否被删除,更在于这一标记究竟能证明什么、统计文本水印的鲁棒性有多强,以及当用户故意篡改 AI 来源信号时法律责任由谁承担。
Anthropic 的水印是统计模式,而非隐藏字符
最重要的技术要点也是最容易被误解的一点。
Claude 的新文本水印并非通过插入不可见字符来实现。
Anthropic 表示不会向文本附加任何额外内容。相反,当模型在下一个词的多个同样合理的选择之间取舍时,会使用一个水印密钥。
设想 Claude 在一个句子中自然可以在“grey”和“overcast”之间选择,而不改变含义。
在正常的模型响应中,这一选择可能受普通随机性影响。
启用水印后,随机选择改为由密钥和前述文本推导而来。在许多符合条件的词汇选择中重复这一过程,就会在最终段落中留下统计模式。
知道密钥的检测器可以估算该段落与 Claude 加水印生成过程的一致性程度。
Anthropic 表示其实施基于 Google DeepMind 发布的 SynthID-Text 方法。
因此,该水印与以下机制有着根本区别:
- 不可见 Unicode 字符
- HTML 注释
- 文档属性
- EXIF 字段
- C2PA 元数据
- 可见图像水印
这些机制通常可以在不重写底层文本的情况下被移除。
统计文本水印存在于措辞本身之中。
Claude 水印能——以及不能——证明什么
Anthropic 对阳性检测结果的含义持谨慎态度。
检测到水印并不证明 Claude 撰写了整个文档。
它仅表明 Claude 可能参与生成了部分措辞。
这一区别对以下工作流至关重要:
- 编辑
- 重写
- 翻译
- 摘要
- 草稿润色
- 协作写作
对于轻度校对,Anthropic 表示可能改变的词太少,水印无法
可靠地注册。
对于翻译来说,情况则不同。Claude 基本上会选择输出的每一个词,因此 Anthropic 表示译文可以携带水印。
较长的文本段落也比短文本更容易评估,因为它们包含更多的词汇选择决策。
代码是另一个特殊情况。精确的语法留给低风险选择的空间更小,因此代码通常比散文文本提供更少的水印嵌入空间,尽管注释和自主命名仍可能携带信号。
Anthropic 为何添加水印
Anthropic 表示,这一变更是为了遵守欧盟《人工智能法案》。
第 50 条透明度义务自 2026 年 8 月 2 日起适用。
欧盟委员会的指导要求生成式人工智能系统的提供商添加机器可读标记,使人工智能生成或篡改的内容可被检测。
随附的《行为准则》规定,标记系统应尽可能在技术上可行的范围内做到有效、可互操作、稳健且可靠。
Anthropic 与许多其他组织一起签署了欧盟《人工智能生成内容透明度行为准则》。
该公司表示,由于目前没有持久有效的方法按地域限制标记系统,因此在受支持模型发布时,将在全球范围内应用水印。
2026 年 8 月 2 日之前推出的较旧模型将获得过渡期,Anthropic 表示将在接下来的几个月内为它们添加水印。
用户的反对意见集中在人机混合创作上
这一公告立即引发了争议。
一些用户对模型从零生成文章时的明确披露感到满意。
更具挑战性的是混合工作流程。
专业人士可能会撰写原始文档,然后要求 Claude:
- 修正语法
- 改写几个段落
- 翻译文档
- 精简风格
- 总结研究内容
- 重新排版提案
诸如“人工智能生成”这样的二元标签可能无法准确反映其中保留了多少人类创作成分。
这也是部分用户反对不可见来源信号可能跟随文本进入后续工作流程的原因之一。
Anthropic 本身强调,该水印并非作者检测器。
阳性结果仅意味着 Claude 可能在某个环节参与过。它无法确定最终文本主要是人类撰写、主要来自人工智能,还是双方大量编辑的产物。
去水印工具几乎立即出现
这一反对声浪催生了明显的开发者机会。
在 Anthropic 公告发布后几天内,就出现了多种工具。
Watermarks Remover
总部位于巴黎的创始人 Guillaume Meyer 发布了开源项目 Watermarks Remover。
该仓库迅速走红,截至 2026 年 8 月 19 日已获得约 14.6K 个 GitHub 星标。
该项目支持多种来源清理方式,包括:
- 隐形 Unicode 清理
- 文件元数据移除
- C2PA 相关元数据处理
- 尽力而为的文本改写
- 面向研究的水印评估
Meyer 表示,第一个版本大约花了五个小时构建。
然而,项目文档包含一个重要免责声明:目前无法保证文本会失败
Claude未来的官方水印检测器。
这是因为Anthropic尚未发布检测API或其密钥。
Sabrina Ramonov的浏览器工具
AI教育者Sabrina Ramonov也推广了一款免费的基于浏览器的水印去除工具。
该工具号称能够清除多种内容类型中隐藏的AI标记,包括:
- 文本
- Word文档
- 网页
- 图片
- 数据文件
这些类别不应相互混淆。
移除文档元数据在技术上不同于削弱统计文本水印。
文件可以剥离元数据,而其中的措辞仍然保留统计信号。
MarkScrub
东京开发者Ansh Aneja发布了一款专注于Claude的清理工具,随后又发布了名为MarkScrub的本地开源版本。
其GitHub描述将其定位为一款CLI和智能体技能,用于从文本和文件中清除AI来源标记。
Aneja表示,早期版本在一天内就吸引了数千名用户,不过该用户数量并未经过原文章中引用的报道的独立核实。
为什么这些工具无法保证100%去除
“水印去除器”这个说法听起来比底层技术所能实现的效果更加绝对。
对于普通的文件元数据,去除通常可以直接验证。
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
工具可以检查PDF、图片或DOCX文件在处理前后的状态,并确认特定元数据字段是否消失。
统计文本水印则不同。
要削弱这种信号,工具通常必须改变措辞。
改写越激进,越有可能破坏原始模式。
但激进的改写也可能改变:
- 语气
- 精确性
- 风格
- 术语
- SEO语言
- 事实细节
Watermarks Remover项目本身也将统计改写描述为尽力而为。
在Anthropic发布公开检测器之前,第三方工具无法诚实保证其清洗后的文本能通过官方的Claude检查。
这一限制是评估当前所有“Claude水印去除器”的核心。
轻度编辑可能不够
Anthropic公开承认其水印并非坚不可摧。
该公司表示,轻度编辑可能仍会保留足够多的模式,从而使其可被检测。
彻底重写可以摧毁信号,因为原始的token选择已被替换。
这并不是Claude独有的问题。
稳健的文本水印一直面临着艰难的权衡:标记必须在普通编辑中存活,同时不显著降低文本质量,但足够广泛的改写可以替换承载信号的词汇选择。
改写攻击越强,“最终措辞仍然是同一段生成文本”这一说法就越没有意义。
文件溯源使用不同的机制
Anthropic还在为支持的文件添加溯源信息。
对于PNEG、JPEG和SVG等格式,该公司表示Claude可以附加C2PA内容凭证。
C2PA是一种开放的溯源标准,存储经过加密签名的、关于文件如何创建或处理的信息。
这不是
与Claude的统计文本水印相同。
一个有用的区分是:
| 溯源方法 | 信号所在位置 | 典型用途 |
|---|---|---|
| Claude统计文本水印 | 词语选择模式 | 检测文本中可能涉及Claude的情况 |
| 隐形Unicode | 文本中的隐藏字符 | 基于编辑的标记方案 |
| C2PA内容凭据 | 签名的文件元数据 | 文件溯源和处理历史 |
| 可见水印 | 像素或渲染内容 | 人类可见的归属标识 |
移除某一层的工具不会自动移除其他层。
Anthropic计划发布检测API
用户目前无法使用Anthropic的官方密钥独立检查Claude的水印。
Anthropic表示计划发布水印检测API。
该公司尚未公布最终的API设计、访问政策、阈值、定价或上线日期。
这一即将推出的检测器将具有重要意义,因为目前的第三方工具只能针对近似实现、开放研究实现或通用统计水印类别进行测试。
一旦官方API可用,关于移除有效性的声明就可以对照实际的Anthropic系统进行评估,而非替代检测器。
欧盟AI法案并未让技术问题消失
法律框架并不能解决鲁棒性问题。
欧盟透明度规则要求提供商实施机器可读标记,并要求特定部署者在指定情况下披露AI生成或操纵的内容。
委员会的行为准则还期望提供商端的技术在技术上可行的范围内具有鲁棒性和可靠性。
但法律要求的存在并不意味着信号能在每次转换中幸存。
重写、翻译、重新编码、截图、元数据剥离以及其他内容转换都可能对不同的溯源机制产生不同影响。
因此,法规为强化标记和检测创造了激励,而攻击者和工具开发者则有动机寻找能削弱这些信号的转换方式。
这就是为什么水印很可能仍将是一场持续的技术竞赛,而非一次性的功能发布。
移除AI水印是否违法?
没有简单的通用答案。
本文讨论的欧盟AI法案条款主要界定了提供商和特定部署者的透明度义务。它们并不等同于对所有最终用户一律禁止编辑标记内容的普遍声明。
然而,编辑的目的至关重要。
为良性文档卫生而移除溯源与在法律、合同、学术或专业要求披露的背景下故意歪曲合成内容是有区别的。
其他规则也可能适用,包括:
- 平台条款
- 雇佣政策
- 学校政策
- 出版规则
- 合同披露要求
- 欺诈或虚假陈述法律
- 特定行业法规
任何处理受监管或高风险内容的人都应将水印移除视为合规问题,而不仅仅是技术问题。
这场争论真正揭示的问题
这场争议揭示了AI署名问题背后更深层的矛盾。
现代大部分知识工作已不再能简单地划分为“人类撰写”和“AI撰写”。
一份文档可能始于人类初稿,由Claude翻译,经同事编辑,被另一个模型摘要,再由原作者重新改写。
水印可以表明模型参与过。
但它无法解释完整的创作历史。
这并不意味着水印毫无用处。
它只是让来源信息成为众多信号之一。
完善的披露体系最终可能需要结合:
- 统计文本标记
- 文件凭证
- 平台级披露
- 编辑历史
- 人工声明
- 情境相关政策
因此,当前围绕移除工具的争议,既是技术层面的争论,也是对混合署名工作流中AI来源信息应如何定义的争论。
常见问题
什么是Claude的隐形文本水印?
Claude的文本水印是一种统计模式,通过在生成过程中做出低风险的用词选择而产生。Anthropic表示,不会在文本中添加隐藏字符。
Claude是否会在带水印的文本中添加不可见的Unicode字符?
Anthropic表示,其新的统计文本水印不依赖隐藏字符。一些第三方清理工具会移除不可见Unicode,因为其他来源方案可能使用它,但那是不同的机制。
Claude的水印能在复制粘贴后保留吗?
可以。由于该信号由措辞本身承载,而非文件元数据,普通的复制粘贴不会将其移除。
水印移除工具能保证彻底去除Claude的水印吗?
目前还不能。Anthropic尚未发布其官方检测API,因此第三方工具无法确凿证明处理后的文本在Anthropic的检测器下会失效。
校对人类撰写的文本会添加Claude水印吗?
Anthropic表示,轻度的校对可能因改变的用词过少而无法可靠检测。较大幅度的重写则会为水印的出现创造更多机会。
Claude的翻译结果会带有水印吗?
会。Anthropic表示,翻译输出可能携带水印,因为翻译文本中的用词由Claude选择。
C2PA和Claude的文本水印是同一回事吗?
不是。C2PA将带签名的来源信息存储于受支持的文件元数据中,而Claude的文本水印是措辞中的统计模式。
根据欧盟AI法案,移除AI水印是否违法?
AI法案为提供者及部分部署者设定了透明度义务,但移除标记的法律后果取决于具体情境和目的。即使水印移除本身未被单独禁止,虚假陈述AI生成内容仍可能带来合同、平台、职业或法律问题。
相关工具
- Anthropic Claude:Anthropic面向消费者的AI助手,未来支持的模型将采用新的文本标记方式。
- Watermarks Remover:一个MIT许可的开源工具包,用于检查和清理多类AI来源信号。
- [MarkScrub](https://github.
com/anshaneja5/markscrub):一个本地CLI和代理技能,用于检查和清理文本和文件中的人工智能来源标记。
- C2PA:Anthropic在支持的文件中用于内容凭证的开放来源标准。
- SynthID-Text:Google DeepMind对统计文本水印的开放研究实现。
相关链接
- Anthropic:Claude文本水印的工作原理:Anthropic对统计水印、局限性、翻译、代码和计划中的检测器API的官方解释。
- 欧盟人工智能法案透明度指南:欧洲委员会关于人工智能提供商和部署者第50条透明度义务的指导。
- 欧盟人工智能生成内容实践准则:涵盖机器可读标记和披露的自愿合规框架。
- Watermarks Remover GitHub仓库:Guillaume Meyer项目的源代码、文档、局限性和许可证。
- MarkScrub GitHub仓库:Ansh Aneja的本地开源来源清理项目。
- C2PA规范与资源:关于内容凭证和加密签名媒体来源的官方信息。
- SynthID-Text研究仓库:Anthropic声称使用的水印家族的参考实现和研究材料。
摘要
Anthropic新型Claude文本水印并不会在文档中隐藏额外字符。它改变的是词语选择的统计模式,使得拥有正确密钥的检测器能够估计Claude是否参与了文本的生成。
这一公告迅速催生了新型水印清除工具。这些项目能够可靠地清理某些形式的元数据和不可见字符,但削弱Claude的统计水印需要进行改写,目前没有任何第三方工具能够证明官方的Anthropic检测器会失效。
欧盟人工智能法案正在推动提供商建立更强大的来源系统,而用户和开发者则在测试这些信号被篡改的难易程度。结果可能是标记、检测、编辑和披露之间持续的竞赛。
关键区别很简单:Claude水印是模型可能参与的证据,而非完全人工智能作者身份的证明——而清除来源并不会自动免除在规则要求的情况下披露人工智能使用的义务。



