引言
Anthropic 刚刚解释完 Claude 新文本水印的工作原理,一个专注于移除 AI 溯源信号的开源仓库就开始在 GitHub 上迅速走红。
该项目 guillaumemeyer/watermarks-remover 自称是一个智能体技能加 Python 服务,用于从用户拥有的文本和文件中剥离多种类别的 AI 溯源标记。在源文章截取数据时,该仓库已获得约 11,000 个 GitHub Star,将一个相当技术性的溯源话题转变为关于 AI 生成内容、用户控制和水印系统持久性的更广泛辩论。

源文章将该项目视为 Claude 水印在一夜之间被有效破解的证据。这个标题比现有证据所能支撑的结论更具戏剧性。
更准确的结论是:**不同的溯源系统以不同方式失效,没有任何单一标记方法能保证在所有变换下存活。**Anthropic 自己表示水印检测存在局限性,Google 将 SynthID 描述为稳健而非不可攻破,OpenAI 明确警告溯源信号有时可能被剥离,而 C2PA 的设计定位是溯源标准而非坚不可摧的 DRM 层。
因此,该 GitHub 项目之所以有趣,不是因为它证明了所有 AI 水印都毫无用处,而是因为它展示了开源研究人员能以多快的速度检验多种溯源层背后的假设。
项目为何爆红
该仓库出现的时间点恰到好处。
2026 年 8 月 14 日,Anthropic 发布了关于计划在未来 Claude 模型中使用的文本水印的详细说明。四天后,BAAI 联合发布的文章将 watermarks-remover 作为开源社区中迅速崛起的反例加以突出。

该仓库自身的文档说明,它针对的是多种不同类别的溯源信号,而非某一种通用的"Claude 水印"。
其覆盖矩阵将这些信号分为几个大类:
- 不可见或非常规的 Unicode 及文本格式标记
- 统计性 token 采样水印
- C2PA、EXIF、XMP 及文档元数据
- 通过外部研究后端实现的部分图像级水印方法

这一区分很重要,因为这些机制作用于完全不同的层面。
从文件中移除元数据与削弱统计性文本水印不是同一个问题。同样,改变图像像素与删除不可见的 Unicode 字符在根本上是不同的。
该项目采用 MIT 许可证 授权,且
其README明确将该工具定位为用户自有内容的隐私与卫生管理。
Anthropic的水印并非隐藏字符把戏
要理解该仓库为何引发如此关注,有必要先弄清楚Anthropic实际发布了什么。
Claude的文本水印并非简单地在输出中粘贴隐藏字符串、零宽字符或秘密标签。
Anthropic表示,其水印基于SynthID-Text,这是一种由Google DeepMind提出并于2024年发表在《自然》杂志上的统计水印方法。
大语言模型本就从概率中选择
语言模型逐词元生成文本。
在每一步,它都会为可能的下一个词元分配概率。某个词元可能极有可能,另一些可能合理,还有许多可能性很低。
正常的生成过程随后使用随机性在这些可能性中进行选择。
统计水印以受控方式修改该随机性的来源。文字对读者来说仍然自然,但词元选择的序列可以包含统计模式,拥有相应密钥的检测器能够识别该模式。
Google DeepMind对SynthID-Text的描述类似:它在生成过程中调整词元概率分数,从而在不添加可见字符的情况下嵌入可检测信号。

Anthropic的“用圆周率代替骰子”类比
Anthropic使用了涉及棋盘游戏的类比。
想象一下,玩家通常掷骰子来决定移动步数。游戏并非使用真正随机的骰子,而是暗中使用已知数列如圆周率的数字。
对玩家来说,移动看起来仍然是随机的。但知道该数列的人之后可以检查模式,并估算是否使用了该随机性来源。
Claude的水印遵循同样的总体思路:它改变词元选择背后的统计过程,而不是在文本中插入可见标签。
水印能证明什么,不能证明什么
Anthropic对检测器的含义十分谨慎。
水印检测器旨在估算Claude对某段文字作出贡献的可能性。它并不能证明文本是否由人类撰写,也无法自动识别由其他所有AI系统生成的文本。
检测在短文本以及高度受限的事实性文本中可靠性也会降低,因为这类文本中模型可选的合理词汇较少。
校对是另一个薄弱场景。如果Claude只修改了标点或少数几个词,可能没有足够的模型选定文本供统计水印被检测到。
这些注意事项之所以重要,是因为源文章将该系统描述得近乎绝对。Anthropic自己的文档并未作出这一声明。
开源项目如何对问题进行分层
该仓库将溯源移除研究按层次组织。
本文保留了这一架构,因为它有助于理解技术争论,但本文并不提供用于绕过水印的操作指南。
来源系统。重要的是区分不同机制。
第一层:不可见文本卫生
最简单的一类标记也是最容易理解的。
文本可能包含不可见或视觉上模糊的字符,包括不寻常的空格、双向控制符、标签字符或其他 Unicode 格式符号。
该代码库描述了一个确定性的文本卫生层,用于检测并规范化这些类别的字符。
这与 Claude 新推出的 SynthID 式统计水印截然不同。
Anthropic 特别指出其水印不依赖隐藏字符,因此仅清理 Unicode 预计无法击败 Anthropic 所描述的统计信号。
这也是代码库将 Unicode 清理和统计水印视为独立层的原因之一。
第二层:统计水印是一个重写问题
统计文本水印更难处理,因为信号存在于令牌选择模式中,而非文件元数据或隐藏字符。
代码库文档将大规模重写或改写列为相关攻击类别。高层原则很直接:如果足够多的令牌选择由不同模型或采样过程重新生成,原有的统计模式可能会被削弱。
这对于统计水印研究来说并非意外特性。水印鲁棒性通常要针对改写、翻译、编辑和重新生成等变换进行评估。
权衡同样重要:更强的重写也可能改变语义、术语、风格、事实准确性或作者信号。
源文章简要提到了这种降质风险,这也是成功的检测规避实验不应自动被视为无损变换的主要原因之一。
为什么“水印已移除”难以证明
Anthropic 尚未发布其对公众开放的 Claude 水印检测 API。该公司表示检测器接入将在稍后推出。
这意味着外部项目目前无法针对 Anthropic 的生产密钥和检测器进行权威的端到端测试。
watermarks-remover 项目本身在统计水印类别的多处使用了“尽力而为”的措辞。这种表述比声称保证移除更为技术负责。
在官方检测器和可复现的评估条件可用之前,任何声称 Claude 水印已被“完全擦除”的说法都应谨慎对待。
第三层:C2PA 与文件元数据
代码库的另一独立部分涉及文件级来源数据。
这包括与图像和文档等格式关联的元数据,包括 C2PA Content Credentials、EXIF、XMP 和文档属性。
C2PA 是一个用于记录数字资产来源和历史的开放标准。它可以承载关于内容来源、经手工具以及随时间变化情况的签名信息。
重要区别在于 C2PA 元数据与嵌入式统计水印并非同一概念。
OpenAI 当前的来源文档也作出了同样的区分。
区别。OpenAI 支持的生成图像可以同时携带 C2PA 内容凭证和 SynthID 水印。OpenAI 表示,元数据可能会在编辑、转换、分享或截图过程中丢失或被剥离,而嵌入式水印则可能在某些转换后仍然保留。
这就是为什么现代溯源系统越来越多地结合多种信号,而不是仅仅依赖元数据。
C2PA 是溯源机制,而非数字版权管理
C2PA 规范旨在记录可验证的溯源信息。
它不是作为一种不可移除的数字版权管理系统而设计的。
C2PA 说明文档明确将内容凭证描述为与 XMP 和 EXIF 等标准元数据格式并行工作。文件在转换过程中可能会丢失元数据;此时生态系统会依靠验证、持久绑定、水印或其他补充信号来提高韧性。
因此,能够移除元数据的工具只是展示了基于元数据的溯源机制的已知局限,本身并不能否定更广泛的 C2PA 模型。
图像级水印是另一个不同的研究领域
源文章随后从文本和元数据转向图像水印。
这又是另一个独立的问题。
Google 的 SynthID 图像水印将不可感知的信号直接嵌入到生成的图像内容中。Google 表示,该水印旨在经过裁剪、滤镜、帧率变化和有损压缩等常见修改后仍可检测。
该开源仓库引用了研究基于再生成攻击以及潜在或像素级水印评估的外部研究系统。
该项目还参考了 MarkDiffusion,这是一个用于潜在扩散模型生成式水印研究的开源工具包。

MarkDiffusion 本身并不仅仅是一个“水印移除器”。其声明目的更为广泛:实现、可视化和评估生成式水印算法,包括其可检测性、鲁棒性和输出质量。
这提醒我们,水印研究一直包含问题的两个方面:
嵌入溯源信号
↓
施加编辑或转换
↓
测试信号是否存续
↓
衡量质量和可检测性
↓
改进水印
鲁棒的水印只有在经过真实转换测试后才具有意义。
MarkLLM 为文本水印提供研究框架
该仓库还参考了 MarkLLM,这是一个由清华大学研究人员及合作者开发的开源工具包,用于实现和评估大语言模型水印方法。
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
MarkLLM 支持多类文本水印算法,包括 KGW、SynthID-Text、Unigram、SWEET、SIR 等。
它的作用很重要,因为它为研究人员提供了一个共同环境来探讨以下问题:
- 水印的可检测性如何?
- 它对文本质量的影
不同的水印算法之间如何比较?
这一研究背景比“水印对抗水印移除器”的简单框架更有价值。
真正的技术问题是在可检测性、鲁棒性、质量、隐私、互操作性和误报风险之间持续权衡。
该项目覆盖面广,但并非无所不包
GitHub 上的覆盖矩阵雄心勃勃,但也包含明确的限制。
某些机制被列为尽力而为。某些图像方法依赖外部后端。某些类别的标记不在范围内。不同厂商在不同产品和模态中暴露了不同的溯源系统。
这对于有关 OpenAI 的主张尤为重要。
该仓库在其厂商覆盖范围中列出了与 OpenAI 相关的溯源面,但这不应被解读为 OpenAI 目前在所有生成文本中使用某种通用不可见统计水印的证据。
OpenAI 2026 年官方文档称,受支持的图像使用 C2PA 元数据加 SynthID,而受支持的音频使用 SynthID。OpenAI 还表示正在将溯源工作扩展到包括文本在内的多种模态,但覆盖范围因产品、模型、导出路径、文件类型和日期而异。
因此,“移除 OpenAI 的隐藏标记”这一说法过于宽泛,若不指定内容类型和溯源机制则不够准确。
为什么 Claude 可能拒绝帮助移除溯源信号
来源文章包含了用户截图,据称这些用户试图让 Claude 操作移除工具但被拒绝。
这一行为与许多 AI 提供商在分析溯源系统与直接帮助用户击败它们之间做出的安全策略区分是一致的。
用户有正当理由检查其拥有文件中的元数据或隐私敏感字段。同时,溯源信号对于真实性、欺诈预防、平台透明度和合规性可能很重要。
因此,对此类项目最安全的用途是研究、互操作性测试、隐私审查或对您拥有的内容进行受控评估——而不是将合成内容伪装成独立的人类创作或规避披露要求。
来源文章进一步声称其他模型在无异议的情况下安装了该项目。这些轶事是用户报告的行为,并非可靠的跨模型政策基准,因此不应被概括为某国模型“允许”水印移除而另一公司模型不允许的说法。
为什么 Anthropic 在全球范围内添加水印
政策背景是**《欧盟人工智能法案》**。
第 50 条要求生成合成音频、图像、视频或文本的系统提供商使这些输出具备机器可读性,并能被检测为人工生成或操纵的内容,同时受该法律详细范围和例外条款的约束。
第 50 条的透明度义务于2026 年 8 月 2 日起适用。
欧盟委员会还发布了一份关于人工智能生成内容透明度的自愿性《行为准则》,以帮助提供商和部署者证明其合规性。
Anthropic 表示已签署该《行为准则》,并在实施文本水印作为合规工作的一部分。
为什么欧洲以外的用户会看到同一套系统
源文章的这一部分基本正确,尽管措辞带有对抗性。
Anthropic 自己在8月14日的帖子中表示,它在发布时全球范围内应用水印,因为它还没有一种持久的方式按地区限定该系统。
Anthropic 还表示将继续评估其他方案。
因此,全球推广并不是从用户行为中推断出来的;这是 Anthropic 直接声明的内容。
欧盟规则比“给所有内容加水印”更广
源文章将《人工智能法案》简化为一条要求。
实际的法律框架更为精细。
第50条规定了某些人工智能系统的提供者和部署者的透明度义务。欧盟委员会2026年的指南解释说,提供者必须添加机器可读标记,以便检测人工智能生成或操纵的内容,而部署者则对深度伪造和某些人工智能生成的出版物等情况负有单独的标注义务。
《实践准则》是自愿性的。其下的第50条义务则不是。
在讨论为什么 Anthropic、Google 和 OpenAI 等公司投资溯源系统时,这一区别很重要。
争论实际上关乎作者身份、溯源和用户控制
源文章的最后部分认为,用户不喜欢所谓的“网络品牌”附着在他们的作品上。
这里确实存在张力,但比任何一方最强硬的措辞都要复杂。
一个人可能花数小时研究、列提纲和撰写文档,然后仅使用人工智能模型进行编辑。Anthropic 自己也承认这种情况,并表示轻度校对可能留下的模型生成文本太少,其水印无法强有力地登记。
这一细微差别很重要。
使用人工智能并不会自动解决作者身份、所有权或创造性贡献的问题。溯源信号回答的是一个更窄的问题:生成或修改此内容时是否可能涉及特定工具?
它们并不决定作品是否准确、原创、合法、符合道德、以人为主导或具有专业价值。
OpenAI 在其验证文档中也提出了同样的观点:检测到溯源信号可以表明受支持的 OpenAI 工具生成或导出了某个文件,但这并不确认真实性、所有权或上下文。
水印和去除水印仍将是猫捉老鼠的问题
源文章的结尾观点比其标题更有说服力:这还不是一场已见分晓的竞赛。
Anthropic 尚未发布其公开的文本水印检测器。因此,GitHub 项目无法针对 Anthropic 的生产检测器和密钥确凿地证明去除效果。
同样,随着研究人员发现哪些变换会削弱水印系统,水印系统也将不断变化。
未来的图景不是一种完美的水印。
而是一个分层溯源栈:
| 层 | 贡献 | 主要限制 |
|---|---|---|
| 统计文本水印 | 生成过程中嵌入的可检测信号 | 在足够重的变换下会减弱;短文本难以处理 |
| 媒体水印 |
| 嵌入图像/音频/视频内容中的信号 | 鲁棒性因算法和变换而异 |
| C2PA 内容凭证 | 带签名的来源与编辑历史 | 元数据可能丢失或被剥离 |
| 平台标签 | 向用户即时披露 | 标签可能不会随导出内容传播 |
| 验证服务 | 同时检查多种来源信号 | 覆盖范围取决于受支持的供应商和格式 |
一个成熟的系统可能会结合其中多种技术,而不是只信任某一种。
什么是已确认的,什么仍是声称
由 Anthropic 确认
- 未来的 Claude 模型将使用基于 SynthID-Text 的文本水印。
- 该水印改变的是 token 生成过程中使用的随机性统计来源,而不是插入隐藏字符。
- 对于短样本以及轻度编辑或事实性文本,检测可靠性较低。
- Anthropic 计划提供水印检测 API。
- Anthropic 在发布时在全球范围应用该系统,因为目前还无法可靠地按地区限定范围。
- 该部署与欧盟 AI 法案以及透明度行为准则的合规要求相关。
由 GitHub 仓库确认
watermarks-remover采用 MIT 许可证。- 该仓库针对的是多类 AI 来源信号,而非单一水印。
- 其文档将 Unicode 清理、统计水印变换、文件元数据和图像级研究后端分开说明。
- 统计水印处理在多处被描述为“尽力而为”而非保证有效。
- 该项目声明的用途是用户对自己拥有的内容进行隐私和卫生处理。
由 Google DeepMind 确认
- SynthID 可以为 AI 生成的文本、图像、音频和视频添加水印。
- SynthID-Text 在生成过程中改变 token 概率分数。
- 图像和媒体水印设计为能够经受一系列常见变换,但 Google 并不声称绝对不可破坏。
由 OpenAI 确认
- 受支持的 OpenAI 生成图像可以同时包含 C2PA 内容凭证和 SynthID 水印。
- 受支持的 OpenAI 生成音频可以包含 SynthID。
- OpenAI 明确指出元数据可能被剥离,且没有任何单一来源技术是万无一失的。
需要谨慎对待的声称
- 声称 Claude 的水印在 Anthropic 的生产检测器可公开测试之前就已被“完全破解”。
- 声称该项目保证移除所有 SynthID 或统计水印。
- 声称 OpenAI 在所有产品中使用一种通用的不可见文本水印。
- 声称每个模型提供商对来源移除都有相同政策。
- 声称未检测到水印就证明内容是由人类撰写的。
常见问题
Claude 的新文本水印是什么?
Claude 的文本水印是一种基于 Google DeepMind SynthID-Text 方法的统计水印。它在生成过程中改变 token 选择的概率,从而让持有相关密钥的检测器能够估计 Claude 是否可能参与了某段文本的生成。
Claude 的水印使用不可见 Unicode 字符吗?
不使用。Anthropic 表示新水印不依赖隐藏字符。不可见 Unicode 清理是一个单独
属于文本卫生范畴,本身并不针对SynthID式统计信号。
开源项目是否已确定破解了Claude的水印?
尚不能下定论。Anthropic尚未发布其公开检测API,因此独立项目无法针对生产环境检测器和密钥充分验证其结果。该代码库本身在统计水印类方面使用了尽力而为的措辞。
SynthID和C2PA有什么区别?
SynthID将水印信号嵌入生成内容中,而C2PA内容凭证则将签名来源信息和编辑历史附加到数字资产上。两者是互补的:元数据可以承载更丰富的上下文,而嵌入式水印可能在元数据被移除的转换过程中依然存活。
C2PA元数据能从文件中删除吗?
元数据可能因编辑、格式转换、导出、分享平台或故意剥离而丢失。这是已知的局限性,因此来源系统越来越多地将内容凭证与嵌入式水印和验证服务相结合。
Anthropic为何在欧盟之外应用Claude水印?
Anthropic表示正在全球范围内推广水印,因为目前尚无持久的方法将系统限定在特定区域。该公司表示将继续评估其他方案。
欧盟《人工智能法案》是否要求AI生成内容可被检测?
第50条要求某些生成式AI系统的提供商确保相关合成输出以机器可读形式标记,并可被检测为人工生成或操纵。透明度义务已于2026年8月2日起适用,并配有详细指南和自愿性行为准则以支持合规。
缺少水印是否证明内容是人工撰写的?
不是。Anthropic、Google和OpenAI均将来源检测描述为概率性或有信号依据的,而非证明人类作者身份。由于不支持的格式、样本过短、内容转换或其他限制,信号可能缺失。
相关工具
- Anthropic Claude文本水印:Anthropic对基于SynthID-Text的水印、局限性和全球推广的官方说明。
- Google DeepMind SynthID:Google对AI生成文本、图像、音频和视频的水印与检测的官方概述。
- C2PA:内容凭证和可互操作媒体来源的官方标准组织。
- MarkLLM:用于实现和评估LLM水印算法的开源研究工具包。
- MarkDiffusion:用于潜在扩散模型中生成水印的开源研究工具包。
- watermarks-remover:源文章中讨论的MIT许可代码库;其自身文档将用途框定为用户拥有内容的使用场景。
相关链接
- [Anthropic:Claude文本水印的工作原理](https://www.anthropic.
com/news/claude-text-watermark):关于Claude水印设计、检测局限性、欧盟合规依据及全球推广的主要来源。
- Google DeepMind:SynthID:描述SynthID如何标记文本及其他媒体内容的主要来源。
- 欧盟AI生成内容透明度实践准则:支持遵守第50条透明度义务的欧盟委员会指南。
- 欧盟人工智能法案,法规(EU)2024/1689:包含合成内容机器可读标记与检测第50条要求的官方法律文本。
- OpenAI:推进内容溯源:OpenAI对C2PA、SynthID、验证及单一溯源信号局限性的说明。
- C2PA技术规范:内容凭证的官方规范与实施指南。
- MarkLLM GitHub仓库:涵盖多种LLM水印及鲁棒性方法的研究框架。
摘要
一个专注于AI溯源移除的开源仓库在Anthropic发布Claude即将采用的基于SynthID文本水印技术原理后仅数天内便在GitHub上迅速走红。这一时间节点颇具戏剧性,但证据并不支持宣告Claude水印已被全面攻破。
更有益的经验在于溯源是分层级的。不可见Unicode、统计文本水印、C2PA元数据和嵌入媒体水印是不同机制,各有其优势与失效模式。能够移除一种信号的技术可能对其他信号无效,而削弱水印的强变换也可能同时降低内容本身的质量。
Anthropic、Google、OpenAI、C2PA、MarkLLM和MarkDiffusion都指向同一更广泛的结论:溯源在作为信号与验证工具的组合时效果最佳,而非依赖单一永久标记。
AI水印并非绝对牢不可破,水印移除也并非彻底抹除——真正的问题在于构建在现实变换条件下仍具实用性的溯源机制。



