AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Claude 文本水印全量落地:AI 检测从「猜风格」转向「验密钥」

今天 · 共 3,171 字

模型
Google DeepMind / Nature

8 月 15 日,Anthropic 在技术博客里首次把 Claude 文本水印的机制讲清楚。它改的只有一处:模型选择下一个词时,"随机性从哪来"。普通生成里,描述天气该用 "overcast" 还是 "grey" 这类不影响含义的低风险选词,由任意随机数决定;水印版改用一把密钥加上前几个词来决定。选词仍然随机、读者看不出差别,但持钥者事后能检查一段文本是否符合"Claude 用这把密钥生成"的规律,并据此算出"Claude 参与过"的概率。

这是一次路线切换。此前判断文本是否 AI 生成,主流做法是 Pangram 这类检测公司的路线:统计措辞特征,找 "this isn't [X], it's [Y]" 或 "quietly" 这类机器味十足的痕迹。Anthropic 明确与这条路划清界限——Pangram 们没有密钥,只能猜;水印是可验证的。但这条新路线能证明的上限,恰好暴露了"AI 生成"这个概念本身的模糊边界。

改的不是"选哪个词",是"随机性从哪来"

大语言模型逐词生成文本。每一步,模型在一组候选词里选一个;在"阴天"还是"灰蒙蒙"这种两种都对、含义几乎相同的低风险决策上,选谁通常由一个随机数决定。Claude 采用的水印(Google DeepMind 2024 年发表在《Nature》的 SynthID-Text)做的,就是把这个随机数的来源换掉:不再用任意随机数生成器,而是用密钥加前几个词来算出选谁。选词依旧随机,但词的序列从此与密钥相关,变得可验证。Anthropic 给的类比是掷骰子换成背圆周率——对玩家和胜负没有区别,但事后看到完整步数序列、又知道圆周率的人,能判断这局棋"是不是用了圆周率"。

这个设计的技术含义是"非失真"(non-distortionary)。SynthID-Text 在采样阶段用一个伪随机 g 函数给每个候选 token 打分,再通过多层"锦标赛采样"(tournament sampling)逐层两两淘汰,选出得分最高的 token——但它不会逼模型去选一个本来不会选的词。DeepMind 论文里的证据是:在 Gemini 上做了一次约 2000 万条回复的实况实验,水印版与无水印版的"点赞率"只差 0.01%、"点踩率"只差 0.02%,均不显著;在 Gemma 7B 上,30 层锦标赛采样带来的延迟增量只有 0.57%。Anthropic 因此声称水印"不影响输出的质量、创造性或可读性"。

它证明的是"参与",不是"作者"

这套机制的上限很明确。Anthropic 的原话是:水印只能回答"这段文本有多少可能是 Claude 参与写的"。它不能确认文本是人写的,也识别不了其他 AI 的输出——即便对方也用水印,用的也是另一把密钥,甚至可能是另一种方法。

更根本的限制藏在"低风险选词"这个前提里。凡是只有唯一正确答案的地方,水印就没有落脚点:写 "Principia" 后面必须是 "Mathematica",写 "2 + 2 =" 后面只能是 "4",这些位置水印不会介入。同理,代码因为绝大多数输出必须精确,几乎不带水印,只有注释这类可以随意措辞的地方才可打标;翻译则相反,每个词都由 Claude 选定,因此整段都带水印。

这引出一个水印无法回避的边界:它记录的是"Claude 是否参与过",而不是"Claude 是否写了"。轻度的修改通常不会完全抹掉水印,逐词重写则会——但 Anthropic 自己也承认,一旦每个词都被换掉,"这段文本是否还算 AI 生成"就变成定义问题了。把这句话倒过来读,才是这项技术的真正局限:来源证明能回答"是否参与",却回答不了"谁写的、责任归谁",而后者恰恰是检测工具被寄予厚望的用途。

头部实验室的文本水印并不对称

把 Claude 放回行业里看,最值得注意的不是"谁第一个做",而是各家进度差异极大。Google 其实走在最前面:DeepMind 在 2024 年的《Nature》论文里就宣布 SynthID-Text 已在 Gemini 与 Gemini Advanced 上规模化部署,是已知最早的大规模生成式文本水印。Anthropic 这次做的事,是把竞争对手开源的这套方法拿来做合规落地——在模型层面给所有 Claude 产品(Claude、API、Claude Code、Cowork、Tag)统一打标,并全球适用。

OpenAI 是另一头。它公开的溯源能力覆盖图像(C2PA 元数据加 SynthID 水印)与音频(SynthID,7 月 31 日刚扩展到音频),并提供公开验证工具,但从未确认上线过文本水印。多家第三方评测在 8 月仍把"ChatGPT 文本水印"标为"未确认"。Meta、Microsoft、Black Forest Labs、Synthesia 等都已签署欧盟行为准则,但文本水印的具体落地进度多数未披露。

这一格局的反差在于:把"验证 AI 文本"从统计猜测换成密钥验证,检测能力就集中到了持有密钥的模型厂商手里。Pangram 这类第三方可以独立地对任何文本做概率判断,而水印检测只有 Anthropic 自己能做——这正是它计划"很快"推出的检测 API 的独特性,也是它不可能成为开放基础设施的原因。

推力来自欧盟第 50 条,落在全球

Anthropic 说得直白:做这件事是为了遵守欧盟 AI 法案。2026 年 7 月,Anthropic 与约 190 家机构签署了《AI 生成内容透明度行为准则》;其背后的法律义务是《AI 法案》第 50 条(透明度义务),自 2026 年 8 月 2 日起适用,要求提供者以机器可读的方式标记 AI 生成内容。行为准则签署是自愿的,但第 50 条本身是强制义务,违规最高可处 1500 万欧元或全球年营业额 3% 的罚款(取高者)。

这项义务有域外效力:只要系统投放到欧盟市场,提供者、部署者、进口商、分销商无论在哪都要遵守。Anthropic 选择"全球适用"而非按地区分片,理由是"目前还没有持久的方式来按区域限定范围"。行为准则的技术口径比法律条文更细:多数内容需至少两种机器可读标记,但自由文本因为无法携带元数据,单一水印即可;200 token(约 150 词)以下的文本更是直接豁免水印要求——这从合规层面印证了水印对短文本的无力。过渡期也留下了一个时间差:8 月 2 日前已投放市场的旧模型,标记与检测义务宽限到 12 月 2 日,水印检测互操作性则推迟到 2027 年 2 月 2 日——Anthropic 称会在未来数月陆续给老模型补上水印。

检测 API 与规避的军备竞赛

水印的价值最终取决于检测能不能可靠落地。Anthropic 的检测 API 仍是"很快推出"、细节待定。这项 API 本身也受行为准则约束:提供者原则上须免费提供检测机制,监管机构、执法部门、媒体、事实核查者、研究者须始终免费、无限制地访问;到 2027 年 2 月 2 日,各家水印检测机制还须实现互操作,让内容无需逐个跑各家的检测器即可被验证。DeepMind 论文则写明了这条路的脆弱点:生成式水印天然易受"窃取、伪造与擦除"攻击,也会被改写或转述削弱——这篇 2024 年的论文已经把规避方式列在限制里了。

这意味着水印不会终结检测的军备竞赛,只是把战场换了地方。统计式检测要与"机器味随模型进步而减弱"赛跑,密钥式检测则要与"改写、转述、擦除"赛跑。对用户和企业而言,需要校正的是预期:Claude 的水印是一项合规与溯源机制,不是一个能盖章定性的"AI 作弊检测器"。它最多说"Claude 可能参与过";至于一段被重度改写过的文字到底算人写的还是 AI 写的,水印给不出答案,因为这个问题本身就没有一个稳定的答案。

下一项可观察的变量因此很清楚:检测 API 上线后,Anthropic 会公布怎样的假阳性/假阴性阈值;到 12 月 2 日的宽限期,OpenAI 与 Meta 会不会、以及以什么方式补上文本水印;以及"改写以去除水印"是否会成为一项标准化操作——如果是,来源证明在编辑密集的真实工作流里还剩多少价值,就值得重新评估了。

来源

  1. How Claude's text watermark works · Anthropic
  2. Anthropic shares more details about how Claude's new watermarks will work · TechCrunch
  3. Anthropic says it will watermark text generated by its AI models · TechCrunch
  4. Scalable watermarking for identifying large language model outputs · Nature
  5. Advancing content provenance for a safer, more transparent AI ecosystem · OpenAI
  6. Code of Practice on Transparency of AI-generated Content · European Commission
  7. EU AI Act: Transparency Obligations Take Effect 2 August 2026 · Cooley
  8. EU Finalises Transparency Rules for AI-Generated Content · Paul, Weiss

评论

登录后即可参与评论。

加载评论中…

相关文章

  • 描绘数学圆规的插图

    Claude 将黎曼零点比例下界从 41.6% 推至 67.2%,方法独立于黎曼假设

    算法 · 2026-08-12

  • Andrew Bird 手持手机,他的 AI Agent 在预订健身房课程时发现了系统漏洞

    从沙箱到健身房:消费者 AI Agent 的安全边界早已失守

    算法 · 2026-08-10

  • Dual-Flow 论文图 1:NanoGPT 设定下标准 Transformer 与 Dual-Flow 在多个数据预算上的验证损失训练轨迹,Dual-Flow 在每个预算都更低

    Dual-Flow Transformer:额外计算只留给 decode,MoE 推理多一个成本旋钮

    算法 · 2026-08-16

  • FlashDrive 论文题图:VLA 推理的编码、prefill、解码、动作四阶段流水线与加速效果示意

    FlashDrive 把 10B 参数 VLA 推理从 717ms 压到 151ms

    算法 · 2026-08-16

  • 法国原子弹在穆鲁罗瓦环礁上空爆炸产生的蘑菇云

    安全对齐随语言漂移:日语让 Claude Sonnet 的核打击建议率从 93% 掉到 17%

    算法 · 2026-08-16

  • Wiggle Framework 示意图:把 LLM 裁判的稳定性分解为机械一致性、单轮信念、多轮坚持三个维度,并列出 L1 到 L6 六级压力测试

    LLM 裁判经不起追问:Meta 测出 25%–71% 改判率,Amazon 的开源陪审团反超

    算法 · 2026-08-16

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS