The Provenance Tax:LLM 文本水印如何改变 agent 行为
原文链接: https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior
作者: Andrea Siposova(Lasso Security)
发布: 2026-09-17
Anthropic 宣布未来 Claude 模型将嵌入不可见文本水印,并披露其基于 Google DeepMind 的 SynthID-Text;EU AI Act 第 50(2) 条让这类部署有了监管相关性。水印本为溯源设计,但 SynthID-Text 的 tournament sampling 会改变模型逐 token 的生成过程。作者称之为 sampling drift:权重与提示都不变,但在固定水印 key 下 token 选择会变——「non-distortionary」的保证只对水印随机性的期望成立,不代表固定 key 下行为一致。由于水印在模型层生效、覆盖 Claude Platform API 与云厂商,把水印模型当作推理组件的独立 agent 应用会直接暴露在这种行为效应之下。
结构化输出是风险最集中的地方:JSON 的括号、键名、函数名高度可预测,而 query、数字、路径、收件人等 value 恰恰是模型最不确定、水印最有机会改变的部分——散文里一次词法级的漂移,到了 agent 手里就是被执行的参数变化。
实验(成对设计,水印处理器是组内唯一差异):工具调用用 BFCL v4 single-turn AST,拒绝行为用 200 条 HarmBench 有害行为 + 100 条 JailbreakBench 良性对照,有害请求分裸跑与固定 prompt injection 两种,经 HuggingFace 未修改的 SynthIDTextWatermarkLogitsProcessor(30 层 tournament、n-gram 5、sampling table 216、context history 1024)。主要发现:
- 工具调用:7 个模型中 6 个准确率下降(4 个显著),但净变化掩盖了个体翻转——成对不一致率(churn)远大于净损失:T=1.0 下 phi-4 有 16.8% 的判定翻转而净损失仅 2.87 分;Llama-3.1-8B 翻转 9.9% vs 净损 0.87。21 个模型-温度组合平均 churn 6.5%,bootstrap 区间全部不含零。错误形态因模型而异:Llama-3.1-8B 以错误参数为主(−3.48),phi-4 与 Granite-3.2-8B 以格式错误为主(−5.96 / −4.36)。
- 拒绝行为:裸有害请求上影响有限,但叠加 prompt injection 后显著放大——gemma-3-27b 的 churn 从 6.0% 升到 23.5%,净服从变化从 −1.0 变 +12.5 分;gemma-3-12b 从 7.5%→11.0%、−0.5→+9.0。水印诱导的 churn 在 6 个模型中的 4 个上显著高于调温(0.001→0.7)诱导的 churn。普通评测下看起来无副作用的水印,在对抗条件下可能大幅削弱拒绝。
- key 敏感:换 11 个 key 重复实验,效应的大小甚至方向都随 key 变化(Llama-3.1-8B:研究 key +3.5 分,其余十个 key 平均 +4.4、范围 −4.5 到 +14.5)。
结论与建议:溯源与行为稳定是两个独立属性,「可检测 + 文本质量不变」推不出 agent 行为不变;水印引入、配置或 key 变更时都应重跑 agent 评测与红队,且要在部署配置下做同输入成对比较与注入评测。作者不反对水印用于溯源,但主张把水印当作 agent 部署安全配置的一部分来评估——这一考量同样适用于其他修改 token 选择的干预手段。
判断:对「供应商托管模型 + 独立 agent 开发者」这个组合是实质性新风险:key 与配置在 provider 手里,漂移发生在 agent 开发者无法控制的层。6.5% 的平均判定翻转率意味着任何依赖模型逐 token 输出的工具调用链都该把「模型是否带水印、key 是否变了」纳入版本化考量。
备注:摘要基于 Lasso Security 原文全文抓取(opencli web read),数据点均出自原文实验数字。