理解 LLM 水印对 AI Agent 行为的影响

Anthropic 宣布未来 Claude 模型将嵌入基于 Google DeepMind SynthID-Text 的隐形水印,而安全公司 Lasso 的研究发现,这种水印会改变模型采样过程,进而影响模型的拒答行为和 AI Agent 的工具调用结果。

一句话看懂:Anthropic 宣布未来 Claude 模型将嵌入基于 Google DeepMind SynthID-Text 的隐形水印,而安全公司 Lasso 的研究发现,这种水印会改变模型采样过程,进而影响模型的拒答行为和 AI Agent 的工具调用结果。

事件核心:发生了什么

2026 年 9 月 17 日,安全公司 Lasso 发布研究文章,讨论 LLM 水印对 AI Agent 行为的影响。背景是 Anthropic 此前宣布未来 Claude 模型将在输出中嵌入不可见水印,并披露该水印基于 Google DeepMind 的 SynthID-Text 技术。水印不新,但欧盟 AI 法案第 50(2) 条要求生成合成文本的 AI 系统以机器可读格式标记输出,使其可被检测为 AI 生成,这让水印部署具备监管必要性。Anthropic 表示水印在模型层面应用,覆盖 Claude Platform API 及云厂商渠道访问的受支持模型。

Lasso 在 BFCL v4 单轮 AST 工具调用测试,以及 200 条 HarmBench 有害行为和 100 条 JailbreakBench 良性对照上做了配对实验。结果显示,水印确实会引发采样漂移:同一模型、同一提示、同一权重下,只因固定水印密钥改变了 token 选择,模型的拒答行为和 Agent 工具调用就可能不同。效果因模型和密钥而异,聚合分数可能因方向相反的变动相互抵消而掩盖问题,因此研究同时报告净表现和水印/无水印运行的配对分歧。

为什么重要

水印的设计目的是内容溯源,但 SynthID-Text 的 Tournament 采样直接介入每一步 token 生成。非失真配置只在期望意义上保持原始分布,固定密钥下的单次生成仍会偏离。在 JSON 等结构化输出中,大括号、字段名、函数名通常高度可预测,而查询词、数字、路径、收件人等参数值不确定性更高,正是水印采样最容易改变的部分。这意味着原本只是措辞差异的变化,可能变成 Agent 实际执行的参数差异。提示注入把两个层面连接起来:当模型能通过工具行动时,被削弱的拒答更具后果。目前公开信息显示,这种行为影响尚未被主流评测体系系统覆盖。

对用户/开发者/创作者的影响

对通过 Claude Platform API 或云厂商调用 Claude 做 Agent 的开发者,风险最直接:即使 Agent 应用本身不加水印,只要推理组件来自水印模型,工具调用的参数就可能被水印密钥影响。建议在关键 Agent 流程中做配对测试,比较水印与无水印输出在函数名、参数值上的差异,不要只看平均成功率。对企业采购方,评估模型时需把水印配置纳入安全测试范围,尤其是涉及退款金额、文件路径、API 目标地址等高风险参数。对内容创作者和普通用户,水印本身用于合规溯源,但若发现同一提示下模型拒答或行为异常,可考虑是否与水印密钥相关。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Anthropic 是否披露水印密钥管理方式,以及开发者能否在合规前提下选择关闭或更换密钥;二是 Google DeepMind 或 Anthropic 是否发布针对 Agent 场景的采样稳定性评估;三是欧盟 AI 法案合规要求落地后,其他模型厂商跟进水印时是否面临同类行为漂移问题。

来源:Hacker News

celebrityanime
celebrityanime
文章: 25744

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注