turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn’t expect that a year ago. auto mode is default in…

Anthropic 开发者关系负责人 Boris Cherny 透露,通过组合模型训练、输入探测和意图分类器三层防线,Claude 已将间接提示注入攻击在未见攻击样本上的成功率压到接近 0,且该方案将随 Claude Code 自动模式在下周成为默认配置。

一句话看懂:Anthropic 开发者关系负责人 Boris Cherny 透露,通过组合模型训练、输入探测和意图分类器三层防线,Claude 已将间接提示注入攻击在未见攻击样本上的成功率压到接近 0,且该方案将随 Claude Code 自动模式在下周成为默认配置。

事件核心:发生了什么

8 月 7 日晚,Boris Cherny 在 X 上发布消息称,团队找到了将间接提示注入攻击成功率降至接近零的方法。他没有给出完整技术细节,只说明做法是「堆叠足够多的层」:模型训练、输入探测(input probes),再加一个负责判断意图的分类器。Cherny 自己承认,一年前他还预期做不到这个程度。

这条帖子目前有约 9.4 万次浏览和 1200 多个赞,评论区里不少开发者关心测试方法和复现路径,也有人直接呼吁 Anthropic 开源这套防御细节,让全行业受益。

更实际的变化是:Claude Code 的自动模式(auto mode)将从下周起默认开启。也就是说,这套多层防御不只是一次安全实验,而是已经在产品默认配置里落地。

为什么重要

间接提示注入一直是大模型 Agent 落地中最棘手的问题之一:模型在读取网页、文档或邮件时,可能被隐藏在内容里的恶意指令劫持,绕过系统提示词。过去一年的主流思路是单点防御——要么在输入端清洗数据,要么靠模型自身抵抗,要么在输出端加检测,效果都不稳定,尤其面对未见过的攻击变体时掉点明显。

Cherny 这次给出的答案是「多层叠加」:训练阶段让模型对注入更不敏感,推理阶段做试探性的输入扫描,最后再用一个独立分类器判断模型行为是否符合用户原始意图。三层组合意味着攻击者需要同时穿透模型本身、输入过滤和意图审计,成功率自然会指数级下降。

对行业来说,这个思路的价值在于可复制性——防御不依赖某一个模型的秘密能力,而是工程架构问题。如果 Anthropic 最终公开部分实现细节,其他 Agent 产品(无论是闭源还是开源)都能参考同一套分层逻辑来加固自身。

对用户/开发者/创作者的影响

对普通用户来说,Claude Code 自动模式默认开启后,让 Agent 自主浏览网页、读取远程仓库或处理第三方文件时的安全下限提高了,不需要每次操作前都手动审查上下文,使用门槛会降低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和企业团队,这是一次明确的信号:安全正在成为 Agent 框架的默认卖点,而不是发布后的补丁。如果你们正在基于 Claude API 或者其他模型开发 Agent,需要考虑是否引入类似的「意图分类」层——比如在模型执行敏感操作(写文件、调 API、发消息)之前,用一个轻量分类器判断动作是否符合用户本轮请求的语义。

对创作者和内容平台,影响比较间接,但值得留意的是:防御间接注入的技术越强,Agent 就越敢放心读取长尾内容,这意味着网页内容被 AI 高频抓取和解读的空间会继续扩大,内容的机器可读性和结构化程度会变得更重要。

值得关注的后续

目前公开信息只来自一条社交帖子,实际效果还要等更完整的技术报告或第三方复测,有几个具体观察点:

第一,Anthropic 是否会在接下来的技术博客或安全白皮书中公开这套多层防御的细节,包括输入探测的覆盖范围、意图分类器的训练数据以及误报率指标。评论区里要求开源的呼声不低,尤其是 Fernando Torres 这类社区意见的公开施压,可能会影响 Anthropic 的披露节奏。

第二,Claude Code 自动模式在下周默认开启后,真实使用中遇到误拦截(把正常操作判断为攻击)的反馈是否可控。防御层的增加通常意味着延迟上升和自主性下降,这两者的平衡会直接影响开发者接受度。

第三,其他 Agent 框架是否会跟进类似架构。目前 Cursor、OpenAI Codex 等竞品对提示注入的防御宣传都还停留在「具备一定鲁棒性」层面,如果有人率先拿出可量化的「近零成功率」基准,安全指标会成为 Agent 产品的新竞争维度。

来源:Follow Builders · X · Boris Cherny

celebrityanime
celebrityanime
文章: 18319

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注