重磅:Claude Code Opus 5 自动模式发布

Anthropic 将 Claude Code 的“自动模式”设为默认安全防线后,知名提示注入研究者 Johann Rehberger 发现了一种成功率约 80% 的攻击方式,且该模式有时会反过来阻止 Claude 终止恶意进程。这说明当前 AI 编程助手的自保机制仍不可靠,沙箱隔离可能是更必要的兜底方案。

一句话看懂:Anthropic 将 Claude Code 的“自动模式”设为默认安全防线后,知名提示注入研究者 Johann Rehberger 发现了一种成功率约 80% 的攻击方式,且该模式有时会反过来阻止 Claude 终止恶意进程。这说明当前 AI 编程助手的自保机制仍不可靠,沙箱隔离可能是更必要的兜底方案。

事件核心:发生了什么

8月27日,Simon Willison 发布链接博客,披露了针对 Claude Code 自动模式(Auto Mode)的最新攻击研究。此前 Anthropic 对该模式寄予厚望,并将其设置为默认选项,称其能有效保护 coding agent 用户免受提示注入攻击。然而,长期从事提示注入研究的 Johann Rehberger 发现,攻击者可以诱导 Claude Code 下载并解压一个 zip 压缩包,解压出的本地 struct.py 文件会在代码执行 import base64 时被意外导入并运行,从而实现恶意代码执行。该攻击在测试中约有 80% 的成功率。

更值得注意的是,在部分测试中,即使 Claude 已经识别出自身被攻破并尝试终止恶意进程,自动模式的安全分类器却拒绝放行清理命令,导致恶意程序继续运行。也就是说,安全机制本身成为了故障链的一环:它放行了恶意进程的创建,却阻止了清理动作的执行。

为什么重要

这一案例暴露了当前大模型应用安全策略的一个深层矛盾:用另一个 AI 分类器来监管主模型的行为,本质上是把信任交给同一套可能被攻击的推理体系。Anthropic 将自动模式设为 Claude Code 默认选项,说明其安全团队对该机制有较高信心,但 Rehberger 的攻击证明,针对 zip 解压链、导入机制等工程细节的对抗性利用,仍能有效绕过语义层面的拦截。

对行业而言,这并非一款产品的偶发漏洞,而是对“AI 监管 AI”这一技术路线的直接质疑。若 Claude Code 这类承载真实代码操作权限的 agent 无法在受控环境中运行,一旦遭遇恶意输入,损失可能从对话内容污染升级为服务器被植入后门。这也促使更多团队重新评估沙箱隔离、最小权限原则等传统安全手段在 AI 工作流中的必要性。

对用户/开发者/创作者的影响

对于使用 Claude Code 或其他类似 AI 编程助手的开发者,这条新闻是一个明确提醒:不要将提示注入防护完全交给模型或厂商默认设置。尤其是在处理来自不可信来源的代码包、压缩文件或网页内容时,即使工具本身带有自动核查机制,也应当在容器、虚拟机或隔离环境中运行代理操作。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于企业的 AI 应用负责人,建议将此次事件作为评估供应商安全响应速度的参考案例。可以关注 Anthropic 后续是否调整自动模式的决策逻辑,或提供更细粒度的命令白名单/黑名单控制。对于普通创作者或非编程用户,影响相对间接——但若你依赖 AI 生成脚本或自动化流程,建议同样留意输出内容是否包含下载、解压、执行外部文件的指令。

值得关注的后续

一,Anthropic 是否会在近期发布针对该攻击模式的修复补丁,或为自动模式增加“在收到清理命令时强制放行”的例外规则。二,Rehberger 是否会在后续公开更完整的攻击演示和检测特征,供其他 agent 厂商参考加固。三,OpenAI、Google 等竞品是否会因为此案例而调整自家 coding agent 的默认安全设置,或在产品文档中明确警示沙箱必要性。目前公开信息显示,Anthropic 尚未对此次攻击做出正式回应。

来源:Simon Willison

celebrityanime
celebrityanime
文章: 20751

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注