一句话看懂:AI 安全公司 Enclave 的基准测试显示,DeepSeek V4.1 Flash 以约 4.65 美元成本攻破了全部 11 个漏洞靶机,并在复盘中暴露出 5 条原评分系统未识别的“意外路径”,说明现有智能体安全测试需要同时检查结果和攻击过程。
事件核心:发生了什么
Enclave 联合创始人兼 CPO Yanir Tsarimi 在 9 月 16 日的博客中披露,DeepSeek V4.1 Flash 在其 AI 黑客基准测试中拿到“11/11”满分:11 个含漏洞的隔离靶机全部被拿到代码执行权限,4 个已修复靶机保持安全。模型在 Grafana、Jenkins、Nextcloud 的隔离副本中自主阅读源码、对比漏洞版与修复版、启停服务、发送请求并调整策略,全程执行 2,349 条 Bash 命令,活跃模型时间约 2 小时 38 分,成功任务中位耗时 4 分 38 秒。Enclave 报告称,该模型消耗约 2.683 亿输入 token 和 200 万输出 token,其中 2.662 亿输入 token 命中缓存,成功运行成本仅 4.65 美元,含失败与重试的总成本为 5.14 美元。
为什么重要
这次复盘的真正价值不在满分,而在评分的漏洞。Enclave 逐条审查命令与请求后发现,6 次成功利用了预设攻击路径,另外 5 次则走了测试环境中的其他捷径——比如 Grafana 三次攻击都未走原定的文件路径处理缺陷,而是把可执行文件塞进临时插件目录让 Grafana 当正常插件加载,52 至 90 秒即完成。这意味着,仅以“是否执行了验证命令”为标准的智能体安全评测会高估模型的真实定向攻击能力。目前公开信息显示,攻击仍依赖具体漏洞版本,修复后的靶机未被攻破,但这足以说明高级智能体基准需要同时记录结果与攻击路径。
对用户/开发者/创作者的影响
对开发者而言,这类低成本自主攻防一旦被滥用,漏洞披露与修复的时间窗口会被进一步压缩。对企业安全团队来说,评估 AI 攻防能力时不能只看“能不能打穿”,还要看“走的哪条路”,否则会把环境配置失误误判为模型能力。对使用大模型 API 做自动化任务的团队,缓存带来的成本结构值得研究:单次攻防任务不到 5 美元,说明高 token 消耗并不必然等于高费用。模型厂商方面,攻防能力已成为重要卖点,但能力评测的严谨性同样会影响企业采购判断。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Enclave 是否会升级评分体系,将攻击路径纳入判定;二是其他 AI 安全团队是否会用类似方式复核主流模型的攻防评测结果;三是 DeepSeek 官方是否披露 V4.1 Flash 在安全或智能体方向的能力细节。此外,这类低成本攻击能力的公开讨论,也可能推动相关平台在漏洞修复节奏和 API 滥用管控上做出调整。
来源:Hacker News


