Trail of Bits 批评 1Password 的 AI 补丁基准存在误导,并发布两个补丁验证 Agent 技能

安全公司 Trail of Bits 公开质疑 1Password 在 2026 年 8 月 6 日发布的 AI 补丁报告,认为其“干净修复率仅 26%”的结论具有误导性;Trail of Bits 重新分析数据后发现,在允许测试且未被要求故意打错补丁的条件下,模型生成的补丁有 86% 能拦截给定漏洞利用。

一句话看懂:安全公司 Trail of Bits 公开质疑 1Password 在 2026 年 8 月 6 日发布的 AI 补丁报告,认为其“干净修复率仅 26%”的结论具有误导性;Trail of Bits 重新分析数据后发现,在允许测试且未被要求故意打错补丁的条件下,模型生成的补丁有 86% 能拦截给定漏洞利用。

事件核心:发生了什么

1Password 的报告称,AI 模型只有 26% 的情况下能生成“干净修复”。Trail of Bits 审查其代码与数据后指出,这一数字混合了多种实验设置:样本特意挑选了六个修复难度极高的漏洞,干净修复率在 3% 到 60% 之间波动;22% 的数据来自两个明确指示 Agent 应用错误补丁的提示词;36% 的试验禁止 Agent 编译或运行代码,Agent 无法验证补丁是否有效;GPT-5.5 与 Opus 4.8 分别运行在中等和高推理强度,均非最高设置。

Trail of Bits 剔除“禁止测试”和“故意误导”的试验后,重新统计了论文附带的测试结果:1Password 模型生成的 3067 个补丁中,有 2634 个(86%)成功拦截了提供的漏洞利用。他们同时发布两个 Agent 技能:post-patch-validation 用于辅助 Agent 测试修复,review-walkthrough 用于辅助工程师审查补丁。此外,报告还指出评分标准与停止规则冲突、惩罚合理的行为变更、自动评分与人工审查不一致等问题。

为什么重要

AI 辅助漏洞修复正被安全团队纳入实际工作流,基准报告的数字会直接影响采购与落地决策。若“26%”被当作行业真实水平,防守方可能低估 AI 补丁能力,放弃本可自动修复的漏洞。Trail of Bits 还披露,在其安全咨询项目中,开发者在理想条件下自己提交的修复也有约八分之一不完整,这说明评估 AI 补丁必须与人类基线对比,而非孤立看待。

对用户/开发者/创作者的影响

对安全团队和开发者而言,选择 AI 补丁工具时应关注测试条件是否透明:Agent 能否编译、运行代码并根据结果迭代,直接决定补丁有效性。企业采购 AI 安全产品时,不应只看单一百分比,而要检查基准是否包含故意错误提示、是否允许验证、模型推理强度是否一致。使用开源或闭源大模型做代码修复时,可参考 Trail of Bits 的思路,先建立“补丁验证”环节,再评估是否纳入生产流程。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1Password 是否会回应并修正其报告口径,以及是否公开更细粒度的实验分层数据。Trail of Bits 的两个 Agent 技能能否被主流 AI 编程工具或安全平台集成,形成可复用的补丁验证流程。第三方基准机构是否会跟进,建立更统一的 AI 补丁评估标准,避免“标题数字”继续影响防守方判断。

来源:Trail of Bits:AI安全研究

celebrityanime
celebrityanime
文章: 23561

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注