后门在LLM代理微调后仍可存活?PersistBD将攻击成功率从20%提升至76%

一项来自 Hugging Face Papers 的研究发现,第三方模型植入的后门在开发者对 LLM Agent 进行监督微调(SFT)和任务级强化学习(RL)后,可能仍然存活甚至被刻意增强;PersistBD 方法可将攻击成功率从 20% 提升至 76%。

一句话看懂:一项来自 Hugging Face Papers 的研究发现,第三方模型植入的后门在开发者对 LLM Agent 进行监督微调(SFT)和任务级强化学习(RL)后,可能仍然存活甚至被刻意增强;PersistBD 方法可将攻击成功率从 20% 提升至 76%。

事件核心:发生了什么

根据 2026 年 10 月 5 日发布在 Hugging Face Papers 的论文摘要,研究者关注软件工程场景下的 LLM Agent 供应链威胁:攻击者在第三方模型中植入后门,当特定输入模式出现时产生恶意输出。开发者通常会对这些模型进行良性 SFT 和后续 RL,以适配具体任务。摘要指出,良性 SFT 会显著降低攻击成功率,但随后的 RL 常常保留残余后门行为,有时甚至提高攻击成功率。基于这一观察,作者提出 PersistBD,在模型发布前对已植入后门的模型进行优化,以增强其穿越良性后训练过程的能力。在 Qwen2.5-Coder-7B 上,PersistBD 将 SFT 后的攻击成功率从 20% 提升到 74%,SFT-RL 后从 20% 提升到 76%,同时保持相近的良性任务表现。目前公开信息仅为论文摘要,全文实验与同行评审状态未在素材中说明。

为什么重要

这项研究把 AI 供应链风险从“预训练模型是否干净”延伸到“后训练能否清除后门”。现实开发中,许多团队基于开源或第三方模型构建 Agent,再进行 SFT 和 RL,天然信任这一流程能覆盖原有隐患。摘要显示,良性后训练在部分条件下不仅无法根除后门,还可能被攻击者逆向利用,通过 PersistBD 类方法主动提高后门存活率。这意味着模型分发、微调服务、RL 训练框架等环节都可能成为攻击面,对依赖第三方模型快速构建 AI 应用的开发者构成新的安全考量。

对用户/开发者/创作者的影响

对开发者而言,若使用外部模型构建软件工程 Agent 或调用相关 API,需要把“继承后门”纳入风险评估,而不能只依赖 SFT 或 RL 作为清洗步骤。企业在采购模型或微调服务时,可关注供应商是否提供后门检测、模型来源审计和训练数据溯源能力。对普通用户和创作者来说,这类风险目前更多影响自动化代码生成、Agent 工具调用等场景,日常对话类使用受影响程度尚不明确。摘要未给出部署建议或缓解方案细节,因此不宜直接推断现有产品已受影响。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 PersistBD 代码已在 GitHub 公开,后续是否会出现更系统的后门检测基准或防御方法;二是模型托管平台和微调服务商是否会跟进模型来源审计或后训练安全评估;三是该研究结论能否在更多模型、更多任务上复现,以及 RL 阶段后门增强的机制是否会被进一步解释。以上均需等待全文或后续研究验证。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 27826

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注