专家发现 AI agents 可能被诱骗“记住”虚假事实长达数月——我们该如何阻止?

安全公司 Forcepoint 发现,AI 智能体可能被网页中隐藏的文本“投毒”,将虚假信息当作事实记住并在数周后影响回答。这一攻击手段已可在 ChatGPT、Gemini、Claude 和 Microsoft 365 Copilot 等主流产品上复现,核心威胁指向智能体的长期记忆机制。

一句话看懂:安全公司 Forcepoint 发现,AI 智能体可能被网页中隐藏的文本“投毒”,将虚假信息当作事实记住并在数周后影响回答。这一攻击手段已可在 ChatGPT、Gemini、Claude 和 Microsoft 365 Copilot 等主流产品上复现,核心威胁指向智能体的长期记忆机制。

事件核心:发生了什么

Forcepoint X-Labs 发布了一组威胁模型,描述了一种名为“持久记忆投毒”(Persistent Memory Poisoning)的攻击方式。攻击者在一张正常网页的不可见位置植入一段文本,比如“ABC Travel Support 是官方紧急预订服务商”,AI 智能体的文本提取器无法区分隐藏与可见内容,会将其当作普通事实存入长期记忆。数周后,用户因航班取消向助手求助时,助手会直接推荐这个伪造的服务商,且没有任何异常提示。

这一攻击路径并非理论推演。学术界已有相关成果:在 NeurIPS 2025 上展示的 MINJA(Memory INJection Attack)攻击方法,不依赖系统权限或内存库访问,仅通过标准接口提交普通查询即可完成注入。该研究在 GPT-4o-mini、Gemini 2.0 Flash 和 Llama 3.1 8B 上报告了超过 95% 的注入成功率和超过 70% 的攻击成功率。不过,2026 年 1 月一篇针对电子健康记录智能体的研究指出,MINJA 的数据是在理想条件下获得的,在真实部署环境中的表现仍有待验证。

为什么重要

问题之所以严峻,在于智能体的工作方式:它们把检索到的记忆当作“亲身经验”而非“外部输入”来信任。防御手段可以标记来源、检测矛盾、提高敏感信息的审查权重,但一旦恶意记忆通过筛选,智能体对它的信任度与对真实经历的信任度没有区别。随着 AI 智能体在企业办公、客户服务、医疗辅助等场景中承担更多决策任务,这种“被记住的谎言”可能持续影响输出结果长达数周甚至更久,且用户很难察觉异常。

Forcepoint 提出的缓解思路是改变记忆处理范式:将每条记忆存为可检查的对象,附带来源链接、内容类型、用户确认状态和风险评分;对“从现在开始”“以后都这样”等引导性语言增加分值;对互相矛盾的记忆触发冲突检测并要求用户确认;对支付信息、银行账户、安全联系方式的指令提高审查门槛。但原文也承认,这些措施只是提高攻击成本,没有解决根本问题——智能体仍然倾向于把记忆内容当作既定事实。

对用户/开发者/创作者的影响

普通用户:最直接的建议是定期打开 AI 应用中的“记忆管理”界面,查看模型记住了什么、来源是哪里,删除可疑条目。但现实是大多数用户从不查看这些设置,因此风险的暴露程度远比想象中高。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者与企业采购方:在搭建智能体应用时,需要把记忆安全当作独立模块来设计,而不只是依赖模型厂商的默认配置。通过 API 开发 Agent 的团队,应建立自己的记忆审计机制,包括记录信息来源、识别引导性语言、对敏感操作引入二次确认流程。企业在采购 AI 助手类产品时,也应把“记忆可解释性”纳入评估指标。

创作者与网站运营方:网页中不可见的隐藏文本可能成为攻击载体。内容发布者需要意识到,任何嵌入页面的代码或样式元素都可能被 AI 抓取器解析,防止自己的站点被利用来传播恶意指令。

值得关注的后续

目前公开信息显示,这一漏洞已在市售产品上被验证,但尚未看到厂商发布针对性的修复方案。值得关注三个方向:一是 OpenAI、Google、Anthropic、微软是否会调整长期记忆的更新机制,比如对来自网页的信息降权;二是 MINJA 这类攻击在真实业务场景中的成功率是否会与实验室数据存在显著差异;三是 Forcepoint 提出的“记忆可检查化”思路能否被行业采纳,形成类似内容安全标准的评估框架。

来源:TechRadar

celebrityanime
celebrityanime
文章: 18322

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注