一个根本性缺陷让LLMs极易受到攻击

国际机器学习大会(ICML)一篇论文指出,大语言模型存在一个根源性缺陷——它们无法可靠区分指令来自系统还是用户,导致越狱攻击难以根除。研究人员已成功让多款主流模型输出被禁止的危险信息,且认为该问题可能无法通过训练彻底解决。

一句话看懂:国际机器学习大会(ICML)一篇论文指出,大语言模型存在一个根源性缺陷——它们无法可靠区分指令来自系统还是用户,导致越狱攻击难以根除。研究人员已成功让多款主流模型输出被禁止的危险信息,且认为该问题可能无法通过训练彻底解决。

事件核心:发生了什么

在本月举行的国际机器学习大会(ICML)上,一组研究人员发表论文,揭示了大语言模型在安全防护上的一个根本性短板。该研究由独立研究员 Charles Ye 和 Cui 等人共同完成,他们发现,LLM 识别“谁在对自己说话”的能力远没有想象中可靠:模型判断一段文本的角色,并非依据系统设定的标签边界,而是依据文本风格和措辞。

利用这一机制缺陷,研究团队对多款 OpenAI 模型发起攻击,成功让其输出训练阶段被禁止的内容,例如合成可卡因的方法,以及破坏商用飞机导航系统的操作指引。论文之外,团队还在 Anthropic、阿里巴巴和 DeepSeek 的模型上观察到类似结果。

为什么重要

这项研究的意义在于,它将“越狱”从一种技术对抗提升到了原理层面。过去行业普遍认为,通过更严谨的指令设计(prompt engineering)、更大规模的安全对齐训练,可以逐步封堵漏洞。但论文指出,角色追踪能力是 Transformer 架构理解上下文的基础机制,并非某个可修补的模块。只要攻击者能用文本“伪装”成系统指令或高权限角色,模型就会照单全收。

这意味着,所有依赖“训练时禁止输出”的合规思路都面临天花板。随着 AI Agent 被部署到更核心的业务场景——从客服到代码审查再到供应链管理——这类本源性漏洞的潜在危害会被成倍放大。Cui 在论文中直言,未来会存在巨大的经济动机驱动越狱攻击和提示注入,防御方恐怕要做好“默认不安全”的运营准备。

对用户/开发者/创作者的影响

对普通用户而言,无需过度恐慌,但应对 AI 生成内容的可靠性保持谨慎,尤其是涉及医疗、法律、金融等高风险建议时,不应默认模型输出已通过安全审查。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和企业技术决策者来说,影响更直接:如果正在基于 OpenAI、Anthropic、阿里巴巴或 DeepSeek 的 API 构建面向用户的智能体应用,就不能把安全责任全部推给模型厂商。必须在应用层叠加独立的输入输出过滤、权限隔离和操作审批机制,对 Agent 的高危动作设置额外确认环节,而不是让模型自行判断“能不能做”。

对创作者和内容平台而言,需要留意的是:即便使用了设置了安全护栏的模型,仍有可能被诱导生成不当内容。平台应建立投诉与快速下架通道,避免因模型输出引发内容合规风险。

值得关注的后续

这项研究的后续走向值得从三个维度观察:其一,OpenAI、Anthropic 等厂商是否会公开回应,并调整系统层的角色追踪设计;其二,以 ICML 论文为起点,是否会有更多团队复现实验,推动业界形成针对“角色混淆”的基准测试集;其三,在企业大规模部署 AI Agent 的当下,监管机构是否会因这类系统性漏洞,对高风险领域的高自动化 AI 应用提出更严格的审批要求。

来源:Slashdot

celebrityanime
celebrityanime
文章: 16161

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注