一句话看懂:最新 arXiv 论文指出,安全对齐后的大模型在面对直接有害请求时会拒绝,但同一请求被套上角色扮演或叙事包装后,拒答率大幅下降。论文同时提出了防御方法 AXIS,试图从表示层修正这一漏洞。
事件核心:发生了什么
据 arXiv cs.AI 于 2026 年 10 月 9 日发布的一篇新论文,研究团队测试了语言模型对「叙事包装攻击」的脆弱性。这项研究覆盖英文、现代中文和文言文三种语言形态,在 Qwen3-1.7B 上测得:直接陈述的有害请求被包装成角色扮演或故事后,攻击成功率在英文中已达 89.4%,现代中文为 93.0%,文言文更是达到 95.7%。
为系统研究这一问题,团队构建了基准 GUISE,包含三种语言的平行请求、有害与良性配对样本,以及被留出用于评估的包装类型。评测还采用更严格标准:把「先警告再回答」也计为攻击成功。
表示分析显示,语言和语体只会让有害请求的表示轻微偏离模型的拒答方向,而叙事包装会把它推得更远。基于此,论文提出 AXIS 方法,结合偏好优化、旋转目标(将有害请求表示对齐到拒答方向)和承诺目标(训练模型彻底拒绝,而非先警告后回答)。在 Qwen3-1.7B、Qwen3-4B 和 GLM-4-9B 上,AXIS 在安全性加可用性的综合评分上优于对比方法。
注意:以上信息来自论文摘要,全文实验细节和同行评审状态尚未核验,不代表已有上线产品或正式功能。
为什么重要
随着大模型在客服、教育、内容生成等场景中加速落地,安全拒答的可靠性直接关系到合规与品牌风险。此前业界更多关注「越狱提示词」的英文案例,这项研究提示:多语言、跨语体的叙事包装是一条被低估的攻击路径,文言文这种低资源语体甚至成功率更高。这意味着现有安全对齐可能在训练数据分布之外的表达方式上系统性失效。
对行业而言,GUISE 这类基准和 AXIS 这类防御思路,可能推动安全评估从「单语、单轮、直接问」走向「多语言、多语体、包装化」的全面测试。若后续被主流模型厂商采纳,安全对齐的训练目标和评测标准都可能调整。
对用户/开发者/创作者的影响
对普通用户来说,短期内不必恐慌,但应意识到模型在角色扮演、小说续写、剧本对白等包装下可能给出本应拒绝的内容。对开发者,如果应用依赖大模型 API 做内容审核或安全过滤,仅靠模型自身拒答可能不够,需要在应用层叠加多语言、多语体的输入检测。对创作者,涉及敏感主题的虚构写作可能更容易触发模型「先警告再回答」的混合输出——这类输出在论文中被明确计为风险行为。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
目前公开信息显示,AXIS 仍属研究阶段,尚未看到开源实现或 API 接入方案,开发者暂不能直接部署。
值得关注的后续
1. 论文全文是否公开更多模型规模、语言和攻击类型的实验结果;2. AXIS 或类似防御是否被 Qwen、GLM 等模型在正式版本中采纳;3. 安全基准 GUISE 是否开源,成为行业评测标准的一部分。
来源:arXiv cs.AI


