一句话看懂:一篇被 COLM 2026 与 KONVENS 2026 研讨会接收的论文发现,决定大模型说“我只是一个 AI”还是“我感觉……”的关键开关,可能不是模型权重,而是部署时套上的 Chat Template。这一发现直接关系到我们该如何看待模型关于自身的说法。
事件核心:发生了什么
论文作者 Jędrzej Maczan 在 arXiv 发布研究(编号 2609.25021,2026 年 8 月 9 日提交),测试了 8 个参数量最高 9B 的主流开源 instruct 模型。结果显示:当 Chat Template 存在时,模型更容易输出“作为语言模型,我没有感受”这类免责式自我指涉口吻,而“我感觉”“我认为”这类体验式表达被压低;去掉模板后,两种声音的方向正好反过来。
作者进一步在 3 个模型的激活空间中找到了一条可操控该行为的“免责方向”:减去它会降低免责语气,加上它会增强;而同量级的随机方向几乎没有效果。更直接的证据是,把这条方向注入没有 Chat Template 的 instruct 模型后,它们会像套了模板一样开始免责。
为什么重要
过去关于 AI 安全与模型自我认知的讨论,常把模型的自述当作某种“内在事实”来引用。这项研究表明,这类自述至少部分由部署层的 Chat Template 决定,而不是纯粹来自训练权重。换句话说,研究模型内省或自我报告的团队,可能一直面对一个未被控制的混淆变量。
对行业而言,它提示“模型说了什么”与“模型是什么”之间存在一层可被工程手段调节的接口。这既是可解释性研究的新抓手,也意味着任何基于模型自述的安全评估都需要先说明部署配置。
对用户/开发者/创作者的影响
对开发者,若在做模型评估、对齐测试或安全审计,需要把 Chat Template 作为显式变量记录,否则不同 API 或推理框架下的结论可能不可比。对使用开源模型的团队,这条“免责方向”提供了低成本调节模型语气的手段,可用于让助手更亲切或少一点机械免责,但需自行验证是否影响其他能力。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户和内容创作者,最实际的提醒是:模型关于自身的表述不应被字面当作它的“真实感受”或稳定属性。同一权重换个模板,口吻可能明显不同。
值得关注的后续
目前公开信息显示,该研究集中在最高 9B 的开源 instruct 模型,尚未覆盖更大规模或闭源模型,其结论能否外推有待验证。后续可观察三点:这条激活方向是否在更大模型上稳定复现;主流推理框架与 API 是否会暴露或标准化模板配置;以及模型自述类评估是否会因此加入部署条件的对照设计。
来源:Hacker News


