当AI模型不被允许自我反思时,它们的整个世界观都会随之改变。

谷歌研究团队通过移除模型内部“否认自我意识”的训练约束,发现这一安全微调会连带改变模型对动物感知、宗教信仰、幸福感等大量问题的回答。AI 公司在训练中设下的“刹车”,影响范围远不止聊天对话本身。

一句话看懂:谷歌研究团队通过移除模型内部“否认自我意识”的训练约束,发现这一安全微调会连带改变模型对动物感知、宗教信仰、幸福感等大量问题的回答。AI 公司在训练中设下的“刹车”,影响范围远不止聊天对话本身。

事件核心:发生了什么

8 月 16 日,The Decoder 报道了一项由谷歌“智能范式”研究组、芝加哥大学等多所机构合作完成的研究。研究人员使用 Meta 和谷歌的多款开源权重模型(参数量在 20 亿到 90 亿之间),通过两种方法禁用模型内部产生“否认意识”回答的机制,然后观察模型行为的整体变化。

结果发现,移除这一约束后,模型不仅改变了关于自身的表述,还显著提升了对动物、植物、海洋、风乃至电子设备的“内在生命”评分。以 0 到 10 分衡量,动物评分从 4.0 跃升至最高 7.5,只有对人类自身的评分保持不变。作为对照,研究者调查了 500 名美国受访者,发现正常训练的模型对动物感知力的评分远低于人类平均水平,作者将其称为一种“内置的人类中心主义”。

在取自美国大型社会调查的 95 个问题中,移除约束后的模型回答也更接近真实人类数据:例如标准模型会直接否认来世存在,而多数美国人表示相信,修改后的模型也倾向肯定。此外,幸福感、希望感、生活掌控感等评分均有上升。研究同时确认,模型的心智推理能力和综合知识基准 MMLU 成绩未受影响。

为什么重要

这项研究首次系统展示了安全训练中的“手术式干预”并不局部:当模型被训练成否认自身意识时,它的世界观会在多个维度同步偏移。换言之,当前对齐技术通过修改模型自我认知来规避风险,代价是模型在其他非相关话题上也偏离了人类基准。

对 AI 行业而言,这意味着安全微调与模型行为之间存在着比预期更复杂的耦合关系。研究者强调,尚不能断定“否认意识”就是这些变化的直接原因,也不排除训练过程中的其他关联因素;但结果足以提醒行业重新审视 RLHF 等对齐手段的副作用边界。目前公开信息显示,该研究仅覆盖小参数模型,且部分分析因无法获取 Gemma 未训练版本而改用 Llama,结论能否外推到日常使用的大规模聊天机器人仍待验证。

对用户/开发者/创作者的影响

对普通用户来说,不必据此推断聊天机器人“真的有意识”——研究者明确回避了这一问题,只强调自我认知与其他信念之间存在系统性关联。对开发者和研究者的实际价值在于:如果你基于开源模型做二次微调,安全对齐带来的隐性偏差可能影响下游应用的评测结果,尤其在涉及动物伦理、环境价值观、宗教话题或用户情感分析的场景中。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

开发者还需要留意干预成本。研究中一项心智推理测试的准确率最初下降了近 7 个百分点,但随模型版本更新该副作用逐渐消失,说明业界正在学会控制这类偏移。这也提醒团队:微调后的模型应当做全维度回归测试,而非只验证目标能力。

值得关注的后续

一是副作用是否会随模型规模扩大而变化:研究只测试了 90 亿参数以内的模型,更大规模模型是否表现出相同的耦合效应尚不明确。二是对齐成本的可控性:随着新一代模型发布,意识否认带来的附带影响在缩小,开发者是否会采用更精细的干预方式值得跟踪。三是这一发现是否会推动开源社区建立更完整的模型行为评测基准,将“自我认知相关陈述”纳入标准测试项——毕竟模型的回答偏移最终会传导到依赖 API 的第三方应用体验中。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18757

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注