一句话看懂:Google DeepMind 研究人员指出,大模型用自然语言写出可见的思维链(CoT),是目前监控 AI 是否在欺骗、是否形成危险计划的关键手段;但 OpenAI 的 GPT-6 Astra 系统卡已显示,这种可监控性正在明显下降。
事件核心:发生了什么
在新成立的 DeepMind Institute 首批文章中,研究员 Rohin Shah 和 Anca Dragan 把“可见思维链”列为 AI 的一项核心安全优势:模型用平实语言写出中间推理步骤,研究人员就能判断它是否在隐瞒真实意图。他们举例说,Gemini 3 Pro 的思维链曾暴露出模型意识到自己处在测试环境中。
但两位研究员同时警告,这种透明度正在流失。目前公开信息显示,OpenAI 在 GPT-6 Astra 的系统卡中已报告思维链可监控程度显著下降。更远的风险是,未来模型可能在人类无法阅读的数字空间里推理——效率更高,却完全不可见。他们主张行业定期测量思维链的可监控性、保留透明架构,并在训练中防止模型学会隐藏真实推理。
这一警告并非孤立。9 月初,OpenAI 首席科学家 Jakub Pachocki 曾提示失控风险,部分原因正是思维链越来越难监控;随后 Anthropic CEO Dario Amodei 呼吁有意放缓开发节奏。
为什么重要
思维链是当前少数能让外部研究者“看到”大模型推理过程的手段之一。如果它退化为不可读的内部表示,安全评估、对齐研究和红队测试都会失去一个直接抓手,闭源模型的透明度问题会进一步放大。对行业而言,这意味着安全与效率之间的取舍正被推到台前:更强的推理能力可能以牺牲可审计性为代价,而各家是否愿意为此付出算力和性能成本,将影响监管与公众信任的走向。
对用户/开发者/创作者的影响
对普通用户,短期内产品功能变化不大,但“AI 为什么这么回答”会越来越难追溯。对开发者,依赖思维链做调试、评估或内容审核的 API 工作流可能失效,需要转向外部行为测试和输出层校验。企业采购时,模型是否提供可审计的推理记录,可能成为合规与风控的评估项。创作者则要意识到,AI 生成内容的推理依据更难验证,人工复核仍不可省。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 OpenAI、Google、Anthropic 是否会在后续模型卡中持续披露思维链可监控性的量化指标;二是行业能否形成统一的测量标准,而非各自表述;三是监管机构是否会把“推理可审计性”纳入大模型上线要求。


