一句话看懂:韩国 KAIST 与 Naver AI Lab 发现,大模型在推理时写下的每一步(如提取、分解、套公式、计算)在模型内部对应着可区分的数据模式,且信号最集中在中层。这意味着 Chain-of-Thought 不只是“说给人看”,而是有内部结构可循。
事件核心:发生了什么
研究团队定义了 8 类反复出现的推理操作,包括信息提取、问题分解、公式回忆、演绎和计算。他们让 Qwen2.5-7B、Qwen3-8B 和 Gemma4-31B 三个模型解数学题,把解题路径切段,再用 GPT-5 给每段打上操作标签。结果显示,不同操作在模型内部表示中能被可靠区分,中层区分度最高。
研究者排除了“用词不同”和“在解题路径中的位置不同”这两种解释:只看 token 的分类器表现更差。即便模型算错答案,内部仍能识别出它当时在做哪类操作——错误计算在内部依然像一次计算。研究还做了干预实验,屏蔽前 30 个 token 的注意力后,该操作的信号会减弱,说明推理步骤不是孤立生成,而是依赖前文积累。相关结论在 Llama-3-8B 上复现,Qwen3-8B 训练出的分类器也能迁移到 GPQA-Diamond 和 MATH-500。
为什么重要
当前 AI 安全的一条重要思路,是靠阅读模型的推理文本来监督它。但此前 Anthropic 的研究显示,模型只会在 25% 到 39% 的情况下披露自己实际使用的线索,输出文本与内部计算并不完全一致。这项研究等于给出了一个更底层的“读数”路径:内部向量里确实携带推理步骤类型的信息,而且不依赖表层措辞。它也为 Recurrent Depth 这类把推理一部分转移到内部数值表示中的技术提供了对照背景。不过目前公开信息显示,实验只覆盖数学任务和少数几个模型,能否用于纠错或实时引导生成仍未验证。
对用户/开发者/创作者的影响
对开发者而言,这意味着未来可能出现更细粒度的推理监控或干预接口,例如在模型“正在套公式”时注入提示,而不是只依赖最终输出。对使用大模型做数学、代码、数据分析的用户来说,短期不会直接改变产品体验,但“模型说出的步骤”和“模型实际在做什么”之间的差距值得保持警觉。对做 AI 安全、对齐或模型可解释性的团队,这是一条可以跟进的技术线索;对普通创作者,现阶段更多是理解模型行为的一个背景知识。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一,这套方法能否扩展到数学以外的任务,比如代码生成、多跳问答或长文档分析。二,是否能据此做出实时的错误检测或推理引导工具,而不只是离线分析。三,开源模型社区是否会跟进复现,把内部推理步骤的可分性变成可用的调试手段。


