总有一种感觉,自回归不应该继续作为大模型推理的主要计算范式。 现在的 LLM 虽然内部有复杂的隐状态计算,但在推理阶段,主要还是依赖逐 token 生成来推进计算。这种方式天然串行,而且已经生成的 token 会成为后续计算的固定上下文,难以直接回滚或整体修正,也会把“内部推理”和“语言表达”过度耦合。 我更看好一种方向:模型在 latent space 中持续维护、更新和修正内部状态,把大部分推理计算留在隐空间里,允许反复迭代甚至并…

AI 从业者 @SakumiXvX 公开发文质疑自回归作为大模型主要推理范式的合理性,认为未来模型应在隐空间中完成大部分推理、最后再生成语言。这一观点触及大模型推理效率与架构演进的深层争议,值得关注。








