一句话看懂:强化学习之父理查・萨顿在红杉专访中直言,当前大语言模型训练后权重固定、无法从交互中持续学习,本质上只是“高级检索”;他提出持续学习才是智能核心,并已创立 Oak Lab 探索这一方向。
事件核心:发生了什么
理查・萨顿(Richard Sutton)近期接受红杉资本专访时,对大语言模型的现状提出尖锐批评。他指出,现有 LLM 在训练完成后权重即被冻结,不会因新经验或交互反馈而自我更新,只能依赖静态训练数据与上下文补全来回应——在他看来,这并非真正智能,而是“高级检索”。萨顿强调人类大脑会从每一次错误和反馈中持续调整权重,而当前模型“出厂即巅峰”,随后能力只会衰减。
他认为,RAG(检索增强生成)、长上下文窗口、LoRA 微调等技术路线,都是在绕开这一根本缺陷。为此,萨顿与其学生已成立 Oak Lab 实验室,专注持续学习与权重自进化的研究。与此同时,一家名为 Alloomi 的产业团队也公开了相似方向的四层架构方案:全局上下文整合、自进化记忆模型(专家判断与反馈经筛选后写入权重)、专家锚定(对齐示范标准以防乱学)及可控安全进化(质量校验与自动回滚)。该团队称,在近期 9 项相关 Benchmark 中达到或接近 SOTA 水平。
为什么重要
萨顿的发言戳中了当下 AI 竞争的软肋:基础模型的参数规模竞赛正在趋平,真正的分水岭可能转向“模型能否在真实业务中持续变强”。如果持续学习跑通,意味着 AI 产品将从交付时定型的静态软件,演进为日复一日积累经验的自进化系统。这个方向一旦成立,将直接影响行业估值逻辑——模型本身的出厂能力只是起点,沉淀的业务经验和专属判断力才是护城河。目前公开信息显示,这一领域尚无团队真正跑通完整闭环,但学术(Oak Lab)与产业(Alloomi)两线均已入局,其潜在商业价值被萨顿描述为“万亿美元级问题”。
对用户/开发者/创作者的影响
对开发者而言,当前主流开发范式是围绕固定权重模型搭建 RAG 管道或微调适配;若持续学习成为新方向,应用层逻辑将转向“从业务反馈中回流训练”,工程重心从提示词工程与检索优化,变为经验沉淀与安全回滚机制设计。对企业采购方来说,选型标准可能从比较模型的静态 Benchmark 分数,转向评估厂商是否具备从实际使用数据中迭代模型的能力。对普通创作者,短期影响有限,但若此类技术落地,使用 AI 工具完成重复任务时,工具会越用越贴合个人习惯与风格,而不是每次冷启动。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Oak Lab 是否会发布面向开发者的持续学习框架或开源权重更新方案,值得跟踪。第二,Alloomi 的四层架构能否在真实业务场景中证明其 Benchmark 之外的实际效果,尤其是“专家锚定”与“安全回滚”在长期运行中是否可靠。第三,主流闭源模型厂商(如 OpenAI、Anthropic、Google)是否会回应这一路线——例如将用户交互反馈纳入后续训练循环,或推出“可更新权重”的 API 形态,这将直接改变现有开发者的技术选型。
来源:@shitunote


