Beren Millidge、John Schulman、Charlie O’Neill 对谈递归自我改进离我们还有多远

Dwarkesh Patel 与 John Schulman、Beren Millidge、Charlie O'Neill 三位一线研究员讨论了递归自我改进(RSI)离现实还有多远。核心共识是:当前 AI 离能力天花板“还远得很”,但真正的瓶颈可能不在算力,而在泛化、持续学习和模拟到现实的迁移。

一句话看懂:Dwarkesh Patel 与 John Schulman、Beren Millidge、Charlie O’Neill 三位一线研究员讨论了递归自我改进(RSI)离现实还有多远。核心共识是:当前 AI 离能力天花板“还远得很”,但真正的瓶颈可能不在算力,而在泛化、持续学习和模拟到现实的迁移。

事件核心:发生了什么

这期播客于 2026 年 9 月 11 日发布,嘉宾来自相对开放的研究机构:Beren Millidge 是开源模型公司 Zyphra 的 CTO,John Schulman 是 Thinking Machines 首席科学家、OpenAI 联合创始人并主导过 RLHF 工作,Charlie O’Neill 是 Baseten 模型训练负责人。

讨论围绕一个假设展开:如果 2036 年并没有出现彻底改变世界的超级智能,最可能的技术原因是什么?Millidge 提出“莫拉维克悖论”式的解释——模型可能在数学、棋类等基准任务上表现极强,却始终存在模拟到现实(sim-to-real)的鸿沟,无法把能力泛化到真实环境。Schulman 认同这一判断,并补充模型在判断力、自我检查等薄弱环节上会形成瓶颈。Millidge 还表示“我们离天花板还远得很”。

为什么重要

递归自我改进是当前 AI 叙事中最激进的一环:如果模型能自动化 AI 研究并持续加速自身迭代,时间线会被大幅压缩。这场对话的价值在于,它把问题从“算力够不够、数据多不多”拉回到具体技术环节。三位研究者并未否定 RSI 的可能,而是指出真正卡住进度的,可能是持续学习、元学习泛化和长时程强化学习(long-horizon RL)能否真正奏效。这直接影响行业对训练路线、数据策略和研究优先级的判断。

对用户/开发者/创作者的影响

对开发者而言,短期内更现实的路径仍是围绕现有大模型的推理、微调和工具集成做工程优化,而非等待全自动 AI 研究员出现。对使用 RLHF、强化学习做产品迭代的团队,这条讨论提示:提升模型在真实场景中的稳定泛化,可能比单纯堆训练量更关键。对关注开源模型的用户,Zyphra 等公司是否能在持续学习方向拿出可验证的进展,是判断开源与闭源差距的重要观察点。目前公开信息显示,三位嘉宾对 RSI 的时间判断并未给出统一数字,更多是方向性讨论。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是长时程 RL 是否能在真实任务中展现出跨环境泛化,而非只在基准测试中领先;二是自动化 AI 研究员的训练方式能否落地,这决定 RSI 从概念走向工程的速度;三是中国实验室的进展在讨论中被单独列为议题,后续是否会出现可核查的能力对比数据。

来源:Dwarkesh Patel:Podcast & Blog(RSS)

celebrityanime
celebrityanime
文章: 22950

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注