一句话看懂:OpenAI 研究员 Noam Brown 在 Dwarkesh Patel 播客中披露,团队用 10,000 个 AI 智能体、88 小时、1300 亿 token 攻克了一道千禧年数学难题;他同时提醒,在启动递归自我改进前,必须先搞清楚模型是否真的对齐。
事件核心:发生了什么
这期播客于 2026 年 9 月 17 日发布,主角是 OpenAI 研究员 Noam Brown。他是 o1 及推理模型的基础贡献者之一,目前转向多智能体系统研究。访谈中他确认,团队上周用一套由 10,000 个不同 AI 智能体组成的系统,消耗 1300 亿 token、运行 88 小时,解决了一道千禧年大奖难题。
Brown 把推理模型的提升逻辑讲得很直白:把测试时算力放在横轴、推理基准表现放在纵轴,曲线始终向上,模型想得越久答得越好。但单线程思考会撞上延迟瓶颈,于是像人类组建团队一样,把任务并行拆给多个智能体,就成了自然选择。
为什么重要
这条路径把“堆算力”从单次推理延伸到了智能体集群。过去谈大模型能力,看的是训练规模;现在多智能体并行让推理侧算力也能持续放大,等于给推理模型开了第二条增长曲线。对行业而言,模型能力的竞争可能从“谁的基座更强”转向“谁能调度更大规模的智能体协作”。
更关键的是对齐问题。Brown 在访谈中强调,我们绝不想再陷入低估 AI 的处境,在启动递归自我改进之前,必须知道模型是否真正对齐。节目还讨论了内部与外部模型的能力差距、思维链质量正在退化,以及如何判断对齐是否已被解决。目前公开信息显示,这些判断仍属研究者个人观点,尚未形成可验证的行业标准。
对用户/开发者/创作者的影响
开发者可以关注智能体编排的工程价值:单次 API 调用之外的并行调度、状态同步和结果聚合,可能成为新的能力分水岭。创作者和企业采购方则要留意,推理侧成本结构会随多智能体规模变化,长任务、复杂研究类应用的可行性在上升。同时,思维链退化意味着依赖模型“自言自语”做可解释性判断的做法需要更谨慎。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 OpenAI 是否会公开这套万级智能体系统的技术细节或产品化路径;二是思维链退化是否会影响现有推理模型的可靠性与对齐评估;三是“如何确认对齐已解决”这一判断标准,会不会成为下一轮模型发布前的公开讨论焦点。


