一句话看懂:Anthropic 在 2026 年 9 月 25 日发布研究成果,Claude 完成了 N=4 超对称 Yang-Mills 理论到九圈的散射振幅计算,这是物理学家 Matt von Hippel 一个月前公开悬赏的挑战。它值得关注的点在于:这不是解题技巧的突破,而是在有限算力预算下完成了一项原以为需要更多计算机资源的计算。
事件核心:发生了什么
Matt von Hippel 曾是理论物理学家,现为科学作者,在 4gravitons.com 写博客。他所在的子领域叫振幅学(amplitudeology),研究粒子散射振幅——用粒子的动量和能量算出它们以某种方式反应的概率。圈数越多,结果越接近真实值,计算也越难。目前多数振幅公式只算到两圈,少数到三圈,粒子物理里最精确的预测用到了五圈。
他给 AI 公司出的题目是:用学术研究者级别的 算力,把某个玩具模型的振幅算到更高圈数,选项包括 N=8 超引力七圈或 N=4 超对称 Yang-Mills 九圈。他刻意选了后者被接受的挑战——不是因为原理上不知道怎么做,而是因为按常规判断,这会消耗超出研究者合理可用的计算机时间。Anthropic 接受了挑战,一个月后交出了九圈结果。
为什么重要
这个实验的设计意图很明确:把“AI 能不能做科研”的问题,从难以衡量的“新想法”转向更可验证的“计算量”。von Hippel 自己说,数学进展常来自灵感,灵感有多难找事先说不清;但计算任务的上限相对清楚,能在预算内完成,说明模型可以在既有方法框架下替代一部分人力算力投入。
对行业而言,这类案例比通用 benchmark 更有说服力,因为它带有领域内行设定的门槛和成本约束。它也给“大模型在基础科研中只是辅助工具”的判断提供了一个反例。目前公开信息显示,Anthropic 把成果放在 Research 栏目,属于研究成果发布,而非新模型或新产品的 训练 能力宣称。
对用户/开发者/创作者的影响
对科研和工程开发者来说,可复用的思路是:把模型中能稳定承接的符号计算、推导验证、代码补全等任务,交给 AI 在给定算力下跑通,人类负责设定目标和验收。对内容创作者和科技作者,这个案例提供了一个少见的第一人称复盘样本,值得关注的是作者为何提出挑战、如何界定“计算难”与“想法难”。对企业采购方,它更多是能力信号,不是可直接下单的功能,短期内不应据此推断 API 会有专门的物理计算接口。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是是否会有同行复现或扩展这一计算,验证结果能否进入正式文献;二是 Anthropic 会不会披露使用的具体模型版本、推理配置和资源规模,让外界判断可迁移性;三是其他 AI 实验室是否接受类似“带预算约束的领域挑战”,如果形成惯例,会成为评估前沿模型科研能力的一种新方式。


