AI 击败 Stratego 史上最强玩家,攻下棋类游戏里最后的人类堡垒之一

卡内基梅隆、NYU、斯坦福和 MIT 的团队造出 Stratego AI「Ataraxos」,在正式 20 局系列赛中以 15 胜 1 负 4 平击败史上最强人类选手 Pim Niemeijer,训练成本不到 8000 美元。这是首个在不完全信息棋类游戏中达到超人水平、且成本远低于 DeepMind 同类尝试…

一句话看懂:卡内基梅隆、NYU、斯坦福和 MIT 的团队造出 Stratego AI「Ataraxos」,在正式 20 局系列赛中以 15 胜 1 负 4 平击败史上最强人类选手 Pim Niemeijer,训练成本不到 8000 美元。这是首个在不完全信息棋类游戏中达到超人水平、且成本远低于 DeepMind 同类尝试的 AI。

事件核心:发生了什么

研究发表于《Nature》,系统名为 Ataraxos。对手 Pim Niemeijer 拿过 4 次世界冠军、15 次荷兰全国冠军,在世界排名第一累计超过 600 周,被同行称为「史上最强 Stratego 选手」。比赛分三周进行以避免疲劳,结果是 15 胜 1 负 4 平。

Stratego 的难点在于双方 40 枚棋子开局全部背面朝上,据论文,可能布阵超过 10^33 种。棋子的等级只有在碰撞时才揭晓,这让每一步的价值同时取决于后续走法和此前的隐藏信息。此前基于德州扑克的求解方法只在隐藏信息很少时有效(德州扑克起始手牌仅 1326 种),所以 Stratego 一直被视为人类最后守住的高水平棋类之一。

成本对比是另一条线索:DeepMind 的 DeepNash 曾用 1024 个 TPU 节点训练两到三个月,论文作者按 2025 年价格估算约 300 万至 450 万美元;Ataraxos 只用 16 张 Nvidia H100 跑一周,再用 4 张 GPU 跑四天「信念网络」,合计不到 8000 美元。研究团队称算力约为前者的 1/500,自对弈局数为 1/30,训练样本为 1/100。两套系统没有直接对战,DeepMind 方面表示 DeepNash 代码已无法运行。

为什么重要

不完全信息博弈长期是 AI 的硬骨头,此前突破多集中在隐藏信息极少的场景。Ataraxos 的意义在于证明了:在信息高度不透明、随机性要求极高的游戏里,靠自对弈加正则化约束也能达到超人水平,而且不需要巨头级算力。研究团队的思路是强制 AI 分散布阵和走法,避免过早锁定固定策略,再随训练推进逐步收紧约束、缩小学习步长。论文把这种正则化比作「能量储备」:烧得太快,早期进步快,后期失去继续学习能力,还容易被对手针对。信念网络则负责预测对手暗子,每步生成可能局面并额外做一次学习。

对行业来说,这更像是「样本效率」和「训练方法」的胜利,而不是算力堆叠的胜利。它说明学术预算也能在前沿博弈问题上拿到结果,对依赖大规模 TPU 集群的路线形成了一次有分量的对照。

对用户/开发者/创作者的影响

目前公开信息显示,Ataraxos 没有开放模型、代码或 API。但它给出的方法线索对做强化学习的开发者有参考价值:在不完全信息环境下,正则化强度与学习步长的协同调度,可能比扩大模型规模更影响最终表现;自对弈加信念网络的组合,也可以迁移到需要处理隐藏状态的决策类产品,比如撮合、谈判、风控博弈等场景。对内容创作者而言,这条新闻的传播点不在「AI 又赢了」,而在「大学预算击败了巨头方案」。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是团队是否会开源代码或提供可复现的训练配置;二是 DeepNash 与 Ataraxos 的直接对比能否补上,目前双方未交手;三是这套方法能否从棋类迁移到真实的不完全信息商业场景,而不只是停留在论文里。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 26740

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注