一句话看懂:卡内基梅隆、MIT、NYU 和斯坦福的研究者造出 AI「Ataraxos」,以 15 胜 1 负 4 平击败四届 Stratego 世界冠军 Pim Niemeijer,首次在大型隐藏信息棋类上跑通了「先搜索再落子」这一路线,训练成本仅约 16 块 GPU 一周。
事件核心:发生了什么
成果已发表在《Nature》上。Ataraxos 用自对弈学习了约 1.63 亿局,靠两个网络配合:一个负责策略,另一个是「信念模型」,根据对手的行棋方式猜测隐藏棋子的身份。此前 DeepMind 的 DeepNash 也曾攻克 Stratego,但做不到落子前搜索,因为隐藏信息让搜索空间大到无法枚举;Ataraxos 改为采样若干「可信局面」分别推演,再据此选招。代价上,DeepNash 用 1024 块谷歌专用芯片训练两三个月,按 2025 年价格估算需 300 万至 450 万美元;Ataraxos 只需 16 块 GPU 训练一周,外加 4 块 GPU 训练信念模型四天,总局数约为前者的 1/34。
为什么重要
它证明了在隐藏信息博弈中,搜索和自对弈可以同时用上,而这正是很多现实决策问题的结构——谈判、竞价、安全对抗都属此类。更关键的是成本:团队靠自写模拟器在显卡上每秒跑数百万步,把「学术团队也能做大模型级别的强化学习」变成现实。目前公开信息显示,这种「信念模型 + 采样搜索」的组合不依赖超大算力集群,对资源有限的实验室和中小公司有直接参考价值。
对用户/开发者/创作者的影响
开发者可以直接借鉴这套思路:不追求枚举全部状态,而是先训练一个模型估计未知变量,再在少量采样局面上评估动作。这类方法在推荐、定价、风控等「信息不完整」的场景里比暴力搜索更可行。对算力采购方来说,GPU 一周级别就能跑通复杂博弈训练,意味着实验迭代周期和预算门槛都在下降,闭源大厂的算力垄断并非唯一路径。创作者则可关注其决策风格——基于概率猜测而非确定最优,这类「像人一样读牌」的 AI 更容易被用在陪练、解说和教学产品中。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一,是否有开源实现或可复用的训练代码放出,这会决定学术界和创业公司能否快速跟进。二,信念模型能否迁移到牌类、谈判等非棋类隐藏信息任务,而不只是 Stratego 这一种游戏。三,16 块 GPU 的效率是否可进一步压缩,若能在消费级硬件上复现,相关应用落地速度会明显加快。
来源:Slashdot


