一句话看懂:卡内基梅隆、MIT、纽约大学和斯坦福的联合团队做出 AI 程序 Ataraxos,以 15 胜 1 负 4 平击败被认为史上最强的 Stratego 人类玩家 Pim Niemeijer;更值得关注的是,它只用了 16 块 GPU 和几千美元训练成本。
事件核心:发生了什么
国际象棋、围棋、德州扑克此前都已被 AI 攻克,但“战略棋”(Stratego)长期是例外。这款游戏每方有 40 枚棋子,对手能看到棋子位置却看不到身份,只有碰撞后才揭示强弱,隐藏信息量超过 10 的 60 次方种排列,一局还常常长达 2000 步。DeepMind 2022 年推出的 DeepNash 也没能稳定战胜顶尖人类。
这次 Ataraxos 通过自我对弈约 1.63 亿局训练,并首次在 Stratego 中跑通了“搜索”环节:用一个“信念模型”神经网络推测对手隐藏棋子,只对合理布局做候选推演,而不是穷举所有可能。最终它以 15:1(4 平)击败手握四届世界冠军、600 多周世界排名第一的 Niemeijer。目前公开信息显示,训练只用了 16 块 GPU,成本数千美元级别。
为什么重要
它的意义不在于又一个游戏被攻破,而在于证明“不完美信息 + 超长决策链”这类难题,未必需要超大算力。DeepMind 的 DeepNash 靠纯自我对弈摸索策略,而 Ataraxos 把通用策略网络与信念推断、搜索结合起来,让推理阶段承担更多工作,训练规模反而更小。这条“小而准”的路线,对真实世界中情报不完整、对手会伪装的场景——比如安全博弈、谈判模拟、资源调度——有直接参考价值。
对用户/开发者/创作者的影响
对开发者来说,Ataraxos 的思路提供了一个可复用范式:在隐藏信息环境下,与其让模型硬猜,不如单独训练一个“信念模型”来估计对手状态,再配合有限搜索做决策,这比把全部压力压在训练算力上更划算。对做 AI 应用和智能体的团队,这意味着复杂决策场景的落地成本可能显著下降。对普通用户,短期内它不会变成消费产品,但“用更少算力做出更强推理”的趋势,会逐步反映到 API 价格和可用模型能力上。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是团队是否会把信念模型 + 搜索的方法迁移到扑克之外的现实博弈任务;二是这套低成本训练范式能否被复现到其他不完美信息游戏或行业仿真中;三是 DeepMind 等厂商是否会跟进这一技术路线,以及 Ataraxos 相关代码或论文是否开源。


