Jevman 基准上线:六个 AI 决策模型吃豆人对战 100 局排名

开源基准 Jevman 让六个 AI 决策模型在《吃豆人》经典幽灵规则下各打 100 局,按平均分与 95% 误差范围排名,并允许任何 HTTP 端点模型提交参战。

一句话看懂:开源基准 Jevman 让六个 AI 决策模型在《吃豆人》经典幽灵规则下各打 100 局,按平均分与 95% 误差范围排名,并允许任何 HTTP 端点模型提交参战。

事件核心:发生了什么

2026 年 10 月 8 日前后,开发者社区出现一个名为 Jevman 的决策模型基准。它将六个 AI 模型放入经典《吃豆人》环境,每个模型与脚本幽灵对战 100 局,每局最多 5 分钟、三条命耗尽即结束。根据公开信息,最长一局实际只持续 2 分 24 秒。游戏在每个路口向模型发送迷宫、豆子与幽灵状态的 JSON,模型返回各方向概率,2 秒内未回答则切换为备用规则,并计入 backup moves。排名采用平均分和 95% 误差范围,误差区间重叠的模型视为并列;同时记录单局最高分,所有对局可重放校验。

为什么重要

当前大模型评测多集中在文本问答、代码生成或多模态理解,Jevman 把“决策”单独拎出来,用实时、限时、可复现的游戏环境做压力测试。它的开放策略比榜单本身更有信号:任何模型只要放在 HTTP 端点上就能参赛,支持托管模型、微调模型或本地运行模型。这降低了评测门槛,也把“模型是否适合做低延迟决策”变成可比较的维度。对开源与闭源模型而言,这既是展示推理速度的窗口,也可能暴露概率输出在连续决策任务中的短板。

对用户/开发者/创作者的影响

开发者可以按仓库提供的 34 行示例端点接入自己的模型,运行一条命令即可按榜单规则完成评测;提交后 CI 会重放对局并核对分数,然后以自报成绩进入榜单。如果模型部署在 Opper 或其他公共 API,也可以通过 issue 请求官方代跑。对 AI 应用团队来说,这类基准提醒:聊天体验之外,模型在有限时间内输出概率并做出连续动作的能力,可能直接影响智能体、游戏 AI 或实时调度场景的选型。创作者则可以把对局录像当作直观的模型行为对比素材,但仍需注意每次成绩只代表该日期、该规则和该环境下的表现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,榜单是否会引入更多游戏或更复杂环境,避免单一《吃豆人》任务过度代表“决策能力”。第二,官方代跑与自报成绩之间是否会出现可信度争议,CI 重放能否完全消除刷分空间。第三,能否吸引主流闭源模型或热门开源模型主动接入,进而形成持续更新的横向对比。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 28553

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注