MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团LongCat团队发布MineExplorer,首个针对多模态大模型在《我的世界》中完成分钟级长程任务的评测基准。测试发现,当前最先进的18款模型(包括Claude、GPT、Gemini等)在需要隐藏前置条件的多跳任务上集体“考砸”,最高成功率仅41%,揭示了AI“能看不能做”的能力断层。

MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

一句话看懂:美团LongCat团队发布MineExplorer,首个针对多模态大模型在《我的世界》中完成分钟级长程任务的评测基准。测试发现,当前最先进的18款模型(包括Claude、GPT、Gemini等)在需要隐藏前置条件的多跳任务上集体“考砸”,最高成功率仅41%,揭示了AI“能看不能做”的能力断层。

事件核心:发生了什么

美团LongCat团队构建了MineExplorer,这是一个基于《我的世界》沙盒环境的开源评测基准。它包含813个人工验证的高质量任务实例(从1跳到4跳),并配套规则化的里程碑自动评测框架。评测中,每个任务实例运行1800个环境步(对应3分钟连续交互视频),环境实时变化。关键设计是“隐藏前置条件”:任务指令不列举所有子目标,模型必须自主推理出未说明的步骤。测试覆盖Claude-Opus-4.6、GPT-4o、Gemini 2.0等18款顶级模型,整体任务成功率(TSR)最高仅41%(Claude-Opus-4.6)。模型在1跳任务上表现尚可(77%),但在4跳任务上骤降至12%。失败主因是导航失败(占近60%),且增加步数或记忆帧数均无法提升性能。

为什么重要

MineExplorer暴露了当前多模态大模型的真实瓶颈:感知层接近可用,但推理与长程规划层严重不足。模型能看懂图像、解析视频,但在动态变化的开放世界中,无法将感知转化为持续行动的策略。这与具身智能赛道的核心需求高度相关——在真实世界中,任务往往包含未说明的前置条件,需要持续探索与自适应。该基准通过“知识解耦”设计,主动剥离《我的世界》专有机制,确保评测的是通用世界常识探索能力,而非游戏攻略记忆。这为行业提供了一条可量化的能力基线,并指出“规划层是瓶颈”这一关键方向。

对用户/开发者/创作者的影响

对AI开发者:MineExplorer不仅是考题,还开源了多智能体数据合成流程和Minecraft训练环境,可直接用于评测和训练。开发者可以此检验模型的探索与推理能力,而非仅关注单步问答准确率。对具身智能从业者:该基准揭示了从“看到”到“做到”的鸿沟,提示应优先攻克长程规划与隐藏条件推理技术。对普通用户:目前公开信息显示,该评测不直接面向终端用户,但其结论提示,依赖AI自动完成复杂任务(如智能家居管理、机器人导航)时需谨慎,现有模型在持续行动场景中可靠性仍有限。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一、其他模型厂商是否会跟进在MineExplorer上的评测,或将其纳入内部能力评估体系。二、MineExplorer开源的数据合成方法和训练环境,能否被社区用于生成更多复杂任务数据,推动模型在长程规划上的进步。三、该基准是否会向其他开放世界游戏或机器人仿真环境扩展,形成更通用的探索能力评估标准。

来源:公众号:龙猫LongCat(美团)

celebrityanime
celebrityanime
文章: 15035

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注