RobotWorld评测84项机器人任务:多模态智能体能写代码,却卡在物理世界

Hugging Face Papers 收录的论文提出 RobotWorld,一个包含 84 项任务的机器人使用仿真测试平台,用来检验多模态智能体能否把「写代码、用工具」的能力迁移到物理执行,结果显示能力可以局部迁移,但远未稳定。

一句话看懂:Hugging Face Papers 收录的论文提出 RobotWorld,一个包含 84 项任务的机器人使用仿真测试平台,用来检验多模态智能体能否把「写代码、用工具」的能力迁移到物理执行,结果显示能力可以局部迁移,但远未稳定。

事件核心:发生了什么

2026 年 10 月 7 日发布的论文摘要显示,研究者构建了 RobotWorld:一个面向「机器人使用」的仿真测试床,覆盖操作、移动操作、行走、驾驶和空中控制五大类,共 84 项任务,并要求智能体在明确的交互预算和可执行的完成校验下,把指令与观测转换为物理动作。

作者不仅统计任务成功率,还分析执行轨迹,因此能区分「做到了动作」和「完成了任务」。摘要提到,当前智能体已经能搭建较复杂的感知与控制流程,包括图像分割、相机标定、空间估计和基于动力学的计算;但这些能力并不能稳定组合成正确行为——例如到达指定位姿却丢失了与任务相关的物体状态、无法纠正无效动作、恢复过晚,或把未完成的任务误判为完成。

摘要还给出模型差异:Astra 在空间类与受约束接触类目标上成功率更高,Opus 5.5 在持续平衡和定时交互类目标上表现更好。需要注意,上述结论均来自论文摘要,未经全文核验,也不代表任何已上线产品能力。

为什么重要

过去一年,通用智能体在数字环境里写代码、调用 API、操作浏览器已经相对常见,行业默认的假设是「这些能力会自然延伸到物理世界」。RobotWorld 的价值在于把这个假设变成可量化的问题,并指出瓶颈不在单点感知或控制,而在长链条组合、状态保持与错误恢复。

对具身智能和机器人基础模型赛道而言,这意味着评测重点可能从「能不能识别物体」转向「任务中途物体状态是否还在、动作失效后能否自查并修正」。这也给训练数据设计和奖励机制提出更具体的要求:仅以最终动作轨迹做监督,容易忽略完成度与状态一致性。

对用户/开发者/创作者的影响

对开发者和研究者,RobotWorld 提供的是一套可对照的任务集合与执行追踪思路,适合在做具身智能体、机器人仿真训练或 VLA 模型时作为诊断工具,而不是只看成功率榜单。对机器人应用企业,摘要揭示的失败模式值得写进采购与验收标准:能否维持任务相关状态、能否在有限交互预算内自我纠正,可能比单纯的抓取成功率更能反映实际可靠性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对更广泛的 AI 应用创作者,这项工作的提醒是,数字任务和物理任务之间存在明显的能力断层,「模型已经会写代码」并不等于「模型能可靠控制硬件」。

值得关注的后续

一是 RobotWorld 是否会开源任务集与评测代码,以及是否有第三方复现结果;二是后续工作能否把「状态保持、错误恢复」转化为可训练的信号,而不止于指出问题;三是 Astra 与 Opus 5.5 的差异化表现是否在更细的任务划分和更多模型上稳定成立。目前公开信息仅来自论文摘要,实验细节与完整榜单仍需等待全文。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28181

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注