早期基准测试显示,GPT-6 Astra在空间推理上似乎出现了“阶跃式提升

GPT-6 Astra 在一个新的机器人操作基准测试中,空间推理表现明显领先对手 MolmoAct2,被研究者称为"阶跃式提升"。这关系到 OpenAI 未来自建消费级机器人这条产品线,也关系到多模态大模型在物理世界里的落地边界。

一句话看懂:GPT-6 Astra 在一个新的机器人操作基准测试中,空间推理表现明显领先对手 MolmoAct2,被研究者称为”阶跃式提升”。这关系到 OpenAI 未来自建消费级机器人这条产品线,也关系到多模态大模型在物理世界里的落地边界。

事件核心:发生了什么

据 The Decoder 报道,一个名为 StationeryBench 的新机器人基准测试把 OpenAI 的 GPT-6 Astra 与 Ai2 的 MolmoAct2 放在同一套双机械臂 YAM 机器人上对比,任务是五类桌面物品操作,包括打开马克笔笔帽、倒出回形针、在两臂之间传递直尺等。两组模型各跑了 200 次试验。结果显示,Astra 在 100 项任务中完整完成了 7 项,MolmoAct2 一项都没完成;Astra 的任务进度中位分为 46(满分 100),MolmoAct2 为 12。所有结果、视频和代码已在 GitHub 公开。

康奈尔大学、Google DeepMind 研究者 Yoav Artzi 称 Astra 是”空间推理上的阶跃式变化”。在一项尚未发布的 REMAP 基准上,Astra 的准确率已接近人类水平,但 Artzi 也指出,Astra 在其他场景下仍达不到人类表现。他推测 OpenAI 使用了大量 3D 数据(例如 Blender 场景)来训练该模型,这与 Astra 在三维任务上的突出改善相吻合。

为什么重要

过去多模态大模型的竞争集中在图像识别、视频理解和文本生成,空间推理长期是弱项——模型能”看懂”图片,却难以判断物体的相对位置、接触关系与操作顺序。StationeryBench 这类基准把评测目标从”描述世界”推向”操作世界”,直接对应机器人控制、具身智能这条路线。

更关键的是,OpenAI 已有长期计划自建消费级机器人,Astra 这次的表现可以视为其模型能力向硬件延伸的早期信号。如果 3D 训练数据的推测成立,也意味着大模型的能力提升路径可能从纯文本与图像语料,扩展到合成 3D 场景,这对算力需求与数据策略都会有连带影响。

对用户/开发者/创作者的影响

对开发者而言,短期最实际的变化是:空间推理正在成为可评测、可对比的模型能力维度,做机器人、AR/VR、3D 建模或工业自动化的团队,可以在选型时把这类基准纳入参考,而不只看文本和图像榜单。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者来说,3D 内容生成、场景理解类 AI 应用的能力上限可能被抬高,但目前公开信息显示,Astra 尚未公布 API、定价或开放时间,实际可用性还不明确。AI 研究者则应关注 StationeryBench 的代码与视频是否可复现,以及评测本身是否对特定模型有偏。

值得关注的后续

一是 StationeryBench 与未发布的 REMAP 完整结果是否会公开,第三方能否复现;二是 Astra 是否开放 API 或进入机器人产品形态,价格与调用限制如何;三是 Ai2、Google DeepMind 等竞品是否推出对标模型,以及 3D 合成数据训练路线会不会成为新的算力争夺点。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 23127

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注