安装在机械臂上的GPT-6 Astra

OpenAI 在 2026 年 9 月 4 日公开了 GPT-6 Astra 模型操控 YAM 机械臂的对比测试结果。在“拾取积木放入碗中”的任务中,GPT-6 Astra 以 95% 的成功率和不到 1 美元的单次运行成本,大幅超越 Anthropic 的 Fable 5.1;但在需要精细插拔的拼图任务中…

一句话看懂:OpenAI 在 2026 年 9 月 4 日公开了 GPT-6 Astra 模型操控 YAM 机械臂的对比测试结果。在“拾取积木放入碗中”的任务中,GPT-6 Astra 以 95% 的成功率和不到 1 美元的单次运行成本,大幅超越 Anthropic 的 Fable 5.1;但在需要精细插拔的拼图任务中,它与 Fable 系列一样卡在最后一步,凸显了前沿模型在物理世界泛化能力上的瓶颈。

事件核心:发生了什么

根据 openai.robocurve.org 发布的测试报告,OpenAI 将 GPT-6 Astra 接入与 Fable 5 / Fable 5.1 完全相同的 Inspect Robots 智能体策略中,并在统一评分规则下完成两项机械臂操作任务。每项任务均进行 20 次试验,由人工评分员按任务推进阶段打分。

结果显示,在“将红色方块从桌面放入碗中”的任务里,GPT-6 Astra 以 19/20 的完成率远超 Fable 5.1(8/20)与 Fable 5(1/20),单次平均耗时从 Fable 5.1 的 6.8 分钟压缩至 2.5 分钟,估算成本也从 2.12 美元降至 0.94 美元。然而在“捏住圆形蓝色拼图块中心旋钮,放入对应圆形凹槽”的高精度任务中,Astra 仅完成 2/20 次,与 Fable 5.1 持平,且均在最后对准阶段停滞,说明其尚未能突破精密装配的物理泛化难题。报告同时列出了全部 120 次运行的译文、视频与回放链接,供外界复核。

为什么重要

此次测试首次在同策略、同硬件、同评分体系下,对 OpenAI 与 Anthropic 最新旗舰模型的“具身智能”能力进行直接横向对比。关键看点并非单纯的成功率高低,而是背后的效率差异——GPT-6 Astra 在简单操作任务中仅需 Fable 5.1 约三分之一的时间与不到一半的输出 token,就能以更高成功率完成任务。这种“少思索、多执行”的推理成本结构,直接关系到机器人调用大模型的 API 实际账单,对具身智能的商业化路径具有参考意义。

同时,Astra 在拼图任务中的停滞与 Fable 5.1 如出一辙,提示当前大模型在真实物理交互中仍受制于缺少触觉反馈与闭环校正能力的痛点。仅仅提高视觉理解或规划能力,难以跨越高精度插拔类场景的技能门槛。

对用户/开发者/创作者的影响

对于正在开发机器人控制应用的开发者,此次数据提供了两个可操作性结论:其一,在处理抓取、搬运、粗对准等中低精度任务时,GPT-6 Astra 的 API 在成功率和单位成本上比 Fable 5.1 优势明显(每完成任务成本约 0.05 美元 vs 0.27 美元),可作为首选项进行实测;其二,若业务场景涉及需要在较小容差内完成装配的工序,当前无论选择哪家模型,都需额外自行编写视觉伺服或力控模块,不能仅依赖模型的零样本推理能力。对于企业评估智能体底层模型预算,Astra 的 token 消耗量(每次约 2.1k vs 12.9k)也意味着同等任务量的长账成本更低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先是这两项任务的结果能否复现到更多构型(例如双臂、移动底盘)的真实机器人上,目前的 20 次试验样本量相对有限;其次是 OpenAI 是否会在后续公开 GPT-6 Astra 在接触力反馈、失败恢复策略上的更新,因为现有数据表明它在拼图类高难点位没有明显进步;最后是 Anthropic 是否会针对 Fable 5.1 在简单抓取任务中的低成功率与高 token 消耗进行推理效率优化——毕竟在简单任务上慢三倍且贵一倍,对 Fable 系列的开发者口碑是不小的隐患。

来源:openai.robocurve.org

celebrityanime
celebrityanime
文章: 22040

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注