OpenAI 的 GPT-6 Astra 现在能精确指出你的 IKEA 置物架到底哪里装错了

OpenAI 的 GPT-6 Astra 在 Epoch AI 的家具组装基准测试中,识别宜家家具装配错误的准确率达到 80%,而十个月前最好的模型只有 28%。这说明大模型在需要"看图对照说明书找错"的细粒度视觉推理上取得了显著进展。

一句话看懂:OpenAI 的 GPT-6 Astra 在 Epoch AI 的家具组装基准测试中,识别宜家家具装配错误的准确率达到 80%,而十个月前最好的模型只有 28%。这说明大模型在需要”看图对照说明书找错”的细粒度视觉推理上取得了显著进展。

事件核心:发生了什么

Epoch AI 推出了家具组装基准测试(Furniture Assembly Benchmark,FAB)。测试方式是:拍摄三件宜家家具组装过程中的照片,照片中包含人为设置的装配错误;模型需要将照片与说明书对比,找出错在哪里并描述问题。

2025 年 11 月,表现最好的模型 Claude Opus 4.5 得分 28%。十个月后,OpenAI 的 GPT-6 Astra 达到 80%,处理每张照片约需三分钟。Claude Fable 5.1 以 70% 紧随其后,Claude Opus 5 为 61%。中国开源权重模型如 Kimi K3 则落后领先者至少七个月。Astra 在视觉机器人任务上同样表现突出。

为什么重要

这个基准测试的价值不在于宜家家具本身,而在于它检验的是多模态模型的一项核心能力:把视觉信息与结构化指令(说明书)对齐,并定位偏差。这类能力直接关系到模型能否在真实物理场景中提供有效辅助。

值得注意的是,就在不久前,大模型还在一些更简单的视觉任务上频繁失败。从 28% 到 80% 的提升幅度,说明视觉推理这条技术路线正在快速收敛。同时,开源权重模型与闭源领先者之间约七个月的差距,也提供了一个观察开源追赶速度的具体参照。

对用户/开发者/创作者的影响

目前该能力还达不到实时装配辅助的要求——每张照片三分钟的处理速度意味着它暂时无法用于视频通话式的即时指导。但研究者指出,这一技术方向未来可能延伸到汽车维修、家电故障排查等场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,这类视觉推理能力的提升意味着基于 API 构建”拍照诊断”类 AI 应用的门槛在降低。对创作者和企业来说,如果模型能稳定完成”对照标准找偏差”的任务,质检、流程审核等场景的自动化空间会进一步打开。

值得关注的后续

一是推理速度能否压缩到可用于实时交互的水平;二是这类视觉推理能力是否会从基准测试走向实际产品功能;三是开源模型能否缩小与闭源领先者之间的时间差。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 25715

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注