新基准测试证实AI模型视觉感知能力依然很弱

Moonshot AI 发布视觉感知基准测试 PerceptionBench,结果显示 GPT-5.6 Sol、Kimi K3、Claude Fable 5 等前沿多模态模型的得分均未突破 60%,所谓“推理错误”中相当一部分在图像读取阶段就已发生。

一句话看懂:Moonshot AI 发布视觉感知基准测试 PerceptionBench,结果显示 GPT-5.6 Sol、Kimi K3、Claude Fable 5 等前沿多模态模型的得分均未突破 60%,所谓“推理错误”中相当一部分在图像读取阶段就已发生。

事件核心:发生了什么

8 月 15 日,Moonshot AI 研究团队发布 PerceptionBench,一个专门评估多模态模型“视觉感知能力”的基准测试。与常规测试不同,PerceptionBench 将视觉能力拆解为 10 个原子技能域,包括视觉关系、计数、属性识别、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉,所有问题仅凭观察图像即可回答,不涉及推理逻辑或外部知识。

研究团队从内部 17,000 道验证题中公开 3,000 道,其中 60% 来源于模型真实错误,40% 为增强图像改写。测试覆盖 16 款前沿模型,最高分由 GPT-5.6 Sol 获得,整体准确率仅 59.7%;Kimi K3 以 58.5% 紧随其后,Claude Fable 5 为 57.2%,Gemini 3.1 Pro 为 56.2%。开源模型表现落后,Qwen3.5-397B-A17B 得分 47.5%,GLM-4.6V 仅 32.5%。其中“幻觉”子项最为薄弱,GPT-5.6 Sol 在该项仅得 26.9%。目前公开信息显示,该数据集与评估代码已上传至 GitHub 的 MoonshotAI/PerceptionBench。

为什么重要

PerceptionBench 的价值在于把“感知”从“推理”中剥离出来。此前行业评测通常将两者混在一起,导致一个模型在复杂任务上失败时,开发者很难定位是图像读取环节出错,还是后续推理环节出错。Moonshot AI 分析了 42 个开源基准测试后发现,每个基准只能覆盖感知错误的一小部分切片。该团队通过将任务逐步拆解为感知子问题,验证了一个关键假设:许多被归因为“推理能力不足”的失败,根源其实在视觉感知层——模型在第一步“看图”时就已歪曲了事实。

这个结论对整个多模态 AI 生态有直接冲击。过去一年,各大厂商把精力集中在扩展推理链、增强逻辑能力上,但 PerceptionBench 提示了一条被忽视的短板:如果感知层本身存在系统性偏差,后续任何推理优化都可能建立在错误输入之上。这也解释了为何看似简单的“图中物体数量”“相对位置”问题,会成为前沿模型的稳定失分点。对于闭源与开源模型的竞争格局而言,Kimi K3 在视觉感知上已与西方头部模型拉平,但整体感知水平仍普遍偏低,意味着行业尚未进入精细化视觉理解阶段。

对用户/开发者/创作者的影响

对开发者而言,这个测试提供了更精确的模型选型依据:如果你正在构建依赖视觉输入的 AI 应用(如自动化质检、图像信息抽取、无障碍辅助工具),不应该被模型在综合榜单上的排名迷惑,而应针对具体感知子项做验证。PerceptionBench 的分类框架可以直接作为评估清单,帮助识别当前模型在你业务场景中的真实短板。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者来说,这项测试意味着 AI 工具在理解和描述图像时可能比你想象的更不可靠。举例来说,当 AI 评价一张设计稿时,它可能遗漏元素、幻觉出不存在的物体,或者在计数类指令上出错。涉及精确视觉信息的领域,人工复核仍是必要环节。

对企业采购方,若计划引入多模态 API 处理视觉任务,建议将 PerceptionBench 的 10 个技能域纳入验收标准,而非只看官方演示或综合分数。当前没有一款模型达到 60% 整体准确率,说明产品化时需对错误率做出合理预期和兜底设计。

值得关注的后续

第一,Moonshot AI 是否会将 PerceptionBench 的评测结果整合到 Kimi K3 的后续训练中,并在下一代版本中显著改善感知分数——这将验证“感知错误可定位、可修复”的假设。

第二,OpenAI、Anthropic、Google 等厂商是否会跟进响应,或推出各自的感知专项评测。PerceptionBench 采用的“从错误反推分类”方法论若成为行业标准,可能改变多模态模型的评测和迭代方式。

第三,开源社区能否基于这 3,000 道题产生可复用的感知微调数据集。60% 准确率的上限说明,仅靠大模型本身的涌现能力不足以解决视觉感知基础问题,是否需要引入更多非自回归架构或视觉编码器优化,值得持续观察。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18604

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注