多模态大模型”第六感”测试:人类93.1%,最强模型仅53.6%

arXiv 上一篇新论文提出 HSS 基准,专门测多模态大模型的"直觉视觉推理"能力。在目前的评测条件下,人类准确率 93.1%,最强模型 GPT-6-astra 仅 53.6%,差距明显。

一句话看懂:arXiv 上一篇新论文提出 HSS 基准,专门测多模态大模型的”直觉视觉推理”能力。在目前的评测条件下,人类准确率 93.1%,最强模型 GPT-6-astra 仅 53.6%,差距明显。

事件核心:发生了什么

2026 年 10 月 8 日提交至 arXiv cs.AI 的一篇新论文(arXiv:2610.08966v1)提出了名为 Humanity’s Sixth Sense(HSS) 的评测基准,目标是衡量一种此前较少被单独测试的能力:直觉视觉推理。

按摘要描述,这类能力指人一眼就能从图像或视频中读出隐含信息——比如判断一辆车能否卡进两个停车位之间、看出房间里谁有话语权、识别不成文的规则或隐藏标签。HSS 覆盖图像和视频输入,并按时间、空间、社交、抽象四类结构组织题目,每道题配有人类撰写的提示语。

关键数据:在论文报告的测试中,人类参与者准确率为 93.1%,最强模型 GPT-6-astra 即便开到最大推理强度也只有 53.6%。论文还尝试了动态视觉操作的 agent 方案,差距有所收窄但并未消除。需要说明的是,以上结果均来自论文摘要,尚不代表完整实验已核验或经过同行评审。

为什么重要

现有视觉评测基本分两类:一类考专家级、数学或学术场景的深度分析,另一类考低层感知(识别物体、读文字)。而人日常真正依赖的”扫一眼就懂”的直觉判断,长期缺少系统性评测。HSS 的价值在于把这块空白变成一个可量化的维度。

这直接关系到 MLLM 的落地边界。模型在复杂推理题上表现亮眼,但如果要和人在真实空间、真实社交场景中协同,靠的恰恰是这种零样本、快速、隐含信息的推断。53.6% 与 93.1% 的落差说明:当前靠扩大现有基准上的规模,未必能补上这一能力。

对用户/开发者/创作者的影响

对开发者而言,HSS 提供了一个新的评测视角。做机器人、自动驾驶、无障碍辅助、视频理解类 AI 应用时,只跑常规 benchmark 可能高估模型在真实环境中的可靠性,建议把直觉推理类测试纳入选型参考。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户,这意味着即便模型在对话和知识题上表现很好,涉及空间判断、社交情境解读的任务仍需人工复核,不宜全权交给模型决策。对内容创作者,若用多模态模型做视频或图像的内容理解与标注,涉及隐含意图、规则判断的环节要保留人工校验。

值得关注的后续

一是论文全文公开后,HSS 的具体题目构成、评分规则和复现难度是否合理;二是 GPT-6-astra 之外的其他前沿模型在 HSS 上的表现,是否形成一致的”直觉短板”;三是 agent 化方案能否进一步缩小差距,以及是否有团队把这类直觉推理能力纳入正式训练目标。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28166

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注