一句话看懂:arXiv 上一篇新论文提出 HSS 基准,专门测多模态大模型的”直觉视觉推理”能力。在目前的评测条件下,人类准确率 93.1%,最强模型 GPT-6-astra 仅 53.6%,差距明显。
事件核心:发生了什么
2026 年 10 月 8 日提交至 arXiv cs.AI 的一篇新论文(arXiv:2610.08966v1)提出了名为 Humanity’s Sixth Sense(HSS) 的评测基准,目标是衡量一种此前较少被单独测试的能力:直觉视觉推理。
按摘要描述,这类能力指人一眼就能从图像或视频中读出隐含信息——比如判断一辆车能否卡进两个停车位之间、看出房间里谁有话语权、识别不成文的规则或隐藏标签。HSS 覆盖图像和视频输入,并按时间、空间、社交、抽象四类结构组织题目,每道题配有人类撰写的提示语。
关键数据:在论文报告的测试中,人类参与者准确率为 93.1%,最强模型 GPT-6-astra 即便开到最大推理强度也只有 53.6%。论文还尝试了动态视觉操作的 agent 方案,差距有所收窄但并未消除。需要说明的是,以上结果均来自论文摘要,尚不代表完整实验已核验或经过同行评审。
为什么重要
现有视觉评测基本分两类:一类考专家级、数学或学术场景的深度分析,另一类考低层感知(识别物体、读文字)。而人日常真正依赖的”扫一眼就懂”的直觉判断,长期缺少系统性评测。HSS 的价值在于把这块空白变成一个可量化的维度。
这直接关系到 MLLM 的落地边界。模型在复杂推理题上表现亮眼,但如果要和人在真实空间、真实社交场景中协同,靠的恰恰是这种零样本、快速、隐含信息的推断。53.6% 与 93.1% 的落差说明:当前靠扩大现有基准上的规模,未必能补上这一能力。
对用户/开发者/创作者的影响
对开发者而言,HSS 提供了一个新的评测视角。做机器人、自动驾驶、无障碍辅助、视频理解类 AI 应用时,只跑常规 benchmark 可能高估模型在真实环境中的可靠性,建议把直觉推理类测试纳入选型参考。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户,这意味着即便模型在对话和知识题上表现很好,涉及空间判断、社交情境解读的任务仍需人工复核,不宜全权交给模型决策。对内容创作者,若用多模态模型做视频或图像的内容理解与标注,涉及隐含意图、规则判断的环节要保留人工校验。
值得关注的后续
一是论文全文公开后,HSS 的具体题目构成、评分规则和复现难度是否合理;二是 GPT-6-astra 之外的其他前沿模型在 HSS 上的表现,是否形成一致的”直觉短板”;三是 agent 化方案能否进一步缩小差距,以及是否有团队把这类直觉推理能力纳入正式训练目标。
来源:arXiv cs.AI


