一句话看懂:ResNet作者何恺明参与的MIT团队发布VISTA,不训练、不微调模型,只把游戏画面从数字网格换成渲染图像并允许模型回看历史帧,就在ARC-AGI-3上把Claude Opus 5.0的相对人类动作效率从40.68推到100.00。
事件核心:发生了什么
2026年10月1日,一篇题为VISTA: A Visual Harness for Reasoning in an Interactive World的论文出现在arXiv,编号2610.02200,作者包括Qiushi Han、Keya Hu、Linlu Qiu、Cathy Wu与Kaiming He(何恺明),机构为麻省理工学院,代码已开放在GitHub。
论文针对ARC-AGI-3交互式像素游戏基准提出一个判断:多模态大模型表现差,问题不在推理,而在“看不见”和“记不住”。官方基准把64×64画面转成4096个整数的数字网格喂给模型,人类看到的角色与机关,到模型那里变成一组坐标。VISTA的做法是不改模型,只改视觉信息的获取方式:把每帧按原始分辨率存进无损视觉记忆,提供inspect、read_pixels、history等只读检查工具,再配GUIDE.md和WORKING.md两个持久笔记文件,让模型在推理时主动回看,而不是在编码时一次性决定什么值得留。检查工具不消耗游戏动作步数。
为什么重要
论文最有力的证据是消融实验:在GPT-5.6 Sol上,仅把文本网格换成渲染图像,分数就从13.33升到47.32;加上视觉记忆与主动检查后升到94.10,这是所有组件中最大的单步增益。Token开销也反向:文本网格方案每局约7190万Token,图像方案约3070万Token,分数反而更高。
更值得注意的一组数字是,320B参数的开源权重模型GLM-5.3 Flash在官方接口下仅得1.89分,接入VISTA后升至66.93分。如果这个结果成立,它指向一个行业性问题:当前多模态模型在交互式基准上的低分,有多少是真实能力缺失,有多少是评测接口设计造成的系统性低估。目前公开信息显示,这仍是论文层面的结论,并非已上线的产品能力,也未见同行评审信息。
对用户/开发者/创作者的影响
对正在做Agent和工具调用的开发者,VISTA提供的是一个“推理时框架”思路:不碰模型权重,把感知、记忆和检查做成可插拔接口,用更少的Token换取更强的多步推理。视觉记忆的代价是完整帧级存档在长时间交互中可能带来存储与检索成本上升。对使用多模态API的团队,这意味着接入方式本身可能比换更大模型更影响效果。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是论文承认实验模型发布时间晚于ARC-AGI-3公开游戏,存在预训练数据污染风险,私有游戏集上的泛化验证是下一个关键节点。二是VISTA纯推理框架的性能上限仍受底层模型能力约束,这套“视觉外挂”能否迁移到网页操作、GUI Agent等真实场景值得观察。三是320B开源模型在VISTA下落点大幅抬升,是否会让更多团队把优化重心从训练转向推理接口设计。
来源:@Yolo_ai_001


