OneSearch-VL 统一图文视频深度研究 Agent,8B 模型双榜提升超 17 个百分点

Hugging Face Papers 收录的论文摘要显示,研究者提出统一多模态深度研究 Agent OneSearch-VL,用视觉锚定证据图(VGEG)串联图像、多图与视频任务,其 8B 模型在两个新基准上比可调用工具的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点。

一句话看懂:Hugging Face Papers 收录的论文摘要显示,研究者提出统一多模态深度研究 Agent OneSearch-VL,用视觉锚定证据图(VGEG)串联图像、多图与视频任务,其 8B 模型在两个新基准上比可调用工具的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点。

事件核心:发生了什么

根据 2026 年 10 月 8 日 Hugging Face Papers 展示的论文摘要,OneSearch-VL 是一个面向单图、多图和视频深度研究的统一 Agent。它的核心设计是 Visually Grounded Evidence Graph(VGEG),把视觉定位锚点、实体关系、可溯源事实和生成答案的操作之间的依赖关系编码为共享的任务级参照,用于数据构造、过程监督和操作级评估。

方法上,研究团队基于 VGEG 构建数据引擎,生成并验证多图与视频问题,同时筛选专家轨迹,最终组装出 OneSearch-VL-SFT-110K 和 OneSearch-VL-RL-10K,分别用于监督微调与强化学习。强化学习阶段还引入 Evidence-aware Visual-Grounded Rubric reward(EVGR),用来监督证据可追溯性和视觉定位。

评测方面,论文同时发布 OneSearch-MI-Bench 和 OneSearch-Video-Bench,按 VGEG 中编码的研究操作组织题目。摘要给出的结果是:OneSearch-VL-8B 在两个新基准上分别比可调用工具的 Qwen3-VL-8B 高出 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得较大提升。需要强调,目前公开信息仅为论文摘要,尚未核验全文实验,也不代表已有可直接使用的产品。

为什么重要

多模态 Agent 的难点不在于单独看图或看视频,而在于把“看到什么”“事实从哪来”“下一步查什么”串成可追踪的推理链。OneSearch-VL 试图用一张任务级证据图统一图像、多图和视频研究流程,这比按模态分别做 pipeline 更接近真实研究助理的形态。

同时,它把数据构造、强化学习奖励和评测基准都绑在 VGEG 上,形成数据—训练—评估闭环。如果这套方法可复现,可能影响多模态 Agent 的开源技术路线,也会给“工具调用+长程检索”类产品提供新的评测思路。

对用户/开发者/创作者的影响

对开发者而言,论文给出的信号是:多模态深度研究 Agent 的竞争点正在从“能不能看图”转向“证据能否追溯、操作能否评测”。GitHub 项目页已公布,后续若开源训练数据和评测脚本,会降低多图/视频检索类应用的复现门槛。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和普通用户,短期内不宜期待马上有消费级产品上线。更现实的影响是,未来图片与视频搜索、内容核查、跨素材事实整理等工具可能更强调来源引用和视觉定位,而不是只给一段无法验证的总结。摘要只说明了 8B 模型在特定基准上的结果,不代表通用场景下的稳定表现。

值得关注的后续

一是项目仓库是否放出完整代码、权重和 VGEG 数据;二是 OneSearch-MI-Bench 与 OneSearch-Video-Bench 是否被社区采纳为常设评测;三是同类多模态 Agent 会否跟进证据图或可追溯奖励设计,而不是单纯扩大模型和算力。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28553

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注