一句话看懂:Nvidia 最新研究显示,在长周期任务中,决定 AI 表现的往往不是大模型本身,而是包裹在模型外层的“工具链”。通过自研工具链,研究人员将 Claude Opus 5 在 ARC-AGI-3 基准上的得分从 30% 拉升至 100%,这直接挑战了“模型即智能”的普遍认知。
事件核心:发生了什么
Nvidia 于 8 月发布研究,展示了“工具链”(harness)在智能体系统中的关键作用。所谓工具链,是指围绕大模型构建的软件层,包括记忆管理、工具调用、反馈规则和运行时环境。研究人员自行开发了名为 Agentic Variation Operators(AVO)的工具链,并在 ARC-AGI-3 交互推理基准(包含一组无说明的 2D 游戏)上进行了测试。结果显示,Claude Opus 5 在叠加定制工具链后得分从 30% 跃升至 100%;未使用该工具链时,Opus 5 的 30% 已是所有参测模型中的最高分。
Nvidia AI 部门产品副总裁 Adel El Hallack 表示,智能体不仅是模型的 API,而是“模型 + 围绕模型的脚手架 + 运行时 + 技能库”的组合。研究特别强调了一个“监督者”组件的价值:它像一个 CEO,在主智能体偏离方向或走入死胡同时进行提醒和纠偏。Nvidia 称,这项研究并非为了发布新商业产品,相关工具链组件已通过 Nemo 品牌以开源形式逐步开放。
为什么重要
该研究对当前“闭源模型对决”的主流叙事提出了有力修正:在长周期任务中,工具链对最终结果的影响可能超过模型本身。长周期任务指需要连续完成大量决策、有时持续数天的工作,这正是目前智能体落地中最难解决的可靠性问题。此前,微软 4 月发布的研究显示,19 个大模型在文档编辑类长任务中普遍产出严重错误;OpenAI 则因自家模型在 ARC-AGI-3 上得分不足 10% 而专门开展研究,最终通过调整两个工具链设置将得分提高两倍,但仍未接近 100%。
Nvidia 的结果进一步印证了 Databricks 在 7 月发布的研究:工具链的选择对推理成本的影响可达到两倍以上。换言之,企业用户若只关注模型参数或 API 价格,而忽视工具链设计,可能在准确性和成本两方面同时承受损失。对于以模型能力为壁垒的闭源厂商而言,这一发现也解释了为何它们开始放慢模型迭代节奏——安全风险与系统复杂度正成为新的瓶颈。
对用户/开发者/创作者的影响
对开发者而言,这意味着“选最强模型”不再是智能体应用的最优解。与其追逐最新版本的大模型,不如花更多精力优化记忆管理、工具调用和任务监督机制。开源工具链如 Nvidia Nemo、Claude Code、Codex 和 Hermes 等提供了可干预的旋钮,用户应评估自身任务对准确性、延迟和成本的敏感度,再决定在工具链上投入多少工程资源。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业采购方来说,评测智能体服务时应将工具链视为独立的评估维度,而不是默认“模型 A 一定优于模型 B”。同一模型搭配不同工具链,可能在成本上产生两倍以上的差异。对创作者和普通用户,这一结论的现实意义是:遇到智能体“跑偏”或表现不稳定时,问题未必出在模型本身,有时更换平台或调整任务描述方式,效果会比等待模型更新更直接。
值得关注的后续
目前公开信息显示,Nvidia 的 AVO 工具链尚未作为独立产品对外开放,但其组件已在 Nemo 生态中逐步开源。接下来值得观察三点:一是 OpenAI 是否会针对 ARC-AGI-3 的低分进一步调整工具链或公开更多技术细节;二是 Claude Code、Codex 等主流工具链是否会引入“监督者”层设计,以提升长周期任务稳定性;三是企业级平台是否会推出更透明的工具链成本报告,帮助用户在模型选择和工具链配置之间做出更理性决策。


