一句话看懂:arXiv 上新发布 AgentHorizon 基准,用 1373 个跨三个操作系统的电脑操作任务衡量自动裁判能否在长轨迹中识别“看似完成但实际违规”的任务,最高分模型 GPT-5.5 在 AH 子集取得 80.9% 平衡准确率。
事件核心:发生了什么
2026 年 10 月 9 日,arXiv cs.AI 发布论文预印本 AgentHorizon,提出一个用于评估“代理式裁判”的基准。该基准包含 1373 组指令—轨迹对,来自 166 小时人工录制的操作轨迹,覆盖三个操作系统。研究团队通过为相近指令分别录制轨迹、再交换指令的方式构造负样本任务,以此检验裁判能否区分“真正完成”和“完成了相似但不兼容请求”的轨迹。该基准提供三个划分:前沿集 AgentHorizon(AH)、简化集 AgentHorizon-Simple(AH-S)和开发集 AgentHorizon-Development(AH-D)。论文还评估了 11 个裁判,分别采用直接传入完整轨迹(最多 300 个截图和动作)和使用五种 agent 框架作为编码智能体两种方式。作者报告,最好的代理式裁判 GPT-5.5 在 AH 子集取得 80.9% 的平衡准确率,并指出工具使用对部分模型有提升,对开放权重模型反而导致更差表现,不同裁判在接受有效轨迹和拒绝失败轨迹上的能力差异很大。
为什么重要
电脑操作代理正在被用于执行跨应用的长流程任务,训练和评估都越来越依赖自动裁判来给出成败判断。但长轨迹里往往藏着隐性违规、副作用或约束冲突,仅看最终界面状态容易误判。AgentHorizon 把“裁判能力”单独拎出来评测,指向一个行业痛点:如果自动评分不可靠,基于自动评分的训练和评测就会系统性偏乐观。目前公开信息显示,这一基准并未提供可直接落地的产品,但它为比较闭源大模型、开放权重模型以及不同 agent 框架下的裁判可靠性,提供了一个可复用的任务池。
对用户/开发者/创作者的影响
对开发电脑操作代理的团队,这类基准提示不能只看任务完成率,还要看失败轨迹是否被识别为失败。若训练数据由自动裁判筛选,错误接受可能把副作用行为写进策略。对使用 API 构建自动化流程的开发者,选择哪个模型作为裁判、是否启用工具调用,可能需要按场景验证,因为论文显示工具使用对开放权重模型可能适得其反。对企业采购和评测方,AH、AH-S、AH-D 三种划分也提供了一种对比不同规模评测成本的方式。目前公开信息仅为摘要,具体任务分布和完整实验结论仍待全文核验。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
可观察后续包括:论文全文是否公开更细的失败类型分析,以及工具使用导致开放权重模型变差的机制解释;是否出现基于 AgentHorizon 的开源评测工具或排行榜;闭源与开源裁判在长轨迹条件下的差距是否随模型迭代缩小。
来源:arXiv cs.AI


