腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

腾讯发布了多领域编码智能体评测套件 WorkBuddy Bench,统一考核智能体在代码、网页、办公和安全四个真实工作场景下的能力,并专门设计了防「背答案」机制。这意味着一贯被分割评测的编码智能体,第一次有了跨域、可复现的公开考场。

腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

一句话看懂:腾讯发布了多领域编码智能体评测套件 WorkBuddy Bench,统一考核智能体在代码、网页、办公和安全四个真实工作场景下的能力,并专门设计了防「背答案」机制。这意味着一贯被分割评测的编码智能体,第一次有了跨域、可复现的公开考场。

事件核心:发生了什么

7月24日,腾讯在 arXiv 上公开了 WorkBuddy Bench 的论文与数据集。这套评测套件包含 260 个任务,覆盖四个工作域:代码(80个仓库级软件工程任务)、网页(70个前端界面任务)、办公(50个多文件业务流程任务)、安全(60个红蓝对抗任务)。与现有基准的最大区别在于,所有任务均非来自任何公开题库,而是从真实代码提交、Pull Request 或业务场景中反向工程改写为口语化、角色化的指令,确保无法通过联网搜索直接匹配答案。数据集的完整目录、环境镜像、评测工具和测试用例均对外开放。

为什么重要

以往的编码智能体评测高度碎片化——SWE-bench 只看代码修补,Design2Code 只管前端还原,生产环境评测大多不公开。WorkBuddy Bench 首次将这四个领域装入同一框架,并且从构造源头解决「数据污染」问题:不依赖隐藏题目,而是通过任务构造逻辑(逆向改写+版本控制)来防止模型记忆答案。这种设计对行业有两个直接影响。其一,评测结果更具可比性,排行榜上可以看出不同模型家族的分域强弱,例如Claude Opus 4.8 在四个子域拿下五个第一,但安全子域下的重排名现象最剧烈(平均绝对变化8.6分),说明不同框架对模型行为的影响不容忽视。其二,开放评测环境允许第三方复现验证,减少了「闭门评测」带来的可信度疑云。

对用户/开发者/创作者的影响

对开发者而言,WorkBuddy Bench 提供了一个可自行搭建的「能力对标场」。如果你正在选型编码智能体(如 CodeBuddy Code、Claude Code 等),可以通过这套工具在自己的工作场景下跑一遍,而非仅依赖厂商的单项榜单。评测框架要求任务内不给目标文件或边界信息,这意味着在实际采购或集成时,需关注智能体的上下文检索和自主环境适应能力。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业技术决策者,该基准透露出一个重要信号:编码智能体已从「单点补丁」迈向「全业务域协同」。四个子域的评分方式不同(代码看隐藏测试通过率,办公偏重规则校验,安全用确定性脚本等),但共用统一任务结构,这暗示未来企业级 AI 工具很可能需要同时处理代码库、办公文档和网络安全事件,而不是各自为政。

对 AI 模型研发团队,数据集的开放降低了做跨域评测的门槛。需要注意的是,评测中禁用了在线搜索和主动询问用户——这正是在测试智能体在「信息不全」环境下的真实推理能力。如果自家模型的测试表现随搜索开关显著波动,就说明数据污染防御仍存在漏洞。

值得关注的后续

第一,目前 WorkBuddy Bench 只发布了初步排行榜,且腾讯明确表示四个子域的分数不能直接求和,因此后续是否有统一加权的总分策略值得关注。第二,安全子域中使用了 5 层反作弊设计,并锚定了 binutils、curl、nginx 等真实 CVE 漏洞。如果其他研究机构能复现其中的安全评测结果,会极大增强该基准在安全圈的可信度。第三,腾讯是否会将这套评测工具集成到企业级产品中(如腾讯云上的智能体评估服务),目前公开信息显示尚未有明确计划,但数据集的开放已经为第三方独立评测创造了条件。

来源:AIbase

celebrityanime
celebrityanime
文章: 15032

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注