虚幻特工

Unreal Labs 发布 Unreal Agent,用完全异步的工具调用机制替代模型自身轮询等待,在真实工作负载中相比 Codex 最高省 40% 成本、相比 Pi 最高省 20%。它提醒行业:除了模型和提示词,Agent 的“外挂框架”(harness)本身也是能省钱的研究方向。

一句话看懂:Unreal Labs 发布 Unreal Agent,用完全异步的工具调用机制替代模型自身轮询等待,在真实工作负载中相比 Codex 最高省 40% 成本、相比 Pi 最高省 20%。它提醒行业:除了模型和提示词,Agent 的“外挂框架”(harness)本身也是能省钱的研究方向。

事件核心:发生了什么

Unreal Labs 在官方博客介绍了其 Agent 产品 Unreal Agent。团队在部署 Agent 时发现,模型大量时间和 token 被消耗在管理工具调用上——等待、轮询、心跳检测。他们的解法是让 harness 以完全异步的方式接管工具调用:每当 Unreal Agent 发出一次工具调用,系统立即在事件日志中写入一条“进行中”记录,工具在后台继续执行;真正完成后,再把结果追加到会话日志并触发模型调用。这样模型不必为等待工具而空转。

官方给出的数据是:当前版本在真实工作负载和 Agent 基准测试上,相比 Codex 最高节省 40% 成本,相比 Pi 最高节省 20%。测试基于 GPT-6 Astra xhigh。在 Terminal-Bench 4.0 上,Unreal Agent 通过率 57.9%、总花费 1428 美元,Codex 榜单基线同为 57.9%、2350 美元;在 SWE-Atlas Codebase QnA 上它是 65.8%、936 美元,高于 Codex 的 63.3%、1303 美元;在 DeepSWE 1.1 上为 72.4%、1367 美元,也高于 Codex 的 69.0%、1633 美元。团队称通过率的边际差异应归因于基准波动。

为什么重要

这则新闻的价值不在于“又一个 Agent 产品”,而在于它把 harness 设计单独拿出来当作研究对象。当下主流 Agent SDK 各有取舍:CLI 导向的 SDK 假设本地会话和子进程,生产环境常需自行补生命周期管理;切换模型供应商可能破坏工具或上下文压缩;SDK 升级也可能改动消息格式、迫使集成重写。Unreal Labs 主张把安全和审批放到确定性环境或沙箱约束里(允许/禁止主机、细粒度令牌、带审批门的代理),而不是依赖 harness 钩子。

成本效率来自两点:一是极简的 harness 占位和经过 token 优化的工具输出,没有子 Agent 或工作流;二是每个模型轮次能发起更多重工具调用。目前公开信息显示,这代表了一条与“堆算力、堆模型”不同的优化路线——通过框架层工程降低推理开销。

对用户/开发者/创作者的影响

对开发者,异步工具调用意味着可以并行启动耗时数分钟的环境搭建,同时探索代码库、搜索网页,而用户随时能插话干预、无需等工具结束,交互体验更接近“随时可打断的助手”。对团队采购,官方给出的 Token 输入量和轮次数据直接影响账单,成本差异在规模化部署时会被放大。对创作者和普通用户,更顺畅的转向(steering)能力会让 Agent 在内容整理、多步任务中更实用,但前提是产品真的落地。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Unreal Agent 是否开放使用、以何种定价提供,40% 的成本节省在客户自有负载上能否复现;二是异步 harness 思路是否被 Codex、Pi 等竞品跟进,或沉淀为开源方案;三是博客末尾提到 ALE-CLI 等基准的完整通过率与均值数据尚未完全公布,后续补齐后的对比值得再看。Unreal Labs 也在文末公开了联系邮箱,寻求在 Agent 前沿成本效率上的合作。

来源:unreallabs.ai

celebrityanime
celebrityanime
文章: 25090

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注