openJiuwen 首发双维度 RSI 框架,AI 自修改,落地办公智能体,算力亲和助力又快又省

openJiuwen 发布双维度 RSI 框架,让智能体既能迭代 Prompt、Skill、Tool、Rail 等"工作装备",也能优化科研论文和算法程序等交付物,并已落地办公智能体 WorkSwarm。在 SWE-bench Lite Dev 上,通过率从 61.0% 提升到 87.0%。

一句话看懂:openJiuwen 发布双维度 RSI 框架,让智能体既能迭代 Prompt、Skill、Tool、Rail 等”工作装备”,也能优化科研论文和算法程序等交付物,并已落地办公智能体 WorkSwarm。在 SWE-bench Lite Dev 上,通过率从 61.0% 提升到 87.0%。

事件核心:发生了什么

openJiuwen 是由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台。继今年 6 月推出 Auto Harness 自动优化 Prompt、Skill、Tool、Rail 后,openJiuwen 此次发布完整的 RSI(递归自我改进)框架,把优化对象扩展为两个维度:Harness 决定 Agent 如何完成任务,Artifacts 则覆盖科研论文和算法程序交付物。

框架以版本化优化对象、可验证的执行证据和可扩展算法为核心,通过任务层、迭代优化层、执行层、基础框架层四层协作,串起”建立基线—定位问题—生成候选—重新评测—采纳融合—经验沉淀—归档停止”六阶段闭环。只有验证有效的修改才会被采纳。这套能力已落地到 WorkSwarm 蜂群办公智能体,用户可在”实验”模式下发起源码或产物优化。

实测数据显示,在 DeepSeek-V4-Flash 任务模型、最多 5 个 Epoch 配置下,Harness 优化将 SWE-bench Lite Dev 全部 23 道题的通过率从 61.0% 提升至 87.0%;冻结优化后的 Harness,在 Evo-Bench General 64 道独立评测题上单次执行通过率从 60.9% 提升至 71.9%。

为什么重要

过去一年,RSI 已从概念走向系统化研究。今年 7 月一篇覆盖 2024—2026 年 1250 篇论文的综述指出,自我改进的对象正从部署阶段行为、训练策略,延伸到评估器乃至 AI 研究过程本身。但多数工作停留在算法层面,缺少可稳定运行的工程闭环。

openJiuwen 的价值在于把 RSI 拆成”优化逻辑+验证机制+算力调度”三件事:用双维度定义改什么,用版本化证据链定义怎么证明有效,再用算力亲和压住多轮优化的成本。目前公开信息显示,这种”工程化 RSI”路线在开源 Agent 平台中尚不多见,其泛化结果(未参与迭代任务的通过率也提升)比单点效果更值得关注。

对用户/开发者/创作者的影响

对开发者而言,这套框架降低了自建 Agent 优化流程的门槛:Harness 可作为插件包热加载、保留版本可回退,失败案例集直接转成优化输入。科研方向用户可提交论文初稿或算法程序任务包,由系统自动尝试多个版本并交付最优结果。企业侧,华为云 AgentArts 已将 openJiuwen 引入商业化平台能力,提供开箱即用入口。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

算力层面,依托昇腾 NPU、鲲鹏 CPU 等基础设施和 Agent Hint 机制,框架在等待时卸载 KV Cache、恢复前预取,实测首 Token 时延均值下降 15.83%,Token 加权 KV Cache 命中率从 7.53% 提升至 14.36%,HBM 与 DDR 峰值使用率分别下降 22.82% 和 30.74%。对高频调用大模型做评测的用户,这部分省下的成本可能比效果提升更直观。

值得关注的后续

一是双维度优化在真实办公场景的稳定性,尤其论文、程序类产物的评测标准能否覆盖长尾任务;二是跨任务经验复用何时落地,这决定了每轮优化是否需要重新试错;三是模型优化与混合优化的接入进度,以及华为云 AgentArts 商业化入口的定价和可用范围;四是开源社区能否围绕 Harness 插件形成生态,而非停留在官方示例。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 23324

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注