微软亚洲研究院开源 Agent Lightning v1.0:约 3500 行代码的智能体 RL 训练框架

微软亚洲研究院开源 Agent Lightning v1.0,用约 3,500 行代码实现“真实 harness 参与强化学习”的训练范式,让部署时的智能体不必在训练框架里重写一遍,并给出编码智能体的端到端训练示例。

一句话看懂:微软亚洲研究院开源 Agent Lightning v1.0,用约 3,500 行代码实现“真实 harness 参与强化学习”的训练范式,让部署时的智能体不必在训练框架里重写一遍,并给出编码智能体的端到端训练示例。

事件核心:发生了什么

微软亚洲研究院在博客中介绍了名为 Harnessed Agentic RL 的训练范式,并开源自 2025 年发布的 Agent Lightning 的完全重构版 v1.0。其核心思路是在智能体与大模型之间放置一个 LLM 代理(proxy):开发者的 harness 代码不变,只需把原先调用模型 API 的 endpoint 指向 Agent Lightning,训练框架即可观测并记录模型的调用请求与响应,从而在部署用的真实 harness 上做强化学习。

v1.0 强调三点:整个框架约 3,500 行代码,规模小到可读可改;智能体以标准 Kubernetes Job 方式运行,支持自管集群、云上 Kubernetes 或本地基础设施,不依赖付费商业沙箱服务;官方给出一个基于 Qwen3.5-9B 的编码智能体端到端训练流程,在 SWE-bench Verified 上把 Pass@1 从 41.8% 提升到 56.4%,绝对提升 14.6 个百分点,训练样本约 6,000 条,基于开源数据集。上述结果来自该博客披露的训练配置与评测条件,并非永久排名。

为什么重要

传统 agentic RL 通常假设训练框架自己掌管环境交互循环,例如 ReAct 式的一步动作、一次观测再拼接上下文,整个 rollout 对应一条连续 token 轨迹。verl、AReaL、slime 等早期系统都按这个假设构建,因此训练一个智能体往往要在 RL 框架里重建它的循环。但 mini-SWE-agent、OpenHands、OpenCode、Claude Code、Codex 这类真实 harness 各自带有上下文管理、工具协议和执行逻辑,重写成本高,而且训练出来的智能体未必等于线上部署的那个。

Harnessed Agentic RL 把环境交互循环交还给 harness,训练系统只看到一系列 LLM 请求与响应,因此一次 rollout 可能被拆成数量不定的训练样本,并带来重分词、样本合并等工程挑战。这套路线的意义在于:它试图把“训练对象”与“部署对象”对齐,同时用轻量代码和原生 Kubernetes 支持降低 agent RL 的基础设施门槛,不绑定商业沙箱。

对用户/开发者/创作者的影响

对开发者而言,最直接的变化是接入方式:如果现有智能体通过 LLM API 调用模型,理论上可以不改 harness,只改 endpoint,让真实运行轨迹进入训练管线。对做 AI 应用、编码智能体和工具调用类产品的团队,这意味着 RL 训练不必先复刻一套简化版智能体,减少训练与线上行为不一致的风险。Kubernetes 原生支持也让已有集群和本地机器可以承接 rollout,而不必额外采购商业沙箱。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对更广泛的创作者与企业用户,短期影响仍偏间接:它不直接提供面向终端用户的新产品,而是改善智能体能力迭代的工程路径。目前公开信息显示,端到端示例集中在编码任务,其他领域是否同样有效还需更多验证。

值得关注的后续

一是看社区能否在更多真实 harness 上复现训练效果,尤其是非编码类智能体;二是看重分词与样本合并等问题的长期方案是否稳定,以及约 3,500 行代码在规模扩大后是否仍易维护;三是看 Kubernetes 原生路线与商业沙箱方案在成本、弹性和合规上的实际对比。

来源:Microsoft Research 博客(RSS)

celebrityanime
celebrityanime
文章: 28023

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注