冻结决策模型Jev首次嵌入强化学习训练流程

alphaXiv 10月8日展示的一篇论文提出,把冻结的决策模型 Jev 作为参考策略、探索评判器和回放评分器嵌入强化学习训练,在九个 MiniGrid 任务和三个 Atari 游戏上取得优于标准 DQN 的表现,模型自身无需训练。

一句话看懂:alphaXiv 10月8日展示的一篇论文提出,把冻结的决策模型 Jev 作为参考策略、探索评判器和回放评分器嵌入强化学习训练,在九个 MiniGrid 任务和三个 Atari 游戏上取得优于标准 DQN 的表现,模型自身无需训练。

事件核心:发生了什么

这篇论文研究的是:一个不生成文本、单次前向传播就能给出结构化类型化答案的决策模型 Jev,能否在强化学习系统中充当组件,而不是被当作黑盒直接执行任务。作者先分析了 RL 系统中各对象对答案的要求,认为 Jev 可以满足除基数价值函数之外的大部分需求。随后他们在三个位置使用 Jev:作为参考策略(Jev-BC 模仿其动作偏好,Jev-PEX 让 critic 在 Jev 提议与学生提议间取舍)、作为探索评判器(Jev-Gate 选择贪心或随机探索,Jev-Bonus 为动作或状态新颖性加奖励)、以及作为回放评分器(改变存储转移的采样概率)。全程 Jev 参数冻结。实验覆盖九个 MiniGrid 任务和三个 Atari 游戏,MiniGrid 按 10000 步成功率计分,Atari 按 50000 次决策的原生回报计分,学生模型最终在无 Jev 辅助下评估。

为什么重要

目前大模型进入 RL 主要有两条路径:要么被继续训练,要么被提示词调用生成 token,后者逐 token 生成导致查询成本高且顺序化。Jev 代表的第三类模型不生成内容、单次返回类型化答案,理论上更适合嵌入训练循环。论文显示,使用冻结 Jev 的训练在多个任务上超过标准 RL 学习器,包括 DQN 单独无法取得进展的任务。如果结论可复现,意味着高级决策模型可以像预训练模型提供先验一样,以组件形式降低 RL 的样本效率门槛,而不必更新自身参数。这对算力有限、希望把现有决策模型接入训练流程的团队具有参考价值。目前公开信息显示,该结论来自论文摘要和 alphaXiv 页面,不代表已有商业产品或经过同行评审。

对用户/开发者/创作者的影响

对 RL 开发者来说,值得关注的是“不训练模型、只调用推理”的思路:把 Jev 这类模型作为参考策略或奖励塑形器接入现有训练代码,可能减少冷启动时的无效探索,而不用承担微调基础模型的开销。对工具链和 API 提供方而言,如果类型化答案接口稳定,决策模型有机会成为 RL 训练管线中的可插拔组件,类似今天大模型在 AI 应用里充当推理模块。对内容创作者和普通用户,短期没有直接产品变化,但这类研究若走向工程化,可能让智能体在稀疏奖励环境下更快学会完成任务。需要留意的是,论文中排名并不一致,没有单一方法在所有任务胜出,Jev 直接控制也不总能可靠完成长任务。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是论文所述方法是否会在更多基准和更长决策周期上复现,尤其 Jev 作为参考策略在 DQN 零进展任务上的增益是否稳定。二是 Jev 或其他高级决策模型是否推出面向开发者的类型化查询接口或开源实现,这决定它能否从论文组件变成工程组件。三是 Jev 的上下文依赖问题,FourRooms 上加入导航特征后直接成功率从 40% 提升到 96%,说明输入信息设计对结果影响很大,后续应用需要明确信息边界。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28808

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注