一句话看懂:Anthropic、OpenAI 和 DeepSeek 正在尝试把“系统提示词”直接用作强化学习的奖励函数,推动 LLM 智能体训练从 RLHF 走向一种被称作 RULER 的新范式。训练不再只依赖人类偏好打分,而是把任务目标和行为边界写进提示词里,由模型自己判断对错。
事件核心:发生了什么
这篇由 Avi Chawla 撰写的长文,梳理了强化学习在 LLM 智能体上的演进路径。文章先回顾了强化学习的基本循环:智能体观察状态 S,采取行动 A,环境转移至新状态 S′ 并返回奖励 R,反复累积形成轨迹,再从中学习。2022 年,OpenAI 在 InstructGPT 中引入 RLHF:人类对模型输出排序,用排序数据训练奖励模型,再通过 PPO 对 LLM 微调。文章指出,到了 2026 年,Anthropic、OpenAI 和 DeepSeek 正不约而同地收敛到同一个方向——将系统提示词用作奖励函数,也就是标题所说的 RULER。目前公开信息显示,RULER 的具体技术细节尚未在素材中展开,但从背景看,它代表的是对 RLHF 依赖“独立奖励模型”这一环节的替代尝试。
为什么重要
RLHF 的成本瓶颈一直很明显:人类排序数据昂贵,奖励模型训练周期长,且奖励模型与策略模型的偏差会随规模放大。如果系统提示词能直接承担奖励函数的职责,训练管线会大幅缩短,模型对指令边界的判断也可能更稳定。更深一层的信号是,头部实验室的竞争焦点正在从“堆算力、扩参数”转向“奖励设计”这类更精细的控制手段。DeepSeek 的参与意味着开源阵营也在跟进这一路线,一旦走通,可能缩小闭源与开源模型在智能体任务上的差距。
对用户/开发者/创作者的影响
对开发者和创作者来说,系统提示词在训练阶段被用作奖励函数,意味着提示词的分量将明显上升——它不只是“设定风格”的输入,而是直接参与模型行为目标的塑造,推理时微小的措辞差异可能被放大。对 API 用户而言,模型对系统级约束的遵从度可能更高,越界请求被拒绝的情况会变化。对关注开源的开发者来说,值得留意 DeepSeek 是否会公布或开源 RULER 相关训练代码,以及复现这套方法所需的算力门槛是否可控。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 RULER 目前是研究验证,还是已经进入 OpenAI、Anthropic 的实际训练流程;二是头部厂商是否会发布相关评测基准或 API 更新,让外部观察到提示词权重变化;三是 DeepSeek 是否跟进开源,以及中小团队能否用更低的训练成本复现这条技术路线。
来源:<a href="https://waytoagi.feishu.cn/wiki/GdflwLv


