RLCD是什么?Jev背后的秘密

Hacker News 上的一篇技术博客提出,Jev 并非传统语言模型的替代品,而是奖励模型演进到多路偏好建模与概率校准后的产品形态。这背后是一套名为 RLCD 的目标函数,让奖励模型从生成器背后走出来,直接成为模型本身。

一句话看懂:Hacker News 上的一篇技术博客提出,Jev 并非传统语言模型的替代品,而是奖励模型演进到多路偏好建模与概率校准后的产品形态。这背后是一套名为 RLCD 的目标函数,让奖励模型从生成器背后走出来,直接成为模型本身。

事件核心:发生了什么

该博客梳理了一条清晰的演进路线:标量奖励 → 成对偏好 → 多路偏好 → 校准决策。

传统奖励模型输出一个 0 到 1 之间的绝对分数,但这个分数并不稳定——同样的 0.8,在不同问题、候选池、检查点或模型家族中含义不同,真正有用的信号其实是候选之间的相对偏好。LLaMA-Berry 的 PPRM 把这一点显式化,用 Bradley–Terry 模型判断“第一个答案是否优于第二个”,并在约 780 万对数学解题数据上训练评估器,再用 DPO 优化成对预测。

RLCD 则把两两比较扩展到多路:候选集为多个答案时,用 Plackett–Luce 公式对全部候选统一归一化,当候选数为 2 时正好退化为 Bradley–Terry。博客给出的核心公式是:RLCD = 多路偏好建模 + 概率校准。目前公开信息显示,Jev 在此目标上增加了类型化输出与并行推理,从而变成可交付的产品。

为什么重要

这一步的意义在于角色转换:过去奖励模型藏在生成模型背后,只负责打分;现在它自己就是模型,直接输出决策和校准后的概率。这意味着“0.8”不再只是排序信号,而是有经验含义的置信度——在被标为 0.8 的预测中,大约 80% 应当是正确的。

对 AI 行业而言,这提供了一条不同于“堆大模型参数”的技术路线:用偏好建模和校准来提升决策质量。如果这类接口被广泛采用,评估、路由、审核等场景可能不再依赖生成模型再判分,而是直接调用奖励模型获得带概率的决策。

对用户/开发者/创作者的影响

开发者最直接的变化是接口形态:Jev 这类产品返回的是决策与概率,而不是一段生成文本。对搭建 AI 应用的人来说,这更像一个可编排的判断模块,适合放进工作流里做候选筛选、质量门控或自动路由。创作者若使用相关工具,可能感知到的是“系统更敢下判断”,但要注意校准的前提是训练分布与线上任务一致,跨领域直接套用概率仍需验证。企业采购时可关注其是否提供可核验的校准指标,而非只宣传准确率。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Jev 是否公布具体的校准评测数据与失败案例;二是 Plackett–Luce 多路偏好建模是否会被更多开源模型采纳,形成与生成模型并列的标配;三是类型化输出与并行推理在实际 API 中的延迟和成本表现,这决定开发者是否愿意把它放进生产链路。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 25382

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注