大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026

腾讯混元与新南威尔士大学联合提出 E-GRM 框架,通过检测模型自身对答案的“自信程度”来决定是否进行深度思考,在奖励模型推理中实现了延迟降低 62%、算力节省近半的同时准确率反而提升 3.3%。这一成果被 ACL 2026 收录,为 RLHF 系统的成本优化打开了新路径。

大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026

一句话看懂:腾讯混元与新南威尔士大学联合提出 E-GRM 框架,通过检测模型自身对答案的“自信程度”来决定是否进行深度思考,在奖励模型推理中实现了延迟降低 62%、算力节省近半的同时准确率反而提升 3.3%。这一成果被 ACL 2026 收录,为 RLHF 系统的成本优化打开了新路径。

事件核心:发生了什么

当前主流的生成式奖励模型(GRM)会对所有输入执行相同深度的思维链(CoT)推理,导致简单问题也消耗大量算力。E-GRM 提出一种“共识度”指标:对同一问题快速生成 5 个候选答案,若结果高度一致(共识度≥0.8),模型便认定该问题只需“直觉”判断,直接输出结果,跳过完整的 CoT 生成链;若答案分散,才启动完整的 K 条推理链生成和判别评分流程。

该方法在 MATH 数据集上的表现是:58% 的样本走了短路径,总延迟从 3.8 秒降至 2.2 秒,FLOPs 从 23.7T 降至 15.7T,准确率反而从 75.1% 提升到 78.4%。关键创新在于它用 5 次并行解码的开销(约 5% 额外延迟)换来了全局近半数的算力节约。论文实验覆盖 7B 到 32B 参数规模的模型,均呈现一致的效率提升和精度增益。

为什么重要

大模型部署的核心瓶颈之一是推理成本。E-GRM 从“算力分配”这个角度切入,展示了一个简洁、可复用的解决方案:不需要复杂的网络改造,仅基于模型解码时的内部行为即可判断问题难度。这对 RLHF 系统中的奖励模型环节尤其关键——它往往是反复调用的组件,任何单位成本上的优化都会被放大。

动态路由的思想在视觉领域的混合专家模型(MoE)中已得到验证,但首次系统性地引入生成式奖励建模。这意味着大模型推理系统可能逐渐从“统一算力消耗”向“按需分配”演化。目前公开信息显示,框架中 0.8 的固定阈值在面向特定专业领域(如数学证明、医学诊断)时可能需要自适应校准,但其核心逻辑具备迁移潜力。

对用户/开发者/创作者的影响

对开发者来说,E-GRM 提供了一种明确的系统降本思路。如果该机制被集成到 RLHF 训练平台或推理框架中,企业可以在不牺牲甚至提升模型判断质量的前提下,大幅降低在线服务的 GPU 占用和响应时间。对于使用大模型 API 进行内容审核、数学推理验证等场景的团队来说,这直接意味着更低的调用成本和更快的反馈。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对 AI 应用开发者而言,奖励模型效率的提升可能会促使更多“需要在推理链中反复自我校验”的应用(如长文档合规检查、复杂代码评估)变得更经济。而那些已经采用多步 CoT 的生成式奖励模型产品,可能会在下一代更新中引入类似的路由逻辑。

值得关注的后续

第一,E-GRM 框架是否会在腾讯混元内部的产品线落地,以及是否会开源模型的实现和预训练权重。第二,学术界是否会针对评分器的“样本外泛化”提出改进方案——目前在分布外推理风格上的表现尚未充分验证。第三,其他大模型团队(如字节、阿里、微软)是否会在 GRM 或推理链优化中跟进“按需推理”思路,推出类似机制的工具或库。这些决定了这项 ACL 2026 工作从论文走向工程实践的速度与广度。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 15031

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注