← 返回新闻列表
InfoQ AI 🗓️ 2026-07-08

深度解读:大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026

⚡ 一句话看懂:深度解读:大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026。来源:InfoQ AI。

生成式奖励模型(GRM)通过思维链(CoT)显著提升了奖励信号的质量,但其“一刀切”的推理策略让简单样本和复杂样本消耗同等计算资源,导致显著的算力浪费。

腾讯混元与新南威尔士大学联合提出的 E-GRM(Efficient Generative Reward Modeling)框架,将 模型自身的不确定性 重新定义为计算资源的调度信号,仅对真正困难的样本投入完整 CoT 推理,对其余样本走短路径直接输出。

本文从问题背景、动态路由机制、判别式评分器到训练与实验四个维度对该框架进行系统解读。

论文题目:Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty 收录会议:ACL 2026 arXiv 链接:https://arxiv.org/abs/2604.10072 问题背景与动机 1.1 静态推理:GRM 绕不开的效率瓶颈 奖励模型是 RLHF 流程的核心组件,为策略模型的候选响应提供质量信号。

从标量奖励模型到生成式奖励模型(GRM),推理链的引入显著提升了奖励信号的可解释性与判别能力,但也带来了固有的效率问题: 1.

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接