生成式奖励模型(GRM)通过思维链(CoT)显著提升了奖励信号的质量,但其“一刀切”的推理策略让简单样本和复杂样本消耗同等计算资源,导致显著的算力浪费。
腾讯混元与新南威尔士大学联合提出的 E-GRM(Efficient Generative Reward Modeling)框架,将 模型自身的不确定性 重新定义为计算资源的调度信号,仅对真正困难的样本投入完整 CoT 推理,对其余样本走短路径直接输出。
本文从问题背景、动态路由机制、判别式评分器到训练与实验四个维度对该框架进行系统解读。
论文题目:Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty 收录会议:ACL 2026 arXiv 链接:https://arxiv.org/abs/2604.10072 问题背景与动机 1.1 静态推理:GRM 绕不开的效率瓶颈 奖励模型是 RLHF 流程的核心组件,为策略模型的候选响应提供质量信号。
从标量奖励模型到生成式奖励模型(GRM),推理链的引入显著提升了奖励信号的可解释性与判别能力,但也带来了固有的效率问题: 1.
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜