E-GRM团队 投稿 
量子位 | 公众号 QbitAI

生成式奖励模型(GRM)是当前LLM推理增强的重要方向——通过Chain-of-Thought(CoT)让模型在输出答案之前先走一遍推理链,从而提升复杂问题的准确率。

这个方法在数学推理、代码生成等领域效果显著,但有个明显的问题:无论问题简单还是复杂,GRM一律要求模型走完整条CoT推理链。

比如问“1+1=?”也要先“Let’s think step by step”,这在计算上是巨大的浪费。

腾讯混元团队敏锐地抓住了这个痛点:既然模型在推理时会表现出不确定性波动,为什么不反过来用这种不确定性来判断“这个问题值不值得深想”?

E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。

发表:ACL 2026(Pages 23302–23319)

背景

场景与痛点

GRM的基本流程是:给模型喂一个prompt(比如“Evaluate the response:…”),让模型先输出一段推理链,然后再给出评分判断。CoT推理链越长、质量越高,最终判断越准——这已经是RewardBench榜单上的共识。

但两个核心问题一直没有解决:

  • 问题一:CoT对简单输入是浪费。

现有GRM把CoT当“标配”,对每个输入都走一遍推理链。RM-Bench中约一半的prompt其实不需要复杂推理,直接判断就够。强制CoT反而引入不必要的token开销和延迟。

  • 问题二:投票制评分太粗糙。

当前主流GRM对CoT输出的评估依赖“多采样后投票”——采样N条推理路径,选出现次数最多的答案。这种机制的问题在于:它只看最终答案,不评价推理路径本身的质量。一条答对的推理路径可能逻辑全是错的(蒙对的),但投票机制无法区分。

E-GRM的答案:不确定性决定是否需要CoT,混合损失判别评分器替代投票。

论文做了什么

  • Dynamic CoT Triggering:M次并行解码→计算答案一致性→一致性高就跳过CoT
  • Discriminative Scorer:混合Huber回归+Hinge排序损失,细粒度评估推理路径质量
  • 两阶段训练:SFT混合短答/长CoT→GRPO偏好优化,让模型同时学会“快答”和“深想”
E-GRM整体框架
动态CoT触发与判别评分框架

技术方案

动态CoT触发(Dynamic CoT Triggering)

这是E-GRM最核心的创新:用模型自身的输出一致性来判断输入复杂度。

具体流程:

输入Prompt→M次并行解码(不同温度)→统计答案分布→计算Consensus
    ↓
Consensus0.8
    →YES:直接输出答案(跳过CoT,省时间)
    →NO:触发CoT+判别评分(深想一下)

M次并行解码(M=5):

对同一个prompt,用不同温度参数(T∈{0,0.3,0.7,1.0})解码5次:

  • 温度低(T=0):确定性输出,模型给出最“自信”的答案
  • 温度高(T=1.0):随机性强,可能跑偏

如果这5次解码的答案高度一致(比如5次都选了同一选项),说明模型对这个输入“很有把握”——这是一个简单问题,不需要深度推理。反之,如果5次答案五花八门,说明模型自己也拿不准——这是一个复杂问题,值得触发CoT。

一致性计算公式:

Consensus(x)=max(y)Count(y)/M

即:出现最多的答案的次数÷总采样次数。取值范围[0.2,1.0]。

  • =1.0:5次全一致
  • =0.2:5次全不同(最不一致)

阈值τ的作用:

这种不确定性估计不需要任何外部模型或手工特征——完全依赖模型自身的输出分布。

判别评分器(Discriminative Scorer)

当Consensus<τ时,触发CoT推理。但CoT生成了多条推理路径,怎么选最好的?

传统方法:投票。E-GRM用的是轻量级判别评分器+混合损失函数来给每条推理路径打分。

混合损失(Hybrid Loss):

L_hybrid=(1−α)×Huber_loss(y_pred,y_true)+α×Hinge_loss(pairs)

两个分量各有分工:

α=0.3:回归占70%、排序占30%。

类比理解:Huber负责“打分准不准”,Hinge负责“排名对不对”。两者合在一起,确保评分器不仅能给每个推理路径一个准确的分数,还能保证分数之间的相对大小是正确的。

打分流程:

N条CoT路径→特征提取(长度/步数/关键性词汇等)→轻量FFN→[01]分数→取最高分

评分器结构极其简单(一个2层MLP),推理开销可以忽略不计。

两阶段训练

阶段一:SFT混合训练

E-GRM不是一个“推理时就切模式”的方法——它在训练阶段就教会模型两种回答风格:

这样模型在推理时可以根据输入复杂度灵活切换:低不确定性→短答模式;高不确定性→CoT模式。

阶段二:GRPO偏好优化

在SFT基础之上,用成对偏好数据进一步微调评分器:

  • 对同一个prompt生成多条推理路径
  • 用判别评分器打分
  • 取“高分路径×低分路径”作为偏好对
  • 用混合损失(Huber+Hinge)进一步优化

GRPO的加入让模型不仅会“快答”和“深想”,还能在深度推理场景中选出最高质量的推理链。

GRPO公式对比
配对奖励函数公式
扩展GRPO优化目标

推理时的完整流程

输入Prompt
    ↓
M=5次并行解码(变温/变Top-p)
    ↓
计算Consensus
    ↓
┌───Consensus≥τ(0.8)──→直接输出答案(~58%样本)

└───Consensus<τ(0.8)──→CoT生成→判别评分→取最优→输出

整个过程的关键词是无外部依赖——不需要传统分类器判断复杂度、不需要额外的reward model、不需要手工规则。一切信号来自模型自身。

实验结果

效率:延迟降低62%

以RM-Bench上全CoT基线为100%:

延迟降到原来的1/3以下,同时准确率还上升了——说明很多简单输入不仅不需要CoT,走了CoT反而可能引入推理噪声。

准确率:三个基准全线上涨

CoT触发率

42%的样本被路由到CoT,58%的样本直接输出。这58%的“直答”样本平均延迟只有CoT模式的约1/5。

性能vs阈值(τ)的权衡

τ=0.8是效率和精度的最佳平衡点。值得注意:τ=0.9时精度反而低于τ=0.8,说明有些输入走CoT反而效果更差(验证了“过推理”或“推理噪声”的存在)

项目价值

学术价值

  • 首次将模型内部不确定性引入生成式奖励建模,提出了一种通用的、无需外部信号的CoT选择性触发机制
  • 混合Huber+Hinge损失提供了一种比投票更精细的推理路径评估方式

实践指导意义

  • “磨刀不误砍柴工”在此不成立。不是所有任务都需要推理链。对简单问题走CoT反而增加噪声和延迟,E-GRM证明了“快答”有时比“深想”更有效。
  • 并行解码是一种便宜的复杂度探针。不需要训练一个单独的分类器来预测“是否需要CoT”,跑几遍M=5的快速采样就够了。
  • 混合损失比纯回归或纯排序都好。Huber保绝对精度、Hinge保相对排序,两者缺一不可。
  • SFT混合训练很关键。如果在训练时只用CoT风格数据,推理时就算模型“想”直接回答,也输出不好短风格答案。
  • GRPO是点睛之笔,但不是必须。纯SFT已经能取得不错的效率提升;GRPO在排序精度上提供+0.5%~1%的增量,适合对精度有极致要求的场景。

作者团队

腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。

该工作入选ACL 2026

同期另一篇工作:同一团队在ACL 2026主会发表了Why Supervised Fine-Tuning Fails to Learn,系统性揭示了SFT训练中15.3%样本“假学会”的问题及其五大根因。详见GitHub。

论文(arXiv):https://arxiv.org/abs/2604.10072
论文(ACL Anthology):https://aclanthology.org/2026.findings-acl.1167/
代码(GitHub):https://github.com/xccc-8071/reason-only-when-needed

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

内容中包含的图片若涉及版权问题,请及时与我们联系删除