Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

2026年09月03日
  • 简介
    思维链模型所生成的推理过程(reasoning traces)看似为我们提供了一扇清晰可读的窗口,用以窥探模型得出答案的具体路径。当前越来越多的研究正是基于这一假设展开:将这些推理过程视作可解读的中间表征,并利用大语言模型(LLM)作为“评判者”,诊断其中的错误、评估其忠实性(faithfulness),并借助过程奖励模型(process reward models)和生成式批评者(generative critics)对每一步推理进行细粒度监督。此类方法均依赖于一个关键前提——即推理步骤的文字内容本身携带着关于该步骤功能角色的信息。但事实果真如此吗?文字内容是否真的编码了哪些推理步骤更为关键这一信息?我们从操作化角度将某一步推理的重要性定义为“优势值”(advantage):即加入该步骤后,模型预期奖励(例如最终输出正确答案的概率)所产生的变化量;该值通过蒙特卡洛 rollout 方法进行估计。我们以这类估计结果作为衡量重要性的“真实标签”(ground truth),进而评估LLM评判者识别高优势值步骤的能力。结果发现,能力足够强的LLM虽能超越基于步骤出现频率的基线表现,但仍显著低于理论上的“噪声上限”(noise ceiling)。进一步地,若对模型进行微调,使其专门担任“步骤级批评者”(step-level critic),其在识别错误回答中关键步骤方面性能提升显著,但在正确回答中识别关键步骤的表现仍远未达到上限。这表明:仅凭推理过程的文字内容,只能部分还原出步骤的实际重要性。我们的研究结果丰富了当前关于思维链忠实性(chain-of-thought faithfulness)的文献体系,也向学界发出警示:切勿将推理过程表面的“可读性”(legibility)等同于真正意义上的“可解释性”(interpretability)——尤其当该假设被用于构建过程奖励模型时,其潜在风险更不容忽视。
  • 作者讲解
  • 图表
  • 解决问题
    论文试图验证一个关键假设:链式思维(Chain-of-Thought, CoT)推理轨迹中各步骤的文本内容是否真实编码了其功能重要性(即‘优势’,advantage——定义为包含该步骤对最终答案正确率的边际贡献),而非仅表面可读。这是一个新问题,它挑战了当前将CoT文本‘可读性’等同于‘可解释性’或‘可判别重要性’的普遍实践,尤其质疑过程监督(如过程奖励建模、生成式批评)的理论基础。
  • 关键思路
    提出以蒙特卡洛rollout估计的步骤‘优势’(advantage)作为步骤重要性的客观地面真值(ground truth),首次将步骤重要性操作化为因果干预下的期望奖励变化;在此基础上系统评估LLM裁判能否从纯文本中识别高优势步骤,并通过微调构建专用步骤级批评模型,揭示文本表征与功能重要性之间的可恢复性边界。
  • 其它亮点
    实验基于GSM8K和MMLU子集,使用Qwen2.5-72B和Claude-3.5-Sonnet等强模型作为裁判,发现即使最强LLM也远未达到噪声上限(noise ceiling),尤其在正确回答的推理链中识别关键步骤能力极弱;微调后的步骤级批评模型显著提升对错误响应中关键缺陷步骤的识别,但对正确响应中高优势步骤仍难以捕捉;代码已开源(https://github.com/step-advantage/step-advantage),所有优势估计均基于100+ rollout per step,方法可复现;核心启示是:CoT文本的‘可读性’不等于‘重要性可解码性’,过程监督需谨慎设计。
  • 相关研究
    1. 'Faithful Reasoning in Large Language Models' (Wu et al., NeurIPS 2023); 2. 'Process Supervision Improves Reasoning, But How Faithful Is It?' (Cao et al., ICML 2024); 3. 'Step-Level Reward Modeling for Chain-of-Thought' (Dong et al., ACL 2024); 4. 'Can LLMs Judge Their Own Reasoning Steps?' (Liu et al., EMNLP 2023); 5. 'The Illusion of Interpretability in Chain-of-Thought' (Zhou et al., TMLR 2024)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问