- 简介检验思维链(Chain-of-Thought, CoT)推理,是理解大语言模型(LLM)为何生成特定输出的最常用手段之一。然而,CoT可信性(faithfulness)方面广为人知的问题,严重制约了我们通过这一方法所能获得的洞见深度与可靠性。本文提出一种名为“反事实模拟训练”(Counterfactual Simulation Training, CST)的新训练方法,其核心目标是提升CoT的可信性:具体而言,即对那些能够帮助模拟器在反事实输入上准确预测模型输出的CoT给予奖励。我们将CST应用于两类场景:(1)基于线索的反事实CoT监控,用以识别模型是否依赖虚假相关特征、是否存在奖励黑客行为(reward hacking),或表现出迎合倾向(sycophancy);(2)面向通用模型驱动型反事实的反事实模拟训练,旨在促使模型在CoT中生成更具可信性、更可泛化的推理过程。我们在参数量高达2350亿的各类模型上开展实验,结果表明:CST可显著提升基于线索的反事实监控准确率(绝对准确率提升达35个百分点),同时亦能增强模型在通用反事实输入下的可模拟性(simulatability)(提升2个百分点)。此外,我们还发现:(1)CST的表现优于各类提示工程(prompting)基线方法;(2)利用大语言模型重写不具可信性的CoT,其效率是仅采用强化学习(RL)方法的5倍;(3)CoT可信性的提升无法自然迁移到“劝阻类线索”(dissuading cues)上(相较而言,“说服类线索”(persuading cues)则可有效受益);(4)更大规模的模型本身并不天然具备更高可信度的CoT,但它们确实能从CST中获得更显著的收益。上述结果表明,CST具有普适性地提升CoT可信性的潜力,尤其有望在CoT监控等关键应用场景中发挥重要作用。本文所有实验所用代码已开源,详见:https://github.com/peterbhase/counterfactual-simulation-training
-
- 图表
- 解决问题论文试图解决链式思维(Chain-of-Thought, CoT)推理的‘不忠实性’(faithfulness)问题——即CoT文本是否真实反映模型实际决策过程。这是一个长期存在但日益关键的问题:当前CoT常被误用为可解释性依据,而实证表明其常与模型输出脱节(如编造理由、依赖提示词表面特征、迎合用户偏好等)。该问题并非全新,但论文首次系统性地将‘反事实可模拟性’作为忠实性的可训练目标。
- 关键思路提出反事实模拟训练(Counterfactual Simulation Training, CST):不直接监督CoT内容正确性,而是训练模型生成能支持‘模拟器’准确预测其自身在反事实输入下行为的CoT。核心创新在于将忠实性重新定义为‘因果可干预性’——若CoT忠实,则微小、语义合理的输入扰动(如添加/删除提示线索)应导致CoT和最终输出按一致逻辑演化;CST通过强化学习奖励满足这一属性的CoT,使推理过程真正成为模型行为的因果中介。
- 其它亮点实验覆盖235B参数大模型,在两类反事实设置下验证:(1) cue-based监控(检测对表面线索的依赖),提升监测准确率35点;(2) generic model-based反事实(如语义等价改写),提升模拟一致性2分。对比显示:CST显著优于思维链提示(CoT prompting)基线;结合LLM重写+RL的混合方法比纯RL高效5倍;效果对‘说服性线索’有效但不对称于‘劝阻性线索’;大模型本身不更忠实,却从CST获益更大。代码已开源(GitHub链接明确),数据集未限定特定基准,强调跨任务泛化性;值得深挖的方向包括:反事实扰动生成的自动化、CST与可解释性评估指标的理论关联、以及在安全对齐中的监控部署。
- ‘Faithful Reasoning in Language Models’ (Jiang et al., ACL 2023); ‘Measuring and Improving Model-Based Reasoning Faithfulness’ (Wang et al., NeurIPS 2023); ‘Self-Consistency Improves Chain of Thought Reasoning in Language Models’ (Wang et al., ICLR 2023); ‘The Curse of Recursion: Training on Generated Data Makes Models Forget’ (Shumailov et al., arXiv 2023); ‘Causal Reasoning in Language Models’ (Fernandez et al., EMNLP 2022)


提问交流