检验思维链(Chain-of-Thought, CoT)推理,是理解大语言模型(LLM)为何生成特定输出的最常用手段之一。然而,CoT可信性(faithfulness)方面广为人知的问题,严重制约了我们通过这一方法所能获得的洞见深度与可靠性。本文提出一种名为“反事实模拟训练”(Counterfactual Simulation Training, CST)的新训练方法,其核心目标是提升CoT的可信性:具体而言,即对那些能够帮助模拟器在反事实输入上准确预测模型输出的CoT给予奖励。我们将CST应用于两类场景:(1)基于线索的反事实CoT监控,用以识别模型是否依赖虚假相关特征、是否存在奖励黑客行为(reward hacking),或表现出迎合倾向(sycophancy);(2)面向通用模型驱动型反事实的反事实模拟训练,旨在促使模型在CoT中生成更具可信性、更可泛化的推理过程。我们在参数量高达2350亿的各类模型上开展实验,结果表明:CST可显著提升基于线索的反事实监控准确率(绝对准确率提升达35个百分点),同时亦能增强模型在通用反事实输入下的可模拟性(simulatability)(提升2个百分点)。此外,我们还发现:(1)CST的表现优于各类提示工程(prompting)基线方法;(2)利用大语言模型重写不具可信性的CoT,其效率是仅采用强化学习(RL)方法的5倍;(3)CoT可信性的提升无法自然迁移到“劝阻类线索”(dissuading cues)上(相较而言,“说服类线索”(persuading cues)则可有效受益);(4)更大规模的模型本身并不天然具备更高可信度的CoT,但它们确实能从CST中获得更显著的收益。上述结果表明,CST具有普适性地提升CoT可信性的潜力,尤其有望在CoT监控等关键应用场景中发挥重要作用。本文所有实验所用代码已开源,详见:https://github.com/peterbhase/counterfactual-simulation-training