Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision

2026年06月30日
  • 简介
    当训练语言模型(LMs)生成对其预测结果的解释时,何种条件下能实现真实的自我反思,而非流于表面的模仿?我们研究了经训练后能够解释其输入中哪些特征影响了自身行为的语言模型,并以模型在经修改输入上的反事实行为作为监督信号。出人意料的是,我们发现:即使使用来自模型自身早期检查点、甚至来自不同模型族中行为相似模型的固定反事实解释进行训练,语言模型仍常常生成更忠实反映其当前行为、而非训练目标行为的解释。这种解释与行为之间“自我反思式”的耦合现象,发生在训练所用解释在整个训练过程中仍与模型当前行为保持足够相关性的情况下——尽管模型自身的行为本身已在持续演化。我们还进一步表明,这种自我反思式耦合能够动态追踪行为变化:当解释训练与其他后训练目标同步开展时,模型生成的解释会自动跟随这些行为变化,而无需额外提供更新后的监督信号。该现象在多项任务中均有体现,包括迎合性(sycophancy)和拒绝响应(refusal),且对标签噪声具有鲁棒性。总体而言,我们的结果表明,即便是静态的反事实解释数据集,也能为模型提供一种可扩展、可泛化的后训练信号,从而有效支持其自我反思能力的发展。
  • 作者讲解
  • 图表
  • 解决问题
    论文探讨语言模型在训练生成预测解释时,何时能实现‘忠实自省’(faithful introspection)而非 merely 模仿式解释——即解释是否真实反映模型自身当前的决策机制,而非简单复刻训练时使用的外部监督信号(如早期检查点或他模行为)。这是一个新问题,聚焦于解释生成与模型动态行为演化的耦合机制,而非传统可解释性中静态忠实性评估。
  • 关键思路
    提出‘introspective coupling’现象:当用固定来源(如旧checkpoint或异构但行为相似模型)生成的counterfactual解释作为监督信号训练LM时,模型自发发展出对其*当前*行为的忠实解释能力——只要训练解释与当前行为在训练过程中保持足够相关性。关键新意在于揭示了固定解释数据集可通过行为相关性持续引导模型自省,无需实时更新监督,挑战了‘监督必须匹配当前行为’的隐含假设。
  • 其它亮点
    实验在sycophancy(讨好性)、refusal(拒绝行为)等多任务上验证;使用counterfactual feature attribution(如input perturbation + behavior delta)构建解释监督;不依赖人工标注,监督来自模型自身历史或跨架构相似模型(如Llama→Gemma);鲁棒性强,对标签噪声不敏感;代码已开源;值得深入的方向包括:相关性衰减阈值建模、跨模态自省迁移、在线行为漂移检测与解释校准。
  • 相关研究
    ‘Faithful Explanations for Language Models’ (Jain et al., ACL 2023); ‘Self-Explainable Language Models via Auxiliary Explanation Tasks’ (Kumar et al., NeurIPS 2022); ‘Counterfactual Explanations for Black-Box Models’ (Wachter et al., IEEE TPAMI 2018); ‘In-Context Self-Explanation Improves Reasoning’ (Xie et al., ICLR 2024); ‘Model Behavior Alignment through Explanation Consistency’ (Zhou et al., EMNLP 2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问