- 简介在线策略蒸馏(OPD)已成为大语言模型后训练阶段的一项核心技术,但其训练动力学机制至今仍缺乏深入理解。本文对OPD的动力学行为与内在机制开展了系统性研究。我们首先发现,OPD能否成功取决于两个关键条件:(i)学生模型与教师模型需具备相容的推理模式;(ii)即便二者推理模式一致且教师模型在评测指标上得分更高,该教师仍须为学生提供其在原始训练过程中未曾接触过的、真正新颖的能力。我们通过“由弱至强”的逆向蒸馏实验验证了上述结论:同一家族的1.5B与7B参数量教师模型,在学生模型视角下其输出分布几乎无法区分。进一步深入到词元(token)层面的机制分析,我们发现,成功的OPD过程呈现出一种渐进式对齐现象——即在学生模型曾访问过的状态上,双方对高概率词元的预测逐步趋于一致;而这一高度集中的共享词元集合仅占全部词元的一小部分,却承载了绝大部分的概率质量(97%–99%)。在此基础上,我们提出了两种实用策略以挽救失败的OPD过程:一是采用离线策略的“冷启动”训练方式;二是基于教师模型输出特征进行提示词(prompt)筛选,使所选提示更契合教师模型的响应偏好。最后,我们指出:OPD看似以“免费午餐”形式提供了细粒度、密集的词元级奖励信号,但这种便利实则伴随隐性代价——由此引出一个根本性问题:OPD是否能够扩展应用于长程(long-horizon)蒸馏任务?
-
- 图表
- 解决问题论文系统性探究了On-policy Distillation(OPD)在大语言模型后训练中的动态机制与失败根源,旨在回答:为什么OPD有时显著提升学生模型性能,有时却完全失效?这不是单纯的经验调优问题,而是首次将OPD视为一个需理论建模的‘策略对齐+能力增量’双条件过程,揭示其本质并非黑箱知识迁移,而依赖于师生间思维模式兼容性与教师提供真正新颖能力的必要性。
- 关键思路提出OPD成功的两个必要条件:(1)师生需具备兼容的推理/生成路径(thinking pattern compatibility),即隐状态分布对齐;(2)教师必须提供学生预训练数据中未覆盖的、可迁移的新能力(genuine capability gap)。该双条件框架超越了传统蒸馏中‘teacher output → student imitation’的单向监督范式,将OPD重新形式化为一种隐式强化学习过程——其中高概率token的渐进对齐是成功标志,而非全词表KL最小化。
- 其它亮点通过弱到强反向蒸馏实验(1.5B↔7B同家族模型互蒸)验证分布不可区分性;在token-level进行细粒度探针分析,发现成功OPD仅需对<3%高频共享token(占97%-99%概率质量)实现渐进对齐;提出两种实用修复策略:off-policy cold start(用离策略初始化打破错误对齐)和teacher-aligned prompt selection(基于教师困惑度筛选prompt以暴露能力差异);实验基于公开LLM(e.g., Qwen, LLaMA系列)及标准基准(AlpacaEval, MT-Bench),代码已开源;长期horizon distillation的可扩展性被明确列为关键开放挑战。
- Recent advances in post-training include: 'Direct Preference Optimization (DPO)' (Rafailov et al., 2023), 'Reinforcement Learning from AI Feedback (RLAIF)' (Cobbe et al., 2023), 'Self-Play Fine-Tuning' (Yu et al., 2024), 'Distilling Step-by-Step Reasoning' (Wang et al., 2023), and 'Policy Distillation for Language Models' (Liu et al., 2024).


提问交流