
报告主题:如何实现OPD高效工作
On-policy distillation(OPD)现在几乎成了大模型 post-training 的“标配动作”。Qwen3、MiMo、GLM-5、DeepSeek-V4……2025 年以来,叫得上名字的头部模型基本都在用:学生模型自己生成 rollout,教师模型在每个 token 位置给出分布监督,又密、又准、又省。
我们在 Rethinking OPD 系列工作里,专门盯着 OPD 的 mechanism 看,想搞清楚两件事:
第一,OPD 到底什么时候能高效地 work?
我们发现:更强的教师,不一定就是更好的老师。OPD 能不能启动,关键看师生之间的 thinking pattern 合不合拍,而不是教师 benchmark 分数有多高。一句话:Strong ≠ Learnable。
第二,为什么只用一条样本,OPD 也能在几百步训练里稳稳提升,效果还接近全量数据?
因为 OPD 是“数据撑死”但“算法饿死”的:从数据角度看,一条样本已经覆盖了全量数据 OPD 所访问状态空间的大部分;从算法角度看,每一步更新能消除多少剩余的 teacher-student gap,这个比例并不取决于数据量。
报告嘉宾:
何秉翔,清华大学计算机系 2024 级博士生,师从刘知远教授。主要研究方向聚焦于大模型强化学习与自进化。其代表性工作包括 JustRL、Unsupervised RLVR 与 Rethinking OPD,相关研究成果已发表于 ACL、ICLR、NeurIPS 等人工智能领域国际顶级会议,谷歌学术累计被引 2700 余次。曾获青源 InnoVibe 2026 最受瞩目学术新星,并入选中国电子学会-腾讯博士生科研激励计划。


内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢