报告主题:如何实现OPD高效工作

报告日期:9月18日(周五) 10:30-11:30
报告要点:

On-policy distillation(OPD)现在几乎成了大模型 post-training 的“标配动作”。Qwen3、MiMo、GLM-5、DeepSeek-V4……2025 年以来,叫得上名字的头部模型基本都在用:学生模型自己生成 rollout,教师模型在每个 token 位置给出分布监督,又密、又准、又省。

我们在 Rethinking OPD 系列工作里,专门盯着 OPD 的 mechanism 看,想搞清楚两件事:

第一,OPD 到底什么时候能高效地 work?

我们发现:更强的教师,不一定就是更好的老师。OPD 能不能启动,关键看师生之间的 thinking pattern 合不合拍,而不是教师 benchmark 分数有多高。一句话:Strong ≠ Learnable。

第二,为什么只用一条样本,OPD 也能在几百步训练里稳稳提升,效果还接近全量数据?

因为 OPD 是“数据撑死”但“算法饿死”的:从数据角度看,一条样本已经覆盖了全量数据 OPD 所访问状态空间的大部分;从算法角度看,每一步更新能消除多少剩余的 teacher-student gap,这个比例并不取决于数据量。

报告嘉宾:

何秉翔,清华大学计算机系 2024 级博士生,师从刘知远教授。主要研究方向聚焦于大模型强化学习与自进化。其代表性工作包括 JustRL、Unsupervised RLVR 与 Rethinking OPD,相关研究成果已发表于 ACL、ICLR、NeurIPS 等人工智能领域国际顶级会议,谷歌学术累计被引 2700 余次。曾获青源 InnoVibe 2026 最受瞩目学术新星,并入选中国电子学会-腾讯博士生科研激励计划。

点上方预约,开播有提醒


更多热门活动:

内容中包含的图片若涉及版权问题,请及时与我们联系删除