报告主题:ICML 2026杰出论文|任意顺序迷思:扩散语言模型生成顺序灵活性
报告日期:7月23日(周四) 10:30-11:30扩散语言模型的"任意生成顺序"被视为扩大推理边界的优势,但实践中"先易后难"解码反而绕开关键token、收窄推理边界——作者称之为"灵活性陷阱"。智源Talk 369期邀请了清华大学倪赞林线上分享,工作来自ICML 2026杰出论文奖。提出极简JustGRPO:仅在RL后训练阶段切回自回归顺序以套用标准GRPO,推理时恢复并行解码,既规避灵活性陷阱、提升后训练效果,又完整保留并行解码效率优势。论文链接:https://arxiv.org/abs/2601.15165议题详情:
扩散语言模型(diffusion LLMs)相较自回归模型有两大特性:并行解码与任意生成顺序。其中并行解码带来的效率提升已被广泛认可,而任意顺序这一特性则值得更深入审视。直觉上,其被认为能扩大模型的推理边界,因为任意顺序在理论上是自回归顺序的"超集"。本文对这一直觉提出了质疑:在实践中,任意顺序常用的"先易后难"解码会绕开高不确定性的关键 token,反而收窄了推理边界,也削弱了 RL 后训练的效果,作者将其称之为"灵活性陷阱"。为此,作者提出极简的 JustGRPO,仅在 RL 阶段改回自回归顺序,从而直接套用标准 GRPO,推理时再切回并行解码。方法简单,却带来更好的后训练性能,同时完整保留了并行解码的效率。报告嘉宾:
倪赞林,清华大学博士研究生,师从黄高副教授,研究方向为高效生成式建模,具体包括扩散语言模型(diffusion language models)、离散化视觉表征(discrete tokenization)与并行解码(parallel decoding)。他已在 ICML、NeurIPS、CVPR、ICCV、ECCV 等机器学习与计算机视觉领域的顶级会议,以及 TPAMI、IJCV 等顶级期刊上发表论文 15 篇,其中 9 篇为第一或共同第一作者,累计被引 900 余次,h-index 为 11。他凭借重新审视扩散语言模型价值来源的工作,获得 ICML 2026 杰出论文奖(全部 23,918 篇投稿中仅 2 篇入选)。他还入选国家自然科学基金博士生专项与中国青年科技人才培育工程,并曾获国家奖学金。
更多热门活动:
内容中包含的图片若涉及版权问题,请及时与我们联系删除
评论
沙发等你来抢