报告主题:ACL2026杰出论文|几何感知破解RLVR微调瓶颈GeoRA

报告日期:7月21日(周二) 14:30-15:30
报告要点:
强化学习结合可验证奖励(RLVR)是推进大推理模型的关键路径,但现有参数高效方法多面向监督学习设计,难以适配RLVR独特的优化几何结构。智源Talk 367期邀请了美团石磊、徐俊线上分享,提出了GeoRA几何感知低秩适配优化框架。GeoRA通过几何约束子空间内SVD分解提取主方向,有效缓解RLVR优化瓶颈,在数学、代码、医学基准上达到SOTA,并展现出更强的跨领域泛化和抗遗忘能力。欢迎大家一起讨论交流。论文链接:https://arxiv.org/abs/2601.09361v1

议题详情:

强化学习结合可验证奖励(RLVR)对于推进大规模推理模型的发展至关重要。然而,现有的参数高效方法(如 PiSSA 和 MiLoRA)是为监督微调(SFT)设计的,未能考虑 RLVR 中独特的优化动态和几何结构。直接应用这些方法可能导致谱坍缩和优化不稳定,限制模型性能。与此同时,依赖稀疏更新的替代方法由于非结构化计算,在现代硬件上面临显著的效率瓶颈。为应对这些挑战,我们提出了 GeoRA(几何结构感知的低秩适配),该方法利用了 RL 更新子空间的各向异性和可压缩特性。GeoRA 通过在几何约束子空间内进行奇异值分解(SVD)提取主方向来初始化适配器,同时冻结残余分量。这种方法既保留了预训练模型的几何结构,又通过密集算子实现了高效的 GPU 计算。在 Qwen 和 Llama 模型上的实验表明,GeoRA 能有效缓解因几何错位导致的优化瓶颈,在数学、代码、医学基准测试中持续优于现有的主流低秩基线方法,达到最先进(SOTA)水平。此外,GeoRA 在跨领域任务中表现出更强的泛化能力和抗灾难性遗忘能力。

报告嘉宾:


石磊硕士毕业于清华大学自动化系,现任美团大模型研究员,主要方向为智能体强化学习和自进化。他曾作为核心成员参与蚂蚁百灵大模型、蚂蚁医疗大模型的研发,在 ACL、AAAI 等会议和期刊发表多篇研究成果,2026 年获 ACL Outstanding Paper Award。


徐俊,美团骑手招聘、履约电销技术负责人。哈工大SCIR实验室博士毕业,长期从事大模型预训练、后训练与推理优化,以及 Agent 应用方向的研究与实践。2022 年获吴文俊人工智能科技进步奖特等奖("中国智能科技最高奖"),2026 年获 ACL Outstanding Paper Award。
 
电脑端观看地址


更多热门活动:

内容中包含的图片若涉及版权问题,请及时与我们联系删除