
报告主题:ACL2026 杰出论文|面向关键位置局部熵最大化的前缀感知大语言模型遗忘方法
议题详情:
机器遗忘学习旨在从大语言模型中遗忘敏感知识,同时保持模型的通用能力。然而,现有方法通常将响应序列中的所有词元视为同等重要,并在整个词表空间上强制引入不确定性。这种全局化处理方式会导致不必要的模型效用下降,并使优化过程扩展至与目标内容无关的区域。为解决上述局限性,本文提出 PALU(Prefix-Aware Localized Unlearning) 框架,该方法通过同时考虑时间维度和词表维度的局部熵最大化目标,实现更加精准的遗忘优化。PALU 揭示了两个关键发现:(i)仅抑制敏感前缀即可切断模型中与目标知识相关的因果生成链路;(ii)仅对 top-k logits 进行平坦化,即可在关键子空间内充分提升模型输出的不确定性。基于上述发现,PALU 避免了在完整词表空间和参数空间中的冗余优化,同时最大程度降低对模型通用性能的影响。
报告嘉宾:

翟乃鑫,中国科学技术大学硕士生,研究方向包括人工智能安全与大语言模型的可靠性研究。当前主要围绕大模型遗忘学习、推理阶段安全控制以及多语言安全对齐等方向开展研究,旨在提升大模型在知识管理、隐私保护和复杂开放环境中的安全性与可信性。相关研究成果发表于或被接收于 ACL、WWW、TMM 等国际会议和期刊,获得 ACL2026 杰出论文奖。


内容中包含的图片若涉及版权问题,请及时与我们联系删除




评论
沙发等你来抢